Completamenti chat#
POST /v1/chat/completions accetta model e messages. Ogni messaggio ha role e content. I campi opzionali includono temperature, max_tokens, stream, tools, tool_choice e response_format quando il modello distribuito li supporta. In caso di successo restituisce id, object, choices e usage. Lo streaming restituisce text/event-stream.
Completamenti legacy#
POST /v1/completions accetta model e prompt. Supportato solo quando il backend di serving espone la modalità di completamento per il modello richiesto.
Embeddings#
POST /v1/embeddings utilizza model e input. Conferma una distribuzione di embedding supportata prima di usare questo endpoint; un servizio non disponibile restituisce 503 service_unavailable. Controlla lo stato del servizio per la disponibilità.
Scoperta dei modelli#
GET /v1/models elenca gli ID di distribuzione collegati. Una voce di catalogo descrive il modello e le sue tariffe; usa la scoperta dei modelli e lo stato del servizio per verificare la disponibilità.
Campi di risposta#
Le risposte non in streaming includono usage.prompt_tokens e usage.completion_tokens. Il flusso SSE termina con un record di utilizzo autorevole seguito da [DONE]. Gli errori del provider sono normalizzati ed escludono credenziali interne.
Servizi ausiliari#
Trascrizione audio, generazione di immagini, reranking ed elaborazione batch gestita richiedono distribuzioni supportate proprie. Controlla lo stato del servizio prima di usarli; le operazioni non disponibili restituiscono service_unavailable. Una tariffa elencata non stabilisce un servizio attivo.
Esempio di richiesta
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'