weightsapi.INFERENZAConsole
Navigazione
Riferimento API

Riferimento API

Endpoint, campi delle richieste e contratti di risposta.

Completamenti chat#

POST /v1/chat/completions accetta model e messages. Ogni messaggio ha role e content. I campi opzionali includono temperature, max_tokens, stream, tools, tool_choice e response_format quando il modello distribuito li supporta. In caso di successo restituisce id, object, choices e usage. Lo streaming restituisce text/event-stream.

Completamenti legacy#

POST /v1/completions accetta model e prompt. Supportato solo quando il backend di serving espone la modalità di completamento per il modello richiesto.

Embeddings#

POST /v1/embeddings utilizza model e input. Conferma una distribuzione di embedding supportata prima di usare questo endpoint; un servizio non disponibile restituisce 503 service_unavailable. Controlla lo stato del servizio per la disponibilità.

Scoperta dei modelli#

GET /v1/models elenca gli ID di distribuzione collegati. Una voce di catalogo descrive il modello e le sue tariffe; usa la scoperta dei modelli e lo stato del servizio per verificare la disponibilità.

Campi di risposta#

Le risposte non in streaming includono usage.prompt_tokens e usage.completion_tokens. Il flusso SSE termina con un record di utilizzo autorevole seguito da [DONE]. Gli errori del provider sono normalizzati ed escludono credenziali interne.

Servizi ausiliari#

Trascrizione audio, generazione di immagini, reranking ed elaborazione batch gestita richiedono distribuzioni supportate proprie. Controlla lo stato del servizio prima di usarli; le operazioni non disponibili restituiscono service_unavailable. Una tariffa elencata non stabilisce un servizio attivo.

Esempio di richiesta

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'