weightsapi.INFERENTIEConsole
Navigatie
API-referentie

API-referentie

Endpoints, verzoekvelden en responscontracten.

Chat completions#

POST /v1/chat/completions accepteert model en messages. Elk bericht heeft role en content. Optionele velden zijn onder meer temperature, max_tokens, stream, tools, tool_choice en response_format wanneer het geïmplementeerde model deze ondersteunt. Succes retourneert id, object, choices en usage. Streaming retourneert text/event-stream.

Legacy completions#

POST /v1/completions accepteert model en prompt. Wordt alleen ondersteund wanneer de serving-backend de completion-modus voor het gevraagde model beschikbaar stelt.

Embeddings#

POST /v1/embeddings gebruikt model en input. Bevestig een ondersteunde embedding-implementatie voordat u dit endpoint gebruikt; een niet-beschikbare service retourneert 503 service_unavailable. Controleer de servicestatus voor beschikbaarheid.

Modelontdekking#

GET /v1/models toont verbonden implementatie-ID's. Een catalogusitem beschrijft het model en zijn tarieven; gebruik modelontdekking en servicestatus om de beschikbaarheid te controleren.

Responsvelden#

Niet-streamingresponses bevatten usage.prompt_tokens en usage.completion_tokens. SSE eindigt met een gezaghebbend usage-record gevolgd door [DONE]. Providerfouten worden genormaliseerd en sluiten interne credentials uit.

Hulpdiensten#

Audiotranscriptie, beeldgeneratie, herrangschikking en beheerde batchverwerking vereisen hun eigen ondersteunde implementaties. Controleer de servicestatus voordat u ze gebruikt; niet-beschikbare bewerkingen retourneren service_unavailable. Een vermeld tarief vestigt geen actieve service.

Voorbeeldverzoek

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'