Chat Completions#
POST /v1/chat/completions akzeptiert model und messages. Jede Nachricht hat role und content. Optionale Felder sind temperature, max_tokens, stream, tools, tool_choice und response_format, sofern das bereitgestellte Modell sie unterstützt. Bei Erfolg werden id, object, choices und usage zurückgegeben. Streaming gibt text/event-stream zurück.
Legacy Completions#
POST /v1/completions akzeptiert model und prompt. Wird nur unterstützt, wenn das Serving-Backend den Completion-Modus für das angeforderte Modell bereitstellt.
Einbettungen#
POST /v1/embeddings verwendet model und input. Bestätigen Sie eine unterstützte Einbettungsbereitstellung, bevor Sie diesen Endpunkt verwenden; ein nicht verfügbarer Dienst gibt 503 service_unavailable zurück. Überprüfen Sie den Dienststatus auf Verfügbarkeit.
Modellerkennung#
GET /v1/models listet verbundene Bereitstellungs-IDs auf. Ein Katalogeintrag beschreibt das Modell und seine Tarife; verwenden Sie Modellerkennung und Dienststatus, um die Verfügbarkeit zu überprüfen.
Antwortfelder#
Nicht-streamende Antworten enthalten usage.prompt_tokens und usage.completion_tokens. SSE endet mit einem maßgeblichen Nutzungsdatensatz, gefolgt von [DONE]. Anbieterfehler werden normalisiert und schließen interne Zugangsdaten aus.
Hilfsdienste#
Audiotranskription, Bilderzeugung, Reranking und verwaltete Batch-Verarbeitung erfordern ihre eigenen unterstützten Bereitstellungen. Überprüfen Sie den Dienststatus, bevor Sie sie verwenden; nicht verfügbare Operationen geben service_unavailable zurück. Ein aufgeführter Tarif begründet keinen aktiven Dienst.
Anfragebeispiel
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'