Complétions de chat#
POST /v1/chat/completions accepte model et messages. Chaque message possède role et content. Les champs facultatifs incluent temperature, max_tokens, stream, tools, tool_choice et response_format lorsque le modèle déployé les prend en charge. En cas de succès, la réponse renvoie id, object, choices et usage. Le streaming renvoie text/event-stream.
Complétions héritées#
POST /v1/completions accepte model et prompt. Pris en charge uniquement lorsque le backend de service expose le mode complétion pour le modèle demandé.
Embeddings#
POST /v1/embeddings utilise model et input. Confirmez un déploiement d'embedding pris en charge avant d'utiliser ce point de terminaison ; un service indisponible renvoie 503 service_unavailable. Vérifiez le statut du service pour la disponibilité.
Découverte de modèles#
GET /v1/models répertorie les identifiants de déploiement connectés. Une entrée du catalogue décrit le modèle et ses tarifs ; utilisez la découverte de modèles et le statut du service pour vérifier la disponibilité.
Champs de réponse#
Les réponses sans streaming incluent usage.prompt_tokens et usage.completion_tokens. Le SSE se termine par un enregistrement d'utilisation faisant autorité suivi de [DONE]. Les erreurs des fournisseurs sont normalisées et excluent les identifiants internes.
Services auxiliaires#
La transcription audio, la génération d'images, le reranking et le traitement par lots géré nécessitent leurs propres déploiements pris en charge. Vérifiez le statut du service avant de les utiliser ; les opérations indisponibles renvoient service_unavailable. Un tarif indiqué n'établit pas un service actif.
Exemple de demande
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'