チャット補完#
POST /v1/chat/completions は model と messages を受け付けます。各メッセージには role と content があります。デプロイされたモデルがサポートしている場合、オプションのフィールドとして temperature、max_tokens、stream、tools、tool_choice、response_format があります。成功時には id、object、choices、usage が返されます。ストリーミングでは text/event-stream が返されます。
レガシー補完#
POST /v1/completions は model と prompt を受け付けます。サービングバックエンドが要求されたモデルに対して完了モードを公開している場合にのみサポートされます。
埋め込み#
POST /v1/embeddingsはmodelとinputを使用します。このエンドポイントを使用する前に、サポートされている埋め込みデプロイメントを確認してください。利用できないサービスは503 service_unavailableを返します。可用性についてはサービス状態を確認してください。
モデル検出#
GET /v1/modelsは接続されたデプロイメントIDを一覧表示します。カタログエントリはモデルとそのレートを説明します。可用性を確認するにはモデル検出とサービス状態を使用してください。
レスポンスフィールド#
非ストリーミングレスポンスには usage.prompt_tokens と usage.completion_tokens が含まれます。SSEは信頼できる使用量レコードで終了し、その後に [DONE] が続きます。プロバイダーエラーは正規化され、内部認証情報は除外されます。
補助サービス#
音声文字起こし、画像生成、リランキング、マネージドバッチ処理にはそれぞれサポートされているデプロイメントが必要です。使用する前にサービス状態を確認してください。利用できない操作はservice_unavailableを返します。記載されたレートはアクティブなサービスを確立するものではありません。
リクエスト例
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'