weightsapi.推論コンソール
ナビゲーション
APIリファレンス

APIリファレンス

エンドポイント、リクエストフィールド、レスポンス契約。

チャット補完#

POST /v1/chat/completions は model と messages を受け付けます。各メッセージには role と content があります。デプロイされたモデルがサポートしている場合、オプションのフィールドとして temperature、max_tokens、stream、tools、tool_choice、response_format があります。成功時には id、object、choices、usage が返されます。ストリーミングでは text/event-stream が返されます。

レガシー補完#

POST /v1/completions は model と prompt を受け付けます。サービングバックエンドが要求されたモデルに対して完了モードを公開している場合にのみサポートされます。

埋め込み#

POST /v1/embeddingsmodelinputを使用します。このエンドポイントを使用する前に、サポートされている埋め込みデプロイメントを確認してください。利用できないサービスは503 service_unavailableを返します。可用性についてはサービス状態を確認してください。

モデル検出#

GET /v1/modelsは接続されたデプロイメントIDを一覧表示します。カタログエントリはモデルとそのレートを説明します。可用性を確認するにはモデル検出とサービス状態を使用してください。

レスポンスフィールド#

非ストリーミングレスポンスには usage.prompt_tokens と usage.completion_tokens が含まれます。SSEは信頼できる使用量レコードで終了し、その後に [DONE] が続きます。プロバイダーエラーは正規化され、内部認証情報は除外されます。

補助サービス#

音声文字起こし、画像生成、リランキング、マネージドバッチ処理にはそれぞれサポートされているデプロイメントが必要です。使用する前にサービス状態を確認してください。利用できない操作はservice_unavailableを返します。記載されたレートはアクティブなサービスを確立するものではありません。

リクエスト例

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'