weightsapi.推論コンソール
ナビゲーション
仕組み

タスクから、より明確な推論ワークフローへ。

マネージド推論を理解し、モデルを選び、リクエストを準備し、クレジット・予約済み金額・使用量の関係を追いましょう。

一目でわかる

モデルを選択し、アクセスと利用上限を設定し、リクエストの使用状況と支払いステータスを追跡します。トラフィックを送る前にモデルの可用性を確認してください。

サービスが管理する範囲を理解する

マネージド推論では、モデルの提供をAPIの背後に置くことで、アプリケーションがGPUサーバー自体を運用することなく回答をリクエストできます。WeightsAPIはオープンウェイトモデル向けにOpenAI互換のリクエスト形式を使用します。利用可能状況はサービスステータスで確認してください。

アプリケーションの所有権はお客様にあります。プロンプト、データ選択、権限、リトライ動作、出力チェックなどです。まず具体的なタスクから始め、有用な回答がどのようなものかを決めてください。ユースケースガイドは出発点を提供しますが、すべてのモデルがすべての機能をサポートすることを保証するものではありません。

実際のタスクに合ったモデルを選ぶ

モデルカタログで機能、ライセンス、コンテキスト、入出力レートを比較してください。モデルページを読み、リクエストには正確なAPIモデルIDを使用してください。公開元のネイティブコンテキストと確認済みのデプロイメント上限を区別してください。入力と意図した出力は後者に収まる必要があります。

カタログへの掲載はデプロイメントが利用可能であることを証明するものではありません。モデル検出はバックエンドが利用可能な場合に接続済みデプロイメントを一覧表示します。すべてのモデルが同じコストであると仮定せず、料金で関連するレートを比較してください。

小さく検証可能なリクエストを準備する

短いプロンプト、正確なモデルID、制限された出力から始めます。クイックスタートではチャット補完形式を説明しています。タスクに必要な会話履歴だけを追加し、API資格情報はサーバー上に保管してください。

ストリーミングは任意です。完全な単一レスポンスではなくイベントとして回答を配信します。有効にする前にストリーミングガイドを読み、中断されたレスポンスや最終使用量レコードの扱い方も確認してください。

アクセスと支出を分離する

コンソールにサインインしてください。アプリケーションや環境ごとに個別のキーを作成し、正の支出上限を設定し、必要に応じて許可するモデルを制限してください。シークレットは最初に表示されたときに保存してください。

キーの上限は、月々の許容量ではなく、生涯の記録された使用量と未処理の予約に適用されます。漏洩したキーは交換し、古いキーは失効させてください。FAQでは、キー、クレジット、保留中のリクエストの関係を説明しています。

AIアクセスには、サインイン、最低100米ドルの確認済みトップアップ1回、認可されたAPIキー、リクエストに十分な利用可能クレジットが必要です。以降の各トップアップも最低100米ドルです。残高が少なくてもリクエストをカバーできる場合は利用可能です。クレジットには取引の検証が必要です。トラフィックを送信する前に、サービスステータスでモデルの利用可能性を確認してください。

利用可能クレジットと最終コストを区別する

承認された有料リクエストの場合、利用可能クレジットは生成開始前に入力と最大出力をカバーします。最終コストは実際の入出力使用量に基づき、初期予約は最終請求ではありません。したがって、決済待ちのリクエストは利用可能クレジットを減少させる可能性があります。

最終使用量が確認される前に応答が停止した場合、予約は照合まで残ることがあります。資金調達注文は支払い指示を提供しますが、クレジットには取引の検証が必要です。請求で見積もり期限、確認、利用可能クレジットを確認してください。

拡張する前に結果を確認する

文書に関する質問では、アプリケーションに関連箇所を選択させ、引用付きの回答をリクエストし、その引用をソースと照合してください。文書の権限と最終レビューはアプリケーション内に保持してください。

代表的な例で回答品質、コンテキスト使用、予想支出を評価してください。必要な機能をテストした後にのみ拡張してください。エラー、中断されたストリーム、保留中のクレジットについては、サポートガイドに従い、サニタイズされたレポートを保持してください。

次のステップが必要ですか?

関連するガイドを探すか、問題の詳細を準備してください。

サポートを開く