weightsapi.推理控制台
导航
API 参考

API 参考

端点、请求字段和响应契约。

聊天补全#

POST /v1/chat/completions 接受 model 和 messages。每条消息包含 role 和 content。可选字段包括 temperature、max_tokens、stream、tools、tool_choice 和 response_format,具体取决于部署的模型是否支持。成功时返回 id、object、choices 和 usage。流式传输返回 text/event-stream。

旧版补全#

POST /v1/completions 接受 model 和 prompt。仅当服务后端为所请求模型公开补全模式时受支持。

嵌入#

POST /v1/embeddings 使用 modelinput。使用此端点前请确认支持的嵌入部署;服务不可用返回 503 service_unavailable。查看服务状态 了解可用性。

模型发现#

GET /v1/models 列出连接的部署 ID。目录条目描述模型及其费率;使用模型发现和服务状态 检查可用性。

响应字段#

非流式响应包含 usage.prompt_tokens 和 usage.completion_tokens。SSE 以权威用量记录后跟 [DONE] 结束。提供程序错误会经过规范化,并排除内部凭据。

辅助服务#

音频转录、图像生成、重排序和托管批处理需要各自支持的部署。使用前请查看服务状态;不可用的操作返回 service_unavailable。列出的费率不构成有效的服务。

请求示例

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'