聊天补全#
POST /v1/chat/completions 接受 model 和 messages。每条消息包含 role 和 content。可选字段包括 temperature、max_tokens、stream、tools、tool_choice 和 response_format,具体取决于部署的模型是否支持。成功时返回 id、object、choices 和 usage。流式传输返回 text/event-stream。
旧版补全#
POST /v1/completions 接受 model 和 prompt。仅当服务后端为所请求模型公开补全模式时受支持。
嵌入#
POST /v1/embeddings 使用 model 和 input。使用此端点前请确认支持的嵌入部署;服务不可用返回 503 service_unavailable。查看服务状态 了解可用性。
模型发现#
GET /v1/models 列出连接的部署 ID。目录条目描述模型及其费率;使用模型发现和服务状态 检查可用性。
响应字段#
非流式响应包含 usage.prompt_tokens 和 usage.completion_tokens。SSE 以权威用量记录后跟 [DONE] 结束。提供程序错误会经过规范化,并排除内部凭据。
辅助服务#
音频转录、图像生成、重排序和托管批处理需要各自支持的部署。使用前请查看服务状态;不可用的操作返回 service_unavailable。列出的费率不构成有效的服务。
请求示例
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'