weightsapi.推理控制台
导航
工作原理

从任务到更清晰的推理工作流。

了解托管推理、选择模型、准备请求,并理解信用额度、预留金额与用量之间的关系。

概览

选择模型,设置访问和支出控制,然后跟踪请求使用情况和付款状态。在发送流量前检查模型可用性。

了解服务管理的内容

托管推理将模型服务置于 API 之后,使您的应用程序无需运行 GPU 服务器即可请求答案。WeightsAPI 对开放权重模型使用与 OpenAI 兼容的请求格式;请查看服务状态以了解可用性。

您仍然拥有应用程序:其提示、数据选择、权限、重试行为和输出检查。从具体任务开始,并决定有用的答案会是什么样子。用例指南提供了起点,但并未承诺每个模型都支持所有功能。

为实际任务选择模型

使用模型目录比较能力、许可证、上下文和输入/输出费率。阅读模型页面,然后在请求中使用其确切的 API 模型 ID。区分发布者的原生上下文与确认的部署限制:输入和预期输出必须符合后者。

目录列表并不证明部署可用。当后端可用时,模型发现会列出已连接的部署。请比较定价上的相关费率,而不要假设所有模型成本相同。

准备一个小的、可检查的请求

从简短提示、确切的模型 ID 和有界输出开始。快速入门解释了 chat-completions 格式。仅添加任务所需的对话历史,并将 API 凭据保存在您的服务器上。

流式是可选的:它以事件形式传递答案,而非一次性完整响应。启用前请阅读流式指南,包括如何处理中断的响应以及最终用量记录。

分离访问和支出

登录控制台。为应用程序或环境创建单独的密钥,设置正支出上限,并在有用时限制允许的模型。首次显示时保存密钥。

密钥上限适用于生命周期内记录的使用量和未结预留,而不是每月配额。更换泄露的密钥并撤销旧密钥。常见问题解答解释了密钥、余额和待处理请求之间的关系。

AI 访问需要登录、至少 100 美元的一次性确认充值、授权的 API 密钥以及足够的可用余额来覆盖请求。每次后续充值的最低金额也是 100 美元;较小的剩余余额在足以覆盖请求时仍可使用。余额需要交易验证。在发送流量之前,请检查服务状态以了解模型可用性。

区分可用余额与最终成本

对于已接受的付费请求,可用余额在生成开始前覆盖输入和最大输出。最终成本使用实际输入/输出使用量;初始预留不是最终费用。因此,等待结算的请求可能会减少可用余额。

如果响应在最终使用量确认前停止,预留可能会一直保留到对账完成。资金订单提供付款说明;余额需要交易验证。请查看计费以了解报价截止时间、确认和可用余额。

在扩展之前审查结果

对于文档问题,让您的应用程序选择相关段落,请求带引用的答案,并对照来源检查这些引用。将文档权限和最终审查保留在您的应用程序中。

用代表性示例评估答案质量、上下文使用和预期支出。仅在测试所需功能后再进行扩展。对于错误、中断的流或待处理的余额,请遵循支持指南并保留一份经过清理的报告。

需要下一步吗?

查找相关指南或准备好您的问题详情。

打开支持