weightsapi.推理控制台
导航
使用场景

您可以评估的使用场景

针对对话助手、代码和工具工作流以及文档问答的实用场景,并附有清晰的输入和质量检查。

概览

在选择模型或迁移流量之前,将实际任务转化为可测试的工作流。

从可检查的结果开始

选择一个可重复的任务,并收集一小组代表性输入,包括模糊请求和缺失信息。定义谁审查输出以及什么使回答可接受。

使用这些场景来定义您自己的验收标准。在引入敏感材料前,请阅读工作原理,查看常见问题并审查数据处理。在运行工作负载前,请查看服务状态

AI 访问需要登录、一次至少 100 美元的已确认充值、一个已授权的 API 密钥以及足够的可用余额来支付请求。之后的每次充值也有 100 美元的最低要求;较小的剩余余额在足以支付请求时仍可使用。余额需要交易验证。发送流量前,请查看服务状态了解模型可用性。

从简短对话起草回复

对于支持团队或内部帮助台,提供已批准的事实、最近的对话和清晰的写作风格;有用的结果是一份可审查的回复。

如果研讨会列出周二至周五的收集时间,而客户询问周日,回复应解释周日不在提供的时间内,并建议确认可用性。不应承诺预约。

质量检查: 验证每个事实声明,保留相关对话上下文,并标记缺失信息。将发送或预订保留在您自己的审查步骤之后。从聊天机器人配方Open WebUI 指南开始,然后在使用前验证所选部署。

审查代码并约束工具操作

对于库存助手,提供相关代码、任务和允许的工具定义。请求 SKU keyboard 的库存水平,并检查应用程序如何处理缺失的 SKU。

预期行为: 提出一个允许的 get_stock 调用并带有经验证的参数,在回答中使用其返回的数据,并解释缺失输入检查。您的应用程序决定是否运行调用;在文件编辑、命令或外部操作前要求权限检查和明确审查。

质量检查: 拒绝未知工具、意外参数和未授权操作,并测试缺失或格式错误的输入。遵循有界工具配方Cline 配置;在启用工具前验证部署能力。

从您控制的文档回答问题

对于内部知识助手,您的应用程序提供文档集合和检索器,然后将所选摘录与稳定的源 ID 一起传递给模型。WeightsAPI 目前不提供嵌入;RAG 配方使用一个小型词法排序示例。

如果源 S1 要求经理批准,而源 S2 说紧急请求遵循相同流程,那么关于紧急访问的回答应引用两个源并保留批准要求。不应凭空捏造批准截止日期。

质量检查: 确认检索到相关摘录,每个引文支持其声明,缺失证据产生明确的限制。在检索层强制执行文档权限,并测试集合无法回答的问题。

在切换流量前比较质量和成本

使用可用的部署,以相同的输入和可比较的设置比较候选模型。对事实准确性、指令遵循、引文和有效的工具参数进行评分;记录输入和输出代币以及首字延迟和完成时间。

使用当前的定价表和实际使用量,包括重复的上下文和重试。设置密钥预算、限制重试并保留回滚路径。只有在您自己的验收标准通过后才切换流量。

需要下一步吗?

查找相关指南或准备好您的问题详情。

打开支持