文档与数据使用场景

适合推理任务的 LLM API

分析长文档、返回经过验证的结构化数据,或解释已核对的计算结果。进入与目标输出一致的任务。

用于推理任务的文档分析、数据抽取与结果验证流程
适合推理任务的 LLM API

生产方案

API、主模型与故障切换配置

需要衡量什么需要记录什么
真实任务集准确率结果、延迟、Token 用量,以及接受或拒绝输出的原因
输出一致性结果、延迟、Token 用量,以及接受或拒绝输出的原因
延迟预算结果、延迟、Token 用量,以及接受或拒绝输出的原因
重试和验证成本结果、延迟、Token 用量,以及接受或拒绝输出的原因
01

选择应用需要返回的结果

分析长文档、返回经过验证的结构化数据,或解释已核对的计算结果。进入与目标输出一致的任务。

  • 用于文档分析的 LLM API
  • 用于结构化数据抽取的 LLM API
  • 用于数学推理的 LLM API
02

验证最终结果

使用已知答案、证据缺失与冲突样例、严格 Schema 和确定性检查。只有应用能够验证关键字段或结果时才接受响应。

  • 真实任务集准确率
  • 输出一致性
  • 延迟预算
  • 重试和验证成本
03

计算可用结果的完整成本

计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。

常见问题

应该先做哪个工作流?

优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。

第一轮应该测试多少个模型?

先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。

比较模型时哪些条件必须一致?

所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。

为这项工作选择模型

使用相同的应用输入和验证规则,对比主路由与备用路由。

浏览模型