Agent 使用场景

适合 Agent 的 LLM API

调用应用函数、操作浏览器工具,或协调多步骤工作流。从最接近产品动作边界的任务开始。

将模型决策连接到应用工具的 AI Agent 工作流
适合 Agent 的 LLM API

生产方案

API、主模型与故障切换配置

需要衡量什么需要记录什么
工具选择是否正确结果、延迟、Token 用量,以及接受或拒绝输出的原因
Schema 遵循情况结果、延迟、Token 用量,以及接受或拒绝输出的原因
工具报错后的恢复能力结果、延迟、Token 用量,以及接受或拒绝输出的原因
完整循环成本结果、延迟、Token 用量,以及接受或拒绝输出的原因
01

选择 Agent 需要执行的操作

调用应用函数、操作浏览器工具,或协调多步骤工作流。从最接近产品动作边界的任务开始。

  • 用于函数调用的 LLM API
  • 用于浏览器 Agent 的 LLM API
  • 用于工作流自动化的 LLM API
02

同时测试工具调用与故障恢复

检查工具选择、参数、权限、重试、确认步骤和最终应用状态。消息看起来正确,并不代表实际操作正确。

  • 工具选择是否正确
  • Schema 遵循情况
  • 工具报错后的恢复能力
  • 完整循环成本
03

计算可用结果的完整成本

计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。

常见问题

应该先做哪个工作流?

优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。

第一轮应该测试多少个模型?

先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。

比较模型时哪些条件必须一致?

所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。

为这项工作选择模型

使用相同的应用输入和验证规则,对比主路由与备用路由。

浏览模型