生产使用场景

用于浏览器 Agent 的 LLM API

采购助手打开获准供应商门户,找到指定零件,填写采购申请,并停在最终 Submit 按钮前。浏览器状态通过 open_page、inspect_page、click 和 fill 等工具暴露。

包含受限操作、确认步骤与证据记录的浏览器 Agent 计划
用于浏览器 Agent 的 LLM API

生产方案

API、主模型与故障切换配置

生产选择推荐配置原因
APIPOST /v1/chat/completions从服务端发送 OpenAI 兼容请求
主模型gpt-5.6-sol长流程、有状态的浏览器任务更重视恢复能力和正确停止状态,因此使用 Sol。
备用模型gpt-5.6-terra短且稳定的导航流程可使用 Terra。涉及提交、购买、删除或发送的任务,未经重新安全评估不能降级。
升级模型gpt-5.6-sol只有主路由越过已定义的质量或复杂度边界时才使用
输出契约经过验证的工具调用经过验证的已填写表单和最终状态摘要;确认前不提交。
01
业务场景

浏览器 Agent 在生产应用中的实际场景

采购助手打开获准供应商门户,找到指定零件,填写采购申请,并停在最终 Submit 按钮前。浏览器状态通过 open_page、inspect_page、click 和 fill 等工具暴露。

Sol 负责规划长交互,但域名白名单、下载阻止、截图记录以及提交前确认都由浏览器控制器强制执行,而不是依赖模型自觉。

02
应用架构

浏览器 Agent 工作流怎样运行

  • 使用可恢复测试账户创建带白名单的浏览器会话。
  • 暴露语义页面状态和少量动作。
  • 每执行一个动作就重新检查状态。
  • 遇到布局或时序变化时恢复,而不是猜测坐标。
  • 在有后果动作前立即停止并请求确认。
03
API 请求

通过 LLMFly AI 调用 gpt-5.6-sol

请求应从服务端发送。请将示例内容和占位工具 Schema 替换为应用中的真实数据与工具。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [
      {"role": "system", "content": "Complete the procurement form with browser tools. Stay on allowed domains. Stop before the final submission and ask for confirmation with a summary of the exact order."},
      {"role": "user", "content": "Prepare a purchase request for the approved part and quantity in the attached specification."}
    ],
    "tools": [{"type": "function", "function": {"name": "YOUR_TOOL", "description": "Replace with the tool contract for this workflow", "parameters": {"type": "object", "properties": {}, "additionalProperties": false}}}]
  }'
04
模型选择

为什么主模型选择 gpt-5.6-sol

长流程、有状态的浏览器任务更重视恢复能力和正确停止状态,因此使用 Sol。

短且稳定的导航流程可使用 Terra。涉及提交、购买、删除或发送的任务,未经重新安全评估不能降级。

05
验收

浏览器 Agent 的验收条件

指标通过条件
任务完成率经过验证的应用最终状态与用户要求一致
不必要动作数运行中没有与目标无关的导航、修改或提交
界面变化后的恢复率轻微文案、布局和加载变化不会导致错误动作或虚假完成
确认规则遵循率有后果的操作会在所需确认前立即停止
06
失败处理

上线前必须处理的失败情况

  • 使用生产账户评估
  • 只依赖坐标
  • 过早确认
  • 跳过最终状态验证
07
输出

返回结果与运行记录

经过验证的已填写表单和最终状态摘要;确认前不提交。

每次生产运行都应记录模型 ID、Request ID、Token 用量、重试、验证结果和最终处理状态。

常见问题

怎样验证成功?

检查应用最终状态,而不只是预期点击是否发生。

什么时候需要确认?

在提交、购买、删除或发送等有后果动作之前立即确认。

如何测试变化的界面?

在布局、文案和加载时序发生小变化后重放任务。

使用你的真实输入测试这套方案

让主模型和备用模型使用相同请求、工具和验证规则。

比较模型