生产使用场景

用于数学推理的 LLM API

价格服务需要解释订阅按比例调整金额。应用代码先计算结果;模型接收公式、已经验证的中间值、币种规则和客户上下文,再生成简洁解释。

与确定性计算结果交叉验证的数学推理回答
用于数学推理的 LLM API

生产方案

API、主模型与故障切换配置

生产选择推荐配置原因
APIPOST /v1/chat/completions从服务端发送 OpenAI 兼容请求
主模型gpt-5.6-terraTerra 适合作为定量推理和面向客户清晰解释的默认模型。
备用模型gpt-5.4所有数值已预计算时,公式解释可使用 gpt-5.4。真正困难的推导升级到 Sol,但仍需确定性验证。
升级模型gpt-5.6-sol只有主路由越过已定义的质量或复杂度边界时才使用
输出契约场景专用文本或补丁简洁解释,其中金额、单位和舍入与独立计算结果完全一致。
01
业务场景

数学推理在生产应用中的实际场景

价格服务需要解释订阅按比例调整金额。应用代码先计算结果;模型接收公式、已经验证的中间值、币种规则和客户上下文,再生成简洁解释。

对于开放式定量分析,模型可以提出计算器或代码工具调用,但最终数值始终在模型之外重新计算并核对。

02
应用架构

数学推理工作流怎样运行

  • 计算或检索可信数值输入。
  • 要求模型给出公式和解释,而不是未经检查的算术。
  • 需要时执行计算器或代码工具。
  • 重新计算最终结果,并验证单位和舍入。
  • 返回经过验证的答案和简洁推导。
03
API 请求

通过 LLMFly AI 调用 gpt-5.6-terra

请求应从服务端发送。请将示例内容和占位工具 Schema 替换为应用中的真实数据与工具。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "messages": [
      {"role": "system", "content": "Explain the verified calculation using the supplied formula and values. Preserve currency, units, and rounding rules. Do not change any verified numeric input."},
      {"role": "user", "content": "Explain this prorated subscription adjustment to the customer in three short steps."}
    ]
  }'
04
模型选择

为什么主模型选择 gpt-5.6-terra

Terra 适合作为定量推理和面向客户清晰解释的默认模型。

所有数值已预计算时,公式解释可使用 gpt-5.4。真正困难的推导升级到 Sol,但仍需确定性验证。

05
验收

数学推理的验收条件

指标通过条件
验证后答案准确率在目标题集中,最终答案与独立复核结果一致
单位与精度遵循单位、舍入、有效数字和不确定性符合任务约定
等价提示词一致性等价表述在允许误差内产生相同答案
每个已验证解答的成本模型调用、工具、重试和检查总成本不超过解题预算
06
失败处理

上线前必须处理的失败情况

  • 使用未经复核的基准答案
  • 把表达流畅当成正确
  • 让模型独立完成脆弱算术
  • 忽略错误单位
07
输出

返回结果与运行记录

简洁解释,其中金额、单位和舍入与独立计算结果完全一致。

每次生产运行都应记录模型 ID、Request ID、Token 用量、重试、验证结果和最终处理状态。

常见问题

模型应该展示完整内部推理吗?

评估最终答案和简洁、可核对的解释,不要依赖隐藏推理。

什么时候使用计算器?

当算术、符号运算或模拟需要验证时,使用确定性工具。

如何比较成本?

按每个已验证解答比较成本,包括工具、重试和验证。

使用你的真实输入测试这套方案

让主模型和备用模型使用相同请求、工具和验证规则。

比较模型