生产使用场景

用于 RAG 聊天机器人的 LLM API

内部政策助手需要回答人事手册和地区补充文件中的问题。检索发生在模型调用之前,每个段落保留文档 ID、章节、生效日期和访问标签。

关联私有文档支持段落与引用的 RAG 回答
用于 RAG 聊天机器人的 LLM API

生产方案

API、主模型与故障切换配置

生产选择推荐配置原因
APIPOST /v1/chat/completions从服务端发送 OpenAI 兼容请求
主模型gemini-2.5-proGemini 2.5 Pro 适合作为长证据集合和跨文档综合的主路由。
备用模型gemini-2.5-flash短且检索质量高的问题使用 Gemini 2.5 Flash。只有确认检索无误后,才把歧义政策综合升级到 Terra。
升级模型gpt-5.6-terra只有主路由越过已定义的质量或复杂度边界时才使用
输出契约场景专用文本或补丁每个重要结论后带段落 ID;证据不足时明确说明缺口。
01
业务场景

RAG 聊天机器人在生产应用中的实际场景

内部政策助手需要回答人事手册和地区补充文件中的问题。检索发生在模型调用之前,每个段落保留文档 ID、章节、生效日期和访问标签。

Gemini 2.5 Pro 只接收选中的段落,并必须引用使用的段落 ID。地区政策发生冲突时,回答要展示冲突,而不是无声选择。

02
应用架构

RAG 聊天机器人工作流怎样运行

  • 检索前验证用户权限。
  • 检索并重排段落,同时保留文档元数据。
  • 向模型发送能够充分回答的最小证据集。
  • 要求句子级段落 ID。
  • 验证引用支持,证据缺失时拒答。
03
API 请求

通过 LLMFly AI 调用 gemini-2.5-pro

请求应从服务端发送。请将示例内容和占位工具 Schema 替换为应用中的真实数据与工具。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2.5-pro",
    "messages": [
      {"role": "system", "content": "Answer only from the supplied passages. Cite passage IDs after each material sentence. If passages are missing or conflicting, state that explicitly."},
      {"role": "user", "content": "Can a Shanghai employee carry unused leave into next year? Use the supplied policy passages."}
    ]
  }'
04
模型选择

为什么主模型选择 gemini-2.5-pro

Gemini 2.5 Pro 适合作为长证据集合和跨文档综合的主路由。

短且检索质量高的问题使用 Gemini 2.5 Flash。只有确认检索无误后,才把歧义政策综合升级到 Terra。

05
验收

RAG 聊天机器人的验收条件

指标通过条件
检索召回率对于可回答的测试问题,检索阶段能返回已知支持段落
引用正确率每条引用都直接支持其对应的句子或字段
无依据结论比例最终回答中不出现没有来源支持的重要结论
正确拒答率来源缺失、过期或冲突时,助手会拒答或明确限定结论
06
失败处理

上线前必须处理的失败情况

  • 把检索漏召回归因于模型
  • 把所有文档塞进上下文
  • 展示无关引用
  • 证据缺失时强制回答
07
输出

返回结果与运行记录

每个重要结论后带段落 ID;证据不足时明确说明缺口。

每次生产运行都应记录模型 ID、Request ID、Token 用量、重试、验证结果和最终处理状态。

常见问题

检索和模型哪个更重要?

两者都重要,但应分开评估,避免把检索漏召回误判为生成失败。

提示词中应该放多少段落?

在预算内使用能够充分支持答案的最小集合。

来源冲突时怎么办?

展示冲突、来源和日期,不要无声地选择一个说法。

使用你的真实输入测试这套方案

让主模型和备用模型使用相同请求、工具和验证规则。

比较模型