业务场景
多语言聊天机器人在生产应用中的实际场景
一个旅行产品支持英语、日语、西班牙语和中文。系统识别会话地区,加载对应地区的产品词表和政策片段,再要求模型回答,同时不得翻译受保护的产品名称。
每种语言分别评分。不能因为平均分较高就上线某个语言;只有母语审查者认可该地区的意图、术语、语气和拒答行为后才上线。
生产使用场景
一个旅行产品支持英语、日语、西班牙语和中文。系统识别会话地区,加载对应地区的产品词表和政策片段,再要求模型回答,同时不得翻译受保护的产品名称。

生产方案
| 生产选择 | 推荐配置 | 原因 |
|---|---|---|
| API | POST /v1/chat/completions | 从服务端发送 OpenAI 兼容请求 |
| 主模型 | gemini-2.5-flash | Gemini 2.5 Flash 是多语言、延迟敏感对话工作负载的首选。 |
| 备用模型 | gpt-5.4-mini | 只有在某种语言通过相同母语审查时才使用 gpt-5.4-mini 备用;政策密集或混合语言失败升级到 Terra。 |
| 升级模型 | gpt-5.6-terra | 只有主路由越过已定义的质量或复杂度边界时才使用 |
| 输出契约 | 场景专用文本或补丁 | 地区语言正确、受保护术语保持不变,且不混入其他地区政策的回复。 |
一个旅行产品支持英语、日语、西班牙语和中文。系统识别会话地区,加载对应地区的产品词表和政策片段,再要求模型回答,同时不得翻译受保护的产品名称。
每种语言分别评分。不能因为平均分较高就上线某个语言;只有母语审查者认可该地区的意图、术语、语气和拒答行为后才上线。
请求应从服务端发送。请将示例内容和占位工具 Schema 替换为应用中的真实数据与工具。
curl https://app.llmfly.ai/v1/chat/completions \
-H "Authorization: Bearer $LLMFLY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash",
"messages": [
{"role": "system", "content": "Reply in the detected locale. Preserve GLOSSARY terms exactly. Use only the supplied locale policy and do not translate protected product names."},
{"role": "user", "content": "Explain the cancellation window in the customer's language using the locale policy."}
]
}'Gemini 2.5 Flash 是多语言、延迟敏感对话工作负载的首选。
只有在某种语言通过相同母语审查时才使用 gpt-5.4-mini 备用;政策密集或混合语言失败升级到 Terra。
| 指标 | 通过条件 |
|---|---|
| 意图保持 | 在每种支持语言中,请求动作和约束都保持不变 |
| 术语准确性 | 产品、法律和行业受控术语符合地区词表 |
| 母语审查采纳率 | 母语审查者认可含义、语气和流畅度,无需实质改写 |
| 按语言统计的延迟与成本 | 每种上线语言分别满足响应时间和会话成本预算 |
地区语言正确、受保护术语保持不变,且不混入其他地区政策的回复。
每次生产运行都应记录模型 ID、Request ID、Token 用量、重试、验证结果和最终处理状态。
应使用母语样例,因为意图、语气、术语和政策会随地区变化。
只有每种语言都通过测试才可以;分别路由可能更稳妥。
使用真实混合语言消息,并验证意图和必要术语是否保留。
让主模型和备用模型使用相同请求、工具和验证规则。