聊天机器人使用场景

适合聊天机器人的 LLM API

搭建客服、知识库或多语言聊天机器人。每种方案都会说明如何让回答有依据、处理信息缺失并安全转人工。

连接客服知识库与转人工工具的客户对话
适合聊天机器人的 LLM API

生产方案

API、主模型与故障切换配置

需要衡量什么需要记录什么
首 Token 延迟结果、延迟、Token 用量,以及接受或拒绝输出的原因
对话历史成本结果、延迟、Token 用量,以及接受或拒绝输出的原因
指令遵循结果、延迟、Token 用量,以及接受或拒绝输出的原因
故障切换表现结果、延迟、Token 用量,以及接受或拒绝输出的原因
01

选择你要支持的对话

搭建客服、知识库或多语言聊天机器人。每种方案都会说明如何让回答有依据、处理信息缺失并安全转人工。

  • 用于客服机器人的 LLM API
  • 用于 RAG 聊天机器人的 LLM API
  • 用于多语言聊天机器人的 LLM API
02

测试完整对话

加入常见问题、模糊请求、数据缺失、多轮上下文和必须转人工的情况,检查最终客户问题是否真正解决。

  • 首 Token 延迟
  • 对话历史成本
  • 指令遵循
  • 故障切换表现
03

计算可用结果的完整成本

计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。

常见问题

应该先做哪个工作流?

优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。

第一轮应该测试多少个模型?

先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。

比较模型时哪些条件必须一致?

所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。

为这项工作选择模型

使用相同的应用输入和验证规则,对比主路由与备用路由。

浏览模型