编码、长文档、工具型 Agent,以及正在从 Sonnet 4.6 升级的生产系统。
依赖旧采样参数、手动 thinking budget 或 Assistant Prefill 且尚未改造的集成。
按决策阅读
从 Sonnet 4.6 迁移前先看这张表
| 旧集成假设 | Sonnet 5 行为 | 需要修改 |
|---|---|---|
| 手动 extended-thinking budget | 不再支持 | 使用 adaptive thinking + effort |
| 非默认 temperature / top_p / top_k | 返回 400 | 删除或恢复默认值 |
| Assistant Message Prefilling | 不支持 | 改为用户消息与明确格式约束 |
| 沿用旧 Token 预算 | 可能低估 | 重新 Tokenize 并调整 max_tokens |
为什么 Tokenizer 变化会影响预算
- 重新统计系统提示词、工具 Schema 和常见文档。
- 思考 Token 与最终文本共享输出预算。
- 同时检查截断率、延迟和单任务成本。
- 在真实路由上验证缓存和计费记录。
Adaptive thinking 与 effort 怎么设置
Sonnet 5 默认启用 adaptive thinking,并通过 effort 控制。先使用默认 high 建立质量基线,再测试较低 effort 是否能在可接受质量下减少延迟与输出。
- 默认提供 1M 上下文,最大输出可达 128K Token。
- 默认启用 adaptive thinking,并通过 effort 参数控制。
- 在支持的平台上提供工具调用、Browser Use 和 Computer Use Toolset。
- 重点面向编码与 Agent 工作流。
Sonnet 5 适合的生产工作负载
其定位重点是编码与 Agent,但仍应使用团队自己的仓库、工具和失败场景验证。
- 生产编码、前端开发、代码审查与重构。
- 长文档分析与知识工作流。
- 需要工具、浏览器交互和结构化检查点的 Agent。
- 从 Sonnet 4.6 升级、同时希望保持 Sonnet 级延迟的团队。
通过 LLMFly AI 调用 Sonnet 5
示例走 OpenAI 兼容入口。模型广场若提供不同协议或路由名,请按当前 Key 的实际配置验证工具调用、流式输出和错误响应。
curl https://app.llmfly.ai/v1/chat/completions \
-H "Authorization: Bearer $LLMFLY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarize the tradeoffs in three bullets."}],
"stream": false
}'无停机迁移检查清单
- 复制现有流量样本并离线重放,不直接切换全部生产流量。
- 移除不兼容采样参数和 Assistant Prefill。
- 重新计算 Token、max_tokens、超时和预算。
- 验证 400 错误、工具调用、结构化输出和截断。
- 先灰度小比例流量,并保留可回滚的 Sonnet 4.6 路由。
Sonnet 5 目前不兼容的做法
- 不再支持手动 extended-thinking budget,应改用 adaptive thinking 与 effort。
- 非默认 temperature、top_p 或 top_k 会返回 400。
- 不支持 Assistant Message Prefilling。
- 相同文本使用新 Tokenizer 可能比 Sonnet 4.6 多约 30% Token,应重新计数并调整预算。
Claude Sonnet 5 规格来源与使用说明
迁移行为与规格核对自 Anthropic Claude Sonnet 5 documentation:https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5。LLMFly AI 是否开放特定协议与工具,以模型广场和小请求实测为准。
常见问题
Sonnet 5 可以直接替换 Sonnet 4.6 的模型 ID 吗?
不建议直接替换。需要处理 Tokenizer、adaptive thinking、采样参数、Assistant Prefill 和输出预算差异。
为什么旧 temperature 参数会报错?
Sonnet 5 对非默认 temperature、top_p 或 top_k 返回 400,应删除这些覆盖值或使用支持的默认行为。
Sonnet 5 还支持手动 thinking budget 吗?
不支持旧式手动 extended-thinking budget,应改用 adaptive thinking 与 effort。
Token 成本一定比 Sonnet 4.6 低吗?
不能只按单价推断。新 Tokenizer 对同一文本可能产生更多 Token,应以真实请求记录比较。
迁移时如何降低风险?
离线重放、重新计数 Token、小比例灰度,并保留可回滚路由。
用真实任务测试 Claude Sonnet 5
获取 API Key,确认当前路由,再从一个小型代表性请求开始。