核心规格规格复核于 2026 年 9 月 1 日
官方模型 IDgpt-5.6-luna
上下文 / 最大输出1.05M / 128K
厂商输入 / 输出每百万 Token$0.20 input / $1.20 output
推理控制none · low · medium · high · xhigh · max
选型结论Luna 的优势是批量处理成本低,前提是验证机制和模型升级方案完整。
优先考虑
分类、抽取、内容处理、范围明确的子 Agent 和成本敏感的大批量请求。
不建议
无人监督的复杂 Agent、困难仓库修改以及无法接受重试的高风险决策。
02
按决策阅读
规模化任务
Luna 适合解决什么问题
Luna 应用于规则相对明确、结果可以自动验证的大量请求。它的低价只有在输出稳定、重试受控且失败能升级时才会转化为真实节省。
- 分类、抽取、审核分流与数据转换。
- 大批量客服草稿和内容处理。
- 指令范围明确、带结果验证的子 Agent。
- 需要大上下文上限但对成本敏感的应用。
分层路由
设计 Luna → Terra → Sol 路由瀑布
升级规则必须由应用显式控制,并记录最终由哪个模型完成任务。
| 层级 | 承担任务 | 升级信号 |
|---|---|---|
| Luna | 分类、抽取、转换、初稿 | Schema 失败、低置信度、重试超限 |
| Terra | 通用编码、工具流程、复杂输入 | 质量门槛未通过或高风险样本 |
| Sol | 最困难和最高价值任务 | 人工复核或终止 |
单位经济
低单价不等于低任务成本
- 厂商公开价为输入每百万 Token 0.20 美元、输出每百万 Token 1.20 美元。
- 缓存输入公开价为每百万 Token 0.02 美元。
- 大批量任务应统计每个通过结果的成本,因为重试可能抵消表面单价优势。
可靠性
先建立可自动验证的输出契约
- 使用结构化输出或严格 JSON Schema。
- 为缺失字段、枚举越界和空结果设置验证器。
- 限制自动重试次数,并区分可重试与不可重试错误。
- 将低置信度或高风险样本升级到 Terra。
接入
调用 Luna 的最小示例
先使用非流式小请求验证路由、输出格式和用量记录,再逐步增加并发和工具调用。
curl https://app.llmfly.ai/v1/chat/completions \
-H "Authorization: Bearer $LLMFLY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-luna",
"messages": [{"role": "user", "content": "Summarize the tradeoffs in three bullets."}],
"stream": false
}'容量与质量
批量任务上线前需要测什么
- 在真实输入分布上测量通过率,而不是只用理想样本。
- 同时观察 P50/P95 延迟、429、重试和升级比例。
- 检查长上下文是否被误用;大窗口不代表应该发送全部历史。
- 设置成本和错误率告警,避免异常重试放大消费。
限制
Luna 的能力边界
- 更低的 Token 价格不代表适合复杂自主任务。
- 如果不筛选提示词,大上下文仍会增加延迟与花费。
- 需要用真实失败场景评估 Schema 遵循和工具恢复。
- 质量未达标时,应准备 Terra 或 Sol 作为升级路由。
资料边界
GPT-5.6 Luna 规格来源与使用说明
规格与厂商参考价核对自 OpenAI model documentation:https://developers.openai.com/api/docs/models。当前平台路由、倍率和可用性请以模型广场为准。
常见问题
Luna 为什么适合大批量任务?
它的厂商参考价较低,同时保留结构化输出、工具和大上下文能力;但必须验证真实通过率和重试成本。
Luna 失败后应该如何处理?
设置有限重试与明确升级条件,通常先升级 Terra,高风险或最困难样本再考虑 Sol。
Luna 可以做复杂 Agent 吗?
可以测试范围明确、带验证的子 Agent,但不应仅凭低价用于无人监督的复杂自主流程。
Luna 的上下文窗口多大?
厂商公开 1.05M 上下文和 128K 最大输出,但大窗口仍会带来延迟与成本。
如何判断 Luna 是否真的省钱?
统计每个通过结果的总成本,包括重试、升级、工具循环和人工返工。
用真实任务测试 GPT-5.6 Luna
获取 API Key,确认当前路由,再从一个小型代表性请求开始。