核心规格数据源复核于 2026 年 9 月 1 日
官方模型 IDgrok-4.6
上下文500K
推理可配置
输入 / 输出每百万 Token$2 / $6
可选模型
从系列进入具体模型页
02
按决策阅读
如何选择系列内的型号
先确定工作负载和服务目标,再选择能通过真实测试集的最小型号。
- 编码、知识工作和需要大上下文的工具型 Agent 可优先测试 Grok 4.6。
- 交互任务先用 low 或 medium;只有质量提升足以覆盖延迟和输出成本时才使用 high 或 xhigh。
- 简单分类或抽取若测试无明显收益,应选择更轻量的路由。
输入、输出、上下文与工具
- 通过 Responses 与 Chat Completions API 接收文本和图片,并输出文本。
- 500K 上下文适合大型代码库、长文档和较长的 Agent 历史。
- 公开工具包括函数调用、网页搜索、X 搜索与代码执行。
- 推理强度支持 low、medium、high、xhigh,文档默认值为 high。
适合哪些工作负载
这些是优先测试方向,不是放之四海而皆准的结论。请使用自己的提示词、工具和验收条件。
- 多文件编码、调试和仓库分析。
- 结合网页搜索、X 搜索与结构化工具的研究 Agent。
- 跨大量资料的长篇知识工作。
- 需要代码执行与函数调用的多步骤流程。
推理、上下文与成本控制
- 长时间 Agent 循环可使用 prompt_cache_key 或 Chat Completions 会话 Header 提升缓存命中稳定性。
- 接近 500K 前应压缩或总结上下文,不要持续重发无限增长的完整历史。
- 实时互联网或 X 信息必须启用对应搜索工具;基础模型本身不是实时数据源。
发送一个最小请求
示例使用表格中的第一个厂商模型 ID。如果模型广场显示的 ID 不同,请改用当前 API Key 可用的模型 ID。
curl https://app.llmfly.ai/v1/chat/completions \
-H "Authorization: Bearer $LLMFLY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"messages": [{"role": "user", "content": "Explain this request in three bullets."}],
"stream": false
}'限制与兼容性说明
- 达到厂商长上下文阈值后,请求价格会翻倍;需确认所选路由如何计费。
- 图片输入受格式和大小限制,上线前应验证预处理流程。
- 新版 Grok 并不支持所有旧采样参数,包括 log probabilities。
生产上线评估清单
- 准备 20–50 条有代表性的任务,并在测试前写明通过条件。
- 记录首 Token 延迟、总延迟、输入输出 Token、工具重试和完整任务成本。
- 验证应用实际使用的 Endpoint、流式模式、工具 Schema 与结构化输出。
- 验证 400、401、404、429 和临时 5xx 的处理方式,并限制重试次数。
- 将模型 ID 放进配置,并在正式切换前验证备用模型。
哪些信息必须在 LLMFly AI 中确认
模型广场会显示当前 API Key 可用的模型 ID、计费倍率、可用状态、支持的接口和兼容说明。部署前请确认这些信息,并发送一个小请求验证。
- Grok 4.6 提供 500K 上下文。
- 可按任务需要配置推理强度。
- 请求中的模型 ID 必须对当前 API Key 可用;不可用的名称会返回 404。
常见问题
表里的模型 ID 可以直接发给 LLMFly AI 吗?
不一定。它们是厂商 ID,请使用模型广场中当前 API Key 可用的模型 ID。
表里是 LLMFly AI 的价格吗?
不是。它们是厂商参考价,实际扣费以模型广场和用量记录为准。
上下文窗口越大,回答一定越好吗?
不一定。经过筛选的上下文通常有更好的相关性、延迟和成本表现。公开窗口是上限,不是目标。
推理强度应该怎么选?
先使用文档默认值,只有测试显示质量或延迟有明确收益时再调整。
生产备用模型需要满足什么?
备用模型必须通过相同的请求格式、工具 Schema 与安全检查,并由应用明确何时允许切换。
确认当前路由
把模型名写入生产配置前,先打开模型广场核对。