埃隆·马斯克 (Elon Musk) 的 xAI 于周一下午发布了 Grok 4.7,这是迄今为止最好的模型,称其“在相同价格和速度下比 Grok 4.6 有了显着改进”。

此次发布是在几次明显的延迟之后发布的。自7月下旬以来,马斯克已经将时间线向后推了至少五次:“四个星期”,然后是“几周”,然后是“3到4周”,然后是9月1日的“10天”,然后是9月11日“还需要几天的时间来做饭”。

xAI 表示,与 Grok 4.6 相比,该模型解决难题的时间更长,并且更频繁地双重检查自己的答案,同时还拥有该公司所谓的迄今为止最强大的安全护栏。

马斯克对 X 进行了跟进,称 Grok 4.7 是“智能、速度和低成本的强大结合”。这次没有等待名单——它现已在 Grok 应用程序、Cursor、Grok Build 和 xAI API 中上线。

Grok 4.7 来了。

在相同的价格和速度下,它比 Grok 4.6 有了显着的改进。 pic.twitter.com/H3OTBbXyvO

- SpaceXAI (@SpaceXAI) 2026 年 9 月 21 日

Grok 4.7 包含 2.1 万亿个参数,比 Grok 4.6 的 1.5 万亿个参数增加了 40%,Grok 4.6 本身是 Grok 4.5 的改进版。成本为每百万输入代币 2 美元,每百万输出代币 6 美元。参数是模型在训练过程中调整的内部旋钮,参数越多通常意味着学习模式的能力越强,而令牌是人工智能模型可以注册或生成的基本信息量。

xAI 还纳入了从马斯克的火箭公司 SpaceX 获取的补充训练数据:星链卫星遥测、制造记录和工程故障日志。与纯粹基于互联网文本训练的任何模型相比,该模型能够更好地推理硬件和物理系统。

也就是说,基准分数讲述了一个熟悉的故事。 GDPval 使用由各个领域的专业人士审查的任务来衡量模型在真实的、具有经济价值的知识工作(法律备忘录、电子表格、幻灯片)上的表现,并将其作为 Elo 评级进行评分,这与国际象棋使用的面对面排名系统相同。

Grok 4.7 的 GDPval 达到 1695。 《克劳德寓言 5.1》以 1735 的成绩位居榜首。

由Artificial Analysis构建的AA-Briefcase测试了将研究、分析和文档制作整合为一项长期任务的多小时办公室工作,也在Elo量表上进行了评分。 Grok 4.7 发布了 1657,而 Fable 5.1 发布了 1678。相同的结果,不同的测试。

CursorBench 4.0 是 Cursor 在其编辑器中针对实际编码任务的基准,根据每个任务消耗的成本和令牌计数绘制了准确性。 Grok 4.7 处于中间位置:每项任务的价格高于 GPT-5.6 Sol 的后继者 GPT-6 Astra 和 Claude Sonnet 5,但仍低于 Fable 5.1,后者在图表上的每个价格点上都获胜。

这并不是 xAI 的新模式。 Grok 4.5 于 7 月推出,拥有业界最大的训练集群,得分仅次于 Claude 和 OpenAI 的模型,位居第三。在此之前,Grok 4.20 用可靠性换取了速度和个性。 Grok 4.6 在编码自主性方面也落后于前沿包。

对于数以百万计通过 X、独立应用程序或 Tesla 仪表板与之交谈的人来说,这一切并不意味着 Grok 4.7 是一个糟糕的产品。这意味着最有可能回答您的问题或为您的汽车语音助手提供动力的模型正在其自己的制造商的基准测试中将梯级置于梯子顶部下方的系统上运行。

对于大多数人来说,这种差距就是价格标签比排行榜位置更重要的原因。 xAI 一直在降低 Anthropic 和 OpenAI 的每代币成本,尽管它在原始功能上落后于他们,并押注“足够好、便宜、无处不在”在大部分日常使用中击败“最好,但价格更高”。

马斯克在发布前几天就已经降低了预期,并写道 Grok 4.7 应该“大致与”Anthropic 的 Claude Opus 5.0 相当,而不是较新的 Opus 5.1,多模式性能仍需改进。

在同一篇文章中,他概述了接下来的三个模型:Grok 4.8 作为一个有意义的进步,Grok 4.9 处于“Astra/Fable 级别”,而 Grok 5 作为可能的前沿领导者。这些升级尚未确定发布日期。 “我们拭目以待,”他写道。