Artificial Analysis 完整文章(网页) · 2026/9/22

Grok 4.7 智能指数得分 46,SpaceXAI 跻身前四

Artificial Analysis 于 2026 年 9 月 21 日评测 Grok 4.7,其智能指数得分 46,比 Grok 4.6 高 2 分,使 SpaceXAI 进入顶级 AI 实验室前四。模型在智能体知识工作(AA-Briefcase 1657 Elo)与编码智能体(指数 56 分)方面显著提升,但 token 用量明显增加。

Artificial Analysis 全部文章 2026年9月21日

Grok 4.7 在 Artificial Analysis 智能指数上得分 46,将 SpaceXAI 带入顶级 AI 实验室前四名。编码智能体指数表现也有所提升,超越 GPT-5.6 Sol。见模型页面。

Grok 4.7 在智能指数上比 Grok 4.6 提升 2 分,在智能体知识工作任务上表现强劲。我们在 xhigh 推理努力下评估了这款新模型。

关键要点: ➤ Grok 4.7 加入智能体知识工作前沿:在 AA-Briefcase(我们用于长时程智能体知识工作的私有基准)上,Grok 4.7 比 Grok 4.6(high)提升 +111 Elo,得分 1657 Elo,仅次于前沿的 Claude Opus 5 和 Claude Fable 5.1。在 GDPval-AA 上得分 1695 Elo,比 Grok 4.6(high)高 +90。 ➤ 编码智能体表现跃升:Grok 4.7(xhigh)配合 Grok Build 在 Artificial Analysis 编码智能体指数上得分 56,比 Grok 4.6(xhigh)提升 +9 分。在其原生框架中的模型里,Grok 4.7 + Grok Build 排名第 4,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。 ➤ 其他方面增量变化:在智能体知识工作之外,Grok 4.7 在智能指数的其他任务上大致与 Grok 4.6(high)持平。它在 Terminal-Bench 4.0(+4.5 个百分点)和 GDP.pdf(+3.0 p.p.)上有所提升,但在 AA-LCR(-3.7 p.p.)和 AutomationBench-AA(-1.1 p.p.)上出现回退。 ➤ 任务中 token 使用量高:Grok 4.7 的提升伴随更高的 token 使用。Grok 4.7(xhigh)每个智能指数任务约使用 81k 输出 token,而 Grok 4.6(high)为 36k,GPT-6 Astra(max)为 27k——分别多 125% 和 196%。

其他模型细节: ➤ 上下文窗口 500k token,与 Grok 4.6 相同 ➤ 定价为每 100 万输入/输出 token 2 美元/6 美元,缓存命中折扣至每 100 万 token 0.50 美元,与 Grok 4.6 一致 ➤ 可配置推理努力从 low 到 xhigh。我们的评估使用 xhigh。

Grok 4.7 在智能体知识工作任务上加入前沿。在 AA-Briefcase 上(用于评估模型在真实专业工作任务上的表现),Grok 4.7 得分 1657 Elo,比 Grok 4.6(high)提升 111,仅次于 Claude Opus 5 和 Claude Fable 5.1。Grok 4.7 的提升主要由分析质量带动:分析质量得分 1994 Elo,呈现质量得分 1499,而 Grok 4.6(high)分别为 1690 和 1519。AA-Briefcase 还会检查提交是否满足每项任务的要求,从完成分析到产出所要求的交付物。

在 GDPval-AA 上,Grok 4.7 得分 1695 Elo,而 Grok 4.6(high)为 1605。这些任务要求模型产出实用的工作产品,如文档、电子表格和幻灯片。

Grok Build 配合 Grok 4.7(xhigh)在 Artificial Analysis 编码智能体指数上得分 56,高于 Grok 4.6(xhigh)的 47。三个组成部分均有提升:DeepSWE v1.1 从 65% 升至 73%,Terminal-Bench 4.0 从 18% 升至 33%,SWE-Atlas-QnA 从 58% 升至 63%。这些结果评估的是 Grok 配合其第一方编码智能体 Grok Build 的表现。它们与智能指数结果不同,后者标准化了跨模型使用的评估框架。

Grok 4.7 的提升伴随更高的 token 使用。Grok 4.7(xhigh)在智能指数上得分 46,每任务使用 81k 输出 token,是 Grok 4.6(xhigh)使用的 38k 的两倍多。相比之下,Muse Spark 1.3(max)为 60k,GPT-6 Astra(max)为 27k。

我们的性能测量显示,Grok 4.7 对长提示的答案输出速度约为 188 token/秒。Grok 4.7 平均每个智能指数任务约 7.1 分钟。

Grok 4.7(xhigh)的 AA-Omniscience 幻觉率低于 Grok 4.6(high):29% 对 34%。准确率大致不变,为 47% 对 48%,AA-Omniscience 指数整体从 30 提升至 32。

Grok 4.7(xhigh)的完整智能指数评估细分,连同 Grok 4.6(high)和其他领先模型。

阅读最新

蚂蚁集团发布面向金融的 Ling-3.0-flash-Fin 蚂蚁集团已于 2026 年 9 月 16 日发布其面向金融的 flash 模型 Ling-3.0-flash-Fin。

宣布 Artificial Analysis 能力指数 v1.1 我们新增了来自 AutomationBench-AA 的智能体工具使用,将 AA-Briefcase 加入智能体知识工作,将 GDP.pdf 加入长上下文。能力指数 v1.1 使每个指数更贴近其覆盖的工作,结合核心智能指数 v4.3 评估的切片以及专门评估。2026年9月14日

基准测试 GPT-6 Astra GPT-6 Astra 在我们的两个旗舰指数中与 Claude Fable 5.1 并列领先,且成本更低。Astra 在智能指数上与 Fable 5.1 持平,成本约为其 40%,在编码智能体指数上成本约为其 60%。2026年9月9日

FDE 判断

Grok 4.7 在长时程智能体知识工作与编码智能体上的提升,意味着企业客户交付中复杂分析与编码自动化的可用性增强,FDE 部署 agent 时可选模型更多,排名已接近前沿。但每个任务 token 用量大幅上升会推高推理成本,交付方案需在性能与成本间权衡。