X:Greg Brockman (@gdb) · 2026/9/4

GPT-6 Astra 在 ARC-AGI-3 达 SOTA,Greg Brockman 称基准已饱和

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上达到 SOTA。标准 harness 得分 63%,新的 Provider Adapter harness 下达 99%,并在 96% 的关卡上超越人类表现。Greg Brockman 称该基准已饱和。更高推理层级通常成本更低,因为 Astra 动作更少,模型调用和 token 消耗更少。

Greg Brockman 转发了 @arcprize 的评测,并称 OpenAI 的 GPT-6 Astra 已在 ARC-AGI-3 上达到 SOTA(当前最优),该基准正趋于饱和。采用标准 harness 时,Astra 得分为 63%;改用新的 Provider Adapter harness 后达到 99%,并在 96% 的 ARC-AGI-3 关卡上超过人类表现。排行榜图还显示,更高推理层级的成本通常反而更低,因为 Astra 能以更少动作通关,从而减少模型调用量和 token 消耗。

FDE 判断

对 FDE 而言,这一结果说明同一模型在不同 harness 或适配层下的表现差异巨大,企业交付时不能只看模型本身,还必须重视集成与适配层。同时,更高推理层级反而降低成本,意味着 FDE 在设计 Agent 方案时,应把推理层级、动作路径和成本放在一起优化,以更少调用完成任务。