AI as Normal Technology(RSS) · 2026/8/5

前沿AI智能体开放式研究能力遭质疑:普林斯顿测试揭示短板

普林斯顿大学团队测试前沿AI智能体的开放式研究能力,让其在六天内用数千美元API额度回答两篇未发表论文的核心问题,结果均被原作者拒绝。智能体缺乏研究判断力、资源意识、创造性反馈应对和回溯能力,且未遵循指令。

领先AI实验室的目标是实现递归自我改进(RSI),即利用AI智能体自动化AI研究。RSI也是预测AI爆炸式进展的基础。我们如何评估是否接近这一里程碑?一种方法是使用基准测试来检验智能体能否开展AI研究。鉴于AI社区对基准测试的重视,这已成为评估RSI进展的主要方式。过去一年中,许多此类评估发现,智能体在结果易于验证的任务上已能取得进展,这引发了关于我们正处于RSI边缘的猜测。但这些评估虽有帮助,却局限于狭窄、可验证的任务。AI研究可能更加开放,成功往往不是立即可见或可验证的,研究人员需要测试有前景的假设、回溯或考虑新颖非常规的方法。我们如何评估智能体开展开放式AI研究的能力?我们在新论文中迈出了回答这一问题的第一步。我们与两篇未发表AI论文的作者合作,请他们起草论文的主要研究问题,然后让前沿AI智能体开展研究以回答这些问题,并给予数千美元API额度和计算资源,以及六天墙钟时间。原作者审阅了智能体的论文,明确拒绝了这两篇论文。为更好理解这些结果,我们团队花费一百多个小时分析智能体日志。主要发现:智能体缺乏开展开放式研究所需的判断力;智能体对可用资源缺乏意识;智能体未能创造性地回应反馈;智能体未能有效回溯;智能体未遵循具体指令。我们两年前发布基准测试研究智能体能否用于改进可重复性时,就希望评估AI开展开放式研究的能力,但想确保方法正确。方法思路由英国AISI合著者提出,由普林斯顿核心团队完善,我们称之为“影子评估”,因为智能体影子般地跟随原始研究。影子评估有重要优势:可测试智能体在未训练过且无法在线访问的结果上的表现,也让花费数月回答问题的专家评估智能体输出。但影子评估也有固有限制:专家评审知道论文是AI生成的,可能偏好自己采用的方法;深度评估导致样本量小;评估涉及大量研究灵活性。我们以在RSI和超级智能辩论中的特定立场著称,这可能影响研究方式。论文中有专门章节讨论潜在偏见及应对方法。我们寻求了不都持相同先验的合作团队,并明确呈现分歧。未来评估中,我们有意引入“对抗性合作者”加入核心团队。我们的结果表明,开放式研究对前沿AI智能体仍具挑战性。但这些发现是初步的,我们正努力解决局限性,如增加样本量、测试新模型、改进脚手架。如果这些发现成立,意味着什么?首先,需理解前沿AI进展(和RSI)在多大程度上能通过可验证任务上的爬山法实现。我们认为,虽然狭窄任务(如提高效率)可能加速,但不会导致广泛RSI或爆炸式进展。其次,需衡量智能体在开放式研究上的当前局限(如缺乏创造力和判断力)能多快被克服。我们计划定期继续影子评估以回答此问题。最后,即使这些局限被克服,可能还有进一步瓶颈减缓AI进展速度,包括计算限制、从现实实验收集数据的必要性等。例如,高质量RL环境的重要性在推理扩展被证明有用前并不清晰;数据中心能源基础设施的重要性在数百亿美元投资前也未意识到。是否遇到进一步瓶颈及其可解决程度,对理解进展速度至关重要。我们的论文识别了一个未解决瓶颈,即前沿智能体在开放式AI研究上表现不佳。如果我们处于瓶颈易解决的世界,应预期AI能力提升带来巨大回报;若处于瓶颈众多且难以克服的世界,阿姆达尔定律将生效:即使AI可处理部分提速百倍,整体进展也受限于最慢组件。弄清我们身处哪个世界可能极大影响AI进展速度的估计。希望我们的结果有助于更丰富地理解这些瓶颈。

FDE 判断

对FDE项目而言,此结果提示智能体在复杂客户交付中仍难独立承担开放式研究任务,需人工主导判断与资源管理。FDE能力上,应强化对智能体局限的认知,善用其辅助而非替代。企业交付中,需合理设定智能体应用边界,避免过度依赖。