
一项新研究发现,AI智能体虽能完成研究所需的工程任务,但在提出原创假设、进行创造性判断等开放式研究环节上表现糟糕,其产出被顶级会议拒绝。这表明,尽管AI自我改进是可能的方向,但其实现速度可能比一些乐观预测要慢得多,当前AI更适合作为研究辅助工具。
人工智能行业最引人注目的承诺之一,是AI即将能够实现自我改进,几乎无需人类干预。大型语言模型(LLM)已经能够编写代码、生成用于训练的综合数据,甚至优化自身运行的计算机芯片。一些预测认为,被研究人员称为“递归自我改进”的爆炸性AI进展即将到来。然而,一项新研究泼了一盆冷水,表明我们距离这一目标可能还有一段距离。
由普林斯顿大学的Peter Kirgis和Sayash Kapoor领导的多机构研究小组发现,AI智能体能够解决AI研究所需的工程问题,但在判断力和创造力方面存在明显不足,无法产出达到顶级机器学习会议接收标准的高质量原创研究。这一差距表明,关于自动化AI研究的一些夸大时间表可能跑在了证据前面。
现有关于智能体如何自动化AI研究的大多数研究,都侧重于评估它们完成具有可验证答案的狭窄任务的能力,例如解决工程问题或针对基准测试对小型语言模型进行后训练。但AI研究的进步还需要开放式思维——选择一组假设,决定哪些证据能解答问题,或知道何时该推倒重来。
为了测试智能体在这类技能上的表现,研究人员提出了一种名为“影子评估”的新评估方法。该方法要求AI回答来自高质量未发表论文的研究问题。在这项研究中,研究人员让Anthropic的Claude Opus 4.5(在名为OpenClaw的开源软件上运行)来处理这些问题,这些问题来自提交给著名机器学习会议NeurIPS 2026的两篇论文。
第一个问题是,大型语言模型的“人格”(决定其行为的因素)能否通过编辑模型的权重(存储其在训练中学到的一切的数十亿个数字)来控制。另一个问题是如何设计一个检测器,用于指出基于电子表格数据进行预测的模型何时变得不可靠。由于这些论文尚未公开,智能体无法从其训练数据中记忆答案,也无法在线找到它们。
智能体获得了六天时间、价值3000美元的Anthropic API积分、用于运行实验的GPU预算、自己的虚拟计算机以及访问开放网络的权限,目标是产出一篇能在顶级AI会议上发表的论文。论文的原作者像评估会议投稿一样对智能体的论文进行了评分。
结果是,两位作者都拒绝了这两篇论文。
人类科学家发现,智能体能够完成进行研究所需的所有工程工作。它们查阅了文献,运行了数百次实验,并整理了结果。然而,正如Kapoor所说,“另一方面,智能体在进行研究本身方面明显表现不佳。”它们运行了一些奇怪的实验(在某些情况下,在极小的综合数据集上测试假设),难以清晰地撰写关于其工作的内容,并且没有为其领域做出新颖贡献。Kapoor表示:“就达到顶级AI会议的质量而言,这些论文还差得很远。”
智能体表现不佳的原因在于,它们难以调动进行研究所需的创造力和判断力。它们在探索不同想法上做得不够,并且过早地投入到没有前景的方法上。尽管智能体提出了新颖且雄心勃勃的假设,与原作者最初的设想相似,但它们却基于非常有限的数据拒绝了这些假设。它们无法从失败的方法中回头。它们可以进行小的调整,但无法从根本上重新思考其方法或从头开始尝试新方法。
此外,智能体还未能整合来自子智能体或外部AI审查工具的反馈。它们没有修订方法论,反而收窄了主张并增加了附加条件。它们也无法有效利用资源,如令牌、计算力和时间。它们还不能遵循关于研究不同阶段应花费多少时间或论文篇幅多长等指示。
尽管存在种种失败,但智能体没有表现出研究人员所称的“奖励黑客”行为,即隐藏或歪曲实验或数据。虽然子智能体(主智能体生成的用于处理部分工作的辅助AI)偶尔会出现幻觉或歪曲结果,但这些都被编排者智能体(监督项目的首席AI)发现了。
Kapoor认为,AI模型擅长研究工程而非开放式研究的原因,可能归结于它们的训练方式。模型在一种称为强化学习的训练机制中,会因在可自动检查成功与否的任务上得到反复训练而变得擅长这些任务。“但当任务本身是开放式的时候,为这些模型创造训练环境就变得更加困难,”他说。
这一研究结果对国内AI领域同样具有重要的参考价值。目前,国内的大模型公司如百度(文心一言)、阿里巴巴(通义千问)、深度求索(DeepSeek)、字节跳动(豆包)等,也在积极探索AI智能体在代码生成、数据处理等领域的应用。然而,与OpenAI、Anthropic等海外前沿机构类似,国内模型在需要深度原创性、复杂判断力和跨领域整合能力的开放式研究任务上,同样面临挑战。这提示我们,在追求模型参数规模和工程能力提升的同时,更需要关注如何通过算法创新(如更高效的强化学习、世界模型等)来弥补模型在“品味”和“创造力”上的短板。
这项研究对“AI即将实现递归自我改进”的乐观预测提出了有力质疑。它清晰地表明,尽管AI在特定工程任务上已经表现出色,但距离真正的自主科学研究仍有显著差距。这种差距的核心在于,当前AI的训练范式——强化学习——在目标明确、反馈可自动化的任务上效果显著,但在需要开放性探索、创造性假设和主观判断的研究工作中,其局限性暴露无遗。因此,我们或许需要重新校准对AI发展速度的预期。短期内,AI更可能作为强大的研究辅助工具,增强人类科学家的能力,而非完全取代他们。要实现真正的“自我改进”,可能需要全新的AI架构或训练范式,这仍是一个待解的科学难题。
递归自我改进指的是AI系统能够自主地改进自身的能力,包括编写更好的代码、设计更优的算法,甚至优化自身的硬件和训练数据,形成一个持续加速的改进循环,从而可能带来指数级的智能增长。
因为“影子评估”使用了尚未发表的论文作为测试题目,这确保了AI无法通过记忆训练数据或联网搜索来“作弊”获取答案。它要求AI真正理解问题、进行推理并生成原创的解决方案,从而更真实地反映其进行开放式研究的能力。
并非如此。研究表明,AI在文献综述、运行实验、代码编写等研究工程环节表现出色。它们的主要短板在于提出原创假设、进行创造性判断、从失败中学习以及整合反馈等更高层次的认知活动。因此,AI目前更适合作为辅助研究工具。
当前主流的训练方式,尤其是强化学习,依赖于明确定义的目标和可自动检查的反馈信号。在开放式研究任务中,问题的答案不唯一,且“好”的标准难以量化,这使得创建有效的训练环境变得极其困难,从而限制了模型在这类任务上的能力提升。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 升级 Gemini API 托管代理,默认启用 3.6 Flash 模型,新增环境钩子、预算控制与免费层,强化智能体自动化与安全管控。

AI智能体规模化落地,数据基础设施是关键。调查显示,数据领先型企业对智能体决策的信任度达100%,而落后型企业仅为30%。本文探讨如何通过数据虚拟化、治理与实时流,构建可信数据环境。

DeepSeek V4 Pro正式版API发布,Agent能力全面增强,在Cybergym、AutomationBench等基准测试中超越Claude Fable 5,编程智能体测试DeepSWE得分从12.8飙升至62.7,同时面临定价上调与思维链表现差异等挑战。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.