🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 前沿动态:日更资讯的一站式入口 / C · 前沿快讯 / C020 · 大变天?Nature报道科研迈向AI自动化:从研究构思到

C020 大变天?Nature 报道科研迈向AI自动化:从研究构思到通过盲审

来源:公众号 PSY-Brain_Frontier | 发布:2026-03-30 | 原文链接

图1

认知神经科学前沿文献分享

图2

基本信息

Title: Towards end-to-end automation of AI research

发表时间: 2026-03-25

发表期刊:Nature

影响因子: 48.5

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图3

图4

研究背景

过去几年,AI在科研中的角色不断扩张,但多数停留在查文献、写代码、提假设等单点辅助上。真正困难的问题是:模型能否将一个研究想法推进成完整实验,再把实验结果整理成论文,并最终通过同行评议的检验?

这篇《Nature》论文探讨的正是这一关键缺口:是否可以构建一个基于基础模型(foundation models)的代理式系统(agentic system),端到端自动完成机器学习科研流程。作者提出了The AI Scientist系统,其目标不是简单生成文本,而是覆盖构思、查重、实验、画图、写作乃至AI审稿的完整链条。同时,评估这类系统本身也极具挑战。若每次都依赖人类专家逐篇审稿,成本极高且难以规模化比较。因此,作者构建了配套的自动审稿器 The Automated Reviewer,用以近似人类评审群体的判断。

这项工作最引人注目的结果在于其真实的外部验证:经批准后,3篇全AI生成的论文被匿名投至ICLR 2025的一个workshop,其中1篇在真实盲审中超过了平均接收阈值。这表明AI自动化科研开始触碰真实学术评审体系,但作者也极其谨慎地指出,这距离顶级主会标准仍有明显差距,且系统的稳定性与方法正确性仍有待解决。

图5

实验设计与方法逻辑

论文的论证为三个层次:系统构建、评估器验证与能力检验。

第一层是系统构建。The AI Scientist包含两种形态:基于模板(template-based)的系统从人类提供的初始代码出发,在特定子领域上迭代推进;无模板(template-free)系统则在更开放的空间中,通过代理式树搜索(agentic tree search)生成代码、调试并推进研究议程,更接近从零开始的开放式科研。

第二层是评估器验证。作者构建了The Automated Reviewer,采用5个独立AI审稿加1个元审稿(meta-review)的集成流程。在OpenReview的ICLR历史决策数据上,该审稿器的平衡准确率(balanced accuracy)达到0.66至0.69,与已知的人类评审一致性水平相当。这使其具备了作为大规模比较系统输出质量的近似标尺的资格。

第三层是能力检验。作者首先在内部比较了不同底层模型和测试时计算(test-time compute)对生成论文质量的影响。随后进行了最关键的外部验证:经ICLR 2025 workshop组织方和IRB批准,作者将3篇未经人工修改正文的AI生成论文提交至ICBINB workshop盲审。此设计的目的并非证明AI已达顶会水平,而是检验其能否在真实同行评审场景下跨过最低可接受门槛。

图6

核心发现

发现一:AI首次闭环完成科研流程,并在真实workshop盲审中达到接收门槛

The AI Scientist将提出想法、新颖性检查、修改代码、运行实验、绘制图表、撰写论文及AI审稿等环节串联为完整闭环。在经批准的外部验证中,3篇全AI生成的论文被提交至ICLR 2025的ICBINB workshop。其中1篇获得6、7、6的评分,超过该workshop的平均接收阈值。这证明全AI生成的论文已能在真实的同行评审环境中跨过初步门槛,但作者强调,这仅是workshop级别,且3篇中仅1篇过线,尚未达到顶级主会标准。

图7

图8

Fig. 1a 中,作者展示了 The AI Scientist 覆盖构思、实验、写作与审稿的完整流程;Fig. 2 则展示了在真实盲审中达到接收门槛的 AI 生成论文片段。

发现二:底层模型升级与测试时计算增加,能显著提升AI生成的论文质量

借助与人类评审一致性相当的自动审稿器,作者量化评估了不同配置下的系统产出。结果显示,驱动系统的底层基础模型发布时间越新,生成的论文得分越高。此外,在无模板的开放式探索中,增加测试时计算,尤其是增加树搜索中的实验节点预算,能让系统尝试更多路径并修复错误,从而进一步提高最终论文的质量评分。

图9

Fig. 1b 中,作者展示了不同发布时间的底层模型驱动系统时,论文评分整体上升的趋势;Fig. 3c 则表明随着实验节点数量增加,自动审稿器给出的论文分数也随之上升。

发现三:当前系统仍存在方法错误与幻觉等短板,尚未能稳定替代人类科研

文中 Limitations 段落与讨论中,作者认为:尽管实现了流程闭环,但当前系统在科学严谨性上仍存在明显瓶颈。作者坦诚列举了常见的失败模式,包括研究想法不成熟、核心方法实现错误、实验不够严谨、图表重复以及引用幻觉(hallucination)等。这些问题直接触及科学研究的正确性与可信度。因此,当前的系统更像是一个能跑通流程的研究代理原型,若无监督地大规模使用,可能带来制造文献噪声、挤占评审资源等伦理与社会风险。

图10

省流总结

本研究提出The AI Scientist系统,实现了机器学习科研从构思到审稿的端到端自动化。在真实workshop盲审中,1篇AI生成论文达到接收门槛。尽管模型升级能提升质量,但系统仍存在实验错误与幻觉等短板,距离顶会标准仍有差距。

图11

请打分

这篇刚刚登上 Nature 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。

分享人:天天

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图12

一键关注,点亮星标 ⭐ 前沿不走丢!

图13

图14

一键分享,让更多人了解前沿

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图15

微信扫一扫可打开此内容,
使用完整服务

返回板块首页