| 迈向人工智能研究的端到端自动化 |
| 来源:一起赢论文网 日期:2026-08-22 浏览数:34 【 字体: 大 中 小 大 中 小 大 中 小 】 |
|
迈向人工智能研究的端到端自动化科学自动化是人工智能(AI)研究中长期以来的目标 1,2.尽管社区在自动化科学流程的各个组成部分方面取得了显著进展,但能够自主导航整个研究生命周期——从构思到发表——的系统仍然遥不可及。这里我们介绍了一个自动化整个科学流程的流程流程。我们介绍《人工智能科学家》,它能创造研究想法,编写代码,运行实验,绘制和分析数据,撰写整篇科学论文,并进行自己的同行评审。其思想、执行和呈现质量足够高,使该AI系统生成的稿件通过了顶级机器学习会议研讨会的第一轮同行评审。该研讨会的录取率为70%。我们的系统利用了现代基础模型 3,4,5在一个复杂的智能体系统中。我们评估《人工智能科学家》的两个模式:一种是使用人工提供的代码模板作为初始研究支架的聚焦模式,另一种是无模板、开放式模式,利用代理搜索进行更广泛的科学探索 6,7.两个环境都能产生多样的想法,并自动测试、报告和评估这些想法。这一成就展示了人工智能在科学贡献方面的日益增强,也预示着研究进行方式的潜在范式转变。和任何有影响力的新技术一样,可能存在重要风险,包括对不堪重负的评审系统加重负担,以及给科学文献增加噪音。然而,如果负责任地开发,这类自主系统将极大加速科学发现。类似内容被他人观看人工智能工具扩大了科学家的影响力,但收缩了科学的重点第14条 2026年1月人工智能科学家的风险:优先保护而非自主性文章 开放获取 2025年9月18日人工智能与科学研究中的理解幻觉第06条 2024年3月主要角色人工智能长期以来一直被用于促进科学发现,这一目标在该领域历史中根深蒂固1,8,9,10,11.在大型语言模型(LLMs)兴起之前,人工智能仅限于协助特定且狭窄的任务,如发现化学结构2,通过寻找数学证明1发现新材料12,13,14以及预测蛋白质的三维形状 15,16.其他系统则专注于分析预先收集的数据集以寻找新的见解10,17,18.然而,随着强大且通用的基础模型的出现,人工智能的作用已扩展到协助更广泛的研究活动。例如,LLMs现在有助于生成新的假设19,20,21,22,23,文献综述写作 24,25以及编码实验26,27,28,29.尽管在自动化各个组件方面取得了这些进步,但能够自主导航整个研究生命周期——从构思到发表——的系统直到现在仍然遥不可及。本文介绍了“人工智能科学家”(The AI Scientist),这是一条实现科学流程全面端到端自动化愿景的流程。AI科学家利用现有的基础模型进行构思、文献检索、实验规划与实施、结果分析、稿件撰写以及同行评审,以产出完整的新论文。我们专注于机器学习科学,因为实验通常完全在计算机上进行。开发此类系统的核心挑战之一是自动评估其大规模科学成果的质量。为此,我们创建了一个自动评审器,并首先与真实的人为论文对比评估其表现。自动评审能够准确预测会议录用决定,表现与人工评审相当(补充信息A.3节)。随后,我们使用自动审核器比较了 AI 科学家的不同配置,评估性能随测试时间计算规模和基础模型质量的变化。我们发现,拥有更多计算资源,《The AI Scientist》表现更佳(见图。3c)。此外,自动评审员显示,基础模型的改进显著提升了生成论文的质量,这一发现强烈表明随着模型的持续改进,未来版本的系统将会有显著提升的能力(见图。1b)。图1:AI科学家工作流程。图1:AI科学家工作流程。全尺寸图像a, 人工智能科学家包含多个不同阶段,涵盖自动化创意生成、基于树的实验、稿件写作和审阅。实验阶段使用智能体树搜索来生成和优化代码实现。该过程分为四个阶段:(1)初步研究,(2)超参数调优,(3)研究议程执行,以及(4)消融研究。从一个实验阶段到下一个实验阶段,选择表现最好的检查点来为树搜索的下一阶段做种。b、《人工智能科学家》论文在不同模型发布中的评分。纸质质量会随着模型发布日期(由The Automated Reviewer判断)持续提升,表明未来基础模型的改进将持续不断。观察到的相关性具有统计学意义(P < 0.00001)。阴影区域表示标准误。点表示平均得分,带有误差条和阴影区域表示标准误(无模板点为n=6,基于模板为n=3)。完整的实验细节,包括模型版本和复制计数,见补充信息A.2.9节。c,自动评审与会议决策的区别。自动评审员的表现可与人工评审者相当,这一点得到了过去会议公开决策的验证(见表1)。条形代表平均平衡的准确率;误差条显示95%自助置信区间(5000次重复)。为了可重复性,每份自动审核为5轮的合奏。对亚抽样准确率进行的双样本z检验(自动n = 698/876,人类n = 412)在训练截止前(P = 0.319)和截止后(P = 0.921)均无显著差异。F 上的非参数引导测试1评分显示自动超额表现(P < 0.001)。为了在与人类论文相同的环境中评估《人工智能科学家》,我们进行了一项实验,将生成的论文提交到国际学习表征会议(ICLR)的研讨会,并获得主办方同意。在计算机科学领域,这类顶级会议是档案和严格同行评审发表的主要且最有声望的场所。他们还有一些工作坊,虽然门槛明显降低,但同行评审接受门槛依然不简单。《人工智能科学家》的一篇论文在研讨会上得分高到超过了人类平均接受门槛,展示了一篇完全由人工智能生成的论文成功通过同行评审过程,尽管门槛较低。生成手稿AI科学家依次完成四个主要阶段(见图)。1a)。第一阶段,AI科学家被提示迭代地扩展档案30在用户指定的机器学习研究子领域内,可以探索高层次的研究方向和假设(示例进展可见补充信息C.4部分)。对于每个方向,它生成描述性标题、其对该想法的理由及为何值得追求,以及一个拟议的实验计划(补充信息部分A.1.1和A.2.6)。在创意生成后,AI科学家通过将语言模型与语义学者应用程序接口(API)连接来过滤想法31以及作为工具的网页访问32.这使得《人工智能科学家》能够摒弃任何与现有文献中作品过于相似的想法。《人工智能科学家》的第二阶段执行拟议实验,然后将结果可视化,以便后续写作。我们测试了两种不同的实验执行变体:(1)基于模板的:AI科学家会获得一个起始代码模板,可重现流行算法的训练运行。随后,AI科学家按线性顺序执行拟议的实验计划(补充信息A.1部分)。(2) 无模板:或者,AI Scientist 可以自行生成初始代码脚本。在这种情况下,实验包括从零开始优化代码的进一步阶段,实验执行则利用树状搜索实现额外的测试时间计算(见图)。3a、b 及方法)。每次实验结束后,AI科学家都会收到结果,并被提示以实验日志的风格做笔记,以便未来规划和撰写。《人工智能科学家》第三阶段以标准机器学习会议论文的风格,简明扼要地总结其研究。AI科学家被提示逐节填写空白的LaTeX会议模板,使用其笔记和图表(方法)。为了构建相关工作部分并在手稿中添加引用,系统会查询语义学者31API,用于相关文献,并通过20轮进行对比其发现与生成的稿件进行比较。对于每一个潜在的引用,系统都会生成其包含的文本理由,指导《人工智能科学家》如何在稿件中适当使用该参考文献。最后,由人工智能科学家生成的论文会经过自动评审员的审核,自动评估所进行研究的科学质量。生成论文的自动评估自动评审员根据顶级神经信息处理系统(NeurIPS)会议(https://neurips.cc/Conferences/2022/ReviewerGuidelines)的评审指南提供评审。输出包含数值评分(合理性、呈现性、贡献、整体质量和评审信心)、优缺点列表,以及二元决策(接受或拒绝)。自动评审流程由五篇综述组成,随后进行元综述,模型作为区域主席,基于所有五篇综述做出最终决定(补充信息A.3节)。我们比较了自动评审员的决策与从公开OpenReview数据集提取的ICLR论文的真实数据33.如表1所示,自动评审员评估与人工评估的一致性可与以F衡量的人际一致相当1评分和平衡准确率,均见NeurIPS 2021一致性研究34该数据测量了人类评审者对一组可比提交内容的一致性(补充信息A.3节)。这展示了其高准确度复制人类评审集体判断的能力。这些结果具有统计学上的显著性(非参数自助检验)35以及两样本Z检验36;补充信息A.3部分)。接下来,为了调查潜在数据污染的影响(即论文决策可能成为LLM训练集的一部分),我们在两个数据集上评估了The Automated Reviewer:一个包含1000篇论文,可能属于模型训练数据的年份(2017–2024),另一个是截止后一年(2025年)的“干净”数据集。 训练时无法看到。知识截止前后几年的比较表明,数据可能存在污染,因为平衡决策准确率从截止前的69%降至截止后的66%。然而,截止线后一年的结果仍与人类评审者相当(例如66%的平衡准确率),显示潜在污染最多影响极小。表1 人工审核员与自动审核员的性能比较全尺寸表格利用The Automated Reviewer,我们评估了由多种大型语言模型生成的研究论文质量,作为The AI Scientist的核心模型。我们的分析显示了一个明确的趋势:随着模型不断改进,《人工智能科学家》所产论文的质量也相应提升(见图。1b)。根据我们的自动审稿人(补充图)评判,使用近代模型平均产出的论文接近机器学习会议研讨会的边缘可接受度。B2)。此外,每篇论文分配的计算量与最终质量之间存在强相关性(见图)。3c),表明模型规模和推理时间投入在《人工智能科学家》的输出质量中起着重要作用,进一步表明随着人工智能系统成本呈指数级下降、能力呈指数级提升,AI系统有望实现显著改进37.人类评估结果也许对《人工智能科学家》作品质量的终极且最公平的检验,是我们所谓的人工智能科学家图灵测试的一种版本:将作品提交给与评估人类科学相同的严格、盲审同行评审系统。我们提交了三篇生成的稿件,提交给一个顶级机器学习会议研讨会的正式同行评审流程。本实验在相关机构审查委员会(IRB)的批准下进行;补充信息部分C.3),以及ICLR 2025领导层和“我不敢相信它没更好”(ICBINB)研讨会组织者的全力合作。这是我们唯一提交的场地。无模板版《人工智能科学家》很容易适应这种环境,只需根据研讨会的广泛主题提示(探讨深度学习的局限性,包括之前改进的想法未能奏效)。随后,整个流程被运行以产生想法、实验和论文。我们在每个阶段手动筛选了最有前景的输出(补充信息部分A.4)。如果没有这种过滤,被分析的论文仍会以最终形式完成,和其他论文一起完成,因此总成本也会更高。这一过程最终选出了三部完整的手稿提交。选拔基于三个标准:想法是否与研讨会主题一致,代码是否正确实现了拟议的想法并无错误运行,以及手稿格式的正确性(补充信息部分A.4)。每篇论文的整个科学流程,从构思、编码到论文写作,均未经过人工修改。这三篇投稿被纳入本次研讨会的43篇评审论文中。评审者被告知部分投稿是AI生成的,但未说明具体是哪些,确保了过程盲目。三篇AI生成的论文中,有一篇获得了评审平均6.33分(个人评分为6、7和6分),高于本次研讨会的平均接受门槛(见图)。2)。主办方表示,如果不是按照我们预先制定的协议撤回,因为是AI生成的,这篇论文很可能会被接受。值得注意的是,被接受的论文报告了一个阴性结果,这与研讨会关于有趣阴性结果的重点相符。另外两篇论文未达到录用标准(补充表D9)。因此,一篇完全由人工智能生成的论文通过了标准的科学同行评审流程。我们还进行了内部审查,利用团队中的人类AI研究人员(补充信息C.2部分)。团队得出结论,虽然其中一篇论文符合研讨会论文的标准,但没有一篇达到ICLR主要会议出版物的更高标准。对三篇提交论文的完整分析,包括其优点、劣势和实施,均见补充信息C.2部分。图2:由The AI Scientist生成的论文精选部分,该论文通过同行评审在顶级机器学习会议研讨会中被接受。图2:由The AI Scientist生成的论文精选部分,该论文通过同行评审在顶级机器学习会议研讨会中被接受。全尺寸图像该论文在元评审前获得了6分(弱接受)、7分(接受)和6分(弱接受)的同行评审评分,排名前45%。这表明,完全由人工智能生成的论文能够在顶级会议研讨会上成功通过同行评审流程。本文完整版可在补充信息部分D.2.1获得。局限性尽管《人工智能科学家》发表了一篇通过同行评审的工作坊论文,但如果要达到最佳人类科学水平,仍有改进空间。三份投稿中只有一份被接受,研讨会的接受率远高于主会议(例如ICLR 2025 ICBINB研讨会的录用率为70%38相比之下,ICLR 2025主会议的32%39).因此,《人工智能科学家》尚未达到顶级出版物的标准,甚至在研讨会上也难以持续达到。常见的失败模式包括产生幼稚或未充分发展的观点、主旨实施错误、缺乏深层方法论严谨性、实验实现错误、正文和附录中重复图表,以及多种幻觉,如引用不准确(失败模式的完整分析见补充信息部分A.4, C.2和C.3)。话虽如此,在机器学习中,一旦某样东西开始运行(即使存在明显缺陷),在短短几年内,随着规模(例如计算和数据)、更完善的核心模型和更先进的技术,系统的能力就会变得令人惊讶,甚至超过人类的表现水平。因此,在评估技术影响时,必须考虑其可能的未来发展轨迹。关键是,这一趋势不仅关乎更好的模型,更关乎AI系统能够执行任务的复杂性。最新研究表明,AI可靠完成的任务时长每7个月翻一番40表明许多当前实现和调试瓶颈可能在短期内得到解决。然而,一些AI弱点出乎意料地难以解决,比如AI容易被欺骗 41,42以及过度自信的错误(幻觉)43尽管已有进展 44,45.这些挑战可能持续存在,阻碍我们可靠地信任像《人工智能科学家》这样的系统输出。同样尚不清楚人工智能系统能在多大程度上产生类似科学重大概念飞跃的新创意。在这些方面研究和改进人工智能系统是未来研究的关键领域。目前,人工智能科学家仅进行计算实验。在未来的研究中,这一做法可以应用于其他科学领域,在那里可以自动进行实验(或让人工进行实验)并从中收集数据(例如自动化化学实验室,进展迅速46).自动化论文生成的能力引发了重要的伦理和社会问题,包括可能使同行评审过程不堪重负、人为抬高研究资历、未经适当署名而重新利用他人的想法、取消科学家职位,或进行不道德或危险的实验(补充信息C.3节).为了负责任地开展这项研究,我们获得了ICLR领导层、研讨会组织者以及不列颠哥伦比亚大学IRB(H24-02652)的明确许可。关键是,作为实验方案的一部分,我们事先确定所有AI生成的投稿在同行评审后都会被撤回,无论结果如何。此举旨在避免在科学界尚未建立明确披露和评估标准之前,为全自动化研究发表树立先例。制定这些规范是确保此类体系用于促进而非破坏科学诚信的关键下一步。最后,还需要更多研究,以确保开放式探索型人工智能能够安全且符合人类价值观 47,48.《人工智能科学家》生成的一篇由人工智能撰写的手稿,该稿件通过了顶级机器学习会议研讨会的同行评审,标志着这场持续数百年的科学努力中的一个里程碑。尽管在一致性和实现顶级质量方面仍存在挑战,这一成功展示了人工智能在科学推理领域的日益增强,也标志着一个新时代的到来,在这个时代,发现过程不再是单纯的人类追求,我们收获科学发现成果的速度有望大幅加快。图3:人工智能科学家的阶段与计算扩展。图3:人工智能科学家的阶段与计算扩展。全尺寸图像答,研究实验阶段被设想为四个阶段的过程。首先构建一个初步的基线代码实现(第一阶段),并通过调整超参数进行优化(第二阶段)。最终生成的代码作为通过智能树搜索(阶段3)执行研究议程的起点,随后进行消融实验(阶段4)。关于智能树搜索过程的详细内容见方法部分。b, The AI Scientist 的树状搜索真实示例,节点注释概述了四个不同阶段中进行的实验。c,《人工智能科学家》论文在计算预算中的评分。在智能树搜索中缩放实验节点数量,显示出更深测试时间搜索预算的改进。误差条表示标准误。完整的实验细节见补充信息A.2.9部分。方法我们的研究方法围绕两个核心自动化系统展开:人工智能科学家用于生成新的科学研究,自动化评审员负责严格评估。这些系统协同工作,探索人工智能在加速科学发现中的潜力。人工智能科学家人工智能科学家是一个智能系统,设计用于自主进行机器学习研究。我们呈现两种模式的结果:一种基于模板的系统,扩展人类提供的代码;另一种是更开放、无模板的系统,操作时需更少的先验指导。每个系统使用的详细提示见补充信息部分A.1.1和A.2.6。各系统生成论文的更多结果和分析可在补充信息部分B.1、C.1、C.2、D.1和D.2中提供。基础技术这两个版本都基于自回归大型语言模型(LLM) 3,4,5,通过建模给定前一个词元出现新词元的条件概率来生成文本。通过庞大的数据和模型扩展,LLM展现出类人的能力,包括推理和代码生成。能动模式49,例如少射提示50以及自我反思51这些数据被《人工智能科学家》利用来提升性能和可靠性。在代码生成方面,基于模板的系统使用了最先进的开源编码助手 Aider52,旨在实现功能、修复错误或重构现有代码库中的代码。为了更进一步并高效地使用更多测试时的计算,这个无模板系统利用大型语言模型(LLM)来驱动树搜索,而无需依赖 Aider。基于模板的人工智能科学家系统提供了一个起始代码模板,可根据标准基准测试(例如,训练一个小型变压器)从流行算法中进行的简单训练运行53关于莎士比亚作品)。其工作流程分为三个阶段:1.创意生成:流程从一个由人工提供的代码模板定义的简单实验开始。系统随后进入一个迭代循环,利用LLM作为突变算符进行思想生成和精炼。每次迭代中,它都会提出一批新研究理念,这些想法是其不断扩展的档案中现有想法的变体或延伸。每个想法是一个结构化对象,包含描述性标题、核心假设摘要、详细实验计划,以及自我评估的有趣度(1–10分制)、新颖性(1–10分制)和可行性(1–10分制)分数。这种迭代的创意库增长源自开放性算法,这些算法维护着多样化的文物集合 20,54.为了强行维护新颖性,每个提出的想法都通过Semantic Scholar API自动与科学文献进行核对31;与现有作品语义高度相似的观点被剔除。该系统被引导扮演“一位有抱负的人工智能博士生,希望发表一篇对该领域有重大贡献的论文”。对于新颖性评估,系统会进行最多十轮文献检索查询,每轮中,系统可以根据之前的结果进行细化搜索。2.实验执行:一旦从档案中选出一个有前景的想法,系统将制定多步骤实验计划,最多包含五个实验。然后它通过 Aider 顺序执行该计划修改代码库。该阶段的一个关键特点是对运行时错误的鲁棒性。系统会自动检测执行失败,捕获错误日志并调用 Aider 代理实例52用于执行自动调试。Aider代理会收到失败代码和错误信息的提示,然后生成补丁,每个实验最多有四个重试周期。修正后的代码随后用于以每次实验7200秒的超时时间重运行实验。所有实验结果,包括指标、生成的图表和观测数据,都记录在实验日志中。该日记作为记忆形式,指导实验计划中的后续步骤。3.手稿生成:实验阶段结束后,系统将研究结果综合成一篇完整的科学论文。为此,它使用 Aider 填充一个标准会议 LaTeX 模板。Aider 撰写章节,包括引言、方法、结果和结论。结果部分通过分析实验期刊撰写,总结关键发现并嵌入生成图表。为了将工作置于更广泛的科学语境中,系统通过查询语义学者API中的相关文献(最多20轮检索)并生成每篇被引论文的摘要,构建相关工作部分。手稿经过多次自动编辑和润色,以提升清晰度和连贯性。最后,系统编译 LaTeX 源代码,并自动纠正编译错误(最多五轮校正),生成最终的 PDF。无模板的AI科学家为了克服固定起始代码库的局限性,我们开发了一个无模板的版本,能够更开放地发现。由于其强大的推理能力,我们在实验中使用OpenAI的o3进行想法生成和代码批评,Anthropic的Claude Sonnet 4用于代码生成,OpenAI的GPT-4o用于成本效益高的视觉语言任务,OpenAI的o4-mini用于评审阶段的经济推理。该版本引入了若干关键增强功能。广义思想生成系统使用的构思过程更为抽象,不依赖于初始代码实现。它首先会生成类似科学论文摘要的高水平研究提案。这些提案阐述了一个研究问题,提出了一种新方法,并假设了预期结果。为了确保提案既有根据又新颖,这一过程与文献综述模块紧密集成,该模块查询外部学术数据库以识别知识空白,避免重新发现现有工作。该系统使用结构化提示来引导思想生成和反思轮次,以根据文献检索结果细化提案(详见补充信息部分A.2.6的提示)。实验进展管理器现实世界的科学实验通常会经历不同阶段,从初步可行性评估到详细的消融分析。为模拟这种结构化方法,我们引入了实验进展管理器,以协调四个明确定义的科学实验阶段:(1)以初步调查测试基本可行性,(2)调整超参数以优化,(3)执行主要研究议程,(4)以消融研究结束,以了解不同组分的贡献。每个阶段都有明确的停止标准。第一阶段结束时,基本工作原型成功执行。第二阶段结束时,实验稳定,表现为训练曲线收敛且至少两个数据集成功执行。第3和第4阶段在分配的计算预算耗尽时结束。每个阶段进行自己的树搜索。该树搜索过程的具体细节详见以下要点。每个节点的最大实验时长为1小时。每阶段结束时,基于LLM的评估器评估所有叶节点,选出最有前景的作为下一阶段探索的根节点,从而有效修剪那些前景较差的研究方向。用于实验的并行化智能体树搜索为了管理开放式研究的复杂性,基于模板的《人工智能科学家》版本的顺序工作流程被并行化的智能树取代。图3a是该方法的概述,图。3b 显示的是通过实际运行生成的树。默认情况下,它使用 Claude Sonnet 4 进行代码生成。我们在图中提供了不同LLM模型选择的结果。1b。智能树搜索中的每个实验节点经历以下执行周期。首先,Claude Sonnet 4 生成了具体的实验计划和相关的 Python 代码来实现实验。生成的代码会立即在 Python 解释器中执行。如果执行遇到错误,错误信息会被记录,节点被标记为有bug,结束该节点当前的执行周期。如果执行成功,实验进入绘图阶段。系统会被提示将所有相关的实验输出(训练和验证指标、损失等)保存到结构化的numpy文件中。在绘图阶段,AI科学家会读取这些存储的结果和代码,生成总结和展示发现的可视化。这些可视化随后会传递给视觉语言模型(VLM)进行批评。VLM标记的任何问题(如标签不清晰、图例缺失或误导性的可视化)都会导致该节点被标记为有bug,并将这些反馈记录下来以便后续调试。成功执行并通过VLM审查且无问题的节点被标记为非bug。每个节点定义为集合,包括实验脚本(例如Python文件)、脚本中实现的高级计划文本描述、执行错误追踪(如适用)、实验运行时间、实验期间记录的性能指标、运行脚本后OpenAI o3的代码批评、可视化脚本、生成图形的文件路径, VLM对这些数据的反馈以及节点的最终状态(无论是有bug还是无bug)。每次迭代时,系统会从已有树中选择多个节点并行扩展。在预设概率下,选择一个有错误的节点(从而优先处理错误解决和调试);否则,会选择一个无bug的节点进行进一步优化和改进。在选择无漏洞节点时,系统采用由GPT-4o指导的最佳优先搜索策略,根据性能指标、训练动态和生成图质量等因素评估候选节点。选中的节点通过创建一个新的子节点来扩展。如果父节点有bug,系统会尝试调试;如果父节点没有bug,则在之前的实验基础上进行精细和改进。Claude Sonnet 4用于生成每个新子节点的计划和实验代码,之后所有新节点并行执行,极大加快探索进程。除了有bug和无bug的节点外,系统还使用针对特定实验需求的专用节点变体:超参数节点在第二阶段系统性地探索不同的超参数配置。系统会保留先前测试过的超参数记录,以防止重复实验。超参数调优过程中遇到的错误会触发相应的调试节点的创建。消融结节评估第4阶段的关键消融检查。这评估了实验背后各种组成部分或假设的重要性。与超参数节点类似,会追踪先前测试的消融条件以避免重复,并根据遇到错误创建调试节点。复制节点使用不同的随机种子执行父实验的复制。通常会创建多个复制节点,以便计算实验结果的统计指标(均值和平均偏差),从而增强结果的稳健性。聚合节点是专门创建的节点,用于整合和可视化复制节点的综合结果。与其他节点类型不同,聚合节点不会进行新的实验,而是生成一个Python脚本来汇总和总结之前的结果。该脚本生成的数字明确显示了平均值和标准值。实验阶段的结构化设计和定制节点类型,促进了跨所有阶段的系统探索。与一些严格遵循预设细粒度工作流程图的LLM代理不同,The AI Scientist采用了更宽松的结构,指导整个实证研究周期,从而实现灵活的系统行为,同时保持迭代阶段的一致性。请参阅补充信息部分A.2.6和A.2.9,分别了解提示和详细超参数。VLM积分该系统结合了使用 GPT-4o 的 VLM,用于分析并对视觉数据提供反馈。在实验过程中,生成的图块会被输入给VLM,VLM会被引导作为科学家进行批评。例如,它可能会标记生成示例质量中无意义的轴或问题,或建议更清晰的数据呈现方式。这些反馈用于生成树搜索中的新实验节点,旨在解决已识别的问题。在撰稿过程中,VLM会评估图表与对应说明之间的对齐,确保说明准确描述情节并突出关键要点,从而提升论文的整体质量和清晰度。VLM评审包括对图文内容、说明准确性及与正文整合的详细分析(详见补充信息部分A.2.6部分的提示)。通用数据集访问为了拓宽研究能力,系统被引导通过向HuggingFace中心生成查询,动态整合公共仓库中的数据集55.提示中列出了HuggingFace上可用的十个示例数据集,系统可以自动生成使用选定数据集进行实验所需的数据加载代码。这种方法部分放宽了使用固定预定义数据集的限制,使人类科学家能够轻松更新候选名单。对于HuggingFace上无法获得的数据集,人类科学家可以从公共数据仓库(例如开放访问档案)下载,存储在本地,并在提示中添加使用说明。这些本地存储的数据集随后可以与 HuggingFace 数据集一起使用,由 AI Scientist 使用(请参见补充信息部分 A.2.6 部分的提示)。增强手稿写作无模板系统摒弃了基于增量的Aider方法,采用如OpenAI的o1等推理模型直接生成LaTeX。56随后是反思51.该系统首先通过专用的图聚合步骤,将多个阶段的实验结果聚合成复合图。写作过程中包含针对不同工作坊形式的特定提示(例如,ICBINB工作坊聚焦于负面结果),每个部分都有详细指导,包括标题、摘要、引言、方法、实验和结论。系统经历多次反思周期,每次都会结合 LaTeX 输入者和 VLM 评测的反馈,以提升图形质量和文本与图形对齐(详见我们的代码和补充信息部分 A.2.6 部分的提示和详细内容)。无模板系统的完整生成过程通常需要数小时到超过15小时,具体取决于问题复杂度。自动审核员为了评估AI生成研究的质量,我们利用o4-mini构建了自动化评审器57.该组件旨在模拟顶级机器学习会议的同行评审流程,遵循官方 NeurIPS 评审指南。代理人处理手稿的PDF以生成结构化综述,包括合理性、表达性和贡献的数值评分,以及优缺点列表和初步接受或拒绝决定(补充信息部分A.3)。自动审核员使用的所有提示均提供于补充信息部分A.3.1。审查流程自动审核员遵循多阶段流程。首先,系统会提示角色:“你是一名人工智能研究者,正在审阅一篇提交到著名机器学习机构的论文。”评审提示提供论文内容及详细的NeurIPS评审指南,要求提供结构化的JSON回复,包括摘要、优势、劣势、问题、局限性、伦理问题及数值评分(合理性、表达方式、贡献、总分1–10及信心水平)。为提升稳健性,最终评估为包含五个独立综述的荟萃综述。每篇论文生成五篇综述,汇总成单一元综述,LLM担任区域主席,在各综述间寻求共识。验证我们利用公开OpenReview数据集中的ICLR数据,对自动审查器与人工决策进行了基准测试33.自动评审员与人类的准确率相当且平衡(69%对66%,详见补充信息A.3.2节),且F等级更高1与NeurIPS 2021一致性实验中人际组一致度(0.62对0.49)的得分比较34约10%的投稿被随机抽选并送交两个独立评审委员会,从而为评审者间一致性提供了现实世界的基准(见表1)。这些结果表明,基于LLM的智能体能够提供与普通人类专家观点一致的宝贵反馈。我们强调,ICLR和NeurIPS论文池中提交的论文数量不同,因此分布发生了变化,因此这种比较并不完全准确。然而,ICLR是唯一一个公开所有接受和拒绝决策的主要机器学习会议,这使我们能够进行分析,而NeurIPS 2021实验是人类一致性实验的唯一现代版本,因此也是唯一可能的对比。 |
| [返回] |