欢迎访问一起赢论文辅导网
本站动态
联系我们
 
 
 
 
 
 
 
 
 
 
 
QQ:3949358033
微信:paperwinner
工作时间:9:00-24:00
博士论文
当前位置:首页 > 博士论文
一个帮助科学家编写专家级实证软件的人工智能系统
来源:一起赢论文网     日期:2026-08-22     浏览数:41     【 字体:

 一个帮助科学家编写专家级实证软件的人工智能系统科学发现的循环常常被缓慢且手动地开发支持计算实验的软件所阻碍1.为此,我们介绍了实证研究辅助(ERA),这是一种人工智能(AI)系统,旨在创建专家级科学软件,目标是最大化质量指标。该系统使用大型语言模型(LLM)和树搜索2系统地提升质量指标,并智能地导航庞大的可能解决方案空间。ERA在探索和整合外部复杂研究理念时,能够取得专家级的成果。树木搜索的有效性在多种任务中得到了证明。在生物信息学领域,ERA发现了40种新的单细胞数据分析方法,这些方法在公开排行榜上优于人类开发的顶尖方法。在流行病学领域,ERA产生了14个模型,这些模型的表现优于美国疾病控制与预防中心(CDC)整体模型以及所有其他单独的COVID-19住院预测模型。ERA还开发了用于地理空间分析、斑马鱼神经活动预测和积分数值解的专家级软件,以及基于规则的新时间序列预测构建。通过设计并实施多样化任务的新解决方案,ERA代表了加速科学进步的重要一步。类似内容被他人观看多尺度数据提升机器学习模型在长新冠识别中的表现文章 开放获取 202655日以大型语言模型评审临床人工智能摘要文章 开放获取 2025115日迈向自主医疗人工智能代理文章 开放获取 2026617日主要角色实证软件旨在最大化可衡量的质量评分,是许多科学研究的核心。经验软件最近使得多项诺贝尔化学奖得以实现:1998年因密度泛函理论获得 3,42013年用于分子动力学模拟52024年则用于蛋白质结构预测 6,7.经验软件支撑着我们创建复杂系统模型的能力,范围从地球大气垂直柱的参数化用于天气建模8,对于湍流流体中应力响应的参数化9,预测社会系统 10,11.然而,科学实证软件开发起来缓慢且困难。领域特定的实证软件需要繁琐的工作1,通常会持续多年。当使用经验软件来检验复杂假设时,纯粹从第一原理来写出来就变得越来越困难。通常没有系统性地寻找替代方法。设计选择往往受直觉或权宜之计所左右,而非彻底的实验。开发软件耗时极长,严重限制了可有效探索的可能性12.这里介绍ERA系统,一种基于人工智能的系统,能够系统自动创建经验软件来解决可评分任务。ERA基于一个大语言模型,通过重写软件来尝试提升质量评分。ERA创建多个候选软件解决方案并使用树搜索2以决定哪些候选人值得进一步研究(见图)。1a)。尽管有许多方法可以设计代码变异系统13,14,15,16我们通过参加Kaggle比赛来开发ERA(见图)。1b),下面将详细说明。我们通过从多种来源获得的研究想法来补充代码突变,包括高被引论文、专业教材和搜索引擎结果(见图)。1c)。实际上,这些想法可以由用户直接注入,也可以通过搜索引擎自动访问文献研究。LLM在编写代码时采用了这种注入的指导。图1ERA的示意图与性能。图1ERA的示意图与性能。全尺寸图像aERA算法示意图。可评分任务连同提出解决该任务方法的研究想法,会被输入到大型语言模型(LLM),LLM生成代码用于在沙盒中评估该可评分任务。然后,这些内容被嵌入到树搜索算法中,在利用和探索之间选择新节点,并从LLM(方法)中抽样。b、代码生成方法在Kaggle Playground基准测试中的表现。结果报告了16项任务中公开排行榜的平均百分位表现。基于ERA的方法以加粗显示。BDT,增强决策树;TS,基于ERA的树搜索。误差条表示基准测试中不同竞赛间性能的标准差。c, 该系统通过基于研究理念和定义的质量指标,迭代优化预测模型和计算算法,实现实证软件开发。我们将科学论文的LLM摘要或AI辅助文献检索作为提示的一部分,并结合成功实施的观点,创造更强大的方法。我们发现ERA开发的软件在涵盖广泛科学学科的可评分任务中表现优于最先进水平。这种专家级表现源于能够以前所未有的规模进行详尽且不懈的解决方案搜索,识别出大海捞针、高质量的解决方案。可评分任务概述我们在Kaggle游乐场竞赛中开发ERA并通过根据科学或工程问题在不同领域中高相关性地选择可评分任务来测试。这些可评分任务列在下方,每个节点的计算成本详见补充表1。单细胞RNA测序(scRNA-seq)批次整合17:这项任务需要在高维稀疏数据集中区分微妙的生物信号与噪声。通过消除混杂因素,我们可以实现大规模多实验室的转录组数据整合。CDC新冠预测18:该任务需要从滞后且噪声较大的实时数据中预测非线性疾病动态。通过提前数周预测新冠病例,我们可以为公共卫生政策和资源分配提供信息。时间序列预测19:该任务需要预测涵盖多种数据集和应用的时间序列结果。地理空间分割20:该任务需要对复杂的卫星图像进行密集的像素多标签语义分割。更好的细分可以带来环境监测和灾害响应的巨大改进。扎普班奇21这项任务需要预测整个脊椎动物大脑中超过7万个神经元的活动。在这一基准指标上表现出色,可能有助于系统层面理解大脑功能和行为。数值求解困难积分:该任务需要解决无法通过标准数值算法的积分。它适用于物理和工程系统的建模。Kaggle Playground 基准测试我们设计ERA是为了在精心策划的Kaggle比赛中获得高分。Kaggle通过排行榜上的百分位排名校准人类表现,我们通过直接提交代码给Kaggle来评分。我们的基准包含2023赛季的16Playground竞赛,涵盖回归和分类任务(补充表2)。操场竞赛是一个理想的基准,因为它们提供了快速迭代、简洁性和对成千上万人类的校准。获得高分需要编写复杂的代码,而无需解决复杂的科学任务。我们的基本策略使用一个简单的提示模板(补充表3),将竞赛描述与之前的试验连接起来。图1b评估了ERA在所有16Playground竞赛中的平均公众百分位排名:ERA显著优于单次LLM1000场最佳LLM调用,且优于AIDE13,因为它能够维持多样化的候选树,当特定代码突变行趋于稳定时,能够回溯。在搜索过程中,系统发现导致分数突然跳升的策略,这些跳跃的累积最终得出最高质量的解答。在提示中加入针对问题的建议,显著提升了表现。我们用两个例子来说明这一点。在专家建议下的树状搜索中,我们提供ERA标准建议,帮助你赢得Kaggle比赛(补充表4)。在增强决策树的树搜索中,我们告诉ERA从零开始实现增强决策树库,不使用标准包(补充表5)。我们手动验证了两种情况下产生的故障码是否遵循了建议。我们现在在不同科学领域的六个基准测试下评估ERA的表现,探索将研究理念融入以提升系统性能的不同方式(见图)。1c 和方法)。基因组学:scRNA-seq数据的批量集成scRNA-seq彻底改变了我们解剖细胞异质性、发现新细胞类型、推断基因调控网络和发育轨迹以及改善治疗靶点优先排序的能力22使得数千个数据集中数亿个细胞能够被单独测序23,24,25.联合分析众多不同scRNA-seq数据集的一个显著挑战是如何在保持生物信号的同时,计算中消除样本间存在的复杂批次效应26.目前有近300种工具用于批量集成scRNA-seq数据27并且已经开发了多个基准测试,用于评估批次效应去除和生物变异性守恒的指标28,29,30.为了评估ERA在该任务中的表现,我们使用了OpenProblems v2.0.0批处理集成基准测试30.截至20257月,该活跃基准评估了15种最先进方法和8种对照方法,涵盖13个不同指标,量化了在涵盖人和小鼠的六个数据集中,消除批量效应的能力并保留因真实生物学差异引起的变异性25(图。2a)。为避免对基准过拟合,我们使用了一个独立数据集进行ERA优化(方法和补充图)。1)对于每次ERA运行,我们根据该训练集的表现选择最佳解,并在保留的OpenProblems数据集(n = 1,747,937个总单元格)上报告表现。我们会提示LLM单单元批积分问题的描述、用于读取数据集的代码、评估指标的代码以及包含特定研究想法的可选文本。图2ERAscRNA测序批次整合中的表现。图2ERAscRNA测序批次整合中的表现。全尺寸图像a, 批量集成任务的示意图,处理不同数据集(蓝色和红色)以消除数据中的批量效应,同时保留生物变异性。b、树搜索(方法名称加粗并加重“(TS)”)的性能,与OpenProblems v2.0.0基准测试上类似已发布的方法进行比较30.“按单元类型完美嵌入带抖动”是一种正对照方法,代表最佳性能;“按批处理洗牌积分”是一种负对照,不执行任何批次积分。总体得分是所有数据集和指标的平均值。每个“数据集”列显示该数据集上所有指标的平均值。每个“指标”列显示该指标在所有数据集中计算的平均值。如果指标无法计算或表现低于最低负面对照组,则赋予0;这些单元格显示为空格。c、性能改进,附有代码创新,用于表现最佳的 BBKNN 实现。基于ComBat的嵌入生成在第429次实现尝试中被引入。dOpenProblems v2.0.0基准测试的总体得分(参考文献:30非对照方法,ERA有无重组思想,Gemini Deep Research34以及与人工智能联合科学家共同研究的ERA35.纵轴下界是“按批次洗牌积分”负控制方法的总分。未涵盖7种重组方法、5种基础方法和2项与其性能不匹配的AI共同科学家方法。*该方法是一种重组,即使没有明确提示重组。fastMNN,巴切勒 fastMNN;kNNk-最近邻居;mnn正确,修车师mnn正确;PC,主成分;TS,基于ERA的树搜索。首先,我们没有指导地运行了ERA,发现其解决方案在概念上与ComBat相似31但相比当前的OpenProblems排行榜(图中“无建议(TS)”)有所改进。2b)。随后我们评估了ERA是否能改进现有算法。我们从OpenProblems基准测试中选出了九种方法,包括六个表现最好的方法(方法)。对于每种方法,我们都获得了纸质PDF,并用Gemini 2.5 Pro在提示词(方法)中添加了简短总结。在两两比较中,ERA在九种方法中有八种的总体得分优于相应的已发表结果(见图。2b)。表现最好的方法是批量平衡k最近邻(BBKNN TS))的ERA实现32,总体提升比最佳已发表方法(ComBat14%31)并且在所有数据集和11/13指标中均与已发表的BBKNN持平或优于(见图)。2b)。这一性能凸显了其有效去除批次效应而不影响生物信号的能力(补充图)。2)。我们观察到ERA也能在没有公开代码的情况下为算法生成性能优异的实现(TabVI(参考文献)33);扩展数据图。1)。值得注意的是,ERA提出的代码解决方案经过专家手工检查,确认几乎所有实现都遵循了所要求的算法(扩展数据表1),且在多次方法的重复运行中性能基本一致(扩展数据图)。此外,ERA即使在与优化超参数的基础方法相比也表现出改进,表明其贡献不仅限于超参数调优(方法及补充图)。3)扩展数据图。2 展示了最佳表现模型 BBKNNTS)中,树状结构及其最大得分随节点数变化的变化。对于BBKNNTS),部分性能提升来自于结合两种现有方法ComBat31以及BBKNN,而不仅仅是实现BBKNN(见图)。特别是,尽管原始的 BBKNN 方法是通过主成分分析(PCA)嵌入计算邻居,而 BBKNNTS)则使用ComBat修正的 PCA 嵌入计算邻居,从而消除了全局线性批次相关的方差。两种实现随后计算跨批次的k个最近邻并构建图(具体实现有所不同),从而消除局部批次效应(补充表6)。对BBKNNTS)的手动修改和已发布的BBKNN实现证实,使用战斗修正的PCA嵌入对于改进两种实现至关重要(扩展数据图)。3),确认了思想重组的价值。这促使人们探索系统化的方法,以产生更复杂的研究理念。首先,类似于科学家常常将想法结合创造新方法的方式,我们基于每种方法的代码摘要,程序化生成了上述11种方法中所有对的55个“重组”(无建议,9次重复和TabVI;以下称为“基础方法”)(方法及补充表7)。我们每次重组时都会触发ERA测试。对于每个基础方法和重组组,我们比较了三者成功计算的顶尖节点在所有指标交叉点的平均得分。值得注意的是,树搜索的重组实现经常优于其基础方法,55种重组解中有24种(44%)优于两种基础方法,剩余31种重组解中有22种优于其中一种(扩展数据图)。4)。其次,我们用了Gemini Deep Research34以及人工智能联合科学家35产生并实现了21个新想法(方法)。在对每种方法应用ERA后,6/11基础方法、29/55重组、4/9深度研究和1/12 AI共同科学家方法(87个中40个)均优于目前OpenProblems排行榜上发布的所有方法(见图)。2d)。为了进一步理解ERA探索的概念空间,我们利用Gemini的文本嵌入模型为每个生成的码进行了嵌入,并计算了余弦相似度(补充图)。嵌入可视化显示了不同的簇,通常代表基于深度学习的方法和非深度学习方法,表明ERA能够生成多种解(补充图)。5)。公共卫生:预测COVID-19住院情况美国COVID-19预测的主要基准是COVID-19预测中心(CovidHubhttps://github.com/CDCgov/covid19-forecast-hub/tree/main )18这是一项由CDC协调的大型协作项目。CovidHub每周接收来自数十个专家领导团队的预测,来自学术机构、产业界和政府,每个团队采用不同的方法论。这些每周预测必须涵盖美国52个州和地区在本周及随后三周内因新冠相关的新住院人数,涵盖23个指定分位数。提交采用加权区间得分(WIS)评估,该评分奖励准确性和合理校准的不确定性。表现最佳的单个模型包括经典的自回归时间序列方法(例如UMASS-ar6_pooled)、梯度增强机器学习模型(例如UMASS-gbqr)以及基于更新方程和贝叶斯估计的流行病学模型(例如CEPH-Rtrend_covid)。CovidHub利用这种方法论多样性,将提交的数据整合进CovidHub集合,这是一种稳健的综合预测系统,历来是美国流行病学预测的黄金标准。我们设计了一项严谨的回顾性研究,以评估在这一竞争环境中的ERA表现,数据截至202551日。对于每个预测周期,我们都运行ERA以利用前6周的数据优化和选择模型,创建贯穿2024-2025季节的滚动验证窗口(见图。3a),数据拆分详见补充表8。我们所得的“谷歌回顾”模型的每周表现详见时间序列排行榜(图)。3b),该模型相对于CovidHub团队及其他表现最佳团队的表现优势进行了可视化。对于最佳复现,每个独立验证分割的WIS时间变异都显示了(扩展数据图)。5)以及复制体间的分布(补充图。6)。直接的管辖区级比较确认,我们的模型在大多数州实现了较低(更好)的WIS(见图)。3cd)。补充无花果。78比较不同模型代表性位置的预测曲线。图3ERACOVID-19预测中的表现。图3ERACOVID-19预测中的表现。全尺寸图像a, 用于预测实验的滚动验证窗口。每次搜索的输出都会在前一个时间段(蓝色)上进行内部验证,然后用该模型对应的预测周期(橙色)进行预测。训练数据包括202088日及之后且验证设置前的所有日期。b、时间序列排行榜,显示参赛队伍的每周预测表现(“平均智慧指数”);以及按平均智慧指数排序的“谷歌回顾”模型。评分汇总涵盖所有52个司法管辖区和四个预测期。每个单元格中的数字是该模型该周的绝对平均 WIS。单元的背景颜色显示了相对于 CovidHub 集合的性能,蓝色表示较低(较好)的感知值,红色表示较高(较差)的感知值。c、我们模型与“CovidHub-ensemble”之间直接管辖区层面的预测误差(平均WIS)比较,展示了我们模型在大多数地区的优异表现。d、我们模型预测误差(平均WIS)的地理分布,汇总了整个2024/2025 COVID-19季节。误差值越低(颜色越浅)表示性能越好。e, 不同建模策略的总体预测表现比较。这包括来自CovidHub竞赛的基线模型、我们的回顾模型、提交模型的重复模型、通过重组生成的新混合模型、Deep Research34以及人工智能联合科学家35.在为期3周(3个参考日期×4个时间视野×52个司法管辖区)评估期间,有14种策略(10项重组策略,2项深度研究,1AI共同科学家和1项重复基线)优于官方CovidHub集合。表现低于CovidHub基线的模型未被展示。总体来看,我们的模型以平均 WIS 26 达到最高表现,优于官方 CovidHub 集合的平均 WIS 29。扩展数据图中展示了代表性的树状树和突破图。6。除了回顾性表现外,我们还研究了ERA通过复制、重组和生成全新预测策略,更广泛地探索解决方案领域的能力(见图。3e)。首先,我们测试了它能否仅用CovidHub(补充表910)中其他团队的简短公开描述来复制现有方法。我们基于树搜索的实现(“基础方法(TS)”)不仅遵循了提供的说明(补充表11),在测试的8个案例中有6个表现超过了原始提交;表现较差的两个模型(复制JHU_CSSE-CSSE_EnsembleOHT_JHU-NBXD)未使用原始方法实现中的外部数据。接着我们探讨了是否可以通过重组来改进解决方案。在本次实验中,我们促使一个大型语言模型分析两个不同父模型的核心原理,并利用其综合指导ERA生成结合各自优势的新混合策略。在26个生成的混合模型(“重组(TS)”)中,有11个的WIS分数优于其两个父模型(扩展数据图)。7)。我们手动验证了所有重组实验的输出代码都包含了来自两个父编码的相关方面(补充表11)。最后,我们使用了Gemini Deep Research34以及人工智能联合科学家35产生新的预测思路,这些想法随后通过ERA加以实施。总体而言,这项系统性探索得出了14种不同策略,其表现优于官方的CovidHub群组:其中1项来自重组,2项来自Deep Research1项来自AI共同科学家,以及1项我们的重复基线。每个生成代码嵌入间的余弦相似性显示了不同方法之间的聚类(补充图)。9)补充图中提供了包含九个树搜索模型及另外三个未超过基线的提交的扩展性能图,连同其对应的验证性能。1011。预测曲线示例见补充图。12。对这14种顶尖策略的深入分析揭示了ERA如何实现卓越表现的关键模式。这些重组模型构成了大多数获胜者,凸显了协同杂交的明显模式。在这些成功的混合体中,最常见的两个基础模型是:基于气候学的简单CMU-climate_baseline和统计自回归模型UMass-ar6_pooled。这表明ERA始终发现,最有效的策略建立在历史平均值和近期趋势的坚实基础上,然后通过更复杂的方法加以增强。事实上,最成功的重组始终融合了不同的建模模式:例如,将流行病学CEPH-Rtrend_covid模型与统计学的UMass-ar6_pooled模型结合,形成了一个基于疾病传播理论但对近期数据趋势高度响应的混合模型;而将强大的机器学习UMass-gbqr模型与稳定的CMU-climate_baseline结合,则提供了坚实的季节性基础,使机器学习模型能够安全地聚焦关于学习短期偏差。最后,我们验证了使用ERA而非仅取128次求解尝试中最佳方案的重要性,适用于流行病学建模和scRNA-seq批次整合(见表1)。表1 ERA与最佳NscRNA测序批次整合和流行病学建模任务中的性能比较全尺寸表格时间序列预测:GIFT-Eval接着,我们使用通用时间序列预测模型评估(GIFT-Eval)对ERA进行了评估19,是时间序列预测的标准基准。GIFT-Eval包含7个不同领域的28个数据集,数据频率从几秒到几年不等。每月约收到四份新提交,涵盖多种方法论,包括黑盒深度学习方法和基础模型。提交的成绩基于官方列车/验证/测试分段,使用归一化平均绝对尺度误差(MASE)指标,相对于季节性天真基线计算得出。我们分两阶段实施了ERA政策。我们从一个按数据集计算的解开始,ERA为每个数据集发现独立的解。第二个统一方案通过对整个GIFT-Eval的平均分数进行爬坡式爬坡,仅使用基础库创建了一个通用预测模型。按数据集解在这里,我们允许ERA使用完整的Python库套件,包括scikit-learnstatsmodelsXGBoostERA的表现优于2025518日的整个排行榜,该榜单包括基础模型、深度学习模型和标准时间序列方法(补充表12)。发现的解显示出对梯度提升和集合/分解模型的强烈收敛(补充图)。13)。统一解决方案我们考虑了代码变异系统是否可以通过在整个GIFT-Eval数据集的平均MASE上用单一代码进行爬坡式,从零开始创建一个统一的通用预测库。为了管理基准测试的多样性,我们允许库配备自适应配置系统,通过该系统生成最多八个预设超参数配置以适应数据集多样性,并通过验证步骤选择每个数据集表现最佳的配置。随着搜索进展,日期和趋势相关特征常常带来性能突破,形成一个顺序预测并减去单个时间序列组成部分的模型,包括基线水平、趋势、季节性、基于日期时间的特征以及最终的残余修正(扩展数据图)。8)这些配置(补充表13)包含特定日期的功能,其中一项包含特定国家的假期([“美国”、“德国”、“加拿大”、“英国”、“加利福尼亚”、“澳大利亚]])。最终的统一解决方案在20255月排行榜上极具竞争力(补充表12)。神经科学与地理空间和数值分析我们还评估了ERA在三个更为不同领域的问题:地理空间语义分割、脊椎动物神经活动预测和数值分析(补充信息)。ERA在每个案例中都达到了专家级表现(补充图)。1420及补充表14)。讨论我们的研究介绍了ERA,这是一种基于人工智能的系统,通过大语言模型驱动树状搜索,系统地创建和改进科学任务软件。通过将创建科学软件的问题定义为寻找一个输出能最大化质量分数的程序,我们将软件创建转化为“可评分任务”,从而产生实证软件。ERA在其基于LLM的重写方法上具有创新性,能够灵活整合领域知识与外部研究理念。前沿大型语言模型能够严格遵循指令,从而高效地探索研究理念。ERA基于多个不同但相关的研究领域:遗传编程、生成式编程、LLMs在代码中的应用、自动化机器学习(AutoML)、LLM与搜索的结合以及科学发现代理。基因编程:基因编程为我们的工作提供了基础。在遗传编程中,通过进化原则(如选择、交叉和突变)迭代改进一组程序。每个项目的适应度由一个“适应度函数”决定,这与我们的“质量评分”直接对应36.虽然遗传编程已经取得了成功,但它传统上依赖于随机突变和代码片段的结构化重组(例如,在抽象语法树中交换子树)。在LLM广泛采用之前,遗传编程系统通过使用形式语法限制搜索空间或利用结构代码度量来偏向进化搜索,成功地融入了人类专业知识37.ERA的一个关键区别是使用LLM通过重写代码来执行智能、语义感知的“突变”,这可以产生比基因编程中典型的随机变化更复杂、更有意义的变异。生成式编程:ERA可以被视为现代AI驱动的传统生成式编程实现,开发者通过模板、领域特定语言等技术创建程序生成器38或元编程)能够为一系列相关问题生成定制的源代码39.相比之下,我们使用由树搜索引导的大型语言模型作为生成引擎。这种方法提供了更大的灵活性,使ERA能够通过探索广阔的解决方案空间并整合多样化的领域知识,整合新的程序,这在更多基于模板的方法中难以实现。用于代码生成的大型语言模型:在庞大的代码语料库上预训练的大型语言模型的出现,彻底改变了代码生成。系统如AlphaCode40以及OpenAI手稿41已证明能够从自然语言描述生成正确且复杂的代码。这些系统通常用于从提示词中“一次性生成”。我们的方法不同之处在于将LLM进行迭代精炼循环。我们的LLM不是从零生成代码,而是通过搜索算法(树搜索)重写现有的软件候选,该算法以质量评分为信号。AutoMLAutoML 系统旨在通过寻找最优模型架构和超参数,自动化构建机器学习流水线的过程。目标是最大化验证数据集的性能指标(例如准确率、F1分数)42,符合我们对可评分任务的定义。虽然AutoML专注于在固定的机器学习框架集合中寻找最佳模型,但ERA则更为通用。它可以重写任何软件,包括预处理步骤、复杂仿真、数学启发式以及其他超出AutoML典型范围的领域。结合大型语言模型与搜索:最相关的工作是将大型语言模型与搜索算法结合,以克服一次性生成的局限。越来越多的文献将自动化算法设计定义为一种进化算法 43,44.FunSearch利用LLM来搜索新的数学发现,方法是将提出代码改进建议的LLM与自动评估器配对15.最近,代理框架如AlphaEvolve14将这些进化编码循环扩展到大海捞针的发现问题,精神上类似于这里探讨的树搜索算法,尽管科学问题解决不需要新颖的探索。科学问题代理:该子领域在高度专业化的系统中表现出色,代理专注于数据科学等问题45转向计算生物学46.ERA不仅专注于某一领域,而是展现出经验式软件优化的通用能力,在多个领域的公开排行榜和学术文献中实现专家级表现。据我们所知,这是首个证明在广泛相关且研究充分的科学问题上超越人类表现的系统。跨越不同领域,通过前沿论文的方法描述进行提示,ERA不仅生成遵循论文方法的代码,而且往往能获得更优的结果。我们希望强调优化经验预测模型与进行真正科学发现之间的关键区别,后者需要对潜在理论、因果机制和数学框架进行推理。尽管本文评估的核心问题主要强调先进的实证软件工程以实现严谨的自动评分,但我们的底层系统远不止于此,致力于科学发现(补充信息)。基于LLM的系统自主生成专家级经验软件的能力带来了更广泛的安全风险,尤其是在应用于可能直接影响人类福祉的领域时。通过自动化复杂的工程工作流,我们的系统大大降低了执行复杂计算任务所需的技术专长。虽然这种民主化加速了有益的科学发现,但同时降低了在敏感或潜在危险领域部署先进模型的门槛。这一现象代表了与大规模推理时间计算与基础模型质量指数级提升相结合的更广泛系统性风险。总结来说,ERA结合了基于树搜索的代码变异系统2具备整合复杂研究理念的能力。这些研究想法可能来自已发表的文献,来自研究代理人(例如,参考文献。 34,35)或结合LLM自身找到的先前想法和解决方案。由于ERA创建的代码可以遵循特定思想,它可以搜索外部提供的研究想法。ERA创造了40种方法,击败了已知最先进的scRNA-seq批量整合方法,14种方法在流行病学预测方面优于CDC的集合。此外,ERA在地理空间推理、神经活动预测和计算数学算法方面取得了专家级表现,并采用了基于规则的新时间序列预测策略。反复试验对科学进步至关重要,无论是对人类还是我们这里介绍的自动化方法。ERA能够非常快速地生成专家级解决方案,将一组想法的探索时间从数周、数月缩短到数小时甚至数天。以这种方式加速研究对科学进步有深远影响。基于这项工作,我们认为,能够通过机器计分解的科学领域,正处于显著加速的边缘。方法代码变异系统我们提示一个大型语言模型,提供描述、评估指标和相关数据。LLM生成Python代码,然后在沙盒中执行并评分。搜索策略显著提升性能:系统结合得分、输出日志及其他信息,逐步攀升至更高分数。我们采用了一种受AlphaZero启发的树搜索策略,置信度上限(UCB47.AlphaZero的关键区别在于,我们的问题不允许穷举节点所有可能子节点,因此每个节点都是扩展候选节点。因此,我们修改UCB算法,使其计数访问次数并利用树计算均值。然而,在采样节点进行扩展时,我们直接从整个集合采样,而不是像 AlphaZero 那样从根节点递归采样。这使得我们的方法更接近平直UCB48比任何蒙特卡洛树搜索变体(如AlphaZero)都要多。我们还注意到,该算法与传统树搜索不同,节点的评分不涉及随机滚动(例如游戏)来估算节点价值。然而,每个节点的评分仍然存在随机性,这源于对LLM本身的采样,产生了每个固定提示词的不同代码(分数)分布。我们使用预测器 + UCB 应用于树(PUCT)树搜索算法来探索代码空间2.PUCT算法在算法1中描述。对于树T和执行候选u,我们定义平坦先区\{P}_{T}u=\frac{1}{|T|}\)。为了更容易调节探索常数cPUCT跨任务,我们将任务特定得分 TaskScoreu) 转换为排名分数 RankScoreT(u)在PUCT公式中。我们定义 \{{\rm{RankScore}}}_{T}u=\frac{{{\rm{Rank}}}_{T}u-1}{|T|-1}\) 当 |T|> 1 1,否则,其中T(u) 给候选人按顺序排列。为了选择下一个扩展节点,该算法通过计算每个节点iPUCT启发(多项式上置信树)获取得分,平衡高分解的利用与搜索空间的探索:()(1)其中 cPUCT是探索常数,Ei) 是基于节点访问次数相对于整棵树总访问次数的探索项。我们调了cPUCTKaggle基准测试中,为了最大化性能,找到了cPUCT= 1 效果良好。具有全局最大PUCT的节点i评分选定。语言模型随后根据该父代码的代码和分数生成一个新的子解决方案。新代码被执行,赋予一个经验分数,并附加到搜索树中,随后将访问计数反向传播到其祖先。这种全局的扁平树结构允许系统在当前优化路径停滞时无缝回溯和分支。我们强调,在我们的算法中,突变发生在代码层面——想法是提示的一部分,生成代码,然后对代码进行评分和迭代。随着树节点数量增加,分数在3001000个节点后趋于饱和(详见补充图中的突破图)。我们通过结合不同的树状搜索和不同提示词来搜索想法。最后,我们这里概述的实现是为Kaggle基准测试的最佳性能而选择的。我们探索了许多替代方案,包括不同的代理配置,这里概述的简单实现在整个基准测试中表现最高。本文中所有实验均使用Gemini 2.5闪存进行,使用Gemini 2.5 Pro时的改进仅有限。算法1UCB 树搜索(PUCT)需求:生成并执行()、TaskScore()定义排名得分 RankScoreT(u),探索常数cPUCT以及一个根节点 r1T {r} ⊳ 初始化树,使用根节点。2Vr) ← 13:对所有迭代 都4N总计← ∑uTVu) ⊳ 获取所有节点的总访问量5: 选择 \{u}^{\ast }\leftarrow {{\rm{argmax}}}_{u\in T}\left{{\rm{RankScore}}}_{T}u+{c}_{{\rm{puct}}{P}_{T}u\frac{\sqrt{{N}_{{\rm{total}}}}}{1+Vu}\right\) ⊳ 选择 PUCT 得分最高的节点6uc← 生成并执行(u*) ⊳ 展开所选节点并执行7T T {uc}8Vuc) ← 19:所有祖先 uaUc(不包括Uc) do ⊳ 反向传播结果10Vua) ← Vua)+111:结束12:结束13: 返回 argmaxuTTaskScoreu) ⊳ 找到最佳解明确对比该算法与标准启发式搜索算法是有用的。我们的方法不依赖束流搜索(在每个深度层积极修剪未被选中的候选物)或(1 + λ)演化策略(只保留最新一代并丢弃历史状态)。同样,我们的系统也不同于将LLM纳入基因编程的涌现努力43,44,49,50,51.近年来,代理式自动机器学习框架涵盖了自动化特征工程、元学习、动态流水线构建和多目标优化52,包括能动系统 53,54,这些人展现出更令人印象深刻的表现55.为代码突变系统添加研究理念当专家解决棘手的科学问题时,他们通常会从以往的工作中寻找灵感。以往的工作可能来自高被引论文、专业教材或搜索引擎。搜索以往作品也可以由大型语言模型支持。34,35,56,57,58,59,60.我们通过在代码变异系统的提示中注入执行研究想法的指令来模拟专家行为(见图)。1)我们应用了研究指令注入技术,用于scRNA序列批量整合、COVID预测、遥感图像分割和全脑神经活动预测。虽然最成功的结果采用了文献中的顶尖方法,但我们还采用了两种基于LLM的搜索策略:Gemini 2.5 Flash的深度研究34以及人工智能联合科学家35.为了运行这些搜索,我们提供了来自主要问题描述的背景信息,并指示模型创造不同的想法(补充表15)。在手动筛选提案并删除一个拟议的scRNA-seq批量集成方法后,我们促使Gemini将这些想法格式化为与基线方法描述一致的结构(补充表16)。最后,我们对这些想法运行了ERA算法,创建了可评分的经验代码。防御率对阵全国最佳我们使用 N = 128 ERA 搜索节点,比较 Gemini 3 FlashMistral 3Claude Sonnet 4.6GPT-5 Gemini 3.1 Pro scRNA-seq 批量集成任务和流行病学流感预测任务中的表现。本文探讨了与本文核心模型同时期的一系列模型,同时也使用Gemini 3.1 Pro作为发表时的先进模型。评分采用与其他实验相同的评分规则:流行病学预测任务(流感预测)是通过滚动评估窗口评估的WIS,而scRNA-seq批次整合则是测量生物学信息保存率、去除批次效应的指标平均值,均测量在验证集上。请注意,批量集成的显著提升是在验证分数变化远小于流行病学预测时发生的。我们在此展示三个不同实验的最佳表现(包括NERA的最佳表现)。批量积分表现的典型波动约为0.01,流行病学预测为O1),并有一定模型依赖性。例如,GPT-5 在不同实验间的变异性远高于其他模型。我们注意到,ERA在探索解空间方面比N个最佳更高效,并且在所有模型和问题上都优于N个最佳,唯独GPT-5在批处理集成中的表现不佳。对于批量集成问题,GPT-5的一次性性能足够好,因此这一区别并不重要。事实上,我们预计随着前沿模型的改进,曾经困难的任务将逐渐饱和。树搜索对于推动模型在复杂任务中的性能非常有用。重组实验对于scRNA-seq批次整合问题和COVID-19预测,我们结合了通过树搜索生成的方法中的思想。对于scRNA-seq批次集成问题,我们使用了11种基线方法的最初版本。针对COVID-19预测问题,我们使用了提交给CovidHub的八个模型复制。我们首先从每次树搜索运行中选出表现最好的节点,采用上述方法之一做种,基于验证集上的得分(针对COVID-19预测,包括2025222日至20253296周的参考日期)。然后,对于每对这些方法,我们都让Gemini 2.5 Flash用一致提示比较这两种方法,并解释两者核心技术上的相似点和差异(补充表7)。随后,解释性回应被添加到提示中,并附上了一条指令,指示树搜索通过结合两种方法的优点来重新组合这些想法(补充表17)。随后,我们运行了ERA以生成新的混合策略。该过程产生了55scRNA测序批次整合问题的重组方法和28COVID-19预测问题的方法(评估时间为202545日至419日的3周保留期;无花果。3e)。我们的重组方法与以往LLM作为突变和交叉算符的尝试不同49,50,51,61,62,63,64.我们重新组合专家观点的方法在概念上与滚动视界进化算法(RHEA)等进化方法相关,但其比较优势在于,我们的树搜索通过LLM提示直接在概念空间中重新组合专家观点,而不仅仅是在模型空间中提取65.

[返回]

下一篇:发现最先进的强化学习算法