| 专家级学术题目基准,用于评估人工智能能力 |
| 来源:一起赢论文网 日期:2026-08-22 浏览数:37 【 字体: 大 中 小 大 中 小 大 中 小 】 |
|
专家级学术题目基准,用于评估人工智能能力基准测试是追踪大型语言模型(LLM)能力快速进展的重要工具。然而,基准测试难度并未跟上:大型语言模型在诸如大规模多任务语言理解测量等热门基准测试中,准确率已超过90%1限制了对最先进大型语言模型能力的有充分的测量。在此,我们介绍了人类最后考试(HLE),这是一个位于人类知识前沿的多模态基准,旨在成为一个专家级的封闭式学术基准,涵盖广泛的学科。HLE包含2500个题目,涵盖数十个学科,包括数学、人文学科和自然科学。HLE由全球各学科专家开发,包含适合自动评分的选择题和简答题。每个问题都有一个明确且易于验证的已知答案,但无法通过互联网快速检索。最先进的LLM在高阶计算上显示出低准确率和校准度,凸显了当前LLM能力与封闭式学术问题专家人类前沿之间的明显差距。为了在对模型能力有清晰理解的情况下为研究和政策制定提供参考,我们公开发布HLE于 https://lastexam.ai。类似内容被他人观看LLM推理链中准确性的词汇线索文章 开放获取 2026年6月4日临床决策任务中基于大型语言模型的代理系统基准测试文章 开放获取 2026年2月18日自我反思增强了大型语言模型对学术反应的有力性文章 开放获取 2025年12月1日主要角色大型语言模型(LLM)的能力显著提升,在多样化任务中超越了人类的表现。为了系统地衡量这些能力,LLMs会在基准测试上进行评估:一组问题用于评估模型在数学、编程或生物学等任务上的表现。然而,最先进的大型语言模型2,3,4,5,6现在在诸如大规模多任务语言理解测量(MMLU)等热门基准测试中实现超过90%的准确率1这些曾是大型语言模型的挑战性前沿。现有基准的饱和度,如图所示。1,限制了我们精确衡量人工智能(AI)能力的能力,并呼吁进行更具挑战性的评估,以有意义地评估人类知识前沿大型语言模型能力的快速提升。图1:前沿大型语言模型在流行基准测试和高水平算法上的表现。图1:前沿大型语言模型在流行基准测试和高水平算法上的表现。全尺寸图像与其他流行能力基准的饱和相比,HLE在多个前沿模型中依然较低,这证明了其在衡量高级、封闭式学术能力方面的有效性。为弥补这一空白,我们引入了HLE(最初定义为人类的最后考试,本文中将使用HLE一词),这是一个包含2500道具有挑战性的题目,涵盖数十个学科领域,旨在以专家水平评估广泛学科中的LLM能力。HLE由学者和领域专家开发,随着LLMs不断改进,提供精确的能力衡量(见“集合”部分)。HLE是多模态的,题目要么纯文本,要么附有图片参考,并包含选择题和精确匹配题,用于自动验证答案。问题原创、精确、明确,且难以简单地通过互联网查找或数据库检索。在基准测试中多样的问题中,HLE强调世界级数学问题,旨在测试广泛应用于多个学术领域的深度推理能力。我们采用多阶段复习流程,确保题目难度和质量(详见“复习”部分)。提交前,每个问题都会与最先进的大型语言模型进行测试以验证难度——如果大型语言模型能正确回答,问题将被拒绝。提交的问题随后通过两阶段评审流程处理:(1)多位研究生级评审的初步反馈轮,(2)组织者和专家评审的批准,确保质量和符合我们的提交标准。发布后,我们进行了公开审查期,欢迎社区反馈以纠正数据集中的任何问题。前沿大型语言模型在所有模型中均表现出较低的准确性,凸显当前能力与专家级学术表现之间的明显差距(见“评估”部分)。模型还以高置信度提供错误答案,而非承认这些难题的不确定性,大多数模型的均方根校准误差超过70%。随着人工智能系统在许多领域接近人类专家的表现,精确测量其能力和局限性对于为研究、治理及更广泛的公众提供信息至关重要。高水平考试成绩表明在封闭式学术题目上具备专家级能力。为了建立评估这些能力的共同参考点,我们公开发布了大量来自HLE的2500个问题,以实现精确测量,同时维护一个私有测试集以评估潜在的模型过拟合情况。数据集收藏HLE包含2500道具有挑战性的题目,涵盖一百多个科目。图中提供了高层次总结。2. HLE是一个全球协作项目,来自近1000名学科专家,隶属于50个国家的500多所机构,主要由教授、研究人员和研究生学位持有者组成。提交给HLE的多样化且具有挑战性的问题示例见图。3.图2:HLE题目在各类别中的分布。图2:HLE题目在各类别中的分布。全尺寸图像HLE包含2500道考试题,涵盖一百多个科目,分为八个高级类别。图3:HLE的示例题目。图3:HLE的示例题目。全尺寸图像提交给HLE的多样且具有挑战性的题目样本。题型HLE包含两种题型:完全匹配题(模型输出一串精确字符串)和选择题(模型从五个或更多选项中选择一个)。HLE是一个多模态基准测试,约14%的题目要求同时理解文本和图像;24%的题目为选择题,其余为完全匹配题。每份问题提交包含若干必需部分:题目文本、答案说明(可为完全匹配的答案或标注正确答案的多项选择选项)、详细解释解答理由、学科及贡献者姓名,以及机构隶属关系,以保持问责性和准确性。投稿格式为确保问题质量和公正性,我们严格执行提交标准。问题应精确、明确、可解且不可检索,确保模型不能依赖记忆或简单的检索方法。所有投稿必须是原创作品或非简单地综合已发表信息,但未发表研究的贡献也被接受。题目通常要求研究生水平的专业知识或测试高度具体主题的知识(例如,精确的历史细节、趣闻和当地习俗),并且答案具体且明确,且被领域专家接受。当LLMs在推理错误的情况下给出正确答案时,作者被鼓励修改问题参数,如选项数量,以减少误报。我们要求清晰的英语和精确的技术术语,并在必要时支持 LaTeX 符号。对于完全匹配的题目,答案保持简短且易于验证,以支持自动评分。我们禁止与大规模杀伤性武器相关的开放式问题、主观解读和内容。最后,每个问题都附有详细的解答以验证准确性。关于贡献者指南的更多信息,请参阅补充信息第1部分。奖金池为了吸引高质量的投稿,我们设立了50万美元的奖金池,前50名题目每题5000美元,接下来500题每题500美元,由主办方确定。这一激励机制,加上任何在HLE中被接受问题的人都可以参与论文合著,吸引了资深专家参与,尤其是那些拥有高级学位或显著技术经验的专家。影评LLM 难度检查为确保问题难度,每个问题提交前都会先对多个前沿大型语言模型进行验证(方法)。如果大型语言模型无法解答问题(或者在选择题中,模型的平均表现不如随机猜测),问题进入下一阶段:人类专家评审。总计我们记录了超过7万次尝试,产生了大约1.3万个问题,这些问题都被难倒,这些问题被提交给专家人类审核。专家评审我们的人类审核员拥有各自领域的研究生学位(例如硕士、博士和法学博士)。评审者会在其领域内挑选投稿,根据标准评分标准进行评分,并在适用时提供反馈。评审分为两轮。第一轮重点是不断完善提交内容,每个问题会获得一到三次审核。其主要目标是帮助问题贡献者(主要由来自各学科的学者和研究人员)更好地设计出封闭、稳健且高质量的AI评估问题。第二轮中,第一轮的优秀和未解决问题将被组织者和评审者批准,纳入最终HLE数据集。两轮的详细信息、操作说明和评分标准可在补充信息第2部分找到。图4展示了我们的完整流程。图4:HLE数据集创建流程。图4:HLE数据集创建流程。全尺寸图像我们接受那些让前沿大型语言模型失败的问题,然后在专家同行评审的帮助下反复完善。每个问题随后由组织者或受其培训的专家审核员手动审核。私人保留的测试集与公开测试组分开,以评估模型过度拟合和公共基准的游戏。评价我们评估了先进大型语言模型在高等研究(HLE)上的表现,并分析其在不同问题类型和领域的能力。我们描述了我们的评估设置(见“设置”部分),并展示了若干跟踪模型表现的指标定量结果(见“定量结果”部分)。设置经过数据收集和审查,我们评估了关于更多前沿多模态大型语言模型的最终HLE数据集。我们使用标准化的系统提示,将模型回答结构化为明确推理,随后给出最终答案。由于题答精确且封闭,我们使用o3-mini作为裁判,在考虑等效格式(例如小数与分数或估计)的同时,验证答案是否正确与模型预测。评估题目详见方法。定量结果准确性所有前沿模型在高等研究(HLE)中均实现较低准确率(见表1),这凸显了在缩小当前大型语言模型与专家级学术能力之间闭门题能力差距方面仍有很大提升空间。这些低分部分是数据集收集过程设计的,旨在过滤现有模型能够正确回答的问题。然而,我们注意到模型表现出非零准确率。这是由于模型推断中固有的噪声——模型在多项选择题中可能猜对答案不一致,或者比随机机会更差。我们注意到,在扩展数据表中,选择题的准确率高于精确答案题。3. 我们选择将这些问题作为数据集中的自然组成部分,而非强烈的对抗过滤。然而,我们强调,前沿模型在数据集上的真实能力底线仍是一个悬而未决的问题,接近零准确度的小幅度变化并不强烈反映进展。表1 不同模型在HLE上的准确率和均根误差,显示所有模型的低精度和高校准误差全尺寸表格校准误差鉴于HLE性能较低,模型应被校准,认识到其不确定性,而不是自信地给出错误答案。为了测量校准,我们提示模型同时提供答案和置信度,范围从0%到100%(方法),使用以下设置7.我们RMS校准误差的实现来自参考文献。8.一个经过良好校准的模型所标称的置信度应与其实际准确率相匹配,例如在声称50%置信度的问题上达到50%的准确率。表1显示所有模型校准不良,均方根校准误差分数较高。模型在HLE中经常以高信心给出错误答案,未能识别问题是否超出自身能力范围。推理时间计算推理模型设计成在回答前需要额外的计算思考:它们生成中间推理标记,然后生成最终反应,这意味着推理时必须解码更多的标记 5,6.为了在评估中阐明这一点,我们分析了图中多个最先进推理模型中输出代币(包括推理代币)的计算密集型缩放。5. 通过对数分箱输出长度2规模化时,我们观察到当更多推理符号时,准确度呈对数线性缩放;然而,这一趋势在2之后会逆转14强调较大的推理预算并不总是最优的。观察到精度提升超过某个阈值会减弱,表明未来的模型不仅应提升其在高等计算上的原始精度,还应提升计算效率。图5:准确性与推理代币预算的比较。图5:准确性与推理代币预算的比较。全尺寸图像准确率按生成输出代币总数分组,显示准确率呈对数线性增长,峰值约为214在反转之前先用代币。讨论局限性尽管当前的大型语言模型在高等计算(HLE)上的准确率非常低,但近期历史显示基准测试迅速饱和——模型在短时间内从接近零的性能显著提升到近乎完美的性能9,10 .HLE的高准确率将展示在封闭、可验证问题和前沿科学知识上的专家级表现,但仅凭这一点并不意味着自主研究能力或通用人工智能11.HLE考试结构化的是学术问题,而非开放式研究或创造性问题解决能力,使其成为涵盖多学科的技术知识和推理的重点衡量,尽管在数学和STEM(科学、技术、工程和数学)学科中表现更为突出,如图所示。2. 通过突破既有封闭基准测试的极限,HLE旨在加速向更动态、更开放的AI能力的新型基准类别的转型。影响通过明确衡量人工智能进展,HLE为科学家和政策制定者提供了评估AI能力的共同参考点。这使得关于发展轨迹、潜在风险及必要治理措施的讨论更加深入。方法相关作品大型语言模型基准测试基准测试是追踪大型语言模型能力快速发展的重要工具,包括一般知识和科学知识1,10,12,13,14,15以及数学推理16,17,18,19,20,21,代码生成22,23,24,25,26,27,28以及通用人类协助7,29,30,31,32,33,34,35.由于其客观性和大规模自动评分的便利性,评估通常包括选择题和简答题31,36,37,38,39,基准测试如MMLU1同时涵盖了广泛的学科和复杂的层次。饱和度与前沿基准设计然而,最先进的模型在许多现有评估中几乎获得满分,掩盖了当前及未来前沿AI能力的全部实力40,41,42,43.这促使开发更具挑战性的基准测试,以测试多模态能力17,22,24,44,45,46,47,48,49,50加强现有基准32,44,45,51,52,筛选多个阶段的问题9,12,19,42,53,54并请专家为高级学术知识编写测试9,12,19,54,55,56.HLE结合了这些方法:问题由主题专家开发,经过多轮审查,同时保持MMLU广泛的主题覆盖。因此,HLE明确衡量了当前AI能力与人类在封闭式学术任务中专业知识之间的差距,补充了开放领域中对高级能力的其他评估 57,58.数据集提交流程为了确保问题难度,我们在提交每个问题前自动检查前沿大型语言模型的准确性。我们的测试流程使用多模态LLM处理文本和图像题目(GPT-4o、Gemini 1.5 Pro、Claude 3.5 Sonnet和o1),并新增了两种非多模态模型(o1-mini和o1-preview)用于纯文本题目。我们根据题型使用不同的提交标准:完全匹配的问题必须难倒所有模型,而选择题必须难倒除一个模型外的全部,以考虑潜在的幸运猜测。用户被指示只提交符合这些条件的问题。我们注意到,由于模型中的非确定性以及选择题的非零底线,对该数据集的进一步评估显示出一些较低但非零的准确性。发行后晚期贡献响应研究界的兴趣,我们在初次发布后开放了平台,欢迎迟到贡献者,最终收到了数千份投稿。每份提交均由组织者手工审核。新问题的难度和质量与我们最初的数据集相近,因此得到了第二个保留的私有题集,将在未来的评估中使用。精炼社区反馈:由于许多提交内容较为先进且专业化,评审者不被期望核实每个解决方案理由的全部准确性,而是关注问题是否符合指南。鉴于评审流程的这一限制,我们在数据集初次发布后启动了社区反馈错误奖励计划,以识别并消除数据集中的主要错误,即标签错误及问题陈述中的其他错误。每份错误报告均由组织者手工核实,并在适当情况下由原作者反馈。可搜索问题:如果模型用搜索工具正确回答,但未搜索时错误回答,问题潜在可搜索。这些潜在可搜索的问题随后被人工审核,剔除通过网络搜索轻松找到的问题。在此过程中,我们使用了GPT-4o mini/GPT-4o搜索和困惑声纳模型。我们观察到,当前在HLE上应用该程序后,前沿模型的性能与应用前在HLE上的性能相似。专家意见分歧率发布前,我们进行了两轮主要的审计,每轮对200个问题进行样本。我们招募了美国顶尖大学的学生,完整解答HLE中的部分题目样本。被标记的错误会在组织者、原问题作者和审核员之间进行沟通,直到达成共识。我们利用这些审计的数据进一步优化了数据集。第一轮旨在识别常见的不精确问题类别,如开放式格式、依赖四舍五入数值或接受率较低的作者投稿。基于这些信号,我们手动删除或修订了潜在问题,随后对新的200题样本进行了第二次审计。这一迭代过程最终得出公众集专家意见分歧率为15.4%。这种专家分歧与其他知名机器学习基准中观察到的情况一致59,60,61,62.在健康和医学等领域,分歧率往往更高。针对生物学、化学和健康子集的针对性同行评审,见参考文献。63,发现专家意见分歧率约为18%。这在其他类似专家级作品中也有体现;例如:64指出,专家医生在复杂健康问题上存在分歧时有发生。为了帮助社区未来识别其他潜在数据集错误,我们概述了几个导致审计复杂性的关键因素:多位专家的需求:我们的多审稿流程凸显了这些问题的复杂性。在若干情况下,审稿人发现了重要信息,比如几十年前的论文或其他人一时不明显的基础概念,这些信息对于确认答案的有效性至关重要。举例来说,如果采用单一评审方法,即仅凭一位持不同意见的专家标记问题,上述健康相关子集的分歧率从18%跃升至25%,这与参考文献中大致的数字和方法相近。63.这一差异凸显了标准同行评审流程的重要性,该流程包含多位评审者和作者反驳,适用于HLE问题。研究经验问题:HLE有意设计包含基于贡献者直接、动手实验所得见解的问题。这种设计捕捉了直接研究经验中获得的知识,而这些知识往往难以通过标准文献检索或外部评审者验证。这样做是为了测试模型知识,超出互联网上容易索引的内容。理解问题设计:设计具有挑战性的封闭式研究问题很困难。因此,某些HLE多项选择题的目标是找出在提供选项中最合理的答案。一些外部评审者不熟悉这些设计原则,试图寻找外部资料来支持开放式答案,而不是评估给定选项中的最佳选择。 |
| [返回] |