| 一般量表赋予AI评估的解释性和预测能力 |
| 来源:一起赢论文网 日期:2026-08-22 浏览数:33 【 字体: 大 中 小 大 中 小 大 中 小 】 |
|
一般量表赋予AI评估的解释性和预测能力确保人工智能(AI)的安全有效使用需要理解并预见其在新任务中的表现,从高级科学挑战到转型的职场活动 1,2,3.迄今为止,基准测试指导了人工智能的发展,但对通用人工智能系统的解释和预测能力有限4,5,6,7,8归因于特定任务间的迁移性有限9,10,11.本文介绍了AI评估的通用量表,能够引出需求曲线,解释常见AI基准实际衡量的能力,提取能力曲线,量化AI系统的整体优势与局限,并强力预测新任务实例的AI表现。我们的全自动方法基于18个评分标准,涵盖广泛的认知和智力需求,将不同任务实例置于同一一般尺度,展示在15个大型语言模型(LLM)和63个任务上。这些量表上的需求和能力剖面带来了新的见解,比如通过基准敏感性和特异性来构建构造效度,并解释了关于人工智能是否具备推理能力的相互矛盾的主张。最终,利用通用尺度实现实例层面的高预测能力,尤其是在分布外环境(新任务和基准)中,能提供优于强黑箱基线预测的估计。这里呈现的量表、评分标准、电池、技术和结果构成了人工智能评估科学的坚实基础,为未来几年人工智能的可靠部署奠定基础。类似内容被他人观看迈向评估人机价值融合的社会人工智能对齐基准文章 开放获取 2026年4月23日利用机器学习和可解释变换器模型分类人类与人工智能文本文章 开放获取 2025年12月8日当人类与人工智能的结合有用时:系统综述与荟萃分析文章 开放获取 2024年10月28日主要角色现有的通用人工智能系统,如大型语言模型(LLM),极不可靠且不可预测6,12 .这给AI评估带来了很大的解释和预测能力负担:我们需要理解AI系统为何失败,并预测其可成功应用的领域。传统的以性能为导向的评估方法在实例层面,无论在基准内还是基准之外,都显示出有限的预测能力9,10 .如果 DeepSeek-R1 的平均性能达到 79.8%13在一个流行的数学基准指标上,比如美国邀请数学考试数据集14我们无法对从该基准中抽样的单个项目做出有根据的成功估算。对于来自其他数学基准测试的非分布实例,更不用说其他领域的基准测试,这个性能评分的信息更有限。事实上,综合性能分数是基准测试和人工智能系统的函数,而不仅仅是系统的恒定属性——即其“能力”——这些属性定义了系统的极限,这些能力可以推广到各种场景。其他评估范式不会汇总表现,而是估计受试者(人类或人工智能系统)的一些属性,这些属性与项目某些属性(具体问题实例)共同可以预测表现;我们在补充信息第1.16节提供了技术术语表,如主题、物品、能力和污染。心理测量学和其他行为科学的多种技术已被应用于人工智能评估15,例如因子分析 16,17以及题目反应理论(IRT)18.然而,提取的因素或参数是总体性的:它们高度依赖于所用系统和基准的人口,这使得它们在人工智能快速发展的过程中很快过时。近年来,与不确定性估计和校准方法相关的评分预测元模型被称为“评估器” 19,20,已被用来通过潜在特征预测实例级新任务的性能。然而,这些特征难以解释,且通常难以从分布中推断出 21,22.或者,这些特征也可以由人类通过认知启发的方法来工程化23但这种方法的可扩展性受限于需要专家来开发认知模型并注释测试题。这些观点在测量内容和方式上有所不同8但他们都曾在解释深度和预测力方面努力。此外,大多数这些框架衍生的特征、参数或尺度经常被极其不稳定的AI系统和基准领域所淹没,很快会被淘汰 24,25.构念效度的缺失10,26,27,28在常见的基准测试范式中也是一个问题8.解决所有这些问题是现实世界中更为严谨评估的前提9,29 ,例如交互式、主观性和自适应性评估30,31,32.表1总结了本文提出的问题及其相关发现、其带来的解决方案及其众多新应用。补充信息 第1.1节 相关工作详情。表1 当前AI评估范式挑战的诊断、本文中方法论解决方案揭示的新发现及新方法论的潜在应用(详见方法部分“应用与扩展的流程与指南”)全尺寸表格我们提出了一种新方法论,能够伴随、绘制并指导未来几十年人工智能的进展、监管和部署。这种方法在大型语言模型(LLM)上实现并演示,这种方法论也适用于具有其他架构和特性的人工智能系统。核心元素是一个由18个尺度组成的数组,范围为(0, ∞),对应与自然语言任务相关的一般能力——如语言理解和逻辑推理——以及广泛的知识领域——如自然科学和形式科学。这些尺度(需求水平)的精确数值通过18个精心设计的需求水平标注(DeLeAn)评分标准获得,范围为0到5+,人类可以解读并应用于任何测试实例,但最终由大型语言模型裁判用于扩展性。通过将评分标准通过20个基准进行分析,我们得到了注释需求水平(ADeLe)电池,其18个需求水平直方图构成需求剖面,考察每个基准的敏感性(测量其声称测量的量)和特异性(不测量超出其宣称测量范围的其他能力)。对于每个应用ADeLe的LLM,我们得到18条特征曲线,界定LLM随需求水平的表现。每条曲线汇总为与各需求尺度相称的能力估计,从而构成18个能力等级的能力档案。值得注意的是,特定任务或基准的需求水平以及人工智能系统的能力水平,是独立于其他基准测试和系统及其任何群体的。最显著的是,需求水平可用于构建AI系统在未见的分配内及特别是分配外实例(新任务和基准)成功的强有力预测模型。例如,通过注释几个声称能评估“推理”的基准(见图)。1)并将注释需求与AI系统测得的能力进行比较,我们可以得到因果解释和预测:如果像DeepSeek-R1-Distilled-Qwen-14B这样的AI系统,其定量推理(QLq)、逻辑推理(QLl)和归纳推理(CL)能力分别为4.5、4.3和4.2,如图所示。1a,我们可以预期GSM8K在相同维度下需求为2、1和0(其他维度较低)时会取得成功。我们还可以预测OlymMATH Hard中典型实例的结果可能不那么乐观,某些维度的值大约在4甚至5之间(见图)。1b)。我们也可以进行反事实分析,例如认为如果 DeepSeek-R1-Distilled-Qwen-14B 在 QLq 中的能力降至 3,其在 GSM8K 上的性能将有微小影响。然而,如果其在QLq中的能力被削弱到1,将会受到很大影响。图1:可以比较相应的大型语言模型和基准配置文件,以解释和预测性能。图1:可以比较相应的大型语言模型和基准配置文件,以解释和预测性能。全尺寸图像这里我们展示了大型语言模型的能力配置文件(a;DeepSeek-R1-蒸馏Qwen-14B,估计如“解释性能力分析:LLM能力剖析”部分所述)以及四种不同的“推理”基准需求曲线(b;GSM8K、OlymMATH Easy、GPQA 和 OlymMATH Hard 这些切片代表各能力需求水平的频率,深色表示频率较高)。研究人员、开发者和用户可以直觉地认为,基准测试GSM8K的性能预计较高,而其他三款则更差。此外,这些配置文件解释了看似矛盾的结果,比如DeepSeek-R1-蒸馏Qwen-14B在GSM8K、OlymMATH Easy、GPQA和OlymMATH Hard上的准确率分别为90.50%、61.80%、59.10%和13.30%,尽管这些基准据称都测试了数学推理。事实上,OlymMATH Easy 对定量推理(QLq)、逻辑推理(QLl)和归纳推理(CL)的需求低于 OlymMATH Hard ,但对其他维度的要求相似。然而,尽管在推理维度上较易,GPQA的表现却不如OlymMATH Easy,原因是其特异性较低,且对某些超出KNf(形式科学)的知识维度(如KNn(自然科学)和KNa(应用科学)有较高的需求。关于这些与“推理”基准的基准的进一步细节,详见补充信息第1.12节。来源数据因此,通过我们的方法论,我们解锁了以下超出以往方法的可能:1.我们可以将能力空间划分为一个层级目录,涵盖一般尺度。DeLeAn评分标准v1.0(详见扩展数据表5中的维度,详见补充信息第2节)系统地应用于ADeLe电池v1.0的16,108个实例(补充表28),共计18个一般尺度的289,944条注释。评分标准的清晰性通过人类与大型语言模型注释的一致性得到验证。存在在任何能力对上不同的实例,以及19个维度之间的适度需求相关性(扩展数据图)。1)认为该比例尺集合可能映射出独特能力,不依赖于现有系统,且可能对未来的人工智能系统保持信息量。2.我们可以解释哪些是共同的基准真正衡量的。我们发现需求存在于多元维度,如非典型性(从常见到唯一)、体积(从小到大)和不可猜测性(从选择题到开放式),这表明污染(高估,因为训练中看到了类似数据33合并(低估,因为将更多因素集中给任务会使示例更难34)和引导(通过减少或增加选项或干扰因素来改变任务难度,低估或高估35),分别(图。2 显示了这些需求的水平,补充表 2 展示了这些维度的预测性)。除了这些效应外,许多基准测试缺乏敏感性或特异性:它们未包含设计者声称测量的维度的所有需求水平实例,或者包含其他不应测量的维度上的非零需求(见图)。2)识别每个实例真正测量的是什么,为基准测试的互操作性和基于构造效度的AI评估铺平了道路。3.我们可以通过相应的尺度来解释人工智能系统的一般优势和局限性。在我们对三类大型语言模型的实验中,我们发现知识维度的能力分数主要由模型规模决定,而定量和逻辑推理、学习与抽象,以及(或许令人意外的)思维建模和社交能力则在思维链、推理重的模型中得到提升,如OpenAI的o1和DeepSeek-R1-Distilled(见图)。3和4)。由于因变量不是基准上的相对百分比,而是对应比率尺度上的一个水平,这些量表不饱和,我们能够澄清相互矛盾的评估结果(补充信息第1.12节),并展示尺度规律中的收益递减(补充信息第1.4节)。4.我们可以从新任务和基准测试中,稳健地预测AI表现。在实例层面实现较高预测力,优于基于嵌入或微调的黑箱评估基线,尤其是在分布外环境(新任务和基准)中,支持量表的内部和外部效度。这些也优于基于域的36或学习层级分类法37(补充信息第1.9节)这开启了多种应用,比如更好的路由方法来选择使用哪种模型38,安全操作领域,保证保障7以及在预期损害或代价时,预先拒绝规则 39,40.详见扩展数据表2、3和4及补充图。8。这些流程通过开源管道实现全自动化,人工智能研究人员、政策制定者和监管机构可以通过将尺度扩展到其他能力、特征或倾向(例如影响安全或公平)以及具有赋能性的代理(参见扩展数据图)来轻松定制。5 以及协作平台的完整解释见方法部分“应用与扩展的流程与指南”)。这一努力在创建人工智能测量标准方面具有开创性意义,模仿了其他科学领域的关键测量工作41,42,43.我们彻底改革人工智能评估的关键要素是配置易于理解、通用且基于测量理论的量表。我们使用包含18个量表的目录,遵循层级结构(补充信息部分2),通过方法部分“通用量表”中详细解释的一套标准选出。我们称前11个为“元素”,涵盖语言表达和元认知等一般能力。第二组包含五个“知识”维度,衡量不同科学领域专业知识。还有三个“多余”维度(其中两个是适当量表,第三个是引导控制变量)、AT(非典型性)、VO(体积)和UG(不可猜测性),它们并不直接反映认知需求,而是反映这些因素使项目以其他方式变得更难。完整的评分标准可在补充信息第2部分找到。我们还探讨了目录子集及其他分类法的替代消融 36,37在补充信息第1.7和1.9节中,没有一个能接近DeLean目录在预测或解释力上的表现。在方法部分“比率尺度”和“需求能力空间剖析”中,我们解释了如何通过作为实例需求测量工具的评分标准定义量表,并围绕这些指标构建方法论;这适用于我们使用的任何目录,无论是DeLeAn v1.0、其扩展还是其他。我们通过这些量表的主要目标是实现兼具解释力和预测力的人工智能评估。我们现在通过四个具体研究问题证明了这一点,并将我们的方法与AI评估中的标准实践或最佳基线进行比较。注释尺度区分层级和维度首先我们要回答以下研究问题:人类能否区分评分标准和维度中的层级?如果能理解,这些刻度只有在解释上才会起到解释作用。在方法部分“LLM注释者与评审者间分析”中,我们描述了如何选拔五个人,评分标准如何呈现,以及样本数据。评审者间协议(r世界政府这五个人的18项要求指数介于0.70到0.91之间(平均为0.83)。应用Delphi方法后,我们得到共识注释,并将其与LLM标注器GPT-4o进行比较,结果获得了很高的一致率(r世界政府得分介于0.75到0.94之间,平均0.86)。这些一致率显示了人类之间以及GPT-4o自动注释之间的共同理解。评分标准的另一个必要支持来源是它是否带来高预测力,我们将在“预测力分析:与评估者预期表现”章节中探讨,同时以易于理解的方式表示该构念。这些维度人类可以理解,但在概念上是冗余的,因为我们无法想象一个维度层次很高而另一个维度较低的实例。如果没有这样的实例,人类将难以区分维度。在特定基准中,维度仍然可以相关(例如,设计或选择偏差总是使一个维度同时增加另一个),但如果相关性不接近最大,我们可以得出结论,必然存在差异很大的实例。扩展数据中见图。1,我们展示了ADeLe电池中所有维度需求水平的Spearman相关性,该样本主要来自2024年AI基准测试。通常较低或中等的相关性表明大多数维度似乎划分了智能空间的不同部分,但仍允许一个维度的水平较低而另一个维度的水平较高的情况。这些例子虽不多,但并非不可能。只有两个相关系数大于0.8,它们属于CL(概念化、学习和抽象),该领域在流形中略显中心,因其与元认知与批判性思维(MC)和QLl(定量与逻辑推理)的强相关性。我们还看到,除 UG 外,外维度的相关性与其他需求高度相关。一般来说,这些正相关或负相关可以有多种解释,因为它们取决于我们选择的基准。总体结论是,GPT-4o的注释对人类在所有维度上都是可理解的,且这些维度可以被很好地区分。这很有价值,因为AI评估实践中的其他评分标准往往很具体,很少量化,且仅偶尔用于解释 44,45尽管认识到这种理解是人工智能采用的关键因素27.此外,维度之间的相关性似乎并不意味着某些需求水平组合是不可能的,而是在当前的ADeLe电池v1.0中出现频率较低。本文中,我们选择实例和基准旨在代表AI基准的整体格局,而非为最小化相关性而挑选。这源于我们对基准所测量的事物的兴趣,以便接下来的研究。通过基准需求剖面进行解释力本节我们探讨的研究问题是:ADeLe及其组成基准的敏感性和特异性如何?我们可以先看看每个基准的需求曲线(见图)。2)这有助于理解基准实际测量的内容,以及它们是否测量设计者声称测量的内容。图2:ADeLe v1.0电池中20个基准测试的18个需求(即需求剖面)电平频率分布。图2:ADeLe v1.0电池中20个基准测试的18个需求(即需求剖面)电平频率分布。全尺寸图像补充信息 第1.12节调和了LLM“推理”中的常见误区,并描述了20个所谓“推理”基准的需求剖面。来源数据总体来说,这些配置文件差异很大,显然它们测量的是不同的东西。专注于专业主题的基准测试(例如ChemLLMBench、OmniMath、MedCalcBench和SciBench)在其各自领域(KNa(应用科学)、KNn(自然科学)和KNf(形式科学))中需求较高,而像TempReason和TruthQuest这样针对单一领域的基准测试,通常在更广泛的维度上达到峰值。其他基准——如Date Arithmetic、GRE & GMAT、MCTACO、TimeDial和TimeQA——需求均较低。相比之下,更广泛的评估如公务员考试、LSAT和MMLU-Pro表现参差不齐。为了确定它们是否测量了它们声称测量的事实,我们必须比较图。2 并列出这些基准所测量的能力或领域(补充表28)。为了更好地说明构念效度的问题,我们通过两个标准系统化了敏感性和特异性阈值:敏感度标准:如果一个新的基准声称测量X,我们应预期该基准中与X相关的需求水平分布广泛:我们通过X维度中均值≥2,标准差(s.d.)≥1.0来描述。特异性标准:此外,我们应预期所有与基准声称测量的维度无关的维度都会出现低水平:我们用所有其他“混杂”维度的平均值<2.0来表征。表2定量列出了基准指标及其是否符合特异性和敏感性标准。在少数特定情况下,基准声称测量的内容与其敏感能力存在一定重叠。然而,这种情况发生在基准声称测量能力的不到一半,且大多数基准和维度不会发生(即汇总量的灵敏度和特异性较少)。例如,像SAT这样的基准测试因不同原因而过于饱和(低非典型性,即高污染),而MedCalcBench实际上衡量的是LLM是否具备足够的注意力和扫描能力来处理给定信息,而不仅仅是测量医学计算能力。此外,在补充信息第1.12节中,我们调和了LLM“推理”中的常见误区,发现对20个“推理”基准的批次缺乏敏感性或特异性。表2 ADeLe中20个基准子集的敏感性和特异性分析全尺寸表格综合来看,常见基准的特异性和敏感性较差且不稳定。这些结果表明,通过为一个“能力”分配一个或多个基准并汇总其准确性(这是当前的标准做法),可以平均不同的需求水平和维度,从而产生高度混淆的结果。如果这就是常见AI评估实践的基线,那么仅仅检测特异性和敏感性问题是远远不够的 10,27.当集成多个基准测试,如BIG-bench时,这个问题变得更加明显46以及其他大型基准测试。即使这种集成可能提高了灵敏度(正如我们在整个ADeLe中看到的;扩展数据图。2)、如果使用总分,特异性会丧失。相反,利用我们的量表,我们可以比较来自不同基准的混合子集,这些项目的需求水平现在变得相对应,创建实例的重组以测试特定能力,并在使用基准之前,系统性地根据其配置文件质量选择或完全淘汰它们。通过LLM能力配置文件进行解释力关于解释力的研究问题将焦点转向人工智能系统:我们能否理解模型的能力及其在非饱和图中的演化?为了回答这个问题,我们挑选了15个LLM(扩展数据表1),并用ADeLe电池运行它们。正如将在方法部分“主体特征曲线”中详细解释的,我们采用主导切片程序:对于沿维度的每个需求水平l,我们仅汇总那些所有剩余维度需求不超过l的任务实例的结果。我们对这些点应用逻辑拟合,得到18条每维特征曲线,这些曲线反映了模型成功率随需求增加而下降的过程(见图)。例如,某些维度的曲线在不同模型间变异性较低且陡峭,如AS(注意力与扫描)和MCu(校准已知与未知)。他们很好地解释了低区间(1到2级要求成功)和高区间(需求5及以上失败)的成功。相比之下,其他维度的曲线则更为平坦,如社会科学知识(KNs),其成功与失败的区分力最低。值得注意的是,多个维度显示出特别明显的行为。MCr(识别相关信息)和MS(心智建模与社会认知)的特征曲线明确区分了推理模型(无论是否精炼)与非推理模型的表现。所有受试者特征曲线的独立图表可在补充信息第1.14节中找到。图3:18项需求和15项LLM的特征曲线。图3:18项需求和15项LLM的特征曲线。全尺寸图像横轴显示该维度的需求水平,纵轴表示各层级的平均性能(成功概率)。我们确保所有箱在拟合中权重与最大箱相同(除了实例数少于100的箱,它们使用按比例权重以保证鲁棒性)。该曲线是一个逻辑拟合,锚点为坐标(20, 0),占总权重的50%。因此曲线会延伸到5级以上,这也是我们用0到10的x轴显示的原因,即使当前版本的刻度只有5级。来源数据我们利用受试者特征曲线下的面积来估算能力,详见方法章节“受试者特征曲线”。注意,能力为4并不意味着模型能解决4级的全部或大部分题目;实际上这意味着它能在预期中正好4级时解决一半的问题。图4展示了15个LLM的能力分布,按家族排列。现在更明显的是,与知识相关的维度在大型模型中较高,而在小型和精简模型中则较低。推理模型(如OpenAI的o1和DeepSeek-R1-Distilled)在QL(定量推理和逻辑推理)上有明显改进,同时也提升了MCr(识别相关信息)和MS(思维建模与社会认知)(在提炼模型中甚至达到7B)。图4:15个大型语言模型的能力配置文件。图4:15个大型语言模型的能力配置文件。全尺寸图像能力为l意味着模型在需求水平l问题上成功的概率为50%(这也是为什么有些能力超过5)。与文献中通常展示的大型语言模型(LLM)径向图不同 47,48,这里显示的数值是实际能力的比率尺度(0,∞),且这些值(期望值)对所用基准难度分布的变化更具韧性。在补充信息第1.4节中,我们展示了模型能力随参数数量变化的明显缩放曲线。来源数据最后,基于参数数量的模型能力提升似乎对LLaMA家族中最大的两个LLM来说是边际的;这一点在补充信息第1.4节中得到进一步确认,我们介绍了LLM实际能力的首个缩放定律。根据需求水平使用开放比率尺度,这与传统的性能尺度规律相悖,后者容易接近100%的准确率饱和,且根据所选基准的需求水平分布波动较大。即使按基准测试、域名或某些标签切片,也要进行聚合46,47,48导致每个维度的值都不相称,难以解释,且难度分布波动。例如,所有逻辑推理基准测试的70%总准确率并不意味着能力高于所有元认知基准的50%总准确率,甚至不超过另一组逻辑推理基准测试的50%总准确率。回顾我们在图中看到的情况。1,适度需求的增加可能伴随着性能大幅下降(如OlymMATH的两个版本所示)。使差异相称是拥有同一规模需求和能力的优势之一。通过从多个维度审视标准化量表,我们可以解释文献中许多相互矛盾的说法,比如大型语言模型被认为具备“复杂推理能力”492022年,对于“无法进行非平凡推理”的LLMs主张50三年后,这似乎与过去几年思维链和推理模型的重大进展不符。这些关于推理的矛盾陈述在补充信息第1.12节中通过我们的量表进行了探讨和澄清。总体而言,通过我们的方法,我们可以全面且细致地研究模型的能力及其演变,特征曲线解释为何每个模型在不同区域成功或失败,具体取决于实例的需求特征。这一解释仅基于AI系统在观察中收集的信息:与IRT及其他潜在变量方法(因子分析或主成分分析)基于多个系统和实例的结果不同,我们用我们的方法论获得的某个LLM的能力和解释,不会受到结果或其他14个LLM选择的影响。通过评估者预测表现的预测力最后一个研究问题是,我们能否预测人工智能在未见的实例中表现,无论是在分布内还是外分布?如图所示,扩展数据的底排。1,大多数维度与成功呈负相关,表明总体而言,更高的需求往往会降低绩效。这对多变量应用时的预测能力非常有希望。为了精确量化这种预测能力,我们训练了三种实例级概率分类器,称为评估器:一种随机森林(RF),将19维需求注释向量直接映射为预测的成功概率;另一种RF模型依赖从每个问题原始文本中提取的预计算GloVe嵌入;以及一个基于题目文本端到端训练的LLaMA模型以预测成功。更多细节见方法部分“评估者与指标”。分布内结果(扩展数据表2)显示,尽管部分模型自身的准确度存在较大不平衡(从Babbage-002的0.102到OpenAI o1的0.843),基于需求的射频在接受者工作特征曲线下面积(AUROC)下测量中实现了高度的辨别(成功与失败之间),并以预期校准误差(ECE)量化为近乎完美校准。在辨别方面,我们看到GPT-4o取得了最佳结果(AUROC中0.882),是三位评估者中最可预测的大型语言模型,而小型模型则难以预测。在所有15个LLMs中平均,基于需求的RF得出的准确率加权平均AUROC约为0.84,与经过微调的LLaMA评估器性能相当,而其平均ECE(0.01)远低于其他方法(基于GloVe的模型为0.03,微调的LLaMA模型为0.04)。展示这些结果的校准图见补充信息第1.5节。这种强劲的分布内表现支持了该方法论的内部有效性。对于外部效度的分析,我们进一步评估了在非分布条件下的预测表现,即将整个任务(非分布任务)或整个基准(非分布基准)纳入训练(分别为扩展数据表3和4)。在分配外任务中,基于需求的评估者的预测力保持稳健(加权AUROC = 0.81,ECE = 0.02),仅略低于分配内评估者,且表现优于其他评估者,后者的表现显著下降(基于LLaMA的加权AUROC值为0.79,基于GloVe的评估者为0.74)。在更具挑战性的非分配基准中,基于需求评估器的表现略有下降(加权AUROC = 0.75,ECE = 0.04)。相比之下,另外两位评估者的预测能力下降幅度更大。这表明基于需求的预测变量相比其他预测变量更不容易出现虚假特征的过度拟合。在补充信息第1.9节中,我们还展示了基于需求评估器的预测能力优于两个基于领域和学习层级的分类法。虽然许多传统的IRT方法可以解释已见项目的性能,但它们无法用于预测新实例的性能(线性逻辑测试模型除外;详见补充信息第1.1节)。IRT要求相关项目被包含在用于提取参数的项目池中,而多维IRT则只提取该池中重要的难度维度。在我们的案例中,任何来自新基准或新样本批次的新实例都可以被自动注释以获得其需求向量,该向量与人口无关,我们可以从中预测性能。预测能力在部署环境中至关重要,因为目标是预测人工智能在未预见场景中表现优异,而不仅仅是在测试环境中评分受试者。AI评估实践中的自然基线就是平均准确率。这在一定程度上可以外推系统选择,但在实例预测中,这导致判别力完全没有(AUROC为0.5),校准也仅适用于分布内。而从LLM本身进行不确定性估计,则需要运行模型,或者在许多情况下使用白盒或灰盒访问,其结果并不优于外部评估器20,正如我们这里所用的。总体而言,基于需求评估者的预测能力优势显而易见。它们基于可解释的要求,而相比之下,两个更大且难以解释的基线。这令人非常鼓舞,为人工智能可靠部署的前景提供了光明的光明。讨论到目前为止,AI评估未能满足快速变化且日益多样化的AI生态系统的需求。理解和预测性能已成为许多通用人工智能系统的紧迫需求。通过构建和利用自动化评分标准对数千实例进行绝对需求标注,我们为人工智能评估树立了有前景的新方向。我们展示并展示的方法论全面、可扩展且标准化,解决了传统人工智能评估实践中的许多问题:解释力和预测能力不足,以及对基准和人工智能系统的特定群体的饱和过度拟合。随着通用人工智能的快速普及和渗透,研究人员、企业、第三方评估机构、政策制定者和监管机构迫切要求严谨、可扩展且可流水的评估。矛盾的是,强大的大型语言模型作为标注工具使这种新方法成为可能且具可扩展性。人类通过评估者间分析和德尔菲方法独立验证了LLM注释的解释价值,其预测能力体现在任务多样性上。然而,我们的工作并非没有局限。首先,DeLeAn v1.0 评分标准未能完全涵盖某些维度,如导航,且排除了人工智能中其他模态和范式的能力,如多模态系统和机器人技术,因为我们的分析仅限于大型语言模型。我们鼓励其他研究者将评分标准扩展到更多个维度(包括倾向、价值观及其他专门为安全或公平设计的元素,并用这些因素评估其他类型的人工智能系统)。其次,我们现有电池中高质量的5+级产品非常少。鉴于人工智能进展的速度,现有的尺度(最高可达5+)需要以一种向下兼容的方式扩展,以保持与现有尺度的兼容。第三,我们可以提升分布内外的预测能力,尤其是引入更多“更纯净”的基准测试,仅在少数需求下加载,并且随着大型语言模型作为注释器的改进。第四,我们使用LLM评判者对模型输出进行评分,与人工评分员相比效果非常出色。然而,未来一些更开放或代理性的任务可能需要更高级的自动评分。总体而言,这一新方法论展示了构建概念导向范式在人工智能评估中的成功发展8整合了不同学科的观点。一个简化的协作平台(https://kinds-of-intelligence-cfi.github.io/ADELE/)及其相关的评分标准目录将在未来几年不断发展,准备解释和预测人工智能系统的性能与安全性。在人工智能评估成为研究和法规核心,而评估科学尚未跟上通用人工智能步伐的当下,我们的工作迈出关键步骤,使人工智能评估更符合实际目的。 |
| [返回] |