欢迎访问一起赢论文辅导网
本站动态
联系我们
 
 
 
 
 
 
 
 
 
 
 
QQ:3949358033
微信:paperwinner
工作时间:9:00-24:00
博士论文
当前位置:首页 > 博士论文
可解释人工智能揭示了无监督学习模型中的巧妙汉斯效应
来源:一起赢论文网     日期:2026-07-13     浏览数:109     【 字体:

 可解释人工智能揭示了无监督学习模型中的巧妙汉斯效应无监督学习已成为人工智能系统的重要组成部分。例如,它在基础模型中产生的表示对各种后续应用至关重要。因此,仔细检查无监督模型非常重要,不仅要确保它们对可用数据做出准确预测,还要确保这些准确预测不源自巧妙汉斯效应(CH)。本文,利用专门开发的可解释人工智能技术并将其应用于流行的图像数据表征学习和异常检测模型,我们展示了CH效应在无监督学习中非常普遍。特别是通过医疗和工业检查数据的应用场景,我们证明了在合理数据集偏移或不同数据子组重新加权下,CH效应系统性地导致下游模型的性能显著下降。我们的实证发现还得到了理论见解的丰富,这些洞见指出无监督学习机中的归纳偏倚是CH效应的主要来源。总体而言,我们的工作揭示了无监督学习实际应用中未被探索的风险,并提出了系统性减轻无监督学习影响的方法,从而使无监督学习更加稳健。类似内容被他人观看基于机器学习的入侵检测系统,使用最小二乘支持向量机文章 开放获取 202548日可解释且整合的深度学习用于发现大脑与行为关联文章 开放获取 2025117日可解释人工智能的统一时间序列分类框架文章 开放获取 2026428日主要角色无监督学习是机器学习(ML)的一个子领域,近年来逐渐受到重视 1,2,3.它解决了监督学习的根本局限性,如数据中缺乏标签或获取标签的高昂成本。无监督学习在建模未知方面取得了成功,例如发现了新的癌症亚型 4,5或者从大型历史语料库中提取新颖见解6.此外,无监督学习不依赖任务特定标签,使其成为核心人工智能(AI)基础设施的良好候选对象:无监督异常检测为输入数据的各种质量或完整性检查提供了基础7,8,9,10.无监督学习也是“基础模型”背后的关键技术1,11,12,13,14,15,提取出可以构建各种下游模型(例如分类、回归、“生成式人工智能”等)的表示。无监督学习模型日益流行,迫切需要仔细审视它们如何得出预测。这对于确保这些模型处理和表示输入数据时的潜在缺陷不会传递到基于它们的众多下游监督模型中。本研究通过对流行的无监督机器学习图像数据模型进行多项调查,我们表明无监督学习模型在很大程度上存在Clever HansCH)效应16.具体来说,我们发现无监督学习模型常常产生可以正确预测实例相似或异常的表征,尽管这些表现在很大程度上由数据质量伪影支持。这种有缺陷的预测策略无法通过常见的评估基准测试(如交叉验证)检测到,但在“下游”应用中,可能会以意外错误的形式出现,例如部署后输入数据发生细微变化时(见图)。1)。虽然CH效应在监督学习中已被广泛研究16,17,18,19,20,21,22在无监督学习背景下缺乏类似研究,加上无监督模型提供了许多后续应用,这令人担忧。图1:无监督学习中的CH效应。图1:无监督学习中的CH效应。全尺寸图像无监督模型正确预测数据实例为相似或异常,但使用的功能在可用数据之外难以很好地泛化。CH效应通常在经典验证方案中未被检测,仅在部署后以预测错误的形式表现出来。问题之所以关键,是因为该缺陷可能被许多下游任务继承。我们的可解释人工智能方法允许在无监督模型中直接检测CH效应,并在某些情况下进行纠正。阳性;Pred,预测;阴性,阴性。X光图像重现自:左、中、参考。79采用知识共享许可CC 1.0;对,裁判。90采用知识共享许可 CC BY-3.0。例如,基于图像的工业检测通常依赖于无监督异常检测9,10 我们发现,CH决策策略可能系统性地漏掉各种制造缺陷,导致潜在的高成本。另一个例子是,医学领域倡导的无监督基础图像数据模型,旨在为各种专业诊断任务提供稳健特征,但这些模型可能在许多任务中引入CH效应,且存在大规模误诊的风险。这些情景(如图所示)1)强调无监督CH效应的实际意义,与其监督CH不同,它可能不仅限于单一特定任务的故障,而是可能影响所有后续任务。为了揭示和理解无监督CH效应,我们建议使用可解释人工智能23,24,25,26,27(这里介绍了基于层级相关传播(LRP)解释框架的技术28,29,30).我们拟议的这些技术使我们能够大规模识别无监督机器学习模型使用(或误用)哪些输入特征,而无需制定具体的下游任务。我们使用LRP的一个扩展,称为BiLRP31揭示共同导致表示空间相似性的输入模式。我们还将LRP与“虚拟图层”结合 32,33揭示共同导致预测异常的像素和频率成分。此外,我们基于AI的可解释分析使我们能够精准定位无监督CH效应出现的更正式原因。尤其是,这些问题主要归因于数据本身,而在于无监督学习机,这阻碍了真正支持任务的特征与模型的整合,尽管数据点数量庞大。我们的发现为制定针对性策略以减轻CH效应和提升模型稳健性提供了新方向。总体而言,我们的研究揭示了无监督学习中CH效应的存在、突出性和独特性,呼吁对这一现代人工智能系统重要组成部分进行更多关注。选举结果CH效应可以定义为模型依赖于某些特定环境中具有预测性的特征(因为它们与真实信号之间存在虚假相关性),但在新数据中未能保持这种预测性,导致性能显著下降。(另见补充说明D,了解正式的特征描述及与相关概念如捷径学习的区别17或人类-人工智能对齐 34,35.)通过对两类代表性无监督模型——表征学习和异常检测的实验,并以可解释人工智能为主要分析工具,我们展示了无监督学习模型中CH效应的广泛存在、其不良后果及可能的缓解策略。CH效应在表征学习中我们首先在利用近期医学基金会模型解决COVID-19检测任务的背景下,探讨CH效应。模拟以数据稀缺为特征的早期疫情阶段,我们进行了聚合,类似于参考文献。19一个大型且成熟的非COVID-19数据集,以及一个较新且较小的COVID-19数据集。具体来说,我们汇总了2597个美国国立卫生研究院(NIHCXR8数据集实例361992年至2015年间收集,包含了535GitHub托管的“COVID-19图像数据收集”实例37,包含来自多个来源的新冠病毒实例。我们分别称它们为“NIH”和“GitHub”子集。进一步出于适应极少COVID-19病例数的需求和避免过拟合,我们选择依赖无监督基础模型提供的表示15,38,39,40.具体来说,我们会将数据输入预训练的PubMedCLIP模型39该模型通过大量X射线扫描以无监督方式构建了其表示。在PubMedCLIP模型之上,我们还训练了一个下游分类器,将COVID-19和非COVID-19病例区分开来。该测试集的类别平衡准确率为87.5%(见表1)。然而,仔细观察该性能评分结构会发现,NIHGitHub子组之间存在明显差异,所有NIH实例均被正确分类,GitHub实例的类别平衡准确率较低,仅为81.7%,更显著的是,如表1所示,误报率(FPR)仅为51%。考虑到GitHub数据集中实例的更高异质性更符合现实环境,这种更高的误差估计更为现实。特别是,51%的高FPR使模型在住院环境中无法实际应用,因为该模型的预测应可靠且低风险地帮助选择合适的医疗治疗。我们强调,如果不密切关注(或了解)数据源,而仅依赖整体准确率评分,这一模型缺陷本可以轻易被忽视。表1 无监督模型在不同数据子组下进行的各种下游任务表现全尺寸表格为了主动检测这种异构且不稳健的预测行为,我们建议使用可解释人工智能。具体来说,为了测试缺陷是否源自无监督的PubMedCLIP组件,我们采用了BiLRP解释技术31.BiLRP直接基于表示空间的相似性工作,无需制定具体的下游任务。图中有说明。2及其数学表述见《方法》。图中展示了两对典型COVID-19阳性病例的BiLRP输出。3(左)。它显示,建模的相似性来自于两张图像中出现的类似文本的注释。这使得我们能够将性能的异质性归因于CH效应,从而突出后续应用的广泛风险(详见补充说明A以获得进一步分析)。我们注意到,与上述逐组准确性分析不同,基于BiLRP的可解释AI分析不需要来源元数据(GitHubNIH),也未聚焦于特定下游任务及其标签。图2BiLRP方法用于解释表示学习模型相似性预测的示意图。图2BiLRP方法用于解释表示学习模型相似性预测的示意图。全尺寸图像BiLRP的输出是将预测相似度分解到两个输入图像中特征对的过程。它通常以加权二分图的形式显示,连接贡献特征对。图3:对PubMedCLIP无监督模型及通用CLIPSimCLRBarlow Twins无监督模型预测的可解释人工智能分析。图3:对PubMedCLIP无监督模型及通用CLIPSimCLRBarlow Twins无监督模型预测的可解释人工智能分析。全尺寸图像我们展示了来自GitHub子集的X光图像对,以及来自垃圾车(gtruck)和coho类别的类似ImageNet图像的成对自然图像。解释通过BiLRP生成。它们强调了无监督模型所采用的意想不到的策略:例如,对于X射线数据,实例间的相似性源于共享的虚假文本注释。对于ImageNet数据,相似性源于logo伪影或背景中有人声的存在。X光图像摘自参考文献。90采用知识共享许可 CC BY-3.0。图片来源:truck(左),Pixnio,采用知识共享CC CC 1.0许可;truck(右),Pexels 采用知识共享许可 CC 1.0;鱼(左),iStock.com/christiannafzger;鱼(右),iStock.com/BrandyTaylor。为了测试表征学习是否普遍倾向于将 CH 策略演进到上述用例之外,我们下载了三个通用基础模型,即原始的 CLIP 模型13SimCLR 12,41以及巴洛双胞胎42.CLIP由图像编码器和文本编码器组成,通过最小化对比度损失,将图像与其在表示空间中的相关文本对齐。SimCLRBarlow Twins通过随机调整大小裁剪和色彩增强生成输入图像的增强视图,最大化这两个视图在表示空间中的相似度。作为下游任务,我们考虑利用线性软极大分类器对ImageNet中的8个类别进行分类43共享 WordNet ID 'truck' ImageNet 类,以及共享 WordNet ID 'fish' 16 ImageNet 类中的一员(详情见方法部分)。这两个任务中每个模型的测试准确性见表1(列“原始”)。在卡车分类任务中,CLIP模型表现最佳,准确率为84.7%。在鱼类分类任务中,CLIP和监督模型表现最佳,准确率分别为85.4%85.9%。我们使用BiLRP来分析这些无监督模型的表示。见图。3(中间),我们观察到基于CLIP的相似性,如PubMedCLIP,也依赖文本。这里,两张垃圾车图片左下角的文字标志被用来支持相似性,暗示了CH效应(参见参考文献)。20在监督学习中也有类似发现)。SimCLRBarlow Twins忽略文本,反而依赖实际的垃圾车。在鱼类分类任务中(图)3,右侧),我们观察到所有无监督模型都会在鱼类特征上放大人类,这再次表明了CH效应。为了确定标志的CH性质以及BiLRP识别的人类检测策略,我们开始在特定数据子组上测试模型,这些子组在运营条件下可能更为常见。结果见表1。我们观察到从原始数据迁移到部分数据子集时,性能系统性下降。例如,当我们在每张卡车图片上插入一个标志来打破标志与卡车类别之间的虚假相关时,CLIP模型的准确率从84.7%下降到80.3%(表1中的“logo”栏)。在观察单个类别(如拖车车)时,性能下降更为明显,拖车通常难以与垃圾车区分开来(补充说明B)。对于鱼类案例,SimCLRBarlow双胞胎在仅保留含人类图像并进行类别重新平衡时,准确率从81.4%83.2%下降到74.8%75.8%。就CLIP而言,其对鱼类的缺乏关注令人惊讶的是,表现却没有类似下降,这也让CLIP能够在这些数据上做好概括的具体策略留下了疑问。补充说明B中提供了每个模型和分类任务预测误差结构的详细分析,并辅以混淆矩阵支持。为了更好地评估无监督学习中CH效应的风险,有必要反思促成其发生的更抽象因素。BiLRP揭示的在类似大型数据集上训练模型的策略异质性表明,无监督学习机比数据本身更在塑造数据表示策略中起着关键作用。以SimCLRBarlow双胞胎为例,图像中心人类的系统性放大可归因于其随机裁切匹配目标,即图像中心的特征携带最多的随机裁剪间相互信息(关于这些模型中放大/抑制效应的进一步研究,请参阅参考文献)。44,45,46,47).在考虑CLIPPubMedCLIP模型时,文本标志、人脸或其他识别特征的系统放大可归因于其图像-文本匹配目标,该目标倾向于放大携带互信息的两种模态中的任何特征。总之,尽管如CLIPSimCLRBarlow Twins中定义的匹配任务直观上旨在为表示引入有用的先验知识和不变性,但在某些数据子集上,它们可能导致不同特征表达的强烈不平衡。这些不平衡容易引起CH效应,进而导致后续任务的准确性下降。异常检测中的CH效应我们将CH效应的研究扩展到无监督学习的另一个领域——异常检测,我们基于流行的MVTec-AD数据集,考虑了一个工业检查的用例9.该数据集包含15个产品类别,每个类别包括一组无制造缺陷的训练图像和一组有缺陷和无缺陷的测试图像。由于制造缺陷罕见且具有异质性,通常通过无监督异常检测来解决该问题 2,9.这些模型将每个实例映射到异常评分,基于阈值的下游模型可用于分类有无制造缺陷的实例。无监督异常检测已受到广泛关注,基于深度神经网络的复杂方法如PatchCore48EfficientAD49在检测各种工业缺陷方面表现出优异性能。有些令人惊讶的是,基于像素空间距离的简单方法在特定任务中表现出竞争力2.我们考虑其中一种方法,称为“D2Neighbors”,其异常根据训练数据中邻居的距离进行预测。具体来说,新实例x的异常分数计算为fx= softminj{x − uj2} 其中 \{{{\bf{u}}}}_{j}}_{i = 1}^{N}\) 是可用的内列实例集合(详见方法部分,了解模型和数据预处理的细节)。该异常模型属于更广泛的基于距离的模型类别50,51,52,并且可以与核密度估计建立联系 53,54以及一类支持向量机55.利用D2Neighbors,我们能够构建下游模型,将MVTec数据中F1分数高于0.9的五个类别(瓶子、胶囊、药丸、牙刷和木材)的工业缺陷进行分类。为了揭示这些意外高F1分数的预测策略,我们采用了可解释人工智能。具体来说,我们考虑将LRP扩展用于异常检测 30,56并进一步赋予解释技术“虚拟层”功能 32,33.“虚拟图层”技术(见图)4)是将输入映射到一个抽象域再映射回来,保持预测函数不变,但提供一个新的表示,可以用来解释预测。我们通过应用离散余弦变换(DCT)构造这样的层57,见图。4(右下角),后面跟着它的逆。这使得我们能够用像素和频率来共同解释预测。图4D2Neighbors异常预测的可解释AI分析。图4D2Neighbors异常预测的可解释AI分析。全尺寸图像a, 合成成像MVTec-AD(类木材)的图像,以及按像素进行的LRP解释异常预测。其他MVTec-AD类别的解释见补充说明Cb、频域解释。x轴表示频率(功率尺度上),y轴是对异常预测的相应频率贡献。c,按频带过滤的像素级贡献。d, 用于解释联合像素-频域异常的虚拟检测层示意图。e,像素级贡献通过阻挡虚拟层内的频率贡献进行过滤。fDCT的基元素,我们用它将像素映射到频率,再映射回频率。我们提出的分析结果如图所示。4个用于两个木质实例(参见补充说明C,涉及不同类别的实例)。像素层面的解释表明,D2Neighbors主要基于包含实际工业缺陷的像素来支持其异常预测。其距离函数的平方差(\\parallel \varDelta {\parallel }^{2}={\sum }_{i}{\varDelta }_{i}^{2}\))促使模型实现像素响应稀疏,高效地剔除新实例与训练数据中无差异的图像区域。然而,我们也在像素层次的解释中看到,异常预测中不可忽视的一部分来自无关背景像素。联合像素频率解释揭示了这些未解决的贡献,表明它们主要源自模型决策策略中的高频部分(见图)。4bc)。D2Neighbors模型在LRP分析中发现的这些无关高频特征的高暴露,令人怀疑我们再次处于CH效应的存在中。我们通过将图像调整算法从OpenCV的最近邻调整尺寸改为更复杂的调整方法,模拟了部署后数据预处理的无害扰动,该方法包含抗锯齿,该程序通过削减高频以消除调整尺寸伪影。实际上,这种变化可能由软件更新引起。在某些情况下,调整尺寸技术已被证明会显著影响图像质量和图像生成指标58但它们对一般机器学习模型,尤其是无监督模型的影响,研究较少。D2Neighbors模型在调整尺寸算法前后的性能见表2(分别为“原始”列和“部署”列)。D2NeighborsF1成绩表现下降了近10个百分点。这种性能下降,加上D2NeighborsLRP揭示的高频依赖,暴露了模型的CH特性:当抗锯齿引入调整过程时,D2Neighbors模型用来支持预测的高频会从数据中消失,显著降低每个实例的异常分数,导致性能下降。D2Neighbors 在部署后性能下降尤其令人惊讶,因为数据质量实际上有所提升。更仔细观察性能下降的结构,我们发现假阴性率(FNR)从4%急剧上升到23%(见表2),这可以用部署后缺乏导致异常的高频来解释。在工业检查环境中,FNR的增加可能带来严重后果,尤其是许多缺陷实例可能被遗漏并沿生产链传播。这可能导致后续生产阶段资源浪费和高召回成本。

[返回]

下一篇:基于图数据库的策略智能问答系统