欢迎访问一起赢论文辅导网
本站动态
联系我们
 
 
 
 
 
 
 
 
 
 
 
QQ:3949358033
微信:paperwinner
工作时间:9:00-24:00
SCI期刊论文
当前位置:首页 > SCI期刊论文
Strater的可解释时间序列预测,采用无采样SHAP
来源:一起赢论文网     日期:2026-07-13     浏览数:145     【 字体:

 Strater 的可解释时间序列预测,采用无采样 SHAP时间序列预测对于跨领域的规划和决策至关重要,模型可解释性对于促进用户信任和满足透明度要求至关重要。我们介绍了SHAPformer,这是一种基于Transformer架构和Shapley加法解释(SHAP)的准确、快速且可解释的时间序列预测模型。SHAPformer 利用注意力操控利用特征子集进行预测,从而消除了既有 SHAP 算法中从背景数据中抽样的需求。因此,它能在不到一秒内生成精确解释,相比 PermutationSHAP,实现了 501000 ×的加速。对于已知的真实解释的合成数据,SHAPformer生成的解释与数据为一致。当应用于电力负荷数据和电价数据时,它在具备竞争力的预测表现的同时,提供了有意义的本地和全球洞察,包括确定过去目标作为关键预测因素,以及检测圣诞节期间不同的负荷预测行为。类似内容被他人观看可解释人工智能的统一时间序列分类框架文章 开放获取 2026428日利用傅里变压器架构考虑环境和运营限制的物流能耗预测文章 开放获取 2026110日用于高效传输线故障检测与分类的混合CNN决策树框架:基于XAI的方法文章 开放获取 2026410日简介时间序列预测在物流、零售、金融、医疗保健、商业服务、交通管理和能源等多个领域都发挥着关键作用1.在能源领域,由于向可再生能源的持续转型,预测变得越来越重要2这对于减轻人为气候变化的严重影响至关重要3.可再生能源发电本身具有固有的变异性,因此准确预测电力负荷和发电对于维持供需之间的实时平衡至关重要4.此外,预报能够及早发现关键电网状况,并通过需求端响应和重调度措施帮助防止设备过载5.在各个领域,现代预测模型越来越依赖复杂的深度学习模型 6,7,包括针对特定用例定制的变压器模型 8,9以及基于变换器的时间序列基础模型10.这些模型涉及大量参数,使其内部过程对人类用户来说是不透明的。机器学习和深度学习模型的这种黑箱特性推动了可解释人工智能(XAI)方法的发展,旨在提升对这些模型工作原理的理解11.这种模型可解释性有几个重要价值。首先,它能提升用户信任,促进深度学习在现实应用中的应用12.其次,解释帮助用户评估预测的可靠性并指导决策13.第三,它们协助开发者调试和完善模型——例如,通过揭示虚假模式或“巧妙汉斯”效应14.最后,XAI支持遵守要求AI系统透明度的法规。例如,欧盟的《人工智能法案》要求涉及人类或关键基础设施(如能源系统)的应用保持透明15.虽然不总是必须符合监管标准,但XAI可以支持人工监督并提升透明度13,并可能为未来人工智能系统透明度的监管标准提供支持。Shapley 加法解释(SHAP16是基于合作博弈论中夏普利值的XAI框架17.SHAP之所以流行,是因为它能够计算特征重要性和特征贡献,同时满足效率性质,即特征贡献与模型预测的和。相比之下,其他事后XAI方法,包括LIME也存在18Grad-CAM19以及分层相关传播(LRP20,21要么突出显示重要输入而不表明其对预测的影响,要么不满足效率性质。SHAP是能源领域最广泛使用的XAI框架22并被应用于解释各种模型的预测23,包括多层感知器24,基于树的方法25,26,27,28,长短期记忆(LSTM)网络29,30,31以及Informer模型32.SHAP的核心思想是计算特征在所有特征子集(也称为“联盟”)中的平均边际贡献。由于大多数模型原生不支持缺失特征的输入,已有多种算法被提出用于估计SHAP值,包括三种针对时间序列模型的方法33,34,35:KernelSHAP16通过拟合加权局部线性模型来估算SHAP值,这些模型是从扰动样本中抽样的缺失特征,从背景数据中抽样。置换SHAP16通过反复置换特征并计算边际特征贡献,从背景数据中抽样缺失特征来估计SHAP值。树架36设计用于基于树的模型,并利用树结构高效计算SHAP值。DeepSHAP16通过应用DeepLIFT估计神经网络的SHAP37贡献规则对一组背景样本反复适用。梯度SHAP是一种基于期望梯度的可微模型方法38.它通过对实例与随机抽样背景样本之间随机点的梯度平均来估算SHAP值。时间短33设计用于时间序列数据,并通过使用 KernelSHAP 估计选定时间步和特征的 SHAP 值,缺失值被基线替代。WindowSHAP34以及ShapTime35是用于时间序列的SHAP算法,通过时间窗口而非单个时间步估计SHAP值,从而减少模型评估次数。大多数SHAP算法采用两种策略来评估特征子集上的模型39:(1) 从边缘或条件分布中抽样缺失特征,或 (2) 用预定义的基线值替换缺失特征。这两种方法都有局限性。抽样计算量大,可能产生不现实的输入,这些输入位于数据分布之外,导致流形外的评估40.基线替代需要仔细选择基线,并且只能基于该基线得到解释。除了像SHAP这样的模型无关解释方法外,还有专门为Transformer模型设计的XAI方法。此类方法通常依赖注意力权重作为特征重要性的代理 41,42.然而,这一做法仍存在争议,因为注意力机制的可解释性存在争议43,44,45.时间融合变换器(TFT46是一个专门计算特征重要性值的专用变换器模型,并设有专门的特征选择层。它已被应用于分析风能预报中的相关特征47以及频率预报48但与SHAP不同的是,它不提供特征对预测的影响信息。注意力操控49限制变换器对单个特征的访问,并评估对模型预测的影响,但不满足效率公理。尽管变压器架构在时间序列预测方面的应用日益增加,但解释其预测仍然具有挑战性。虽然SHAP在能量领域被广泛用于模型可解释性,但现有的SHAP算法计算量大,且依赖采样或基线替换,可能导致不现实的输入。因此,目前尚无高效的方法来计算基于SHAP的时间序列变换器的特征贡献23.这一局限促使开发能够为此类模型提供忠实SHAP解释的方法,而无需依赖抽样或预定义基线。为了满足对准确且可解释方法的需求,我们提出了SHAPformer,一种基于Transformer的时间序列预测模型,能够高效计算精确的SHAP值。该方法的概述见图。1. SHAPformer将过去的目标分组为每日窗口,每个外生变量使用一个窗口,相比单独处理每个特征,减少了联盟数量。它利用注意力操控49用于对蒙蔽输入进行训练和推断,从而使模型能够在特征群子集上进行评估,而无需采样或被基线值替换。我们的贡献如下:图1:拟议方法概述。图1:拟议方法概述。全尺寸图像输入由过去目标时间序列和协变量时间序列组成。输入被划分为特征组,颜色表示。SHAPformer 基于掩蔽输入进行预测。SHAP值由边际贡献推导,定义为有特征组与不包含特征组预测值的差值。多个局部解释被组合成全局特征重要性值和特征依赖图。1.我们介绍SHAPformer,一种时间序列预测模型,结合了Transformers强大的预测性能和SHAP的可解释性。2.我们在一个具有已知真实解释的合成数据集上验证了SHAPformer的解释,展示了其准确捕捉底层模式的能力。3.我们将SHAPformer应用于输电系统运营商(TSO)的电荷数据以及市场竞标区的每日电价数据,显示SHAPformer能在不到一秒钟内生成解释,并提供有意义的本地和全球洞察。选举结果我们在实验中使用了三个数据集——一个合成数据集,包含已知的真实解释用于验证SHAPformer解释,以及两个实证数据集以展示其在现实应用中的适用性:合成数据集:该数据集显示每日、每周和年度的季节性,依赖外生协变量(节假日和乘数),对此有真实的解释。数据生成过程的详细信息已在合成数据集中提供。数据集包含10万个训练样本和各1万个用于验证和测试的样本。负载数据集:该数据集包含德国TSO传输电负荷测量数据,涵盖2015年至201950,以及来自哥白尼ERA5再分析模型的天气数据(室外温度和降水)51.2019年上半年用于验证,下半年用于测试。负载数据标准化为均值和单位方差均为零。价格数据集:该数据集包含来自ENTSO-E透明度平台的DE/LU竞标区的当天电价52以小时分辨率显示202010月至202512月的数据,并结合哥白尼ERA5重新分析模型的天气数据(风速和太阳辐照度)51.2024年用于验证,2025年用于测试。价格数据标准化为均值和单位方差均为零。选择数据集的时间分割是为了避免数据泄露,并模拟真实环境,即模型基于历史数据训练,并基于未见的未来观测进行评估。SHAPformer与标准变换器模型进行了比较,后者由三种SHAP算法——KernelSHAPPermutationSHAPWindowSHAP——以及最先进的预测模型(详见方法部分)进行对比。所有模型均使用一周的上下文数据,并预测后续的168小时数值。所有模型的预测准确性、训练时间和推断时间汇总于表1。对于实证数据集,结果通过五次不同的随机初始化平均。补充结果中报告了各跑次的额外指标和标准差。表1 预测模型比较全尺寸表格快速计算精确的SHAP值,同时保持预报质量我们将SHAPformer的预测性能及其解释与多种基线预测和XAI方法进行了比较。在预测性能评估中,我们使用标准变压器53(因为SHAPformer基于Transformer架构),一个持久基线、线性回归和极端梯度增强(XGBoost54.在解释比较中,我们使用TFT和变换器,这些变换器由三种SHAP算法解释:(1KernelSHAP,通过基于扰动输入的预测拟合线性模型来估算SHAP;2) 置换SHAP,在假设特征独立性的情况下,利用背景数据扰动输入,并根据模型输出估计SHAP;以及(3WindowSHAP的一个变体,将过去的目标分为七个窗口(每个窗口对应前七天),并每个外生变量额外使用一个窗口,计算每个窗口的SHAP值,而非每个特征,通过联合抽样同一窗口内的所有特征。不同XAI方法解释单一预报的运行时间见表2(基于搭载AMD EPYC 7402P处理器、128GB内存和NVIDIA 3090 RTX GPU配备24GB显存的机器)。SHAPformer 在合成数据集上生成解释的速度比 PermutationSHAP 50 ×以上,在电价和负载数据集上则快 8001000 ×,每个解释的运行时间不到一秒。值得注意的是,尽管基于所有特征组联盟计算精确的SHAP值,SHAPformer仍实现了这一加速,而置换SHAP仅用十个特征置换近似SHAP值。SHAPformer 的加速部分来自特征分组,WindowSHAP 采用相同策略实现了 134143 ×加速。此外,SHAPformer利用注意力操作排除缺失特征群,消除抽样和重复模型评估的需求,使所有联盟的计算可行性增强,同时加快速度。然而,SHAPformer的推理速度优势是以训练时间增加为代价,训练时间比TFT或标准变压器长2倍到13倍。由于模型更大(超参数详见补充结果),合成数据集中变换器和SHAPformer的推断时间均高于经验数据集,且合成数据集包含一个额外的协变量。SHAPformer在负载和价格数据集上速度快于WindowSHAP13个特征,但在合成数据集中14个特征,由于SHAPformer中评估联盟数量呈指数增长,速度较慢。表2 XAI方法比较全尺寸表格TFT是最快的解释方法,因为它通过单一模型评估产生解释。然而,它不能直接与基于SHAP的方法比较,因为它仅提供特征重要性值,并未说明单个特征如何影响预测,因此信息量不如基于SHAP的方法。SHAPformer的预报准确性与表1中报告的其他模型相当甚至更好。所有评估模型的表现均优于持续基线,后者仅预测一周前的值。变压器在合成和负载数据集中实现了最低的预报误差,SHAPformer紧随其后,预测误差仅高出约1%。在价格数据集中,SHAPformer是最准确的模型,分别比TFTTransformer高出4.4%7.9%。在实证数据集中,SHAPformer 的表现优于线性回归、XGBoost TFTTFT在负载数据集上的较高预测误差源于(a)实验重复间的差异更大(尽管SHAPformerTransformer在所有运行中均优于TFT),以及(b)圣诞节前的较大预报误差,TFT的因果关注机制阻止模型在预测预报视界前几天时使用后期假日特征。成功验证SHAPformer对合成数据的解释在证明了SHAPformer的预测准确性和快速推断后,我们利用一个已知的真实解释的合成数据集验证了其解释。综合时间序列包含日、周和年度季节性,并依赖协变量。通过将SHAP应用于数据生成过程,可以获得实地真实的解释。数据集详情及真实生成数据见合成数据集。SHAPformer的全局特征重要性接近真实情况,只是它低估了月份特征的重要性(见图。2相比之下,PermutationSHAP WindowSHAP 在关键特征上偏离了真实数据,如过去目标(“负载”)、小时和星期几。TFT更难解释,因为它为过去和未来特征产生独立的特征重要性值集合。然而,可以观察到这两个集合都不像真实的地面,线性组合也不是。值得注意的是,SHAPformerPermutationSHAP都能有效滤除无关特征,如两个噪声协变量,而其他方法则赋予它们大于零的重要性值,尽管目标变量与噪声协变量无关。我们计算特征重要性误差,定义为图中所示特征重要性值的平均绝对误差。2A,关于地面真实值,并在表2中报告。我们发现SHAPformer与地面真实特征的重要性非常接近,仅偏差1.64个百分点,而第二好的WindowSHAP的特征重要性误差则是其三倍以上。由于合成数据集中所有样本均有真实解释,也可用于评估SHAP方法的局部解释。表2报告了局部解释误差,定义为局部解释在所有样本、预报视界和特征组间平均的绝对误差。同样,我们发现SHAPformer最能匹配地面真实性,导致局部解释误差比其他SHAP算法低三到四倍。图2:合成测试数据的全局解释。图2:合成测试数据的全局解释。全尺寸图像SHAPformer能够很好地近似地面真实特征的重要性(TFT:时间融合变换器)。BC 依赖于六个最重要的特征。 点颜色表示一个相互作用的变量。对于离散变量,为了提高可见性,在x方向加入了噪声。接下来,我们比较SHAPformer的习得特征依赖关系(见图)。2B)与地面真相(图)。2C)。正的SHAP值表示某特征相对于平均值的预测值增加,而负的SHAP值表示模型的预测值下降。点颜色表示一个相互作用变量。总体来说,SHAPformer的特征依赖关系与实际情况高度一致,只是它低估了月份的重要性。在图(a)面板中。2BC,上周的负荷对预测有线性影响。过去的负载会导致夜间(亮点)的SHAP值高于白天(暗点),因为预期夜间负载较低。在面板(b)中,对小时的依赖形成半正弦波,这正是数据生成时使用的每日模式。这与乘数相互作用:负乘数(深蓝色点)会减弱该小时的效果,而正乘数(浅绿色到黄色)则会增强其效果。面板(c)反映了用于建模周末(第五天和第六天)数据生成时使用的乘法缩小效应,SHAP值比工作日更接近零——晚上为负,白天为正。面板(d)显示,节假日通过增加负向负值过去负载而减少正负负荷来缩减预测负荷,而非假日则表现出相反但较轻微的效果。在面板(e)中,月份特征在地面真实中具有正弦效应,SHAPformer部分捕捉了这一效果,但幅度有所降低。最后,面板(f)显示了乘数特征的X形模式:乘数越高,前负负载越大,负负载越低,而乘数越低,效果相反。总体来看,SHAPformer的特征重要性和特征依赖关系与地面真实值的一致性表明模型捕捉了数据中的底层依赖关系。除了全局解释外,SHAPformer的局部解释也与补充结果中所示的基础真实性相符。使用置换SHAPWindowSHAP创建的依赖图及局部解释在补充结果中展示,供比较使用。关于电力负荷和电价预测的洞察基于合成数据验证SHAPformer,我们分析了其对过去十二个月负载和价格数据集的全局解释,这些数据集被排除在模型训练之外。在这些情况下,没有实地的真实信息,因此我们利用领域知识来评估解释的质量。在图中分析的电负载数据集上。3SHAPformer将过去的负载确定为最重要的预测变量,其次是星期几和一天中的小时。月份、温度和节假日等特征贡献较小,且重要程度相近,而降水量几乎无关紧要。PermutationSHAP WindowSHAP 的解释彼此相似,但与 SHAPformer 的解释不同,强调小时和星期几,并且对过去负载的重视远低于 SHAPformer。对于TFT,解释并不简单,因为它输出了两组不同的特征重要性——一组用于过去输入,一组用于未来协变量——两者之间的关系不明确。在TFT中,最重要的过去特征是负载,而小时、温度和星期几则是最重要的未来特征。图3TransnetBW对电力负载数据的全局说明。图3TransnetBW对电力负载数据的全局说明。全尺寸图像A 特征重要性评分来自SHAPformer,一个用不同SHAP算法解释的变换器模型,以及时间融合变换器(TFT)。B 依赖图取自SHAPformer,特征值位于横轴,对应的SHAP值位于纵轴。点颜色表示一个相互作用的变量。对于离散变量,为了提高可见性,在x方向加入了噪声。图3B显示了SHAPformer学习到的特征依赖关系。SHAP值以标准化电荷表示,其中1.0对应一个标准差(~ 1550 MW)。在面板(a)中,观察到上周载荷与预测载荷之间的线性关系。值得注意的是,某一负载值的SHAP值在夜间较高(亮点)——很可能是因为白天被视为低负载的负载在夜间可能异常高。面板(b)显示了典型的每日负载模式,夜间负荷较低,中午和傍晚有两个峰值。周日(黄点)时,SHAP值通常接近零。面板(c)显示预测负荷在周六和周日较低,尤其是在白天(暗点)。节假日(如面板(d)所示)持续减少预测负荷,尽管夜间效果较弱(亮点)。在面板(e)中,月份特征反映了季节性模式,冬季负载较高,除十二月外,可能是圣诞节期间工业活动减少所致。最后,面板(f)显示温度会影响寒冷日子的预测负荷,白天气温低于15度时,压力上升尤为明显°夜间气温低于0度°C.4展示了12月两次预报的本地SHAPformer解释。在这两种情况下,白昼小时特征都会降低夜间的预测值,并显示两个每日峰值——与依赖图中观察到的模式相呼应。星期几功能如预期般减少了周末的预测。有趣的是,在左侧的例子中,尽管月份功能位于十二月,但仍然具有积极效果——很可能是因为前一周落在十一月,而十一月在编码器输入的月份特征中有所体现。相比之下,右侧的例子位于12月晚些时候,显示出强烈的负月份效应。假期功能在工作日有积极影响,表明模型将12月与整体负载较低联系起来,原因是假期季节延长,除非在无节假日的周。左侧例子中,早期预报日的低温会增加预测值,而最后两天的较暖气温则降低预测值。在右手例子中,温度更稳定,并且对预测有持续的正影响。过去负载的影响在两个例子中也有所不同:左侧例子中,过去负载增加了工作日的预测值,而右边例子则将预测从第3天降到第7天——尤其受最后两天输入日影响,平均负载低于前几天。图4TransnetBW真实负载数据示例的局部解释。图4TransnetBW真实负载数据示例的局部解释。全尺寸图像答:电力负载数据集中两个示例的输入数据和目标数据。左侧的预报视界起点为20191211300,右侧为201912172200B SHAPformer对应的解释。总体而言,观察到的依赖模式与领域知识高度吻合,增强了对SHAPformer预测的信心。12月的模式——较低负载被视为默认,非节假日为例外——看似出乎意料,但可以用该期间的延长假期来合理解释。价格数据的特征重要性和特征依赖性图(见图)。5)再次与我们的领域理解保持一致55.除了过去的价格和时间信号外,风速作为一个重要特征被使用,且其大致呈线性负依赖关系。电价通常假设与剩余负荷(即负荷减去必须运行容量)呈线性增长。由于风能和太阳能通过我们的模型进入辐照度特性,通常被视为必运行发电,它们会降低成本,正如我们在模型中看到的那样。整点功能类似于早晚价格高峰,而星期几和节假日功能主要在非工作日降价。月度特征没有明显的规律;推测,该模型反映了训练数据中特定时期的高价格。图5:全球电价数据解释。图5:全球电价数据解释。全尺寸图像A 特征重要性评分来自SHAPformer,一个用不同SHAP算法解释的变换器模型,以及时间融合变换器(TFT)。 B 依赖图取自SHAPformer,特征值位于横轴,对应的SHAP值位于纵轴。点颜色表示一个相互作用的变量。对于离散变量,为了提高可见性,在x方向加入了噪声。讨论我们引入了SHAPformer,这是一种准确高效的可解释时间序列预测方法。SHAPformer 为基于变换器(Transformer)的模型生成 SHAP 解释的速度比已建立的 PermutationSHAP 快几个数量级。这一显著加速源于两个关键机制:将输入特征分组以减少联盟数量,以及调整注意力权重以估计边际贡献而不进行抽样。这两种机制都有助于缩短运行时间。WindowSHAP 应用功能分组但不进行注意力操作,速度快于 PermutationSHAP。然而,只有SHAPformer能实现每个解释推断时间低于1秒。SHAPformer已在合成数据上成功验证,能够在特征重要性、依赖模式和特征交互方面精确再现真实情况。它能正确识别无关的噪声特征为无信息性,并捕捉关键关系,包括日常模式、节假日和周末的乘法效应以及温度相互作用。唯一的例外是月份特征,SHAPformer似乎低估了其重要性,可能是因为它在数据生成过程中的影响较小,且与目标时间序列中的噪声相当(参见合成数据集)。SHAPformer结合了变换器的预测优势与高效的校准SHAP解释计算方法。然而,针对掩蔽输入进行训练以实现精确归因,可能会略微降低预测准确性,相较于标准变压器。在我们的实验中,这导致两个数据集的RMSE略有增加,而SHAPformer在电价数据集上的表现更好。鉴于在可解释性和效率上的显著提升,我们认为这些差异是可以接受的:SHAPformer产生的解释更接近地面真实的SHAP解释,并将解释生成的计算成本降低了最多三个数量级。因此,SHAPformer代表了预测准确性略有下降与可解释性和运行时间提升之间的权衡。现有的SHAP算法要么对模型真实,要么对数据真实56.条件抽样倾向于产生与数据真实的解释,而流形外抽样则能更好地反映模型内部行为的解释40.我们认为SHAPformer同时实现了两者:既忠于模型,也忠于数据。这得益于其无采样设计和训练策略,能够对缺失特征构建鲁棒性。在存在相关特征的情况下,SHAPformer学会利用任意相关输入进行准确预测,并将预测贡献分配到这些输入之间。这与基于完整特征集训练的模型形成对比,后者可能依赖任意特征组合,导致解释误解底层数据关系。SHAPformer与合成数据的真实解释高度一致,支持了这一观点。将SHAPformer应用于真实世界载荷数据,可以洞察不同特征如何影响模型的预测。最重要的预测指标是上周的负荷,其次是星期几和一天中的小时。其他因素如月份、气温和节假日也有影响,而降水量影响较小。这与 PermutationSHAP WindowSHAP 解释的 Transformer 模型形成对比,后者更强调时间特征,淡化过去负载的作用。这一差异凸显了全局解释如何帮助区分具有相似预报准确性但学习依赖不同的模型。在我们看来,预测模型可以合理地依赖基于日历的输入或滞后负荷值来估算典型负荷模式。SHAP值对于揭示模型依赖哪些线索起到了关键作用。鉴于SHAPformer更贴近合成数据的真实解释,我们有信心其对真实世界数据的解释也比比较方法更忠实于底层数据关系。尽管有其优势,SHAPformer仍有若干局限性。首先,SHAPformer的快速推断是以增加训练时间为代价的。使用掩蔽输入训练需要模型在不同特征子集上学习更复杂的结构,且由于每次迭代只接收部分输入,每个时代的有效训练数据量减少。然而,对于需要解释许多预测的应用,缩短的推理时间是值得额外训练的。其次,SHAPformer的计算复杂度随特征群数量呈指数增长,因为模型对所有2个特征群进行评估NN个特征群的子集。在我们设定的七个输入天和六到七个协变量(视数据集而定)的情况下,这种完整的枚举在计算上可行且理想,因为它能获得最准确的SHAP估计。然而,在特征群较多的情况下,如更长的输入序列或额外的协变量,这种穷尽方法可能变得不切实际。未来的研究可以通过基于特征组子集估计近似SHAP值来解决这个问题。第三,特征重要性和局部解释在不同训练运行中可能有所不同,如表2中的不稳定性指标所示。该指标衡量特征重要性值在五次模型训练和评估运行中的标准差,结果显示SHAPformer的特征重要性平均偏差12个百分点。第四,实证评估仅限于一个合成数据集和两个真实世界数据集,因为每个数据集都需要领域理解来验证解释,我们会将更多数据集的评估留待后续研究。最后,合成基准依赖于若干假设:基于数据生成过程得出的SHAP值定义了实地真实解释,假设所学模型忠实地代表该过程,并且尊重特征之间的依赖关系(例如,可以从星期数特征推断出时间,表示日数切换)。虽然这些假设允许受控评估,但对不遵循这些假设的模型的忠实解释将与实际情况有所不同。未来,SHAPformer的高效SHAP计算可以应用于Transformer以外的其他模型,通过在特征子集上训练,从而在推断时对特征子集运行。对于不依赖注意力的模型,可以使用特征丢失代替注意力操控。以这种方式训练模型不仅有助于解释性,还可能提高对已知异常和缺失值的鲁棒性。通过使用注意力操作或类似机制去掉这些数值,这些模型可能更有效地适应现实世界的数据缺陷。我们以 Python 包的形式发布 SHAPformer57以便研究人员和从业者能够获得。这将促进其在电力负载预测之外多个领域的应用和评估。SHAPformer可以应用于单变量环境——仅凭过去目标的窗口解释预测——也可以应用于协变量知情的环境,从而涵盖多种应用场景。鉴于其在合成数据上的验证以及在两个预测任务上的评估,我们有信心SHAPformer能够很好地推广到其他应用场景。我们发布综合数据集和真实解释58,以便未来用于XAI方法的评估。但请注意,这个基本真实值是基于多个假设创建的,例如基础真实值应与SHAP值相似,并且应尊重特征之间的依赖关系(例如,可以通过星期数特征的跳跃推断出一天中的小时)。在不同假设下,其他解释可能有效,尤其是当目标是创建对已学习不同依赖关系的模型真实解释时。我们认为这种评估方法是对现有解释指标的补充59并相信未来它可以扩展到其他数据模式。

[返回]

下一篇:Experimental evidence on the productivity effects of generative artificial intelligence