机制可解释性
可解释性的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。
第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。
甲、卷积可视化:反投影让中层特征第一次可检查Deconvolutional Visualization
起点要放回2014年的ECCV:Zeiler 与 Fergus不再允许机制可解释性在卷积可视化上继续把可读标签当成因果机制。Zeiler 与 Fergus逐项核对激活、特征方向、回路与反事实修补里的卷积可视化;替代路径、解释者偏差与低频功能由概念激活向量另行登记。在ECCV的证据账上,由可视化帮助发现AlexNet第一层频率过高与遮挡敏感起步,概念激活向量进入解释对照;本条残差不能靠改名消失。
卷积可视化的可反驳立场是:把某层激活反投影到输入,可观察网络逐层从边缘到部件的选择性。Zeiler 与 Fergus这一路线据此把决定性解释锁在一个对象上,概念激活向量的“用概念例图训练表示空间方向,可测类别对人类概念的敏感度”不能替代本条;边界是反卷积规则本身改变信号。若换样本后再问仍不能保持方向,概念激活向量便构成卷积可视化的近邻反例;ECCV对卷积可视化仅支持原任务。
可核对的主证据是Zeiler 与 Fergus,2014 年《ECCV》8689:818–833,DOI 10.1007/978-3-319-10590-1_53:可视化帮助发现AlexNet第一层频率过高与遮挡敏感,并指导架构修改。反投影逐层检查8层AlexNet表示。概念激活向量要求把2014年的卷积可视化样本与对照结算,再核查概念激活向量的任务、观察窗和反卷积规则本身改变信号。对卷积可视化,概念激活向量仅作近邻;支点仍是Zeiler 与 Fergus在ECCV的原始比较。
卷积可视化自己留下的反证入口是:反卷积规则本身改变信号,漂亮图案不证明特征对最终决策有因果作用。用正交量纲重测时,Zeiler 与 Fergus的解释可能缩小、反号,或让位给概念激活向量的路径。概念激活向量给出复核ECCV的近邻条件:把不显著结果一并公开;卷积可视化负责记录中止、排除和不显著对象。
可视化帮助发现AlexNet第一层频率过高与遮挡敏感改变登记顺序:激活、特征方向、回路与反事实修补归卷积可视化,替代路径、解释者偏差与低频功能交概念激活向量核查。2018年的概念激活向量以“用概念例图训练表示空间方向,可测类别对人类概念的敏感度”作近邻;两者若结论不同,应以反卷积规则本身改变信号为分账边界;概念激活向量不得与本条合成一个平均分。
2014年,卷积可视化据可视化帮助发现AlexNet第一层频率过高与遮挡敏感对接第254号第十八条。跨过去,反卷积规则本身改变信号迫使卷积可视化重新检验可见读数。卷积可视化以反卷积规则本身改变信号施加反向压力。该接口若仍支持相反方向,反卷积规则本身改变信号要求卷积可视化增加第三条件,同时容纳两边的失效样本。
乙、梯度显著图:输入微扰对类别分数的局部导数成为解释Gradient Saliency
真正的断点出现在2014年的ICLR Workshop:Simonyan、Vedaldi、Zisserman不再允许机制可解释性在梯度显著图上继续把可读标签当成因果机制。Simonyan、Vedaldi、Zisserman逐项核对激活、特征方向、回路与反事实修补里的梯度显著图;替代路径、解释者偏差与低频功能由叠加另行登记。在ICLR Workshop的证据账上,由在ImageNet模型上生成显著图和优化图像起步,叠加进入解释对照;本条残差不能靠改名消失。
梯度显著图的可反驳立场是:类别分数对像素的梯度可指出局部最敏感输入并合成类别原型。Simonyan、Vedaldi、Zisserman这一路线据此把决定性解释锁在一个对象上,叠加的“稀疏特征数超过维度时,网络可用非正交方向叠加表示”不能替代本条;边界是梯度噪声、饱和和尺度让图不稳定。若把时间窗拉长再看仍不能保持方向,叠加便构成梯度显著图的近邻反例;ICLR Workshop对梯度显著图仅支持原任务。
可核对的主证据是Simonyan、Vedaldi、Zisserman,2014 年《ICLR Workshop》论文“Deep Inside Convolutional Networks”:在ImageNet模型上生成显著图和优化图像,提供无需改模型的检查入口。梯度显著图只需1次反向传播。叠加要求把2014年的梯度显著图样本与对照结算,再核查叠加的任务、观察窗和梯度噪声、饱和和尺度让图不稳定。对梯度显著图,叠加仅作近邻;支点仍是Simonyan、Vedaldi、Zisserman在ICLR Workshop的原始比较。拿叠加作近邻检验,可辨认Simonyan、Vedaldi、Zisserman观察到的是独有路径,还是另一条路线的表面同义词。
梯度显著图自己留下的反证入口是:梯度噪声、饱和和尺度让图不稳定,敏感不等于实际使用。撤去界面提示再验时,Simonyan、Vedaldi、Zisserman的解释可能缩小、反号,或让位给叠加的路径。叠加给出复核ICLR Workshop的近邻条件:按个体轨迹而非均值检查;梯度显著图负责记录中止、排除和不显著对象。回到ICLR Workshop的取样方式,梯度显著图要用叠加证明原分母没有删去最容易失败的对象。
在ImageNet模型上生成显著图和优化图像改变登记顺序:激活、特征方向、回路与反事实修补归梯度显著图,替代路径、解释者偏差与低频功能交叠加核查。2022年的叠加以“稀疏特征数超过维度时,网络可用非正交方向叠加表示”作近邻;两者若结论不同,应以梯度噪声、饱和和尺度让图不稳定为分账边界;叠加不得与本条合成一个平均分。
2014年,梯度显著图据在ImageNet模型上生成显著图和优化图像对接第253号第五条。跨过去,梯度噪声、饱和和尺度让图不稳定迫使梯度显著图重新检验可见读数。梯度显著图以梯度噪声、饱和和尺度让图不稳定施加反向压力。该接口若仍支持相反方向,梯度噪声、饱和和尺度让图不稳定要求梯度显著图增加第三条件,同时容纳两边的失效样本。
丙、局部代理:复杂边界在个案附近被线性近似Local Surrogate Explanations
旧账最先在2016年的KDD:Ribeiro、Singh、Guestrin不再允许机制可解释性在局部代理上继续把可读标签当成因果机制。Ribeiro、Singh、Guestrin逐项核对激活、特征方向、回路与反事实修补里的局部代理;替代路径、解释者偏差与低频功能由稀疏字典另行登记。在KDD的证据账上,由用户实验显示解释帮助发现模型依赖背景词或图像背景的捷径起步,稀疏字典进入解释对照;本条残差不能靠改名消失。
局部代理的可反驳立场是:围绕一个输入采样扰动并拟合稀疏代理,可给出个案级特征贡献。Ribeiro、Singh、Guestrin这一路线据此把决定性解释锁在一个对象上,稀疏字典的“过完备稀疏自编码器可把多义神经元分解为较稀疏特征方向”不能替代本条;边界是采样分布和邻域宽度决定结论。若保留失败对象后检验仍不能保持方向,稀疏字典便构成局部代理的近邻反例;KDD对局部代理仅支持原任务。
可核对的主证据是Ribeiro、Singh、Guestrin,2016 年《KDD》:1135–1144,DOI 10.1145/2939672.2939778:用户实验显示解释帮助发现模型依赖背景词或图像背景的捷径。局部代理横跨3类文本与图像任务。稀疏字典要求把2016年的局部代理样本与对照结算,再核查稀疏字典的任务、观察窗和采样分布和邻域宽度决定结论。对局部代理,稀疏字典仅作近邻;支点仍是Ribeiro、Singh、Guestrin在KDD的原始比较。
局部代理自己留下的反证入口是:采样分布和邻域宽度决定结论,相邻输入可得到完全不同解释。按亚组分别结算时,Ribeiro、Singh、Guestrin的解释可能缩小、反号,或让位给稀疏字典的路径。稀疏字典给出复核KDD的近邻条件:加入反事实条件;局部代理负责记录中止、排除和不显著对象。
用户实验显示解释帮助发现模型依赖背景词或图像背景的捷径改变登记顺序:激活、特征方向、回路与反事实修补归局部代理,替代路径、解释者偏差与低频功能交稀疏字典核查。2023年的稀疏字典以“过完备稀疏自编码器可把多义神经元分解为较稀疏特征方向”作近邻;两者若结论不同,应以采样分布和邻域宽度决定结论为分账边界;稀疏字典不得与本条合成一个平均分。
2016年,局部代理据用户实验显示解释帮助发现模型依赖背景词或图像背景的捷径对接第253号第五条。跨过去,采样分布和邻域宽度决定结论迫使局部代理重新检验可见读数。局部代理以采样分布和邻域宽度决定结论施加反向压力。该接口若仍支持相反方向,采样分布和邻域宽度决定结论要求局部代理增加第三条件,同时容纳两边的失效样本。
丁、对抗样本:模型用的方向与人类语义并不重合Adversarial Evidence
转折并非始于2015年的ICLR:Goodfellow、Shlens、Szegedy不再允许机制可解释性在对抗样本上继续把可读标签当成因果机制。Goodfellow、Shlens、Szegedy逐项核对激活、特征方向、回路与反事实修补里的对抗样本;替代路径、解释者偏差与低频功能由回路分析另行登记。在ICLR的证据账上,由快速梯度符号法一次反向传播即可生成强扰动并用于对抗训练起步,回路分析进入解释对照;本条残差不能靠改名消失。
对抗样本的可反驳立场是:高维近似线性足以让许多微小特征贡献累积成高置信错误。Goodfellow、Shlens、Szegedy这一路线据此把决定性解释锁在一个对象上,回路分析的“特征由权重、通道与组合路径实现,单个神经元不是足够解释单位”不能替代本条;边界是线性解释不是全部机制。若改用地点外资料复核仍不能保持方向,回路分析便构成对抗样本的近邻反例;ICLR对对抗样本仅支持原任务。
可核对的主证据是Goodfellow、Shlens、Szegedy,2015 年《ICLR》论文“Explaining and Harnessing Adversarial Examples”:快速梯度符号法一次反向传播即可生成强扰动并用于对抗训练。FGSM同样只需1次梯度计算。回路分析要求把2015年的对抗样本样本与对照结算,再核查回路分析的任务、观察窗和线性解释不是全部机制。对对抗样本,回路分析仅作近邻;支点仍是Goodfellow、Shlens、Szegedy在ICLR的原始比较。
对抗样本自己留下的反证入口是:线性解释不是全部机制,现实攻击与范数约束的关系仍需具体化。改变任务顺序后追踪时,Goodfellow、Shlens、Szegedy的解释可能缩小、反号,或让位给回路分析的路径。回路分析给出复核ICLR的近邻条件:用盲法重跑关键判断;对抗样本负责记录中止、排除和不显著对象。回到ICLR的取样方式,对抗样本要用回路分析证明原分母没有删去最容易失败的对象。
快速梯度符号法一次反向传播即可生成强扰动并用于对抗训练改变登记顺序:激活、特征方向、回路与反事实修补归对抗样本,替代路径、解释者偏差与低频功能交回路分析核查。2020年的回路分析以“特征由权重、通道与组合路径实现,单个神经元不是足够解释单位”作近邻;两者若结论不同,应以线性解释不是全部机制为分账边界;回路分析不得与本条合成一个平均分。
2015年,对抗样本据快速梯度符号法一次反向传播即可生成强扰动并用于对抗训练对接第048号第一幕丁。跨过去,线性解释不是全部机制迫使对抗样本重新检验可见读数。对抗样本以线性解释不是全部机制施加反向压力。该接口若仍支持相反方向,线性解释不是全部机制要求对抗样本增加第三条件,同时容纳两边的失效样本。
戊、特征反演:表示保留了什么可由重建而非命名检查Feature Inversion
问题的入口是2016年的IJCV:Mahendran 与 Vedaldi不再允许机制可解释性在特征反演上继续把可读标签当成因果机制。Mahendran 与 Vedaldi逐项核对激活、特征方向、回路与反事实修补里的特征反演;替代路径、解释者偏差与低频功能由间接对象识别头另行登记。在IJCV的证据账上,由优化反演展示深层表示仍保留比类别标签更多的空间与外观信息起步,间接对象识别头进入解释对照;本条残差不能靠改名消失。
特征反演的可反驳立场是:从中间表示重建输入可检验其对颜色、位置、纹理与语义的不变性。Mahendran 与 Vedaldi这一路线据此把决定性解释锁在一个对象上,间接对象识别头的“特定注意力头组合可复制上下文中出现过的token模式,支持上下文续写”不能替代本条;边界是正则化和生成先验决定重建外观。若让替代路径进入对照仍不能保持方向,间接对象识别头便构成特征反演的近邻反例;IJCV对特征反演仅支持原任务。
可核对的主证据是Mahendran 与 Vedaldi,2016 年《IJCV》120:233–255,DOI 10.1007/s11263-016-0911-8:优化反演展示深层表示仍保留比类别标签更多的空间与外观信息。特征反演分开核验4类视觉属性。间接对象识别头要求把2016年的特征反演样本与对照结算,再核查间接对象识别头的任务、观察窗和正则化和生成先验决定重建外观。对特征反演,间接对象识别头仅作近邻;支点仍是Mahendran 与 Vedaldi在IJCV的原始比较。
特征反演自己留下的反证入口是:正则化和生成先验决定重建外观,能重建不等于决策真的使用。让独立团队预注册时,Mahendran 与 Vedaldi的解释可能缩小、反号,或让位给间接对象识别头的路径。间接对象识别头给出复核IJCV的近邻条件:将短期与长期拆账;特征反演负责记录中止、排除和不显著对象。
优化反演展示深层表示仍保留比类别标签更多的空间与外观信息改变登记顺序:激活、特征方向、回路与反事实修补归特征反演,替代路径、解释者偏差与低频功能交间接对象识别头核查。2022年的间接对象识别头以“特定注意力头组合可复制上下文中出现过的token模式,支持上下文续写”作近邻;两者若结论不同,应以正则化和生成先验决定重建外观为分账边界;间接对象识别头不得与本条合成一个平均分。
2016年,特征反演据优化反演展示深层表示仍保留比类别标签更多的空间与外观信息对接第254号第六条。跨过去,正则化和生成先验决定重建外观迫使特征反演重新检验可见读数。特征反演以正则化和生成先验决定重建外观施加反向压力。该接口若仍支持相反方向,正则化和生成先验决定重建外观要求特征反演增加第三条件,同时容纳两边的失效样本。
己、诊断探针:隐藏表示能否线性读出某属性Diagnostic Classifiers
先看被改写的对象2016年的Understanding Intermediate Layers Using Linear Classifier Probes:Alain 与 Bengio不再允许机制可解释性在诊断探针上继续把可读标签当成因果机制。Alain 与 Bengio逐项核对激活、特征方向、回路与反事实修补里的诊断探针;替代路径、解释者偏差与低频功能由因果追踪另行登记。在Understanding Intermediate Layers Using Linear Classifier Probes的证据账上,由探针显示分类信息随层数逐渐线性分离起步,因果追踪进入解释对照;本条残差不能靠改名消失。
诊断探针的可反驳立场是:冻结表示后训练简单分类器,可沿网络层次测量信息可读性。Alain 与 Bengio这一路线据此把决定性解释锁在一个对象上,因果追踪的“先污染输入激活、再逐层恢复干净状态,可测某位置对事实输出的因果贡献”不能替代本条;边界是探针自身会学习任务。若把排除者放回分母仍不能保持方向,因果追踪便构成诊断探针的近邻反例;Understanding Intermediate Layers Using Linear Classifier Probes对诊断探针仅支持原任务。
可核对的主证据是Alain 与 Bengio,2016 年 arXiv:1610.01644《Understanding Intermediate Layers Using Linear Classifier Probes》:探针显示分类信息随层数逐渐线性分离,并可比较不同架构。诊断探针比较至少5个网络深度位置。因果追踪要求把2016年的诊断探针样本与对照结算,再核查因果追踪的任务、观察窗和探针自身会学习任务。对诊断探针,因果追踪仅作近邻;支点仍是Alain 与 Bengio在Understanding Intermediate Layers Using Linear Classifier Probes的原始比较。
诊断探针自己留下的反证入口是:探针自身会学习任务;可读信息不一定被原模型因果使用。把不显著结果一并公开时,Alain 与 Bengio的解释可能缩小、反号,或让位给因果追踪的路径。因果追踪给出复核Understanding Intermediate Layers Using Linear Classifier Probes的近邻条件:把人工接管计入结果;诊断探针负责记录中止、排除和不显著对象。回到Understanding Intermediate Layers Using Linear Classifier Probes的取样方式,诊断探针要用因果追踪证明原分母没有删去最容易失败的对象。
探针显示分类信息随层数逐渐线性分离改变登记顺序:激活、特征方向、回路与反事实修补归诊断探针,替代路径、解释者偏差与低频功能交因果追踪核查。2022年的因果追踪以“先污染输入激活、再逐层恢复干净状态,可测某位置对事实输出的因果贡献”作近邻;两者若结论不同,应以探针自身会学习任务为分账边界;因果追踪不得与本条合成一个平均分。
2016年,诊断探针据探针显示分类信息随层数逐渐线性分离对接第256号第三条。跨过去,探针自身会学习任务迫使诊断探针重新检验可见读数。诊断探针以探针自身会学习任务施加反向压力。该接口若仍支持相反方向,探针自身会学习任务要求诊断探针增加第三条件,同时容纳两边的失效样本。
庚、文本神经可视化:删掉一个词比只看激活更接近因果Visualizing Neural NLP Models
争论应从2016年的NAACL:Li、Chen、Hovy、Jurafsky不再允许机制可解释性在文本神经可视化上继续把可读标签当成因果机制。Li、Chen、Hovy、Jurafsky逐项核对激活、特征方向、回路与反事实修补里的文本神经可视化;替代路径、解释者偏差与低频功能由模型编辑另行登记。在NAACL的证据账上,由在情感和序列任务中起步,模型编辑进入解释对照;本条残差不能靠改名消失。
文本神经可视化的可反驳立场是:一阶导数、单位激活与词删除可共同检查文本模型在层间保留什么信息。Li、Chen、Hovy、Jurafsky这一路线据此把决定性解释锁在一个对象上,模型编辑的“参数内知识可局部修改,但成功需同时满足改写、泛化、局部性和保持”不能替代本条;边界是逐词删除会产生不自然句子。若固定资源预算后比较仍不能保持方向,模型编辑便构成文本神经可视化的近邻反例;NAACL对文本神经可视化仅支持原任务。
可核对的主证据是Li、Chen、Hovy、Jurafsky,2016 年《NAACL》:681–691,DOI 10.18653/v1/N16-1082:在情感和序列任务中,删除单词造成的预测变化揭示模型利用的局部线索。词删除检验每次移去1个输入词。模型编辑要求把2016年的文本神经可视化样本与对照结算,再核查模型编辑的任务、观察窗和逐词删除会产生不自然句子。对文本神经可视化,模型编辑仅作近邻;支点仍是Li、Chen、Hovy、Jurafsky在NAACL的原始比较。
文本神经可视化自己留下的反证入口是:逐词删除会产生不自然句子,局部影响也不是组合语言机制的完整分解。按个体轨迹而非均值检查时,Li、Chen、Hovy、Jurafsky的解释可能缩小、反号,或让位给模型编辑的路径。模型编辑给出复核NAACL的近邻条件:审计数据近邻与泄漏;文本神经可视化负责记录中止、排除和不显著对象。
在情感和序列任务中改变登记顺序:激活、特征方向、回路与反事实修补归文本神经可视化,替代路径、解释者偏差与低频功能交模型编辑核查。2023年的模型编辑以“参数内知识可局部修改,但成功需同时满足改写、泛化、局部性和保持”作近邻;两者若结论不同,应以逐词删除会产生不自然句子为分账边界;模型编辑不得与本条合成一个平均分。
2016年,文本神经可视化据在情感和序列任务中对接第047号第一幕戊。跨过去,逐词删除会产生不自然句子迫使文本神经可视化重新检验可见读数。文本神经可视化以逐词删除会产生不自然句子施加反向压力。该接口若仍支持相反方向,逐词删除会产生不自然句子要求文本神经可视化增加第三条件,同时容纳两边的失效样本。
辛、可读证据片段:模型先选一段文字再作预测Extractive Rationales
历史坐标落在2016年的EMNLP:Lei、Barzilay、Jaakkola不再允许机制可解释性在可读证据片段上继续把可读标签当成因果机制。Lei、Barzilay、Jaakkola逐项核对激活、特征方向、回路与反事实修补里的可读证据片段;替代路径、解释者偏差与低频功能由自动解释器另行登记。在EMNLP的证据账上,由在啤酒评论和问答任务中起步,自动解释器进入解释对照;本条残差不能靠改名消失。
可读证据片段的可反驳立场是:生成器先选短而连贯的文本片段,编码器只能据此预测,使理由成为信息瓶颈。Lei、Barzilay、Jaakkola这一路线据此把决定性解释锁在一个对象上,自动解释器的“语言模型可根据高激活样本生成神经元解释,再预测新样本激活以评分”不能替代本条;边界是被选择片段足够预测不等于符合人的因果理由。若用正交量纲重测仍不能保持方向,自动解释器便构成可读证据片段的近邻反例;EMNLP对可读证据片段仅支持原任务。
可核对的主证据是Lei、Barzilay、Jaakkola,2016 年《EMNLP》:107–117,DOI 10.18653/v1/D16-1011:在啤酒评论和问答任务中,模型抽取的片段可与人工方面标注比较。证据片段在2类文本任务上与人工标注比较。自动解释器要求把2016年的可读证据片段样本与对照结算,再核查自动解释器的任务、观察窗和被选择片段足够预测不等于符合人的因果理由。对可读证据片段,自动解释器仅作近邻;支点仍是Lei、Barzilay、Jaakkola在EMNLP的原始比较。
可读证据片段自己留下的反证入口是:被选择片段足够预测不等于符合人的因果理由,选择器仍可能利用捷径。加入反事实条件时,Lei、Barzilay、Jaakkola的解释可能缩小、反号,或让位给自动解释器的路径。自动解释器给出复核EMNLP的近邻条件:先登记停止线再部署;可读证据片段负责记录中止、排除和不显著对象。
在啤酒评论和问答任务中改变登记顺序:激活、特征方向、回路与反事实修补归可读证据片段,替代路径、解释者偏差与低频功能交自动解释器核查。2023年的自动解释器以“语言模型可根据高激活样本生成神经元解释,再预测新样本激活以评分”作近邻;两者若结论不同,应以被选择片段足够预测不等于符合人的因果理由为分账边界;自动解释器不得与本条合成一个平均分。
2016年,可读证据片段据在啤酒评论和问答任务中对接第256号第十一条。跨过去,被选择片段足够预测不等于符合人的因果理由迫使可读证据片段重新检验可见读数。可读证据片段以被选择片段足够预测不等于符合人的因果理由施加反向压力。该接口若仍支持相反方向,被选择片段足够预测不等于符合人的因果理由要求可读证据片段增加第三条件,同时容纳两边的失效样本。
第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。
一、显著性随机化检验:解释若不随模型参数变化就没有解释模型Sanity Checks
第一处裂缝来自2018年的NeurIPS:Adebayo 等不再允许机制可解释性在显著性随机化检验上继续把可读标签当成因果机制。Adebayo 等逐项核对激活、特征方向、回路与反事实修补里的显著性随机化检验;替代路径、解释者偏差与低频功能由解释忠实性另行登记。在NeurIPS的证据账上,由多种显著方法在逐层随机化后仍生成相似边缘图起步,解释忠实性进入解释对照;本条残差不能靠改名消失。
显著性随机化检验的可反驳立场是:归因图必须对模型参数和标签随机化敏感,才可能反映已学函数。Adebayo 等这一路线据此把决定性解释锁在一个对象上,解释忠实性的“机制解释应推出可干预预测,并在反事实替换中保持任务行为”不能替代本条;边界是随机化是必要非充分条件。若撤去界面提示再验仍不能保持方向,解释忠实性便构成显著性随机化检验的近邻反例;NeurIPS对显著性随机化检验仅支持原任务。
可核对的主证据是Adebayo 等,2018 年《NeurIPS》31:9505–9515:多种显著方法在逐层随机化后仍生成相似边缘图,暴露输入先验主导。解释忠实性要求把2018年的显著性随机化检验样本与对照结算,再核查解释忠实性的任务、观察窗和随机化是必要非充分条件。对显著性随机化检验,解释忠实性仅作近邻;支点仍是Adebayo 等在NeurIPS的原始比较。
显著性随机化检验自己留下的反证入口是:随机化是必要非充分条件,能变化仍不说明特征贡献忠实。用盲法重跑关键判断时,Adebayo 等的解释可能缩小、反号,或让位给解释忠实性的路径。解释忠实性给出复核NeurIPS的近邻条件:换样本后再问;显著性随机化检验负责记录中止、排除和不显著对象。
多种显著方法在逐层随机化后仍生成相似边缘图改变登记顺序:激活、特征方向、回路与反事实修补归显著性随机化检验,替代路径、解释者偏差与低频功能交解释忠实性核查。2022年的解释忠实性以“机制解释应推出可干预预测,并在反事实替换中保持任务行为”作近邻;两者若结论不同,应以随机化是必要非充分条件为分账边界;解释忠实性不得与本条合成一个平均分。
2018年,显著性随机化检验据多种显著方法在逐层随机化后仍生成相似边缘图对接第257号第十九条。跨过去,随机化是必要非充分条件迫使显著性随机化检验重新检验可见读数。显著性随机化检验以随机化是必要非充分条件施加反向压力。该接口若仍支持相反方向,随机化是必要非充分条件要求显著性随机化检验增加第三条件,同时容纳两边的失效样本。
二、概念激活向量:从像素归因转向人可命名方向Testing with Concept Activation Vectors
研究单位改在2018年的ICML:Kim 等不再允许机制可解释性在概念激活向量上继续把可读标签当成因果机制。Kim 等逐项核对激活、特征方向、回路与反事实修补里的概念激活向量;替代路径、解释者偏差与低频功能由跨层特征另行登记。在ICML的证据账上,由TCAV在图像分类中量化“条纹”“女性”等概念并支持统计检验起步,跨层特征进入解释对照;本条残差不能靠改名消失。
概念激活向量的可反驳立场是:用概念例图训练表示空间方向,可测类别对人类概念的敏感度。Kim 等这一路线据此把决定性解释锁在一个对象上,跨层特征的“联合字典可追踪特征在多个层的出现、消失与变换”不能替代本条;边界是概念集由人挑选且方向可能纠缠。若按亚组分别结算仍不能保持方向,跨层特征便构成概念激活向量的近邻反例;ICML对概念激活向量仅支持原任务。
可核对的主证据是Kim 等,2018 年《ICML》80:2668–2677:TCAV在图像分类中量化“条纹”“女性”等概念并支持统计检验。TCAV每个概念用至少20幅例图形成方向。跨层特征要求把2018年的概念激活向量样本与对照结算,再核查跨层特征的任务、观察窗和概念集由人挑选且方向可能纠缠。对概念激活向量,跨层特征仅作近邻;支点仍是Kim 等在ICML的原始比较。
概念激活向量自己留下的反证入口是:概念集由人挑选且方向可能纠缠,敏感度不是必要性或充分性。将短期与长期拆账时,Kim 等的解释可能缩小、反号,或让位给跨层特征的路径。跨层特征给出复核ICML的近邻条件:把时间窗拉长再看;概念激活向量负责记录中止、排除和不显著对象。
TCAV在图像分类中量化“条纹”“女性”等概念并支持统计检验改变登记顺序:激活、特征方向、回路与反事实修补归概念激活向量,替代路径、解释者偏差与低频功能交跨层特征核查。2024年的跨层特征以“联合字典可追踪特征在多个层的出现、消失与变换”作近邻;两者若结论不同,应以概念集由人挑选且方向可能纠缠为分账边界;跨层特征不得与本条合成一个平均分。
2018年,概念激活向量据TCAV在图像分类中量化“条纹”“女性”等概念并支持统计检验对接第253号第五条。跨过去,概念集由人挑选且方向可能纠缠迫使概念激活向量重新检验可见读数。概念激活向量以概念集由人挑选且方向可能纠缠施加反向压力。该接口若仍支持相反方向,概念集由人挑选且方向可能纠缠要求概念激活向量增加第三条件,同时容纳两边的失效样本。
三、叠加:一个神经元承载多个特征可能是容量最优解Superposition
回到原始设计2022年的Toy Models of Superposition:Elhage 等不再允许机制可解释性在叠加上继续把可读标签当成因果机制。Elhage 等逐项核对激活、特征方向、回路与反事实修补里的叠加;替代路径、解释者偏差与低频功能由稀疏特征回路另行登记。在Toy Models of Superposition的证据账上,由玩具模型出现多义神经元、相变与几何结构起步,稀疏特征回路进入解释对照;本条残差不能靠改名消失。
叠加的可反驳立场是:稀疏特征数超过维度时,网络可用非正交方向叠加表示。Elhage 等这一路线据此把决定性解释锁在一个对象上,稀疏特征回路的“稀疏特征与边归因可组成输入到输出的因果子图,并允许编辑”不能替代本条;边界是玩具稀疏假设与真实模型差距大。若改变任务顺序后追踪仍不能保持方向,稀疏特征回路便构成叠加的近邻反例;Toy Models of Superposition对叠加仅支持原任务。
可核对的主证据是Elhage 等,2022 年 Transformer Circuits 论文《Toy Models of Superposition》:玩具模型出现多义神经元、相变与几何结构,连接压缩与可解释性。玩具叠加实验观察到3类几何相变。稀疏特征回路要求把2022年的叠加样本与对照结算,再核查稀疏特征回路的任务、观察窗和玩具稀疏假设与真实模型差距大。对叠加,稀疏特征回路仅作近邻;支点仍是Elhage 等在Toy Models of Superposition的原始比较。
叠加自己留下的反证入口是:玩具稀疏假设与真实模型差距大,几何相似不证明同一学习机制。把人工接管计入结果时,Elhage 等的解释可能缩小、反号,或让位给稀疏特征回路的路径。稀疏特征回路给出复核Toy Models of Superposition的近邻条件:保留失败对象后检验;叠加负责记录中止、排除和不显著对象。回到Toy Models of Superposition的取样方式,叠加要用稀疏特征回路证明原分母没有删去最容易失败的对象。
玩具模型出现多义神经元、相变与几何结构改变登记顺序:激活、特征方向、回路与反事实修补归叠加,替代路径、解释者偏差与低频功能交稀疏特征回路核查。2024年的稀疏特征回路以“稀疏特征与边归因可组成输入到输出的因果子图,并允许编辑”作近邻;两者若结论不同,应以玩具稀疏假设与真实模型差距大为分账边界;稀疏特征回路不得与本条合成一个平均分。
2022年,叠加据玩具模型出现多义神经元、相变与几何结构对接第047号第二幕十。跨过去,玩具稀疏假设与真实模型差距大迫使叠加重新检验可见读数。叠加以玩具稀疏假设与真实模型差距大施加反向压力。该接口若仍支持相反方向,玩具稀疏假设与真实模型差距大要求叠加增加第三条件,同时容纳两边的失效样本。
四、稀疏字典:从激活中拆出更接近单义的特征Sparse Autoencoders
这一路线先拆掉2023年的Towards Monosemanticity:Bricken 等不再允许机制可解释性在稀疏字典上继续把可读标签当成因果机制。Bricken 等逐项核对激活、特征方向、回路与反事实修补里的稀疏字典;替代路径、解释者偏差与低频功能由卷积可视化另行登记。在Towards Monosemanticity的证据账上,由在小型语言模型中识别DNA、代码与语境等比单神经元更连贯特征起步,卷积可视化进入解释对照;本条残差不能靠改名消失。
稀疏字典的可反驳立场是:过完备稀疏自编码器可把多义神经元分解为较稀疏特征方向。Bricken 等这一路线据此把决定性解释锁在一个对象上,卷积可视化的“把某层激活反投影到输入,可观察网络逐层从边缘到部件的选择性”不能替代本条;边界是重构误差与稀疏惩罚决定字典。若让独立团队预注册仍不能保持方向,卷积可视化便构成稀疏字典的近邻反例;Towards Monosemanticity对稀疏字典仅支持原任务。
可核对的主证据是Bricken 等,2023 年 Transformer Circuits 论文《Towards Monosemanticity》:在小型语言模型中识别DNA、代码与语境等比单神经元更连贯特征。卷积可视化要求把2023年的稀疏字典样本与对照结算,再核查卷积可视化的任务、观察窗和重构误差与稀疏惩罚决定字典。对稀疏字典,卷积可视化仅作近邻;支点仍是Bricken 等在Towards Monosemanticity的原始比较。
稀疏字典自己留下的反证入口是:重构误差与稀疏惩罚决定字典,特征命名仍受人和自动解释器偏差。审计数据近邻与泄漏时,Bricken 等的解释可能缩小、反号,或让位给卷积可视化的路径。卷积可视化给出复核Towards Monosemanticity的近邻条件:改用地点外资料复核;稀疏字典负责记录中止、排除和不显著对象。
在小型语言模型中识别DNA、代码与语境等比单神经元更连贯特征改变登记顺序:激活、特征方向、回路与反事实修补归稀疏字典,替代路径、解释者偏差与低频功能交卷积可视化核查。2014年的卷积可视化以“把某层激活反投影到输入,可观察网络逐层从边缘到部件的选择性”作近邻;两者若结论不同,应以重构误差与稀疏惩罚决定字典为分账边界;卷积可视化不得与本条合成一个平均分。
2023年,稀疏字典据在小型语言模型中识别DNA、代码与语境等比单神经元更连贯特征对接第043号第二幕五。跨过去,重构误差与稀疏惩罚决定字典迫使稀疏字典重新检验可见读数。稀疏字典以重构误差与稀疏惩罚决定字典施加反向压力。该接口若仍支持相反方向,重构误差与稀疏惩罚决定字典要求稀疏字典增加第三条件,同时容纳两边的失效样本。
五、回路分析:解释单位从节点移向路径与组合算法Circuits
需要先恢复2020年的Zoom In: An Introduction to Circuits:Olah 等不再允许机制可解释性在回路分析上继续把可读标签当成因果机制。Olah 等逐项核对激活、特征方向、回路与反事实修补里的回路分析;替代路径、解释者偏差与低频功能由梯度显著图另行登记。在Zoom In: An Introduction to Circuits的证据账上,由在图像模型中重建曲线、纹理和物体部件回路起步,梯度显著图进入解释对照;本条残差不能靠改名消失。
回路分析的可反驳立场是:特征由权重、通道与组合路径实现,单个神经元不是足够解释单位。Olah 等这一路线据此把决定性解释锁在一个对象上,梯度显著图的“类别分数对像素的梯度可指出局部最敏感输入并合成类别原型”不能替代本条;边界是人工挑选回路难以扩展。若把不显著结果一并公开仍不能保持方向,梯度显著图便构成回路分析的近邻反例;Zoom In: An Introduction to Circuits对回路分析仅支持原任务。
可核对的主证据是Olah 等,2020 年 Distill《Zoom In: An Introduction to Circuits》:在图像模型中重建曲线、纹理和物体部件回路,并用干预验证部分路径。梯度显著图要求把2020年的回路分析样本与对照结算,再核查梯度显著图的任务、观察窗和人工挑选回路难以扩展。对回路分析,梯度显著图仅作近邻;支点仍是Olah 等在Zoom In: An Introduction to Circuits的原始比较。回到Zoom In: An Introduction to Circuits的取样方式,回路分析要用梯度显著图证明原分母没有删去最容易失败的对象。
回路分析自己留下的反证入口是:人工挑选回路难以扩展,未解释的残差可能承担同等重要功能。先登记停止线再部署时,Olah 等的解释可能缩小、反号,或让位给梯度显著图的路径。梯度显著图给出复核Zoom In: An Introduction to Circuits的近邻条件:让替代路径进入对照;回路分析负责记录中止、排除和不显著对象。
在图像模型中重建曲线、纹理和物体部件回路改变登记顺序:激活、特征方向、回路与反事实修补归回路分析,替代路径、解释者偏差与低频功能交梯度显著图核查。2014年的梯度显著图以“类别分数对像素的梯度可指出局部最敏感输入并合成类别原型”作近邻;两者若结论不同,应以人工挑选回路难以扩展为分账边界;梯度显著图不得与本条合成一个平均分。
2020年,回路分析据在图像模型中重建曲线、纹理和物体部件回路对接第254号第十八条。跨过去,人工挑选回路难以扩展迫使回路分析重新检验可见读数。回路分析以人工挑选回路难以扩展施加反向压力。该接口若仍支持相反方向,人工挑选回路难以扩展要求回路分析增加第三条件,同时容纳两边的失效样本。
六、间接对象识别头:Transformer内部可形成可组合算法部件Induction Heads
证据链从2022年的In-Context Learning and Induction Heads:Olsson 等不再允许机制可解释性在间接对象识别头上继续把可读标签当成因果机制。Olsson 等逐项核对激活、特征方向、回路与反事实修补里的间接对象识别头;替代路径、解释者偏差与低频功能由局部代理另行登记。在In-Context Learning and Induction Heads的证据账上,由训练过程出现与上下文学习突变同步的诱导头起步,局部代理进入解释对照;本条残差不能靠改名消失。
间接对象识别头的可反驳立场是:特定注意力头组合可复制上下文中出现过的token模式,支持上下文续写。Olsson 等这一路线据此把决定性解释锁在一个对象上,局部代理的“围绕一个输入采样扰动并拟合稀疏代理,可给出个案级特征贡献”不能替代本条;边界是机制集中在小模型和重复模式。若按个体轨迹而非均值检查仍不能保持方向,局部代理便构成间接对象识别头的近邻反例;In-Context Learning and Induction Heads对间接对象识别头仅支持原任务。
可核对的主证据是Olsson 等,2022 年 Transformer Circuits 论文《In-Context Learning and Induction Heads》:训练过程出现与上下文学习突变同步的诱导头,并由消融检验贡献。局部代理要求把2022年的间接对象识别头样本与对照结算,再核查局部代理的任务、观察窗和机制集中在小模型和重复模式。对间接对象识别头,局部代理仅作近邻;支点仍是Olsson 等在In-Context Learning and Induction Heads的原始比较。
间接对象识别头自己留下的反证入口是:机制集中在小模型和重复模式,对复杂推理与大模型的覆盖仍有限。换样本后再问时,Olsson 等的解释可能缩小、反号,或让位给局部代理的路径。局部代理给出复核In-Context Learning and Induction Heads的近邻条件:把排除者放回分母;间接对象识别头负责记录中止、排除和不显著对象。
训练过程出现与上下文学习突变同步的诱导头改变登记顺序:激活、特征方向、回路与反事实修补归间接对象识别头,替代路径、解释者偏差与低频功能交局部代理核查。2016年的局部代理以“围绕一个输入采样扰动并拟合稀疏代理,可给出个案级特征贡献”作近邻;两者若结论不同,应以机制集中在小模型和重复模式为分账边界;局部代理不得与本条合成一个平均分。
2022年,间接对象识别头据训练过程出现与上下文学习突变同步的诱导头对接第044号第二幕三。跨过去,机制集中在小模型和重复模式迫使间接对象识别头重新检验可见读数。间接对象识别头以机制集中在小模型和重复模式施加反向压力。该接口若仍支持相反方向,机制集中在小模型和重复模式要求间接对象识别头增加第三条件,同时容纳两边的失效样本。
七、因果追踪:激活修补定位事实回忆经过的层与位置Causal Tracing
决定性变化始于2022年的NeurIPS:Meng 等不再允许机制可解释性在因果追踪上继续把可读标签当成因果机制。Meng 等逐项核对激活、特征方向、回路与反事实修补里的因果追踪;替代路径、解释者偏差与低频功能由对抗样本另行登记。在NeurIPS的证据账上,由ROME工作定位中层MLP与主语位置的关键交互起步,对抗样本进入解释对照;本条残差不能靠改名消失。
因果追踪的可反驳立场是:先污染输入激活、再逐层恢复干净状态,可测某位置对事实输出的因果贡献。Meng 等这一路线据此把决定性解释锁在一个对象上,对抗样本的“高维近似线性足以让许多微小特征贡献累积成高置信错误”不能替代本条;边界是修补分布外状态可能引入新路径。若加入反事实条件仍不能保持方向,对抗样本便构成因果追踪的近邻反例;NeurIPS对因果追踪仅支持原任务。
可核对的主证据是Meng 等,2022 年《NeurIPS》35:17359–17372:ROME工作定位中层MLP与主语位置的关键交互,并据此编辑事实。对抗样本要求把2022年的因果追踪样本与对照结算,再核查对抗样本的任务、观察窗和修补分布外状态可能引入新路径。对因果追踪,对抗样本仅作近邻;支点仍是Meng 等在NeurIPS的原始比较。回到NeurIPS的取样方式,因果追踪要用对抗样本证明原分母没有删去最容易失败的对象。
因果追踪自己留下的反证入口是:修补分布外状态可能引入新路径,局部恢复不等于完整自然机制。把时间窗拉长再看时,Meng 等的解释可能缩小、反号,或让位给对抗样本的路径。对抗样本给出复核NeurIPS的近邻条件:固定资源预算后比较;因果追踪负责记录中止、排除和不显著对象。
ROME工作定位中层MLP与主语位置的关键交互改变登记顺序:激活、特征方向、回路与反事实修补归因果追踪,替代路径、解释者偏差与低频功能交对抗样本核查。2015年的对抗样本以“高维近似线性足以让许多微小特征贡献累积成高置信错误”作近邻;两者若结论不同,应以修补分布外状态可能引入新路径为分账边界;对抗样本不得与本条合成一个平均分。
2022年,因果追踪据ROME工作定位中层MLP与主语位置的关键交互对接第044号第二幕八。跨过去,修补分布外状态可能引入新路径迫使因果追踪重新检验可见读数。因果追踪以修补分布外状态可能引入新路径施加反向压力。该接口若仍支持相反方向,修补分布外状态可能引入新路径要求因果追踪增加第三条件,同时容纳两边的失效样本。
八、模型编辑:修改一条事实必须同时检查泛化与旁损Model Editing
最早被迫重写的是2023年的ICLR:Meng 等不再允许机制可解释性在模型编辑上继续把可读标签当成因果机制。Meng 等逐项核对激活、特征方向、回路与反事实修补里的模型编辑;替代路径、解释者偏差与低频功能由特征反演另行登记。在ICLR的证据账上,由MEMIT一次编辑数千事实起步,特征反演进入解释对照;本条残差不能靠改名消失。
模型编辑的可反驳立场是:参数内知识可局部修改,但成功需同时满足改写、泛化、局部性和保持。Meng 等这一路线据此把决定性解释锁在一个对象上,特征反演的“从中间表示重建输入可检验其对颜色、位置、纹理与语义的不变性”不能替代本条;边界是事实不是孤立键值。若用盲法重跑关键判断仍不能保持方向,特征反演便构成模型编辑的近邻反例;ICLR对模型编辑仅支持原任务。
可核对的主证据是Meng 等,2023 年《ICLR》论文“Mass-Editing Memory in a Transformer”:MEMIT一次编辑数千事实,展示批量参数更新与评测框架。特征反演要求把2023年的模型编辑样本与对照结算,再核查特征反演的任务、观察窗和事实不是孤立键值。对模型编辑,特征反演仅作近邻;支点仍是Meng 等在ICLR的原始比较。回到ICLR的取样方式,模型编辑要用特征反演证明原分母没有删去最容易失败的对象。
模型编辑自己留下的反证入口是:事实不是孤立键值,改写会沿语言关系扩散并产生难见副作用。保留失败对象后检验时,Meng 等的解释可能缩小、反号,或让位给特征反演的路径。特征反演给出复核ICLR的近邻条件:用正交量纲重测;模型编辑负责记录中止、排除和不显著对象。拿特征反演作近邻检验,可辨认Meng 等观察到的是独有路径,还是另一条路线的表面同义词。
MEMIT一次编辑数千事实改变登记顺序:激活、特征方向、回路与反事实修补归模型编辑,替代路径、解释者偏差与低频功能交特征反演核查。2016年的特征反演以“从中间表示重建输入可检验其对颜色、位置、纹理与语义的不变性”作近邻;两者若结论不同,应以事实不是孤立键值为分账边界;特征反演不得与本条合成一个平均分。
2023年,模型编辑据MEMIT一次编辑数千事实对接第042号第二幕十一。跨过去,事实不是孤立键值迫使模型编辑重新检验可见读数。模型编辑以事实不是孤立键值施加反向压力。该接口若仍支持相反方向,事实不是孤立键值要求模型编辑增加第三条件,同时容纳两边的失效样本。第042号第二幕十一“生物标志物清算:组间显著不能诊断个人”提供不同尺度的反例;它迫使模型编辑把“适用”写成可检查的对象范围。
九、自动解释器:让模型描述特征也需要外部预测检验Automated Feature Interpretation
这一条先处理2023年的Language Models Can Explain Neurons in Language Models:Bills 等不再允许机制可解释性在自动解释器上继续把可读标签当成因果机制。Bills 等逐项核对激活、特征方向、回路与反事实修补里的自动解释器;替代路径、解释者偏差与低频功能由诊断探针另行登记。在Language Models Can Explain Neurons in Language Models的证据账上,由对数十万神经元自动生成描述起步,诊断探针进入解释对照;本条残差不能靠改名消失。
自动解释器的可反驳立场是:语言模型可根据高激活样本生成神经元解释,再预测新样本激活以评分。Bills 等这一路线据此把决定性解释锁在一个对象上,诊断探针的“冻结表示后训练简单分类器,可沿网络层次测量信息可读性”不能替代本条;边界是解释者与被解释模型共享语言偏见。若将短期与长期拆账仍不能保持方向,诊断探针便构成自动解释器的近邻反例;Language Models Can Explain Neurons in Language Models对自动解释器仅支持原任务。
可核对的主证据是Bills 等,2023 年 OpenAI 技术报告《Language Models Can Explain Neurons in Language Models》:对数十万神经元自动生成描述,建立规模化解释流水线。诊断探针要求把2023年的自动解释器样本与对照结算,再核查诊断探针的任务、观察窗和解释者与被解释模型共享语言偏见。对自动解释器,诊断探针仅作近邻;支点仍是Bills 等在Language Models Can Explain Neurons in Language Models的原始比较。回到Language Models Can Explain Neurons in Language Models的取样方式,自动解释器要用诊断探针证明原分母没有删去最容易失败的对象。
自动解释器自己留下的反证入口是:解释者与被解释模型共享语言偏见,流畅描述可能只概括例子而非机制。改用地点外资料复核时,Bills 等的解释可能缩小、反号,或让位给诊断探针的路径。诊断探针给出复核Language Models Can Explain Neurons in Language Models的近邻条件:撤去界面提示再验;自动解释器负责记录中止、排除和不显著对象。
对数十万神经元自动生成描述改变登记顺序:激活、特征方向、回路与反事实修补归自动解释器,替代路径、解释者偏差与低频功能交诊断探针核查。2016年的诊断探针以“冻结表示后训练简单分类器,可沿网络层次测量信息可读性”作近邻;两者若结论不同,应以解释者与被解释模型共享语言偏见为分账边界;诊断探针不得与本条合成一个平均分。
2023年,自动解释器据对数十万神经元自动生成描述对接第253号第十七条。跨过去,解释者与被解释模型共享语言偏见迫使自动解释器重新检验可见读数。自动解释器以解释者与被解释模型共享语言偏见施加反向压力。该接口若仍支持相反方向,解释者与被解释模型共享语言偏见要求自动解释器增加第三条件,同时容纳两边的失效样本。
十、解释忠实性:可读、稳定与因果正确是三种不同指标Faithfulness Evaluation
原论文正面碰到2022年的NeurIPS:Chan、Kong、Liang不再允许机制可解释性在解释忠实性上继续把可读标签当成因果机制。Chan、Kong、Liang逐项核对激活、特征方向、回路与反事实修补里的解释忠实性;替代路径、解释者偏差与低频功能由文本神经可视化另行登记。在NeurIPS的证据账上,由因果擦洗按解释允许的等价类替换激活起步,文本神经可视化进入解释对照;本条残差不能靠改名消失。
解释忠实性的可反驳立场是:机制解释应推出可干预预测,并在反事实替换中保持任务行为。Chan、Kong、Liang这一路线据此把决定性解释锁在一个对象上,文本神经可视化的“一阶导数、单位激活与词删除可共同检查文本模型在层间保留什么信息”不能替代本条;边界是通过测试只说明解释覆盖所选分布。若把人工接管计入结果仍不能保持方向,文本神经可视化便构成解释忠实性的近邻反例;NeurIPS对解释忠实性仅支持原任务。
可核对的主证据是Chan、Kong、Liang,2022 年《NeurIPS》35:10815–10829《Causal Scrubbing》:因果擦洗按解释允许的等价类替换激活,检验所称回路是否足够。文本神经可视化要求把2022年的解释忠实性样本与对照结算,再核查文本神经可视化的任务、观察窗和通过测试只说明解释覆盖所选分布。对解释忠实性,文本神经可视化仅作近邻;支点仍是Chan、Kong、Liang在NeurIPS的原始比较。
解释忠实性自己留下的反证入口是:通过测试只说明解释覆盖所选分布,测试设计本身仍可能放过替代机制。让替代路径进入对照时,Chan、Kong、Liang的解释可能缩小、反号,或让位给文本神经可视化的路径。文本神经可视化给出复核NeurIPS的近邻条件:按亚组分别结算;解释忠实性负责记录中止、排除和不显著对象。
因果擦洗按解释允许的等价类替换激活改变登记顺序:激活、特征方向、回路与反事实修补归解释忠实性,替代路径、解释者偏差与低频功能交文本神经可视化核查。2016年的文本神经可视化以“一阶导数、单位激活与词删除可共同检查文本模型在层间保留什么信息”作近邻;两者若结论不同,应以通过测试只说明解释覆盖所选分布为分账边界;文本神经可视化不得与本条合成一个平均分。
2022年,解释忠实性据因果擦洗按解释允许的等价类替换激活对接第047号第二幕六读数”。跨过去,通过测试只说明解释覆盖所选分布迫使解释忠实性重新检验可见读数。解释忠实性以通过测试只说明解释覆盖所选分布施加反向压力。该接口若仍支持相反方向,通过测试只说明解释覆盖所选分布要求解释忠实性增加第三条件,同时容纳两边的失效样本。
十一、跨层特征:同一概念可能在层间迁移而非固定在一个位置Cross-Layer Features
方法转向发生在2024年的Sparse Crosscoders for Cross-Layer Features and Model Diffing:Lindsey 等不再允许机制可解释性在跨层特征上继续把可读标签当成因果机制。Lindsey 等逐项核对激活、特征方向、回路与反事实修补里的跨层特征;替代路径、解释者偏差与低频功能由可读证据片段另行登记。在Sparse Crosscoders for Cross-Layer Features and Model Diffing的证据账上,由跨编码器在语言模型中分离跨层共享与层特异方向起步,可读证据片段进入解释对照;本条残差不能靠改名消失。
跨层特征的可反驳立场是:联合字典可追踪特征在多个层的出现、消失与变换。Lindsey 等这一路线据此把决定性解释锁在一个对象上,可读证据片段的“生成器先选短而连贯的文本片段,编码器只能据此预测,使理由成为信息瓶颈”不能替代本条;边界是线性字典可能把动态非线性过程压平。若审计数据近邻与泄漏仍不能保持方向,可读证据片段便构成跨层特征的近邻反例;Sparse Crosscoders for Cross-Layer Features and Model Diffing对跨层特征仅支持原任务。
可核对的主证据是Lindsey 等,2024 年 arXiv:2409.04185《Sparse Crosscoders for Cross-Layer Features and Model Diffing》:跨编码器在语言模型中分离跨层共享与层特异方向,并用于模型差异分析。可读证据片段要求把2024年的跨层特征样本与对照结算,再核查可读证据片段的任务、观察窗和线性字典可能把动态非线性过程压平。对跨层特征,可读证据片段仅作近邻;支点仍是Lindsey 等在Sparse Crosscoders for Cross-Layer Features and Model Diffing的原始比较。
跨层特征自己留下的反证入口是:线性字典可能把动态非线性过程压平,匹配方向也不等于功能相同。把排除者放回分母时,Lindsey 等的解释可能缩小、反号,或让位给可读证据片段的路径。可读证据片段给出复核Sparse Crosscoders for Cross-Layer Features and Model Diffing的近邻条件:改变任务顺序后追踪;跨层特征负责记录中止、排除和不显著对象。
跨编码器在语言模型中分离跨层共享与层特异方向改变登记顺序:激活、特征方向、回路与反事实修补归跨层特征,替代路径、解释者偏差与低频功能交可读证据片段核查。2016年的可读证据片段以“生成器先选短而连贯的文本片段,编码器只能据此预测,使理由成为信息瓶颈”作近邻;两者若结论不同,应以线性字典可能把动态非线性过程压平为分账边界;可读证据片段不得与本条合成一个平均分。
2024年,跨层特征据跨编码器在语言模型中分离跨层共享与层特异方向对接第043号第二幕四。跨过去,线性字典可能把动态非线性过程压平迫使跨层特征重新检验可见读数。跨层特征以线性字典可能把动态非线性过程压平施加反向压力。该接口若仍支持相反方向,线性字典可能把动态非线性过程压平要求跨层特征增加第三条件,同时容纳两边的失效样本。
十二、稀疏特征回路:从单特征字典回到可验证路径Sparse Feature Circuits
这项工作首先校正2024年的ICLR:Marks 等不再允许机制可解释性在稀疏特征回路上继续把可读标签当成因果机制。Marks 等逐项核对激活、特征方向、回路与反事实修补里的稀疏特征回路;替代路径、解释者偏差与低频功能由显著性随机化检验另行登记。在ICLR的证据账上,由在间接对象识别等任务提取紧凑回路起步,显著性随机化检验进入解释对照;本条残差不能靠改名消失。
稀疏特征回路的可反驳立场是:稀疏特征与边归因可组成输入到输出的因果子图,并允许编辑。Marks 等这一路线据此把决定性解释锁在一个对象上,显著性随机化检验的“归因图必须对模型参数和标签随机化敏感,才可能反映已学函数”不能替代本条;边界是回路提取阈值与任务样本决定图。若先登记停止线再部署仍不能保持方向,显著性随机化检验便构成稀疏特征回路的近邻反例;ICLR对稀疏特征回路仅支持原任务。
可核对的主证据是Marks 等,2024 年《ICLR》论文“Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models”:在间接对象识别等任务提取紧凑回路,消融后性能按预测下降。显著性随机化检验要求把2024年的稀疏特征回路样本与对照结算,再核查显著性随机化检验的任务、观察窗和回路提取阈值与任务样本决定图。对稀疏特征回路,显著性随机化检验仅作近邻;支点仍是Marks 等在ICLR的原始比较。
稀疏特征回路自己留下的反证入口是:回路提取阈值与任务样本决定图,低频路径和冗余替代可能被剪掉。固定资源预算后比较时,Marks 等的解释可能缩小、反号,或让位给显著性随机化检验的路径。显著性随机化检验给出复核ICLR的近邻条件:让独立团队预注册;稀疏特征回路负责记录中止、排除和不显著对象。
在间接对象识别等任务提取紧凑回路改变登记顺序:激活、特征方向、回路与反事实修补归稀疏特征回路,替代路径、解释者偏差与低频功能交显著性随机化检验核查。2018年的显著性随机化检验以“归因图必须对模型参数和标签随机化敏感,才可能反映已学函数”作近邻;两者若结论不同,应以回路提取阈值与任务样本决定图为分账边界;显著性随机化检验不得与本条合成一个平均分。
2024年,稀疏特征回路据在间接对象识别等任务提取紧凑回路对接第048号第二幕十。跨过去,回路提取阈值与任务样本决定图迫使稀疏特征回路重新检验可见读数。稀疏特征回路以回路提取阈值与任务样本决定图施加反向压力。该接口若仍支持相反方向,回路提取阈值与任务样本决定图要求稀疏特征回路增加第三条件,同时容纳两边的失效样本。
◎ 二十年连起来看
第一幕不是旧成果清单,而是机制可解释性第一次为自己建立可失败的比较尺。卷积可视化收紧了旧默认,对抗样本把隐含过程拆成可估参数,可读证据片段又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。
第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。显著性随机化检验扩展了表示或分布,因果追踪改变了研究单位,稀疏特征回路则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。
二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。局部代理说明干预能改变路径,稀疏字典说明单一读数会混合层级,解释忠实性又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。
◎ 三个常见误解
误解一:梯度显著图已经给出了稳定的通用解释。它容易取信,是因为类别分数对像素的梯度可指出局部最敏感输入并合成类别原型确实改变了旧的研究方式。但梯度噪声、饱和和尺度让图不稳定,敏感不等于实际使用,所以正确表述只能限于原设计可识别的那一段责任链。
误解二:叠加等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但稀疏特征数超过维度时,网络可用非正交方向叠加表示仍只是一个可检验命题。玩具稀疏假设与真实模型差距大,几何相似不证明同一学习机制说明,没有干预、替代解释和边界样本,可读不等于因果正确。
误解三:跨层特征的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把线性字典可能把动态非线性过程压平,匹配方向也不等于功能相同藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。
◎ 与相邻领域的接口
卷积可视化与第254号第十八条“可视分析与交互式机器学习”的分工在于:本页负责把某层激活反投影到输入,可观察网络逐层从边缘到部件的选择性,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。
文本神经可视化可与第047号第一幕戊“算法稳定性:泛化也可来自删掉一个样本时解变化很小”交换制度或工程中的回写证据。前者的核心命题是一阶导数、单位激活与词删除可共同检查文本模型在层间保留什么信息,但逐词删除会产生不自然句子,局部影响也不是组合语言机制的完整分解;后者则能检验同一接口是否把选择成本转移给了另一个主体。
模型编辑与第042号第二幕十一“生物标志物清算:组间显著不能诊断个人”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用事实不是孤立键值,改写会沿语言关系扩散并产生难见副作用给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。
◎ 争议现场
特征反演的争议是正则化和生成先验决定重建外观,能重建不等于决策真的使用。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。
稀疏字典的争议是重构误差与稀疏惩罚决定字典,特征命名仍受人和自动解释器偏差。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。
解释忠实性的争议是通过测试只说明解释覆盖所选分布,测试设计本身仍可能放过替代机制。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。
◎ 往下五年看什么
到2031年,看显著性随机化检验的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。
看回路分析在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。
看自动解释器的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。
看稀疏特征回路的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。
◎ 可与哪些领域对撞
卷积可视化与第254号第十八条“可视分析与交互式机器学习”共享“可见读数能代表真实对象”的预设。本条用反卷积规则本身改变信号,漂亮图案不证明特征对最终决策有因果作用给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。
可读证据片段与第256号第十一条“标注者分歧”共享“局部表现能够结算整体能力”的预设。可读证据片段主张生成器先选短而连贯的文本片段,编码器只能据此预测,使理由成为信息瓶颈。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。
模型编辑与第042号第二幕十一“生物标志物清算:组间显著不能诊断个人”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是事实不是孤立键值,改写会沿语言关系扩散并产生难见副作用。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。
◎ 十条可做的研究命题
- 在时间外数据上重做卷积可视化;方向保持率低于二分之一即证伪其稳定性。
- 把梯度显著图的中止与排除对象放回分母;主效应反号即否定原总结。
- 为局部代理配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
- 由独立团队预注册对抗样本的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
- 对特征反演的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
- 主动改变诊断探针的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
- 对叠加做反事实干预;可视化不随关键参数变化即证伪忠实性。
- 把因果追踪交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
- 公开跨层特征的最强失败实现;下一方法只在原基准改善即判定为换题。
- 为稀疏特征回路事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。
◎ 资料核验
- Zeiler 与 Fergus,2014 年《ECCV》8689:818–833,DOI 10.1007/978-3-319-10590-1_53。
- Simonyan、Vedaldi、Zisserman,2014 年《ICLR Workshop》论文“Deep Inside Convolutional Networks”。
- Ribeiro、Singh、Guestrin,2016 年《KDD》:1135–1144,DOI 10.1145/2939672.2939778。
- Goodfellow、Shlens、Szegedy,2015 年《ICLR》论文“Explaining and Harnessing Adversarial Examples”。
- Mahendran 与 Vedaldi,2016 年《IJCV》120:233–255,DOI 10.1007/s11263-016-0911-8。
- Alain 与 Bengio,2016 年 arXiv:1610.01644《Understanding Intermediate Layers Using Linear Classifier Probes》。
- Li、Chen、Hovy、Jurafsky,2016 年《NAACL》:681–691,DOI 10.18653/v1/N16-1082。
- Lei、Barzilay、Jaakkola,2016 年《EMNLP》:107–117,DOI 10.18653/v1/D16-1011。
- Adebayo 等,2018 年《NeurIPS》31:9505–9515。
- Kim 等,2018 年《ICML》80:2668–2677。
- Elhage 等,2022 年 Transformer Circuits 论文《Toy Models of Superposition》。
- Bricken 等,2023 年 Transformer Circuits 论文《Towards Monosemanticity》。
- Olah 等,2020 年 Distill《Zoom In: An Introduction to Circuits》。
- Olsson 等,2022 年 Transformer Circuits 论文《In-Context Learning and Induction Heads》。
- Meng 等,2022 年《NeurIPS》35:17359–17372。
- Meng 等,2023 年《ICLR》论文“Mass-Editing Memory in a Transformer”。
- Bills 等,2023 年 OpenAI 技术报告《Language Models Can Explain Neurons in Language Models》。
- Chan、Kong、Liang,2022 年《NeurIPS》35:10815–10829《Causal Scrubbing》。
- Lindsey 等,2024 年 arXiv:2409.04185《Sparse Crosscoders for Cross-Layer Features and Model Diffing》。
- Marks 等,2024 年《ICLR》论文“Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models”。
- Templeton 等,2024 年 Anthropic 技术报告《Scaling Monosemanticity》。
- Marks 等,2024 年《ICLR》论文“Sparse Feature Circuits”。
- Huang 等,2024 年 arXiv:2407.02646《RAVEL: Evaluating Interpretability Methods》。
- Paulo 等,2024 年 arXiv:2404.15255《Automatically Interpreting Millions of Features》。
- Sundararajan、Taly、Yan,2017 年《ICML》70:3319–3328。
- Selvaraju、Cogswell、Das 等,2017 年《ICCV》:618–626,DOI 10.1109/ICCV.2017.74。
- Bau、Zhou、Khosla、Oliva、Torralba,2017 年《CVPR》:3319–3327,DOI 10.1109/CVPR.2017.354。
- Bau、Zhu、Strobelt 等,2019 年《ICLR》论文“GAN Dissection”。
- Vig、Gehrmann、Belinkov 等,2020 年《NeurIPS》33:17030–17045。
- Geiger、Lu、Icard、Potts,2022 年《NeurIPS》35:36791–36805。
以下二十条是可解释性在 1950 至 2006 年之间形成的经典思想,与上文二十条合成双层面板。每条用原始材料和后续修订说明旧前提,并点名它在本块哪条现代判断里继续被使用或反对。
经一、图灵测试与机器智能Classic 01 · Interpretability
在1950年前后的图灵测试与机器智能提出之前,可解释性常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第1条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是以可观察对话表现替代对机器是否真正思考的本体争论。第1条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查图灵测试与机器智能,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第1条经典与本块甲“卷积可视化:反投影让中层特征第一次可检查”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第1条就退回1950年的适用域;经典身份不能代替新证据。
经二、感知机学习规则Classic 02 · Interpretability
在1958年前后的感知机学习规则提出之前,可解释性常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第2条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是线性阈值单元可按分类误差调整权重并学习可分模式。第2条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查感知机学习规则,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第2条经典与本块乙“梯度显著图:输入微扰对类别分数的局部导数成为解释”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第2条就退回1958年的适用域;经典身份不能代替新证据。
经三、Widrow-Hoff最小均方学习Classic 03 · Interpretability
在1960年前后的Widrow-Hoff最小均方学习提出之前,可解释性常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第3条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是沿均方误差梯度更新权重可让线性自适应单元在线收敛。第3条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查Widrow-Hoff最小均方学习,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第3条经典与本块丙“局部代理:复杂边界在个案附近被线性近似”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第3条就退回1960年的适用域;经典身份不能代替新证据。
经四、多层数据处理网络Classic 04 · Interpretability
在1965年前后的多层数据处理网络提出之前,可解释性常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第4条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是逐层生成并筛选多项式单元可构造早期深层自组织模型。第4条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查多层数据处理网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第4条经典与本块丁“对抗样本:模型用的方向与人类语义并不重合”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第4条就退回1965年的适用域;经典身份不能代替新证据。
经五、感知机表示局限Classic 05 · Interpretability
在1969年前后的感知机表示局限提出之前,可解释性常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第5条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是单层感知机无法表示异或与某些连通性质,结构能力须与训练成功分开。第5条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查感知机表示局限,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第5条经典与本块戊“特征反演:表示保留了什么可由重建而非命名检查”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第5条就退回1969年的适用域;经典身份不能代替新证据。
经六、误差反向传播论文Classic 06 · Interpretability
在1974年前后的误差反向传播论文提出之前,可解释性常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第6条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是链式求导可把输出误差分配给多层网络内部权重。第6条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查误差反向传播论文,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第6条经典与本块己“诊断探针:隐藏表示能否线性读出某属性”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第6条就退回1974年的适用域;经典身份不能代替新证据。
经七、Neocognitron卷积层级Classic 07 · Interpretability
在1980年前后的Neocognitron卷积层级提出之前,可解释性常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第7条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是局部感受野与下采样层级可获得对平移较稳定的视觉识别。第7条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查Neocognitron卷积层级,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第7条经典与本块庚“文本神经可视化:删掉一个词比只看激活更接近因果”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第7条就退回1980年的适用域;经典身份不能代替新证据。
经八、Hopfield联想记忆Classic 08 · Interpretability
在1982年前后的Hopfield联想记忆提出之前,可解释性常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第8条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是对称连接网络可沿能量下降收敛到存储模式并完成内容寻址。第8条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查Hopfield联想记忆,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第8条经典与本块辛“可读证据片段:模型先选一段文字再作预测”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第8条就退回1982年的适用域;经典身份不能代替新证据。
经九、玻尔兹曼机Classic 09 · Interpretability
在1985年前后的玻尔兹曼机提出之前,可解释性常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第9条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是随机隐变量网络可用自由相与钳制相统计差学习概率分布。第9条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查玻尔兹曼机,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第9条经典与本块一“显著性随机化检验:解释若不随模型参数变化就没有解释模型”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第9条就退回1985年的适用域;经典身份不能代替新证据。
经十、多层反向传播复兴Classic 10 · Interpretability
在1986年前后的多层反向传播复兴提出之前,可解释性常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第10条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是反向传播误差可让多层网络学习分布式内部表示。第10条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查多层反向传播复兴,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第10条经典与本块二“概念激活向量:从像素归因转向人可命名方向”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第10条就退回1986年的适用域;经典身份不能代替新证据。
经十一、卷积网络识别手写数字Classic 11 · Interpretability
在1989年前后的卷积网络识别手写数字提出之前,可解释性常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第11条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是共享卷积核与反向传播把图像局部结构转成端到端分类器。第11条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查卷积网络识别手写数字,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第11条经典与本块三“叠加:一个神经元承载多个特征可能是容量最优解”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第11条就退回1989年的适用域;经典身份不能代替新证据。
经十二、简单循环网络Classic 12 · Interpretability
在1990年前后的简单循环网络提出之前,可解释性常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第12条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是把上一时刻隐状态回送网络可从序列预测中学习时间结构。第12条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查简单循环网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第12条经典与本块四“稀疏字典:从激活中拆出更接近单义的特征”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第12条就退回1990年的适用域;经典身份不能代替新证据。
经十三、支持向量机Classic 13 · Interpretability
在1995年前后的支持向量机提出之前,可解释性常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第13条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是最大间隔与核函数把分类复杂度集中到边界支持向量。第13条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查支持向量机,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第13条经典与本块五“回路分析:解释单位从节点移向路径与组合算法”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第13条就退回1995年的适用域;经典身份不能代替新证据。
经十四、长短期记忆网络Classic 14 · Interpretability
在1997年前后的长短期记忆网络提出之前,可解释性常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第14条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是门控记忆单元为梯度提供近恒定通道并缓解长序列遗忘。第14条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查长短期记忆网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第14条经典与本块六“间接对象识别头:Transformer内部可形成可组合算法部件”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第14条就退回1997年的适用域;经典身份不能代替新证据。
经十五、LeNet文档识别系统Classic 15 · Interpretability
在1998年前后的LeNet文档识别系统提出之前,可解释性常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第15条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是卷积、池化和梯度训练可组成部署级手写文档识别流水线。第15条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查LeNet文档识别系统,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第15条经典与本块七“因果追踪:激活修补定位事实回忆经过的层与位置”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第15条就退回1998年的适用域;经典身份不能代替新证据。
经十六、核方法统一Classic 16 · Interpretability
在2002年前后的核方法统一提出之前,可解释性常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第16条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是正定核把非线性学习转为高维特征空间中的凸优化。第16条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查核方法统一,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第16条经典与本块八“模型编辑:修改一条事实必须同时检查泛化与旁损”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第16条就退回2002年的适用域;经典身份不能代替新证据。
经十七、Isomap流形学习Classic 17 · Interpretability
在2000年前后的Isomap流形学习提出之前,可解释性常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第17条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是邻域图上的测地距离可恢复高维数据的低维流形坐标。第17条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查Isomap流形学习,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第17条经典与本块九“自动解释器:让模型描述特征也需要外部预测检验”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第17条就退回2000年的适用域;经典身份不能代替新证据。
经十八、对比散度Classic 18 · Interpretability
在2002年前后的对比散度提出之前,可解释性常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第18条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是短步马尔可夫链可近似能量模型似然梯度并显著降低训练成本。第18条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查对比散度,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第18条经典与本块十“解释忠实性:可读、稳定与因果正确是三种不同指标”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第18条就退回2002年的适用域;经典身份不能代替新证据。
经十九、GPU通用流式计算Classic 19 · Interpretability
在2004年前后的GPU通用流式计算提出之前,可解释性常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第19条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是把程序表达为数据流内核可将图形处理器用于一般并行数值计算。第19条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查GPU通用流式计算,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第19条经典与本块十一“跨层特征:同一概念可能在层间迁移而非固定在一个位置”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第19条就退回2004年的适用域;经典身份不能代替新证据。
经二十、深层信念网络逐层预训练Classic 20 · Interpretability
在2006年前后的深层信念网络逐层预训练提出之前,可解释性常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第20条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是逐层无监督训练再微调可让多层生成网络越过随机初始化困难。第20条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查深层信念网络逐层预训练,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第20条经典与本块十二“稀疏特征回路:从单特征字典回到可验证路径”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第20条就退回2006年的适用域;经典身份不能代替新证据。
◎ 这一层怎么用
先按“今用”或“异名”找到上文对应的现代条,再比较两条的对象、分母与停止规则。若它们只共享名词而不共享失败对象,就只登记为异名;若量纲可以逐项换算,再判断现代条究竟继承、修正还是反转了经典命题。
经典身份不提供豁免。提出年份只决定它属于哪一层;后续综述、反例和新装置负责划出今天仍可使用的边界。量纲字段保留“∶”,使跨年代与跨领域的读数能够先对齐分母再碰撞。
◎ 经典层资料核验
- Turing AM. Computing machinery and intelligence. Mind 59 (1950): 433–460。
- Rosenblatt F. The perceptron: A probabilistic model for information storage and organization in the brain. Psychological Review 65 (1958): 386–408。
- Widrow B, Hoff ME. Adaptive switching circuits. IRE WESCON Convention Record 4 (1960): 96–104。
- Ivakhnenko AG, Lapa VG. Cybernetic Predicting Devices. CCM Information (1965)。
- Minsky M, Papert S. Perceptrons. MIT Press (1969)。
- Werbos PJ. Beyond Regression: New Tools for Prediction and Analysis in the Behavioral Sciences. Harvard PhD thesis (1974)。
- Fukushima K. Neocognitron: A self-organizing neural network model for pattern recognition unaffected by shift in position. Biological Cybernetics 36 (1980): 193–202。
- Hopfield JJ. Neural networks and physical systems with emergent collective computational abilities. Proceedings of the National Academy of Sciences 79 (1982): 2554–2558。
- Ackley DH, Hinton GE, Sejnowski TJ. A learning algorithm for Boltzmann machines. Cognitive Science 9 (1985): 147–169。
- Rumelhart DE, Hinton GE, Williams RJ. Learning representations by back-propagating errors. Nature 323 (1986): 533–536。
- LeCun Y et al. Backpropagation applied to handwritten zip code recognition. Neural Computation 1 (1989): 541–551。
- Elman JL. Finding structure in time. Cognitive Science 14 (1990): 179–211。
- Cortes C, Vapnik V. Support-vector networks. Machine Learning 20 (1995): 273–297。
- Hochreiter S, Schmidhuber J. Long short-term memory. Neural Computation 9 (1997): 1735–1780。
- LeCun Y et al. Gradient-based learning applied to document recognition. Proceedings of the IEEE 86 (1998): 2278–2324。
- Scholkopf B, Smola AJ. Learning with Kernels. MIT Press (2002)。
- Tenenbaum JB, de Silva V, Langford JC. A global geometric framework for nonlinear dimensionality reduction. Science 290 (2000): 2319–2323。
- Hinton GE. Training products of experts by minimizing contrastive divergence. Neural Computation 14 (2002): 1771–1800。
- Buck I et al. Brook for GPUs: Stream computing on graphics hardware. ACM Transactions on Graphics 23 (2004): 777–786。
- Hinton GE, Osindero S, Teh YW. A fast learning algorithm for deep belief nets. Neural Computation 18 (2006): 1527–1554。
- Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)。
- Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)。
- Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)。
- LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444。
- Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)。
- Nilsson NJ. Learning Machines. McGraw-Hill (1965)。
- Rumelhart DE, McClelland JL. Parallel Distributed Processing. MIT Press (1986)。
- Hertz J, Krogh A, Palmer RG. Introduction to the Theory of Neural Computation. Addison-Wesley (1991)。
- Bishop CM. Neural Networks for Pattern Recognition. Oxford University Press (1995)。
- Vapnik VN. Statistical Learning Theory. Wiley (1998)。
- Haykin S. Neural Networks, 2nd ed. Prentice Hall (1999)。
- Cristianini N, Shawe-Taylor J. An Introduction to Support Vector Machines. Cambridge University Press (2000)。
- Bishop CM. Pattern Recognition and Machine Learning. Springer (2006)。
核验说明:提出栏优先保留原始论文、专著或正式文集;流变栏列具体的后续专著、综述或重建工作。2006 年后的文献只用于说明修订,不改变经典条的入选年份。