深度学习
深度学习的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。
第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。
甲、深层信念网:逐层预训练让深网络第一次稳定启动Deep Belief Nets
起点要放回2006年的Neural Computation:Hinton、Osindero、Teh不再允许深度学习在深层信念网上继续用训练成功代替泛化解释。Hinton、Osindero、Teh逐项核对模型参数、训练样本与样本外误差里的深层信念网;数据污染、算力预算与长尾失败由掩码自编码另行登记。在Neural Computation的证据账上,由MNIST等任务证明多层表示可被实际训练起步,掩码自编码进入解释对照;本条残差不能靠改名消失。
深层信念网的可反驳立场是:无监督逐层预训练先找到参数盆地,再用监督信号整体微调。Hinton、Osindero、Teh这一路线据此把决定性解释锁在一个对象上,掩码自编码的“高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算”不能替代本条;边界是收益依赖当时初始化和数据规模。若换样本后再问仍不能保持方向,掩码自编码便构成深层信念网的近邻反例;Neural Computation对深层信念网仅支持原任务。
可核对的主证据是Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527:MNIST等任务证明多层表示可被实际训练,打破深网络必然卡在优化中的判断。深层信念网在MNIST把测试误差压到约1.25%。掩码自编码要求把2006年的深层信念网样本与对照结算,再核查掩码自编码的任务、观察窗和收益依赖当时初始化和数据规模。对深层信念网,掩码自编码仅作近邻;支点仍是Hinton、Osindero、Teh在Neural Computation的原始比较。
深层信念网自己留下的反证入口是:收益依赖当时初始化和数据规模,后来的归一化与残差结构会改变必要性。用正交量纲重测时,Hinton、Osindero、Teh的解释可能缩小、反号,或让位给掩码自编码的路径。掩码自编码给出复核Neural Computation的近邻条件:把不显著结果一并公开;深层信念网负责记录中止、排除和不显著对象。
MNIST等任务证明多层表示可被实际训练改变登记顺序:模型参数、训练样本与样本外误差归深层信念网,数据污染、算力预算与长尾失败交掩码自编码核查。2022年的掩码自编码以“高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算”作近邻;两者若结论不同,应以收益依赖当时初始化和数据规模为分账边界;掩码自编码不得与本条合成一个平均分。
2006年,深层信念网据MNIST等任务证明多层表示可被实际训练对接第047号第二幕四。跨过去,收益依赖当时初始化和数据规模迫使深层信念网重新检验可见读数。深层信念网以收益依赖当时初始化和数据规模施加反向压力。该接口若仍支持相反方向,收益依赖当时初始化和数据规模要求深层信念网增加第三条件,同时容纳两边的失效样本。
乙、ReLU:一个非饱和门改变梯度与稀疏激活Rectified Linear Units
真正的断点出现在2011年的AISTATS:Glorot、Bordes、Bengio不再允许深度学习在深度学习里的ReLU上继续用训练成功代替泛化解释。Glorot、Bordes、Bengio逐项核对模型参数、训练样本与样本外误差里的深度学习里的ReLU;数据污染、算力预算与长尾失败由双下降另行登记。在AISTATS的证据账上,由在图像与文本基准上起步,双下降进入解释对照;本条残差不能靠改名消失。
深度学习里的ReLU的可反驳立场是:非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示。Glorot、Bordes、Bengio这一路线据此把决定性解释锁在一个对象上,双下降的“经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降”不能替代本条;边界是死亡单元与尺度爆炸仍在。若把时间窗拉长再看仍不能保持方向,双下降便构成深度学习里的ReLU的近邻反例;AISTATS对深度学习里的ReLU仅支持原任务。
可核对的主证据是Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323:在图像与文本基准上,ReLU网络训练更快并超过双曲正切网络。ReLU论文比较4组图像与文本任务。双下降要求把2011年的深度学习里的ReLU样本与对照结算,再核查双下降的任务、观察窗和死亡单元与尺度爆炸仍在。对深度学习里的ReLU,双下降仅作近邻;支点仍是Glorot、Bordes、Bengio在AISTATS的原始比较。回到AISTATS的取样方式,深度学习里的ReLU要用双下降证明原分母没有删去最容易失败的对象。
深度学习里的ReLU自己留下的反证入口是:死亡单元与尺度爆炸仍在,激活函数不能替代初始化、归一化和数据设计。撤去界面提示再验时,Glorot、Bordes、Bengio的解释可能缩小、反号,或让位给双下降的路径。双下降给出复核AISTATS的近邻条件:按个体轨迹而非均值检查;深度学习里的ReLU负责记录中止、排除和不显著对象。拿双下降作近邻检验,可辨认Glorot、Bordes、Bengio观察到的是独有路径,还是另一条路线的表面同义词。
在图像与文本基准上改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的ReLU,数据污染、算力预算与长尾失败交双下降核查。2019年的双下降以“经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降”作近邻;两者若结论不同,应以死亡单元与尺度爆炸仍在为分账边界;双下降不得与本条合成一个平均分。
2011年,深度学习里的ReLU据在图像与文本基准上对接第049号第二幕三。跨过去,死亡单元与尺度爆炸仍在迫使深度学习里的ReLU重新检验可见读数。深度学习里的ReLU以死亡单元与尺度爆炸仍在施加反向压力。该接口若仍支持相反方向,死亡单元与尺度爆炸仍在要求深度学习里的ReLU增加第三条件,同时容纳两边的失效样本。
丙、ImageNet转折:数据、GPU与卷积一同越过旧基线The ImageNet Breakthrough
旧账最先在2012年的NeurIPS:Krizhevsky、Sutskever、Hinton不再允许深度学习在ImageNet转折上继续用训练成功代替泛化解释。Krizhevsky、Sutskever、Hinton逐项核对模型参数、训练样本与样本外误差里的ImageNet转折;数据污染、算力预算与长尾失败由神经缩放律另行登记。在NeurIPS的证据账上,由AlexNet将ImageNet top-5错误率降至15.3%起步,神经缩放律进入解释对照;本条残差不能靠改名消失。第258号第十四条“再采样基准证明‘同名测试集’也会发生分布变化”提供不同尺度的反例;它迫使ImageNet转折把“适用”写成可检查的对象范围。
ImageNet转折的可反驳立场是:深卷积网络在大规模标注与GPU训练下显著拉开视觉误差。Krizhevsky、Sutskever、Hinton这一路线据此把决定性解释锁在一个对象上,神经缩放律的“在一定区间内,增加参数、数据和计算可用平滑幂律预测损失”不能替代本条;边界是胜利混合了数据、算力、增强和架构。若保留失败对象后检验仍不能保持方向,神经缩放律便构成ImageNet转折的近邻反例;NeurIPS对ImageNet转折仅支持原任务。
可核对的主证据是Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105:AlexNet将ImageNet top-5错误率降至15.3%,领先次名十个百分点以上。AlexNet含约6000万个参数和65万个神经元。神经缩放律要求把2012年的ImageNet转折样本与对照结算,再核查神经缩放律的任务、观察窗和胜利混合了数据、算力、增强和架构。对ImageNet转折,神经缩放律仅作近邻;支点仍是Krizhevsky、Sutskever、Hinton在NeurIPS的原始比较。拿神经缩放律作近邻检验,可辨认Krizhevsky、Sutskever、Hinton观察到的是独有路径,还是另一条路线的表面同义词。
ImageNet转折自己留下的反证入口是:胜利混合了数据、算力、增强和架构,不能把全部增益归给“更深”。按亚组分别结算时,Krizhevsky、Sutskever、Hinton的解释可能缩小、反号,或让位给神经缩放律的路径。神经缩放律给出复核NeurIPS的近邻条件:加入反事实条件;ImageNet转折负责记录中止、排除和不显著对象。回到NeurIPS的取样方式,ImageNet转折要用神经缩放律证明原分母没有删去最容易失败的对象。
AlexNet将ImageNet top-5错误率降至15.3%改变登记顺序:模型参数、训练样本与样本外误差归ImageNet转折,数据污染、算力预算与长尾失败交神经缩放律核查。2020年的神经缩放律以“在一定区间内,增加参数、数据和计算可用平滑幂律预测损失”作近邻;两者若结论不同,应以胜利混合了数据、算力、增强和架构为分账边界;神经缩放律不得与本条合成一个平均分。
2012年,ImageNet转折据AlexNet将ImageNet top-5错误率降至15.3%对接第258号第十四条。跨过去,胜利混合了数据、算力、增强和架构迫使ImageNet转折重新检验可见读数。ImageNet转折以胜利混合了数据、算力、增强和架构施加反向压力。该接口若仍支持相反方向,胜利混合了数据、算力、增强和架构要求ImageNet转折增加第三条件,同时容纳两边的失效样本。
丁、Dropout:随机删节点把共适应变成集成近似Dropout
转折并非始于2014年的JMLR:Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov不再允许深度学习在深度学习里的Dropout上继续用训练成功代替泛化解释。Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov逐项核对模型参数、训练样本与样本外误差里的深度学习里的Dropout;数据污染、算力预算与长尾失败由彩票假说另行登记。在JMLR的证据账上,由在视觉、语音和文本任务上降低测试误差起步,彩票假说进入解释对照;本条残差不能靠改名消失。
深度学习里的Dropout的可反驳立场是:训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成。Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov这一路线据此把决定性解释锁在一个对象上,彩票假说的“过参数网络的成功部分来自初始化时存在的稀疏可训练子结构”不能替代本条;边界是保留率与归一化相互作用。若改用地点外资料复核仍不能保持方向,彩票假说便构成深度学习里的Dropout的近邻反例;JMLR对深度学习里的Dropout仅支持原任务。
可核对的主证据是Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958:在视觉、语音和文本任务上降低测试误差,成为早期深网标准正则项。Dropout训练时以约0.5保留概率随机删除隐藏单元。彩票假说要求把2014年的深度学习里的Dropout样本与对照结算,再核查彩票假说的任务、观察窗和保留率与归一化相互作用。对深度学习里的Dropout,彩票假说仅作近邻;支点仍是Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov在JMLR的原始比较。
深度学习里的Dropout自己留下的反证入口是:保留率与归一化相互作用;现代大模型中它并非处处必要。改变任务顺序后追踪时,Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov的解释可能缩小、反号,或让位给彩票假说的路径。彩票假说给出复核JMLR的近邻条件:用盲法重跑关键判断;深度学习里的Dropout负责记录中止、排除和不显著对象。
在视觉、语音和文本任务上降低测试误差改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的Dropout,数据污染、算力预算与长尾失败交彩票假说核查。2019年的彩票假说以“过参数网络的成功部分来自初始化时存在的稀疏可训练子结构”作近邻;两者若结论不同,应以保留率与归一化相互作用为分账边界;彩票假说不得与本条合成一个平均分。
2014年,深度学习里的Dropout据在视觉、语音和文本任务上降低测试误差对接第047号第一幕戊。跨过去,保留率与归一化相互作用迫使深度学习里的Dropout重新检验可见读数。深度学习里的Dropout以保留率与归一化相互作用施加反向压力。该接口若仍支持相反方向,保留率与归一化相互作用要求深度学习里的Dropout增加第三条件,同时容纳两边的失效样本。
戊、序列到序列:固定接口把翻译改成端到端学习Sequence to Sequence Learning
问题的入口是2014年的NeurIPS:Sutskever、Vinyals、Le不再允许深度学习在序列到序列上继续用训练成功代替泛化解释。Sutskever、Vinyals、Le逐项核对模型参数、训练样本与样本外误差里的序列到序列;数据污染、算力预算与长尾失败由深度学习里的Grokking另行登记。在NeurIPS的证据账上,由四层LSTM在WMT英语法语翻译取得34.8 BLEU起步,深度学习里的Grokking进入解释对照;本条残差不能靠改名消失。
序列到序列的可反驳立场是:编码器与解码器可直接从成对序列学习映射,减少手写语言管线。Sutskever、Vinyals、Le这一路线据此把决定性解释锁在一个对象上,深度学习里的Grokking的“训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度”不能替代本条;边界是固定长度向量成为瓶颈。若让替代路径进入对照仍不能保持方向,深度学习里的Grokking便构成序列到序列的近邻反例;NeurIPS对序列到序列仅支持原任务。
可核对的主证据是Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112:四层LSTM在WMT英语法语翻译取得34.8 BLEU,重排源句改善长依赖。4层LSTM在英法翻译取得34.8 BLEU。深度学习里的Grokking要求把2014年的序列到序列样本与对照结算,再核查深度学习里的Grokking的任务、观察窗和固定长度向量成为瓶颈。对序列到序列,深度学习里的Grokking仅作近邻;支点仍是Sutskever、Vinyals、Le在NeurIPS的原始比较。回到NeurIPS的取样方式,序列到序列要用深度学习里的Grokking证明原分母没有删去最容易失败的对象。
序列到序列自己留下的反证入口是:固定长度向量成为瓶颈,长句与稀有词暴露信息压缩上限。让独立团队预注册时,Sutskever、Vinyals、Le的解释可能缩小、反号,或让位给深度学习里的Grokking的路径。深度学习里的Grokking给出复核NeurIPS的近邻条件:将短期与长期拆账;序列到序列负责记录中止、排除和不显著对象。
四层LSTM在WMT英语法语翻译取得34.8 BLEU改变登记顺序:模型参数、训练样本与样本外误差归序列到序列,数据污染、算力预算与长尾失败交深度学习里的Grokking核查。2022年的深度学习里的Grokking以“训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度”作近邻;两者若结论不同,应以固定长度向量成为瓶颈为分账边界;深度学习里的Grokking不得与本条合成一个平均分。
2014年,序列到序列据四层LSTM在WMT英语法语翻译取得34.8 BLEU对接第256号第一条。跨过去,固定长度向量成为瓶颈迫使序列到序列重新检验可见读数。序列到序列以固定长度向量成为瓶颈施加反向压力。该接口若仍支持相反方向,固定长度向量成为瓶颈要求序列到序列增加第三条件,同时容纳两边的失效样本。
己、批归一化:训练分布被纳入网络内部控制Batch Normalization
先看被改写的对象2015年的ICML:Ioffe 与 Szegedy不再允许深度学习在批归一化上继续用训练成功代替泛化解释。Ioffe 与 Szegedy逐项核对模型参数、训练样本与样本外误差里的批归一化;数据污染、算力预算与长尾失败由对抗鲁棒另行登记。在ICML的证据账上,由ImageNet网络以更少训练步达到同等准确率起步,对抗鲁棒进入解释对照;本条残差不能靠改名消失。
批归一化的可反驳立场是:中间激活按小批量标准化,使更大学习率和更深网络可训练。Ioffe 与 Szegedy这一路线据此把决定性解释锁在一个对象上,对抗鲁棒的“鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试”不能替代本条;边界是小批量统计会泄漏样本依赖。若把排除者放回分母仍不能保持方向,对抗鲁棒便构成批归一化的近邻反例;ICML对批归一化仅支持原任务。
可核对的主证据是Ioffe 与 Szegedy,2015 年《ICML》37:448–456:ImageNet网络以更少训练步达到同等准确率,并降低初始化敏感性。批归一化把达到同等精度的训练步数缩短约14倍。对抗鲁棒要求把2015年的批归一化样本与对照结算,再核查对抗鲁棒的任务、观察窗和小批量统计会泄漏样本依赖。对批归一化,对抗鲁棒仅作近邻;支点仍是Ioffe 与 Szegedy在ICML的原始比较。
批归一化自己留下的反证入口是:小批量统计会泄漏样本依赖,训练与推理分布不一致时性能可崩。把不显著结果一并公开时,Ioffe 与 Szegedy的解释可能缩小、反号,或让位给对抗鲁棒的路径。对抗鲁棒给出复核ICML的近邻条件:把人工接管计入结果;批归一化负责记录中止、排除和不显著对象。回到ICML的取样方式,批归一化要用对抗鲁棒证明原分母没有删去最容易失败的对象。
ImageNet网络以更少训练步达到同等准确率改变登记顺序:模型参数、训练样本与样本外误差归批归一化,数据污染、算力预算与长尾失败交对抗鲁棒核查。2018年的对抗鲁棒以“鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试”作近邻;两者若结论不同,应以小批量统计会泄漏样本依赖为分账边界;对抗鲁棒不得与本条合成一个平均分。
2015年,批归一化据ImageNet网络以更少训练步达到同等准确率对接第047号第二幕六读数”。跨过去,小批量统计会泄漏样本依赖迫使批归一化重新检验可见读数。批归一化以小批量统计会泄漏样本依赖施加反向压力。该接口若仍支持相反方向,小批量统计会泄漏样本依赖要求批归一化增加第三条件,同时容纳两边的失效样本。
庚、残差学习:让层学习修正量而非重做全部映射Residual Networks
争论应从2016年的CVPR:He、Zhang、Ren、Sun不再允许深度学习在残差学习上继续用训练成功代替泛化解释。He、Zhang、Ren、Sun逐项核对模型参数、训练样本与样本外误差里的残差学习;数据污染、算力预算与长尾失败由分布外泛化另行登记。在CVPR的证据账上,由ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛起步,分布外泛化进入解释对照;本条残差不能靠改名消失。
残差学习的可反驳立场是:恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差。He、Zhang、Ren、Sun这一路线据此把决定性解释锁在一个对象上,分布外泛化的“模型必须在时间、地点、亚群和采集方式变化下接受分组评估”不能替代本条;边界是深度只是表达预算。若固定资源预算后比较仍不能保持方向,分布外泛化便构成残差学习的近邻反例;CVPR对残差学习仅支持原任务。
可核对的主证据是He、Zhang、Ren、Sun,2016 年《CVPR》:770–778,DOI 10.1109/CVPR.2016.90:ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛。152层残差网在ImageNet测试集取得3.57%错误率。分布外泛化要求把2016年的残差学习样本与对照结算,再核查分布外泛化的任务、观察窗和深度只是表达预算。对残差学习,分布外泛化仅作近邻;支点仍是He、Zhang、Ren、Sun在CVPR的原始比较。回到CVPR的取样方式,残差学习要用分布外泛化证明原分母没有删去最容易失败的对象。
残差学习自己留下的反证入口是:深度只是表达预算;延迟、内存和数据偏差不会因捷径自动消失。按个体轨迹而非均值检查时,He、Zhang、Ren、Sun的解释可能缩小、反号,或让位给分布外泛化的路径。分布外泛化给出复核CVPR的近邻条件:审计数据近邻与泄漏;残差学习负责记录中止、排除和不显著对象。第050号第二幕一“视觉Transformer:图像图块可直接进入自注意力”提供不同尺度的反例;它迫使残差学习把“适用”写成可检查的对象范围。
ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛改变登记顺序:模型参数、训练样本与样本外误差归残差学习,数据污染、算力预算与长尾失败交分布外泛化核查。2021年的分布外泛化以“模型必须在时间、地点、亚群和采集方式变化下接受分组评估”作近邻;两者若结论不同,应以深度只是表达预算为分账边界;分布外泛化不得与本条合成一个平均分。
2016年,残差学习据ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛对接第050号第二幕一。跨过去,深度只是表达预算迫使残差学习重新检验可见读数。残差学习以深度只是表达预算施加反向压力。该接口若仍支持相反方向,深度只是表达预算要求残差学习增加第三条件,同时容纳两边的失效样本。拿分布外泛化作近邻检验,可辨认He、Zhang、Ren、Sun观察到的是独有路径,还是另一条路线的表面同义词。
辛、开源框架:计算图与自动微分把复现成本降到团队可承受Open Deep-Learning Frameworks
历史坐标落在2016年的TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems:Abadi 等不再允许深度学习在开源框架上继续用训练成功代替泛化解释。Abadi 等逐项核对模型参数、训练样本与样本外误差里的开源框架;数据污染、算力预算与长尾失败由效率独立成题另行登记。在TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems的证据账上,由TensorFlow把研究原型、分布式训练和部署接口放进同一系统起步,效率独立成题进入解释对照;本条残差不能靠改名消失。
开源框架的可反驳立场是:统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展。Abadi 等这一路线据此把决定性解释锁在一个对象上,效率独立成题的“模型进步应同时报告训练计算、推理成本和硬件条件”不能替代本条;边界是框架锁定、默认算子和随机性仍会改变结果。若用正交量纲重测仍不能保持方向,效率独立成题便构成开源框架的近邻反例;TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems对开源框架仅支持原任务。
可核对的主证据是Abadi 等,2016 年 arXiv:1603.04467《TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems》:TensorFlow把研究原型、分布式训练和部署接口放进同一系统。TensorFlow把训练从1台机器扩展到数千设备。效率独立成题要求把2016年的开源框架样本与对照结算,再核查效率独立成题的任务、观察窗和框架锁定、默认算子和随机性仍会改变结果。对开源框架,效率独立成题仅作近邻;支点仍是Abadi 等在TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems的原始比较。
开源框架自己留下的反证入口是:框架锁定、默认算子和随机性仍会改变结果;能运行不等于可复现。加入反事实条件时,Abadi 等的解释可能缩小、反号,或让位给效率独立成题的路径。效率独立成题给出复核TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems的近邻条件:先登记停止线再部署;开源框架负责记录中止、排除和不显著对象。
TensorFlow把研究原型、分布式训练和部署接口放进同一系统改变登记顺序:模型参数、训练样本与样本外误差归开源框架,数据污染、算力预算与长尾失败交效率独立成题核查。2020年的效率独立成题以“模型进步应同时报告训练计算、推理成本和硬件条件”作近邻;两者若结论不同,应以框架锁定、默认算子和随机性仍会改变结果为分账边界;效率独立成题不得与本条合成一个平均分。
2016年,开源框架据TensorFlow把研究原型、分布式训练和部署接口放进同一系统对接第249号第九条。跨过去,框架锁定、默认算子和随机性仍会改变结果迫使开源框架重新检验可见读数。开源框架以框架锁定、默认算子和随机性仍会改变结果施加反向压力。该接口若仍支持相反方向,框架锁定、默认算子和随机性仍会改变结果要求开源框架增加第三条件,同时容纳两边的失效样本。
第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。
一、自监督对比学习:标签不再是表示学习的唯一入口Contrastive Self-Supervision
第一处裂缝来自2020年的ICML:Chen、Kornblith、Norouzi、Hinton不再允许深度学习在自监督对比学习上继续用训练成功代替泛化解释。Chen、Kornblith、Norouzi、Hinton逐项核对模型参数、训练样本与样本外误差里的自监督对比学习;数据污染、算力预算与长尾失败由蒸馏另行登记。在ICML的证据账上,由SimCLR在线性评估达到76.5% top-1起步,蒸馏进入解释对照;本条残差不能靠改名消失。
自监督对比学习的可反驳立场是:不同增强视图的一致性可在无人工标签时学习可迁移视觉表示。Chen、Kornblith、Norouzi、Hinton这一路线据此把决定性解释锁在一个对象上,蒸馏的“教师输出与中间注意、隐藏状态可共同压入更小学生模型”不能替代本条;边界是效果高度依赖增强、批量和数据分布。若撤去界面提示再验仍不能保持方向,蒸馏便构成自监督对比学习的近邻反例;ICML对自监督对比学习仅支持原任务。
可核对的主证据是Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607:SimCLR在线性评估达到76.5% top-1,并在少标签条件显著提高样本效率。蒸馏要求把2020年的自监督对比学习样本与对照结算,再核查蒸馏的任务、观察窗和效果高度依赖增强、批量和数据分布。对自监督对比学习,蒸馏仅作近邻;支点仍是Chen、Kornblith、Norouzi、Hinton在ICML的原始比较。回到ICML的取样方式,自监督对比学习要用蒸馏证明原分母没有删去最容易失败的对象。
自监督对比学习自己留下的反证入口是:效果高度依赖增强、批量和数据分布;不恰当不变性会删除任务所需信息。用盲法重跑关键判断时,Chen、Kornblith、Norouzi、Hinton的解释可能缩小、反号,或让位给蒸馏的路径。蒸馏给出复核ICML的近邻条件:换样本后再问;自监督对比学习负责记录中止、排除和不显著对象。拿蒸馏作近邻检验,可辨认Chen、Kornblith、Norouzi、Hinton观察到的是独有路径,还是另一条路线的表面同义词。
SimCLR在线性评估达到76.5% top-1改变登记顺序:模型参数、训练样本与样本外误差归自监督对比学习,数据污染、算力预算与长尾失败交蒸馏核查。2020年的蒸馏以“教师输出与中间注意、隐藏状态可共同压入更小学生模型”作近邻;两者若结论不同,应以效果高度依赖增强、批量和数据分布为分账边界;蒸馏不得与本条合成一个平均分。
2020年,自监督对比学习据SimCLR在线性评估达到76.5% top-1对接第050号第二幕三。跨过去,效果高度依赖增强、批量和数据分布迫使自监督对比学习重新检验可见读数。自监督对比学习以效果高度依赖增强、批量和数据分布施加反向压力。该接口若仍支持相反方向,效果高度依赖增强、批量和数据分布要求自监督对比学习增加第三条件,同时容纳两边的失效样本。
二、掩码自编码:预测缺失部分取代逐对样本比较Masked Autoencoders
研究单位改在2022年的CVPR:He、Chen、Xie 等不再允许深度学习在掩码自编码上继续用训练成功代替泛化解释。He、Chen、Xie 等逐项核对模型参数、训练样本与样本外误差里的掩码自编码;数据污染、算力预算与长尾失败由科学迁移另行登记。在CVPR的证据账上,由MAE遮蔽75%图块起步,科学迁移进入解释对照;本条残差不能靠改名消失。
掩码自编码的可反驳立场是:高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算。He、Chen、Xie 等这一路线据此把决定性解释锁在一个对象上,科学迁移的“深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线”不能替代本条;边界是像素重建偏爱纹理与低频统计。若按亚组分别结算仍不能保持方向,科学迁移便构成掩码自编码的近邻反例;CVPR对掩码自编码仅支持原任务。
可核对的主证据是He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553:MAE遮蔽75%图块,用ViT-H在ImageNet微调达到87.8% top-1。科学迁移要求把2022年的掩码自编码样本与对照结算,再核查科学迁移的任务、观察窗和像素重建偏爱纹理与低频统计。对掩码自编码,科学迁移仅作近邻;支点仍是He、Chen、Xie 等在CVPR的原始比较。回到CVPR的取样方式,掩码自编码要用科学迁移证明原分母没有删去最容易失败的对象。
掩码自编码自己留下的反证入口是:像素重建偏爱纹理与低频统计,迁移到几何和语义任务仍需检验。将短期与长期拆账时,He、Chen、Xie 等的解释可能缩小、反号,或让位给科学迁移的路径。科学迁移给出复核CVPR的近邻条件:把时间窗拉长再看;掩码自编码负责记录中止、排除和不显著对象。拿科学迁移作近邻检验,可辨认He、Chen、Xie 等观察到的是独有路径,还是另一条路线的表面同义词。
MAE遮蔽75%图块改变登记顺序:模型参数、训练样本与样本外误差归掩码自编码,数据污染、算力预算与长尾失败交科学迁移核查。2021年的科学迁移以“深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线”作近邻;两者若结论不同,应以像素重建偏爱纹理与低频统计为分账边界;科学迁移不得与本条合成一个平均分。
2022年,掩码自编码据MAE遮蔽75%图块对接第045号第二幕六。跨过去,像素重建偏爱纹理与低频统计迫使掩码自编码重新检验可见读数。掩码自编码以像素重建偏爱纹理与低频统计施加反向压力。该接口若仍支持相反方向,像素重建偏爱纹理与低频统计要求掩码自编码增加第三条件,同时容纳两边的失效样本。
三、双下降:参数越过插值点后测试误差还能再次下降Double Descent
回到原始设计2019年的PNAS:Belkin、Hsu、Ma、Mandal不再允许深度学习在双下降上继续用训练成功代替泛化解释。Belkin、Hsu、Ma、Mandal逐项核对模型参数、训练样本与样本外误差里的双下降;数据污染、算力预算与长尾失败由数据污染审计另行登记。在PNAS的证据账上,由随机特征、树与神经网络在训练误差刚到零附近出现风险峰起步,数据污染审计进入解释对照;本条残差不能靠改名消失。
双下降的可反驳立场是:经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降。Belkin、Hsu、Ma、Mandal这一路线据此把决定性解释锁在一个对象上,数据污染审计的“开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据”不能替代本条;边界是曲线受优化、噪声和横轴选择影响。若改变任务顺序后追踪仍不能保持方向,数据污染审计便构成双下降的近邻反例;PNAS对双下降仅支持原任务。
可核对的主证据是Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116:随机特征、树与神经网络在训练误差刚到零附近出现风险峰,继续增大模型后下降。数据污染审计要求把2019年的双下降样本与对照结算,再核查数据污染审计的任务、观察窗和曲线受优化、噪声和横轴选择影响。对双下降,数据污染审计仅作近邻;支点仍是Belkin、Hsu、Ma、Mandal在PNAS的原始比较。
双下降自己留下的反证入口是:曲线受优化、噪声和横轴选择影响,不能据此断言规模总能治愈过拟合。把人工接管计入结果时,Belkin、Hsu、Ma、Mandal的解释可能缩小、反号,或让位给数据污染审计的路径。数据污染审计给出复核PNAS的近邻条件:保留失败对象后检验;双下降负责记录中止、排除和不显著对象。
随机特征、树与神经网络在训练误差刚到零附近出现风险峰改变登记顺序:模型参数、训练样本与样本外误差归双下降,数据污染、算力预算与长尾失败交数据污染审计核查。2024年的数据污染审计以“开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据”作近邻;两者若结论不同,应以曲线受优化、噪声和横轴选择影响为分账边界;数据污染审计不得与本条合成一个平均分。
2019年,双下降据随机特征、树与神经网络在训练误差刚到零附近出现风险峰对接第257号第一条。跨过去,曲线受优化、噪声和横轴选择影响迫使双下降重新检验可见读数。双下降以曲线受优化、噪声和横轴选择影响施加反向压力。该接口若仍支持相反方向,曲线受优化、噪声和横轴选择影响要求双下降增加第三条件,同时容纳两边的失效样本。
四、神经缩放律:损失随模型、数据和计算呈近似幂律Neural Scaling Laws
这一路线先拆掉2020年的Scaling Laws for Neural Language Models:Kaplan 等不再允许深度学习在神经缩放律上继续用训练成功代替泛化解释。Kaplan 等逐项核对模型参数、训练样本与样本外误差里的神经缩放律;数据污染、算力预算与长尾失败由深层信念网另行登记。在Scaling Laws for Neural Language Models的证据账上,由跨七个数量级实验给出计算最优配比并影响训练预算规划起步,深层信念网进入解释对照;本条残差不能靠改名消失。
神经缩放律的可反驳立场是:在一定区间内,增加参数、数据和计算可用平滑幂律预测损失。Kaplan 等这一路线据此把决定性解释锁在一个对象上,深层信念网的“无监督逐层预训练先找到参数盆地,再用监督信号整体微调”不能替代本条;边界是外推会遇到数据质量、任务饱和和能力断点。若让独立团队预注册仍不能保持方向,深层信念网便构成神经缩放律的近邻反例;Scaling Laws for Neural Language Models对神经缩放律仅支持原任务。
可核对的主证据是Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》:跨七个数量级实验给出计算最优配比并影响训练预算规划。缩放实验横跨约7个数量级。深层信念网要求把2020年的神经缩放律样本与对照结算,再核查深层信念网的任务、观察窗和外推会遇到数据质量、任务饱和和能力断点。对神经缩放律,深层信念网仅作近邻;支点仍是Kaplan 等在Scaling Laws for Neural Language Models的原始比较。
神经缩放律自己留下的反证入口是:外推会遇到数据质量、任务饱和和能力断点;损失下降不等于风险下降。审计数据近邻与泄漏时,Kaplan 等的解释可能缩小、反号,或让位给深层信念网的路径。深层信念网给出复核Scaling Laws for Neural Language Models的近邻条件:改用地点外资料复核;神经缩放律负责记录中止、排除和不显著对象。
跨七个数量级实验给出计算最优配比并影响训练预算规划改变登记顺序:模型参数、训练样本与样本外误差归神经缩放律,数据污染、算力预算与长尾失败交深层信念网核查。2006年的深层信念网以“无监督逐层预训练先找到参数盆地,再用监督信号整体微调”作近邻;两者若结论不同,应以外推会遇到数据质量、任务饱和和能力断点为分账边界;深层信念网不得与本条合成一个平均分。
2020年,神经缩放律据跨七个数量级实验给出计算最优配比并影响训练预算规划对接第044号第二幕五。跨过去,外推会遇到数据质量、任务饱和和能力断点迫使神经缩放律重新检验可见读数。神经缩放律以外推会遇到数据质量、任务饱和和能力断点施加反向压力。该接口若仍支持相反方向,外推会遇到数据质量、任务饱和和能力断点要求神经缩放律增加第三条件,同时容纳两边的失效样本。
五、彩票假说:大网络里可能藏着可单独训练的稀疏子网Lottery Tickets
需要先恢复2019年的ICLR:Frankle 与 Carbin不再允许深度学习在彩票假说上继续用训练成功代替泛化解释。Frankle 与 Carbin逐项核对模型参数、训练样本与样本外误差里的彩票假说;数据污染、算力预算与长尾失败由深度学习里的ReLU另行登记。在ICLR的证据账上,由迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网起步,深度学习里的ReLU进入解释对照;本条残差不能靠改名消失。
彩票假说的可反驳立场是:过参数网络的成功部分来自初始化时存在的稀疏可训练子结构。Frankle 与 Carbin这一路线据此把决定性解释锁在一个对象上,深度学习里的ReLU的“非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示”不能替代本条;边界是大规模任务对原始初始化和训练日程敏感。若把不显著结果一并公开仍不能保持方向,深度学习里的ReLU便构成彩票假说的近邻反例;ICLR对彩票假说仅支持原任务。
可核对的主证据是Frankle 与 Carbin,2019 年《ICLR》论文“The Lottery Ticket Hypothesis”:迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网。深度学习里的ReLU要求把2019年的彩票假说样本与对照结算,再核查深度学习里的ReLU的任务、观察窗和大规模任务对原始初始化和训练日程敏感。对彩票假说,深度学习里的ReLU仅作近邻;支点仍是Frankle 与 Carbin在ICLR的原始比较。
彩票假说自己留下的反证入口是:大规模任务对原始初始化和训练日程敏感,事后找到不等于事前可预测。先登记停止线再部署时,Frankle 与 Carbin的解释可能缩小、反号,或让位给深度学习里的ReLU的路径。深度学习里的ReLU给出复核ICLR的近邻条件:让替代路径进入对照;彩票假说负责记录中止、排除和不显著对象。
迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网改变登记顺序:模型参数、训练样本与样本外误差归彩票假说,数据污染、算力预算与长尾失败交深度学习里的ReLU核查。2011年的深度学习里的ReLU以“非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示”作近邻;两者若结论不同,应以大规模任务对原始初始化和训练日程敏感为分账边界;深度学习里的ReLU不得与本条合成一个平均分。
2019年,彩票假说据迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网对接第248号第十四条。跨过去,大规模任务对原始初始化和训练日程敏感迫使彩票假说重新检验可见读数。彩票假说以大规模任务对原始初始化和训练日程敏感施加反向压力。该接口若仍支持相反方向,大规模任务对原始初始化和训练日程敏感要求彩票假说增加第三条件,同时容纳两边的失效样本。
六、Grokking:记住训练集之后还可能突然学会规则Grokking
证据链从2022年的Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets:Power 等不再允许深度学习在深度学习里的Grokking上继续用训练成功代替泛化解释。Power 等逐项核对模型参数、训练样本与样本外误差里的深度学习里的Grokking;数据污染、算力预算与长尾失败由ImageNet转折另行登记。在Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的证据账上,由模运算任务中起步,ImageNet转折进入解释对照;本条残差不能靠改名消失。第047号第二幕八“缩放律:经验幂律成为预算预测而非机制解释”提供不同尺度的反例;它迫使深度学习里的Grokking把“适用”写成可检查的对象范围。
深度学习里的Grokking的可反驳立场是:训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度。Power 等这一路线据此把决定性解释锁在一个对象上,ImageNet转折的“深卷积网络在大规模标注与GPU训练下显著拉开视觉误差”不能替代本条;边界是现象集中在合成小任务。若按个体轨迹而非均值检查仍不能保持方向,ImageNet转折便构成深度学习里的Grokking的近邻反例;Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets对深度学习里的Grokking仅支持原任务。
可核对的主证据是Power 等,2022 年 arXiv:2201.02177《Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets》:模运算任务中,模型先记忆样本,再在持续训练与正则化下形成可泛化结构。ImageNet转折要求把2022年的深度学习里的Grokking样本与对照结算,再核查ImageNet转折的任务、观察窗和现象集中在合成小任务。对深度学习里的Grokking,ImageNet转折仅作近邻;支点仍是Power 等在Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的原始比较。回到Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的取样方式,深度学习里的Grokking要用ImageNet转折证明原分母没有删去最容易失败的对象。
深度学习里的Grokking自己留下的反证入口是:现象集中在合成小任务,阈值受权重衰减与数据量控制,不能直接类比开放世界推理。换样本后再问时,Power 等的解释可能缩小、反号,或让位给ImageNet转折的路径。ImageNet转折给出复核Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的近邻条件:把排除者放回分母;深度学习里的Grokking负责记录中止、排除和不显著对象。拿ImageNet转折作近邻检验,可辨认Power 等观察到的是独有路径,还是另一条路线的表面同义词。
模运算任务中改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的Grokking,数据污染、算力预算与长尾失败交ImageNet转折核查。2012年的ImageNet转折以“深卷积网络在大规模标注与GPU训练下显著拉开视觉误差”作近邻;两者若结论不同,应以现象集中在合成小任务为分账边界;ImageNet转折不得与本条合成一个平均分。
2022年,深度学习里的Grokking据模运算任务中对接第047号第二幕八。跨过去,现象集中在合成小任务迫使深度学习里的Grokking重新检验可见读数。深度学习里的Grokking以现象集中在合成小任务施加反向压力。该接口若仍支持相反方向,现象集中在合成小任务要求深度学习里的Grokking增加第三条件,同时容纳两边的失效样本。
七、对抗鲁棒:高准确率模型可被人眼不可见扰动击穿Adversarial Robustness
决定性变化始于2018年的ICLR:Madry、Makelov、Schmidt、Tsipras、Vladu不再允许深度学习在对抗鲁棒上继续用训练成功代替泛化解释。Madry、Makelov、Schmidt、Tsipras、Vladu逐项核对模型参数、训练样本与样本外误差里的对抗鲁棒;数据污染、算力预算与长尾失败由深度学习里的Dropout另行登记。在ICLR的证据账上,由投影梯度对抗训练在MNIST和CIFAR建立可重复强基线起步,深度学习里的Dropout进入解释对照;本条残差不能靠改名消失。
对抗鲁棒的可反驳立场是:鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试。Madry、Makelov、Schmidt、Tsipras、Vladu这一路线据此把决定性解释锁在一个对象上,深度学习里的Dropout的“训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成”不能替代本条;边界是一个范数球不代表现实攻击。若加入反事实条件仍不能保持方向,深度学习里的Dropout便构成对抗鲁棒的近邻反例;ICLR对对抗鲁棒仅支持原任务。
可核对的主证据是Madry、Makelov、Schmidt、Tsipras、Vladu,2018 年《ICLR》论文“Towards Deep Learning Models Resistant to Adversarial Attacks”:投影梯度对抗训练在MNIST和CIFAR建立可重复强基线。深度学习里的Dropout要求把2018年的对抗鲁棒样本与对照结算,再核查深度学习里的Dropout的任务、观察窗和一个范数球不代表现实攻击。对对抗鲁棒,深度学习里的Dropout仅作近邻;支点仍是Madry、Makelov、Schmidt、Tsipras、Vladu在ICLR的原始比较。回到ICLR的取样方式,对抗鲁棒要用深度学习里的Dropout证明原分母没有删去最容易失败的对象。
对抗鲁棒自己留下的反证入口是:一个范数球不代表现实攻击,鲁棒训练还会付出准确率与算力代价。把时间窗拉长再看时,Madry、Makelov、Schmidt、Tsipras、Vladu的解释可能缩小、反号,或让位给深度学习里的Dropout的路径。深度学习里的Dropout给出复核ICLR的近邻条件:固定资源预算后比较;对抗鲁棒负责记录中止、排除和不显著对象。
投影梯度对抗训练在MNIST和CIFAR建立可重复强基线改变登记顺序:模型参数、训练样本与样本外误差归对抗鲁棒,数据污染、算力预算与长尾失败交深度学习里的Dropout核查。2014年的深度学习里的Dropout以“训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成”作近邻;两者若结论不同,应以一个范数球不代表现实攻击为分账边界;深度学习里的Dropout不得与本条合成一个平均分。
2018年,对抗鲁棒据投影梯度对抗训练在MNIST和CIFAR建立可重复强基线对接第257号第十三条。跨过去,一个范数球不代表现实攻击迫使对抗鲁棒重新检验可见读数。对抗鲁棒以一个范数球不代表现实攻击施加反向压力。该接口若仍支持相反方向,一个范数球不代表现实攻击要求对抗鲁棒增加第三条件,同时容纳两边的失效样本。
八、分布外泛化:独立同分布验证不能担保部署Out-of-Distribution Generalization
最早被迫重写的是2021年的ICML:Koh 等不再允许深度学习在分布外泛化上继续用训练成功代替泛化解释。Koh 等逐项核对模型参数、训练样本与样本外误差里的分布外泛化;数据污染、算力预算与长尾失败由序列到序列另行登记。在ICML的证据账上,由WILDS汇集医疗、遥感、动物和文本数据起步,序列到序列进入解释对照;本条残差不能靠改名消失。
分布外泛化的可反驳立场是:模型必须在时间、地点、亚群和采集方式变化下接受分组评估。Koh 等这一路线据此把决定性解释锁在一个对象上,序列到序列的“编码器与解码器可直接从成对序列学习映射,减少手写语言管线”不能替代本条;边界是基准切分只覆盖已知变化。若用盲法重跑关键判断仍不能保持方向,序列到序列便构成分布外泛化的近邻反例;ICML对分布外泛化仅支持原任务。
可核对的主证据是Koh 等,2021 年《ICML》139:5637–5664:WILDS汇集医疗、遥感、动物和文本数据,显示标准经验风险最小化常难被复杂方法稳定超过。序列到序列要求把2021年的分布外泛化样本与对照结算,再核查序列到序列的任务、观察窗和基准切分只覆盖已知变化。对分布外泛化,序列到序列仅作近邻;支点仍是Koh 等在ICML的原始比较。
分布外泛化自己留下的反证入口是:基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络。保留失败对象后检验时,Koh 等的解释可能缩小、反号,或让位给序列到序列的路径。序列到序列给出复核ICML的近邻条件:用正交量纲重测;分布外泛化负责记录中止、排除和不显著对象。回到ICML的取样方式,分布外泛化要用序列到序列证明原分母没有删去最容易失败的对象。
WILDS汇集医疗、遥感、动物和文本数据改变登记顺序:模型参数、训练样本与样本外误差归分布外泛化,数据污染、算力预算与长尾失败交序列到序列核查。2014年的序列到序列以“编码器与解码器可直接从成对序列学习映射,减少手写语言管线”作近邻;两者若结论不同,应以基准切分只覆盖已知变化为分账边界;序列到序列不得与本条合成一个平均分。
2021年,分布外泛化据WILDS汇集医疗、遥感、动物和文本数据对接第258号第三条。跨过去,基准切分只覆盖已知变化迫使分布外泛化重新检验可见读数。分布外泛化以基准切分只覆盖已知变化施加反向压力。该接口若仍支持相反方向,基准切分只覆盖已知变化要求分布外泛化增加第三条件,同时容纳两边的失效样本。
九、效率独立成题:准确率要除以能耗、内存与延迟Efficient Deep Learning
这一条先处理2020年的Communications of the ACM:Schwartz、Dodge、Smith、Etzioni不再允许深度学习在效率独立成题上继续用训练成功代替泛化解释。Schwartz、Dodge、Smith、Etzioni逐项核对模型参数、训练样本与样本外误差里的效率独立成题;数据污染、算力预算与长尾失败由批归一化另行登记。在Communications of the ACM的证据账上,由Green AI提出把效率作为主要评价而非脚注起步,批归一化进入解释对照;本条残差不能靠改名消失。
效率独立成题的可反驳立场是:模型进步应同时报告训练计算、推理成本和硬件条件。Schwartz、Dodge、Smith、Etzioni这一路线据此把决定性解释锁在一个对象上,批归一化的“中间激活按小批量标准化,使更大学习率和更深网络可训练”不能替代本条;边界是能耗依赖地区电网和硬件利用率。若将短期与长期拆账仍不能保持方向,批归一化便构成效率独立成题的近邻反例;Communications of the ACM对效率独立成题仅支持原任务。
可核对的主证据是Schwartz、Dodge、Smith、Etzioni,2020 年《Communications of the ACM》63(12):54–63,DOI 10.1145/3381831:Green AI提出把效率作为主要评价而非脚注,暴露同等精度下数十倍成本差。批归一化要求把2020年的效率独立成题样本与对照结算,再核查批归一化的任务、观察窗和能耗依赖地区电网和硬件利用率。对效率独立成题,批归一化仅作近邻;支点仍是Schwartz、Dodge、Smith、Etzioni在Communications of the ACM的原始比较。回到Communications of the ACM的取样方式,效率独立成题要用批归一化证明原分母没有删去最容易失败的对象。
效率独立成题自己留下的反证入口是:能耗依赖地区电网和硬件利用率,单一FLOPs也不能代表环境与服务成本。改用地点外资料复核时,Schwartz、Dodge、Smith、Etzioni的解释可能缩小、反号,或让位给批归一化的路径。批归一化给出复核Communications of the ACM的近邻条件:撤去界面提示再验;效率独立成题负责记录中止、排除和不显著对象。
Green AI提出把效率作为主要评价而非脚注改变登记顺序:模型参数、训练样本与样本外误差归效率独立成题,数据污染、算力预算与长尾失败交批归一化核查。2015年的批归一化以“中间激活按小批量标准化,使更大学习率和更深网络可训练”作近邻;两者若结论不同,应以能耗依赖地区电网和硬件利用率为分账边界;批归一化不得与本条合成一个平均分。
2020年,效率独立成题据Green AI提出把效率作为主要评价而非脚注对接第251号第十六条。跨过去,能耗依赖地区电网和硬件利用率迫使效率独立成题重新检验可见读数。效率独立成题以能耗依赖地区电网和硬件利用率施加反向压力。该接口若仍支持相反方向,能耗依赖地区电网和硬件利用率要求效率独立成题增加第三条件,同时容纳两边的失效样本。
十、蒸馏:小模型同时学习软分布与中间表示Knowledge Distillation
原论文正面碰到2020年的Findings of EMNLP:Jiao、Yin、Shang 等不再允许深度学习在蒸馏上继续用训练成功代替泛化解释。Jiao、Yin、Shang 等逐项核对模型参数、训练样本与样本外误差里的蒸馏;数据污染、算力预算与长尾失败由残差学习另行登记。在Findings of EMNLP的证据账上,由TinyBERT把模型缩小约7.5倍、推理加速约9.4倍起步,残差学习进入解释对照;本条残差不能靠改名消失。
蒸馏的可反驳立场是:教师输出与中间注意、隐藏状态可共同压入更小学生模型。Jiao、Yin、Shang 等这一路线据此把决定性解释锁在一个对象上,残差学习的“恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差”不能替代本条;边界是学生会继承教师偏差与盲点。若把人工接管计入结果仍不能保持方向,残差学习便构成蒸馏的近邻反例;Findings of EMNLP对蒸馏仅支持原任务。
可核对的主证据是Jiao、Yin、Shang 等,2020 年《Findings of EMNLP》:4163–4174,DOI 10.18653/v1/2020.findings-emnlp.372:TinyBERT把模型缩小约7.5倍、推理加速约9.4倍,并保留九成以上任务表现。残差学习要求把2020年的蒸馏样本与对照结算,再核查残差学习的任务、观察窗和学生会继承教师偏差与盲点。对蒸馏,残差学习仅作近邻;支点仍是Jiao、Yin、Shang 等在Findings of EMNLP的原始比较。回到Findings of EMNLP的取样方式,蒸馏要用残差学习证明原分母没有删去最容易失败的对象。
蒸馏自己留下的反证入口是:学生会继承教师偏差与盲点;压缩后的相似准确率不代表相似校准。让替代路径进入对照时,Jiao、Yin、Shang 等的解释可能缩小、反号,或让位给残差学习的路径。残差学习给出复核Findings of EMNLP的近邻条件:按亚组分别结算;蒸馏负责记录中止、排除和不显著对象。拿残差学习作近邻检验,可辨认Jiao、Yin、Shang 等观察到的是独有路径,还是另一条路线的表面同义词。
TinyBERT把模型缩小约7.5倍、推理加速约9.4倍改变登记顺序:模型参数、训练样本与样本外误差归蒸馏,数据污染、算力预算与长尾失败交残差学习核查。2016年的残差学习以“恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差”作近邻;两者若结论不同,应以学生会继承教师偏差与盲点为分账边界;残差学习不得与本条合成一个平均分。
2020年,蒸馏据TinyBERT把模型缩小约7.5倍、推理加速约9.4倍对接第050号第二幕二。跨过去,学生会继承教师偏差与盲点迫使蒸馏重新检验可见读数。蒸馏以学生会继承教师偏差与盲点施加反向压力。该接口若仍支持相反方向,学生会继承教师偏差与盲点要求蒸馏增加第三条件,同时容纳两边的失效样本。第050号第二幕二“可提示分割:点、框和粗掩码成为通用视觉接口”提供不同尺度的反例;它迫使蒸馏把“适用”写成可检查的对象范围。
十一、科学迁移:高分基准不等于物理与生物规律被学会Deep Learning for Science
方法转向发生在2021年的Nature:Jumper 等不再允许深度学习在科学迁移上继续用训练成功代替泛化解释。Jumper 等逐项核对模型参数、训练样本与样本外误差里的科学迁移;数据污染、算力预算与长尾失败由开源框架另行登记。在Nature的证据账上,由AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度起步,开源框架进入解释对照;本条残差不能靠改名消失。
科学迁移的可反驳立场是:深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线。Jumper 等这一路线据此把决定性解释锁在一个对象上,开源框架的“统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展”不能替代本条;边界是高置信结构不等于动力学、结合与细胞情境。若审计数据近邻与泄漏仍不能保持方向,开源框架便构成科学迁移的近邻反例;Nature对科学迁移仅支持原任务。
可核对的主证据是Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2:AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度。AlphaFold在CASP14多数目标达到接近实验结构的原子级精度。开源框架要求把2021年的科学迁移样本与对照结算,再核查开源框架的任务、观察窗和高置信结构不等于动力学、结合与细胞情境。对科学迁移,开源框架仅作近邻;支点仍是Jumper 等在Nature的原始比较。
科学迁移自己留下的反证入口是:高置信结构不等于动力学、结合与细胞情境;数据库覆盖决定可预测范围。把排除者放回分母时,Jumper 等的解释可能缩小、反号,或让位给开源框架的路径。开源框架给出复核Nature的近邻条件:改变任务顺序后追踪;科学迁移负责记录中止、排除和不显著对象。
AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度改变登记顺序:模型参数、训练样本与样本外误差归科学迁移,数据污染、算力预算与长尾失败交开源框架核查。2016年的开源框架以“统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展”作近邻;两者若结论不同,应以高置信结构不等于动力学、结合与细胞情境为分账边界;开源框架不得与本条合成一个平均分。
2021年,科学迁移据AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度对接第027号第二幕二。跨过去,高置信结构不等于动力学、结合与细胞情境迫使科学迁移重新检验可见读数。科学迁移以高置信结构不等于动力学、结合与细胞情境施加反向压力。该接口若仍支持相反方向,高置信结构不等于动力学、结合与细胞情境要求科学迁移增加第三条件,同时容纳两边的失效样本。
十二、数据污染审计:测试集一旦进入训练就失去裁判资格Benchmark Contamination
这项工作首先校正2024年的Rethinking Benchmark and Contamination for Language Models with Rephrased Samples:Deng 等不再允许深度学习在数据污染审计上继续用训练成功代替泛化解释。Deng 等逐项核对模型参数、训练样本与样本外误差里的数据污染审计;数据污染、算力预算与长尾失败由自监督对比学习另行登记。在Rethinking Benchmark and Contamination for Language Models with Rephrased Samples的证据账上,由对题目复述与成员推断的实验显示起步,自监督对比学习进入解释对照;本条残差不能靠改名消失。
数据污染审计的可反驳立场是:开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据。Deng 等这一路线据此把决定性解释锁在一个对象上,自监督对比学习的“不同增强视图的一致性可在无人工标签时学习可迁移视觉表示”不能替代本条;边界是检测器也会误判常识重合。若先登记停止线再部署仍不能保持方向,自监督对比学习便构成数据污染审计的近邻反例;Rethinking Benchmark and Contamination for Language Models with Rephrased Samples对数据污染审计仅支持原任务。
可核对的主证据是Deng 等,2024 年 arXiv:2403.10131《Rethinking Benchmark and Contamination for Language Models with Rephrased Samples》:对题目复述与成员推断的实验显示,精确去重无法覆盖语义近邻泄漏。自监督对比学习要求把2024年的数据污染审计样本与对照结算,再核查自监督对比学习的任务、观察窗和检测器也会误判常识重合。对数据污染审计,自监督对比学习仅作近邻;支点仍是Deng 等在Rethinking Benchmark and Contamination for Language Models with Rephrased Samples的原始比较。
数据污染审计自己留下的反证入口是:检测器也会误判常识重合;无污染声明不是清白证明,需要封闭新题与时间切分。固定资源预算后比较时,Deng 等的解释可能缩小、反号,或让位给自监督对比学习的路径。自监督对比学习给出复核Rethinking Benchmark and Contamination for Language Models with Rephrased Samples的近邻条件:让独立团队预注册;数据污染审计负责记录中止、排除和不显著对象。
对题目复述与成员推断的实验显示改变登记顺序:模型参数、训练样本与样本外误差归数据污染审计,数据污染、算力预算与长尾失败交自监督对比学习核查。2020年的自监督对比学习以“不同增强视图的一致性可在无人工标签时学习可迁移视觉表示”作近邻;两者若结论不同,应以检测器也会误判常识重合为分账边界;自监督对比学习不得与本条合成一个平均分。
2024年,数据污染审计据对题目复述与成员推断的实验显示对接第258号第十七条。跨过去,检测器也会误判常识重合迫使数据污染审计重新检验可见读数。数据污染审计以检测器也会误判常识重合施加反向压力。该接口若仍支持相反方向,检测器也会误判常识重合要求数据污染审计增加第三条件,同时容纳两边的失效样本。
◎ 二十年连起来看
第一幕不是旧成果清单,而是深度学习第一次为自己建立可失败的比较尺。深层信念网收紧了旧默认,深度学习里的Dropout把隐含过程拆成可估参数,开源框架又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。
第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。自监督对比学习扩展了表示或分布,对抗鲁棒改变了研究单位,数据污染审计则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。
二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。ImageNet转折说明干预能改变路径,神经缩放律说明单一读数会混合层级,蒸馏又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。
◎ 三个常见误解
误解一:深度学习里的ReLU已经给出了稳定的通用解释。它容易取信,是因为非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示确实改变了旧的研究方式。但死亡单元与尺度爆炸仍在,激活函数不能替代初始化、归一化和数据设计,所以正确表述只能限于原设计可识别的那一段责任链。
误解二:双下降等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降仍只是一个可检验命题。曲线受优化、噪声和横轴选择影响,不能据此断言规模总能治愈过拟合说明,没有干预、替代解释和边界样本,可读不等于因果正确。
误解三:科学迁移的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把高置信结构不等于动力学、结合与细胞情境;数据库覆盖决定可预测范围藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。
◎ 与相邻领域的接口
深层信念网与第047号第二幕四“神经切线核:无限宽网络在训练初期近似核回归”的分工在于:本页负责无监督逐层预训练先找到参数盆地,再用监督信号整体微调,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。
残差学习可与第050号第二幕一“视觉Transformer:图像图块可直接进入自注意力”交换制度或工程中的回写证据。前者的核心命题是恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差,但深度只是表达预算;延迟、内存和数据偏差不会因捷径自动消失;后者则能检验同一接口是否把选择成本转移给了另一个主体。
分布外泛化与第258号第三条“协变量漂移把训练集与部署集区分成两个分布”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。
◎ 争议现场
序列到序列的争议是固定长度向量成为瓶颈,长句与稀有词暴露信息压缩上限。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。
神经缩放律的争议是外推会遇到数据质量、任务饱和和能力断点;损失下降不等于风险下降。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。
蒸馏的争议是学生会继承教师偏差与盲点;压缩后的相似准确率不代表相似校准。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。
◎ 往下五年看什么
到2031年,看自监督对比学习的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。
看彩票假说在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。
看效率独立成题的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。
看数据污染审计的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。
◎ 可与哪些领域对撞
深层信念网与第047号第二幕四“神经切线核:无限宽网络在训练初期近似核回归”共享“可见读数能代表真实对象”的预设。本条用收益依赖当时初始化和数据规模,后来的归一化与残差结构会改变必要性给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。
开源框架与第249号第九条“多层中间表示”共享“局部表现能够结算整体能力”的预设。开源框架主张统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。
分布外泛化与第258号第三条“协变量漂移把训练集与部署集区分成两个分布”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。
◎ 十条可做的研究命题
- 在时间外数据上重做深层信念网;方向保持率低于二分之一即证伪其稳定性。
- 把深度学习里的ReLU的中止与排除对象放回分母;主效应反号即否定原总结。
- 为ImageNet转折配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
- 由独立团队预注册深度学习里的Dropout的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
- 对序列到序列的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
- 主动改变批归一化的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
- 对双下降做反事实干预;可视化不随关键参数变化即证伪忠实性。
- 把对抗鲁棒交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
- 公开科学迁移的最强失败实现;下一方法只在原基准改善即判定为换题。
- 为数据污染审计事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。
◎ 资料核验
- Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527。
- Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323。
- Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105。
- Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958。
- Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112。
- Ioffe 与 Szegedy,2015 年《ICML》37:448–456。
- He、Zhang、Ren、Sun,2016 年《CVPR》:770–778,DOI 10.1109/CVPR.2016.90。
- Abadi 等,2016 年 arXiv:1603.04467《TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems》。
- Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607。
- He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553。
- Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116。
- Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》。
- Frankle 与 Carbin,2019 年《ICLR》论文“The Lottery Ticket Hypothesis”。
- Power 等,2022 年 arXiv:2201.02177《Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets》。
- Madry、Makelov、Schmidt、Tsipras、Vladu,2018 年《ICLR》论文“Towards Deep Learning Models Resistant to Adversarial Attacks”。
- Koh 等,2021 年《ICML》139:5637–5664。
- Schwartz、Dodge、Smith、Etzioni,2020 年《Communications of the ACM》63(12):54–63,DOI 10.1145/3381831。
- Jiao、Yin、Shang 等,2020 年《Findings of EMNLP》:4163–4174,DOI 10.18653/v1/2020.findings-emnlp.372。
- Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2。
- Deng 等,2024 年 arXiv:2403.10131《Rethinking Benchmark and Contamination for Language Models with Rephrased Samples》。
- Kirchenbauer 等,2024 年《ICLR 2024》论文“On the Reliability of Watermarks for Large Language Models”。
- Dubey 等,2024 年 arXiv:2407.21783《The Llama 3 Herd of Models》。
- Gu 与 Dao,2024 年《COLM 2024》论文“Mamba: Linear-Time Sequence Modeling with Selective State Spaces”。
- DeepSeek-AI,2025 年 arXiv:2501.12948《DeepSeek-R1》。
以下二十条是深度学习在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。
经一、感知机:第一台自己调参数的机器,和它被吹出去的那部分Classic 01 · Deep Learning
此前的机器都要人把规则写完,感知机第一次把规则交给数据:给样例、看错在哪、按错的方向挪权重。这个循环今天仍是所有监督学习的内核。硬件实现也很重要——它证明这不是纸上算法,四百个光电管接进去就能识别简单图形。
问题出在演示到宣称的那一步。当时的报道称这台机器将能行走、说话、书写、自我复制并意识到自身存在,而实际能力是线性可分类别的分类。这段落差在此后二十年里被反复引用为「神经网络言过其实」的证据,其代价由整个方向承担。经典层收它,一半是收算法,一半是收这份代价。
经二、最小均方规则:让机器一边工作一边改自己Classic 02 · Deep Learning
LMS 与感知机同年,路线却不同:感知机按分类对错更新,LMS 按连续误差的平方更新。后者可微、可分析、有收敛条件,因而立刻进了工程——今天的调制解调器、回声消除与降噪耳机里跑的仍是它的后代。这是神经网络研究最早也最持久的一次工业兑现。
它同时把一个至今没消失的麻烦摆了出来:稳定收敛的学习率上界由输入信号的功率决定,输入尺度一变就要重调。半个世纪里这靠预处理与人工调参解决,代价是每换一个数据集就要重来一遍。把「输入分布」从外部预处理挪进网络内部,是这条老问题的最终解法。
经三、感知机收敛定理:能不能学会,取决于两类点离得多开Classic 03 · Deep Learning
这条定理把一个经验算法变成了可分析的对象:它不保证学得快,但保证在有限步内停。更要紧的是它指出了决定难度的量——不是样本数,不是维度,而是间隔与数据半径之比。学习的难度第一次有了一个几何量作为刻度。
间隔这个量后来两次改变领域面貌。第一次是支持向量机把「最大化间隔」变成显式目标,得到当时最好的泛化界。第二次出乎意料:深度网络在测试集上准确率极高,而决策边界离真实样本极近——沿某个方向挪动一点点就换类。准确率与间隔在深网上分了家,这正是对抗样本的几何解释。
经四、多层网络的随机梯度:深层不是不能训,是没人接着训Classic 04 · Deep Learning
这项工作比通行叙事早了近二十年:它已经给出了多层网络加随机梯度的完整配方,也报告了可用的实验结果。它没有改变领域走向,主要不是因为想法不对,而是因为发表语言、期刊圈层与当时缺乏算力和数据这三件事叠在一起。
它的存在改写了「为什么深层训练迟到」的解释。常见说法是「反向传播直到 1986 年才被发明」,而更准确的说法是:方法在文献里出现过多次,每次都因为缺少可复现的规模化证据而没有被接住。这条经典因此是关于领域记忆的:一个方法是否算数,取决于有没有人在可比较的条件下把它做给别人看。
经五、《感知机》一书:一份严格的能力证明,被读成了一纸死刑Classic 05 · Deep Learning
这本书的数学是干净的:它精确刻画了单层结构能与不能表示什么,其中连通性判定的结论至今成立。它做的是能力上界的证明,而不是对整个研究方向的判决——书里明确说到多层网络的情形是开放的。
被广泛接受的却是那个更强也更省事的读法。这里值得记的不是谁误读了谁,而是误读的结构:一个在明确条件下成立的否定结论,被搬到条件之外当成普遍结论。今天在机器学习里,同一结构以另一种形式反复出现——在独立同分布的测试集上验证通过,就被当作在部署环境里也成立。
经六、自动微分的逆向模式:先有工具,二十年后才有用武之地Classic 06 · Deep Learning
这条结果的分量常被低估:它说的不是「可以求导」,而是「求全部导数的代价与求一次函数值同阶」。若不是这样,参数量上亿的模型每一步都要做上亿次前向计算,训练在算术上就不成立。整个深度学习的可行性建立在这条复杂度结论上。
它同样是一条「工具先到、用途后到」的经典。二十年里它属于数值分析,与神经网络的文献几乎不交叉;反向传播被反复重新发现,正是因为发现者往往不知道这件事早已被一般地解决了。今天框架把它藏进一行调用,代价是很少有人再意识到它是一条有前提的复杂度定理。
经七、新认知机:卷积、池化与整流单元,一次全在里面了Classic 07 · Deep Learning
今天卷积网络的三件核心结构——局部连接、权值共享、池化——在这里已经同时具备,而且动机不是工程便利而是视觉皮层的简单细胞与复杂细胞。它给出的是一整套架构假设:不变性不该靠数据量堆出来,该由结构本身保证。
它与后来主流的差别只在学习规则:无监督的竞争学习换成了带标签的反向传播。这一点值得记,因为它说明结构与学习算法是两笔账,可以分别更换。同样值得记的是整流线性单元——它在这里就在用,被饱和型激活压了三十年,直到梯度问题变得无法回避才被翻出来。
经八、Hopfield 网络:把记忆写成一个能量函数的谷底Classic 08 · Deep Learning
这条命题把「记忆」从存取地址改成了动力学:不需要知道存在哪里,给一个残缺的输入,系统自己滚到最近的谷底。内容寻址、容错、自动补全,全都是这一个机制的后果。它同时把统计物理的整套语言引进来,让「网络会不会收敛」成为可以证明的问题。
它的边界也很硬。存储容量与神经元数成正比而系数很小,超出后模式互相干扰;能量面上还会长出没存过的虚假谷底。这两条限制说明「联想记忆」不是免费的,而现代模型对同一问题的回答是把补全从吸引子动力学换成条件概率建模——要补的东西一样,代价结构完全不同,容量也不再由神经元数直接封顶。
经九、玻尔兹曼机:不给标签,让网络自己去匹配数据的分布Classic 09 · Deep Learning
这是第一个把学习明确写成分布匹配的神经网络:不问「分类对不对」,只问「我生成的东西像不像看到的东西」。隐单元因此有了明确的身份——它们是为了解释数据而被引入的潜变量,不是为了拟合标签而加的中间层。今天所有生成式预训练的目标函数都在这条线上。
代价是那个「自由相位」:要估计模型自身的统计量,就得从模型里采样,而采样需要马尔可夫链跑到平衡。全连接版本上这实际做不到。此后二十年的技术史几乎都在绕开这一步——限制连接结构、截断链长、换成对比目标、换成去噪目标。目标没变,可算性被反复重新工程化。
经十、反向传播的普及:不是被发明的那一次,是被接住的那一次Classic 10 · Deep Learning
算法本身此前已被多次独立给出,这一次不同的地方是配套:一本两卷本的书、一批可复现的演示、一个把它与认知科学问题接起来的框架。方法因此第一次有了共同体。这提示一件事——领域记忆不由首次发表决定,由「有没有人把它做成别人能接着做的样子」决定。
它随即暴露出深层网络的真问题不在能不能求导,而在导数传得动传不动。链式法则把每层的雅可比连乘,稍有偏离就指数放大或衰减。后续三十年里最有效的几项改动——非饱和激活、内部归一化、跳连接——都不是新的学习原理,而是在修这条梯度路径。
经十一、UCI 数据库:有了公共赛道,才有了可比较的成绩Classic 11 · Deep Learning
在此之前,论文各用各的数据,谁也无法核对谁。公共数据集把领域从互相说服改成互相比较,这是机器学习能够快速积累的制度基础——它的作用与临床试验注册在医学里的作用同构。基准文化的一切好处都从这里开始。
坏处来自同一处。同一批测试集被整个共同体使用数十年,每一次「据此调整超参再报结果」都在悄悄把测试集变成训练集的一部分;发表偏倚让被报告的是那些恰好合适的配置。这种磨损无法从单篇论文里看出来,只能在共同体层面统计。今天大模型时代的污染问题,是同一件事在规模上的放大。
经十二、万能逼近定理:能表示,和能学到,是两件事Classic 12 · Deep Learning
这条定理终结了「神经网络表达能力不足」这一质疑,功劳明确。它也是被误用最多的一条:定理是存在性的,它保证存在一组权重能逼近,不保证这组权重能被任何算法在有限时间与有限样本下找到,也不给所需宽度的上界。
真正回答「代价是多少」的不是定理而是经验规律。缩放律给出的是损失随参数量、数据量与计算量的近似幂律关系——它没有存在性定理那么漂亮,却是唯一能用来做预算的东西。这一对照值得记住:存在性定理常常是研究纲领的入场券,而工程决策要的是代价曲线,两者不能互相替代。
经十三、卷积网络加反向传播:一个跑通了的系统,和它当年的算力账Classic 13 · Deep Learning
这项工作把两条线并到一起:结构上的不变性假设与端到端的梯度训练。它不是演示,是一个真正部署的系统——美国相当比例的支票金额识别曾由它的后续版本完成。这在当时是神经网络唯一大规模的工业落地,也是此后十几年里这条路线最有力的存在证明。
它同时是一份关于约束的记录。当年的算力使网络只能做到几层与几万参数,于是特征工程与结构设计承担了大部分工作。二十年后同一结构不改原理只放大规模就越过所有旧基线,这说明当时被当作「方法的上限」的东西,其实是「当时算力的上限」。区分这两者,是判断一条路线该不该被放弃的关键。
经十四、最优脑损伤:先训练一个大的,再把大部分剪掉Classic 14 · Deep Learning
它给「哪些参数不重要」提供了第一个有理论依据的判据:不是看权重绝对值大小,而是看删掉它会让损失涨多少,用海森矩阵的对角近似来估。结论是训练完的网络里大部分参数可以删掉——这本身就说明参数量与真正被使用的容量不是一回事。
它留下的问题在三十年后才被问对。既然剪完的小网络能达到大网络的精度,为什么不一开始就训练那个小网络?经验回答长期是「训不出来」。彩票假说给出的解释是:小网络能训成,但要配上它在大网络里那次初始化。这把剪枝从工程手段变成了关于优化景观的经验主张。
经十五、偏差与方差的分解:那条被画了二十年的 U 形曲线Classic 15 · Deep Learning
这条分解是恒等式,不可能错。它的教学价值极高:它解释了为什么更复杂的模型不一定更好,也给出了「刚刚好」这个直觉的数学形式。整整一代人据此把模型选择理解为在一条 U 形曲线上找最低点,而正则化是把曲线往左压。
被推翻的不是分解,是关于曲线形状的经验概括。当参数量越过能完全拟合训练集的那一点之后再继续增加,测试误差会第二次下降,且常常降到比第一个谷底更低。恒等式仍然成立——方差项在插值区间之后随隐式正则化而下降。这是一个漂亮的案例:同一个数学结论,两种完全不同的实践后果。
经十六、长程依赖的困难:不是学不会,是梯度到不了那么远Classic 16 · Deep Learning
这项工作把一个工程挫折变成了定理式的结论:不是调参不够用心,而是稳定存储与梯度传播这两个要求指向雅可比谱半径的相反方向。它因此界定了后续所有解法的形状——必须在结构上给信息开一条不经过反复相乘的路。
门控与注意力正是这样的路。但另一件事说明这条分析不覆盖全部:有些任务上模型先长时间只会背训练集,再在远超拟合点的训练步数上突然获得泛化能力。这说明「学不会」有时不是梯度到不了,而是还没到时候——优化时间本身是一个独立的变量,而原分析里没有它。
经十七、Bagging:把不稳定这件事拿来当资源用Classic 17 · Deep Learning
它的前提很反直觉:只有当基学习器不稳定——训练集轻微变动就给出很不同的模型——集成才有效。稳定的学习器平均起来没有收益。于是「不稳定」从缺点变成了被利用的性质,而这一条把决策树从一个平庸的方法送上了表格数据的头把交椅。
把它搬进神经网络的代价是隐式的。随机失活训练的是权重共享的指数多个子网络,测试时用一次前向近似它们的平均——这个近似在什么条件下成立,从未被完整刻画。它有效是经验事实,而它是否真的等价于集成,则是一个至今没有干净答案的问题。
经十八、长短期记忆:给信息开一条不用反复相乘的路Classic 18 · Deep Learning
它的解法是结构性的:与其让信息每一步都被权重矩阵乘一次,不如开一条加法通道,让状态默认原样传下去,只在门允许时才被改写。这与后来残差连接的思路是同一个——把「保持不变」设为默认,把「改变」设为需要理由的操作。
它被替换的原因不是效果不好,而是它按定义无法并行:第 t 步必须等第 t−1 步算完。当训练规模变成决定性因素时,一个稍差但可完全并行的结构会赢。这条经典因此记录了一次口径变化——评价一个结构的标准,从「同等计算下的精度」变成了「同等墙钟时间下能吃进多少数据」。
经十九、图形处理器训练:把一件业余可做的事变成了门槛Classic 19 · Deep Learning
这个观察本身不深刻——矩阵乘天然并行,而图形硬件恰好就是为大批同构的乘加造的,两者对上不需要任何理论准备。它的分量在于后果:同样的算法,同样的数据,换一种硬件就跨过了可用性阈值。此后所有关于「哪条路线更好」的比较,都必须先问一句在什么硬件预算下比较。
它也改变了这个领域的社会结构。用工作站就能复现主要结果的时代结束了;能否参与前沿工作开始取决于能否拿到算力。这一条与本层的公共数据集那条正好构成一对:一个降低了准入门槛,另一个抬高了它,而两者都不是靠算法思想起作用的。
经二十、模型压缩:让小模型去学大模型的输出,而不是学标签Classic 20 · Deep Learning
它的洞察是:真正难的是找到那个函数,而不是表示它。既然大模型已经找到了,就让小模型直接去拟合这个函数而不是原始标签——大模型对每个输入给出的整条概率分布,比一个硬标签携带的信息多得多,包括「这张图第二像什么」。
这条方法此后成了部署的常规,但它的解释一直含糊。若小模型确实能表示同样的函数,为什么从标签直接训练不行?现有回答——软标签提供了类间关系、起到正则作用、平滑了优化景观——都是部分成立的经验说法。这与彩票假说指向同一处空白:我们能训出什么,与我们能表示什么,之间隔着一层至今没被讲清的东西。
◎ 这一层怎么用
先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。
三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(McCulloch–Pitts 的形式神经元、Hebb 的学习规则、Turing 的可计算性)只在流变栏里被点名。其二,经典身份不提供豁免——本层有四条今天已被明确修正:《感知机》一书的否定结论被误推为方向死刑、偏差方差的 U 形曲线只覆盖插值点左侧、万能逼近定理被当成可学习性的保证、长程依赖的分析漏掉了训练时长这一变量。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。
本层的四条路在这门学科里有其特定落点。机制路(新认知机、Hopfield、玻尔兹曼机、反向传播、长短期记忆、随机梯度多层)问「靠什么算得出来」;测量路(收敛定理、万能逼近、偏差方差分解、长程依赖分析、最优脑损伤)问「凭什么说它学到了」;制度路(自动微分、公共数据库、卷积系统、图形处理器、模型压缩)问「谁能参与、按什么赛道比」;人的路(感知机的宣称、《感知机》一书的误读、Bagging 的社群实践)问「一次外推的代价由谁承担」。⚠ 这门学科的「人的路」抓手与实验科学不同:它不是受试者保护,而是宣称与证据的落差由谁买单,以及准入门槛被什么抬高。
◎ 经典层资料核验
- Rosenblatt, F. The perceptron: a probabilistic model for information storage and organization in the brain. Psychological Review 65 (1958): 386–408。
- Rosenblatt, F. Principles of Neurodynamics. Washington, DC: Spartan Books, 1962(专著)。
- Widrow, B. and Hoff, M. E. Adaptive switching circuits. IRE WESCON Convention Record 4 (1960): 96–104。
- Widrow, B. and Stearns, S. D. Adaptive Signal Processing. Englewood Cliffs: Prentice-Hall, 1985(专著)。
- Novikoff, A. B. J. On convergence proofs on perceptrons. Proceedings of the Symposium on the Mathematical Theory of Automata 12 (1962): 615–622。
- Amari, S. A theory of adaptive pattern classifiers. IEEE Transactions on Electronic Computers EC-16 (1967): 299–307。
- Minsky, M. and Papert, S. Perceptrons: An Introduction to Computational Geometry. Cambridge, MA: MIT Press, 1969(专著)。
- Olazaran, M. A sociological study of the official history of the perceptrons controversy. Social Studies of Science 26 (1996): 611–659。
- Linnainmaa, S. The Representation of the Cumulative Rounding Error of an Algorithm as a Taylor Expansion of the Local Rounding Errors. Master’s thesis, University of Helsinki, 1970(专著)。
- Griewank, A. and Walther, A. Evaluating Derivatives. 2nd ed. Philadelphia: SIAM, 2008(专著)。
- Fukushima, K. Neocognitron: a self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position. Biological Cybernetics 36 (1980): 193–202。
- Hopfield, J. J. Neural networks and physical systems with emergent collective computational abilities. PNAS 79 (1982): 2554–2558。
- Amit, D. J., Gutfreund, H. and Sompolinsky, H. Storing infinite numbers of patterns in a spin-glass model of neural networks. Physical Review Letters 55 (1985): 1530–1533。
- Ackley, D. H., Hinton, G. E. and Sejnowski, T. J. A learning algorithm for Boltzmann machines. Cognitive Science 9 (1985): 147–169。
- Rumelhart, D. E., Hinton, G. E. and Williams, R. J. Learning representations by back-propagating errors. Nature 323 (1986): 533–536。
- Rumelhart, D. E. and McClelland, J. L. (eds.) Parallel Distributed Processing, 2 vols. Cambridge, MA: MIT Press, 1986(专著)。
- Werbos, P. J. The Roots of Backpropagation. New York: Wiley, 1994(专著)。
- Aha, D. W. and Murphy, P. M. UCI Repository of Machine Learning Databases. Irvine: University of California, 1987。
- Cybenko, G. Approximation by superpositions of a sigmoidal function. Mathematics of Control, Signals and Systems 2 (1989): 303–314。
- Hornik, K., Stinchcombe, M. and White, H. Multilayer feedforward networks are universal approximators. Neural Networks 2 (1989): 359–366。
- LeCun, Y. et al. Backpropagation applied to handwritten zip code recognition. Neural Computation 1 (1989): 541–551。
- LeCun, Y., Bottou, L., Bengio, Y. and Haffner, P. Gradient-based learning applied to document recognition. Proceedings of the IEEE 86 (1998): 2278–2324。
- LeCun, Y., Denker, J. S. and Solla, S. A. Optimal brain damage. In Advances in Neural Information Processing Systems 2. San Mateo: Morgan Kaufmann, 1990(专著)。
- Geman, S., Bienenstock, E. and Doursat, R. Neural networks and the bias/variance dilemma. Neural Computation 4 (1992): 1–58。
- Bengio, Y., Simard, P. and Frasconi, P. Learning long-term dependencies with gradient descent is difficult. IEEE Transactions on Neural Networks 5 (1994): 157–166。
- Breiman, L. Bagging predictors. Machine Learning 24 (1996): 123–140。
- Breiman, L. Random forests. Machine Learning 45 (2001): 5–32。
- Freund, Y. and Schapire, R. E. A decision-theoretic generalization of on-line learning. Journal of Computer and System Sciences 55 (1997): 119–139。
- Hochreiter, S. and Schmidhuber, J. Long short-term memory. Neural Computation 9 (1997): 1735–1780。
- Gers, F. A., Schmidhuber, J. and Cummins, F. Learning to forget: continual prediction with LSTM. Neural Computation 12 (2000): 2451–2471。
- Vapnik, V. N. The Nature of Statistical Learning Theory. New York: Springer, 1995(专著)。
- Bishop, C. M. Neural Networks for Pattern Recognition. Oxford: Clarendon Press, 1995(专著)。
- Oh, K.-S. and Jung, K. GPU implementation of neural networks. Pattern Recognition 37 (2004): 1311–1314。
- Steinkraus, D., Buck, I. and Simard, P. Y. Using GPUs for machine learning algorithms. Proceedings of ICDAR (2005): 1115–1120。
- Buciluă, C., Caruana, R. and Niculescu-Mizil, A. Model compression. Proceedings of ACM SIGKDD (2006): 535–541。
- Hinton, G. E., Osindero, S. and Teh, Y.-W. A fast learning algorithm for deep belief nets. Neural Computation 18 (2006): 1527–1554。
- Schmidhuber, J. Deep learning in neural networks: an overview. Neural Networks 61 (2015): 85–117。