SDE Universes·新思想前沿计算与人工智能
新思想前沿 · 计算与人工智能

深度学习

近二十年与经典层 · 两幕 20 个新思想 + 20 个经典思想 · 约 36,652 字 · 王德生 亲撰 · 2026 年 8 月

深度学习的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。

【第一幕】上一个十年 · 约 2006–2016

第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。

甲、深层信念网:逐层预训练让深网络第一次稳定启动Deep Belief Nets

提出Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527。 争议(未见反对;边界:收益依赖当时初始化和数据规模,后来的归一化与残差结构会改变必要性。) 最新(2024—2026年未见直接更新。)。 关键无监督逐层预训练先找到参数盆地,再用监督信号整体微调。

起点要放回2006年的Neural Computation:Hinton、Osindero、Teh不再允许深度学习在深层信念网上继续用训练成功代替泛化解释。Hinton、Osindero、Teh逐项核对模型参数、训练样本与样本外误差里的深层信念网;数据污染、算力预算与长尾失败由掩码自编码另行登记。在Neural Computation的证据账上,由MNIST等任务证明多层表示可被实际训练起步,掩码自编码进入解释对照;本条残差不能靠改名消失。

深层信念网的可反驳立场是:无监督逐层预训练先找到参数盆地,再用监督信号整体微调。Hinton、Osindero、Teh这一路线据此把决定性解释锁在一个对象上,掩码自编码的“高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算”不能替代本条;边界是收益依赖当时初始化和数据规模。若换样本后再问仍不能保持方向,掩码自编码便构成深层信念网的近邻反例;Neural Computation对深层信念网仅支持原任务。

可核对的主证据是Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527:MNIST等任务证明多层表示可被实际训练,打破深网络必然卡在优化中的判断。深层信念网在MNIST把测试误差压到约1.25%。掩码自编码要求把2006年的深层信念网样本与对照结算,再核查掩码自编码的任务、观察窗和收益依赖当时初始化和数据规模。对深层信念网,掩码自编码仅作近邻;支点仍是Hinton、Osindero、Teh在Neural Computation的原始比较。

深层信念网自己留下的反证入口是:收益依赖当时初始化和数据规模,后来的归一化与残差结构会改变必要性。用正交量纲重测时,Hinton、Osindero、Teh的解释可能缩小、反号,或让位给掩码自编码的路径。掩码自编码给出复核Neural Computation的近邻条件:把不显著结果一并公开;深层信念网负责记录中止、排除和不显著对象。

MNIST等任务证明多层表示可被实际训练改变登记顺序:模型参数、训练样本与样本外误差归深层信念网,数据污染、算力预算与长尾失败交掩码自编码核查。2022年的掩码自编码以“高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算”作近邻;两者若结论不同,应以收益依赖当时初始化和数据规模为分账边界;掩码自编码不得与本条合成一个平均分。

2006年,深层信念网据MNIST等任务证明多层表示可被实际训练对接第047号第二幕四。跨过去,收益依赖当时初始化和数据规模迫使深层信念网重新检验可见读数。深层信念网以收益依赖当时初始化和数据规模施加反向压力。该接口若仍支持相反方向,收益依赖当时初始化和数据规模要求深层信念网增加第三条件,同时容纳两边的失效样本。

位置D——它把深层信念网的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有深层信念网是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲深层信念网在未见任务上保持增益的任务数/全部预注册任务数 失效当收益依赖当时初始化和数据规模,主指标越高,边界外保持率反而越低 自曝原始纳入标准首先暴露:收益依赖当时初始化和数据规模 空栏深层信念网中与“收益依赖当时初始化和数据规模”有关却未入分母的失败对象 异名另见第047号第二幕四“神经切线核:无限宽网络在训练初期近似核回归”

乙、ReLU:一个非饱和门改变梯度与稀疏激活Rectified Linear Units

提出Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323。 争议(未见反对;边界:死亡单元与尺度爆炸仍在,激活函数不能替代初始化、归一化和数据设计。) 最新(2024—2026年未见直接更新。)。 关键非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示。

真正的断点出现在2011年的AISTATS:Glorot、Bordes、Bengio不再允许深度学习在深度学习里的ReLU上继续用训练成功代替泛化解释。Glorot、Bordes、Bengio逐项核对模型参数、训练样本与样本外误差里的深度学习里的ReLU;数据污染、算力预算与长尾失败由双下降另行登记。在AISTATS的证据账上,由在图像与文本基准上起步,双下降进入解释对照;本条残差不能靠改名消失。

深度学习里的ReLU的可反驳立场是:非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示。Glorot、Bordes、Bengio这一路线据此把决定性解释锁在一个对象上,双下降的“经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降”不能替代本条;边界是死亡单元与尺度爆炸仍在。若把时间窗拉长再看仍不能保持方向,双下降便构成深度学习里的ReLU的近邻反例;AISTATS对深度学习里的ReLU仅支持原任务。

可核对的主证据是Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323:在图像与文本基准上,ReLU网络训练更快并超过双曲正切网络。ReLU论文比较4组图像与文本任务。双下降要求把2011年的深度学习里的ReLU样本与对照结算,再核查双下降的任务、观察窗和死亡单元与尺度爆炸仍在。对深度学习里的ReLU,双下降仅作近邻;支点仍是Glorot、Bordes、Bengio在AISTATS的原始比较。回到AISTATS的取样方式,深度学习里的ReLU要用双下降证明原分母没有删去最容易失败的对象。

深度学习里的ReLU自己留下的反证入口是:死亡单元与尺度爆炸仍在,激活函数不能替代初始化、归一化和数据设计。撤去界面提示再验时,Glorot、Bordes、Bengio的解释可能缩小、反号,或让位给双下降的路径。双下降给出复核AISTATS的近邻条件:按个体轨迹而非均值检查;深度学习里的ReLU负责记录中止、排除和不显著对象。拿双下降作近邻检验,可辨认Glorot、Bordes、Bengio观察到的是独有路径,还是另一条路线的表面同义词。

在图像与文本基准上改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的ReLU,数据污染、算力预算与长尾失败交双下降核查。2019年的双下降以“经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降”作近邻;两者若结论不同,应以死亡单元与尺度爆炸仍在为分账边界;双下降不得与本条合成一个平均分。

2011年,深度学习里的ReLU据在图像与文本基准上对接第049号第二幕三。跨过去,死亡单元与尺度爆炸仍在迫使深度学习里的ReLU重新检验可见读数。深度学习里的ReLU以死亡单元与尺度爆炸仍在施加反向压力。该接口若仍支持相反方向,死亡单元与尺度爆炸仍在要求深度学习里的ReLU增加第三条件,同时容纳两边的失效样本。

位置E——它把深度学习里的ReLU的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有深度学习里的ReLU是决定因素 预设〔01 谁进入分母〕被成功采集或完成任务者可以代表全部目标对象 量纲深度学习里的ReLU在未见任务上保持增益的任务数/全部预注册任务数 失效当死亡单元与尺度爆炸仍在,主指标越高,边界外保持率反而越低 自曝主要终点自己留下:死亡单元与尺度爆炸仍在 空栏深度学习里的ReLU中与“死亡单元与尺度爆炸仍在”有关却未入分母的失败对象 异名另见第049号第二幕三“叠加:一个神经元承载多个特征可能是容量最优解”

丙、ImageNet转折:数据、GPU与卷积一同越过旧基线The ImageNet Breakthrough

提出Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105。 争议(未见反对;边界:胜利混合了数据、算力、增强和架构,不能把全部增益归给“更深”。) 最新(2024—2026年未见直接更新。)。 关键深卷积网络在大规模标注与GPU训练下显著拉开视觉误差。

旧账最先在2012年的NeurIPS:Krizhevsky、Sutskever、Hinton不再允许深度学习在ImageNet转折上继续用训练成功代替泛化解释。Krizhevsky、Sutskever、Hinton逐项核对模型参数、训练样本与样本外误差里的ImageNet转折;数据污染、算力预算与长尾失败由神经缩放律另行登记。在NeurIPS的证据账上,由AlexNet将ImageNet top-5错误率降至15.3%起步,神经缩放律进入解释对照;本条残差不能靠改名消失。第258号第十四条“再采样基准证明‘同名测试集’也会发生分布变化”提供不同尺度的反例;它迫使ImageNet转折把“适用”写成可检查的对象范围。

ImageNet转折的可反驳立场是:深卷积网络在大规模标注与GPU训练下显著拉开视觉误差。Krizhevsky、Sutskever、Hinton这一路线据此把决定性解释锁在一个对象上,神经缩放律的“在一定区间内,增加参数、数据和计算可用平滑幂律预测损失”不能替代本条;边界是胜利混合了数据、算力、增强和架构。若保留失败对象后检验仍不能保持方向,神经缩放律便构成ImageNet转折的近邻反例;NeurIPS对ImageNet转折仅支持原任务。

可核对的主证据是Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105:AlexNet将ImageNet top-5错误率降至15.3%,领先次名十个百分点以上。AlexNet含约6000万个参数和65万个神经元。神经缩放律要求把2012年的ImageNet转折样本与对照结算,再核查神经缩放律的任务、观察窗和胜利混合了数据、算力、增强和架构。对ImageNet转折,神经缩放律仅作近邻;支点仍是Krizhevsky、Sutskever、Hinton在NeurIPS的原始比较。拿神经缩放律作近邻检验,可辨认Krizhevsky、Sutskever、Hinton观察到的是独有路径,还是另一条路线的表面同义词。

ImageNet转折自己留下的反证入口是:胜利混合了数据、算力、增强和架构,不能把全部增益归给“更深”。按亚组分别结算时,Krizhevsky、Sutskever、Hinton的解释可能缩小、反号,或让位给神经缩放律的路径。神经缩放律给出复核NeurIPS的近邻条件:加入反事实条件;ImageNet转折负责记录中止、排除和不显著对象。回到NeurIPS的取样方式,ImageNet转折要用神经缩放律证明原分母没有删去最容易失败的对象。

AlexNet将ImageNet top-5错误率降至15.3%改变登记顺序:模型参数、训练样本与样本外误差归ImageNet转折,数据污染、算力预算与长尾失败交神经缩放律核查。2020年的神经缩放律以“在一定区间内,增加参数、数据和计算可用平滑幂律预测损失”作近邻;两者若结论不同,应以胜利混合了数据、算力、增强和架构为分账边界;神经缩放律不得与本条合成一个平均分。

2012年,ImageNet转折据AlexNet将ImageNet top-5错误率降至15.3%对接第258号第十四条。跨过去,胜利混合了数据、算力、增强和架构迫使ImageNet转折重新检验可见读数。ImageNet转折以胜利混合了数据、算力、增强和架构施加反向压力。该接口若仍支持相反方向,胜利混合了数据、算力、增强和架构要求ImageNet转折增加第三条件,同时容纳两边的失效样本。

位置S——它把ImageNet转折所定义的结构、表示或可判结果当成单独够用的那一样 单因只有ImageNet转折是决定因素 预设〔02 单一读数代表复杂对象〕一个汇总分足以替代多层过程 量纲ImageNet转折在未见任务上保持增益的任务数/全部预注册任务数 失效当胜利混合了数据、算力、增强和架构,主指标越高,边界外保持率反而越低 自曝配平资源后突出:胜利混合了数据、算力、增强和架构 空栏ImageNet转折中与“胜利混合了数据、算力、增强和架构”有关却未入分母的失败对象 异名另见第258号第十四条“再采样基准证明‘同名测试集’也会发生分布变化”

丁、Dropout:随机删节点把共适应变成集成近似Dropout

提出Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958。 争议(未见反对;边界:保留率与归一化相互作用;现代大模型中它并非处处必要。) 最新(2024—2026年未见直接更新。)。 关键训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成。

转折并非始于2014年的JMLR:Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov不再允许深度学习在深度学习里的Dropout上继续用训练成功代替泛化解释。Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov逐项核对模型参数、训练样本与样本外误差里的深度学习里的Dropout;数据污染、算力预算与长尾失败由彩票假说另行登记。在JMLR的证据账上,由在视觉、语音和文本任务上降低测试误差起步,彩票假说进入解释对照;本条残差不能靠改名消失。

深度学习里的Dropout的可反驳立场是:训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成。Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov这一路线据此把决定性解释锁在一个对象上,彩票假说的“过参数网络的成功部分来自初始化时存在的稀疏可训练子结构”不能替代本条;边界是保留率与归一化相互作用。若改用地点外资料复核仍不能保持方向,彩票假说便构成深度学习里的Dropout的近邻反例;JMLR对深度学习里的Dropout仅支持原任务。

可核对的主证据是Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958:在视觉、语音和文本任务上降低测试误差,成为早期深网标准正则项。Dropout训练时以约0.5保留概率随机删除隐藏单元。彩票假说要求把2014年的深度学习里的Dropout样本与对照结算,再核查彩票假说的任务、观察窗和保留率与归一化相互作用。对深度学习里的Dropout,彩票假说仅作近邻;支点仍是Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov在JMLR的原始比较。

深度学习里的Dropout自己留下的反证入口是:保留率与归一化相互作用;现代大模型中它并非处处必要。改变任务顺序后追踪时,Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov的解释可能缩小、反号,或让位给彩票假说的路径。彩票假说给出复核JMLR的近邻条件:用盲法重跑关键判断;深度学习里的Dropout负责记录中止、排除和不显著对象。

在视觉、语音和文本任务上降低测试误差改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的Dropout,数据污染、算力预算与长尾失败交彩票假说核查。2019年的彩票假说以“过参数网络的成功部分来自初始化时存在的稀疏可训练子结构”作近邻;两者若结论不同,应以保留率与归一化相互作用为分账边界;彩票假说不得与本条合成一个平均分。

2014年,深度学习里的Dropout据在视觉、语音和文本任务上降低测试误差对接第047号第一幕戊。跨过去,保留率与归一化相互作用迫使深度学习里的Dropout重新检验可见读数。深度学习里的Dropout以保留率与归一化相互作用施加反向压力。该接口若仍支持相反方向,保留率与归一化相互作用要求深度学习里的Dropout增加第三条件,同时容纳两边的失效样本。

位置D——它把深度学习里的Dropout的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有深度学习里的Dropout是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲同等精度下节省的训练资源/原方案全部训练资源 失效当保留率与归一化相互作用,主指标越高,边界外保持率反而越低 自曝作者在方法附录承认:保留率与归一化相互作用 空栏深度学习里的Dropout中与“保留率与归一化相互作用”有关却未入分母的失败对象 异名另见第047号第一幕戊“算法稳定性:泛化也可来自删掉一个样本时解变化很小”

戊、序列到序列:固定接口把翻译改成端到端学习Sequence to Sequence Learning

提出Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112。 争议(未见反对;边界:固定长度向量成为瓶颈,长句与稀有词暴露信息压缩上限。) 最新Gu 与 Dao,2024 年《COLM 2024》论文“Mamba: Linear-Time Sequence Modeling with Selective State Spaces”。 关键编码器与解码器可直接从成对序列学习映射,减少手写语言管线。

问题的入口是2014年的NeurIPS:Sutskever、Vinyals、Le不再允许深度学习在序列到序列上继续用训练成功代替泛化解释。Sutskever、Vinyals、Le逐项核对模型参数、训练样本与样本外误差里的序列到序列;数据污染、算力预算与长尾失败由深度学习里的Grokking另行登记。在NeurIPS的证据账上,由四层LSTM在WMT英语法语翻译取得34.8 BLEU起步,深度学习里的Grokking进入解释对照;本条残差不能靠改名消失。

序列到序列的可反驳立场是:编码器与解码器可直接从成对序列学习映射,减少手写语言管线。Sutskever、Vinyals、Le这一路线据此把决定性解释锁在一个对象上,深度学习里的Grokking的“训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度”不能替代本条;边界是固定长度向量成为瓶颈。若让替代路径进入对照仍不能保持方向,深度学习里的Grokking便构成序列到序列的近邻反例;NeurIPS对序列到序列仅支持原任务。

可核对的主证据是Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112:四层LSTM在WMT英语法语翻译取得34.8 BLEU,重排源句改善长依赖。4层LSTM在英法翻译取得34.8 BLEU。深度学习里的Grokking要求把2014年的序列到序列样本与对照结算,再核查深度学习里的Grokking的任务、观察窗和固定长度向量成为瓶颈。对序列到序列,深度学习里的Grokking仅作近邻;支点仍是Sutskever、Vinyals、Le在NeurIPS的原始比较。回到NeurIPS的取样方式,序列到序列要用深度学习里的Grokking证明原分母没有删去最容易失败的对象。

序列到序列自己留下的反证入口是:固定长度向量成为瓶颈,长句与稀有词暴露信息压缩上限。让独立团队预注册时,Sutskever、Vinyals、Le的解释可能缩小、反号,或让位给深度学习里的Grokking的路径。深度学习里的Grokking给出复核NeurIPS的近邻条件:将短期与长期拆账;序列到序列负责记录中止、排除和不显著对象。

四层LSTM在WMT英语法语翻译取得34.8 BLEU改变登记顺序:模型参数、训练样本与样本外误差归序列到序列,数据污染、算力预算与长尾失败交深度学习里的Grokking核查。2022年的深度学习里的Grokking以“训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度”作近邻;两者若结论不同,应以固定长度向量成为瓶颈为分账边界;深度学习里的Grokking不得与本条合成一个平均分。

2014年,序列到序列据四层LSTM在WMT英语法语翻译取得34.8 BLEU对接第256号第一条。跨过去,固定长度向量成为瓶颈迫使序列到序列重新检验可见读数。序列到序列以固定长度向量成为瓶颈施加反向压力。该接口若仍支持相反方向,固定长度向量成为瓶颈要求序列到序列增加第三条件,同时容纳两边的失效样本。

位置E——它把序列到序列的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有序列到序列是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲序列到序列在未见任务上保持增益的任务数/全部预注册任务数 失效当固定长度向量成为瓶颈,主指标越高,边界外保持率反而越低 自曝换到独立样本时暴露:固定长度向量成为瓶颈 空栏序列到序列中与“固定长度向量成为瓶颈”有关却未入分母的失败对象 异名另见第256号第一条“任务体系的坍缩”

己、批归一化:训练分布被纳入网络内部控制Batch Normalization

提出Ioffe 与 Szegedy,2015 年《ICML》37:448–456。 争议(未见反对;边界:小批量统计会泄漏样本依赖,训练与推理分布不一致时性能可崩。) 最新(2024—2026年未见直接更新。)。 关键中间激活按小批量标准化,使更大学习率和更深网络可训练。

先看被改写的对象2015年的ICML:Ioffe 与 Szegedy不再允许深度学习在批归一化上继续用训练成功代替泛化解释。Ioffe 与 Szegedy逐项核对模型参数、训练样本与样本外误差里的批归一化;数据污染、算力预算与长尾失败由对抗鲁棒另行登记。在ICML的证据账上,由ImageNet网络以更少训练步达到同等准确率起步,对抗鲁棒进入解释对照;本条残差不能靠改名消失。

批归一化的可反驳立场是:中间激活按小批量标准化,使更大学习率和更深网络可训练。Ioffe 与 Szegedy这一路线据此把决定性解释锁在一个对象上,对抗鲁棒的“鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试”不能替代本条;边界是小批量统计会泄漏样本依赖。若把排除者放回分母仍不能保持方向,对抗鲁棒便构成批归一化的近邻反例;ICML对批归一化仅支持原任务。

可核对的主证据是Ioffe 与 Szegedy,2015 年《ICML》37:448–456:ImageNet网络以更少训练步达到同等准确率,并降低初始化敏感性。批归一化把达到同等精度的训练步数缩短约14倍。对抗鲁棒要求把2015年的批归一化样本与对照结算,再核查对抗鲁棒的任务、观察窗和小批量统计会泄漏样本依赖。对批归一化,对抗鲁棒仅作近邻;支点仍是Ioffe 与 Szegedy在ICML的原始比较。

批归一化自己留下的反证入口是:小批量统计会泄漏样本依赖,训练与推理分布不一致时性能可崩。把不显著结果一并公开时,Ioffe 与 Szegedy的解释可能缩小、反号,或让位给对抗鲁棒的路径。对抗鲁棒给出复核ICML的近邻条件:把人工接管计入结果;批归一化负责记录中止、排除和不显著对象。回到ICML的取样方式,批归一化要用对抗鲁棒证明原分母没有删去最容易失败的对象。

ImageNet网络以更少训练步达到同等准确率改变登记顺序:模型参数、训练样本与样本外误差归批归一化,数据污染、算力预算与长尾失败交对抗鲁棒核查。2018年的对抗鲁棒以“鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试”作近邻;两者若结论不同,应以小批量统计会泄漏样本依赖为分账边界;对抗鲁棒不得与本条合成一个平均分。

2015年,批归一化据ImageNet网络以更少训练步达到同等准确率对接第047号第二幕六读数”。跨过去,小批量统计会泄漏样本依赖迫使批归一化重新检验可见读数。批归一化以小批量统计会泄漏样本依赖施加反向压力。该接口若仍支持相反方向,小批量统计会泄漏样本依赖要求批归一化增加第三条件,同时容纳两边的失效样本。

位置S——它把批归一化所定义的结构、表示或可判结果当成单独够用的那一样 单因只有批归一化是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲同等精度下节省的训练资源/原方案全部训练资源 失效当小批量统计会泄漏样本依赖,主指标越高,边界外保持率反而越低 自曝消融或假对照提醒:小批量统计会泄漏样本依赖 空栏批归一化中与“小批量统计会泄漏样本依赖”有关却未入分母的失败对象 异名另见第047号第二幕六“平坦极小值清算:坐标重参数化会改变“平坦”读数”

庚、残差学习:让层学习修正量而非重做全部映射Residual Networks

提出He、Zhang、Ren、Sun,2016 年《CVPR》:770–778,DOI 10.1109/CVPR.2016.90。 争议(未见反对;边界:深度只是表达预算;延迟、内存和数据偏差不会因捷径自动消失。) 最新(2024—2026年未见直接更新。)。 关键恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差。

争论应从2016年的CVPR:He、Zhang、Ren、Sun不再允许深度学习在残差学习上继续用训练成功代替泛化解释。He、Zhang、Ren、Sun逐项核对模型参数、训练样本与样本外误差里的残差学习;数据污染、算力预算与长尾失败由分布外泛化另行登记。在CVPR的证据账上,由ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛起步,分布外泛化进入解释对照;本条残差不能靠改名消失。

残差学习的可反驳立场是:恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差。He、Zhang、Ren、Sun这一路线据此把决定性解释锁在一个对象上,分布外泛化的“模型必须在时间、地点、亚群和采集方式变化下接受分组评估”不能替代本条;边界是深度只是表达预算。若固定资源预算后比较仍不能保持方向,分布外泛化便构成残差学习的近邻反例;CVPR对残差学习仅支持原任务。

可核对的主证据是He、Zhang、Ren、Sun,2016 年《CVPR》:770–778,DOI 10.1109/CVPR.2016.90:ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛。152层残差网在ImageNet测试集取得3.57%错误率。分布外泛化要求把2016年的残差学习样本与对照结算,再核查分布外泛化的任务、观察窗和深度只是表达预算。对残差学习,分布外泛化仅作近邻;支点仍是He、Zhang、Ren、Sun在CVPR的原始比较。回到CVPR的取样方式,残差学习要用分布外泛化证明原分母没有删去最容易失败的对象。

残差学习自己留下的反证入口是:深度只是表达预算;延迟、内存和数据偏差不会因捷径自动消失。按个体轨迹而非均值检查时,He、Zhang、Ren、Sun的解释可能缩小、反号,或让位给分布外泛化的路径。分布外泛化给出复核CVPR的近邻条件:审计数据近邻与泄漏;残差学习负责记录中止、排除和不显著对象。第050号第二幕一“视觉Transformer:图像图块可直接进入自注意力”提供不同尺度的反例;它迫使残差学习把“适用”写成可检查的对象范围。

ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛改变登记顺序:模型参数、训练样本与样本外误差归残差学习,数据污染、算力预算与长尾失败交分布外泛化核查。2021年的分布外泛化以“模型必须在时间、地点、亚群和采集方式变化下接受分组评估”作近邻;两者若结论不同,应以深度只是表达预算为分账边界;分布外泛化不得与本条合成一个平均分。

2016年,残差学习据ResNet-152在ImageNet达到3.57% top-5错误率并赢得2015年竞赛对接第050号第二幕一。跨过去,深度只是表达预算迫使残差学习重新检验可见读数。残差学习以深度只是表达预算施加反向压力。该接口若仍支持相反方向,深度只是表达预算要求残差学习增加第三条件,同时容纳两边的失效样本。拿分布外泛化作近邻检验,可辨认He、Zhang、Ren、Sun观察到的是独有路径,还是另一条路线的表面同义词。

位置D——它把残差学习的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有残差学习是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲残差学习在未见任务上保持增益的任务数/全部预注册任务数 失效当深度只是表达预算,主指标越高,边界外保持率反而越低 自曝长期随访没有保留:深度只是表达预算 空栏残差学习中与“深度只是表达预算”有关却未入分母的失败对象 异名另见第050号第二幕一“视觉Transformer:图像图块可直接进入自注意力”

辛、开源框架:计算图与自动微分把复现成本降到团队可承受Open Deep-Learning Frameworks

提出Abadi 等,2016 年 arXiv:1603.04467《TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems》。 争议(未见反对;边界:框架锁定、默认算子和随机性仍会改变结果;能运行不等于可复现。) 最新(2024—2026年未见直接更新。)。 关键统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展。

历史坐标落在2016年的TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems:Abadi 等不再允许深度学习在开源框架上继续用训练成功代替泛化解释。Abadi 等逐项核对模型参数、训练样本与样本外误差里的开源框架;数据污染、算力预算与长尾失败由效率独立成题另行登记。在TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems的证据账上,由TensorFlow把研究原型、分布式训练和部署接口放进同一系统起步,效率独立成题进入解释对照;本条残差不能靠改名消失。

开源框架的可反驳立场是:统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展。Abadi 等这一路线据此把决定性解释锁在一个对象上,效率独立成题的“模型进步应同时报告训练计算、推理成本和硬件条件”不能替代本条;边界是框架锁定、默认算子和随机性仍会改变结果。若用正交量纲重测仍不能保持方向,效率独立成题便构成开源框架的近邻反例;TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems对开源框架仅支持原任务。

可核对的主证据是Abadi 等,2016 年 arXiv:1603.04467《TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems》:TensorFlow把研究原型、分布式训练和部署接口放进同一系统。TensorFlow把训练从1台机器扩展到数千设备。效率独立成题要求把2016年的开源框架样本与对照结算,再核查效率独立成题的任务、观察窗和框架锁定、默认算子和随机性仍会改变结果。对开源框架,效率独立成题仅作近邻;支点仍是Abadi 等在TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems的原始比较。

开源框架自己留下的反证入口是:框架锁定、默认算子和随机性仍会改变结果;能运行不等于可复现。加入反事实条件时,Abadi 等的解释可能缩小、反号,或让位给效率独立成题的路径。效率独立成题给出复核TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems的近邻条件:先登记停止线再部署;开源框架负责记录中止、排除和不显著对象。

TensorFlow把研究原型、分布式训练和部署接口放进同一系统改变登记顺序:模型参数、训练样本与样本外误差归开源框架,数据污染、算力预算与长尾失败交效率独立成题核查。2020年的效率独立成题以“模型进步应同时报告训练计算、推理成本和硬件条件”作近邻;两者若结论不同,应以框架锁定、默认算子和随机性仍会改变结果为分账边界;效率独立成题不得与本条合成一个平均分。

2016年,开源框架据TensorFlow把研究原型、分布式训练和部署接口放进同一系统对接第249号第九条。跨过去,框架锁定、默认算子和随机性仍会改变结果迫使开源框架重新检验可见读数。开源框架以框架锁定、默认算子和随机性仍会改变结果施加反向压力。该接口若仍支持相反方向,框架锁定、默认算子和随机性仍会改变结果要求开源框架增加第三条件,同时容纳两边的失效样本。

位置E——它把开源框架的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有开源框架是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲同等精度下节省的训练资源/原方案全部训练资源 失效当框架锁定、默认算子和随机性仍会改变结果,主指标越高,边界外保持率反而越低 自曝不同站点之间显出:框架锁定、默认算子和随机性仍会改变结果 空栏开源框架中与“框架锁定、默认算子和随机性仍会改变结果”有关却未入分母的失败对象 异名另见第249号第九条“多层中间表示”
【第二幕】这个十年 · 约 2016–2026

第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。

一、自监督对比学习:标签不再是表示学习的唯一入口Contrastive Self-Supervision

提出Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607。 争议(未见反对;边界:效果高度依赖增强、批量和数据分布;不恰当不变性会删除任务所需信息。) 最新(2024—2026年未见直接更新。)。 关键不同增强视图的一致性可在无人工标签时学习可迁移视觉表示。

第一处裂缝来自2020年的ICML:Chen、Kornblith、Norouzi、Hinton不再允许深度学习在自监督对比学习上继续用训练成功代替泛化解释。Chen、Kornblith、Norouzi、Hinton逐项核对模型参数、训练样本与样本外误差里的自监督对比学习;数据污染、算力预算与长尾失败由蒸馏另行登记。在ICML的证据账上,由SimCLR在线性评估达到76.5% top-1起步,蒸馏进入解释对照;本条残差不能靠改名消失。

自监督对比学习的可反驳立场是:不同增强视图的一致性可在无人工标签时学习可迁移视觉表示。Chen、Kornblith、Norouzi、Hinton这一路线据此把决定性解释锁在一个对象上,蒸馏的“教师输出与中间注意、隐藏状态可共同压入更小学生模型”不能替代本条;边界是效果高度依赖增强、批量和数据分布。若撤去界面提示再验仍不能保持方向,蒸馏便构成自监督对比学习的近邻反例;ICML对自监督对比学习仅支持原任务。

可核对的主证据是Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607:SimCLR在线性评估达到76.5% top-1,并在少标签条件显著提高样本效率。蒸馏要求把2020年的自监督对比学习样本与对照结算,再核查蒸馏的任务、观察窗和效果高度依赖增强、批量和数据分布。对自监督对比学习,蒸馏仅作近邻;支点仍是Chen、Kornblith、Norouzi、Hinton在ICML的原始比较。回到ICML的取样方式,自监督对比学习要用蒸馏证明原分母没有删去最容易失败的对象。

自监督对比学习自己留下的反证入口是:效果高度依赖增强、批量和数据分布;不恰当不变性会删除任务所需信息。用盲法重跑关键判断时,Chen、Kornblith、Norouzi、Hinton的解释可能缩小、反号,或让位给蒸馏的路径。蒸馏给出复核ICML的近邻条件:换样本后再问;自监督对比学习负责记录中止、排除和不显著对象。拿蒸馏作近邻检验,可辨认Chen、Kornblith、Norouzi、Hinton观察到的是独有路径,还是另一条路线的表面同义词。

SimCLR在线性评估达到76.5% top-1改变登记顺序:模型参数、训练样本与样本外误差归自监督对比学习,数据污染、算力预算与长尾失败交蒸馏核查。2020年的蒸馏以“教师输出与中间注意、隐藏状态可共同压入更小学生模型”作近邻;两者若结论不同,应以效果高度依赖增强、批量和数据分布为分账边界;蒸馏不得与本条合成一个平均分。

2020年,自监督对比学习据SimCLR在线性评估达到76.5% top-1对接第050号第二幕三。跨过去,效果高度依赖增强、批量和数据分布迫使自监督对比学习重新检验可见读数。自监督对比学习以效果高度依赖增强、批量和数据分布施加反向压力。该接口若仍支持相反方向,效果高度依赖增强、批量和数据分布要求自监督对比学习增加第三条件,同时容纳两边的失效样本。

位置E——它把自监督对比学习的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有自监督对比学习是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲自监督对比学习在未见任务上保持增益的任务数/全部预注册任务数 失效当效果高度依赖增强、批量和数据分布,主指标越高,边界外保持率反而越低 自曝失败试次放回分母后看到:效果高度依赖增强、批量和数据分布 空栏自监督对比学习中与“效果高度依赖增强、批量和数据分布”有关却未入分母的失败对象 异名另见第050号第二幕三“自监督视觉:不同视图一致性取代全部人工标签”

二、掩码自编码:预测缺失部分取代逐对样本比较Masked Autoencoders

提出He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553。 争议(未见反对;边界:像素重建偏爱纹理与低频统计,迁移到几何和语义任务仍需检验。) 最新(2024—2026年未见直接更新。)。 关键高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算。

研究单位改在2022年的CVPR:He、Chen、Xie 等不再允许深度学习在掩码自编码上继续用训练成功代替泛化解释。He、Chen、Xie 等逐项核对模型参数、训练样本与样本外误差里的掩码自编码;数据污染、算力预算与长尾失败由科学迁移另行登记。在CVPR的证据账上,由MAE遮蔽75%图块起步,科学迁移进入解释对照;本条残差不能靠改名消失。

掩码自编码的可反驳立场是:高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算。He、Chen、Xie 等这一路线据此把决定性解释锁在一个对象上,科学迁移的“深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线”不能替代本条;边界是像素重建偏爱纹理与低频统计。若按亚组分别结算仍不能保持方向,科学迁移便构成掩码自编码的近邻反例;CVPR对掩码自编码仅支持原任务。

可核对的主证据是He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553:MAE遮蔽75%图块,用ViT-H在ImageNet微调达到87.8% top-1。科学迁移要求把2022年的掩码自编码样本与对照结算,再核查科学迁移的任务、观察窗和像素重建偏爱纹理与低频统计。对掩码自编码,科学迁移仅作近邻;支点仍是He、Chen、Xie 等在CVPR的原始比较。回到CVPR的取样方式,掩码自编码要用科学迁移证明原分母没有删去最容易失败的对象。

掩码自编码自己留下的反证入口是:像素重建偏爱纹理与低频统计,迁移到几何和语义任务仍需检验。将短期与长期拆账时,He、Chen、Xie 等的解释可能缩小、反号,或让位给科学迁移的路径。科学迁移给出复核CVPR的近邻条件:把时间窗拉长再看;掩码自编码负责记录中止、排除和不显著对象。拿科学迁移作近邻检验,可辨认He、Chen、Xie 等观察到的是独有路径,还是另一条路线的表面同义词。

MAE遮蔽75%图块改变登记顺序:模型参数、训练样本与样本外误差归掩码自编码,数据污染、算力预算与长尾失败交科学迁移核查。2021年的科学迁移以“深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线”作近邻;两者若结论不同,应以像素重建偏爱纹理与低频统计为分账边界;科学迁移不得与本条合成一个平均分。

2022年,掩码自编码据MAE遮蔽75%图块对接第045号第二幕六。跨过去,像素重建偏爱纹理与低频统计迫使掩码自编码重新检验可见读数。掩码自编码以像素重建偏爱纹理与低频统计施加反向压力。该接口若仍支持相反方向,像素重建偏爱纹理与低频统计要求掩码自编码增加第三条件,同时容纳两边的失效样本。

位置S——它把掩码自编码所定义的结构、表示或可判结果当成单独够用的那一样 单因只有掩码自编码是决定因素 预设〔01 谁进入分母〕被成功采集或完成任务者可以代表全部目标对象 量纲掩码自编码在未见任务上保持增益的任务数/全部预注册任务数 失效当像素重建偏爱纹理与低频统计,主指标越高,边界外保持率反而越低 自曝切换评价口径便会看到:像素重建偏爱纹理与低频统计 空栏掩码自编码中与“像素重建偏爱纹理与低频统计”有关却未入分母的失败对象 异名另见第045号第二幕六“潜空间扩散:先压缩图像,再在潜变量中去噪”

三、双下降:参数越过插值点后测试误差还能再次下降Double Descent

提出Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116。 争议(未见反对;边界:曲线受优化、噪声和横轴选择影响,不能据此断言规模总能治愈过拟合。) 最新(2024—2026年未见直接更新。)。 关键经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降。

回到原始设计2019年的PNAS:Belkin、Hsu、Ma、Mandal不再允许深度学习在双下降上继续用训练成功代替泛化解释。Belkin、Hsu、Ma、Mandal逐项核对模型参数、训练样本与样本外误差里的双下降;数据污染、算力预算与长尾失败由数据污染审计另行登记。在PNAS的证据账上,由随机特征、树与神经网络在训练误差刚到零附近出现风险峰起步,数据污染审计进入解释对照;本条残差不能靠改名消失。

双下降的可反驳立场是:经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降。Belkin、Hsu、Ma、Mandal这一路线据此把决定性解释锁在一个对象上,数据污染审计的“开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据”不能替代本条;边界是曲线受优化、噪声和横轴选择影响。若改变任务顺序后追踪仍不能保持方向,数据污染审计便构成双下降的近邻反例;PNAS对双下降仅支持原任务。

可核对的主证据是Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116:随机特征、树与神经网络在训练误差刚到零附近出现风险峰,继续增大模型后下降。数据污染审计要求把2019年的双下降样本与对照结算,再核查数据污染审计的任务、观察窗和曲线受优化、噪声和横轴选择影响。对双下降,数据污染审计仅作近邻;支点仍是Belkin、Hsu、Ma、Mandal在PNAS的原始比较。

双下降自己留下的反证入口是:曲线受优化、噪声和横轴选择影响,不能据此断言规模总能治愈过拟合。把人工接管计入结果时,Belkin、Hsu、Ma、Mandal的解释可能缩小、反号,或让位给数据污染审计的路径。数据污染审计给出复核PNAS的近邻条件:保留失败对象后检验;双下降负责记录中止、排除和不显著对象。

随机特征、树与神经网络在训练误差刚到零附近出现风险峰改变登记顺序:模型参数、训练样本与样本外误差归双下降,数据污染、算力预算与长尾失败交数据污染审计核查。2024年的数据污染审计以“开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据”作近邻;两者若结论不同,应以曲线受优化、噪声和横轴选择影响为分账边界;数据污染审计不得与本条合成一个平均分。

2019年,双下降据随机特征、树与神经网络在训练误差刚到零附近出现风险峰对接第257号第一条。跨过去,曲线受优化、噪声和横轴选择影响迫使双下降重新检验可见读数。双下降以曲线受优化、噪声和横轴选择影响施加反向压力。该接口若仍支持相反方向,曲线受优化、噪声和横轴选择影响要求双下降增加第三条件,同时容纳两边的失效样本。

位置D——它把双下降的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有双下降是决定因素 预设〔02 单一读数代表复杂对象〕一个汇总分足以替代多层过程 量纲双下降在未见任务上保持增益的任务数/全部预注册任务数 失效当曲线受优化、噪声和横轴选择影响,主指标越高,边界外保持率反而越低 自曝训练分布之外出现:曲线受优化、噪声和横轴选择影响 空栏双下降中与“曲线受优化、噪声和横轴选择影响”有关却未入分母的失败对象 异名另见第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”

四、神经缩放律:损失随模型、数据和计算呈近似幂律Neural Scaling Laws

提出Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》。 争议(未见反对;边界:外推会遇到数据质量、任务饱和和能力断点;损失下降不等于风险下降。) 最新(2024—2026年未见直接更新。)。 关键在一定区间内,增加参数、数据和计算可用平滑幂律预测损失。

这一路线先拆掉2020年的Scaling Laws for Neural Language Models:Kaplan 等不再允许深度学习在神经缩放律上继续用训练成功代替泛化解释。Kaplan 等逐项核对模型参数、训练样本与样本外误差里的神经缩放律;数据污染、算力预算与长尾失败由深层信念网另行登记。在Scaling Laws for Neural Language Models的证据账上,由跨七个数量级实验给出计算最优配比并影响训练预算规划起步,深层信念网进入解释对照;本条残差不能靠改名消失。

神经缩放律的可反驳立场是:在一定区间内,增加参数、数据和计算可用平滑幂律预测损失。Kaplan 等这一路线据此把决定性解释锁在一个对象上,深层信念网的“无监督逐层预训练先找到参数盆地,再用监督信号整体微调”不能替代本条;边界是外推会遇到数据质量、任务饱和和能力断点。若让独立团队预注册仍不能保持方向,深层信念网便构成神经缩放律的近邻反例;Scaling Laws for Neural Language Models对神经缩放律仅支持原任务。

可核对的主证据是Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》:跨七个数量级实验给出计算最优配比并影响训练预算规划。缩放实验横跨约7个数量级。深层信念网要求把2020年的神经缩放律样本与对照结算,再核查深层信念网的任务、观察窗和外推会遇到数据质量、任务饱和和能力断点。对神经缩放律,深层信念网仅作近邻;支点仍是Kaplan 等在Scaling Laws for Neural Language Models的原始比较。

神经缩放律自己留下的反证入口是:外推会遇到数据质量、任务饱和和能力断点;损失下降不等于风险下降。审计数据近邻与泄漏时,Kaplan 等的解释可能缩小、反号,或让位给深层信念网的路径。深层信念网给出复核Scaling Laws for Neural Language Models的近邻条件:改用地点外资料复核;神经缩放律负责记录中止、排除和不显著对象。

跨七个数量级实验给出计算最优配比并影响训练预算规划改变登记顺序:模型参数、训练样本与样本外误差归神经缩放律,数据污染、算力预算与长尾失败交深层信念网核查。2006年的深层信念网以“无监督逐层预训练先找到参数盆地,再用监督信号整体微调”作近邻;两者若结论不同,应以外推会遇到数据质量、任务饱和和能力断点为分账边界;深层信念网不得与本条合成一个平均分。

2020年,神经缩放律据跨七个数量级实验给出计算最优配比并影响训练预算规划对接第044号第二幕五。跨过去,外推会遇到数据质量、任务饱和和能力断点迫使神经缩放律重新检验可见读数。神经缩放律以外推会遇到数据质量、任务饱和和能力断点施加反向压力。该接口若仍支持相反方向,外推会遇到数据质量、任务饱和和能力断点要求神经缩放律增加第三条件,同时容纳两边的失效样本。

位置E——它把神经缩放律的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有神经缩放律是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲神经缩放律在未见任务上保持增益的任务数/全部预注册任务数 失效当外推会遇到数据质量、任务饱和和能力断点,主指标越高,边界外保持率反而越低 自曝参数识别检验告诉我们:外推会遇到数据质量、任务饱和和能力断点 空栏神经缩放律中与“外推会遇到数据质量、任务饱和和能力断点”有关却未入分母的失败对象 异名另见第044号第二幕五“缩放律修订:模型与数据要按计算预算共同增长”

五、彩票假说:大网络里可能藏着可单独训练的稀疏子网Lottery Tickets

提出Frankle 与 Carbin,2019 年《ICLR》论文“The Lottery Ticket Hypothesis”。 争议(未见反对;边界:大规模任务对原始初始化和训练日程敏感,事后找到不等于事前可预测。) 最新(2024—2026年未见直接更新。)。 关键过参数网络的成功部分来自初始化时存在的稀疏可训练子结构。

需要先恢复2019年的ICLR:Frankle 与 Carbin不再允许深度学习在彩票假说上继续用训练成功代替泛化解释。Frankle 与 Carbin逐项核对模型参数、训练样本与样本外误差里的彩票假说;数据污染、算力预算与长尾失败由深度学习里的ReLU另行登记。在ICLR的证据账上,由迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网起步,深度学习里的ReLU进入解释对照;本条残差不能靠改名消失。

彩票假说的可反驳立场是:过参数网络的成功部分来自初始化时存在的稀疏可训练子结构。Frankle 与 Carbin这一路线据此把决定性解释锁在一个对象上,深度学习里的ReLU的“非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示”不能替代本条;边界是大规模任务对原始初始化和训练日程敏感。若把不显著结果一并公开仍不能保持方向,深度学习里的ReLU便构成彩票假说的近邻反例;ICLR对彩票假说仅支持原任务。

可核对的主证据是Frankle 与 Carbin,2019 年《ICLR》论文“The Lottery Ticket Hypothesis”:迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网。深度学习里的ReLU要求把2019年的彩票假说样本与对照结算,再核查深度学习里的ReLU的任务、观察窗和大规模任务对原始初始化和训练日程敏感。对彩票假说,深度学习里的ReLU仅作近邻;支点仍是Frankle 与 Carbin在ICLR的原始比较。

彩票假说自己留下的反证入口是:大规模任务对原始初始化和训练日程敏感,事后找到不等于事前可预测。先登记停止线再部署时,Frankle 与 Carbin的解释可能缩小、反号,或让位给深度学习里的ReLU的路径。深度学习里的ReLU给出复核ICLR的近邻条件:让替代路径进入对照;彩票假说负责记录中止、排除和不显著对象。

迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网改变登记顺序:模型参数、训练样本与样本外误差归彩票假说,数据污染、算力预算与长尾失败交深度学习里的ReLU核查。2011年的深度学习里的ReLU以“非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示”作近邻;两者若结论不同,应以大规模任务对原始初始化和训练日程敏感为分账边界;深度学习里的ReLU不得与本条合成一个平均分。

2019年,彩票假说据迭代剪枝可在MNIST与CIFAR中找到达到原网精度的少量权重子网对接第248号第十四条。跨过去,大规模任务对原始初始化和训练日程敏感迫使彩票假说重新检验可见读数。彩票假说以大规模任务对原始初始化和训练日程敏感施加反向压力。该接口若仍支持相反方向,大规模任务对原始初始化和训练日程敏感要求彩票假说增加第三条件,同时容纳两边的失效样本。

位置S——它把彩票假说所定义的结构、表示或可判结果当成单独够用的那一样 单因只有彩票假说是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲彩票假说在未见任务上保持增益的任务数/全部预注册任务数 失效当大规模任务对原始初始化和训练日程敏感,主指标越高,边界外保持率反而越低 自曝任务重测把弱点定位为:大规模任务对原始初始化和训练日程敏感 空栏彩票假说中与“大规模任务对原始初始化和训练日程敏感”有关却未入分母的失败对象 异名另见第248号第十四条“参数化与实例复杂度”

六、Grokking:记住训练集之后还可能突然学会规则Grokking

提出Power 等,2022 年 arXiv:2201.02177《Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets》。 争议(未见反对;边界:现象集中在合成小任务,阈值受权重衰减与数据量控制,不能直接类比开放世界推理。) 最新(2024—2026年未见直接更新。)。 关键训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度。

证据链从2022年的Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets:Power 等不再允许深度学习在深度学习里的Grokking上继续用训练成功代替泛化解释。Power 等逐项核对模型参数、训练样本与样本外误差里的深度学习里的Grokking;数据污染、算力预算与长尾失败由ImageNet转折另行登记。在Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的证据账上,由模运算任务中起步,ImageNet转折进入解释对照;本条残差不能靠改名消失。第047号第二幕八“缩放律:经验幂律成为预算预测而非机制解释”提供不同尺度的反例;它迫使深度学习里的Grokking把“适用”写成可检查的对象范围。

深度学习里的Grokking的可反驳立场是:训练误差归零很久后,测试误差可突然下降,显示优化轨迹有长时间尺度。Power 等这一路线据此把决定性解释锁在一个对象上,ImageNet转折的“深卷积网络在大规模标注与GPU训练下显著拉开视觉误差”不能替代本条;边界是现象集中在合成小任务。若按个体轨迹而非均值检查仍不能保持方向,ImageNet转折便构成深度学习里的Grokking的近邻反例;Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets对深度学习里的Grokking仅支持原任务。

可核对的主证据是Power 等,2022 年 arXiv:2201.02177《Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets》:模运算任务中,模型先记忆样本,再在持续训练与正则化下形成可泛化结构。ImageNet转折要求把2022年的深度学习里的Grokking样本与对照结算,再核查ImageNet转折的任务、观察窗和现象集中在合成小任务。对深度学习里的Grokking,ImageNet转折仅作近邻;支点仍是Power 等在Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的原始比较。回到Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的取样方式,深度学习里的Grokking要用ImageNet转折证明原分母没有删去最容易失败的对象。

深度学习里的Grokking自己留下的反证入口是:现象集中在合成小任务,阈值受权重衰减与数据量控制,不能直接类比开放世界推理。换样本后再问时,Power 等的解释可能缩小、反号,或让位给ImageNet转折的路径。ImageNet转折给出复核Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets的近邻条件:把排除者放回分母;深度学习里的Grokking负责记录中止、排除和不显著对象。拿ImageNet转折作近邻检验,可辨认Power 等观察到的是独有路径,还是另一条路线的表面同义词。

模运算任务中改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的Grokking,数据污染、算力预算与长尾失败交ImageNet转折核查。2012年的ImageNet转折以“深卷积网络在大规模标注与GPU训练下显著拉开视觉误差”作近邻;两者若结论不同,应以现象集中在合成小任务为分账边界;ImageNet转折不得与本条合成一个平均分。

2022年,深度学习里的Grokking据模运算任务中对接第047号第二幕八。跨过去,现象集中在合成小任务迫使深度学习里的Grokking重新检验可见读数。深度学习里的Grokking以现象集中在合成小任务施加反向压力。该接口若仍支持相反方向,现象集中在合成小任务要求深度学习里的Grokking增加第三条件,同时容纳两边的失效样本。

位置D——它把深度学习里的Grokking的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有深度学习里的Grokking是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲深度学习里的Grokking在未见任务上保持增益的任务数/全部预注册任务数 失效当现象集中在合成小任务,主指标越高,边界外保持率反而越低 自曝横跨人群后原结论暴露:现象集中在合成小任务 空栏深度学习里的Grokking中与“现象集中在合成小任务”有关却未入分母的失败对象 异名另见第047号第二幕八“缩放律:经验幂律成为预算预测而非机制解释”

七、对抗鲁棒:高准确率模型可被人眼不可见扰动击穿Adversarial Robustness

提出Madry、Makelov、Schmidt、Tsipras、Vladu,2018 年《ICLR》论文“Towards Deep Learning Models Resistant to Adversarial Attacks”。 争议(未见反对;边界:一个范数球不代表现实攻击,鲁棒训练还会付出准确率与算力代价。) 最新(2024—2026年未见直接更新。)。 关键鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试。

决定性变化始于2018年的ICLR:Madry、Makelov、Schmidt、Tsipras、Vladu不再允许深度学习在对抗鲁棒上继续用训练成功代替泛化解释。Madry、Makelov、Schmidt、Tsipras、Vladu逐项核对模型参数、训练样本与样本外误差里的对抗鲁棒;数据污染、算力预算与长尾失败由深度学习里的Dropout另行登记。在ICLR的证据账上,由投影梯度对抗训练在MNIST和CIFAR建立可重复强基线起步,深度学习里的Dropout进入解释对照;本条残差不能靠改名消失。

对抗鲁棒的可反驳立场是:鲁棒性必须对明确威胁模型中的最坏扰动优化,而非依赖随机噪声测试。Madry、Makelov、Schmidt、Tsipras、Vladu这一路线据此把决定性解释锁在一个对象上,深度学习里的Dropout的“训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成”不能替代本条;边界是一个范数球不代表现实攻击。若加入反事实条件仍不能保持方向,深度学习里的Dropout便构成对抗鲁棒的近邻反例;ICLR对对抗鲁棒仅支持原任务。

可核对的主证据是Madry、Makelov、Schmidt、Tsipras、Vladu,2018 年《ICLR》论文“Towards Deep Learning Models Resistant to Adversarial Attacks”:投影梯度对抗训练在MNIST和CIFAR建立可重复强基线。深度学习里的Dropout要求把2018年的对抗鲁棒样本与对照结算,再核查深度学习里的Dropout的任务、观察窗和一个范数球不代表现实攻击。对对抗鲁棒,深度学习里的Dropout仅作近邻;支点仍是Madry、Makelov、Schmidt、Tsipras、Vladu在ICLR的原始比较。回到ICLR的取样方式,对抗鲁棒要用深度学习里的Dropout证明原分母没有删去最容易失败的对象。

对抗鲁棒自己留下的反证入口是:一个范数球不代表现实攻击,鲁棒训练还会付出准确率与算力代价。把时间窗拉长再看时,Madry、Makelov、Schmidt、Tsipras、Vladu的解释可能缩小、反号,或让位给深度学习里的Dropout的路径。深度学习里的Dropout给出复核ICLR的近邻条件:固定资源预算后比较;对抗鲁棒负责记录中止、排除和不显著对象。

投影梯度对抗训练在MNIST和CIFAR建立可重复强基线改变登记顺序:模型参数、训练样本与样本外误差归对抗鲁棒,数据污染、算力预算与长尾失败交深度学习里的Dropout核查。2014年的深度学习里的Dropout以“训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成”作近邻;两者若结论不同,应以一个范数球不代表现实攻击为分账边界;深度学习里的Dropout不得与本条合成一个平均分。

2018年,对抗鲁棒据投影梯度对抗训练在MNIST和CIFAR建立可重复强基线对接第257号第十三条。跨过去,一个范数球不代表现实攻击迫使对抗鲁棒重新检验可见读数。对抗鲁棒以一个范数球不代表现实攻击施加反向压力。该接口若仍支持相反方向,一个范数球不代表现实攻击要求对抗鲁棒增加第三条件,同时容纳两边的失效样本。

位置S——它把对抗鲁棒所定义的结构、表示或可判结果当成单独够用的那一样 单因只有对抗鲁棒是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲边界数据上仍正确判定的样本数/全部边界样本数 失效当一个范数球不代表现实攻击,主指标越高,边界外保持率反而越低 自曝误差分解把漏项指向:一个范数球不代表现实攻击 空栏对抗鲁棒中与“一个范数球不代表现实攻击”有关却未入分母的失败对象 异名另见第257号第十三条“高维稳健统计把异常值从‘先删掉’改为对抗模型的一部分”

八、分布外泛化:独立同分布验证不能担保部署Out-of-Distribution Generalization

提出Koh 等,2021 年《ICML》139:5637–5664。 争议(未见反对;边界:基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络。) 最新(2024—2026年未见直接更新。)。 关键模型必须在时间、地点、亚群和采集方式变化下接受分组评估。

最早被迫重写的是2021年的ICML:Koh 等不再允许深度学习在分布外泛化上继续用训练成功代替泛化解释。Koh 等逐项核对模型参数、训练样本与样本外误差里的分布外泛化;数据污染、算力预算与长尾失败由序列到序列另行登记。在ICML的证据账上,由WILDS汇集医疗、遥感、动物和文本数据起步,序列到序列进入解释对照;本条残差不能靠改名消失。

分布外泛化的可反驳立场是:模型必须在时间、地点、亚群和采集方式变化下接受分组评估。Koh 等这一路线据此把决定性解释锁在一个对象上,序列到序列的“编码器与解码器可直接从成对序列学习映射,减少手写语言管线”不能替代本条;边界是基准切分只覆盖已知变化。若用盲法重跑关键判断仍不能保持方向,序列到序列便构成分布外泛化的近邻反例;ICML对分布外泛化仅支持原任务。

可核对的主证据是Koh 等,2021 年《ICML》139:5637–5664:WILDS汇集医疗、遥感、动物和文本数据,显示标准经验风险最小化常难被复杂方法稳定超过。序列到序列要求把2021年的分布外泛化样本与对照结算,再核查序列到序列的任务、观察窗和基准切分只覆盖已知变化。对分布外泛化,序列到序列仅作近邻;支点仍是Koh 等在ICML的原始比较。

分布外泛化自己留下的反证入口是:基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络。保留失败对象后检验时,Koh 等的解释可能缩小、反号,或让位给序列到序列的路径。序列到序列给出复核ICML的近邻条件:用正交量纲重测;分布外泛化负责记录中止、排除和不显著对象。回到ICML的取样方式,分布外泛化要用序列到序列证明原分母没有删去最容易失败的对象。

WILDS汇集医疗、遥感、动物和文本数据改变登记顺序:模型参数、训练样本与样本外误差归分布外泛化,数据污染、算力预算与长尾失败交序列到序列核查。2014年的序列到序列以“编码器与解码器可直接从成对序列学习映射,减少手写语言管线”作近邻;两者若结论不同,应以基准切分只覆盖已知变化为分账边界;序列到序列不得与本条合成一个平均分。

2021年,分布外泛化据WILDS汇集医疗、遥感、动物和文本数据对接第258号第三条。跨过去,基准切分只覆盖已知变化迫使分布外泛化重新检验可见读数。分布外泛化以基准切分只覆盖已知变化施加反向压力。该接口若仍支持相反方向,基准切分只覆盖已知变化要求分布外泛化增加第三条件,同时容纳两边的失效样本。

位置D——它把分布外泛化的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有分布外泛化是决定因素 预设〔01 谁进入分母〕被成功采集或完成任务者可以代表全部目标对象 量纲边界数据上仍正确判定的样本数/全部边界样本数 失效当基准切分只覆盖已知变化,结论只留在原任务内 自曝开放材料使外部团队发现:基准切分只覆盖已知变化 空栏分布外泛化中与“基准切分只覆盖已知变化”有关却未入分母的失败对象 异名另见第258号第三条“协变量漂移把训练集与部署集区分成两个分布”

九、效率独立成题:准确率要除以能耗、内存与延迟Efficient Deep Learning

提出Schwartz、Dodge、Smith、Etzioni,2020 年《Communications of the ACM》63(12):54–63,DOI 10.1145/3381831。 争议(未见反对;边界:能耗依赖地区电网和硬件利用率,单一FLOPs也不能代表环境与服务成本。) 最新(2024—2026年未见直接更新。)。 关键模型进步应同时报告训练计算、推理成本和硬件条件。

这一条先处理2020年的Communications of the ACM:Schwartz、Dodge、Smith、Etzioni不再允许深度学习在效率独立成题上继续用训练成功代替泛化解释。Schwartz、Dodge、Smith、Etzioni逐项核对模型参数、训练样本与样本外误差里的效率独立成题;数据污染、算力预算与长尾失败由批归一化另行登记。在Communications of the ACM的证据账上,由Green AI提出把效率作为主要评价而非脚注起步,批归一化进入解释对照;本条残差不能靠改名消失。

效率独立成题的可反驳立场是:模型进步应同时报告训练计算、推理成本和硬件条件。Schwartz、Dodge、Smith、Etzioni这一路线据此把决定性解释锁在一个对象上,批归一化的“中间激活按小批量标准化,使更大学习率和更深网络可训练”不能替代本条;边界是能耗依赖地区电网和硬件利用率。若将短期与长期拆账仍不能保持方向,批归一化便构成效率独立成题的近邻反例;Communications of the ACM对效率独立成题仅支持原任务。

可核对的主证据是Schwartz、Dodge、Smith、Etzioni,2020 年《Communications of the ACM》63(12):54–63,DOI 10.1145/3381831:Green AI提出把效率作为主要评价而非脚注,暴露同等精度下数十倍成本差。批归一化要求把2020年的效率独立成题样本与对照结算,再核查批归一化的任务、观察窗和能耗依赖地区电网和硬件利用率。对效率独立成题,批归一化仅作近邻;支点仍是Schwartz、Dodge、Smith、Etzioni在Communications of the ACM的原始比较。回到Communications of the ACM的取样方式,效率独立成题要用批归一化证明原分母没有删去最容易失败的对象。

效率独立成题自己留下的反证入口是:能耗依赖地区电网和硬件利用率,单一FLOPs也不能代表环境与服务成本。改用地点外资料复核时,Schwartz、Dodge、Smith、Etzioni的解释可能缩小、反号,或让位给批归一化的路径。批归一化给出复核Communications of the ACM的近邻条件:撤去界面提示再验;效率独立成题负责记录中止、排除和不显著对象。

Green AI提出把效率作为主要评价而非脚注改变登记顺序:模型参数、训练样本与样本外误差归效率独立成题,数据污染、算力预算与长尾失败交批归一化核查。2015年的批归一化以“中间激活按小批量标准化,使更大学习率和更深网络可训练”作近邻;两者若结论不同,应以能耗依赖地区电网和硬件利用率为分账边界;批归一化不得与本条合成一个平均分。

2020年,效率独立成题据Green AI提出把效率作为主要评价而非脚注对接第251号第十六条。跨过去,能耗依赖地区电网和硬件利用率迫使效率独立成题重新检验可见读数。效率独立成题以能耗依赖地区电网和硬件利用率施加反向压力。该接口若仍支持相反方向,能耗依赖地区电网和硬件利用率要求效率独立成题增加第三条件,同时容纳两边的失效样本。

位置E——它把效率独立成题的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有效率独立成题是决定因素 预设〔02 单一读数代表复杂对象〕一个汇总分足以替代多层过程 量纲同等精度下节省的训练资源/原方案全部训练资源 失效当能耗依赖地区电网和硬件利用率,结论只留在原任务内 自曝一次真正的边界检验显示:能耗依赖地区电网和硬件利用率 空栏效率独立成题中与“能耗依赖地区电网和硬件利用率”有关却未入分母的失败对象 异名另见第251号第十六条“功耗、暗硅与热设计”

十、蒸馏:小模型同时学习软分布与中间表示Knowledge Distillation

提出Jiao、Yin、Shang 等,2020 年《Findings of EMNLP》:4163–4174,DOI 10.18653/v1/2020.findings-emnlp.372。 争议(未见反对;边界:学生会继承教师偏差与盲点;压缩后的相似准确率不代表相似校准。) 最新(2024—2026年未见直接更新。)。 关键教师输出与中间注意、隐藏状态可共同压入更小学生模型。

原论文正面碰到2020年的Findings of EMNLP:Jiao、Yin、Shang 等不再允许深度学习在蒸馏上继续用训练成功代替泛化解释。Jiao、Yin、Shang 等逐项核对模型参数、训练样本与样本外误差里的蒸馏;数据污染、算力预算与长尾失败由残差学习另行登记。在Findings of EMNLP的证据账上,由TinyBERT把模型缩小约7.5倍、推理加速约9.4倍起步,残差学习进入解释对照;本条残差不能靠改名消失。

蒸馏的可反驳立场是:教师输出与中间注意、隐藏状态可共同压入更小学生模型。Jiao、Yin、Shang 等这一路线据此把决定性解释锁在一个对象上,残差学习的“恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差”不能替代本条;边界是学生会继承教师偏差与盲点。若把人工接管计入结果仍不能保持方向,残差学习便构成蒸馏的近邻反例;Findings of EMNLP对蒸馏仅支持原任务。

可核对的主证据是Jiao、Yin、Shang 等,2020 年《Findings of EMNLP》:4163–4174,DOI 10.18653/v1/2020.findings-emnlp.372:TinyBERT把模型缩小约7.5倍、推理加速约9.4倍,并保留九成以上任务表现。残差学习要求把2020年的蒸馏样本与对照结算,再核查残差学习的任务、观察窗和学生会继承教师偏差与盲点。对蒸馏,残差学习仅作近邻;支点仍是Jiao、Yin、Shang 等在Findings of EMNLP的原始比较。回到Findings of EMNLP的取样方式,蒸馏要用残差学习证明原分母没有删去最容易失败的对象。

蒸馏自己留下的反证入口是:学生会继承教师偏差与盲点;压缩后的相似准确率不代表相似校准。让替代路径进入对照时,Jiao、Yin、Shang 等的解释可能缩小、反号,或让位给残差学习的路径。残差学习给出复核Findings of EMNLP的近邻条件:按亚组分别结算;蒸馏负责记录中止、排除和不显著对象。拿残差学习作近邻检验,可辨认Jiao、Yin、Shang 等观察到的是独有路径,还是另一条路线的表面同义词。

TinyBERT把模型缩小约7.5倍、推理加速约9.4倍改变登记顺序:模型参数、训练样本与样本外误差归蒸馏,数据污染、算力预算与长尾失败交残差学习核查。2016年的残差学习以“恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差”作近邻;两者若结论不同,应以学生会继承教师偏差与盲点为分账边界;残差学习不得与本条合成一个平均分。

2020年,蒸馏据TinyBERT把模型缩小约7.5倍、推理加速约9.4倍对接第050号第二幕二。跨过去,学生会继承教师偏差与盲点迫使蒸馏重新检验可见读数。蒸馏以学生会继承教师偏差与盲点施加反向压力。该接口若仍支持相反方向,学生会继承教师偏差与盲点要求蒸馏增加第三条件,同时容纳两边的失效样本。第050号第二幕二“可提示分割:点、框和粗掩码成为通用视觉接口”提供不同尺度的反例;它迫使蒸馏把“适用”写成可检查的对象范围。

位置S——它把蒸馏所定义的结构、表示或可判结果当成单独够用的那一样 单因只有蒸馏是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲蒸馏在未见任务上保持增益的任务数/全部预注册任务数 失效当学生会继承教师偏差与盲点,结论只留在原任务内 自曝部署或临床记录反证:学生会继承教师偏差与盲点 空栏蒸馏中与“学生会继承教师偏差与盲点”有关却未入分母的失败对象 异名另见第050号第二幕二“可提示分割:点、框和粗掩码成为通用视觉接口”

十一、科学迁移:高分基准不等于物理与生物规律被学会Deep Learning for Science

提出Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2。 争议(未见反对;边界:高置信结构不等于动力学、结合与细胞情境;数据库覆盖决定可预测范围。) 最新(2024—2026年未见直接更新。)。 关键深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线。

方法转向发生在2021年的Nature:Jumper 等不再允许深度学习在科学迁移上继续用训练成功代替泛化解释。Jumper 等逐项核对模型参数、训练样本与样本外误差里的科学迁移;数据污染、算力预算与长尾失败由开源框架另行登记。在Nature的证据账上,由AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度起步,开源框架进入解释对照;本条残差不能靠改名消失。

科学迁移的可反驳立场是:深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线。Jumper 等这一路线据此把决定性解释锁在一个对象上,开源框架的“统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展”不能替代本条;边界是高置信结构不等于动力学、结合与细胞情境。若审计数据近邻与泄漏仍不能保持方向,开源框架便构成科学迁移的近邻反例;Nature对科学迁移仅支持原任务。

可核对的主证据是Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2:AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度。AlphaFold在CASP14多数目标达到接近实验结构的原子级精度。开源框架要求把2021年的科学迁移样本与对照结算,再核查开源框架的任务、观察窗和高置信结构不等于动力学、结合与细胞情境。对科学迁移,开源框架仅作近邻;支点仍是Jumper 等在Nature的原始比较。

科学迁移自己留下的反证入口是:高置信结构不等于动力学、结合与细胞情境;数据库覆盖决定可预测范围。把排除者放回分母时,Jumper 等的解释可能缩小、反号,或让位给开源框架的路径。开源框架给出复核Nature的近邻条件:改变任务顺序后追踪;科学迁移负责记录中止、排除和不显著对象。

AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度改变登记顺序:模型参数、训练样本与样本外误差归科学迁移,数据污染、算力预算与长尾失败交开源框架核查。2016年的开源框架以“统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展”作近邻;两者若结论不同,应以高置信结构不等于动力学、结合与细胞情境为分账边界;开源框架不得与本条合成一个平均分。

2021年,科学迁移据AlphaFold在CASP14多数目标上达到接近实验结构的原子级精度对接第027号第二幕二。跨过去,高置信结构不等于动力学、结合与细胞情境迫使科学迁移重新检验可见读数。科学迁移以高置信结构不等于动力学、结合与细胞情境施加反向压力。该接口若仍支持相反方向,高置信结构不等于动力学、结合与细胞情境要求科学迁移增加第三条件,同时容纳两边的失效样本。

位置D——它把科学迁移的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有科学迁移是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲科学迁移在未见任务上保持增益的任务数/全部预注册任务数 失效当高置信结构不等于动力学、结合与细胞情境,结论只留在原任务内 自曝不显著结果没有消失而是说明:高置信结构不等于动力学、结合与细胞情境 空栏科学迁移中与“高置信结构不等于动力学、结合与细胞情境”有关却未入分母的失败对象 异名另见第027号第二幕二“AlphaFold2把结构预测推进到近实验精度”

十二、数据污染审计:测试集一旦进入训练就失去裁判资格Benchmark Contamination

提出Deng 等,2024 年 arXiv:2403.10131《Rethinking Benchmark and Contamination for Language Models with Rephrased Samples》。 争议(未见反对;边界:检测器也会误判常识重合;无污染声明不是清白证明,需要封闭新题与时间切分。) 最新(2024—2026年未见直接更新。)。 关键开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据。

这项工作首先校正2024年的Rethinking Benchmark and Contamination for Language Models with Rephrased Samples:Deng 等不再允许深度学习在数据污染审计上继续用训练成功代替泛化解释。Deng 等逐项核对模型参数、训练样本与样本外误差里的数据污染审计;数据污染、算力预算与长尾失败由自监督对比学习另行登记。在Rethinking Benchmark and Contamination for Language Models with Rephrased Samples的证据账上,由对题目复述与成员推断的实验显示起步,自监督对比学习进入解释对照;本条残差不能靠改名消失。

数据污染审计的可反驳立场是:开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据。Deng 等这一路线据此把决定性解释锁在一个对象上,自监督对比学习的“不同增强视图的一致性可在无人工标签时学习可迁移视觉表示”不能替代本条;边界是检测器也会误判常识重合。若先登记停止线再部署仍不能保持方向,自监督对比学习便构成数据污染审计的近邻反例;Rethinking Benchmark and Contamination for Language Models with Rephrased Samples对数据污染审计仅支持原任务。

可核对的主证据是Deng 等,2024 年 arXiv:2403.10131《Rethinking Benchmark and Contamination for Language Models with Rephrased Samples》:对题目复述与成员推断的实验显示,精确去重无法覆盖语义近邻泄漏。自监督对比学习要求把2024年的数据污染审计样本与对照结算,再核查自监督对比学习的任务、观察窗和检测器也会误判常识重合。对数据污染审计,自监督对比学习仅作近邻;支点仍是Deng 等在Rethinking Benchmark and Contamination for Language Models with Rephrased Samples的原始比较。

数据污染审计自己留下的反证入口是:检测器也会误判常识重合;无污染声明不是清白证明,需要封闭新题与时间切分。固定资源预算后比较时,Deng 等的解释可能缩小、反号,或让位给自监督对比学习的路径。自监督对比学习给出复核Rethinking Benchmark and Contamination for Language Models with Rephrased Samples的近邻条件:让独立团队预注册;数据污染审计负责记录中止、排除和不显著对象。

对题目复述与成员推断的实验显示改变登记顺序:模型参数、训练样本与样本外误差归数据污染审计,数据污染、算力预算与长尾失败交自监督对比学习核查。2020年的自监督对比学习以“不同增强视图的一致性可在无人工标签时学习可迁移视觉表示”作近邻;两者若结论不同,应以检测器也会误判常识重合为分账边界;自监督对比学习不得与本条合成一个平均分。

2024年,数据污染审计据对题目复述与成员推断的实验显示对接第258号第十七条。跨过去,检测器也会误判常识重合迫使数据污染审计重新检验可见读数。数据污染审计以检测器也会误判常识重合施加反向压力。该接口若仍支持相反方向,检测器也会误判常识重合要求数据污染审计增加第三条件,同时容纳两边的失效样本。

位置E——它把数据污染审计的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有数据污染审计是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲边界数据上仍正确判定的样本数/全部边界样本数 失效当检测器也会误判常识重合,结论只留在原任务内 自曝近期复核仍保留的自我否定是:检测器也会误判常识重合 空栏数据污染审计中与“检测器也会误判常识重合”有关却未入分母的失败对象 异名另见第258号第十七条“去重与污染审计证明训练数据规模不能按原始token计数”

◎ 二十年连起来看

第一幕不是旧成果清单,而是深度学习第一次为自己建立可失败的比较尺。深层信念网收紧了旧默认,深度学习里的Dropout把隐含过程拆成可估参数,开源框架又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。

第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。自监督对比学习扩展了表示或分布,对抗鲁棒改变了研究单位,数据污染审计则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。

二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。ImageNet转折说明干预能改变路径,神经缩放律说明单一读数会混合层级,蒸馏又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。

◎ 三个常见误解

误解一:深度学习里的ReLU已经给出了稳定的通用解释。它容易取信,是因为非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示确实改变了旧的研究方式。但死亡单元与尺度爆炸仍在,激活函数不能替代初始化、归一化和数据设计,所以正确表述只能限于原设计可识别的那一段责任链。

误解二:双下降等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降仍只是一个可检验命题。曲线受优化、噪声和横轴选择影响,不能据此断言规模总能治愈过拟合说明,没有干预、替代解释和边界样本,可读不等于因果正确。

误解三:科学迁移的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把高置信结构不等于动力学、结合与细胞情境;数据库覆盖决定可预测范围藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。

◎ 与相邻领域的接口

深层信念网与第047号第二幕四“神经切线核:无限宽网络在训练初期近似核回归”的分工在于:本页负责无监督逐层预训练先找到参数盆地,再用监督信号整体微调,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。

残差学习可与第050号第二幕一“视觉Transformer:图像图块可直接进入自注意力”交换制度或工程中的回写证据。前者的核心命题是恒等捷径为梯度提供低阻通道,使百层网络不再因退化而更差,但深度只是表达预算;延迟、内存和数据偏差不会因捷径自动消失;后者则能检验同一接口是否把选择成本转移给了另一个主体。

分布外泛化与第258号第三条“协变量漂移把训练集与部署集区分成两个分布”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。

◎ 争议现场

序列到序列的争议是固定长度向量成为瓶颈,长句与稀有词暴露信息压缩上限。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。

神经缩放律的争议是外推会遇到数据质量、任务饱和和能力断点;损失下降不等于风险下降。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。

蒸馏的争议是学生会继承教师偏差与盲点;压缩后的相似准确率不代表相似校准。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。

◎ 往下五年看什么

到2031年,看自监督对比学习的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。

看彩票假说在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。

看效率独立成题的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。

看数据污染审计的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。

◎ 可与哪些领域对撞

深层信念网与第047号第二幕四“神经切线核:无限宽网络在训练初期近似核回归”共享“可见读数能代表真实对象”的预设。本条用收益依赖当时初始化和数据规模,后来的归一化与残差结构会改变必要性给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。

开源框架与第249号第九条“多层中间表示”共享“局部表现能够结算整体能力”的预设。开源框架主张统一计算图、自动微分和设备调度,让论文方法能跨硬件复现与扩展。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。

分布外泛化与第258号第三条“协变量漂移把训练集与部署集区分成两个分布”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是基准切分只覆盖已知变化,未知部署环境仍可能超出测试包络。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。

◎ 十条可做的研究命题

  1. 在时间外数据上重做深层信念网;方向保持率低于二分之一即证伪其稳定性。
  2. 把深度学习里的ReLU的中止与排除对象放回分母;主效应反号即否定原总结。
  3. 为ImageNet转折配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
  4. 由独立团队预注册深度学习里的Dropout的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
  5. 对序列到序列的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
  6. 主动改变批归一化的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
  7. 对双下降做反事实干预;可视化不随关键参数变化即证伪忠实性。
  8. 把对抗鲁棒交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
  9. 公开科学迁移的最强失败实现;下一方法只在原基准改善即判定为换题。
  10. 为数据污染审计事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。

◎ 资料核验

  1. Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527。
  2. Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323。
  3. Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105。
  4. Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958。
  5. Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112。
  6. Ioffe 与 Szegedy,2015 年《ICML》37:448–456。
  7. He、Zhang、Ren、Sun,2016 年《CVPR》:770–778,DOI 10.1109/CVPR.2016.90。
  8. Abadi 等,2016 年 arXiv:1603.04467《TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems》。
  9. Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607。
  10. He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553。
  11. Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116。
  12. Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》。
  13. Frankle 与 Carbin,2019 年《ICLR》论文“The Lottery Ticket Hypothesis”。
  14. Power 等,2022 年 arXiv:2201.02177《Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets》。
  15. Madry、Makelov、Schmidt、Tsipras、Vladu,2018 年《ICLR》论文“Towards Deep Learning Models Resistant to Adversarial Attacks”。
  16. Koh 等,2021 年《ICML》139:5637–5664。
  17. Schwartz、Dodge、Smith、Etzioni,2020 年《Communications of the ACM》63(12):54–63,DOI 10.1145/3381831。
  18. Jiao、Yin、Shang 等,2020 年《Findings of EMNLP》:4163–4174,DOI 10.18653/v1/2020.findings-emnlp.372。
  19. Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2。
  20. Deng 等,2024 年 arXiv:2403.10131《Rethinking Benchmark and Contamination for Language Models with Rephrased Samples》。
  21. Kirchenbauer 等,2024 年《ICLR 2024》论文“On the Reliability of Watermarks for Large Language Models”。
  22. Dubey 等,2024 年 arXiv:2407.21783《The Llama 3 Herd of Models》。
  23. Gu 与 Dao,2024 年《COLM 2024》论文“Mamba: Linear-Time Sequence Modeling with Selective State Spaces”。
  24. DeepSeek-AI,2025 年 arXiv:2501.12948《DeepSeek-R1》。
【学科经典思想汇集部分】1950–2006 · 20 条经典学科思想

以下二十条是深度学习在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。

经一、感知机:第一台自己调参数的机器,和它被吹出去的那部分Classic 01 · Deep Learning

提出Frank Rosenblatt,1958 年《心理学评论》65:386–408,随后有 Mark I 硬件实现。 流变收敛定理确立了它的能力边界;而当年关于「能自我复制、能意识到自身存在」的公开宣称从未兑现,反噬持续二十年。 今用本块十一「科学迁移:高分基准不等于物理与生物规律被学会」处理的正是同一种外推。 关键一个带可调权重的阈值单元,能通过误差驱动的权重更新自行学会线性可分的分类。

此前的机器都要人把规则写完,感知机第一次把规则交给数据:给样例、看错在哪、按错的方向挪权重。这个循环今天仍是所有监督学习的内核。硬件实现也很重要——它证明这不是纸上算法,四百个光电管接进去就能识别简单图形。

问题出在演示到宣称的那一步。当时的报道称这台机器将能行走、说话、书写、自我复制并意识到自身存在,而实际能力是线性可分类别的分类。这段落差在此后二十年里被反复引用为「神经网络言过其实」的证据,其代价由整个方向承担。经典层收它,一半是收算法,一半是收这份代价。

位置S——它把「一次可运行的演示」当成单独够用的那一样 预设〔01 演示可外推〕默认受控条件下的能力可按比例延伸到开放任务 量纲公开宣称的能力项数∶其中在同一系统上被演示过的能力项数 失效当演示任务与宣称任务在结构上不同类时,性能曲线不可外推,宣称与证据脱钩 异名科学传播称「过度承诺」,产品管理称「演示与量产的差距」;另见本块十一

经二、最小均方规则:让机器一边工作一边改自己Classic 02 · Deep Learning

提出Bernard Widrow 与 Marcian Hoff,1960 年 IRE WESCON 会议记录 4:96–104,Adaline 与 LMS 算法。 流变成为自适应滤波与通信均衡的工业标准;其对输入尺度与学习率的敏感性长期靠人工调节,直到网络内部归一化出现。 今用本块己「批归一化:训练分布被纳入网络内部控制」把这项人工调节收进了模型自身。 关键按瞬时误差的平方对权重求梯度并逐样本更新,可在线逼近最小均方误差解。

LMS 与感知机同年,路线却不同:感知机按分类对错更新,LMS 按连续误差的平方更新。后者可微、可分析、有收敛条件,因而立刻进了工程——今天的调制解调器、回声消除与降噪耳机里跑的仍是它的后代。这是神经网络研究最早也最持久的一次工业兑现。

它同时把一个至今没消失的麻烦摆了出来:稳定收敛的学习率上界由输入信号的功率决定,输入尺度一变就要重调。半个世纪里这靠预处理与人工调参解决,代价是每换一个数据集就要重来一遍。把「输入分布」从外部预处理挪进网络内部,是这条老问题的最终解法。

位置E——它把「逐样本的梯度更新」当成单独够用的那一样 预设〔02 输入分布外生且稳定〕默认送进来的信号统计量在训练全程不变 量纲可稳定收敛的学习率上界∶输入信号功率的实测变动范围 失效当各层输入分布随训练自行漂移时,固定学习率无法同时适配各层,调参成本随深度上升 异名信号处理称「自适应滤波」,控制论称「在线辨识」;另见本块己

经三、感知机收敛定理:能不能学会,取决于两类点离得多开Classic 03 · Deep Learning

提出Albert Novikoff,1962 年《自动机数学理论研讨会论文集》12:615–622。 流变间隔概念此后成为统计学习理论与支持向量机的核心;二〇一〇年代又在对抗样本研究里以「决策边界离数据多近」的形式回来。 今用本块七「对抗鲁棒:高准确率模型可被人眼不可见扰动击穿」量的正是这段距离。 关键若两类样本线性可分且间隔为正,感知机的更新次数有一个只依赖间隔与半径的上界。

这条定理把一个经验算法变成了可分析的对象:它不保证学得快,但保证在有限步内停。更要紧的是它指出了决定难度的量——不是样本数,不是维度,而是间隔与数据半径之比。学习的难度第一次有了一个几何量作为刻度。

间隔这个量后来两次改变领域面貌。第一次是支持向量机把「最大化间隔」变成显式目标,得到当时最好的泛化界。第二次出乎意料:深度网络在测试集上准确率极高,而决策边界离真实样本极近——沿某个方向挪动一点点就换类。准确率与间隔在深网上分了家,这正是对抗样本的几何解释。

位置D——它把「类间几何间隔」当成单独够用的那一样 预设〔03 高准确率蕴含大间隔〕默认分类正确率高的模型其决策边界离样本也远 量纲测试集准确率∶把样本推过决策边界所需的最小扰动范数 失效当高维空间中边界紧贴数据流形时,准确率与间隔可同时取极端相反的值 异名优化理论称「条件数」,安全工程称「安全裕度」;另见本块七

经四、多层网络的随机梯度:深层不是不能训,是没人接着训Classic 04 · Deep Learning

提出甘利俊一(Shun-ichi Amari),1967 年《IEEE 电子计算机汇刊》EC-16:299–307,用随机梯度下降训练多层分类器。 流变这条线索在西方文献中长期未被引用;深层训练的可行性直到二〇〇六年前后才因逐层预训练重新成为公认事实。 今用本块甲「深层信念网:逐层预训练让深网络第一次稳定启动」正是这一问题被重新解决的那一刻。 关键多层非线性分类器可用随机梯度下降端到端训练,不必逐层手工设计特征。

这项工作比通行叙事早了近二十年:它已经给出了多层网络加随机梯度的完整配方,也报告了可用的实验结果。它没有改变领域走向,主要不是因为想法不对,而是因为发表语言、期刊圈层与当时缺乏算力和数据这三件事叠在一起。

它的存在改写了「为什么深层训练迟到」的解释。常见说法是「反向传播直到 1986 年才被发明」,而更准确的说法是:方法在文献里出现过多次,每次都因为缺少可复现的规模化证据而没有被接住。这条经典因此是关于领域记忆的:一个方法是否算数,取决于有没有人在可比较的条件下把它做给别人看。

位置S——它把「方法已被提出」当成单独够用的那一样 预设〔04 已发表即已进入领域〕默认正确的方法一旦见刊就会被后续工作继承 量纲文献中独立提出该方法的次数∶其中引发后续跟进的次数 失效当缺少同一基准上的可比较证据时,方法的重新发现次数与其被采纳的概率无关 异名科学计量学称「睡美人文献」,工程管理称「技术就绪度不足」;另见本块甲

经五、《感知机》一书:一份严格的能力证明,被读成了一纸死刑Classic 05 · Deep Learning

提出Marvin Minsky 与 Seymour Papert,1969 年《感知机》(MIT Press)。 流变书中关于单层网络的结论完全正确,且作者明确讨论了多层情形;但「神经网络此路不通」的读法在此后十余年支配了经费与人才流向。 今用本块八「分布外泛化:独立同分布验证不能担保部署」处理的是同一种误推——把一个域内的结论搬到域外。 关键单层感知机无法计算奇偶性与连通性这类需要全局信息的谓词,其权重规模随输入尺寸增长。

这本书的数学是干净的:它精确刻画了单层结构能与不能表示什么,其中连通性判定的结论至今成立。它做的是能力上界的证明,而不是对整个研究方向的判决——书里明确说到多层网络的情形是开放的。

被广泛接受的却是那个更强也更省事的读法。这里值得记的不是谁误读了谁,而是误读的结构:一个在明确条件下成立的否定结论,被搬到条件之外当成普遍结论。今天在机器学习里,同一结构以另一种形式反复出现——在独立同分布的测试集上验证通过,就被当作在部署环境里也成立。

位置D——它把「一个域内的不可能性证明」当成单独够用的那一样 预设〔05 条件内结论可搬到条件外〕默认限定条件下的否定结果适用于放宽条件后的情形 量纲被证明成立的条件范围∶该结论在实践中被引用的条件范围 失效当结论的前提(层数、可分性、分布)被放宽而结论仍被沿用时,证明与断言不再是同一件事 异名逻辑学称「越界推广」,法学称「判例的射程」;另见本块八

经六、自动微分的逆向模式:先有工具,二十年后才有用武之地Classic 06 · Deep Learning

提出Seppo Linnainmaa,1970 年赫尔辛基大学硕士论文,给出累积舍入误差的逆向自动微分算法。 流变长期只在数值分析与最优控制里使用;直到深度学习框架把它做成默认基础设施,才成为所有人每天都在用的东西。 今用本块辛「开源框架:计算图与自动微分把复现成本降到团队可承受」正是它的工业化形态。 关键对任意由基本运算复合而成的函数,其全部偏导数可以在与函数求值同量级的代价内一次算出。

这条结果的分量常被低估:它说的不是「可以求导」,而是「求全部导数的代价与求一次函数值同阶」。若不是这样,参数量上亿的模型每一步都要做上亿次前向计算,训练在算术上就不成立。整个深度学习的可行性建立在这条复杂度结论上。

它同样是一条「工具先到、用途后到」的经典。二十年里它属于数值分析,与神经网络的文献几乎不交叉;反向传播被反复重新发现,正是因为发现者往往不知道这件事早已被一般地解决了。今天框架把它藏进一行调用,代价是很少有人再意识到它是一条有前提的复杂度定理。

位置E——它把「一次逆向遍历」当成单独够用的那一样 预设〔06 计算图可完整驻留〕默认前向中间结果能被全部保存以供逆向使用 量纲逆向求导的时间代价∶一次前向求值的时间代价 失效当中间结果因显存不足必须丢弃并重算时,同阶结论不再成立,代价随重算策略上升 异名数值分析称「伴随方法」,最优控制称「协状态方程」;另见本块辛

经七、新认知机:卷积、池化与整流单元,一次全在里面了Classic 07 · Deep Learning

提出福岛邦彦(Kunihiko Fukushima),1980 年《生物控制论》36:193–202。 流变其结构被完整继承,而其无监督的竞争学习规则被反向传播取代;整流线性激活直到二〇一〇年前后才被重新采用。 今用本块乙「ReLU:一个非饱和门改变梯度与稀疏激活」用的正是这本书里已经在用的那种单元。 关键局部感受野、权值共享与逐层下采样的交替堆叠,可产生对位移不敏感的模式识别。

今天卷积网络的三件核心结构——局部连接、权值共享、池化——在这里已经同时具备,而且动机不是工程便利而是视觉皮层的简单细胞与复杂细胞。它给出的是一整套架构假设:不变性不该靠数据量堆出来,该由结构本身保证。

它与后来主流的差别只在学习规则:无监督的竞争学习换成了带标签的反向传播。这一点值得记,因为它说明结构与学习算法是两笔账,可以分别更换。同样值得记的是整流线性单元——它在这里就在用,被饱和型激活压了三十年,直到梯度问题变得无法回避才被翻出来。

位置S——它把「架构中的不变性假设」当成单独够用的那一样 预设〔07 结构可保证不变性〕默认位移不变性能由权值共享与池化完全提供 量纲由结构保证的不变性维度数∶实际任务中需要的不变性维度数 失效当所需不变性(旋转、尺度、视角)不在结构假设内时,只能退回用数据增广补偿 异名信号处理称「平移不变滤波」,建筑学称「结构承载与装饰分离」;另见本块乙

经八、Hopfield 网络:把记忆写成一个能量函数的谷底Classic 08 · Deep Learning

提出John Hopfield,1982 年《美国科学院院刊》79:2554–2558。 流变容量上界被证明约为神经元数的百分之十四,虚假吸引子问题始终存在;其能量视角则被现代生成模型继承。 今用本块二「掩码自编码:预测缺失部分取代逐对样本比较」做的正是「从残缺恢复整体」这同一件事。 关键对称连接的二值网络存在能量函数,其动力学必收敛到局部极小,存储的模式即这些极小点。

这条命题把「记忆」从存取地址改成了动力学:不需要知道存在哪里,给一个残缺的输入,系统自己滚到最近的谷底。内容寻址、容错、自动补全,全都是这一个机制的后果。它同时把统计物理的整套语言引进来,让「网络会不会收敛」成为可以证明的问题。

它的边界也很硬。存储容量与神经元数成正比而系数很小,超出后模式互相干扰;能量面上还会长出没存过的虚假谷底。这两条限制说明「联想记忆」不是免费的,而现代模型对同一问题的回答是把补全从吸引子动力学换成条件概率建模——要补的东西一样,代价结构完全不同,容量也不再由神经元数直接封顶。

位置E——它把「能量面的局部极小」当成单独够用的那一样 预设〔08 极小点即存储项〕默认动力学收敛到的谷底对应曾经写入的模式 量纲可稳定检索的模式数∶网络中神经元的数目 失效当写入模式数超过容量上界时,出现未被写入的虚假吸引子,检索结果不可信而系统仍会收敛 异名统计物理称「自旋玻璃」,数据库称「内容寻址存储」;另见本块二

经九、玻尔兹曼机:不给标签,让网络自己去匹配数据的分布Classic 09 · Deep Learning

提出David Ackley、Geoffrey Hinton 与 Terrence Sejnowski,1985 年《认知科学》9:147–169。 流变原始版本的采样代价过高而基本不可训练;受限版本与对比散度使它在二〇〇六年前后短暂成为深层预训练的主力。 今用本块一「自监督对比学习:标签不再是表示学习的唯一入口」延续的正是「不用标签也能学表示」这条路。 关键网络的目标是让其自身生成分布逼近数据分布,学习规则由数据相位与自由相位的统计量之差给出。

这是第一个把学习明确写成分布匹配的神经网络:不问「分类对不对」,只问「我生成的东西像不像看到的东西」。隐单元因此有了明确的身份——它们是为了解释数据而被引入的潜变量,不是为了拟合标签而加的中间层。今天所有生成式预训练的目标函数都在这条线上。

代价是那个「自由相位」:要估计模型自身的统计量,就得从模型里采样,而采样需要马尔可夫链跑到平衡。全连接版本上这实际做不到。此后二十年的技术史几乎都在绕开这一步——限制连接结构、截断链长、换成对比目标、换成去噪目标。目标没变,可算性被反复重新工程化。

位置D——它把「模型分布与数据分布之差」当成单独够用的那一样 预设〔09 模型统计量可采样估计〕默认自由相位的期望能在可接受时间内被近似 量纲达到平衡所需的采样步数∶单次参数更新可承受的采样步数 失效当马尔可夫链混合缓慢时,梯度估计有系统偏差,训练可以稳定进行却收敛到错误的模型 异名统计物理称「配分函数难题」,统计学称「难解归一化常数」;另见本块一

经十、反向传播的普及:不是被发明的那一次,是被接住的那一次Classic 10 · Deep Learning

提出David Rumelhart、Geoffrey Hinton 与 Ronald Williams,1986 年《自然》323:533–536,及同年《并行分布处理》两卷(MIT Press)。 流变深层网络随后被发现梯度会指数衰减或爆炸;这一障碍靠激活函数、归一化与跳连接分三次绕开。 今用本块庚「残差学习:让层学习修正量而非重做全部映射」正是对梯度路径的最后一次改造。 关键误差可沿网络逐层反传,从而对隐藏层权重求导,使多层网络的端到端训练成为常规。

算法本身此前已被多次独立给出,这一次不同的地方是配套:一本两卷本的书、一批可复现的演示、一个把它与认知科学问题接起来的框架。方法因此第一次有了共同体。这提示一件事——领域记忆不由首次发表决定,由「有没有人把它做成别人能接着做的样子」决定。

它随即暴露出深层网络的真问题不在能不能求导,而在导数传得动传不动。链式法则把每层的雅可比连乘,稍有偏离就指数放大或衰减。后续三十年里最有效的几项改动——非饱和激活、内部归一化、跳连接——都不是新的学习原理,而是在修这条梯度路径。

位置E——它把「误差的逐层回传」当成单独够用的那一样 预设〔10 梯度可无损穿越深度〕默认链式法则在层数增加时不改变信号量级 量纲第一层收到的梯度范数∶最后一层的梯度范数 失效当逐层雅可比的谱半径系统偏离一时,深度增加使可训练性下降,而算法本身没有任何错误 异名控制论称「误差反传」,会计学称「成本逐级分摊」;另见本块庚

经十一、UCI 数据库:有了公共赛道,才有了可比较的成绩Classic 11 · Deep Learning

提出David Aha 与 Patrick Murphy,1987 年在加州大学欧文分校建立机器学习数据库。 流变它使横向比较成为可能,也让「在少数固定数据集上刷分」成为默认研究方式;同一批数据被反复使用带来的过拟合直到很晚才被系统研究。 今用本块十二「数据污染审计:测试集一旦进入训练就失去裁判资格」处理的正是这条赛道被磨损的问题。 关键公开、固定、可下载的标准数据集使不同算法的性能可以被直接比较。

在此之前,论文各用各的数据,谁也无法核对谁。公共数据集把领域从互相说服改成互相比较,这是机器学习能够快速积累的制度基础——它的作用与临床试验注册在医学里的作用同构。基准文化的一切好处都从这里开始。

坏处来自同一处。同一批测试集被整个共同体使用数十年,每一次「据此调整超参再报结果」都在悄悄把测试集变成训练集的一部分;发表偏倚让被报告的是那些恰好合适的配置。这种磨损无法从单篇论文里看出来,只能在共同体层面统计。今天大模型时代的污染问题,是同一件事在规模上的放大。

位置S——它把「一个固定的公共测试集」当成单独够用的那一样 预设〔11 测试集使用不改变其效力〕默认反复使用同一批留出数据不损害其裁判身份 量纲同一测试集被共同体使用的累计次数∶该测试集上仍可信的性能差异幅度 失效当整个共同体在同一批数据上迭代时,留出集逐步退化为验证集,报告的领先幅度不可信 异名统计学称「多重检验的社群版」,体育称「主场磨损」;另见本块十二

经十二、万能逼近定理:能表示,和能学到,是两件事Classic 12 · Deep Learning

提出George Cybenko,1989 年《控制、信号与系统数学》2:303–314;Kurt Hornik 等同年给出更一般的结果。 流变它被广泛引用为「神经网络无所不能」的依据,而定理本身对所需宽度、可学习性与样本复杂度一概未言。 今用本块四「神经缩放律:损失随模型、数据和计算呈近似幂律」给出的正是定理没有给的那部分——代价。 关键具有一个隐藏层与非多项式激活的前馈网络,可在紧集上以任意精度逼近任意连续函数。

这条定理终结了「神经网络表达能力不足」这一质疑,功劳明确。它也是被误用最多的一条:定理是存在性的,它保证存在一组权重能逼近,不保证这组权重能被任何算法在有限时间与有限样本下找到,也不给所需宽度的上界。

真正回答「代价是多少」的不是定理而是经验规律。缩放律给出的是损失随参数量、数据量与计算量的近似幂律关系——它没有存在性定理那么漂亮,却是唯一能用来做预算的东西。这一对照值得记住:存在性定理常常是研究纲领的入场券,而工程决策要的是代价曲线,两者不能互相替代。

位置S——它把「表达能力的存在性」当成单独够用的那一样 预设〔12 可表示蕴含可学到〕默认存在合适的参数就意味着训练能找到它 量纲定理保证的逼近精度∶达到该精度所需的宽度与样本数 失效当所需宽度随精度指数增长或优化不可达时,存在性成立而工程上完全不可用 异名数学分析称「稠密性」,经济学称「可行性不等于可达成」;另见本块四

经十三、卷积网络加反向传播:一个跑通了的系统,和它当年的算力账Classic 13 · Deep Learning

提出Yann LeCun 等,1989 年《神经计算》1:541–551;后有 1998 年《IEEE 会刊》86:2278–2324 的系统总结与 MNIST 基准。 流变技术路线正确而规模受限,长期只在支票识别等窄场景里工业化;直到图形处理器把同一结构放大两个数量级才全面兑现。 今用本块丙「ImageNet转折:数据、GPU与卷积一同越过旧基线」是同一条路线在算力到位后的结果。 关键把卷积结构与反向传播合在一起端到端训练,可在真实手写识别任务上达到工业可用精度。

这项工作把两条线并到一起:结构上的不变性假设与端到端的梯度训练。它不是演示,是一个真正部署的系统——美国相当比例的支票金额识别曾由它的后续版本完成。这在当时是神经网络唯一大规模的工业落地,也是此后十几年里这条路线最有力的存在证明。

它同时是一份关于约束的记录。当年的算力使网络只能做到几层与几万参数,于是特征工程与结构设计承担了大部分工作。二十年后同一结构不改原理只放大规模就越过所有旧基线,这说明当时被当作「方法的上限」的东西,其实是「当时算力的上限」。区分这两者,是判断一条路线该不该被放弃的关键。

位置D——它把「一次可部署的系统」当成单独够用的那一样 预设〔13 当前上限即方法上限〕默认在现有算力下测到的性能天花板属于方法本身 量纲同一结构在当年可训练的参数量∶二十年后可训练的参数量 失效当性能瓶颈来自算力而非结构时,据此判定的方法上限会在资源变化后整条失效 异名工程学称「工艺受限」,经济史称「技术的时机」;另见本块丙

经十四、最优脑损伤:先训练一个大的,再把大部分剪掉Classic 14 · Deep Learning

提出Yann LeCun、John Denker 与 Sara Solla,1990 年《神经信息处理系统进展》第 2 卷(Morgan Kaufmann)。 流变剪枝成为模型压缩的标准手段;而「大网络里是否本来就藏着一个能单独训练的小网络」这一问直到很晚才被提出。 今用本块五「彩票假说:大网络里可能藏着可单独训练的稀疏子网」把剪枝从压缩手段改成了关于训练的主张。 关键用损失对权重的二阶导数估计每个参数的显著性,删去显著性最低的一批可在几乎不损精度下大幅稀疏化。

它给「哪些参数不重要」提供了第一个有理论依据的判据:不是看权重绝对值大小,而是看删掉它会让损失涨多少,用海森矩阵的对角近似来估。结论是训练完的网络里大部分参数可以删掉——这本身就说明参数量与真正被使用的容量不是一回事。

它留下的问题在三十年后才被问对。既然剪完的小网络能达到大网络的精度,为什么不一开始就训练那个小网络?经验回答长期是「训不出来」。彩票假说给出的解释是:小网络能训成,但要配上它在大网络里那次初始化。这把剪枝从工程手段变成了关于优化景观的经验主张。

位置E——它把「参数的二阶显著性」当成单独够用的那一样 预设〔14 剪枝后的结构可独立训练〕默认删掉不重要参数所得的结构与其来历无关 量纲剪枝后保留的参数比例∶从随机初始化直接训练该稀疏结构能达到的精度 失效当稀疏结构只有配合原初始化才能训成时,剪枝结果不可与从头训练的同规模网络相比 异名统计学称「变量选择」,外科学称「按功能代价切除」;另见本块五

经十五、偏差与方差的分解:那条被画了二十年的 U 形曲线Classic 15 · Deep Learning

提出Stuart Geman、Élie Bienenstock 与 René Doursat,1992 年《神经计算》4:1–58。 流变其分解本身是恒等式而始终成立;但「测试误差随容量先降后升」这条经验曲线在过参数化区间被证明只是曲线的左半段。 今用本块三「双下降:参数越过插值点后测试误差还能再次下降」正是曲线右半段被补上的那一次。 关键预测误差可分解为偏差、方差与不可约噪声三项,模型容量增加降低偏差而提高方差。

这条分解是恒等式,不可能错。它的教学价值极高:它解释了为什么更复杂的模型不一定更好,也给出了「刚刚好」这个直觉的数学形式。整整一代人据此把模型选择理解为在一条 U 形曲线上找最低点,而正则化是把曲线往左压。

被推翻的不是分解,是关于曲线形状的经验概括。当参数量越过能完全拟合训练集的那一点之后再继续增加,测试误差会第二次下降,且常常降到比第一个谷底更低。恒等式仍然成立——方差项在插值区间之后随隐式正则化而下降。这是一个漂亮的案例:同一个数学结论,两种完全不同的实践后果。

位置S——它把「容量与误差的单峰关系」当成单独够用的那一样 预设〔15 容量与方差单调同向〕默认参数越多方差越大,故存在唯一最优容量 量纲插值点左侧观察到的容量区间∶实际可用的容量区间 失效当训练在插值点右侧且带隐式正则时,方差随容量下降,单峰曲线只覆盖了半个区间 异名统计学称「模型选择」,工程学称「按经验区间外推」;另见本块三

经十六、长程依赖的困难:不是学不会,是梯度到不了那么远Classic 16 · Deep Learning

提出Yoshua Bengio、Patrice Simard 与 Paolo Frasconi,1994 年《IEEE 神经网络汇刊》5:157–166。 流变其分析被广泛接受,解法则分两路:门控结构与后来的注意力机制;而「训练到某一步之后突然学会」这类现象说明时间尺度并非唯一障碍。 今用本块六「Grokking:记住训练集之后还可能突然学会规则」正是对「学不会」这一判断的时间维修正。 关键循环网络要稳定保存长程信息,与梯度不指数消失这两项要求在数学上互相冲突。

这项工作把一个工程挫折变成了定理式的结论:不是调参不够用心,而是稳定存储与梯度传播这两个要求指向雅可比谱半径的相反方向。它因此界定了后续所有解法的形状——必须在结构上给信息开一条不经过反复相乘的路。

门控与注意力正是这样的路。但另一件事说明这条分析不覆盖全部:有些任务上模型先长时间只会背训练集,再在远超拟合点的训练步数上突然获得泛化能力。这说明「学不会」有时不是梯度到不了,而是还没到时候——优化时间本身是一个独立的变量,而原分析里没有它。

位置D——它把「梯度可达的时间跨度」当成单独够用的那一样 预设〔16 学不会即梯度不可达〕默认训练失败可完全归因于信号传播距离 量纲梯度衰减到可忽略前的时间步数∶任务实际要求的依赖跨度 失效当延长训练步数后泛化突然出现时,失败的原因是训练时长而非传播距离,归因整条改写 异名控制论称「可观测性」,教育学称「学习潜伏期」;另见本块六

经十七、Bagging:把不稳定这件事拿来当资源用Classic 17 · Deep Learning

提出Leo Breiman,1996 年《机器学习》24:123–140。 流变与同期的提升方法一起统治了表格数据领域;其「多个扰动版本取平均」的思路后来以随机失活的形式回到神经网络内部。 今用本块丁「Dropout:随机删节点把共适应变成集成近似」正是把这条外部集成搬进单个网络的做法。 关键对同一训练集作有放回重采样并训练多个模型再取平均,可显著降低不稳定学习器的方差。

它的前提很反直觉:只有当基学习器不稳定——训练集轻微变动就给出很不同的模型——集成才有效。稳定的学习器平均起来没有收益。于是「不稳定」从缺点变成了被利用的性质,而这一条把决策树从一个平庸的方法送上了表格数据的头把交椅。

把它搬进神经网络的代价是隐式的。随机失活训练的是权重共享的指数多个子网络,测试时用一次前向近似它们的平均——这个近似在什么条件下成立,从未被完整刻画。它有效是经验事实,而它是否真的等价于集成,则是一个至今没有干净答案的问题。

位置E——它把「多个扰动模型的平均」当成单独够用的那一样 预设〔17 平均总能降方差〕默认对任何基学习器作集成都带来收益 量纲集成后的方差下降幅度∶基学习器对训练集扰动的敏感度 失效当基学习器足够稳定时,集成的收益趋近于零而计算成本按份数增加 异名统计学称「自助重抽」,投资学称「分散化」;另见本块丁

经十八、长短期记忆:给信息开一条不用反复相乘的路Classic 18 · Deep Learning

提出Sepp Hochreiter 与 Jürgen Schmidhuber,1997 年《神经计算》9:1735–1780。 流变遗忘门于 2000 年补入;此后十余年是序列建模的默认选择,直到并行化需求把它换成了注意力结构。 今用本块戊「序列到序列:固定接口把翻译改成端到端学习」用的正是这条结构撑起来的编码解码框架。 关键在循环单元中引入一条常误差流的细胞状态与若干乘性门,使梯度可在长时间跨度上不衰减地传播。

它的解法是结构性的:与其让信息每一步都被权重矩阵乘一次,不如开一条加法通道,让状态默认原样传下去,只在门允许时才被改写。这与后来残差连接的思路是同一个——把「保持不变」设为默认,把「改变」设为需要理由的操作。

它被替换的原因不是效果不好,而是它按定义无法并行:第 t 步必须等第 t−1 步算完。当训练规模变成决定性因素时,一个稍差但可完全并行的结构会赢。这条经典因此记录了一次口径变化——评价一个结构的标准,从「同等计算下的精度」变成了「同等墙钟时间下能吃进多少数据」。

位置S——它把「一条恒等的信息通道」当成单独够用的那一样 预设〔18 序列必须按时间顺序计算〕默认循环依赖不可拆解,训练无法在时间维并行 量纲同等硬件下每秒可处理的序列步数∶可并行结构下的同一指标 失效当规模成为主要变量时,不可并行的结构即使精度更优也会被淘汰,评价口径本身改变 异名数字电路称「保持与使能」,档案学称「默认留存、改写留痕」;另见本块戊

经十九、图形处理器训练:把一件业余可做的事变成了门槛Classic 19 · Deep Learning

提出Kyoung-Su Oh 与 Keechul Jung,2004 年《模式识别》37:1311–1314,以及 Dave Steinkraus 等 2005 年在文档分析会议上的报告。 流变二〇〇七年通用计算接口发布后成为标准做法;训练成本随后成为独立于精度的研究议题与准入门槛。 今用本块九「效率独立成题:准确率要除以能耗、内存与延迟」正是这条成本线被单列出来之后的结果。 关键神经网络的前向与反向计算以稠密矩阵乘为主,可由图形硬件的并行结构获得一个数量级以上的加速。

这个观察本身不深刻——矩阵乘天然并行,而图形硬件恰好就是为大批同构的乘加造的,两者对上不需要任何理论准备。它的分量在于后果:同样的算法,同样的数据,换一种硬件就跨过了可用性阈值。此后所有关于「哪条路线更好」的比较,都必须先问一句在什么硬件预算下比较。

它也改变了这个领域的社会结构。用工作站就能复现主要结果的时代结束了;能否参与前沿工作开始取决于能否拿到算力。这一条与本层的公共数据集那条正好构成一对:一个降低了准入门槛,另一个抬高了它,而两者都不是靠算法思想起作用的。

位置D——它把「一次硬件适配」当成单独够用的那一样 预设〔19 算法优劣与硬件无关〕默认方法比较的结论不随计算平台改变 量纲同一算法在通用处理器上的训练时间∶在并行硬件上的训练时间 失效当不同方法对硬件并行度的适配差异极大时,方法排序随平台翻转,比较必须标注算力预算 异名计算机体系结构称「算法—硬件协同」,科学社会学称「研究资本门槛」;另见本块九

经二十、模型压缩:让小模型去学大模型的输出,而不是学标签Classic 20 · Deep Learning

提出Cristian Buciluă、Rich Caruana 与 Alexandru Niculescu-Mizil,2006 年《ACM SIGKDD 会议论文集》535–541。 流变二〇一五年以「知识蒸馏」之名重提并加入温度软化,成为部署的标准环节;而小模型究竟学到了什么,至今解释不一。 今用本块十「蒸馏:小模型同时学习软分布与中间表示」是这条方法被系统化之后的形态。 关键用大模型对大量未标注数据的预测作为训练目标,可让一个小得多的模型逼近其性能。

它的洞察是:真正难的是找到那个函数,而不是表示它。既然大模型已经找到了,就让小模型直接去拟合这个函数而不是原始标签——大模型对每个输入给出的整条概率分布,比一个硬标签携带的信息多得多,包括「这张图第二像什么」。

这条方法此后成了部署的常规,但它的解释一直含糊。若小模型确实能表示同样的函数,为什么从标签直接训练不行?现有回答——软标签提供了类间关系、起到正则作用、平滑了优化景观——都是部分成立的经验说法。这与彩票假说指向同一处空白:我们能训出什么,与我们能表示什么,之间隔着一层至今没被讲清的东西。

位置E——它把「大模型的输出分布」当成单独够用的那一样 预设〔20 教师输出可完整转移〕默认小模型能通过拟合输出获得教师的全部可用信息 量纲学生模型达到的精度∶教师模型在同一测试集上的精度 失效当任务依赖教师内部表示而非输出分布时,输出拟合不足以转移,须另行对齐中间层 异名工艺传承称「师徒示范」,测量学称「代理标签」;另见本块十

◎ 这一层怎么用

先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。

三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(McCulloch–Pitts 的形式神经元、Hebb 的学习规则、Turing 的可计算性)只在流变栏里被点名。其二,经典身份不提供豁免——本层有四条今天已被明确修正:《感知机》一书的否定结论被误推为方向死刑、偏差方差的 U 形曲线只覆盖插值点左侧、万能逼近定理被当成可学习性的保证、长程依赖的分析漏掉了训练时长这一变量。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。

本层的四条路在这门学科里有其特定落点。机制路(新认知机、Hopfield、玻尔兹曼机、反向传播、长短期记忆、随机梯度多层)问「靠什么算得出来」;测量路(收敛定理、万能逼近、偏差方差分解、长程依赖分析、最优脑损伤)问「凭什么说它学到了」;制度路(自动微分、公共数据库、卷积系统、图形处理器、模型压缩)问「谁能参与、按什么赛道比」;人的路(感知机的宣称、《感知机》一书的误读、Bagging 的社群实践)问「一次外推的代价由谁承担」。⚠ 这门学科的「人的路」抓手与实验科学不同:它不是受试者保护,而是宣称与证据的落差由谁买单,以及准入门槛被什么抬高

◎ 经典层资料核验

  1. Rosenblatt, F. The perceptron: a probabilistic model for information storage and organization in the brain. Psychological Review 65 (1958): 386–408。
  2. Rosenblatt, F. Principles of Neurodynamics. Washington, DC: Spartan Books, 1962(专著)。
  3. Widrow, B. and Hoff, M. E. Adaptive switching circuits. IRE WESCON Convention Record 4 (1960): 96–104。
  4. Widrow, B. and Stearns, S. D. Adaptive Signal Processing. Englewood Cliffs: Prentice-Hall, 1985(专著)。
  5. Novikoff, A. B. J. On convergence proofs on perceptrons. Proceedings of the Symposium on the Mathematical Theory of Automata 12 (1962): 615–622。
  6. Amari, S. A theory of adaptive pattern classifiers. IEEE Transactions on Electronic Computers EC-16 (1967): 299–307。
  7. Minsky, M. and Papert, S. Perceptrons: An Introduction to Computational Geometry. Cambridge, MA: MIT Press, 1969(专著)。
  8. Olazaran, M. A sociological study of the official history of the perceptrons controversy. Social Studies of Science 26 (1996): 611–659。
  9. Linnainmaa, S. The Representation of the Cumulative Rounding Error of an Algorithm as a Taylor Expansion of the Local Rounding Errors. Master’s thesis, University of Helsinki, 1970(专著)。
  10. Griewank, A. and Walther, A. Evaluating Derivatives. 2nd ed. Philadelphia: SIAM, 2008(专著)。
  11. Fukushima, K. Neocognitron: a self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position. Biological Cybernetics 36 (1980): 193–202。
  12. Hopfield, J. J. Neural networks and physical systems with emergent collective computational abilities. PNAS 79 (1982): 2554–2558。
  13. Amit, D. J., Gutfreund, H. and Sompolinsky, H. Storing infinite numbers of patterns in a spin-glass model of neural networks. Physical Review Letters 55 (1985): 1530–1533。
  14. Ackley, D. H., Hinton, G. E. and Sejnowski, T. J. A learning algorithm for Boltzmann machines. Cognitive Science 9 (1985): 147–169。
  15. Rumelhart, D. E., Hinton, G. E. and Williams, R. J. Learning representations by back-propagating errors. Nature 323 (1986): 533–536。
  16. Rumelhart, D. E. and McClelland, J. L. (eds.) Parallel Distributed Processing, 2 vols. Cambridge, MA: MIT Press, 1986(专著)。
  17. Werbos, P. J. The Roots of Backpropagation. New York: Wiley, 1994(专著)。
  18. Aha, D. W. and Murphy, P. M. UCI Repository of Machine Learning Databases. Irvine: University of California, 1987。
  19. Cybenko, G. Approximation by superpositions of a sigmoidal function. Mathematics of Control, Signals and Systems 2 (1989): 303–314。
  20. Hornik, K., Stinchcombe, M. and White, H. Multilayer feedforward networks are universal approximators. Neural Networks 2 (1989): 359–366。
  21. LeCun, Y. et al. Backpropagation applied to handwritten zip code recognition. Neural Computation 1 (1989): 541–551。
  22. LeCun, Y., Bottou, L., Bengio, Y. and Haffner, P. Gradient-based learning applied to document recognition. Proceedings of the IEEE 86 (1998): 2278–2324。
  23. LeCun, Y., Denker, J. S. and Solla, S. A. Optimal brain damage. In Advances in Neural Information Processing Systems 2. San Mateo: Morgan Kaufmann, 1990(专著)。
  24. Geman, S., Bienenstock, E. and Doursat, R. Neural networks and the bias/variance dilemma. Neural Computation 4 (1992): 1–58。
  25. Bengio, Y., Simard, P. and Frasconi, P. Learning long-term dependencies with gradient descent is difficult. IEEE Transactions on Neural Networks 5 (1994): 157–166。
  26. Breiman, L. Bagging predictors. Machine Learning 24 (1996): 123–140。
  27. Breiman, L. Random forests. Machine Learning 45 (2001): 5–32。
  28. Freund, Y. and Schapire, R. E. A decision-theoretic generalization of on-line learning. Journal of Computer and System Sciences 55 (1997): 119–139。
  29. Hochreiter, S. and Schmidhuber, J. Long short-term memory. Neural Computation 9 (1997): 1735–1780。
  30. Gers, F. A., Schmidhuber, J. and Cummins, F. Learning to forget: continual prediction with LSTM. Neural Computation 12 (2000): 2451–2471。
  31. Vapnik, V. N. The Nature of Statistical Learning Theory. New York: Springer, 1995(专著)。
  32. Bishop, C. M. Neural Networks for Pattern Recognition. Oxford: Clarendon Press, 1995(专著)。
  33. Oh, K.-S. and Jung, K. GPU implementation of neural networks. Pattern Recognition 37 (2004): 1311–1314。
  34. Steinkraus, D., Buck, I. and Simard, P. Y. Using GPUs for machine learning algorithms. Proceedings of ICDAR (2005): 1115–1120。
  35. Buciluă, C., Caruana, R. and Niculescu-Mizil, A. Model compression. Proceedings of ACM SIGKDD (2006): 535–541。
  36. Hinton, G. E., Osindero, S. and Teh, Y.-W. A fast learning algorithm for deep belief nets. Neural Computation 18 (2006): 1527–1554。
  37. Schmidhuber, J. Deep learning in neural networks: an overview. Neural Networks 61 (2015): 85–117。
新思想前沿 · 第 43 号《深度学习》· 20 条现代思想 + 20 条 1950–2006 经典思想 · 双层资料核验 · 王德生 亲撰 · ← 回到 626 个领域总览