计算神经科学
计算神经科学的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。
这十年计算神经科学改用训练出来的网络当大脑模型;而上一个十年,它押的是完全相反的一注——把神经元一个一个照实模拟出来。 本幕把深层信念网:逐层预训练让深网络第一次稳定启动、ReLU:一个非饱和门改变梯度与稀疏激活、ImageNet转折:数据、GPU与卷积一同越过旧基线放到同一张证据图上,比较结构、过程与环境条件怎样分别取得解释权。
甲、深层信念网:逐层预训练让深网络第一次稳定启动Deep Belief Nets
起点要放回2006年的Neural Computation:Hinton、Osindero、Teh不再允许深度学习在深层信念网上继续用训练成功代替泛化解释。Hinton、Osindero、Teh逐项核对模型参数、训练样本与样本外误差里的深层信念网;数据污染、算力预算与长尾失败由掩码自编码另行登记。在Neural Computation的证据账上,由MNIST等任务证明多层表示可被实际训练起步,掩码自编码进入解释对照;本条残差不能靠改名消失。
深层信念网的可反驳立场是:无监督逐层预训练先找到参数盆地,再用监督信号整体微调。Hinton、Osindero、Teh这一路线据此把决定性解释锁在一个对象上,掩码自编码的“高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算”不能替代本条;边界是收益依赖当时初始化和数据规模。若换样本后再问仍不能保持方向,掩码自编码便构成深层信念网的近邻反例;Neural Computation对深层信念网仅支持原任务。
可核对的主证据是Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527:MNIST等任务证明多层表示可被实际训练,打破深网络必然卡在优化中的判断。深层信念网在MNIST把测试误差压到约1.25%。掩码自编码要求把2006年的深层信念网样本与对照结算,再核查掩码自编码的任务、观察窗和收益依赖当时初始化和数据规模。对深层信念网,掩码自编码仅作近邻;支点仍是Hinton、Osindero、Teh在Neural Computation的原始比较。
深层信念网自己留下的反证入口是:收益依赖当时初始化和数据规模,后来的归一化与残差结构会改变必要性。用正交量纲重测时,Hinton、Osindero、Teh的解释可能缩小、反号,或让位给掩码自编码的路径。掩码自编码给出复核Neural Computation的近邻条件:把不显著结果一并公开;深层信念网负责记录中止、排除和不显著对象。
MNIST等任务证明多层表示可被实际训练改变登记顺序:模型参数、训练样本与样本外误差归深层信念网,数据污染、算力预算与长尾失败交掩码自编码核查。2022年的掩码自编码以“高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算”作近邻;两者若结论不同,应以收益依赖当时初始化和数据规模为分账边界;掩码自编码不得与本条合成一个平均分。
2006年,深层信念网据MNIST等任务证明多层表示可被实际训练对接第047号第二幕四。跨过去,收益依赖当时初始化和数据规模迫使深层信念网重新检验可见读数。深层信念网以收益依赖当时初始化和数据规模施加反向压力。这使无监督逐层预训练先找到参数盆地,再用监督信号整体微调。分母入口五证,继续充当本条可复核的判别边界。
乙、ReLU:一个非饱和门改变梯度与稀疏激活Rectified Linear Units
真正的断点出现在2011年的AISTATS:Glorot、Bordes、Bengio不再允许深度学习在深度学习里的ReLU上继续用训练成功代替泛化解释。Glorot、Bordes、Bengio逐项核对模型参数、训练样本与样本外误差里的深度学习里的ReLU;数据污染、算力预算与长尾失败由双下降另行登记。在AISTATS的证据账上,由在图像与文本基准上起步,双下降进入解释对照;本条残差不能靠改名消失。
深度学习里的ReLU的可反驳立场是:非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示。Glorot、Bordes、Bengio这一路线据此把决定性解释锁在一个对象上,双下降的“经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降”不能替代本条;边界是死亡单元与尺度爆炸仍在。若把时间窗拉长再看仍不能保持方向,双下降便构成深度学习里的ReLU的近邻反例;AISTATS对深度学习里的ReLU仅支持原任务。
可核对的主证据是Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323:在图像与文本基准上,ReLU网络训练更快并超过双曲正切网络。ReLU论文比较4组图像与文本任务。双下降要求把2011年的深度学习里的ReLU样本与对照结算,再核查双下降的任务、观察窗和死亡单元与尺度爆炸仍在。对深度学习里的ReLU,双下降仅作近邻;支点仍是Glorot、Bordes、Bengio在AISTATS的原始比较。回到AISTATS的取样方式,深度学习里的ReLU要用双下降证明原分母没有删去最容易失败的对象。
深度学习里的ReLU自己留下的反证入口是:死亡单元与尺度爆炸仍在,激活函数不能替代初始化、归一化和数据设计。撤去界面提示再验时,Glorot、Bordes、Bengio的解释可能缩小、反号,或让位给双下降的路径。双下降给出复核AISTATS的近邻条件:按个体轨迹而非均值检查;深度学习里的ReLU负责记录中止、排除和不显著对象。拿双下降作近邻检验,可辨认Glorot、Bordes、Bengio观察到的是独有路径,还是另一条路线的表面同义词。
在图像与文本基准上改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的ReLU,数据污染、算力预算与长尾失败交双下降核查。2019年的双下降以“经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降”作近邻;两者若结论不同,应以死亡单元与尺度爆炸仍在为分账边界;双下降不得与本条合成一个平均分。
2011年,深度学习里的ReLU据在图像与文本基准上对接第049号第二幕三。跨过去,死亡单元与尺度爆炸仍在迫使深度学习里的ReLU重新检验可见读数。深度学习里的ReLU以死亡单元与尺度爆炸仍在施加反向压力。这使非饱和分段线性激活缓解深层梯度衰减,并产生稀疏表示。时间窗七证,继续充当本条可复核的判别边界。
丙、ImageNet转折:数据、GPU与卷积一同越过旧基线The ImageNet Breakthrough
旧账最先在2012年的NeurIPS:Krizhevsky、Sutskever、Hinton不再允许深度学习在ImageNet转折上继续用训练成功代替泛化解释。Krizhevsky、Sutskever、Hinton逐项核对模型参数、训练样本与样本外误差里的ImageNet转折;数据污染、算力预算与长尾失败由神经缩放律另行登记。在NeurIPS的证据账上,由AlexNet将ImageNet top-5错误率降至15.3%起步,神经缩放律进入解释对照;本条残差不能靠改名消失。第258号第十四条“再采样基准证明‘同名测试集’也会发生分布变化”提供不同尺度的反例;它迫使ImageNet转折把“适用”写成可检查的对象范围。
ImageNet转折的可反驳立场是:深卷积网络在大规模标注与GPU训练下显著拉开视觉误差。Krizhevsky、Sutskever、Hinton这一路线据此把决定性解释锁在一个对象上,神经缩放律的“在一定区间内,增加参数、数据和计算可用平滑幂律预测损失”不能替代本条;边界是胜利混合了数据、算力、增强和架构。若保留失败对象后检验仍不能保持方向,神经缩放律便构成ImageNet转折的近邻反例;NeurIPS对ImageNet转折仅支持原任务。
可核对的主证据是Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105:AlexNet将ImageNet top-5错误率降至15.3%,领先次名十个百分点以上。AlexNet含约6000万个参数和65万个神经元。神经缩放律要求把2012年的ImageNet转折样本与对照结算,再核查神经缩放律的任务、观察窗和胜利混合了数据、算力、增强和架构。对ImageNet转折,神经缩放律仅作近邻;支点仍是Krizhevsky、Sutskever、Hinton在NeurIPS的原始比较。拿神经缩放律作近邻检验,可辨认Krizhevsky、Sutskever、Hinton观察到的是独有路径,还是另一条路线的表面同义词。
ImageNet转折自己留下的反证入口是:胜利混合了数据、算力、增强和架构,不能把全部增益归给“更深”。按亚组分别结算时,Krizhevsky、Sutskever、Hinton的解释可能缩小、反号,或让位给神经缩放律的路径。神经缩放律给出复核NeurIPS的近邻条件:加入反事实条件;ImageNet转折负责记录中止、排除和不显著对象。回到NeurIPS的取样方式,ImageNet转折要用神经缩放律证明原分母没有删去最容易失败的对象。
AlexNet将ImageNet top-5错误率降至15.3%改变登记顺序:模型参数、训练样本与样本外误差归ImageNet转折,数据污染、算力预算与长尾失败交神经缩放律核查。2020年的神经缩放律以“在一定区间内,增加参数、数据和计算可用平滑幂律预测损失”作近邻;两者若结论不同,应以胜利混合了数据、算力、增强和架构为分账边界;神经缩放律不得与本条合成一个平均分。
2012年,ImageNet转折据AlexNet将ImageNet top-5错误率降至15.3%对接第258号第十四条。跨过去,胜利混合了数据、算力、增强和架构迫使ImageNet转折重新检验可见读数。ImageNet转折以胜利混合了数据、算力、增强和架构施加反向压力。这使深卷积网络在大规模标注与GPU训练下显著拉开视觉误差。对照组八证,继续充当本条可复核的判别边界。
丁、Dropout:随机删节点把共适应变成集成近似Dropout
转折并非始于2014年的JMLR:Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov不再允许深度学习在深度学习里的Dropout上继续用训练成功代替泛化解释。Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov逐项核对模型参数、训练样本与样本外误差里的深度学习里的Dropout;数据污染、算力预算与长尾失败由彩票假说另行登记。在JMLR的证据账上,由在视觉、语音和文本任务上降低测试误差起步,彩票假说进入解释对照;本条残差不能靠改名消失。回到失访端,反向材料来自(未见反对;边界:保留率与归一化相互作用;现代大模型中它并非处处必要。);它限定了何时不能沿用原方向。
深度学习里的Dropout的可反驳立场是:训练中随机屏蔽单元可抑制特征共适应,并近似共享权重的模型集成。Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov这一路线据此把决定性解释锁在一个对象上,彩票假说的“过参数网络的成功部分来自初始化时存在的稀疏可训练子结构”不能替代本条;边界是保留率与归一化相互作用。若改用地点外资料复核仍不能保持方向,彩票假说便构成深度学习里的Dropout的近邻反例;JMLR对深度学习里的Dropout仅支持原任务。
可核对的主证据是Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958:在视觉、语音和文本任务上降低测试误差,成为早期深网标准正则项。Dropout训练时以约0.5保留概率随机删除隐藏单元。彩票假说要求把2014年的深度学习里的Dropout样本与对照结算,再核查彩票假说的任务、观察窗和保留率与归一化相互作用。对深度学习里的Dropout,彩票假说仅作近邻;支点仍是Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov在JMLR的原始比较。
深度学习里的Dropout自己留下的反证入口是:保留率与归一化相互作用;现代大模型中它并非处处必要。改变任务顺序后追踪时,Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov的解释可能缩小、反号,或让位给彩票假说的路径。彩票假说给出复核JMLR的近邻条件:用盲法重跑关键判断;深度学习里的Dropout负责记录中止、排除和不显著对象。
在视觉、语音和文本任务上降低测试误差改变登记顺序:模型参数、训练样本与样本外误差归深度学习里的Dropout,数据污染、算力预算与长尾失败交彩票假说核查。2019年的彩票假说以“过参数网络的成功部分来自初始化时存在的稀疏可训练子结构”作近邻;两者若结论不同,应以保留率与归一化相互作用为分账边界;彩票假说不得与本条合成一个平均分。
2014年,深度学习里的Dropout据在视觉、语音和文本任务上降低测试误差对接第047号第一幕戊。跨过去,保留率与归一化相互作用迫使深度学习里的Dropout重新检验可见读数。深度学习里的Dropout以保留率与归一化相互作用施加反向压力。
戊、稀疏表示与压缩感知Sparse Representation
Donoho 2006改写了稀疏是否属于对象而非选定字典;压缩感知把采样率与稀疏度而非最高频率联系起来让旧默认有了可查裂缝。在跨场址复现之前,必须逐年保留未采用与失败案例,才能分开概念改名和对象变化;稀疏表示与压投运后仍保留责任主体。当平均值被拆开,补列未采用和失败样本;稀疏表示与压由此留下可执行否证入口。沿责任链继续追问,补列未采用和失败样本;稀疏表示与压记录同时划定外推边界(Donoho 2006)。
本条只承认以少量线性观测恢复可压缩信号;移除后若压缩感知把采样率与稀疏度而非最高频率联系起来仍出现,立场即撤回。当平均值被拆开,应在同一服务基线下固定场址与资源,再做移除机制的消融检验;稀疏表示与压须连同不确定性报告结果。沿责任链继续追问,固定服务基线再做消融;稀疏表示与压下一次更新可追到原始版本(Monga 2020)。
Donoho 2006报告压缩感知把采样率与稀疏度而非最高频率联系起来;稀疏表示与压以兑现数/候选与中止总数结算。沿责任链继续追问,最低记录还须给出原始分子、总体分母、观察期与退出原因;稀疏表示与压据此区分证据与宣传。以同一服务单位复算,公开分子分母与退出;稀疏表示与压据此拆开相关变化与机制效应。面对分布外情形,公开分子分母与退出;稀疏表示与压还须公开未完成与退出事件(Donoho 2006;IEEE Signal Processing Society 2025)。稀疏表示与复核门槛预注册3站×13批次。
Monga 2020保留字典选择、近似稀疏和噪声相关会使理论界变松;稀疏表示与压越界后须重判方向。以同一服务单位复算,应分开常态与极端样本,并把反号结论收窄到实际适用区间;稀疏表示与压由此留下可执行否证入口。面对分布外情形,分列常态极端与反号;稀疏表示与压记录同时划定外推边界。为防止事后改口,分列常态极端与反号;稀疏表示与压投运后仍保留责任主体(Donoho 2006)。
IEEE Signal Processing Society 2025记录结构化感知继续用模型失配与相干性限制恢复;维护账须继续追踪压缩感知把采样率与稀疏度而非最高频率联系起来。面对分布外情形,还须把许可、维护、责任主体和退出条件按版本保存;稀疏表示与压下一次更新可追到原始版本。
跨域比较以字典选择、近似稀疏和噪声相关会使理论界变松划界,并用压缩感知把采样率与稀疏度而非最高频率联系起来重算以少量线性观测恢复可压缩信号。这使以少量线性观测恢复可压缩信号继续充当本条可复核的判别边界。
己、稀疏贝叶斯学习Sparse Bayesian Learning
Wipf & Rao 2007改写了层级先验给出的稀疏是否依赖超参数与局部极值;稀疏贝叶斯学习把稀疏度选择写入概率模型让旧默认有了可查裂缝。当平均值被拆开,必须逐年保留未采用与失败案例,才能分开概念改名和对象变化;稀疏贝叶斯学投运后仍保留责任主体。沿责任链继续追问,补列未采用和失败样本;稀疏贝叶斯学由此留下可执行否证入口(Wipf & Rao 2007)。
本条只承认用证据最大化自动关闭不必要系数;移除后若稀疏贝叶斯学习把稀疏度选择写入概率模型仍出现,立场即撤回。沿责任链继续追问,应在同一服务基线下固定场址与资源,再做移除机制的消融检验;稀疏贝叶斯学须连同不确定性报告结果。以同一服务单位复算,固定服务基线再做消融;稀疏贝叶斯学下一次更新可追到原始版本(Monga 2020)。
Wipf & Rao 2007报告稀疏贝叶斯学习把稀疏度选择写入概率模型;稀疏贝叶斯学以兑现数/候选与中止总数结算。以同一服务单位复算,最低记录还须给出原始分子、总体分母、观察期与退出原因;稀疏贝叶斯学据此区分证据与宣传。面对分布外情形,公开分子分母与退出;稀疏贝叶斯学据此拆开相关变化与机制效应。为防止事后改口,公开分子分母与退出;稀疏贝叶斯学分母改变便重算结论(Wipf & Rao 2007;IEEE Signal Processing Society 2025)。稀疏贝叶斯复核门槛预注册4站×15批次。
Monga 2020保留后验近似与初始化会制造不同支持集;稀疏贝叶斯学越界后须重判方向。面对分布外情形,应分开常态与极端样本,并把反号结论收窄到实际适用区间;稀疏贝叶斯学由此留下可执行否证入口。为防止事后改口,应分开常态与极端样本,并把反号结论收窄到实际适用区间;一旦结果反号就应撤回原来的充分性主张。在下一轮独立复核里,分列常态极端与反号;稀疏贝叶斯学投运后仍保留责任主体(Wipf & Rao 2007)。
IEEE Signal Processing Society 2025记录自动相关性判定继续与变分推断和阵列处理结合;维护账须继续追踪稀疏贝叶斯学习把稀疏度选择写入概率模型。为防止事后改口,还须把许可、维护、责任主体和退出条件按版本保存;稀疏贝叶斯学局部增益不得冒充系统收益。在下一轮独立复核里,保存许可维护与责任版本;稀疏贝叶斯学把观察记录接回问责链。
跨域比较以后验近似与初始化会制造不同支持集划界,并用稀疏贝叶斯学习把稀疏度选择写入概率模型重算用证据最大化自动关闭不必要系数。
庚、暗硅:晶体管继续增加,能同时点亮的比例却下降Dark Silicon: More Transistors, Fewer Can Be Powered at Once
2000年代中期以前,工艺缩小常同时带来更高频率和近似恒定功率密度,更多晶体管几乎等于更多可用性能。电压下降跟不上尺寸后,频率和核数受到散热限制。Esmaeilzadeh等2011年用跨工艺模型提出“暗硅”:未来芯片必须让一部分晶体管在任一时刻关闭,通用多核的线性扩展路线终止。
〔对象清单〕本条主张,决定后摩尔时代AI加速器是否必要的只有功率预算能否容纳通用晶体管同时工作。若芯片面积仍可增加而TDP近似固定,专用数据通路用更少控制和更低精度完成矩阵操作,才可让更多区域在预算内点亮。2011年的判断把架构目标从“放多少核”改成“每焦耳能完成多少有用工作”。对暗硅:晶体管继续增加,能同时点亮的比例却下降Dark Silicon: More Transistors, Fewer Can Be Powered at Once而言,真正需要登记的不是又一个平均分,而是由“决定后摩尔时代AI加速器是否必要的只有功率预算能否容纳通用晶体管同时工作”推出的每一步中介、责任人和可撤回条件;〔对象清单〕缺少任何一环,都不能把相关性写成机制。
ISCA 2011论文以45nm到8nm的缩放情景估算多核性能与可点亮面积,结论是即使晶体管继续增加,功率约束也会使相当比例保持dark;不同配置的性能提升远低于核数增长。核验应报告工艺、电压、频率、温度、良率与工作负载,不能用峰值TOPS把未持续运行的单元也计入。
专用化能降低单任务能耗,却会让芯片面对模型变化时闲置;固定功能越多,软件兼容与验证成本反而越高。暗区不是零成本,仍占晶圆面积、制造材料和漏电。若只按运行焦耳评价,一代加速器很快淘汰造成的隐含碳与供应链风险会被功率墙叙事遮住。2025年审计还应把chiplet暗区和封装漏电计入同一TDP边界。〔对象清单〕落到复现实务,可为暗硅:晶体管继续增加,能同时点亮的比例却下降Dark Silicon: More Transistors, Fewer Can Be Powered at Once建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“额定TDP内完成的有效AI操作数/焦耳、晶圆面积与生命周期设备年”统一结算,避免换口径后仍宣称性能提高。
2025年的验收应在额定功率下同时运行训练、推理和数据搬运,记录持续频率、热点温度、节流时间与有效TOPS/W;再按5年利用率摊销晶圆面积与制造碳。
它与第251号第十六条“功耗、暗硅与热设计”是直接异名,本条把物理边界接到AI专用化;与第351号第一条“屋顶线模型:算术强度决定性能上限”相接时,功率是计算与带宽共同的上限。这使Dennard缩放失效后,晶体管密度不再自动转成可同时使用的通用计算,专用AI单元由此获得系统理由。异质层三证,继续充当本条可复核的判别边界。
辛、CUDA与GPU训练:图形并行阵列成为AI通用底座CUDA and GPU Training: Graphics Arrays Become the General AI Substrate
CUDA在2007年开放kernel与线程层级后,研究者不必把矩阵运算伪装成图形。AlexNet于2012年把约6000万参数、65万神经元的卷积网络拆到2块GPU,以ReLU、dropout和数据增强训练ImageNet。硬件不只是让既有算法更快,而是把此前训练周期不可接受的深网络变成可迭代实验。〔事件时间轴〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定GPU能否成为AI通用底座的只有主流学习算子是否能映射为高占用的规则并行kernel”的操作定义,仍能复算“达到固定验证质量的样本数/GPU小时、HBM字节与移植人工小时”,否则所谓转向可能只是数据管线或命名变化。
〔事件时间轴〕本条的单因命题是,决定GPU能否成为AI通用底座的只有主流学习算子是否能映射为高占用的规则并行kernel。卷积和矩阵乘法重用数据、线程独立度高,适合SIMT;cuDNN等库又把kernel优化封装进框架。2012年以后,研究者选择可在GPU高效执行的层,算法与硬件形成共同演化。
NeurIPS 2012论文在ImageNet ILSVRC-2012把top-5错误率降到15.3%,第二名约26.2%,训练使用2块GTX 580 GPU、约5至6天。可复算硬件读数需含精度、batch、训练天数、GPU小时与主机供料;视觉准确率突破不能全归因于GPU,也不能把两卡演示外推成无限多卡线性。机构采用CUDA与GPU训练:图形并行阵列成为AI通用底座CUDA and GPU Training: Graphics Arrays Become the General AI Substrate之前还应公布否决门槛:一旦“当模型包含大量动态稀疏和小批分支时,理论TOPS越高,实际利用率反而越低”出现,就暂停扩张并回到“两个GPU即可把大规模卷积训练推到可行时间,软件栈随后反向塑造网络结构”的原始记录复核;该门槛必须早于部署决定写入方案。
GPU擅长规则密集运算,稀疏、小批和控制分支会降低利用率;模型越围绕硬件峰值设计,算法探索反而越可能忽略不规则但有价值的结构。专有驱动与库版本影响数值和复现,显存又把参数切分推给系统。研究成本因而从“能否训练”转成谁拥有足够设备与软件人才。
2025年的验收应报告SM occupancy、HBM带宽、kernel空隙、主机等待和达到同一质量的GPU小时,分别测试batch=1与训练大批量。框架锁定可用同一模型在CUDA与至少一类替代后端上的性能保留率衡量;若模型改写大量算子才能迁移,移植人工也要进入单位结果成本。
它与第351号第五条“异构加速编程:GPU不是外设而是协处理器”是直接异名,本条强调深度学习生态如何围绕GPU形成;与第536号第二条CUDA相比,此处验收芯片数据通路和算法共适配,而非运行时供料。这使两个GPU即可把大规模卷积训练推到可行时间,软件栈随后反向塑造网络结构。边界样本三证,继续充当本条可复核的判别边界。
本幕把自监督对比学习:标签不再是表示学习的唯一入口、掩码自编码:预测缺失部分取代逐对样本比较、双下降:参数越过插值点后测试误差还能再次下降放到同一张证据图上,比较结构、过程与环境条件怎样分别取得解释权。
一、自监督对比学习:标签不再是表示学习的唯一入口Contrastive Self-Supervision
第一处裂缝来自2020年的ICML:Chen、Kornblith、Norouzi、Hinton不再允许深度学习在自监督对比学习上继续用训练成功代替泛化解释。Chen、Kornblith、Norouzi、Hinton逐项核对模型参数、训练样本与样本外误差里的自监督对比学习;数据污染、算力预算与长尾失败由蒸馏另行登记。在ICML的证据账上,由SimCLR在线性评估达到76.5% top-1起步,蒸馏进入解释对照;本条残差不能靠改名消失。
自监督对比学习的可反驳立场是:不同增强视图的一致性可在无人工标签时学习可迁移视觉表示。Chen、Kornblith、Norouzi、Hinton这一路线据此把决定性解释锁在一个对象上,蒸馏的“教师输出与中间注意、隐藏状态可共同压入更小学生模型”不能替代本条;边界是效果高度依赖增强、批量和数据分布。若撤去界面提示再验仍不能保持方向,蒸馏便构成自监督对比学习的近邻反例;ICML对自监督对比学习仅支持原任务。
可核对的主证据是Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607:SimCLR在线性评估达到76.5% top-1,并在少标签条件显著提高样本效率。蒸馏要求把2020年的自监督对比学习样本与对照结算,再核查蒸馏的任务、观察窗和效果高度依赖增强、批量和数据分布。对自监督对比学习,蒸馏仅作近邻;支点仍是Chen、Kornblith、Norouzi、Hinton在ICML的原始比较。回到ICML的取样方式,自监督对比学习要用蒸馏证明原分母没有删去最容易失败的对象。
自监督对比学习自己留下的反证入口是:效果高度依赖增强、批量和数据分布;不恰当不变性会删除任务所需信息。用盲法重跑关键判断时,Chen、Kornblith、Norouzi、Hinton的解释可能缩小、反号,或让位给蒸馏的路径。蒸馏给出复核ICML的近邻条件:换样本后再问;自监督对比学习负责记录中止、排除和不显著对象。拿蒸馏作近邻检验,可辨认Chen、Kornblith、Norouzi、Hinton观察到的是独有路径,还是另一条路线的表面同义词。
SimCLR在线性评估达到76.5% top-1改变登记顺序:模型参数、训练样本与样本外误差归自监督对比学习,数据污染、算力预算与长尾失败交蒸馏核查。2020年的蒸馏以“教师输出与中间注意、隐藏状态可共同压入更小学生模型”作近邻;两者若结论不同,应以效果高度依赖增强、批量和数据分布为分账边界;蒸馏不得与本条合成一个平均分。
2020年,自监督对比学习据SimCLR在线性评估达到76.5% top-1对接第050号第二幕三。跨过去,效果高度依赖增强、批量和数据分布迫使自监督对比学习重新检验可见读数。自监督对比学习以效果高度依赖增强、批量和数据分布施加反向压力。这使不同增强视图的一致性可在无人工标签时学习可迁移视觉表示。跨中心六证,继续充当本条可复核的判别边界。
二、掩码自编码:预测缺失部分取代逐对样本比较Masked Autoencoders
研究单位改在2022年的CVPR:He、Chen、Xie 等不再允许深度学习在掩码自编码上继续用训练成功代替泛化解释。He、Chen、Xie 等逐项核对模型参数、训练样本与样本外误差里的掩码自编码;数据污染、算力预算与长尾失败由科学迁移另行登记。在CVPR的证据账上,由MAE遮蔽75%图块起步,科学迁移进入解释对照;本条残差不能靠改名消失。
掩码自编码的可反驳立场是:高比例遮蔽后重建像素能迫使编码器学习图像结构,并降低预训练计算。He、Chen、Xie 等这一路线据此把决定性解释锁在一个对象上,科学迁移的“深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线”不能替代本条;边界是像素重建偏爱纹理与低频统计。若按亚组分别结算仍不能保持方向,科学迁移便构成掩码自编码的近邻反例;CVPR对掩码自编码仅支持原任务。
可核对的主证据是He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553:MAE遮蔽75%图块,用ViT-H在ImageNet微调达到87.8% top-1。科学迁移要求把2022年的掩码自编码样本与对照结算,再核查科学迁移的任务、观察窗和像素重建偏爱纹理与低频统计。对掩码自编码,科学迁移仅作近邻;支点仍是He、Chen、Xie 等在CVPR的原始比较。回到CVPR的取样方式,掩码自编码要用科学迁移证明原分母没有删去最容易失败的对象。
掩码自编码自己留下的反证入口是:像素重建偏爱纹理与低频统计,迁移到几何和语义任务仍需检验。将短期与长期拆账时,He、Chen、Xie 等的解释可能缩小、反号,或让位给科学迁移的路径。科学迁移给出复核CVPR的近邻条件:把时间窗拉长再看;掩码自编码负责记录中止、排除和不显著对象。拿科学迁移作近邻检验,可辨认He、Chen、Xie 等观察到的是独有路径,还是另一条路线的表面同义词。
MAE遮蔽75%图块改变登记顺序:模型参数、训练样本与样本外误差归掩码自编码,数据污染、算力预算与长尾失败交科学迁移核查。2021年的科学迁移以“深网能把结构先验、进化信息与端到端训练结合,改变科学预测管线”作近邻;两者若结论不同,应以像素重建偏爱纹理与低频统计为分账边界;科学迁移不得与本条合成一个平均分。
2022年,掩码自编码据MAE遮蔽75%图块对接第045号第二幕六。跨过去,像素重建偏爱纹理与低频统计迫使掩码自编码重新检验可见读数。掩码自编码以像素重建偏爱纹理与低频统计施加反向压力。该接口若仍支持相反方向,像素重建偏爱纹理与低频统计要求掩码自编码增加第三条件,同时容纳两边的失效样本。
三、双下降:参数越过插值点后测试误差还能再次下降Double Descent
回到原始设计2019年的PNAS:Belkin、Hsu、Ma、Mandal不再允许深度学习在双下降上继续用训练成功代替泛化解释。Belkin、Hsu、Ma、Mandal逐项核对模型参数、训练样本与样本外误差里的双下降;数据污染、算力预算与长尾失败由数据污染审计另行登记。在PNAS的证据账上,由随机特征、树与神经网络在训练误差刚到零附近出现风险峰起步,数据污染审计进入解释对照;本条残差不能靠改名消失。
双下降的可反驳立场是:经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降。Belkin、Hsu、Ma、Mandal这一路线据此把决定性解释锁在一个对象上,数据污染审计的“开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据”不能替代本条;边界是曲线受优化、噪声和横轴选择影响。若改变任务顺序后追踪仍不能保持方向,数据污染审计便构成双下降的近邻反例;PNAS对双下降仅支持原任务。
可核对的主证据是Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116:随机特征、树与神经网络在训练误差刚到零附近出现风险峰,继续增大模型后下降。数据污染审计要求把2019年的双下降样本与对照结算,再核查数据污染审计的任务、观察窗和曲线受优化、噪声和横轴选择影响。对双下降,数据污染审计仅作近邻;支点仍是Belkin、Hsu、Ma、Mandal在PNAS的原始比较。
双下降自己留下的反证入口是:曲线受优化、噪声和横轴选择影响,不能据此断言规模总能治愈过拟合。把人工接管计入结果时,Belkin、Hsu、Ma、Mandal的解释可能缩小、反号,或让位给数据污染审计的路径。数据污染审计给出复核PNAS的近邻条件:保留失败对象后检验;双下降负责记录中止、排除和不显著对象。
随机特征、树与神经网络在训练误差刚到零附近出现风险峰改变登记顺序:模型参数、训练样本与样本外误差归双下降,数据污染、算力预算与长尾失败交数据污染审计核查。2024年的数据污染审计以“开放网络预训练使测试题、改写题和解答可能进入语料,分数需带污染证据”作近邻;两者若结论不同,应以曲线受优化、噪声和横轴选择影响为分账边界;数据污染审计不得与本条合成一个平均分。
2019年,双下降据随机特征、树与神经网络在训练误差刚到零附近出现风险峰对接第257号第一条。跨过去,曲线受优化、噪声和横轴选择影响迫使双下降重新检验可见读数。双下降以曲线受优化、噪声和横轴选择影响施加反向压力。这使经典偏差—方差U形曲线在现代过参数模型中会出现第二次下降。路径债四证,继续充当本条可复核的判别边界。
四、神经缩放律:损失随模型、数据和计算呈近似幂律Neural Scaling Laws
这一路线先拆掉2020年的Scaling Laws for Neural Language Models:Kaplan 等不再允许深度学习在神经缩放律上继续用训练成功代替泛化解释。Kaplan 等逐项核对模型参数、训练样本与样本外误差里的神经缩放律;数据污染、算力预算与长尾失败由深层信念网另行登记。在Scaling Laws for Neural Language Models的证据账上,由跨七个数量级实验给出计算最优配比并影响训练预算规划起步,深层信念网进入解释对照;本条残差不能靠改名消失。
神经缩放律的可反驳立场是:在一定区间内,增加参数、数据和计算可用平滑幂律预测损失。Kaplan 等这一路线据此把决定性解释锁在一个对象上,深层信念网的“无监督逐层预训练先找到参数盆地,再用监督信号整体微调”不能替代本条;边界是外推会遇到数据质量、任务饱和和能力断点。若让独立团队预注册仍不能保持方向,深层信念网便构成神经缩放律的近邻反例;Scaling Laws for Neural Language Models对神经缩放律仅支持原任务。
可核对的主证据是Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》:跨七个数量级实验给出计算最优配比并影响训练预算规划。缩放实验横跨约7个数量级。深层信念网要求把2020年的神经缩放律样本与对照结算,再核查深层信念网的任务、观察窗和外推会遇到数据质量、任务饱和和能力断点。对神经缩放律,深层信念网仅作近邻;支点仍是Kaplan 等在Scaling Laws for Neural Language Models的原始比较。
神经缩放律自己留下的反证入口是:外推会遇到数据质量、任务饱和和能力断点;损失下降不等于风险下降。审计数据近邻与泄漏时,Kaplan 等的解释可能缩小、反号,或让位给深层信念网的路径。深层信念网给出复核Scaling Laws for Neural Language Models的近邻条件:改用地点外资料复核;神经缩放律负责记录中止、排除和不显著对象。
跨七个数量级实验给出计算最优配比并影响训练预算规划改变登记顺序:模型参数、训练样本与样本外误差归神经缩放律,数据污染、算力预算与长尾失败交深层信念网核查。2006年的深层信念网以“无监督逐层预训练先找到参数盆地,再用监督信号整体微调”作近邻;两者若结论不同,应以外推会遇到数据质量、任务饱和和能力断点为分账边界;深层信念网不得与本条合成一个平均分。
2020年,神经缩放律据跨七个数量级实验给出计算最优配比并影响训练预算规划对接第044号第二幕五。跨过去,外推会遇到数据质量、任务饱和和能力断点迫使神经缩放律重新检验可见读数。神经缩放律以外推会遇到数据质量、任务饱和和能力断点施加反向压力。
五、深度展开Deep Unfolding
Hershey 2014以前,旧框架没有回答把迭代器层化后是否仍保留算法稳定性;深度展开让稀疏推断和源分离用有限层学习步长与阈值,兼顾结构先验和数据适配把问题改成可核验对象。从失败样本回看,必须逐年保留未采用与失败案例,才能分开概念改名和对象变化;深度展开须分开验收常态与压力场景。把观察窗拉长以后,补列未采用和失败样本;缺少这一列就无法判断方向有没有翻转(Hershey 2014)。
可反驳命题写得很窄:只有把每次迭代映射成可训练网络层能使深度展开保持原方向。增加预算与样本不能替代这一步,反之若深度展开让稀疏推断和源分离用有限层学习步长与阈值,兼顾结构先验和数据适配由其他机制同样产生,本条必须撤回单因。把观察窗拉长以后,固定服务基线再做消融;深度展开据此区分设备存在与服务兑现(Monga 2020)。
第三段的硬账来自Hershey, Le Roux & Weninger, IEEE ICASSP, 1171–1175 (2014)所报告的深度展开让稀疏推断和源分离用有限层学习步长与阈值,兼顾结构先验和数据适配。应同时记录成功数/全部尝试数、实际周期/设计周期以及边界内外的差值,才能知道把每次迭代映射成可训练网络层是否真的兑现。对照未采用者时,公开分子分母与退出;深度展开醒目纪录仍须排除筛选效应(Hershey 2014;IEEE Signal Processing Society 2025)。深度展开复核门槛预注册6站×29批次。
Monga 2020把边界写成训练层数固定且分布外迭代无保证,网络看似像算法不等于具有收敛证书;此时局部收益可能翻成系统损失。在跨场址复现之前,应分开常态与极端样本,并把反号结论收窄到实际适用区间;缺少这一列就无法判断方向有没有翻转。当平均值被拆开,分列常态极端与反号;一旦结果反号就应撤回原来的充分性主张(Hershey 2014)。
IEEE Signal Processing Society, ICASSP 2025 Proceedings (2025).把近期进展概括为模型驱动深度学习继续加入可解释约束与收敛分析。对深度展开的制度含义,是合同须规定数据归属、失效报告与长期责任,并按深度展开让稀疏推断和源分离用有限层学习步长与阈值,兼顾结构先验和数据适配复核撤场后的证据链。当平均值被拆开,保存许可维护与责任版本;深度展开局部增益不得冒充系统收益(Monga 2020)。
深度展开与外部面板共享的是“可测代理等于真实服务”这一预设,分歧点则在深度展开让稀疏推断和源分离用有限层学习步长与阈值,兼顾结构先验和数据适配。这使把每次迭代映射成可训练网络层继续充当本条可复核的判别边界。
六、学习式图像压缩Learned Image Compression
Ballé 2017改写了感知失真与码率优化是否保留事实细节;学习压缩把变换、量化与概率模型端到端优化让旧默认有了可查裂缝。把观察窗拉长以后,必须逐年保留未采用与失败案例,才能分开概念改名和对象变化;学习式图像压须分开验收常态与压力场景。对照未采用者时,补列未采用和失败样本;缺少这一列就无法判断方向有没有翻转(Ballé 2017)。
本条只承认共同学习非线性变换和熵模型;移除后若学习压缩把变换、量化与概率模型端到端优化仍出现,立场即撤回。对照未采用者时,应在同一服务基线下固定场址与资源,再做移除机制的消融检验;学习式图像压据此区分设备存在与服务兑现。在跨场址复现之前,固定服务基线再做消融;学习式图像压局部增益不得冒充系统收益。当平均值被拆开,固定服务基线再做消融;学习式图像压把观察记录接回问责链(Monga 2020)。
Ballé 2017报告学习压缩把变换、量化与概率模型端到端优化;学习式图像压以兑现数/候选与中止总数结算。在跨场址复现之前,最低记录还须给出原始分子、总体分母、观察期与退出原因;学习式图像压醒目纪录仍须排除筛选效应。当平均值被拆开,公开分子分母与退出;学习式图像压记录须回到全量分母。沿责任链继续追问,公开分子分母与退出;学习式图像压分母改变便重算结论(Ballé 2017;IEEE Signal Processing Society 2025)。学习式图像复核门槛预注册2站×31批次。
Monga 2020保留训练集和感知损失会偏好常见纹理;学习式图像压越界后须重判方向。当平均值被拆开,应分开常态与极端样本,并把反号结论收窄到实际适用区间;缺少这一列就无法判断方向有没有翻转。沿责任链继续追问,应分开常态与极端样本,并把反号结论收窄到实际适用区间;一旦结果反号就应撤回原来的充分性主张。以同一服务单位复算,分列常态极端与反号;学习式图像压投运后仍保留责任主体(Ballé 2017)。
IEEE Signal Processing Society 2025记录超先验和生成式压缩继续报告率失真感知三方权衡;维护账须继续追踪学习压缩把变换、量化与概率模型端到端优化。沿责任链继续追问,还须把许可、维护、责任主体和退出条件按版本保存;学习式图像压局部增益不得冒充系统收益。
跨域比较以训练集和感知损失会偏好常见纹理划界,并用学习压缩把变换、量化与概率模型端到端优化重算共同学习非线性变换和熵模型。这使共同学习非线性变换和熵模型继续充当本条可复核的判别边界。
七、正则化去噪REDRegularization by Denoising
Romano 2017改写了任意去噪器是否对应可解释正则项;RED把强去噪器嵌入反问题而不显式写概率分布让旧默认有了可查裂缝。对照未采用者时,必须逐年保留未采用与失败案例,才能分开概念改名和对象变化;正则化去噪须分开验收常态与压力场景。在跨场址复现之前,补列未采用和失败样本;缺少这一列就无法判断方向有没有翻转。当平均值被拆开,补列未采用和失败样本;一旦结果反号就应撤回原来的充分性主张(Romano 2017)。
本条只承认用成熟去噪器的残差定义图像先验;移除后若RED把强去噪器嵌入反问题而不显式写概率分布仍出现,立场即撤回。在跨场址复现之前,应在同一服务基线下固定场址与资源,再做移除机制的消融检验;正则化去噪据此区分设备存在与服务兑现。当平均值被拆开,固定服务基线再做消融;正则化去噪局部增益不得冒充系统收益。沿责任链继续追问,固定服务基线再做消融;正则化去噪把观察记录接回问责链(Monga 2020)。
Romano 2017报告RED把强去噪器嵌入反问题而不显式写概率分布;正则化去噪以兑现数/候选与中止总数结算。当平均值被拆开,最低记录还须给出原始分子、总体分母、观察期与退出原因;正则化去噪醒目纪录仍须排除筛选效应。沿责任链继续追问,公开分子分母与退出;正则化去噪记录须回到全量分母。以同一服务单位复算,公开分子分母与退出;正则化去噪分母改变便重算结论(Romano 2017;IEEE Signal Processing Society 2025)。正则化去噪复核门槛预注册3站×33批次。
Monga 2020保留去噪器不满足局部齐次或雅可比对称时原正则解释失效;正则化去噪越界后须重判方向。沿责任链继续追问,应分开常态与极端样本,并把反号结论收窄到实际适用区间;缺少这一列就无法判断方向有没有翻转。以同一服务单位复算,分列常态极端与反号;一旦结果反号就应撤回原来的充分性主张。面对分布外情形,分列常态极端与反号;正则化去噪投运后仍保留责任主体(Romano 2017)。
IEEE Signal Processing Society 2025记录即插即用和扩散先验继续研究固定点与收敛条件;维护账须继续追踪RED把强去噪器嵌入反问题而不显式写概率分布。
跨域比较以去噪器不满足局部齐次或雅可比对称时原正则解释失效划界,并用RED把强去噪器嵌入反问题而不显式写概率分布重算用成熟去噪器的残差定义图像先验。这使用成熟去噪器的残差定义图像先验继续充当本条可复核的判别边界。
八、事件相机信号Event-Based Vision
Gallego et al. 2020改写了异步亮度变化能否替代绝对强度和静态纹理;事件相机把固定帧率改成微秒级稀疏变化流让旧默认有了可查裂缝。在跨场址复现之前,必须逐年保留未采用与失败案例,才能分开概念改名和对象变化;事件相机信号须分开验收常态与压力场景。当平均值被拆开,补列未采用和失败样本;缺少这一列就无法判断方向有没有翻转(Gallego et al. 2020)。
本条只承认只在像素对数亮度越阈值时发送事件;移除后若事件相机把固定帧率改成微秒级稀疏变化流仍出现,立场即撤回。当平均值被拆开,应在同一服务基线下固定场址与资源,再做移除机制的消融检验;事件相机信号据此区分设备存在与服务兑现。沿责任链继续追问,固定服务基线再做消融;事件相机信号局部增益不得冒充系统收益(Monga 2020)。
Gallego et al. 2020的硬证据是事件相机把固定帧率改成微秒级稀疏变化流,显著提高动态范围并降低运动模糊;实际兑现数/全部候选与中止数才可复算。沿责任链继续追问,最低记录还须给出原始分子、总体分母、观察期与退出原因;事件相机信号醒目纪录仍须排除筛选效应。以同一服务单位复算,公开分子分母与退出;事件相机信号记录须回到全量分母(Gallego et al. 2020;IEEE Signal Processing Society 2025)。事件相机信复核门槛预注册4站×35批次。
Monga 2020保留静止场景无事件且阈值逐像素漂移;事件相机信号越界后须重判方向。以同一服务单位复算,应分开常态与极端样本,并把反号结论收窄到实际适用区间;缺少这一列就无法判断方向有没有翻转。面对分布外情形,分列常态极端与反号;一旦结果反号就应撤回原来的充分性主张。为防止事后改口,分列常态极端与反号;事件相机信号须分开验收常态与压力场景(Gallego et al. 2020)。
IEEE Signal Processing Society 2025记录神经形态相机继续扩展高速机器人和HDR任务;采购与监管须把事件相机把固定帧率改成微秒级稀疏变化流,显著提高动态范围并降低运动模糊写进维护账。面对分布外情形,还须把许可、维护、责任主体和退出条件按版本保存;事件相机信号局部增益不得冒充系统收益。
外部接口由静止场景无事件且阈值逐像素漂移,事件多不等于信息多划定;加入事件相机把固定帧率改成微秒级稀疏变化流,显著提高动态范围并降低运动模糊后,只在像素对数亮度越阈值时发送事件才可跨域比较。这使只在像素对数亮度越阈值时发送事件继续充当本条可复核的判别边界。
九、Eyeriss v2:压缩稀疏性进入可重构片上网络Eyeriss v2: Compressed Sparsity Enters a Reconfigurable On-Chip Network
Eyeriss第一代面向规则CNN复用,但MobileNet等紧凑网络层形状多变,权重和激活又含大量零。Eyeriss v2在2019年引入hierarchical mesh,把局部PE簇与全局网络分层连接,可在不同层改变广播、单播和归约;编码数据在压缩域流动,硬件尽量不乘零、不传零。
〔外部复算〕本条主张,决定稀疏AI加速能否跨层保持收益的只有片上网络和PE是否随稀疏模式重构并在压缩域直接工作。固定dataflow会在小channel或depthwise层闲置,HM-NoC允许每层选择连接;稀疏PE解码非零和索引。2019年的核心是让“跳过什么”与“怎样路由”共同设计。〔外部复算〕面向下一轮材料,AI芯片、神经形态与存内计算应优先补齐“剪枝训练、动态输入、索引溢出、重构切换、映射失败与最坏层”的原始记录,并把“当非结构稀疏高度不均时,平均零越多,最慢PE决定的整层延迟反而越突出”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
论文在65nm实现原型并比较Eyeriss,报告对MobileNet等紧凑、稀疏网络获得显著吞吐和能效增益;具体核验应逐层给出非零率、压缩比、索引字节、PE负载方差和mJ/inference。只以理论零比例乘MAC数,会把解码、fragment和最慢PE等待排除。
随机非结构稀疏会让每个PE工作量不同,平均零很多但关键簇仍密集;压缩越高,索引占比反而越大。模型通过剪枝适配硬件可能损失准确率,动态激活稀疏又随输入变化。硬件重构配置本身需要编译和切换,短层的控制开销可能超过节省。Eyeriss v2于2019年的NoC选择仍需逐层验证。把Eyeriss v2:压缩稀疏性进入可重构片上网络Eyeriss v2: Compressed Sparsity Enters a Reconfigurable On-Chip Network与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“保持软件等效质量的非零有效操作数/索引字节、NoC焦耳与空闲PE秒”在这些类别上都可回查,跨研究比较才有意义。
2025年的验收应按真实输入分布测P50与P99非零率,比较非结构、块和N:M稀疏;报告软件等效质量、索引、NoC和空闲PE。模型剪枝训练成本与硬件映射失败要单列,重构切换进入延迟。若稀疏加速只在挑选层成立,整网速度不能按局部倍数相乘。验证还要按层公开稀疏索引字节和NoC拥塞尾部,避免整网平均压缩率掩盖最慢层。
它与第351号第一条“屋顶线模型:算术强度决定性能上限”对撞:压缩既少算也改变字节分母;与第251号第十七条“可组合的基础设施”相比,这里可重构发生在片上网络。2019年的优势依赖稀疏形态与层分布,零比例不是跨模型固定资产。这使hierarchical mesh让PE、buffer和路由按层重构,同时在压缩域处理稀疏权重与激活。阈值侧六证,继续充当本条可复核的判别边界。
十、天机芯:ANN与SNN在同一核上跨范式运行Tianjic: ANNs and SNNs Share One Cross-Paradigm Core
传统AI加速器为ANN矩阵乘优化,神经形态芯片为SNN事件优化,两套编程和硬件割裂。天机芯在2019年把axon、dendrite、soma、router等构件做成可配置FCore,同一28nm芯片的156个核既能运行CNN、MLP,也能运行SNN及混合连接。跨范式由外部系统拼接下沉到片上。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当模块范式和接口继续增加时,兼容模式越多,单一任务数据通路效率反而越低”做至少两轮外部复算,若方向翻转,天机芯:ANN与SNN在同一核上跨范式运行Tianjic: ANNs and SNNs Share One Cross-Paradigm Core的结论必须随之收窄。
〔反号压力〕本条主张,决定混合神经网络能否在同一芯片协作的只有计算核是否能重配编码、状态更新和通信语义。连续数值和spike需要不同时间、精度与路由,FCore通过共享存储与模式配置复用物理资源;片上mesh传递两类事件。2019年的接口让感知、决策和控制可分别选范式再组合。
Nature 2019论文报告单芯片156个FCore,并用多芯片平台控制自动自行车,组合视觉CNN、语音SNN、目标跟踪、控制和决策模块;系统可识别命令、避障和平衡。核验应拆分每个模块准确率、芯片数、功耗、端到端失效率和人工预设,不能用一次公开视频代表开放道路能力。
兼容两种范式会让每种数据通路都不如专用极致,模式切换和编码转换也耗能;演示中的任务图由工程师预先设计,网络并未自行形成通用策略。整合模块越多,反而越难定位错误来自传感、ANN、SNN还是控制。AGI措辞还会诱使读者把平台兼容性误当认知通用性。
2025年的验收应在同工艺下比较专用ANN、专用SNN与Tianjic混合方案,固定任务质量并报告模式转换、路由和闲置核;自行车测试需覆盖天气、道路和失败干预。每个模块的训练来源与在线学习能力单列,只有当混合方案在多任务能效或延迟上胜出,跨范式才有实质收益。道路演示需把摄像头、车载控制器和无线链路功耗纳入,不能只测Tianjic裸芯片。〔反号压力〕在AI芯片、神经形态与存内计算的这一对象上,复核应把“在未见条件下完成的混合闭环任务数/芯片焦耳、模式转换与人工干预次数”拆成同一分母下的主结果与失败谱,“范式转换、模块训练、失败归因、天气道路、人工预设与AGI标题外推”要单列编码,不能在汇总时并入其他项。
它与第351号第十条“性能可移植性:可移植不是能运行,而是少掉速”共享跨范式保留率,本条发生在同一核;与第533号具身智能关于闭环控制相接时,芯片只提供执行平台。这使156个FCore以可重构构件兼容连续激活、脉冲编码与混合网络,并在片上路由多任务。失败谱四证,继续充当本条可复核的判别边界。
十一、晶圆级引擎:切割芯片的边界被冗余路由跨过去Wafer-Scale Engines: Redundant Routing Crosses the Reticle Boundary
普通芯片受光刻reticle限制,训练大模型必须跨封装、板卡和机架通信。Cerebras在2019年发布WSE-1,不切割晶圆,而以冗余核和路由绕过制造缺陷,把约46,225mm²硅面积连接成二维mesh。片上SRAM靠近每个AI核,细粒度消息不需经过高能SerDes,晶圆本身成为系统边界。
〔责任链〕本条主张,决定晶圆级AI处理器能否把集群通信收回硅内的只有缺陷容忍mesh是否让大量本地核保持可路由。已知坏核和坏链路在配置时绕过,任务图铺到剩余资源;本地memory与邻居通信减少全局共享内存压力。2019年的工程突破是在良率不完美时仍把整片晶圆当可编程设备。〔责任链〕落到复现实务,可为晶圆级引擎:切割芯片的边界被冗余路由跨过去Wafer-Scale Engines: Redundant Routing Crosses the Reticle Boundary建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到目标质量的有效任务数/可用核小时、整机焦耳与平均消息hop”统一结算,避免换口径后仍宣称性能提高。
WSE-1采用14nm,公开规模约1.2万亿transistors、40万AI-optimized cores、18GB SRAM和约9PB/s内存带宽;WSE-2后增至85万核、40GB。核验需报告可用核比例、映射后利用率、冷却功率、系统价格与time-to-solution,不能把片上带宽峰值直接当应用吞吐。
二维mesh对局部通信高效,却不天然适合全局all-to-all;模型层若要求大范围归约,跳数和拥塞会增长。晶圆越大,热点与供电均匀性越难,故障也集中在单设备。专用编译映射不能复用GPU共享内存假设,软件移植和运维人才会成为隐性门槛。〔责任链〕本条的边界案例应从“坏核分布、供电热点、编译迁移、全局通信、单设备故障与供应商锁定”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当模型需要频繁全局归约时,晶圆面积越大,mesh拥塞与跳数反而越高”究竟是偶发噪声,还是足以改变结论方向的系统反例。
2025年的验收应以Transformer、稀疏MoE和FFT等不同通信图测hop、拥塞、可用核与能耗,注入坏核并比较映射退化;报告整机冷却和主机。跨两代WSE重编同一模型,公开代码改动与性能保留。若晶圆带宽高但模型需频繁跨全局,局部峰值不构成端到端优势。晶圆缺陷绕行后的备用核比例和跨晶圆结果分布必须公开,才能把WSE规模与可制造性放进同一张表。
它与第251号第十七条“可组合的基础设施”形成反向碰撞:chiplet分解,这里整片集成;与第351号第十二条“百亿亿次协同设计:应用、算法与机器必须共同收敛”共享任务图共设计。1.2万亿晶体管说明集成规模,不证明每个模型都能利用40万核。WSE在2022年的公开架构数据也未覆盖所有生产良率。
十二、CONV-SRAM:成熟存储阵列在读出路径内做卷积点积CONV-SRAM: Mature Memory Arrays Compute Dot Products in the Read Path
新型RRAM和PCM承诺高密非易失存内计算,但制造集成与变异尚难;另一条路线利用已成熟的SRAM。CONV-SRAM在2019年修改bitcell与外围读出,让输入控制字线、存储位表示权重,在存储阵列内部累积卷积点积。计算从独立MAC阵列推进到缓存本体,而不等待新存储器成熟。机构采用CONV-SRAM:成熟存储阵列在读出路径内做卷积点积CONV-SRAM: Mature Memory Arrays Compute Dot Products in the Read Path之前还应公布否决门槛:一旦“当目标精度提高需多次读出时,有效bit越多,端到端能效反而越低”出现,就暂停扩张并回到“在bitcell与读出电路中执行卷积dot-product,让权重不离开片上SRAM即可生成部分和”的原始记录复核;该门槛必须早于部署决定写入方案。
〔排除规则〕本条主张,决定SRAM存内计算能否进入可靠AI芯片的只有读出路径是否在不破坏存储状态时提供足够线性的点积。差分cell、位线电流和时间/电压域转换共同编码乘加;多bit精度通过bit slicing或多次读出组合。2019年的优势是CMOS兼容与高耐久,代价是单元和外围面积。
JSCC 2019论文报告CONV-SRAM在40nm实现低功耗CNN dot-product,给出能效、吞吐与芯片测量,并讨论不同精度。核验应列阵列面积、bitcell增量、ADC或sense amplifier、读扰动、PVT角和完整层准确率;只比较核心pJ/op会漏掉输入装载、部分和合并与数字激活。把CONV-SRAM:成熟存储阵列在读出路径内做卷积点积CONV-SRAM: Mature Memory Arrays Compute Dot Products in the Read Path与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“保持软件等效精度的完整层数/SoC焦耳、硅面积与重校准次数”在这些类别上都可回查,跨研究比较才有意义。
SRAM易失,断电后权重需从外部重载;增大cell或多线会降低密度。模拟位线随工艺、电压和温度偏移,精度越高,重复读与转换能耗反而越大。把缓存改成计算单元还可能妨碍普通读写和纠错;若模型层不适合阵列形状,剩余容量闲置。
2026年的验收应在多个PVT corner和芯片样本上报告有效位、准确率与重校准频率,测断电重载和ECC兼容;面积效率与系统能效同表。与数字SRAM+MAC基线比较时,固定模型、工艺与存储容量,并计入权重加载。若CIM模式降低普通缓存可用性,也要登记机会成本。同时报告CONV-SRAM在不同电源电压下的读扰和保持失败,确认8T单元不会因计算模式破坏权重。
它与第251号第十条“内存墙与近数据计算”共享少搬权重,本条选择成熟SRAM;与第351号第九条“混合精度可靠性:低精度算、高清晰度验”相接时,外围数字校正决定有效精度。这使在bitcell与读出电路中执行卷积dot-product,让权重不离开片上SRAM即可生成部分和。接口面五证,继续充当本条可复核的判别边界。
◎ 二十年连起来看
两幕是两注押反了方向:上一个十年押的是自下而上、按细节重建;这十年押的是目标驱动、用任务训练出模型。前者的失败与后者的成功指向同一条判据——模型的价值在于它能不能做出可检验的预测,而不在于它有多像。
被继承的是那把尺子(能否预测留出数据上的神经响应)与那台机器(大规模记录)。而当年批评自下而上模拟的那句话,如今被原样用在了新范式上:预测得准不等于解释了。这一次这门学科接受得快得多——它把「训练出来的模型」本身列成了新的研究对象。
◎ 三个常见误解
其一,以为大脑是一台计算机。计算是描述大脑的一种有效抽象,但它没有清晰的程序与数据分离、没有集中时钟、结构随使用而改变——把比喻当成同构会误导建模。
其二,以为神经元相当于晶体管。单个神经元的树突就能完成非线性运算,其复杂度更接近一个小网络;用一层加权求和来代表它,是简化而非等价。
其三,以为把全脑模拟出来就等于理解。没有约束的大规模模拟会得到一个与真实同样难以理解的系统;理解需要的是能被检验的简化,而不是更完整的复制。
◎ 与相邻领域的接口
这块面板与认知神经科学在编码模型上已经合流;与深度学习互为对照系统,那一侧的架构变化直接影响这里的模型选择;与脑机接口的接口是解码——把群体活动映射到意图,用的正是这里的流形方法;而与统计物理的关系在于,无序系统与随机矩阵的工具正被用来分析大规模神经网络的动力学。
◎ 争议现场
深度网络算不算大脑的模型,是最持久的分歧。支持者以预测精度为证:没有别的模型能同时解释这么多脑区的响应;批评者说预测精度不等于机制解释,网络的结构、学习规则与训练数据都与生物大相径庭,且不同架构常常给出相近的预测分数,说明该指标区分力有限。可判之处在于区分性实验——设计出能把不同模型拉开差距的刺激或干预,而这正是近几年最活跃的方向。
第二场争论关于连接组的价值。乐观一方认为接线图是不可替代的地基,没有它任何机制模型都缺约束;质疑一方指出蠕虫的完整连接组早已公开数十年,仍无法据此预测其行为,因为突触强度、神经调质与状态依赖不在图里。裁决办法很实在:拿连接组做出一个此前做不出的行为预测并被验证——这样的案例数量将说明它到底值多少。
◎ 往下五年看什么
其一,哺乳动物皮层立方毫米级连接组与同一块组织的活动记录能否配对完成——这是第一次有机会把结构与功能在同一批神经元上对齐。其二,学习规则的实验判决:能否在活体中直接观测到与某种可行替代方案相符的可塑性信号,这是这一分支能否从类比走向机制的关键。其三,模型与神经科学的互相抽血会不会继续——若人工智能一侧的架构变化不再对神经科学有启发,这门学科需要重新找它的模型来源。
◎ 可与哪些领域对撞
第2条“ReLU:一个非饱和门改变梯度与稀疏激活”与第049号第二幕三“叠加:一个神经元承载多个特征可对撞:共享〔01 谁进入分母〕围绕“ReLU:一个非饱和门改变梯度与稀疏;本条单因是只有深度学习里的ReLU是决定因素。若当死亡单元与尺度爆炸仍在,主指标越高,边界外保持率反,方向会反转,须为计算神经科学补第三条件。
第7条“暗硅:晶体管继续增加,能同时点亮的比例却下降”与第251号第十六条“功耗、暗硅与热设计”对撞:共享〔04 测量不改变被测对象〕围绕“暗硅:晶体管继续增加;本条单因是决定后摩尔时代AI加速器是否必要的只有功。若当模型算子快速变化时,专用单元越多,芯片可利用面积比,方向会反转,须为计算神经科学补第三条件。
第13条“深度展开”与未见已发布面板点到同一读数对撞:共享〔18 干预不回写到被干预者〕围绕“深度展开”的证据默;本条单因是只认把每次迭代映射成可训练网络层。若若遗漏本条边界,流程指标越好,真实结局反而可能越差,方向会反转,须为计算神经科学补第三条件。
第18条“天机芯:ANN与SNN在同一核上跨范式运行”与第351号第十条“性能可移植性:可移植不是能运行,而对撞:共享〔22 通过形式审查=实质合规〕围绕“天机芯:ANN与SNN在同一核;本条单因是决定混合神经网络能否在同一芯片协作的。若当模块范式和接口继续增加时,兼容模式越多,单一任务数,方向会反转,须为计算神经科学补第三条件。
◎ 十条可做的研究命题
1. 动态边界「这个回路」从哪里到哪里,换个画法结论会不会变 预测对同一份记录采用不同的单元纳入与变量边界(按解剖分区、按功能聚类、按流形维度截断),即使原始数据不变,被判定为控制变量的成分与跨个体对齐度都会出现可重复的分叉
2. 迁移合同模型换一只动物就不灵了,先写清哪几条不能变 预测跨个体与跨制备失败可由少数条件的破坏解释:记录稳定性与漂移校正方式、行为任务的时序结构、清醒状态与运动统计、对齐所用的参考流形
3. 认知-制度双循环基准、数据格式与评审,正在决定我们建什么模型 预测只改研究者的建模判断或只改评价制度,都不能稳定提升模型的干预预测力;只有当基准任务同时要求预测扰动后果、且数据格式强制记录扰动参数时,两者才会一起改变
4. 跨尺度回写群体流形反过来限制了单个神经元能做什么 预测单神经元的可达调谐随群体活动所处的流形位置而变:在流形被外部输入或状态约束固定时,对单神经元的定向扰动不再传递到行为
5. 冗余智能同一件事有几条算法能做,砍掉一条会怎样 预测具备多条可替代表征通路的回路在常规条件下效率略低,但在通路被消融或输入统计骤变后的恢复速度显著更快
6. 成本曲率从几百通道做到几万通道,成本是在哪一步弯上去的 预测记录规模扩大时的总成本不是线性的:在采集端近似线性,而在对齐、行为标注与因果验证三处出现曲率转折
7. 稀缺转移记录不再稀缺之后,卡住我们的是什么 预测记录通道不再是瓶颈后,进步速度不会按通道数同比增长:限制将转移到行为标注质量、可施加的因果扰动种类与模型验证周期这三处,且旧指标(可解码维度、拟合优度)继续上升却不再对应
8. 极端压力学噪声、失稳与分布移位同时发生时,解码是从哪一环断的 预测记录漂移、行为状态变化与输入统计移位三者同步出现时的解码崩溃,不能由三个单因素测试相加预测:存在一个组合区间,越过后误差由渐增转为跳变,且此时模型的置信度不下降反而上
9. 退出机制闭环刺激实验要停下来的时候怎么停 预测预先演练过停止与善后的闭环实验,即使初期效率略低,在出现刺激诱发的适应或异常动力学时的不可逆损害与恢复时间显著低于同等效率但无退出方案的实验
10. 协同主体模型、记录与共同体三者合起来才是那个「会算的东西」 预测保持研究者个人能力不变,只改变数据格式、共享时点与结果否决结构,会显著改变跨个体对齐度与错误传播:强制记录扰动参数与失败会话的格式,会明显缩短同类结论被独立验证或推翻
◎ 资料核验
- Hinton、Osindero、Teh,2006 年《Neural Computation》18(7):1527–1554,DOI 10.1162/neco.2006.18.7.1527
- Glorot、Bordes、Bengio,2011 年《AISTATS》15:315–323
- Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105
- Srivastava、Hinton、Krizhevsky、Sutskever、Salakhutdinov,2014 年《JMLR》15:1929–1958
- Donoho, IEEE Transactions on Information Theory 52, 1289–1306 (2006), doi:10.1109/TIT.2006.871582
- Wipf & Rao, IEEE Transactions on Signal Processing 55, 3704–3716 (2007), doi:10.1109/TSP.2007.901154
- Esmaeilzadeh等,2011年ISCA论文《Dark Silicon and the End of Multicore Scaling》
- NVIDIA,2007年CUDA;Krizhevsky、Sutskever与Hinton,2012年NeurIPS《ImageNet Classification with Deep Convolutional Neural Networks》
- Chen、Kornblith、Norouzi、Hinton,2020 年《ICML》119:1597–1607
- He、Chen、Xie 等,2022 年《CVPR》:16000–16009,DOI 10.1109/CVPR52688.2022.01553
- Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116
- Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》
- Hershey, Le Roux & Weninger, IEEE ICASSP, 1171–1175 (2014), doi:10.1109/ICASSP.2014.6853874
- Ballé, Laparra & Simoncelli, International Conference on Learning Representations (2017)
- Romano, Elad & Milanfar, SIAM Journal on Imaging Sciences 10, 1804–1844 (2017), doi:10.1137/16M1102884
- Gallego et al., IEEE Transactions on Pattern Analysis and Machine Intelligence 44, 154–180 (2022), doi:10.1109/TPAMI.2020.3008413
- Chen、Yang、Emer与Sze,2019年《IEEE Journal on Emerging and Selected Topics in Circuits and Systems》论文《Eyeriss v2》
- (2024—2026年未见直接更新。)
- (2025年文献)IEEE Signal Processing Society, ICASSP 2025 Proceedings (2025)
- (2024年文献)Lu, A. et al. “High-Speed Emerging Memories for AI Hardware Accelerators.” Nature Reviews Electrical Engineering, 2024.
以下二十条是计算神经科学在 1950 至 2006 年之间形成的经典思想,与上文近二十年的二十条合成一块面板的两层。经典层不做名人榜;每条都用具名原始材料和后续修订说明旧前提如何成立,又点名它在本块哪一条现代判断里继续被使用或反对。
经一、图灵测试与机器智能Classic 01 · Computational Neuroscience
在1950年前后的图灵测试与机器智能提出之前,计算神经科学常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第1条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是以可观察对话表现替代对机器是否真正思考的本体争论。第1条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查图灵测试与机器智能,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第1条经典与本块甲“深层信念网:逐层预训练让深网络第一次稳定启动”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第1条就退回1950年的适用域;经典身份不能代替新证据。
经二、感知机学习规则Classic 02 · Computational Neuroscience
在1958年前后的感知机学习规则提出之前,计算神经科学常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第2条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是线性阈值单元可按分类误差调整权重并学习可分模式。第2条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查感知机学习规则,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第2条经典与本块乙“ReLU:一个非饱和门改变梯度与稀疏激活”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第2条就退回1958年的适用域;经典身份不能代替新证据。
经三、Widrow-Hoff最小均方学习Classic 03 · Computational Neuroscience
在1960年前后的Widrow-Hoff最小均方学习提出之前,计算神经科学常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第3条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是沿均方误差梯度更新权重可让线性自适应单元在线收敛。第3条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查Widrow-Hoff最小均方学习,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第3条经典与本块丙“ImageNet转折:数据、GPU与卷积一同越过旧基线”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第3条就退回1960年的适用域;经典身份不能代替新证据。
经四、多层数据处理网络Classic 04 · Computational Neuroscience
在1965年前后的多层数据处理网络提出之前,计算神经科学常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第4条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是逐层生成并筛选多项式单元可构造早期深层自组织模型。第4条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查多层数据处理网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第4条经典与本块丁“Dropout:随机删节点把共适应变成集成近似”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第4条就退回1965年的适用域;经典身份不能代替新证据。
经五、感知机表示局限Classic 05 · Computational Neuroscience
在1969年前后的感知机表示局限提出之前,计算神经科学常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第5条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是单层感知机无法表示异或与某些连通性质,结构能力须与训练成功分开。第5条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查感知机表示局限,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第5条经典与本块戊“稀疏表示与压缩感知”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第5条就退回1969年的适用域;经典身份不能代替新证据。
经六、误差反向传播论文Classic 06 · Computational Neuroscience
在1974年前后的误差反向传播论文提出之前,计算神经科学常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第6条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是链式求导可把输出误差分配给多层网络内部权重。第6条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查误差反向传播论文,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第6条经典与本块己“稀疏贝叶斯学习”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第6条就退回1974年的适用域;经典身份不能代替新证据。
经七、Neocognitron卷积层级Classic 07 · Computational Neuroscience
在1980年前后的Neocognitron卷积层级提出之前,计算神经科学常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第7条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是局部感受野与下采样层级可获得对平移较稳定的视觉识别。第7条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查Neocognitron卷积层级,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第7条经典与本块庚“暗硅:晶体管继续增加,能同时点亮的比例却下降”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第7条就退回1980年的适用域;经典身份不能代替新证据。
经八、Hopfield联想记忆Classic 08 · Computational Neuroscience
在1982年前后的Hopfield联想记忆提出之前,计算神经科学常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第8条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是对称连接网络可沿能量下降收敛到存储模式并完成内容寻址。第8条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查Hopfield联想记忆,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第8条经典与本块辛“CUDA与GPU训练:图形并行阵列成为AI通用底座”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第8条就退回1982年的适用域;经典身份不能代替新证据。
经九、玻尔兹曼机Classic 09 · Computational Neuroscience
在1985年前后的玻尔兹曼机提出之前,计算神经科学常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第9条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是随机隐变量网络可用自由相与钳制相统计差学习概率分布。第9条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查玻尔兹曼机,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第9条经典与本块一“自监督对比学习:标签不再是表示学习的唯一入口”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第9条就退回1985年的适用域;经典身份不能代替新证据。
经十、多层反向传播复兴Classic 10 · Computational Neuroscience
在1986年前后的多层反向传播复兴提出之前,计算神经科学常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第10条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是反向传播误差可让多层网络学习分布式内部表示。第10条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查多层反向传播复兴,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第10条经典与本块二“掩码自编码:预测缺失部分取代逐对样本比较”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第10条就退回1986年的适用域;经典身份不能代替新证据。
经十一、卷积网络识别手写数字Classic 11 · Computational Neuroscience
在1989年前后的卷积网络识别手写数字提出之前,计算神经科学常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第11条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是共享卷积核与反向传播把图像局部结构转成端到端分类器。第11条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查卷积网络识别手写数字,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第11条经典与本块三“双下降:参数越过插值点后测试误差还能再次下降”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第11条就退回1989年的适用域;经典身份不能代替新证据。
经十二、简单循环网络Classic 12 · Computational Neuroscience
在1990年前后的简单循环网络提出之前,计算神经科学常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第12条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是把上一时刻隐状态回送网络可从序列预测中学习时间结构。第12条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查简单循环网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第12条经典与本块四“神经缩放律:损失随模型、数据和计算呈近似幂律”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第12条就退回1990年的适用域;经典身份不能代替新证据。
经十三、支持向量机Classic 13 · Computational Neuroscience
在1995年前后的支持向量机提出之前,计算神经科学常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第13条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是最大间隔与核函数把分类复杂度集中到边界支持向量。第13条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查支持向量机,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第13条经典与本块五“深度展开”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第13条就退回1995年的适用域;经典身份不能代替新证据。
经十四、长短期记忆网络Classic 14 · Computational Neuroscience
在1997年前后的长短期记忆网络提出之前,计算神经科学常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第14条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是门控记忆单元为梯度提供近恒定通道并缓解长序列遗忘。第14条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查长短期记忆网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第14条经典与本块六“学习式图像压缩”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第14条就退回1997年的适用域;经典身份不能代替新证据。
经十五、LeNet文档识别系统Classic 15 · Computational Neuroscience
在1998年前后的LeNet文档识别系统提出之前,计算神经科学常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第15条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是卷积、池化和梯度训练可组成部署级手写文档识别流水线。第15条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查LeNet文档识别系统,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第15条经典与本块七“正则化去噪RED”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第15条就退回1998年的适用域;经典身份不能代替新证据。
经十六、核方法统一Classic 16 · Computational Neuroscience
在2002年前后的核方法统一提出之前,计算神经科学常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第16条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是正定核把非线性学习转为高维特征空间中的凸优化。第16条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查核方法统一,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第16条经典与本块八“事件相机信号”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第16条就退回2002年的适用域;经典身份不能代替新证据。
经十七、Isomap流形学习Classic 17 · Computational Neuroscience
在2000年前后的Isomap流形学习提出之前,计算神经科学常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第17条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是邻域图上的测地距离可恢复高维数据的低维流形坐标。第17条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查Isomap流形学习,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第17条经典与本块九“Eyeriss v2:压缩稀疏性进入可重构片上网络”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第17条就退回2000年的适用域;经典身份不能代替新证据。
经十八、对比散度Classic 18 · Computational Neuroscience
在2002年前后的对比散度提出之前,计算神经科学常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第18条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是短步马尔可夫链可近似能量模型似然梯度并显著降低训练成本。第18条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查对比散度,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第18条经典与本块十“天机芯:ANN与SNN在同一核上跨范式运行”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第18条就退回2002年的适用域;经典身份不能代替新证据。
经十九、GPU通用流式计算Classic 19 · Computational Neuroscience
在2004年前后的GPU通用流式计算提出之前,计算神经科学常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第19条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是把程序表达为数据流内核可将图形处理器用于一般并行数值计算。第19条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查GPU通用流式计算,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第19条经典与本块十一“晶圆级引擎:切割芯片的边界被冗余路由跨过去”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第19条就退回2004年的适用域;经典身份不能代替新证据。
经二十、深层信念网络逐层预训练Classic 20 · Computational Neuroscience
在2006年前后的深层信念网络逐层预训练提出之前,计算神经科学常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第20条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是逐层无监督训练再微调可让多层生成网络越过随机初始化困难。第20条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查深层信念网络逐层预训练,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第20条经典与本块十二“CONV-SRAM:成熟存储阵列在读出路径内做卷积点积”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第20条就退回2006年的适用域;经典身份不能代替新证据。
◎ 这一层怎么用
先按“今用”或“异名”找到上文对应的现代条,再比较两条的对象、分母与停止规则。若它们只共享名词而不共享失败对象,就只登记为异名;若量纲可以逐项换算,再判断现代条究竟继承、修正还是反转了经典命题。
经典身份不提供豁免。提出年份只决定它属于哪一层;后续综述、反例和新装置负责划出今天仍可使用的边界。量纲字段保留“∶”,使跨年代与跨领域的读数能够先对齐分母再碰撞。
◎ 经典层资料核验
- Turing AM. Computing machinery and intelligence. Mind 59 (1950): 433–460。
- Rosenblatt F. The perceptron: A probabilistic model for information storage and organization in the brain. Psychological Review 65 (1958): 386–408。
- Widrow B, Hoff ME. Adaptive switching circuits. IRE WESCON Convention Record 4 (1960): 96–104。
- Ivakhnenko AG, Lapa VG. Cybernetic Predicting Devices. CCM Information (1965)。
- Minsky M, Papert S. Perceptrons. MIT Press (1969)。
- Werbos PJ. Beyond Regression: New Tools for Prediction and Analysis in the Behavioral Sciences. Harvard PhD thesis (1974)。
- Fukushima K. Neocognitron: A self-organizing neural network model for pattern recognition unaffected by shift in position. Biological Cybernetics 36 (1980): 193–202。
- Hopfield JJ. Neural networks and physical systems with emergent collective computational abilities. Proceedings of the National Academy of Sciences 79 (1982): 2554–2558。
- Ackley DH, Hinton GE, Sejnowski TJ. A learning algorithm for Boltzmann machines. Cognitive Science 9 (1985): 147–169。
- Rumelhart DE, Hinton GE, Williams RJ. Learning representations by back-propagating errors. Nature 323 (1986): 533–536。
- LeCun Y et al. Backpropagation applied to handwritten zip code recognition. Neural Computation 1 (1989): 541–551。
- Elman JL. Finding structure in time. Cognitive Science 14 (1990): 179–211。
- Cortes C, Vapnik V. Support-vector networks. Machine Learning 20 (1995): 273–297。
- Hochreiter S, Schmidhuber J. Long short-term memory. Neural Computation 9 (1997): 1735–1780。
- LeCun Y et al. Gradient-based learning applied to document recognition. Proceedings of the IEEE 86 (1998): 2278–2324。
- Scholkopf B, Smola AJ. Learning with Kernels. MIT Press (2002)。
- Tenenbaum JB, de Silva V, Langford JC. A global geometric framework for nonlinear dimensionality reduction. Science 290 (2000): 2319–2323。
- Hinton GE. Training products of experts by minimizing contrastive divergence. Neural Computation 14 (2002): 1771–1800。
- Buck I et al. Brook for GPUs: Stream computing on graphics hardware. ACM Transactions on Graphics 23 (2004): 777–786。
- Hinton GE, Osindero S, Teh YW. A fast learning algorithm for deep belief nets. Neural Computation 18 (2006): 1527–1554。
- Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)。
- Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)。
- Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)。
- LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444。
- Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)。
- Nilsson NJ. Learning Machines. McGraw-Hill (1965)。
- Rumelhart DE, McClelland JL. Parallel Distributed Processing. MIT Press (1986)。
- Hertz J, Krogh A, Palmer RG. Introduction to the Theory of Neural Computation. Addison-Wesley (1991)。
- Bishop CM. Neural Networks for Pattern Recognition. Oxford University Press (1995)。
- Vapnik VN. Statistical Learning Theory. Wiley (1998)。
- Haykin S. Neural Networks, 2nd ed. Prentice Hall (1999)。
- Cristianini N, Shawe-Taylor J. An Introduction to Support Vector Machines. Cambridge University Press (2000)。
- Bishop CM. Pattern Recognition and Machine Learning. Springer (2006)。
核验说明:提出栏优先保留原始论文、专著或正式文集;流变栏列具体的后续专著、综述或重建工作。2006 年后的文献只用于说明修订,不改变经典条的入选年份。