机器学习理论
学习理论的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。
第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。
甲、压缩感知:稀疏性让欠定问题获得精确恢复保证Compressed Sensing
起点要放回2006年的IEEE Transactions on Information Theory:Candès、Romberg、Tao不再允许机器学习理论在压缩感知上继续把低维与独立同分布直觉直接外推。Candès、Romberg、Tao逐项核对样本数、维数、复杂度与风险里的压缩感知;常数依赖、分布假设与有限样本区间由良性过拟合另行登记。在IEEE Transactions on Information Theory的证据账上,由理论给出高概率采样数与误差界起步,良性过拟合进入解释对照;本条残差不能靠改名消失。
压缩感知的可反驳立场是:只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复。Candès、Romberg、Tao这一路线据此把决定性解释锁在一个对象上,良性过拟合的“高维线性回归中,最小范数插值器可在特定协方差谱下泛化”不能替代本条;边界是真实信号仅近似稀疏。若换样本后再问仍不能保持方向,良性过拟合便构成压缩感知的近邻反例;IEEE Transactions on Information Theory对压缩感知仅支持原任务。
可核对的主证据是Candès、Romberg、Tao,2006 年《IEEE Transactions on Information Theory》52(2):489–509,DOI 10.1109/TIT.2005.862083:理论给出高概率采样数与误差界,并迅速进入成像和信号处理。恢复保证可让观测数降到原维度约10%的量级。良性过拟合要求把2006年的压缩感知样本与对照结算,再核查良性过拟合的任务、观察窗和真实信号仅近似稀疏。对压缩感知,良性过拟合仅作近邻;支点仍是Candès、Romberg、Tao在IEEE Transactions on Information Theory的原始比较。
压缩感知自己留下的反证入口是:真实信号仅近似稀疏,矩阵条件难检验;漂亮保证不自动覆盖采集偏差。用正交量纲重测时,Candès、Romberg、Tao的解释可能缩小、反号,或让位给良性过拟合的路径。良性过拟合给出复核IEEE Transactions on Information Theory的近邻条件:把不显著结果一并公开;压缩感知负责记录中止、排除和不显著对象。回到IEEE Transactions on Information Theory的取样方式,压缩感知要用良性过拟合证明原分母没有删去最容易失败的对象。
理论给出高概率采样数与误差界改变登记顺序:样本数、维数、复杂度与风险归压缩感知,常数依赖、分布假设与有限样本区间交良性过拟合核查。2020年的良性过拟合以“高维线性回归中,最小范数插值器可在特定协方差谱下泛化”作近邻;两者若结论不同,应以真实信号仅近似稀疏为分账边界;良性过拟合不得与本条合成一个平均分。
2006年,压缩感知据理论给出高概率采样数与误差界对接第257号第一条。跨过去,真实信号仅近似稀疏迫使压缩感知重新检验可见读数。压缩感知以真实信号仅近似稀疏施加反向压力。该接口若仍支持相反方向,真实信号仅近似稀疏要求压缩感知增加第三条件,同时容纳两边的失效样本。拿良性过拟合作近邻检验,可辨认Candès、Romberg、Tao观察到的是独有路径,还是另一条路线的表面同义词。
乙、PAC-Bayes复兴:先验、后验与经验误差共同给出泛化界PAC-Bayesian Bounds
真正的断点出现在2009年的AISTATS:Germain、Lacasse、Laviolette、Marchand不再允许机器学习理论在PAC-Bayes复兴上继续把低维与独立同分布直觉直接外推。Germain、Lacasse、Laviolette、Marchand逐项核对样本数、维数、复杂度与风险里的PAC-Bayes复兴;常数依赖、分布假设与有限样本区间由隐式偏置另行登记。在AISTATS的证据账上,由转导式PAC-Bayes界把无标签测试输入纳入分析起步,隐式偏置进入解释对照;本条残差不能靠改名消失。
PAC-Bayes复兴的可反驳立场是:随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制。Germain、Lacasse、Laviolette、Marchand这一路线据此把决定性解释锁在一个对象上,隐式偏置的“无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向”不能替代本条;边界是先验若在看标签后挑选会破坏保证。若把时间窗拉长再看仍不能保持方向,隐式偏置便构成PAC-Bayes复兴的近邻反例;AISTATS对PAC-Bayes复兴仅支持原任务。
可核对的主证据是Germain、Lacasse、Laviolette、Marchand,2009 年《AISTATS》5:105–112:转导式PAC-Bayes界把无标签测试输入纳入分析,并为数据依赖后验提供保证。PAC-Bayes界同时结算1项经验风险与1项KL复杂度。隐式偏置要求把2009年的PAC-Bayes复兴样本与对照结算,再核查隐式偏置的任务、观察窗和先验若在看标签后挑选会破坏保证。对PAC-Bayes复兴,隐式偏置仅作近邻;支点仍是Germain、Lacasse、Laviolette、Marchand在AISTATS的原始比较。
PAC-Bayes复兴自己留下的反证入口是:先验若在看标签后挑选会破坏保证,数值界也常远大于实际误差。撤去界面提示再验时,Germain、Lacasse、Laviolette、Marchand的解释可能缩小、反号,或让位给隐式偏置的路径。隐式偏置给出复核AISTATS的近邻条件:按个体轨迹而非均值检查;PAC-Bayes复兴负责记录中止、排除和不显著对象。回到AISTATS的取样方式,PAC-Bayes复兴要用隐式偏置证明原分母没有删去最容易失败的对象。
转导式PAC-Bayes界把无标签测试输入纳入分析改变登记顺序:样本数、维数、复杂度与风险归PAC-Bayes复兴,常数依赖、分布假设与有限样本区间交隐式偏置核查。2018年的隐式偏置以“无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向”作近邻;两者若结论不同,应以先验若在看标签后挑选会破坏保证为分账边界;隐式偏置不得与本条合成一个平均分。
2009年,PAC-Bayes复兴据转导式PAC-Bayes界把无标签测试输入纳入分析对接第257号第十五条。跨过去,先验若在看标签后挑选会破坏保证迫使PAC-Bayes复兴重新检验可见读数。PAC-Bayes复兴以先验若在看标签后挑选会破坏保证施加反向压力。该接口若仍支持相反方向,先验若在看标签后挑选会破坏保证要求PAC-Bayes复兴增加第三条件,同时容纳两边的失效样本。
丙、高维Lasso:变量多于样本时仍可做稀疏选择High-Dimensional Sparsity
旧账最先在2009年的Annals of Statistics:Bickel、Ritov、Tsybakov不再允许机器学习理论在高维Lasso上继续把低维与独立同分布直觉直接外推。Bickel、Ritov、Tsybakov逐项核对样本数、维数、复杂度与风险里的高维Lasso;常数依赖、分布假设与有限样本区间由神经切线核另行登记。在Annals of Statistics的证据账上,由预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出起步,神经切线核进入解释对照;本条残差不能靠改名消失。
高维Lasso的可反驳立场是:受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界。Bickel、Ritov、Tsybakov这一路线据此把决定性解释锁在一个对象上,神经切线核的“无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析”不能替代本条;边界是高度相关变量会让选择不稳。若保留失败对象后检验仍不能保持方向,神经切线核便构成高维Lasso的近邻反例;Annals of Statistics对高维Lasso仅支持原任务。
可核对的主证据是Bickel、Ritov、Tsybakov,2009 年《Annals of Statistics》37(4):1705–1732,DOI 10.1214/08-AOS620:预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出。Lasso误差界由稀疏度、样本数和维度3个量控制。神经切线核要求把2009年的高维Lasso样本与对照结算,再核查神经切线核的任务、观察窗和高度相关变量会让选择不稳。对高维Lasso,神经切线核仅作近邻;支点仍是Bickel、Ritov、Tsybakov在Annals of Statistics的原始比较。
高维Lasso自己留下的反证入口是:高度相关变量会让选择不稳,预测正确也不代表找回真实因果变量。按亚组分别结算时,Bickel、Ritov、Tsybakov的解释可能缩小、反号,或让位给神经切线核的路径。神经切线核给出复核Annals of Statistics的近邻条件:加入反事实条件;高维Lasso负责记录中止、排除和不显著对象。回到Annals of Statistics的取样方式,高维Lasso要用神经切线核证明原分母没有删去最容易失败的对象。
预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出改变登记顺序:样本数、维数、复杂度与风险归高维Lasso,常数依赖、分布假设与有限样本区间交神经切线核核查。2018年的神经切线核以“无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析”作近邻;两者若结论不同,应以高度相关变量会让选择不稳为分账边界;神经切线核不得与本条合成一个平均分。
2009年,高维Lasso据预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出对接第257号第一条。跨过去,高度相关变量会让选择不稳迫使高维Lasso重新检验可见读数。高维Lasso以高度相关变量会让选择不稳施加反向压力。该接口若仍支持相反方向,高度相关变量会让选择不稳要求高维Lasso增加第三条件,同时容纳两边的失效样本。
丁、矩阵完成:低秩结构把缺失表格变成可恢复对象Matrix Completion
转折并非始于2009年的Foundations of Computational Mathematics:Candès 与 Recht不再允许机器学习理论在矩阵完成上继续把低维与独立同分布直觉直接外推。Candès 与 Recht逐项核对样本数、维数、复杂度与风险里的矩阵完成;常数依赖、分布假设与有限样本区间由均场极限另行登记。在Foundations of Computational Mathematics的证据账上,由理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵起步,均场极限进入解释对照;本条残差不能靠改名消失。
矩阵完成的可反驳立场是:随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目。Candès 与 Recht这一路线据此把决定性解释锁在一个对象上,均场极限的“两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流”不能替代本条;边界是现实缺失并非随机。若改用地点外资料复核仍不能保持方向,均场极限便构成矩阵完成的近邻反例;Foundations of Computational Mathematics对矩阵完成仅支持原任务。
可核对的主证据是Candès 与 Recht,2009 年《Foundations of Computational Mathematics》9:717–772,DOI 10.1007/s10208-009-9045-5:理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵。均场极限要求把2009年的矩阵完成样本与对照结算,再核查均场极限的任务、观察窗和现实缺失并非随机。对矩阵完成,均场极限仅作近邻;支点仍是Candès 与 Recht在Foundations of Computational Mathematics的原始比较。回到Foundations of Computational Mathematics的取样方式,矩阵完成要用均场极限证明原分母没有删去最容易失败的对象。
矩阵完成自己留下的反证入口是:现实缺失并非随机,热门选择与社会结构会破坏采样假设。改变任务顺序后追踪时,Candès 与 Recht的解释可能缩小、反号,或让位给均场极限的路径。均场极限给出复核Foundations of Computational Mathematics的近邻条件:用盲法重跑关键判断;矩阵完成负责记录中止、排除和不显著对象。
理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵改变登记顺序:样本数、维数、复杂度与风险归矩阵完成,常数依赖、分布假设与有限样本区间交均场极限核查。2018年的均场极限以“两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流”作近邻;两者若结论不同,应以现实缺失并非随机为分账边界;均场极限不得与本条合成一个平均分。
2009年,矩阵完成据理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵对接第250号第五条。跨过去,现实缺失并非随机迫使矩阵完成重新检验可见读数。矩阵完成以现实缺失并非随机施加反向压力。该接口若仍支持相反方向,现实缺失并非随机要求矩阵完成增加第三条件,同时容纳两边的失效样本。
戊、算法稳定性:泛化也可来自删掉一个样本时解变化很小Algorithmic Stability
问题的入口是2010年的COLT:Shalev-Shwartz、Shamir、Srebro、Sridharan不再允许机器学习理论在算法稳定性上继续把低维与独立同分布直觉直接外推。Shalev-Shwartz、Shamir、Srebro、Sridharan逐项核对样本数、维数、复杂度与风险里的算法稳定性;常数依赖、分布假设与有限样本区间由平坦极小值清算另行登记。在COLT的证据账上,由对正则化经验风险最小化给出稳定性与可学习性的联系起步,平坦极小值清算进入解释对照;本条残差不能靠改名消失。
算法稳定性的可反驳立场是:学习算法对单个训练样本扰动不敏感,可直接推出泛化。Shalev-Shwartz、Shamir、Srebro、Sridharan这一路线据此把决定性解释锁在一个对象上,平坦极小值清算的“参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因”不能替代本条;边界是深网在参数上不稳定却可能在预测上稳定。若让替代路径进入对照仍不能保持方向,平坦极小值清算便构成算法稳定性的近邻反例;COLT对算法稳定性仅支持原任务。
可核对的主证据是Shalev-Shwartz、Shamir、Srebro、Sridharan,2010 年《COLT》:5–19:对正则化经验风险最小化给出稳定性与可学习性的联系。稳定性检验每次只替换1个训练样本。平坦极小值清算要求把2010年的算法稳定性样本与对照结算,再核查平坦极小值清算的任务、观察窗和深网在参数上不稳定却可能在预测上稳定。对算法稳定性,平坦极小值清算仅作近邻;支点仍是Shalev-Shwartz、Shamir、Srebro、Sridharan在COLT的原始比较。
算法稳定性自己留下的反证入口是:深网在参数上不稳定却可能在预测上稳定,选错稳定对象会误判。让独立团队预注册时,Shalev-Shwartz、Shamir、Srebro、Sridharan的解释可能缩小、反号,或让位给平坦极小值清算的路径。平坦极小值清算给出复核COLT的近邻条件:将短期与长期拆账;算法稳定性负责记录中止、排除和不显著对象。
对正则化经验风险最小化给出稳定性与可学习性的联系改变登记顺序:样本数、维数、复杂度与风险归算法稳定性,常数依赖、分布假设与有限样本区间交平坦极小值清算核查。2017年的平坦极小值清算以“参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因”作近邻;两者若结论不同,应以深网在参数上不稳定却可能在预测上稳定为分账边界;平坦极小值清算不得与本条合成一个平均分。
2010年,算法稳定性据对正则化经验风险最小化给出稳定性与可学习性的联系对接第043号第一幕己。跨过去,深网在参数上不稳定却可能在预测上稳定迫使算法稳定性重新检验可见读数。算法稳定性以深网在参数上不稳定却可能在预测上稳定施加反向压力。该接口若仍支持相反方向,深网在参数上不稳定却可能在预测上稳定要求算法稳定性增加第三条件,同时容纳两边的失效样本。
己、非凸矩阵分解:交替最小化也能获得恢复保证Benign Nonconvexity
先看被改写的对象2013年的STOC:Jain、Netrapalli、Sanghavi不再允许机器学习理论在非凸矩阵分解上继续把低维与独立同分布直觉直接外推。Jain、Netrapalli、Sanghavi逐项核对样本数、维数、复杂度与风险里的非凸矩阵分解;常数依赖、分布假设与有限样本区间由Grokking理论另行登记。在STOC的证据账上,由算法用分样本迭代给出多项式时间与样本复杂度保证起步,Grokking理论进入解释对照;本条残差不能靠改名消失。
非凸矩阵分解的可反驳立场是:低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵。Jain、Netrapalli、Sanghavi这一路线据此把决定性解释锁在一个对象上,Grokking理论的“延迟泛化可由表示形成与正则化驱动的相变解释”不能替代本条;边界是这些结构条件很强。若把排除者放回分母仍不能保持方向,Grokking理论便构成非凸矩阵分解的近邻反例;STOC对非凸矩阵分解仅支持原任务。
可核对的主证据是Jain、Netrapalli、Sanghavi,2013 年《STOC》:665–674,DOI 10.1145/2488608.2488693:算法用分样本迭代给出多项式时间与样本复杂度保证,改变“非凸必绕开”直觉。良性非凸结果覆盖矩阵与张量2类问题。Grokking理论要求把2013年的非凸矩阵分解样本与对照结算,再核查Grokking理论的任务、观察窗和这些结构条件很强。对非凸矩阵分解,Grokking理论仅作近邻;支点仍是Jain、Netrapalli、Sanghavi在STOC的原始比较。
非凸矩阵分解自己留下的反证入口是:这些结构条件很强,不能直接覆盖任意深网损失景观。把不显著结果一并公开时,Jain、Netrapalli、Sanghavi的解释可能缩小、反号,或让位给Grokking理论的路径。Grokking理论给出复核STOC的近邻条件:把人工接管计入结果;非凸矩阵分解负责记录中止、排除和不显著对象。回到STOC的取样方式,非凸矩阵分解要用Grokking理论证明原分母没有删去最容易失败的对象。
算法用分样本迭代给出多项式时间与样本复杂度保证改变登记顺序:样本数、维数、复杂度与风险归非凸矩阵分解,常数依赖、分布假设与有限样本区间交Grokking理论核查。2022年的Grokking理论以“延迟泛化可由表示形成与正则化驱动的相变解释”作近邻;两者若结论不同,应以这些结构条件很强为分账边界;Grokking理论不得与本条合成一个平均分。
2013年,非凸矩阵分解据算法用分样本迭代给出多项式时间与样本复杂度保证对接第244号第十条。跨过去,这些结构条件很强迫使非凸矩阵分解重新检验可见读数。非凸矩阵分解以这些结构条件很强施加反向压力。该接口若仍支持相反方向,这些结构条件很强要求非凸矩阵分解增加第三条件,同时容纳两边的失效样本。
庚、随机梯度的统计视角:噪声不只是优化误差Stochastic Gradient as Statistical Procedure
争论应从2016年的ICML:Hardt、Recht、Singer不再允许机器学习理论在随机梯度的统计视角上继续把低维与独立同分布直觉直接外推。Hardt、Recht、Singer逐项核对样本数、维数、复杂度与风险里的随机梯度的统计视角;常数依赖、分布假设与有限样本区间由缩放律另行登记。在ICML的证据账上,由研究给出凸与部分非凸情形的稳定性界起步,缩放律进入解释对照;本条残差不能靠改名消失。
随机梯度的统计视角的可反驳立场是:SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化。Hardt、Recht、Singer这一路线据此把决定性解释锁在一个对象上,缩放律的“损失在有限区间随参数、数据和计算近似幂律下降”不能替代本条;边界是最坏界在实际深网常松。若固定资源预算后比较仍不能保持方向,缩放律便构成随机梯度的统计视角的近邻反例;ICML对随机梯度的统计视角仅支持原任务。
可核对的主证据是Hardt、Recht、Singer,2016 年《ICML》48:1225–1234:研究给出凸与部分非凸情形的稳定性界,把早停写成正则化。SGD界同时受步长、轮数和平滑性3个量控制。缩放律要求把2016年的随机梯度的统计视角样本与对照结算,再核查缩放律的任务、观察窗和最坏界在实际深网常松。对随机梯度的统计视角,缩放律仅作近邻;支点仍是Hardt、Recht、Singer在ICML的原始比较。
随机梯度的统计视角自己留下的反证入口是:最坏界在实际深网常松,批量顺序与动量又改变噪声形状。按个体轨迹而非均值检查时,Hardt、Recht、Singer的解释可能缩小、反号,或让位给缩放律的路径。缩放律给出复核ICML的近邻条件:审计数据近邻与泄漏;随机梯度的统计视角负责记录中止、排除和不显著对象。
研究给出凸与部分非凸情形的稳定性界改变登记顺序:样本数、维数、复杂度与风险归随机梯度的统计视角,常数依赖、分布假设与有限样本区间交缩放律核查。2020年的缩放律以“损失在有限区间随参数、数据和计算近似幂律下降”作近邻;两者若结论不同,应以最坏界在实际深网常松为分账边界;缩放律不得与本条合成一个平均分。
2016年,随机梯度的统计视角据研究给出凸与部分非凸情形的稳定性界对接第043号第二幕六。跨过去,最坏界在实际深网常松迫使随机梯度的统计视角重新检验可见读数。随机梯度的统计视角以最坏界在实际深网常松施加反向压力。该接口若仍支持相反方向,最坏界在实际深网常松要求随机梯度的统计视角增加第三条件,同时容纳两边的失效样本。
辛、自适应数据分析:反复查看测试集会耗尽统计有效性Adaptive Data Analysis
历史坐标落在2015年的STOC:Dwork、Feldman、Hardt 等不再允许机器学习理论在自适应数据分析上继续把低维与独立同分布直觉直接外推。Dwork、Feldman、Hardt 等逐项核对样本数、维数、复杂度与风险里的自适应数据分析;常数依赖、分布假设与有限样本区间由涌现争论另行登记。在STOC的证据账上,由差分隐私与稳定性提供控制自适应查询误差的理论工具起步,涌现争论进入解释对照;本条残差不能靠改名消失。
自适应数据分析的可反驳立场是:研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化。Dwork、Feldman、Hardt 等这一路线据此把决定性解释锁在一个对象上,涌现争论的“若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力”不能替代本条;边界是正式机制成本高。若用正交量纲重测仍不能保持方向,涌现争论便构成自适应数据分析的近邻反例;STOC对自适应数据分析仅支持原任务。
可核对的主证据是Dwork、Feldman、Hardt 等,2015 年《STOC》:117–126,DOI 10.1145/2746539.2746580:差分隐私与稳定性提供控制自适应查询误差的理论工具。自适应查询实验比较2种有效性保护机制。涌现争论要求把2015年的自适应数据分析样本与对照结算,再核查涌现争论的任务、观察窗和正式机制成本高。对自适应数据分析,涌现争论仅作近邻;支点仍是Dwork、Feldman、Hardt 等在STOC的原始比较。
自适应数据分析自己留下的反证入口是:正式机制成本高,现实排行榜的泄漏路径也不只来自数值查询。加入反事实条件时,Dwork、Feldman、Hardt 等的解释可能缩小、反号,或让位给涌现争论的路径。涌现争论给出复核STOC的近邻条件:先登记停止线再部署;自适应数据分析负责记录中止、排除和不显著对象。
差分隐私与稳定性提供控制自适应查询误差的理论工具改变登记顺序:样本数、维数、复杂度与风险归自适应数据分析,常数依赖、分布假设与有限样本区间交涌现争论核查。2024年的涌现争论以“若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力”作近邻;两者若结论不同,应以正式机制成本高为分账边界;涌现争论不得与本条合成一个平均分。
2015年,自适应数据分析据差分隐私与稳定性提供控制自适应查询误差的理论工具对接第257号第七条。跨过去,正式机制成本高迫使自适应数据分析重新检验可见读数。自适应数据分析以正式机制成本高施加反向压力。该接口若仍支持相反方向,正式机制成本高要求自适应数据分析增加第三条件,同时容纳两边的失效样本。
第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。
一、双下降:插值阈值把一条U形风险曲线折成两段Double Descent
第一处裂缝来自2019年的PNAS:Belkin、Hsu、Ma、Mandal不再允许机器学习理论在双下降上继续把低维与独立同分布直觉直接外推。Belkin、Hsu、Ma、Mandal逐项核对样本数、维数、复杂度与风险里的双下降;常数依赖、分布假设与有限样本区间由神经崩塌另行登记。在PNAS的证据账上,由线性模型、随机特征、树与神经网络都展示现代风险曲线起步,神经崩塌进入解释对照;本条残差不能靠改名消失。
双下降的可反驳立场是:模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降。Belkin、Hsu、Ma、Mandal这一路线据此把决定性解释锁在一个对象上,神经崩塌的“过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构”不能替代本条;边界是峰值位置依赖训练、噪声和容量度量。若撤去界面提示再验仍不能保持方向,神经崩塌便构成双下降的近邻反例;PNAS对双下降仅支持原任务。
可核对的主证据是Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116:线性模型、随机特征、树与神经网络都展示现代风险曲线。双下降把风险曲线分成2个下降区间。神经崩塌要求把2019年的双下降样本与对照结算,再核查神经崩塌的任务、观察窗和峰值位置依赖训练、噪声和容量度量。对双下降,神经崩塌仅作近邻;支点仍是Belkin、Hsu、Ma、Mandal在PNAS的原始比较。
双下降自己留下的反证入口是:峰值位置依赖训练、噪声和容量度量;规模增大不是无条件保险。用盲法重跑关键判断时,Belkin、Hsu、Ma、Mandal的解释可能缩小、反号,或让位给神经崩塌的路径。神经崩塌给出复核PNAS的近邻条件:换样本后再问;双下降负责记录中止、排除和不显著对象。回到PNAS的取样方式,双下降要用神经崩塌证明原分母没有删去最容易失败的对象。
线性模型、随机特征、树与神经网络都展示现代风险曲线改变登记顺序:样本数、维数、复杂度与风险归双下降,常数依赖、分布假设与有限样本区间交神经崩塌核查。2020年的神经崩塌以“过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构”作近邻;两者若结论不同,应以峰值位置依赖训练、噪声和容量度量为分账边界;神经崩塌不得与本条合成一个平均分。
2019年,双下降据线性模型、随机特征、树与神经网络都展示现代风险曲线对接第043号第二幕三。跨过去,峰值位置依赖训练、噪声和容量度量迫使双下降重新检验可见读数。双下降以峰值位置依赖训练、噪声和容量度量施加反向压力。该接口若仍支持相反方向,峰值位置依赖训练、噪声和容量度量要求双下降增加第三条件,同时容纳两边的失效样本。
二、良性过拟合:把训练噪声插值也能接近最优风险Benign Overfitting
研究单位改在2020年的PNAS:Bartlett、Long、Lugosi、Tsigler不再允许机器学习理论在良性过拟合上继续把低维与独立同分布直觉直接外推。Bartlett、Long、Lugosi、Tsigler逐项核对样本数、维数、复杂度与风险里的良性过拟合;常数依赖、分布假设与有限样本区间由上下文学习理论另行登记。在PNAS的证据账上,由理论给出良性、临界和灾难性过拟合的谱条件起步,上下文学习理论进入解释对照;本条残差不能靠改名消失。
良性过拟合的可反驳立场是:高维线性回归中,最小范数插值器可在特定协方差谱下泛化。Bartlett、Long、Lugosi、Tsigler这一路线据此把决定性解释锁在一个对象上,上下文学习理论的“Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法”不能替代本条;边界是条件依赖特征几何与噪声。若按亚组分别结算仍不能保持方向,上下文学习理论便构成良性过拟合的近邻反例;PNAS对良性过拟合仅支持原任务。
可核对的主证据是Bartlett、Long、Lugosi、Tsigler,2020 年《PNAS》117(48):30063–30070,DOI 10.1073/pnas.1907378117:理论给出良性、临界和灾难性过拟合的谱条件。谱条件区分良性、临界和灾难性3种过拟合区间。上下文学习理论要求把2020年的良性过拟合样本与对照结算,再核查上下文学习理论的任务、观察窗和条件依赖特征几何与噪声。对良性过拟合,上下文学习理论仅作近邻;支点仍是Bartlett、Long、Lugosi、Tsigler在PNAS的原始比较。
良性过拟合自己留下的反证入口是:条件依赖特征几何与噪声,现实表示是训练出来的而非固定输入。将短期与长期拆账时,Bartlett、Long、Lugosi、Tsigler的解释可能缩小、反号,或让位给上下文学习理论的路径。上下文学习理论给出复核PNAS的近邻条件:把时间窗拉长再看;良性过拟合负责记录中止、排除和不显著对象。
理论给出良性、临界和灾难性过拟合的谱条件改变登记顺序:样本数、维数、复杂度与风险归良性过拟合,常数依赖、分布假设与有限样本区间交上下文学习理论核查。2023年的上下文学习理论以“Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法”作近邻;两者若结论不同,应以条件依赖特征几何与噪声为分账边界;上下文学习理论不得与本条合成一个平均分。
2020年,良性过拟合据理论给出良性、临界和灾难性过拟合的谱条件对接第043号第二幕五。跨过去,条件依赖特征几何与噪声迫使良性过拟合重新检验可见读数。良性过拟合以条件依赖特征几何与噪声施加反向压力。该接口若仍支持相反方向,条件依赖特征几何与噪声要求良性过拟合增加第三条件,同时容纳两边的失效样本。
三、隐式偏置:优化器在无数零误差解中偏向特定方向Implicit Bias
回到原始设计2018年的JMLR:Soudry、Hoffer、Nacson、Gunasekar、Srebro不再允许机器学习理论在隐式偏置上继续把低维与独立同分布直觉直接外推。Soudry、Hoffer、Nacson、Gunasekar、Srebro逐项核对样本数、维数、复杂度与风险里的隐式偏置;常数依赖、分布假设与有限样本区间由保形预测另行登记。在JMLR的证据账上,由对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM起步,保形预测进入解释对照;本条残差不能靠改名消失。
隐式偏置的可反驳立场是:无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向。Soudry、Hoffer、Nacson、Gunasekar、Srebro这一路线据此把决定性解释锁在一个对象上,保形预测的“交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合”不能替代本条;边界是深网、动量与自适应优化器的偏置不同。若改变任务顺序后追踪仍不能保持方向,保形预测便构成隐式偏置的近邻反例;JMLR对隐式偏置仅支持原任务。
可核对的主证据是Soudry、Hoffer、Nacson、Gunasekar、Srebro,2018 年《JMLR》19(70):1–57:对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM。最大间隔方向在训练误差降到0之后才显现。保形预测要求把2018年的隐式偏置样本与对照结算,再核查保形预测的任务、观察窗和深网、动量与自适应优化器的偏置不同。对隐式偏置,保形预测仅作近邻;支点仍是Soudry、Hoffer、Nacson、Gunasekar、Srebro在JMLR的原始比较。
隐式偏置自己留下的反证入口是:深网、动量与自适应优化器的偏置不同,线性结论不能原样外推。把人工接管计入结果时,Soudry、Hoffer、Nacson、Gunasekar、Srebro的解释可能缩小、反号,或让位给保形预测的路径。保形预测给出复核JMLR的近邻条件:保留失败对象后检验;隐式偏置负责记录中止、排除和不显著对象。
对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM改变登记顺序:样本数、维数、复杂度与风险归隐式偏置,常数依赖、分布假设与有限样本区间交保形预测核查。2023年的保形预测以“交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合”作近邻;两者若结论不同,应以深网、动量与自适应优化器的偏置不同为分账边界;保形预测不得与本条合成一个平均分。
2018年,隐式偏置据对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM对接第257号第十七条。跨过去,深网、动量与自适应优化器的偏置不同迫使隐式偏置重新检验可见读数。隐式偏置以深网、动量与自适应优化器的偏置不同施加反向压力。该接口若仍支持相反方向,深网、动量与自适应优化器的偏置不同要求隐式偏置增加第三条件,同时容纳两边的失效样本。
四、神经切线核:无限宽网络在训练初期近似核回归Neural Tangent Kernel
这一路线先拆掉2018年的NeurIPS:Jacot、Gabriel、Hongler不再允许机器学习理论在神经切线核上继续把低维与独立同分布直觉直接外推。Jacot、Gabriel、Hongler逐项核对样本数、维数、复杂度与风险里的神经切线核;常数依赖、分布假设与有限样本区间由压缩感知另行登记。在NeurIPS的证据账上,由NTK给出收敛和泛化研究的新入口起步,压缩感知进入解释对照;本条残差不能靠改名消失。
神经切线核的可反驳立场是:无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析。Jacot、Gabriel、Hongler这一路线据此把决定性解释锁在一个对象上,压缩感知的“只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复”不能替代本条;边界是真实有限网络会学习特征。若让独立团队预注册仍不能保持方向,压缩感知便构成神经切线核的近邻反例;NeurIPS对神经切线核仅支持原任务。
可核对的主证据是Jacot、Gabriel、Hongler,2018 年《NeurIPS》31:8571–8580:NTK给出收敛和泛化研究的新入口,并连接深网与经典核方法。压缩感知要求把2018年的神经切线核样本与对照结算,再核查压缩感知的任务、观察窗和真实有限网络会学习特征。对神经切线核,压缩感知仅作近邻;支点仍是Jacot、Gabriel、Hongler在NeurIPS的原始比较。回到NeurIPS的取样方式,神经切线核要用压缩感知证明原分母没有删去最容易失败的对象。
神经切线核自己留下的反证入口是:真实有限网络会学习特征,固定核近似常漏掉最有价值的表示变化。审计数据近邻与泄漏时,Jacot、Gabriel、Hongler的解释可能缩小、反号,或让位给压缩感知的路径。压缩感知给出复核NeurIPS的近邻条件:改用地点外资料复核;神经切线核负责记录中止、排除和不显著对象。
NTK给出收敛和泛化研究的新入口改变登记顺序:样本数、维数、复杂度与风险归神经切线核,常数依赖、分布假设与有限样本区间交压缩感知核查。2006年的压缩感知以“只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复”作近邻;两者若结论不同,应以真实有限网络会学习特征为分账边界;压缩感知不得与本条合成一个平均分。
2018年,神经切线核据NTK给出收敛和泛化研究的新入口对接第043号第一幕甲。跨过去,真实有限网络会学习特征迫使神经切线核重新检验可见读数。神经切线核以真实有限网络会学习特征施加反向压力。该接口若仍支持相反方向,真实有限网络会学习特征要求神经切线核增加第三条件,同时容纳两边的失效样本。
五、均场极限:宽网络也可看作参数分布的动力系统Mean-Field Limits
需要先恢复2018年的NeurIPS:Chizat 与 Bach不再允许机器学习理论在均场极限上继续把低维与独立同分布直觉直接外推。Chizat 与 Bach逐项核对样本数、维数、复杂度与风险里的均场极限;常数依赖、分布假设与有限样本区间由PAC-Bayes复兴另行登记。在NeurIPS的证据账上,由框架允许研究特征学习而非完全冻结的核极限起步,PAC-Bayes复兴进入解释对照;本条残差不能靠改名消失。
均场极限的可反驳立场是:两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流。Chizat 与 Bach这一路线据此把决定性解释锁在一个对象上,PAC-Bayes复兴的“随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制”不能替代本条;边界是两层、无限宽与连续时间近似离生产模型仍远。若把不显著结果一并公开仍不能保持方向,PAC-Bayes复兴便构成均场极限的近邻反例;NeurIPS对均场极限仅支持原任务。
可核对的主证据是Chizat 与 Bach,2018 年《NeurIPS》31:3046–3056:框架允许研究特征学习而非完全冻结的核极限。PAC-Bayes复兴要求把2018年的均场极限样本与对照结算,再核查PAC-Bayes复兴的任务、观察窗和两层、无限宽与连续时间近似离生产模型仍远。对均场极限,PAC-Bayes复兴仅作近邻;支点仍是Chizat 与 Bach在NeurIPS的原始比较。回到NeurIPS的取样方式,均场极限要用PAC-Bayes复兴证明原分母没有删去最容易失败的对象。
均场极限自己留下的反证入口是:两层、无限宽与连续时间近似离生产模型仍远,边界条件决定结论。先登记停止线再部署时,Chizat 与 Bach的解释可能缩小、反号,或让位给PAC-Bayes复兴的路径。PAC-Bayes复兴给出复核NeurIPS的近邻条件:让替代路径进入对照;均场极限负责记录中止、排除和不显著对象。
框架允许研究特征学习而非完全冻结的核极限改变登记顺序:样本数、维数、复杂度与风险归均场极限,常数依赖、分布假设与有限样本区间交PAC-Bayes复兴核查。2009年的PAC-Bayes复兴以“随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制”作近邻;两者若结论不同,应以两层、无限宽与连续时间近似离生产模型仍远为分账边界;PAC-Bayes复兴不得与本条合成一个平均分。
2018年,均场极限据框架允许研究特征学习而非完全冻结的核极限对接第045号第二幕四。跨过去,两层、无限宽与连续时间近似离生产模型仍远迫使均场极限重新检验可见读数。均场极限以两层、无限宽与连续时间近似离生产模型仍远施加反向压力。该接口若仍支持相反方向,两层、无限宽与连续时间近似离生产模型仍远要求均场极限增加第三条件,同时容纳两边的失效样本。
六、平坦极小值清算:坐标重参数化会改变“平坦”读数Sharpness Reparameterization
证据链从2017年的ICML:Dinh、Pascanu、Bengio、Bengio不再允许机器学习理论在平坦极小值清算上继续把低维与独立同分布直觉直接外推。Dinh、Pascanu、Bengio、Bengio逐项核对样本数、维数、复杂度与风险里的平坦极小值清算;常数依赖、分布假设与有限样本区间由高维Lasso另行登记。在ICML的证据账上,由通过重参数化可在保持同一函数时任意改变Hessian型尖锐度起步,高维Lasso进入解释对照;本条残差不能靠改名消失。
平坦极小值清算的可反驳立场是:参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因。Dinh、Pascanu、Bengio、Bengio这一路线据此把决定性解释锁在一个对象上,高维Lasso的“受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界”不能替代本条;边界是尺度不变或功能空间指标仍可能有用。若按个体轨迹而非均值检查仍不能保持方向,高维Lasso便构成平坦极小值清算的近邻反例;ICML对平坦极小值清算仅支持原任务。
可核对的主证据是Dinh、Pascanu、Bengio、Bengio,2017 年《ICML》70:1019–1028:通过重参数化可在保持同一函数时任意改变Hessian型尖锐度。高维Lasso要求把2017年的平坦极小值清算样本与对照结算,再核查高维Lasso的任务、观察窗和尺度不变或功能空间指标仍可能有用。对平坦极小值清算,高维Lasso仅作近邻;支点仍是Dinh、Pascanu、Bengio、Bengio在ICML的原始比较。
平坦极小值清算自己留下的反证入口是:尺度不变或功能空间指标仍可能有用,但必须先说明度量。换样本后再问时,Dinh、Pascanu、Bengio、Bengio的解释可能缩小、反号,或让位给高维Lasso的路径。高维Lasso给出复核ICML的近邻条件:把排除者放回分母;平坦极小值清算负责记录中止、排除和不显著对象。
通过重参数化可在保持同一函数时任意改变Hessian型尖锐度改变登记顺序:样本数、维数、复杂度与风险归平坦极小值清算,常数依赖、分布假设与有限样本区间交高维Lasso核查。2009年的高维Lasso以“受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界”作近邻;两者若结论不同,应以尺度不变或功能空间指标仍可能有用为分账边界;高维Lasso不得与本条合成一个平均分。
2017年,平坦极小值清算据通过重参数化可在保持同一函数时任意改变Hessian型尖锐度对接第049号第二幕十。跨过去,尺度不变或功能空间指标仍可能有用迫使平坦极小值清算重新检验可见读数。平坦极小值清算以尺度不变或功能空间指标仍可能有用施加反向压力。该接口若仍支持相反方向,尺度不变或功能空间指标仍可能有用要求平坦极小值清算增加第三条件,同时容纳两边的失效样本。
七、Grokking理论:权重衰减推动从记忆解迁到结构解Theory of Grokking
决定性变化始于2022年的NeurIPS:Liu、Kitaev、Michaud、Tegmark不再允许机器学习理论在Grokking理论上继续把低维与独立同分布直觉直接外推。Liu、Kitaev、Michaud、Tegmark逐项核对样本数、维数、复杂度与风险里的Grokking理论;常数依赖、分布假设与有限样本区间由矩阵完成另行登记。在NeurIPS的证据账上,由合成算法任务中起步,矩阵完成进入解释对照;本条残差不能靠改名消失。
Grokking理论的可反驳立场是:延迟泛化可由表示形成与正则化驱动的相变解释。Liu、Kitaev、Michaud、Tegmark这一路线据此把决定性解释锁在一个对象上,矩阵完成的“随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目”不能替代本条;边界是多套机制可产生相似曲线。若加入反事实条件仍不能保持方向,矩阵完成便构成Grokking理论的近邻反例;NeurIPS对Grokking理论仅支持原任务。
可核对的主证据是Liu、Kitaev、Michaud、Tegmark,2022 年《NeurIPS》35:34665–34681:合成算法任务中,表示几何变化先于测试精度突升。矩阵完成要求把2022年的Grokking理论样本与对照结算,再核查矩阵完成的任务、观察窗和多套机制可产生相似曲线。对Grokking理论,矩阵完成仅作近邻;支点仍是Liu、Kitaev、Michaud、Tegmark在NeurIPS的原始比较。回到NeurIPS的取样方式,Grokking理论要用矩阵完成证明原分母没有删去最容易失败的对象。
Grokking理论自己留下的反证入口是:多套机制可产生相似曲线,真实数据是否存在清晰相变仍待检验。把时间窗拉长再看时,Liu、Kitaev、Michaud、Tegmark的解释可能缩小、反号,或让位给矩阵完成的路径。矩阵完成给出复核NeurIPS的近邻条件:固定资源预算后比较;Grokking理论负责记录中止、排除和不显著对象。拿矩阵完成作近邻检验,可辨认Liu、Kitaev、Michaud、Tegmark观察到的是独有路径,还是另一条路线的表面同义词。
合成算法任务中改变登记顺序:样本数、维数、复杂度与风险归Grokking理论,常数依赖、分布假设与有限样本区间交矩阵完成核查。2009年的矩阵完成以“随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目”作近邻;两者若结论不同,应以多套机制可产生相似曲线为分账边界;矩阵完成不得与本条合成一个平均分。
2022年,Grokking理论据合成算法任务中对接第043号第二幕六。跨过去,多套机制可产生相似曲线迫使Grokking理论重新检验可见读数。Grokking理论以多套机制可产生相似曲线施加反向压力。该接口若仍支持相反方向,多套机制可产生相似曲线要求Grokking理论增加第三条件,同时容纳两边的失效样本。第043号第二幕六“Grokking:记住训练集之后还可能突然学会规则”提供不同尺度的反例;它迫使Grokking理论把“适用”写成可检查的对象范围。
八、缩放律:经验幂律成为预算预测而非机制解释Empirical Scaling Laws
最早被迫重写的是2020年的Scaling Laws for Neural Language Models:Kaplan 等不再允许机器学习理论在缩放律上继续把低维与独立同分布直觉直接外推。Kaplan 等逐项核对样本数、维数、复杂度与风险里的缩放律;常数依赖、分布假设与有限样本区间由算法稳定性另行登记。在Scaling Laws for Neural Language Models的证据账上,由跨规模实验使训练前预算选择从经验猜测变成可拟合曲线起步,算法稳定性进入解释对照;本条残差不能靠改名消失。
缩放律的可反驳立场是:损失在有限区间随参数、数据和计算近似幂律下降。Kaplan 等这一路线据此把决定性解释锁在一个对象上,算法稳定性的“学习算法对单个训练样本扰动不敏感,可直接推出泛化”不能替代本条;边界是幂律外推不说明能力从何产生。若用盲法重跑关键判断仍不能保持方向,算法稳定性便构成缩放律的近邻反例;Scaling Laws for Neural Language Models对缩放律仅支持原任务。
可核对的主证据是Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》:跨规模实验使训练前预算选择从经验猜测变成可拟合曲线。算法稳定性要求把2020年的缩放律样本与对照结算,再核查算法稳定性的任务、观察窗和幂律外推不说明能力从何产生。对缩放律,算法稳定性仅作近邻;支点仍是Kaplan 等在Scaling Laws for Neural Language Models的原始比较。回到Scaling Laws for Neural Language Models的取样方式,缩放律要用算法稳定性证明原分母没有删去最容易失败的对象。
缩放律自己留下的反证入口是:幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全。保留失败对象后检验时,Kaplan 等的解释可能缩小、反号,或让位给算法稳定性的路径。算法稳定性给出复核Scaling Laws for Neural Language Models的近邻条件:用正交量纲重测;缩放律负责记录中止、排除和不显著对象。
跨规模实验使训练前预算选择从经验猜测变成可拟合曲线改变登记顺序:样本数、维数、复杂度与风险归缩放律,常数依赖、分布假设与有限样本区间交算法稳定性核查。2010年的算法稳定性以“学习算法对单个训练样本扰动不敏感,可直接推出泛化”作近邻;两者若结论不同,应以幂律外推不说明能力从何产生为分账边界;算法稳定性不得与本条合成一个平均分。
2020年,缩放律据跨规模实验使训练前预算选择从经验猜测变成可拟合曲线对接第044号第二幕五。跨过去,幂律外推不说明能力从何产生迫使缩放律重新检验可见读数。缩放律以幂律外推不说明能力从何产生施加反向压力。该接口若仍支持相反方向,幂律外推不说明能力从何产生要求缩放律增加第三条件,同时容纳两边的失效样本。
九、涌现争论:离散指标可把平滑变化画成突然跳跃Emergence Under Measurement
这一条先处理2024年的NeurIPS:Schaeffer、Miranda、Koyejo不再允许机器学习理论在涌现争论上继续把低维与独立同分布直觉直接外推。Schaeffer、Miranda、Koyejo逐项核对样本数、维数、复杂度与风险里的涌现争论;常数依赖、分布假设与有限样本区间由非凸矩阵分解另行登记。在NeurIPS的证据账上,由把指标改为连续误差后起步,非凸矩阵分解进入解释对照;本条残差不能靠改名消失。
涌现争论的可反驳立场是:若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力。Schaeffer、Miranda、Koyejo这一路线据此把决定性解释锁在一个对象上,非凸矩阵分解的“低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵”不能替代本条;边界是有些策略切换仍可能真实离散。若将短期与长期拆账仍不能保持方向,非凸矩阵分解便构成涌现争论的近邻反例;NeurIPS对涌现争论仅支持原任务。
可核对的主证据是Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”:把指标改为连续误差后,多项所谓涌现能力转为可预测曲线。非凸矩阵分解要求把2024年的涌现争论样本与对照结算,再核查非凸矩阵分解的任务、观察窗和有些策略切换仍可能真实离散。对涌现争论,非凸矩阵分解仅作近邻;支点仍是Schaeffer、Miranda、Koyejo在NeurIPS的原始比较。回到NeurIPS的取样方式,涌现争论要用非凸矩阵分解证明原分母没有删去最容易失败的对象。
涌现争论自己留下的反证入口是:有些策略切换仍可能真实离散;测量解释不能先验否定全部相变。改用地点外资料复核时,Schaeffer、Miranda、Koyejo的解释可能缩小、反号,或让位给非凸矩阵分解的路径。非凸矩阵分解给出复核NeurIPS的近邻条件:撤去界面提示再验;涌现争论负责记录中止、排除和不显著对象。
把指标改为连续误差后改变登记顺序:样本数、维数、复杂度与风险归涌现争论,常数依赖、分布假设与有限样本区间交非凸矩阵分解核查。2013年的非凸矩阵分解以“低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵”作近邻;两者若结论不同,应以有些策略切换仍可能真实离散为分账边界;非凸矩阵分解不得与本条合成一个平均分。
2024年,涌现争论据把指标改为连续误差后对接第256号第三条。跨过去,有些策略切换仍可能真实离散迫使涌现争论重新检验可见读数。涌现争论以有些策略切换仍可能真实离散施加反向压力。该接口若仍支持相反方向,有些策略切换仍可能真实离散要求涌现争论增加第三条件,同时容纳两边的失效样本。
十、神经崩塌:训练末期类内表示收缩并形成对称几何Neural Collapse
原论文正面碰到2020年的PNAS:Papyan、Han、Donoho不再允许机器学习理论在神经崩塌上继续把低维与独立同分布直觉直接外推。Papyan、Han、Donoho逐项核对样本数、维数、复杂度与风险里的神经崩塌;常数依赖、分布假设与有限样本区间由随机梯度的统计视角另行登记。在PNAS的证据账上,由跨多种网络与数据观察到四类收敛现象起步,随机梯度的统计视角进入解释对照;本条残差不能靠改名消失。
神经崩塌的可反驳立场是:过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构。Papyan、Han、Donoho这一路线据此把决定性解释锁在一个对象上,随机梯度的统计视角的“SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化”不能替代本条;边界是现象依赖平衡分类与继续训练。若把人工接管计入结果仍不能保持方向,随机梯度的统计视角便构成神经崩塌的近邻反例;PNAS对神经崩塌仅支持原任务。
可核对的主证据是Papyan、Han、Donoho,2020 年《PNAS》117(40):24652–24663,DOI 10.1073/pnas.2015509117:跨多种网络与数据观察到四类收敛现象,为末期表示提供可量对象。随机梯度的统计视角要求把2020年的神经崩塌样本与对照结算,再核查随机梯度的统计视角的任务、观察窗和现象依赖平衡分类与继续训练。对神经崩塌,随机梯度的统计视角仅作近邻;支点仍是Papyan、Han、Donoho在PNAS的原始比较。
神经崩塌自己留下的反证入口是:现象依赖平衡分类与继续训练,开放类、长尾和自监督下不必成立。让替代路径进入对照时,Papyan、Han、Donoho的解释可能缩小、反号,或让位给随机梯度的统计视角的路径。随机梯度的统计视角给出复核PNAS的近邻条件:按亚组分别结算;神经崩塌负责记录中止、排除和不显著对象。
跨多种网络与数据观察到四类收敛现象改变登记顺序:样本数、维数、复杂度与风险归神经崩塌,常数依赖、分布假设与有限样本区间交随机梯度的统计视角核查。2016年的随机梯度的统计视角以“SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化”作近邻;两者若结论不同,应以现象依赖平衡分类与继续训练为分账边界;随机梯度的统计视角不得与本条合成一个平均分。
2020年,神经崩塌据跨多种网络与数据观察到四类收敛现象对接第049号第二幕三。跨过去,现象依赖平衡分类与继续训练迫使神经崩塌重新检验可见读数。神经崩塌以现象依赖平衡分类与继续训练施加反向压力。该接口若仍支持相反方向,现象依赖平衡分类与继续训练要求神经崩塌增加第三条件,同时容纳两边的失效样本。
十一、上下文学习理论:提示示例可诱导隐式算法Theory of In-Context Learning
方法转向发生在2023年的ICLR:Akyürek 等不再允许机器学习理论在上下文学习理论上继续把低维与独立同分布直觉直接外推。Akyürek 等逐项核对样本数、维数、复杂度与风险里的上下文学习理论;常数依赖、分布假设与有限样本区间由自适应数据分析另行登记。在ICLR的证据账上,由合成线性任务中起步,自适应数据分析进入解释对照;本条残差不能靠改名消失。
上下文学习理论的可反驳立场是:Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法。Akyürek 等这一路线据此把决定性解释锁在一个对象上,自适应数据分析的“研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化”不能替代本条;边界是构造任务与真实语言提示差距大。若审计数据近邻与泄漏仍不能保持方向,自适应数据分析便构成上下文学习理论的近邻反例;ICLR对上下文学习理论仅支持原任务。
可核对的主证据是Akyürek 等,2023 年《ICLR》论文“What Learning Algorithm Is In-Context Learning?”:合成线性任务中,隐藏状态与已知优化步骤出现可测对应。自适应数据分析要求把2023年的上下文学习理论样本与对照结算,再核查自适应数据分析的任务、观察窗和构造任务与真实语言提示差距大。对上下文学习理论,自适应数据分析仅作近邻;支点仍是Akyürek 等在ICLR的原始比较。
上下文学习理论自己留下的反证入口是:构造任务与真实语言提示差距大,行为等价不证明内部逐步执行同一算法。把排除者放回分母时,Akyürek 等的解释可能缩小、反号,或让位给自适应数据分析的路径。自适应数据分析给出复核ICLR的近邻条件:改变任务顺序后追踪;上下文学习理论负责记录中止、排除和不显著对象。
合成线性任务中改变登记顺序:样本数、维数、复杂度与风险归上下文学习理论,常数依赖、分布假设与有限样本区间交自适应数据分析核查。2015年的自适应数据分析以“研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化”作近邻;两者若结论不同,应以构造任务与真实语言提示差距大为分账边界;自适应数据分析不得与本条合成一个平均分。
2023年,上下文学习理论据合成线性任务中对接第256号第二条。跨过去,构造任务与真实语言提示差距大迫使上下文学习理论重新检验可见读数。上下文学习理论以构造任务与真实语言提示差距大施加反向压力。该接口若仍支持相反方向,构造任务与真实语言提示差距大要求上下文学习理论增加第三条件,同时容纳两边的失效样本。
十二、保形预测:有限样本覆盖率不要求模型正确Conformal Prediction
这项工作首先校正2023年的Foundations and Trends in Machine Learning:Angelopoulos 与 Bates不再允许机器学习理论在保形预测上继续把低维与独立同分布直觉直接外推。Angelopoulos 与 Bates逐项核对样本数、维数、复杂度与风险里的保形预测;常数依赖、分布假设与有限样本区间由双下降另行登记。在Foundations and Trends in Machine Learning的证据账上,由方法适配分类、回归和黑箱模型起步,双下降进入解释对照;本条残差不能靠改名消失。
保形预测的可反驳立场是:交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合。Angelopoulos 与 Bates这一路线据此把决定性解释锁在一个对象上,双下降的“模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降”不能替代本条;边界是边际覆盖会掩盖亚群失配。若先登记停止线再部署仍不能保持方向,双下降便构成保形预测的近邻反例;Foundations and Trends in Machine Learning对保形预测仅支持原任务。
可核对的主证据是Angelopoulos 与 Bates,2023 年《Foundations and Trends in Machine Learning》16(4):494–591,DOI 10.1561/2200000101:方法适配分类、回归和黑箱模型,把不确定性输出变成可检查频率。双下降要求把2023年的保形预测样本与对照结算,再核查双下降的任务、观察窗和边际覆盖会掩盖亚群失配。对保形预测,双下降仅作近邻;支点仍是Angelopoulos 与 Bates在Foundations and Trends in Machine Learning的原始比较。回到Foundations and Trends in Machine Learning的取样方式,保形预测要用双下降证明原分母没有删去最容易失败的对象。
保形预测自己留下的反证入口是:边际覆盖会掩盖亚群失配,分布漂移和自适应选择会破坏交换性。固定资源预算后比较时,Angelopoulos 与 Bates的解释可能缩小、反号,或让位给双下降的路径。双下降给出复核Foundations and Trends in Machine Learning的近邻条件:让独立团队预注册;保形预测负责记录中止、排除和不显著对象。拿双下降作近邻检验,可辨认Angelopoulos 与 Bates观察到的是独有路径,还是另一条路线的表面同义词。
方法适配分类、回归和黑箱模型改变登记顺序:样本数、维数、复杂度与风险归保形预测,常数依赖、分布假设与有限样本区间交双下降核查。2019年的双下降以“模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降”作近邻;两者若结论不同,应以边际覆盖会掩盖亚群失配为分账边界;双下降不得与本条合成一个平均分。
2023年,保形预测据方法适配分类、回归和黑箱模型对接第257号第六条。跨过去,边际覆盖会掩盖亚群失配迫使保形预测重新检验可见读数。保形预测以边际覆盖会掩盖亚群失配施加反向压力。该接口若仍支持相反方向,边际覆盖会掩盖亚群失配要求保形预测增加第三条件,同时容纳两边的失效样本。
◎ 二十年连起来看
第一幕不是旧成果清单,而是机器学习理论第一次为自己建立可失败的比较尺。压缩感知收紧了旧默认,矩阵完成把隐含过程拆成可估参数,自适应数据分析又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。
第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。双下降扩展了表示或分布,Grokking理论改变了研究单位,保形预测则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。
二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。高维Lasso说明干预能改变路径,神经切线核说明单一读数会混合层级,神经崩塌又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。
◎ 三个常见误解
误解一:PAC-Bayes复兴已经给出了稳定的通用解释。它容易取信,是因为随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制确实改变了旧的研究方式。但先验若在看标签后挑选会破坏保证,数值界也常远大于实际误差,所以正确表述只能限于原设计可识别的那一段责任链。
误解二:隐式偏置等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向仍只是一个可检验命题。深网、动量与自适应优化器的偏置不同,线性结论不能原样外推说明,没有干预、替代解释和边界样本,可读不等于因果正确。
误解三:上下文学习理论的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把构造任务与真实语言提示差距大,行为等价不证明内部逐步执行同一算法藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。
◎ 与相邻领域的接口
压缩感知与第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”的分工在于:本页负责只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。
随机梯度的统计视角可与第043号第二幕六“Grokking:记住训练集之后还可能突然学会规则”交换制度或工程中的回写证据。前者的核心命题是SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化,但最坏界在实际深网常松,批量顺序与动量又改变噪声形状;后者则能检验同一接口是否把选择成本转移给了另一个主体。
缩放律与第044号第二幕五“缩放律修订:模型与数据要按计算预算共同增长”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。
◎ 争议现场
算法稳定性的争议是深网在参数上不稳定却可能在预测上稳定,选错稳定对象会误判。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。
神经切线核的争议是真实有限网络会学习特征,固定核近似常漏掉最有价值的表示变化。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。
神经崩塌的争议是现象依赖平衡分类与继续训练,开放类、长尾和自监督下不必成立。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。
◎ 往下五年看什么
到2031年,看双下降的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。
看均场极限在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。
看涌现争论的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。
看保形预测的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。
◎ 可与哪些领域对撞
压缩感知与第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”共享“可见读数能代表真实对象”的预设。本条用真实信号仅近似稀疏,矩阵条件难检验;漂亮保证不自动覆盖采集偏差给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。
自适应数据分析与第257号第七条“选择后推断承认‘看过数据’会改变零分布”共享“局部表现能够结算整体能力”的预设。自适应数据分析主张研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。
缩放律与第044号第二幕五“缩放律修订:模型与数据要按计算预算共同增长”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。
◎ 十条可做的研究命题
- 在时间外数据上重做压缩感知;方向保持率低于二分之一即证伪其稳定性。
- 把PAC-Bayes复兴的中止与排除对象放回分母;主效应反号即否定原总结。
- 为高维Lasso配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
- 由独立团队预注册矩阵完成的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
- 对算法稳定性的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
- 主动改变非凸矩阵分解的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
- 对隐式偏置做反事实干预;可视化不随关键参数变化即证伪忠实性。
- 把Grokking理论交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
- 公开上下文学习理论的最强失败实现;下一方法只在原基准改善即判定为换题。
- 为保形预测事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。
◎ 资料核验
- Candès、Romberg、Tao,2006 年《IEEE Transactions on Information Theory》52(2):489–509,DOI 10.1109/TIT.2005.862083。
- Germain、Lacasse、Laviolette、Marchand,2009 年《AISTATS》5:105–112。
- Bickel、Ritov、Tsybakov,2009 年《Annals of Statistics》37(4):1705–1732,DOI 10.1214/08-AOS620。
- Candès 与 Recht,2009 年《Foundations of Computational Mathematics》9:717–772,DOI 10.1007/s10208-009-9045-5。
- Shalev-Shwartz、Shamir、Srebro、Sridharan,2010 年《COLT》:5–19。
- Jain、Netrapalli、Sanghavi,2013 年《STOC》:665–674,DOI 10.1145/2488608.2488693。
- Hardt、Recht、Singer,2016 年《ICML》48:1225–1234。
- Dwork、Feldman、Hardt 等,2015 年《STOC》:117–126,DOI 10.1145/2746539.2746580。
- Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116。
- Bartlett、Long、Lugosi、Tsigler,2020 年《PNAS》117(48):30063–30070,DOI 10.1073/pnas.1907378117。
- Soudry、Hoffer、Nacson、Gunasekar、Srebro,2018 年《JMLR》19(70):1–57。
- Jacot、Gabriel、Hongler,2018 年《NeurIPS》31:8571–8580。
- Chizat 与 Bach,2018 年《NeurIPS》31:3046–3056。
- Dinh、Pascanu、Bengio、Bengio,2017 年《ICML》70:1019–1028。
- Liu、Kitaev、Michaud、Tegmark,2022 年《NeurIPS》35:34665–34681。
- Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》。
- Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”。
- Papyan、Han、Donoho,2020 年《PNAS》117(40):24652–24663,DOI 10.1073/pnas.2015509117。
- Akyürek 等,2023 年《ICLR》论文“What Learning Algorithm Is In-Context Learning?”。
- Angelopoulos 与 Bates,2023 年《Foundations and Trends in Machine Learning》16(4):494–591,DOI 10.1561/2200000101。
- Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”。
- Bachmann 等,2024 年 arXiv:2404.08712《The Pitfalls of Next-Token Prediction》。
- Mallinar 等,2024 年《ICML》论文“Benign, Tempered, or Catastrophic Overfitting”。
- Aerni 等,2024 年《JMLR》25:1–68“Generalization Bounds for Neural Networks”。
以下二十条是机器学习理论在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。
经一、随机逼近:不必知道函数,也能一步步逼近它的根Classic 01 · Learning Theory
这条结果给出的是一个反直觉的许可:不需要精确的函数值,甚至不需要知道函数长什么样,只要每次观测在期望意义上指对方向,按合适的速度衰减步长,就能收敛。整个随机梯度下降的合法性来自这里,而不是来自任何关于神经网络的分析。
两条步长条件写得很硬:和发散保证走得够远,平方和收敛保证噪声被平均掉。今天的实践大量违反它——固定学习率、周期重启、大批量。这些做法有效,但它们的有效性不是这条定理给的,而是经验的。噪声在原框架里是需要被压掉的干扰,而现代视角把它当作起正则作用的一部分,这是一次身份翻转。
经二、多重比较:看得越多,「显著」就越不值钱Classic 02 · Learning Theory
这条道理简单到几乎是算术:每次检验有百分之五的假阳性率,做二十次就几乎必有一次。困难在于「做了几次」这件事本身常常说不清——中途换过模型、删过异常点、试过别的变量,这些都算检验,而它们通常不进论文,也不进任何可被审计的记录。
留出集把同一问题带到了机器学习。整个共同体在同一批测试数据上反复调参,每一次调整都消耗一点统计有效性,而没有人在记账。自适应数据分析这一支的贡献,是把「消耗了多少」变成可以量化并给出预算的东西——这正是六十年前那条校正在群体尺度上的版本。
经三、随机图的相变:某个密度之上,整块结构忽然连起来了Classic 03 · Learning Theory
它给出的图像很强:连通性、巨型分支、子图出现,都不是随密度平滑增长,而是在一个阈值附近骤然发生。这条结果把「突变」从修辞变成了可以证明的数学事实,也给了后来一切「涌现」讨论一个严格的参照原型。
严格之处也是它的限制。相变是渐近的——在有限规模下,那条陡峭的曲线其实是光滑的,而画得多陡取决于横轴怎么取、指标怎么定。今天关于大模型能力是否「涌现」的争论,核心恰恰在此:把连续的对数似然改成离散的正确率,一条平滑上升的曲线就会显示成一次跳跃。判断跳跃真伪必须先固定指标。
经四、正则化:解不稳定的时候,往目标里加一条偏好Classic 04 · Learning Theory
它处理的是一类根本困难:观测不足以确定解,微小噪声导致解剧烈变化。加惩罚等于承认「光靠数据定不下来」,并把补足的那部分明写成对解的偏好。这一步之后,「先验」从哲学问题变成了目标函数里的一项。
惩罚形式带来的差别远大于当初的预期。二范数惩罚把系数压小但都不为零,一范数惩罚则会把一批系数精确压到零,从而同时完成选择与估计。同一个框架,换一种范数就换了一类可解问题。这提示:正则项不是「稳定化的技术手段」,它规定了解的形态,因而必须像模型假设那样被声明与检验。
经五、核技巧:不必真的把数据搬到高维去Classic 05 · Learning Theory
这一步的漂亮在于它把「表示能力」与「计算代价」解耦了:特征空间可以是无穷维,而计算量只取决于样本数。加上表示定理保证最优解落在训练点张成的子空间里,整个非线性学习问题就变回了有限维的凸问题。
代价随样本数增长。核矩阵是样本数的平方,求解常是立方,几万个样本就吃不下。深度学习兴起后,这条路线一度被视为过去式;而无限宽网络在训练初期等价于一个特定核的结果,又把它接了回来——不是作为方法,是作为分析工具。旧工具的第二次生命常常是换了身份——从「用来算」变成「用来解释别的东西为什么算得动」。
经六、通用归纳:最好的预测器可以被定义,但算不出来Classic 06 · Learning Theory
这条结果给出了一个理论上的天花板:存在一个不需要针对任务调整的预测器,它对所有可计算规律都最终学得好。它同时把「简单」定义清楚了——最短程序长度,而不是人类觉得简洁。奥卡姆剃刀第一次有了形式版本。
它不可计算,因而永远只能被近似。这个「可定义而不可达」的位置极有用:它给了一把尺子,让人能问「某个可计算方法离理想差在哪」。压缩率作为学习效果的代理、最短描述作为模型选择准则,都是这条思路的可计算投影,而每一次投影都要付出一次代价——限定假设类、限定编码方案、限定可搜索的程序集合,通用性就在这些地方一点点漏掉。
经七、奇异值分解的数值算法:低秩逼近第一次真的能算Classic 07 · Learning Theory
最优低秩逼近这条结论早就有,真正改变局面的是能稳定算出来。这项算法让主成分分析、潜在语义分析、推荐系统的早期方法都成为工程上可行的事。「先降到低秩,再在低秩上做事」这条路线的地基就在这里,且它的稳定性有严格的扰动界撑着。
它有一个硬前提:矩阵是完整的。一旦有缺失,最优低秩逼近变成非凸问题,经典算法无从下手。矩阵完成的贡献是证明了在合适的采样与相干性条件下,用核范数这个凸代理可以精确恢复——问题没有变简单,是换了一个可解的等价形式,代价是多出了一组必须检查的条件,而这些条件在真实数据上是否成立,通常无法直接验证。
经八、k 均值:交替最小化,简单到几乎不像个算法Classic 08 · Learning Theory
它是交替最小化这一整类方法的原型:一个联合优化难解,但固定一半之后另一半有闭式解,于是来回迭代。这个模式此后出现在矩阵分解、期望最大化、生成对抗训练里,形式各异而骨架相同。它的普及程度说明「可分块」这一结构比凸性更常见也更好用。
单调下降不等于收敛到好解——它只保证不变坏。初值决定结果,而不同初值的结果可以差很远。这个缺陷五十年里没有被算法本身修正,是被初始化策略绕开的。这提示一条通用经验:当算法保证只是单调性时,真正决定结果的往往是初始化,而初始化常被当作实现细节写在附录里。
经九、采样密度的必要条件:Nyquist 那条线不是唯一的线Classic 09 · Learning Theory
这条结果把采样定理推到了一般情形:不必是低通信号,任何已知频谱支撑的信号都有一个密度下界,且这个界是紧的——低于它必然失稳。它把「要采多少点」从工程经验变成了由信号结构决定的量。
压缩感知没有推翻它,是换了结构假设。带限说的是频谱集中在一块已知区域,稀疏说的是能量集中在少数未知位置。后一种假设更弱也更贴近真实信号,而恢复保证的代价从「密度」变成了「测量矩阵的性质加非线性重建」。这一条示范了一件事:一个界的紧性总是相对于它的前提而言的,换前提就换界。
经十、一致收敛与 VC 维:多复杂的模型才算太复杂Classic 10 · Learning Theory
这条定理奠定了统计学习理论:泛化不再靠直觉,而由假设类的一个组合量控制,且对任何分布成立。它把「模型太复杂会过拟合」从经验说法变成了可以算出上界的命题,也给出了「样本量该多大」的第一个原则性答案。
分布无关这条优点在深度学习上变成了缺点。深网的 VC 维极大,界给出的泛化误差上界远超一,因而不提供任何信息;而实际泛化很好。理论没有错——它是上界,上界松不构成反例。但它也确实不再有解释力,于是必须换成依赖数据与算法的分析。一条正确而空洞的界,比错误的界更难被察觉。
经十一、模式分类的教科书化:一门手艺被写成一套可教的框架Classic 11 · Learning Theory
这本书做的是给一门散乱的手艺立骨架:先讲最优决策该是什么,再讲各种方法是对它的哪一种近似。这个次序让学习者能判断一个新方法在框架里的位置,而不是记住一堆技巧。此后几十年的课程与术语基本沿用它,连「特征提取—分类器设计」这个分工也是它定下的。
断层出现在维度上。书里的直觉建立在低维特征空间——类条件密度、决策边界、距离度量都是可画出来的。高维表示里这些直觉大量失效:距离趋于同质、密度估计不可行,而分类反而更容易。神经崩塌那类现象——类内塌成一点、类间构成对称结构——在低维图像里根本想不出来。
经十二、交叉验证:用同一批数据既训练又评估,怎样才不作弊Classic 12 · Learning Theory
它解决的是一个循环困境:想估计模型对新数据的表现,而新数据没有。留出一部分假装它是新的,反复轮换取平均,就得到一个近乎无偏的估计。这个想法极其通用,几乎不依赖模型形式,也不需要任何分布假设,因而横扫了整个应用领域。
误用同样普遍,且都出在「留出的那部分是否真的独立」上。用全部数据先做特征筛选再交叉验证,特征筛选已经看过验证集;时间序列上随机划分,未来的信息漏进了过去;同一病人的多张影像分到两侧,模型只需认人不必认病。这三种错误各自能把估计的准确率抬高十几个百分点,而流程看上去完全规范,代码也跑得通。
经十三、结构风险最小化:在拟合与复杂度之间明写一条取舍曲线Classic 13 · Learning Theory
它把模型选择从「试哪个准」变成了一个有目标函数的问题:把置信项与经验项加起来最小化。这一步的方法论意义很大——它承认了「在训练集上更准」本身不是选择依据,必须付出复杂度的价钱,而价钱可以被算出来。
现代实践与它形状相似而口径不同。缩放律给的不是复杂度惩罚,而是「在给定算力下模型与数据该按什么比例增长」的经验关系;它预测的是损失值而不是泛化间隙,且完全不带机制解释。两者都在做取舍,但一个由理论界推出,一个由拟合实测曲线得来——当预算成为主约束时,可预测性比可解释性先被需要。
经十四、最小描述长度:把模型和数据一起压缩,谁压得短选谁Classic 14 · Learning Theory
这条准则把奥卡姆剃刀变成了可计算的东西,而且不需要引入先验概率的语言:学习就是压缩,压得越短说明抓到的规律越多。它把模型选择、正则化与信息论接到了一起,也给了「过拟合」一个直观解释——记住噪声不会让总长度变短。
它自带一处必须声明的相对性:描述长度依赖于编码方案,换一套编码,谁更短就可能翻转。这不是缺陷,是它的性质——不存在与语言无关的简单性。平坦极小值那场争论是同一件事的重演:一个解看起来平坦还是尖锐,取决于参数怎么标定,而重参数化可以随意改变这个读数。凡是依赖描述方式的量,报数时必须连描述方式一起报。
经十五、可能近似正确:把「学会了」写成一个可以验收的规格Classic 15 · Learning Theory
这条定义的贡献是把学习变成了可验收的工程规格:说清楚要多准、要多大把握、允许用多少样本与多少时间。此前「机器能不能学会」是个含糊的问题,此后它有了明确的成立与不成立,可以证明也可以证否。
它的严格设定同时是它的局限:对分布不作任何假设、按最坏情形计价,于是很多现实中容易的问题在框架里不可学。PAC-Bayes 的修正是把先验放回来——不再要求对所有分布一致好,而是承认我们对哪些假设更可信,从而给出更紧也更贴合实际的界。这是一次典型的松绑:放弃普遍性,换回信息量。
经十六、奥卡姆定理:压得下来,就学得会Classic 16 · Learning Theory
这条定理把「简单」与「泛化」之间的直觉连接做成了证明:压缩即学习,而且给出了压缩比与泛化误差的定量关系。它是「先压缩再预测」这一整套思路在统计学习理论中的正式依据,也长期被当作正则化的理论辩护。
反例出在另一头。插值学习的模型参数量远超样本数,完全没有压缩,却能达到接近最优的风险;提升方法在训练误差归零后继续训练,测试误差还在下降。这些不推翻定理——定理是充分条件不是必要条件。但它们表明「不简单就不会泛化」这条常被当成推论的说法从来不成立,而它曾经指导过大量模型选择实践。
经十七、存储容量的统计力学计算:物理学家算出了感知机能记多少Classic 17 · Learning Theory
这项工作的方法论意义大于结论:它把学习问题当成一个有大量自由度的物理系统,问的不是最坏情形而是典型情形。典型情形分析给出的是精确的数值与相变位置,而不是宽松的上界——同一个问题,换一套数学工具,答案的形态完全不同。
它被主流忽视了二十多年,原因之一是副本方法当时缺乏严格性,另一原因是学科语言不通。这条经典因此还有一层用处:它记录了一次因方法论传统不同而造成的长期错过。今天的均场分析、无限宽极限、随机矩阵理论,用的都是这条线上的工具,而其中不少结论在二三十年前就以另一种记号存在过。
经十八、最大间隔与支持向量机:在无数条分界线里挑一条最宽的Classic 18 · Learning Theory
它给出的是一个明确的选择原则:数据可分时解有无穷多,凭什么挑?答案是挑间隔最大的,而这一选择有泛化界支撑,且优化问题是凸的、有唯一解。原则清楚、计算可靠、理论有保证,三者齐备在机器学习里并不常见。
深度网络把这个问题重新提了一遍,答案却变了形式。网络参数远多于样本,零训练误差的解有无穷多,而梯度下降总是收敛到其中某一类。这个偏向不是写在目标函数里的,是优化算法与初始化共同带来的。同一个「挑哪一条」的问题,一次由显式目标回答,一次由隐式动力学回答——后者难得多,因为它不在你写下的东西里。
经十九、提升方法的间隔解释:训练误差归零之后,为什么还在变好Classic 19 · Learning Theory
这是统计学习理论史上最重要的一次经验挑战:按当时的复杂度理论,训练误差为零之后继续增加轮数只会过拟合,而实测相反。间隔解释给出的答案是——训练误差看不见的东西,间隔分布看得见:模型在把每个样本推得离边界更远。
这条解释后来并未获得一致接受,替代说法陆续出现。但它开辟的问法沿用至今:当一个指标已经饱和,就必须换一个更细的量来看模型还在改变什么。Grokking 是这条问法在深度学习上最戏剧化的形态——训练误差归零之后再训练几个数量级的步数,泛化才突然出现。指标饱和不等于学习停止。
经二十、保形预测:不假设模型正确,也能给出有效的区间Classic 20 · Learning Theory
这条结果的位置很特别:它不要求模型对,只要求数据可交换。任何模型——好的坏的、可解释的黑箱的——都能被包装成一个带覆盖保证的预测集。不确定性量化因此第一次与模型质量脱钩,这在实践上极有价值。
要看清它给的是什么:边际覆盖,即在全体上平均达标;不是条件覆盖,即对每个子群都达标。两者差别在高风险场合极大——整体百分之九十的覆盖率完全可以由某些子群百分之百、另一些子群百分之六十拼出来。可交换性也是一条真前提:时间序列、分布漂移、非随机采样,任何一条不成立,保证就随之消失。
◎ 这一层怎么用
先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。
三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(Fisher 的判别分析、Shannon 一九四九年的采样定理、Wald 的统计决策论)只在提出栏与流变栏里被点名其历史位置。其二,经典身份不提供豁免——本层有四条今天已被明确收窄:VC 界在深度网络上正确而空洞、奥卡姆定理的充分条件被长期误用为必要条件、最小描述长度依赖编码方案因而不是绝对量、结构风险最小化的嵌套假设类设定与按算力预算共同扩张的现代做法不吻合。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。
本层四条路的落点:机制路(随机逼近、正则化、核技巧、k 均值、奇异值分解)问「靠什么算得出来」;测量路(VC 维、交叉验证、最小描述长度、奥卡姆定理、保形预测)问「凭什么说它会泛化」;制度路(结构风险最小化、可能近似正确、模式分类教科书、采样密度、随机图相变)问「按什么共同规格验收」;人的路(多重比较、通用归纳、统计力学容量、最大间隔、提升方法的间隔解释)问「一个标准由谁定、代价由谁承担」。⚠ 这门学科反复出现的母题是一个读数随描述方式而变,却常被当作对象的性质来报——最小描述长度依赖编码、平坦依赖参数化、涌现依赖指标是否阈值化、简单性依赖语言。凡遇到这一族,报数时必须连口径一起报。
◎ 经典层资料核验
- Robbins, H. and Monro, S. A stochastic approximation method. Annals of Mathematical Statistics 22 (1951): 400–407。
- Kushner, H. J. and Yin, G. G. Stochastic Approximation and Recursive Algorithms and Applications. New York: Springer, 2003(专著)。
- Tukey, J. W. The Problem of Multiple Comparisons. Princeton University, 1953(专著)。
- Scheffé, H. A method for judging all contrasts in the analysis of variance. Biometrika 40 (1953): 87–104。
- Erdős, P. and Rényi, A. On the evolution of random graphs. Publications of the Mathematical Institute of the Hungarian Academy of Sciences 5 (1960): 17–61。
- Bollobás, B. Random Graphs. London: Academic Press, 1985(专著)。
- Tikhonov, A. N. Solution of incorrectly formulated problems and the regularization method. Soviet Mathematics Doklady 151 (1963): 501–504。
- Tikhonov, A. N. and Arsenin, V. Y. Solutions of Ill-Posed Problems. Washington: Winston, 1977(专著)。
- Aizerman, M. A., Braverman, E. M. and Rozonoer, L. I. Theoretical foundations of the potential function method. Automation and Remote Control 25 (1964): 821–837。
- Kimeldorf, G. and Wahba, G. Some results on Tchebycheffian spline functions. Journal of Mathematical Analysis and Applications 33 (1971): 82–95。
- Schölkopf, B. and Smola, A. J. Learning with Kernels. Cambridge, MA: MIT Press, 2002(专著)。
- Solomonoff, R. J. A formal theory of inductive inference, Parts I and II. Information and Control 7 (1964): 1–22, 224–254。
- Li, M. and Vitányi, P. An Introduction to Kolmogorov Complexity and Its Applications. New York: Springer, 1997(专著)。
- Golub, G. and Kahan, W. Calculating the singular values and pseudo-inverse of a matrix. SIAM Journal on Numerical Analysis 2 (1965): 205–224。
- Golub, G. H. and Van Loan, C. F. Matrix Computations. Baltimore: Johns Hopkins University Press, 1983(专著)。
- MacQueen, J. Some methods for classification and analysis of multivariate observations. Proceedings of the Fifth Berkeley Symposium 1 (1967): 281–297。
- Lloyd, S. P. Least squares quantization in PCM. IEEE Transactions on Information Theory 28 (1982): 129–137。
- Landau, H. J. Necessary density conditions for sampling and interpolation of certain entire functions. Acta Mathematica 117 (1967): 37–52。
- Vapnik, V. N. and Chervonenkis, A. Y. On the uniform convergence of relative frequencies of events to their probabilities. Theory of Probability and Its Applications 16 (1971): 264–280。
- Vapnik, V. N. Estimation of Dependences Based on Empirical Data. New York: Springer, 1982(专著)。
- Vapnik, V. N. Statistical Learning Theory. New York: Wiley, 1998(专著)。
- Duda, R. O. and Hart, P. E. Pattern Classification and Scene Analysis. New York: Wiley, 1973(专著)。
- Stone, M. Cross-validatory choice and assessment of statistical predictions. Journal of the Royal Statistical Society B 36 (1974): 111–133。
- Geisser, S. The predictive sample reuse method with applications. Journal of the American Statistical Association 70 (1975): 320–328。
- Rissanen, J. Modeling by shortest data description. Automatica 14 (1978): 465–471。
- Grünwald, P. D. The Minimum Description Length Principle. Cambridge, MA: MIT Press, 2007(专著)。
- Valiant, L. G. A theory of the learnable. Communications of the ACM 27 (1984): 1134–1142。
- Kearns, M. J. and Vazirani, U. V. An Introduction to Computational Learning Theory. Cambridge, MA: MIT Press, 1994(专著)。
- Blumer, A., Ehrenfeucht, A., Haussler, D. and Warmuth, M. K. Occam’s razor. Information Processing Letters 24 (1987): 377–380。
- Gardner, E. The space of interactions in neural network models. Journal of Physics A 21 (1988): 257–270。
- Engel, A. and Van den Broeck, C. Statistical Mechanics of Learning. Cambridge: Cambridge University Press, 2001(专著)。
- Boser, B. E., Guyon, I. M. and Vapnik, V. N. A training algorithm for optimal margin classifiers. Proceedings of COLT (1992): 144–152。
- Cortes, C. and Vapnik, V. Support-vector networks. Machine Learning 20 (1995): 273–297。
- Schapire, R. E., Freund, Y., Bartlett, P. and Lee, W. S. Boosting the margin. Annals of Statistics 26 (1998): 1651–1686。
- Schapire, R. E. and Freund, Y. Boosting: Foundations and Algorithms. Cambridge, MA: MIT Press, 2012(专著)。
- Vovk, V., Gammerman, A. and Shafer, G. Algorithmic Learning in a Random World. New York: Springer, 2005(专著)。
- Bousquet, O. and Elisseeff, A. Stability and generalization. Journal of Machine Learning Research 2 (2002): 499–526。