SDE Universes·新思想前沿计算与人工智能
新思想前沿 · 计算与人工智能

机器学习理论

近二十年与经典层 · 两幕 20 个新思想 + 20 个经典思想 · 约 36,681 字 · 王德生 亲撰 · 2026 年 8 月

学习理论的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。

【第一幕】上一个十年 · 约 2006–2016

第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。

甲、压缩感知:稀疏性让欠定问题获得精确恢复保证Compressed Sensing

提出Candès、Romberg、Tao,2006 年《IEEE Transactions on Information Theory》52(2):489–509,DOI 10.1109/TIT.2005.862083。 争议(未见反对;边界:真实信号仅近似稀疏,矩阵条件难检验;漂亮保证不自动覆盖采集偏差。) 最新(2024—2026年未见直接更新。)。 关键只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复。

起点要放回2006年的IEEE Transactions on Information Theory:Candès、Romberg、Tao不再允许机器学习理论在压缩感知上继续把低维与独立同分布直觉直接外推。Candès、Romberg、Tao逐项核对样本数、维数、复杂度与风险里的压缩感知;常数依赖、分布假设与有限样本区间由良性过拟合另行登记。在IEEE Transactions on Information Theory的证据账上,由理论给出高概率采样数与误差界起步,良性过拟合进入解释对照;本条残差不能靠改名消失。

压缩感知的可反驳立场是:只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复。Candès、Romberg、Tao这一路线据此把决定性解释锁在一个对象上,良性过拟合的“高维线性回归中,最小范数插值器可在特定协方差谱下泛化”不能替代本条;边界是真实信号仅近似稀疏。若换样本后再问仍不能保持方向,良性过拟合便构成压缩感知的近邻反例;IEEE Transactions on Information Theory对压缩感知仅支持原任务。

可核对的主证据是Candès、Romberg、Tao,2006 年《IEEE Transactions on Information Theory》52(2):489–509,DOI 10.1109/TIT.2005.862083:理论给出高概率采样数与误差界,并迅速进入成像和信号处理。恢复保证可让观测数降到原维度约10%的量级。良性过拟合要求把2006年的压缩感知样本与对照结算,再核查良性过拟合的任务、观察窗和真实信号仅近似稀疏。对压缩感知,良性过拟合仅作近邻;支点仍是Candès、Romberg、Tao在IEEE Transactions on Information Theory的原始比较。

压缩感知自己留下的反证入口是:真实信号仅近似稀疏,矩阵条件难检验;漂亮保证不自动覆盖采集偏差。用正交量纲重测时,Candès、Romberg、Tao的解释可能缩小、反号,或让位给良性过拟合的路径。良性过拟合给出复核IEEE Transactions on Information Theory的近邻条件:把不显著结果一并公开;压缩感知负责记录中止、排除和不显著对象。回到IEEE Transactions on Information Theory的取样方式,压缩感知要用良性过拟合证明原分母没有删去最容易失败的对象。

理论给出高概率采样数与误差界改变登记顺序:样本数、维数、复杂度与风险归压缩感知,常数依赖、分布假设与有限样本区间交良性过拟合核查。2020年的良性过拟合以“高维线性回归中,最小范数插值器可在特定协方差谱下泛化”作近邻;两者若结论不同,应以真实信号仅近似稀疏为分账边界;良性过拟合不得与本条合成一个平均分。

2006年,压缩感知据理论给出高概率采样数与误差界对接第257号第一条。跨过去,真实信号仅近似稀疏迫使压缩感知重新检验可见读数。压缩感知以真实信号仅近似稀疏施加反向压力。该接口若仍支持相反方向,真实信号仅近似稀疏要求压缩感知增加第三条件,同时容纳两边的失效样本。拿良性过拟合作近邻检验,可辨认Candès、Romberg、Tao观察到的是独有路径,还是另一条路线的表面同义词。

位置E——它把压缩感知的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有压缩感知是决定因素 预设〔02 单一读数代表复杂对象〕一个汇总分足以替代多层过程 量纲独立分布上满足压缩感知所述保证的样本数/全部检验样本数 失效当真实信号仅近似稀疏,主指标越高,边界外保持率反而越低 自曝原始纳入标准首先暴露:真实信号仅近似稀疏 空栏压缩感知中与“真实信号仅近似稀疏”有关却未入分母的失败对象 异名另见第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”

乙、PAC-Bayes复兴:先验、后验与经验误差共同给出泛化界PAC-Bayesian Bounds

提出Germain、Lacasse、Laviolette、Marchand,2009 年《AISTATS》5:105–112。 争议(未见反对;边界:先验若在看标签后挑选会破坏保证,数值界也常远大于实际误差。) 最新(2024—2026年未见直接更新。)。 关键随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制。

真正的断点出现在2009年的AISTATS:Germain、Lacasse、Laviolette、Marchand不再允许机器学习理论在PAC-Bayes复兴上继续把低维与独立同分布直觉直接外推。Germain、Lacasse、Laviolette、Marchand逐项核对样本数、维数、复杂度与风险里的PAC-Bayes复兴;常数依赖、分布假设与有限样本区间由隐式偏置另行登记。在AISTATS的证据账上,由转导式PAC-Bayes界把无标签测试输入纳入分析起步,隐式偏置进入解释对照;本条残差不能靠改名消失。

PAC-Bayes复兴的可反驳立场是:随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制。Germain、Lacasse、Laviolette、Marchand这一路线据此把决定性解释锁在一个对象上,隐式偏置的“无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向”不能替代本条;边界是先验若在看标签后挑选会破坏保证。若把时间窗拉长再看仍不能保持方向,隐式偏置便构成PAC-Bayes复兴的近邻反例;AISTATS对PAC-Bayes复兴仅支持原任务。

可核对的主证据是Germain、Lacasse、Laviolette、Marchand,2009 年《AISTATS》5:105–112:转导式PAC-Bayes界把无标签测试输入纳入分析,并为数据依赖后验提供保证。PAC-Bayes界同时结算1项经验风险与1项KL复杂度。隐式偏置要求把2009年的PAC-Bayes复兴样本与对照结算,再核查隐式偏置的任务、观察窗和先验若在看标签后挑选会破坏保证。对PAC-Bayes复兴,隐式偏置仅作近邻;支点仍是Germain、Lacasse、Laviolette、Marchand在AISTATS的原始比较。

PAC-Bayes复兴自己留下的反证入口是:先验若在看标签后挑选会破坏保证,数值界也常远大于实际误差。撤去界面提示再验时,Germain、Lacasse、Laviolette、Marchand的解释可能缩小、反号,或让位给隐式偏置的路径。隐式偏置给出复核AISTATS的近邻条件:按个体轨迹而非均值检查;PAC-Bayes复兴负责记录中止、排除和不显著对象。回到AISTATS的取样方式,PAC-Bayes复兴要用隐式偏置证明原分母没有删去最容易失败的对象。

转导式PAC-Bayes界把无标签测试输入纳入分析改变登记顺序:样本数、维数、复杂度与风险归PAC-Bayes复兴,常数依赖、分布假设与有限样本区间交隐式偏置核查。2018年的隐式偏置以“无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向”作近邻;两者若结论不同,应以先验若在看标签后挑选会破坏保证为分账边界;隐式偏置不得与本条合成一个平均分。

2009年,PAC-Bayes复兴据转导式PAC-Bayes界把无标签测试输入纳入分析对接第257号第十五条。跨过去,先验若在看标签后挑选会破坏保证迫使PAC-Bayes复兴重新检验可见读数。PAC-Bayes复兴以先验若在看标签后挑选会破坏保证施加反向压力。该接口若仍支持相反方向,先验若在看标签后挑选会破坏保证要求PAC-Bayes复兴增加第三条件,同时容纳两边的失效样本。

位置S——它把PAC-Bayes复兴所定义的结构、表示或可判结果当成单独够用的那一样 单因只有PAC-Bayes复兴是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲独立分布上满足PAC-Bayes复兴所述保证的样本数/全部检验样本数 失效当先验若在看标签后挑选会破坏保证,主指标越高,边界外保持率反而越低 自曝主要终点自己留下:先验若在看标签后挑选会破坏保证 空栏PAC-Bayes复兴中与“先验若在看标签后挑选会破坏保证”有关却未入分母的失败对象 异名另见第257号第十五条“贝叶斯工作流把后验计算从终点改为循环诊断”

丙、高维Lasso:变量多于样本时仍可做稀疏选择High-Dimensional Sparsity

提出Bickel、Ritov、Tsybakov,2009 年《Annals of Statistics》37(4):1705–1732,DOI 10.1214/08-AOS620。 争议(未见反对;边界:高度相关变量会让选择不稳,预测正确也不代表找回真实因果变量。) 最新(2024—2026年未见直接更新。)。 关键受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界。

旧账最先在2009年的Annals of Statistics:Bickel、Ritov、Tsybakov不再允许机器学习理论在高维Lasso上继续把低维与独立同分布直觉直接外推。Bickel、Ritov、Tsybakov逐项核对样本数、维数、复杂度与风险里的高维Lasso;常数依赖、分布假设与有限样本区间由神经切线核另行登记。在Annals of Statistics的证据账上,由预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出起步,神经切线核进入解释对照;本条残差不能靠改名消失。

高维Lasso的可反驳立场是:受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界。Bickel、Ritov、Tsybakov这一路线据此把决定性解释锁在一个对象上,神经切线核的“无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析”不能替代本条;边界是高度相关变量会让选择不稳。若保留失败对象后检验仍不能保持方向,神经切线核便构成高维Lasso的近邻反例;Annals of Statistics对高维Lasso仅支持原任务。

可核对的主证据是Bickel、Ritov、Tsybakov,2009 年《Annals of Statistics》37(4):1705–1732,DOI 10.1214/08-AOS620:预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出。Lasso误差界由稀疏度、样本数和维度3个量控制。神经切线核要求把2009年的高维Lasso样本与对照结算,再核查神经切线核的任务、观察窗和高度相关变量会让选择不稳。对高维Lasso,神经切线核仅作近邻;支点仍是Bickel、Ritov、Tsybakov在Annals of Statistics的原始比较。

高维Lasso自己留下的反证入口是:高度相关变量会让选择不稳,预测正确也不代表找回真实因果变量。按亚组分别结算时,Bickel、Ritov、Tsybakov的解释可能缩小、反号,或让位给神经切线核的路径。神经切线核给出复核Annals of Statistics的近邻条件:加入反事实条件;高维Lasso负责记录中止、排除和不显著对象。回到Annals of Statistics的取样方式,高维Lasso要用神经切线核证明原分母没有删去最容易失败的对象。

预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出改变登记顺序:样本数、维数、复杂度与风险归高维Lasso,常数依赖、分布假设与有限样本区间交神经切线核核查。2018年的神经切线核以“无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析”作近邻;两者若结论不同,应以高度相关变量会让选择不稳为分账边界;神经切线核不得与本条合成一个平均分。

2009年,高维Lasso据预言不等式把误差随稀疏度、维数对数和样本数的变化明确写出对接第257号第一条。跨过去,高度相关变量会让选择不稳迫使高维Lasso重新检验可见读数。高维Lasso以高度相关变量会让选择不稳施加反向压力。该接口若仍支持相反方向,高度相关变量会让选择不稳要求高维Lasso增加第三条件,同时容纳两边的失效样本。

位置D——它把高维Lasso的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有高维Lasso是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲独立分布上满足高维Lasso所述保证的样本数/全部检验样本数 失效当高度相关变量会让选择不稳,主指标越高,边界外保持率反而越低 自曝配平资源后突出:高度相关变量会让选择不稳 空栏高维Lasso中与“高度相关变量会让选择不稳”有关却未入分母的失败对象 异名另见第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”

丁、矩阵完成:低秩结构把缺失表格变成可恢复对象Matrix Completion

提出Candès 与 Recht,2009 年《Foundations of Computational Mathematics》9:717–772,DOI 10.1007/s10208-009-9045-5。 争议(未见反对;边界:现实缺失并非随机,热门选择与社会结构会破坏采样假设。) 最新(2024—2026年未见直接更新。)。 关键随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目。

转折并非始于2009年的Foundations of Computational Mathematics:Candès 与 Recht不再允许机器学习理论在矩阵完成上继续把低维与独立同分布直觉直接外推。Candès 与 Recht逐项核对样本数、维数、复杂度与风险里的矩阵完成;常数依赖、分布假设与有限样本区间由均场极限另行登记。在Foundations of Computational Mathematics的证据账上,由理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵起步,均场极限进入解释对照;本条残差不能靠改名消失。

矩阵完成的可反驳立场是:随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目。Candès 与 Recht这一路线据此把决定性解释锁在一个对象上,均场极限的“两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流”不能替代本条;边界是现实缺失并非随机。若改用地点外资料复核仍不能保持方向,均场极限便构成矩阵完成的近邻反例;Foundations of Computational Mathematics对矩阵完成仅支持原任务。

可核对的主证据是Candès 与 Recht,2009 年《Foundations of Computational Mathematics》9:717–772,DOI 10.1007/s10208-009-9045-5:理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵。均场极限要求把2009年的矩阵完成样本与对照结算,再核查均场极限的任务、观察窗和现实缺失并非随机。对矩阵完成,均场极限仅作近邻;支点仍是Candès 与 Recht在Foundations of Computational Mathematics的原始比较。回到Foundations of Computational Mathematics的取样方式,矩阵完成要用均场极限证明原分母没有删去最容易失败的对象。

矩阵完成自己留下的反证入口是:现实缺失并非随机,热门选择与社会结构会破坏采样假设。改变任务顺序后追踪时,Candès 与 Recht的解释可能缩小、反号,或让位给均场极限的路径。均场极限给出复核Foundations of Computational Mathematics的近邻条件:用盲法重跑关键判断;矩阵完成负责记录中止、排除和不显著对象。

理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵改变登记顺序:样本数、维数、复杂度与风险归矩阵完成,常数依赖、分布假设与有限样本区间交均场极限核查。2018年的均场极限以“两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流”作近邻;两者若结论不同,应以现实缺失并非随机为分账边界;均场极限不得与本条合成一个平均分。

2009年,矩阵完成据理论解释协同过滤为何可能用少量评分推断巨大用户物品矩阵对接第250号第五条。跨过去,现实缺失并非随机迫使矩阵完成重新检验可见读数。矩阵完成以现实缺失并非随机施加反向压力。该接口若仍支持相反方向,现实缺失并非随机要求矩阵完成增加第三条件,同时容纳两边的失效样本。

位置E——它把矩阵完成的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有矩阵完成是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲独立分布上满足矩阵完成所述保证的样本数/全部检验样本数 失效当现实缺失并非随机,主指标越高,边界外保持率反而越低 自曝作者在方法附录承认:现实缺失并非随机 空栏矩阵完成中与“现实缺失并非随机”有关却未入分母的失败对象 异名另见第250号第五条“向量检索”

戊、算法稳定性:泛化也可来自删掉一个样本时解变化很小Algorithmic Stability

提出Shalev-Shwartz、Shamir、Srebro、Sridharan,2010 年《COLT》:5–19。 争议(未见反对;边界:深网在参数上不稳定却可能在预测上稳定,选错稳定对象会误判。) 最新(2024—2026年未见直接更新。)。 关键学习算法对单个训练样本扰动不敏感,可直接推出泛化。

问题的入口是2010年的COLT:Shalev-Shwartz、Shamir、Srebro、Sridharan不再允许机器学习理论在算法稳定性上继续把低维与独立同分布直觉直接外推。Shalev-Shwartz、Shamir、Srebro、Sridharan逐项核对样本数、维数、复杂度与风险里的算法稳定性;常数依赖、分布假设与有限样本区间由平坦极小值清算另行登记。在COLT的证据账上,由对正则化经验风险最小化给出稳定性与可学习性的联系起步,平坦极小值清算进入解释对照;本条残差不能靠改名消失。

算法稳定性的可反驳立场是:学习算法对单个训练样本扰动不敏感,可直接推出泛化。Shalev-Shwartz、Shamir、Srebro、Sridharan这一路线据此把决定性解释锁在一个对象上,平坦极小值清算的“参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因”不能替代本条;边界是深网在参数上不稳定却可能在预测上稳定。若让替代路径进入对照仍不能保持方向,平坦极小值清算便构成算法稳定性的近邻反例;COLT对算法稳定性仅支持原任务。

可核对的主证据是Shalev-Shwartz、Shamir、Srebro、Sridharan,2010 年《COLT》:5–19:对正则化经验风险最小化给出稳定性与可学习性的联系。稳定性检验每次只替换1个训练样本。平坦极小值清算要求把2010年的算法稳定性样本与对照结算,再核查平坦极小值清算的任务、观察窗和深网在参数上不稳定却可能在预测上稳定。对算法稳定性,平坦极小值清算仅作近邻;支点仍是Shalev-Shwartz、Shamir、Srebro、Sridharan在COLT的原始比较。

算法稳定性自己留下的反证入口是:深网在参数上不稳定却可能在预测上稳定,选错稳定对象会误判。让独立团队预注册时,Shalev-Shwartz、Shamir、Srebro、Sridharan的解释可能缩小、反号,或让位给平坦极小值清算的路径。平坦极小值清算给出复核COLT的近邻条件:将短期与长期拆账;算法稳定性负责记录中止、排除和不显著对象。

对正则化经验风险最小化给出稳定性与可学习性的联系改变登记顺序:样本数、维数、复杂度与风险归算法稳定性,常数依赖、分布假设与有限样本区间交平坦极小值清算核查。2017年的平坦极小值清算以“参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因”作近邻;两者若结论不同,应以深网在参数上不稳定却可能在预测上稳定为分账边界;平坦极小值清算不得与本条合成一个平均分。

2010年,算法稳定性据对正则化经验风险最小化给出稳定性与可学习性的联系对接第043号第一幕己。跨过去,深网在参数上不稳定却可能在预测上稳定迫使算法稳定性重新检验可见读数。算法稳定性以深网在参数上不稳定却可能在预测上稳定施加反向压力。该接口若仍支持相反方向,深网在参数上不稳定却可能在预测上稳定要求算法稳定性增加第三条件,同时容纳两边的失效样本。

位置S——它把算法稳定性所定义的结构、表示或可判结果当成单独够用的那一样 单因只有算法稳定性是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲独立分布上满足算法稳定性所述保证的样本数/全部检验样本数 失效当深网在参数上不稳定却可能在预测上稳定,主指标越高,边界外保持率反而越低 自曝换到独立样本时暴露:深网在参数上不稳定却可能在预测上稳定 空栏算法稳定性中与“深网在参数上不稳定却可能在预测上稳定”有关却未入分母的失败对象 异名另见第043号第一幕己“批归一化:训练分布被纳入网络内部控制”

己、非凸矩阵分解:交替最小化也能获得恢复保证Benign Nonconvexity

提出Jain、Netrapalli、Sanghavi,2013 年《STOC》:665–674,DOI 10.1145/2488608.2488693。 争议(未见反对;边界:这些结构条件很强,不能直接覆盖任意深网损失景观。) 最新(2024—2026年未见直接更新。)。 关键低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵。

先看被改写的对象2013年的STOC:Jain、Netrapalli、Sanghavi不再允许机器学习理论在非凸矩阵分解上继续把低维与独立同分布直觉直接外推。Jain、Netrapalli、Sanghavi逐项核对样本数、维数、复杂度与风险里的非凸矩阵分解;常数依赖、分布假设与有限样本区间由Grokking理论另行登记。在STOC的证据账上,由算法用分样本迭代给出多项式时间与样本复杂度保证起步,Grokking理论进入解释对照;本条残差不能靠改名消失。

非凸矩阵分解的可反驳立场是:低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵。Jain、Netrapalli、Sanghavi这一路线据此把决定性解释锁在一个对象上,Grokking理论的“延迟泛化可由表示形成与正则化驱动的相变解释”不能替代本条;边界是这些结构条件很强。若把排除者放回分母仍不能保持方向,Grokking理论便构成非凸矩阵分解的近邻反例;STOC对非凸矩阵分解仅支持原任务。

可核对的主证据是Jain、Netrapalli、Sanghavi,2013 年《STOC》:665–674,DOI 10.1145/2488608.2488693:算法用分样本迭代给出多项式时间与样本复杂度保证,改变“非凸必绕开”直觉。良性非凸结果覆盖矩阵与张量2类问题。Grokking理论要求把2013年的非凸矩阵分解样本与对照结算,再核查Grokking理论的任务、观察窗和这些结构条件很强。对非凸矩阵分解,Grokking理论仅作近邻;支点仍是Jain、Netrapalli、Sanghavi在STOC的原始比较。

非凸矩阵分解自己留下的反证入口是:这些结构条件很强,不能直接覆盖任意深网损失景观。把不显著结果一并公开时,Jain、Netrapalli、Sanghavi的解释可能缩小、反号,或让位给Grokking理论的路径。Grokking理论给出复核STOC的近邻条件:把人工接管计入结果;非凸矩阵分解负责记录中止、排除和不显著对象。回到STOC的取样方式,非凸矩阵分解要用Grokking理论证明原分母没有删去最容易失败的对象。

算法用分样本迭代给出多项式时间与样本复杂度保证改变登记顺序:样本数、维数、复杂度与风险归非凸矩阵分解,常数依赖、分布假设与有限样本区间交Grokking理论核查。2022年的Grokking理论以“延迟泛化可由表示形成与正则化驱动的相变解释”作近邻;两者若结论不同,应以这些结构条件很强为分账边界;Grokking理论不得与本条合成一个平均分。

2013年,非凸矩阵分解据算法用分样本迭代给出多项式时间与样本复杂度保证对接第244号第十条。跨过去,这些结构条件很强迫使非凸矩阵分解重新检验可见读数。非凸矩阵分解以这些结构条件很强施加反向压力。该接口若仍支持相反方向,这些结构条件很强要求非凸矩阵分解增加第三条件,同时容纳两边的失效样本。

位置D——它把非凸矩阵分解的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有非凸矩阵分解是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲独立分布上满足非凸矩阵分解所述保证的样本数/全部检验样本数 失效当这些结构条件很强,主指标越高,边界外保持率反而越低 自曝消融或假对照提醒:这些结构条件很强 空栏非凸矩阵分解中与“这些结构条件很强”有关却未入分母的失败对象 异名另见第244号第十条“样本外证书的数据驱动优化”

庚、随机梯度的统计视角:噪声不只是优化误差Stochastic Gradient as Statistical Procedure

提出Hardt、Recht、Singer,2016 年《ICML》48:1225–1234。 争议(未见反对;边界:最坏界在实际深网常松,批量顺序与动量又改变噪声形状。) 最新(2024—2026年未见直接更新。)。 关键SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化。

争论应从2016年的ICML:Hardt、Recht、Singer不再允许机器学习理论在随机梯度的统计视角上继续把低维与独立同分布直觉直接外推。Hardt、Recht、Singer逐项核对样本数、维数、复杂度与风险里的随机梯度的统计视角;常数依赖、分布假设与有限样本区间由缩放律另行登记。在ICML的证据账上,由研究给出凸与部分非凸情形的稳定性界起步,缩放律进入解释对照;本条残差不能靠改名消失。

随机梯度的统计视角的可反驳立场是:SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化。Hardt、Recht、Singer这一路线据此把决定性解释锁在一个对象上,缩放律的“损失在有限区间随参数、数据和计算近似幂律下降”不能替代本条;边界是最坏界在实际深网常松。若固定资源预算后比较仍不能保持方向,缩放律便构成随机梯度的统计视角的近邻反例;ICML对随机梯度的统计视角仅支持原任务。

可核对的主证据是Hardt、Recht、Singer,2016 年《ICML》48:1225–1234:研究给出凸与部分非凸情形的稳定性界,把早停写成正则化。SGD界同时受步长、轮数和平滑性3个量控制。缩放律要求把2016年的随机梯度的统计视角样本与对照结算,再核查缩放律的任务、观察窗和最坏界在实际深网常松。对随机梯度的统计视角,缩放律仅作近邻;支点仍是Hardt、Recht、Singer在ICML的原始比较。

随机梯度的统计视角自己留下的反证入口是:最坏界在实际深网常松,批量顺序与动量又改变噪声形状。按个体轨迹而非均值检查时,Hardt、Recht、Singer的解释可能缩小、反号,或让位给缩放律的路径。缩放律给出复核ICML的近邻条件:审计数据近邻与泄漏;随机梯度的统计视角负责记录中止、排除和不显著对象。

研究给出凸与部分非凸情形的稳定性界改变登记顺序:样本数、维数、复杂度与风险归随机梯度的统计视角,常数依赖、分布假设与有限样本区间交缩放律核查。2020年的缩放律以“损失在有限区间随参数、数据和计算近似幂律下降”作近邻;两者若结论不同,应以最坏界在实际深网常松为分账边界;缩放律不得与本条合成一个平均分。

2016年,随机梯度的统计视角据研究给出凸与部分非凸情形的稳定性界对接第043号第二幕六。跨过去,最坏界在实际深网常松迫使随机梯度的统计视角重新检验可见读数。随机梯度的统计视角以最坏界在实际深网常松施加反向压力。该接口若仍支持相反方向,最坏界在实际深网常松要求随机梯度的统计视角增加第三条件,同时容纳两边的失效样本。

位置E——它把随机梯度的统计视角的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有随机梯度的统计视角是决定因素 预设〔18 干预不回写到被干预者〕对象不会适应、规避或利用干预 量纲独立分布上满足随机梯度的统计视角所述保证的样本数/全部检验样本数 失效当最坏界在实际深网常松,主指标越高,边界外保持率反而越低 自曝长期随访没有保留:最坏界在实际深网常松 空栏随机梯度的统计视角中与“最坏界在实际深网常松”有关却未入分母的失败对象 异名另见第043号第二幕六“Grokking:记住训练集之后还可能突然学会规则”

辛、自适应数据分析:反复查看测试集会耗尽统计有效性Adaptive Data Analysis

提出Dwork、Feldman、Hardt 等,2015 年《STOC》:117–126,DOI 10.1145/2746539.2746580。 争议(未见反对;边界:正式机制成本高,现实排行榜的泄漏路径也不只来自数值查询。) 最新(2024—2026年未见直接更新。)。 关键研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化。

历史坐标落在2015年的STOC:Dwork、Feldman、Hardt 等不再允许机器学习理论在自适应数据分析上继续把低维与独立同分布直觉直接外推。Dwork、Feldman、Hardt 等逐项核对样本数、维数、复杂度与风险里的自适应数据分析;常数依赖、分布假设与有限样本区间由涌现争论另行登记。在STOC的证据账上,由差分隐私与稳定性提供控制自适应查询误差的理论工具起步,涌现争论进入解释对照;本条残差不能靠改名消失。

自适应数据分析的可反驳立场是:研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化。Dwork、Feldman、Hardt 等这一路线据此把决定性解释锁在一个对象上,涌现争论的“若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力”不能替代本条;边界是正式机制成本高。若用正交量纲重测仍不能保持方向,涌现争论便构成自适应数据分析的近邻反例;STOC对自适应数据分析仅支持原任务。

可核对的主证据是Dwork、Feldman、Hardt 等,2015 年《STOC》:117–126,DOI 10.1145/2746539.2746580:差分隐私与稳定性提供控制自适应查询误差的理论工具。自适应查询实验比较2种有效性保护机制。涌现争论要求把2015年的自适应数据分析样本与对照结算,再核查涌现争论的任务、观察窗和正式机制成本高。对自适应数据分析,涌现争论仅作近邻;支点仍是Dwork、Feldman、Hardt 等在STOC的原始比较。

自适应数据分析自己留下的反证入口是:正式机制成本高,现实排行榜的泄漏路径也不只来自数值查询。加入反事实条件时,Dwork、Feldman、Hardt 等的解释可能缩小、反号,或让位给涌现争论的路径。涌现争论给出复核STOC的近邻条件:先登记停止线再部署;自适应数据分析负责记录中止、排除和不显著对象。

差分隐私与稳定性提供控制自适应查询误差的理论工具改变登记顺序:样本数、维数、复杂度与风险归自适应数据分析,常数依赖、分布假设与有限样本区间交涌现争论核查。2024年的涌现争论以“若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力”作近邻;两者若结论不同,应以正式机制成本高为分账边界;涌现争论不得与本条合成一个平均分。

2015年,自适应数据分析据差分隐私与稳定性提供控制自适应查询误差的理论工具对接第257号第七条。跨过去,正式机制成本高迫使自适应数据分析重新检验可见读数。自适应数据分析以正式机制成本高施加反向压力。该接口若仍支持相反方向,正式机制成本高要求自适应数据分析增加第三条件,同时容纳两边的失效样本。

位置S——它把自适应数据分析所定义的结构、表示或可判结果当成单独够用的那一样 单因只有自适应数据分析是决定因素 预设〔18 干预不回写到被干预者〕对象不会适应、规避或利用干预 量纲独立分布上满足自适应数据分析所述保证的样本数/全部检验样本数 失效当正式机制成本高,主指标越高,边界外保持率反而越低 自曝不同站点之间显出:正式机制成本高 空栏自适应数据分析中与“正式机制成本高”有关却未入分母的失败对象 异名另见第257号第七条“选择后推断承认‘看过数据’会改变零分布”
【第二幕】这个十年 · 约 2016–2026

第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。

一、双下降:插值阈值把一条U形风险曲线折成两段Double Descent

提出Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116。 争议(未见反对;边界:峰值位置依赖训练、噪声和容量度量;规模增大不是无条件保险。) 最新(2024—2026年未见直接更新。)。 关键模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降。

第一处裂缝来自2019年的PNAS:Belkin、Hsu、Ma、Mandal不再允许机器学习理论在双下降上继续把低维与独立同分布直觉直接外推。Belkin、Hsu、Ma、Mandal逐项核对样本数、维数、复杂度与风险里的双下降;常数依赖、分布假设与有限样本区间由神经崩塌另行登记。在PNAS的证据账上,由线性模型、随机特征、树与神经网络都展示现代风险曲线起步,神经崩塌进入解释对照;本条残差不能靠改名消失。

双下降的可反驳立场是:模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降。Belkin、Hsu、Ma、Mandal这一路线据此把决定性解释锁在一个对象上,神经崩塌的“过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构”不能替代本条;边界是峰值位置依赖训练、噪声和容量度量。若撤去界面提示再验仍不能保持方向,神经崩塌便构成双下降的近邻反例;PNAS对双下降仅支持原任务。

可核对的主证据是Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116:线性模型、随机特征、树与神经网络都展示现代风险曲线。双下降把风险曲线分成2个下降区间。神经崩塌要求把2019年的双下降样本与对照结算,再核查神经崩塌的任务、观察窗和峰值位置依赖训练、噪声和容量度量。对双下降,神经崩塌仅作近邻;支点仍是Belkin、Hsu、Ma、Mandal在PNAS的原始比较。

双下降自己留下的反证入口是:峰值位置依赖训练、噪声和容量度量;规模增大不是无条件保险。用盲法重跑关键判断时,Belkin、Hsu、Ma、Mandal的解释可能缩小、反号,或让位给神经崩塌的路径。神经崩塌给出复核PNAS的近邻条件:换样本后再问;双下降负责记录中止、排除和不显著对象。回到PNAS的取样方式,双下降要用神经崩塌证明原分母没有删去最容易失败的对象。

线性模型、随机特征、树与神经网络都展示现代风险曲线改变登记顺序:样本数、维数、复杂度与风险归双下降,常数依赖、分布假设与有限样本区间交神经崩塌核查。2020年的神经崩塌以“过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构”作近邻;两者若结论不同,应以峰值位置依赖训练、噪声和容量度量为分账边界;神经崩塌不得与本条合成一个平均分。

2019年,双下降据线性模型、随机特征、树与神经网络都展示现代风险曲线对接第043号第二幕三。跨过去,峰值位置依赖训练、噪声和容量度量迫使双下降重新检验可见读数。双下降以峰值位置依赖训练、噪声和容量度量施加反向压力。该接口若仍支持相反方向,峰值位置依赖训练、噪声和容量度量要求双下降增加第三条件,同时容纳两边的失效样本。

位置S——它把双下降所定义的结构、表示或可判结果当成单独够用的那一样 单因只有双下降是决定因素 预设〔02 单一读数代表复杂对象〕一个汇总分足以替代多层过程 量纲独立分布上满足双下降所述保证的样本数/全部检验样本数 失效当峰值位置依赖训练、噪声和容量度量,主指标越高,边界外保持率反而越低 自曝失败试次放回分母后看到:峰值位置依赖训练、噪声和容量度量 空栏双下降中与“峰值位置依赖训练、噪声和容量度量”有关却未入分母的失败对象 异名另见第043号第二幕三“双下降:参数越过插值点后测试误差还能再次下降”

二、良性过拟合:把训练噪声插值也能接近最优风险Benign Overfitting

提出Bartlett、Long、Lugosi、Tsigler,2020 年《PNAS》117(48):30063–30070,DOI 10.1073/pnas.1907378117。 争议(未见反对;边界:条件依赖特征几何与噪声,现实表示是训练出来的而非固定输入。) 最新Mallinar 等,2024 年《ICML》论文“Benign, Tempered, or Catastrophic Overfitting”。 关键高维线性回归中,最小范数插值器可在特定协方差谱下泛化。

研究单位改在2020年的PNAS:Bartlett、Long、Lugosi、Tsigler不再允许机器学习理论在良性过拟合上继续把低维与独立同分布直觉直接外推。Bartlett、Long、Lugosi、Tsigler逐项核对样本数、维数、复杂度与风险里的良性过拟合;常数依赖、分布假设与有限样本区间由上下文学习理论另行登记。在PNAS的证据账上,由理论给出良性、临界和灾难性过拟合的谱条件起步,上下文学习理论进入解释对照;本条残差不能靠改名消失。

良性过拟合的可反驳立场是:高维线性回归中,最小范数插值器可在特定协方差谱下泛化。Bartlett、Long、Lugosi、Tsigler这一路线据此把决定性解释锁在一个对象上,上下文学习理论的“Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法”不能替代本条;边界是条件依赖特征几何与噪声。若按亚组分别结算仍不能保持方向,上下文学习理论便构成良性过拟合的近邻反例;PNAS对良性过拟合仅支持原任务。

可核对的主证据是Bartlett、Long、Lugosi、Tsigler,2020 年《PNAS》117(48):30063–30070,DOI 10.1073/pnas.1907378117:理论给出良性、临界和灾难性过拟合的谱条件。谱条件区分良性、临界和灾难性3种过拟合区间。上下文学习理论要求把2020年的良性过拟合样本与对照结算,再核查上下文学习理论的任务、观察窗和条件依赖特征几何与噪声。对良性过拟合,上下文学习理论仅作近邻;支点仍是Bartlett、Long、Lugosi、Tsigler在PNAS的原始比较。

良性过拟合自己留下的反证入口是:条件依赖特征几何与噪声,现实表示是训练出来的而非固定输入。将短期与长期拆账时,Bartlett、Long、Lugosi、Tsigler的解释可能缩小、反号,或让位给上下文学习理论的路径。上下文学习理论给出复核PNAS的近邻条件:把时间窗拉长再看;良性过拟合负责记录中止、排除和不显著对象。

理论给出良性、临界和灾难性过拟合的谱条件改变登记顺序:样本数、维数、复杂度与风险归良性过拟合,常数依赖、分布假设与有限样本区间交上下文学习理论核查。2023年的上下文学习理论以“Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法”作近邻;两者若结论不同,应以条件依赖特征几何与噪声为分账边界;上下文学习理论不得与本条合成一个平均分。

2020年,良性过拟合据理论给出良性、临界和灾难性过拟合的谱条件对接第043号第二幕五。跨过去,条件依赖特征几何与噪声迫使良性过拟合重新检验可见读数。良性过拟合以条件依赖特征几何与噪声施加反向压力。该接口若仍支持相反方向,条件依赖特征几何与噪声要求良性过拟合增加第三条件,同时容纳两边的失效样本。

位置D——它把良性过拟合的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有良性过拟合是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲独立分布上满足良性过拟合所述保证的样本数/全部检验样本数 失效当条件依赖特征几何与噪声,主指标越高,边界外保持率反而越低 自曝切换评价口径便会看到:条件依赖特征几何与噪声 空栏良性过拟合中与“条件依赖特征几何与噪声”有关却未入分母的失败对象 异名另见第043号第二幕五“彩票假说:大网络里可能藏着可单独训练的稀疏子网”

三、隐式偏置:优化器在无数零误差解中偏向特定方向Implicit Bias

提出Soudry、Hoffer、Nacson、Gunasekar、Srebro,2018 年《JMLR》19(70):1–57。 争议(未见反对;边界:深网、动量与自适应优化器的偏置不同,线性结论不能原样外推。) 最新(2024—2026年未见直接更新。)。 关键无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向。

回到原始设计2018年的JMLR:Soudry、Hoffer、Nacson、Gunasekar、Srebro不再允许机器学习理论在隐式偏置上继续把低维与独立同分布直觉直接外推。Soudry、Hoffer、Nacson、Gunasekar、Srebro逐项核对样本数、维数、复杂度与风险里的隐式偏置;常数依赖、分布假设与有限样本区间由保形预测另行登记。在JMLR的证据账上,由对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM起步,保形预测进入解释对照;本条残差不能靠改名消失。

隐式偏置的可反驳立场是:无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向。Soudry、Hoffer、Nacson、Gunasekar、Srebro这一路线据此把决定性解释锁在一个对象上,保形预测的“交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合”不能替代本条;边界是深网、动量与自适应优化器的偏置不同。若改变任务顺序后追踪仍不能保持方向,保形预测便构成隐式偏置的近邻反例;JMLR对隐式偏置仅支持原任务。

可核对的主证据是Soudry、Hoffer、Nacson、Gunasekar、Srebro,2018 年《JMLR》19(70):1–57:对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM。最大间隔方向在训练误差降到0之后才显现。保形预测要求把2018年的隐式偏置样本与对照结算,再核查保形预测的任务、观察窗和深网、动量与自适应优化器的偏置不同。对隐式偏置,保形预测仅作近邻;支点仍是Soudry、Hoffer、Nacson、Gunasekar、Srebro在JMLR的原始比较。

隐式偏置自己留下的反证入口是:深网、动量与自适应优化器的偏置不同,线性结论不能原样外推。把人工接管计入结果时,Soudry、Hoffer、Nacson、Gunasekar、Srebro的解释可能缩小、反号,或让位给保形预测的路径。保形预测给出复核JMLR的近邻条件:保留失败对象后检验;隐式偏置负责记录中止、排除和不显著对象。

对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM改变登记顺序:样本数、维数、复杂度与风险归隐式偏置,常数依赖、分布假设与有限样本区间交保形预测核查。2023年的保形预测以“交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合”作近邻;两者若结论不同,应以深网、动量与自适应优化器的偏置不同为分账边界;保形预测不得与本条合成一个平均分。

2018年,隐式偏置据对线性逻辑回归证明参数范数发散而方向趋向硬间隔SVM对接第257号第十七条。跨过去,深网、动量与自适应优化器的偏置不同迫使隐式偏置重新检验可见读数。隐式偏置以深网、动量与自适应优化器的偏置不同施加反向压力。该接口若仍支持相反方向,深网、动量与自适应优化器的偏置不同要求隐式偏置增加第三条件,同时容纳两边的失效样本。

位置E——它把隐式偏置的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有隐式偏置是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲独立分布上满足隐式偏置所述保证的样本数/全部检验样本数 失效当深网、动量与自适应优化器的偏置不同,主指标越高,边界外保持率反而越低 自曝训练分布之外出现:深网、动量与自适应优化器的偏置不同 空栏隐式偏置中与“深网、动量与自适应优化器的偏置不同”有关却未入分母的失败对象 异名另见第257号第十七条“e值把连续查看数据从违规变成可结算的证据过程”

四、神经切线核:无限宽网络在训练初期近似核回归Neural Tangent Kernel

提出Jacot、Gabriel、Hongler,2018 年《NeurIPS》31:8571–8580。 争议(未见反对;边界:真实有限网络会学习特征,固定核近似常漏掉最有价值的表示变化。) 最新(2024—2026年未见直接更新。)。 关键无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析。

这一路线先拆掉2018年的NeurIPS:Jacot、Gabriel、Hongler不再允许机器学习理论在神经切线核上继续把低维与独立同分布直觉直接外推。Jacot、Gabriel、Hongler逐项核对样本数、维数、复杂度与风险里的神经切线核;常数依赖、分布假设与有限样本区间由压缩感知另行登记。在NeurIPS的证据账上,由NTK给出收敛和泛化研究的新入口起步,压缩感知进入解释对照;本条残差不能靠改名消失。

神经切线核的可反驳立场是:无限宽极限下,参数梯度内积趋于固定核,训练动力学可解析。Jacot、Gabriel、Hongler这一路线据此把决定性解释锁在一个对象上,压缩感知的“只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复”不能替代本条;边界是真实有限网络会学习特征。若让独立团队预注册仍不能保持方向,压缩感知便构成神经切线核的近邻反例;NeurIPS对神经切线核仅支持原任务。

可核对的主证据是Jacot、Gabriel、Hongler,2018 年《NeurIPS》31:8571–8580:NTK给出收敛和泛化研究的新入口,并连接深网与经典核方法。压缩感知要求把2018年的神经切线核样本与对照结算,再核查压缩感知的任务、观察窗和真实有限网络会学习特征。对神经切线核,压缩感知仅作近邻;支点仍是Jacot、Gabriel、Hongler在NeurIPS的原始比较。回到NeurIPS的取样方式,神经切线核要用压缩感知证明原分母没有删去最容易失败的对象。

神经切线核自己留下的反证入口是:真实有限网络会学习特征,固定核近似常漏掉最有价值的表示变化。审计数据近邻与泄漏时,Jacot、Gabriel、Hongler的解释可能缩小、反号,或让位给压缩感知的路径。压缩感知给出复核NeurIPS的近邻条件:改用地点外资料复核;神经切线核负责记录中止、排除和不显著对象。

NTK给出收敛和泛化研究的新入口改变登记顺序:样本数、维数、复杂度与风险归神经切线核,常数依赖、分布假设与有限样本区间交压缩感知核查。2006年的压缩感知以“只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复”作近邻;两者若结论不同,应以真实有限网络会学习特征为分账边界;压缩感知不得与本条合成一个平均分。

2018年,神经切线核据NTK给出收敛和泛化研究的新入口对接第043号第一幕甲。跨过去,真实有限网络会学习特征迫使神经切线核重新检验可见读数。神经切线核以真实有限网络会学习特征施加反向压力。该接口若仍支持相反方向,真实有限网络会学习特征要求神经切线核增加第三条件,同时容纳两边的失效样本。

位置S——它把神经切线核所定义的结构、表示或可判结果当成单独够用的那一样 单因只有神经切线核是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲独立分布上满足神经切线核所述保证的样本数/全部检验样本数 失效当真实有限网络会学习特征,主指标越高,边界外保持率反而越低 自曝参数识别检验告诉我们:真实有限网络会学习特征 空栏神经切线核中与“真实有限网络会学习特征”有关却未入分母的失败对象 异名另见第043号第一幕甲“深层信念网:逐层预训练让深网络第一次稳定启动”

五、均场极限:宽网络也可看作参数分布的动力系统Mean-Field Limits

提出Chizat 与 Bach,2018 年《NeurIPS》31:3046–3056。 争议(未见反对;边界:两层、无限宽与连续时间近似离生产模型仍远,边界条件决定结论。) 最新(2024—2026年未见直接更新。)。 关键两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流。

需要先恢复2018年的NeurIPS:Chizat 与 Bach不再允许机器学习理论在均场极限上继续把低维与独立同分布直觉直接外推。Chizat 与 Bach逐项核对样本数、维数、复杂度与风险里的均场极限;常数依赖、分布假设与有限样本区间由PAC-Bayes复兴另行登记。在NeurIPS的证据账上,由框架允许研究特征学习而非完全冻结的核极限起步,PAC-Bayes复兴进入解释对照;本条残差不能靠改名消失。

均场极限的可反驳立场是:两层网络宽度趋于无限时,训练可描述为概率测度上的梯度流。Chizat 与 Bach这一路线据此把决定性解释锁在一个对象上,PAC-Bayes复兴的“随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制”不能替代本条;边界是两层、无限宽与连续时间近似离生产模型仍远。若把不显著结果一并公开仍不能保持方向,PAC-Bayes复兴便构成均场极限的近邻反例;NeurIPS对均场极限仅支持原任务。

可核对的主证据是Chizat 与 Bach,2018 年《NeurIPS》31:3046–3056:框架允许研究特征学习而非完全冻结的核极限。PAC-Bayes复兴要求把2018年的均场极限样本与对照结算,再核查PAC-Bayes复兴的任务、观察窗和两层、无限宽与连续时间近似离生产模型仍远。对均场极限,PAC-Bayes复兴仅作近邻;支点仍是Chizat 与 Bach在NeurIPS的原始比较。回到NeurIPS的取样方式,均场极限要用PAC-Bayes复兴证明原分母没有删去最容易失败的对象。

均场极限自己留下的反证入口是:两层、无限宽与连续时间近似离生产模型仍远,边界条件决定结论。先登记停止线再部署时,Chizat 与 Bach的解释可能缩小、反号,或让位给PAC-Bayes复兴的路径。PAC-Bayes复兴给出复核NeurIPS的近邻条件:让替代路径进入对照;均场极限负责记录中止、排除和不显著对象。

框架允许研究特征学习而非完全冻结的核极限改变登记顺序:样本数、维数、复杂度与风险归均场极限,常数依赖、分布假设与有限样本区间交PAC-Bayes复兴核查。2009年的PAC-Bayes复兴以“随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制”作近邻;两者若结论不同,应以两层、无限宽与连续时间近似离生产模型仍远为分账边界;PAC-Bayes复兴不得与本条合成一个平均分。

2018年,均场极限据框架允许研究特征学习而非完全冻结的核极限对接第045号第二幕四。跨过去,两层、无限宽与连续时间近似离生产模型仍远迫使均场极限重新检验可见读数。均场极限以两层、无限宽与连续时间近似离生产模型仍远施加反向压力。该接口若仍支持相反方向,两层、无限宽与连续时间近似离生产模型仍远要求均场极限增加第三条件,同时容纳两边的失效样本。

位置D——它把均场极限的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有均场极限是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲独立分布上满足均场极限所述保证的样本数/全部检验样本数 失效当两层、无限宽与连续时间近似离生产模型仍远,主指标越高,边界外保持率反而越低 自曝任务重测把弱点定位为:两层、无限宽与连续时间近似离生产模型仍远 空栏均场极限中与“两层、无限宽与连续时间近似离生产模型仍远”有关却未入分母的失败对象 异名另见第045号第二幕四“得分SDE:扩散与得分匹配被统一成连续时间”

六、平坦极小值清算:坐标重参数化会改变“平坦”读数Sharpness Reparameterization

提出Dinh、Pascanu、Bengio、Bengio,2017 年《ICML》70:1019–1028。 争议(未见反对;边界:尺度不变或功能空间指标仍可能有用,但必须先说明度量。) 最新(2024—2026年未见直接更新。)。 关键参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因。

证据链从2017年的ICML:Dinh、Pascanu、Bengio、Bengio不再允许机器学习理论在平坦极小值清算上继续把低维与独立同分布直觉直接外推。Dinh、Pascanu、Bengio、Bengio逐项核对样本数、维数、复杂度与风险里的平坦极小值清算;常数依赖、分布假设与有限样本区间由高维Lasso另行登记。在ICML的证据账上,由通过重参数化可在保持同一函数时任意改变Hessian型尖锐度起步,高维Lasso进入解释对照;本条残差不能靠改名消失。

平坦极小值清算的可反驳立场是:参数空间中的尖锐度不是函数不变量,不能直接作为泛化原因。Dinh、Pascanu、Bengio、Bengio这一路线据此把决定性解释锁在一个对象上,高维Lasso的“受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界”不能替代本条;边界是尺度不变或功能空间指标仍可能有用。若按个体轨迹而非均值检查仍不能保持方向,高维Lasso便构成平坦极小值清算的近邻反例;ICML对平坦极小值清算仅支持原任务。

可核对的主证据是Dinh、Pascanu、Bengio、Bengio,2017 年《ICML》70:1019–1028:通过重参数化可在保持同一函数时任意改变Hessian型尖锐度。高维Lasso要求把2017年的平坦极小值清算样本与对照结算,再核查高维Lasso的任务、观察窗和尺度不变或功能空间指标仍可能有用。对平坦极小值清算,高维Lasso仅作近邻;支点仍是Dinh、Pascanu、Bengio、Bengio在ICML的原始比较。

平坦极小值清算自己留下的反证入口是:尺度不变或功能空间指标仍可能有用,但必须先说明度量。换样本后再问时,Dinh、Pascanu、Bengio、Bengio的解释可能缩小、反号,或让位给高维Lasso的路径。高维Lasso给出复核ICML的近邻条件:把排除者放回分母;平坦极小值清算负责记录中止、排除和不显著对象。

通过重参数化可在保持同一函数时任意改变Hessian型尖锐度改变登记顺序:样本数、维数、复杂度与风险归平坦极小值清算,常数依赖、分布假设与有限样本区间交高维Lasso核查。2009年的高维Lasso以“受限特征相关条件下,L1正则可给出预测与参数估计的非渐近界”作近邻;两者若结论不同,应以尺度不变或功能空间指标仍可能有用为分账边界;高维Lasso不得与本条合成一个平均分。

2017年,平坦极小值清算据通过重参数化可在保持同一函数时任意改变Hessian型尖锐度对接第049号第二幕十。跨过去,尺度不变或功能空间指标仍可能有用迫使平坦极小值清算重新检验可见读数。平坦极小值清算以尺度不变或功能空间指标仍可能有用施加反向压力。该接口若仍支持相反方向,尺度不变或功能空间指标仍可能有用要求平坦极小值清算增加第三条件,同时容纳两边的失效样本。

位置E——它把平坦极小值清算的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有平坦极小值清算是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲独立分布上满足平坦极小值清算所述保证的样本数/全部检验样本数 失效当尺度不变或功能空间指标仍可能有用,结论只留在原任务内 自曝横跨人群后原结论暴露:尺度不变或功能空间指标仍可能有用 空栏平坦极小值清算中与“尺度不变或功能空间指标仍可能有用”有关却未入分母的失败对象 异名另见第049号第二幕十“解释忠实性:可读、稳定与因果正确是三种不同指标”

七、Grokking理论:权重衰减推动从记忆解迁到结构解Theory of Grokking

提出Liu、Kitaev、Michaud、Tegmark,2022 年《NeurIPS》35:34665–34681。 争议(未见反对;边界:多套机制可产生相似曲线,真实数据是否存在清晰相变仍待检验。) 最新(2024—2026年未见直接更新。)。 关键延迟泛化可由表示形成与正则化驱动的相变解释。

决定性变化始于2022年的NeurIPS:Liu、Kitaev、Michaud、Tegmark不再允许机器学习理论在Grokking理论上继续把低维与独立同分布直觉直接外推。Liu、Kitaev、Michaud、Tegmark逐项核对样本数、维数、复杂度与风险里的Grokking理论;常数依赖、分布假设与有限样本区间由矩阵完成另行登记。在NeurIPS的证据账上,由合成算法任务中起步,矩阵完成进入解释对照;本条残差不能靠改名消失。

Grokking理论的可反驳立场是:延迟泛化可由表示形成与正则化驱动的相变解释。Liu、Kitaev、Michaud、Tegmark这一路线据此把决定性解释锁在一个对象上,矩阵完成的“随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目”不能替代本条;边界是多套机制可产生相似曲线。若加入反事实条件仍不能保持方向,矩阵完成便构成Grokking理论的近邻反例;NeurIPS对Grokking理论仅支持原任务。

可核对的主证据是Liu、Kitaev、Michaud、Tegmark,2022 年《NeurIPS》35:34665–34681:合成算法任务中,表示几何变化先于测试精度突升。矩阵完成要求把2022年的Grokking理论样本与对照结算,再核查矩阵完成的任务、观察窗和多套机制可产生相似曲线。对Grokking理论,矩阵完成仅作近邻;支点仍是Liu、Kitaev、Michaud、Tegmark在NeurIPS的原始比较。回到NeurIPS的取样方式,Grokking理论要用矩阵完成证明原分母没有删去最容易失败的对象。

Grokking理论自己留下的反证入口是:多套机制可产生相似曲线,真实数据是否存在清晰相变仍待检验。把时间窗拉长再看时,Liu、Kitaev、Michaud、Tegmark的解释可能缩小、反号,或让位给矩阵完成的路径。矩阵完成给出复核NeurIPS的近邻条件:固定资源预算后比较;Grokking理论负责记录中止、排除和不显著对象。拿矩阵完成作近邻检验,可辨认Liu、Kitaev、Michaud、Tegmark观察到的是独有路径,还是另一条路线的表面同义词。

合成算法任务中改变登记顺序:样本数、维数、复杂度与风险归Grokking理论,常数依赖、分布假设与有限样本区间交矩阵完成核查。2009年的矩阵完成以“随机观测足够多且矩阵低秩、不相干时,可由核范数恢复全部条目”作近邻;两者若结论不同,应以多套机制可产生相似曲线为分账边界;矩阵完成不得与本条合成一个平均分。

2022年,Grokking理论据合成算法任务中对接第043号第二幕六。跨过去,多套机制可产生相似曲线迫使Grokking理论重新检验可见读数。Grokking理论以多套机制可产生相似曲线施加反向压力。该接口若仍支持相反方向,多套机制可产生相似曲线要求Grokking理论增加第三条件,同时容纳两边的失效样本。第043号第二幕六“Grokking:记住训练集之后还可能突然学会规则”提供不同尺度的反例;它迫使Grokking理论把“适用”写成可检查的对象范围。

位置D——它把Grokking理论的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有Grokking理论是决定因素 预设〔02 单一读数代表复杂对象〕一个汇总分足以替代多层过程 量纲独立分布上满足Grokking理论所述保证的样本数/全部检验样本数 失效当多套机制可产生相似曲线,结论只留在原任务内 自曝误差分解把漏项指向:多套机制可产生相似曲线 空栏Grokking理论中与“多套机制可产生相似曲线”有关却未入分母的失败对象 异名另见第043号第二幕六“Grokking:记住训练集之后还可能突然学会规则”

八、缩放律:经验幂律成为预算预测而非机制解释Empirical Scaling Laws

提出Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》。 争议(未见反对;边界:幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全。) 最新(2024—2026年未见直接更新。)。 关键损失在有限区间随参数、数据和计算近似幂律下降。

最早被迫重写的是2020年的Scaling Laws for Neural Language Models:Kaplan 等不再允许机器学习理论在缩放律上继续把低维与独立同分布直觉直接外推。Kaplan 等逐项核对样本数、维数、复杂度与风险里的缩放律;常数依赖、分布假设与有限样本区间由算法稳定性另行登记。在Scaling Laws for Neural Language Models的证据账上,由跨规模实验使训练前预算选择从经验猜测变成可拟合曲线起步,算法稳定性进入解释对照;本条残差不能靠改名消失。

缩放律的可反驳立场是:损失在有限区间随参数、数据和计算近似幂律下降。Kaplan 等这一路线据此把决定性解释锁在一个对象上,算法稳定性的“学习算法对单个训练样本扰动不敏感,可直接推出泛化”不能替代本条;边界是幂律外推不说明能力从何产生。若用盲法重跑关键判断仍不能保持方向,算法稳定性便构成缩放律的近邻反例;Scaling Laws for Neural Language Models对缩放律仅支持原任务。

可核对的主证据是Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》:跨规模实验使训练前预算选择从经验猜测变成可拟合曲线。算法稳定性要求把2020年的缩放律样本与对照结算,再核查算法稳定性的任务、观察窗和幂律外推不说明能力从何产生。对缩放律,算法稳定性仅作近邻;支点仍是Kaplan 等在Scaling Laws for Neural Language Models的原始比较。回到Scaling Laws for Neural Language Models的取样方式,缩放律要用算法稳定性证明原分母没有删去最容易失败的对象。

缩放律自己留下的反证入口是:幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全。保留失败对象后检验时,Kaplan 等的解释可能缩小、反号,或让位给算法稳定性的路径。算法稳定性给出复核Scaling Laws for Neural Language Models的近邻条件:用正交量纲重测;缩放律负责记录中止、排除和不显著对象。

跨规模实验使训练前预算选择从经验猜测变成可拟合曲线改变登记顺序:样本数、维数、复杂度与风险归缩放律,常数依赖、分布假设与有限样本区间交算法稳定性核查。2010年的算法稳定性以“学习算法对单个训练样本扰动不敏感,可直接推出泛化”作近邻;两者若结论不同,应以幂律外推不说明能力从何产生为分账边界;算法稳定性不得与本条合成一个平均分。

2020年,缩放律据跨规模实验使训练前预算选择从经验猜测变成可拟合曲线对接第044号第二幕五。跨过去,幂律外推不说明能力从何产生迫使缩放律重新检验可见读数。缩放律以幂律外推不说明能力从何产生施加反向压力。该接口若仍支持相反方向,幂律外推不说明能力从何产生要求缩放律增加第三条件,同时容纳两边的失效样本。

位置E——它把缩放律的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有缩放律是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲独立分布上满足缩放律所述保证的样本数/全部检验样本数 失效当幂律外推不说明能力从何产生,结论只留在原任务内 自曝开放材料使外部团队发现:幂律外推不说明能力从何产生 空栏缩放律中与“幂律外推不说明能力从何产生”有关却未入分母的失败对象 异名另见第044号第二幕五“缩放律修订:模型与数据要按计算预算共同增长”

九、涌现争论:离散指标可把平滑变化画成突然跳跃Emergence Under Measurement

提出Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”。 争议(未见反对;边界:有些策略切换仍可能真实离散;测量解释不能先验否定全部相变。) 最新(2024—2026年未见直接更新。)。 关键若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力。

这一条先处理2024年的NeurIPS:Schaeffer、Miranda、Koyejo不再允许机器学习理论在涌现争论上继续把低维与独立同分布直觉直接外推。Schaeffer、Miranda、Koyejo逐项核对样本数、维数、复杂度与风险里的涌现争论;常数依赖、分布假设与有限样本区间由非凸矩阵分解另行登记。在NeurIPS的证据账上,由把指标改为连续误差后起步,非凸矩阵分解进入解释对照;本条残差不能靠改名消失。

涌现争论的可反驳立场是:若评价函数非线性或有阈值,平滑损失改善会被显示成突然能力。Schaeffer、Miranda、Koyejo这一路线据此把决定性解释锁在一个对象上,非凸矩阵分解的“低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵”不能替代本条;边界是有些策略切换仍可能真实离散。若将短期与长期拆账仍不能保持方向,非凸矩阵分解便构成涌现争论的近邻反例;NeurIPS对涌现争论仅支持原任务。

可核对的主证据是Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”:把指标改为连续误差后,多项所谓涌现能力转为可预测曲线。非凸矩阵分解要求把2024年的涌现争论样本与对照结算,再核查非凸矩阵分解的任务、观察窗和有些策略切换仍可能真实离散。对涌现争论,非凸矩阵分解仅作近邻;支点仍是Schaeffer、Miranda、Koyejo在NeurIPS的原始比较。回到NeurIPS的取样方式,涌现争论要用非凸矩阵分解证明原分母没有删去最容易失败的对象。

涌现争论自己留下的反证入口是:有些策略切换仍可能真实离散;测量解释不能先验否定全部相变。改用地点外资料复核时,Schaeffer、Miranda、Koyejo的解释可能缩小、反号,或让位给非凸矩阵分解的路径。非凸矩阵分解给出复核NeurIPS的近邻条件:撤去界面提示再验;涌现争论负责记录中止、排除和不显著对象。

把指标改为连续误差后改变登记顺序:样本数、维数、复杂度与风险归涌现争论,常数依赖、分布假设与有限样本区间交非凸矩阵分解核查。2013年的非凸矩阵分解以“低秩和不相干条件下,非凸交替最小化可从合适初始化恢复缺失矩阵”作近邻;两者若结论不同,应以有些策略切换仍可能真实离散为分账边界;非凸矩阵分解不得与本条合成一个平均分。

2024年,涌现争论据把指标改为连续误差后对接第256号第三条。跨过去,有些策略切换仍可能真实离散迫使涌现争论重新检验可见读数。涌现争论以有些策略切换仍可能真实离散施加反向压力。该接口若仍支持相反方向,有些策略切换仍可能真实离散要求涌现争论增加第三条件,同时容纳两边的失效样本。

位置S——它把涌现争论所定义的结构、表示或可判结果当成单独够用的那一样 单因只有涌现争论是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲独立分布上满足涌现争论所述保证的样本数/全部检验样本数 失效当有些策略切换仍可能真实离散,结论只留在原任务内 自曝一次真正的边界检验显示:有些策略切换仍可能真实离散 空栏涌现争论中与“有些策略切换仍可能真实离散”有关却未入分母的失败对象 异名另见第256号第三条“评测的构念效度危机”

十、神经崩塌:训练末期类内表示收缩并形成对称几何Neural Collapse

提出Papyan、Han、Donoho,2020 年《PNAS》117(40):24652–24663,DOI 10.1073/pnas.2015509117。 争议(未见反对;边界:现象依赖平衡分类与继续训练,开放类、长尾和自监督下不必成立。) 最新(2024—2026年未见直接更新。)。 关键过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构。

原论文正面碰到2020年的PNAS:Papyan、Han、Donoho不再允许机器学习理论在神经崩塌上继续把低维与独立同分布直觉直接外推。Papyan、Han、Donoho逐项核对样本数、维数、复杂度与风险里的神经崩塌;常数依赖、分布假设与有限样本区间由随机梯度的统计视角另行登记。在PNAS的证据账上,由跨多种网络与数据观察到四类收敛现象起步,随机梯度的统计视角进入解释对照;本条残差不能靠改名消失。

神经崩塌的可反驳立场是:过参数分类器在终端阶段出现类均值等角、权重对齐等共同结构。Papyan、Han、Donoho这一路线据此把决定性解释锁在一个对象上,随机梯度的统计视角的“SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化”不能替代本条;边界是现象依赖平衡分类与继续训练。若把人工接管计入结果仍不能保持方向,随机梯度的统计视角便构成神经崩塌的近邻反例;PNAS对神经崩塌仅支持原任务。

可核对的主证据是Papyan、Han、Donoho,2020 年《PNAS》117(40):24652–24663,DOI 10.1073/pnas.2015509117:跨多种网络与数据观察到四类收敛现象,为末期表示提供可量对象。随机梯度的统计视角要求把2020年的神经崩塌样本与对照结算,再核查随机梯度的统计视角的任务、观察窗和现象依赖平衡分类与继续训练。对神经崩塌,随机梯度的统计视角仅作近邻;支点仍是Papyan、Han、Donoho在PNAS的原始比较。

神经崩塌自己留下的反证入口是:现象依赖平衡分类与继续训练,开放类、长尾和自监督下不必成立。让替代路径进入对照时,Papyan、Han、Donoho的解释可能缩小、反号,或让位给随机梯度的统计视角的路径。随机梯度的统计视角给出复核PNAS的近邻条件:按亚组分别结算;神经崩塌负责记录中止、排除和不显著对象。

跨多种网络与数据观察到四类收敛现象改变登记顺序:样本数、维数、复杂度与风险归神经崩塌,常数依赖、分布假设与有限样本区间交随机梯度的统计视角核查。2016年的随机梯度的统计视角以“SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化”作近邻;两者若结论不同,应以现象依赖平衡分类与继续训练为分账边界;随机梯度的统计视角不得与本条合成一个平均分。

2020年,神经崩塌据跨多种网络与数据观察到四类收敛现象对接第049号第二幕三。跨过去,现象依赖平衡分类与继续训练迫使神经崩塌重新检验可见读数。神经崩塌以现象依赖平衡分类与继续训练施加反向压力。该接口若仍支持相反方向,现象依赖平衡分类与继续训练要求神经崩塌增加第三条件,同时容纳两边的失效样本。

位置D——它把神经崩塌的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有神经崩塌是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲独立分布上满足神经崩塌所述保证的样本数/全部检验样本数 失效当现象依赖平衡分类与继续训练,结论只留在原任务内 自曝部署或临床记录反证:现象依赖平衡分类与继续训练 空栏神经崩塌中与“现象依赖平衡分类与继续训练”有关却未入分母的失败对象 异名另见第049号第二幕三“叠加:一个神经元承载多个特征可能是容量最优解”

十一、上下文学习理论:提示示例可诱导隐式算法Theory of In-Context Learning

提出Akyürek 等,2023 年《ICLR》论文“What Learning Algorithm Is In-Context Learning?”。 争议(未见反对;边界:构造任务与真实语言提示差距大,行为等价不证明内部逐步执行同一算法。) 最新(2024—2026年未见直接更新。)。 关键Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法。

方法转向发生在2023年的ICLR:Akyürek 等不再允许机器学习理论在上下文学习理论上继续把低维与独立同分布直觉直接外推。Akyürek 等逐项核对样本数、维数、复杂度与风险里的上下文学习理论;常数依赖、分布假设与有限样本区间由自适应数据分析另行登记。在ICLR的证据账上,由合成线性任务中起步,自适应数据分析进入解释对照;本条残差不能靠改名消失。

上下文学习理论的可反驳立场是:Transformer前向过程可在特定任务分布中实现近似梯度下降或回归算法。Akyürek 等这一路线据此把决定性解释锁在一个对象上,自适应数据分析的“研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化”不能替代本条;边界是构造任务与真实语言提示差距大。若审计数据近邻与泄漏仍不能保持方向,自适应数据分析便构成上下文学习理论的近邻反例;ICLR对上下文学习理论仅支持原任务。

可核对的主证据是Akyürek 等,2023 年《ICLR》论文“What Learning Algorithm Is In-Context Learning?”:合成线性任务中,隐藏状态与已知优化步骤出现可测对应。自适应数据分析要求把2023年的上下文学习理论样本与对照结算,再核查自适应数据分析的任务、观察窗和构造任务与真实语言提示差距大。对上下文学习理论,自适应数据分析仅作近邻;支点仍是Akyürek 等在ICLR的原始比较。

上下文学习理论自己留下的反证入口是:构造任务与真实语言提示差距大,行为等价不证明内部逐步执行同一算法。把排除者放回分母时,Akyürek 等的解释可能缩小、反号,或让位给自适应数据分析的路径。自适应数据分析给出复核ICLR的近邻条件:改变任务顺序后追踪;上下文学习理论负责记录中止、排除和不显著对象。

合成线性任务中改变登记顺序:样本数、维数、复杂度与风险归上下文学习理论,常数依赖、分布假设与有限样本区间交自适应数据分析核查。2015年的自适应数据分析以“研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化”作近邻;两者若结论不同,应以构造任务与真实语言提示差距大为分账边界;自适应数据分析不得与本条合成一个平均分。

2023年,上下文学习理论据合成线性任务中对接第256号第二条。跨过去,构造任务与真实语言提示差距大迫使上下文学习理论重新检验可见读数。上下文学习理论以构造任务与真实语言提示差距大施加反向压力。该接口若仍支持相反方向,构造任务与真实语言提示差距大要求上下文学习理论增加第三条件,同时容纳两边的失效样本。

位置E——它把上下文学习理论的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有上下文学习理论是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲独立分布上满足上下文学习理论所述保证的样本数/全部检验样本数 失效当构造任务与真实语言提示差距大,结论只留在原任务内 自曝不显著结果没有消失而是说明:构造任务与真实语言提示差距大 空栏上下文学习理论中与“构造任务与真实语言提示差距大”有关却未入分母的失败对象 异名另见第256号第二条“上下文学习”

十二、保形预测:有限样本覆盖率不要求模型正确Conformal Prediction

提出Angelopoulos 与 Bates,2023 年《Foundations and Trends in Machine Learning》16(4):494–591,DOI 10.1561/2200000101。 争议(未见反对;边界:边际覆盖会掩盖亚群失配,分布漂移和自适应选择会破坏交换性。) 最新(2024—2026年未见直接更新。)。 关键交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合。

这项工作首先校正2023年的Foundations and Trends in Machine Learning:Angelopoulos 与 Bates不再允许机器学习理论在保形预测上继续把低维与独立同分布直觉直接外推。Angelopoulos 与 Bates逐项核对样本数、维数、复杂度与风险里的保形预测;常数依赖、分布假设与有限样本区间由双下降另行登记。在Foundations and Trends in Machine Learning的证据账上,由方法适配分类、回归和黑箱模型起步,双下降进入解释对照;本条残差不能靠改名消失。

保形预测的可反驳立场是:交换性条件下,可用校准残差构造具有边际覆盖保证的预测集合。Angelopoulos 与 Bates这一路线据此把决定性解释锁在一个对象上,双下降的“模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降”不能替代本条;边界是边际覆盖会掩盖亚群失配。若先登记停止线再部署仍不能保持方向,双下降便构成保形预测的近邻反例;Foundations and Trends in Machine Learning对保形预测仅支持原任务。

可核对的主证据是Angelopoulos 与 Bates,2023 年《Foundations and Trends in Machine Learning》16(4):494–591,DOI 10.1561/2200000101:方法适配分类、回归和黑箱模型,把不确定性输出变成可检查频率。双下降要求把2023年的保形预测样本与对照结算,再核查双下降的任务、观察窗和边际覆盖会掩盖亚群失配。对保形预测,双下降仅作近邻;支点仍是Angelopoulos 与 Bates在Foundations and Trends in Machine Learning的原始比较。回到Foundations and Trends in Machine Learning的取样方式,保形预测要用双下降证明原分母没有删去最容易失败的对象。

保形预测自己留下的反证入口是:边际覆盖会掩盖亚群失配,分布漂移和自适应选择会破坏交换性。固定资源预算后比较时,Angelopoulos 与 Bates的解释可能缩小、反号,或让位给双下降的路径。双下降给出复核Foundations and Trends in Machine Learning的近邻条件:让独立团队预注册;保形预测负责记录中止、排除和不显著对象。拿双下降作近邻检验,可辨认Angelopoulos 与 Bates观察到的是独有路径,还是另一条路线的表面同义词。

方法适配分类、回归和黑箱模型改变登记顺序:样本数、维数、复杂度与风险归保形预测,常数依赖、分布假设与有限样本区间交双下降核查。2019年的双下降以“模型容量刚够插值噪声时风险最高,继续过参数化后可再次下降”作近邻;两者若结论不同,应以边际覆盖会掩盖亚群失配为分账边界;双下降不得与本条合成一个平均分。

2023年,保形预测据方法适配分类、回归和黑箱模型对接第257号第六条。跨过去,边际覆盖会掩盖亚群失配迫使保形预测重新检验可见读数。保形预测以边际覆盖会掩盖亚群失配施加反向压力。该接口若仍支持相反方向,边际覆盖会掩盖亚群失配要求保形预测增加第三条件,同时容纳两边的失效样本。

位置S——它把保形预测所定义的结构、表示或可判结果当成单独够用的那一样 单因只有保形预测是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲独立分布上满足保形预测所述保证的样本数/全部检验样本数 失效当边际覆盖会掩盖亚群失配,结论只留在原任务内 自曝近期复核仍保留的自我否定是:边际覆盖会掩盖亚群失配 空栏保形预测中与“边际覆盖会掩盖亚群失配”有关却未入分母的失败对象 异名另见第257号第六条“共形预测把不确定性从模型假设转成有限样本覆盖”

◎ 二十年连起来看

第一幕不是旧成果清单,而是机器学习理论第一次为自己建立可失败的比较尺。压缩感知收紧了旧默认,矩阵完成把隐含过程拆成可估参数,自适应数据分析又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。

第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。双下降扩展了表示或分布,Grokking理论改变了研究单位,保形预测则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。

二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。高维Lasso说明干预能改变路径,神经切线核说明单一读数会混合层级,神经崩塌又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。

◎ 三个常见误解

误解一:PAC-Bayes复兴已经给出了稳定的通用解释。它容易取信,是因为随机预测器的泛化可由经验风险与后验偏离先验的KL复杂度共同控制确实改变了旧的研究方式。但先验若在看标签后挑选会破坏保证,数值界也常远大于实际误差,所以正确表述只能限于原设计可识别的那一段责任链。

误解二:隐式偏置等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但无显式正则时,梯度下降仍可在可分数据上收敛到最大间隔方向仍只是一个可检验命题。深网、动量与自适应优化器的偏置不同,线性结论不能原样外推说明,没有干预、替代解释和边界样本,可读不等于因果正确。

误解三:上下文学习理论的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把构造任务与真实语言提示差距大,行为等价不证明内部逐步执行同一算法藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。

◎ 与相邻领域的接口

压缩感知与第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”的分工在于:本页负责只要信号稀疏且测量矩阵满足几何条件,少于维度的观测也能精确恢复,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。

随机梯度的统计视角可与第043号第二幕六“Grokking:记住训练集之后还可能突然学会规则”交换制度或工程中的回写证据。前者的核心命题是SGD的步长、迭代数与损失平滑性共同决定算法稳定和泛化,但最坏界在实际深网常松,批量顺序与动量又改变噪声形状;后者则能检验同一接口是否把选择成本转移给了另一个主体。

缩放律与第044号第二幕五“缩放律修订:模型与数据要按计算预算共同增长”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。

◎ 争议现场

算法稳定性的争议是深网在参数上不稳定却可能在预测上稳定,选错稳定对象会误判。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。

神经切线核的争议是真实有限网络会学习特征,固定核近似常漏掉最有价值的表示变化。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。

神经崩塌的争议是现象依赖平衡分类与继续训练,开放类、长尾和自监督下不必成立。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。

◎ 往下五年看什么

到2031年,看双下降的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。

看均场极限在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。

看涌现争论的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。

看保形预测的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。

◎ 可与哪些领域对撞

压缩感知与第257号第一条“高维稀疏性把‘参数多于样本’从禁区变成条件命题”共享“可见读数能代表真实对象”的预设。本条用真实信号仅近似稀疏,矩阵条件难检验;漂亮保证不自动覆盖采集偏差给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。

自适应数据分析与第257号第七条“选择后推断承认‘看过数据’会改变零分布”共享“局部表现能够结算整体能力”的预设。自适应数据分析主张研究者根据前次结果继续提问时,普通训练测试分离不再保证泛化。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。

缩放律与第044号第二幕五“缩放律修订:模型与数据要按计算预算共同增长”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是幂律外推不说明能力从何产生,也不含数据权利、推理成本与安全。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。

◎ 十条可做的研究命题

  1. 在时间外数据上重做压缩感知;方向保持率低于二分之一即证伪其稳定性。
  2. 把PAC-Bayes复兴的中止与排除对象放回分母;主效应反号即否定原总结。
  3. 为高维Lasso配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
  4. 由独立团队预注册矩阵完成的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
  5. 对算法稳定性的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
  6. 主动改变非凸矩阵分解的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
  7. 对隐式偏置做反事实干预;可视化不随关键参数变化即证伪忠实性。
  8. 把Grokking理论交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
  9. 公开上下文学习理论的最强失败实现;下一方法只在原基准改善即判定为换题。
  10. 为保形预测事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。

◎ 资料核验

  1. Candès、Romberg、Tao,2006 年《IEEE Transactions on Information Theory》52(2):489–509,DOI 10.1109/TIT.2005.862083。
  2. Germain、Lacasse、Laviolette、Marchand,2009 年《AISTATS》5:105–112。
  3. Bickel、Ritov、Tsybakov,2009 年《Annals of Statistics》37(4):1705–1732,DOI 10.1214/08-AOS620。
  4. Candès 与 Recht,2009 年《Foundations of Computational Mathematics》9:717–772,DOI 10.1007/s10208-009-9045-5。
  5. Shalev-Shwartz、Shamir、Srebro、Sridharan,2010 年《COLT》:5–19。
  6. Jain、Netrapalli、Sanghavi,2013 年《STOC》:665–674,DOI 10.1145/2488608.2488693。
  7. Hardt、Recht、Singer,2016 年《ICML》48:1225–1234。
  8. Dwork、Feldman、Hardt 等,2015 年《STOC》:117–126,DOI 10.1145/2746539.2746580。
  9. Belkin、Hsu、Ma、Mandal,2019 年《PNAS》116(32):15849–15854,DOI 10.1073/pnas.1903070116。
  10. Bartlett、Long、Lugosi、Tsigler,2020 年《PNAS》117(48):30063–30070,DOI 10.1073/pnas.1907378117。
  11. Soudry、Hoffer、Nacson、Gunasekar、Srebro,2018 年《JMLR》19(70):1–57。
  12. Jacot、Gabriel、Hongler,2018 年《NeurIPS》31:8571–8580。
  13. Chizat 与 Bach,2018 年《NeurIPS》31:3046–3056。
  14. Dinh、Pascanu、Bengio、Bengio,2017 年《ICML》70:1019–1028。
  15. Liu、Kitaev、Michaud、Tegmark,2022 年《NeurIPS》35:34665–34681。
  16. Kaplan 等,2020 年 arXiv:2001.08361《Scaling Laws for Neural Language Models》。
  17. Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”。
  18. Papyan、Han、Donoho,2020 年《PNAS》117(40):24652–24663,DOI 10.1073/pnas.2015509117。
  19. Akyürek 等,2023 年《ICLR》论文“What Learning Algorithm Is In-Context Learning?”。
  20. Angelopoulos 与 Bates,2023 年《Foundations and Trends in Machine Learning》16(4):494–591,DOI 10.1561/2200000101。
  21. Schaeffer、Miranda、Koyejo,2024 年《NeurIPS》论文“Are Emergent Abilities of Large Language Models a Mirage?”。
  22. Bachmann 等,2024 年 arXiv:2404.08712《The Pitfalls of Next-Token Prediction》。
  23. Mallinar 等,2024 年《ICML》论文“Benign, Tempered, or Catastrophic Overfitting”。
  24. Aerni 等,2024 年《JMLR》25:1–68“Generalization Bounds for Neural Networks”。
【学科经典思想汇集部分】1950–2006 · 20 条经典学科思想

以下二十条是机器学习理论在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。

经一、随机逼近:不必知道函数,也能一步步逼近它的根Classic 01 · Learning Theory

提出Herbert Robbins 与 Sutton Monro,1951 年《数理统计年刊》22:400–407。 流变步长条件此后成为随机优化的标准前提;其渐近正态理论只覆盖凸与光滑情形,深度网络上的行为至今没有对应结果。 今用本块庚「随机梯度的统计视角:噪声不只是优化误差」处理的正是这条老算法里那份噪声的另一重身份。 关键对只能带噪观测的方程,按平方可和而和发散的步长序列迭代,可几乎必然收敛到其根。

这条结果给出的是一个反直觉的许可:不需要精确的函数值,甚至不需要知道函数长什么样,只要每次观测在期望意义上指对方向,按合适的速度衰减步长,就能收敛。整个随机梯度下降的合法性来自这里,而不是来自任何关于神经网络的分析。

两条步长条件写得很硬:和发散保证走得够远,平方和收敛保证噪声被平均掉。今天的实践大量违反它——固定学习率、周期重启、大批量。这些做法有效,但它们的有效性不是这条定理给的,而是经验的。噪声在原框架里是需要被压掉的干扰,而现代视角把它当作起正则作用的一部分,这是一次身份翻转。

位置E——它把「带噪的迭代逼近」当成单独够用的那一样 预设〔01 噪声是待消除的干扰〕默认随机性只带来误差,不带来任何有益的选择偏向 量纲满足两条步长条件的实际训练设置数∶全部训练设置数 失效当噪声本身参与选择解的类型时,压掉噪声会改变最终解的性质,收敛保证与泛化效果指向相反 异名控制论称「自适应调节」,航海称「小步修正航向」;另见本块庚

经二、多重比较:看得越多,「显著」就越不值钱Classic 02 · Learning Theory

提出John Tukey,1953 年未刊稿《同时统计推断问题》,后收入其文集;Henry Scheffé 于 1953 年给出对应的置信区间方法。 流变校正方法成为统计学标准;而「看了多少次」在真实分析流程中往往无法追溯,于是校正常常无从做起。 今用本块辛「自适应数据分析:反复查看测试集会耗尽统计有效性」正是把这条老账搬到了留出集上。 关键当在同一批数据上作多次检验时,至少一次假阳性的概率随检验次数迅速上升,须对显著性水平作相应校正。

这条道理简单到几乎是算术:每次检验有百分之五的假阳性率,做二十次就几乎必有一次。困难在于「做了几次」这件事本身常常说不清——中途换过模型、删过异常点、试过别的变量,这些都算检验,而它们通常不进论文,也不进任何可被审计的记录。

留出集把同一问题带到了机器学习。整个共同体在同一批测试数据上反复调参,每一次调整都消耗一点统计有效性,而没有人在记账。自适应数据分析这一支的贡献,是把「消耗了多少」变成可以量化并给出预算的东西——这正是六十年前那条校正在群体尺度上的版本。

位置S——它把「一次检验的显著性水平」当成单独够用的那一样 预设〔02 检验次数可被如实计数〕默认分析过程中的全部比较都会被记录并纳入校正 量纲论文中报告的检验次数∶分析过程中实际发生的比较次数 失效当探索性操作不留痕迹时,校正无从计算,报告的显著性系统性高估 异名科研伦理称「事后假设」,赌场称「多次下注总有一次中」;另见本块辛

经三、随机图的相变:某个密度之上,整块结构忽然连起来了Classic 03 · Learning Theory

提出Paul Erdős 与 Alfréd Rényi,1960 年《匈牙利科学院数学研究所公报》5:17–61。 流变阈值现象成为组合与统计物理的共同语言;而「跳跃是真实的还是被观察方式造出来的」这一问在有限尺度下始终难判。 今用本块九「涌现争论:离散指标可把平滑变化画成突然跳跃」处理的正是同一件事——跳跃到底属于系统还是属于尺子。 关键随机图的许多整体性质在边密度越过某个阈值时几乎必然由不成立变为成立,转变发生在极窄的窗口内。

它给出的图像很强:连通性、巨型分支、子图出现,都不是随密度平滑增长,而是在一个阈值附近骤然发生。这条结果把「突变」从修辞变成了可以证明的数学事实,也给了后来一切「涌现」讨论一个严格的参照原型。

严格之处也是它的限制。相变是渐近的——在有限规模下,那条陡峭的曲线其实是光滑的,而画得多陡取决于横轴怎么取、指标怎么定。今天关于大模型能力是否「涌现」的争论,核心恰恰在此:把连续的对数似然改成离散的正确率,一条平滑上升的曲线就会显示成一次跳跃。判断跳跃真伪必须先固定指标。

位置D——它把「阈值处的骤变」当成单独够用的那一样 预设〔03 观察到的跳跃属于系统〕默认指标上的突变反映被测对象本身的不连续 量纲用连续指标测得的变化速率∶用离散指标测得的同一变化的陡度 失效当指标本身含阈值化操作时,任何平滑变化都可被画成跳跃,突变性由度量而非对象决定 异名统计物理称「有限尺度标度」,新闻业称「阈值制造的突发」;另见本块九

经四、正则化:解不稳定的时候,往目标里加一条偏好Classic 04 · Learning Theory

提出Andrey Tikhonov,1963 年《苏联科学院院刊》151:501–504。 流变由不适定反问题扩展到统计学与机器学习;惩罚项的选择长期被当作技术细节,直到稀疏惩罚显示不同范数给出完全不同的解结构。 今用本块丙「高维Lasso:变量多于样本时仍可做稀疏选择」正是换一种范数带来的整套新性质。 关键对不适定问题,在拟合项之外加一个对解本身的惩罚,可使解唯一且对数据扰动稳定。

它处理的是一类根本困难:观测不足以确定解,微小噪声导致解剧烈变化。加惩罚等于承认「光靠数据定不下来」,并把补足的那部分明写成对解的偏好。这一步之后,「先验」从哲学问题变成了目标函数里的一项。

惩罚形式带来的差别远大于当初的预期。二范数惩罚把系数压小但都不为零,一范数惩罚则会把一批系数精确压到零,从而同时完成选择与估计。同一个框架,换一种范数就换了一类可解问题。这提示:正则项不是「稳定化的技术手段」,它规定了解的形态,因而必须像模型假设那样被声明与检验。

位置S——它把「一个惩罚项」当成单独够用的那一样 预设〔04 惩罚只影响稳定性〕默认正则化只是让解变稳,不改变解的结构性质 量纲不同范数惩罚下非零系数的个数∶变量总数 失效当惩罚的几何形状决定解落在何处时,正则项是模型假设而非数值技巧,选错即选错了模型 异名贝叶斯统计称「先验分布」,工程学称「设计约束」;另见本块丙

经五、核技巧:不必真的把数据搬到高维去Classic 05 · Learning Theory

提出Mark Aizerman、Emmanuil Braverman 与 Lev Rozonoer,1964 年《自动化与远程控制》25:821–837;表示定理由 George Kimeldorf 与 Grace Wahba 于 1971 年给出。 流变使非线性学习获得凸优化保证;其计算代价随样本数平方增长,在大数据时代被随机特征与深度表示取代。 今用本块四「神经切线核:无限宽网络在训练初期近似核回归」是这条老工具与深层网络之间意外的接口。 关键若算法只通过内积使用数据,则可用核函数替换内积,从而隐式地在高维特征空间中工作而不必显式构造它。

这一步的漂亮在于它把「表示能力」与「计算代价」解耦了:特征空间可以是无穷维,而计算量只取决于样本数。加上表示定理保证最优解落在训练点张成的子空间里,整个非线性学习问题就变回了有限维的凸问题。

代价随样本数增长。核矩阵是样本数的平方,求解常是立方,几万个样本就吃不下。深度学习兴起后,这条路线一度被视为过去式;而无限宽网络在训练初期等价于一个特定核的结果,又把它接了回来——不是作为方法,是作为分析工具。旧工具的第二次生命常常是换了身份——从「用来算」变成「用来解释别的东西为什么算得动」。

位置E——它把「内积可被替换」当成单独够用的那一样 预设〔05 表示能力与计算代价可分离〕默认高维特征不必付出与维度相称的计算 量纲核矩阵的存储与求解代价∶样本数 失效当样本数达到百万量级时,平方与立方代价使方法不可用,表示能力再强也不能兑现 异名数学物理称「格林函数」,会计学称「隐性成本转移」;另见本块四

经六、通用归纳:最好的预测器可以被定义,但算不出来Classic 06 · Learning Theory

提出Ray Solomonoff,1964 年《信息与控制》7:1–22 与 7:224–254。 流变其最优性有严格证明而不可计算;实践中只能取各种可计算的近似,压缩即预测这一思路由此进入信息论与学习理论。 今用本块十一「上下文学习理论:提示示例可诱导隐式算法」争的正是「一个通用预测器如何在给定上下文中挑出规律」。 关键对任意可计算的数据生成过程,以程序长度为先验的贝叶斯混合预测器的误差有界,且该界不依赖于具体过程。

这条结果给出了一个理论上的天花板:存在一个不需要针对任务调整的预测器,它对所有可计算规律都最终学得好。它同时把「简单」定义清楚了——最短程序长度,而不是人类觉得简洁。奥卡姆剃刀第一次有了形式版本。

它不可计算,因而永远只能被近似。这个「可定义而不可达」的位置极有用:它给了一把尺子,让人能问「某个可计算方法离理想差在哪」。压缩率作为学习效果的代理、最短描述作为模型选择准则,都是这条思路的可计算投影,而每一次投影都要付出一次代价——限定假设类、限定编码方案、限定可搜索的程序集合,通用性就在这些地方一点点漏掉。

位置S——它把「以程序长度为先验」当成单独够用的那一样 预设〔06 理想标准可被有效近似〕默认不可计算的最优解总有实用价值的可计算逼近 量纲理想预测器的误差界∶可计算近似实际达到的误差 失效当近似必须限定假设类才能计算时,通用性丧失,而丧失多少无法由该理论本身回答 异名科学哲学称「奥卡姆剃刀的形式化」,导航称「不可达的真北」;另见本块十一

经七、奇异值分解的数值算法:低秩逼近第一次真的能算Classic 07 · Learning Theory

提出Gene Golub 与 William Kahan,1965 年《工业与应用数学学会杂志 B 辑》2:205–224。 流变成为数值线性代数的支柱;其对缺失数据的无能为力,直到低秩矩阵完成的凸松弛出现才被绕开。 今用本块丁「矩阵完成:低秩结构把缺失表格变成可恢复对象」正是在有缺失时重新问同一个问题。 关键任意矩阵可稳定地分解为奇异值形式,其截断给出在谱范数与弗罗贝尼乌斯范数下的最优低秩逼近。

最优低秩逼近这条结论早就有,真正改变局面的是能稳定算出来。这项算法让主成分分析、潜在语义分析、推荐系统的早期方法都成为工程上可行的事。「先降到低秩,再在低秩上做事」这条路线的地基就在这里,且它的稳定性有严格的扰动界撑着。

它有一个硬前提:矩阵是完整的。一旦有缺失,最优低秩逼近变成非凸问题,经典算法无从下手。矩阵完成的贡献是证明了在合适的采样与相干性条件下,用核范数这个凸代理可以精确恢复——问题没有变简单,是换了一个可解的等价形式,代价是多出了一组必须检查的条件,而这些条件在真实数据上是否成立,通常无法直接验证。

位置D——它把「完整矩阵的最优低秩逼近」当成单独够用的那一样 预设〔07 数据矩阵是完整的〕默认所有条目均可观测,缺失只是需要预先填补的杂事 量纲可观测条目的比例∶精确恢复所需的最低采样比例 失效当缺失非随机且与取值相关时,采样条件不成立,恢复结果系统性偏向被观测到的那一部分 异名测绘称「控制点覆盖」,统计学称「非随机缺失」;另见本块丁

经八、k 均值:交替最小化,简单到几乎不像个算法Classic 08 · Learning Theory

提出Stuart Lloyd 于 1957 年在贝尔实验室内部报告中提出,1982 年正式刊出;James MacQueen 于 1967 年在伯克利数理统计与概率研讨会论文集第 1 卷 281–297 中独立给出并命名。 流变其局部最优与初值敏感被反复研究;带保证的初始化直到二〇〇七年才出现,而算法本身从未改变。 今用本块己「非凸矩阵分解:交替最小化也能获得恢复保证」延续的正是这条「固定一半、优化另一半」的老套路。 关键把聚类问题写成中心与分配的联合优化,交替固定一方最优化另一方,每步不增加目标值。

它是交替最小化这一整类方法的原型:一个联合优化难解,但固定一半之后另一半有闭式解,于是来回迭代。这个模式此后出现在矩阵分解、期望最大化、生成对抗训练里,形式各异而骨架相同。它的普及程度说明「可分块」这一结构比凸性更常见也更好用。

单调下降不等于收敛到好解——它只保证不变坏。初值决定结果,而不同初值的结果可以差很远。这个缺陷五十年里没有被算法本身修正,是被初始化策略绕开的。这提示一条通用经验:当算法保证只是单调性时,真正决定结果的往往是初始化,而初始化常被当作实现细节写在附录里。

位置E——它把「交替单调下降」当成单独够用的那一样 预设〔08 单调下降蕴含解质量〕默认目标值不断降低意味着逼近了好的解 量纲不同初值下收敛到的目标值范围∶全局最优目标值 失效当目标面多局部极小时,单调性对解的质量不提供任何信息,结果由初始化而非算法决定 异名优化理论称「块坐标下降」,工程学称「逐项调试」;另见本块己

经九、采样密度的必要条件:Nyquist 那条线不是唯一的线Classic 09 · Learning Theory

提出Henry Landau,1967 年《数学学报》117:37–52。 流变其密度条件对带限信号是紧的;而「信号必须带限」这一前提在结构化稀疏信号上被压缩感知整体绕开。 今用本块甲「压缩感知:稀疏性让欠定问题获得精确恢复保证」正是换一种结构假设之后的重新计价。 关键对频谱支撑在给定集合上的信号,稳定采样所需的平均密度有一个由该集合测度决定的下界。

这条结果把采样定理推到了一般情形:不必是低通信号,任何已知频谱支撑的信号都有一个密度下界,且这个界是紧的——低于它必然失稳。它把「要采多少点」从工程经验变成了由信号结构决定的量。

压缩感知没有推翻它,是换了结构假设。带限说的是频谱集中在一块已知区域,稀疏说的是能量集中在少数未知位置。后一种假设更弱也更贴近真实信号,而恢复保证的代价从「密度」变成了「测量矩阵的性质加非线性重建」。这一条示范了一件事:一个界的紧性总是相对于它的前提而言的,换前提就换界。

位置S——它把「频谱支撑已知」当成单独够用的那一样 预设〔09 结构假设唯一〕默认对信号的先验只能是带限这一种形式 量纲带限假设下所需的采样密度∶稀疏假设下所需的测量次数 失效当信号的结构是稀疏而非带限时,按带限计算的采样量大幅过剩,而按带限设计的重建无法利用稀疏 异名测量学称「采样充分性」,地质勘探称「测线间距」;另见本块甲

经十、一致收敛与 VC 维:多复杂的模型才算太复杂Classic 10 · Learning Theory

提出Vladimir Vapnik 与 Alexey Chervonenkis,1971 年《概率论及其应用》16:264–280。 流变其界对经典模型类给出有用的数值;对深度网络则给出远大于一的空洞界,与实际泛化表现完全脱节。 今用本块一「双下降:插值阈值把一条U形风险曲线折成两段」正是这条界的图像被经验推翻的那一处。 关键经验误差一致收敛到真实误差的速率由假设类的 VC 维控制,与数据分布无关。

这条定理奠定了统计学习理论:泛化不再靠直觉,而由假设类的一个组合量控制,且对任何分布成立。它把「模型太复杂会过拟合」从经验说法变成了可以算出上界的命题,也给出了「样本量该多大」的第一个原则性答案。

分布无关这条优点在深度学习上变成了缺点。深网的 VC 维极大,界给出的泛化误差上界远超一,因而不提供任何信息;而实际泛化很好。理论没有错——它是上界,上界松不构成反例。但它也确实不再有解释力,于是必须换成依赖数据与算法的分析。一条正确而空洞的界,比错误的界更难被察觉。

位置D——它把「假设类的组合复杂度」当成单独够用的那一样 预设〔10 分布无关是优点〕默认对任何分布都成立的界在实际问题上仍有信息量 量纲该界给出的泛化误差上界∶实测的泛化误差 失效当上界远超一时,定理仍然成立而不提供任何约束,正确性与解释力分离 异名工程学称「过于保守的安全系数」,法学称「宽泛到无法适用的条款」;另见本块一

经十一、模式分类的教科书化:一门手艺被写成一套可教的框架Classic 11 · Learning Theory

提出Richard Duda 与 Peter Hart,1973 年《模式分类与场景分析》(Wiley)。 流变其贝叶斯决策—参数估计—非参数方法的组织方式沿用至今;而书中以低维特征为主的设定与高维表示时代的现象之间有明显断层。 今用本块十「神经崩塌:训练末期类内表示收缩并形成对称几何」讨论的正是这套框架里的判别几何在深层表示上的新形态。 关键分类问题可统一组织为贝叶斯决策理论下的密度估计与判别函数设计,各类方法是同一框架的不同近似。

这本书做的是给一门散乱的手艺立骨架:先讲最优决策该是什么,再讲各种方法是对它的哪一种近似。这个次序让学习者能判断一个新方法在框架里的位置,而不是记住一堆技巧。此后几十年的课程与术语基本沿用它,连「特征提取—分类器设计」这个分工也是它定下的。

断层出现在维度上。书里的直觉建立在低维特征空间——类条件密度、决策边界、距离度量都是可画出来的。高维表示里这些直觉大量失效:距离趋于同质、密度估计不可行,而分类反而更容易。神经崩塌那类现象——类内塌成一点、类间构成对称结构——在低维图像里根本想不出来。

位置E——它把「贝叶斯决策的统一框架」当成单独够用的那一样 预设〔11 低维直觉可外推〕默认在二三维中画出的决策图景在高维仍然成立 量纲框架中依赖密度估计的方法数∶在高维下仍可执行密度估计的方法数 失效当维度使距离同质化且密度不可估时,框架仍自洽而其中多数方法不可用,直觉反向 异名教育学称「教材的路径依赖」,制图学称「小比例尺经验用于大比例尺」;另见本块十

经十二、交叉验证:用同一批数据既训练又评估,怎样才不作弊Classic 12 · Learning Theory

提出Mervyn Stone,1974 年《皇家统计学会杂志 B 辑》36:111–133;Seymour Geisser 同年给出平行工作。 流变成为模型选择的默认工具;其在时间序列、分组数据与特征选择流程中的误用,是应用统计中最持久的错误来源之一。 今用本块戊「算法稳定性:泛化也可来自删掉一个样本时解变化很小」正是把留一法从评估工具改造成了分析工具。 关键把数据反复划分为训练与验证两部分,用验证部分的平均误差估计模型在新数据上的表现。

它解决的是一个循环困境:想估计模型对新数据的表现,而新数据没有。留出一部分假装它是新的,反复轮换取平均,就得到一个近乎无偏的估计。这个想法极其通用,几乎不依赖模型形式,也不需要任何分布假设,因而横扫了整个应用领域。

误用同样普遍,且都出在「留出的那部分是否真的独立」上。用全部数据先做特征筛选再交叉验证,特征筛选已经看过验证集;时间序列上随机划分,未来的信息漏进了过去;同一病人的多张影像分到两侧,模型只需认人不必认病。这三种错误各自能把估计的准确率抬高十几个百分点,而流程看上去完全规范,代码也跑得通。

位置S——它把「留出部分的平均误差」当成单独够用的那一样 预设〔12 划分保证独立〕默认按样本随机划分即可使两部分互不泄露信息 量纲交叉验证给出的准确率∶在真正独立数据上的准确率 失效当划分未隔离个体、时间或预处理步骤时,估计系统性偏高而流程外观完全合规 异名审计学称「自我评价的独立性」,考试制度称「考前泄题」;另见本块戊

经十三、结构风险最小化:在拟合与复杂度之间明写一条取舍曲线Classic 13 · Learning Theory

提出Vladimir Vapnik 与 Alexey Chervonenkis 于 1974 年在《模式识别理论》(Nauka)中提出;英文系统表述见 Vapnik 1982 年的专著。 流变为模型选择提供了原则性依据;其嵌套假设类的设定与「按预算共同扩大模型和数据」这一现代做法不完全吻合。 今用本块八「缩放律:经验幂律成为预算预测而非机制解释」给出的正是这条取舍在算力预算下的经验形态。 关键在一列复杂度递增的嵌套假设类中,应选择使经验误差与复杂度惩罚之和最小的那一类,而非经验误差最小的那一类。

它把模型选择从「试哪个准」变成了一个有目标函数的问题:把置信项与经验项加起来最小化。这一步的方法论意义很大——它承认了「在训练集上更准」本身不是选择依据,必须付出复杂度的价钱,而价钱可以被算出来。

现代实践与它形状相似而口径不同。缩放律给的不是复杂度惩罚,而是「在给定算力下模型与数据该按什么比例增长」的经验关系;它预测的是损失值而不是泛化间隙,且完全不带机制解释。两者都在做取舍,但一个由理论界推出,一个由拟合实测曲线得来——当预算成为主约束时,可预测性比可解释性先被需要。

位置D——它把「经验误差加复杂度惩罚」当成单独够用的那一样 预设〔13 复杂度可先验排序〕默认假设类能被排成一列复杂度递增的嵌套序列 量纲理论惩罚项预测的最优容量∶按算力预算实测得到的最优容量 失效当模型族不构成嵌套序列且惩罚项远松于实际时,取舍曲线的最低点与实测最优点不重合 异名工程学称「按成本函数选型」,投资学称「风险调整后收益」;另见本块八

经十四、最小描述长度:把模型和数据一起压缩,谁压得短选谁Classic 14 · Learning Theory

提出Jorma Rissanen,1978 年《自动化》14:465–471。 流变与贝叶斯模型选择在多数情形下等价;其对编码方案的依赖使「描述长度」不是一个绝对量,这一点常被忽略。 今用本块六「平坦极小值清算:坐标重参数化会改变“平坦”读数」揭示的正是同一种依赖——读数随描述方式改变。 关键最好的模型是使「模型的编码长度加上给定模型后数据的编码长度」之和最小的那一个。

这条准则把奥卡姆剃刀变成了可计算的东西,而且不需要引入先验概率的语言:学习就是压缩,压得越短说明抓到的规律越多。它把模型选择、正则化与信息论接到了一起,也给了「过拟合」一个直观解释——记住噪声不会让总长度变短。

它自带一处必须声明的相对性:描述长度依赖于编码方案,换一套编码,谁更短就可能翻转。这不是缺陷,是它的性质——不存在与语言无关的简单性。平坦极小值那场争论是同一件事的重演:一个解看起来平坦还是尖锐,取决于参数怎么标定,而重参数化可以随意改变这个读数。凡是依赖描述方式的量,报数时必须连描述方式一起报。

位置S——它把「总编码长度」当成单独够用的那一样 预设〔14 简单性是绝对的〕默认存在与编码方案无关的复杂度排序 量纲在一种编码下的模型排序∶换一种合理编码后的排序 失效当两种编码给出相反的排序时,「更简单」不是关于模型的判断而是关于语言的判断 异名语言学称「描述的相对性」,会计学称「计量口径决定盈亏」;另见本块六

经十五、可能近似正确:把「学会了」写成一个可以验收的规格Classic 15 · Learning Theory

提出Leslie Valiant,1984 年《ACM 通讯》27:1134–1142。 流变其分布无关与最坏情形设定被认为过严;不可知学习、贝叶斯与在线学习各自放宽了其中一条。 今用本块乙「PAC-Bayes复兴:先验、后验与经验误差共同给出泛化界」正是把先验重新装回这个框架的一次修正。 关键一个概念类可学,当且仅当存在算法能以高概率在多项式时间与样本内输出误差小于给定阈值的假设。

这条定义的贡献是把学习变成了可验收的工程规格:说清楚要多准、要多大把握、允许用多少样本与多少时间。此前「机器能不能学会」是个含糊的问题,此后它有了明确的成立与不成立,可以证明也可以证否。

它的严格设定同时是它的局限:对分布不作任何假设、按最坏情形计价,于是很多现实中容易的问题在框架里不可学。PAC-Bayes 的修正是把先验放回来——不再要求对所有分布一致好,而是承认我们对哪些假设更可信,从而给出更紧也更贴合实际的界。这是一次典型的松绑:放弃普遍性,换回信息量。

位置E——它把「最坏情形下的可学性」当成单独够用的那一样 预设〔15 分布无关的规格有实用意义〕默认对最坏分布成立的保证在实际分布上也是有用的 量纲框架内被判为可学的概念类数∶实践中被成功学习的概念类数 失效当最坏分布远离实际分布时,不可学的判定不构成实践障碍,而可学的保证过于宽松 异名软件工程称「验收标准」,保险业称「最坏情形定价」;另见本块乙

经十六、奥卡姆定理:压得下来,就学得会Classic 16 · Learning Theory

提出Anselm Blumer、Andrzej Ehrenfeucht、David Haussler 与 Manfred Warmuth,1987 年《信息处理快报》24:377–380。 流变其结论在概念类有限或维度受控时成立;插值学习与提升方法给出的经验反例,使「简单才泛化」这条直觉需要重新限定。 今用本块二「良性过拟合:把训练噪声插值也能接近最优风险」正是这条直觉最直接的一次反例。 关键若一个算法能把样本压缩为显著短于样本本身的假设描述,则该假设以高概率具有低泛化误差。

这条定理把「简单」与「泛化」之间的直觉连接做成了证明:压缩即学习,而且给出了压缩比与泛化误差的定量关系。它是「先压缩再预测」这一整套思路在统计学习理论中的正式依据,也长期被当作正则化的理论辩护。

反例出在另一头。插值学习的模型参数量远超样本数,完全没有压缩,却能达到接近最优的风险;提升方法在训练误差归零后继续训练,测试误差还在下降。这些不推翻定理——定理是充分条件不是必要条件。但它们表明「不简单就不会泛化」这条常被当成推论的说法从来不成立,而它曾经指导过大量模型选择实践。

位置S——它把「描述的压缩比」当成单独够用的那一样 预设〔16 压缩是泛化的必要条件〕默认不能被压缩的假设一定不能泛化 量纲假设描述长度∶样本描述长度 失效当模型参数量远超样本数却仍泛化良好时,压缩不是必要条件,而充分条件被误用为判据 异名逻辑学称「充分条件被当作必要条件」,工艺称「精简未必更牢」;另见本块二

经十七、存储容量的统计力学计算:物理学家算出了感知机能记多少Classic 17 · Learning Theory

提出Elizabeth Gardner,1988 年《物理学杂志 A 辑》21:257–270。 流变其副本方法给出的容量与泛化曲线后被严格证明;这条路线长期被主流机器学习忽视,直到宽网络的均场分析重新用上它。 今用本块五「均场极限:宽网络也可看作参数分布的动力系统」正是这条统计力学路线的当代延续。 关键随机模式下感知机可存储的模式数与权重数之比有一个精确的临界值,可用统计力学的副本方法算出。

这项工作的方法论意义大于结论:它把学习问题当成一个有大量自由度的物理系统,问的不是最坏情形而是典型情形。典型情形分析给出的是精确的数值与相变位置,而不是宽松的上界——同一个问题,换一套数学工具,答案的形态完全不同。

它被主流忽视了二十多年,原因之一是副本方法当时缺乏严格性,另一原因是学科语言不通。这条经典因此还有一层用处:它记录了一次因方法论传统不同而造成的长期错过。今天的均场分析、无限宽极限、随机矩阵理论,用的都是这条线上的工具,而其中不少结论在二三十年前就以另一种记号存在过。

位置D——它把「典型情形的精确解」当成单独够用的那一样 预设〔17 最坏情形分析是唯一严格路径〕默认没有分布假设的界才算可靠结论 量纲最坏情形界给出的容量估计∶典型情形分析给出的临界容量 失效当最坏情形远离实际分布时,其界失去信息量,而典型情形的精确解需要分布假设作为代价 异名统计物理称「自平均性」,工程学称「按典型工况设计」;另见本块五

经十八、最大间隔与支持向量机:在无数条分界线里挑一条最宽的Classic 18 · Learning Theory

提出Bernhard Boser、Isabelle Guyon 与 Vladimir Vapnik,1992 年计算学习理论年会论文集 144–152;软间隔版本由 Corinna Cortes 与 Vapnik 于 1995 年给出。 流变凸性与间隔界使它成为一代默认方法;核矩阵的平方代价与特征工程依赖使它在大规模问题上退居其次。 今用本块三「隐式偏置:优化器在无数零误差解中偏向特定方向」正是把「挑哪一条」这件事从显式目标改成了优化器的自发倾向。 关键在所有能分开训练数据的超平面中,选择间隔最大的那一个,可使泛化误差界只依赖间隔而不依赖维度。

它给出的是一个明确的选择原则:数据可分时解有无穷多,凭什么挑?答案是挑间隔最大的,而这一选择有泛化界支撑,且优化问题是凸的、有唯一解。原则清楚、计算可靠、理论有保证,三者齐备在机器学习里并不常见。

深度网络把这个问题重新提了一遍,答案却变了形式。网络参数远多于样本,零训练误差的解有无穷多,而梯度下降总是收敛到其中某一类。这个偏向不是写在目标函数里的,是优化算法与初始化共同带来的。同一个「挑哪一条」的问题,一次由显式目标回答,一次由隐式动力学回答——后者难得多,因为它不在你写下的东西里。

位置E——它把「最大间隔」当成单独够用的那一样 预设〔18 选择原则须显式写出〕默认解的选取只能由目标函数与约束决定 量纲显式目标函数决定的解∶算法与初始化共同决定的解 失效当零误差解构成连续集合时,最终解由优化动力学选出,显式目标不再唯一确定结果 异名几何学称「最大内接球」,法学称「解释规则的选择」;另见本块三

经十九、提升方法的间隔解释:训练误差归零之后,为什么还在变好Classic 19 · Learning Theory

提出Robert Schapire、Yoav Freund、Peter Bartlett 与 Wee Sun Lee,1998 年《统计年刊》26:1651–1686。 流变间隔解释被后续研究部分质疑,替代解释(自平均、隐式正则)并存;但「零训练误差之后继续改善」这一经验事实从未被推翻。 今用本块七「Grokking理论:权重衰减推动从记忆解迁到结构解」处理的正是同一类「拟合完成之后才发生的事」。 关键提升方法在训练误差降为零后继续训练,测试误差仍会下降,因为间隔分布持续改善。

这是统计学习理论史上最重要的一次经验挑战:按当时的复杂度理论,训练误差为零之后继续增加轮数只会过拟合,而实测相反。间隔解释给出的答案是——训练误差看不见的东西,间隔分布看得见:模型在把每个样本推得离边界更远。

这条解释后来并未获得一致接受,替代说法陆续出现。但它开辟的问法沿用至今:当一个指标已经饱和,就必须换一个更细的量来看模型还在改变什么。Grokking 是这条问法在深度学习上最戏剧化的形态——训练误差归零之后再训练几个数量级的步数,泛化才突然出现。指标饱和不等于学习停止。

位置S——它把「训练误差」当成单独够用的那一样 预设〔19 训练误差归零即学习完成〕默认拟合完毕之后模型不再发生有意义的变化 量纲训练误差归零所需的轮数∶测试误差停止改善所需的轮数 失效当两个轮数相差数量级时,以训练误差为停止判据会在学习真正完成之前停机 异名教育学称「熟练之后的自动化」,体育训练称「达标之后的精雕」;另见本块七

经二十、保形预测:不假设模型正确,也能给出有效的区间Classic 20 · Learning Theory

提出Vladimir Vovk、Alexander Gammerman 与 Glenn Shafer,2005 年《随机世界中的算法学习》(Springer)。 流变其有限样本覆盖保证只依赖可交换性;一旦数据存在分布漂移或时间依赖,保证即失效,条件覆盖也无法免费获得。 今用本块十二「保形预测:有限样本覆盖率不要求模型正确」正是这套方法在深度模型时代的落地。 关键只要数据可交换,就可由任意预测器构造出具有精确有限样本边际覆盖率的预测集合,无需模型正确。

这条结果的位置很特别:它不要求模型对,只要求数据可交换。任何模型——好的坏的、可解释的黑箱的——都能被包装成一个带覆盖保证的预测集。不确定性量化因此第一次与模型质量脱钩,这在实践上极有价值。

要看清它给的是什么:边际覆盖,即在全体上平均达标;不是条件覆盖,即对每个子群都达标。两者差别在高风险场合极大——整体百分之九十的覆盖率完全可以由某些子群百分之百、另一些子群百分之六十拼出来。可交换性也是一条真前提:时间序列、分布漂移、非随机采样,任何一条不成立,保证就随之消失。

位置D——它把「边际覆盖率」当成单独够用的那一样 预设〔20 边际覆盖足以担保使用〕默认整体上达标的覆盖率对各个子群同样成立 量纲整体覆盖率∶最差子群的覆盖率 失效当子群之间的覆盖率差异很大时,整体保证成立而对特定人群的使用不受任何保护 异名精算学称「平均费率掩盖分层风险」,公共卫生称「总体达标掩盖不平等」;另见本块十二

◎ 这一层怎么用

先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。

三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(Fisher 的判别分析、Shannon 一九四九年的采样定理、Wald 的统计决策论)只在提出栏与流变栏里被点名其历史位置。其二,经典身份不提供豁免——本层有四条今天已被明确收窄:VC 界在深度网络上正确而空洞、奥卡姆定理的充分条件被长期误用为必要条件、最小描述长度依赖编码方案因而不是绝对量、结构风险最小化的嵌套假设类设定与按算力预算共同扩张的现代做法不吻合。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。

本层四条路的落点:机制路(随机逼近、正则化、核技巧、k 均值、奇异值分解)问「靠什么算得出来」;测量路(VC 维、交叉验证、最小描述长度、奥卡姆定理、保形预测)问「凭什么说它会泛化」;制度路(结构风险最小化、可能近似正确、模式分类教科书、采样密度、随机图相变)问「按什么共同规格验收」;人的路(多重比较、通用归纳、统计力学容量、最大间隔、提升方法的间隔解释)问「一个标准由谁定、代价由谁承担」。⚠ 这门学科反复出现的母题是一个读数随描述方式而变,却常被当作对象的性质来报——最小描述长度依赖编码、平坦依赖参数化、涌现依赖指标是否阈值化、简单性依赖语言。凡遇到这一族,报数时必须连口径一起报。

◎ 经典层资料核验

  1. Robbins, H. and Monro, S. A stochastic approximation method. Annals of Mathematical Statistics 22 (1951): 400–407。
  2. Kushner, H. J. and Yin, G. G. Stochastic Approximation and Recursive Algorithms and Applications. New York: Springer, 2003(专著)。
  3. Tukey, J. W. The Problem of Multiple Comparisons. Princeton University, 1953(专著)。
  4. Scheffé, H. A method for judging all contrasts in the analysis of variance. Biometrika 40 (1953): 87–104。
  5. Erdős, P. and Rényi, A. On the evolution of random graphs. Publications of the Mathematical Institute of the Hungarian Academy of Sciences 5 (1960): 17–61。
  6. Bollobás, B. Random Graphs. London: Academic Press, 1985(专著)。
  7. Tikhonov, A. N. Solution of incorrectly formulated problems and the regularization method. Soviet Mathematics Doklady 151 (1963): 501–504。
  8. Tikhonov, A. N. and Arsenin, V. Y. Solutions of Ill-Posed Problems. Washington: Winston, 1977(专著)。
  9. Aizerman, M. A., Braverman, E. M. and Rozonoer, L. I. Theoretical foundations of the potential function method. Automation and Remote Control 25 (1964): 821–837。
  10. Kimeldorf, G. and Wahba, G. Some results on Tchebycheffian spline functions. Journal of Mathematical Analysis and Applications 33 (1971): 82–95。
  11. Schölkopf, B. and Smola, A. J. Learning with Kernels. Cambridge, MA: MIT Press, 2002(专著)。
  12. Solomonoff, R. J. A formal theory of inductive inference, Parts I and II. Information and Control 7 (1964): 1–22, 224–254。
  13. Li, M. and Vitányi, P. An Introduction to Kolmogorov Complexity and Its Applications. New York: Springer, 1997(专著)。
  14. Golub, G. and Kahan, W. Calculating the singular values and pseudo-inverse of a matrix. SIAM Journal on Numerical Analysis 2 (1965): 205–224。
  15. Golub, G. H. and Van Loan, C. F. Matrix Computations. Baltimore: Johns Hopkins University Press, 1983(专著)。
  16. MacQueen, J. Some methods for classification and analysis of multivariate observations. Proceedings of the Fifth Berkeley Symposium 1 (1967): 281–297。
  17. Lloyd, S. P. Least squares quantization in PCM. IEEE Transactions on Information Theory 28 (1982): 129–137。
  18. Landau, H. J. Necessary density conditions for sampling and interpolation of certain entire functions. Acta Mathematica 117 (1967): 37–52。
  19. Vapnik, V. N. and Chervonenkis, A. Y. On the uniform convergence of relative frequencies of events to their probabilities. Theory of Probability and Its Applications 16 (1971): 264–280。
  20. Vapnik, V. N. Estimation of Dependences Based on Empirical Data. New York: Springer, 1982(专著)。
  21. Vapnik, V. N. Statistical Learning Theory. New York: Wiley, 1998(专著)。
  22. Duda, R. O. and Hart, P. E. Pattern Classification and Scene Analysis. New York: Wiley, 1973(专著)。
  23. Stone, M. Cross-validatory choice and assessment of statistical predictions. Journal of the Royal Statistical Society B 36 (1974): 111–133。
  24. Geisser, S. The predictive sample reuse method with applications. Journal of the American Statistical Association 70 (1975): 320–328。
  25. Rissanen, J. Modeling by shortest data description. Automatica 14 (1978): 465–471。
  26. Grünwald, P. D. The Minimum Description Length Principle. Cambridge, MA: MIT Press, 2007(专著)。
  27. Valiant, L. G. A theory of the learnable. Communications of the ACM 27 (1984): 1134–1142。
  28. Kearns, M. J. and Vazirani, U. V. An Introduction to Computational Learning Theory. Cambridge, MA: MIT Press, 1994(专著)。
  29. Blumer, A., Ehrenfeucht, A., Haussler, D. and Warmuth, M. K. Occam’s razor. Information Processing Letters 24 (1987): 377–380。
  30. Gardner, E. The space of interactions in neural network models. Journal of Physics A 21 (1988): 257–270。
  31. Engel, A. and Van den Broeck, C. Statistical Mechanics of Learning. Cambridge: Cambridge University Press, 2001(专著)。
  32. Boser, B. E., Guyon, I. M. and Vapnik, V. N. A training algorithm for optimal margin classifiers. Proceedings of COLT (1992): 144–152。
  33. Cortes, C. and Vapnik, V. Support-vector networks. Machine Learning 20 (1995): 273–297。
  34. Schapire, R. E., Freund, Y., Bartlett, P. and Lee, W. S. Boosting the margin. Annals of Statistics 26 (1998): 1651–1686。
  35. Schapire, R. E. and Freund, Y. Boosting: Foundations and Algorithms. Cambridge, MA: MIT Press, 2012(专著)。
  36. Vovk, V., Gammerman, A. and Shafer, G. Algorithmic Learning in a Random World. New York: Springer, 2005(专著)。
  37. Bousquet, O. and Elisseeff, A. Stability and generalization. Journal of Machine Learning Research 2 (2002): 499–526。
新思想前沿 · 第 47 号《学习理论》· 20 条现代思想 + 20 条 1950–2006 经典思想 · 双层资料核验 · 王德生 亲撰 · ← 回到 626 个领域总览