SDE Universes·新思想前沿数学与统计的其余主干
新思想前沿 · 数学与统计的其余主干

贝叶斯统计与计算

近二十年 · 两幕 · 20 个新思想 · 约 30,881 字 · 王德生 亲撰 · 2026 年 8 月

贝叶斯统计近二十年的关键变化,不是先验与后验的定义发生了变化,而是“后验已经算出来”这句话被拆成许多可审计承诺:似然是否可算、近似族是否失真、链是否探索尾部、模型是否只在候选集中相对更好、模拟诊断能否覆盖实现错误。第一幕发明了共享非参数结构、伪边际、ABC、粒子MCMC、随机变分和自动HMC;第二幕把损失更新、概率编程、复杂度先验、交叉验证、诊断与基准推到中心。共同标准由“得到样本”换成“每单位计算预算得到多少已校准信息”。选目从非参数先验、Hamiltonian动力学、近似贝叶斯计算和变分推断,推进到NUTS、概率编程、SBC、stacking与大数据MCMC清算。第一幕解决“复杂后验怎样表示和移动”,第二幕追问“近似后验是否校准、程序是否真的推到了声明分布”。这里不把运行成功等同于推断成功:链能走、ELBO能升、神经网络能拟合,都可能仍错在目标或尾部。每条因此同时登记计算代价与校准读数,使速度、精度和可信度不能互相冒名。阅读时应把每条的主证据年份、关键读数与失效条件连在一起,而不能把标题本身当作已经稳定的共识。

【第一幕】上一个十年 · 约 2006—2016

第一幕把“手工为每个模型造算法”的默认拆开:似然可以估计、数据可以分批、轨迹可以自适应、未知成分数可以由先验支持。从“层次狄利克雷过程:群组可共享未知数量的成分”到“NUTS:HMC轨迹长度可以在线自适应”,共同动作是把旧默认改写成可反驳的结构命题;主证据均在2016年前形成。

甲、层次狄利克雷过程:群组可共享未知数量的成分Hierarchical Dirichlet Processes

提出Yee Whye Teh、Michael Jordan、Matthew Beal与David Blei,2006年《Journal of the American Statistical Association》101(476):1566–1581,DOI:10.1198/016214506000000302,〈Hierarchical Dirichlet Processes〉 关键多个群组可在不知道主题或混合成分数的情况下,共享一组全局原子并保留各自不同权重

2006年前后,旧框架把问题压成一句话:“不同群组要么使用完全相同的有限混合成分,要么必须分别建模”。但算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“群组共享原子数/全部被占用原子数”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“群组共享原子数/全部被占用原子数”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

本条命题是:多个群组可在不知道主题或混合成分数的情况下,共享一组全局原子并保留各自不同权重。否证方式为:固定目标分布、近似族、计算预算与诊断规则,按“群组共享原子数/全部被占用原子数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Yee Whye Teh等在2006年〈Hierarchical Dirichlet Processes〉中的主结果给出主证据:论文构造“1个全局Dirichlet过程+多个以它为基测度的群组过程”2层先验,给出中国餐馆特许经营表示与Gibbs采样;在文本与基因表达中,模型自动使用有限但由数据决定的共享成分数。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“群组共享原子数/全部被占用原子数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:“无限”是先验支持而非样本中真的出现无穷成分;结果对浓度参数、基测度和可交换假设敏感,弱信号下成分数会被先验推动。失效条件为:当群组间不存在可共享的原子或观测顺序具有不可忽略结构时,层次DP的交换性框架会错设。收敛需统一对象与“群组共享原子数/全部被占用原子数”,并公开采样诊断、模拟校准和近似误差及最强反例。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“群组共享原子数/全部被占用原子数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:多任务学习称“共享字典”,生态学称“物种池”;另见第310号多层空间过程。共享预设为“不同群组要么使用完全相同的有限混合成分,要么必须分别建模”;先统一“群组共享原子数/全部被占用原子数”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置S——把『层次狄利克雷过程:群组可共享未知数量的成分』形成的对象结构作为首要显露 单因决定『层次狄利克雷过程:群组可共享未知数量的成分』当前结论的最小充分项只有:多个群组可在不知道主题或混合成分数的情况下,共享一组全局原子并保留各自不同权重 预设〔01 谁进入分母〕不同群组要么使用完全相同的有限混合成分,要么必须分别建模 量纲群组共享原子数/全部被占用原子数 失效失效边界是『群组间不存在可共享的原子或观测顺序具有不可忽略结构时,层次DP的交换性框架会错设』;越过该边界,相关条件越强,群组共享原子数反而越低 自曝『层次狄利克雷过程:群组可共享未知数量的成分』的原始材料只直接支持“YeeWhyeTeh等在2006年〈HierarchicalDirichletProcesses〉中的主结果给出主证据:论文构造“1个全局Diric”,没有自动覆盖边界外对象 空栏『层次狄利克雷过程:群组可共享未知数量的成分』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名多任务学习称“共享字典”,生态学称“物种池”;另见第 588 号第 13 条『空间转录组反应扩散』

乙、伪边际MCMC:似然估不准也能精确采后验Pseudo-Marginal MCMC

提出Christophe Andrieu与Gareth Roberts,2009年《The Annals of Statistics》37(2):697–725,DOI:10.1214/07-AOS574,〈The Pseudo-Marginal Approach for Efficient Monte Carlo Computations〉 关键只要似然估计非负且无偏把随机估计值放进MetropolisHastings接

在2009年前后的文献中,默认判断仍是“MCMC要精确,接受率中的似然必须被精确计算”。它没有处理算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“有效样本数/一次似然估计计算量”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“有效样本数/一次似然估计计算量”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

可以把命题写为:只要似然估计非负且无偏,把随机估计值放进Metropolis–Hastings接受率,扩展链的参数边际仍是精确后验。与口号不同,它预先承诺了失败方式:固定目标分布、近似族、计算预算与诊断规则,按“有效样本数/一次似然估计计算量”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Christophe Andrieu等在2009年〈The Pseudo-Marginal Approach for Efficient Monte Carlo Computations〉中的主结果提供了决定性证据。作者把每次1个无偏随机似然估计连同参数写入扩展状态,并证明扩展链的边际不变分布仍是精确后验;粒子滤波或重要抽样估计可替代不可得似然,精确性不要求估计方差趋于0。这里最有信息量的读数是“有效样本数/一次似然估计计算量”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

后续争论集中在:无偏不等于高效:对数似然估计方差过大时链会粘住,相关随机数与粒子数选择决定成本;负或有偏估计破坏理论。因此,本条并非无条件有效;当似然估计非正、存在系统偏差或方差大到链长期停留时不成立。收口所需的不是一句“仍需研究”,而是一套双方都可能失败的设计:统一对象、分母、反例族和资源预算,并让“有效样本数/一次似然估计计算量”在独立材料上接受复算。

另一处后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。最低报告责任包括“有效样本数/一次似然估计计算量”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:随机优化称“无偏梯度”,数值线性代数称“随机迹估计”;另见第309号粒子方法。只有“有效样本数/一次似然估计计算量”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置D——把『伪边际MCMC:似然估不准也能精确采后验』中的操作次序与变化路径作为首要显露 单因决定『伪边际MCMC:似然估不准也能精确采后验』当前结论的最小充分项只有:只要似然估计非负且无偏把随机估计值放进MetropolisHastings接 预设〔01 谁进入分母〕MCMC要精确,接受率中的似然必须被精确计算 量纲有效样本数/一次似然估计计算量 失效失效边界是『似然估计非正、存在系统偏差或方差大到链长期停留时不成立』;越过该边界,相关条件越强,有效样本数反而越低 自曝『伪边际MCMC:似然估不准也能精确采后验』的原始材料只直接支持“ChristopheAndrieu等在2009年〈ThePseudo-MarginalApproachforEfficientMonteCarloC”,没有自动覆盖边界外对象 空栏『伪边际MCMC:似然估不准也能精确采后验』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名随机优化称“无偏梯度”,数值线性代数称“随机迹估计”;另见第 213 号第 3 条『随机数值线性代数与草图法』

丙、ABC序贯蒙特卡洛:不能算似然就比较模拟摘要Approximate Bayesian Computation with SMC

提出Tina Toni、David Welch、Natalja Strelkowa等,2009年《Journal of the Royal Society Interface》6(31):187–202,DOI:10.1098/rsif.2008.0172,〈Approximate Bayesian Computation Scheme for Parameter Inference and Model Selection in Dynamical Systems〉 关键当似然不可解但模型可模拟时,可逐步收紧模拟摘要与观测摘要的距离阈值,用序贯粒子近似后验

到2009年前后,常见出发点仍是“贝叶斯推断必须能够逐点计算似然”。真正暴露问题的并非一个孤立反例,而是算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“被接受模拟数/全部模型模拟次数”为何随条件改变。当研究者改用“被接受模拟数/全部模型模拟次数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

核心主张是:当似然不可解但模型可模拟时,可逐步收紧模拟摘要与观测摘要的距离阈值,用序贯粒子近似后验。它不是定义性的正确,而有清楚的否证口:固定目标分布、近似族、计算预算与诊断规则,按“被接受模拟数/全部模型模拟次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

主证据来自Tina Toni等在2009年〈Approximate Bayesian Computation Scheme for Parameter Inference and Model Selection in Dynamical Systems〉中的主结果。作者把ABC与SMC结合,让粒子依次通过ε1>ε2>…>εT的T级容差序列并重加权;在生化动力系统中,相较拒绝ABC显著减少被浪费的模拟,并可同时处理参数和模型。其关键不是论文规模,而是给出了“被接受模拟数/全部模型模拟次数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:近似误差由摘要充分性、距离与容差共同决定;容差趋零也不能修复不充分摘要,模型选择的Bayes因子尤其可能失真。失效条件为:当模拟器极慢、摘要不识别参数或容差无法降到观测噪声尺度时,ABC后验没有可信含义。收敛需统一对象与“被接受模拟数/全部模型模拟次数”,并公开采样诊断、模拟校准和近似误差及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。报告应围绕“被接受模拟数/全部模型模拟次数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为工程称“仿真校准”,机器学习称“似然自由推断”;另见第309号模拟型预测。碰撞须固定“贝叶斯推断必须能够逐点计算似然”并比较“被接受模拟数/全部模型模拟次数”;第三项是近似目标、尾部质量与计算预算。

位置E——把『ABC序贯蒙特卡洛:不能算似然就比较模拟摘要』成立所需的边界环境作为首要显露 单因决定『ABC序贯蒙特卡洛:不能算似然就比较模拟摘要』当前结论的最小充分项只有:当似然不可解但模型可模拟时,可逐步收紧模拟摘要与观测摘要的距离阈值,用序贯粒子近似后验 预设〔01 谁进入分母〕贝叶斯推断必须能够逐点计算似然 量纲被接受模拟数/全部模型模拟次数 失效失效边界是『模拟器极慢、摘要不识别参数或容差无法降到观测噪声尺度时,ABC后验没有可信含义』;越过该边界,相关条件越强,被接受模拟数反而越低 自曝『ABC序贯蒙特卡洛:不能算似然就比较模拟摘要』的原始材料只直接支持“主证据来自TinaToni等在2009年〈ApproximateBayesianComputationSchemeforParameterInfer”,没有自动覆盖边界外对象 空栏『ABC序贯蒙特卡洛:不能算似然就比较模拟摘要』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名工程称“仿真校准”,机器学习称“似然自由推断”;另见第 583 号第 3 条『多层蒙特卡洛』

丁、粒子MCMC:状态空间模型的隐变量可整条更新Particle Markov Chain Monte Carlo

提出Christophe Andrieu、Arnaud Doucet与Roman Holenstein,2010年《Journal of the Royal Statistical Society: Series B》72(3):269–342,DOI:10.1111/j.1467-9868.2009.00736.x,〈Particle Markov Chain Monte Carlo Methods〉 关键粒子滤波给出的无偏似然估计可嵌入MCMC,使参数与完整潜在状态轨迹在非线性非高斯模型中联合采样且保持精确后验

2010年前后,本领域常把“潜在状态必须解析积分或用粗糙近似后才能做参数MCMC”当作默认起点。它在典型对象上看似稳固,却被算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“完整轨迹有效样本数/粒子传播次数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“完整轨迹有效样本数/粒子传播次数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

理论内容不是“再加一种方法”,而是:粒子滤波给出的无偏似然估计可嵌入MCMC,使参数与完整潜在状态轨迹在非线性非高斯模型中联合采样且保持精确后验。它允许以下决定性反例:固定目标分布、近似族、计算预算与诊断规则,按“完整轨迹有效样本数/粒子传播次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

证据链的锚点是Christophe Andrieu等在2010年〈Particle Markov Chain Monte Carlo Methods〉中的主结果。论文提出粒子边际MH、粒子Gibbs与粒子独立MH 3种算法,证明有限粒子数下扩展链仍以目标后验为边际;实例展示传统逐时更新严重退化时,整条隐状态轨迹更新更有效。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“完整轨迹有效样本数/粒子传播次数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:时间长度增加时需更多粒子维持似然方差;粒子贫化、路径退化和高维状态会使计算迅速恶化,精确性不等于可用效率。失效条件为:当状态维数很高、观测极信息化或粒子数不足以覆盖后验路径时,粒子链会退化。收敛需统一对象与“完整轨迹有效样本数/粒子传播次数”,并公开采样诊断、模拟校准和近似误差及最强反例。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“完整轨迹有效样本数/粒子传播次数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:时间序列称“粒子平滑”,运筹学称“序贯重要抽样”;另见第309号状态空间模型。共享预设为“潜在状态必须解析积分或用粗糙近似后才能做参数MCMC”;先统一“完整轨迹有效样本数/粒子传播次数”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置D——把『粒子MCMC:状态空间模型的隐变量可整条更新』中的操作次序与变化路径作为首要显露 单因决定『粒子MCMC:状态空间模型的隐变量可整条更新』当前结论的最小充分项只有:粒子滤波给出的无偏似然估计可嵌入MCMC,使参数与完整潜在状态轨迹在非线性非高斯模型中联合采样且保持精确后验 预设〔02 单一读数代表复杂对象〕潜在状态必须解析积分或用粗糙近似后才能做参数MCMC 量纲完整轨迹有效样本数/粒子传播次数 失效失效边界是『状态维数很高、观测极信息化或粒子数不足以覆盖后验路径时,粒子链会退化』;越过该边界,相关条件越强,完整轨迹有效样本数反而越低 自曝『粒子MCMC:状态空间模型的隐变量可整条更新』的原始材料只直接支持“证据链的锚点是ChristopheAndrieu等在2010年〈ParticleMarkovChainMonteCarloMethods〉中的主结果”,没有自动覆盖边界外对象 空栏『粒子MCMC:状态空间模型的隐变量可整条更新』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名时间序列称“粒子平滑”,运筹学称“序贯重要抽样”;另见第 437 号第 20 条『人工智能事故披露需要把模型更新纳入危机时间线』

戊、ABC模型选择失败:好参数摘要不等于好模型摘要ABC Model Choice Failure

提出Christian Robert、Jean-Marie Cornuet、Jean-Michel Marin与Natesh Pillai,2011年《Proceedings of the National Academy of Sciences》108(37):15112–15117,DOI:10.1073/pnas.1102900108,〈Lack of Confidence in Approximate Bayesian Computation Model Choice〉 关键对每个模型内部近似充分的低维摘要未必在模型之间保留Bayes因子所需信息容差

在2011年前后的文献中,标准叙事是“能准确估计各模型参数的摘要也足以比较模型”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“近似模型后验误差/容差阈值”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“近似模型后验误差/容差阈值”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

新命题明确写成:对每个模型内部近似充分的低维摘要,未必在模型之间保留Bayes因子所需信息;容差趋零也可选错模型。这句话可以被反驳,检验方式是:固定目标分布、近似族、计算预算与诊断规则,按“近似模型后验误差/容差阈值”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

Christian Robert等在2011年〈Lack of Confidence in Approximate Bayesian Computation Model Choice〉中的主结果是本条的证据起点。论文给出2个模型间的解析反例和群体遗传实例,证明ABC模型后验可收敛到与真实Bayes因子不同的值;问题来自跨模型联合充分性,而非只来自蒙特卡洛误差。具体读数“近似模型后验误差/容差阈值”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

截至2026年,未收敛部分是:若能使用全数据或对模型指标联合充分的摘要,问题可缓解;但复杂模型中这类摘要通常未知,分类器式模型比较也需要独立校准。这意味着“成立”至少要区分存在、稳定、可实现与可迁移四层;失效口为:当使用全数据似然或确有跨模型充分摘要时,本反例不适用。只有在统一的“近似模型后验误差/容差阈值”上报告失败概率、误差范围或常数依赖,争论才可能真正结束。

另一处后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。最低报告责任包括“近似模型后验误差/容差阈值”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:机器学习称“表示不足”,信息检索称“排序特征丢失”;另见第353号离线指标。只有“近似模型后验误差/容差阈值”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置E——把『ABC模型选择失败:好参数摘要不等于好模型摘要』成立所需的边界环境作为首要显露 单因决定『ABC模型选择失败:好参数摘要不等于好模型摘要』当前结论的最小充分项只有:对每个模型内部近似充分的低维摘要未必在模型之间保留Bayes因子所需信息容差 预设〔02 单一读数代表复杂对象〕能准确估计各模型参数的摘要也足以比较模型 量纲近似模型后验误差/容差阈值 失效失效边界是『使用全数据似然或确有跨模型充分摘要时,本反例不适用』;越过该边界,相关条件越强,近似模型后验误差反而越低 自曝『ABC模型选择失败:好参数摘要不等于好模型摘要』的原始材料只直接支持“ChristianRobert等在2011年〈LackofConfidenceinApproximateBayesianComputationMod”,没有自动覆盖边界外对象 空栏『ABC模型选择失败:好参数摘要不等于好模型摘要』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“表示不足”,信息检索称“排序特征丢失”;另见第 215 号第 20 条『跨装置机器学习:训练集相似不等于物理可运输』

己、贝叶斯优化:实验预算要按信息价值分配Bayesian Optimization

提出Jasper Snoek、Hugo Larochelle与Ryan Adams,2012年《Advances in Neural Information Processing Systems》25:2951–2959,〈Practical Bayesian Optimization of Machine Learning Algorithms〉 关键昂贵黑箱函数的下一次评估应由代理后验与采集函数共同选择,在探索不确定区与利用高值区之间权衡

2012年前后,旧框架把问题压成一句话:“所有候选实验或超参数组合应被均匀或随机试验”。但算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“目标函数改进量/新增实验评估次数”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“目标函数改进量/新增实验评估次数”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

本条命题是:昂贵黑箱函数的下一次评估应由代理后验与采集函数共同选择,在探索不确定区与利用高值区之间权衡。否证方式为:固定目标分布、近似族、计算预算与诊断规则,按“目标函数改进量/新增实验评估次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Jasper Snoek等在2012年〈Practical Bayesian Optimization of Machine Learning Algorithms〉中的主结果给出主证据:作者用高斯过程与期望改进分配昂贵实验预算,并把成本、并行和噪声3类约束纳入采集函数;评价单位从“最好一次结果”改成“每1次函数评估带来的样本外改进”。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“目标函数改进量/新增实验评估次数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:代理核、搜索空间编码与噪声模型错设会使采集函数自信地探索错误区域;高维、条件结构和分布漂移削弱样本效率。失效条件为:当单次评估很便宜、目标高维且缺乏可利用平滑结构时,贝叶斯优化的建模开销不划算。收敛需统一对象与“目标函数改进量/新增实验评估次数”,并公开采样诊断、模拟校准和近似误差及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。报告应围绕“目标函数改进量/新增实验评估次数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为实验设计称“序贯最优设计”,运筹学称“知识梯度”;另见第308号自适应实验。碰撞须固定“所有候选实验或超参数组合应被均匀或随机试验”并比较“目标函数改进量/新增实验评估次数”;第三项是近似目标、尾部质量与计算预算。

位置S——把『贝叶斯优化:实验预算要按信息价值分配』形成的对象结构作为首要显露 单因决定『贝叶斯优化:实验预算要按信息价值分配』当前结论的最小充分项只有:昂贵黑箱函数的下一次评估应由代理后验与采集函数共同选择,在探索不确定区与利用高值区之间权衡 预设〔02 单一读数代表复杂对象〕所有候选实验或超参数组合应被均匀或随机试验 量纲目标函数改进量/新增实验评估次数 失效失效边界是『单次评估很便宜、目标高维且缺乏可利用平滑结构时,贝叶斯优化的建模开销不划算』;越过该边界,相关条件越强,目标函数改进量反而越低 自曝『贝叶斯优化:实验预算要按信息价值分配』的原始材料只直接支持“JasperSnoek等在2012年〈PracticalBayesianOptimizationofMachineLearningAlgorithm”,没有自动覆盖边界外对象 空栏『贝叶斯优化:实验预算要按信息价值分配』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名实验设计称“序贯最优设计”,运筹学称“知识梯度”;另见第 214 号第 9 条『零阶随机优化:函数值差分承担梯度信息』

庚、随机变分推断:全数据后验可以由小批量自然梯度逼近Stochastic Variational Inference

提出Matthew Hoffman、David Blei、Chong Wang与John Paisley,2013年《Journal of Machine Learning Research》14:1303–1347,〈Stochastic Variational Inference〉 关键共轭指数族模型的全局变分参数可用小批量局部更新与自然梯度迭代,数据规模不再要求每步扫描全库

在2013年前后的文献中,默认判断仍是“贝叶斯后验计算每次迭代都必须访问全部数据”。它没有处理算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“ELBO增量/读取数据条数”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“ELBO增量/读取数据条数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

可以把命题写为:共轭指数族模型的全局变分参数可用小批量局部更新与自然梯度迭代,数据规模不再要求每步扫描全库。与口号不同,它预先承诺了失败方式:固定目标分布、近似族、计算预算与诊断规则,按“ELBO增量/读取数据条数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Matthew Hoffman等在2013年〈Stochastic Variational Inference〉中的主结果提供了决定性证据。论文把坐标上升的全局充分统计量替换为无偏小批量估计并使用Robbins–Monro步长;在约100万篇文档的主题模型上,算法以流式方式学习并达到与批量方法可比的预测性能。这里最有信息量的读数是“ELBO增量/读取数据条数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

后续争论集中在:均值场族会低估相关与尾部,步长与小批量方差决定收敛;目标ELBO改善不保证后验近似对决策量准确。因此,本条并非无条件有效;当局部变量无法快速优化、梯度偏置或数据分布随流变化时,随机近似可能不收敛到目标ELBO。收口所需的不是一句“仍需研究”,而是一套双方都可能失败的设计:统一对象、分母、反例族和资源预算,并让“ELBO增量/读取数据条数”在独立材料上接受复算。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“ELBO增量/读取数据条数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:机器学习称“小批量训练”,调查抽样称“子样本估计”;另见第351号并行计算。共享预设为“贝叶斯后验计算每次迭代都必须访问全部数据”;先统一“ELBO增量/读取数据条数”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置E——把『随机变分推断:全数据后验可以由小批量自然梯度逼近』成立所需的边界环境作为首要显露 单因决定『随机变分推断:全数据后验可以由小批量自然梯度逼近』当前结论的最小充分项只有:共轭指数族模型的全局变分参数可用小批量局部更新与自然梯度迭代,数据规模不再要求每步扫描全库 预设〔03 相关方向等同因果方向〕贝叶斯后验计算每次迭代都必须访问全部数据 量纲ELBO增量/读取数据条数 失效失效边界是『局部变量无法快速优化、梯度偏置或数据分布随流变化时,随机近似可能不收敛到目标ELBO』;越过该边界,相关条件越强,ELBO增量反而越低 自曝『随机变分推断:全数据后验可以由小批量自然梯度逼近』的原始材料只直接支持“MatthewHoffman等在2013年〈StochasticVariationalInference〉中的主结果提供了决定性证据”,没有自动覆盖边界外对象 空栏『随机变分推断:全数据后验可以由小批量自然梯度逼近』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“小批量训练”,调查抽样称“子样本估计”;另见第 213 号第 4 条『随机迭代求解与随机预条件』

辛、NUTS:HMC轨迹长度可以在线自适应No-U-Turn Sampler

提出Matthew Hoffman与Andrew Gelman,2014年《Journal of Machine Learning Research》15:1593–1623,〈The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo〉 关键HamiltonianMonteCarlo可通过检测轨迹开始回转的几何条件自

到2014年前后,常见出发点仍是“高效HMC必须由使用者预先猜出合适的积分步数”。真正暴露问题的并非一个孤立反例,而是算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“有效样本数/梯度评估次数”为何随条件改变。当研究者改用“有效样本数/梯度评估次数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

核心主张是:Hamiltonian Monte Carlo可通过检测轨迹开始回转的几何条件自动停止,并用双平均适配步长,减少人工调参。它不是定义性的正确,而有清楚的否证口:固定目标分布、近似族、计算预算与诊断规则,按“有效样本数/梯度评估次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

主证据来自Matthew Hoffman等在2014年〈The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo〉中的主结果。NUTS每层把轨迹长度从2^j扩到2^(j+1),以U-turn条件自动停止并保持详细平衡;在多个层次模型中,它达到与精调HMC相近或更高的每梯度有效样本数。其关键不是论文规模,而是给出了“有效样本数/梯度评估次数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

结论的边界同样具体:发散、漏斗几何和质量矩阵错配仍需重参数化;自动轨迹长度不是自动模型诊断,高维强相关下预热成本仍大。可检查的失效条件是:当后验不可微、具有离散维度或严重多模态且轨迹不能跨模态时不成立。争议若要收敛,双方需在最容易触发这些边界的对象上共同检验,并公开采样诊断、模拟校准和近似误差;只展示顺手的对象或平均结果,会把条件性成功误报为普遍规律。

另一处后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。最低报告责任包括“有效样本数/梯度评估次数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:控制论称“事件触发停止”,数值积分称“自适应步长”;另见第360号自适应资源。只有“有效样本数/梯度评估次数”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置S——把『NUTS:HMC轨迹长度可以在线自适应』形成的对象结构作为首要显露 单因决定『NUTS:HMC轨迹长度可以在线自适应』当前结论的最小充分项只有:HamiltonianMonteCarlo可通过检测轨迹开始回转的几何条件自 预设〔03 相关方向等同因果方向〕高效HMC必须由使用者预先猜出合适的积分步数 量纲有效样本数/梯度评估次数 失效当后验不可微、具有离散维度或严重多模态且轨迹不能跨模态时不成立 自曝『NUTS:HMC轨迹长度可以在线自适应』的原始材料只直接支持“主证据来自MatthewHoffman等在2014年〈TheNo-U-TurnSampler:AdaptivelySettingPathLength”,没有自动覆盖边界外对象 空栏『NUTS:HMC轨迹长度可以在线自适应』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名控制论称“事件触发停止”,数值积分称“自适应步长”;另见第 590 号第 13 条『稀有事件自适应分裂』
【第二幕】这十年 · 约 2016—2026

第二幕开始审查自动化的代价:通用程序、快速近似和模型平均都必须给出失真、尾部、校准与计算分母。从“广义贝叶斯:损失也可以定义后验更新”到“SBC敏感性清算:秩直方图不是一个万能诊断”,共同动作是接受规模、复制、边界与部署检验;主证据落在2016—2026年。

一、广义贝叶斯:损失也可以定义后验更新General Bayesian Updating

提出Pier Giovanni Bissiri、Chris Holmes与Stephen Walker,2016年《Journal of the Royal Statistical Society: Series B》78(5):1103–1130,DOI:10.1111/rssb.12158,〈A General Framework for Updating Belief Distributions〉 关键当完整似然不可信或研究目标由特定损失定义时,可用先验乘以指数负损失形成一致更新,但损失尺度必须校准

2016年前后,本领域常把“合法贝叶斯更新必须来自一个完全正确的概率似然”当作默认起点。它在典型对象上看似稳固,却被算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“累计数据损失/先验信息惩罚”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“累计数据损失/先验信息惩罚”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

理论内容不是“再加一种方法”,而是:当完整似然不可信或研究目标由特定损失定义时,可用先验乘以指数负损失形成一致更新,但损失尺度必须校准。它允许以下决定性反例:固定目标分布、近似族、计算预算与诊断规则,按“累计数据损失/先验信息惩罚”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

证据链的锚点是Pier Giovanni Bissiri等在2016年〈A General Framework for Updating Belief Distributions〉中的主结果。作者从相干性公理推出“先验×exp(−ηΣ损失)”的广义后验形式;1个温度参数η控制数据损失相对先验的权重,分位数与鲁棒位置等非似然目标因此可统一更新。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“累计数据损失/先验信息惩罚”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:损失和学习率选择带来新的主观性;不适当尺度会导致区间严重欠覆盖,广义后验不自动继承传统Bayes的频率校准。失效条件为:当损失无法与决策目标对应或温度未校准时,广义后验的概率解释失效。收敛需统一对象与“累计数据损失/先验信息惩罚”,并公开采样诊断、模拟校准和近似误差及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。报告应围绕“累计数据损失/先验信息惩罚”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为机器学习称“Gibbs后验”,控制论称“代价加权更新”;另见第306号TMLE。碰撞须固定“合法贝叶斯更新必须来自一个完全正确的概率似然”并比较“累计数据损失/先验信息惩罚”;第三项是近似目标、尾部质量与计算预算。

位置D——把『广义贝叶斯:损失也可以定义后验更新』中的操作次序与变化路径作为首要显露 单因决定『广义贝叶斯:损失也可以定义后验更新』当前结论的最小充分项只有:当完整似然不可信或研究目标由特定损失定义时,可用先验乘以指数负损失形成一致更新,但损失尺度必须校准 预设〔03 相关方向等同因果方向〕合法贝叶斯更新必须来自一个完全正确的概率似然 量纲累计数据损失/先验信息惩罚 失效当损失无法与决策目标对应或温度未校准时,广义后验的概率解释失效 自曝『广义贝叶斯:损失也可以定义后验更新』的原始材料只直接支持“证据链的锚点是PierGiovanniBissiri等在2016年〈AGeneralFrameworkforUpdatingBeliefDistri”,没有自动覆盖边界外对象 空栏『广义贝叶斯:损失也可以定义后验更新』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“Gibbs后验”,控制论称“代价加权更新”;另见第 214 号第 16 条『贝叶斯优化:昂贵黑箱由后验不确定性安排试验』

二、Stan:概率程序必须把采样诊断变成默认输出Stan Probabilistic Programming

提出Bob Carpenter、Andrew Gelman、Matthew Hoffman等,2017年《Journal of Statistical Software》76(1):1–32,DOI:10.18637/jss.v076.i01,〈Stan: A Probabilistic Programming Language〉 关键用户只需声明可微对数密度编译器与自动微分即可运行NUTS并报告发散有效样本量

在2017年前后的文献中,标准叙事是“复杂贝叶斯模型必须为每个模型手工推导专用采样器”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“有效样本数/壁钟秒数”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“有效样本数/壁钟秒数”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

新命题明确写成:用户只需声明可微对数密度,编译器与自动微分即可运行NUTS并报告发散、有效样本量和R-hat,使模型与算法诊断进入同一工作流。这句话可以被反驳,检验方式是:固定目标分布、近似族、计算预算与诊断规则,按“有效样本数/壁钟秒数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

Bob Carpenter等在2017年〈Stan: A Probabilistic Programming Language〉中的主结果是本条的证据起点。论文描述Stan语言、反向自动微分以及采样、优化、变分3类主要计算模块;多个应用显示同一模型可跨接口复用,并以梯度驱动算法替代手写Gibbs更新。具体读数“有效样本数/壁钟秒数”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

截至2026年,未收敛部分是:自动微分不修复错误模型;离散潜变量需边缘化,发散常要求重参数化。语言便利会诱使使用者把可运行误当作已收敛。这意味着“成立”至少要区分存在、稳定、可实现与可迁移四层;失效口为:当模型含不可微黑箱、巨大离散空间或内存超限时,通用HMC工作流不适用。只有在统一的“有效样本数/壁钟秒数”上报告失败概率、误差范围或常数依赖,争论才可能真正结束。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“有效样本数/壁钟秒数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:软件工程称“领域专用语言”,形式化方法称“可执行规格”;另见第352号验证工具链。共享预设为“复杂贝叶斯模型必须为每个模型手工推导专用采样器”;先统一“有效样本数/壁钟秒数”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置S——把『Stan:概率程序必须把采样诊断变成默认输出』形成的对象结构作为首要显露 单因决定『Stan:概率程序必须把采样诊断变成默认输出』当前结论的最小充分项只有:用户只需声明可微对数密度编译器与自动微分即可运行NUTS并报告发散有效样本量 预设〔04 尺度迁移不改变结论〕复杂贝叶斯模型必须为每个模型手工推导专用采样器 量纲有效样本数/壁钟秒数 失效当模型含不可微黑箱、巨大离散空间或内存超限时,通用HMC工作流不适用 自曝『Stan:概率程序必须把采样诊断变成默认输出』的原始材料只直接支持“BobCarpenter等在2017年〈Stan:AProbabilisticProgrammingLanguage〉中的主结果是本条的证据起点”,没有自动覆盖边界外对象 空栏『Stan:概率程序必须把采样诊断变成默认输出』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名软件工程称“领域专用语言”,形式化方法称“可执行规格”;另见第 583 号第 14 条『JAX可组合自动微分』

三、自动微分变分推断:通用近似的速度要用失真计价Automatic Differentiation Variational Inference

提出Alp Kucukelbir、Dustin Tran、Rajesh Ranganath、Andrew Gelman与David Blei,2017年《Journal of Machine Learning Research》18(14):1–45,〈Automatic Differentiation Variational Inference〉 关键把连续潜变量变换到无约束空间并自动微分ELBO,可为广泛模型自动生成均值场或满秩高斯近似

2017年前后,旧框架把问题压成一句话:“通用贝叶斯近似必须依赖模型专门的变分推导”。但算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“后验近似误差/梯度评估次数”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“后验近似误差/梯度评估次数”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

本条把转向压成一句可检验的话:把连续潜变量变换到无约束空间并自动微分ELBO,可为广泛模型自动生成均值场或满秩高斯近似。可反驳版本为:固定目标分布、近似族、计算预算与诊断规则,按“后验近似误差/梯度评估次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

Alp Kucukelbir等在2017年〈Automatic Differentiation Variational Inference〉中的主结果给出主证据:ADVI提供均值场与全秩高斯2类近似族,并用重参数化梯度和随机优化在多个模型上自动拟合;运行常快于长链MCMC,但尾部、相关和多峰失真需另行诊断。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“后验近似误差/梯度评估次数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

主结果没有消灭争议。反向KL倾向覆盖单一模态并低估尾部,优化收敛不代表近似正确;层次漏斗、强偏态和多模态模型常出现看似稳定的错误。它明确在以下情形失效:当后验多模态、重尾或强曲率且高斯族不能覆盖时,ADVI会系统失真。决定性证据应同时给出最强支持对象与最强反例,并登记采样诊断、模拟校准和近似误差;如果结论只在作者选择的表示、样本或停止规则下成立,就只能称为条件性转向。

另一处后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。最低报告责任包括“后验近似误差/梯度评估次数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:机器学习称“自动变分”,数值分析称“低秩近似”;另见第301号有限近似。只有“后验近似误差/梯度评估次数”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置D——把『自动微分变分推断:通用近似的速度要用失真计价』中的操作次序与变化路径作为首要显露 单因决定『自动微分变分推断:通用近似的速度要用失真计价』当前结论的最小充分项只有:把连续潜变量变换到无约束空间并自动微分ELBO,可为广泛模型自动生成均值场或满秩高斯近似 预设〔04 尺度迁移不改变结论〕通用贝叶斯近似必须依赖模型专门的变分推导 量纲后验近似误差/梯度评估次数 失效当后验多模态、重尾或强曲率且高斯族不能覆盖时,ADVI会系统失真 自曝『自动微分变分推断:通用近似的速度要用失真计价』的原始材料只直接支持“AlpKucukelbir等在2017年〈AutomaticDifferentiationVariationalInference〉中的主结果给出主”,没有自动覆盖边界外对象 空栏『自动微分变分推断:通用近似的速度要用失真计价』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“自动变分”,数值分析称“低秩近似”;另见第 213 号第 18 条『十八、可微编程与自动微分』

四、PC先验:复杂模型的每一步扩张都要付距离代价Penalised Complexity Priors

提出Daniel Simpson、Håvard Rue、Andrea Riebler、Thiago Martins与Sigrunn Sørbye,2017年《Statistical Science》32(1):1–28,DOI:10.1214/16-STS576,〈Penalising Model Component Complexity: A Principled, Practical Approach to Constructing Priors〉 关键先验应从简单基准模型出发以到基准的KullbackLeibler距离指数惩罚

在2017年前后的文献中,默认判断仍是““弱信息”先验可以脱离一个明确的简单基准定义”。它没有处理算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“复杂度距离/允许的尾概率预算”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“复杂度距离/允许的尾概率预算”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

可以把命题写为:先验应从简单基准模型出发,以到基准的Kullback–Leibler距离指数惩罚额外复杂度,并用可解释尾概率校准。与口号不同,它预先承诺了失败方式:固定目标分布、近似族、计算预算与诊断规则,按“复杂度距离/允许的尾概率预算”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Daniel Simpson等在2017年〈Penalising Model Component Complexity: A Principled, Practical Approach to Constructing Priors〉中的主结果提供了决定性证据。作者提出4项PC先验原则,把随机效应方差、相关长度等参数映射到复杂度距离;例如直接指定P(σ>U)=α,避免逆Gamma先验在零附近的病态行为。这里最有信息量的读数是“复杂度距离/允许的尾概率预算”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

后续争论集中在:基准模型与距离选择仍包含判断,参数化不变性只在规定变换下成立;多个复杂组件同时存在时独立PC先验未必表达联合结构。因此,本条并非无条件有效;当没有科学上可辩护的基准模型或复杂度方向不是单调时,PC构造会失去解释。收口所需的不是一句“仍需研究”,而是一套双方都可能失败的设计:统一对象、分母、反例族和资源预算,并让“复杂度距离/允许的尾概率预算”在独立材料上接受复算。

实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。报告应围绕“复杂度距离/允许的尾概率预算”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为正则化称“向零收缩”,工程称“复杂度预算”;另见第360号能耗预算。碰撞须固定““弱信息”先验可以脱离一个明确的简单基准定义”并比较“复杂度距离/允许的尾概率预算”;第三项是近似目标、尾部质量与计算预算。

位置E——把『PC先验:复杂模型的每一步扩张都要付距离代价』成立所需的边界环境作为首要显露 单因决定『PC先验:复杂模型的每一步扩张都要付距离代价』当前结论的最小充分项只有:先验应从简单基准模型出发以到基准的KullbackLeibler距离指数惩罚 预设〔04 尺度迁移不改变结论〕“弱信息”先验可以脱离一个明确的简单基准定义 量纲复杂度距离/允许的尾概率预算 失效当没有科学上可辩护的基准模型或复杂度方向不是单调时,PC构造会失去解释 自曝『PC先验:复杂模型的每一步扩张都要付距离代价』的原始材料只直接支持“DanielSimpson等在2017年〈PenalisingModelComponentComplexity:APrincipled,Practi”,没有自动覆盖边界外对象 空栏『PC先验:复杂模型的每一步扩张都要付距离代价』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名正则化称“向零收缩”,工程称“复杂度预算”;另见第 214 号第 18 条『大模型优化的解耦权重衰减:正则化不应被自适应尺度吞掉』

五、PSIS-LOO:交叉验证要诊断重要性权重尾部Pareto-Smoothed Importance Sampling LOO

提出Aki Vehtari、Andrew Gelman与Jonah Gabry,2017年《Statistics and Computing》27:1413–1432,DOI:10.1007/s11222-016-9696-4,〈Practical Bayesian Model Evaluation Using Leave-One-Out Cross-Validation and WAIC〉 关键留一法可由单次后验样本的重要性权重近似但必须用Pareto尾指数k诊断何时权

到2017年前后,常见出发点仍是“只要平均预测分数可算,近似交叉验证误差就可忽略”。真正暴露问题的并非一个孤立反例,而是算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“有效重要性样本数/后验抽样数”为何随条件改变。当研究者改用“有效重要性样本数/后验抽样数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

核心主张是:留一法可由单次后验样本的重要性权重近似,但必须用Pareto尾指数k诊断何时权重方差太大并需要重拟合。它不是定义性的正确,而有清楚的否证口:固定目标分布、近似族、计算预算与诊断规则,按“有效重要性样本数/后验抽样数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

主证据来自Aki Vehtari等在2017年〈Practical Bayesian Model Evaluation Using Leave-One-Out Cross-Validation and WAIC〉中的主结果。作者比较WAIC与PSIS-LOO,在多个模型中展示Pareto平滑稳定极端权重;k小于约0.5通常可靠,超过约0.7提示近似不稳定并应做精确留一或更强方法。其关键不是论文规模,而是给出了“有效重要性样本数/后验抽样数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

结论的边界同样具体:阈值是经验诊断而非普遍定理;高度影响观测、非因子化似然与时间空间依赖下,逐点留一目标本身可能错误。可检查的失效条件是:当Pareto尾指数过大或观测不可条件独立分解时,PSIS近似与目标都需重设。争议若要收敛,双方需在最容易触发这些边界的对象上共同检验,并公开采样诊断、模拟校准和近似误差;只展示顺手的对象或平均结果,会把条件性成功误报为普遍规律。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“有效重要性样本数/后验抽样数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:鲁棒统计称“影响点诊断”,系统性能称“尾部权重”;另见第360号尾延迟。共享预设为“只要平均预测分数可算,近似交叉验证误差就可忽略”;先统一“有效重要性样本数/后验抽样数”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置D——把『PSIS-LOO:交叉验证要诊断重要性权重尾部』中的操作次序与变化路径作为首要显露 单因决定『PSIS-LOO:交叉验证要诊断重要性权重尾部』当前结论的最小充分项只有:留一法可由单次后验样本的重要性权重近似但必须用Pareto尾指数k诊断何时权 预设〔05 观测与干预不回写对象〕只要平均预测分数可算,近似交叉验证误差就可忽略 量纲有效重要性样本数/后验抽样数 失效当Pareto尾指数过大或观测不可条件独立分解时,PSIS近似与目标都需重设 自曝『PSIS-LOO:交叉验证要诊断重要性权重尾部』的原始材料只直接支持“主证据来自AkiVehtari等在2017年〈PracticalBayesianModelEvaluationUsingLeave-One-OutC”,没有自动覆盖边界外对象 空栏『PSIS-LOO:交叉验证要诊断重要性权重尾部』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名鲁棒统计称“影响点诊断”,系统性能称“尾部权重”;另见第 214 号第 13 条『性能估计问题:一阶法的最坏界可由半定规划审计』

六、大数据MCMC清算:子采样接受检验没有免费午餐Tall-Data MCMC Limitations

提出Rémi Bardenet、Arnaud Doucet与Chris Holmes,2017年《Journal of Machine Learning Research》18(47):1–62,〈On Markov Chain Monte Carlo Methods for Tall Data〉 关键精确MCMC若每步只看极少数据,通常必须用昂贵控制变量或接受最坏情况下扫描全数据;简单子采样检验不能同时保证普适精确与固定成本

2017年前后,本领域常把“数据规模增大后,精确后验采样仍可用与n无关的每步成本普遍实现”当作默认起点。它在典型对象上看似稳固,却被算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“每次接受决策读取的数据条数/总数据条数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“每次接受决策读取的数据条数/总数据条数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条命题是:精确MCMC若每步只看极少数据,通常必须用昂贵控制变量或接受最坏情况下扫描全数据;简单子采样检验不能同时保证普适精确与固定成本。否证方式为:固定目标分布、近似族、计算预算与诊断规则,按“每次接受决策读取的数据条数/总数据条数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Rémi Bardenet等在2017年〈On Markov Chain Monte Carlo Methods for Tall Data〉中的主结果。综述统一分析子采样MH、界与控制变量等多类方法,指出数据项对数似然差的方差决定所需样本;在后验集中时,2阶控制变量可降成本,但预处理与误差条件不可省。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“每次接受决策读取的数据条数/总数据条数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:在特殊模型、充分统计量或允许近似偏差时仍可获得大幅加速;结论针对一般精确性承诺,不是否定所有随机梯度算法。失效条件为:当模型存在固定维充分统计量、强控制变量或明确允许近似时,线性扫描下界可被绕开。收敛需统一对象与“每次接受决策读取的数据条数/总数据条数”,并公开采样诊断、模拟校准和近似误差及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。最低报告责任包括“每次接受决策读取的数据条数/总数据条数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:计算复杂性称“查询下界”,数据库称“近似查询”;另见第304号不可计算边界。只有“每次接受决策读取的数据条数/总数据条数”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置E——把『大数据MCMC清算:子采样接受检验没有免费午餐』成立所需的边界环境作为首要显露 单因决定『大数据MCMC清算:子采样接受检验没有免费午餐』当前结论的最小充分项只有:精确MCMC若每步只看极少数据,通常必须用昂贵控制变量或接受最坏情况下扫描全数据;简单子采样检验不能同时保证普适精确与固定成本 预设〔05 观测与干预不回写对象〕数据规模增大后,精确后验采样仍可用与n无关的每步成本普遍实现 量纲每次接受决策读取的数据条数/总数据条数 失效当模型存在固定维充分统计量、强控制变量或明确允许近似时,线性扫描下界可被绕开 自曝『大数据MCMC清算:子采样接受检验没有免费午餐』的原始材料只直接支持“证据链的锚点是RémiBardenet等在2017年〈OnMarkovChainMonteCarloMethodsforTallData〉中的主结果”,没有自动覆盖边界外对象 空栏『大数据MCMC清算:子采样接受检验没有免费午餐』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名计算复杂性称“查询下界”,数据库称“近似查询”;另见第 440 号第 20 条『反事实企业史把“本可不同”变成可检验边界』

七、后验预测堆叠:模型权重由样本外预测而非后验模型概率决定Bayesian Stacking

提出Yuling Yao、Aki Vehtari、Daniel Simpson与Andrew Gelman,2018年《Bayesian Analysis》13(3):917–1007,DOI:10.1214/17-BA1091,〈Using Stacking to Average Bayesian Predictive Distributions〉 关键在M-开放世界中,没有候选模型为真时,应选择使留一对数预测密度最大的凸组合,而不是用对模型先验高度敏感的后验模型概率

在2018年前后的文献中,标准叙事是“候选模型中必有一个真实模型,模型平均应估计它为真的概率”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“组合样本外对数得分/最佳单模型得分”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“组合样本外对数得分/最佳单模型得分”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

本条命题是:在M-开放世界中,没有候选模型为真时,应选择使留一对数预测密度最大的凸组合,而不是用对模型先验高度敏感的后验模型概率。否证方式为:固定目标分布、近似族、计算预算与诊断规则,按“组合样本外对数得分/最佳单模型得分”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Yuling Yao等在2018年〈Using Stacking to Average Bayesian Predictive Distributions〉中的主结果是本条的证据起点。作者比较stacking、pseudo-BMA与Bayesian model averaging 3种权重方案;模拟与实例显示候选模型互补时,stacking有更好的样本外预测,并避免权重塌到1个“最真”模型。具体读数“组合样本外对数得分/最佳单模型得分”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:结果依赖候选模型多样性和交叉验证稳定性;权重优化只提升预测,不给每个模型因果或结构真实性背书。失效条件为:当候选模型近乎相同、留一目标与部署分布不同或权重过拟合时,stacking增益消失。收敛需统一对象与“组合样本外对数得分/最佳单模型得分”,并公开采样诊断、模拟校准和近似误差及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。报告应围绕“组合样本外对数得分/最佳单模型得分”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为机器学习称“集成学习”,时间序列称“预测组合”;另见第309号组合谜题。碰撞须固定“候选模型中必有一个真实模型,模型平均应估计它为真的概率”并比较“组合样本外对数得分/最佳单模型得分”;第三项是近似目标、尾部质量与计算预算。

位置S——把『后验预测堆叠:模型权重由样本外预测而非后验模型概率决定』形成的对象结构作为首要显露 单因决定『后验预测堆叠:模型权重由样本外预测而非后验模型概率决定』当前结论的最小充分项只有:在M-开放世界中,没有候选模型为真时,应选择使留一对数预测密度最大的凸组合,而不是用对模型先验高度敏感的后验模型概率 预设〔05 观测与干预不回写对象〕候选模型中必有一个真实模型,模型平均应估计它为真的概率 量纲组合样本外对数得分/最佳单模型得分 失效当候选模型近乎相同、留一目标与部署分布不同或权重过拟合时,stacking增益消失 自曝『后验预测堆叠:模型权重由样本外预测而非后验模型概率决定』的原始材料只直接支持“YulingYao等在2018年〈UsingStackingtoAverageBayesianPredictiveDistributions〉中的主”,没有自动覆盖边界外对象 空栏『后验预测堆叠:模型权重由样本外预测而非后验模型概率决定』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“集成学习”,时间序列称“预测组合”;另见第 432 号第 20 条『强化学习把预测器变成政策选择器』

八、线性响应变分:近似后验的协方差可以被灵敏度修正Linear Response Variational Bayes

提出Ryan Giordano、Tamara Broderick与Michael Jordan,2018年《Journal of Machine Learning Research》19(74):1–47,〈Covariances, Robustness and Variational Bayes〉 关键均值场变分虽低估协方差,但最优参数对模型扰动的线性响应可恢复更准确的协方差与局部鲁棒性

2018年前后,旧框架把问题压成一句话:“一旦选择均值场族,后验相关信息就完全不可恢复”。但算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“修正后协方差误差/原变分协方差误差”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“修正后协方差误差/原变分协方差误差”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

本条把转向压成一句可检验的话:均值场变分虽低估协方差,但最优参数对模型扰动的线性响应可恢复更准确的协方差与局部鲁棒性。可反驳版本为:固定目标分布、近似族、计算预算与诊断规则,按“修正后协方差误差/原变分协方差误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

Ryan Giordano等在2018年〈Covariances, Robustness and Variational Bayes〉中的主结果给出主证据:论文对变分最优条件施加1次指数倾斜并求导,得到线性响应协方差;在混合与随机效应模型中,它比原均值场方差更接近MCMC,且无需完整采样。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“修正后协方差误差/原变分协方差误差”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:修正是局部一阶近似,强多模态与非平滑最优点仍失败;Hessian求逆在高维可能昂贵,近似均值严重偏时协方差修正不能救回目标。失效条件为:当变分最优解不唯一、Hessian奇异或扰动响应高度非线性时不成立。收敛需统一对象与“修正后协方差误差/原变分协方差误差”,并公开采样诊断、模拟校准和近似误差及最强反例。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“修正后协方差误差/原变分协方差误差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:控制论称“灵敏度分析”,数值分析称“后验误差修正”;另见第360号性能剖析。共享预设为“一旦选择均值场族,后验相关信息就完全不可恢复”;先统一“修正后协方差误差/原变分协方差误差”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置E——把『线性响应变分:近似后验的协方差可以被灵敏度修正』成立所需的边界环境作为首要显露 单因决定『线性响应变分:近似后验的协方差可以被灵敏度修正』当前结论的最小充分项只有:均值场变分虽低估协方差,但最优参数对模型扰动的线性响应可恢复更准确的协方差与局部鲁棒性 预设〔06 聚合次序不影响结论〕一旦选择均值场族,后验相关信息就完全不可恢复 量纲修正后协方差误差/原变分协方差误差 失效当变分最优解不唯一、Hessian奇异或扰动响应高度非线性时不成立 自曝『线性响应变分:近似后验的协方差可以被灵敏度修正』的原始材料只直接支持“RyanGiordano等在2018年〈Covariances,RobustnessandVariationalBayes〉中的主结果给出主证据:论”,没有自动覆盖边界外对象 空栏『线性响应变分:近似后验的协方差可以被灵敏度修正』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名控制论称“灵敏度分析”,数值分析称“后验误差修正”;另见第 213 号第 11 条『自适应有限元的收敛性与最优性理论』

九、改进R-hat:均值收敛不代表尾部和尺度收敛Rank-Normalized R-hat and ESS

提出Aki Vehtari、Andrew Gelman、Daniel Simpson等,2021年《Bayesian Analysis》16(2):667–718,DOI:10.1214/20-BA1221,〈Rank-Normalization, Folding, and Localization: An Improved R-hat for Assessing Convergence of MCMC〉 关键MCMC收敛诊断应对秩归一化链同时检查位置尺度与尾部并分别报告bulk与ta

在2021年前后的文献中,默认判断仍是“各链均值相近就足以判定整个后验已被探索”。它没有处理算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“链间方差/链内方差”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“链间方差/链内方差”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

可以把命题写为:MCMC收敛诊断应对秩归一化链同时检查位置、尺度与尾部,并分别报告bulk与tail有效样本量。与口号不同,它预先承诺了失败方式:固定目标分布、近似族、计算预算与诊断规则,按“链间方差/链内方差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Aki Vehtari等在2021年〈Rank-Normalization, Folding, and Localization: An Improved R-hat for Assessing Convergence of MCMC〉中的主结果提供了决定性证据。论文用反例显示传统R-hat可在重尾、偏态和方差未收敛时接近1;新方法对秩正态化、折叠后取最大R-hat,并用局部ESS评估分位数,建议R-hat小于1.01且ESS充足。这里最有信息量的读数是“链间方差/链内方差”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

后续争论集中在:诊断只能发现部分问题,不能证明链已覆盖所有模态;多个初始化若都落在同一局部模态仍会给出漂亮读数。因此,本条并非无条件有效;当所有链从同一未发现的局部模态开始或模型不可识别时,R-hat仍可能漏报。收口所需的不是一句“仍需研究”,而是一套双方都可能失败的设计:统一对象、分母、反例族和资源预算,并让“链间方差/链内方差”在独立材料上接受复算。

这一转向带来的实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本条而言,最低报告责任应围绕“链间方差/链内方差”展开,同时给出失败对象、资源成本和敏感性分析。这样才能区分真正的结构收益,与筛选、数据泄漏、隐藏常数或未计成本造成的表面优势。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:质量控制称“批间/批内比”,系统测试称“多起点一致性”;另见第360号基准方差。只有“链间方差/链内方差”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置S——把『改进R-hat:均值收敛不代表尾部和尺度收敛』形成的对象结构作为首要显露 单因决定『改进R-hat:均值收敛不代表尾部和尺度收敛』当前结论的最小充分项只有:MCMC收敛诊断应对秩归一化链同时检查位置尺度与尾部并分别报告bulk与ta 预设〔06 聚合次序不影响结论〕各链均值相近就足以判定整个后验已被探索 量纲链间方差/链内方差 失效当所有链从同一未发现的局部模态开始或模型不可识别时,R-hat仍可能漏报 自曝『改进R-hat:均值收敛不代表尾部和尺度收敛』的原始材料只直接支持“AkiVehtari等在2021年〈Rank-Normalization,Folding,andLocalization:AnImprovedR-h”,没有自动覆盖边界外对象 空栏『改进R-hat:均值收敛不代表尾部和尺度收敛』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名质量控制称“批间/批内比”,系统测试称“多起点一致性”;另见第 439 号第 7 条『服务生态系统把创新放到制度与多方资源整合中』

十、模拟型推断基准:后验近似必须在已知真值任务上横向比较Simulation-Based Inference Benchmark

提出Jan-Matthis Lueckmann、Jan Boelts、David Greenberg等,2021年《Proceedings of Machine Learning Research》130:343–351,〈Benchmarking Simulation-Based Inference〉 关键神经后验、似然比与ABC方法应在统一模拟器、预算和参考后验下比较校准与样本效率,而不是各自在不同任务上报最好结果

到2021年前后,常见出发点仍是“在一个自选模拟任务上表现好即可证明似然自由算法普遍优越”。真正暴露问题的并非一个孤立反例,而是算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“后验距离/模拟器调用次数”为何随条件改变。当研究者改用“后验距离/模拟器调用次数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

核心主张是:神经后验、似然比与ABC方法应在统一模拟器、预算和参考后验下比较校准与样本效率,而不是各自在不同任务上报最好结果。它不是定义性的正确,而有清楚的否证口:固定目标分布、近似族、计算预算与诊断规则,按“后验距离/模拟器调用次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

主证据来自Jan-Matthis Lueckmann等在2021年〈Benchmarking Simulation-Based Inference〉中的主结果。作者建立包含十个任务的sbi benchmark,提供参考后验、多个算法和分类器二样本、C2ST等指标;结果显示没有单一方法在所有预算和维数上占优。其关键不是论文规模,而是给出了“后验距离/模拟器调用次数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:基准任务仍比真实科学模拟器简化,参考后验也有误差;排名对预算、网络架构与指标敏感,刷榜不能替代应用校准。失效条件为:当真实模拟器的失配、离散结构或成本模式不在基准覆盖内时,排名不可外推。收敛需统一对象与“后验距离/模拟器调用次数”,并公开采样诊断、模拟校准和近似误差及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。报告应围绕“后验距离/模拟器调用次数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为系统研究称“可重放基准”,实验设计称“共同试验台”;另见第360号基准方法学。碰撞须固定“在一个自选模拟任务上表现好即可证明似然自由算法普遍优越”并比较“后验距离/模拟器调用次数”;第三项是近似目标、尾部质量与计算预算。

位置D——把『模拟型推断基准:后验近似必须在已知真值任务上横向比较』中的操作次序与变化路径作为首要显露 单因决定『模拟型推断基准:后验近似必须在已知真值任务上横向比较』当前结论的最小充分项只有:神经后验、似然比与ABC方法应在统一模拟器、预算和参考后验下比较校准与样本效率,而不是各自在不同任务上报最好结果 预设〔06 聚合次序不影响结论〕在一个自选模拟任务上表现好即可证明似然自由算法普遍优越 量纲后验距离/模拟器调用次数 失效当真实模拟器的失配、离散结构或成本模式不在基准覆盖内时,排名不可外推 自曝『模拟型推断基准:后验近似必须在已知真值任务上横向比较』的原始材料只直接支持“主证据来自Jan-MatthisLueckmann等在2021年〈BenchmarkingSimulation-BasedInference〉中的主”,没有自动覆盖边界外对象 空栏『模拟型推断基准:后验近似必须在已知真值任务上横向比较』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名系统研究称“可重放基准”,实验设计称“共同试验台”;另见第 214 号第 4 条『近端分裂:不可微结构必须由算子而不是平滑替代处理』

十一、Pathfinder:优化路径本身可生成快速后验近似Pathfinder Variational Inference

提出Lu Zhang、Bob Carpenter、Andrew Gelman与Aki Vehtari,2022年《Journal of Machine Learning Research》23(306):1–49,〈Pathfinder: Parallel Quasi-Newton Variational Inference〉 关键准牛顿优化沿途积累的逆Hessian近似可构造一串局部高斯选择预测KL最好的

2022年前后,本领域常把“后验近似必须在一个固定变分族中从头优化或运行长链采样”当作默认起点。它在典型对象上看似稳固,却被算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“1-Wasserstein误差/对数密度与梯度评估次数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“1-Wasserstein误差/对数密度与梯度评估次数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

理论内容不是“再加一种方法”,而是:准牛顿优化沿途积累的逆Hessian近似可构造一串局部高斯,选择预测KL最好的节点即可快速产生后验近似样本。它允许以下决定性反例:固定目标分布、近似族、计算预算与诊断规则,按“1-Wasserstein误差/对数密度与梯度评估次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

证据链的锚点是Lu Zhang等在2022年〈Pathfinder: Parallel Quasi-Newton Variational Inference〉中的主结果。在广泛PosteriorDB任务上,Pathfinder的1-Wasserstein误差优于ADVI并接近短链动态HMC,同时减少一到两个数量级的对数密度与梯度评估;多起点重要性重采样提高多样性。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“1-Wasserstein误差/对数密度与梯度评估次数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:局部高斯仍难覆盖分离多模态、强重尾和边界;ELBO估计与优化路径可能错过主模态,多起点会增加并行预算。失效条件为:当优化路径不经过高后验质量区域或后验没有可用局部曲率时不成立。收敛需统一对象与“1-Wasserstein误差/对数密度与梯度评估次数”,并公开采样诊断、模拟校准和近似误差及最强反例。

由此,对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。对本项证据须公开“1-Wasserstein误差/对数密度与梯度评估次数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:数值优化称“轨迹复用”,导航称“沿途候选点”;另见第309号滚动预测。共享预设为“后验近似必须在一个固定变分族中从头优化或运行长链采样”;先统一“1-Wasserstein误差/对数密度与梯度评估次数”,若仍逆向,再检验近似目标、尾部质量与计算预算。

位置S——把『Pathfinder:优化路径本身可生成快速后验近似』形成的对象结构作为首要显露 单因决定『Pathfinder:优化路径本身可生成快速后验近似』当前结论的最小充分项只有:准牛顿优化沿途积累的逆Hessian近似可构造一串局部高斯选择预测KL最好的 预设〔01 谁进入分母〕后验近似必须在一个固定变分族中从头优化或运行长链采样 量纲1-Wasserstein误差/对数密度与梯度评估次数 失效当优化路径不经过高后验质量区域或后验没有可用局部曲率时不成立 自曝『Pathfinder:优化路径本身可生成快速后验近似』的原始材料只直接支持“证据链的锚点是LuZhang等在2022年〈Pathfinder:ParallelQuasi-NewtonVariationalInference〉”,没有自动覆盖边界外对象 空栏『Pathfinder:优化路径本身可生成快速后验近似』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名数值优化称“轨迹复用”,导航称“沿途候选点”;另见第 214 号第 3 条『FISTA:复合凸问题的加速可以保留稀疏近端结构』

十二、SBC敏感性清算:秩直方图不是一个万能诊断Simulation-Based Calibration Test Quantities

提出Martin Modrák、Angie H. Moon、Shinyoung Kim等,2025年《Bayesian Analysis》20(2):461–488,DOI:10.1214/23-BA1404,〈Simulation-Based Calibration Checking for Bayesian Computation: The Choice of Test Quantities Shapes Sensitivity〉 关键模拟校准能否发现实现错误,取决于被检验的量;只检查单参数秩可漏掉相关结构、联合变换和推断算法的系统偏差

在2025年前后的文献中,标准叙事是“一组均匀参数秩直方图足以证明贝叶斯计算实现正确”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:算法能够运行、后验得到校准、尾部被探索与单位有效样本成本可承受并不是同一件事;旧口径尤其无法解释“被检出的植入错误数/全部植入错误数”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“被检出的植入错误数/全部植入错误数”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

本条命题是:模拟校准能否发现实现错误,取决于被检验的量;只检查单参数秩可漏掉相关结构、联合变换和推断算法的系统偏差。否证方式为:固定目标分布、近似族、计算预算与诊断规则,按“被检出的植入错误数/全部植入错误数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Martin Modrák等在2025年〈Simulation-Based Calibration Checking for Bayesian Computation: The Choice of Test Quantities Shapes Sensitivity〉中的主结果是本条的证据起点。论文构造实现错误并比较参数本身、对数似然、联合函数和重参数化量4类test quantity;不同诊断量对错误的敏感性差异显著,作者据此给出选择工作流。具体读数“被检出的植入错误数/全部植入错误数”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:SBC要求能够从先验预测生成并认为生成器正确;它检验算法相对模型的校准,不检验模型是否贴近现实。有限重复数也限制小偏差检测力。失效条件为:当生成器本身错误、测试量与故障正交或模拟重复过少时,SBC会漏检。收敛需统一对象与“被检出的植入错误数/全部植入错误数”,并公开采样诊断、模拟校准和近似误差及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;概率程序与算法论文应同时输出目标分布、近似假设、链与尾部诊断、模拟校准以及单位有效样本成本,不能把“运行结束”当作收敛。最低报告责任包括“被检出的植入错误数/全部植入错误数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:软件测试称“测试覆盖率”,形式化验证称“性质选择”;另见第352号规格完备性。只有“被检出的植入错误数/全部植入错误数”可换算时才属同一动作;冲突仍在时应测量近似目标、尾部质量与计算预算。

位置S——把『SBC敏感性清算:秩直方图不是一个万能诊断』形成的对象结构作为首要显露 单因决定『SBC敏感性清算:秩直方图不是一个万能诊断』当前结论的最小充分项只有:模拟校准能否发现实现错误,取决于被检验的量;只检查单参数秩可漏掉相关结构、联合变换和推断算法的系统偏差 预设〔02 单一读数代表复杂对象〕一组均匀参数秩直方图足以证明贝叶斯计算实现正确 量纲被检出的植入错误数/全部植入错误数 失效当生成器本身错误、测试量与故障正交或模拟重复过少时,SBC会漏检 自曝『SBC敏感性清算:秩直方图不是一个万能诊断』的原始材料只直接支持“MartinModrák等在2025年〈Simulation-BasedCalibrationCheckingforBayesianComputat”,没有自动覆盖边界外对象 空栏『SBC敏感性清算:秩直方图不是一个万能诊断』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名软件测试称“测试覆盖率”,形式化验证称“性质选择”;另见第 438 号第 8 条『敏捷方法的成功取决于迭代是否产生真实反馈』

◎ 二十年连起来看

第一条贯穿线是:计算对象从参数值变成“近似承诺”。伪边际、ABC、变分与Pathfinder都输出后验近似或精确边际,但每一种“精确”都对应不同扩展状态、容差、近似族和计算预算。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。

第二条贯穿线是:自动化必须携带自我诊断。NUTS与Stan减少手工调参,PSIS、改进R-hat和SBC随后补上尾权重、链混合与实现覆盖。没有诊断的自动化只会更快地产生不可见错误。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。

第三条贯穿线是:模型不再被假定为真。广义贝叶斯允许损失替代似然,stacking在M-开放世界按预测组合,PC先验从基准复杂度出发。未解的是,失配模型下的概率区间如何同时保持决策解释与频率校准。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。

◎ 三个常见误解

误解一:贝叶斯方法天然免于过拟合和多重比较。先验与层级收缩可以控制复杂度,却不能替代模型检查;先验过宽、后验选择与多次探索同样会制造乐观结果。容易误读,是因为后验概率看似已经把一切不确定性统一装进一个数。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。最容易误读之处,应由反例、边界或样本外结果直接揭示。

误解二:MCMC跑得久就一定正确。长链可能困在同一模态,传统R-hat也会漏掉尾部和尺度;需要多起点、发散检查、bulk/tail ESS与后验预测。容易误读,是因为迭代次数是可见的,而探索空间是不可见的。最容易误读之处,应由反例、边界或样本外结果直接揭示。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。

误解三:变分推断只是更快的MCMC。它优化的是近似族内的KL目标,方向性KL会系统低估尾部并偏好单模态;速度换来的是不同误差结构。容易误读,是因为两者最后都输出“后验样本”。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。最容易误读之处,应由反例、边界或样本外结果直接揭示。

◎ 与相邻领域的接口

与第306号生物统计学的接口在目标量和校准:贝叶斯计算给出后验与近似诊断,生物统计决定临床estimand、因果识别与外推;一个后验算得再精确,也可能回答错问题。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

与第309号时间序列的接口在状态空间、粒子MCMC与预测组合。本块关注后验计算和算法诊断,第309号关注滚动时间下的预测损失、结构变化与层级一致性。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。

与第304号可计算性与递归论的接口在算法边界:本块多讨论有限预算下的近似误差,第304号追问是否存在统一算法和收敛模量;大数据MCMC的查询下界处于两者交界。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。

与第360号系统性能与能效的接口在“有效样本/成本”:后验算法应以每梯度、每秒和每焦耳的有效样本与校准误差比较,而不是只看迭代数。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。

◎ 争议现场

第一场争论是广义后验的学习率怎样校准。相干性给出指数损失形式,却不唯一给出温度;不同温度改变区间宽度和先验权重。要收敛,需要在可生成数据的任务上以覆盖率和决策损失联合校准,并报告温度敏感性。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。

第二场争论是变分近似能否承担科学不确定性。支持者强调大模型和实时推断不可离开VI,批评者指出尾部与多模态失真不可见。要收敛,需要共同PosteriorDB、决策相关函数量、计算等预算和外部模拟真值。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。

第三场争论是自动诊断能否成为“通过证书”。R-hat、ESS、PSIS-k和SBC都只检查某类故障。要收敛,需要报告诊断覆盖矩阵:每个故障类型由哪一个测试量检测,以及未覆盖哪些结构。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。

◎ 往下五年看什么

观察点一是概率程序默认报告中,发散率、bulk/tail ESS、PSIS-k与SBC是否形成统一机器可读记录,而不是散落在日志里。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。

观察点二是Pathfinder、VI与短链HMC在相同梯度预算下,对决策相关后验函数的误差比和能耗比;单一ELBO不再足够。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。

观察点三是模拟型推断基准从十余标准任务扩展到真实昂贵模拟器后,算法排名的稳定率与失配敏感性。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

观察点四是广义贝叶斯学习率在独立数据中的区间覆盖率、预测得分与决策损失三者能否同时校准。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。

◎ 可与哪些领域对撞

本块第二条“伪边际MCMC”可与第304号“表示依赖的可计算性”对撞。共享预设是不可直接求值的对象可以由随机名字代表;相反点是伪边际只要求无偏而允许噪声,可计算分析要求误差模量。若两边都成立,第三项是随机表示何时携带足够认证信息。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

本块第十四条“PSIS-LOO”可与第360号“尾延迟”对撞。共享预设是平均值会掩盖少数高权重事件;相反点是PSIS平滑尾部以稳定估计,系统工程要直接限制尾部服务时间。若两边都成立,必须引入第三项:哪些尾部应被平滑,哪些必须被保留为风险。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。第三项必须能产生新的可证伪读数,不能只是折中措辞。

本块第十六条“stacking”可与第309号预测组合对撞。共享预设是候选模型都可能错;相反点是贝叶斯stacking按留一对数得分优化分布组合,传统组合常按点预测误差或固定平均。若两边都成立,第三项是评分规则决定组合权重。第三项必须能产生新的可证伪读数,不能只是折中措辞。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。

本块第二十条“SBC测试量”可与第352号形式化方法中的“规格覆盖”对撞。共享预设是验证只能发现被明示的性质;相反点是SBC用随机生成与统计检验,形式化证明用逻辑穷尽。若两边都成立,第三项是性质选择本身必须被审计。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

◎ 十条可做的研究命题

1. 命题:伪边际MCMC的效率主要由对数似然方差而非似然估计均方误差决定;在同模型调节粒子数与相关随机数;若均方误差解释更多ESS,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。

2. 命题:ABC模型选择的错误可由跨模型摘要的分类信息量预测;在已知Bayes因子任务上比较摘要;若信息量与误差无关,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

3. 命题:NUTS发散率比总迭代数更能预测后验函数偏差;建立模拟漏斗基准;若迭代数预测更强,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

4. 命题:广义贝叶斯学习率按覆盖率校准后,样本外决策损失优于固定温度;在多类失配模型中比较;若无增益,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

5. 命题:PSIS-k大于0.7的观测也是模型失配的稳定定位器;对高k点做独立数据复核;若多数只是数值偶然,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

6. 命题:stacking在候选模型结构互补时优于BMA,而在模型近重复时无增益;量化预测残差相关;若关系不存在,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

7. 命题:线性响应VB能改善协方差却不能修复均值偏差;在多模态模拟中分别比较;若均值也稳定改善,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

8. 命题:Pathfinder的优势随局部曲率可辨识性增加;用Hessian条件数分层PosteriorDB;若性能与条件数无关,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

9. 命题:同时使用参数、对数似然和联合函数的SBC测试量,错误检出率高于单参数秩;植入可控实现故障;若检出率不高,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

10. 命题:以每焦耳有效样本与校准误差排序,会改变传统按壁钟时间得到的贝叶斯算法排名;实测多硬件;若排名不变,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

◎ 资料核验

  1. Yee Whye Teh、Michael Jordan、Matthew Beal与David Blei,2006年《Journal of the American Statistical Association》101(476):1566–1581,DOI:10.1198/016214506000000302,〈Hierarchical Dirichlet Processes〉
  2. Christophe Andrieu与Gareth Roberts,2009年《The Annals of Statistics》37(2):697–725,DOI:10.1214/07-AOS574,〈The Pseudo-Marginal Approach for Efficient Monte Carlo Computations〉
  3. Tina Toni、David Welch、Natalja Strelkowa等,2009年《Journal of the Royal Society Interface》6(31):187–202,DOI:10.1098/rsif.2008.0172,〈Approximate Bayesian Computation Scheme for Parameter Inference and Model Selection in Dynamical Systems〉
  4. Christophe Andrieu、Arnaud Doucet与Roman Holenstein,2010年《Journal of the Royal Statistical Society: Series B》72(3):269–342,DOI:10.1111/j.1467-9868.2009.00736.x,〈Particle Markov Chain Monte Carlo Methods〉
  5. Christian Robert、Jean-Marie Cornuet、Jean-Michel Marin与Natesh Pillai,2011年《Proceedings of the National Academy of Sciences》108(37):15112–15117,DOI:10.1073/pnas.1102900108,〈Lack of Confidence in Approximate Bayesian Computation Model Choice〉
  6. Jasper Snoek、Hugo Larochelle与Ryan Adams,2012年《Advances in Neural Information Processing Systems》25:2951–2959,〈Practical Bayesian Optimization of Machine Learning Algorithms〉
  7. Matthew Hoffman、David Blei、Chong Wang与John Paisley,2013年《Journal of Machine Learning Research》14:1303–1347,〈Stochastic Variational Inference〉
  8. Matthew Hoffman与Andrew Gelman,2014年《Journal of Machine Learning Research》15:1593–1623,〈The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo〉
  9. Pier Giovanni Bissiri、Chris Holmes与Stephen Walker,2016年《Journal of the Royal Statistical Society: Series B》78(5):1103–1130,DOI:10.1111/rssb.12158,〈A General Framework for Updating Belief Distributions〉
  10. Bob Carpenter、Andrew Gelman、Matthew Hoffman等,2017年《Journal of Statistical Software》76(1):1–32,DOI:10.18637/jss.v076.i01,〈Stan: A Probabilistic Programming Language〉
  11. Alp Kucukelbir、Dustin Tran、Rajesh Ranganath、Andrew Gelman与David Blei,2017年《Journal of Machine Learning Research》18(14):1–45,〈Automatic Differentiation Variational Inference〉
  12. Daniel Simpson、Håvard Rue、Andrea Riebler、Thiago Martins与Sigrunn Sørbye,2017年《Statistical Science》32(1):1–28,DOI:10.1214/16-STS576,〈Penalising Model Component Complexity: A Principled, Practical Approach to Constructing Priors〉
  13. Aki Vehtari、Andrew Gelman与Jonah Gabry,2017年《Statistics and Computing》27:1413–1432,DOI:10.1007/s11222-016-9696-4,〈Practical Bayesian Model Evaluation Using Leave-One-Out Cross-Validation and WAIC〉
  14. Rémi Bardenet、Arnaud Doucet与Chris Holmes,2017年《Journal of Machine Learning Research》18(47):1–62,〈On Markov Chain Monte Carlo Methods for Tall Data〉
  15. Yuling Yao、Aki Vehtari、Daniel Simpson与Andrew Gelman,2018年《Bayesian Analysis》13(3):917–1007,DOI:10.1214/17-BA1091,〈Using Stacking to Average Bayesian Predictive Distributions〉
  16. Ryan Giordano、Tamara Broderick与Michael Jordan,2018年《Journal of Machine Learning Research》19(74):1–47,〈Covariances, Robustness and Variational Bayes〉
  17. Aki Vehtari、Andrew Gelman、Daniel Simpson等,2021年《Bayesian Analysis》16(2):667–718,DOI:10.1214/20-BA1221,〈Rank-Normalization, Folding, and Localization: An Improved R-hat for Assessing Convergence of MCMC〉
  18. Jan-Matthis Lueckmann、Jan Boelts、David Greenberg等,2021年《Proceedings of Machine Learning Research》130:343–351,〈Benchmarking Simulation-Based Inference〉
  19. Lu Zhang、Bob Carpenter、Andrew Gelman与Aki Vehtari,2022年《Journal of Machine Learning Research》23(306):1–49,〈Pathfinder: Parallel Quasi-Newton Variational Inference〉
  20. Martin Modrák、Angie H. Moon、Shinyoung Kim等,2025年《Bayesian Analysis》20(2):461–488,DOI:10.1214/23-BA1404,〈Simulation-Based Calibration Checking for Bayesian Computation: The Choice of Test Quantities Shapes Sensitivity〉
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行碰撞行(预设/量纲/失效/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板