统计学
近二十年统计学最深的变化,不是增加了多少算法,而是重新规定“什么算一个可负责的结论”。第一幕面对的是维数暴涨、网络依赖、海量检验、隐私约束和事后选择:样本不再天然独立,参数数目可以超过观测数,分析路径本身也会改变零分布。第二幕进一步把机器学习、因果推断与实时决策拉进同一责任链:预测器可以很复杂,但置信区间、覆盖率、错误发现率和外推边界必须仍然可核对。从稀疏性、合成控制和共形预测,到双重机器学习、目标试验、e值与预测增强推断,这二十条共同完成了一次判据更换:统计学不再只问模型在已见数据上拟合多好,而要问在选择、漂移、隐私、污染和重复查看之后,错误率还能否保持原来的含义。
第一幕的共同动作,是把高维、依赖、隐私和分析者选择从“技术细节”提升为推断对象;旧的固定设计、固定模型与单次检验假设由此逐项失效。
甲、高维稀疏性把“参数多于样本”从禁区变成条件命题High-Dimensional Sparsity as an Inferential Assumption
经典线性模型默认观测数n明显大于参数数p,变量一多便被视为不可识别;基因表达和成像数据却让p达到数万而n只有数百,删变量或逐个检验都会破坏联合结构。在2007年前后,围绕“高维稀疏性把“参数多于样本”从禁区变成条件命题”出现的异常把这一旧默认推到前台。就“高维稀疏性把“参数多于样本”从禁区变成条件命题”而言,这使旧框架在样本扩张、尺度变化或干预发生时失去可比性,研究对象本身必须重新界定。
高维推断并非天然不可能,决定可恢复性的不是p本身,而是真实信号的稀疏度、设计矩阵的相关结构和惩罚尺度。L1约束把不可解的无限候选压缩为少数活动坐标,但稀疏性是需要检验的结构假设,不是免费的算法魔法。High-Dimensional Sparsity as an Inferential Assumption由此给出一条可检验的因果或结构主张。在统计学的“高维稀疏性把“参数多于样本”从禁区变成条件命题”问题上,其关键不是给现象换名,而是给出可以跨样本比较的控制量,并明确何时不再适用。
Candès与Tao在2007年给出Dantzig选择器,在p≫n的情形把估计误差界写成稀疏度s、噪声σ与log p的函数;模拟与真实数据表明,当受限等距或兼容条件近似成立时,恢复误差随s log p/n缩放。围绕“高维稀疏性把“参数多于样本”从禁区变成条件命题”,这组2007年前后的观测至少包含两个可复核锚点。以“高维稀疏性把“参数多于样本”从禁区变成条件命题”为例,结果把概念争论压成了可测差异:若更换数据、仪器或边界后该比例消失,理论就失去支撑。
强相关变量会造成选择不稳定,弱而密集的信号也可能被L1惩罚系统性压小;2020年的大规模比较显示,最佳子集、前向选择和lasso的优劣随信噪比与相关结构切换,没有一个方法在所有设计上占优。到2020年前后的后续工作,“高维稀疏性把“参数多于样本”从禁区变成条件命题”的争点已从“是否存在”转到“在哪个边界失效”。围绕“高维稀疏性把“参数多于样本”从禁区变成条件命题”这条命题,只要这些混杂未被分离,相关性仍可能很强,却不能据此宣称机制已经确定。
这条转向使“变量筛选”与“效应估计”被分开,交叉验证、稳定选择和去偏估计进入标准流程;生物统计与金融风控开始同时报告预测误差、选择频率和系数不确定性。在2020年前后的统计推断实践中,高维稀疏性把“参数多于样本”从禁区变成条件命题因此改变了至少一个数据、实验或解释环节。就“高维稀疏性把“参数多于样本”从禁区变成条件命题”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
它与第047号机器学习理论面板共享容量控制问题,却把错误率与置信区间留在中心;与第213号数值分析面板相比,本条关心的是结构可识别性而非求解器收敛速度。到2020年的接口比较中,另见第047号面板所用的相邻术语,但本条保留统计学自己的证据口径。
乙、图模型把协方差矩阵改写成条件依赖网络Sparse Graphical Models and Precision-Matrix Networks
传统多元统计常把协方差矩阵当作需要整体估计的二阶对象,高维时矩阵奇异且每个相关系数都受间接路径污染;研究者难以区分直接联系与由第三变量传递的表面相关。在2008年前后,围绕“图模型把协方差矩阵改写成条件依赖网络”出现的异常把这一旧默认推到前台。在统计学的“图模型把协方差矩阵改写成条件依赖网络”问题上,当这一遗漏进入真实数据后,误差不再只是数值偏差,而会改变研究者认定的因果方向与边界。
若联合分布近似高斯,精度矩阵中的零元素可被解释为给定其余变量后的条件独立,因此估计一个稀疏逆协方差就等于恢复一张直接依赖网络。graphical lasso用对数行列式似然与L1惩罚平衡拟合和边稀疏度,使网络结构与正定性在同一优化问题中被估计。Sparse Graphical Models and Precision-Matrix Networks由此给出一条可检验的因果或结构主张。以“图模型把协方差矩阵改写成条件依赖网络”为例,与旧框架相比,新增的不是更多参数,而是一个能够区分竞争机制的次序判据。
Friedman等在2008年给出坐标下降算法,把数千变量的精度矩阵估计化为一系列lasso回归;Ravikumar等在2011年证明,样本量达到与最大节点度平方乘log p同阶时,边集合可在条件下被一致恢复。围绕“图模型把协方差矩阵改写成条件依赖网络”,这组2008年前后的观测至少包含两个可复核锚点。围绕“图模型把协方差矩阵改写成条件依赖网络”这条命题,在这一证据链中,年份、样本规模与不确定区间共同限制了结论能够外推到多远。
零边只表示条件独立,不自动意味着因果方向;非高斯分布、潜在变量和批次效应都能制造假边,惩罚参数的小幅改变也会重排稀疏网络,故“画出网络”不能等同于发现机制。到2011年前后的后续工作,“图模型把协方差矩阵改写成条件依赖网络”的争点已从“是否存在”转到“在哪个边界失效”。就“图模型把协方差矩阵改写成条件依赖网络”而言,这也解释了为什么相同标题的研究可能得到相反结果:它们实际上测量了不同分母。
该框架把代谢组、脑网络和金融联动中的“相关热图”升级为可检验的条件依赖图,并促使稳定性选择、潜变量图模型和非参数图模型发展。在2011年前后的统计推断实践中,图模型把协方差矩阵改写成条件依赖网络因此改变了至少一个数据、实验或解释环节。在统计学的“图模型把协方差矩阵改写成条件依赖网络”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第035号系统与网络生物学面板相比,本条提供的是误差受控的边恢复;与第177号社会网络分析不同,它从变量的联合分布推网络,而不是直接观察关系。到2011年的接口比较中,另见第035号面板所用的相邻术语,但本条保留统计学自己的证据口径。
丙、经验零分布承认“理论零”会被大规模实验扭曲Empirical Nulls in Large-Scale Testing
微阵列时代一次进行上万次检验,传统流程仍把每个z值与N(0,1)比较;样本相关、未建模混杂和标准误偏差会让中心峰变宽或平移,于是理论零分布产生系统性假阳性。在2008年前后,围绕“经验零分布承认“理论零”会被大规模实验扭曲”出现的异常把这一旧默认推到前台。以“经验零分布承认“理论零”会被大规模实验扭曲”为例,于是,原本被放在脚注里的条件开始主导结论,继续沿用旧近似会把系统性差异误写成随机波动。
在大规模并行检验中,零假设群体本身可以作为混合模型的一部分估计;经验零分布、局部错误发现率与效应分布应联合校准。两组模型把观测统计量写成零组与非零组的混合,中心区域估计零组位置和尺度,尾部概率再转成每个发现的后验错误率。Empirical Nulls in Large-Scale Testing由此给出一条可检验的因果或结构主张。围绕“经验零分布承认“理论零”会被大规模实验扭曲”这条命题,这一转向的实质,是把默认假设从不可见背景变成可以单独操纵和计量的实验变量。
Efron在2008年用前列腺癌微阵列示例展示理论零N(0,1)与经验零的中心和方差差异;当标准差从1偏到约1.5时,同一z阈值对应的局部FDR会出现数量级变化,发现清单也随之重排。围绕“经验零分布承认“理论零”会被大规模实验扭曲”,这组2008年前后的观测至少包含两个可复核锚点。就“经验零分布承认“理论零”会被大规模实验扭曲”而言,由此得到的并非无条件常数,而是一个带样本、时间与误差范围的经验阈值。
若真实效应高度集中在零附近,中心匹配会把弱信号吞入零组;经验零也可能把实验设计缺陷“校准掉”而不是修复,因而必须与已知阴性对照、置换和批次诊断共同使用。到2017年前后的后续工作,“经验零分布承认“理论零”会被大规模实验扭曲”的争点已从“是否存在”转到“在哪个边界失效”。在统计学的“经验零分布承认“理论零”会被大规模实验扭曲”问题上,争论能否收敛,取决于是否在同一协议下同时测量竞争变量,而不是各自选择有利数据。
这条思路把“p值小”改成“在当前实验的所有候选中,这个发现有多大概率来自零组”,并推动自适应收缩、局部符号错误率和效应量排序。在2017年前后的统计推断实践中,经验零分布承认“理论零”会被大规模实验扭曲因此改变了至少一个数据、实验或解释环节。以“经验零分布承认“理论零”会被大规模实验扭曲”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第030号单细胞组学面板的差异表达相接时,本条负责校准成千上万基因的错误率;与第334号蛋白质组学规划面板共享多重检验但不替代其测量模型。到2017年的接口比较中,另见第030号面板所用的相邻术语,但本条保留统计学自己的证据口径。
丁、差分隐私把隐私损失写成可累计的统计预算Differential Privacy as a Statistical Budget
过去的数据匿名化依赖去名、抽样或抑制小单元,但外部数据联结可重新识别个体;更严重的是,隐私风险没有统一量纲,发布次数增加后无法结算累积泄露。在2006年前后,围绕“差分隐私把隐私损失写成可累计的统计预算”出现的异常把这一旧默认推到前台。围绕“差分隐私把隐私损失写成可累计的统计预算”这条命题,这一矛盾说明,问题不在仪器或算法还不够精细,而在旧对象定义把关键自由度排除在外。
差分隐私要求相邻数据库的输出分布在乘法因子e\^ε内接近,使任何个人是否在数据中都只有限度改变观察者的后验判断。查询敏感度决定需要加入的Laplace或Gaussian噪声,组合定理则把多次发布的ε与δ累加为一张可审计的隐私账本。Differential Privacy as a Statistical Budget由此给出一条可检验的因果或结构主张。就“差分隐私把隐私损失写成可累计的统计预算”而言,这一说法把机制、测量与决策连在一起,使支持证据必须同时满足方向、量级与顺序三项约束。
Dwork等在2006年证明,对敏感度Δf的数值查询加入尺度Δf/ε的Laplace噪声可满足ε-差分隐私;2018年美国人口普查局宣布将该框架用于2020人口普查,说明它已从定理进入国家级统计生产。围绕“差分隐私把隐私损失写成可累计的统计预算”,这组2006年前后的观测至少包含两个可复核锚点。在统计学的“差分隐私把隐私损失写成可累计的统计预算”问题上,因此,证据不是一条漂亮曲线,而是一组可以在独立数据中重新计算的数量关系。
ε并非直观的“再识别概率”,预算选择带有政策判断;小地区、稀有群体和高维列联表对噪声尤其敏感,隐私增强可能把结构性少数的统计信号淹没。到2018年前后的后续工作,“差分隐私把隐私损失写成可累计的统计预算”的争点已从“是否存在”转到“在哪个边界失效”。以“差分隐私把隐私损失写成可累计的统计预算”为例,因此,本条的边界不是一句“仍需研究”,而是当上述条件被满足时,原命题应明确退出。
官方统计因此必须同时发布精度损失、预算分配和后处理规则,抽样误差之外增加“隐私噪声”这一独立误差源;数据使用者也不能把经后处理的表格当作原始计数。在2018年前后的统计推断实践中,差分隐私把隐私损失写成可累计的统计预算因此改变了至少一个数据、实验或解释环节。围绕“差分隐私把隐私损失写成可累计的统计预算”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
它与第172号数据与隐私法面板共享“谁承担隐私成本”的问题,但本条给出的是输出分布约束;与第250号数据库面板相比,重点是推断效用而非访问控制。到2018年的接口比较中,另见第172号面板所用的相邻术语,但本条保留统计学自己的证据口径。就“差分隐私把隐私损失写成可累计的统计预算”而言,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
戊、合成控制用“加权对照体”替代不存在的双胞胎Synthetic Control as a Constructed Counterfactual
政策通常只在一个国家、州或城市实施,传统回归依赖线性外推,差分中的差分又要求平行趋势;当只有一个处理单位且趋势明显不同,研究者没有自然对照组。在2010年前后,围绕“合成控制用“加权对照体”替代不存在的双胞胎”出现的异常把这一旧默认推到前台。就“合成控制用“加权对照体”替代不存在的双胞胎”而言,从那以后,领域内真正需要比较的就不再是单个中心值,而是不同条件下结构是否仍保持。
从未受处理的供体池中选择非负、和为1的权重,使处理前结果与协变量轨迹尽量贴合;处理后的实际值与合成值之差被视为政策效应。权重由处理前拟合确定,安慰剂检验把每个供体轮流当作处理单位,效应大小相对于安慰剂分布而非单一标准误解释。Synthetic Control as a Constructed Counterfactual由此给出一条可检验的因果或结构主张。在统计学的“合成控制用“加权对照体”替代不存在的双胞胎”问题上,如果该命题成立,同一对象在不同尺度上的读数应能通过明确的比率、阈值或结构量相互换算。
Abadie等在2010年重估加州1988年控烟法,合成加州在处理前的香烟销售轨迹高度贴合,处理后人均年销售与合成对照的差距逐步扩大;供体置换显示加州差距相对多数州异常。围绕“合成控制用“加权对照体”替代不存在的双胞胎”,这组2010年前后的观测至少包含两个可复核锚点。以“合成控制用“加权对照体”替代不存在的双胞胎”为例,数字本身不是终点,更要紧的是它规定了后续复现必须保留的分母与对照条件。
供体池若缺少可组合出处理单位的轨迹,权重会集中在少数单位并产生外推;处理外溢、同期冲击和短处理前序列也会破坏解释,优秀的处理前拟合不是因果充分条件。到2021年前后的后续工作,“合成控制用“加权对照体”替代不存在的双胞胎”的争点已从“是否存在”转到“在哪个边界失效”。围绕“合成控制用“加权对照体”替代不存在的双胞胎”这条命题,截至后续复核,最稳妥的结论仍是限定性的,而不是把一个局部机制升级为普遍定律。
合成控制把个案研究变成一套可审计的权重与图形诊断,随后扩展到矩阵补全、合成差分和多个处理单位;报告规范开始要求公开供体、权重和安慰剂路径。在2021年前后的统计推断实践中,合成控制用“加权对照体”替代不存在的双胞胎因此改变了至少一个数据、实验或解释环节。就“合成控制用“加权对照体”替代不存在的双胞胎”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第074号因果推断与计量面板相比,本条强调单个处理单位的构造性反事实;与第085号公共政策面板的政策评估相接时,统计学负责识别而非价值判断。到2021年的接口比较中,另见第074号面板所用的相邻术语,但本条保留统计学自己的证据口径。
己、共形预测把不确定性从模型假设转成有限样本覆盖Conformal Prediction and Finite-Sample Coverage
传统预测区间依赖线性、高斯或正确似然;模型复杂后,人们常只报告点预测或用交叉验证误差代替个体不确定性,但平均误差不能告诉某个新样本会落在哪里。在2008年前后,围绕“共形预测把不确定性从模型假设转成有限样本覆盖”出现的异常把这一旧默认推到前台。在统计学的“共形预测把不确定性从模型假设转成有限样本覆盖”问题上,旧模型能够描述平均情形,却无法解释极端样本、局部亚群与时间变化同时出现时的失败。
把训练后的非一致性分数与校准样本排序比较,可以为新样本构造预测集合;只要数据交换,边际覆盖率至少为1−α,预测器本身可以是黑箱。split conformal用一部分数据拟合模型、另一部分计算残差分位数,集合宽度由第ceil((n+1)(1−α))个分数决定,而非渐近正态近似。Conformal Prediction and Finite-Sample Coverage由此给出一条可检验的因果或结构主张。以“共形预测把不确定性从模型假设转成有限样本覆盖”为例,它把一个可被反驳的关系放到中心:只要控制变量改变而预言方向不变,命题就应当失败。
Shafer与Vovk在2008年系统化该框架;以n个校准分数为例,排名对称性给出有限样本覆盖保证,α=0.1时目标覆盖为90%,无需知道误差分布的方差或尾部形状。围绕“共形预测把不确定性从模型假设转成有限样本覆盖”,这组2008年前后的观测至少包含两个可复核锚点。围绕“共形预测把不确定性从模型假设转成有限样本覆盖”这条命题,这一设计尤其重要,因为它把先验上相似的两种解释放进同一套观测口径中比较。
保证通常是边际而非条件覆盖,少数亚群可能系统性欠覆盖;数据漂移、时间依赖和校准集过小会破坏交换性,集合很宽时“覆盖正确”也可能没有决策价值。到2023年前后的后续工作,“共形预测把不确定性从模型假设转成有限样本覆盖”的争点已从“是否存在”转到“在哪个边界失效”。就“共形预测把不确定性从模型假设转成有限样本覆盖”而言,这场争论留下的价值,恰是把失败条件写得比成功故事更清楚。
共形层让医疗、气象和机器学习系统可以分别优化点预测与覆盖控制,并推动风险控制集合、在线共形和组条件校准;评价指标从准确率扩展到覆盖—宽度曲线。在2023年前后的统计推断实践中,共形预测把不确定性从模型假设转成有限样本覆盖因此改变了至少一个数据、实验或解释环节。在统计学的“共形预测把不确定性从模型假设转成有限样本覆盖”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第047号机器学习理论面板相比,本条不限制预测器形式而限制误差承诺;与第112号临床试验方法学相接时,可用于个体风险区间但不能替代随机化。到2023年的接口比较中,另见第047号面板所用的相邻术语,但本条保留统计学自己的证据口径。
庚、选择后推断承认“看过数据”会改变零分布Post-Selection Inference after Model Search
研究者常先看数据、筛变量、选模型,再把最终模型当作预先指定并使用普通t检验;每一步搜索都在挑选有利噪声,却没有进入标准误,显著性因此被系统性夸大。在2013年前后,围绕“选择后推断承认“看过数据”会改变零分布”出现的异常把这一旧默认推到前台。以“选择后推断承认“看过数据”会改变零分布”为例,这类反例累积后,研究者不得不承认:背景条件不是噪声,背景条件就是命题的一部分。
推断目标必须条件化于选择事件或对整个模型搜索过程提供同时保证;选择规则是数据生成链的一部分,不能在推断阶段被抹去。PoSI给所有可能子模型的线性组合同时覆盖,选择性推断则把lasso选择事件表示成多面体约束,在该条件下计算截断正态分布。Post-Selection Inference after Model Search由此给出一条可检验的因果或结构主张。围绕“选择后推断承认“看过数据”会改变零分布”这条命题,由此,理论不再允许事后挑选解释,在数据到来之前,它已经规定了什么结果会构成反证。
Berk等在2013年给出模型无关的同时置信区间,其临界值随候选模型数量扩大;Lee等在2016年证明lasso选择事件可写为Ay≤b,并由此得到选择后p值和区间。围绕“选择后推断承认“看过数据”会改变零分布”,这组2013年前后的观测至少包含两个可复核锚点。就“选择后推断承认“看过数据”会改变零分布”而言,这些读数的意义在于,它们同时给出了效应方向、可重复尺度和旧模型开始失真的位置。
条件化越充分,区间可能越宽、功效越低;真实工作流若包含手工图形、数据清洗与反复尝试,选择事件难以完整编码,形式上的一次选择仍可能低估实际自由度。到2016年前后的后续工作,“选择后推断承认“看过数据”会改变零分布”的争点已从“是否存在”转到“在哪个边界失效”。在统计学的“选择后推断承认“看过数据”会改变零分布”问题上,边界条件一旦越过,理论预测应当发生符号、阈值或排序上的可见改变,否则它只是叙述。
这一转向催生数据分割、数据雕刻、预注册与独立验证集;软件输出不再只给最终系数,还需记录候选集合和选择路径,以便判断误差承诺对应哪一次分析。在2016年前后的统计推断实践中,选择后推断承认“看过数据”会改变零分布因此改变了至少一个数据、实验或解释环节。以“选择后推断承认“看过数据”会改变零分布”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第496号开放科学与科研诚信规划面板的预注册相接时,本条解释其统计必要性;与第255号软件工程面板相比,分析日志既是复现资产也是推断条件。到2016年的接口比较中,另见第496号面板所用的相邻术语,但本条保留统计学自己的证据口径。围绕“选择后推断承认“看过数据”会改变零分布”这条命题,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
辛、可重复性危机把p值从裁决器降为一项证据The Replication Crisis and the Demotion of the P-Value
“p<0.05”长期被当作发现门槛,默认分析方案在数据之前固定;现实中样本量、变量、协变量和报告结果可在看过数据后调整,论文却只展示最后一条路径。在2011年前后,围绕“可重复性危机把p值从裁决器降为一项证据”出现的异常把这一旧默认推到前台。围绕“可重复性危机把p值从裁决器降为一项证据”这条命题,因此,新的问题不是在旧公式上再加一项修正,而是重新决定什么算一次观测、一次状态或一次机制。
显著性不是数据的固有属性,而是设计、分析选择和报告制度共同产生的结果;若路径未固定,名义一类错误率不能继续按5%解释。研究者自由度构成一棵分支树,每条路径单独看都合法,事后选择最小p值却等价于隐性多重检验;透明报告与重复实验才重新约束错误率。The Replication Crisis and the Demotion of the P-Value由此给出一条可检验的因果或结构主张。就“可重复性危机把p值从裁决器降为一项证据”而言,它因此把“看起来相关”推进到“改变哪个量会先改变哪个结果”的层面。
Simmons等2011年的模拟与实验表明,仅允许灵活选择样本停止、协变量和结果,就能把不存在效应报告为显著;2016年ASA声明明确指出,p值不测量假设为真的概率,也不应单独决定结论。围绕“可重复性危机把p值从裁决器降为一项证据”,这组2011年前后的观测至少包含两个可复核锚点。在统计学的“可重复性危机把p值从裁决器降为一项证据”问题上,这一步使领域第一次能够区分“模型拟合得好”与“模型抓住了生成机制”。
危机并不意味着所有p值都无效,也不意味着贝叶斯方法自动免疫;效应量、先验和模型选择同样会被选择性使用,机械把阈值改成0.005仍无法修复未披露路径。到2016年前后的后续工作,“可重复性危机把p值从裁决器降为一项证据”的争点已从“是否存在”转到“在哪个边界失效”。以“可重复性危机把p值从裁决器降为一项证据”为例,后续研究若只增加样本而不改变识别设计,通常只能缩小错误答案的置信区间。
注册报告、开放数据、功效分析和多重分析逐渐进入期刊流程;统计咨询也从“怎样得到显著”转向“怎样让设计、估计与不确定性支持同一问题”。在2016年前后的统计推断实践中,可重复性危机把p值从裁决器降为一项证据因此改变了至少一个数据、实验或解释环节。围绕“可重复性危机把p值从裁决器降为一项证据”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第496号科研诚信面板共享制度改革,但本条说明错误率怎样被分析路径改变;与第146号心理测量学相比,重点不是量表可靠性而是结论选择机制。到2016年的接口比较中,另见第496号面板所用的相邻术语,但本条保留统计学自己的证据口径。就“可重复性危机把p值从裁决器降为一项证据”而言,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
第二幕把这套自我约束带入机器学习与因果决策:模型可以由算法学习,但效应、覆盖和风险必须在样本外、干预后与数据漂移中重新结算。
一、模型X敲除变量把错误发现率带入黑箱协变量分布Model-X Knockoffs for Controlled Variable Selection
高维变量选择通常依赖正确的响应模型;一旦线性形式错了,lasso的p值和选择保证一起失效,而复杂预测器虽能拟合非线性,却不给变量级错误发现率。在2018年前后,围绕“模型X敲除变量把错误发现率带入黑箱协变量分布”出现的异常把这一旧默认推到前台。就“模型X敲除变量把错误发现率带入黑箱协变量分布”而言,这使旧框架在样本扩张、尺度变化或干预发生时失去可比性,研究对象本身必须重新界定。
若协变量联合分布可估计,就能为每个Xj构造一个交换对称的knockoff X̃j;原变量相对副本的预测重要性差异可在不指定Y\|X模型时控制FDR。敲除统计量满足交换符号性质,数据驱动阈值比较正负极端数目,用“假变量胜出”的频率估计真实选择中的错误比例。Model-X Knockoffs for Controlled Variable Selection由此给出一条可检验的因果或结构主张。在统计学的“模型X敲除变量把错误发现率带入黑箱协变量分布”问题上,其关键不是给现象换名,而是给出可以跨样本比较的控制量,并明确何时不再适用。
Candès等2018年在基因组与模拟中展示,目标q=0.1时选择集合的期望FDR可维持在10%附近,同时允许随机森林和神经网络定义重要性;2020年研究进一步分析协变量分布估计误差下的稳健性。围绕“模型X敲除变量把错误发现率带入黑箱协变量分布”,这组2018年前后的观测至少包含两个可复核锚点。以“模型X敲除变量把错误发现率带入黑箱协变量分布”为例,结果把概念争论压成了可测差异:若更换数据、仪器或边界后该比例消失,理论就失去支撑。
核心困难从响应模型转移到X的联合分布;高维离散、强依赖或生成模型错配会制造不合格副本,边际FDR受控也不保证每个科学亚组都公平。到2020年前后的后续工作,“模型X敲除变量把错误发现率带入黑箱协变量分布”的争点已从“是否存在”转到“在哪个边界失效”。围绕“模型X敲除变量把错误发现率带入黑箱协变量分布”这条命题,只要这些混杂未被分离,相关性仍可能很强,却不能据此宣称机制已经确定。
模型X框架让“黑箱预测+白箱错误率”成为可能,推动基因关联、电子健康记录和多模态筛选中使用生成式协变量模型,并要求单独诊断knockoff质量。在2020年前后的统计推断实践中,模型X敲除变量把错误发现率带入黑箱协变量分布因此改变了至少一个数据、实验或解释环节。就“模型X敲除变量把错误发现率带入黑箱协变量分布”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第045号生成模型面板相接时,生成器用于构造负对照而非生成样本;与第025号基因组学相比,本条控制的是入选变量比例而非单个基因p值。到2020年的接口比较中,另见第045号面板所用的相邻术语,但本条保留统计学自己的证据口径。
二、双重机器学习用正交化隔离“预测误差”和“因果参数”Double and Debiased Machine Learning
高维混杂下,倾向得分和结果回归都需要灵活模型;直接把正则化预测代入效应公式会把机器学习偏差传给处理效应,标准误也忽略了同一数据被反复拟合。在2018年前后,围绕“双重机器学习用正交化隔离“预测误差”和“因果参数””出现的异常把这一旧默认推到前台。在统计学的“双重机器学习用正交化隔离“预测误差”和“因果参数””问题上,当这一遗漏进入真实数据后,误差不再只是数值偏差,而会改变研究者认定的因果方向与边界。
构造对干扰参数一阶误差不敏感的正交得分,并用cross-fitting让每个观测的残差由未见过它的模型产生,可把预测器的慢收敛与目标参数的根n推断分开。处理模型与结果模型分别估计,残差化后求矩条件;只要两类干扰误差乘积足够小,目标效应仍可近似正态并形成常规置信区间。Double and Debiased Machine Learning由此给出一条可检验的因果或结构主张。以“双重机器学习用正交化隔离“预测误差”和“因果参数””为例,与旧框架相比,新增的不是更多参数,而是一个能够区分竞争机制的次序判据。
Chernozhukov等2018年证明,在干扰估计达到n\^−1/4量级且采用K折交叉拟合时,多类平均处理效应估计可实现根n一致;后续DoubleML软件把重复分割、标准误与敏感性分析固定成可复算流程。围绕“双重机器学习用正交化隔离“预测误差”和“因果参数””,这组2018年前后的观测至少包含两个可复核锚点。围绕“双重机器学习用正交化隔离“预测误差”和“因果参数””这条命题,在这一证据链中,年份、样本规模与不确定区间共同限制了结论能够外推到多远。
正交化不能修复未观测混杂、重叠不足和错误因果图;小样本中折数、学习器与超参数会影响有限样本偏差,多次尝试学习器仍会重新引入选择问题。到2022年前后的后续工作,“双重机器学习用正交化隔离“预测误差”和“因果参数””的争点已从“是否存在”转到“在哪个边界失效”。就“双重机器学习用正交化隔离“预测误差”和“因果参数””而言,这也解释了为什么相同标题的研究可能得到相反结果:它们实际上测量了不同分母。
该方法使随机森林、boosting和神经网络可以作为因果推断的“干扰估计器”,但要求把识别假设与预测性能分开报告;高AUC不等于效应可信。在2022年前后的统计推断实践中,双重机器学习用正交化隔离“预测误差”和“因果参数”因此改变了至少一个数据、实验或解释环节。在统计学的“双重机器学习用正交化隔离“预测误差”和“因果参数””问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第074号因果推断面板相比,本条专门解决高维干扰估计的统计误差;与第047号机器学习理论相比,优化目标是参数覆盖而非最低预测损失。到2022年的接口比较中,另见第074号面板所用的相邻术语,但本条保留统计学自己的证据口径。
三、因果森林把“平均有效”拆成可推断的异质效应Causal Forests and Heterogeneous Treatment Effects
随机试验通常报告平均处理效应,即便干预只对某些人有效也会被一个均值掩盖;事后按亚组切分又容易追逐噪声,传统树模型缺乏有效置信区间。在2018年前后,围绕“因果森林把“平均有效”拆成可推断的异质效应”出现的异常把这一旧默认推到前台。以“因果森林把“平均有效”拆成可推断的异质效应”为例,于是,原本被放在脚注里的条件开始主导结论,继续沿用旧近似会把系统性差异误写成随机波动。
树结构可以围绕条件平均处理效应τ(x)而不是结果均值分裂;用独立样本决定分裂与估计叶节点,可减少自适应偏差并形成点态区间。因果森林把许多honest trees加权,局部邻域由协变量与效应异质性共同决定,广义随机森林则把局部矩估计统一到一套权重框架。Causal Forests and Heterogeneous Treatment Effects由此给出一条可检验的因果或结构主张。围绕“因果森林把“平均有效”拆成可推断的异质效应”这条命题,这一转向的实质,是把默认假设从不可见背景变成可以单独操纵和计量的实验变量。
Wager与Athey在2018年给出诚实因果森林的渐近正态性;2019年广义随机森林把分位数、工具变量和局部似然纳入同一算法,并用数千棵树估计个体化效应与标准误。围绕“因果森林把“平均有效”拆成可推断的异质效应”,这组2018年前后的观测至少包含两个可复核锚点。就“因果森林把“平均有效”拆成可推断的异质效应”而言,由此得到的并非无条件常数,而是一个带样本、时间与误差范围的经验阈值。
条件效应依赖可观测协变量,个体级“预测”仍有大量不可约不确定性;森林发现的亚组若不在外部样本复现,常只是平滑后的数据挖掘。到2019年前后的后续工作,“因果森林把“平均有效”拆成可推断的异质效应”的争点已从“是否存在”转到“在哪个边界失效”。在统计学的“因果森林把“平均有效”拆成可推断的异质效应”问题上,争论能否收敛,取决于是否在同一协议下同时测量竞争变量,而不是各自选择有利数据。
这条转向促使临床和政策研究同时报告平均效应、异质性分布与决策规则,并区分“谁获益更多”与“能否准确预测某个人的获益”。在2019年前后的统计推断实践中,因果森林把“平均有效”拆成可推断的异质效应因此改变了至少一个数据、实验或解释环节。以“因果森林把“平均有效”拆成可推断的异质效应”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第116号精准医疗面板相接时,本条提供异质效应估计而不提供生物机制;与第153号创业与风险投资面板的uplift建模共享方法但决策损失不同。到2019年的接口比较中,另见第116号面板所用的相邻术语,但本条保留统计学自己的证据口径。围绕“因果森林把“平均有效”拆成可推断的异质效应”这条命题,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
四、目标试验模拟把观察数据分析先写成一项未实施的随机试验Target Trial Emulation
电子健康记录和行政数据规模巨大,但常以“用药者”和“未用药者”事后分组;时间零点、资格标准和治疗切换不清会产生永生时间偏差与选择偏差。在2016年前后,围绕“目标试验模拟把观察数据分析先写成一项未实施的随机试验”出现的异常把这一旧默认推到前台。围绕“目标试验模拟把观察数据分析先写成一项未实施的随机试验”这条命题,这一矛盾说明,问题不在仪器或算法还不够精细,而在旧对象定义把关键自由度排除在外。
每个观察性因果问题都应先写出目标随机试验协议,包括入组时刻、治疗策略、随访、结局、因果对比和分析计划;数据只是对协议的实现程度。clone-censor-weight、序贯试验和逆概率加权把动态治疗策略与偏离协议纳入;相同病人可在多个合格时点进入一系列嵌套试验。Target Trial Emulation由此给出一条可检验的因果或结构主张。就“目标试验模拟把观察数据分析先写成一项未实施的随机试验”而言,这一说法把机制、测量与决策连在一起,使支持证据必须同时满足方向、量级与顺序三项约束。
Hernán与Robins在2016年系统说明协议缺失如何制造偏差;后续研究在数十万电子病历中复现已知随机试验方向,显示统一时间零点后估计可从相反方向回到接近试验结果。围绕“目标试验模拟把观察数据分析先写成一项未实施的随机试验”,这组2016年前后的观测至少包含两个可复核锚点。在统计学的“目标试验模拟把观察数据分析先写成一项未实施的随机试验”问题上,因此,证据不是一条漂亮曲线,而是一组可以在独立数据中重新计算的数量关系。
模拟不会创造未测混杂,也不能补回记录中不存在的依从性和结局;当治疗策略无法清楚定义或数据采集由预后决定时,目标试验只能暴露缺口而不能消除缺口。到2021年前后的后续工作,“目标试验模拟把观察数据分析先写成一项未实施的随机试验”的争点已从“是否存在”转到“在哪个边界失效”。以“目标试验模拟把观察数据分析先写成一项未实施的随机试验”为例,因此,本条的边界不是一句“仍需研究”,而是当上述条件被满足时,原命题应明确退出。
该框架把数据清洗从技术步骤变成设计步骤,要求在分析前登记资格、分配与删失规则;监管真实世界证据也开始按“可模拟哪一项试验”评价可用性。在2021年前后的统计推断实践中,目标试验模拟把观察数据分析先写成一项未实施的随机试验因此改变了至少一个数据、实验或解释环节。围绕“目标试验模拟把观察数据分析先写成一项未实施的随机试验”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第112号临床试验方法学面板共享试验协议,但本条专门讨论观察数据的设计化;与第119号流行病学面板相比,强调时间零点与策略而非一般混杂控制。
五、高维稳健统计把异常值从“先删掉”改为对抗模型的一部分High-Dimensional Robust Estimation under Contamination
经典稳健统计给出高崩溃点估计,但高维时计算常不可行;现代数据管线又会出现传感故障、恶意样本和重尾分布,简单截尾或逐坐标中位数无法保留方向结构。在2019年前后,围绕“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”出现的异常把这一旧默认推到前台。就“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”而言,从那以后,领域内真正需要比较的就不再是单个中心值,而是不同条件下结构是否仍保持。
把数据看作(1−ε)真实分布与ε任意污染的混合,可用谱过滤、迭代加权和median-of-means构造同时具有计算效率与接近最优误差的估计。异常样本会在经验协方差的最大特征方向留下过量能量,过滤算法反复识别该方向并削弱高影响点,直到剩余样本满足集中界。High-Dimensional Robust Estimation under Contamination由此给出一条可检验的因果或结构主张。在统计学的“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”问题上,如果该命题成立,同一对象在不同尺度上的读数应能通过明确的比率、阈值或结构量相互换算。
Diakonikolas等2019年给出多项式时间的高维均值与协方差估计,在亚高斯模型下误差随ε和√(d/n)缩放;Lugosi与Mendelson证明重尾下仍可获得近亚高斯置信界。围绕“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”,这组2019年前后的观测至少包含两个可复核锚点。以“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”为例,数字本身不是终点,更要紧的是它规定了后续复现必须保留的分母与对照条件。
污染模型允许异常值任意却假设大多数样本来自同一分布;真实多峰、分布漂移和少数亚群可能被算法误判为攻击,稳健并不自动等于公平。到2019年前后的后续工作,“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”的争点已从“是否存在”转到“在哪个边界失效”。围绕“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”这条命题,截至后续复核,最稳妥的结论仍是限定性的,而不是把一个局部机制升级为普遍定律。
稳健性由预处理选项升级为推断目标,传感网络、联邦学习和科学仪器开始报告对污染比例的敏感曲线,而非只在清洗后的数据上给单一精度。在2019年前后的统计推断实践中,高维稳健统计把异常值从“先删掉”改为对抗模型的一部分因此改变了至少一个数据、实验或解释环节。就“高维稳健统计把异常值从“先删掉”改为对抗模型的一部分”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第048号AI安全面板的对抗样本相接时,本条控制统计参数而非分类边界;与第062号传感物联网面板相比,它提供污染下的误差界。到2019年的接口比较中,另见第048号面板所用的相邻术语,但本条保留统计学自己的证据口径。
六、模拟式推断让“没有似然”不再等于“不能统计”Simulation-Based Inference without an Explicit Likelihood
气候、粒子碰撞和复杂生物模型能够前向模拟,却无法写出可计算似然;传统近似贝叶斯计算依赖手工摘要和接受阈值,维数升高后样本效率急剧下降。在2020年前后,围绕“模拟式推断让“没有似然”不再等于“不能统计””出现的异常把这一旧默认推到前台。在统计学的“模拟式推断让“没有似然”不再等于“不能统计””问题上,旧模型能够描述平均情形,却无法解释极端样本、局部亚群与时间变化同时出现时的失败。
神经密度估计、分类式似然比与normalizing flow可从模拟样本学习p(x\|θ)、p(θ\|x)或似然比,同时用覆盖诊断检查近似推断是否校准。模拟器生成带参数标签的数据,网络学习可逆变换或分类边界;后验预测检查、模拟校准和覆盖测试把黑箱近似重新接回频率学保证。Simulation-Based Inference without an Explicit Likelihood由此给出一条可检验的因果或结构主张。以“模拟式推断让“没有似然”不再等于“不能统计””为例,它把一个可被反驳的关系放到中心:只要控制变量改变而预言方向不变,命题就应当失败。
Cranmer等2020年总结三类神经模拟式推断,并在高能物理示例中用数十万到数百万次模拟逼近高维似然;normalizing flow通过可逆Jacobian精确计算密度而非只生成样本。围绕“模拟式推断让“没有似然”不再等于“不能统计””,这组2020年前后的观测至少包含两个可复核锚点。围绕“模拟式推断让“没有似然”不再等于“不能统计””这条命题,这一设计尤其重要,因为它把先验上相似的两种解释放进同一套观测口径中比较。
模拟器错了,后验可以非常精确地回答错误世界;训练分布、参数先验和模拟预算限制尾部覆盖,网络校准也不能替代模型差异检验。到2021年前后的后续工作,“模拟式推断让“没有似然”不再等于“不能统计””的争点已从“是否存在”转到“在哪个边界失效”。就“模拟式推断让“没有似然”不再等于“不能统计””而言,这场争论留下的价值,恰是把失败条件写得比成功故事更清楚。
研究工作流由“构造一个足够简单的似然”转向“维护模拟器、训练数据和校准测试”,使计算预算与统计误差在同一报告中结算。在2021年前后的统计推断实践中,模拟式推断让“没有似然”不再等于“不能统计”因此改变了至少一个数据、实验或解释环节。在统计学的“模拟式推断让“没有似然”不再等于“不能统计””问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第319号计算物理面板相比,本条关注由模拟反推参数的不确定性;与第023号计算化学面板相接时,模拟器是证据生成器而非真值。到2021年的接口比较中,另见第319号面板所用的相邻术语,但本条保留统计学自己的证据口径。以“模拟式推断让“没有似然”不再等于“不能统计””为例,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
七、贝叶斯工作流把后验计算从终点改为循环诊断Bayesian Workflow and Iterative Model Criticism
贝叶斯分析常被压缩成“给先验、算后验”,只要MCMC收敛便宣布完成;但后验可以在错误模型中高度集中,弱先验也会在高维中隐含极强假设。在2020年前后,围绕“贝叶斯工作流把后验计算从终点改为循环诊断”出现的异常把这一旧默认推到前台。以“贝叶斯工作流把后验计算从终点改为循环诊断”为例,这类反例累积后,研究者不得不承认:背景条件不是噪声,背景条件就是命题的一部分。
可信分析必须依次检查生成模型能否产生合理数据、计算器是否探索了后验、后验预测是否重现关键结构,以及结论是否对先验和模型选择敏感。prior predictive check暴露尺度错误,R-hat与有效样本量诊断计算,posterior predictive check比较复制数据,LOO交叉验证与堆叠比较预测表现。Bayesian Workflow and Iterative Model Criticism由此给出一条可检验的因果或结构主张。围绕“贝叶斯工作流把后验计算从终点改为循环诊断”这条命题,由此,理论不再允许事后挑选解释,在数据到来之前,它已经规定了什么结果会构成反证。
Gabry等2019年把可视化嵌入从先验到后验的每一步;Gelman等2020年将工作流形式化,要求模型扩展由具体失配驱动,而非一次性在候选模型中挑最低信息准则。围绕“贝叶斯工作流把后验计算从终点改为循环诊断”,这组2020年前后的观测至少包含两个可复核锚点。就“贝叶斯工作流把后验计算从终点改为循环诊断”而言,这些读数的意义在于,它们同时给出了效应方向、可重复尺度和旧模型开始失真的位置。
工作流仍包含研究者判断,图形检查若无预先关注的特征也会变成新的选择自由;复杂层级模型可能计算通过但不可识别,漂亮的后验预测也不等于因果正确。到2020年前后的后续工作,“贝叶斯工作流把后验计算从终点改为循环诊断”的争点已从“是否存在”转到“在哪个边界失效”。在统计学的“贝叶斯工作流把后验计算从终点改为循环诊断”问题上,边界条件一旦越过,理论预测应当发生符号、阈值或排序上的可见改变,否则它只是叙述。
这条转向改变了软件设计:Stan、ArviZ与bayesplot围绕诊断而非单一后验表格组织输出;论文开始附先验预测图、链诊断和敏感性结果。在2020年前后的统计推断实践中,贝叶斯工作流把后验计算从终点改为循环诊断因此改变了至少一个数据、实验或解释环节。以“贝叶斯工作流把后验计算从终点改为循环诊断”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第307号贝叶斯统计与计算规划面板相比,本条取全领域的责任流程;与第255号软件工程面板相接时,模型检查日志成为版本化资产。到2020年的接口比较中,另见第307号面板所用的相邻术语,但本条保留统计学自己的证据口径。围绕“贝叶斯工作流把后验计算从终点改为循环诊断”这条命题,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
八、可迁移性把“样本内无偏”与“目标人群有效”分开Transportability and Generalization across Populations
随机试验保证入组样本内的内部效度,却常默认结果自动适用于年龄、医院和地区不同的人群;代表性不足被当作描述性缺陷,缺少可计算的外推条件。在2016年前后,围绕“可迁移性把“样本内无偏”与“目标人群有效”分开”出现的异常把这一旧默认推到前台。围绕“可迁移性把“样本内无偏”与“目标人群有效”分开”这条命题,因此,新的问题不是在旧公式上再加一项修正,而是重新决定什么算一次观测、一次状态或一次机制。
用选择图或抽样指示变量表示试验样本与目标人群的差异,若影响效应的变量被测量且存在重叠,可通过标准化或加权识别目标平均效应。试验内随机化消除处理混杂,目标人群数据估计协变量分布,逆抽样概率权重把两部分信息拼接;数据融合公式明确哪些变量必须共享。Transportability and Generalization across Populations由此给出一条可检验的因果或结构主张。就“可迁移性把“样本内无偏”与“目标人群有效”分开”而言,它因此把“看起来相关”推进到“改变哪个量会先改变哪个结果”的层面。
Bareinboim与Pearl在2016年给出数据融合的图准则;Dahabreh等2019年展示将试验参与概率纳入权重后,可把样本效应转换为目标群体效应并计算不确定区间。围绕“可迁移性把“样本内无偏”与“目标人群有效”分开”,这组2016年前后的观测至少包含两个可复核锚点。在统计学的“可迁移性把“样本内无偏”与“目标人群有效”分开”问题上,这一步使领域第一次能够区分“模型拟合得好”与“模型抓住了生成机制”。
未测效应修饰、样本与目标无重叠或入组机制依赖潜在结局时不可识别;权重极端会让少数观测支配结果,外推区间可能比样本内估计宽得多。到2019年前后的后续工作,“可迁移性把“样本内无偏”与“目标人群有效”分开”的争点已从“是否存在”转到“在哪个边界失效”。以“可迁移性把“样本内无偏”与“目标人群有效”分开”为例,后续研究若只增加样本而不改变识别设计,通常只能缩小错误答案的置信区间。
试验报告由“谁被招募”扩展到“目标人群是谁、哪些变量决定可搬运性”,真实世界数据的价值也从扩大样本转为补齐目标分布。在2019年前后的统计推断实践中,可迁移性把“样本内无偏”与“目标人群有效”分开因此改变了至少一个数据、实验或解释环节。围绕“可迁移性把“样本内无偏”与“目标人群有效”分开”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第120号全球卫生面板相比,本条给出跨地区外推的识别条件;与第112号临床试验方法学面板相接时,区分内部效度与运输误差。到2019年的接口比较中,另见第074号面板所用的相邻术语,但本条保留统计学自己的证据口径。就“可迁移性把“样本内无偏”与“目标人群有效”分开”而言,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
九、e值把连续查看数据从违规变成可结算的证据过程E-Values and Anytime-Valid Inference
传统p值假设分析时点和样本量预先固定;在线平台、临床监测和A/B测试却每天查看结果,达到显著就停止会使错误率不断累积。在2021年前后,围绕“e值把连续查看数据从违规变成可结算的证据过程”出现的异常把这一旧默认推到前台。就“e值把连续查看数据从违规变成可结算的证据过程”而言,这使旧框架在样本扩张、尺度变化或干预发生时失去可比性,研究对象本身必须重新界定。
使用零假设下期望至多为1的e变量,并将其乘积构成e过程,可在任意数据依赖停止时用阈值1/α控制错误;证据还能跨实验安全相乘或平均。Ville不等式约束e过程的最大值,赌注解释把每一步证据视为对零假设财富的更新;停止规则因此无需提前写死,但下注策略必须可预测。E-Values and Anytime-Valid Inference由此给出一条可检验的因果或结构主张。在统计学的“e值把连续查看数据从违规变成可结算的证据过程”问题上,其关键不是给现象换名,而是给出可以跨样本比较的控制量,并明确何时不再适用。
Vovk与Wang在2021年系统整理e值校准与组合;当α=0.05时,e过程越过20即可拒绝零假设,且无论在第100次还是第10000次查看,越界概率仍受5%控制。围绕“e值把连续查看数据从违规变成可结算的证据过程”,这组2021年前后的观测至少包含两个可复核锚点。以“e值把连续查看数据从违规变成可结算的证据过程”为例,结果把概念争论压成了可测差异:若更换数据、仪器或边界后该比例消失,理论就失去支撑。
e值对使用者不如p值熟悉,功效取决于赌注策略;若在看到当前数据后追溯性选择e变量,或只报告最大e值而不记录过程,同样会破坏保证。到2023年前后的后续工作,“e值把连续查看数据从违规变成可结算的证据过程”的争点已从“是否存在”转到“在哪个边界失效”。围绕“e值把连续查看数据从违规变成可结算的证据过程”这条命题,只要这些混杂未被分离,相关性仍可能很强,却不能据此宣称机制已经确定。
在线实验、药物安全和质量监控由固定样本检验转向连续证据账本;报告可以同时给当前e值、最大e值和停止规则,而不是隐藏中途查看次数。在2023年前后的统计推断实践中,e值把连续查看数据从违规变成可结算的证据过程因此改变了至少一个数据、实验或解释环节。就“e值把连续查看数据从违规变成可结算的证据过程”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第151号运营与供应链面板的连续监控相接时,本条给出重复报警的错误控制;与第309号时间序列规划面板相比,重点是证据过程而非预测。到2023年的接口比较中,另见第151号面板所用的相邻术语,但本条保留统计学自己的证据口径。在统计学的“e值把连续查看数据从违规变成可结算的证据过程”问题上,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
十、预测增强推断让黑箱标签成为“省样本”而非“替代真值”Prediction-Powered Inference
机器学习常为未标注样本生成伪标签,随后把预测当真值计算人群均值或回归系数;模型偏差一旦随亚群变化,海量伪标签会让错误估计极其精确。在2023年前后,围绕“预测增强推断让黑箱标签成为“省样本”而非“替代真值””出现的异常把这一旧默认推到前台。在统计学的“预测增强推断让黑箱标签成为“省样本”而非“替代真值””问题上,当这一遗漏进入真实数据后,误差不再只是数值偏差,而会改变研究者认定的因果方向与边界。
用大规模未标注数据上的预测提高效率,再用独立标注样本估计并校正预测偏差,可在不信任黑箱正确性的前提下获得有效置信区间。估计量由“预测总体量”加上“标注样本中的真实值减预测值平均”组成;预测越准,校正项方差越小,但无偏性依赖标注样本代表性而非模型完美。Prediction-Powered Inference由此给出一条可检验的因果或结构主张。以“预测增强推断让黑箱标签成为“省样本”而非“替代真值””为例,与旧框架相比,新增的不是更多参数,而是一个能够区分竞争机制的次序判据。
Angelopoulos等2023年在多个科学任务中组合数万预测与数百人工标签,置信区间比只用标签更窄,同时保持标称覆盖;误差校正项直接暴露模型在目标群体中的系统偏差。围绕“预测增强推断让黑箱标签成为“省样本”而非“替代真值””,这组2023年前后的观测至少包含两个可复核锚点。围绕“预测增强推断让黑箱标签成为“省样本”而非“替代真值””这条命题,在这一证据链中,年份、样本规模与不确定区间共同限制了结论能够外推到多远。
标注样本若由模型置信度或便利性选择,校正会失真;预测分布漂移、标签测量误差和多次选择目标参数也会削弱保证,廉价预测不能弥补没有代表性的真值。到2025年前后的后续工作,“预测增强推断让黑箱标签成为“省样本”而非“替代真值””的争点已从“是否存在”转到“在哪个边界失效”。就“预测增强推断让黑箱标签成为“省样本”而非“替代真值””而言,这也解释了为什么相同标题的研究可能得到相反结果:它们实际上测量了不同分母。
这条方法为遥感、生态计数和医学影像提供“机器先量、人工抽检、统计校正”的制度,明确区分自动化产量与真实标注的责任。在2025年前后的统计推断实践中,预测增强推断让黑箱标签成为“省样本”而非“替代真值”因此改变了至少一个数据、实验或解释环节。在统计学的“预测增强推断让黑箱标签成为“省样本”而非“替代真值””问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第050号计算机视觉面板相接时,模型只提供辅助测量;与第492号监管科学面板相比,本条给出抽检校正公式而非合规原则。到2025年的接口比较中,另见第308号面板所用的相邻术语,但本条保留统计学自己的证据口径。
十一、规格曲线把“一个模型的答案”展开为所有合理分析的分布Specification-Curve and Multiverse Analysis
观察性研究往往有多种合理的变量定义、协变量集、排除标准和函数形式,论文只报告其中一条;读者无法知道结论是稳健现象还是某个分析选择的产物。在2020年前后,围绕“规格曲线把“一个模型的答案”展开为所有合理分析的分布”出现的异常把这一旧默认推到前台。以“规格曲线把“一个模型的答案”展开为所有合理分析的分布”为例,于是,原本被放在脚注里的条件开始主导结论,继续沿用旧近似会把系统性差异误写成随机波动。
先登记所有理论上可辩护的规格,计算每一种结果,再用规格曲线或多宇宙分布展示效应与选择的关系;稳健性是结果跨合理分析路径的性质。每个规格被编码为一行,排序后的效应值与下方设计选择对齐;置换或共同零检验评估整组规格是否整体偏离零,而非挑选最小p值。Specification-Curve and Multiverse Analysis由此给出一条可检验的因果或结构主张。围绕“规格曲线把“一个模型的答案”展开为所有合理分析的分布”这条命题,这一转向的实质,是把默认假设从不可见背景变成可以单独操纵和计量的实验变量。
Steegen等2016年用多宇宙分析展示同一数据在不同合理处理下可产生方向差异;Simonsohn等2020年给出标准流程,把数十到数百个规格的效应、置信区间和设计决策同时可视化。围绕“规格曲线把“一个模型的答案”展开为所有合理分析的分布”,这组2020年前后的观测至少包含两个可复核锚点。就“规格曲线把“一个模型的答案”展开为所有合理分析的分布”而言,由此得到的并非无条件常数,而是一个带样本、时间与误差范围的经验阈值。
“合理规格”的边界仍由研究者决定,故曲线不能自动消除主观性;规格高度相关时,不能把模型数量当作独立证据,庞大图形也可能掩盖关键识别差异。到2020年前后的后续工作,“规格曲线把“一个模型的答案”展开为所有合理分析的分布”的争点已从“是否存在”转到“在哪个边界失效”。在统计学的“规格曲线把“一个模型的答案”展开为所有合理分析的分布”问题上,争论能否收敛,取决于是否在同一协议下同时测量竞争变量,而不是各自选择有利数据。
稳健性附录由几项随意替代模型升级为系统分析空间,审稿人可追踪哪一项编码选择导致结论翻转,理论争论也能落到具体分支。在2020年前后的统计推断实践中,规格曲线把“一个模型的答案”展开为所有合理分析的分布因此改变了至少一个数据、实验或解释环节。以“规格曲线把“一个模型的答案”展开为所有合理分析的分布”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第496号开放科学面板相比,本条提供披露分析空间的统计格式;与第174号计算法学面板相接时,可审计法律实证结论对口径的依赖。到2020年的接口比较中,另见第496号面板所用的相邻术语,但本条保留统计学自己的证据口径。
十二、漂移下的共形推断把覆盖保证与目标分布权重绑定Conformal Inference under Covariate Shift
早期共形预测依赖交换性,部署场景却常发生医院、季节和人群变化;继续用原校准残差会让总体90%覆盖在目标亚群中跌破门槛。在2024年前后,围绕“漂移下的共形推断把覆盖保证与目标分布权重绑定”出现的异常把这一旧默认推到前台。围绕“漂移下的共形推断把覆盖保证与目标分布权重绑定”这条命题,这一矛盾说明,问题不在仪器或算法还不够精细,而在旧对象定义把关键自由度排除在外。
若条件结果机制近似稳定而协变量分布改变,可通过估计目标与训练密度比、构造加权分位数或双重稳健枢轴,在目标分布下恢复边际覆盖。校准样本按w(x)=p_target(x)/p_train(x)加权,或结合工作模型与重抽样构造不分割区间;选择与聚合方法则在多个候选共形集合间控制额外选择误差。Conformal Inference under Covariate Shift由此给出一条可检验的因果或结构主张。就“漂移下的共形推断把覆盖保证与目标分布权重绑定”而言,这一说法把机制、测量与决策连在一起,使支持证据必须同时满足方向、量级与顺序三项约束。
Qin等2024年提出无需简单数据分割的重抽样方法,在协变量漂移和因果应用中维持接近目标95%的覆盖;Yang与Kuchibhotla同年给出选择、聚合共形集合的有限样本控制。围绕“漂移下的共形推断把覆盖保证与目标分布权重绑定”,这组2024年前后的观测至少包含两个可复核锚点。在统计学的“漂移下的共形推断把覆盖保证与目标分布权重绑定”问题上,因此,证据不是一条漂亮曲线,而是一组可以在独立数据中重新计算的数量关系。
密度比在重叠薄弱区域会爆炸,条件机制一旦同时漂移,单纯加权不能恢复;总体覆盖仍可能掩盖临床重要亚群,集合宽度也会在极端目标区域急剧增加。到2024年前后的后续工作,“漂移下的共形推断把覆盖保证与目标分布权重绑定”的争点已从“是否存在”转到“在哪个边界失效”。以“漂移下的共形推断把覆盖保证与目标分布权重绑定”为例,因此,本条的边界不是一句“仍需研究”,而是当上述条件被满足时,原命题应明确退出。
部署监控开始把覆盖率按时间、地点和人群分层,并在漂移触发后重新校准;共形方法由一次性包装层变成持续维护的不确定性服务。在2024年前后的统计推断实践中,漂移下的共形推断把覆盖保证与目标分布权重绑定因此改变了至少一个数据、实验或解释环节。围绕“漂移下的共形推断把覆盖保证与目标分布权重绑定”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第258号数据科学面板的概念漂移相接时,本条提供可证明的覆盖修复;与第309号时间序列规划面板相比,强调目标分布而非序列预测本身。到2024年的接口比较中,另见第258号面板所用的相邻术语,但本条保留统计学自己的证据口径。
◎ 二十年连起来看
第一条贯穿线索是:错误率从模型内部的性质,变成整个分析流程的性质。 高维筛选、选择后推断与规格曲线都说明,只要数据决定了变量、模型或停止时点,零分布就已改变。2011年的研究者自由度与2021年的e过程看似相反:前者限制查看,后者允许随时查看;它们共同要求把查看规则写进证据账本。
第二条线索是:预测能力与推断责任被主动拆开。 双重机器学习、因果森林和预测增强推断都允许使用复杂黑箱,却不把高AUC误当成效应可信。2018年以来的共同做法,是用样本分割、正交得分、校正项或覆盖测试,让预测器只承担提高效率的角色。
第三条线索是:外部环境被重新纳入分母。 差分隐私增加隐私噪声,运输公式增加目标人群,漂移共形增加目标密度比。统计学不再假设一个样本代表所有未来,而是明确说明结论属于哪一个人群、哪一套查询和哪一种数据流。
◎ 三个常见误解
误解一是“样本足够大,模型假设就不重要”。大样本能缩小随机误差,却会把未测混杂、选择偏差和模型错配估计得更精确。高维污染和目标试验的案例表明,n增加不能修复错误的时间零点或错误的生成机制。
误解二是“机器学习越准,统计推断越可靠”。双重机器学习与预测增强推断恰恰把两者分开:预测只提高干扰估计或伪标签效率,覆盖与无偏性仍来自正交化、真实标签和抽样设计。
误解三是“放弃p值就解决了可重复性危机”。贝叶斯后验、AIC、交叉验证和e值都可能被事后选择。真正被要求改变的是路径披露、设计约束和独立校准,而不是把0.05换成另一枚数字。
◎ 与相邻领域的接口
与第074号《因果推断与计量》的分工:第074号更强调识别假设、工具变量与政策效应,本块强调这些识别结果如何在高维、选择后和样本外保持误差承诺。双重机器学习与合成控制是两块的异名接口。
与第047号《机器学习理论》的分工:第047号问泛化误差、优化与表示,本块问置信区间、错误发现率和覆盖率。共形预测、knockoff与预测增强推断说明,黑箱可以被使用,但不能自行签发统计保证。
与第308号《实验设计与抽样调查》(规划中)的分工:抽样设计决定谁进入数据,统计学在此负责选择、隐私与漂移之后的推断。预测增强推断实际上重新激活了双相抽样与校正估计的老结构。
与第258号《数据科学》的分工:数据科学维护数据生产与部署系统,本块维护从数据到结论的错误率。概念漂移在第258号是系统故障,在本块则具体表现为覆盖、校准和外推失效。
◎ 争议现场
争议一是条件覆盖能否在有限样本、分布无关的同时实现。共形预测给出边际覆盖,但亚群条件覆盖存在不可能性。要收敛,需要预先指定具有决策意义的亚群,并同时报告覆盖、集合宽度与样本量,而不是只给全体90%。
争议二是高维因果推断中机器学习究竟减少还是隐藏模型依赖。双重机器学习保证一阶正交,却仍依赖重叠和无未测混杂。可执行的收敛条件是:同一数据上同时报告干扰预测误差、重叠诊断、负对照与对未测混杂的敏感曲线。
争议三是差分隐私预算应由统计学、法律还是政策决定。ε越小隐私越强、稀有群体误差却越大。收敛不能靠寻找“正确ε”,而要公开不同预算下地区与群体误差曲线,并让预算分配对应明确的社会损失函数。
◎ 往下五年看什么
观察点一是2026—2031年高风险预测系统是否开始把“覆盖率×集合宽度×亚群”作为固定三联表。若医疗、气象和信贷仍只发布整体准确率,共形推断就尚未改变制度。
观察点二是e过程能否进入持续A/B测试和安全监测的审计日志。可数读数包括:多少平台公开查看次数、停止规则和最大e值,以及传统固定样本结论有多少在连续监控下翻转。
观察点三是预测增强推断能把人工标注量减少到什么比例,同时维持95%覆盖。最有价值的数字不是模型准确率,而是达到同一置信区间宽度所需真标签数之比。
观察点四是隐私统计能否为小地区和少数群体给出可接受误差。应追踪ε预算下零计数、负计数后处理与人口结构偏差,而不是只报告全国总量误差。
◎ 可与哪些领域对撞
本块“差分隐私”与第149号《会计与审计》的审计抽样共享预设:个体信息可被汇总而不改变总体判断。前者用ε限制单个记录影响,后者用抽样风险限制漏报。若二者都成立,数据发布制度必须把隐私噪声也视为一种可审计调整,而不能让它游离于账本之外。
“选择后推断”与第255号《软件工程》的持续集成共享预设:过程日志决定结果能否被信任。统计学认为未记录的模型搜索改变零分布,软件工程认为未记录的构建步骤破坏可复现。两边相反之处在于,一个试图条件化历史,一个试图固定历史;若都成立,分析系统需要可重放而非只可查看的日志。
“目标试验模拟”与第105号《外科与围手术期医学》的路径管理共享预设:时间零点决定比较是否公平。临床路径允许治疗随病情改变,目标试验则要求策略在协议中预先定义。若两边都成立,就必须引入动态策略这一第三对象,而不能用“接受过治疗”概括全过程。
“经验零分布”与第193号《图书情报与知识组织》的引文基线共享预设:一个异常值只有相对于当前总体才有意义。统计学从数据估计零组,文献计量常用学科与年份基线。两边若同时成立,跨领域排名就不能共享一个固定零分布。
◎ 十条可做的研究命题
1. 在电子健康记录中,目标试验协议完整度比样本量更能预测与随机试验的一致性;对50项已知试验做盲法模拟并评分协议完整度;若样本量解释力更高且协议分数无增量,则证伪。
2. 共形预测在部署漂移中的失效可由密度比极值提前预警;连续记录目标/训练密度比与亚群覆盖;若覆盖下降不随密度比尾部变化,则该预警判据失效。
3. 模型X knockoff在协变量生成模型通过交换性诊断后能稳定控制10% FDR;跨五类真实高维数据重复选择;若诊断通过而FDR仍系统超出15%,则证伪。
4. 预测增强推断可把达到同一95%区间宽度所需人工标签减少一半;在遥感与病理各做随机标注实验;若节省比例低于10%,则其成本优势不成立。
5. 规格曲线中同号效应比例比单一p值更能预测独立复现;对已完成复制的研究回溯计算;若AUC不高于原始p值,则证伪。
6. e过程在持续A/B测试中能把实际假阳性率压回名义5%;用历史平台日志重放固定p值与e值规则;若两者错误率无差异,则证伪。
7. 高维稳健估计会把真实少数亚群误识别为污染;构造带已知亚群的混合数据并比较过滤路径;若亚群保留率不低于常规估计,则这一风险被否定。
8. 差分隐私对小地区误差的主要来源是预算分配而非噪声机制;固定总ε比较多种层级分配;若误差差异小于机制差异,则命题被证伪。
9. 贝叶斯先验预测检查能减少后验模型的结构性失配;随机分配分析团队使用或不使用先验预测;若后验预测失配率无下降,则证伪。
10. 运输公式的增量价值由效应修饰变量覆盖率决定;在多中心试验中逐步遮蔽修饰变量;若目标效应误差不随覆盖率下降而增加,则该机制不成立。
◎ 资料核验
以下按源行与边界讨论所用资料列出;期刊卷页或DOI已写入,预印本明确标注。
- Candès E, Tao T. The Dantzig selector: Statistical estimation when p is much larger than n. Annals of Statistics 35, 2313–2351 (2007). DOI: 10.1214/009053606000001523.
- Hastie T, Tibshirani R, Tibshirani R. Best subset, forward stepwise or lasso? Analysis and recommendations based on extensive comparisons. Statistical Science 35, 579–592 (2020). DOI: 10.1214/19-STS733.
- Friedman J, Hastie T, Tibshirani R. Sparse inverse covariance estimation with the graphical lasso. Biostatistics 9, 432–441 (2008). DOI: 10.1093/biostatistics/kxm045.
- Ravikumar P, Wainwright MJ, Raskutti G, Yu B. High-dimensional covariance estimation by minimizing l1-penalized log-determinant divergence. Electronic Journal of Statistics 5, 935–980 (2011). DOI: 10.1214/11-EJS631.
- Efron B. Microarrays, empirical Bayes and the two-groups model. Statistical Science 23, 1–22 (2008). DOI: 10.1214/07-STS236.
- Stephens M. False discovery rates: a new deal. Biostatistics 18, 275–294 (2017). DOI: 10.1093/biostatistics/kxw041.
- Dwork C, McSherry F, Nissim K, Smith A. Calibrating noise to sensitivity in private data analysis. Theory of Cryptography Conference, 265–284 (2006). DOI: 10.1007/11681878_14.
- Abowd JM. The U.S. Census Bureau adopts differential privacy. Journal of Privacy and Confidentiality 8, 1–22 (2018). DOI: 10.29012/jpc.684.
- Abadie A, Diamond A, Hainmueller J. Synthetic control methods for comparative case studies. Journal of the American Statistical Association 105, 493–505 (2010). DOI: 10.1198/jasa.2009.ap08746.
- Abadie A. Using synthetic controls: feasibility, data requirements, and methodological aspects. Journal of Economic Literature 59, 391–425 (2021). DOI: 10.1257/jel.20191450.
- Shafer G, Vovk V. A tutorial on conformal prediction. Journal of Machine Learning Research 9, 371–421 (2008).
- Angelopoulos AN, Bates S. Conformal prediction: a gentle introduction. Foundations and Trends in Machine Learning 16, 494–591 (2023). DOI: 10.1561/2200000101.
- Berk R, Brown L, Buja A, Zhang K, Zhao L. Valid post-selection inference. Annals of Statistics 41, 802–837 (2013). DOI: 10.1214/12-AOS1077.
- Lee JD, Sun DL, Sun Y, Taylor JE. Exact post-selection inference, with application to the lasso. Annals of Statistics 44, 907–927 (2016). DOI: 10.1214/15-AOS1371.
- Simmons JP, Nelson LD, Simonsohn U. False-positive psychology: undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychological Science 22, 1359–1366 (2011). DOI: 10.1177/0956797611417632.
- Wasserstein RL, Lazar NA. The ASA statement on p-values: context, process, and purpose. The American Statistician 70, 129–133 (2016). DOI: 10.1080/00031305.2016.1154108.
- Candès E, Fan Y, Janson L, Lv J. Panning for gold: model-X knockoffs for high dimensional controlled variable selection. Journal of the Royal Statistical Society B 80, 551–577 (2018). DOI: 10.1111/rssb.12265.
- Barber RF, Candès EJ, Samworth RJ. Robust inference with knockoffs. Annals of Statistics 48, 1409–1431 (2020). DOI: 10.1214/19-AOS1852.
- Chernozhukov V et al. Double/debiased machine learning for treatment and structural parameters. Econometrics Journal 21, C1–C68 (2018). DOI: 10.1111/ectj.12097.
- Bach P, Chernozhukov V, Kurz MS, Spindler M. DoubleML—An object-oriented implementation of double machine learning in Python. Journal of Machine Learning Research 23, 1–6 (2022).
- Wager S, Athey S. Estimation and inference of heterogeneous treatment effects using random forests. Journal of the American Statistical Association 113, 1228–1242 (2018). DOI: 10.1080/01621459.2017.1319839.
- Athey S, Tibshirani J, Wager S. Generalized random forests. Annals of Statistics 47, 1148–1178 (2019). DOI: 10.1214/18-AOS1709.
- Hernán MA, Robins JM. Using big data to emulate a target trial when a randomized trial is not available. American Journal of Epidemiology 183, 758–764 (2016). DOI: 10.1093/aje/kwv254.
- Hernán MA, Wang W, Leaf DE. Target trial emulation: a framework for causal inference from observational data. New England Journal of Medicine 385, 1347–1358 (2021). DOI: 10.1056/NEJMra2100622.
- Diakonikolas I et al. Robust estimators in high dimensions without the computational intractability. SIAM Journal on Computing 48, 742–864 (2019). DOI: 10.1137/17M1126680.
- Lugosi G, Mendelson S. Sub-Gaussian estimators of the mean of a random vector. Annals of Statistics 47, 783–794 (2019). DOI: 10.1214/17-AOS1600.
- Cranmer K, Brehmer J, Louppe G. The frontier of simulation-based inference. Proceedings of the National Academy of Sciences 117, 30055–30062 (2020). DOI: 10.1073/pnas.1912789117.
- Papamakarios G, Nalisnick E, Rezende DJ, Mohamed S, Lakshminarayanan B. Normalizing flows for probabilistic modeling and inference. Journal of Machine Learning Research 22, 1–64 (2021).
- Gelman A et al. Bayesian workflow. Statistical Science 35, 1–20 (2020). DOI: 10.1214/20-STS775.
- Gabry J, Simpson D, Vehtari A, Betancourt M, Gelman A. Visualization in Bayesian workflow. Journal of the Royal Statistical Society A 182, 389–402 (2019). DOI: 10.1111/rssa.12378.
- Bareinboim E, Pearl J. Causal inference and the data-fusion problem. Proceedings of the National Academy of Sciences 113, 7345–7352 (2016). DOI: 10.1073/pnas.1510507113.
- Dahabreh IJ et al. Generalizing trial results to target populations. Biometrics 75, 685–694 (2019). DOI: 10.1111/biom.12926.
- Vovk V, Wang R. E-values: calibration, combination and applications. Annals of Statistics 49, 1736–1754 (2021). DOI: 10.1214/20-AOS2020.
- Ramdas A, Grünwald P, Vovk V, Shafer G. Game-theoretic statistics and safe anytime-valid inference. Statistical Science 38, 576–601 (2023). DOI: 10.1214/22-STS894.
- Angelopoulos AN et al. Prediction-powered inference. Science 382, 669–674 (2023). DOI: 10.1126/science.adi6000.
- Csillag D et al. Extending prediction-powered inference through conformal prediction. arXiv:2510.16166 (2025, preprint).
- Simonsohn U, Simmons JP, Nelson LD. Specification curve analysis. Nature Human Behaviour 4, 1208–1214 (2020). DOI: 10.1038/s41562-020-0912-z.
- Steegen S, Tuerlinckx F, Gelman A, Vanpaemel W. Increasing transparency through a multiverse analysis. Perspectives on Psychological Science 11, 702–712 (2016). DOI: 10.1177/1745691616658637.
- Qin J, Liu Y, Li M, Huang CY. Distribution-free prediction intervals under covariate shift, with an application to causal inference. Journal of the American Statistical Association 120, 559–571 (2025; online 2024). DOI: 10.1080/01621459.2024.2356886.
- Yang Y, Kuchibhotla AK. Selection and aggregation of conformal prediction sets. Journal of the American Statistical Association 120, 435–447 (2025; online 2024). DOI: 10.1080/01621459.2024.2344700.