SDE Universes·新思想前沿数学与统计的其余主干
新思想前沿 · 数学与统计的其余主干

实验设计与抽样调查

近二十年 · 两幕 · 20 个新思想 · 约 31,245 字 · 王德生 亲撰 · 2026 年 8 月

实验设计与抽样调查近二十年的共同变化,是从“随机化或概率抽样已经完成,后面交给公式”转向“设计、现场、干扰、适应、隐私与分析必须保留同一证据链”。第一幕重写了响应式调查、群组随机、总调查误差、再随机化、回归调整与计算机实验空间填充;第二幕面对网络干扰、非概率大数据、自适应在线试验、人口普查隐私与市场切换。二十条都在强调:数据的可信度不是记录数的属性,而是每个单位为何被观察、为何被处理、与谁相互影响以及发布时又加了什么扰动的共同产物。选目从响应式调查、空间平衡、协变量调整和高维设计,推进到非概率样本、平台实验、隐私普查、代理指标与自适应推断。第一幕把设计从抽样前的一次决定改成可监测过程,第二幕面对算法分配、数据融合和隐私噪声,使选择机制本身进入估计。这里的共同问题不是“样本够不够大”,而是每个单位以何种概率进入、被观察和被保留。读者应沿包含概率、成本、失访与噪声预算的分母,区分设计带来的信息与数据规模制造的幻觉。

【第一幕】上一个十年 · 约 2006—2016

第一幕把设计从一次性抽签扩展为可实时控制的过程,并把配对、平衡、投影与总体误差写成分析必须尊重的结构。从“响应式调查设计:误差与成本要在采集中实时控制”到“最大投影设计:高维空间填充必须兼顾低维投影”,共同动作是把旧默认改写成可反驳的结构命题;主证据均在2016年前形成。

甲、响应式调查设计:误差与成本要在采集中实时控制Responsive Survey Design

提出Robert Groves与Steven Heeringa,2006年《Journal of the Royal Statistical Society: Series A》169(3):439–457,DOI:10.1111/j.1467-985X.2006.00423.x,〈Responsive Design for Household Surveys: Tools for Actively Controlling Survey Errors and Costs〉 关键调查过程可根据联络历史、样本构成与成本指标动态改变追访策略,使总调查误差而非单一应答率成为控制目标

在2006年前后的文献中,默认判断仍是“调查设计在开场前固定后,现场只需机械执行并追求最高应答率”。它没有处理进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“误差下降量/新增追访成本”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“误差下降量/新增追访成本”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条命题是:调查过程可根据联络历史、样本构成与成本指标动态改变追访策略,使总调查误差而非单一应答率成为控制目标。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“误差下降量/新增追访成本”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Robert Groves等在2006年〈Responsive Design for Household Surveys: Tools for Actively Controlling Survey Errors and Costs〉中的主结果。作者提出至少2阶段的响应式框架:先用过程旁数据监控不同子群的联络和回应,再在关键阶段切换访员、时段或模式;停止规则由偏倚风险与每新增1个完成样本的边际成本共同决定。其关键不是论文规模,而是给出了“误差下降量/新增追访成本”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:过程指标常只是偏倚代理,应答率提高也可能扩大测量误差;动态改变策略会使包含概率和权重估计更复杂,需要保留完整paradata。失效条件为:当过程旁数据与最终结果偏倚无关,或干预无法定向到失衡子群时,响应式调整不改善总误差。收敛需统一对象与“误差下降量/新增追访成本”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“误差下降量/新增追访成本”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:控制论称“反馈控制”,在线实验称“自适应分配”;另见第307号序贯贝叶斯优化。共享预设为“调查设计在开场前固定后,现场只需机械执行并追求最高应答率”;先统一“误差下降量/新增追访成本”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置D——把『响应式调查设计:误差与成本要在采集中实时控制』中的操作次序与变化路径作为首要显露 单因决定『响应式调查设计:误差与成本要在采集中实时控制』当前结论的最小充分项只有:调查过程可根据联络历史、样本构成与成本指标动态改变追访策略,使总调查误差而非单一应答率成为控制目标 预设〔01 谁进入分母〕调查设计在开场前固定后,现场只需机械执行并追求最高应答率 量纲误差下降量/新增追访成本 失效失效边界是『过程旁数据与最终结果偏倚无关,或干预无法定向到失衡子群时,响应式调整不改善总误差』;越过该边界,相关条件越强,误差下降量反而越低 自曝『响应式调查设计:误差与成本要在采集中实时控制』的原始材料只直接支持“主证据来自RobertGroves等在2006年〈ResponsiveDesignforHouseholdSurveys:ToolsforActiv”,没有自动覆盖边界外对象 空栏『响应式调查设计:误差与成本要在采集中实时控制』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名控制论称“反馈控制”,在线实验称“自适应分配”;另见第 214 号第 2 条『在线凸优化:遗憾而非离线最优成为目标』

乙、阶梯楔形试验:推广顺序本身可以随机化Stepped-Wedge Cluster Randomized Trials

提出Michael Hussey与James Hughes,2007年《Contemporary Clinical Trials》28(2):182–191,DOI:10.1016/j.cct.2006.05.007,〈Design and Analysis of Stepped Wedge Cluster Randomized Trials〉 关键当干预必须分批推广且最终所有群组都接受时可随机化切换时间并用群组与时期效应识

到2007年前后,常见出发点仍是“分阶段推广无法保持随机试验的设计性识别”。真正暴露问题的并非一个孤立反例,而是进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“可识别处理对比数/总群组—时期单元数”为何随条件改变。当研究者改用“可识别处理对比数/总群组—时期单元数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

新命题明确写成:当干预必须分批推广且最终所有群组都接受时,可随机化切换时间并用群组与时期效应识别平均处理效应。这句话可以被反驳,检验方式是:固定抽样框、分配机制、干扰结构与非应答过程,按“可识别处理对比数/总群组—时期单元数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

证据链的锚点是Michael Hussey等在2007年〈Design and Analysis of Stepped Wedge Cluster Randomized Trials〉中的主结果。论文给出线性混合模型与功效计算,说明每个群组至少跨越对照与处理2种状态,并在不同时间贡献观察;设计效率由群内相关、群组数、时期数和世俗趋势共同决定。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“可识别处理对比数/总群组—时期单元数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:若干预效应随暴露时间变化、存在提前采用或同期政策冲击,简单模型会偏;群组很少时渐近标准误不可靠。失效条件为:当切换时间无法执行、时期效应与处理完全共线或干预有跨群扩散时不成立。收敛需统一对象与“可识别处理对比数/总群组—时期单元数”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“可识别处理对比数/总群组—时期单元数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:运筹学称“错峰上线”,平台实验称“staggered rollout”;另见第360号渐进部署。只有“可识别处理对比数/总群组—时期单元数”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置E——把『阶梯楔形试验:推广顺序本身可以随机化』成立所需的边界环境作为首要显露 单因决定『阶梯楔形试验:推广顺序本身可以随机化』当前结论的最小充分项只有:当干预必须分批推广且最终所有群组都接受时可随机化切换时间并用群组与时期效应识 预设〔01 谁进入分母〕分阶段推广无法保持随机试验的设计性识别 量纲可识别处理对比数/总群组—时期单元数 失效失效边界是『切换时间无法执行、时期效应与处理完全共线或干预有跨群扩散时不成立』;越过该边界,相关条件越强,可识别处理对比数反而越低 自曝『阶梯楔形试验:推广顺序本身可以随机化』的原始材料只直接支持“证据链的锚点是MichaelHussey等在2007年〈DesignandAnalysisofSteppedWedgeClusterRandomiz”,没有自动覆盖边界外对象 空栏『阶梯楔形试验:推广顺序本身可以随机化』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名运筹学称“错峰上线”,平台实验称“staggeredrollout”;另见第 435 号第 20 条『外部资本把家族所有权变成可谈判组合』

丙、配对群组随机化:分析必须尊重配对设计Matched-Pair Cluster Randomization

提出Kosuke Imai、Gary King与Clayton Nall,2009年《Statistical Science》24(1):29–53,DOI:10.1214/08-STS274,〈The Essential Role of Pair Matching in Cluster-Randomized Experiments〉 关键在群组随机试验中,先按强预后变量配对再在对内随机,通常能提高功效;分析若忽略配对会丢失设计带来的精度并可错估不确定性

2009年前后,旧默认是“随机化以后,分析可忽略随机化前的阻断与配对信息”,但进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“配对后处理差方差/未配对处理差方差”为何随条件改变。以“配对后处理差方差/未配对处理差方差”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:在群组随机试验中,先按强预后变量配对再在对内随机,通常能提高功效;分析若忽略配对会丢失设计带来的精度并可错估不确定性。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“配对后处理差方差/未配对处理差方差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Kosuke Imai等在2009年〈The Essential Role of Pair Matching in Cluster-Randomized Experiments〉中的主结果是本条的证据起点。每个匹配对由2个群组组成并在对内随机;作者比较配对与非配对设计的有限样本性质,给出设计型估计与方差,在群组数有限、群间差异大时,配对可明显降低处理差估计方差。具体读数“配对后处理差方差/未配对处理差方差”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:错误配对、群组退出与处理效应异质性会削弱优势;若配对变量弱或群组极多且平衡,增益可能小。推断需按随机化单位而非个体数计量。失效条件为:当配对变量与结局无关、对内群组不可比或成对丢失严重时,配对设计不增效。收敛需统一对象与“配对后处理差方差/未配对处理差方差”,并公开随机化分布、非应答和成本预算及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。报告应围绕“配对后处理差方差/未配对处理差方差”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为机器学习称“成对匹配”,农业试验称“区组”;另见第305号比较案例。碰撞须固定“随机化以后,分析可忽略随机化前的阻断与配对信息”并比较“配对后处理差方差/未配对处理差方差”;第三项是入样概率、暴露干扰与响应机制。

位置S——把『配对群组随机化:分析必须尊重配对设计』形成的对象结构作为首要显露 单因决定『配对群组随机化:分析必须尊重配对设计』当前结论的最小充分项只有:在群组随机试验中,先按强预后变量配对再在对内随机,通常能提高功效;分析若忽略配对会丢失设计带来的精度并可错估不确定性 预设〔01 谁进入分母〕随机化以后,分析可忽略随机化前的阻断与配对信息 量纲配对后处理差方差/未配对处理差方差 失效失效边界是『配对变量与结局无关、对内群组不可比或成对丢失严重时,配对设计不增效』;越过该边界,相关条件越强,配对后处理差方差反而越低 自曝『配对群组随机化:分析必须尊重配对设计』的原始材料只直接支持“KosukeImai等在2009年〈TheEssentialRoleofPairMatchinginCluster-RandomizedExperi”,没有自动覆盖边界外对象 空栏『配对群组随机化:分析必须尊重配对设计』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“成对匹配”,农业试验称“区组”;另见第 440 号第 19 条『人工智能辅助史学必须保留来源链与不确定性』

丁、总调查误差:样本误差只是误差预算的一项Total Survey Error Paradigm

提出Robert Groves与Lars Lyberg,2010年《Public Opinion Quarterly》74(5):849–879,DOI:10.1093/poq/nfq065,〈Total Survey Error: Past, Present, and Future〉 关键调查质量应把覆盖、抽样、无回答、测量、处理与调整误差放入同一误差预算,而不能用抽样标准误代表全部不确定性

在2010年前后的文献中,标准叙事是“概率抽样和标准误正确,就足以保证调查结论可靠”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“非抽样均方误差/总均方误差”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“非抽样均方误差/总均方误差”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

可以把命题写为:调查质量应把覆盖、抽样、无回答、测量、处理与调整误差放入同一误差预算,而不能用抽样标准误代表全部不确定性。与口号不同,它预先承诺了失败方式:固定抽样框、分配机制、干扰结构与非应答过程,按“非抽样均方误差/总均方误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Robert Groves等在2010年〈Total Survey Error: Past, Present, and Future〉中的主结果给出主证据:作者把总调查误差写成至少2类核心量:均方误差MSE=偏差²+方差,并继续分解覆盖、测量、非应答与处理误差;降低一种误差可能提高另一种,例如强追访提高应答率却增加访员效应。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“非抽样均方误差/总均方误差”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:不同误差分量难以在单次调查中独立估计,成本函数也常缺失;框架若只作清单而无验证研究,会失去决策能力。失效条件为:当目标仅是已完整登记总体上的随机抽样均值,且测量与处理近乎无误时,非抽样分量可忽略。收敛需统一对象与“非抽样均方误差/总均方误差”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“非抽样均方误差/总均方误差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:软件测试称“全链路误差预算”,工程称“总不确定度”;另见第360号性能归因。共享预设为“概率抽样和标准误正确,就足以保证调查结论可靠”;先统一“非抽样均方误差/总均方误差”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置E——把『总调查误差:样本误差只是误差预算的一项』成立所需的边界环境作为首要显露 单因决定『总调查误差:样本误差只是误差预算的一项』当前结论的最小充分项只有:调查质量应把覆盖、抽样、无回答、测量、处理与调整误差放入同一误差预算,而不能用抽样标准误代表全部不确定性 预设〔02 单一读数代表复杂对象〕概率抽样和标准误正确,就足以保证调查结论可靠 量纲非抽样均方误差/总均方误差 失效失效边界是『目标仅是已完整登记总体上的随机抽样均值,且测量与处理近乎无误时,非抽样分量可忽略』;越过该边界,相关条件越强,非抽样均方误差反而越低 自曝『总调查误差:样本误差只是误差预算的一项』的原始材料只直接支持“RobertGroves等在2010年〈TotalSurveyError:Past,Present,andFuture〉中的主结果给出主证据:作者把”,没有自动覆盖边界外对象 空栏『总调查误差:样本误差只是误差预算的一项』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名软件测试称“全链路误差预算”,工程称“总不确定度”;另见第 590 号第 5 条『模型校准与差异项』

戊、回应者驱动抽样的连续近似:招募不是有放回随机游走Successive Sampling for Respondent-Driven Sampling

提出Krista Gile,2011年《Journal of the American Statistical Association》106(493):135–146,DOI:10.1198/jasa.2011.ap09475,〈Improved Inference for Respondent-Driven Sampling Data with Application to HIV Prevalence Estimation〉 关键隐蔽人群的链式招募在样本占总体比例不小的时候应按无放回连续抽样近似,而不是假定无限总体有放回随机游走

2011年前后,旧框架把问题压成一句话:“回应者驱动抽样可视为稳定的有放回随机游走,样本比例无需进入权重”。但进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“估计有效包含概率/自报网络度数”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“估计有效包含概率/自报网络度数”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

核心主张是:隐蔽人群的链式招募在样本占总体比例不小的时候应按无放回连续抽样近似,而不是假定无限总体有放回随机游走。它不是定义性的正确,而有清楚的否证口:固定抽样框、分配机制、干扰结构与非应答过程,按“估计有效包含概率/自报网络度数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

Krista Gile等在2011年〈Improved Inference for Respondent-Driven Sampling Data with Application to HIV Prevalence Estimation〉中的主结果提供了决定性证据。Gile提出successive sampling估计器,把抽样分数n/N、受访者自报度数与总体规模N同时用于迭代包含概率;模拟显示在n/N较高且度数与结局相关时,比Volz–Heckathorn估计偏差更小。这里最有信息量的读数是“估计有效包含概率/自报网络度数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:总体规模常未知且自报网络度数有误,招募并非随机从全部关系中选择;种子选择、同质性与非响应仍可形成大偏倚。失效条件为:当招募极非随机、网络分裂或总体规模估计严重错误时,连续抽样修正不识别总体比例。收敛需统一对象与“估计有效包含概率/自报网络度数”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“估计有效包含概率/自报网络度数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:网络科学称“链式采样”,生态学称“无放回捕获”;另见第310号网络空间采样。只有“估计有效包含概率/自报网络度数”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置S——把『回应者驱动抽样的连续近似:招募不是有放回随机游走』形成的对象结构作为首要显露 单因决定『回应者驱动抽样的连续近似:招募不是有放回随机游走』当前结论的最小充分项只有:隐蔽人群的链式招募在样本占总体比例不小的时候应按无放回连续抽样近似,而不是假定无限总体有放回随机游走 预设〔02 单一读数代表复杂对象〕回应者驱动抽样可视为稳定的有放回随机游走,样本比例无需进入权重 量纲估计有效包含概率/自报网络度数 失效失效边界是『招募极非随机、网络分裂或总体规模估计严重错误时,连续抽样修正不识别总体比例』;越过该边界,相关条件越强,估计有效包含概率反而越低 自曝『回应者驱动抽样的连续近似:招募不是有放回随机游走』的原始材料只直接支持“KristaGile等在2011年〈ImprovedInferenceforRespondent-DrivenSamplingDatawithApp”,没有自动覆盖边界外对象 空栏『回应者驱动抽样的连续近似:招募不是有放回随机游走』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名网络科学称“链式采样”,生态学称“无放回捕获”;另见第 587 号第 17 条『时序群组相互作用』

己、再随机化:先把协变量平衡写进设计Rerandomization

提出Kari Lock Morgan与Donald Rubin,2012年《The Annals of Statistics》40(2):1263–1282,DOI:10.1214/12-AOS1008,〈Rerandomization to Improve Covariate Balance in Experiments〉 关键随机分配可重复进行直到预先规定的协变量平衡准则通过;只要分析尊重接受规则,处理效应估计仍无偏且方差降低

在2012年前后的文献中,默认判断仍是“随机化只要概率正确,随机化实现中的基线失衡不应被设计阶段主动控制”。它没有处理进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“被接受分配数/全部生成分配数”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“被接受分配数/全部生成分配数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条命题是:随机分配可重复进行直到预先规定的协变量平衡准则通过;只要分析尊重接受规则,处理效应估计仍无偏且方差降低。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“被接受分配数/全部生成分配数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Kari Lock Morgan等在2012年〈Rerandomization to Improve Covariate Balance in Experiments〉中的主结果。论文以Mahalanobis距离阈值定义可接受分配,推导协变量解释方差R²和接受概率共同决定的方差缩减;接受域对处理标签对称保证无偏。其关键不是论文规模,而是给出了“被接受分配数/全部生成分配数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:平衡准则必须事前固定,过严阈值增加计算并可能忽视未纳入协变量;若分析使用普通随机化方差而不条件于设计,区间会保守或错配。失效条件为:当平衡变量与结局无关或接受规则在看过结局后改变时,再随机化不增效且破坏有效性。收敛需统一对象与“被接受分配数/全部生成分配数”,并公开随机化分布、非应答和成本预算及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。报告应围绕“被接受分配数/全部生成分配数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为优化称“约束随机化”,软件测试称“生成直到满足不变量”;另见第352号性质约束。碰撞须固定“随机化只要概率正确,随机化实现中的基线失衡不应被设计阶段主动控制”并比较“被接受分配数/全部生成分配数”;第三项是入样概率、暴露干扰与响应机制。

位置D——把『再随机化:先把协变量平衡写进设计』中的操作次序与变化路径作为首要显露 单因决定『再随机化:先把协变量平衡写进设计』当前结论的最小充分项只有:随机分配可重复进行直到预先规定的协变量平衡准则通过;只要分析尊重接受规则,处理效应估计仍无偏且方差降低 预设〔02 单一读数代表复杂对象〕随机化只要概率正确,随机化实现中的基线失衡不应被设计阶段主动控制 量纲被接受分配数/全部生成分配数 失效失效边界是『平衡变量与结局无关或接受规则在看过结局后改变时,再随机化不增效且破坏有效性』;越过该边界,相关条件越强,被接受分配数反而越低 自曝『再随机化:先把协变量平衡写进设计』的原始材料只直接支持“主证据来自KariLockMorgan等在2012年〈RerandomizationtoImproveCovariateBalanceinExper”,没有自动覆盖边界外对象 空栏『再随机化:先把协变量平衡写进设计』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名优化称“约束随机化”,软件测试称“生成直到满足不变量”;另见第 432 号第 13 条『公平约束揭露代理变量偏差』

庚、回归调整复权:随机试验中要用处理交互和稳健方差Agnostic Regression Adjustment

提出Winston Lin,2013年《The Annals of Applied Statistics》7(1):295–318,DOI:10.1214/12-AOAS583,〈Agnostic Notes on Regression Adjustments to Experimental Data: Reexamining Freedman’s Critique〉 关键完全随机试验可通过处理组分别拟合的协变量回归提高精度,配合异方差稳健标准误,在模型错设下仍对平均处理效应渐近有效

到2013年前后,常见出发点仍是“回归模型一旦可能错设,就不应在随机试验中使用协变量调整”。真正暴露问题的并非一个孤立反例,而是进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“调整后处理效应方差/未调整差均值方差”为何随条件改变。当研究者改用“调整后处理效应方差/未调整差均值方差”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

本条命题是:完全随机试验可通过处理组分别拟合的协变量回归提高精度,配合异方差稳健标准误,在模型错设下仍对平均处理效应渐近有效。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“调整后处理效应方差/未调整差均值方差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Winston Lin等在2013年〈Agnostic Notes on Regression Adjustments to Experimental Data: Reexamining Freedman’s Critique〉中的主结果。Lin针对处理与对照2个随机化臂,证明加入“处理×中心化协变量”交互可消除传统OLS调整的一阶偏差风险;当协变量有预测力时,调整后的渐近方差不大于未调整差均值。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“调整后处理效应方差/未调整差均值方差”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:群组随机、小样本和高维协变量需要额外修正;数据驱动选择若不交叉拟合会重引入偏差,稳健方差在很少随机化单位时也不可靠。失效条件为:当协变量无预测力、随机化单位很少或调整流程使用结局选择变量却无分样时,理论保证弱化。收敛需统一对象与“调整后处理效应方差/未调整差均值方差”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“调整后处理效应方差/未调整差均值方差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:因果推断称“设计型回归调整”,机器学习称“残差化”;另见第306号双重机器学习。共享预设为“回归模型一旦可能错设,就不应在随机试验中使用协变量调整”;先统一“调整后处理效应方差/未调整差均值方差”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置S——把『回归调整复权:随机试验中要用处理交互和稳健方差』形成的对象结构作为首要显露 单因决定『回归调整复权:随机试验中要用处理交互和稳健方差』当前结论的最小充分项只有:完全随机试验可通过处理组分别拟合的协变量回归提高精度,配合异方差稳健标准误,在模型错设下仍对平均处理效应渐近有效 预设〔03 相关方向等同因果方向〕回归模型一旦可能错设,就不应在随机试验中使用协变量调整 量纲调整后处理效应方差/未调整差均值方差 失效失效边界是『协变量无预测力、随机化单位很少或调整流程使用结局选择变量却无分样时,理论保证弱化』;越过该边界,相关条件越强,调整后处理效应方差反而越低 自曝『回归调整复权:随机试验中要用处理交互和稳健方差』的原始材料只直接支持“证据链的锚点是WinstonLin等在2013年〈AgnosticNotesonRegressionAdjustmentstoExperimenta”,没有自动覆盖边界外对象 空栏『回归调整复权:随机试验中要用处理交互和稳健方差』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名因果推断称“设计型回归调整”,机器学习称“残差化”;另见第 214 号第 5 条『ADMM:可分目标通过对偶残差协调』

辛、最大投影设计:高维空间填充必须兼顾低维投影Maximum Projection Designs

提出V. Roshan Joseph、Evren Gul与Shan Ba,2015年《Biometrika》102(2):371–380,DOI:10.1093/biomet/asv002,〈Maximum Projection Designs for Computer Experiments〉 关键计算机实验设计不应只在完整高维空间最大化点距,还要让所有低维投影保持空间填充,以应对只有少数因子真正活跃

2015年前后,本领域常把“高维设计在全空间均匀,就会在任何重要低维子空间同样均匀”当作默认起点。它在典型对象上看似稳固,却被进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“最差低维投影距离/全部因子子集数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“最差低维投影距离/全部因子子集数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条把转向压成一句可检验的话:计算机实验设计不应只在完整高维空间最大化点距,还要让所有低维投影保持空间填充,以应对只有少数因子真正活跃。可反驳版本为:固定抽样框、分配机制、干扰结构与非应答过程,按“最差低维投影距离/全部因子子集数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

V. Roshan Joseph等在2015年〈Maximum Projection Designs for Computer Experiments〉中的主结果是本条的证据起点。作者提出MaxPro准则,对点对在各坐标差的乘积施惩罚;与maximin和Latin超立方相比,设计在1维及多维子空间投影更均匀,准则计算成本不高于忽略投影的版本。具体读数“最差低维投影距离/全部因子子集数”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:当所有高阶交互都同等重要时,强调低维投影未必最优;混合因子、约束域和序贯增补需要扩展,优化本身也可能落入局部最优。失效条件为:当响应确实由高维密集交互主导、且低维稀疏性不成立时,MaxPro优势会减弱。收敛需统一对象与“最差低维投影距离/全部因子子集数”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“最差低维投影距离/全部因子子集数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:压缩感知称“低维可见性”,可视化称“投影覆盖”;另见第301号有限维近似。只有“最差低维投影距离/全部因子子集数”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置D——把『最大投影设计:高维空间填充必须兼顾低维投影』中的操作次序与变化路径作为首要显露 单因决定『最大投影设计:高维空间填充必须兼顾低维投影』当前结论的最小充分项只有:计算机实验设计不应只在完整高维空间最大化点距,还要让所有低维投影保持空间填充,以应对只有少数因子真正活跃 预设〔03 相关方向等同因果方向〕高维设计在全空间均匀,就会在任何重要低维子空间同样均匀 量纲最差低维投影距离/全部因子子集数 失效失效边界是『响应确实由高维密集交互主导、且低维稀疏性不成立时,MaxPro优势会减弱』;越过该边界,相关条件越强,最差低维投影距离反而越低 自曝『最大投影设计:高维空间填充必须兼顾低维投影』的原始材料只直接支持“V.RoshanJoseph等在2015年〈MaximumProjectionDesignsforComputerExperiments〉中的主结果”,没有自动覆盖边界外对象 空栏『最大投影设计:高维空间填充必须兼顾低维投影』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名压缩感知称“低维可见性”,可视化称“投影覆盖”;另见第 214 号第 1 条『压缩感知:稀疏性让欠定系统可恢复』
【第二幕】这十年 · 约 2016—2026

第二幕处理旧独立性被打破的世界:网络、平台、自适应算法、非概率数据和隐私机制都要求重新定义随机单位与有效分母。从“高维试验回归:Lasso调整必须把选择误差纳入随机化推断”到“隐私感知抽样:最优分层样本量必须把噪声预算写进去”,共同动作是接受规模、复制、边界与部署检验;主证据落在2016—2026年。

一、高维试验回归:Lasso调整必须把选择误差纳入随机化推断Lasso Adjustment in Randomized Experiments

提出Nicolas Bloniarz、Hanzhong Liu、Cun-Hui Zhang、Jasjeet Sekhon与Bin Yu,2016年《Proceedings of the National Academy of Sciences》113(27):7383–7390,DOI:10.1073/pnas.1510506113,〈Lasso Adjustments of Treatment Effect Estimates in Randomized Experiments〉 关键协变量数接近或超过样本量时可分别用Lasso预测潜在结局并做偏差修正借助随机

在2016年前后的文献中,标准叙事是“高维协变量会使随机试验无法安全做回归调整”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“调整后均方误差/未调整估计均方误差”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“调整后均方误差/未调整估计均方误差”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

本条命题是:协变量数接近或超过样本量时,可分别用Lasso预测潜在结局并做偏差修正,借助随机化获得平均处理效应的渐近正态推断。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“调整后均方误差/未调整估计均方误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Nicolas Bloniarz等在2016年〈Lasso Adjustments of Treatment Effect Estimates in Randomized Experiments〉中的主结果给出主证据:论文在处理与对照2组的随机试验中给出稀疏性与预测误差条件;模拟和真实试验显示Lasso调整相对差均值和普通OLS降低方差,关键不是解释非零系数,而是提高结局预测。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“调整后均方误差/未调整估计均方误差”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:强相关、非稀疏信号与调参泄漏会削弱增益;有限样本标准误需谨慎,选择变量本身不能被当作科学发现。失效条件为:当结局不可由稀疏或近似稀疏协变量预测,或调参使用全数据结局泄漏时不成立。收敛需统一对象与“调整后均方误差/未调整估计均方误差”,并公开随机化分布、非应答和成本预算及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。报告应围绕“调整后均方误差/未调整估计均方误差”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为生物统计称“高维协变量调整”,机器学习称“正则化残差化”;另见第306号稳定选择。碰撞须固定“高维协变量会使随机试验无法安全做回归调整”并比较“调整后均方误差/未调整估计均方误差”;第三项是入样概率、暴露干扰与响应机制。

位置E——把『高维试验回归:Lasso调整必须把选择误差纳入随机化推断』成立所需的边界环境作为首要显露 单因决定『高维试验回归:Lasso调整必须把选择误差纳入随机化推断』当前结论的最小充分项只有:协变量数接近或超过样本量时可分别用Lasso预测潜在结局并做偏差修正借助随机 预设〔03 相关方向等同因果方向〕高维协变量会使随机试验无法安全做回归调整 量纲调整后均方误差/未调整估计均方误差 失效当结局不可由稀疏或近似稀疏协变量预测,或调参使用全数据结局泄漏时不成立 自曝『高维试验回归:Lasso调整必须把选择误差纳入随机化推断』的原始材料只直接支持“NicolasBloniarz等在2016年〈LassoAdjustmentsofTreatmentEffectEstimatesinRandomi”,没有自动覆盖边界外对象 空栏『高维试验回归:Lasso调整必须把选择误差纳入随机化推断』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生物统计称“高维协变量调整”,机器学习称“正则化残差化”;另见第 432 号第 20 条『强化学习把预测器变成政策选择器』

二、网络实验:随机单位不是独立结局单位Network Experiments and Graph Cluster Randomization

提出Dean Eckles、Brian Karrer与Johan Ugander,2017年《Journal of Causal Inference》5(1):Article 20150021,DOI:10.1515/jci-2015-0021,〈Design and Analysis of Experiments in Networks: Reducing Bias from Interference〉 关键社交网络中个体处理会影响邻居,独立个体随机化估计的是混合暴露而非全网政策效应;图聚类随机化可减少跨组污染

2017年前后,旧框架把问题压成一句话:“只要处理独立随机,个体结局也可按互不干扰分析”。但进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“跨处理组网络边数/全部观测网络边数”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“跨处理组网络边数/全部观测网络边数”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

核心主张是:社交网络中个体处理会影响邻居,独立个体随机化估计的是混合暴露而非全网政策效应;图聚类随机化可减少跨组污染。它不是定义性的正确,而有清楚的否证口:固定抽样框、分配机制、干扰结构与非应答过程,按“跨处理组网络边数/全部观测网络边数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

Dean Eckles等在2017年〈Design and Analysis of Experiments in Networks: Reducing Bias from Interference〉中的主结果提供了决定性证据。作者形式化图上的干预反应,比较独立随机与集群随机2种设计;模拟显示当影响沿边传播时,按高模块度聚类随机能降低对“全处理∶全对照”对比的偏差,但方差可能上升。这里最有信息量的读数是“跨处理组网络边数/全部观测网络边数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:网络边观测不全、传播半径未知和聚类算法选择会改变估计;减少偏差与增加方差之间没有普遍最优点。失效条件为:当干扰不存在、网络极稀疏或图聚类与真实传播路径无关时,集群随机化不增益。收敛需统一对象与“跨处理组网络边数/全部观测网络边数”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“跨处理组网络边数/全部观测网络边数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:流行病学称“溢出效应”,系统工程称“耦合单元”;另见第357号多智能体系统。共享预设为“只要处理独立随机,个体结局也可按互不干扰分析”;先统一“跨处理组网络边数/全部观测网络边数”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置D——把『网络实验:随机单位不是独立结局单位』中的操作次序与变化路径作为首要显露 单因决定『网络实验:随机单位不是独立结局单位』当前结论的最小充分项只有:社交网络中个体处理会影响邻居,独立个体随机化估计的是混合暴露而非全网政策效应;图聚类随机化可减少跨组污染 预设〔04 尺度迁移不改变结论〕只要处理独立随机,个体结局也可按互不干扰分析 量纲跨处理组网络边数/全部观测网络边数 失效当干扰不存在、网络极稀疏或图聚类与真实传播路径无关时,集群随机化不增益 自曝『网络实验:随机单位不是独立结局单位』的原始材料只直接支持“DeanEckles等在2017年〈DesignandAnalysisofExperimentsinNetworks:ReducingBiasfro”,没有自动覆盖边界外对象 空栏『网络实验:随机单位不是独立结局单位』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名流行病学称“溢出效应”,系统工程称“耦合单元”;另见第 438 号第 1 条『巨型项目的成本低估是系统性而非偶然误差』

三、一般干扰下的设计型因果推断Exposure Mapping under Interference

提出Peter Aronow与Cyrus Samii,2017年《The Annals of Applied Statistics》11(4):1912–1947,DOI:10.1214/16-AOAS1005,〈Estimating Average Causal Effects under General Interference, with Application to a Social Network Experiment〉 关键在干扰存在时,应先把完整处理向量映射为有限暴露条件,再用设计概率估计各暴露的平均潜在结局

在2017年前后的文献中,默认判断仍是“干扰只需在结果模型里加邻居变量,无需重写处理条件与设计概率”。它没有处理进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“处于目标暴露的单位数/全部随机化单位数”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“处于目标暴露的单位数/全部随机化单位数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

理论内容不是“再加一种方法”,而是:在干扰存在时,应先把完整处理向量映射为有限暴露条件,再用设计概率估计各暴露的平均潜在结局。它允许以下决定性反例:固定抽样框、分配机制、干扰结构与非应答过程,按“处于目标暴露的单位数/全部随机化单位数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

主证据来自Peter Aronow等在2017年〈Estimating Average Causal Effects under General Interference, with Application to a Social Network Experiment〉中的主结果。作者给出广义Horvitz–Thompson与Hájek 2类估计、无偏方差和保守区间,并在社交网络实验中区分直接、邻居与组合3种暴露;识别依赖每个暴露条件具有正包含概率。其关键不是论文规模,而是给出了“处于目标暴露的单位数/全部随机化单位数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:暴露映射若遗漏传播机制,估计仍有结构错设;稀有暴露导致极端权重,网络测量误差会改变包含概率。失效条件为:当目标暴露几乎没有正概率或映射不能涵盖真实干扰路径时不成立。收敛需统一对象与“处于目标暴露的单位数/全部随机化单位数”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“处于目标暴露的单位数/全部随机化单位数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:网络科学称“邻域处理”,空间统计称“局部暴露”;另见第310号邻域效应。只有“处于目标暴露的单位数/全部随机化单位数”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置E——把『一般干扰下的设计型因果推断』成立所需的边界环境作为首要显露 单因决定『一般干扰下的设计型因果推断』当前结论的最小充分项只有:在干扰存在时,应先把完整处理向量映射为有限暴露条件,再用设计概率估计各暴露的平均潜在结局 预设〔04 尺度迁移不改变结论〕干扰只需在结果模型里加邻居变量,无需重写处理条件与设计概率 量纲处于目标暴露的单位数/全部随机化单位数 失效当目标暴露几乎没有正概率或映射不能涵盖真实干扰路径时不成立 自曝『一般干扰下的设计型因果推断』的原始材料只直接支持“主证据来自PeterAronow等在2017年〈EstimatingAverageCausalEffectsunderGeneralInterfer”,没有自动覆盖边界外对象 空栏『一般干扰下的设计型因果推断』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名网络科学称“邻域处理”,空间统计称“局部暴露”;另见第 432 号第 9 条『因果机器学习从平均效应走向异质效应』

四、非概率样本:大数据也必须借概率样本校准Inference from Nonprobability Samples

提出Michael Elliott与Richard Valliant,2017年《Statistical Science》32(2):249–264,DOI:10.1214/16-STS598,〈Inference for Nonprobability Samples〉 关键自愿面板网络数据和行政记录若无已知包含概率必须依赖选择模型结果模型或参考概率

到2017年前后,常见出发点仍是“数据量足够大时,非随机选择偏倚会被平均掉”。真正暴露问题的并非一个孤立反例,而是进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“加权有效样本量/原始非概率样本量”为何随条件改变。当研究者改用“加权有效样本量/原始非概率样本量”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

本条命题是:自愿面板、网络数据和行政记录若无已知包含概率,必须依赖选择模型、结果模型或参考概率样本,规模不能替代代表性。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“加权有效样本量/原始非概率样本量”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Michael Elliott等在2017年〈Inference for Nonprobability Samples〉中的主结果。综述把非概率样本校准归纳为伪权重与结果建模2条主路径,并讨论匹配、贝叶斯整合与质量诊断;有效推断依赖选择在给定辅助变量后可忽略及总体辅助分布可得。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“加权有效样本量/原始非概率样本量”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:不可观测选择、覆盖缺口和测量口径差异无法由权重自动修复;参考样本自身也有误差,极端权重会让名义大样本变成小有效样本。失效条件为:当选择依赖未观测结局相关变量且无外部校准信息时,总体均值不可识别。收敛需统一对象与“加权有效样本量/原始非概率样本量”,并公开随机化分布、非应答和成本预算及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。报告应围绕“加权有效样本量/原始非概率样本量”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为机器学习称“样本选择偏差”,推荐系统称“曝光偏差”;另见第353号反馈回路。碰撞须固定“数据量足够大时,非随机选择偏倚会被平均掉”并比较“加权有效样本量/原始非概率样本量”;第三项是入样概率、暴露干扰与响应机制。

位置S——把『非概率样本:大数据也必须借概率样本校准』形成的对象结构作为首要显露 单因决定『非概率样本:大数据也必须借概率样本校准』当前结论的最小充分项只有:自愿面板网络数据和行政记录若无已知包含概率必须依赖选择模型结果模型或参考概率 预设〔04 尺度迁移不改变结论〕数据量足够大时,非随机选择偏倚会被平均掉 量纲加权有效样本量/原始非概率样本量 失效当选择依赖未观测结局相关变量且无外部校准信息时,总体均值不可识别 自曝『非概率样本:大数据也必须借概率样本校准』的原始材料只直接支持“证据链的锚点是MichaelElliott等在2017年〈InferenceforNonprobabilitySamples〉中的主结果”,没有自动覆盖边界外对象 空栏『非概率样本:大数据也必须借概率样本校准』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“样本选择偏差”,推荐系统称“曝光偏差”;另见第 592 号第 10 条『物理信息神经网络』

五、协变量自适应随机化:推断要识别实际分配机制Covariate-Adaptive Randomization

提出Federico Bugni、Ivan Canay与Azeem Shaikh,2018年《Journal of the American Statistical Association》113(524):1784–1796,DOI:10.1080/01621459.2017.1375934,〈Inference under Covariate-Adaptive Randomization〉 关键分层、最小化等自适应随机化改变处理份额的依赖结构,普通两样本t检验可能保守或失真;有效推断需按设计机制修正方差

2018年前后,本领域常把“只要每个受试者有已知处理概率,普通独立同分布标准误就足够”当作默认起点。它在典型对象上看似稳固,却被进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“实际分配方差/完全随机分配方差”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“实际分配方差/完全随机分配方差”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条把转向压成一句可检验的话:分层、最小化等自适应随机化改变处理份额的依赖结构,普通两样本t检验可能保守或失真;有效推断需按设计机制修正方差。可反驳版本为:固定抽样框、分配机制、干扰结构与非应答过程,按“实际分配方差/完全随机分配方差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

Federico Bugni等在2018年〈Inference under Covariate-Adaptive Randomization〉中的主结果是本条的证据起点。作者建立广泛协变量自适应机制的渐近理论,展示分层不平衡的方差项如何进入处理效应区间,并提出稳健方差估计与检验。具体读数“实际分配方差/完全随机分配方差”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:结果依赖分层数与每层样本增长;小层、动态新增协变量和响应自适应分配需要不同理论,软件默认标准误往往不知道设计细节。失效条件为:当分配机制被错误记录、层数随样本过快增长或处理概率接近零时不成立。收敛需统一对象与“实际分配方差/完全随机分配方差”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“实际分配方差/完全随机分配方差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:临床试验称“最小化”,运筹学称“在线平衡”;另见第307号自适应采样。共享预设为“只要每个受试者有已知处理概率,普通独立同分布标准误就足够”;先统一“实际分配方差/完全随机分配方差”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置E——把『协变量自适应随机化:推断要识别实际分配机制』成立所需的边界环境作为首要显露 单因决定『协变量自适应随机化:推断要识别实际分配机制』当前结论的最小充分项只有:分层、最小化等自适应随机化改变处理份额的依赖结构,普通两样本t检验可能保守或失真;有效推断需按设计机制修正方差 预设〔05 观测与干预不回写对象〕只要每个受试者有已知处理概率,普通独立同分布标准误就足够 量纲实际分配方差/完全随机分配方差 失效当分配机制被错误记录、层数随样本过快增长或处理概率接近零时不成立 自曝『协变量自适应随机化:推断要识别实际分配机制』的原始材料只直接支持“FedericoBugni等在2018年〈InferenceunderCovariate-AdaptiveRandomization〉中的主结果是本”,没有自动覆盖边界外对象 空栏『协变量自适应随机化:推断要识别实际分配机制』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名临床试验称“最小化”,运筹学称“在线平衡”;另见第 214 号第 7 条『随机方差缩减:有限和结构让噪声逐轮归零』

六、随机饱和设计:干扰要通过处理密度实验化Randomized Saturation Designs

提出Sarah Baird、J. Aislinn Bohren、Craig McIntosh与Berk Özler,2018年《Journal of Econometrics》202(1):15–32,DOI:10.1016/j.jeconom.2017.09.003,〈Optimal Design of Experiments in the Presence of Interference〉 关键在群组内随机不同处理饱和度,再随机个体处理,可同时识别直接效应、溢出效应和总政策效应,而不是把干扰当偏差

在2018年前后的文献中,标准叙事是“有干扰的试验只能估直接效应,溢出无法通过随机化识别”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“不同饱和度群组数/全部随机化群组数”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“不同饱和度群组数/全部随机化群组数”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

可以把命题写为:在群组内随机不同处理饱和度,再随机个体处理,可同时识别直接效应、溢出效应和总政策效应,而不是把干扰当偏差。与口号不同,它预先承诺了失败方式:固定抽样框、分配机制、干扰结构与非应答过程,按“不同饱和度群组数/全部随机化群组数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Sarah Baird等在2018年〈Optimal Design of Experiments in the Presence of Interference〉中的主结果给出主证据:论文把随机饱和写成2阶段设计:先随机群组饱和度,再在群组内随机个体;极端饱和度有利于总效应,更多中间水平有利于识别剂量—溢出曲线。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“不同饱和度群组数/全部随机化群组数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:干扰必须主要留在群组内,实际接受与分配不一致会改变暴露;群组数不足时,多饱和度牺牲每个对比的精度。失效条件为:当干扰跨越随机化群组或处理密度不是有效暴露量时,饱和设计不能识别目标效应。收敛需统一对象与“不同饱和度群组数/全部随机化群组数”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“不同饱和度群组数/全部随机化群组数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:生态学称“密度梯度”,平台实验称“市场饱和”;另见第357号群体涌现。只有“不同饱和度群组数/全部随机化群组数”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置S——把『随机饱和设计:干扰要通过处理密度实验化』形成的对象结构作为首要显露 单因决定『随机饱和设计:干扰要通过处理密度实验化』当前结论的最小充分项只有:在群组内随机不同处理饱和度,再随机个体处理,可同时识别直接效应、溢出效应和总政策效应,而不是把干扰当偏差 预设〔05 观测与干预不回写对象〕有干扰的试验只能估直接效应,溢出无法通过随机化识别 量纲不同饱和度群组数/全部随机化群组数 失效当干扰跨越随机化群组或处理密度不是有效暴露量时,饱和设计不能识别目标效应 自曝『随机饱和设计:干扰要通过处理密度实验化』的原始材料只直接支持“SarahBaird等在2018年〈OptimalDesignofExperimentsinthePresenceofInterference〉中的”,没有自动覆盖边界外对象 空栏『随机饱和设计:干扰要通过处理密度实验化』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生态学称“密度梯度”,平台实验称“市场饱和”;另见第 214 号第 4 条『近端分裂:不可微结构必须由算子而不是平滑替代处理』

七、差分隐私进入人口普查:发布误差变成设计变量Differential Privacy for the Census

提出John Abowd,2018年《Proceedings of the 24th ACM SIGKDD Conference》KDD 2018:2867,DOI:10.1145/3219819.3226070(会议报告),〈The U.S. Census Bureau Adopts Differential Privacy〉 关键官方统计发布不能再把表格逐项精确与保密同时承诺;差分隐私用可累计的隐私预算把披露风险与统计误差显式交换

2018年前后,旧框架把问题压成一句话:“只要删除姓名并限制表格粒度,人口普查微数据与精细表格可长期安全发布”。但进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“隐私噪声方差/发布单元真实计数”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“隐私噪声方差/发布单元真实计数”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

本条命题是:官方统计发布不能再把表格逐项精确与保密同时承诺;差分隐私用可累计的隐私预算把披露风险与统计误差显式交换。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“隐私噪声方差/发布单元真实计数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

John Abowd等在2018年〈The U.S. Census Bureau Adopts Differential Privacy〉中的主结果提供了决定性证据。美国人口普查局宣布2020普查采用差分隐私框架;每次查询消耗epsilon预算,TopDown等后处理再施加非负、总量一致等约束,发布值因此是受控噪声与一致化的结果。这里最有信息量的读数是“隐私噪声方差/发布单元真实计数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:预算分配具有价值判断,噪声对小地区和少数群体相对影响更大;后处理会引入相关与偏差,传统抽样误差公式不覆盖隐私误差。失效条件为:当攻击面不含辅助信息、查询次数严格有限且传统方法已有可证明保护时,DP增量可能较小。收敛需统一对象与“隐私噪声方差/发布单元真实计数”,并公开随机化分布、非应答和成本预算及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。报告应围绕“隐私噪声方差/发布单元真实计数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为计算机科学称“隐私预算”,质量工程称“受控扰动”;另见第354号隐私工程。碰撞须固定“只要删除姓名并限制表格粒度,人口普查微数据与精细表格可长期安全发布”并比较“隐私噪声方差/发布单元真实计数”;第三项是入样概率、暴露干扰与响应机制。

位置D——把『差分隐私进入人口普查:发布误差变成设计变量』中的操作次序与变化路径作为首要显露 单因决定『差分隐私进入人口普查:发布误差变成设计变量』当前结论的最小充分项只有:官方统计发布不能再把表格逐项精确与保密同时承诺;差分隐私用可累计的隐私预算把披露风险与统计误差显式交换 预设〔05 观测与干预不回写对象〕只要删除姓名并限制表格粒度,人口普查微数据与精细表格可长期安全发布 量纲隐私噪声方差/发布单元真实计数 失效当攻击面不含辅助信息、查询次数严格有限且传统方法已有可证明保护时,DP增量可能较小 自曝『差分隐私进入人口普查:发布误差变成设计变量』的原始材料只直接支持“JohnAbowd等在2018年〈TheU.S.CensusBureauAdoptsDifferentialPrivacy〉中的主结果提供了决定性证”,没有自动覆盖边界外对象 空栏『差分隐私进入人口普查:发布误差变成设计变量』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名计算机科学称“隐私预算”,质量工程称“受控扰动”;另见第 438 号第 5 条『联盟式交付用共同风险池替代逐项索赔』

八、双重稳健整合:非概率样本要同时建选择与结果Doubly Robust Nonprobability Integration

提出Yilin Chen、Pengfei Li与Changbao Wu,2020年《Journal of the American Statistical Association》115(532):2011–2021,DOI:10.1080/01621459.2019.1677241,〈Doubly Robust Inference with Nonprobability Survey Samples〉 关键有参考概率样本提供总体辅助信息时,可同时拟合非概率入样倾向与结果模型;任一模型正确即可一致估计有限总体均值

2020年前后,旧默认是“非概率数据只能被丢弃,或必须假定一个完全正确的选择模型”,但进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“参考概率样本有效信息量/非概率样本原始规模”为何随条件改变。以“参考概率样本有效信息量/非概率样本原始规模”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:有参考概率样本提供总体辅助信息时,可同时拟合非概率入样倾向与结果模型;任一模型正确即可一致估计有限总体均值。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“参考概率样本有效信息量/非概率样本原始规模”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Yilin Chen等在2020年〈Doubly Robust Inference with Nonprobability Survey Samples〉中的主结果。论文同时建立选择模型与结果模型2套方程,构造伪似然倾向和增强逆概率估计;只要2个模型中至少1个正确,估计保持一致,相较只加权或只回归有更小偏差。其关键不是论文规模,而是给出了“参考概率样本有效信息量/非概率样本原始规模”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:双重稳健仍要求选择可忽略、共同支持和变量口径一致;两个模型同时错或极端权重时无保护,高维辅助变量需要正则化与交叉拟合。失效条件为:当参考样本缺少决定选择和结果的关键变量、或两数据源测量不一致时不成立。收敛需统一对象与“参考概率样本有效信息量/非概率样本原始规模”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“参考概率样本有效信息量/非概率样本原始规模”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:数据融合称“概率—非概率整合”,生物统计称“双重稳健”;另见第306号TMLE。共享预设为“非概率数据只能被丢弃,或必须假定一个完全正确的选择模型”;先统一“参考概率样本有效信息量/非概率样本原始规模”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置S——把『双重稳健整合:非概率样本要同时建选择与结果』形成的对象结构作为首要显露 单因决定『双重稳健整合:非概率样本要同时建选择与结果』当前结论的最小充分项只有:有参考概率样本提供总体辅助信息时,可同时拟合非概率入样倾向与结果模型;任一模型正确即可一致估计有限总体均值 预设〔06 聚合次序不影响结论〕非概率数据只能被丢弃,或必须假定一个完全正确的选择模型 量纲参考概率样本有效信息量/非概率样本原始规模 失效当参考样本缺少决定选择和结果的关键变量、或两数据源测量不一致时不成立 自曝『双重稳健整合:非概率样本要同时建选择与结果』的原始材料只直接支持“主证据来自YilinChen等在2020年〈DoublyRobustInferencewithNonprobabilitySurveySamples”,没有自动覆盖边界外对象 空栏『双重稳健整合:非概率样本要同时建选择与结果』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名数据融合称“概率—非概率整合”,生物统计称“双重稳健”;另见第 585 号第 12 条『有限元模型验证与确认』

九、自适应实验区间:算法偏爱某臂后仍要推断未被偏爱的政策Inference after Adaptive Experiments

提出Vitor Hadad、David Hirshberg、Ruohan Zhan、Stefan Wager与Susan Athey,2021年《Proceedings of the National Academy of Sciences》118(15):e2014602118,DOI:10.1073/pnas.2014602118,〈Confidence Intervals for Policy Evaluation in Adaptive Experiments〉 关键多臂老虎机等自适应分配使样本均值有偏、逆概率权重重尾;方差稳定的自适应权重可对目标政策给出渐近有效区间

到2021年前后,常见出发点仍是“随机化概率已知,就可把自适应数据当普通独立试验分析”。真正暴露问题的并非一个孤立反例,而是进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“有效加权信息量/累计实验轮数”为何随条件改变。当研究者改用“有效加权信息量/累计实验轮数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

新命题明确写成:多臂老虎机等自适应分配使样本均值有偏、逆概率权重重尾;方差稳定的自适应权重可对目标政策给出渐近有效区间。这句话可以被反驳,检验方式是:固定抽样框、分配机制、干扰结构与非应答过程,按“有效加权信息量/累计实验轮数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

证据链的锚点是Vitor Hadad等在2021年〈Confidence Intervals for Policy Evaluation in Adaptive Experiments〉中的主结果。作者比较方差加权增强IPW、朴素均值与普通IPW 3类估计器;模拟显示处理概率衰减时,前者覆盖率与RMSE更稳定,尤其能评估被算法较少分配的非最优臂。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“有效加权信息量/累计实验轮数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:需要记录真实分配概率并满足探索下界;模型更新、延迟结局与非平稳环境会改变理论,事后挑选政策仍有选择问题。失效条件为:当某些行动概率过快趋零、分配日志错误或奖励非平稳时,区间不能保证覆盖。收敛需统一对象与“有效加权信息量/累计实验轮数”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“有效加权信息量/累计实验轮数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:在线学习称“离策略评估”,序贯分析称“自适应推断”;另见第357号多智能体学习。只有“有效加权信息量/累计实验轮数”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置D——把『自适应实验区间:算法偏爱某臂后仍要推断未被偏爱的政策』中的操作次序与变化路径作为首要显露 单因决定『自适应实验区间:算法偏爱某臂后仍要推断未被偏爱的政策』当前结论的最小充分项只有:多臂老虎机等自适应分配使样本均值有偏、逆概率权重重尾;方差稳定的自适应权重可对目标政策给出渐近有效区间 预设〔06 聚合次序不影响结论〕随机化概率已知,就可把自适应数据当普通独立试验分析 量纲有效加权信息量/累计实验轮数 失效当某些行动概率过快趋零、分配日志错误或奖励非平稳时,区间不能保证覆盖 自曝『自适应实验区间:算法偏爱某臂后仍要推断未被偏爱的政策』的原始材料只直接支持“证据链的锚点是VitorHadad等在2021年〈ConfidenceIntervalsforPolicyEvaluationinAdaptiveE”,没有自动覆盖边界外对象 空栏『自适应实验区间:算法偏爱某臂后仍要推断未被偏爱的政策』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名在线学习称“离策略评估”,序贯分析称“自适应推断”;另见第 213 号第 11 条『自适应有限元的收敛性与最优性理论』

十、切换实验:市场干扰时按时间块随机Switchback Experiments

提出Iavor Bojinov、David Simchi-Levi与Jinglong Zhao,2023年《Management Science》69(7):3759–3777,DOI:10.1287/mnsc.2022.4583,〈Design and Analysis of Switchback Experiments〉 关键共享市场、配送网络等系统无法独立随机用户时,可在连续时间块切换处理,并显式处理滞后和时间相关以估政策效应

2023年前后,本领域常把“在线实验只有用户级随机化才具有因果解释”当作默认起点。它在典型对象上看似稳固,却被进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“有效独立切换次数/总实验时长”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“有效独立切换次数/总实验时长”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条把转向压成一句可检验的话:共享市场、配送网络等系统无法独立随机用户时,可在连续时间块切换处理,并显式处理滞后和时间相关以估政策效应。可反驳版本为:固定抽样框、分配机制、干扰结构与非应答过程,按“有效独立切换次数/总实验时长”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

Iavor Bojinov等在2023年〈Design and Analysis of Switchback Experiments〉中的主结果是本条的证据起点。论文推导无偏估计和最坏均方误差近最优的切换间隔;独立切换数近似为“总实验时长/时间块长度”,块过短会被carryover污染,块过长则使这个分母迅速变小。具体读数“有效独立切换次数/总实验时长”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:需要干扰主要通过共同时间环境传播且滞后长度可界定;趋势、节假日、预期行为和不可逆处理会破坏简单交替。失效条件为:当处理影响不可逆、滞后超过实验周期或时间趋势与处理安排共线时不成立。收敛需统一对象与“有效独立切换次数/总实验时长”,并公开随机化分布、非应答和成本预算及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。报告应围绕“有效独立切换次数/总实验时长”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为工程称“交替工况试验”,医学称“N-of-1交叉”;另见第309号干预时间序列。碰撞须固定“在线实验只有用户级随机化才具有因果解释”并比较“有效独立切换次数/总实验时长”;第三项是入样概率、暴露干扰与响应机制。

位置E——把『切换实验:市场干扰时按时间块随机』成立所需的边界环境作为首要显露 单因决定『切换实验:市场干扰时按时间块随机』当前结论的最小充分项只有:共享市场、配送网络等系统无法独立随机用户时,可在连续时间块切换处理,并显式处理滞后和时间相关以估政策效应 预设〔06 聚合次序不影响结论〕在线实验只有用户级随机化才具有因果解释 量纲有效独立切换次数/总实验时长 失效当处理影响不可逆、滞后超过实验周期或时间趋势与处理安排共线时不成立 自曝『切换实验:市场干扰时按时间块随机』的原始材料只直接支持“IavorBojinov等在2023年〈DesignandAnalysisofSwitchbackExperiments〉中的主结果是本条的证据起点”,没有自动覆盖边界外对象 空栏『切换实验:市场干扰时按时间块随机』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名工程称“交替工况试验”,医学称“N-of-1交叉”;另见第 215 号第 11 条『低温等离子体医学:活性物种剂量而非“等离子体时间”决定效应』

十一、代理变量切换实验:短期读数可服务长期效应,但要校正Surrogate-Assisted Switchback Design

提出Hongyu Chen与David Simchi-Levi,2025年在线发表、2026年见刊于《Management Science》72(6):4854–4870,DOI:10.1287/mnsc.2023.03818,〈Efficient Switchback Experiments with Surrogate Variables: Estimation and Experimental Design〉 关键当主要结局延迟或噪声大时经过校准的代理变量可与最终结局联合估计并据其相关结构

在2025年前后的文献中,标准叙事是“延迟结局出现前,切换实验只能等待,短期代理不能进入正式推断”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“最终结局方差下降量/代理变量采集成本”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“最终结局方差下降量/代理变量采集成本”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

本条命题是:当主要结局延迟或噪声大时,经过校准的代理变量可与最终结局联合估计,并据其相关结构优化切换周期和样本分配。否证方式为:固定抽样框、分配机制、干扰结构与非应答过程,按“最终结局方差下降量/代理变量采集成本”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Hongyu Chen等在2025年〈Efficient Switchback Experiments with Surrogate Variables: Estimation and Experimental Design〉中的主结果给出主证据:论文构造代理增强估计器,并给出Fisher随机化检验与渐近正态检验2套推断;代理—最终结局协方差越强,达到同一精度所需实验时长越短。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“最终结局方差下降量/代理变量采集成本”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:代理相关不等于因果替代,处理可能改变代理—结局关系;设计前估计协方差也会漂移,错误代理可带来偏差或虚假精度。失效条件为:当代理与最终结局条件相关弱、处理改变代理机制或校准样本不足时不成立。收敛需统一对象与“最终结局方差下降量/代理变量采集成本”,并公开随机化分布、非应答和成本预算及最强反例。

由此,对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。对本项证据须公开“最终结局方差下降量/代理变量采集成本”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:临床试验称“替代终点”,机器学习称“代理损失”;另见第309号领先指标。共享预设为“延迟结局出现前,切换实验只能等待,短期代理不能进入正式推断”;先统一“最终结局方差下降量/代理变量采集成本”,若仍逆向,再检验入样概率、暴露干扰与响应机制。

位置D——把『代理变量切换实验:短期读数可服务长期效应,但要校正』中的操作次序与变化路径作为首要显露 单因决定『代理变量切换实验:短期读数可服务长期效应,但要校正』当前结论的最小充分项只有:当主要结局延迟或噪声大时经过校准的代理变量可与最终结局联合估计并据其相关结构 预设〔01 谁进入分母〕延迟结局出现前,切换实验只能等待,短期代理不能进入正式推断 量纲最终结局方差下降量/代理变量采集成本 失效当代理与最终结局条件相关弱、处理改变代理机制或校准样本不足时不成立 自曝『代理变量切换实验:短期读数可服务长期效应,但要校正』的原始材料只直接支持“HongyuChen等在2025年〈EfficientSwitchbackExperimentswithSurrogateVariables:Est”,没有自动覆盖边界外对象 空栏『代理变量切换实验:短期读数可服务长期效应,但要校正』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名临床试验称“替代终点”,机器学习称“代理损失”;另见第 439 号第 11 条『服务机器人部署需要同时设计接受与失败补救』

十二、隐私感知抽样:最优分层样本量必须把噪声预算写进去Private Optimal Survey Design

提出Yu-Wei Chen、Raghu Pasupathy与Jordan A. Awan,2025年《Proceedings of Machine Learning Research》267:8856–8870(ICML 2025会议论文),arXiv:2501.18121,〈Optimal Survey Design for Private Mean Estimation〉 关键在差分隐私均值估计中传统Neyman分配可能因各层隐私噪声不同而非最优抽样率

2025年前后,旧框架把问题压成一句话:“先按经典精度分配样本,再在分析末端加隐私噪声即可保持设计最优”。但进入样本、接受处理、发生回应、受到干扰和被隐私机制扰动的概率会共同改变估计;旧口径尤其无法解释“总估计方差/每层隐私预算与样本量”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“总估计方差/每层隐私预算与样本量”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

核心主张是:在差分隐私均值估计中,传统Neyman分配可能因各层隐私噪声不同而非最优;抽样率与名义隐私预算必须联合优化。它不是定义性的正确,而有清楚的否证口:固定抽样框、分配机制、干扰结构与非应答过程,按“总估计方差/每层隐私预算与样本量”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

Yu-Wei Chen等在2025年〈Optimal Survey Design for Private Mean Estimation〉中的主结果提供了决定性证据。作者针对Laplace、离散Laplace与TuLap 3种隐私机制建立强凸方差目标并给出整数最优算法;理论显示忽略隐私噪声项会把最优分层样本量配置推向错误方向并放大总方差。这里最有信息量的读数是“总估计方差/每层隐私预算与样本量”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:结果针对均值与特定机制,层方差和总体规模需先验估计;复杂表格、非响应与多次发布会改变预算组合,当前论文仍属新近方法。失效条件为:当隐私噪声相对抽样误差可忽略、或发布目标不是分层均值时,联合设计优势可能消失。收敛需统一对象与“总估计方差/每层隐私预算与样本量”,并公开随机化分布、非应答和成本预算及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;设计文档应记录抽样框、入样与分配概率、非应答、干扰、隐私噪声和成本轨迹,分析必须尊重真实分配机制。最低报告责任包括“总估计方差/每层隐私预算与样本量”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:资源分配称“预算联立优化”,安全工程称“privacy-by-design”;另见第354号隐私工程。只有“总估计方差/每层隐私预算与样本量”可换算时才属同一动作;冲突仍在时应测量入样概率、暴露干扰与响应机制。

位置D——把『隐私感知抽样:最优分层样本量必须把噪声预算写进去』中的操作次序与变化路径作为首要显露 单因决定『隐私感知抽样:最优分层样本量必须把噪声预算写进去』当前结论的最小充分项只有:在差分隐私均值估计中传统Neyman分配可能因各层隐私噪声不同而非最优抽样率 预设〔02 单一读数代表复杂对象〕先按经典精度分配样本,再在分析末端加隐私噪声即可保持设计最优 量纲总估计方差/每层隐私预算与样本量 失效当隐私噪声相对抽样误差可忽略、或发布目标不是分层均值时,联合设计优势可能消失 自曝『隐私感知抽样:最优分层样本量必须把噪声预算写进去』的原始材料只直接支持“Yu-WeiChen等在2025年〈OptimalSurveyDesignforPrivateMeanEstimation〉中的主结果提供了决定性证”,没有自动覆盖边界外对象 空栏『隐私感知抽样:最优分层样本量必须把噪声预算写进去』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名资源分配称“预算联立优化”,安全工程称“privacy-by-design”;另见第 214 号第 8 条『差分隐私优化:噪声预算必须和统计误差同账』

◎ 二十年连起来看

第一条贯穿线是:随机化不是标签,而是一套概率记录。配对、再随机化、协变量自适应、网络暴露和切换实验都说明,分析必须使用真实分配机制;只写“随机对照”而丢掉实现概率,会丢失精度甚至有效性。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。

第二条贯穿线是:独立单位被重新发现为设计对象。群组、网络邻域、市场时段和抽样链都不是独立个人的简单集合;有效样本量由随机化层级、干扰半径与权重决定。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。

第三条贯穿线是:成本与隐私进入误差函数。响应式设计按边际追访成本控制误差,差分隐私把发布噪声计入预算,隐私感知抽样进一步在采集前联立优化。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。

◎ 三个常见误解

误解一:随机化之后协变量平衡不重要。随机化保证长期无偏,不保证一次实现精确;再随机化与配对可在不牺牲设计性识别下提高信息量。容易误读,是因为“随机”常被误解为每次样本都会自动平衡。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。最容易误读之处,应由反例、边界或样本外结果直接揭示。

误解二:应答率越高,调查偏倚越小。偏倚取决于回应者与未回应者在目标量上的差异;高应答也可能来自强追访并增加测量误差。容易误读,是因为应答率可即时观测,而无回应偏倚需要外部验证。最容易误读之处,应由反例、边界或样本外结果直接揭示。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。

误解三:平台A/B测试拥有海量用户,所以标准误必然很小。网络干扰、共享市场、时间相关和自适应分配会把数百万点击压成少数独立集群或切换。容易误读,是因为日志行数比独立随机单位数更显眼。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。

◎ 与相邻领域的接口

与第306号生物统计学的分工是:本块优先通过随机化与抽样机制制造可识别性,第306号在临床与观察数据中定义estimand、控制混杂并外推;阶梯楔形和目标试验在两块交界。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

与第310号空间统计的接口在空间抽样、邻域干扰与覆盖。抽样设计决定哪些位置有非零包含概率,空间模型决定未采位置如何借邻近信息;两者不能互相替代。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。

与第357号多智能体系统的接口在网络与市场干扰:本块把群体相互作用纳入潜在结果和随机化,第357号研究协议、学习与涌现机制。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

与第354号软件安全与隐私工程的接口在差分隐私:本块关心发布噪声对估计与小区域公平的影响,安全工程关心攻击模型、预算组合与系统实现。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

◎ 争议现场

第一场争论是响应式设计是否真的降低偏倚,还是只降低成本。过程指标与结果偏倚并非一一对应。要收敛,需要在随机化嵌入式试验中比较不同追访策略对外部基准偏差、测量误差和成本的联合影响。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。

第二场争论是网络实验应优先无偏还是低均方误差。图聚类减少污染却增加方差,暴露映射更精细又产生稀有权重。要收敛,需要在已知传播机制的仿真与多网络现场实验中,按政策目标比较偏差—方差前沿。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。

第三场争论是官方统计的隐私预算怎样体现公共价值。总epsilon可换来许多空间与人口单元的不同误差。要收敛,需要公开预算分配规则、各群体相对误差和实际重识别风险,而不只争论一个总参数。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。

◎ 往下五年看什么

观察点一是调查机构在现场实时监控的不再只是应答率,而是辅助变量失衡、每减少一个偏差单位的成本和模式切换后的测量差。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

观察点二是在线实验论文中明确报告随机化单位、干扰假设、有效切换数和分配概率日志的比例;这四项可直接审计。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。

观察点三是非概率样本整合在外部概率样本上的有效样本量、权重尾部与敏感性区间,而不是合并后总记录数。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。

观察点四是差分隐私官方表格在小区域、少数群体和重复查询下的相对均方误差,以及隐私感知抽样能否降低该最差误差。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

◎ 可与哪些领域对撞

本块第六条“再随机化”可与第352号形式化方法中的“满足不变量后才接受执行”对撞。共享预设是候选实现可被重复生成直到通过约束;相反点是实验设计保留概率随机性,形式化验证追求确定性证书。若两边都成立,第三项是接受规则本身必须可审计且事前固定。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。

本块第十二条“网络干扰”可与第357号多智能体系统的“涌现”对撞。共享预设是个体结果由邻居行动共同生成;相反点是因果设计试图隔离可定义暴露,多智能体研究允许策略共同演化。若两边都成立,第三项是暴露映射必须随策略变化更新。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。第三项必须能产生新的可证伪读数,不能只是折中措辞。

本块第十六条“差分隐私人口普查”可与第303号复几何的“非极质量”对撞。共享预设是总量可以保持而局部质量被重新分配;相反点是隐私机制主动加噪,几何理论剔除奇异集伪质量。若两边都成立,第三项是局部失真对弱小子群的责任。第三项必须能产生新的可证伪读数,不能只是折中措辞。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。

本块第二十条“隐私感知抽样”可与第360号能效调度对撞。共享预设是预算在多个单元间分配会改变总体误差;相反点是调查在隐私—方差间分配,系统在能耗—延迟间分配。若两边都成立,第三项是最差单元约束而非只优化平均。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

◎ 十条可做的研究命题

1. 命题:响应式追访按辅助变量失衡触发,比按应答率阈值触发更能降低总体偏差;在同一调查嵌入随机策略;若偏差不低且成本更高,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。

2. 命题:阶梯楔形试验中未建模暴露时长是效应异质性的主要来源;重分析公开试验;若加入时长不改善拟合与预测,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

3. 命题:再随机化的精度增益可由预后R²和接受概率共同预测;跨实验验证理论公式;若预测误差系统很大,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

4. 命题:MaxPro设计在稀疏活跃因子计算机实验中优于maximin;按未知活跃子空间做盲测;若样本外误差不低,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

5. 命题:图聚类随机化的最优粒度由跨组边比例而非模块度单独决定;在多网络试验比较;若模块度始终预测更强,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

6. 命题:非概率样本的有效样本量比原始规模更能预测总体估计误差;建立带外部真值的多数据源库;若原始规模更强,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。

7. 命题:自适应实验使用稳定方差权重后,对非最优政策的区间覆盖接近名义水平;在多臂现场随机植入评估任务;若覆盖不足,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。

8. 命题:切换实验的最优块长等于主要carryover衰减时间的常数倍;在不同市场估计脉冲响应;若无稳定比例,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

9. 命题:代理增强切换实验只有在代理—最终结局关系处理不变时降低均方误差;用处理交互检验;若关系变化仍稳定获益,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。

10. 命题:隐私感知分层抽样能降低小群体最大相对误差而不增加总成本;在公开人口表仿真;若最大误差不降,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

◎ 资料核验

  1. Robert Groves与Steven Heeringa,2006年《Journal of the Royal Statistical Society: Series A》169(3):439–457,DOI:10.1111/j.1467-985X.2006.00423.x,〈Responsive Design for Household Surveys: Tools for Actively Controlling Survey Errors and Costs〉
  2. Michael Hussey与James Hughes,2007年《Contemporary Clinical Trials》28(2):182–191,DOI:10.1016/j.cct.2006.05.007,〈Design and Analysis of Stepped Wedge Cluster Randomized Trials〉
  3. Kosuke Imai、Gary King与Clayton Nall,2009年《Statistical Science》24(1):29–53,DOI:10.1214/08-STS274,〈The Essential Role of Pair Matching in Cluster-Randomized Experiments〉
  4. Robert Groves与Lars Lyberg,2010年《Public Opinion Quarterly》74(5):849–879,DOI:10.1093/poq/nfq065,〈Total Survey Error: Past, Present, and Future〉
  5. Krista Gile,2011年《Journal of the American Statistical Association》106(493):135–146,DOI:10.1198/jasa.2011.ap09475,〈Improved Inference for Respondent-Driven Sampling Data with Application to HIV Prevalence Estimation〉
  6. Kari Lock Morgan与Donald Rubin,2012年《The Annals of Statistics》40(2):1263–1282,DOI:10.1214/12-AOS1008,〈Rerandomization to Improve Covariate Balance in Experiments〉
  7. Winston Lin,2013年《The Annals of Applied Statistics》7(1):295–318,DOI:10.1214/12-AOAS583,〈Agnostic Notes on Regression Adjustments to Experimental Data: Reexamining Freedman’s Critique〉
  8. V. Roshan Joseph、Evren Gul与Shan Ba,2015年《Biometrika》102(2):371–380,DOI:10.1093/biomet/asv002,〈Maximum Projection Designs for Computer Experiments〉
  9. Nicolas Bloniarz、Hanzhong Liu、Cun-Hui Zhang、Jasjeet Sekhon与Bin Yu,2016年《Proceedings of the National Academy of Sciences》113(27):7383–7390,DOI:10.1073/pnas.1510506113,〈Lasso Adjustments of Treatment Effect Estimates in Randomized Experiments〉
  10. Dean Eckles、Brian Karrer与Johan Ugander,2017年《Journal of Causal Inference》5(1):Article 20150021,DOI:10.1515/jci-2015-0021,〈Design and Analysis of Experiments in Networks: Reducing Bias from Interference〉
  11. Peter Aronow与Cyrus Samii,2017年《The Annals of Applied Statistics》11(4):1912–1947,DOI:10.1214/16-AOAS1005,〈Estimating Average Causal Effects under General Interference, with Application to a Social Network Experiment〉
  12. Michael Elliott与Richard Valliant,2017年《Statistical Science》32(2):249–264,DOI:10.1214/16-STS598,〈Inference for Nonprobability Samples〉
  13. Federico Bugni、Ivan Canay与Azeem Shaikh,2018年《Journal of the American Statistical Association》113(524):1784–1796,DOI:10.1080/01621459.2017.1375934,〈Inference under Covariate-Adaptive Randomization〉
  14. Sarah Baird、J. Aislinn Bohren、Craig McIntosh与Berk Özler,2018年《Journal of Econometrics》202(1):15–32,DOI:10.1016/j.jeconom.2017.09.003,〈Optimal Design of Experiments in the Presence of Interference〉
  15. John Abowd,2018年《Proceedings of the 24th ACM SIGKDD Conference》KDD 2018:2867,DOI:10.1145/3219819.3226070(会议报告),〈The U.S. Census Bureau Adopts Differential Privacy〉
  16. Yilin Chen、Pengfei Li与Changbao Wu,2020年《Journal of the American Statistical Association》115(532):2011–2021,DOI:10.1080/01621459.2019.1677241,〈Doubly Robust Inference with Nonprobability Survey Samples〉
  17. Vitor Hadad、David Hirshberg、Ruohan Zhan、Stefan Wager与Susan Athey,2021年《Proceedings of the National Academy of Sciences》118(15):e2014602118,DOI:10.1073/pnas.2014602118,〈Confidence Intervals for Policy Evaluation in Adaptive Experiments〉
  18. Iavor Bojinov、David Simchi-Levi与Jinglong Zhao,2023年《Management Science》69(7):3759–3777,DOI:10.1287/mnsc.2022.4583,〈Design and Analysis of Switchback Experiments〉
  19. Hongyu Chen与David Simchi-Levi,2025年在线发表、2026年见刊于《Management Science》72(6):4854–4870,DOI:10.1287/mnsc.2023.03818,〈Efficient Switchback Experiments with Surrogate Variables: Estimation and Experimental Design〉
  20. Yu-Wei Chen、Raghu Pasupathy与Jordan A. Awan,2025年《Proceedings of Machine Learning Research》267:8856–8870(ICML 2025会议论文),arXiv:2501.18121,〈Optimal Survey Design for Private Mean Estimation〉
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行碰撞行(预设/量纲/失效/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板