生物统计学
生物统计学在近二十年里完成了一次明显的角色转换:它不再只是把医学数据送进一个熟悉检验,而是先定义目标量、数据生成机制和能够承受的偏倚,再决定模型。第一幕把高维多重性、缺失、纵向—生存耦合与预测报告变成可审计对象;第二幕则把因果机器学习、异质效应、estimand、外推、联邦数据与目标试验报告推到中心。二十条共同反对一个旧习惯:样本大、算法新或p值小,并不自动等于问题问对、分母正确和结论可迁移。选目横跨靶向学习、网络荟萃、缺失数据、联合模型、目标试验、高维异质效应、外推与联邦分析。第一幕把“一个显著系数”拆成目标参数、识别假设和有效影响函数,第二幕则面对电子健康记录、多中心数据和机器学习带来的规模与选择。这里的共同判据是:预测准确不能替代因果可识别,样本量也不能替代目标人群。读者应沿每条的偏差/标准误、直接/间接证据或目标/样本人群之比,判断方法究竟改善了哪一层。阅读时应把每条的主证据年份、关键读数与失效条件连在一起,而不能把标题本身当作已经稳定的共识。
这一幕的共同动作,是把隐藏在“常规分析”里的选择、缺失、相关与模型开发过程显式化;错误不再只在最后一个p值,而在整个数据生成链。从“靶向最大似然:机器学习也要对准因果参数”到“TRIPOD:预测模型必须公开完整生成链”,共同动作是把旧默认改写成可反驳的结构命题;主证据均在2016年前形成。
甲、靶向最大似然:机器学习也要对准因果参数Targeted Maximum Likelihood Learning
在2006年前后的文献中,标准叙事是“预测整体分布最好的模型也会给出最好的因果参数估计”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“目标参数偏差/有效影响函数标准误”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“目标参数偏差/有效影响函数标准误”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。
本条命题是:先拟合结果与处理机制,再沿有效影响函数方向更新,可在双重稳健条件下把灵活学习器对准目标参数而非整体预测误差。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“目标参数偏差/有效影响函数标准误”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
证据链的锚点是Mark van der Laan等在2006年〈Targeted Maximum Likelihood Learning〉中的主结果。论文把替代估计写成初始分布加靶向波动2步;当结果回归或处理机制这2个nuisance模型中至少1个正确时估计保持一致,两者都正确时达到n^{-1/2}阶与半参数效率界,后来交叉拟合进一步放宽经验过程条件。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“目标参数偏差/有效影响函数标准误”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。
争议边界是:双重稳健不是“双重保险”:两个 nuisance 模型同时严重错设仍会偏;有限样本中极端倾向分数、过拟合与正值性破坏可使影响函数方差失控。失效条件为:当处理概率接近零或一、且缺少截断与重叠诊断时,靶向更新不能修复不可识别性。收敛需统一对象与“目标参数偏差/有效影响函数标准误”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“目标参数偏差/有效影响函数标准误”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:机器学习称“任务定向损失”,控制论称“闭环校正”;另见第307号广义贝叶斯。共享预设为“预测整体分布最好的模型也会给出最好的因果参数估计”;先统一“目标参数偏差/有效影响函数标准误”,若仍逆向,再检验目标人群、处理机制与缺失机制。
乙、网络荟萃分析:没有直接试验也能比较,但一致性必须入账Network Meta-analysis and Inconsistency
2008年前后,旧框架把问题压成一句话:“不同试验中的共同对照可以无损充当治疗之间的桥”。但目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“直接与间接效应差/合并标准误”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“直接与间接效应差/合并标准误”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。
理论内容不是“再加一种方法”,而是:多治疗网络可把直接与间接证据合成同一相对效应尺度,但只有在可交换性与一致性成立时,缺边比较才有因果含义。它允许以下决定性反例:固定目标人群、处理机制、缺失机制与基线信息,按“直接与间接效应差/合并标准误”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。
Georgia Salanti等在2008年〈Evaluation of Networks of Randomized Trials〉中的主结果是本条的证据起点。作者系统描述含3种及以上治疗的网络、闭环与不一致来源;网络中每条间接路径都相当于额外比较,精度由共同对照与试验异质性共同决定,而不是简单增加研究数。具体读数“直接与间接效应差/合并标准误”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。
争议边界是:人群、剂量、结局定义与随访不同会破坏传递性;网络越密并不自动越可靠,闭环不一致与小研究效应可让排名看似精确却方向错误。失效条件为:当效应修饰因子在网络各边系统失衡时,间接比较不再可交换。收敛需统一对象与“直接与间接效应差/合并标准误”,并公开识别假设、重叠区间和外部验证及最强反例。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“直接与间接效应差/合并标准误”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:图论称“闭环一致性”,推荐系统称“传递比较”;另见第353号排序偏差。只有“直接与间接效应差/合并标准误”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
丙、局部假发现率:大规模检验要估计“这个结果是假”的概率Local False Discovery Rates
在2007年前后的文献中,默认判断仍是“每个p值都能脱离其他检验单独解释”。它没有处理目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“预期伪发现数/被报告发现总数”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“预期伪发现数/被报告发现总数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。
新命题明确写成:在成千上万次同时检验中,应从总体混合分布估计每个观测的局部假发现率,而不能只按单个p值作二元裁决。这句话可以被反驳,检验方式是:固定目标人群、处理机制、缺失机制与基线信息,按“预期伪发现数/被报告发现总数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。
Bradley Efron等在2007年〈Size, Power and False Discovery Rates〉中的主结果给出主证据:Efron把经验零分布、两组混合模型与局部fdr联系起来,并用微阵列数据说明理论N(0,1)常不能代表实际零分布;同样阈值下,经验零会显著改变候选基因数。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“预期伪发现数/被报告发现总数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。
争议边界是:混合模型的可识别性、弱信号密集时的零分布估计和相关检验仍困难;局部fdr是模型后验量,不等同于频率学意义的条件错误率。失效条件为:当检验统计量的联合依赖未知且经验零无法稳定估计时,局部fdr会对模型选择高度敏感。收敛需统一对象与“预期伪发现数/被报告发现总数”,并公开识别假设、重叠区间和外部验证及最强反例。
实践后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。报告应围绕“预期伪发现数/被报告发现总数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。
跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为贝叶斯称“局部后验错误概率”,质量控制称“不良品占通过件比例”;另见第307号后验校准。碰撞须固定“每个p值都能脱离其他检验单独解释”并比较“预期伪发现数/被报告发现总数”;第三项是目标人群、处理机制与缺失机制。
丁、联合模型:纵向轨迹与生存结局不能分开估Joint Models for Longitudinal and Time-to-Event Data
到2010年前后,常见出发点仍是“纵向测量过程与事件过程在给定基线协变量后可以独立分析”。真正暴露问题的并非一个孤立反例,而是目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“动态预测误差/可用纵向测量次数”为何随条件改变。当研究者改用“动态预测误差/可用纵向测量次数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。
本条命题是:当生物标志物测量误差与失访或死亡相关时,纵向模型和生存模型必须通过共享随机效应或潜在轨迹联合估计。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“动态预测误差/可用纵向测量次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
Dimitris Rizopoulos等在2010年〈JM: An R Package for the Joint Modelling of Longitudinal and Time-to-Event Data〉中的主结果提供了决定性证据。文章把纵向过程与生存过程写成2个子模型,并用1组共享随机效应把它们接入风险函数;个体生存概率可随每次新测量更新,预测使用到当前时点的完整纵向历史而非最后一次观测。这里最有信息量的读数是“动态预测误差/可用纵向测量次数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。
争议边界是:共享随机效应形式、关联函数与缺失机制若错设,联合估计也会偏;复杂模型在稀疏随访、小事件数和非线性轨迹下容易出现计算与可识别问题。失效条件为:当纵向指标与事件时间确实条件独立且测量无信息性缺失时,联合模型的增益很小。收敛需统一对象与“动态预测误差/可用纵向测量次数”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“动态预测误差/可用纵向测量次数”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:工程称“退化—失效联合模型”,时间序列称“状态—终止联合过程”;另见第309号动态预测。共享预设为“纵向测量过程与事件过程在给定基线协变量后可以独立分析”;先统一“动态预测误差/可用纵向测量次数”,若仍逆向,再检验目标人群、处理机制与缺失机制。
戊、稳定选择:高维变量必须用重抽样频率过筛Stability Selection
2010年前后,本领域常把“一次拟合中入选的变量就是可重复的生物标志物”当作默认起点。它在典型对象上看似稳固,却被目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“跨子样本入选次数/全部重抽样次数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“跨子样本入选次数/全部重抽样次数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。
本条命题是:高维选择不应把一次正则化路径上的非零系数当成发现,而应报告变量跨子样本和惩罚强度被选中的稳定概率。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“跨子样本入选次数/全部重抽样次数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
主证据来自Nicolai Meinshausen等在2010年〈Stability Selection〉中的主结果。作者把每次约n/2的子抽样与Lasso等选择器结合,在交换性条件下给出预期假阳性数的有限样本上界;入选阈值π_thr需大于0.5,阈值、平均入选数与错误上界形成可检查关系。其关键不是论文规模,而是给出了“跨子样本入选次数/全部重抽样次数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。
争议边界是:高度相关变量会轮流入选,使真正信号的单个稳定概率下降;交换性与基础选择器性质不满足时,理论错误界不再保守。失效条件为:当信号由成组高度相关变量共同承担且选择器随机挑一个代表时,单变量阈值会漏检。收敛需统一对象与“跨子样本入选次数/全部重抽样次数”,并公开识别假设、重叠区间和外部验证及最强反例。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“跨子样本入选次数/全部重抽样次数”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:机器学习称“选择稳定性”,实验科学称“重复命中率”;另见第307号后验敏感性。只有“跨子样本入选次数/全部重抽样次数”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
己、链式方程多重插补:缺失值不是一次填平Multiple Imputation by Chained Equations
在2011年前后的文献中,标准叙事是“缺失值用一个最可能的数填上后,可以当作真实观测继续分析”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“插补间方差/总估计方差”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“插补间方差/总估计方差”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。
核心主张是:缺失数据应生成多个与不确定性相容的完整数据集,并在分析后按Rubin规则合并,而不是用均值或单次预测把缺失当已知。它不是定义性的正确,而有清楚的否证口:固定目标人群、处理机制、缺失机制与基线信息,按“插补间方差/总估计方差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。
证据链的锚点是Stef van Buuren等在2011年〈mice: Multivariate Imputation by Chained Equations in R〉中的主结果。论文系统化链式条件模型并展示不同变量类型的插补器;进行m次插补后,总方差按W+(1+1/m)B合并组内方差W与组间方差B,缺失比例越高,组间部分越重要。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“插补间方差/总估计方差”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。
争议边界是:链式条件分布未必对应一个相容联合分布;缺失非随机、结构缺失、被动变量关系和插补模型与分析模型不兼容都会制造虚假精度。失效条件为:当缺失机制依赖未观测值且没有敏感性参数或外部信息时,多重插补不能识别结论。收敛需统一对象与“插补间方差/总估计方差”,并公开识别假设、重叠区间和外部验证及最强反例。
实践后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。报告应围绕“插补间方差/总估计方差”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。
跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为贝叶斯称“后验预测补全”,调查统计称“热卡与多重插补”;另见第308号非应答调整。碰撞须固定“缺失值用一个最可能的数填上后,可以当作真实观测继续分析”并比较“插补间方差/总估计方差”;第三项是目标人群、处理机制与缺失机制。
庚、孟德尔随机化的多效性清算MR-Egger Regression
2015年前后,旧框架把问题压成一句话:“遗传变异只通过目标暴露影响结局”。但目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“工具—结局效应斜率/工具—暴露效应斜率”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“工具—结局效应斜率/工具—暴露效应斜率”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。
理论内容不是“再加一种方法”,而是:遗传工具变量即使存在方向性多效性,只要工具强度与直接效应独立,MR-Egger斜率仍可估计因果效应并由截距检测平均多效性。它允许以下决定性反例:固定目标人群、处理机制、缺失机制与基线信息,按“工具—结局效应斜率/工具—暴露效应斜率”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。
Jack Bowden等在2015年〈Mendelian Randomization with Invalid Instruments: Effect Estimation and Bias Detection through Egger Regression〉中的主结果是本条的证据起点。作者把加权Egger回归引入多SNP孟德尔随机化;截距偏离零提示方向性多效性,模拟显示在InSIDE假设成立时斜率较传统IVW偏差小,但标准误更大。具体读数“工具—结局效应斜率/工具—暴露效应斜率”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。
争议边界是:InSIDE不可从数据直接检验,弱工具引起回归稀释,样本重叠与连锁不平衡也会偏;“截距不显著”不等于没有多效性。失效条件为:当工具强度与直接效应相关,或存在强弱工具偏倚时,MR-Egger斜率不再识别因果效应。收敛需统一对象与“工具—结局效应斜率/工具—暴露效应斜率”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“工具—结局效应斜率/工具—暴露效应斜率”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:计量经济学称“无效工具稳健估计”,网络分析称“旁路效应”;另见第308号工具化设计。共享预设为“遗传变异只通过目标暴露影响结局”;先统一“工具—结局效应斜率/工具—暴露效应斜率”,若仍逆向,再检验目标人群、处理机制与缺失机制。
辛、TRIPOD:预测模型必须公开完整生成链TRIPOD Reporting Statement
在2015年前后的文献中,默认判断仍是“模型性能摘要足以代表其开发与验证质量”。它没有处理目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“已报告清单项目数/TRIPOD全部22项”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“已报告清单项目数/TRIPOD全部22项”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。
新命题明确写成:临床预测模型只有报告样本来源、结局、缺失、候选变量、建模、内部验证与性能全链条,外部团队才可能判断偏倚和复现。这句话可以被反驳,检验方式是:固定目标人群、处理机制、缺失机制与基线信息,按“已报告清单项目数/TRIPOD全部22项”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。
Gary Collins等在2015年〈Transparent Reporting of a Multivariable Prediction Model for Individual Prognosis or Diagnosis〉中的主结果给出主证据:TRIPOD形成22项清单,覆盖模型开发与验证;它把“给一个AUC”改成同时报告校准、处理连续变量方式、完整模型和验证设计,并区分开发、更新与外部验证。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“已报告清单项目数/TRIPOD全部22项”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。
反对意见主要针对外延,而非简单否认主结果:清单改善透明度而不自动改善方法质量;高度遵循仍可能基于偏样本、事件数不足或数据泄漏,报告完整与模型可靠是两件事。本条的失效条件为:当原始数据与分析代码不可获得、且关键变量定义无法还原时,清单完整仍不足以复现。要判断边界是否只是技术限制,需把识别假设、重叠区间和外部验证与同一分母下的独立复验放在一起;若方向随对象类或归一化改变,就应主动收窄标题。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“已报告清单项目数/TRIPOD全部22项”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:软件工程称“模型卡”,实验设计称“预注册报告”;另见第360号基准可重放性。只有“已报告清单项目数/TRIPOD全部22项”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
第二幕把研究问题写成目标量,并要求机器学习、真实世界数据和多机构计算围绕该目标接受识别、校准、外推与报告审计。从“目标试验模拟:先写理想随机试验,再映射观察数据”到“TARGET声明:目标试验模拟进入可审计报告时代”,共同动作是接受规模、复制、边界与部署检验;主证据落在2016—2026年。
一、目标试验模拟:先写理想随机试验,再映射观察数据Target Trial Emulation
2016年前后,旧默认是“只要回归中加入足够协变量,观察数据即可直接回答治疗效果”,但目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“成功映射的协议要素数/目标试验全部要素数”为何随条件改变。以“成功映射的协议要素数/目标试验全部要素数”重新计量后,原先混在一起的边界和代价必须分别说明。
本条命题是:观察性因果研究应先明确资格、治疗策略、分配、随访、结局、因果对比与分析计划,再判断数据能否模拟该试验。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“成功映射的协议要素数/目标试验全部要素数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
Miguel Hernán等在2016年〈Using Big Data to Emulate a Target Trial When a Randomized Trial Is Not Available〉中的主结果提供了决定性证据。作者用激素治疗与冠心病争议说明,目标试验至少要先写清资格、治疗策略、分配、随访、结局、因果对比和分析计划7个协议要素;若随访起点、治疗起点和资格窗口不对齐,会制造永生时间与选择偏倚。这里最有信息量的读数是“成功映射的协议要素数/目标试验全部要素数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。
争议边界是:模拟不能创造未测混杂,也不能修复缺失的治疗策略或时间戳;“像试验”是一套设计纪律,不是让观察数据自动获得随机化地位。失效条件为:当关键混杂不可测、治疗策略不可定义或时间零点无法对齐时,目标试验仍不可识别。收敛需统一对象与“成功映射的协议要素数/目标试验全部要素数”,并公开识别假设、重叠区间和外部验证及最强反例。
实践后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。报告应围绕“成功映射的协议要素数/目标试验全部要素数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。
跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为系统工程称“先写需求再实现”,软件测试称“参考规范”;另见第308号随机化设计。碰撞须固定“只要回归中加入足够协变量,观察数据即可直接回答治疗效果”并比较“成功映射的协议要素数/目标试验全部要素数”;第三项是目标人群、处理机制与缺失机制。
二、Model-X击落:控制假发现而不要求知道结局模型Model-X Knockoffs
2018年前后,本领域常把“要控制高维变量选择错误,必须正确指定结局回归模型”当作默认起点。它在典型对象上看似稳固,却被目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“错误入选变量数/全部入选变量数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“错误入选变量数/全部入选变量数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。
本条命题是:若能刻画协变量联合分布,可构造与原变量可交换的假变量,在结局模型任意复杂时仍控制变量选择的假发现率。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“错误入选变量数/全部入选变量数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
主证据来自Emmanuel Candès等在2018年〈Panning for Gold: Model-X Knockoffs for High-Dimensional Controlled Variable Selection〉中的主结果。论文为每个原变量构造1个满足交换性与条件独立的knockoff副本,用原变量与副本的重要性差作选择统计量;理论在有限样本控制FDR,模拟和基因组应用显示比固定设计版本适用更广。其关键不是论文规模,而是给出了“错误入选变量数/全部入选变量数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。
争议边界是:协变量分布错设会破坏交换性;高维强依赖下生成高质量副本困难,选择到的是条件关联而不自动是因果变量。失效条件为:当协变量联合分布无法可靠学习或副本与原变量过度相关时,功效和FDR保证都会退化。收敛需统一对象与“错误入选变量数/全部入选变量数”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“错误入选变量数/全部入选变量数”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:实验科学称“负对照特征”,安全检测称“诱饵变量”;另见第307号后验预测检查。共享预设为“要控制高维变量选择错误,必须正确指定结局回归模型”;先统一“错误入选变量数/全部入选变量数”,若仍逆向,再检验目标人群、处理机制与缺失机制。
三、因果森林:异质效应必须样本外诚实估计Causal Forests
在2018年前后的文献中,标准叙事是“平均处理效应足以代表临床人群的全部决策价值”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“样本外处理效应误差/亚组有效样本量”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“样本外处理效应误差/亚组有效样本量”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。
本条命题是:森林可通过诚实分样与局部加权估计条件平均处理效应,并为个体异质性给出渐近正态推断,而非只做黑箱分组。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“样本外处理效应误差/亚组有效样本量”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
证据链的锚点是Stefan Wager等在2018年〈Estimation and Inference of Heterogeneous Treatment Effects Using Random Forests〉中的主结果。方法在每棵树内使用2个互不重叠的子样本:1个决定分裂,另1个估计叶内效应,从而减少适应性偏差;在正则条件下给出点估计渐近正态与方差估计,模拟显示能恢复非线性异质性。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“样本外处理效应误差/亚组有效样本量”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。
争议边界是:条件效应不是个体确定效应;重叠差、稀有亚组和大量探索会让异质性不稳定,未经外部验证的叶子解释容易变成事后故事。失效条件为:当协变量重叠不足或真实异质性小于估计噪声时,个体化分层不可靠。收敛需统一对象与“样本外处理效应误差/亚组有效样本量”,并公开识别假设、重叠区间和外部验证及最强反例。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“样本外处理效应误差/亚组有效样本量”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:机器学习称“条件效应学习”,医学称“治疗效应异质性”;另见第307号层级收缩。只有“样本外处理效应误差/亚组有效样本量”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
四、双重机器学习:预测器要交叉拟合才配进入因果推断Double/Debiased Machine Learning
2018年前后,旧框架把问题压成一句话:“只要机器学习预测足够准,把拟合值直接代入回归就能得到有效因果区间”。但目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“主参数偏差/nuisance误差乘积”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“主参数偏差/nuisance误差乘积”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。
理论内容不是“再加一种方法”,而是:高维或非参数 nuisance 学习器必须通过正交得分和样本分割消除一阶过拟合偏差,才能对低维因果参数作根n推断。它允许以下决定性反例:固定目标人群、处理机制、缺失机制与基线信息,按“主参数偏差/nuisance误差乘积”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。
Victor Chernozhukov等在2018年〈Double/Debiased Machine Learning for Treatment and Structural Parameters〉中的主结果是本条的证据起点。论文定义Neyman正交矩条件并进行K折交叉拟合(K≥2);2类nuisance误差只以乘积进入主参数余项,使许多机器学习器在较弱收敛率下仍可获得n^{-1/2}阶渐近正态区间。具体读数“主参数偏差/nuisance误差乘积”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。
争议边界是:正交性针对指定参数与识别模型,不能修复未测混杂;小样本折间不稳定、弱重叠和超参数搜索穿越折界会破坏理论。失效条件为:当正交得分写错、交叉拟合被数据泄漏破坏或nuisance误差乘积不收敛时不成立。收敛需统一对象与“主参数偏差/nuisance误差乘积”,并公开识别假设、重叠区间和外部验证及最强反例。
实践后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。报告应围绕“主参数偏差/nuisance误差乘积”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。
跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为数值分析称“误差正交化”,软件测试称“训练—验证隔离”;另见第360号基准泄漏。碰撞须固定“只要机器学习预测足够准,把拟合值直接代入回归就能得到有效因果区间”并比较“主参数偏差/nuisance误差乘积”;第三项是目标人群、处理机制与缺失机制。
五、Estimand框架:临床问题先于缺失数据处理ICH E9(R1) Estimands
在2019年前后的文献中,默认判断仍是“试验主要问题由主要终点和一个分析模型就能完整表达”。它没有处理目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“被明确规定的estimand属性数/五个必要属性”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“被明确规定的estimand属性数/五个必要属性”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。
新命题明确写成:试验分析必须先用治疗、目标人群、结局变量、并发事件策略和总体汇总五个属性定义estimand,再选择估计器与缺失处理。这句话可以被反驳,检验方式是:固定目标人群、处理机制、缺失机制与基线信息,按“被明确规定的estimand属性数/五个必要属性”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。
International Council for Harmonisation等在2019年〈Addendum on Estimands and Sensitivity Analysis in Clinical Trials〉中的主结果给出主证据:指南把estimand写成治疗、目标人群、结局变量、并发事件策略和总体汇总5个属性;停药、救援治疗、死亡等不再只是“缺失值麻烦”,而成为问题定义的一部分。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“被明确规定的estimand属性数/五个必要属性”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。
争议边界是:同一试验可支持多个estimand,选择具有临床与监管判断;定义清楚不保证可识别,主层等策略常依赖强假设。失效条件为:当策略依赖不可观测反事实亚组且无识别假设时,estimand虽定义明确仍无法估计。收敛需统一对象与“被明确规定的estimand属性数/五个必要属性”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“被明确规定的estimand属性数/五个必要属性”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:决策理论称“目标量”,工程称“验收指标”;另见第308号设计目标。共享预设为“试验主要问题由主要终点和一个分析模型就能完整表达”;先统一“被明确规定的estimand属性数/五个必要属性”,若仍逆向,再检验目标人群、处理机制与缺失机制。
六、试验外推:入组者不再自动代表目标人群Generalizing Trial Results
到2019年前后,常见出发点仍是“随机试验的平均效应天然适用于所有符合资格的患者”。真正暴露问题的并非一个孤立反例,而是目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“目标人群有效样本量/原始试验样本量”为何随条件改变。当研究者改用“目标人群有效样本量/原始试验样本量”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。
本条把转向压成一句可检验的话:嵌套于目标队列的随机试验可用入组概率权重或结果模型把处理效应推广到全部符合资格者,但需样本选择可交换与正值性。可反驳版本为:固定目标人群、处理机制、缺失机制与基线信息,按“目标人群有效样本量/原始试验样本量”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。
Issa Dahabreh等在2019年〈Generalizing Causal Inferences from Individuals in Randomized Trials to All Trial-Eligible Individuals〉中的主结果提供了决定性证据。作者把1个随机试验样本与1个目标总体样本联合起来,给出识别公式、估计器与模拟,并在冠心病治疗例中使用队列基线协变量;试验内随机化只保证内部效度,外推还要建模谁进入试验。这里最有信息量的读数是“目标人群有效样本量/原始试验样本量”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。
争议边界是:未测选择因子、极端参与概率与目标人群定义漂移会使外推失效;扩大权重并不会自动增加真实信息。失效条件为:当决定入组的效应修饰因素未记录或目标人群不满足参与正值性时不成立。收敛需统一对象与“目标人群有效样本量/原始试验样本量”,并公开识别假设、重叠区间和外部验证及最强反例。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“目标人群有效样本量/原始试验样本量”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:调查统计称“覆盖与校准加权”,机器学习称“域适应”;另见第308号非概率样本。只有“目标人群有效样本量/原始试验样本量”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
七、PROBAST:预测模型偏倚必须按四个域审计PROBAST Risk-of-Bias Tool
2019年前后,本领域常把“模型发表在高水平期刊或通过外部验证就足以证明低偏倚”当作默认起点。它在典型对象上看似稳固,却被目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“低风险信号问题数/全部20个信号问题”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“低风险信号问题数/全部20个信号问题”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。
可以把命题写为:预测模型研究的可靠性需分别审查参与者、预测变量、结局与分析四域,并把适用性与偏倚风险分开。与口号不同,它预先承诺了失败方式:固定目标人群、处理机制、缺失机制与基线信息,按“低风险信号问题数/全部20个信号问题”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。
主证据来自Robert Wolff等在2019年〈PROBAST: A Tool to Assess the Risk of Bias and Applicability of Prediction Model Studies〉中的主结果。PROBAST以20个信号问题组织评估;很多论文在分析域因事件数不足、过度拟合、缺失处理与性能评估不当被判高风险,即便标题声称外部验证。其关键不是论文规模,而是给出了“低风险信号问题数/全部20个信号问题”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。
争议边界是:工具依赖评审者判断与完整报告;域级“低风险”不等于临床净获益,算法更新与数据漂移也超出原版本范围。失效条件为:当报告信息严重缺失时,工具只能判“不清楚”而不能恢复研究质量。收敛需统一对象与“低风险信号问题数/全部20个信号问题”,并公开识别假设、重叠区间和外部验证及最强反例。
实践后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。报告应围绕“低风险信号问题数/全部20个信号问题”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。
跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为软件安全称“威胁建模”,审计称“控制域检查”;另见第354号软件供应链审计。碰撞须固定“模型发表在高水平期刊或通过外部验证就足以证明低偏倚”并比较“低风险信号问题数/全部20个信号问题”;第三项是目标人群、处理机制与缺失机制。
八、预测模型样本量不再用“每变量十事件”Sample Size for Prediction Models
在2019年前后的文献中,标准叙事是“每个候选预测变量拥有十个事件即可普遍防止过拟合”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“有效事件数/候选参数自由度”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“有效事件数/候选参数自由度”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。
核心主张是:预测模型开发样本量应同时控制总体过拟合、R²收缩、结局率估计精度与参数数目,而不是沿用每变量十事件的口号。它不是定义性的正确,而有清楚的否证口:固定目标人群、处理机制、缺失机制与基线信息,按“有效事件数/候选参数自由度”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。
证据链的锚点是Richard Riley等在2019年〈Calculating the Sample Size Required for Developing a Clinical Prediction Model〉中的主结果。作者给出基于预期R²、参数数、结局比例与目标收缩因子的计算框架;对二分类与时间结局,所需样本可显著高于EPV=10,也可能在强信号下更低。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“有效事件数/候选参数自由度”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。
争议边界是:预期R²常未知且从乐观先验取得;机器学习的有效自由度、复杂非线性与数据驱动变量筛选仍难用单一参数数表示。失效条件为:当参数自由度被严重低估或验证数据与开发数据分布不同,样本量公式不能保证校准。收敛需统一对象与“有效事件数/候选参数自由度”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“有效事件数/候选参数自由度”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:机器学习称“样本复杂度”,实验设计称“信息量预算”;另见第308号设计效应。共享预设为“每个候选预测变量拥有十个事件即可普遍防止过拟合”;先统一“有效事件数/候选参数自由度”,若仍逆向,再检验目标人群、处理机制与缺失机制。
九、校准是预测模型的阿喀琉斯之踵Calibration: The Achilles Heel
2019年前后,旧框架把问题压成一句话:“AUC高意味着模型给出的绝对风险也可信”。但目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“预测概率与观察发生率之差/风险区间宽度”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“预测概率与观察发生率之差/风险区间宽度”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。
理论内容不是“再加一种方法”,而是:区分度高的模型仍可能系统高估或低估风险,临床预测至少要报告校准截距、斜率与曲线,而不能只报AUC。它允许以下决定性反例:固定目标人群、处理机制、缺失机制与基线信息,按“预测概率与观察发生率之差/风险区间宽度”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。
Ben Van Calster等在2019年〈Calibration: The Achilles Heel of Predictive Analytics〉中的主结果是本条的证据起点。作者用模拟与实例展示,相同AUC可对应完全不同的风险刻度;理想校准截距为0、斜率为1,截距偏离反映整体风险偏移,斜率小于1常提示过拟合,曲线揭示局部失配。具体读数“预测概率与观察发生率之差/风险区间宽度”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。
争议边界是:校准依赖目标人群、时间与结局率,部署后会漂移;小样本校准曲线不稳定,重新校准也可能掩盖排序模型的结构错误。失效条件为:当用途只需要固定容量下的排序且不使用概率阈值时,绝对校准的重要性会下降。收敛需统一对象与“预测概率与观察发生率之差/风险区间宽度”,并公开识别假设、重叠区间和外部验证及最强反例。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“预测概率与观察发生率之差/风险区间宽度”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:气象学称“可靠度”,机器学习称“概率校准”;另见第309号概率预测。只有“预测概率与观察发生率之差/风险区间宽度”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
十、联邦学习:医疗数据可以不汇总,但偏倚不会因此消失Federated Learning in Medicine
在2020年前后的文献中,默认判断仍是“多中心建模必须把原始患者数据集中到同一服务器”。它没有处理目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“跨机构性能增益/交换的模型更新字节数”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“跨机构性能增益/交换的模型更新字节数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。
本条命题是:多机构可只交换模型更新而不集中患者级数据,获得接近集中训练的影像模型,但隐私、异质性与治理需单独评估。否证方式为:固定目标人群、处理机制、缺失机制与基线信息,按“跨机构性能增益/交换的模型更新字节数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。
Micah Sheller等在2020年〈Federated Learning in Medicine: Facilitating Multi-Institutional Collaborations without Sharing Patient Data〉中的主结果给出主证据:研究在多机构脑肿瘤分割数据上比较集中、联邦与单机构3种训练方式;联邦模型性能接近集中方案并普遍优于单机构模型,说明样本多样性可以通过参数聚合共享。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“跨机构性能增益/交换的模型更新字节数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。
争议边界是:梯度可泄漏信息,机构分布不均、标签标准不同与通信故障会偏向大站点;不共享数据不等于满足差分隐私或法规要求。失效条件为:当站点分布极端异质、聚合权重不当或攻击者可观察细粒度更新时不成立。收敛需统一对象与“跨机构性能增益/交换的模型更新字节数”,并公开识别假设、重叠区间和外部验证及最强反例。
实践后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。报告应围绕“跨机构性能增益/交换的模型更新字节数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。
跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为分布式系统称“联邦优化”,治理称“数据不出域”;另见第351号分布式科学计算。碰撞须固定“多中心建模必须把原始患者数据集中到同一服务器”并比较“跨机构性能增益/交换的模型更新字节数”;第三项是目标人群、处理机制与缺失机制。
十一、真实世界证据的estimand:数据来源不能替代问题定义Estimands in Real-World Evidence
到2023年前后,常见出发点仍是“数据库里能提取到的变量自然定义了研究问题”。真正暴露问题的并非一个孤立反例,而是目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“可从数据库映射的estimand属性数/五个目标属性”为何随条件改变。当研究者改用“可从数据库映射的estimand属性数/五个目标属性”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。
本条把转向压成一句可检验的话:真实世界研究也应显式定义目标人群、治疗策略、并发事件与时间窗,否则数据库规模只会放大含混问题。可反驳版本为:固定目标人群、处理机制、缺失机制与基线信息,按“可从数据库映射的estimand属性数/五个目标属性”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。
Yingchun Chen等在2023年〈Estimands in Real-World Evidence Studies〉中的主结果提供了决定性证据。作者把ICH estimand的5个属性映射到电子病历和理赔数据,展示治疗换线、依从性、死亡与数据截断如何改变所估对比;同一数据库可对应多个不同政策问题。这里最有信息量的读数是“可从数据库映射的estimand属性数/五个目标属性”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。
争议边界是:真实世界数据常缺少随机分配、精准时间戳与完整结局;estimand框架只澄清目标,仍需混杂控制、测量误差和敏感性分析。失效条件为:当关键治疗策略与并发事件无法在数据中区分时,estimand无法被忠实映射。收敛需统一对象与“可从数据库映射的estimand属性数/五个目标属性”,并公开识别假设、重叠区间和外部验证及最强反例。
由此,对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。对本项证据须公开“可从数据库映射的estimand属性数/五个目标属性”、失败对象和资源成本;只报最优结果不足以支持迁移。
接口:本条可与碰撞行登记的相邻学科直接比较。异名:数据工程称“语义契约”,调查统计称“目标总体定义”;另见第308号总体框架。共享预设为“数据库里能提取到的变量自然定义了研究问题”;先统一“可从数据库映射的estimand属性数/五个目标属性”,若仍逆向,再检验目标人群、处理机制与缺失机制。
十二、TARGET声明:目标试验模拟进入可审计报告时代TARGET Reporting Statement
2025年前后,本领域常把“只要分析方法先进,观察性试验模拟的设计细节可以省略”当作默认起点。它在典型对象上看似稳固,却被目标人群、处理机制、缺失过程与预测模型会把同一批医学记录推向不同结论;旧口径尤其无法解释“完整报告项目数/TARGET全部21项”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“完整报告项目数/TARGET全部21项”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。
可以把命题写为:声称模拟目标试验的观察研究必须逐项报告协议、数据映射、识别假设、estimand、精度与敏感性,而不能只在标题中使用“target trial”。与口号不同,它预先承诺了失败方式:固定目标人群、处理机制、缺失机制与基线信息,按“完整报告项目数/TARGET全部21项”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。
主证据来自Aidan Cashin等在2025年〈Transparent Reporting of Observational Studies Emulating a Target Trial—The TARGET Statement〉中的主结果。国际共识形成21项清单,分布于摘要、引言、方法、结果、讨论与其他信息六部分;核心要求包括写出假想试验协议、说明每个元素如何映射到观察数据并报告设计选择敏感性。其关键不是论文规模,而是给出了“完整报告项目数/TARGET全部21项”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。
争议边界是:TARGET是报告规范而非偏倚消除器;即使21项齐全,未测混杂、错误时间零点或不合理策略仍可导致错误结论。失效条件为:当研究并未显式模拟平行组个体随机目标试验,或问题属于其他设计时,清单不能机械套用。收敛需统一对象与“完整报告项目数/TARGET全部21项”,并公开识别假设、重叠区间和外部验证及最强反例。
另一处后果是:对本条的评价不能停在一次最终平均值;分析计划应先写目标量、目标人群、处理与缺失机制,再报告偏差、标准误、重叠和敏感性分析,不能让预测器替代识别。最低报告责任包括“完整报告项目数/TARGET全部21项”、最坏对象与成本账本,负结果属于理论边界而非附注。
接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:软件工程称“可追溯需求矩阵”,审计称“证据链”;另见第360号基准报告。只有“完整报告项目数/TARGET全部21项”可换算时才属同一动作;冲突仍在时应测量目标人群、处理机制与缺失机制。
◎ 二十年连起来看
第一条贯穿线是:分析从“选模型”转向“先定义目标量”。TMLE、目标试验与estimand都要求先说明要估什么,再决定如何拟合。机器学习可以进入nuisance环节,却不能替代因果问题、时间零点与目标人群。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。
第二条贯穿线是:分母从记录数换成有效信息量。稳定选择、外推权重、预测样本量与联合模型都说明,一万条相关记录可能只提供很少独立信息;有效事件、重叠、校准与选择概率才是可比较分母。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。
第三条贯穿线是:透明度本身成为统计对象。TRIPOD、PROBAST与TARGET把报告项目写成可计数清单,但也揭示一个边界:报告完整不等于设计正确,清单只能让错误被看见,不能替代识别。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。
◎ 三个常见误解
误解一:双重稳健意味着两个模型随便错一个都没关系。它只保证在指定识别条件下,结果模型或处理模型至少一个正确时的一致性;两者同时错、正值性破坏或过拟合泄漏都会失效。之所以容易误读,是“双重”听起来像两个独立保险,而理论实际依赖同一数据生成机制。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。
误解二:随机试验一旦完成,结果就天然可推广。随机化只保护试验参与者内部的处理比较;谁进入试验、目标人群与参与者是否重叠,需要额外建模。容易误读,是因为“最高等级证据”常把内部效度与外部效度合并成一个标签。最容易误读之处,应由反例、边界或样本外结果直接揭示。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。
误解三:AUC高或交叉验证好就代表临床模型可靠。区分度、校准、偏倚风险和决策净获益是不同问题;部署时的结局率漂移还会破坏绝对风险。容易误读,是因为单一分数便于排名,却掩盖了概率是否可信。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。
◎ 与相邻领域的接口
与第307号贝叶斯统计与计算的分工是:本块把目标参数、设计与频率学误差作为主线,第307号把先验、后验近似与计算校准作为主线;TMLE的影响函数与贝叶斯后验检查在“算法误差是否进入结论”处相接。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。
与第308号实验设计与抽样调查的分工是:本块多从既有临床与观察数据追问可识别性,第308号优先在采集前通过随机化、抽样概率和响应设计制造可识别性;试验外推正好横跨两块。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。
与第310号空间统计的接口在空间流行病学与多中心数据:医院、社区与环境暴露存在空间依赖,原始记录数不能当独立样本数;本块负责因果与临床目标,第310号负责空间支持和协方差。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。
与第354号软件安全与隐私工程的接口在联邦学习和敏感数据治理:本块问估计是否偏、是否可推广,安全工程问更新是否泄漏、供应链和访问控制是否可信。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。
◎ 争议现场
第一场争论是因果机器学习的“灵活性”究竟增加还是减少可信度。支持者强调正交得分与交叉拟合允许复杂nuisance;批评者指出超参数、弱重叠与未测混杂仍被包装在黑箱里。要收敛,需要预注册目标量、公开折分和在已知真值的半合成基准上同时报告覆盖率、偏差与重叠。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。
第二场争论是个体化治疗效应是否已可用于临床决策。因果森林能估条件平均效应,但亚组稀疏、选择性报告和分布漂移会夸大异质性。要收敛,需要外部站点的样本外校准、明确决策阈值,并比较加入异质效应后相对简单规则的净获益。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。
第三场争论是报告清单会不会演变成形式合规。TRIPOD、PROBAST与TARGET提高可见性,却可能被当作勾选任务。要收敛,需要把清单遵循与可复现率、外部校准和结论改变率联系起来,而不是只统计项目完成百分比。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。
◎ 往下五年看什么
观察点一是TARGET发布后,目标试验模拟论文中完整给出21项的比例、时间零点错误率与敏感性分析比例;这三个读数能判断新规范是否改变实践而非只改变标题。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。
观察点二是异质处理效应模型在独立医院中的校准斜率、策略价值增益与亚组稳定率,而不是模型发现了多少“高反应者”。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。
观察点三是联邦学习相对集中训练的性能比、跨机构最差站点误差与每轮隐私预算;只有三项同时报告,才能判断隐私与公平代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。
观察点四是临床预测论文中同时报告校准曲线、决策曲线、完整模型和外部验证的比例,以及这些模型两年后性能漂移幅度。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。
◎ 可与哪些领域对撞
本块第一条“TMLE”可与第360号系统性能中的“针对服务级目标优化”对撞。两边共享预设:整体平均损失不等于真正关心的目标量;相反点在于统计学用影响函数校正估计偏差,系统工程用调度与资源控制约束尾部。若两边都成立,就必须引入第三项——目标函数的责任归属:谁决定被优化的那一个分母。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。
本块第十条“Model-X击落”可与第354号软件安全中的“蜜罐与诱饵”对撞。共享预设是:一个假对象只有与真对象在可见结构上可交换,才可测出选择机制;相反点是统计学希望副本不影响结局,安全工程希望诱饵能改变攻击者行为。若两边都成立,第三项就是观察者反应性。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。
本块第十四条“estimand”可与第303号复几何的“稳定性判据”对撞。共享预设是:存在性判断必须先指定允许的退化路径;相反点是临床试验把并发事件纳入问题定义,复几何把测试构形当外部挑战。若两边都成立,就必须承认目标对象由它能承受的扰动共同定义。第三项必须能产生新的可证伪读数,不能只是折中措辞。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。
本块第十八条“联邦学习”可与第308号调查统计的“非概率样本整合”对撞。共享预设是数据可以留在原处而贡献总体估计;相反点是联邦学习聚合参数,调查整合聚合加权证据。若两边都成立,第三项是站点权重如何由信息量而非规模决定。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。
◎ 十条可做的研究命题
1. 命题:在重叠充足的临床队列中,交叉拟合TMLE的95%区间覆盖率高于同一学习器直接插件估计;用半合成已知真值数据比较;若覆盖率无差且区间同宽,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。
2. 命题:网络荟萃分析中效应修饰因子失衡比网络密度更能预测不一致;收集公开网络并编码协变量分布;若密度在样本外预测中始终优于失衡指标,则命题被证伪。另做跨样本复现和至少一种敏感性分析。
3. 命题:高维生物标志物研究中,稳定选择的独立队列复现率高于单次Lasso;在同一数据上预注册两条流程;若复现率不高且发现数更少,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。
4. 命题:目标试验协议在分析前公开能降低时间零点错误;随机抽取同主题观察研究比较预注册与未预注册组;若错误率相同,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。
5. 命题:因果森林带来的决策净获益主要集中在重叠良好的亚组;按倾向分数重叠分层外部验证;若低重叠组同样稳定获益,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。
6. 命题:PROBAST分析域高风险比期刊影响因子更能预测外部校准失败;建立模型—外部验证配对库;若影响因子预测更强,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。
7. 命题:预测模型所需样本量按有效自由度计算,比EPV=10更能预测校准斜率;在多数据库重做开发;若两种规则误差相同,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。
8. 命题:联邦模型最差站点性能与机构数据异质性正相关而与总站点数无关;控制样本量做联邦模拟;若站点数解释更多,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。
9. 命题:TARGET完整遵循与观察试验模拟的结论稳定性正相关;对设计选择做多宇宙重分析;若遵循度不能预测结论改变率,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。
10. 命题:同时报告校准与决策曲线会减少不适合部署的高AUC模型被推荐;随机化摘要展示信息;若推荐率不变,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。
◎ 资料核验
- Mark van der Laan与Daniel Rubin,2006年《The International Journal of Biostatistics》2(1):Article 11,DOI:10.2202/1557-4679.1043,〈Targeted Maximum Likelihood Learning〉
- Georgia Salanti、Julian P. T. Higgins、A. E. Ades与John P. A. Ioannidis,2008年《Statistical Methods in Medical Research》17(3):279–301,DOI:10.1177/0962280207080643,〈Evaluation of Networks of Randomized Trials〉
- Bradley Efron,2007年《The Annals of Statistics》35(4):1351–1377,DOI:10.1214/009053606000001460,〈Size, Power and False Discovery Rates〉
- Dimitris Rizopoulos,2010年《Journal of Statistical Software》35(9):1–33,DOI:10.18637/jss.v035.i09,〈JM: An R Package for the Joint Modelling of Longitudinal and Time-to-Event Data〉
- Nicolai Meinshausen与Peter Bühlmann,2010年《Journal of the Royal Statistical Society: Series B》72(4):417–473,DOI:10.1111/j.1467-9868.2010.00740.x,〈Stability Selection〉
- Stef van Buuren与Karin Groothuis-Oudshoorn,2011年《Journal of Statistical Software》45(3):1–67,DOI:10.18637/jss.v045.i03,〈mice: Multivariate Imputation by Chained Equations in R〉
- Jack Bowden、George Davey Smith与Stephen Burgess,2015年《International Journal of Epidemiology》44(2):512–525,DOI:10.1093/ije/dyv080,〈Mendelian Randomization with Invalid Instruments: Effect Estimation and Bias Detection through Egger Regression〉
- Gary Collins、Johannes Reitsma、Douglas Altman与Karel Moons,2015年《Annals of Internal Medicine》162(1):55–63,DOI:10.7326/M14-0697,〈Transparent Reporting of a Multivariable Prediction Model for Individual Prognosis or Diagnosis〉
- Miguel Hernán与James Robins,2016年《American Journal of Epidemiology》183(8):758–764,DOI:10.1093/aje/kwv254,〈Using Big Data to Emulate a Target Trial When a Randomized Trial Is Not Available〉
- Emmanuel Candès、Yingying Fan、Lucas Janson与Jinchi Lv,2018年《The Annals of Statistics》46(5):2051–2091,DOI:10.1214/18-AOS1686,〈Panning for Gold: Model-X Knockoffs for High-Dimensional Controlled Variable Selection〉
- Stefan Wager与Susan Athey,2018年《Journal of the American Statistical Association》113(523):1228–1242,DOI:10.1080/01621459.2017.1319839,〈Estimation and Inference of Heterogeneous Treatment Effects Using Random Forests〉
- Victor Chernozhukov、Denis Chetverikov、Mert Demirer等,2018年《The Econometrics Journal》21(1):C1–C68,DOI:10.1111/ectj.12097,〈Double/Debiased Machine Learning for Treatment and Structural Parameters〉
- International Council for Harmonisation,2019年《ICH Harmonised Guideline》E9(R1):1–32(指南),〈Addendum on Estimands and Sensitivity Analysis in Clinical Trials〉
- Issa Dahabreh、Sarah Robertson、Eric Tchetgen Tchetgen、Elizabeth Stuart与Miguel Hernán,2019年《Biometrics》75(2):685–694,DOI:10.1111/biom.13009,〈Generalizing Causal Inferences from Individuals in Randomized Trials to All Trial-Eligible Individuals〉
- Robert Wolff、Karel Moons、Richard Riley等,2019年《Annals of Internal Medicine》170(1):51–58,DOI:10.7326/M18-1376,〈PROBAST: A Tool to Assess the Risk of Bias and Applicability of Prediction Model Studies〉
- Richard Riley、Joie Ensor、Karel Snell等,2019年《Statistics in Medicine》38(7):1262–1275,DOI:10.1002/sim.7992,〈Calculating the Sample Size Required for Developing a Clinical Prediction Model〉
- Ben Van Calster、David McLernon、Maarten van Smeden等,2019年《BMC Medicine》17:Article 230,DOI:10.1186/s12916-019-1466-7,〈Calibration: The Achilles Heel of Predictive Analytics〉
- Micah Sheller、Brandon Edwards、G. Anthony Reina等,2020年《Scientific Reports》10:Article 12598,DOI:10.1038/s41598-020-69250-1,〈Federated Learning in Medicine: Facilitating Multi-Institutional Collaborations without Sharing Patient Data〉
- Yingchun Chen、Jianxiong Chu与Kert Viele,2023年《Statistics in Biopharmaceutical Research》15(4):765–776,〈Estimands in Real-World Evidence Studies〉
- Aidan G. Cashin、Harrison J. Hansford、Miguel A. Hernán等,2025年《JAMA》334(12):1084–1093,DOI:10.1001/jama.2025.13350,〈Transparent Reporting of Observational Studies Emulating a Target Trial—The TARGET Statement〉