基因组学
基因组学的转向并不只是测序价格下降。过去二十年,参考对象从一条线性基因组变为人群变异、结构变异和多路径图,统计对象从常见位点相关变为稀有变异、功能扰动和临床决策;同时,样本祖源、参考偏倚、同意范围和可再识别性进入结果本身。下面二十条不把“读到序列”与“解释功能”混为一谈,也不把人群平均风险直接翻译成个体命运。 页尾的经典层继续追问:这些新读数所改写的老前提,当年由谁、用什么材料立起来。
第一幕建立规模化读写与人群坐标。二代测序把成本打下,HapMap和千人基因组把常见变异与单倍型系统编目,GWAS让疾病关联爆发;缺失遗传力和ENCODE争论随即指出,统计关联、分子活性和生物功能不是一件事。癌症基因组与外显子诊断则把测序送入疾病分型。
甲、大规模并行测序把基因组从项目变成常规数据流Massively Parallel Sequencing Turns Genomes into Routine Data Streams
换批次重做时,Margulies等在2005年的工作把困难落到测序覆盖度可识别的对象上;本条改写的是「测序变成可扩展读数,但可读、可比对与可解释仍是三道不同门」,而不是把大规模并行测序把基因组从项目变成常规数据流当作又一次性能刷新。将校准曲线整体重做时,大规模并行测序把基因组从项目变成常规数据流离开测序覆盖度对象定义后,平均改进可能只来自分母重选。
把样品规模放大后,本条锁定并行反应数与每轮碱基识别:保持祖源分层与样本边界不变,只改变这一环节,大规模并行测序有效对象数/样本外复现登记总数才应沿预测方向移动。让第二个实验室独立执行时,2009年复核若不能在祖源分层保留「测序变成可扩展读数,但可读、可比对与可解释仍是三道不同门」的方向,它就只是原样本内的相关。
短读平台在一次运行产生数十亿碱基,并以约30×覆盖成为人类基因组常规线。把观察窗延长时,须按测序覆盖度口径把Margulies等在2005年的提出证据与Bentley等在2008年的后续结果放进大规模并行测序分母。更换原料或样本批号后,测序覆盖度核对对象是否同一,样本外复现核对失败样本有没有被删去;二者分开,大规模并行测序有效对象数/样本外复现登记总数才不由筛选规则制造。
缩小到单个对象时,原始研究已露出边界:高覆盖人类基因组的可调用比例没有覆盖着丝粒、大片段重复与复杂结构变异。争议不在于大规模并行测序把基因组从项目变成常规数据流是否发生,而在于换批次或换尺度后,祖源分层改变且主效应方向不再保留。
把失败样本补回分母后,实际流程并列保存测序覆盖度、祖源分层与样本外复现,分别标记对象、过程和退出原因。按预注册方案重跑时,工程验收以样本外复现为入口采用大规模并行测序有效对象数/样本外复现登记总数,单次图像和展示性个案都不能代替大规模并行测序分母。
移出原先环境后,本条与第 031 号《免疫学》第六条「百日疫苗:从病原序列到大规模接种」形成可查接口:邻块用「百日疫苗:从病原序列到大规模接种」核对免疫学对象,本块只核对测序覆盖度下的大规模并行测序有效对象数/样本外复现登记总数。改变操作者而锁定流程时,两边共享〔01 谁进入分母〕,却不能互相代替;大规模并行测序还须接受祖源分层的独立复测。在盲法复核中,反例仍由本家给出——高覆盖人类基因组的可调用比例没有覆盖着丝粒、大片段重复与复杂结构变异;删掉这项限制,只会得到同名类比。
乙、HapMap把常见变异组织成连锁单倍型HapMap Organizes Common Variants into Linkage Haplotypes
改用另一台装置后,InternationalHap在2007年的工作把困难落到参考坐标可识别的对象上;本条改写的是「单倍型压缩是群体条件化工具,不是普适人类基因组坐标」,而不是把HapMap把常见变异组织成连锁单倍型当作又一次性能刷新。把样品规模放大后,若归档仍只留下冠军样品,测序覆盖度未接纳的未通过测序覆盖度、在家系共分离退出或未进入HapMap统计的对象就会从因果账本中消失。
让第二个实验室独立执行时,本条锁定群体历史形成的位点相关结构:保持家系共分离与样本边界不变,只改变这一环节,HapMap有效对象数/测序覆盖度登记总数才应沿预测方向移动。更换原料或样本批号后,2009年复核若不能在家系共分离保留「单倍型压缩是群体条件化工具,不是普适人类基因组坐标」的方向,它就只是原样本内的相关。
国际HapMap第二阶段2007年将数百万SNP与多个群体单倍型公开。缩小到单个对象时,须按参考坐标口径把InternationalHap在2007年的提出证据与1000GenomesProje在2010年的后续结果放进HapMap分母。把观察窗延长时,参考坐标核对对象是否同一,测序覆盖度核对失败样本有没有被删去;二者分开,HapMap有效对象数/测序覆盖度登记总数才不由筛选规则制造。
提高通量而不改阈值时,原始研究已露出边界:初始群体数量有限,所谓代表性标签对未采样祖源并不成立。争议不在于HapMap把常见变异组织成连锁单倍型是否发生,而在于换批次或换尺度后,家系共分离改变且主效应方向不再保留。把失败样本补回分母后,2010年论文承担的是越过原参考坐标场景的边界检验,不能用更新年份冒充HapMap的独立复现。
按预注册方案重跑时,实际流程并列保存参考坐标、家系共分离与测序覆盖度,分别标记对象、过程和退出原因。移出原先环境后,工程验收以测序覆盖度为入口采用HapMap有效对象数/测序覆盖度登记总数,单次图像和展示性个案都不能代替HapMap分母。
改变操作者而锁定流程时,本条与第 034 号《进化生物学》第甲条「全基因组关联研究:共同变异成为可检验架构」形成可查接口:邻块用「全基因组关联研究:共同变异成为可检验架构」核对进化生物学对象,本块只核对参考坐标下的HapMap有效对象数/测序覆盖度登记总数。在盲法复核中,两边共享〔08 缺失即不存在〕,却不能互相代替;HapMap还须接受家系共分离的独立复测。将校准曲线整体重做时,反例仍由本家给出——初始群体数量有限,所谓代表性标签对未采样祖源并不成立;删掉这项限制,只会得到同名类比。
丙、千人基因组把人群变异谱变成公共参考The 1000 Genomes Project Makes Population Variation a Public Reference
把样品规模放大后,1000GenomesProje在2010年的工作把困难落到祖源分层可识别的对象上;本条改写的是「人群参考的价值来自频率分母,不能把未观察变异记作不存在」,而不是把千人基因组把人群变异谱变成公共参考当作又一次性能刷新。
更换原料或样本批号后,本条锁定跨群体样本与联合变异调用:保持样本外复现与样本边界不变,只改变这一环节,千人基因组有效对象数/参考坐标登记总数才应沿预测方向移动。把观察窗延长时,2009年复核若不能在样本外复现保留「人群参考的价值来自频率分母,不能把未观察变异记作不存在」的方向,它就只是原样本内的相关。
2010年试点建立方法,2015年最终阶段分析2504人、26个人群并描述超过8800万变异。提高通量而不改阈值时,须按祖源分层口径把1000GenomesProje在2010年的提出证据与1000GenomesProje在2015年的后续结果放进千人基因组分母。缩小到单个对象时,祖源分层核对对象是否同一,参考坐标核对失败样本有没有被删去;二者分开,千人基因组有效对象数/参考坐标登记总数才不由筛选规则制造。
把失败样本补回分母后,原始研究已露出边界:2504人无法支撑许多群体的极低频估计,26个人群标签也会遮蔽内部连续结构。争议不在于千人基因组把人群变异谱变成公共参考是否发生,而在于换批次或换尺度后,样本外复现改变且主效应方向不再保留。按预注册方案重跑时,2015年论文承担的是越过原祖源分层场景的边界检验,不能用更新年份冒充千人基因组的独立复现。
移出原先环境后,实际流程并列保存祖源分层、样本外复现与参考坐标,分别标记对象、过程和退出原因。改变操作者而锁定流程时,工程验收以参考坐标为入口采用千人基因组有效对象数/参考坐标登记总数,单次图像和展示性个案都不能代替千人基因组分母。
在盲法复核中,本条与第 332 号《生物信息学与计算生物学》第七条「泛基因组图:参考坐标从一条线变成多路径图」形成可查接口:邻块用「泛基因组图:参考坐标从一条线变成多路径图」核对生物信息学与计算生物学对象,本块只核对祖源分层下的千人基因组有效对象数/参考坐标登记总数。将校准曲线整体重做时,两边共享〔19 类别互斥且穷尽〕,却不能互相代替;千人基因组还须接受样本外复现的独立复测。把域外样本纳入时,反例仍由本家给出——2504人无法支撑许多群体的极低频估计,26个人群标签也会遮蔽内部连续结构;删掉这项限制,只会得到同名类比。
丁、GWAS把复杂病因拆成全基因组小效应GWAS Decomposes Complex Disease into Genome-Wide Small Effects
让第二个实验室独立执行时,Klein等在2005年的工作把困难落到家系共分离可识别的对象上;本条改写的是「GWAS回答位点与表型共变,不直接回答分子机制或个体命运」,而不是把GWAS把复杂病因拆成全基因组小效应当作又一次性能刷新。交换发现批次与验证批次时,GWAS把复杂病因拆成全基因组小效应离开家系共分离对象定义后,平均改进可能只来自分母重选。
把观察窗延长时,本条锁定样本量、等位频率与表型定义的统计功效:保持测序覆盖度与样本边界不变,只改变这一环节,GWAS有效对象数/祖源分层登记总数才应沿预测方向移动。缩小到单个对象时,2009年复核若不能在测序覆盖度保留「GWAS回答位点与表型共变,不直接回答分子机制或个体命运」的方向,它就只是原样本内的相关。
早期CFH风险等位基因的优势比约4倍,远大于后来多数GWAS小效应。把失败样本补回分母后,须按家系共分离口径把Klein等在2005年的提出证据与Visscher等在2017年的后续结果放进GWAS分母。提高通量而不改阈值时,家系共分离核对对象是否同一,祖源分层核对失败样本有没有被删去;二者分开,GWAS有效对象数/祖源分层登记总数才不由筛选规则制造。
按预注册方案重跑时,原始研究已露出边界:首批病例对照的祖源与诊断选择会影响效应估计,显著性不等于解释比例大。争议不在于GWAS把复杂病因拆成全基因组小效应是否发生,而在于换批次或换尺度后,测序覆盖度改变且主效应方向不再保留。移出原先环境后,2017年论文承担的是越过原家系共分离场景的边界检验,不能用更新年份冒充GWAS的独立复现。
改变操作者而锁定流程时,实际流程并列保存家系共分离、测序覆盖度与祖源分层,分别标记对象、过程和退出原因。在盲法复核中,工程验收以祖源分层为入口采用GWAS有效对象数/祖源分层登记总数,单次图像和展示性个案都不能代替GWAS分母。
将校准曲线整体重做时,本条与第 119 号《流行病学》第甲条「反事实响应面 —— 同一暴露的效应在不同背景风险上会反号」形成可查接口:邻块用「反事实响应面 —— 同一暴露的效应在不同背景风险上会反号」核对流行病学对象,本块只核对家系共分离下的GWAS有效对象数/祖源分层登记总数。把域外样本纳入时,两边共享〔05 平均值代表个体〕,却不能互相代替;GWAS还须接受测序覆盖度的独立复测。固定成本而扩大覆盖时,反例仍由本家给出——首批病例对照的祖源与诊断选择会影响效应估计,显著性不等于解释比例大;删掉这项限制,只会得到同名类比。
戊、缺失遗传力把显著位点与总体遗传贡献分开Missing Heritability Separates Significant Loci from Total Genetic Contribution
更换原料或样本批号后,Manolio等在2009年的工作把困难落到样本外复现可识别的对象上;本条改写的是「遗传力是群体方差比例,不是个人性状有多少由基因决定」,而不是把缺失遗传力把显著位点与总体遗传贡献分开当作又一次性能刷新。
缩小到单个对象时,本条锁定进入模型的变异频谱与遗传度估计口径:保持参考坐标与样本边界不变,只改变这一环节,缺失遗传力有效对象数/家系共分离登记总数才应沿预测方向移动。提高通量而不改阈值时,2012年复核若不能在参考坐标保留「遗传力是群体方差比例,不是个人性状有多少由基因决定」的方向,它就只是原样本内的相关。
全基因组序列可把身高SNP遗传力估计推到约40%,仍非个人决定比例。按预注册方案重跑时,须按样本外复现口径把Manolio等在2009年的提出证据与Wainschtein等在2022年的后续结果放进缺失遗传力分母。把失败样本补回分母后,样本外复现核对对象是否同一,家系共分离核对失败样本有没有被删去;二者分开,缺失遗传力有效对象数/家系共分离登记总数才不由筛选规则制造。
移出原先环境后,原始研究已露出边界:不同研究的遗传力分母、环境方差和样本亲缘结构不同,缺口不是固定常数。争议不在于缺失遗传力把显著位点与总体遗传贡献分开是否发生,而在于换批次或换尺度后,参考坐标改变且主效应方向不再保留。
在盲法复核中,实际流程并列保存样本外复现、参考坐标与家系共分离,分别标记对象、过程和退出原因。将校准曲线整体重做时,工程验收以家系共分离为入口采用缺失遗传力有效对象数/家系共分离登记总数,单次图像和展示性个案都不能代替缺失遗传力分母。
把域外样本纳入时,本条与第 308 号《实验设计与抽样调查》第十二条「隐私感知抽样:最优分层样本量必须把噪声预算写进去」形成可查接口:邻块用「隐私感知抽样:最优分层样本量必须把噪声预算写进去」核对实验设计与抽样调查对象,本块只核对样本外复现下的缺失遗传力有效对象数/家系共分离登记总数。固定成本而扩大覆盖时,两边共享〔10 更多数据必然减少偏倚〕,却不能互相代替;缺失遗传力还须接受参考坐标的独立复测。交换发现批次与验证批次时,反例仍由本家给出——不同研究的遗传力分母、环境方差和样本亲缘结构不同,缺口不是固定常数;删掉这项限制,只会得到同名类比。
己、ENCODE把生化活性与生物功能的边界公开化ENCODE Exposes the Boundary between Biochemical Activity and Biological Function
把观察窗延长时,ENCODE Project Consortium在2012年的工作把困难落到测序覆盖度可识别的对象上;本条改写的是「活性、调控作用和生物必需性必须分级,不能用一个百分比合并」,而不是把ENCODE把生化活性与生物功能的边界公开化当作又一次性能刷新。撤去展示性筛选后,ENCODE把生化活性与生物功能的边界公开化离开测序覆盖度对象定义后,平均改进可能只来自分母重选。
提高通量而不改阈值时,本条锁定实验可检测活性与功能定义:保持祖源分层与样本边界不变,只改变这一环节,ENCODE有效对象数/样本外复现登记总数才应沿预测方向移动。把失败样本补回分母后,2013年复核若不能在祖源分层保留「活性、调控作用和生物必需性必须分级,不能用一个百分比合并」的方向,它就只是原样本内的相关。
ENCODE2012年报告约80%基因组具有某类生化关联,引发功能定义争论。移出原先环境后,须按测序覆盖度口径把ENCODE Project Consortium在2012年的提出证据与ENCODE Project Consortium在2020年的后续结果放进ENCODE分母。按预注册方案重跑时,测序覆盖度核对对象是否同一,样本外复现核对失败样本有没有被删去;二者分开,ENCODE有效对象数/样本外复现登记总数才不由筛选规则制造。
改变操作者而锁定流程时,原始研究已露出边界:80%来自多种宽松实验定义的并集,不能当作80%碱基都具有可验证表型功能。争议不在于ENCODE把生化活性与生物功能的边界公开化是否发生,而在于换批次或换尺度后,祖源分层改变且主效应方向不再保留。在盲法复核中,2020年论文承担的是越过原测序覆盖度场景的边界检验,不能用更新年份冒充ENCODE的独立复现。
将校准曲线整体重做时,实际流程并列保存测序覆盖度、祖源分层与样本外复现,分别标记对象、过程和退出原因。把域外样本纳入时,工程验收以样本外复现为入口采用ENCODE有效对象数/样本外复现登记总数,单次图像和展示性个案都不能代替ENCODE分母。
固定成本而扩大覆盖时,本条与第 109 号《病理与诊断学》第九条「远程病理:稀缺专家跨越地理边界」形成可查接口:邻块用「远程病理:稀缺专家跨越地理边界」核对病理与诊断学对象,本块只核对测序覆盖度下的ENCODE有效对象数/样本外复现登记总数。交换发现批次与验证批次时,两边共享〔16 稀有与常见服从同一机制〕,却不能互相代替;ENCODE还须接受祖源分层的独立复测。把最优参数降为中位参数时,反例仍由本家给出——80%来自多种宽松实验定义的并集,不能当作80%碱基都具有可验证表型功能;删掉这项限制,只会得到同名类比。
庚、癌症基因组把肿瘤分类推进到分子亚型Cancer Genomics Moves Tumor Classification toward Molecular Subtypes
缩小到单个对象时,TCGA Research Network在2008年的工作把困难落到参考坐标可识别的对象上;本条改写的是「分子分型能重组疾病类别,但亚型必须与可行动结局连接」,而不是把癌症基因组把肿瘤分类推进到分子亚型当作又一次性能刷新。由外部团队只凭公开记录复算时,癌症基因组把肿瘤分类推进到分子亚型离开参考坐标对象定义后,平均改进可能只来自分母重选。
把失败样本补回分母后,本条锁定体细胞变异组合与多组学聚类:保持家系共分离与样本边界不变,只改变这一环节,癌症基因组有效对象数/测序覆盖度登记总数才应沿预测方向移动。按预注册方案重跑时,2009年复核若不能在家系共分离保留「分子分型能重组疾病类别,但亚型必须与可行动结局连接」的方向,它就只是原样本内的相关。
首批TCGA胶质母细胞瘤分析超过200个肿瘤,并整合3种以上组学。改变操作者而锁定流程时,须按参考坐标口径把TCGA Research Network在2008年的提出证据与Weinstein等在2013年的后续结果放进癌症基因组分母。移出原先环境后,参考坐标核对对象是否同一,测序覆盖度核对失败样本有没有被删去;二者分开,癌症基因组有效对象数/测序覆盖度登记总数才不由筛选规则制造。
在盲法复核中,原始研究已露出边界:治疗前大块肿瘤平均信号会漏掉空间克隆和治疗后演化,聚类稳定不等于临床有效。争议不在于癌症基因组把肿瘤分类推进到分子亚型是否发生,而在于换批次或换尺度后,家系共分离改变且主效应方向不再保留。
把域外样本纳入时,实际流程并列保存参考坐标、家系共分离与测序覆盖度,分别标记对象、过程和退出原因。固定成本而扩大覆盖时,工程验收以测序覆盖度为入口采用癌症基因组有效对象数/测序覆盖度登记总数,单次图像和展示性个案都不能代替癌症基因组分母。
交换发现批次与验证批次时,本条与第 519 号《生物学哲学与医学哲学》第乙条「发育系统:基因不是蓝图,表型由多资源循环重建」形成可查接口:邻块用「发育系统:基因不是蓝图,表型由多资源循环重建」核对生物学哲学与医学哲学对象,本块只核对参考坐标下的癌症基因组有效对象数/测序覆盖度登记总数。把最优参数降为中位参数时,两边共享〔08 缺失即不存在〕,却不能互相代替;癌症基因组还须接受家系共分离的独立复测。撤去展示性筛选后,反例仍由本家给出——治疗前大块肿瘤平均信号会漏掉空间克隆和治疗后演化,聚类稳定不等于临床有效;删掉这项限制,只会得到同名类比。
辛、外显子测序把罕见病诊断变成家系过滤Exome Sequencing Turns Rare-Disease Diagnosis into Family Filtering
提高通量而不改阈值时,Ng等在2010年的工作把困难落到祖源分层可识别的对象上;本条改写的是「诊断率以全部转诊病例为分母,候选变异数不是成功数」,而不是把外显子测序把罕见病诊断变成家系过滤当作又一次性能刷新。
按预注册方案重跑时,本条锁定家系共分离与稀有功能变异过滤:保持样本外复现与样本边界不变,只改变这一环节,外显子测序有效对象数/参考坐标登记总数才应沿预测方向移动。移出原先环境后,2009年复核若不能在样本外复现保留「诊断率以全部转诊病例为分母,候选变异数不是成功数」的方向,它就只是原样本内的相关。
临床外显子系列的分子诊断率约25%,意味着约3/4转诊病例仍未解决。在盲法复核中,须按祖源分层口径把Ng等在2010年的提出证据与Yang等在2013年的后续结果放进外显子测序分母。改变操作者而锁定流程时,祖源分层核对对象是否同一,参考坐标核对失败样本有没有被删去;二者分开,外显子测序有效对象数/参考坐标登记总数才不由筛选规则制造。
将校准曲线整体重做时,原始研究已露出边界:约25%诊断率来自特定转诊人群和当时知识库,不能当作所有罕见病固定产率。争议不在于外显子测序把罕见病诊断变成家系过滤是否发生,而在于换批次或换尺度后,样本外复现改变且主效应方向不再保留。把域外样本纳入时,2013年论文承担的是越过原祖源分层场景的边界检验,不能用更新年份冒充外显子测序的独立复现。
固定成本而扩大覆盖时,实际流程并列保存祖源分层、样本外复现与参考坐标,分别标记对象、过程和退出原因。交换发现批次与验证批次时,工程验收以参考坐标为入口采用外显子测序有效对象数/参考坐标登记总数,单次图像和展示性个案都不能代替外显子测序分母。
把最优参数降为中位参数时,本条与第 074 号《因果推断与计量》第甲条「观察性研究先做设计再看结果,平衡不是回归后的装饰」形成可查接口:邻块用「观察性研究先做设计再看结果,平衡不是回归后的装饰」核对因果推断与计量对象,本块只核对祖源分层下的外显子测序有效对象数/参考坐标登记总数。撤去展示性筛选后,两边共享〔01 谁进入分母〕,却不能互相代替;外显子测序还须接受样本外复现的独立复测。由外部团队只凭公开记录复算时,反例仍由本家给出——约25%诊断率来自特定转诊人群和当时知识库,不能当作所有罕见病固定产率;删掉这项限制,只会得到同名类比。
第二幕重写参考和解释。长读长补回重复与结构变异,端粒到端粒组装和人类泛基因组把“参考”从单线改成图;生物银行与外显子组扩大稀有变异统计,PRS暴露祖源迁移风险,MPRA、饱和编辑和深度序列模型把候选推向功能,急症全基因组与隐私研究又规定临床和治理边界。
一、长读长把重复与结构变异重新放回基因组Long Reads Restore Repeats and Structural Variation
把失败样本补回分母后,Pendleton等在2015年的工作把困难落到家系共分离可识别的对象上;本条改写的是「读长增加的是可跨越性,仍需以真实断点和完整基因组为分母」,而不是把长读长把重复与结构变异重新放回基因组当作又一次性能刷新。
移出原先环境后,本条锁定单条读段跨越重复与变异断点的长度:保持测序覆盖度与样本边界不变,只改变这一环节,长读长有效对象数/祖源分层登记总数才应沿预测方向移动。改变操作者而锁定流程时,2009年复核若不能在测序覆盖度保留「读长增加的是可跨越性,仍需以真实断点和完整基因组为分母」的方向,它就只是原样本内的相关。
高保真长读常达10–20kb,单条读段可跨越多数中等重复与断点。将校准曲线整体重做时,须按家系共分离口径把Pendleton等在2015年的提出证据与Wenger等在2019年的后续结果放进长读长分母。在盲法复核中,家系共分离核对对象是否同一,祖源分层核对失败样本有没有被删去;二者分开,长读长有效对象数/祖源分层登记总数才不由筛选规则制造。
把域外样本纳入时,原始研究已露出边界:高质量DNA和优选样本不代表临床保存样本、低丰度嵌合和极端重复同样可解。争议不在于长读长把重复与结构变异重新放回基因组是否发生,而在于换批次或换尺度后,测序覆盖度改变且主效应方向不再保留。固定成本而扩大覆盖时,2019年论文承担的是越过原家系共分离场景的边界检验,不能用更新年份冒充长读长的独立复现。
交换发现批次与验证批次时,实际流程并列保存家系共分离、测序覆盖度与祖源分层,分别标记对象、过程和退出原因。把最优参数降为中位参数时,工程验收以祖源分层为入口采用长读长有效对象数/祖源分层登记总数,单次图像和展示性个案都不能代替长读长分母。
撤去展示性筛选后,本条与第 031 号《免疫学》第三条「IL-17/23轴把银屑病关节炎皮肤与关节重新配对」形成可查接口:邻块用「IL-17/23轴把银屑病关节炎皮肤与关节重新配对」核对免疫学对象,本块只核对家系共分离下的长读长有效对象数/祖源分层登记总数。由外部团队只凭公开记录复算时,两边共享〔10 更多数据必然减少偏倚〕,却不能互相代替;长读长还须接受测序覆盖度的独立复测。换批次重做时,反例仍由本家给出——高质量DNA和优选样本不代表临床保存样本、低丰度嵌合和极端重复同样可解;删掉这项限制,只会得到同名类比。
二、端粒到端粒组装把参考缺口变成可测序对象Telomere-to-Telomere Assembly Turns Reference Gaps into Sequence
按预注册方案重跑时,Nurk等在2022年的工作把困难落到样本外复现可识别的对象上;本条改写的是「完整参考解决序列空白,不解决一条序列代表全人类的问题」,而不是把端粒到端粒组装把参考缺口变成可测序对象当作又一次性能刷新。把样品规模放大后,端粒到端粒组装把参考缺口变成可测序对象离开样本外复现对象定义后,平均改进可能只来自分母重选。
改变操作者而锁定流程时,本条锁定互补长读平台与重复特异变异:保持参考坐标与样本边界不变,只改变这一环节,端粒到端粒组装有效对象数/家系共分离登记总数才应沿预测方向移动。在盲法复核中,2009年复核若不能在参考坐标保留「完整参考解决序列空白,不解决一条序列代表全人类的问题」的方向,它就只是原样本内的相关。
Nurk等2022年发布CHM13端粒到端粒组装,增加近2亿碱基并校正重复区域。把域外样本纳入时,须按样本外复现口径把Nurk等在2022年的提出证据与Rhie等在2023年的后续结果放进端粒到端粒组装分母。将校准曲线整体重做时,样本外复现核对对象是否同一,家系共分离核对失败样本有没有被删去;二者分开,端粒到端粒组装有效对象数/家系共分离登记总数才不由筛选规则制造。
固定成本而扩大覆盖时,原始研究已露出边界:CHM13的无缺口来自特殊样本,不能把其重复结构直接当作所有个体的标准。争议不在于端粒到端粒组装把参考缺口变成可测序对象是否发生,而在于换批次或换尺度后,参考坐标改变且主效应方向不再保留。
把最优参数降为中位参数时,实际流程并列保存样本外复现、参考坐标与家系共分离,分别标记对象、过程和退出原因。撤去展示性筛选后,工程验收以家系共分离为入口采用端粒到端粒组装有效对象数/家系共分离登记总数,单次图像和展示性个案都不能代替端粒到端粒组装分母。
由外部团队只凭公开记录复算时,本条与第 034 号《进化生物学》第十二条「CRISPRoff把表观沉默变成可写且可保持的状态」形成可查接口:邻块用「CRISPRoff把表观沉默变成可写且可保持的状态」核对进化生物学对象,本块只核对样本外复现下的端粒到端粒组装有效对象数/家系共分离登记总数。换批次重做时,两边共享〔25 失败样本不含信息〕,却不能互相代替;端粒到端粒组装还须接受参考坐标的独立复测。改用另一台装置后,反例仍由本家给出——CHM13的无缺口来自特殊样本,不能把其重复结构直接当作所有个体的标准;删掉这项限制,只会得到同名类比。
三、人类泛基因组把参考坐标从一条线改成图The Human Pangenome Replaces One Linear Reference with a Graph
移出原先环境后,Liao等在2023年的工作把困难落到测序覆盖度可识别的对象上;本条改写的是「参考应显式表示多样性,但版本更新必须保持临床可追踪」,而不是把人类泛基因组把参考坐标从一条线改成图当作又一次性能刷新。
在盲法复核中,本条锁定参考中被表示的人群单倍型多样性:保持祖源分层与样本边界不变,只改变这一环节,人类泛基因组有效对象数/样本外复现登记总数才应沿预测方向移动。将校准曲线整体重做时,2009年复核若不能在祖源分层保留「参考应显式表示多样性,但版本更新必须保持临床可追踪」的方向,它就只是原样本内的相关。
Liao等2023年发布首版人类泛基因组,包含47名个体的94个单倍型并增加大量序列。固定成本而扩大覆盖时,须按测序覆盖度口径把Liao等在2023年的提出证据与Sirén等在2024年的后续结果放进人类泛基因组分母。把域外样本纳入时,测序覆盖度核对对象是否同一,样本外复现核对失败样本有没有被删去;二者分开,人类泛基因组有效对象数/样本外复现登记总数才不由筛选规则制造。
交换发现批次与验证批次时,原始研究已露出边界:94个单倍型远未覆盖全球结构多样性,图内改善也可能把图外人群继续留在盲区。争议不在于人类泛基因组把参考坐标从一条线改成图是否发生,而在于换批次或换尺度后,祖源分层改变且主效应方向不再保留。
撤去展示性筛选后,实际流程并列保存测序覆盖度、祖源分层与样本外复现,分别标记对象、过程和退出原因。由外部团队只凭公开记录复算时,工程验收以样本外复现为入口采用人类泛基因组有效对象数/样本外复现登记总数,单次图像和展示性个案都不能代替人类泛基因组分母。
换批次重做时,本条与第 332 号《生物信息学与计算生物学》第乙条「德布鲁因图装配:基因组不再由最长重叠直接拼出」形成可查接口:邻块用「德布鲁因图装配:基因组不再由最长重叠直接拼出」核对生物信息学与计算生物学对象,本块只核对测序覆盖度下的人类泛基因组有效对象数/样本外复现登记总数。改用另一台装置后,两边共享〔05 平均值代表个体〕,却不能互相代替;人类泛基因组还须接受祖源分层的独立复测。把样品规模放大后,反例仍由本家给出——94个单倍型远未覆盖全球结构多样性,图内改善也可能把图外人群继续留在盲区;删掉这项限制,只会得到同名类比。
四、UK Biobank把基因型接到长期人群表型UK Biobank Links Genotypes to Longitudinal Population Phenotypes
改变操作者而锁定流程时,Bycroft等在2018年的工作把困难落到参考坐标可识别的对象上;本条改写的是「生物银行是选择性队列,不是人口普查;关联与患病率必须分开」,而不是把UK Biobank把基因型接到长期人群表型当作又一次性能刷新。
将校准曲线整体重做时,本条锁定统一同意下的样本规模与纵向表型链接:保持家系共分离与样本边界不变,只改变这一环节,UKBiobank有效对象数/测序覆盖度登记总数才应沿预测方向移动。把域外样本纳入时,2009年复核若不能在家系共分离保留「生物银行是选择性队列,不是人口普查;关联与患病率必须分开」的方向,它就只是原样本内的相关。
UKBiobank连接约50万参与者,规模却不能消除健康志愿者选择。交换发现批次与验证批次时,须按参考坐标口径把Bycroft等在2018年的提出证据与Szustakowski等在2021年的后续结果放进UKBiobank分母。固定成本而扩大覆盖时,参考坐标核对对象是否同一,测序覆盖度核对失败样本有没有被删去;二者分开,UKBiobank有效对象数/测序覆盖度登记总数才不由筛选规则制造。
把最优参数降为中位参数时,原始研究已露出边界:约50万规模不能消除健康志愿者和祖源偏差,更多变量也增加选择性报告空间。争议不在于UK Biobank把基因型接到长期人群表型是否发生,而在于换批次或换尺度后,家系共分离改变且主效应方向不再保留。撤去展示性筛选后,2021年论文承担的是越过原参考坐标场景的边界检验,不能用更新年份冒充UKBiobank的独立复现。
由外部团队只凭公开记录复算时,实际流程并列保存参考坐标、家系共分离与测序覆盖度,分别标记对象、过程和退出原因。换批次重做时,工程验收以测序覆盖度为入口采用UKBiobank有效对象数/测序覆盖度登记总数,单次图像和展示性个案都不能代替UKBiobank分母。
改用另一台装置后,本条与第 119 号《流行病学》第丁条「动态边界 —— 把人群的边界画在哪里,健康差异就换一个数」形成可查接口:邻块用「动态边界 —— 把人群的边界画在哪里,健康差异就换一个数」核对流行病学对象,本块只核对参考坐标下的UKBiobank有效对象数/测序覆盖度登记总数。把样品规模放大后,两边共享〔16 稀有与常见服从同一机制〕,却不能互相代替;UKBiobank还须接受家系共分离的独立复测。让第二个实验室独立执行时,反例仍由本家给出——约50万规模不能消除健康志愿者和祖源偏差,更多变量也增加选择性报告空间;删掉这项限制,只会得到同名类比。
五、大型外显子组把稀有变异推进到基因负荷检验Large Exome Cohorts Move Rare Variants into Gene-Burden Tests
在盲法复核中,Szustakowski等在2021年的工作把困难落到祖源分层可识别的对象上;本条改写的是「基因负荷的因果单位取决于变异聚合规则,不是基因名本身」,而不是把大型外显子组把稀有变异推进到基因负荷检验当作又一次性能刷新。把观察窗延长时,大型外显子组把稀有变异推进到基因负荷检验离开祖源分层对象定义后,平均改进可能只来自分母重选。
把域外样本纳入时,本条锁定样本量、变异分组规则与表型准确性:保持样本外复现与样本边界不变,只改变这一环节,大型外显子组有效对象数/参考坐标登记总数才应沿预测方向移动。固定成本而扩大覆盖时,2009年复核若不能在样本外复现保留「基因负荷的因果单位取决于变异聚合规则,不是基因名本身」的方向,它就只是原样本内的相关。
UKBiobank约20万外显子研究和后续全队列发现多种基因—表型关联。把最优参数降为中位参数时,须按祖源分层口径把Szustakowski等在2021年的提出证据与Backman等在2021年的后续结果放进大型外显子组分母。交换发现批次与验证批次时,祖源分层核对对象是否同一,参考坐标核对失败样本有没有被删去;二者分开,大型外显子组有效对象数/参考坐标登记总数才不由筛选规则制造。
撤去展示性筛选后,原始研究已露出边界:欧洲祖源和成人志愿者占优,儿童重病与其他祖源的效应频谱可能不同。争议不在于大型外显子组把稀有变异推进到基因负荷检验是否发生,而在于换批次或换尺度后,样本外复现改变且主效应方向不再保留。
换批次重做时,实际流程并列保存祖源分层、样本外复现与参考坐标,分别标记对象、过程和退出原因。改用另一台装置后,工程验收以参考坐标为入口采用大型外显子组有效对象数/参考坐标登记总数,单次图像和展示性个案都不能代替大型外显子组分母。
把样品规模放大后,本条与第 308 号《实验设计与抽样调查》第己条「再随机化:先把协变量平衡写进设计」形成可查接口:邻块用「再随机化:先把协变量平衡写进设计」核对实验设计与抽样调查对象,本块只核对祖源分层下的大型外显子组有效对象数/参考坐标登记总数。让第二个实验室独立执行时,两边共享〔19 类别互斥且穷尽〕,却不能互相代替;大型外显子组还须接受样本外复现的独立复测。更换原料或样本批号后,反例仍由本家给出——欧洲祖源和成人志愿者占优,儿童重病与其他祖源的效应频谱可能不同;删掉这项限制,只会得到同名类比。
六、多基因风险评分把群体效应压成个体分数Polygenic Scores Compress Population Effects into Individual Risk
将校准曲线整体重做时,Khera等在2018年的工作把困难落到家系共分离可识别的对象上;本条改写的是「PRS是人群条件化排序,不是跨人群稳定的个人命运值」,而不是把多基因风险评分把群体效应压成个体分数当作又一次性能刷新。
固定成本而扩大覆盖时,本条锁定效应与目标人群连锁结构匹配:保持测序覆盖度与样本边界不变,只改变这一环节,多基因风险评分有效对象数/祖源分层登记总数才应沿预测方向移动。交换发现批次与验证批次时,2019年复核若不能在测序覆盖度保留「PRS是人群条件化排序,不是跨人群稳定的个人命运值」的方向,它就只是原样本内的相关。
部分PRS可识别约8%人群达到3倍以上相对风险,绝对风险仍随基线改变。撤去展示性筛选后,须按家系共分离口径把Khera等在2018年的提出证据与Lewis与Vassos在2020年的后续结果放进多基因风险评分分母。把最优参数降为中位参数时,家系共分离核对对象是否同一,祖源分层核对失败样本有没有被删去;二者分开,多基因风险评分有效对象数/祖源分层登记总数才不由筛选规则制造。
由外部团队只凭公开记录复算时,原始研究已露出边界:高分尾部风险依赖目标队列患病率和祖源,不能把相对风险直接写成个人绝对概率。争议不在于多基因风险评分把群体效应压成个体分数是否发生,而在于换批次或换尺度后,测序覆盖度改变且主效应方向不再保留。
改用另一台装置后,实际流程并列保存家系共分离、测序覆盖度与祖源分层,分别标记对象、过程和退出原因。把样品规模放大后,工程验收以祖源分层为入口采用多基因风险评分有效对象数/祖源分层登记总数,单次图像和展示性个案都不能代替多基因风险评分分母。
让第二个实验室独立执行时,本条与第 109 号《病理与诊断学》第二条「空间转录组:形态邻域获得基因表达层」形成可查接口:邻块用「空间转录组:形态邻域获得基因表达层」核对病理与诊断学对象,本块只核对家系共分离下的多基因风险评分有效对象数/祖源分层登记总数。更换原料或样本批号后,两边共享〔08 缺失即不存在〕,却不能互相代替;多基因风险评分还须接受测序覆盖度的独立复测。把观察窗延长时,反例仍由本家给出——高分尾部风险依赖目标队列患病率和祖源,不能把相对风险直接写成个人绝对概率;删掉这项限制,只会得到同名类比。
七、增强子—基因图把GWAS信号从最近基因中解放Enhancer–Gene Maps Free GWAS Signals from the Nearest Gene
把域外样本纳入时,Nasser等在2021年的工作把困难落到样本外复现可识别的对象上;本条改写的是「最近基因只是方便规则,功能连接需要细胞状态与扰动证据」,而不是把增强子—基因图把GWAS信号从最近基因中解放当作又一次性能刷新。
交换发现批次与验证批次时,本条锁定细胞类型特异调控连接与精细定位:保持参考坐标与样本边界不变,只改变这一环节,增强子—基因图有效对象数/家系共分离登记总数才应沿预测方向移动。把最优参数降为中位参数时,2009年复核若不能在参考坐标保留「最近基因只是方便规则,功能连接需要细胞状态与扰动证据」的方向,它就只是原样本内的相关。
增强子—基因图连接数万候选元件,单个位点仍常保留2个以上可能靶基因。由外部团队只凭公开记录复算时,须按样本外复现口径把Nasser等在2021年的提出证据与Mountjoy等在2021年的后续结果放进增强子—基因图分母。撤去展示性筛选后,样本外复现核对对象是否同一,家系共分离核对失败样本有没有被删去;二者分开,增强子—基因图有效对象数/家系共分离登记总数才不由筛选规则制造。
换批次重做时,原始研究已露出边界:ABC高分是模型候选,不等于编辑该增强子必然改变目标基因或疾病表型。争议不在于增强子—基因图把GWAS信号从最近基因中解放是否发生,而在于换批次或换尺度后,参考坐标改变且主效应方向不再保留。
把样品规模放大后,实际流程并列保存样本外复现、参考坐标与家系共分离,分别标记对象、过程和退出原因。让第二个实验室独立执行时,工程验收以家系共分离为入口采用增强子—基因图有效对象数/家系共分离登记总数,单次图像和展示性个案都不能代替增强子—基因图分母。
更换原料或样本批号后,本条与第 519 号《生物学哲学与医学哲学》第丁条「生物信息去中心化:序列有特异性,但“编码”不等于总指挥」形成可查接口:邻块用「生物信息去中心化:序列有特异性,但“编码”不等于总指挥」核对生物学哲学与医学哲学对象,本块只核对样本外复现下的增强子—基因图有效对象数/家系共分离登记总数。把观察窗延长时,两边共享〔01 谁进入分母〕,却不能互相代替;增强子—基因图还须接受参考坐标的独立复测。缩小到单个对象时,反例仍由本家给出——ABC高分是模型候选,不等于编辑该增强子必然改变目标基因或疾病表型;删掉这项限制,只会得到同名类比。
八、MPRA把非编码变异推进到并行功能读出MPRA Moves Noncoding Variants into Parallel Functional Assays
固定成本而扩大覆盖时,Tewhey等在2016年的工作把困难落到测序覆盖度可识别的对象上;本条改写的是「并行活性是候选排序,不是原位染色质中的最终功能」,而不是把MPRA把非编码变异推进到并行功能读出当作又一次性能刷新。把失败样本补回分母后,MPRA把非编码变异推进到并行功能读出离开测序覆盖度对象定义后,平均改进可能只来自分母重选。
把最优参数降为中位参数时,本条锁定候选序列、条形码与表达读出的配对:保持祖源分层与样本边界不变,只改变这一环节,MPRA有效对象数/样本外复现登记总数才应沿预测方向移动。撤去展示性筛选后,2009年复核若不能在祖源分层保留「并行活性是候选排序,不是原位染色质中的最终功能」的方向,它就只是原样本内的相关。
MPRA一次可测3万以上调控片段,每条变异需要多个条形码复本。换批次重做时,须按测序覆盖度口径把Tewhey等在2016年的提出证据与van Arensbergen等在2019年的后续结果放进MPRA分母。由外部团队只凭公开记录复算时,测序覆盖度核对对象是否同一,样本外复现核对失败样本有没有被删去;二者分开,MPRA有效对象数/样本外复现登记总数才不由筛选规则制造。
改用另一台装置后,原始研究已露出边界:载体上的短片段无法保留三维接触、内源拷贝数和发育时序。争议不在于MPRA把非编码变异推进到并行功能读出是否发生,而在于换批次或换尺度后,祖源分层改变且主效应方向不再保留。把样品规模放大后,2019年论文承担的是越过原测序覆盖度场景的边界检验,不能用更新年份冒充MPRA的独立复现。
让第二个实验室独立执行时,实际流程并列保存测序覆盖度、祖源分层与样本外复现,分别标记对象、过程和退出原因。更换原料或样本批号后,工程验收以样本外复现为入口采用MPRA有效对象数/样本外复现登记总数,单次图像和展示性个案都不能代替MPRA分母。
把观察窗延长时,本条与第 074 号《因果推断与计量》第己条「目标学习让参数先于算法,机器学习只服务预先定义的estimand」形成可查接口:邻块用「目标学习让参数先于算法,机器学习只服务预先定义的estimand」核对因果推断与计量对象,本块只核对测序覆盖度下的MPRA有效对象数/样本外复现登记总数。缩小到单个对象时,两边共享〔10 更多数据必然减少偏倚〕,却不能互相代替;MPRA还须接受祖源分层的独立复测。提高通量而不改阈值时,反例仍由本家给出——载体上的短片段无法保留三维接触、内源拷贝数和发育时序;删掉这项限制,只会得到同名类比。
九、饱和基因组编辑把变异解释从逐例猜测变成全位点地图Saturation Genome Editing Builds Complete Variant-Function Maps
交换发现批次与验证批次时,Findlay等在2018年的工作把困难落到参考坐标可识别的对象上;本条改写的是「功能地图需与临床家系证据对齐,细胞分数不能单独定为致病」,而不是把饱和基因组编辑把变异解释从逐例猜测变成全位点地图当作又一次性能刷新。按预注册方案重跑时,饱和基因组编辑把变异解释从逐例猜测变成全位点地图离开参考坐标对象定义后,平均改进可能只来自分母重选。
撤去展示性筛选后,本条锁定内源编辑覆盖与读出对致病机制的匹配:保持家系共分离与样本边界不变,只改变这一环节,饱和基因组编辑有效对象数/测序覆盖度登记总数才应沿预测方向移动。由外部团队只凭公开记录复算时,2009年复核若不能在家系共分离保留「功能地图需与临床家系证据对齐,细胞分数不能单独定为致病」的方向,它就只是原样本内的相关。
Findlay等2018年对BRCA1关键外显子做饱和编辑并分类数千变异。改用另一台装置后,须按参考坐标口径把Findlay等在2018年的提出证据与Fowler等在2023年的后续结果放进饱和基因组编辑分母。换批次重做时,参考坐标核对对象是否同一,测序覆盖度核对失败样本有没有被删去;二者分开,饱和基因组编辑有效对象数/测序覆盖度登记总数才不由筛选规则制造。
把样品规模放大后,原始研究已露出边界:BRCA1细胞适应度只检验部分功能,组织特异、显性负效应和长期风险不在分母。争议不在于饱和基因组编辑把变异解释从逐例猜测变成全位点地图是否发生,而在于换批次或换尺度后,家系共分离改变且主效应方向不再保留。
更换原料或样本批号后,实际流程并列保存参考坐标、家系共分离与测序覆盖度,分别标记对象、过程和退出原因。把观察窗延长时,工程验收以测序覆盖度为入口采用饱和基因组编辑有效对象数/测序覆盖度登记总数,单次图像和展示性个案都不能代替饱和基因组编辑分母。
缩小到单个对象时,本条与第 031 号《免疫学》第十条「基因编辑猪器官进入临床」形成可查接口:邻块用「基因编辑猪器官进入临床」核对免疫学对象,本块只核对参考坐标下的饱和基因组编辑有效对象数/测序覆盖度登记总数。提高通量而不改阈值时,两边共享〔08 缺失即不存在〕,却不能互相代替;饱和基因组编辑还须接受家系共分离的独立复测。把失败样本补回分母后,反例仍由本家给出——BRCA1细胞适应度只检验部分功能,组织特异、显性负效应和长期风险不在分母;删掉这项限制,只会得到同名类比。
十、Enformer把远程调控预测推进到二十万碱基窗口Enformer Extends Regulatory Prediction to 200-kb Contexts
把最优参数降为中位参数时,Avsec等在2021年的工作把困难落到祖源分层可识别的对象上;本条改写的是「长上下文模型仍需原位扰动验证,注意权重不是增强子证据」,而不是把Enformer把远程调控预测推进到二十万碱基窗口当作又一次性能刷新。移出原先环境后,Enformer把远程调控预测推进到二十万碱基窗口离开祖源分层对象定义后,平均改进可能只来自分母重选。
由外部团队只凭公开记录复算时,本条锁定长程序列上下文与训练图谱:保持样本外复现与样本边界不变,只改变这一环节,Enformer有效对象数/参考坐标登记总数才应沿预测方向移动。换批次重做时,2009年复核若不能在样本外复现保留「长上下文模型仍需原位扰动验证,注意权重不是增强子证据」的方向,它就只是原样本内的相关。
Enformer输入窗口为196,608bp,远程上下文比早期1kb模型扩大约200倍。把样品规模放大后,须按祖源分层口径把Avsec等在2021年的提出证据与Dalla-Torre等在2025年的后续结果放进Enformer分母。改用另一台装置后,祖源分层核对对象是否同一,参考坐标核对失败样本有没有被删去;二者分开,Enformer有效对象数/参考坐标登记总数才不由筛选规则制造。
让第二个实验室独立执行时,原始研究已露出边界:训练标签来自现有细胞与实验分布,未测状态在模型中没有独立未知类别。争议不在于Enformer把远程调控预测推进到二十万碱基窗口是否发生,而在于换批次或换尺度后,样本外复现改变且主效应方向不再保留。更换原料或样本批号后,2025年论文承担的是越过原祖源分层场景的边界检验,不能用更新年份冒充Enformer的独立复现。
把观察窗延长时,实际流程并列保存祖源分层、样本外复现与参考坐标,分别标记对象、过程和退出原因。缩小到单个对象时,工程验收以参考坐标为入口采用Enformer有效对象数/参考坐标登记总数,单次图像和展示性个案都不能代替Enformer分母。
提高通量而不改阈值时,本条与第 034 号《进化生物学》第丁条「三维基因组:远端接触改写“最近基因”原则」形成可查接口:邻块用「三维基因组:远端接触改写“最近基因”原则」核对进化生物学对象,本块只核对祖源分层下的Enformer有效对象数/参考坐标登记总数。把失败样本补回分母后,两边共享〔05 平均值代表个体〕,却不能互相代替;Enformer还须接受样本外复现的独立复测。按预注册方案重跑时,反例仍由本家给出——训练标签来自现有细胞与实验分布,未测状态在模型中没有独立未知类别;删掉这项限制,只会得到同名类比。
十一、超快速全基因组把诊断时间压到重症决策窗Rapid Whole-Genome Sequencing Enters Critical-Care Decision Windows
撤去展示性筛选后,Clark等在2019年的工作把困难落到家系共分离可识别的对象上;本条改写的是「快速诊断的终点是净临床获益,不是测序仪完成时间」,而不是把超快速全基因组把诊断时间压到重症决策窗当作又一次性能刷新。
换批次重做时,本条锁定从采样到可行动报告的总周转时间:保持测序覆盖度与样本边界不变,只改变这一环节,超快速全基因组有效对象数/祖源分层登记总数才应沿预测方向移动。改用另一台装置后,2009年复核若不能在测序覆盖度保留「快速诊断的终点是净临床获益,不是测序仪完成时间」的方向,它就只是原样本内的相关。
重症全基因组把部分病例周转压到26小时量级,诊断率仍依入组而变。让第二个实验室独立执行时,须按家系共分离口径把Clark等在2019年的提出证据与Owen等在2022年的后续结果放进超快速全基因组分母。把样品规模放大后,家系共分离核对对象是否同一,祖源分层核对失败样本有没有被删去;二者分开,超快速全基因组有效对象数/祖源分层登记总数才不由筛选规则制造。
更换原料或样本批号后,原始研究已露出边界:专门中心和高风险入组提高诊断产率,不能外推到所有新生儿或常规筛查。争议不在于超快速全基因组把诊断时间压到重症决策窗是否发生,而在于换批次或换尺度后,测序覆盖度改变且主效应方向不再保留。
缩小到单个对象时,实际流程并列保存家系共分离、测序覆盖度与祖源分层,分别标记对象、过程和退出原因。提高通量而不改阈值时,工程验收以祖源分层为入口采用超快速全基因组有效对象数/祖源分层登记总数,单次图像和展示性个案都不能代替超快速全基因组分母。
把失败样本补回分母后,本条与第 332 号《生物信息学与计算生物学》第己条「宏基因组:微生物研究从可培养物种转向群落基因库」形成可查接口:邻块用「宏基因组:微生物研究从可培养物种转向群落基因库」核对生物信息学与计算生物学对象,本块只核对家系共分离下的超快速全基因组有效对象数/祖源分层登记总数。按预注册方案重跑时,两边共享〔16 稀有与常见服从同一机制〕,却不能互相代替;超快速全基因组还须接受测序覆盖度的独立复测。移出原先环境后,反例仍由本家给出——专门中心和高风险入组提高诊断产率,不能外推到所有新生儿或常规筛查;删掉这项限制,只会得到同名类比。
十二、基因组再识别证明匿名序列不是匿名身份Genomic Re-identification Shows Anonymous Sequences Are Not Anonymous
由外部团队只凭公开记录复算时,Gymrek等在2013年的工作把困难落到样本外复现可识别的对象上;本条改写的是「基因组隐私是家族与网络属性,不能只由样本本人一次同意结清」,而不是把基因组再识别证明匿名序列不是匿名身份当作又一次性能刷新。
改用另一台装置后,本条锁定基因组唯一性与外部数据库链接:保持参考坐标与样本边界不变,只改变这一环节,基因组再识别有效对象数/家系共分离登记总数才应沿预测方向移动。把样品规模放大后,2009年复核若不能在参考坐标保留「基因组隐私是家族与网络属性,不能只由样本本人一次同意结清」的方向,它就只是原样本内的相关。
家谱数据库覆盖扩张后,约60%的欧洲血统美国人可由三代表亲缘被定位。更换原料或样本批号后,须按样本外复现口径把Gymrek等在2013年的提出证据与Erlich等在2018年的后续结果放进基因组再识别分母。让第二个实验室独立执行时,样本外复现核对对象是否同一,家系共分离核对失败样本有没有被删去;二者分开,基因组再识别有效对象数/家系共分离登记总数才不由筛选规则制造。
把观察窗延长时,原始研究已露出边界:概念验证的成功率受家谱数据库与人口结构影响,但规模扩张会改变风险而非让风险固定。争议不在于基因组再识别证明匿名序列不是匿名身份是否发生,而在于换批次或换尺度后,参考坐标改变且主效应方向不再保留。
提高通量而不改阈值时,实际流程并列保存样本外复现、参考坐标与家系共分离,分别标记对象、过程和退出原因。把失败样本补回分母后,工程验收以家系共分离为入口采用基因组再识别有效对象数/家系共分离登记总数,单次图像和展示性个案都不能代替基因组再识别分母。
按预注册方案重跑时,本条与第 119 号《流行病学》第丙条「稀缺转移 —— 当数据不再稀缺,瓶颈迁到哪里」形成可查接口:邻块用「稀缺转移 —— 当数据不再稀缺,瓶颈迁到哪里」核对流行病学对象,本块只核对样本外复现下的基因组再识别有效对象数/家系共分离登记总数。移出原先环境后,两边共享〔19 类别互斥且穷尽〕,却不能互相代替;基因组再识别还须接受参考坐标的独立复测。改变操作者而锁定流程时,反例仍由本家给出——概念验证的成功率受家谱数据库与人口结构影响,但规模扩张会改变风险而非让风险固定;删掉这项限制,只会得到同名类比。
◎ 二十年连起来看
基因组学最深的变化,是判断对象从单一冠军读数转向完整责任链。2005年的「大规模并行测序把基因组从项目变成常规数据流」与2015年的「长读长把重复与结构变异重新放回基因组」分别改写对象和尺度;把两条并读,才看见何种改进来自机制,何种改进只是分母移动。
第二条贯穿线是失败开始拥有名称。「GWAS把复杂病因拆成全基因组小效应」把失效写进过程,「大型外显子组把稀有变异推进到基因负荷检验」又把退出、域外和未复现样本放回账本。二十条自曝字段互不代用,说明基因组学的边界不是一句“仍需研究”可以概括。
第三条线是基础设施进入思想本身。从「外显子测序把罕见病诊断变成家系过滤」到「基因组再识别证明匿名序列不是匿名身份」,基因组学越来越依赖版本、共享数据、质量控制和长期维护。技术能否工作与谁能持续复算,已经是同一条命题的两个端点。
◎ 三个常见误解
误解一把「大规模并行测序把基因组从项目变成常规数据流」读成性能越高越好;只有大规模并行测序有效对象数/样本外复现登记总数保持方向,冠军读数才可外推。
误解二把「端粒到端粒组装把参考缺口变成可测序对象」理解为旧方法失效;在当CHM13的无缺口来自特殊样本,不能把其重复结构直接当作所有个体的标准时,本条只适用于…时,旧方法仍可能是更稳健的基线。
误解三把「超快速全基因组把诊断时间压到重症决策窗」当成自动化问题;若未通过祖源分层、在测序覆盖度退出或未进入超快速全基因组统计的对象仍不设字段,吞吐越高,遗漏越难看见。自动化不会自行修复采样和标签的既有边界。
◎ 与相邻领域的接口
与第 034 号《进化生物学》的分工落在对象层:对方第甲条「全基因组关联研究:共同变异成为可检验架构」解释邻域机制,本块「HapMap把常见变异组织成连锁单倍型」负责给出基因组学的可比读数与失败分母。
与第 519 号《生物学哲学与医学哲学》的接口落在方法层。对方「发育系统:基因不是蓝图,表型由多资源循环重建」提供另一种观测或计算,本块「癌症基因组把肿瘤分类推进到分子亚型」要求同一变化在参考坐标和家系共分离之间保留方向。
与第 519 号《生物学哲学与医学哲学》的接口落在治理层。对方第丁条「生物信息去中心化:序列有特异性,但“编码”不等于总指挥」处理外部条件,本块「增强子—基因图把GWAS信号从最近基因中解放」核对名义采用、真实到达与长期代价是否属于同一分母。
◎ 争议现场
第一场争论围绕「千人基因组把人群变异谱变成公共参考」:2504人无法支撑许多群体的极低频估计,26个人群标签也会遮蔽内部连续结构。要收敛,需要在预注册方案中固定测序覆盖度与祖源分层,并把阴性批次逐一公开。
第二场争论围绕「UK Biobank把基因型接到长期人群表型」:当约50万规模不能消除健康志愿者和祖源偏差,更多变量也增加选择性报告空间时,本条只适用于…。决定性设计不是继续增加同类样本,而是换装置、换实验室后保留UKBiobank有效对象数/测序覆盖度登记总数的符号。
第三场争论围绕「Enformer把远程调控预测推进到二十万碱基窗口」:未通过参考坐标、在样本外复现退出或未进入Enformer统计的对象。只有把这些对象纳入分母,并观察它们是否改变结论,争论才会从术语偏好变成可判决证据。
◎ 往下五年看什么
到2031年先看「缺失遗传力把显著位点与总体遗传贡献分开」能否把缺失遗传力有效对象数/家系共分离登记总数从单中心读数推进到多中心分布,并公开中心间方差。
第二个读数是「人类泛基因组把参考坐标从一条线改成图」的失败率:未通过样本外复现、在祖源分层退出或未进入人类泛基因组统计的对象占全部进入流程对象的比例是否下降,而不是入组后成功率是否继续升高。
第三个读数是「MPRA把非编码变异推进到并行功能读出」的真实迁移:在参考坐标改变、样本外复现保持时,主效应的方向能否跨批次保留。
第四个读数是「基因组再识别证明匿名序列不是匿名身份」的全成本分母:把维护、退出、复测与处置纳入后,基因组再识别有效对象数/家系共分离登记总数是否仍优于现行基线。
◎ 可与哪些领域对撞
本块「大规模并行测序把基因组从项目变成常规数据流」与第 031 号《免疫学》第六条「百日疫苗:从病原序列到大规模接种」共享〔01 谁进入分母〕。两边若都成立,对象身份就不能只在实验开始前给定一次。
本块「外显子测序把罕见病诊断变成家系过滤」与第 074 号《因果推断与计量》第甲条「【第一幕】上一个十年 · 主证据 2006—2016」都核对失败分母:退出者和未达标路径本身可能是结果。
本块「多基因风险评分把群体效应压成个体分数」与第 109 号《病理与诊断学》第二条「空间转录组:形态邻域获得基因表达层」在顺序上相反;需另设条件变量裁决何时可交换。
本块「超快速全基因组把诊断时间压到重症决策窗」与第 332 号《生物信息学与计算生物学》第己条「宏基因组:微生物研究从可培养物种转向群落基因库」共同挑战“更多数据自然减偏”:同源误差增加时,置信度升而外推性不升。
◎ 十条可做的研究命题
命题1:固定测序覆盖度,以「ENCODE把生化活性与生物功能的边」的只检验实验可检测活性与功能定义,不以测序预测ENCODE有效对象数/样本外复现登;跨批次保留未通过样本外复现、在祖源分层退出或未,失败样本使方向消失即证伪。
命题2:固定参考坐标,以「长读长把重复与结构变异重新放回基因组」的只检验单条读段跨越重复与变异断点的长度预测长读长有效对象数/祖源分层登记总数;跨批次保留未通过祖源分层、在测序覆盖度退出或未,失败样本使方向消失即证伪。
命题3:固定祖源分层,以「UKBiobank把基因型接到长期人」的只检验统一同意下的样本规模与纵向表型链接预测UKBiobank有效对象数/测序覆;跨批次保留未通过测序覆盖度、在家系共分离退出或,失败样本使方向消失即证伪。
命题4:固定家系共分离,以「增强子—基因图把GWAS信号从最近基」的只检验细胞类型特异调控连接与精细定位,不预测增强子—基因图有效对象数/家系共分离;跨批次保留未通过家系共分离、在参考坐标退出或未,失败样本使方向消失即证伪。
命题5:固定样本外复现,以「Enformer把远程调控预测推进到」的只检验长程序列上下文与训练图谱,不以祖源预测Enformer有效对象数/参考坐标;跨批次保留未通过参考坐标、在样本外复现退出或未,失败样本使方向消失即证伪。
命题6:固定测序覆盖度,以「大规模并行测序把基因组从项目变成常规」的只检验并行反应数与每轮碱基识别,不以测序预测大规模并行测序有效对象数/样本外复现;跨批次保留未通过样本外复现、在祖源分层退出或未,失败样本使方向消失即证伪。
命题7:固定参考坐标,以「GWAS把复杂病因拆成全基因组小效应」的只检验样本量、等位频率与表型定义的统计功预测GWAS有效对象数/祖源分层登记总数;跨批次保留未通过祖源分层、在测序覆盖度退出或未,失败样本使方向消失即证伪。
命题8:固定祖源分层,以「癌症基因组把肿瘤分类推进到分子亚型」的只检验体细胞变异组合与多组学聚类,不以参预测癌症基因组有效对象数/测序覆盖度登记;跨批次保留未通过测序覆盖度、在家系共分离退出或,失败样本使方向消失即证伪。
命题9:固定家系共分离,以「端粒到端粒组装把参考缺口变成可测序对」的只检验互补长读平台与重复特异变异,不以样预测端粒到端粒组装有效对象数/家系共分离;跨批次保留未通过家系共分离、在参考坐标退出或未,失败样本使方向消失即证伪。
命题10:固定样本外复现,以「大型外显子组把稀有变异推进到基因负荷」的只检验样本量、变异分组规则与表型准确性预测大型外显子组有效对象数/参考坐标登记;跨批次保留未通过参考坐标、在样本外复现退出或未,失败样本使方向消失即证伪。
补充判据:基因组学还须同时公开测序覆盖度、祖源分层与样本外复现的版本,让命题在换批次后仍可由外部团队判定成立或失败。退出对象应保留原始编号、退出时点与处置原因;若补回这些对象会改变方向,原命题就只能保留为样本内描述。
◎ 资料核验
- Margulies等,2005年《自然》437:376–380,DOI 10.1038/nature03959。
- 边界证据:解释边界可参见Manolio等,2009年《自然》461:747–753,DOI 10.1038/nature08494。
- Bentley等,2008年《自然》456:53–59,DOI 10.1038/nature07517。
- International HapMap Consortium,2007年《自然》449:851–861,DOI 10.1038/nature06258。
- 1000 Genomes Project Consortium,2010年《自然》467:1061–1073,DOI 10.1038/nature09534。
- 1000 Genomes Project Consortium,2015年《自然》526:68–74,DOI 10.1038/nature15393。
- Klein等,2005年《科学》308:385–389,DOI 10.1126/science.1109557。
- Visscher等,2017年《美国人类遗传学杂志》101:5–22,DOI 10.1016/j.ajhg.2017.06.005。
- Manolio等,2009年《自然》461:747–753,DOI 10.1038/nature08494。
- Zuk等,2012年《美国科学院院刊》109:1193–1198,DOI 10.1073/pnas.1119675109。
- Wainschtein等,2022年《自然·遗传学》54:263–273,DOI 10.1038/s41588-021-00997-7。
- ENCODE Project Consortium,2012年《自然》489:57–74,DOI 10.1038/nature11247。
- Graur等,2013年《基因组生物学与进化》5:578–590,DOI 10.1093/gbe/evt028。
- ENCODE Project Consortium,2020年《自然》583:699–710,DOI 10.1038/s41586-020-2493-4。
- TCGA Research Network,2008年《自然》455:1061–1068,DOI 10.1038/nature07385。
- Weinstein等,2013年《自然·遗传学》45:1113–1120,DOI 10.1038/ng.2764。
- Ng等,2010年《自然·遗传学》42:30–35,DOI 10.1038/ng.499。
- Yang等,2013年《新英格兰医学杂志》369:1502–1511,DOI 10.1056/NEJMoa1306555。
- Pendleton等,2015年《自然·方法》12:780–786,DOI 10.1038/nmeth.3454。
- Wenger等,2019年《自然·生物技术》37:1155–1162,DOI 10.1038/s41587-019-0217-9。
- Nurk等,2022年《科学》376:44–53,DOI 10.1126/science.abj6987。
- Rhie等,2023年《自然》621:344–354,DOI 10.1038/s41586-023-06457-y。
- Liao等,2023年《自然》617:312–324,DOI 10.1038/s41586-023-05896-x。
- Sirén等,2024年《自然·方法》21:2017–2023,DOI 10.1038/s41592-024-02407-2。
- Bycroft等,2018年《自然》562:203–209,DOI 10.1038/s41586-018-0579-z。
- Szustakowski等,2021年《自然·遗传学》53:942–948,DOI 10.1038/s41588-021-00885-0。
- Backman等,2021年《自然》599:628–634,DOI 10.1038/s41586-021-04103-z。
- Khera等,2018年《自然·遗传学》50:1219–1224,DOI 10.1038/s41588-018-0183-z。
- Martin等,2019年《自然·遗传学》51:584–591,DOI 10.1038/s41588-019-0379-x。
- Lewis与Vassos,2020年《基因组医学》12:44,DOI 10.1186/s13073-020-00742-5。
- Nasser等,2021年《自然》593:238–243,DOI 10.1038/s41586-021-03446-x。
- Mountjoy等,2021年《自然·遗传学》53:1527–1533,DOI 10.1038/s41588-021-00945-5。
- Tewhey等,2016年《细胞》165:1519–1529,DOI 10.1016/j.cell.2016.04.027。
- van Arensbergen等,2019年《自然·遗传学》51:1160–1169,DOI 10.1038/s41588-019-0455-2。
- Findlay等,2018年《自然》562:217–222,DOI 10.1038/s41586-018-0461-z。
- Fowler等,2023年《基因组生物学》24:147,DOI 10.1186/s13059-023-02986-x。
- Avsec等,2021年《自然·方法》18:1196–1203,DOI 10.1038/s41592-021-01252-x。
- Dalla-Torre等,2025年《自然·方法》22:287–297,DOI 10.1038/s41592-024-02523-z。
- Clark等,2019年《科学·转化医学》11:eaat6177,DOI 10.1126/scitranslmed.aat6177。
- Owen等,2022年《自然·通讯》13:4057,DOI 10.1038/s41467-022-31446-6。
- Gymrek等,2013年《科学》339:321–324,DOI 10.1126/science.1229566。
- Erlich等,2018年《科学》362:690–694,DOI 10.1126/science.aau4832。
以下二十条收录基因组学在1950至2006年间仍被上文正面使用或正面反对的经典命题。它们回答的是另一道问题:现代层每个新读数所改写的老前提,当年由谁、用什么材料立起来。这里不按名望排序,也不回避后来被削弱或判为无效的工作;失效史本身就是可供碰撞的证据。每条采用一行来源、两段正文和五字段碰撞行,并在“今用”与第二段点名它在上文哪一条继续活着。
经一、数量性状遗传学:复杂性状可分解为群体中的遗传与环境方差Quantitative Genetics
1960年前后的默认前提是基因组学的主导口径还把数量性状遗传学涉及的差异并入平均结果。Douglas Falconer没有只给出术语,而是用亲缘相似与方差分解把问题变成可比较的材料;由此得到的判决是“复杂性状可分解为群体中的遗传与环境方差”。核心读数是符合数量性状遗传学预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:基因—环境相关和群体结构改变时,遗传率不能解释个体命运。后续工作保留了数量性状遗传学的问题意识,同时把对象、时间窗和因果范围重新划定。今天从数量性状遗传学倒读本块戊「缺失遗传力把显著位点与总体遗传贡献分开」,仍可用这条旧前提核对现代层的新证据。因此本块戊既正面使用数量性状遗传学,也用遗传力是群体方差比例,不是个人性状有多少由基因决定。检验其失效条件。
经二、中性进化理论:多数分子替换可由选择中性或近中性的漂变解释Neutral Theory of Molecular Evolution
1968年前后的默认前提是基因组学的主导口径还把中性进化理论涉及的差异并入平均结果。Motoo Kimura没有只给出术语,而是用替换速率与群体遗传模型把问题变成可比较的材料;由此得到的判决是“多数分子替换可由选择中性或近中性的漂变解释”。核心读数是符合中性进化理论预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:连锁选择和群体史强烈时,表面中性频谱不能单独识别机制。后续工作保留了中性进化理论的问题意识,同时把对象、时间窗和因果范围重新划定。今天从中性进化理论倒读本块乙「HapMap把常见变异组织成连锁单倍型」,仍可用这条旧前提核对现代层的新证据。因此本块乙既正面使用中性进化理论,也用单倍型压缩是群体条件化工具,不是普适人类基因组坐标。检验其失效条件。
经三、遗传变异的群体分布:人群内变异远多于传统种族组间变异The Distribution of Human Genetic Variation
1972年前后的默认前提是基因组学的主导口径还把遗传变异的群体分布涉及的差异并入平均结果。Richard Lewontin没有只给出术语,而是用多位点等位基因方差分解把问题变成可比较的材料;由此得到的判决是“人群内变异远多于传统种族组间变异”。核心读数是由受影响者确认的遗传变异的群体分布记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:少数功能位点的组间差异不能由全基因组平均比例直接否定。后续工作保留了遗传变异的群体分布的问题意识,同时把对象、时间窗和因果范围重新划定。今天从遗传变异的群体分布倒读本块丙「千人基因组把人群变异谱变成公共参考」,仍可用这条旧前提核对现代层的新证据。本块丙据此用遗传变异的群体分布的现代关键读数检验其失效。
经四、双脱氧测序:链终止片段梯可逐碱基读出DNA序列Sanger Sequencing
1977年前后的默认前提是基因组学的主导口径还把双脱氧测序涉及的差异并入平均结果。Frederick Sanger没有只给出术语,而是用双脱氧终止与电泳条带把问题变成可比较的材料;由此得到的判决是“链终止片段梯可逐碱基读出DNA序列”。核心读数是被双脱氧测序稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:杂合模板、重复和长片段使条带重叠时,逐碱基判读失真。后续工作保留了双脱氧测序的问题意识,同时把对象、时间窗和因果范围重新划定。今天从双脱氧测序倒读本块甲「大规模并行测序把基因组从项目变成常规数据流」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块甲既正面使用双脱氧测序,也用测序变成可扩展读数,但可读、可比对与可解释仍是三道不同门。检验其失效条件。
经五、Maxam–Gilbert测序:碱基特异化学裂解可从片段梯读取序列Maxam–Gilbert Sequencing
1977年前后的默认前提是基因组学的主导口径还把Maxam–Gilbert测序涉及的差异并入平均结果。Allan Maxam与Walter Gilbert没有只给出术语,而是用放射标记与四类化学反应把问题变成可比较的材料;由此得到的判决是“碱基特异化学裂解可从片段梯读取序列”。当时最要紧的读数不是后来教科书里的结论,而是被Maxam–Gilbert测序稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:毒性试剂、片段长度与复杂操作使方法难以规模化。后续工作保留了Maxam–Gilbert测序的问题意识,同时把对象、时间窗和因果范围重新划定。今天从Maxam–Gilbert测序倒读本块甲「大规模并行测序把基因组从项目变成常规数据流」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块甲既正面使用Maxam–Gilbert测序,也用测序变成可扩展读数,但可读、可比对与可解释仍是三道不同门。检验其失效条件。
经六、RFLP连锁图:全基因组多态标记可用连锁建立人类遗传图RFLP Linkage Mapping
1980年前后的默认前提是基因组学的主导口径还把RFLP连锁图涉及的差异并入平均结果。David Botstein等没有只给出术语,而是用限制片段长度多态与家系重组把问题变成可比较的材料;由此得到的判决是“全基因组多态标记可用连锁建立人类遗传图”。当时最要紧的读数不是后来教科书里的结论,而是被RFLP连锁图稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:标记稀疏和小家系下,连锁区间过宽而不能直接定位因果变异。后续工作保留了RFLP连锁图的问题意识,同时把对象、时间窗和因果范围重新划定。今天从RFLP连锁图倒读本块乙「HapMap把常见变异组织成连锁单倍型」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块乙既正面使用RFLP连锁图,也用单倍型压缩是群体条件化工具,不是普适人类基因组坐标。检验其失效条件。
经七、PCR:引物循环扩增可把特定DNA片段从复杂样本中指数复制Polymerase Chain Reaction
1985年前后的默认前提是基因组学的主导口径还把PCR涉及的差异并入平均结果。Kary Mullis没有只给出术语,而是用β-珠蛋白片段循环扩增把问题变成可比较的材料;由此得到的判决是“引物循环扩增可把特定DNA片段从复杂样本中指数复制”。当时最要紧的读数不是后来教科书里的结论,而是符合PCR预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。这一步把PCR从经验判断改成可被下一代实验推翻的命题。
后来的修正并未抹去这条经典,而是把边界划得更清楚:污染和扩增偏倚存在时,检测到序列不等于原样本含量。后续工作保留了PCR的问题意识,同时把对象、时间窗和因果范围重新划定。今天从PCR倒读本块甲「大规模并行测序把基因组从项目变成常规数据流」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块甲既正面使用PCR,也用测序变成可扩展读数,但可读、可比对与可解释仍是三道不同门。检验其失效条件。
经八、自动荧光测序:四色荧光与自动检测可把序列判读变成仪器数据流Automated Fluorescent Sequencing
1986年前后的默认前提是基因组学的主导口径还把自动荧光测序涉及的差异并入平均结果。Leroy Hood团队没有只给出术语,而是用四色标记与在线峰识别把问题变成可比较的材料;由此得到的判决是“四色荧光与自动检测可把序列判读变成仪器数据流”。核心读数是被自动荧光测序稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:峰重叠、迁移差和软件阈值未校准时,自动化会稳定复制错误。后续工作保留了自动荧光测序的问题意识,同时把对象、时间窗和因果范围重新划定。今天从自动荧光测序倒读本块甲「大规模并行测序把基因组从项目变成常规数据流」,仍可用这条旧前提核对现代层的新证据。因此本块甲既正面使用自动荧光测序,也用测序变成可扩展读数,但可读、可比对与可解释仍是三道不同门。检验其失效条件。
经九、同源基因定位:不预设基因功能也可沿连锁与物理图找到致病位点Positional Cloning
1986年前后的默认前提是基因组学的主导口径还把同源基因定位涉及的差异并入平均结果。Ray White与Francis Collins没有只给出术语,而是用家系连锁、染色体步移与候选区缩小把问题变成可比较的材料;由此得到的判决是“不预设基因功能也可沿连锁与物理图找到致病位点”。核心读数是符合同源基因定位预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:外显不全和遗传异质性高时,位置区间不能唯一指向机制。后续工作保留了同源基因定位的问题意识,同时把对象、时间窗和因果范围重新划定。今天从同源基因定位倒读本块辛「外显子测序把罕见病诊断变成家系过滤」,仍可用这条旧前提核对现代层的新证据。因此本块辛既正面使用同源基因定位,也用诊断率以全部转诊病例为分母,候选变异数不是成功数。检验其失效条件。
经十、STS物理图:短而唯一的序列标签可把克隆与染色体位置接成公共地图Sequence-Tagged Sites
1989年前后的默认前提是基因组学的主导口径还把STS物理图涉及的差异并入平均结果。Maynard Olson没有只给出术语,而是用PCR标签与克隆重叠把问题变成可比较的材料;由此得到的判决是“短而唯一的序列标签可把克隆与染色体位置接成公共地图”。当时最要紧的读数不是后来教科书里的结论,而是实际按STS物理图执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:重复区和参考缺口中,唯一标签假设不成立。后续工作保留了STS物理图的问题意识,同时把对象、时间窗和因果范围重新划定。今天从STS物理图倒读本块一「长读长把重复与结构变异重新放回基因组」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块一既正面使用STS物理图,也用读长增加的是可跨越性,仍需以真实断点和完整基因组为分母。检验其失效条件。
经十一、连锁定位的似然框架:多标记联合似然可提高复杂家系的连锁定位Multipoint Linkage Analysis
1987年前后的默认前提是基因组学的主导口径还把连锁定位的似然框架涉及的差异并入平均结果。Eric Lander与David Botstein没有只给出术语,而是用LOD分数与多点标记把问题变成可比较的材料;由此得到的判决是“多标记联合似然可提高复杂家系的连锁定位”。核心读数是符合连锁定位的似然框架预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:模型错设、表型误分和位点异质性会制造虚假连锁峰。后续工作保留了连锁定位的似然框架的问题意识,同时把对象、时间窗和因果范围重新划定。今天从连锁定位的似然框架倒读本块丁「GWAS把复杂病因拆成全基因组小效应」,仍可用这条旧前提核对现代层的新证据。因此本块丁既正面使用连锁定位的似然框架,也用GWAS回答位点与表型共变,不直接回答分子机制或个体命运。检验其失效条件。
经十二、全基因组显著性阈值:全基因组扫描必须按搜索空间控制偶然峰Genome-Wide Significance Thresholds
1995年前后的默认前提是基因组学的主导口径还把全基因组显著性阈值涉及的差异并入平均结果。Lander与Kruglyak没有只给出术语,而是用连锁和关联检验的多重比较把问题变成可比较的材料;由此得到的判决是“全基因组扫描必须按搜索空间控制偶然峰”。核心读数是实际按全基因组显著性阈值执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:连锁不平衡、祖源和有效检验数变化时,固定阈值不再同义。后续工作保留了全基因组显著性阈值的问题意识,同时把对象、时间窗和因果范围重新划定。今天从全基因组显著性阈值倒读本块五「大型外显子组把稀有变异推进到基因负荷检验」,仍可用这条旧前提核对现代层的新证据。本块五据此用全基因组显著性阈值的现代关键读数检验其失效。
经十三、首个自由生活细菌基因组:全基因组鸟枪法可直接组装完整微生物基因组The First Free-Living Bacterial Genome
1995年前后的默认前提是基因组学的主导口径还把首个自由生活细菌基因组涉及的差异并入平均结果。J. Craig Venter团队用流感嗜血杆菌鸟枪测序与组装形成可比较材料;由此得到的判决是“全基因组鸟枪法可直接组装完整微生物基因组”。核心读数是符合首个自由生活细菌基因组预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:重复、质粒和混合菌株增多时,微生物成功不能直接外推到人类基因组。后续工作保留了首个自由生活细菌基因组的问题意识,同时把对象、时间窗和因果范围重新划定。今天从首个自由生活细菌基因组倒读本块丙「千人基因组把人群变异谱变成公共参考」,仍可用这条旧前提核对现代层的新证据。本块丙据此用首个自由生活细菌基因组的现代关键读数检验其失效。
经十四、关联优于连锁的功效判断:复杂病小效应位点需要大样本关联而非家系连锁Association over Linkage for Complex Traits
1996年前后的默认前提是基因组学的主导口径还把关联优于连锁的功效判断涉及的差异并入平均结果。Risch与Merikangas用效应大小与样本量功效计算形成可比较材料;由此得到的判决是“复杂病小效应位点需要大样本关联而非家系连锁”。核心读数是符合关联优于连锁的功效判断预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:表型粗糙和群体结构未控时,大样本关联只会放大系统偏倚。后续工作保留了关联优于连锁的功效判断的问题意识,同时把对象、时间窗和因果范围重新划定。今天从关联优于连锁的功效判断倒读本块六「多基因风险评分把群体效应压成个体分数」,仍可用这条旧前提核对现代层的新证据。本块六据此用关联优于连锁的功效判断的现代关键读数检验其失效。
经十五、百慕大原则:大规模序列数据应在生成后快速公开而非延迟占有The Bermuda Principles
1996年前后的默认前提是基因组学的主导口径还把百慕大原则涉及的差异并入平均结果。国际人类基因组计划没有只给出术语,而是用每日释放与公共数据库规则把问题变成可比较的材料;由此得到的判决是“大规模序列数据应在生成后快速公开而非延迟占有”。核心读数是实际按百慕大原则执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:质量版本和撤回机制不足时,快速公开会把早期错误同步扩散。后续工作保留了百慕大原则的问题意识,同时把对象、时间窗和因果范围重新划定。今天从百慕大原则倒读本块三「人类泛基因组把参考坐标从一条线改成图」,仍可用这条旧前提核对现代层的新证据。因此本块三既正面使用百慕大原则,也用参考应显式表示多样性,但版本更新必须保持临床可追踪。检验其失效条件。
经十六、BAC克隆体系:大插入BAC可为复杂基因组提供稳定物理克隆骨架Bacterial Artificial Chromosomes
1992年前后的默认前提是基因组学的主导口径还把BAC克隆体系涉及的差异并入平均结果。Hiroaki Shizuya没有只给出术语,而是用300 kb量级插入与稳定复制把问题变成可比较的材料;由此得到的判决是“大插入BAC可为复杂基因组提供稳定物理克隆骨架”。核心读数是实际按BAC克隆体系执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:克隆偏倚和不可克隆区域存在时,物理图仍会留下系统缺口。后续工作保留了BAC克隆体系的问题意识,同时把对象、时间窗和因果范围重新划定。今天从BAC克隆体系倒读本块二「端粒到端粒组装把参考缺口变成可测序对象」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块二既正面使用BAC克隆体系,也用完整参考解决序列空白,不解决一条序列代表全人类的问题。检验其失效条件。
经十七、SNP联盟:开放SNP目录可把全基因组关联的公共标记基础设施前置The SNP Consortium
1999年前后的默认前提是基因组学的主导口径还把SNP联盟涉及的差异并入平均结果。公共—私营SNP联盟没有只给出术语,而是用跨机构发现与公共提交把问题变成可比较的材料;由此得到的判决是“开放SNP目录可把全基因组关联的公共标记基础设施前置”。核心读数是由受影响者确认的SNP联盟记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:发现样本祖源单一时,标记密度高也不能保证跨人群可转移。后续工作保留了SNP联盟的问题意识,同时把对象、时间窗和因果范围重新划定。今天从SNP联盟倒读本块七「增强子—基因图把GWAS信号从最近基因中解放」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块七既正面使用SNP联盟,也用最近基因只是方便规则,功能连接需要细胞状态与扰动证据。检验其失效条件。
经十八、人类基因组草图:参考序列可以作为公共坐标组织基因、变异与比较The Human Genome Draft
2001年前后的默认前提是基因组学的主导口径还把人类基因组草图涉及的差异并入平均结果。国际人类基因组测序联盟没有只给出术语,而是用分层克隆测序与公共装配把问题变成可比较的材料;由此得到的判决是“参考序列可以作为公共坐标组织基因、变异与比较”。核心读数是由受影响者确认的人类基因组草图记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:参考中的缺口、错装和单一单倍型使坐标不等于全部人类基因组。后续工作保留了人类基因组草图的问题意识,同时把对象、时间窗和因果范围重新划定。今天从人类基因组草图倒读本块三「人类泛基因组把参考坐标从一条线改成图」,仍可用这条旧前提核对现代层的新证据。本块三据此用人类基因组草图的现代关键读数检验其失效。
经十九、Celera全基因组鸟枪装配:人类基因组可由大规模鸟枪读段与计算装配完成Whole-Genome Shotgun Assembly
2001年前后的默认前提是基因组学的主导口径还把Celera全基因组鸟枪装配涉及的差异并入平均结果。Celera Genomics没有只给出术语,而是用私营测序数据与公共骨架联合装配把问题变成可比较的材料;由此得到的判决是“人类基因组可由大规模鸟枪读段与计算装配完成”。核心读数是符合Celera全基因组鸟枪装配预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:公共数据依赖和重复区缺口未分账时,方法独立性会被高估。后续工作保留了Celera全基因组鸟枪装配的问题意识,同时把对象、时间窗和因果范围重新划定。今天从Celera全基因组鸟枪装配倒读本块三「人类泛基因组把参考坐标从一条线改成图」,仍可用这条旧前提核对现代层的新证据。本块三据此用Celera全基因组鸟枪装配的现代关键读数检验其失效。
经二十、人类参考基因组完成图:高准确度参考覆盖大部分常染色质并给出剩余缺口清单The Finished Human Genome
2004年前后的默认前提是基因组学的主导口径还把人类参考基因组完成图涉及的差异并入平均结果。国际人类基因组测序联盟用克隆逐段收尾与错误率评估形成可比较材料;由此得到的判决是“高准确度参考覆盖大部分常染色质并给出剩余缺口清单”。核心读数是由受影响者确认的人类参考基因组完成图记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:“完成”不含着丝粒、大片段重复和人群结构变异时,名称会掩盖边界。后续工作保留了人类参考基因组完成图的问题意识,同时把对象、时间窗和因果范围重新划定。今天从人类参考基因组完成图倒读本块十二「基因组再识别证明匿名序列不是匿名身份」,仍可用这条旧前提核对现代层的新证据。本块十二据此用人类参考基因组完成图的现代关键读数检验其失效。
◎ 这一层怎么用
读到现代层的某一条时,先沿“今用”回到对应经典,比较两条的关键栏:前者说明基因组学近二十年换掉了什么,后者说明被换掉的前提如何取得最初证据。年份边界严格分开,1950年前的工作只作背景,2006年后的主证据只进现代层。
使用时守三条纪律:年代久远不等于免于边界审查;被修正的经典仍可提供失效条件;两层不比高下,也不把同一命题拆写两遍。若经典条无法回指本块具体条目,它就不属于这一层。
◎ 经典层资料核验
- Falconer,1960年《Introduction to Quantitative Genetics》(Oliver & Boyd)。
- Kimura,1968年《Nature》217:624–626。
- Lewontin,1972年《Evolutionary Biology》6:381–398。
- Sanger、Nicklen与Coulson,1977年《Proceedings of the National Academy of Sciences》74:5463–5467。
- Maxam与Gilbert,1977年《Proceedings of the National Academy of Sciences》74:560–564。
- Botstein等,1980年《American Journal of Human Genetics》32:314–331。
- Saiki等,1985年《Science》230:1350–1354。
- Smith等,1986年《Nature》321:674–679。
- Collins,1992年《Nature Genetics》1:3–6(对1980年代定位克隆的总结)。
- Olson等,1989年《Science》245:1434–1435。
- Lander与Botstein,1987年《Proceedings of the National Academy of Sciences》84:2363–2367。
- Lander与Kruglyak,1995年《Nature Genetics》11:241–247。
- Fleischmann等,1995年《Science》269:496–512。
- Risch与Merikangas,1996年《Science》273:1516–1517。
- 1996年百慕大人类基因组会议《Bermuda Principles》(机构文件)。
- Shizuya等,1992年《Proceedings of the National Academy of Sciences》89:8794–8797。
- Thorisson与Stein,2003年《Nucleic Acids Research》31:124–127(联盟资源总结)。
- 国际人类基因组测序联盟,2001年《Nature》409:860–921。
- Venter等,2001年《Science》291:1304–1351。
- 国际人类基因组测序联盟,2004年《Nature》431:931–945。
- Falconer,1960年《Introduction to Quantitative Genetics》(Oliver & Boyd)。
- Lewontin,1974年《The Genetic Basis of Evolutionary Change》(Columbia University Press)。
- Cavalli-Sforza、Menozzi与Piazza,1994年《The History and Geography of Human Genes》(Princeton University Press)。
- Hartl与Clark,1997年《Principles of Population Genetics》(Sinauer)。
- Lander与Waterman主编,1995年《Calculating the Secrets of Life》(National Academy Press)。
- Strachan与Read,1996年《Human Molecular Genetics》(Bios Scientific)。
- Brown,1999年《Genomes》(Wiley-Liss)。
- Primrose,2001年《Principles of Genome Analysis》(Blackwell)。
- National Research Council,1988年《Mapping and Sequencing the Human Genome》(National Academies Press)。
- International Human Genome Sequencing Consortium,2004年《Finishing the Euchromatic Sequence of the Human Genome》(Nature)。
- Mount,2004年《Bioinformatics: Sequence and Genome Analysis》第二版(Cold Spring Harbor Laboratory Press)。