SDE Universes·新思想前沿生命科学的其余主干
新思想前沿 · 生命科学的其余主干

生物信息学与计算生物学

近二十年 · 两幕 · 20 个新思想 · 约 24,674 字 · 王德生 亲撰 · 2026 年 8 月

过去二十年,生物信息学从“帮助处理实验数据的软件工具”变成了生命科学对象的一部分。读段要先被比对,基因组要在图中装配,表达量由生成模型估计,细胞类型由邻域算法命名,蛋白结构甚至由学习模型直接提出。计算不再只是把既有事实整理得更快,它开始决定哪些对象可见、哪些路径可追踪、哪些证据可以跨机构和跨组学连接。本面板选取二十个转向,重点不是罗列热门算法,而是说明每一种计算结构怎样改写了生物学的分母、坐标和可证伪条件。

【第一幕】上一个十年 · 约 2006—2016

第一幕的共同动作,是把测序爆炸带来的规模问题转化为可求解的索引、图、概率和网络。短读长比对、装配、RNA 定量、变异调用、宏基因组与系统模型共同确立了一个新事实:原始数据从不直接等于生物对象,中间的计算表示本身就是证据链。

甲、短读长比对:从逐字符搜索到种子—扩展索引Short-read mapping: seed-and-extend indexes

提出Li 与 Durbin,2009 年《Bioinformatics》25:1754–1760,DOI 10.1093/bioinformatics/btp324 争议Langmead 等,2009 年《Genome Biology》10:R25,DOI 10.1186/gb-2009-10-3-r25 最新Li,2018 年《Bioinformatics》34:3094–3100,DOI 10.1093/bioinformatics/bty191 关键决定读段归属的不是“相似即可”,而是索引、重复区与多重比对的共同规则。

高通量测序刚出现时,逐条动态规划无法在数亿条读段上完成全基因组定位,重复序列又使一个读段常有多个同等合理的位置。在短读长比对从逐的对象核查中,本项先把“尚尚尚未比对和多重比对读段在最终变异表中不设字段”放回分母,再判断可见结果是否代表总体。2009年Li 与 Durbin由此重新定义研究单位,使后来的复制能够重做对象而不只是重跑程序。

BWA 与 Bowtie 把参考基因组压入 Burrows–Wheeler 索引,使候选位置先被快速召回,再由局部比对细化。它把因果责任集中到候选位置是否在受控时间内被完整召回,并留下明确失败标准:核心环节缺席时,原结果不应由另一条未记录路径原样维持。判决标准是先改变候选位置在受控时间内被完整召回这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

BWA 论文展示了对短读长进行内存可控的全基因组比对,Bowtie 在当时硬件上把数百万条读段的处理推进到小时量级;随后 minimap2 以最小化子索引统一长短读长映射。提出、争议与更新材料共同指向速度提升同时改变了可分析样本规模,但多重比对、错配代价和参考偏倚依然会直接改写下游变异与表达读数。比较从平均值转向对象级账本,尤其检查被合并、退出和未分类3类记录。以短读长比对从逐为对象,本条固定2项可核量:分子“被唯一定位的读段数”与分母“全部输入读段数”,复核时不得只报前者。 在短读长比对从逐证据链中,原始锚点仍是Li 与 Durbin,2009 年《Bioinformatics》25:1754–1760,DOI 10.1093/bioinformatics/btp324;以短读长比对从逐为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

当样本含有参考中不存当的序列、大片段重排或高度同源拷贝时,线性参考上的最佳位置并不等于真实来源。在短读长比对从逐的边界核查中,这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。 对短读长比对从逐的争议记录是Langmead 等,2009 年《Genome Biology》10:R25,DOI 10.1186/gb-2009-10-3-r25;以短读长比对从逐为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

成熟流程开始强制保存未比对读段、次优比对分数和版本化参数,而不是只输出一个 BAM 文件。临床与群体项目还需报告可调用区比例,避免把算法无法定位的区域解释为“没有变异”。2018年Li所代表的扩展还要求把阴性与不可判定对象长期保存,否则外部复核只能看到成功路径。以短读长比对从逐为对象,复核时还须冻结对象定义、观察窗口、停止规则与资源预算,并逐一登记退出、未分类和未进入记录的对象。

本项先把“未记录对象”放回分母,再判断可见结果是否代表总体。

位置D——主显露 单因决定读段归属的只有候选位置被完整召回 预设〔03 有限近似控制无限对象〕有限长度种子足以定位整条读段 量纲被唯一定位的读段数/全部输入读段数 失效当参考缺失真实路径时,映射率越高反而越可能把读段错误吸附到近似区域 自曝比对器自己报告多重位置与低映射质量,却常被下游过滤成唯一坐标 空栏未比对和多重比对读段在最终变异表中不设字段 异名另见第 331 号第 10 条『全基因组诊断:罕见病从逐基因排查转向一次性搜索』

乙、德布鲁因图装配:基因组不再由最长重叠直接拼出de Bruijn graph assembly

提出Zerbino 与 Birney,2008 年《Genome Research》18:821–829,DOI 10.1101/gr.074492.107 争议Simpson 等,2009 年《Genome Research》19:1117–1123,DOI 10.1101/gr.089532.108 最新Kolmogorov 等,2020 年《Nature Methods》17:1103–1110,DOI 10.1038/s41592-020-00971-x 关键装配的核心由“比较所有读段”转为“在 k-mer 图中清理分叉并找路径”。

短读长数量爆炸后,传统重叠—布局—一致方法的两两比较代价迅速失控,重复与测序错误在图中形成大量近似分支。当平台或样本改变后,旧参照经常随之漂移。2008年Zerbino 与 Birney使这种漂移可见,并把“被剪掉的低覆盖分支和替代单倍型”纳入结果责任范围,而不是让它在软件默认值中消失。

Velvet 与 ABySS 用 k-mer 德布鲁因图把读段压成节点和边,装配问题因此从读段配对转成图简化与路径选择。强主张可以压缩为一句:若图中真实分叉与错误分叉被正确区分这一条件不成立,主要结果就不应保持同一方向。这个判据把机制命题与一般伴随关系区分开来。

Velvet 通过去除尖端、气泡和低覆盖连接改善短读长装配,ABySS 进一步把图分布到多台机器;长读长时代 Flye 又用重复图把不完整读段组织为可解析单元。这组材料把总量叙述改成比例、阈值或结构量,具体含义是N50 的上升只有在错拼率、缺失率和单倍型塌缩同时受控时才有意义,单纯追求更长片段可能把2个真实拷贝错误合并。如果“被剪掉的低覆盖分支和替代单倍型”未进入分母,结论会天然偏向乐观。以德布鲁因图装配为对象,主证据的归幕年份为2008年,该时点固定了对象与观察窗。

k 值过小时重复区塌缩,过大时低覆盖区域断裂;杂合、污染与拷贝数变化会把图分叉解释推向相反方向。未解决的问题是装配器仍难在重复长度超过读长、且缺少长程连接时唯一恢复真实序列。尤其当重复长于所有连接信息时,更激进之图压缩会反过来提高错拼率的情形中,当前流程可能把真实反例过滤成低质量材料。一个直接反例是在保持主测量不变时改变图中真实分叉与错误分叉被正确区分这一条件;就“德布鲁因图装配”而言,结果若不随之改变,首要解释就不成立。

现代项目把装配图、覆盖轨迹和未解析分叉作为一等产物保存,以便后续泛基因组和结构变异分析重新使用。评审应同时看 BUSCO 完整度、QV、错拼和相位块,而不能只以 N50 排名。这使方法从一次性分析转成基础设施:维护者需要追溯“以正确装配碱基数占可评估参考碱基数的比例核算”的分母变化及其决策后果。以德布鲁因图装配为对象,可迁移性取决于谁被排除以及排除发生在哪一步,这两项都应成为结构化字段。 围绕德布鲁因图装配的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

证据责任落在可复算路径:对象如何进入、何处退出、退出后怎样改变结论,三步缺一不可。

位置S——主显露 单因决定装配正确性的只有图分叉被正确解释 预设〔03 有限近似控制无限对象〕有限 k-mer 集足以恢复完整基因组 量纲正确装配碱基数/可评估参考碱基数 失效当重复长于所有连接信息时,更激进的图压缩会反过来提高错拼率 自曝装配器承认多条等价路径存在,却通常只交付一条主装配 空栏被剪掉的低覆盖分支和替代单倍型在主 FASTA 中没有位置 异名另见第 338 号第 11 条『泛基因组与可动染色体:一个参考基因组不再代表一个真菌种』

丙、RNA-seq 定量:表达量从芯片强度变成读段生成率RNA-seq quantification

提出Mortazavi 等,2008 年《Nature Methods》5:621–628,DOI 10.1038/nmeth.1226 争议Trapnell 等,2010 年《Nature Biotechnology》28:511–515,DOI 10.1038/nbt.1621 最新Patro 等,2017 年《Nature Methods》14:417–419,DOI 10.1038/nmeth.4197 关键表达不再由探针亮度定义,而由片段长度、转录本共享和采样模型共同估计。

微阵列只能测量预先设计的探针,交叉杂交和饱和使不同基因的信号难以直接比较,未知转录本更无法进入读数。在RNA-seq的对象核查中,这里的判决不靠术语声望,而靠“以分配给目标转录本的片段数占全部有效片段数的比例核算”在独立样本中是否保持方向。

RNA-seq 把表达定义为转录本产生片段的概率,并用归一化和概率分配处理基因长度、测序深度与多重归属。它把因果责任集中到片段生成模型能否正确拆分共享读段,并留下明确失败标准:核心环节缺席时,原结果不应由另一条未记录路径原样维持。判决标准是先改变片段生成模型正确拆分共享读段这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

Mortazavi 等以每百万读段和每千碱基归一化展示哺乳动物转录组,Cufflinks 将剪接异构体纳入组装,Salmon 通过准映射和偏倚校正把大规模定量推进到分钟级。提出、争议与更新材料共同指向同一基因的基因级计数可以稳定,而转录本级比例因共享外显子和短读长不可识别而大幅波动,因此“表达差异”必须注明层级。在RNA-seq的读数核查中,执行层面的最低责任是同时报告分子、分母和未完成者,而不是只公布最佳批次。就RNA-seq的实证锚点而言,源行所列证据从2008年延伸到2017年,至少跨越2个公开研究阶段; 在RNA-seq证据链中,原始锚点仍是Mortazavi 等,2008 年《Nature Methods》5:621–628,DOI 10.1038/nmeth.1226;以RNA-seq为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

在强 3′ 偏倚、降解、批次与细胞组成变化下,归一化因子本身会吸收真实生物差异。以RNA-seq为对象,当场景、尺度或时间窗改变时,先复算共同分母,再讨论机制是否仍成立。 对RNA-seq的争议记录是Trapnell 等,2010 年《Nature Biotechnology》28:511–515,DOI 10.1038/nbt.1621;以RNA-seq为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

临床表达签名开始要求锁定建库平台、转录本注释和归一化版本,并用数字 PCR 或蛋白读数做正交验证。数据共享必须保留原始计数而非只交差异基因列表,以便新注释下重新计算。以RNA-seq为对象,原证据保留了一个明确锚点,但没有自动覆盖边界外对象;推广责任由此独立存在。以RNA-seq为对象,围绕RNA-seq的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 围绕RNA-seq的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 围绕RNA-seq的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

这里的判决不靠术语声望,而靠“共同读数”在独立样本中是否保持方向。

位置S——主显露 单因决定表达差异的只有片段生成率 预设〔02 单一读数代表复杂对象〕一个归一化表达值足以代表转录状态 量纲分配给目标转录本的片段数/全部有效片段数 失效当总 RNA 组成整体迁移时,归一化后数值会反向压低真实增加的转录本;越过该边界,分配给目标转录本的片段数可能上升而对象质量实质恶化,故价值符号反转。 自曝定量软件承认共享读段不可辨,却仍输出精确到小数的转录本丰度 空栏无法唯一分配的读段只作为概率质量,不在结果表中占一行 异名另见第 334 号第 1 条『MaxQuant 与无标记定量:从谱图清单转向可比较蛋白丰度』

丁、GATK 与最佳实践:变异识别变成可版本化的证据链GATK and variant-calling best practices

提出McKenna 等,2010 年《Genome Research》20:1297–1303,DOI 10.1101/gr.107524.110 争议DePristo 等,2011 年《Nature Genetics》43:491–498,DOI 10.1038/ng.806 最新Poplin 等,2018 年《Nature Biotechnology》36:983–987,DOI 10.1038/nbt.4235 关键变异不再是碱基不同,而是读段、质量、局部单倍型与校准模型共同支持的判决。

早期变异流程把每个位点独立比较,碱基质量、比对误差、重复和批次效应常被混在同一个阈值中处理。2010年McKenna 等把问题从“怎样得到一个结果”改成“哪些对象有资格进入结果”。在此之前,“低质量候选、人工否决及不可调用区在最终 VCF 中没有同等地位”通常被并入误差或直接删除,旧结论因而无法说明自己的可见边界。

GATK 将重比对、质量校准、局部组装、联合分型和变异质量重校准组织为可复算流水线。本条把证据链是否在样本和队列层面保持一致置于决定位置:只有这一环节成立,后续的规模、精度和应用才保持同一含义。若移除它而主要读数不变,GATK 与最佳实践只能保留为相关描述。

McKenna 等发布统一工具框架,DePristo 等用群体外显子数据建立最佳实践;DeepVariant 随后把候选位点转成图像式张量并在基准样本上取得高准确率。这些材料支持的具体解释是高准确率依赖 Genome in a Bottle 等真值集,但真值集在复杂重复区和不同祖源上的覆盖并不均匀。把结果写成“以通过全部质量过滤的变异数占候选变异总数的比例核算”后,分子、分母与不确定度可以同时复核,平台升级便不会被误写为生物变化。就GATK 与最的实证锚点而言,源行所列证据从2010年延伸到2018年,至少跨越2个公开研究阶段;在GATK 与最的读数核查中,这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。

当平台、读长、样本类型或参考版本改变时,既有校准模型可能把新型真实变异判为异常。尚未收敛的是复杂结构变异、低比例镶嵌和 HLA 等多态区域仍需要专门模型,单一小变异流程不能包办。2011年DePristo 等把这条边界推到争论中心。更关键的是,当真所涉值集不覆盖新平台或复杂区域时,更严格校准反而会删除真实变异;这时原来的正向解释可能被选择或补偿机制倒置。方法文献也承认:流程承认可调用区有限,却常将未调用区域并入全基因组阴性。

临床实验室把版本、参数、可调用区和人工复核写进报告,使“阴性”能够被解释为在哪些区域真正看过。同一患者的复分析需保留旧版判决及变化原因,避免软件升级悄然改写诊断历史。到2018年,Poplin 等把这一思路带入新场景。真实部署还要保存版本、失败样本和“低质量候选、人工否决及不可调用区在最终 VCF 中没有同等地位”的处置记录,才可区分迁移误差与对象变化。

旧口径遮住的是失败对象的去向;本项要求其与成功对象在同一观察窗内结算。

位置S——主显露 单因决定变异真实性的只有流程证据链完整 预设〔02 单一读数代表复杂对象〕一个质量分数足以代表多层证据 量纲通过全部质量过滤的变异数/候选变异总数 失效当真值集不覆盖新平台或复杂区域时,更严格校准反而会删除真实变异 自曝流程承认可调用区有限,却常把未调用区域并入全基因组阴性 空栏低质量候选、人工否决与不可调用区在最终 VCF 中没有同等地位 异名另见第 335 号第 4 条『记忆痕迹细胞:记忆从分布式活动变成可操控细胞集合』

戊、网络医学:疾病基因从列表变成模块与邻域Network medicine

提出Goh 等,2007 年《PNAS》104:8685–8690,DOI 10.1073/pnas.0701361104 争议Menche 等,2015 年《Science》347:1257601,DOI 10.1126/science.1257601 最新Halu 等,2019 年《Nature Reviews Genetics》20:509–523,DOI 10.1038/s41576-019-0126-0 关键疾病的计算对象不再是孤立基因,而是互作网络中的模块、距离和跨层连接。

候选基因方法把每个基因视为独立解释单元,难以说明同一疾病为何涉及不同通路,也难以利用蛋白互作和表型共现。2007年Goh 等把问题从“怎样得到一个结果”改成“哪些对象有资格进入结果”。在此之前,“尚尚尚未被实验过的潜在边与负互作在网络中没有字段”通常被并入误差或直接删除,旧结论因而无法说明自己的可见边界。

网络医学主张疾病表型由相互连接的分子模块产生,模块之间的距离可预测共病、药物重定位与副作用。本条把目标在多层互作网络中的相对位置置于决定位置:只有这一环节成立,后续的规模、精度和应用才保持同一含义。若移除它而主要读数不变,网络医学只能保留为相关描述。

Goh 等构建人类疾病网络,Menche 等用蛋白互作网络距离量化疾病分离与重叠;后续多层网络把组织、调控和药物靶点纳入同一框架。这些材料支持的具体解释是网络距离能够产生可检验排序,但边缺失、研究偏好和组织不匹配会让高度研究的蛋白天然成为枢纽。把结果写成“以跨疾病最短路径长度占网络可达路径平均长度的比例核算”后,分子、分母与不确定度可以同时复核,平台升级便不会被误写为生物变化。就网络医学疾病基的实证锚点而言,源行所列证据从2007年延伸到2019年,至少跨越2个公开研究阶段;证据能支持的范围止于已观察对象;对“尚尚尚未被实验过的潜在边与负互作在网络中没有字段”的外推必须另行检验。

当互作网络稀疏、方向和时间未知时,邻近不等于因果,模块边界可随数据库更新大幅漂移。尚未收敛的是如何把动态细胞状态和剂量效应纳入静态网络,仍是从关联图走向机制模型的瓶颈。2015年Menche 等把这条边界推到争论中心。更关键的是,当研究偏好使高频蛋白拥有更多边时,距离越近反而越能够能只是文献密度效应;这时原来的正向解释可能被选择或补偿机制倒置。方法文献也承认:网络所涉论文承认边不完备且无方向,却常以精确模块分数排序疾病。

药物重定位流程开始要求前瞻实验验证,而不是把网络近邻本身当作治疗证据。数据库应公开负互作、测量条件与文献支持数,避免缺边被误读为生物隔离。到2019年,Halu 等把这一思路带入新场景。真实部署还要保存版本、失败样本和“尚尚尚未被实验过的潜在边与负互作在网络中没有字段”的处置记录,才可区分迁移误差与对象变化。

若只保存终点图表,第三方无法恢复筛选次序;因此过程记录本身属于证据。

位置S——主显露 单因决定疾病关联的只有网络邻近 预设〔02 单一读数代表复杂对象〕一个网络距离足以代表疾病机制接近程度 量纲跨疾病最短路径长度/网络可达路径平均长度 失效当研究偏好使高频蛋白拥有更多边时,距离越近反而越可能只是文献密度效应 自曝网络论文承认边不完备且无方向,却常以精确模块分数排序疾病 空栏未被实验过的潜在边与负互作在网络中没有字段 异名另见第 337 号第 5 条『社会免疫:昆虫群体把疾病防御分布到互动网络』

己、宏基因组:微生物研究从可培养物种转向群落基因库Metagenomics

提出Qin 等,2010 年《Nature》464:59–65,DOI 10.1038/nature08821 争议Human Microbiome Project Consortium,2012 年《Nature》486:207–214,DOI 10.1038/nature11234 最新Almeida 等,2021 年《Nature Biotechnology》39:105–114,DOI 10.1038/s41587-020-0603-3 关键群落不再由培养皿中的物种代表,而由样本中的基因、基因组和功能路径直接重建。

传统微生物学依赖培养,难培养类群被系统排除,样本中的丰度和功能常由少数易培养代表物推断。随着数据量与分辨率上升,“无法分箱的 contig 和无注释基因只进入“尚未知”总栏”已不能再被解释为偶然噪声。2010年Qin 等把遗漏本身设为研究问题,领域由此开始追踪对象、路径与条件各自造成的差异。该命题的强处在可反驳:越过“当数据库偏向易培养类群时,注释率越高反而越能够能压低真正新颖群落”,结果必须允许翻转。

宏基因组以环境 DNA 直接重建群落基因目录、物种组成和代谢潜能,使不可培养成员进入主账本。其必要条件是样本中序列能否被正确分箱和注释。扩大样本或换用更复杂模型不能替代这一条件;入口若错,后端优化只会更稳定地复制入口错误。判决标准是先改变样本中序列被正确分箱和注释这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

2010 年人类肠道基因目录报告约 330 万个非冗余微生物基因,HMP 在多身体部位建立群落基线;统一人类胃肠基因组库随后显著扩展未培养物种的参考覆盖。这组证据把宏基因组从概念推进到可核对命题,因为物种数和功能数随数据库扩张增加,但同一短读段可来自多个近缘种,功能注释也常停在家族层而非实际反应。尤其需要保留“无法分箱的 contig 和无注释基因只进入“尚未知”总栏”,否则完整度、准确率或效应量都会被高估。就宏基因组微生物的实证锚点而言,本条固定2项可核量:分子“可被参考库注释的读段数”与分母“全部非宿主读段数”,复核时不得只报前者。

宿主污染、批次、提取偏好和低丰度装配会使群落差异大于真实生物差异。2012年Human Microbiome Project Consortium将问题压到一个可检查条件:基因存在并不等于表达或代谢通量,宏转录组、蛋白组和代谢组仍需补足执行层。当数据库偏向易培养类群时,注释率越高反而越能够能压低真正新颖群落,原本的优势反而会成为偏倚来源。

临床菌群研究开始要求纵向采样、阴性对照和绝对定量,并区分关联标志物与可干预机制。公共参考库需记录采样地域、宿主、培养状态和组装质量,避免未知序列被统一归为“其他”。由此产生的制度后果是,数据版本、排除理由和“无法分箱的 contig 和无注释基因只进入“尚未知”总栏”不能只留在实验室笔记里,而应进入正式结果。

该命题的强处在可反驳:越过“适用边界”,结果必须允许翻转。

位置D——主显露 单因决定群落功能的只有基因库组成 预设〔06 聚合次序不影响结论〕先按物种聚合还是先按功能聚合不会改变群落结论 量纲可被参考库注释的读段数/全部非宿主读段数 失效当数据库偏向易培养类群时,注释率越高反而越可能压低真正新颖群落 自曝宏基因组承认基因存在不等于表达,却常用功能丰度直接解释代谢作用 空栏无法分箱的 contig 和无注释基因只进入“未知”总栏 异名另见第 338 号第 4 条『沉默次生代谢基因簇:天然产物从培养偶遇转向基因组采矿』

庚、约束代谢模型:细胞功能从通路图变成可求解流量空间Constraint-based metabolic modeling

提出Orth、Thiele 与 Palsson,2010 年《Nature Biotechnology》28:245–248,DOI 10.1038/nbt.1614 争议Ebrahim 等,2013 年《BMC Systems Biology》7:74,DOI 10.1186/1752-0509-7-74 最新Robinson 等,2020 年《Science Signaling》13:eaaz1482,DOI 10.1126/scisignal.aaz1482 关键代谢网络不再只是箭头图,而是受化学计量、边界条件和目标函数约束的可行流量集合。

经典通路图列出反应却不能回答在给定营养和基因缺失下哪些流量组合仍可实现,定性箭头也难以预测代谢补偿。把“多重最优解”纳入记录后,旧框架把对象、过程与环境压成同一输出,异常来源因而无法定位。2010年Orth、Thiele 与 Palsson拆开这三层,使“多重最优解和被删去的旁路”从技术余数变成可以追踪的研究材料。以约束代谢模型细为对象,比较从平均值转向对象级账本,尤其检查被合并、退出和未分类三类记录。

通量平衡分析以化学计量守恒定义可行空间,并用目标函数和环境边界求出增长、产物或能量的可能流量。研究因此要先回答约束集是否真实限定了细胞可行空间是否成立。以“约束代谢模型”的证据链为准,只有答案为是,更大队列与更多特征才是增益;以“约束代谢模型”的证据链为准,否则它们只是提高错误结论的确定度。判决标准是先改变约束集真实限定了细胞可行空间这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

COBRA 框架把基因—蛋白—反应规则标准化,COBRApy 使大规模重建可编程;Human1 进一步整合人类代谢反应与组织表达,支持疾病和药物分析。由此可直接检验模型能正确预测部分基因必需性,但目标函数、交换边界和无效循环会显著改变结果。判断约束代谢模型是否成立,不看术语是否相同,而看“以满足实验约束的可行流量解数占全部数学可行解数的比例核算”在另一平台能否保持同向。本项拒绝把采用率当成效果;以约束代谢模型细为对象,真正的验收量是失败边界出现后读数是否按预期改变。 主证据的归幕年份为2010年,该时点固定了对象与观察窗。就约束代谢模型细的实证锚点而言,本条固定2项可核量:分子“满足实验约束的可行流量解数”与分母“全部数学可行解数”,复核时不得只报前者。

稳态假设在快速转录响应、细胞周期和空间梯度中失效,多个最优解也可能给出同一增长率。

工业生物技术用这些模型筛选敲除和供料策略,临床研究则用患者表达数据构建个体化代谢网络。模型版本必须附带反应来源、方向性与边界值,否则同名网络无法复现。走向真实应用后,约束代谢模型应按可审计记录验收,而不是按一次演示成功验收,特别要保留“多重最优解和被删去的旁路”。 围绕约束代谢模型细的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

比较从平均值转向对象级账本,尤其检查被合并、退出和未分类三类记录。

位置E——主显露 单因决定代谢行为的只有约束集 预设〔10 更多数据必然减少偏倚〕加入更多反应与组学数据会单调提高模型真实性 量纲满足实验约束的可行流量解数/全部数学可行解数 失效当新增反应引入无效循环时,网络越完整反而越容易产生虚假高产方案 自曝模型自己承认目标函数未知,却常把最大增长当作细胞唯一目标 空栏多重最优解和被删去的旁路在单一预测中没有位置 异名另见第 334 号第 18 条『空间代谢组整合:代谢物与细胞身份在同一切片对齐』

辛、物种树与基因树分离:系统发育从单树转向不一致集合Species trees versus gene trees

提出Maddison 与 Knowles,2006 年《Systematic Biology》55:21–30,DOI 10.1080/10635150500354928 争议Degnan 与 Rosenberg,2009 年《Trends in Ecology & Evolution》24:332–340,DOI 10.1016/j.tree.2009.01.009 最新Mirarab 等,2014 年《Bioinformatics》30:i541–i548,DOI 10.1093/bioinformatics/btu462 关键基因组中的树不必一致,物种历史需在不完全谱系排序与基因流背景下估计。

早期系统发育常把多个基因串联后求一棵最优树,默认每个位点共享同一分叉历史。早期研究可以回答“是否出现信号”,却回答不了信号属于谁、经何路径产生。2006年Maddison 与 Knowles用新的对象定义补上这段证据链,“被过滤之冲突基因和替代拓扑不进入最终树图”也因此不再是无名损失。

共祖模型把每个基因树视为物种树条件下的随机实现,并用大量局部树的不一致反推物种分化。该框架先检验基因树分布而非单一串联树的支持度,再讨论预测和应用。这个次序使“解释有效”与“模型拟合得好”分离,也给反例留下了明确入口。

Maddison 与 Knowles 用模拟显示多基因方法需要显式处理谱系排序,Degnan 与 Rosenberg 描述异常基因树区,ASTRAL 以四元组汇总在大规模基因组数据上估计物种树。数据的判决力来自高 bootstrap 的串联树仍可能在模型错配下稳定错误,基因树估计误差又会传递到物种树。换算成“以支持主拓扑的基因树数占全部可用基因树数的比例核算”后,失败对象与成功对象进入同一账本,方法净收益才可计算。可迁移性取决于谁被排除以及排除发生在哪一步,这2项都应成为结构化字段。就物种树与基因树的实证锚点而言,源行所列证据从2006年延伸到2014年,至少跨越2个公开研究阶段; 在物种树与基因树证据链中,原始锚点仍是Maddison 与 Knowles,2006 年《Systematic Biology》55:21–30,DOI 10.1080/10635150500354928;

杂交、水平转移、基因复制丢失和重组使单纯共祖模型不再完整。2009年Degnan 与 Rosenberg说明,边界应按条件而不是按学科名称划定。当基因流占主导时,加入更多位点会反过来将网状历史压成更自信的错误单树,结果即使稳定,也可能只是稳定地产生同一种误差。一个直接反例是在保持主测量不变时改变基因树分布而非单一串联树的支持度这一条件;以“物种树与基因树分离”的证据链为准,结果若不随之改变,首要解释就不成立。 对物种树与基因树的争议记录是Degnan 与 Rosenberg,2009 年《Trends in Ecology & Evolution》24:332–340,DOI 10.1016/j.tree.2009.01.009;

系统分类开始同时报告主拓扑、替代拓扑比例和冲突位点,而不是隐藏不一致。数据矩阵、过滤阈值和基因树集合必须公开,因为缺失位点选择可改变物种树。2014年Mirarab 等把问题推进到长期运行阶段,每次更新都应能说明哪些对象新增、哪些对象退出。 围绕物种树与基因树的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

本项把测量窗口固定下来,防止短期改善替代长期结局,也防止版本变化伪装成进步。

位置D——主显露 单因决定物种历史的只有局部树分布 预设〔06 聚合次序不影响结论〕先串联位点还是先估基因树不会改变物种树 量纲支持主拓扑的基因树数/全部可用基因树数 失效当基因流占主导时,加入更多位点会反过来把网状历史压成更自信的错误单树 自曝方法承认基因树估计误差,却常把低支持树当作真实随机样本汇总 空栏被过滤的冲突基因和替代拓扑不进入最终树图 异名另见第 338 号第 1 条『真菌生命树:六基因系统发育改写高阶分类』
【第二幕】这十年 · 约 2016—2026

第二幕的共同动作,是让计算从“分析已测数据”进入“定义对象、生成候选和组织协作”。单细胞、空间组学、基础模型、泛基因组图、联邦计算和生成式设计把算法推到实验之前与治理之中,也迫使领域重新审视泄漏、版本和失败样本。

一、单细胞计算:细胞类型由聚类标签转向状态分布Single-cell computational analysis

提出前身为Satija 等,2015 年《Nature Biotechnology》33:495–502,DOI 10.1038/nbt.3192 争议Luecken 与 Theis,2019 年《Molecular Systems Biology》15:e8746,DOI 10.15252/msb.20188746 最新Wolf、Angerer 与 Theis,2018 年《Genome Biology》19:15,DOI 10.1186/s13059-017-1382-0 关键分析对象从组织均值变为稀疏、高维且具有连续状态的单细胞分布。

组织测序把不同细胞平均在一起,少数细胞状态和谱系过渡被稀释;但单细胞矩阵又带来大量零值、批次与双细胞。在单细胞计算细胞的对象核查中,执行层面的最低责任是同时报告分子、分母和未完成者,而不是只公布最佳批次。

Seurat 与 Scanpy 等框架把质量控制、降维、邻接图、聚类和差异分析组织为细胞级计算流程。它把因果责任集中到局部邻域结构能否稳定重现,并留下明确失败标准:核心环节缺席时,原结果不应由另一条未记录路径原样维持。判决标准是先改变局部邻域结构稳定重现这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

Seurat 通过多标记联合识别空间与细胞异质性,Scanpy 用图方法扩展到百万细胞;实践指南随后系统展示过滤、归一化和批次校正的敏感性。提出、争议与更新材料共同指向聚类数和标记基因会随邻居数、分辨率和预处理改变,因此标签不是原始观测,而是模型产物。推广责任由此独立存在。就单细胞计算细胞的实证锚点而言,源行所列证据从2015年延伸到2018年,至少跨越2个公开研究阶段;复核时应同时报告“以跨批次保持同标签的细胞数占全部匹配细胞数的比例核算”的分子、分母和区间。 在单细胞计算细胞证据链中,原始锚点仍是前身为Satija 等,2015 年《Nature Biotechnology》33:495–502,DOI 10.1038/nbt.3192;以单细胞计算细胞为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

连续分化过程被强制切成离散类时,边界细胞会在不同流程间跳转。2019年Luecken 与 Theis提示,流程承认分辨率参数任意,却常将一个聚类方案写成自然分类。一个直接反例是在保持主测量不变时改变局部邻域结构稳定重现这一条件;在“该比率”的复核中,结果若不随之改变,首要解释就不成立。 对单细胞计算细胞的争议记录是Luecken 与 Theis,2019 年《Molecular Systems Biology》15:e8746,DOI 10.15252/msb.20188746;以单细胞计算细胞为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

细胞图谱项目开始保存原始计数、元数据和多层标签,并允许未来注释重写旧分类。疾病比较必须按供体而非按细胞数做独立重复,避免数十万细胞制造虚假样本量。2018年Wolf、Angerer 与 Theis所代表的扩展还要求把阴性与不可判定对象长期保存,否则外部复核只能看到成功路径。 围绕单细胞计算细胞的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

执行层面的最低责任是同时报告分子、分母和未完成者,而不是只公布最佳批次。

位置E——主显露 单因决定细胞类型的只有邻域稳定性 预设〔15 同名即同物〕相同细胞类型标签在不同数据集代表同一对象 量纲跨批次保持同标签的细胞数/全部匹配细胞数 失效当连续状态被强制聚类时,提高分辨率反而会制造更多看似独立的细胞类型 自曝流程承认分辨率参数任意,却常把一个聚类方案写成自然分类 空栏被质控删去的低 RNA 细胞和双细胞在图谱中没有本体位置 异名另见第 335 号第 10 条『单细胞脑细胞分类:神经元类型从形态名称转向多模态谱系』

二、AlphaFold:蛋白折叠从物理采样转向学习到的几何约束AlphaFold

提出Senior 等,2020 年《Nature》577:706–710,DOI 10.1038/s41586-019-1923-7 争议Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2 最新Abramson 等,2024 年《Nature》630:493–500,DOI 10.1038/s41586-024-07487-w 关键结构预测的决定变量从手工能量函数转为序列共演化、几何表示与学习到的置信度。

传统同源建模依赖已知模板,分子动力学难在可接受计算量内搜索巨大构象空间,无模板蛋白长期缺少高精度结构。在AlphaFo的对象核查中,这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。

AlphaFold 通过注意力网络整合多序列比对和残基对几何,直接预测三维坐标并给出逐残基置信度。它把因果责任集中到模型是否学到可迁移的几何约束,并留下明确失败标准:核心环节缺席时,原结果不应由另一条未记录路径原样维持。判决标准是先改变模型学到可迁移的几何约束这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

CASP13 版本显著提高无模板预测,AlphaFold2 在 CASP14 多数目标接近实验精度;AlphaFold3 又将复合物、核酸和小分子纳入统一扩散式框架。提出、争议与更新材料共同指向高 pLDDT 表示模型内部一致,并不等于动态构象、配体状态或细胞环境已经被验证。 在AlphaFo证据链中,原始锚点仍是Senior 等,2020 年《Nature》577:706–710,DOI 10.1038/s41586-019-1923-7; 主证据的归幕年份为2020年,该时点固定了对象与观察窗。就AlphaFo的实证锚点而言,本条固定2项可核量:分子“高置信残基数”与分母“蛋白全部残基数”,复核时不得只报前者。以AlphaFo为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

无序区、构象转换、共价修饰和新颖配体可使单一静态结构误导功能解释。资源成本不是背景变量;若发现“替代所涉构象、无序集合和失败复合物不进入单模型文件”需要额外投入,该投入必须入分母。因此边界检验要把“替代所涉构象、无序集合和失败复合物不进入单模型文件”放回分析,观察“以高置信残基数占蛋白全部残基数的比例核算”是否随之改变方向。一个直接反例是在保持主测量不变时改变模型学到可迁移的几何约束这一条件;以“AlphaFold”的证据链为准,结果若不随之改变,首要解释就不成立。 对AlphaFo的争议记录是Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2;以AlphaFo为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

结构数据库从实验稀缺资源变为全蛋白组假说库,加速突变解释和靶点筛选。使用预测结构时应同时公开置信度、模板日期和实验验证状态,不能把颜色图当作晶体结构。在AlphaFo的治理核查中,证据责任落在可复算路径:对象如何进入、何处退出、退出后怎样改变结论,三步缺一不可。

这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。

位置S——主显露 单因决定蛋白功能解释的只有预测结构 预设〔03 有限近似控制无限对象〕有限训练结构足以覆盖蛋白构象空间 量纲高置信残基数/蛋白全部残基数 失效当蛋白依赖构象切换时,置信度越高反而越可能固化一个非功能状态 自曝系统自己输出低置信和对齐误差,却常在二次研究中被裁掉 空栏替代构象、无序集合和失败复合物不进入单模型文件 异名另见第 334 号第 1 条『MaxQuant 与无标记定量:从谱图清单转向可比较蛋白丰度』

三、单细胞基础模型:细胞表达矩阵被当作可预训练语言Single-cell foundation models

提出Cui 等,2024年《Nature Methods》21:1470–1480,DOI 10.1038/s41592-024-02201-0 争议Kedzierska 等,2025年《Genome Biology》26:101,DOI 10.1186/s13059-025-03574-x 最新Tejada-Lapuerta、Schaar、Gutgesell 等,2025年《Nature Methods》22:2525–2538,DOI 10.1038/s41592-025-02814-z 关键大规模细胞预训练模型试图把基因共现、状态和空间邻域压入统一表示。

传统单细胞模型通常为每个数据集重新训练,标签和批次知识难以跨组织、物种与平台迁移。旧方法遇到例外时,常以过滤、合并或扩大误差项维持原解释。2024年Cui 等把例外改写为可检验对象,并要求说明“从未进入公共图谱的细胞状态”在何处、为何被排除。

基础模型以数千万至上亿细胞进行自监督预训练,再通过微调或零样本任务完成注释、扰动预测和整合。决定性的并非读数是否漂亮,而在于预训练表示编码可复用的细胞规律能否在独立样本和正交测量中维持。只在原始数据集成立的关系,还不能称为可迁移机制。判决标准是先改变预训练表示编码可复用的细胞规律这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

scGPT 将基因表达序列化后用于多组学任务,Nicheformer 汇集超过一亿个单细胞与空间细胞学习邻域表示;独立零样本评测却发现部分模型并未稳定超过较简单基线。这些结果说明参数规模和预训练细胞数不是生物泛化的同义词,训练集重叠、标签继承和数据泄漏会抬高成绩。最醒目的单一读数未必最有判别力;真正需要复制的是“以跨研究零样本正确注释数占全部测试细胞数的比例核算”在新样本上是否保持方向。就单细胞基础模型的实证锚点而言,源行所列证据从2024年延伸到2025年,至少跨越2个公开研究阶段; 在单细胞基础模型证据链中,原始锚点仍是Cui 等,2024年《Nature Methods》21:1470–1480,DOI 10.1038/s41592-024-02201-0;

不同物种、疾病和实验平台的表达分布漂移可使表示失效,罕见状态尤其容易被多数类吸收。争论的核心不是“还要不要研究”,而是模型究竟学到调控因果还是共现统计,仍需基因扰动和前瞻外推验证。当预所涉训练语料高度偏向常见组织时,数据越多反而越会吞没罕见状态,方向反转本身就是对强解释的判决。 对单细胞基础模型的争议记录是Kedzierska 等,2025年《Genome Biology》26:101,DOI 10.1186/s13059-025-03574-x;

未来细胞图谱可能同时发布数据与可查询模型,但版本、许可和可解释性将成为公共基础设施问题。基准必须按供体、研究和时间隔离训练测试,并公开预训练语料来源。进入常规流程后,最需要锁定的是对象进入规则、时间窗和版本;否则规模越大,定义漂移影响越广。 围绕单细胞基础模型的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

证据能支持的范围止于已观察对象;对“账外对象”的外推必须另行检验。

位置S——主显露 单因决定迁移效果的只有预训练表示规模 预设〔15 同名即同物〕不同研究中的同名细胞标签可无损合并为一种训练对象 量纲跨研究零样本正确注释数/全部测试细胞数 失效当预训练语料高度偏向常见组织时,数据越多反而越会吞没罕见状态 自曝模型论文承认训练语料与标签继承,却常把同源数据上的优势称为零样本泛化 空栏从未进入公共图谱的细胞状态在模型词表中没有位置 异名另见第 335 号第 19 条『长读长脑转录组:基因表达让位于细胞型特异异构体』

四、空间组学:表达矩阵重新获得组织坐标Spatial omics

提出Ståhl 等,2016 年《Science》353:78–82,DOI 10.1126/science.aaf2403 争议Rodriques 等,2019 年《Science》363:1463–1467,DOI 10.1126/science.aaw1219 最新Tejada-Lapuerta、Schaar、Gutgesell 等,2025年《Nature Methods》22:2525–2538,DOI 10.1038/s41592-025-02814-z 关键细胞状态不再脱离位置解释,邻域、边界与组织结构成为表达的一部分。

解离单细胞测序打散组织,细胞类型可被识别,却失去谁与谁相邻、位于何种微环境的信息。就“空间组学:表达矩阵重新获得组织坐标”而言,旧框架把对象、过程与环境压成同一输出,异常来源因而无法定位。2016年Ståhl 等拆开这三层,使“切片所涉之外、分割失败和低 RNA 区域没有细胞标签”从技术余数变成可以追踪的研究材料。

空间转录组和成像式测序把基因表达映射回组织坐标,使细胞邻域和形态边界成为计算对象。研究因此要先回答空间位置是否与分子状态共同建模是否成立。在“以被可靠分配到细胞的转录本数占全部检测转录本数的比例核算”的复核中,只有答案为是,更大队列与更多特征才是增益;在“以被可靠分配到细胞的转录本数占全部检测转录本数的比例核算”的复核中,否则它们只是提高错误结论的确定度。判决标准是先改变空间位置与分子状态共同建模这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

Ståhl 等以条码阵列展示组织切片表达图,Slide-seq 将分辨率推进到近细胞尺度;新一代模型开始在数千万空间细胞上学习跨组织邻域表示。由此可直接检验分辨率提高会减少每个位置的分子数,空间平滑虽能补信号,也可能制造不存在的连续梯度。判断空间组学是否成立,不看术语是否相同,而看“该比率”在另一平台能否保持同向。就空间组学表达矩的实证锚点而言,源行所列证据从2016年延伸到2025年,至少跨越2个公开研究阶段;复核时应同时报告“该比率”的分子、分母和区间。 在空间组学表达矩证据链中,原始锚点仍是Ståhl 等,2016 年《Science》353:78–82,DOI 10.1126/science.aaf2403;以空间组学表达矩为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

切片厚度、细胞分割和探针面板会使邻接关系依赖技术平台。在空间组学表达矩的边界核查中,本项先把“切片所涉之外、分割失败和低 RNA 区域没有细胞标签”放回分母,再判断可见结果是否代表总体。 对空间组学表达矩的争议记录是Rodriques 等,2019 年《Science》363:1463–1467,DOI 10.1126/science.aaw1219;以空间组学表达矩为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

病理学开始把空间分子图与 H&E、免疫染色和临床结局联合,形成可回到切片位置的标志物。空间数据必须保存原始图像、坐标变换和分割版本,否则无法复核邻域。

当场景、尺度或时间窗改变时,先复算共同分母,再讨论机制是否仍成立。

位置D——主显露 单因决定组织功能的只有空间邻域 预设〔10 更多数据必然减少偏倚〕提高空间分辨率会单调接近真实组织 量纲被可靠分配到细胞的转录本数/全部检测转录本数 失效当每格分子数过低时,分辨率越高反而越依赖平滑并制造假边界 自曝平台承认分割和解卷积不确定,却常只发布一张确定细胞地图 空栏切片之外、分割失败和低 RNA 区域没有细胞标签 异名另见第 334 号第 8 条『成像质谱与成像质谱流式:蛋白进入组织坐标』

五、多组学整合:共同嵌入取代逐层相关Multi-omics integration

提出Argelaguet 等,2018 年《Molecular Systems Biology》14:e8124,DOI 10.15252/msb.20178124 争议Stuart 等,2019 年《Cell》177:1888–1902.e21,DOI 10.1016/j.cell.2019.05.031 最新Luecken 等,2022 年《Nature Methods》19:41–50,DOI 10.1038/s41592-021-01336-8 关键不同组学不再按两两相关拼接,而由潜在因子、锚点或图结构学习共同与特异变化。

基因组、转录组、蛋白组和表观组各自具有不同噪声、尺度与缺失,简单相关容易把批次共同性当成生物共同性。该领域长期把中心趋势当作对象本身,边缘材料则被视为质量问题。2018年Argelaguet 等显示,边缘处可能正是机制分叉的位置,因此“被过度校正消失之稀有状态没有独立错误栏”需要单独解释。本项拒绝把采用率当成效果;

MOFA、锚点对齐和多模态邻接图通过潜在空间同时解释跨层共有变异与层特异变异。本条只承认共同潜在结构是否来自生物而非批次是首要环节。若其他变量能够完全替代它,现有证据支持的就是多路径等价,而不是该机制的决定性。判决标准是先改变共同潜在结构来自生物而非批次这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

MOFA 用因子模型分解多组学变异,Seurat v3 以锚点转移细胞标签;大规模基准显示不同方法在标签转移、批次去除和稀有群保留之间没有单一冠军。证据并非只证明“可用”,而是表明混合得越均匀不等于整合越好,过度校正可把疾病特异状态一起抹平。任何复制都应沿用“以跨模态保留的邻居对数占全部候选邻居对数的比例核算”的对象范围和观察窗口,否则2个结果不能直接合并。 在多组学整合共同证据链中,原始锚点仍是Argelaguet 等,2018 年《Molecular Systems Biology》14:e8124,DOI 10.15252/msb.20178124;以多组学整合共同为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

当各组学来自不同细胞或不同供体时,伪配对会生成看似连续的共同空间。如何在保留真实异质性的同时校正技术差异,仍需任务特异判据。方法文献自己承认方法承认批次及生物不可完全分离,却常以混合度最高者为最好,所以严格验证应主动寻找这一反向情形,而不是把它留在附注。 对多组学整合共同的争议记录是Stuart 等,2019 年《Cell》177:1888–1902.e21,DOI 10.1016/j.cell.2019.05.031;以多组学整合共同为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

临床多组学研究开始预先定义整合目标,是预测、分型还是机制,而不是先做 UMAP 再寻找故事。算法评估应同时报告批次混合、标签保持和下游可重复性三类指标。2022年Luecken 等的应用表明,实施成本不只在设备和算力,还在长期保存失败路径与边界条件。因此过程记录本身属于证据。 围绕多组学整合共同的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

真正的验收量是失败边界出现后读数是否按预期改变。

位置E——主显露 单因决定跨组学一致性的只有对齐方式 预设〔06 聚合次序不影响结论〕先分别归一化还是先联合建模不会改变共同因子 量纲跨模态保留的邻居对数/全部候选邻居对数 失效当疾病信号与批次共线时,校正越强反而越会删除真实效应 自曝方法承认批次与生物不可完全分离,却常以混合度最高者为最好 空栏被过度校正消失的稀有状态没有独立错误栏 异名另见第 336 号第 2 条『行为综合征:跨情境相关约束取代逐项最优化』

六、长读长转录组:异构体从推断对象变成单分子路径Long-read transcriptomics

提出Li,2018 年《Bioinformatics》34:3094–3100,DOI 10.1093/bioinformatics/bty191 争议Tang 等,2020 年《Nature Communications》11:1438,DOI 10.1038/s41467-020-15171-6 最新Clavell-Revelles 等,2025年《Nature Communications》16:10194,DOI 10.1038/s41467-025-66096-x 关键完整转录本的外显子连接可由单分子直接读取,减少短读长拼接的组合歧义。

短读长覆盖外显子片段,却常无法确认远距离外显子属于同一分子,复杂异构体和融合转录本因此依赖统计拼接。过去一旦得出总体结果,进入分母之外的材料便很少继续保存。2018年Li改变了这种结算方式:“无法到达两端之部分分子与降解路径在主注释中没有身份”会直接影响结论边界,不能再被静默丢弃。

长读长 RNA 测序把完整分子作为基本对象,通过误差校正和剪接位点聚类直接建立异构体目录。该主张把全长分子路径被重复观察写成可扰动的先决条件。若阻断后结果不变,或结果先于该环节出现,长读长转录组就需要重新命名。判决标准是先改变全长分子路径被重复观察这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

minimap2 提供剪接感知长读长比对,FLAIR 结合短读长和注释校正异构体;2025 年跨祖源队列以超过 8 亿条全长读段扩展人类基因注释。这些数字同时给出支持与边界:单分子路径减少组合歧义,但原始错误率、5′截断和 PCR 偏倚仍会生成伪异构体。若将“无法到达两端之部分分子与降解路径在主注释中没有身份”从分析中拿走,原本的机制证据可能退化为选择效应。就长读长转录组异的实证锚点而言,本条固定2项可核量:分子“被2条以上全长读段支持的异构体数”与分母“全部候选异构体数”,复核时不得只报前者。 在长读长转录组异证据链中,原始锚点仍是Li,2018 年《Bioinformatics》34:3094–3100,DOI 10.1093/bioinformatics/bty191;以长读长转录组异为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

低表达转录本需要极深测序,少数异常分子难与技术错误分开。异构体存在是否产生稳定蛋白,仍需核糖体和蛋白组验证。最有判别力的研究不是再做一次同条件复制,而是当保持主测量不变时主动触发“截断和错误集中在转录本端部时,测得越深反而越会扩增伪异构体种类”。 对长读长转录组异的争议记录是Tang 等,2020 年《Nature Communications》11:1438,DOI 10.1038/s41467-020-15171-6;

罕见病与肿瘤研究可直接观察异常剪接和融合,注释开始纳入群体与组织特异转录本。目录应区分高置信重复异构体、单分子候选和降解产物,避免所有路径等价进入基因模型。后续流程应把“以被两条以上全长读段支持的异构体数占全部候选异构体数的比例核算”设为持续监测量;一旦版本更新改变分母,旧结果就需要重新标注。

可迁移性取决于谁被排除以及排除发生在哪一步,这两项都应成为结构化字段。

位置E——主显露 单因决定异构体真实性的只有全长路径重复 预设〔15 同名即同物〕相同外显子链即可视为同一功能异构体 量纲被两条以上全长读段支持的异构体数/全部候选异构体数 失效当截断和错误集中当转录本端部时,测得越深反而越会扩增伪异构体种类 自曝流程承认大量单读段异构体不可靠,却常把它们并入总多样性 空栏无法到达两端的部分分子与降解路径在主注释中没有身份 异名另见第 335 号第 19 条『长读长脑转录组:基因表达让位于细胞型特异异构体』

七、泛基因组图:参考坐标从一条线变成多路径图Pangenome graphs

提出Garrison 等,2018 年《Nature Biotechnology》36:875–879,DOI 10.1038/nbt.4227 争议Li、Feng 与 Chu,2020 年《Genome Biology》21:265,DOI 10.1186/s13059-020-02168-z 最新Liao 等,2023 年《Nature》617:312–324,DOI 10.1038/s41586-023-05896-x 关键参考不再是单一个体的序列,而是容纳替代单倍型和结构变异的可遍历路径集合。

线性参考使与参考差异大的读段更难映射,非参考插入和复杂单倍型缺少稳定坐标。该领域长期把中心趋势当作对象本身,边缘材料则被视为质量问题。2018年Garrison 等显示,边缘处可能正是机制分叉的位置,因此“尚尚尚未进入图的祖源特异序列仍被当作未比对垃圾”需要单独解释。推广责任由此独立存在。

变异图和泛基因组把多条单倍型编码为节点与边,使读段可以沿最匹配路径比对并在图坐标中调用变异。本条只承认真实群体路径是否进入参考图是首要环节。若其他变量能够完全替代它,现有证据支持的就是多路径等价,而不是该机制的决定性。判决标准是先改变真实群体路径进入参考图这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

vg 展示图基因组映射与基因分型,minigraph 可扩展构建大规模图;人类泛基因组草案以 47 个个体的高质量单倍型显著增加非参考序列。证据并非只证明“可用”,而是表明图可降低参考偏倚,但路径数量、版本和坐标转换增加了复现与临床报告成本。任何复制都应沿用“以样本读段可达的图路径数占图中全部候选路径数的比例核算”的对象范围和观察窗口,否则2个结果不能直接合并。 在泛基因组图参考证据链中,原始锚点仍是Garrison 等,2018 年《Nature Biotechnology》36:875–879,DOI 10.1038/nbt.4227;它固定了对象、年份与出处,独立复核不得用异题评论替换。 在泛基因组图参考证据链中,原始锚点仍是Garrison 等,2018 年《Nature Biotechnology》36:875–879,DOI 10.1038/nbt.4227;它固定了对象、年份与出处,独立复核不得用异题评论替换。

若图仍由有限祖源构成,缺席人群的特异序列依旧无法被召回。全球稳定图坐标、图上注释和版本兼容尚未形成统一标准。方法文献自己承认图方法承认版本及路径选择影响坐标,却常以总非参考碱基数代表进步,所以严格验证应主动寻找这一反向情形,而不是把它留在附注。 对泛基因组图参考的争议记录是Li、Feng 与 Chu,2020 年《Genome Biology》21:265,DOI 10.1186/s13059-020-02168-z;未公开检验的部分继续保留为未知状态,不并入支持证据。

临床实验室未来可能按区域使用图参考,同时保留与现行线性坐标的双向映射。新增路径必须有质量、祖源和同意信息,不能把代表性问题转化为无来源节点。2023年Liao 等的应用表明,实施成本不只在设备和算力,还在长期保存失败路径与边界条件。 围绕泛基因组图参考的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

原证据保留了一个明确锚点,但没有自动覆盖边界外对象;

位置E——主显露 单因决定参考偏倚的只有路径覆盖 预设〔03 有限近似控制无限对象〕有限样本路径足以代表人类序列多样性 量纲样本读段可达的图路径数/图中全部候选路径数 失效当图加入大量近似路径而缺少坐标治理时,覆盖越广反而越会增加歧义映射 自曝图方法承认版本与路径选择影响坐标,却常以总非参考碱基数代表进步 空栏未进入图的祖源特异序列仍被当作未比对垃圾 异名另见第 331 号第 11 条『人类泛基因组:单一参考序列让位于多路径参照』

八、可重现工作流:分析从脚本集合变成有依赖图的执行对象Reproducible workflows

提出前身为Goecks 等,2010 年《Genome Biology》11:R86,DOI 10.1186/gb-2010-11-8-r86 争议Di Tommaso 等,2017 年《Nature Biotechnology》35:316–319,DOI 10.1038/nbt.3820 最新Ewels 等,2020 年《Nature Biotechnology》38:276–278,DOI 10.1038/s41587-020-0439-x 关键可重现性不再等于共享代码,而是数据、软件、参数、容器与依赖被同一执行图锁定。

分析常由个人脚本和手工步骤组成,同一代码在软件版本、路径与并行环境变化后无法重跑。在“以成功重跑的流程步骤数占全部声明步骤数的比例核算”的复核中,旧框架把对象、过程与环境压成同一输出,异常来源因而无法定位。2010年Goecks 等拆开这三层,使“手工所涉排除、标签修正和失败重跑在正式 DAG 中没有字段”从技术余数变成可以追踪的研究材料。

Galaxy、Nextflow 和 nf-core 将输入、步骤、依赖、资源和输出声明为可执行工作流,并用容器和版本锁定环境。研究因此要先回答完整依赖图能否被重新执行是否成立。把“手工排除、标签修正”纳入记录后,只有答案为是,更大队列与更多特征才是增益;把“手工排除、标签修正”纳入记录后,否则它们只是提高错误结论的确定度。判决标准是先改变完整依赖图被重新执行这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

Galaxy 提供网页化可追踪历史,Nextflow 用数据流模型跨本地与云环境运行,nf-core 建立社区审查和持续测试的标准流程库。由此可直接检验工作流成功结束只说明计算链执行,并不保证科学问题、样本标签和统计假设正确。判断可重现工作流是否成立,不看术语是否相同,而看“以成功重跑的流程步骤数占全部声明步骤数的比例核算”在另一平台能否保持同向。证据责任落在可复算路径:对象如何进入、何处退出、退出后怎样改变结论,3步缺一不可。就可重现工作流分的实证锚点而言,源行所列证据从2010年延伸到2020年,至少跨越2个公开研究阶段;复核时应同时报告“该比率”的分子、分母和区间。 在可重现工作流分证据链中,原始锚点仍是前身为Goecks 等,2010 年《Genome Biology》11:R86,DOI 10.1186/gb-2010-11-8-r86;

外部数据库更新、私有数据和硬件非确定性仍会使相同流程得到不同结果。2017年Di Tommaso 等给出的边界意味着:当外所涉部数据库静默更新时,自动化程度越高反而越会无声改变结果,原来的解释会被对象构成、时间窗或测量过程反向塑形。

期刊和临床项目开始要求工作流标识符、版本和最小测试数据,使结果可在受控环境复算。流程更新要记录为何改变、影响哪些样本,并保留旧版本结果,避免“最新”自动覆盖审计链。走向真实应用后,可重现工作流应按可审计记录验收,而不是按一次演示成功验收,特别要保留“手工所涉排除、标签修正和失败重跑在正式 DAG 中没有字段”。 围绕可重现工作流分的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

同名方法在不同机构可能处理不同对象,必须先锁定对象、分母与停止规则。

位置E——主显露 单因决定复现的只有执行图完整 预设〔28 记录存在即可核对〕有代码与容器就等于研究可复现 量纲成功重跑的流程步骤数/全部声明步骤数 失效当外部数据库静默更新时,自动化程度越高反而越会无声改变结果 自曝工作流承认输入语义和研究设计在图外,却常以绿色通过标志代表完整复现 空栏手工排除、标签修正和失败重跑在正式 DAG 中没有字段 异名另见第 335 号第 4 条『记忆痕迹细胞:记忆从分布式活动变成可操控细胞集合』

九、隐私计算与联邦生物信息:数据不再必须集中Privacy-preserving and federated bioinformatics

提出前身为Shringarpure 与 Bustamante,2015 年《American Journal of Human Genetics》97:631–646,DOI 10.1016/j.ajhg.2015.09.010 争议Sheller 等,2020 年《Scientific Reports》10:12598,DOI 10.1038/s41598-020-69250-1 最新Warnat-Herresthal 等,2021 年《Nature》594:265–270,DOI 10.1038/s41586-021-03583-3 关键跨机构分析的对象由集中数据湖转为受治理的模型更新、查询与安全聚合。

基因组和临床数据高度可识别,集中共享面临同意、法律和攻击风险;但完全不共享又限制稀有病和多中心学习。就“隐私计算与联邦生物信息”而言,此前的困难并非缺少算法,而是旧算法先验规定了什么算证据。2015年Shringarpure 与 Bustamante改变了这一入口,过去没有独立位置的“因算力、法律或样本过小而尚未加入的机构不在全局模型分母”开始进入证据链。

联邦学习、安全聚合和最小查询使各机构保留原始数据,只交换受控统计量或模型参数。这一命题允许直接做否定实验:阻断或替代更新能在不暴露个体的条件下聚合,核心结果应同步改变。在“以满足隐私预算的更新次数占全部模型更新次数的比例核算”的复核中,若结果保持不变,理论就失去决定性解释。判决标准是先改变更新能在不暴露个体的条件下聚合这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

Beacon 攻击研究显示简单存在性查询可泄露成员身份,Sheller 等比较集中与联邦医学影像学习,Swarm Learning 在去中心化节点间完成临床分类。从2015年到2021年,证据链的共同含义是数据不出域并不等于无泄露,梯度、模型更新和小中心统计仍可能暴露个体或站点特征。“以满足隐私预算的更新次数占全部模型更新次数的比例核算”因此不仅是性能指标,也是检查对象定义是否漂移的最低尺度。在隐私计算与联邦的读数核查中,这里的判决不靠术语声望,而靠“以满足隐私预算的更新次数占全部模型更新次数的比例核算”在独立样本中是否保持方向。就隐私计算与联邦的实证锚点而言,本条固定2项可核量:分子“满足隐私预算的更新次数”与分母“全部模型更新次数”,复核时不得只报前者。

非独立同分布、中心掉线与算力差异会使聚合偏向大中心。现阶段还需要区分如何同时审计隐私预算、性能公平和模型漂移仍缺统一报告标准。方法材料已留下警告——联邦研究承认梯度可泄露且分布不齐,却常以“数据尚未移动”作为安全结论——但不少应用没有据此降低结论强度。一个直接反例是在保持主测量不变时改变更新能在不暴露个体的条件下聚合这一条件;就“隐私计算与联邦生物信息”而言,结果若不随之改变,首要解释就不成立。

国家级生物库可用分布式查询完成病例计数和联合分析,减少复制敏感原始数据。参与中心、退出权、更新频率和攻击测试必须成为协议组成,而非部署后的附加安全层。2021年Warnat-Herresthal 等推进了应用,也暴露出现实门槛:流程能运行,不等于结论在新对象上仍成立。

只有把反向事件写进主表,读数上升才不至于与实质恶化混为一谈。

位置D——主显露 单因决定合作的只有更新可安全聚合 预设〔28 记录存在即可核对〕交换日志完整就足以证明隐私与公平 量纲满足隐私预算的更新次数/全部模型更新次数 失效当小站点分布不同而权重按样本量聚合时,参与中心越多反而越会压低少数中心性能 自曝联邦研究承认梯度可泄露且分布不齐,却常以“数据未移动”作为安全结论 空栏因算力、法律或样本过小而未加入的机构不在全局模型分母 异名另见第 333 号第 7 条『癌症表观遗传:驱动不再必须改变 DNA 字母』

十、Perturb-seq:从相关矩阵转向可并行的因果扰动Perturb-seq and causal perturbation maps

提出Dixit 等,2016 年《Cell》167:1853–1866.e17,DOI 10.1016/j.cell.2016.11.038 争议Norman 等,2019 年《Cell》177:1863–1875.e21,DOI 10.1016/j.cell.2019.05.013 最新Replogle 等,2022 年《Cell》185:2559–2575.e28,DOI 10.1016/j.cell.2022.05.013 关键基因调控关系不再只由共表达推断,而由条形码扰动与单细胞响应直接估计。

共表达网络难区分因果方向和共同上游,单基因敲除又难以在大量基因与细胞状态上并行测量。

Perturb-seq 把 CRISPR 扰动条形码与单细胞转录组结合,在同一实验中读取基因干预和全局细胞响应。它把因果责任集中到受控扰动是否引起可重复状态变化,并留下明确失败标准:核心环节缺席时,原结果不应由另一条未记录路径原样维持。判决标准是先改变受控扰动引起可重复状态变化这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

Dixit 等在免疫细胞中并行解析转录因子作用,Norman 等绘制组合扰动产生的新细胞状态,Replogle 等扩展到全基因组尺度的必需基因图谱。提出、争议与更新材料共同指向大规模扰动增强方向性,但编辑效率、细胞选择和条形码误配会把干预强度混入效应。旧口径遮住的是失败对象的去向;本项要求其与成功对象在同一观察窗内结算。就Perturb的实证锚点而言,源行所列证据从2016年延伸到2022年,至少跨越2个公开研究阶段;复核时应同时报告“以产生可重复响应的 guide 数占全部有效 guide 数的比例核算”的分子、分母和区间。 在Perturb证据链中,原始锚点仍是Dixit 等,2016 年《Cell》167:1853–1866.e17,DOI 10.1016/j.cell.2016.11.038;它固定了对象、年份与出处,独立复核不得用异题评论替换。 在Perturb证据链中,原始锚点仍是Dixit 等,2016 年《Cell》167:1853–1866.e17,DOI 10.1016/j.cell.2016.11.038;它固定了对象、年份与出处,独立复核不得用异题评论替换。

强致死扰动使目标细胞在测量前消失,观察到的幸存者并非原始总体。一个直接反例是在保持主测量不变时改变受控扰动引起可重复状态变化这一条件;把“死亡细胞、未编辑细胞”纳入记录后,结果若不随之改变,首要解释就不成立。 对Perturb的争议记录是Norman 等,2019 年《Cell》177:1863–1875.e21,DOI 10.1016/j.cell.2019.05.013;未公开检验的部分继续保留为未知状态,不并入支持证据。

药物靶点筛选开始以细胞状态轨迹而非单一存活率评价干预,并可与空间模型结合。实验必须报告未感染、无效 guide 和细胞丢失,避免只对存活细胞讲因果。在Perturb的治理核查中,这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。 复核时还须冻结对象定义、观察窗口、停止规则与资源预算,并逐一登记退出、未分类和未进入记录的对象。 围绕Perturb的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 对Perturb的外推必须另列时间窗、地点、尺度和资源预算;这些条件改变时,原方向不自动延续。

本项的复核单位不是一次成功,而是成功、失败与未知状态组成的完整事件集。

位置D——主显露 单因决定调控因果的只有受控扰动响应 预设〔10 更多数据必然减少偏倚〕扩大扰动规模会单调逼近真实调控网络 量纲产生可重复响应的 guide 数/全部有效 guide 数 失效当强扰动当测量前淘汰细胞时,筛得越全面反而越会漏掉最关键必需基因 自曝平台承认编辑效率与幸存偏差,却常以终点细胞状态代表全部反应 空栏死亡细胞、未编辑细胞和多 guide 细胞在主效应矩阵中没有位置 异名另见第 338 号第 9 条『CRISPR 真菌遗传学:从低效同源重组转向可编程扰动』

十一、生成式蛋白设计:算法从预测天然结构转向提出新序列Generative protein design

提出Dauparas 等,2022 年《Science》378:49–56,DOI 10.1126/science.add2187 争议Watson 等,2023 年《Nature》620:1089–1100,DOI 10.1038/s41586-023-06415-8 最新Abramson 等,2024 年《Nature》630:493–500,DOI 10.1038/s41586-024-07487-w 关键计算模型不再只回答天然蛋白会折成什么,而开始给定几何与功能约束生成可合成序列。

传统蛋白工程依赖突变扫描和专家直觉,设计空间巨大,许多候选在折叠、表达或功能上失败。在“以实验验证成功的设计数占全部合成设计数的比例核算”的复核中,旧框架把对象、过程与环境压成同一输出,异常来源因而无法定位。2022年Dauparas 等拆开这三层,使“尚尚尚未合成、未表达和低活性候选不进入成功率叙事”从技术余数变成可以追踪的研究材料。把“未合成、未表达”纳入记录后,这个区分使后来研究能够追溯旧结论究竟遗漏了哪一类材料。

ProteinMPNN 与 RFdiffusion 分别从目标骨架生成序列、从功能约束生成骨架,把设计变成可采样的条件生成问题。研究因此要先回答生成模型能否把功能约束转成可折叠序列是否成立。把“未合成、未表达”纳入记录后,只有答案为是,更大队列与更多特征才是增益;把“未合成、未表达”纳入记录后,否则它们只是提高错误结论的确定度。判决标准是先改变生成模型把功能约束转成可折叠序列这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

ProteinMPNN 在多类骨架上提高序列恢复与实验成功率,RFdiffusion 展示对称体、结合蛋白和酶样骨架的去 novo 设计;结构模型又用于候选筛选。由此可直接检验计算置信度与实验表达、亲和力和免疫原性之间仍有显著落差,成功案例存在强筛选。判断生成式蛋白设计是否成立,不看术语是否相同,而看“以实验验证成功的设计数占全部合成设计数的比例核算”在另一平台能否保持同向。因此过程记录本身属于证据。就生成式蛋白设计的实证锚点而言,源行所列证据从2022年延伸到2024年,至少跨越2个公开研究阶段;复核时应同时报告“该比率”的分子、分母和区间。 在生成式蛋白设计证据链中,原始锚点仍是Dauparas 等,2022 年《Science》378:49–56,DOI 10.1126/science.add2187;

训练数据偏向可表达稳定蛋白,模型可能避开真正新颖但难折叠的区域。在生成式蛋白设计的边界核查中,本项把测量窗口固定下来,防止短期改善替代长期结局,也防止版本变化伪装成进步。

药物与材料开发可先生成小型候选库再实验筛选,但需要把失败率和合成成本纳入效益。设计序列、筛选阈值和未成功候选应保存,以避免只展示少数命中造成平台成功率幻觉。走向真实应用后,生成式蛋白设计应按可审计记录验收,而不是按一次演示成功验收,特别要保留“尚尚尚未合成、未表达和低活性候选不进入成功率叙事”。

资源成本不是背景变量;若发现“未记录对象”需要额外投入,该投入必须入分母。

位置D——主显露 单因决定设计成功的只有生成结构满足约束 预设〔27 能力可与承载它的人分离〕功能可从天然蛋白中抽出并写入任意新骨架 量纲实验验证成功的设计数/全部合成设计数 失效当功能依赖动态构象和细胞伴侣时,结构匹配越高反而可能越稳定在错误状态 自曝设计论文承认大量候选未通过实验,却常只展示最终命中 空栏未合成、未表达和低活性候选不进入成功率叙事 异名另见第 334 号第 14 条『交联质谱:蛋白结构由单体序列扩展到距离约束网络』

十二、基准与数据泄漏:算法领先不再等于生物学领先Benchmarking and data leakage

提出Duò、Robinson 与 Soneson,2018 年《F1000Research》7:1141,DOI 10.12688/f1000research.15666.4 争议Kapoor 与 Narayanan,2023 年《Patterns》4:100804,DOI 10.1016/j.patter.2023.100804 最新Kedzierska 等,2025年《Genome Biology》26:101,DOI 10.1186/s13059-025-03574-x 关键方法比较的核心从单一排行榜转向任务定义、数据隔离、失败模式和外部分布。

生物信息算法常在公开数据集上反复调参,训练、特征选择和测试边界模糊,排行榜提升可能来自记住数据而非更好建模。真正暴露旧框架的,是那些无法按既有规则归类的材料。2018年Duò、Robinson 与 Soneson将这类材料转成正式分析对象,并把“未观察到”与“确实不存在”分开。就“基准与数据泄漏”而言,这个区分使后来研究能够追溯旧结论究竟遗漏了哪一类材料。

现代基准把数据按供体、研究、时间或物种隔离,并同时评价准确率、校准、资源、鲁棒性和失败率。这里不是把多种因素并列,而是将首要解释权交给测试集是否真正独立且任务与使用场景一致。旁路可以改变幅度,却不能在该环节失效时继续维持同一结论。判决标准是先改变测试集真正独立且任务与使用场景一致这一条件,再观察主要结果是否随后改变,并在独立样本中重复。

2025年Kedzierska 等补充了同一证据链。单细胞基准显示不同聚类方法排名依赖数据与指标,泄漏研究系统总结生物医学机器学习常见错误;2025 年零样本评测进一步发现部分基础模型不超过简单基线。由这些读数可以判断一个平均分会隐藏稀有类、外部分布和算力代价,冠军模型未必适合实际流程。若只报中心值而不报“以未见数据上的正确预测数占全部测试样本数的比例核算”的完整分母,成功样本会系统性抬高方法表现。就基准与数据泄漏的实证锚点而言,本条固定2项可核量:分子“未见数据上的正确预测数”与分母“全部测试样本数”,复核时不得只报前者。 在基准与数据泄漏证据链中,原始锚点仍是Duò、Robinson 与 Soneson,2018 年《F1000Research》7:1141,DOI 10.12688/f1000research.15666.4;

基准数据一旦公开并被长期优化,就会逐渐成为训练集,独立性随时间衰减。如何持续生成未被见过、同时有高质量真值的新测试集,是方法学公共品问题。这构成基准与数据泄漏的硬边界。当公所涉开基准被反复调参时,使用次数越多反而越失去测试独立性,对象身份或驱动方向会发生变化,原分类与外推规则应停止使用。

期刊与平台开始要求预注册评测、盲测服务器和完整运行日志,减少自行选择最佳切分。排行榜应展示置信区间、失败样本和版本日期,并冻结评测代码。在2025年的应用中,Kedzierska 等进一步说明:只有原始分母、失败案例与版本差异都可追溯,性能改善才有迁移意义。

最终判断由公开数据能否重建对象流决定,而不是作者是否给出肯定结论。

位置E——主显露 单因决定算法优劣的只有独立测试表现 预设〔28 记录存在即可核对〕有测试集和运行日志就等于比较公平 量纲未见数据上的正确预测数/全部测试样本数 失效当公开基准被反复调参时,使用次数越多反而越失去测试独立性 自曝基准论文承认任务与数据选择改变排名,却仍常发布单一总冠军 空栏崩溃运行、超时和被排除数据集不进入排行榜分母 异名另见第 334 号第 13 条『蛋白型与自上而下蛋白组:一个基因不再等于一种蛋白』

◎ 二十年连起来看

第一条贯穿线索是,生命数据的基本坐标从线性表格转向图与分布。 比对器使用索引,装配器使用德布鲁因图,系统发育面对基因树集合,泛基因组使用多路径坐标;同一个“位置”在不同算法里不再是天然给定,而是计算结构的产物。

第二条线索是,规模优势不断被代表性、可辨识性和数据泄漏反向约束。 从数百万读段到一亿空间细胞,更多数据确实提高覆盖,却也放大参考偏倚、批次共线和多数类支配。真正的进步读数由总量转向独立外推、失败率和未进入分母者。

第三条线索是,计算对象逐步获得了实验与治理后果。 AlphaFold、Perturb-seq 和生成式蛋白设计改变实验选择;工作流、隐私计算和基准设计决定结果能否被复算。计算生物学因此不只是方法学,而是一套生产证据的制度。

◎ 三个常见误解

误解一是“算法准确率高,生物结论就可靠”。这个说法看似合理,因为比对、分型和分类都用准确率评估;但真值集覆盖、任务定义和外部分布会改变同一模型的意义。正确表述是:准确率只在明确分母、独立测试和使用场景下成立。

误解二是“把更多组学放进模型一定更接近真实”。多组学和网络模型确实增加维度,却可能把批次共线、无效循环和标签继承一并放大。正确表述是:新增数据必须提供正交约束,否则只是增加可拟合自由度。

误解三是“共享代码就等于可复现”。Galaxy、Nextflow 与容器解决执行环境,但样本选择、标签修正、数据库版本和研究问题仍可能在代码之外。正确表述是:可复现需要数据语义、流程依赖和判决日志同时可追踪。

◎ 与相邻领域的接口

与第331号遗传学的分工是:遗传学界定哪些变异和人群关系值得解释,本面板决定它们怎样被召回、分型和比较。算法只在可调用区域内有发言权,不能把计算缺失写成生物缺失。

与第333号癌症生物学的界面在克隆、空间和扰动。癌症问题提供耐药与演化假说,计算方法负责从单细胞、ctDNA 与条形码中恢复谱系;若没有独立验证,树形图只是最可能解释而非真实历史。

与第334号蛋白质组与代谢组的接口在跨层对齐。RNA、蛋白和代谢物有不同动态范围与缺失机制,整合前必须先保留各层特异坐标,不能用共同嵌入把冲突抹平。

与第360号基准治理的接口在数据隔离与重放。生命科学基准特别容易因公共数据库和预训练语料重叠而失真,因此时间切分、供体切分和盲测服务器应成为标准。

◎ 争议现场

第一场争论是单细胞基础模型是否真正学到可迁移生物学。收敛条件是按研究、供体、物种和时间彻底隔离训练测试,并在未见扰动和罕见状态上与简单基线盲比;参数规模或同分布准确率不能替代这一检验。

第二场争论是泛基因组图能否成为临床默认参考。收敛需要在多祖源真实病例中同时比较召回、误报、坐标可追踪、解释一致与复分析成本,并证明新增诊断收益高于版本治理代价。

第三场争论是生成式蛋白设计的成功率如何计算。收敛必须把所有被生成、筛选、合成、表达和功能测试的候选纳入同一分母,并由独立实验室复现;只展示最终命中会系统夸大平台能力。

◎ 往下五年看什么

观察基础模型在真正零样本的跨物种、跨平台和跨疾病任务上,相对线性或图基线的净提升是否稳定超过预设阈值,并公开训练语料重叠率。

观察图参考是否在非欧洲祖源和复杂区域把可调用比例提高至少若干个百分点,同时不增加无法跨版本追踪的临床报告。

观察生物信息工作流是否普遍发布软件物料清单、参考数据库哈希和失败运行;若只有容器而无数据语义,复现率不会实质提高。

观察生成式设计是否从少数展示案例进入按全部候选计数的前瞻试验,并报告每个成功蛋白的计算、合成和筛选总成本。

◎ 可与哪些领域对读

本块第三条 RNA 定量可与第334号蛋白质组定量对读。两边共享“一个归一化丰度代表分子状态”的预设;RNA 受转录本共享影响,蛋白受肽段共享影响。若两边都成立,丰度应被定义为层特异分配,而不是可直接互换的同一种数。

本块第十五条泛基因组图可与第339号形态空间对读。两边都反对单一典型参考;一个增加序列路径,一个增加形态轴。若两边都成立,分类参考应是一套可扩展坐标,而不是一个中心样本。

本块第十七条联邦计算可与第340号跨境生物多样性数据治理对读。两边共享“数据集中才能合作”的旧预设,却分别面临个体隐私与主权利益。若都成立,合作单位应是受权查询和可撤回贡献,而非数据所有权转移。

本块第二十条基准泄漏可与第336号动物行为机器视觉对读。行为模型若在同一地点和个体上切分训练测试,会把背景与身份当成行为。两边都成立时,真正的泛化单位必须从帧升级为个体、群体和地点。

◎ 十条可做的研究命题

1. 命题:图参考对复杂结构变异的召回提升主要来自非参考路径而非更宽松比对;做法:同一读段在等参数线性与图流程盲评;证伪:提升在移除新增路径后仍保持。

2. 命题:单细胞基础模型在跨研究零样本注释上不稳定超过简单最近邻;做法:按研究完全隔离的公开盲测;证伪:多个组织中持续显著领先。

3. 命题:多组学整合的过度批次校正会删除疾病特异稀有状态;做法:带已知掺样真值的模拟与真实扰动数据;证伪:校正后稀有状态保持率不降。

4. 命题:公开基准使用次数越多,模型排名对隐藏新测试集的预测力越低;做法:按发布日期构建时间外推;证伪:旧榜排名稳定预测新榜。

5. 命题:联邦模型的小中心性能由聚合权重而非总样本量决定;做法:固定数据、随机改变权重;证伪:权重变化不影响小中心校准。

6. 命题:长读长发现的大多数单读段新异构体不能形成稳定蛋白;做法:核糖体测序与靶向蛋白组验证;证伪:多数候选有翻译证据。

7. 命题:Perturb-seq 对必需基因的效应低估主要来自测量前细胞淘汰;做法:早期时间点和谱系条形码;证伪:早晚效应一致。

8. 命题:生成式蛋白设计的真实成功率显著低于展示论文中的命中率;做法:按所有生成候选建立前瞻登记;证伪:全分母成功率相近。

9. 命题:空间分辨率超过某阈值后,邻域结论由平滑参数主导;做法:同一样本多分辨率与独立成像验证;证伪:邻域在无平滑下仍稳定。

10. 命题:工作流容器化只能解释部分复现失败,数据库和样本语义占更大比例;做法:分层重放旧研究;证伪:锁定容器后绝大多数结果恢复。

◎ 资料核验

以下按源行去重列出。书籍、指南和机构标准按其出版信息著录;同行评议论文保留卷页或 DOI。

  1. Li 与 Durbin,2009 年《Bioinformatics》25:1754–1760,DOI 10.1093/bioinformatics/btp324。
  2. Langmead 等,2009 年《Genome Biology》10:R25,DOI 10.1186/gb-2009-10-3-r25。
  3. Li,2018 年《Bioinformatics》34:3094–3100,DOI 10.1093/bioinformatics/bty191。
  4. Zerbino 与 Birney,2008 年《Genome Research》18:821–829,DOI 10.1101/gr.074492.107。
  5. Simpson 等,2009 年《Genome Research》19:1117–1123,DOI 10.1101/gr.089532.108。
  6. Kolmogorov 等,2020 年《Nature Methods》17:1103–1110,DOI 10.1038/s41592-020-00971-x。
  7. Mortazavi 等,2008 年《Nature Methods》5:621–628,DOI 10.1038/nmeth.1226。
  8. Trapnell 等,2010 年《Nature Biotechnology》28:511–515,DOI 10.1038/nbt.1621。
  9. Patro 等,2017 年《Nature Methods》14:417–419,DOI 10.1038/nmeth.4197。
  10. McKenna 等,2010 年《Genome Research》20:1297–1303,DOI 10.1101/gr.107524.110。
  11. DePristo 等,2011 年《Nature Genetics》43:491–498,DOI 10.1038/ng.806。
  12. Poplin 等,2018 年《Nature Biotechnology》36:983–987,DOI 10.1038/nbt.4235。
  13. Goh 等,2007 年《PNAS》104:8685–8690,DOI 10.1073/pnas.0701361104。
  14. Menche 等,2015 年《Science》347:1257601,DOI 10.1126/science.1257601。
  15. Halu 等,2019 年《Nature Reviews Genetics》20:509–523,DOI 10.1038/s41576-019-0126-0。
  16. Qin 等,2010 年《Nature》464:59–65,DOI 10.1038/nature08821。
  17. Human Microbiome Project Consortium,2012 年《Nature》486:207–214,DOI 10.1038/nature11234。
  18. Almeida 等,2021 年《Nature Biotechnology》39:105–114,DOI 10.1038/s41587-020-0603-3。
  19. Orth、Thiele 与 Palsson,2010 年《Nature Biotechnology》28:245–248,DOI 10.1038/nbt.1614。
  20. Ebrahim 等,2013 年《BMC Systems Biology》7:74,DOI 10.1186/1752-0509-7-74。
  21. Robinson 等,2020 年《Science Signaling》13:eaaz1482,DOI 10.1126/scisignal.aaz1482。
  22. Maddison 与 Knowles,2006 年《Systematic Biology》55:21–30,DOI 10.1080/10635150500354928。
  23. Degnan 与 Rosenberg,2009 年《Trends in Ecology & Evolution》24:332–340,DOI 10.1016/j.tree.2009.01.009。
  24. Mirarab 等,2014 年《Bioinformatics》30:i541–i548,DOI 10.1093/bioinformatics/btu462。
  25. 前身为Satija 等,2015 年《Nature Biotechnology》33:495–502,DOI 10.1038/nbt.3192。
  26. Luecken 与 Theis,2019 年《Molecular Systems Biology》15:e8746,DOI 10.15252/msb.20188746。
  27. Wolf、Angerer 与 Theis,2018 年《Genome Biology》19:15,DOI 10.1186/s13059-017-1382-0。
  28. Senior 等,2020 年《Nature》577:706–710,DOI 10.1038/s41586-019-1923-7。
  29. Jumper 等,2021 年《Nature》596:583–589,DOI 10.1038/s41586-021-03819-2。
  30. Abramson 等,2024 年《Nature》630:493–500,DOI 10.1038/s41586-024-07487-w。
  31. Cui 等,2024年《Nature Methods》21:1470–1480,DOI 10.1038/s41592-024-02201-0。
  32. Kedzierska 等,2025年《Genome Biology》26:101,DOI 10.1186/s13059-025-03574-x。
  33. Tejada-Lapuerta、Schaar、Gutgesell 等,2025年《Nature Methods》22:2525–2538,DOI 10.1038/s41592-025-02814-z。
  34. Ståhl 等,2016 年《Science》353:78–82,DOI 10.1126/science.aaf2403。
  35. Rodriques 等,2019 年《Science》363:1463–1467,DOI 10.1126/science.aaw1219。
  36. Argelaguet 等,2018 年《Molecular Systems Biology》14:e8124,DOI 10.15252/msb.20178124。
  37. Stuart 等,2019 年《Cell》177:1888–1902.e21,DOI 10.1016/j.cell.2019.05.031。
  38. Luecken 等,2022 年《Nature Methods》19:41–50,DOI 10.1038/s41592-021-01336-8。
  39. Tang 等,2020 年《Nature Communications》11:1438,DOI 10.1038/s41467-020-15171-6。
  40. Clavell-Revelles 等,2025年《Nature Communications》16:10194,DOI 10.1038/s41467-025-66096-x。
  41. Garrison 等,2018 年《Nature Biotechnology》36:875–879,DOI 10.1038/nbt.4227。
  42. Li、Feng 与 Chu,2020 年《Genome Biology》21:265,DOI 10.1186/s13059-020-02168-z。
  43. Liao 等,2023 年《Nature》617:312–324,DOI 10.1038/s41586-023-05896-x。
  44. 前身为Goecks 等,2010 年《Genome Biology》11:R86,DOI 10.1186/gb-2010-11-8-r86。
  45. Di Tommaso 等,2017 年《Nature Biotechnology》35:316–319,DOI 10.1038/nbt.3820。
  46. Ewels 等,2020 年《Nature Biotechnology》38:276–278,DOI 10.1038/s41587-020-0439-x。
  47. 前身为Shringarpure 与 Bustamante,2015 年《American Journal of Human Genetics》97:631–646,DOI 10.1016/j.ajhg.2015.09.010。
  48. Sheller 等,2020 年《Scientific Reports》10:12598,DOI 10.1038/s41598-020-69250-1。
  49. Warnat-Herresthal 等,2021 年《Nature》594:265–270,DOI 10.1038/s41586-021-03583-3。
  50. Dixit 等,2016 年《Cell》167:1853–1866.e17,DOI 10.1016/j.cell.2016.11.038。
  51. Norman 等,2019 年《Cell》177:1863–1875.e21,DOI 10.1016/j.cell.2019.05.013。
  52. Replogle 等,2022 年《Cell》185:2559–2575.e28,DOI 10.1016/j.cell.2022.05.013。
  53. Dauparas 等,2022 年《Science》378:49–56,DOI 10.1126/science.add2187。
  54. Watson 等,2023 年《Nature》620:1089–1100,DOI 10.1038/s41586-023-06415-8。
  55. Duò、Robinson 与 Soneson,2018 年《F1000Research》7:1141,DOI 10.12688/f1000research.15666.4。
  56. Kapoor 与 Narayanan,2023 年《Patterns》4:100804,DOI 10.1016/j.patter.2023.100804。
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行八字段碰撞行(位置/单因/预设/量纲/失效/自曝/空栏/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板