结构生物学与蛋白折叠
结构生物学过去二十年的变化,不是实验被预测取代,而是结构证据链重新分工。盲评和共进化把预测变成可量化任务,直接电子探测器、串行晶体学与MicroED扩展可测对象;AlphaFold2随后把单链结构预测变成基础设施,又把难题推到复合物、配体、构象系综、无序、功能与实验条件。下面二十条坚持一条边界:坐标像实验不等于坐标来自实验,高置信局部几何也不等于机制已被证明。 页尾的经典层继续追问:这些新读数所改写的老前提,当年由谁、用什么材料立起来。
第一幕同时改造尺子与仪器。CASP坚持盲靶标,共进化从序列家族抽取接触,直接探测冷冻电镜跨过分辨率门槛;串行飞秒晶体学与MicroED处理更小晶体,Foldit和Rosetta设计说明结构既可被预测也可被提出。
甲、CASP把结构预测放到不许自评的盲尺上CASP Puts Structure Prediction on a Blind Benchmark
换批次重做时,Moult等在2009年的工作把困难落到盲靶提交可识别的对象上;本条改写的是「预测进步必须由时间隔离的实验结构裁决,不能用模型自洽代替」,而不是把CASP把结构预测放到不许自评的盲尺上当作又一次性能刷新。将校准曲线整体重做时,CASP把结构预测放到不许自评的盲尺上离开盲靶提交对象定义后,平均改进可能只来自分母重选。
把样品规模放大后,本条锁定盲靶标、提交截止与独立实验答案:保持构象系综与样本边界不变,只改变这一环节,CASP有效对象数/界面能登记总数才应沿预测方向移动。让第二个实验室独立执行时,2001年复核若不能在构象系综保留「预测进步必须由时间隔离的实验结构裁决,不能用模型自洽代替」的方向,它就只是原样本内的相关。
一届CASP通常只有约100个目标,需按模板、自由建模与复合物分层。把观察窗延长时,须按盲靶提交口径把Moult等在2009年的提出证据与Lensink等在2019年的后续结果放进CASP分母。更换原料或样本批号后,盲靶提交核对对象是否同一,界面能核对失败样本有没有被删去;二者分开,CASP有效对象数/界面能登记总数才不由筛选规则制造。
缩小到单个对象时,原始研究已露出边界:CASP靶标由可在周期内完成的实验结构构成,不等于整个蛋白宇宙的随机样本。争议不在于CASP把结构预测放到不许自评的盲尺上是否发生,而在于换批次或换尺度后,构象系综改变且主效应方向不再保留。提高通量而不改阈值时,2019年论文承担的是越过原盲靶提交场景的边界检验,不能用更新年份冒充CASP的独立复现。
把失败样本补回分母后,实际流程并列保存盲靶提交、构象系综与界面能,分别标记对象、过程和退出原因。按预注册方案重跑时,工程验收以界面能为入口采用CASP有效对象数/界面能登记总数,单次图像和展示性个案都不能代替CASP分母。
移出原先环境后,本条与第 332 号《生物信息学与计算生物学》第十一条「生成式蛋白设计:算法从预测天然结构转向提出新序列」形成可查接口:邻块用「生成式蛋白设计:算法从预测天然结构转向提出新序列」核对生物信息学与计算生物学对象,本块只核对盲靶提交下的CASP有效对象数/界面能登记总数。改变操作者而锁定流程时,两边共享〔03 有限近似控制无限对象〕,却不能互相代替;CASP还须接受构象系综的独立复测。在盲法复核中,反例仍由本家给出——CASP靶标由可在周期内完成的实验结构构成,不等于整个蛋白宇宙的随机样本;删掉这项限制,只会得到同名类比。
乙、共进化把序列家族变成三维接触约束Coevolution Turns Sequence Families into 3D Contact Restraints
改用另一台装置后,Marks等在2011年的工作把困难落到分辨率可识别的对象上;本条改写的是「序列数据库可提供空间约束,但信息量由有效家族深度而非条数决定」,而不是把共进化把序列家族变成三维接触约束当作又一次性能刷新。
让第二个实验室独立执行时,本条锁定同源序列深度与直接统计耦合:保持实验复测与样本边界不变,只改变这一环节,共进化有效对象数/盲靶提交登记总数才应沿预测方向移动。更换原料或样本批号后,2001年复核若不能在实验复测保留「序列数据库可提供空间约束,但信息量由有效家族深度而非条数决定」的方向,它就只是原样本内的相关。
共进化折叠常要求有效同源序列数接近或超过蛋白长度L。缩小到单个对象时,须按分辨率口径把Marks等在2011年的提出证据与Morcos等在2011年的后续结果放进共进化分母。把观察窗延长时,分辨率核对对象是否同一,盲靶提交核对失败样本有没有被删去;二者分开,共进化有效对象数/盲靶提交登记总数才不由筛选规则制造。
提高通量而不改阈值时,原始研究已露出边界:丰富细菌蛋白家族上的成功不能外推到人类孤儿蛋白、抗体和可变复合物。争议不在于共进化把序列家族变成三维接触约束是否发生,而在于换批次或换尺度后,实验复测改变且主效应方向不再保留。把失败样本补回分母后,2011年论文承担的是越过原分辨率场景的边界检验,不能用更新年份冒充共进化的独立复现。
按预注册方案重跑时,实际流程并列保存分辨率、实验复测与盲靶提交,分别标记对象、过程和退出原因。移出原先环境后,工程验收以盲靶提交为入口采用共进化有效对象数/盲靶提交登记总数,单次图像和展示性个案都不能代替共进化分母。
改变操作者而锁定流程时,本条与第 259 号《生物化学与分子生物学》第三条「TurboID把短暂近邻从不可见互作变成分钟级标记」形成可查接口:邻块用「TurboID把短暂近邻从不可见互作变成分钟级标记」核对生物化学与分子生物学对象,本块只核对分辨率下的共进化有效对象数/盲靶提交登记总数。在盲法复核中,两边共享〔15 同名即同物〕,却不能互相代替;共进化还须接受实验复测的独立复测。将校准曲线整体重做时,反例仍由本家给出——丰富细菌蛋白家族上的成功不能外推到人类孤儿蛋白、抗体和可变复合物;删掉这项限制,只会得到同名类比。
丙、直接电子探测器触发冷冻电镜分辨率革命Direct Electron Detectors Trigger the Cryo-EM Resolution Revolution
把样品规模放大后,Bai等在2013年的工作把困难落到构象系综可识别的对象上;本条改写的是「分辨率提高来自探测与统计链,不等于样品只有一个构象」,而不是把直接电子探测器触发冷冻电镜分辨率革命当作又一次性能刷新。
更换原料或样本批号后,本条锁定探测量子效率与逐帧运动校正:保持界面能与样本边界不变,只改变这一环节,直接电子探测器有效对象数/分辨率登记总数才应沿预测方向移动。把观察窗延长时,2001年复核若不能在界面能保留「分辨率提高来自探测与统计链,不等于样品只有一个构象」的方向,它就只是原样本内的相关。
直接探测器推动单颗粒重构跨入3–4Å,可见侧链却仍需分类。提高通量而不改阈值时,须按构象系综口径把Bai等在2013年的提出证据与Kühlbrandt在2014年的后续结果放进直接电子探测器分母。缩小到单个对象时,构象系综核对对象是否同一,分辨率核对失败样本有没有被删去;二者分开,直接电子探测器有效对象数/分辨率登记总数才不由筛选规则制造。
把失败样本补回分母后,原始研究已露出边界:最终重构只包含被分类保留颗粒,制样失败、界面偏好和少数状态不在同一分母。争议不在于直接电子探测器触发冷冻电镜分辨率革命是否发生,而在于换批次或换尺度后,界面能改变且主效应方向不再保留。按预注册方案重跑时,2014年论文承担的是越过原构象系综场景的边界检验,不能用更新年份冒充直接电子探测器的独立复现。
移出原先环境后,实际流程并列保存构象系综、界面能与分辨率,分别标记对象、过程和退出原因。改变操作者而锁定流程时,工程验收以分辨率为入口采用直接电子探测器有效对象数/分辨率登记总数,单次图像和展示性个案都不能代替直接电子探测器分母。
在盲法复核中,本条与第 043 号《深度学习》第二条「掩码自编码:预测缺失部分取代逐对样本比较」形成可查接口:邻块用「掩码自编码:预测缺失部分取代逐对样本比较」核对深度学习对象,本块只核对构象系综下的直接电子探测器有效对象数/分辨率登记总数。将校准曲线整体重做时,两边共享〔29 越精细越接近真实〕,却不能互相代替;直接电子探测器还须接受界面能的独立复测。把域外样本纳入时,反例仍由本家给出——最终重构只包含被分类保留颗粒,制样失败、界面偏好和少数状态不在同一分母;删掉这项限制,只会得到同名类比。
丁、串行飞秒晶体学把辐射损伤改成击毁前衍射Serial Femtosecond Crystallography Diffracts before Destruction
让第二个实验室独立执行时,Boutet等在2012年的工作把困难落到实验复测可识别的对象上;本条改写的是「无损伤结构由大量一次性快照重建,合并分母必须公开」,而不是把串行飞秒晶体学把辐射损伤改成击毁前衍射当作又一次性能刷新。
把观察窗延长时,本条锁定飞秒脉冲与串行样品输运:保持盲靶提交与样本边界不变,只改变这一环节,串行飞秒晶体学有效对象数/构象系综登记总数才应沿预测方向移动。缩小到单个对象时,2001年复核若不能在盲靶提交保留「无损伤结构由大量一次性快照重建,合并分母必须公开」的方向,它就只是原样本内的相关。
串行飞秒晶体学可用数万张快照合并到约2Å分辨率。把失败样本补回分母后,须按实验复测口径把Boutet等在2012年的提出证据与Tenboer等在2014年的后续结果放进串行飞秒晶体学分母。提高通量而不改阈值时,实验复测核对对象是否同一,构象系综核对失败样本有没有被删去;二者分开,串行飞秒晶体学有效对象数/构象系综登记总数才不由筛选规则制造。
按预注册方案重跑时,原始研究已露出边界:成功索引的图样只占全部脉冲一部分,未命中和异质微晶会被管线排除。争议不在于串行飞秒晶体学把辐射损伤改成击毁前衍射是否发生,而在于换批次或换尺度后,盲靶提交改变且主效应方向不再保留。移出原先环境后,2014年论文承担的是越过原实验复测场景的边界检验,不能用更新年份冒充串行飞秒晶体学的独立复现。
改变操作者而锁定流程时,实际流程并列保存实验复测、盲靶提交与构象系综,分别标记对象、过程和退出原因。在盲法复核中,工程验收以构象系综为入口采用串行飞秒晶体学有效对象数/构象系综登记总数,单次图像和展示性个案都不能代替串行飞秒晶体学分母。
将校准曲线整体重做时,本条与第 301 号《泛函分析与算子代数》第己条「自由单调输运:小扰动可搬成新自由分布」形成可查接口:邻块用「自由单调输运:小扰动可搬成新自由分布」核对泛函分析与算子代数对象,本块只核对实验复测下的串行飞秒晶体学有效对象数/构象系综登记总数。把域外样本纳入时,两边共享〔11 可复现=可重做〕,却不能互相代替;串行飞秒晶体学还须接受盲靶提交的独立复测。固定成本而扩大覆盖时,反例仍由本家给出——成功索引的图样只占全部脉冲一部分,未命中和异质微晶会被管线排除;删掉这项限制,只会得到同名类比。
戊、MicroED让纳米晶体进入电子衍射结构学MicroED Brings Nanocrystals into Electron Diffraction
更换原料或样本批号后,Shi等在2013年的工作把困难落到界面能可识别的对象上;本条改写的是「纳米晶可测不等于电子强度与X射线强度可无条件互换」,而不是把MicroED让纳米晶体进入电子衍射结构学当作又一次性能刷新。把观察窗延长时,若归档仍只留下冠军样品,实验复测未接纳的未通过实验复测、在分辨率退出或未进入MicroED统计的对象就会从因果账本中消失。
缩小到单个对象时,本条锁定电子强散射与低剂量旋转采集:保持分辨率与样本边界不变,只改变这一环节,MicroED有效对象数/实验复测登记总数才应沿预测方向移动。提高通量而不改阈值时,2001年复核若不能在分辨率保留「纳米晶可测不等于电子强度与X射线强度可无条件互换」的方向,它就只是原样本内的相关。
MicroED从纳米晶获得约2–3Å结构,晶体厚度只有数百纳米。按预注册方案重跑时,须按界面能口径把Shi等在2013年的提出证据与Nannenga与Gonen在2019年的后续结果放进MicroED分母。把失败样本补回分母后,界面能核对对象是否同一,实验复测核对失败样本有没有被删去;二者分开,MicroED有效对象数/实验复测登记总数才不由筛选规则制造。
晶体厚度、动力学散射、取向和束损伤。移出原先环境后,原始研究已露出边界:易形成规则纳米晶的样品受益最大,异质、厚片和带电样品仍可能无法精修。争议不在于MicroED让纳米晶体进入电子衍射结构学是否发生,而在于换批次或换尺度后,分辨率改变且主效应方向不再保留。改变操作者而锁定流程时,2019年论文承担的是越过原界面能场景的边界检验,不能用更新年份冒充MicroED的独立复现。
在盲法复核中,实际流程并列保存界面能、分辨率与实验复测,分别标记对象、过程和退出原因。将校准曲线整体重做时,工程验收以实验复测为入口采用MicroED有效对象数/实验复测登记总数,单次图像和展示性个案都不能代替MicroED分母。
把域外样本纳入时,本条与第 319 号《计算物理与多尺度模拟》第甲条「相场晶体跨越原子与扩散时间」形成可查接口:邻块用「相场晶体跨越原子与扩散时间」核对计算物理与多尺度模拟对象,本块只核对界面能下的MicroED有效对象数/实验复测登记总数。固定成本而扩大覆盖时,两边共享〔23 中位个案代表分布〕,却不能互相代替;MicroED还须接受分辨率的独立复测。交换发现批次与验证批次时,反例仍由本家给出——易形成规则纳米晶的样品受益最大,异质、厚片和带电样品仍可能无法精修;删掉这项限制,只会得到同名类比。
己、Foldit把人的空间直觉变成可记录搜索Foldit Turns Human Spatial Intuition into Recorded Search
把观察窗延长时,Cooper等在2010年的工作把困难落到盲靶提交可识别的对象上;本条改写的是「众包价值在搜索多样性,最终仍需实验而非游戏得分验收」,而不是把Foldit把人的空间直觉变成可记录搜索当作又一次性能刷新。缩小到单个对象时,若归档仍只留下冠军样品,界面能未接纳的未通过界面能、在构象系综退出或未进入Foldit统计的对象就会从因果账本中消失。
提高通量而不改阈值时,本条锁定人机混合构象搜索与排行榜激励:保持构象系综与样本边界不变,只改变这一环节,Foldit有效对象数/界面能登记总数才应沿预测方向移动。把失败样本补回分母后,2001年复核若不能在构象系综保留「众包价值在搜索多样性,最终仍需实验而非游戏得分验收」的方向,它就只是原样本内的相关。
Foldit吸引5万以上玩家,实际高分策略集中在少数活跃参与者。移出原先环境后,须按盲靶提交口径把Cooper等在2010年的提出证据与Eiben等在2012年的后续结果放进Foldit分母。按预注册方案重跑时,盲靶提交核对对象是否同一,界面能核对失败样本有没有被删去;二者分开,Foldit有效对象数/界面能登记总数才不由筛选规则制造。
玩家选择、评分函数误差、问题可视化和不可扩展劳动。改变操作者而锁定流程时,原始研究已露出边界:少数高技能玩家和精选任务不能代表任意蛋白或持续人力成本。争议不在于Foldit把人的空间直觉变成可记录搜索是否发生,而在于换批次或换尺度后,构象系综改变且主效应方向不再保留。在盲法复核中,2012年论文承担的是越过原盲靶提交场景的边界检验,不能用更新年份冒充Foldit的独立复现。
将校准曲线整体重做时,实际流程并列保存盲靶提交、构象系综与界面能,分别标记对象、过程和退出原因。把域外样本纳入时,工程验收以界面能为入口采用Foldit有效对象数/界面能登记总数,单次图像和展示性个案都不能代替Foldit分母。
固定成本而扩大覆盖时,本条与第 031 号《免疫学》第二条「Anifrolumab把I型干扰素签名变成SLE治疗入口」形成可查接口:邻块用「Anifrolumab把I型干扰素签名变成SLE治疗入口」核对免疫学对象,本块只核对盲靶提交下的Foldit有效对象数/界面能登记总数。交换发现批次与验证批次时,两边共享〔28 记录存在即可核对〕,却不能互相代替;Foldit还须接受构象系综的独立复测。把最优参数降为中位参数时,反例仍由本家给出——少数高技能玩家和精选任务不能代表任意蛋白或持续人力成本;删掉这项限制,只会得到同名类比。
庚、Rosetta界面设计把蛋白结合从筛选推进到计算提案Rosetta Interface Design Moves Binding from Screening to Proposal
缩小到单个对象时,Fleishman等在2011年的工作把困难落到分辨率可识别的对象上;本条改写的是「设计成功率必须以全部计算与实验候选为分母」,而不是把Rosetta界面设计把蛋白结合从筛选推进到计算提案当作又一次性能刷新。
把失败样本补回分母后,本条锁定界面几何互补、能量函数与序列搜索:保持实验复测与样本边界不变,只改变这一环节,Rosetta界面设计有效对象数/盲靶提交登记总数才应沿预测方向移动。按预注册方案重跑时,2001年复核若不能在实验复测保留「设计成功率必须以全部计算与实验候选为分母」的方向,它就只是原样本内的相关。
早期界面设计从约8万计算候选收缩到数十实验构建,最终强结合者更少。改变操作者而锁定流程时,须按分辨率口径把Fleishman等在2011年的提出证据与Chevalier等在2017年的后续结果放进Rosetta界面设计分母。移出原先环境后,分辨率核对对象是否同一,盲靶提交核对失败样本有没有被删去;二者分开,Rosetta界面设计有效对象数/盲靶提交登记总数才不由筛选规则制造。
在盲法复核中,原始研究已露出边界:报道的高亲和成功者来自大量计算和筛选漏斗,不能用最终数量代表初始命中率。争议不在于Rosetta界面设计把蛋白结合从筛选推进到计算提案是否发生,而在于换批次或换尺度后,实验复测改变且主效应方向不再保留。将校准曲线整体重做时,2017年论文承担的是越过原分辨率场景的边界检验,不能用更新年份冒充Rosetta界面设计的独立复现。
把域外样本纳入时,实际流程并列保存分辨率、实验复测与盲靶提交,分别标记对象、过程和退出原因。固定成本而扩大覆盖时,工程验收以盲靶提交为入口采用Rosetta界面设计有效对象数/盲靶提交登记总数,单次图像和展示性个案都不能代替Rosetta界面设计分母。
交换发现批次与验证批次时,本条与第 117 号《医疗器械与诊断技术》第十二条「人因工程:误用不是使用者噪声而是设计变量」形成可查接口:邻块用「人因工程:误用不是使用者噪声而是设计变量」核对医疗器械与诊断技术对象,本块只核对分辨率下的Rosetta界面设计有效对象数/盲靶提交登记总数。把最优参数降为中位参数时,两边共享〔15 同名即同物〕,却不能互相代替;Rosetta界面设计还须接受实验复测的独立复测。撤去展示性筛选后,反例仍由本家给出——报道的高亲和成功者来自大量计算和筛选漏斗,不能用最终数量代表初始命中率;删掉这项限制,只会得到同名类比。
辛、结构基因组学把失败构建暴露为系统瓶颈Structural Genomics Exposes Construct Failure as a System Bottleneck
提高通量而不改阈值时,StructuralGenomi在2008年的工作把困难落到构象系综可识别的对象上;本条改写的是「结构库的空白不是随机缺失,高通量会选择最容易的蛋白」,而不是把结构基因组学把失败构建暴露为系统瓶颈当作又一次性能刷新。
按预注册方案重跑时,本条锁定从基因到结构各步骤的累计成功率:保持界面能与样本边界不变,只改变这一环节,结构基因组学有效对象数/分辨率登记总数才应沿预测方向移动。移出原先环境后,2001年复核若不能在界面能保留「结构库的空白不是随机缺失,高通量会选择最容易的蛋白」的方向,它就只是原样本内的相关。
蛋白质结构计划在2000–2015年间产出近7000个PDB结构,但膜蛋白与复合物仍在成功集中偏少。在盲法复核中,须按构象系综口径把StructuralGenomi在2008年的提出证据与Grabowski等在2016年的后续结果放进结构基因组学分母。改变操作者而锁定流程时,构象系综核对对象是否同一,分辨率核对失败样本有没有被删去;二者分开,结构基因组学有效对象数/分辨率登记总数才不由筛选规则制造。
将校准曲线整体重做时,原始研究已露出边界:最终PDB条目看不见表达、纯化和结晶失败,成功率优化会改变被研究蛋白分布。争议不在于结构基因组学把失败构建暴露为系统瓶颈是否发生,而在于换批次或换尺度后,界面能改变且主效应方向不再保留。把域外样本纳入时,2016年论文承担的是越过原构象系综场景的边界检验,不能用更新年份冒充结构基因组学的独立复现。
固定成本而扩大覆盖时,实际流程并列保存构象系综、界面能与分辨率,分别标记对象、过程和退出原因。交换发现批次与验证批次时,工程验收以分辨率为入口采用结构基因组学有效对象数/分辨率登记总数,单次图像和展示性个案都不能代替结构基因组学分母。
把最优参数降为中位参数时,本条与第 258 号《数据科学》第二条「模型卡把用途、亚群与失败条件写进产品接口」形成可查接口:邻块用「模型卡把用途、亚群与失败条件写进产品接口」核对数据科学对象,本块只核对构象系综下的结构基因组学有效对象数/分辨率登记总数。撤去展示性筛选后,两边共享〔03 有限近似控制无限对象〕,却不能互相代替;结构基因组学还须接受界面能的独立复测。由外部团队只凭公开记录复算时,反例仍由本家给出——最终PDB条目看不见表达、纯化和结晶失败,成功率优化会改变被研究蛋白分布;删掉这项限制,只会得到同名类比。
第二幕由AlphaFold系列重写规模。深度网络把序列、共进化和几何合并,结构数据库覆盖亿级序列,语言模型进一步压缩搜索;复合物与全原子预测扩展对象,同时暴露状态、配体、修饰和置信度误读。设计端的ProteinMPNN与RFdiffusion把算法从解释天然蛋白推到创造新折叠与功能。
一、AlphaFold第一代把共进化与深度网络合成距离几何AlphaFold 1 Combines Coevolution and Deep Networks into Distance Geometry
把失败样本补回分母后,Senior等在2020年的工作把困难落到实验复测可识别的对象上;本条改写的是「距离分布把学习结果转成几何约束,但序列家族深度仍是隐含资源」,而不是把AlphaFold第一代把共进化与深度网络合成距离几何当作又一次性能刷新。
移出原先环境后,本条锁定多序列比对信息与距离分布预测:保持盲靶提交与样本边界不变,只改变这一环节,AlphaFold第一代有效对象数/构象系综登记总数才应沿预测方向移动。改变操作者而锁定流程时,2001年复核若不能在盲靶提交保留「距离分布把学习结果转成几何约束,但序列家族深度仍是隐含资源」的方向,它就只是原样本内的相关。
CASP13中AlphaFold在自由建模目标明显领先。将校准曲线整体重做时,须按实验复测口径把Senior等在2020年的提出证据与Akdel等在2022年的后续结果放进AlphaFold第一代分母。在盲法复核中,实验复测核对对象是否同一,构象系综核对失败样本有没有被删去;二者分开,AlphaFold第一代有效对象数/构象系综登记总数才不由筛选规则制造。
把域外样本纳入时,原始研究已露出边界:CASP自由建模靶标数量有限,领先不等于对无同源、无序和多状态蛋白普适。争议不在于AlphaFold第一代把共进化与深度网络合成距离几何是否发生,而在于换批次或换尺度后,盲靶提交改变且主效应方向不再保留。固定成本而扩大覆盖时,2022年论文承担的是越过原实验复测场景的边界检验,不能用更新年份冒充AlphaFold第一代的独立复现。
交换发现批次与验证批次时,实际流程并列保存实验复测、盲靶提交与构象系综,分别标记对象、过程和退出原因。把最优参数降为中位参数时,工程验收以构象系综为入口采用AlphaFold第一代有效对象数/构象系综登记总数,单次图像和展示性个案都不能代替AlphaFold第一代分母。
撤去展示性筛选后,本条与第 332 号《生物信息学与计算生物学》第二条「AlphaFold:蛋白折叠从物理采样转向学习到的几何约束」形成可查接口:邻块用「AlphaFold:蛋白折叠从物理采样转向学习到的几何约束」核对生物信息学与计算生物学对象,本块只核对实验复测下的AlphaFold第一代有效对象数/构象系综登记总数。由外部团队只凭公开记录复算时,两边共享〔23 中位个案代表分布〕,却不能互相代替;AlphaFold第一代还须接受盲靶提交的独立复测。换批次重做时,反例仍由本家给出——CASP自由建模靶标数量有限,领先不等于对无同源、无序和多状态蛋白普适;删掉这项限制,只会得到同名类比。
二、AlphaFold2把结构预测推进到近实验精度AlphaFold2 Moves Prediction toward Experimental Accuracy
按预注册方案重跑时,Jumper等在2021年的工作把困难落到界面能可识别的对象上;本条改写的是「预测坐标可成为实验假说,但置信度只描述模型自己的局部把握」,而不是把AlphaFold2把结构预测推进到近实验精度当作又一次性能刷新。移出原先环境后,若归档仍只留下冠军样品,实验复测未接纳的未通过实验复测、在分辨率退出或未进入AlphaFold2统计的对象就会从因果账本中消失。
改变操作者而锁定流程时,本条锁定多序列注意、等变结构更新与回收迭代:保持分辨率与样本边界不变,只改变这一环节,AlphaFold2有效对象数/实验复测登记总数才应沿预测方向移动。在盲法复核中,2001年复核若不能在分辨率保留「预测坐标可成为实验假说,但置信度只描述模型自己的局部把握」的方向,它就只是原样本内的相关。
Jumper等2021年报告CASP14中多数目标达到近实验精度,主链中位误差显著下降。把域外样本纳入时,须按界面能口径把Jumper等在2021年的提出证据与Akdel等在2022年的后续结果放进AlphaFold2分母。将校准曲线整体重做时,界面能核对对象是否同一,实验复测核对失败样本有没有被删去;二者分开,AlphaFold2有效对象数/实验复测登记总数才不由筛选规则制造。
固定成本而扩大覆盖时,原始研究已露出边界:CASP靶标与PDB相似分布并不覆盖细胞内复合、无序、配体诱导与替代构象。争议不在于AlphaFold2把结构预测推进到近实验精度是否发生,而在于换批次或换尺度后,分辨率改变且主效应方向不再保留。交换发现批次与验证批次时,2022年论文承担的是越过原界面能场景的边界检验,不能用更新年份冒充AlphaFold2的独立复现。
把最优参数降为中位参数时,实际流程并列保存界面能、分辨率与实验复测,分别标记对象、过程和退出原因。撤去展示性筛选后,工程验收以实验复测为入口采用AlphaFold2有效对象数/实验复测登记总数,单次图像和展示性个案都不能代替AlphaFold2分母。
由外部团队只凭公开记录复算时,本条与第 259 号《生物化学与分子生物学》第九条「ISRIB把整合应激反应定位到eIF2B的变构开关」形成可查接口:邻块用「ISRIB把整合应激反应定位到eIF2B的变构开关」核对生物化学与分子生物学对象,本块只核对界面能下的AlphaFold2有效对象数/实验复测登记总数。换批次重做时,两边共享〔23 中位个案代表分布〕,却不能互相代替;AlphaFold2还须接受分辨率的独立复测。改用另一台装置后,反例仍由本家给出——CASP靶标与PDB相似分布并不覆盖细胞内复合、无序、配体诱导与替代构象;删掉这项限制,只会得到同名类比。
三、RoseTTAFold证明三轨信息交换不是单一路线RoseTTAFold Shows Three-Track Reasoning Is an Alternative Route
移出原先环境后,Baek等在2021年的工作把困难落到盲靶提交可识别的对象上;本条改写的是「独立路线证明联合几何学习可复现,也为复合物设计提供开放底座」,而不是把RoseTTAFold证明三轨信息交换不是单一路线当作又一次性能刷新。改变操作者而锁定流程时,若归档仍只留下冠军样品,界面能未接纳的未通过界面能、在构象系综退出或未进入RoseTTAFold统计的对象就会从因果账本中消失。
在盲法复核中,本条锁定多尺度表示的双向更新:保持构象系综与样本边界不变,只改变这一环节,RoseTTAFold有效对象数/界面能登记总数才应沿预测方向移动。将校准曲线整体重做时,2001年复核若不能在构象系综保留「独立路线证明联合几何学习可复现,也为复合物设计提供开放底座」的方向,它就只是原样本内的相关。
RoseTTAFold在数百个盲目标上验证,并能在10分钟量级生成部分模型。固定成本而扩大覆盖时,须按盲靶提交口径把Baek等在2021年的提出证据与Humphreys等在2021年的后续结果放进RoseTTAFold分母。把域外样本纳入时,盲靶提交核对对象是否同一,界面能核对失败样本有没有被删去;二者分开,RoseTTAFold有效对象数/界面能登记总数才不由筛选规则制造。
大复合物、构象变化、模板泄漏和计算预算。交换发现批次与验证批次时,原始研究已露出边界:开放代码不消除训练库与PDB选择偏差,未知复合物仍需实验化学计量验证。争议不在于RoseTTAFold证明三轨信息交换不是单一路线是否发生,而在于换批次或换尺度后,构象系综改变且主效应方向不再保留。把最优参数降为中位参数时,2021年论文承担的是越过原盲靶提交场景的边界检验,不能用更新年份冒充RoseTTAFold的独立复现。
撤去展示性筛选后,实际流程并列保存盲靶提交、构象系综与界面能,分别标记对象、过程和退出原因。由外部团队只凭公开记录复算时,工程验收以界面能为入口采用RoseTTAFold有效对象数/界面能登记总数,单次图像和展示性个案都不能代替RoseTTAFold分母。
换批次重做时,本条与第 043 号《深度学习》第乙条「ReLU:一个非饱和门改变梯度与稀疏激活」形成可查接口:邻块用「ReLU:一个非饱和门改变梯度与稀疏激活」核对深度学习对象,本块只核对盲靶提交下的RoseTTAFold有效对象数/界面能登记总数。改用另一台装置后,两边共享〔11 可复现=可重做〕,却不能互相代替;RoseTTAFold还须接受构象系综的独立复测。把样品规模放大后,反例仍由本家给出——开放代码不消除训练库与PDB选择偏差,未知复合物仍需实验化学计量验证;删掉这项限制,只会得到同名类比。
四、AlphaFold数据库把结构预测变成公共基础设施The AlphaFold Database Makes Predictions Public Infrastructure
改变操作者而锁定流程时,Tunyasuvunakool等在2021年的工作把困难落到分辨率可识别的对象上;本条改写的是「公共预测库必须让置信、版本和非实验来源随坐标一起传播」,而不是把AlphaFold数据库把结构预测变成公共基础设施当作又一次性能刷新。更换原料或样本批号后,AlphaFold数据库把结构预测变成公共基础设施离开分辨率对象定义后,平均改进可能只来自分母重选。
将校准曲线整体重做时,本条锁定规模化推理、版本化序列与开放分发:保持实验复测与样本边界不变,只改变这一环节,AlphaFold数据库有效对象数/盲靶提交登记总数才应沿预测方向移动。把域外样本纳入时,2001年复核若不能在实验复测保留「公共预测库必须让置信、版本和非实验来源随坐标一起传播」的方向,它就只是原样本内的相关。
结构数据库先覆盖约36万个人蛋白预测,后扩到2亿以上序列。交换发现批次与验证批次时,须按分辨率口径把Tunyasuvunakool等在2021年的提出证据与Varadi等在2022年的后续结果放进AlphaFold数据库分母。固定成本而扩大覆盖时,分辨率核对对象是否同一,盲靶提交核对失败样本有没有被删去;二者分开,AlphaFold数据库有效对象数/盲靶提交登记总数才不由筛选规则制造。
把最优参数降为中位参数时,原始研究已露出边界:逾两亿覆盖是序列数量,不是两亿个实验验证结构或功能机制。争议不在于AlphaFold数据库把结构预测变成公共基础设施是否发生,而在于换批次或换尺度后,实验复测改变且主效应方向不再保留。撤去展示性筛选后,2022年论文承担的是越过原分辨率场景的边界检验,不能用更新年份冒充AlphaFold数据库的独立复现。
由外部团队只凭公开记录复算时,实际流程并列保存分辨率、实验复测与盲靶提交,分别标记对象、过程和退出原因。换批次重做时,工程验收以盲靶提交为入口采用AlphaFold数据库有效对象数/盲靶提交登记总数,单次图像和展示性个案都不能代替AlphaFold数据库分母。
改用另一台装置后,本条与第 301 号《泛函分析与算子代数》第三条「C单纯性:群的边界动力决定理想结构」形成可查接口:邻块用「C单纯性:群的边界动力决定理想结构」核对泛函分析与算子代数对象,本块只核对分辨率下的AlphaFold数据库有效对象数/盲靶提交登记总数。把样品规模放大后,两边共享〔28 记录存在即可核对〕,却不能互相代替;AlphaFold数据库还须接受实验复测的独立复测。让第二个实验室独立执行时,反例仍由本家给出——逾两亿覆盖是序列数量,不是两亿个实验验证结构或功能机制;删掉这项限制,只会得到同名类比。
五、ESMFold把多序列搜索部分压进蛋白语言模型ESMFold Compresses Part of Evolutionary Search into a Protein Language Model
在盲法复核中,Lin等在2023年的工作把困难落到构象系综可识别的对象上;本条改写的是「语言模型提高结构搜索速度,不消除序列分布和置信校准」,而不是把ESMFold把多序列搜索部分压进蛋白语言模型当作又一次性能刷新。将校准曲线整体重做时,若归档仍只留下冠军样品,分辨率未接纳的未通过分辨率、在界面能退出或未进入ESMFold统计的对象就会从因果账本中消失。
把域外样本纳入时,本条锁定序列预训练规模与结构头映射:保持界面能与样本边界不变,只改变这一环节,ESMFold有效对象数/分辨率登记总数才应沿预测方向移动。固定成本而扩大覆盖时,2001年复核若不能在界面能保留「语言模型提高结构搜索速度,不消除序列分布和置信校准」的方向,它就只是原样本内的相关。
ESMFold扫描约6.17亿条宏基因组序列,规模远大于实验验证量。把最优参数降为中位参数时,须按构象系综口径把Lin等在2023年的提出证据与Hayes等在2025年的后续结果放进ESMFold分母。交换发现批次与验证批次时,构象系综核对对象是否同一,分辨率核对失败样本有没有被删去;二者分开,ESMFold有效对象数/分辨率登记总数才不由筛选规则制造。
撤去展示性筛选后,原始研究已露出边界:宏基因组预测规模巨大但实验确认稀少,结构簇数量不能直接等于新功能数量。争议不在于ESMFold把多序列搜索部分压进蛋白语言模型是否发生,而在于换批次或换尺度后,界面能改变且主效应方向不再保留。由外部团队只凭公开记录复算时,2025年论文承担的是越过原构象系综场景的边界检验,不能用更新年份冒充ESMFold的独立复现。
换批次重做时,实际流程并列保存构象系综、界面能与分辨率,分别标记对象、过程和退出原因。改用另一台装置后,工程验收以分辨率为入口采用ESMFold有效对象数/分辨率登记总数,单次图像和展示性个案都不能代替ESMFold分母。
把样品规模放大后,本条与第 319 号《计算物理与多尺度模拟》第二条「等变网络把对称性写进模型」形成可查接口:邻块用「等变网络把对称性写进模型」核对计算物理与多尺度模拟对象,本块只核对构象系综下的ESMFold有效对象数/分辨率登记总数。让第二个实验室独立执行时,两边共享〔29 越精细越接近真实〕,却不能互相代替;ESMFold还须接受界面能的独立复测。更换原料或样本批号后,反例仍由本家给出——宏基因组预测规模巨大但实验确认稀少,结构簇数量不能直接等于新功能数量;删掉这项限制,只会得到同名类比。
六、AlphaFold-Multimer把界面预测推进到复合物AlphaFold-Multimer Extends Prediction to Complexes
将校准曲线整体重做时,Evans等在2022年的工作把困难落到实验复测可识别的对象上;本条改写的是「复合物预测必须把候选链集合与计量错误纳入分母」,而不是把AlphaFold-Multimer把界面预测推进到复合物当作又一次性能刷新。把域外样本纳入时,若归档仍只留下冠军样品,构象系综未接纳的未通过构象系综、在盲靶提交退出或未进入AlphaFold-Mul…统计的对象就会从因果账本中消失。
固定成本而扩大覆盖时,本条锁定跨链共进化、配对:保持盲靶提交与样本边界不变,只改变这一环节,AlphaFold-Mul…有效对象数/构象系综登记总数才应沿预测方向移动。交换发现批次与验证批次时,2001年复核若不能在盲靶提交保留「复合物预测必须把候选链集合与计量错误纳入分母」的方向,它就只是原样本内的相关。
复合物基准中高质量界面比例约60%量级,给错伙伴时会明显下降。撤去展示性筛选后,须按实验复测口径把Evans等在2022年的提出证据与Bryant等在2022年的后续结果放进AlphaFold-Mul…分母。把最优参数降为中位参数时,实验复测核对对象是否同一,构象系综核对失败样本有没有被删去;二者分开,AlphaFold-Mul…有效对象数/构象系综登记总数才不由筛选规则制造。
由外部团队只凭公开记录复算时,原始研究已露出边界:给定真实互作伙伴的测试不能代表全蛋白组从零识别互作和化学计量。争议不在于AlphaFold-Multimer把界面预测推进到复合物是否发生,而在于换批次或换尺度后,盲靶提交改变且主效应方向不再保留。换批次重做时,2022年论文承担的是越过原实验复测场景的边界检验,不能用更新年份冒充AlphaFold-Mul…的独立复现。
改用另一台装置后,实际流程并列保存实验复测、盲靶提交与构象系综,分别标记对象、过程和退出原因。把样品规模放大后,工程验收以构象系综为入口采用AlphaFold-Mul…有效对象数/构象系综登记总数,单次图像和展示性个案都不能代替AlphaFold-Mul…分母。
让第二个实验室独立执行时,本条与第 031 号《免疫学》第丁条「Belimumab把系统性红斑狼疮从经验免疫抑制推进到B细胞生存信号」形成可查接口:邻块用「Belimumab把系统性红斑狼疮从经验免疫抑制推进到B细胞生存信号」核对免疫学对象,本块只核对实验复测下的AlphaFold-Mul…有效对象数/构象系综登记总数。更换原料或样本批号后,两边共享〔15 同名即同物〕,却不能互相代替;AlphaFold-Mul…还须接受盲靶提交的独立复测。把观察窗延长时,反例仍由本家给出——给定真实互作伙伴的测试不能代表全蛋白组从零识别互作和化学计量;删掉这项限制,只会得到同名类比。
七、AlphaFold3把预测对象扩展到全原子相互作用AlphaFold 3 Extends Prediction to All-Atom Interactions
把域外样本纳入时,Abramson等在2024年的工作把困难落到界面能可识别的对象上;本条改写的是「复合坐标预测不是结合自由能、反应机制或药效的替代」,而不是把AlphaFold3把预测对象扩展到全原子相互作用当作又一次性能刷新。提高通量而不改阈值时,AlphaFold3把预测对象扩展到全原子相互作用离开界面能对象定义后,平均改进可能只来自分母重选。
交换发现批次与验证批次时,本条锁定扩散去噪外部场景:保持分辨率与样本边界不变,只改变这一环节,AlphaFold3有效对象数/实验复测登记总数才应沿预测方向移动。把最优参数降为中位参数时,2001年复核若不能在分辨率保留「复合坐标预测不是结合自由能、反应机制或药效的替代」的方向,它就只是原样本内的相关。
Abramson等2024年报告AlphaFold3在多类相互作用基准改进。由外部团队只凭公开记录复算时,须按界面能口径把Abramson等在2024年的提出证据与Nature Editorial在2024年的后续结果放进AlphaFold3分母。撤去展示性筛选后,界面能核对对象是否同一,实验复测核对失败样本有没有被删去;二者分开,AlphaFold3有效对象数/实验复测登记总数才不由筛选规则制造。
换批次重做时,原始研究已露出边界:测试集和训练结构的远近会影响精度,静态姿势也不能给出细胞内占有率与动力学。争议不在于AlphaFold3把预测对象扩展到全原子相互作用是否发生,而在于扩大对象种类提高覆盖却让单一置信分数更易被跨任务误读时,全原子token表示与扩散去噪越强,目标读数反而越差。改用另一台装置后,2024年论文承担的是越过原界面能场景的边界检验,不能用更新年份冒充AlphaFold3的独立复现。
把样品规模放大后,实际流程并列保存界面能、分辨率与实验复测,分别标记对象、过程和退出原因。让第二个实验室独立执行时,工程验收以实验复测为入口采用AlphaFold3有效对象数/实验复测登记总数,单次图像和展示性个案都不能代替AlphaFold3分母。
更换原料或样本批号后,本条与第 117 号《医疗器械与诊断技术》第九条「数字病理:全视野模型把样本偏差放大到医院尺度」形成可查接口:邻块用「数字病理:全视野模型把样本偏差放大到医院尺度」核对医疗器械与诊断技术对象,本块只核对界面能下的AlphaFold3有效对象数/实验复测登记总数。把观察窗延长时,两边共享〔03 有限近似控制无限对象〕,却不能互相代替;AlphaFold3还须接受分辨率的独立复测。缩小到单个对象时,反例仍由本家给出——测试集和训练结构的远近会影响精度,静态姿势也不能给出细胞内占有率与动力学;删掉这项限制,只会得到同名类比。
八、构象系综研究把高置信单结构的边界显露出来Conformational Ensembles Expose the Limits of One High-Confidence Structure
固定成本而扩大覆盖时,Del Alamo等在2022年的工作把困难落到盲靶提交可识别的对象上;本条改写的是「结构多样性与热力学系综不是同义词,状态权重需实验或物理校准」,而不是把构象系综研究把高置信单结构的边界显露出来当作又一次性能刷新。
把最优参数降为中位参数时,本条锁定、模板与能量景观中的状态权重:保持构象系综与样本边界不变,只改变这一环节,构象系综研究有效对象数/界面能登记总数才应沿预测方向移动。撤去展示性筛选后,2001年复核若不能在构象系综保留「结构多样性与热力学系综不是同义词,状态权重需实验或物理校准」的方向,它就只是原样本内的相关。
DelAlamo等2022年系统测试AlphaFold2对转运蛋白替代构象的能力,发现浅化MSA可产生状态多样性但排名不稳定。换批次重做时,须按盲靶提交口径把Del Alamo等在2022年的提出证据与Wayment-Steele等在2024年的后续结果放进构象系综研究分母。由外部团队只凭公开记录复算时,盲靶提交核对对象是否同一,界面能核对失败样本有没有被删去;二者分开,构象系综研究有效对象数/界面能登记总数才不由筛选规则制造。
改用另一台装置后,原始研究已露出边界:改变MSA得到多个姿势可能是模型不稳定而非真实能量景观,不能按数量推占有率。争议不在于构象系综研究把高置信单结构的边界显露出来是否发生,而在于换批次或换尺度后,构象系综改变且主效应方向不再保留。
让第二个实验室独立执行时,实际流程并列保存盲靶提交、构象系综与界面能,分别标记对象、过程和退出原因。更换原料或样本批号后,工程验收以界面能为入口采用构象系综研究有效对象数/界面能登记总数,单次图像和展示性个案都不能代替构象系综研究分母。
把观察窗延长时,本条与第 258 号《数据科学》第三条「数据表说明书把数据集从“下载文件”改成有历史的研究对象」形成可查接口:邻块用「数据表说明书把数据集从“下载文件”改成有历史的研究对象」核对数据科学对象,本块只核对盲靶提交下的构象系综研究有效对象数/界面能登记总数。缩小到单个对象时,两边共享〔23 中位个案代表分布〕,却不能互相代替;构象系综研究还须接受构象系综的独立复测。提高通量而不改阈值时,反例仍由本家给出——改变MSA得到多个姿势可能是模型不稳定而非真实能量景观,不能按数量推占有率;删掉这项限制,只会得到同名类比。
九、ProteinMPNN把固定骨架的序列设计变成条件生成ProteinMPNN Makes Sequence Design Conditional on Backbone
交换发现批次与验证批次时,Dauparas等在2022年的工作把困难落到分辨率可识别的对象上;本条改写的是「序列设计的终点是实验折叠与功能,不是模型自洽」,而不是把ProteinMPNN把固定骨架的序列设计变成条件生成当作又一次性能刷新。按预注册方案重跑时,ProteinMPNN把固定骨架的序列设计变成条件生成离开分辨率对象定义后,平均改进可能只来自分母重选。
撤去展示性筛选后,本条锁定骨架几何条件下的氨基酸概率:保持实验复测与样本边界不变,只改变这一环节,ProteinMPNN有效对象数/盲靶提交登记总数才应沿预测方向移动。由外部团队只凭公开记录复算时,2001年复核若不能在实验复测保留「序列设计的终点是实验折叠与功能,不是模型自洽」的方向,它就只是原样本内的相关。
ProteinMPNN序列恢复率超过50%,天然序列也不是唯一可折叠答案。改用另一台装置后,须按分辨率口径把Dauparas等在2022年的提出证据与Watson等在2023年的后续结果放进ProteinMPNN分母。换批次重做时,分辨率核对对象是否同一,盲靶提交核对失败样本有没有被删去;二者分开,ProteinMPNN有效对象数/盲靶提交登记总数才不由筛选规则制造。
把样品规模放大后,原始研究已露出边界:成功设计经计算和实验多级筛选,最终命中率必须除以全部进入流程候选。争议不在于ProteinMPNN把固定骨架的序列设计变成条件生成是否发生,而在于换批次或换尺度后,实验复测改变且主效应方向不再保留。让第二个实验室独立执行时,2023年论文承担的是越过原分辨率场景的边界检验,不能用更新年份冒充ProteinMPNN的独立复现。
更换原料或样本批号后,实际流程并列保存分辨率、实验复测与盲靶提交,分别标记对象、过程和退出原因。把观察窗延长时,工程验收以盲靶提交为入口采用ProteinMPNN有效对象数/盲靶提交登记总数,单次图像和展示性个案都不能代替ProteinMPNN分母。
缩小到单个对象时,本条与第 332 号《生物信息学与计算生物学》第丙条「RNA-seq 定量:表达量从芯片强度变成读段生成率」形成可查接口:邻块用「RNA-seq 定量:表达量从芯片强度变成读段生成率」核对生物信息学与计算生物学对象,本块只核对分辨率下的ProteinMPNN有效对象数/盲靶提交登记总数。提高通量而不改阈值时,两边共享〔28 记录存在即可核对〕,却不能互相代替;ProteinMPNN还须接受实验复测的独立复测。把失败样本补回分母后,反例仍由本家给出——成功设计经计算和实验多级筛选,最终命中率必须除以全部进入流程候选;删掉这项限制,只会得到同名类比。
十、RFdiffusion把新蛋白骨架变成去噪生成RFdiffusion Turns New Protein Backbones into Denoising Generation
把最优参数降为中位参数时,Watson等在2023年的工作把困难落到构象系综可识别的对象上;本条改写的是「扩散模型提出结构,湿实验决定是否折叠、结合和执行功能」,而不是把RFdiffusion把新蛋白骨架变成去噪生成当作又一次性能刷新。撤去展示性筛选后,若归档仍只留下冠军样品,分辨率未接纳的未通过分辨率、在界面能退出或未进入RFdiffusion统计的对象就会从因果账本中消失。
由外部团队只凭公开记录复算时,本条锁定结构扩散去噪与条件约束:保持界面能与样本边界不变,只改变这一环节,RFdiffusion有效对象数/分辨率登记总数才应沿预测方向移动。换批次重做时,2001年复核若不能在界面能保留「扩散模型提出结构,湿实验决定是否折叠、结合和执行功能」的方向,它就只是原样本内的相关。
扩散模型提出结构,湿实验决定是否折叠、结合和执行功能。把样品规模放大后,须按构象系综口径把Watson等在2023年的提出证据与Krishna等在2024年的后续结果放进RFdiffusion分母。改用另一台装置后,构象系综核对对象是否同一,分辨率核对失败样本有没有被删去;二者分开,RFdiffusion有效对象数/分辨率登记总数才不由筛选规则制造。
让第二个实验室独立执行时,原始研究已露出边界:论文展示的是经过计算过滤和实验筛选的幸存者,生成总数不是设计成功总数。争议不在于RFdiffusion把新蛋白骨架变成去噪生成是否发生,而在于换批次或换尺度后,界面能改变且主效应方向不再保留。更换原料或样本批号后,2024年论文承担的是越过原构象系综场景的边界检验,不能用更新年份冒充RFdiffusion的独立复现。
把观察窗延长时,实际流程并列保存构象系综、界面能与分辨率,分别标记对象、过程和退出原因。缩小到单个对象时,工程验收以分辨率为入口采用RFdiffusion有效对象数/分辨率登记总数,单次图像和展示性个案都不能代替RFdiffusion分母。
提高通量而不改阈值时,本条与第 259 号《生物化学与分子生物学》第己条「化学蛋白组学把“可成药”改成全蛋白组反应性地图」形成可查接口:邻块用「化学蛋白组学把“可成药”改成全蛋白组反应性地图」核对生物化学与分子生物学对象,本块只核对构象系综下的RFdiffusion有效对象数/分辨率登记总数。把失败样本补回分母后,两边共享〔11 可复现=可重做〕,却不能互相代替;RFdiffusion还须接受界面能的独立复测。按预注册方案重跑时,反例仍由本家给出——论文展示的是经过计算过滤和实验筛选的幸存者,生成总数不是设计成功总数;删掉这项限制,只会得到同名类比。
十一、从头酶功能设计把结构成功推向催化验收De Novo Functional Design Pushes Beyond Structure into Catalysis
撤去展示性筛选后,Yeh等在2023年的工作把困难落到实验复测可识别的对象上;本条改写的是「功能设计必须按周转、选择性和稳定性验收,结构吻合只是入口」,而不是把从头酶功能设计把结构成功推向催化验收当作又一次性能刷新。
换批次重做时,本条锁定功能基序几何、序列背景与实验选择:保持盲靶提交与样本边界不变,只改变这一环节,从头酶功能设计有效对象数/构象系综登记总数才应沿预测方向移动。改用另一台装置后,2001年复核若不能在盲靶提交保留「功能设计必须按周转、选择性和稳定性验收,结构吻合只是入口」的方向,它就只是原样本内的相关。
功能设计必须按周转、选择性和稳定性验收,结构吻合只是入口。让第二个实验室独立执行时,须按实验复测口径把Yeh等在2023年的提出证据与Lauko等在2025年的后续结果放进从头酶功能设计分母。把样品规模放大后,实验复测核对对象是否同一,构象系综核对失败样本有没有被删去;二者分开,从头酶功能设计有效对象数/构象系综登记总数才不由筛选规则制造。
更换原料或样本批号后,原始研究已露出边界:成功荧光素酶来自特定易读发光反应,不能外推为任意多步催化可按同样效率设计。争议不在于从头酶功能设计把结构成功推向催化验收是否发生,而在于换批次或换尺度后,盲靶提交改变且主效应方向不再保留。
缩小到单个对象时,实际流程并列保存实验复测、盲靶提交与构象系综,分别标记对象、过程和退出原因。提高通量而不改阈值时,工程验收以构象系综为入口采用从头酶功能设计有效对象数/构象系综登记总数,单次图像和展示性个案都不能代替从头酶功能设计分母。
把失败样本补回分母后,本条与第 043 号《深度学习》第辛条「开源框架:计算图与自动微分把复现成本降到团队可承受」形成可查接口:邻块用「开源框架:计算图与自动微分把复现成本降到团队可承受」核对深度学习对象,本块只核对实验复测下的从头酶功能设计有效对象数/构象系综登记总数。按预注册方案重跑时,两边共享〔28 记录存在即可核对〕,却不能互相代替;从头酶功能设计还须接受盲靶提交的独立复测。移出原先环境后,反例仍由本家给出——成功荧光素酶来自特定易读发光反应,不能外推为任意多步催化可按同样效率设计;删掉这项限制,只会得到同名类比。
十二、AlphaMissense把结构先验接到变异致病排序AlphaMissense Connects Structural Priors to Variant Pathogenicity
由外部团队只凭公开记录复算时,Cheng等在2023年的工作把困难落到界面能可识别的对象上;本条改写的是「结构与语言先验能排序变异,家系、功能和临床证据仍决定致病结论」,而不是把AlphaMissense把结构先验接到变异致病排序当作又一次性能刷新。换批次重做时,若归档仍只留下冠军样品,实验复测未接纳的未通过实验复测、在分辨率退出或未进入AlphaMissense统计的对象就会从因果账本中消失。
改用另一台装置后,本条锁定序列进化约束、结构环境与临床标签:保持分辨率与样本边界不变,只改变这一环节,AlphaMissense有效对象数/实验复测登记总数才应沿预测方向移动。把样品规模放大后,2001年复核若不能在分辨率保留「结构与语言先验能排序变异,家系、功能和临床证据仍决定致病结论」的方向,它就只是原样本内的相关。
Cheng等2023年发布AlphaMissense并为约7100万可能错义变异分类。更换原料或样本批号后,须按界面能口径把Cheng等在2023年的提出证据与Molotkov、Mardis与Artomov在2024年的后续结果放进AlphaMissense分母。让第二个实验室独立执行时,界面能核对对象是否同一,实验复测核对失败样本有没有被删去;二者分开,AlphaMissense有效对象数/实验复测登记总数才不由筛选规则制造。
把观察窗延长时,原始研究已露出边界:模型把既有临床标签和进化约束压成分数,罕见机制与低外显率基因会被平均。争议不在于AlphaMissense把结构先验接到变异致病排序是否发生,而在于换批次或换尺度后,分辨率改变且主效应方向不再保留。缩小到单个对象时,2024年论文承担的是越过原界面能场景的边界检验,不能用更新年份冒充AlphaMissense的独立复现。
提高通量而不改阈值时,实际流程并列保存界面能、分辨率与实验复测,分别标记对象、过程和退出原因。把失败样本补回分母后,工程验收以实验复测为入口采用AlphaMissense有效对象数/实验复测登记总数,单次图像和展示性个案都不能代替AlphaMissense分母。
按预注册方案重跑时,本条与第 301 号《泛函分析与算子代数》第四条「量子Wasserstein:熵下降成为非交换距离」形成可查接口:邻块用「量子Wasserstein:熵下降成为非交换距离」核对泛函分析与算子代数对象,本块只核对界面能下的AlphaMissense有效对象数/实验复测登记总数。移出原先环境后,两边共享〔29 越精细越接近真实〕,却不能互相代替;AlphaMissense还须接受分辨率的独立复测。改变操作者而锁定流程时,反例仍由本家给出——模型把既有临床标签和进化约束压成分数,罕见机制与低外显率基因会被平均;删掉这项限制,只会得到同名类比。
◎ 二十年连起来看
结构生物学与蛋白折叠最深的变化,是判断对象从单一冠军读数转向完整责任链。2009年的「CASP把结构预测放到不许自评的盲尺上」与2020年的「AlphaFold第一代把共进化与深度网络合成距离几何」分别改写对象和尺度;把两条并读,才看见何种改进来自机制,何种改进只是分母移动。
第二条贯穿线是失败开始拥有名称。「串行飞秒晶体学把辐射损伤改成击毁前衍射」把失效写进过程,「ESMFold把多序列搜索部分压进蛋白语言模型」又把退出、域外和未复现样本放回账本。二十条自曝字段互不代用,说明结构生物学与蛋白折叠的边界不是一句“仍需研究”可以概括。
第三条线是基础设施进入思想本身。从「结构基因组学把失败构建暴露为系统瓶颈」到「AlphaMissense把结构先验接到变异致病排序」,结构生物学与蛋白折叠越来越依赖版本、共享数据、质量控制和长期维护。技术能否工作与谁能持续复算,已经是同一条命题的两个端点。
◎ 三个常见误解
误解一把「CASP把结构预测放到不许自评的盲尺上」读成性能越高越好;只有CASP有效对象数/界面能登记总数保持方向,冠军读数才可外推。
误解二把「AlphaFold2把结构预测推进到近实验精度」理解为旧方法失效;在使用最高置信模型会系统删除真实柔性和替代状态时,多序列注意、等…;方向反过来时,旧方法仍可能是更稳健的基线。
误解三把「从头酶功能设计把结构成功推向催化验收」当成自动化问题;若未通过构象系综、在盲靶提交退出或未进入从头酶功能设计统计的对象仍不设字段,吞吐越高,遗漏越难看见。自动化不会自行修复采样和标签的既有边界。
◎ 与相邻领域的接口
与第 259 号《生物化学与分子生物学》的分工落在对象层:对方第三条「TurboID把短暂近邻从不可见互作变成分钟级标记」解释邻域机制,本块「共进化把序列家族变成三维接触约束」负责给出结构生物学与蛋白折叠的可比读数与失败分母。
与第 117 号《医疗器械与诊断技术》的接口落在方法层。对方「人因工程:误用不是使用者噪声而是设计变量」提供另一种观测或计算,本块「Rosetta界面设计把蛋白结合从筛选推进到计算提案」要求同一变化在分辨率和实验复测之间保留方向。
与第 117 号《医疗器械与诊断技术》的接口落在治理层。对方第九条「数字病理:全视野模型把样本偏差放大到医院尺度」处理外部条件,本块「AlphaFold3把预测对象扩展到全原子相互作用」核对名义采用、真实到达与长期代价是否属于同一分母。
◎ 争议现场
第一场争论围绕「直接电子探测器触发冷冻电镜分辨率革命」:最终重构只包含被分类保留颗粒,制样失败、界面偏好和少数状态不在同一分母。要收敛,需要在预注册方案中固定盲靶提交与构象系综,并把阴性批次逐一公开。
第二场争论围绕「AlphaFold数据库把结构预测变成公共基础设施」:当逾两亿覆盖是序列数量,不是两亿个实验验证结构或功能机制时,本条只适用于原样本与原装置…。决定性设计不是继续增加同类样本,而是换装置、换实验室后保留AlphaFold数据库有效对象数/盲靶提交登记总数的符号。
第三场争论围绕「RFdiffusion把新蛋白骨架变成去噪生成」:未通过分辨率、在界面能退出或未进入RFdiffusion统计的对象。只有把这些对象纳入分母,并观察它们是否改变结论,争论才会从术语偏好变成可判决证据。
◎ 往下五年看什么
到2031年先看「MicroED让纳米晶体进入电子衍射结构学」能否把MicroED有效对象数/实验复测登记总数从单中心读数推进到多中心分布,并公开中心间方差。
第二个读数是「RoseTTAFold证明三轨信息交换不是单一路线」的失败率:未通过界面能、在构象系综退出或未进入RoseTTAFold统计的对象占全部进入流程对象的比例是否下降,而不是入组后成功率是否继续升高。
第三个读数是「构象系综研究把高置信单结构的边界显露出来」的真实迁移:在分辨率改变、界面能保持时,主效应的方向能否跨批次保留。
第四个读数是「AlphaMissense把结构先验接到变异致病排序」的全成本分母:把维护、退出、复测与处置纳入后,AlphaMissense有效对象数/实验复测登记总数是否仍优于现行基线。
◎ 可与哪些领域对撞
本块「CASP把结构预测放到不许自评的盲尺上」与第 332 号《生物信息学与计算生物学》第十一条「生成式蛋白设计:算法从预测天然结构转向提出新序列」共享〔03 有限近似控制无限对象〕。两边若都成立,对象身份就不能只在实验开始前给定一次。
本块「结构基因组学把失败构建暴露为系统瓶颈」与第 258 号《数据科学》第二条「模型卡把用途、亚群与失败条件写进产品接口」都核对失败分母:退出者和未达标路径本身可能是结果。
本块「AlphaFold-Multimer把界面预测推进到复合物」与第 031 号《免疫学》第丁条「Belimumab把系统性红斑狼疮从经验免疫抑制推进到B细胞生存信号」在顺序上相反;需另设条件变量裁决何时可交换。
本块「从头酶功能设计把结构成功推向催化验收」与第 043 号《深度学习》第辛条「开源框架:计算图与自动微分把复现成本降到团队可承受」共同挑战“更多数据自然减偏”:同源误差增加时,置信度升而外推性不升。
◎ 十条可做的研究命题
命题1:固定盲靶提交,以「结构基因组学把失败构建暴露为系统瓶颈」的只检验从基因到结构各步骤的累计成功率,不预测结构基因组学有效对象数/分辨率登记总;跨批次保留未通过分辨率、在界面能退出或未进入结,失败样本使方向消失即证伪。
命题2:固定分辨率,以「RoseTTAFold证明三轨信息交」的只检验多尺度表示的双向更新,不以盲靶提交预测RoseTTAFold有效对象数/界;跨批次保留未通过界面能、在构象系综退出或未进入,失败样本使方向消失即证伪。
命题3:固定构象系综,以「AlphaFold-Multimer」的只检验跨链共进化、配对,不以实验复测展示预测AlphaFold-Mul…有效对象;跨批次保留未通过构象系综、在盲靶提交退出或未进,失败样本使方向消失即证伪。
命题4:固定实验复测,以「ProteinMPNN把固定骨架的序」的只检验骨架几何条件下的氨基酸概率,不以分预测ProteinMPNN有效对象数/盲;跨批次保留未通过盲靶提交、在实验复测退出或未进,失败样本使方向消失即证伪。
命题5:固定界面能,以「AlphaMissense把结构先验」的只检验序列进化约束、结构环境与临床标签预测AlphaMissense有效对象数;跨批次保留未通过实验复测、在分辨率退出或未进入,失败样本使方向消失即证伪。
命题6:固定盲靶提交,以「直接电子探测器触发冷冻电镜分辨率革命」的只检验探测量子效率与逐帧运动校正,不以构预测直接电子探测器有效对象数/分辨率登记;跨批次保留未通过分辨率、在界面能退出或未进入直,失败样本使方向消失即证伪。
命题7:固定分辨率,以「Foldit把人的空间直觉变成可记录」的只检验人机混合构象搜索与排行榜激励,不以预测Foldit有效对象数/界面能登记总;跨批次保留未通过界面能、在构象系综退出或未进入,失败样本使方向消失即证伪。
命题8:固定构象系综,以「AlphaFold第一代把共进化与深」的只检验多序列比对信息与距离分布预测,不以预测AlphaFold第一代有效对象数/;跨批次保留未通过构象系综、在盲靶提交退出或未进,失败样本使方向消失即证伪。
命题9:固定实验复测,以「AlphaFold数据库把结构预测变」的只检验规模化推理、版本化序列与开放分发预测AlphaFold数据库有效对象数/;跨批次保留未通过盲靶提交、在实验复测退出或未进,失败样本使方向消失即证伪。
命题10:固定界面能,以「AlphaFold3把预测对象扩展到」的只检验扩散去噪外部场景,不以界面能展示值预测AlphaFold3有效对象数/实验;跨批次保留全原子token表示与扩散去噪里的翻,失败样本使方向消失即证伪。
补充判据:结构生物学与蛋白折叠还须同时公开盲靶提交、构象系综与界面能的版本,让命题在换批次后仍可由外部团队判定成立或失败。退出对象应保留原始编号、退出时点与处置原因;若补回这些对象会改变方向,原命题就只能保留为样本内描述。
判定记录还要说明分辨率与实验复测由谁复核、在何时冻结;没有责任人和冻结时点的开放数据,不能承担跨场景比较。
最后保留一张域外反例表,逐项标记界面能是否改变主结论;每个对象都注明进入分母或排除的理由。
◎ 资料核验
- Moult等,2009年《蛋白质》77(S9):1–4,DOI 10.1002/prot.22589。
- 边界证据:边界可参见Baker与Sali,2001年《科学》294:93–96,DOI 10.1126/science.1065659。
- Lensink等,2019年《蛋白质》87:1200–1221,DOI 10.1002/prot.25838。
- Marks等,2011年《公共科学图书馆·综合》6:e28766,DOI 10.1371/journal.pone.0028766。
- Morcos等,2011年《美国科学院院刊》108:E1293–E1301,DOI 10.1073/pnas.1111471108。
- Bai等,2013年《eLife》2:e00461,DOI 10.7554/eLife.00461。
- Kühlbrandt,2014年《科学》343:1443–1444,DOI 10.1126/science.1251652。
- Boutet等,2012年《科学》337:362–364,DOI 10.1126/science.1217737。
- Tenboer等,2014年《科学》346:1242–1246,DOI 10.1126/science.1259357。
- Shi等,2013年《eLife》2:e01345,DOI 10.7554/eLife.01345。
- Nannenga与Gonen,2019年《自然·方法》16:369–379,DOI 10.1038/s41592-019-0395-x。
- Cooper等,2010年《自然》466:756–760,DOI 10.1038/nature09304。
- Eiben等,2012年《自然·生物技术》30:190–192,DOI 10.1038/nbt.2109。
- Fleishman等,2011年《科学》332:816–821,DOI 10.1126/science.1202617。
- Chevalier等,2017年《自然》550:74–79,DOI 10.1038/nature23912。
- Structural Genomics Consortium等,2008年《自然·方法》5:135–146,DOI 10.1038/nmeth.f.202。
- Grabowski等,2016年《结构与功能基因组学杂志》17:1–16,DOI 10.1007/s10969-016-9201-5。
- Senior等,2020年《自然》577:706–710,DOI 10.1038/s41586-019-1923-7。
- Akdel等,2022年《自然·结构与分子生物学》29:1056–1067,DOI 10.1038/s41594-022-00849-w。
- Jumper等,2021年《自然》596:583–589,DOI 10.1038/s41586-021-03819-2。
- Baek等,2021年《科学》373:871–876,DOI 10.1126/science.abj8754。
- Humphreys等,2021年《科学》374:eabm4805,DOI 10.1126/science.abm4805。
- Tunyasuvunakool等,2021年《自然》596:590–596,DOI 10.1038/s41586-021-03828-1。
- Varadi等,2022年《核酸研究》50:D439–D444,DOI 10.1093/nar/gkab1061。
- Lin等,2023年《科学》379:1123–1130,DOI 10.1126/science.ade2574。
- Hayes等,2025年《科学》387:850–858,DOI 10.1126/science.ads0018。
- Evans等,2022年《bioRxiv》2021.10.04.463034,DOI 10.1101/2021.10.04.463034。
- Bryant等,2022年《自然·通讯》13:1265,DOI 10.1038/s41467-022-28865-w。
- Abramson等,2024年《自然》630:493–500,DOI 10.1038/s41586-024-07487-w。
- Nature Editorial,2024年《自然》630:273,DOI 10.1038/d41586-024-01463-0。
- Del Alamo等,2022年《eLife》11:e75751,DOI 10.7554/eLife.75751。
- Wayment-Steele等,2024年《自然》625:832–839,DOI 10.1038/s41586-023-06832-9。
- Dauparas等,2022年《科学》378:49–56,DOI 10.1126/science.add2187。
- Watson等,2023年《自然》620:1089–1100,DOI 10.1038/s41586-023-06415-8。
- Krishna等,2024年《科学》384:eadl2528,DOI 10.1126/science.adl2528。
- Yeh等,2023年《自然》614:774–780,DOI 10.1038/s41586-023-05696-3。
- Lauko等,2025年《科学》388:eadu2454,DOI 10.1126/science.adu2454。
- Cheng等,2023年《科学》381:eadg7492,DOI 10.1126/science.adg7492。
- Molotkov、Mardis与Artomov,2024年《Disease Models & Mechanisms》17:dmm052218,DOI 10.1242/dmm.052218。
以下二十条收录结构生物学与蛋白折叠在1950至2006年间仍被上文正面使用或正面反对的经典命题。它们回答的是另一道问题:现代层每个新读数所改写的老前提,当年由谁、用什么材料立起来。这里不按名望排序,也不回避后来被削弱或判为无效的工作;失效史本身就是可供碰撞的证据。每条采用一行来源、两段正文和五字段碰撞行,并在“今用”与第二段点名它在上文哪一条继续活着。
经一、α螺旋与β折叠:肽键几何与氢键可以限定蛋白主链的规则二级结构The Alpha Helix and Beta Sheet
1951年前后的默认前提是结构生物学与蛋白折叠的主导口径还把α螺旋与β折叠涉及的差异并入平均结果。Linus Pauling与Robert Corey没有只给出术语,而是用模型搭建与已知键长键角把问题变成可比较的材料;由此得到的判决是“肽键几何与氢键可以限定蛋白主链的规则二级结构”。核心读数是符合α螺旋与β折叠预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:非规则环区和内在无序占主导时,二级结构目录不能代表完整构象。后续工作保留了α螺旋与β折叠的问题意识,同时把对象、时间窗和因果范围重新划定。今天从α螺旋与β折叠倒读本块甲「CASP把结构预测放到不许自评的盲尺上」,仍可用这条旧前提核对现代层的新证据。因此本块甲既正面使用α螺旋与β折叠,也用预测进步必须由时间隔离的实验结构裁决,不能用模型自洽代替。检验其失效条件。
经二、肌红蛋白三维结构:X射线晶体学可以给出蛋白质的三维原子轮廓The Structure of Myoglobin
1958年前后的默认前提是结构生物学与蛋白折叠的主导口径还把肌红蛋白三维结构涉及的差异并入平均结果。John Kendrew没有只给出术语,而是用低分辨肌红蛋白电子密度图把问题变成可比较的材料;由此得到的判决是“X射线晶体学可以给出蛋白质的三维原子轮廓”。核心读数是被肌红蛋白三维结构稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:晶体堆积和低分辨率下,静态轮廓不能揭示溶液中的全部状态。后续工作保留了肌红蛋白三维结构的问题意识,同时把对象、时间窗和因果范围重新划定。今天从肌红蛋白三维结构倒读本块甲「CASP把结构预测放到不许自评的盲尺上」,仍可用这条旧前提核对现代层的新证据。本块甲据此用肌红蛋白三维结构的现代关键读数检验其失效。
经三、血红蛋白变构结构:亚基构象与界面变化可把氧结合转成协同响应The Structure of Haemoglobin
1960年前后的默认前提是结构生物学与蛋白折叠的主导口径还把血红蛋白变构结构涉及的差异并入平均结果。Max Perutz没有只给出术语,而是用去氧与含氧晶体结构比较把问题变成可比较的材料;由此得到的判决是“亚基构象与界面变化可把氧结合转成协同响应”。核心读数是符合血红蛋白变构结构预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:晶体端点之间的路径和动力学不能由两张静态结构直接推出。后续工作保留了血红蛋白变构结构的问题意识,同时把对象、时间窗和因果范围重新划定。今天从血红蛋白变构结构倒读本块甲「CASP把结构预测放到不许自评的盲尺上」,仍可用这条旧前提核对现代层的新证据。本块甲据此用血红蛋白变构结构的现代关键读数检验其失效。
经四、Ramachandran构象图:主链二面角受立体排斥限制,可用允许区检查模型The Ramachandran Plot
1963年前后的默认前提是结构生物学与蛋白折叠的主导口径还把Ramachandran构象图涉及的差异并入平均结果。G. N. Ramachandran没有只给出术语,而是用硬球接触与φ/ψ角分布把问题变成可比较的材料;由此得到的判决是“主链二面角受立体排斥限制,可用允许区检查模型”。当时最要紧的读数不是后来教科书里的结论,而是被Ramachandran构象图稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:甘氨酸、脯氨酸和高能瞬态构象不能按一般残基同一边界判定。后续工作保留了Ramachandran构象图的问题意识,同时把对象、时间窗和因果范围重新划定。今天从Ramachandran构象图倒读本块甲「CASP把结构预测放到不许自评的盲尺上」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块甲既正面使用Ramachandran构象图,也用预测进步必须由时间隔离的实验结构裁决,不能用模型自洽代替。检验其失效条件。
经五、Levinthal悖论:蛋白不可能靠随机穷举构象空间完成快速折叠Levinthal's Paradox
1969年前后的默认前提是结构生物学与蛋白折叠的主导口径还把Levinthal悖论涉及的差异并入平均结果。Cyrus Levinthal没有只给出术语,而是用构象数量级与折叠时间估算把问题变成可比较的材料;由此得到的判决是“蛋白不可能靠随机穷举构象空间完成快速折叠”。核心读数是符合Levinthal悖论预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:把悖论误读成存在唯一确定路径时,会忽略多路径与粗糙能量景观。后续工作保留了Levinthal悖论的问题意识,同时把对象、时间窗和因果范围重新划定。今天从Levinthal悖论倒读本块八「构象系综研究把高置信单结构的边界显露出来」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块八既正面使用Levinthal悖论,也用结构多样性与热力学系综不是同义词,状态权重需实验或物理校准。检验其失效条件。
经六、蛋白质数据库:结构坐标应作为可检索、可复用的公共数据保存The Protein Data Bank
1971年前后的默认前提是结构生物学与蛋白折叠的主导口径还把蛋白质数据库涉及的差异并入平均结果。PDB创始团队没有只给出术语,而是用首批晶体结构坐标集中存储把问题变成可比较的材料;由此得到的判决是“结构坐标应作为可检索、可复用的公共数据保存”。核心读数是实际按蛋白质数据库执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:只有坐标而无实验图、版本和构建信息时,记录存在不等于可复算。后续工作保留了蛋白质数据库的问题意识,同时把对象、时间窗和因果范围重新划定。今天从蛋白质数据库倒读本块四「AlphaFold数据库把结构预测变成公共基础设施」,仍可用这条旧前提核对现代层的新证据。本块四据此用蛋白质数据库的现代关键读数检验其失效。
经七、Anfinsen热力学假说:特定小蛋白的天然构象信息包含在其氨基酸序列中Anfinsen's Thermodynamic Hypothesis
1973年前后的默认前提是结构生物学与蛋白折叠的主导口径还把Anfinsen热力学假说涉及的差异并入平均结果。Christian Anfinsen没有只给出术语,而是用核糖核酸酶变性与复性把问题变成可比较的材料;由此得到的判决是“特定小蛋白的天然构象信息包含在其氨基酸序列中”。核心读数是符合Anfinsen热力学假说预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:伴侣依赖、多聚装配、翻译共折叠和无序蛋白中,孤立序列不单独决定状态。后续工作保留了Anfinsen热力学假说的问题意识,同时把对象、时间窗和因果范围重新划定。今天从Anfinsen热力学假说倒读本块甲「CASP把结构预测放到不许自评的盲尺上」,仍可用这条旧前提核对现代层的新证据。因此本块甲既正面使用Anfinsen热力学假说,也用预测进步必须由时间隔离的实验结构裁决,不能用模型自洽代替。检验其失效条件。
经八、单颗粒三维重构:大量二维噪声投影可经对齐和平均恢复三维结构Single-Particle Reconstruction
1975年前后的默认前提是结构生物学与蛋白折叠的主导口径还把单颗粒三维重构涉及的差异并入平均结果。Joachim Frank没有只给出术语,而是用电子显微图像相关对齐把问题变成可比较的材料;由此得到的判决是“大量二维噪声投影可经对齐和平均恢复三维结构”。核心读数是被单颗粒三维重构稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:构象异质和取向偏好存在时,平均会制造并不存在的单一结构。后续工作保留了单颗粒三维重构的问题意识,同时把对象、时间窗和因果范围重新划定。今天从单颗粒三维重构倒读本块丙「直接电子探测器触发冷冻电镜分辨率革命」,仍可用这条旧前提核对现代层的新证据。本块丙据此用单颗粒三维重构的现代关键读数检验其失效。
经九、电子晶体学膜蛋白结构:二维晶体电子衍射可解析膜蛋白跨膜结构Electron Crystallography of Membrane Proteins
1975年前后的默认前提是结构生物学与蛋白折叠的主导口径还把电子晶体学膜蛋白结构涉及的差异并入平均结果。Richard Henderson与Nigel Unwin没有只给出术语,而是用紫膜细菌视紫红质图像重构把问题变成可比较的材料;由此得到的判决是“二维晶体电子衍射可解析膜蛋白跨膜结构”。核心读数是被电子晶体学膜蛋白结构稳定区分的对象数∶全部进入比较的对象数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:二维晶体中的脂质环境和周期约束不能代表所有功能构象。后续工作保留了电子晶体学膜蛋白结构的问题意识,同时把对象、时间窗和因果范围重新划定。今天从电子晶体学膜蛋白结构倒读本块戊「MicroED让纳米晶体进入电子衍射结构学」,仍可用这条旧前提核对现代层的新证据。本块戊据此用电子晶体学膜蛋白结构的现代关键读数检验其失效。
经十、蛋白分子动力学:原子轨迹模拟可以把蛋白结构从静态模型扩展为运动集合Protein Molecular Dynamics
1977年前后的默认前提是结构生物学与蛋白折叠的主导口径还把蛋白分子动力学涉及的差异并入平均结果。Martin Karplus与J. Andrew McCammon没有只给出术语,而是用胰蛋白酶抑制剂短时分子动力学把问题变成可比较的材料;由此得到的判决是“原子轨迹模拟可以把蛋白结构从静态模型扩展为运动集合”。核心读数是由受影响者确认的蛋白分子动力学记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:力场误差与时间尺度不足时,精细轨迹可能从未访问真实慢状态。后续工作保留了蛋白分子动力学的问题意识,同时把对象、时间窗和因果范围重新划定。今天从蛋白分子动力学倒读本块一「AlphaFold第一代把共进化与深度网络合成距离几何」,仍可用这条旧前提核对现代层的新证据。本块一据此用蛋白分子动力学的现代关键读数检验其失效。
经十一、Kabsch结构比对:最小二乘旋转可给两组原子坐标一个可比较的RMSDLeast-Squares Structural Superposition
1976年前后的默认前提是结构生物学与蛋白折叠的主导口径还把Kabsch结构比对涉及的差异并入平均结果。Wolfgang Kabsch没有只给出术语,而是用正交Procrustes旋转把问题变成可比较的材料;由此得到的判决是“最小二乘旋转可给两组原子坐标一个可比较的RMSD”。核心读数是实际按Kabsch结构比对执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:局部域运动和对应关系改变时,单一RMSD会把不同结构压成同一均值。后续工作保留了Kabsch结构比对的问题意识,同时把对象、时间窗和因果范围重新划定。今天从Kabsch结构比对倒读本块三「RoseTTAFold证明三轨信息交换不是单一路线」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块三既正面使用Kabsch结构比对,也用独立路线证明联合几何学习可复现,也为复合物设计提供开放底座。检验其失效条件。
经十二、膜片钳揭示单通道:单个离子通道的开闭可被直接记录为离散电流Patch Clamp Single-Channel Recording
1976年前后的默认前提是结构生物学与蛋白折叠的主导口径还把膜片钳揭示单通道涉及的差异并入平均结果。Erwin Neher与Bert Sakmann没有只给出术语,而是用微电极密封与单通道电流把问题变成可比较的材料;由此得到的判决是“单个离子通道的开闭可被直接记录为离散电流”。核心读数是由受影响者确认的膜片钳揭示单通道记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:膜片环境和电压控制改变蛋白状态时,测量不能与被测通道分离。后续工作保留了膜片钳揭示单通道的问题意识,同时把对象、时间窗和因果范围重新划定。今天从膜片钳揭示单通道倒读本块乙「共进化把序列家族变成三维接触约束」,仍可用这条旧前提核对现代层的新证据。本块乙据此用膜片钳揭示单通道的现代关键读数检验其失效。
经十三、核磁共振蛋白结构:核磁约束可在溶液中给出蛋白构象集合Protein Structure by NMR
1986年前后的默认前提是结构生物学与蛋白折叠的主导口径还把核磁共振蛋白结构涉及的差异并入平均结果。Kurt Wüthrich没有只给出术语,而是用NOE距离、耦合常数与结构计算把问题变成可比较的材料;由此得到的判决是“核磁约束可在溶液中给出蛋白构象集合”。核心读数是由受影响者确认的核磁共振蛋白结构记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:稀疏约束和快速平均下,单一代表结构会隐藏真实系综。后续工作保留了核磁共振蛋白结构的问题意识,同时把对象、时间窗和因果范围重新划定。今天从核磁共振蛋白结构倒读本块八「构象系综研究把高置信单结构的边界显露出来」,仍可用这条旧前提核对现代层的新证据。本块八据此用核磁共振蛋白结构的现代关键读数检验其失效。
经十四、序列—结构关系:序列同一性下降与结构偏差呈系统关系Sequence Identity and Structural Similarity
1986年前后的默认前提是结构生物学与蛋白折叠的主导口径还把序列—结构关系涉及的差异并入平均结果。Cyrus Chothia与Arthur Lesk没有只给出术语,而是用同源蛋白序列与结构成对比较把问题变成可比较的材料;由此得到的判决是“序列同一性下降与结构偏差呈系统关系”。核心读数是由受影响者确认的序列—结构关系记录数∶全部机构记录数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:结构域重排和功能位点选择出现时,全局序列同一性不能预测局部几何。后续工作保留了序列—结构关系的问题意识,同时把对象、时间窗和因果范围重新划定。今天从序列—结构关系倒读本块五「ESMFold把多序列搜索部分压进蛋白语言模型」,仍可用这条旧前提核对现代层的新证据。因此本块五既正面使用序列—结构关系,也用语言模型提高结构搜索速度,不消除序列分布和置信校准。检验其失效条件。
经十五、折叠漏斗:偏向天然态的粗糙能量景观可解释快速折叠而非随机搜索The Protein-Folding Funnel
1987年前后的默认前提是结构生物学与蛋白折叠的主导口径还把折叠漏斗涉及的差异并入平均结果。Bryngelson与Wolynes没有只给出术语,而是用自旋玻璃类比与自由能景观把问题变成可比较的材料;由此得到的判决是“偏向天然态的粗糙能量景观可解释快速折叠而非随机搜索”。核心读数是符合折叠漏斗预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:多稳态、聚集或功能性无序中,单一漏斗图像会遗漏竞争盆地。后续工作保留了折叠漏斗的问题意识,同时把对象、时间窗和因果范围重新划定。今天从折叠漏斗倒读本块八「构象系综研究把高置信单结构的边界显露出来」,仍可用这条旧前提核对现代层的新证据。本块八据此用折叠漏斗的现代关键读数检验其失效。
经十六、分子伴侣:有些蛋白需要伴侣抑制聚集和协助折叠Molecular Chaperones
1987年前后的默认前提是结构生物学与蛋白折叠的主导口径还把分子伴侣涉及的差异并入平均结果。R. John Ellis没有只给出术语,而是用热休克蛋白与折叠中间体把问题变成可比较的材料;由此得到的判决是“有些蛋白需要伴侣抑制聚集和协助折叠”。当时最要紧的读数不是后来教科书里的结论,而是符合分子伴侣预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:把伴侣作用等同于提供最终结构信息时,会夸大其模板功能。后续工作保留了分子伴侣的问题意识,同时把对象、时间窗和因果范围重新划定。今天从分子伴侣倒读本块六「AlphaFold-Multimer把界面预测推进到复合物」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块六既正面使用分子伴侣,也用复合物预测必须把候选链集合与计量错误纳入分母。检验其失效条件。
经十七、同源建模:已知同源结构可约束未知蛋白的三维模型Comparative Protein Modelling
1993年前后的默认前提是结构生物学与蛋白折叠的主导口径还把同源建模涉及的差异并入平均结果。Andrej Šali与Tom Blundell没有只给出术语,而是用空间约束满足与模板比对把问题变成可比较的材料;由此得到的判决是“已知同源结构可约束未知蛋白的三维模型”。核心读数是符合同源建模预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:低同源、错误比对和新折叠出现时,漂亮模型会稳定继承模板错误。后续工作保留了同源建模的问题意识,同时把对象、时间窗和因果范围重新划定。今天从同源建模倒读本块九「ProteinMPNN把固定骨架的序列设计变成条件生成」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块九既正面使用同源建模,也用序列设计的终点是实验折叠与功能,不是模型自洽。检验其失效条件。
经十八、SCOP结构分类:蛋白结构可按家族、超家族和折叠层级组织SCOP Structural Classification
1995年前后的默认前提是结构生物学与蛋白折叠的主导口径还把SCOP结构分类涉及的差异并入平均结果。Alexey Murzin等没有只给出术语,而是用专家检查的结构层级分类把问题变成可比较的材料;由此得到的判决是“蛋白结构可按家族、超家族和折叠层级组织”。核心读数是实际按SCOP结构分类执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:连续演化与多结构域重组存在时,互斥层级会强迫对象落入单格。后续工作保留了SCOP结构分类的问题意识,同时把对象、时间窗和因果范围重新划定。今天从SCOP结构分类倒读本块四「AlphaFold数据库把结构预测变成公共基础设施」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块四既正面使用SCOP结构分类,也用公共预测库必须让置信、版本和非实验来源随坐标一起传播。检验其失效条件。
经十九、CATH结构域分类:自动算法与人工审查可共同划分结构域层级CATH Domain Classification
1997年前后的默认前提是结构生物学与蛋白折叠的主导口径还把CATH结构域分类涉及的差异并入平均结果。Christine Orengo等没有只给出术语,而是用类、架构、拓扑和同源超家族把问题变成可比较的材料;由此得到的判决是“自动算法与人工审查可共同划分结构域层级”。核心读数是实际按CATH结构域分类执行的单位数∶名义采用该安排的单位数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:结构域边界依赖算法和版本时,同一蛋白会跨版本换类。后续工作保留了CATH结构域分类的问题意识,同时把对象、时间窗和因果范围重新划定。今天从CATH结构域分类倒读本块四「AlphaFold数据库把结构预测变成公共基础设施」,仍能看见这条旧前提在起作用——现代层改变的是对象、尺度或证据门槛,并未取消它提出的问题。因此本块四既正面使用CATH结构域分类,也用公共预测库必须让置信、版本和非实验来源随坐标一起传播。检验其失效条件。
经二十、内在无序蛋白:功能蛋白不必都具有唯一稳定三维结构Intrinsically Disordered Proteins
2001年前后的默认前提是结构生物学与蛋白折叠的主导口径还把内在无序蛋白涉及的差异并入平均结果。Keith Dunker与Peter Wright没有只给出术语,而是用序列偏好、谱学与功能案例汇总把问题变成可比较的材料;由此得到的判决是“功能蛋白不必都具有唯一稳定三维结构”。核心读数是符合内在无序蛋白预测的观察数∶全部接受同一检验的观察数第一次有了可复算分母。
后来的修正并未抹去这条经典,而是把边界划得更清楚:无序预测分数不能代替条件依赖的实验系综,也不能把未折叠等同于无功能。后续工作保留了内在无序蛋白的问题意识,同时把对象、时间窗和因果范围重新划定。今天从内在无序蛋白倒读本块十二「AlphaMissense把结构先验接到变异致病排序」,仍可用这条旧前提核对现代层的新证据。本块十二据此用内在无序蛋白的现代关键读数检验其失效。
◎ 这一层怎么用
读到现代层的某一条时,先沿“今用”回到对应经典,比较两条的关键栏:前者说明结构生物学与蛋白折叠近二十年换掉了什么,后者说明被换掉的前提如何取得最初证据。年份边界严格分开,1950年前的工作只作背景,2006年后的主证据只进现代层。
使用时守三条纪律:年代久远不等于免于边界审查;被修正的经典仍可提供失效条件;两层不比高下,也不把同一命题拆写两遍。若经典条无法回指本块具体条目,它就不属于这一层。
◎ 经典层资料核验
- Pauling、Corey与Branson,1951年《Proceedings of the National Academy of Sciences》37:205–211。
- Kendrew等,1958年《Nature》181:662–666。
- Perutz等,1960年《Nature》185:416–422。
- Ramachandran、Ramakrishnan与Sasisekharan,1963年《Journal of Molecular Biology》7:95–99。
- Levinthal,1969年收于《Mössbauer Spectroscopy in Biological Systems》(University of Illinois Press)。
- Protein Data Bank,1971年《Nature New Biology》233:223。
- Anfinsen,1973年《Science》181:223–230。
- Frank,1975年《Ultramicroscopy》1:159–162。
- Henderson与Unwin,1975年《Nature》257:28–32。
- McCammon、Gelin与Karplus,1977年《Nature》267:585–590。
- Kabsch,1976年《Acta Crystallographica A》32:922–923。
- Neher与Sakmann,1976年《Nature》260:799–802。
- Wüthrich,1986年《NMR of Proteins and Nucleic Acids》(Wiley)。
- Chothia与Lesk,1986年《EMBO Journal》5:823–826。
- Bryngelson与Wolynes,1987年《Proceedings of the National Academy of Sciences》84:7524–7528。
- Ellis,1987年《Nature》328:378–379。
- Šali与Blundell,1993年《Journal of Molecular Biology》234:779–815。
- Murzin等,1995年《Journal of Molecular Biology》247:536–540。
- Orengo等,1997年《Structure》5:1093–1108。
- Dunker等,2001年《Journal of Molecular Graphics and Modelling》19:26–59。
- Branden与Tooze,1991年《Introduction to Protein Structure》(Garland)。
- Creighton,1993年《Proteins: Structures and Molecular Properties》(W. H. Freeman)。
- Wüthrich,1986年《NMR of Proteins and Nucleic Acids》(Wiley)。
- Cantor与Schimmel,1980年《Biophysical Chemistry》(W. H. Freeman)。
- Fersht,1999年《Structure and Mechanism in Protein Science》(W. H. Freeman)。
- Berman等,2000年《The Protein Data Bank》(Nucleic Acids Research)。
- Lesk,2001年《Introduction to Protein Architecture》(Oxford University Press)。
- Bourne与Weissig主编,2003年《Structural Bioinformatics》(Wiley-Liss)。
- Dill与Bromberg,2003年《Molecular Driving Forces》(Garland Science)。
- Richards,1991年《The Protein Folding Problem》(AAAS文集)。
- Nelson与Cox,2005年《Lehninger Principles of Biochemistry》第四版(W. H. Freeman)。