生物医学基础模型与医学AI
医学基础模型的价值不在参数规模,而在同一表征能否跨任务复用后仍保留疾病谱、工作流和人群差异。本面板把基准成绩、临床对话、影像迁移与监管边界分开,拒绝把考试正确率直接写成医疗能力。
第一幕追踪生物医学基础模型与医学AI如何把旧问题变成可执行、可测量的对象;判断标准始终是医学基础模型的决定性机制是可复用表征在跨机构迁移后仍保持临床校准与可追责性,而不是预训练数据或参数增加。
甲、皮肤癌深度学习Dermatologist-Level Classification
Esteva et al., Nature 542, 115–118 (2017), doi:10.1038/nature21056把皮肤癌深度学习钉在可复算节点:研究在图像数据上训练网络并与皮肤科医师比较,证明通用视觉表征可迁移到皮肤病分类。端到端卷积网络学习病变视觉表征须与肤色、相机与转诊谱变化分账;〔对象清单〕2026年复核保留旧基线、版本与失败运行。
皮肤癌深度学习只锁定一个原因:端到端卷积网络学习病变视觉表征。〔对象清单〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,肤色、相机与转诊谱变化不得由峰值代偿。多肤色外部队列的敏感度差以95%区间裁决。〔〔对象清单〕对象清单〕对皮肤癌深度学习Dermatologist-Level Classification而言,真正需要登记的不是又一个平均分,而是由“决定本项医学AI结果能否成立的只有端到端卷积网络学习病变视觉表征”推出的每一步中介、责任人和可撤回条件,〔对象清单〕缺少任何一环,都不能把相关性写成机制。
提出卷页由Esteva et al., Nature 542, 115–118 (2017), doi:10.1038/nature21056锁定,反方命题是“精选图像上的专家水平能否迁移到真实分诊”,截至2025年的延续为“外部临床试验开始检验多肤色和手机图像”。皮肤癌深度学习复算给3套配置、95%区间、5%尾部和run ID,肤色、相机与转诊谱变化失败样本不清洗。
皮肤癌深度学习的硬边界是病例谱、图像质量和转诊阈值变化会令曲线下面积无法代表临床伤害。2026年把肤色、相机与转诊谱变化推至规格外;深肤色与手机图像占比越高,精选集专家一致率反而越低,平均基准不能冲销反号结果。〔对象清单〕落到复现实务,可为皮肤癌深度学习Dermatologist-Level Classification建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“端到端卷积网络学习病变视觉表征”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。
〔对象清单〕工程验收以“端到端卷积网络学习病变视觉表征”为主读数,连续24h记录多肤色外部队列的敏感度差、版本、人工接管与恢复。肤色、相机与转诊谱变化未测即保留“尚缺皮肤癌深度学习在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。
皮肤癌深度学习跨域登记为计算精准健康称“PheWAS电子病历表型扫描”;见第552号第一条“PheWAS电子病历表型扫描”。〔对象清单〕它共享〔01 谁进入分母〕精选图像上的专家水平能否迁移到真实分诊,2026年送往第二平台时,肤色、相机与转诊谱变化的对象、量纲与停止阈值均不得改名。皮肤癌深度学习若不能跨版本复现,只保留为局部案例;多肤色外部队列的敏感度差必须公开原始记录。〔对象清单〕本条的边界案例应从“尚缺皮肤癌深度学习在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:病例谱、图像质量和转诊阈值变化会令曲线下面积无法代表临床伤害,深肤色与手机图像占比越高,精选集专家一致率反而越低”究竟是偶发噪声,还是足以改变结论方向的系统反例。
乙、胸片深度学习基准Chest Radiograph Deep Learning
胸片深度学习基准由Rajpurkar et al., arXiv:1711.05225, CheXNet (2017)固定为历史节点,新意是CheXNet在ChestX-ray14上推动胸片深度学习基准,并暴露自然语言标签与病灶定位差距。2026年重读时把用弱标签海量胸片预训练疾病表征、弱标签噪声、设备差异与患病率漂移和实现栈并列,避免把单次纪录误作系统能力。
可消融的唯一单因是用弱标签海量胸片预训练疾病表征:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。跨机构标签复核后的AUROC差以95%区间登记。
Rajpurkar et al., arXiv:1711.05225, CheXNet (2017)给出起点,争议由“公开标签能否代表放射科最终诊断”承担,最新状态是“大胸片模型转向报告生成和多机构外部验证”。证据表列3组弱标签噪声、设备差异与患病率漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔事件时间轴〕机构采用胸片深度学习基准Chest Radiograph Deep Learning之前还应公布否决门槛:一旦“⇄系统核算后方向反转:报告抽取错误、设备标记和医院捷径会制造表面准确,不能从内部测试推临床优越,标签量越大,历史报告偏差被模型复制得反而”出现,就暂停扩张并回到“用弱标签海量胸片预训练疾病表征”的原始记录复核,该门槛必须早于部署决定写入方案。
边界判据写作报告抽取错误、设备标记和医院捷径会制造表面准确,不能从内部测试推临床优越。当2026年测试越过弱标签噪声、设备差异与患病率漂移,标签量越大,历史报告偏差被模型复制得反而越稳;方向翻转须先于均值进入结论。
“用弱标签海量胸片预训练疾病表征”承担验收读数,另开弱标签噪声、设备差异与患病率漂移账。系统跑满24h后保留跨机构标签复核后的AUROC差、版本、维修与中止原因;〔事件时间轴〕余下5%失败及“尚缺胸片深度学习基准在独立场景的长周期阴性结果”仍入正文。〔事件时间轴〕把胸片深度学习基准Chest Radiograph Deep Learning与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“用弱标签海量胸片预训练疾病表征”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。
胸片深度学习基准的异名接口采用计算精准健康称“个人多组学纵向剖面iPOP”;见第552号第二条“个体多组学画像”。共同预设是〔01 谁进入分母〕公开标签能否代表放射科最终诊断;第二团队在2026年重放原始记录时,不得以同向代理替换弱标签噪声、设备差异与患病率漂移。胸片深度学习基准若不能跨版本复现,只保留为局部案例;跨机构标签复核后的AUROC差必须公开原始记录。
丙、ClinicalBERT病历语言模型ClinicalBERT
在Alsentzer et al., Clinical Natural Language Processing Workshop, 72–78 (2019)之前,ClinicalBERT病历语言模型缺少把局部优化变成系统判断的支点;节点价值在于ClinicalBERT展示领域语料可改善临床文本任务,令病历成为可复用表征来源。2026年评价在临床记录上继续预训练通用语言模型时,同时冻结科室缩写、去标识损失与跨院语义漂移和对照。
因果账只许留下在临床记录上继续预训练通用语言模型这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;科室缩写、去标识损失与跨院语义漂移只界定失效域。跨院概念映射后的F1下降报告95%区间。
来源链依次是Alsentzer et al., Clinical Natural Language Processing Workshop, 72–78 (2019)、“去标识病历文本能否跨医院保留语义”和“临床语言预训练进入编码、预测和摘要任务”。原始表公开3档配置、95%区间、5%失败谱及run ID;科室缩写、去标识损失与跨院语义漂移导致的中止按失败计入分母。
记录风格、模板和照护流程高度机构化,模型可能学习谁记录而非谁患病构成ClinicalBERT病历语言模型的停止线。到2026年,科室缩写、去标识损失与跨院语义漂移一旦主导,去标识越彻底,跨院关键时间与身份线索反而损失越多,峰值读数便不能代表净效用。〔装置边界〕面向下一轮材料,生物医学基础模型与医学AI应优先补齐“尚缺ClinicalBERT病历语言模型在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:记录风格、模板和照护流程高度机构化,模型可能学习谁记录而非谁患病,去标识越彻底,跨院关键时间与身份线索反而损失越多”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
部署账把“在临床记录上继续预训练通用语言模型”设为主量纲,每24h记录跨院概念映射后的F1下降、版本、漂移与恢复。科室缩写、去标识损失与跨院语义漂移无数据就写“尚缺ClinicalBERT病历语言模型在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。
与相邻领域的精确链接是计算精准健康称“临床药物基因组实施CPIC”;见第552号第三条“CPIC药物基因组指南”。双方共享〔01 谁进入分母〕去标识病历文本能否跨医院保留语义;2026年跨平台转移时,科室缩写、去标识损失与跨院语义漂移仍用同一单位、版本与失败阈值。〔装置边界〕在生物医学基础模型与医学AI的这一对象上,复核应把“以“在临床记录上继续预训练通用语言模型”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺ClinicalBERT病历语言模型在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。
丁、BioBERT生物医学预训练BioBERT
Lee et al., Bioinformatics 36, 1234–1240 (2020), doi:10.1093/bioinformatics/btz682使BioBERT生物医学预训练从局部演示转为可审计命题,核心观察是BioBERT在PubMed和全文语料上适配BERT,并改善实体识别、关系抽取与问答。2026年证据包把在论文语料上继续预训练获得领域表征与文献时效、实体歧义与机制外推分别编号,并保留旧方法对照。〔样本分层〕对BioBERT生物医学预训练BioBERT而言,真正需要登记的不是又一个平均分,而是由“决定本项医学AI结果能否成立的只有在论文语料上继续预训练获得领域表征”推出的每一步中介、责任人和可撤回条件,〔样本分层〕缺少任何一环,都不能把相关性写成机制。
这里拒绝多因叙述,决定结果能否成立的只有在论文语料上继续预训练获得领域表征。〔样本分层〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。机制问答与实体关系的校准误差须给95%区间。
提出证据见Lee et al., Bioinformatics 36, 1234–1240 (2020), doi:10.1093/bioinformatics/btz682,最强争议是“文献语言能力是否等于生物机制理解”,延续状态为“生物医学编码器成为检索、实体和关系抽取底座”。BioBERT生物医学预训练交付3批文献时效、实体歧义与机制外推数据、95%区间、5%尾部和run ID,异常逐例保留。〔样本分层〕落到复现实务,可为BioBERT生物医学预训练BioBERT建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“在论文语料上继续预训练获得领域表征”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。
BioBERT生物医学预训练不能越过文献偏倚和时间泄漏会进入模型,抽取关系不能自动成为因果知识。2026年把文献时效、实体歧义与机制外推扫过全量程时,语料覆盖越广,相关语言捷径反而越容易冒充机制理解;方向一旦翻转,平均性能再高也不抵销。
验收表首先读取“在论文语料上继续预训练获得领域表征”,随后核对文献时效、实体歧义与机制外推。持续24h日志含机制问答与实体关系的校准误差、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺BioBERT生物医学预训练在独立场景的长周期阴性结果”。〔样本分层〕证据链还要把Lee et al., Bioinformatics 36, 1234–1240 (2020),的起点材料与更新文献放在同一比较表里,并逐项报告“在论文语料上继续预训练获得领域表征”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
跨域异名为计算精准健康称“UK Biobank深表型队列”;见第552号第四条“英国生物样本库”,不是宽泛类比。它检验〔02 单一读数代表复杂对象〕文献语言能力是否等于生物机制理解;2026年由独立团队复跑原始记录时,文献时效、实体歧义与机制外推的单位、阈值和停止规则保持不变。
戊、BEHRT电子病历TransformerBEHRT
Li et al., Scientific Reports 10, 7155 (2020), doi:10.1038/s41598-020-62922-y把BEHRT电子病历Transformer钉在可复算节点:BEHRT把诊断、年龄和位置编码成纵向序列,在多病预测上展示预训练迁移。用注意力学习疾病和就诊序列表征须与不规则就诊间隔、缺失机制与编码变更分账;〔版本登记〕2026年复核保留旧基线、版本与失败运行。
BEHRT电子病历Transformer只锁定一个原因:用注意力学习疾病和就诊序列表征。〔版本登记〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,不规则就诊间隔、缺失机制与编码变更不得由峰值代偿。时间切分外部队列的校准斜率以95%区间裁决。〔版本登记〕机构采用BEHRT电子病历TransformerBEHRT之前还应公布否决门槛:一旦“⇄系统核算后方向反转:病历事件由医疗利用产生,缺失不随机且同一代码在不同制度中含义不同,就诊序列越长,编码变更与不规则缺失反而越能主导注”出现,就暂停扩张并回到“用注意力学习疾病和就诊序列表征”的原始记录复核,该门槛必须早于部署决定写入方案。
提出卷页由Li et al., Scientific Reports 10, 7155 (2020), doi:10.1038/s41598-020-62922-y锁定,反方命题是“就诊序列能否像词序列一样建模而不丢时间和缺失机制”,截至2025年的延续为“纵向病历基础模型扩展到代码、数值与文本多模态”。BEHRT电子病历Transformer复算给3套配置、95%区间、5%尾部和run ID,不规则就诊间隔、缺失机制与编码变更失败样本不清洗。
BEHRT电子病历Transformer的硬边界是病历事件由医疗利用产生,缺失不随机且同一代码在不同制度中含义不同。2026年把不规则就诊间隔、缺失机制与编码变更推至规格外;就诊序列越长,编码变更与不规则缺失反而越能主导注意力,平均基准不能冲销反号结果。
〔版本登记〕工程验收以“用注意力学习疾病和就诊序列表征”为主读数,连续24h记录时间切分外部队列的校准斜率、版本、人工接管与恢复。不规则就诊间隔、缺失机制与编码变更未测即保留“尚缺BEHRT电子病历Transformer在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。
BEHRT电子病历Transformer跨域登记为计算精准健康称“精准医学计划与All of Us”;见第552号第五条“精准医学计划”。〔版本登记〕它共享〔02 单一读数代表复杂对象〕就诊序列能否像词序列一样建模而不丢时间和缺失机制,2026年送往第二平台时,不规则就诊间隔、缺失机制与编码变更的对象、量纲与停止阈值均不得改名。〔版本登记〕本条的边界案例应从“尚缺BEHRT电子病历Transformer在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:病历事件由医疗利用产生,缺失不随机且同一代码在不同制度中含义不同,就诊序列越长,编码变更与不规则缺失反而越能主导注”究竟是偶发噪声,还是足以改变结论方向的系统反例。
己、CONSORT-AI临床试验报告CONSORT-AI
CONSORT-AI临床试验报告由Liu et al., Nature Medicine 26, 1364–1374 (2020), doi:10.1038/s41591-020-1034-x固定为历史节点,新意是CONSORT-AI扩展清单要求说明模型如何整合进临床、输入质量、输出使用与错误案例。2026年重读时把把算法版本、输入和失败写入试验报告、算法版本、人机交互与失败处置披露和实现栈并列,避免把单次纪录误作系统能力。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项医学AI结果能否成立的只有把算法版本、输入和失败写入试验报告”的操作定义,仍能复算“以“把算法版本、输入和失败写入试验报告”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。
可消融的唯一单因是把算法版本、输入和失败写入试验报告:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。CONSORT-AI条目完整率以95%区间登记。
Liu et al., Nature Medicine 26, 1364–1374 (2020), doi:10.1038/s41591-020-1034-x给出起点,争议由“算法试验能否披露人机交互和错误处理”承担,最新状态是“AI干预报告与SPIRIT-AI共同成为最低透明度要求”。证据表列3组算法版本、人机交互与失败处置披露配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔失败谱〕面向下一轮材料,生物医学基础模型与医学AI应优先补齐“尚缺CONSORT-AI临床试验报告在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:遵守报告清单不等于试验设计公平,选择性终点和对照仍可制造优势,报告清单越齐,未被记录的人机纠错反而越易被当作不存在”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
边界判据写作遵守报告清单不等于试验设计公平,选择性终点和对照仍可制造优势。当2026年测试越过算法版本、人机交互与失败处置披露,报告清单越齐,未被记录的人机纠错反而越易被当作不存在;方向翻转须先于均值进入结论。
“把算法版本、输入和失败写入试验报告”承担验收读数,另开算法版本、人机交互与失败处置披露账。系统跑满24h后保留CONSORT-AI条目完整率、版本、维修与中止原因;〔失败谱〕余下5%失败及“尚缺CONSORT-AI临床试验报告在独立场景的长周期阴性结果”仍入正文。〔失败谱〕在生物医学基础模型与医学AI的这一对象上,复核应把“以“把算法版本、输入和失败写入试验报告”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺CONSORT-AI临床试验报告在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。
CONSORT-AI临床试验报告的异名接口采用计算精准健康称“NCI-MATCH分子肿瘤匹配”;见第552号第六条“NCI-MATCH篮式试验”。共同预设是〔02 单一读数代表复杂对象〕算法试验能否披露人机交互和错误处理;第二团队在2026年重放原始记录时,不得以同向代理替换算法版本、人机交互与失败处置披露。
庚、WHO健康AI伦理原则WHO AI for Health Ethics
在WHO, Ethics and governance of artificial intelligence for health (2021)之前,WHO健康AI伦理原则缺少把局部优化变成系统判断的支点;节点价值在于WHO把人权和伦理置于设计、部署与使用中心,反对技术性能独占治理。2026年评价把自主、福祉、透明、责任、公平与持续性并列时,同时冻结公平、责任、透明与采购约束落地和对照。
因果账只许留下把自主、福祉、透明、责任、公平与持续性并列这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;公平、责任、透明与采购约束落地只界定失效域。采购合同中可执行伦理条款占比报告95%区间。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:原则若没有数据访问、申诉、监测和制裁机制,会停留在价值声明,伦理原则越多,缺少责任主体时可执行约束反而越稀薄”做至少两轮外部复算,若方向翻转,WHO健康AI伦理原则WHO AI for Health Ethics的结论必须随之收窄。
来源链依次是WHO, Ethics and governance of artificial intelligence for health (2021)、“六项伦理原则能否变成采购和问责条款”和“监管机构开始发布医疗AI全生命周期规则”。原始表公开3档配置、95%区间、5%失败谱及run ID;公平、责任、透明与采购约束落地导致的中止按失败计入分母。
原则若没有数据访问、申诉、监测和制裁机制,会停留在价值声明构成WHO健康AI伦理原则的停止线。到2026年,公平、责任、透明与采购约束落地一旦主导,伦理原则越多,缺少责任主体时可执行约束反而越稀薄,峰值读数便不能代表净效用。〔机构接口〕证据链还要把WHO, Ethics and governance of artificial intelli的起点材料与更新文献放在同一比较表里,并逐项报告“把自主、福祉、透明、责任、公平与持续性并列”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
部署账把“把自主、福祉、透明、责任、公平与持续性并列”设为主量纲,每24h记录采购合同中可执行伦理条款占比、版本、漂移与恢复。公平、责任、透明与采购约束落地无数据就写“尚缺WHO健康AI伦理原则在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。
与相邻领域的精确链接是计算精准健康称“多基因风险评分的临床阈值”;见第552号第七条“多基因风险等同单基因风险”。双方共享〔04 测量不改变被测对象〕六项伦理原则能否变成采购和问责条款;2026年跨平台转移时,公平、责任、透明与采购约束落地仍用同一单位、版本与失败阈值。〔机构接口〕对WHO健康AI伦理原则WHO AI for Health Ethics而言,真正需要登记的不是又一个平均分,而是由“决定本项医学AI结果能否成立的只有把自主、福祉、透明、责任、公平与持续性并列”推出的每一步中介、责任人和可撤回条件,〔机构接口〕缺少任何一环,都不能把相关性写成机制。
辛、GatorTron临床大模型GatorTron
Yang et al., npj Digital Medicine 5, 194 (2022), doi:10.1038/s41746-022-00742-2使GatorTron临床大模型从局部演示转为可审计命题,核心观察是GatorTron比较不同规模模型,在临床实体、关系、相似度和问答上呈现规模收益。2026年证据包把九百亿词临床语料扩大语言表征与语料年代、患者结构与下游任务复杂度分别编号,并保留旧方法对照。〔资源预算〕机构采用GatorTron临床大模型GatorTron之前还应公布否决门槛:一旦“⇄系统核算后方向反转:单一医疗系统语料与算力门槛限制复用,基准提升不说明床旁安全,参数越大,复杂任务上的可重复净增益反而可能越小”出现,就暂停扩张并回到“九百亿词临床语料扩大语言表征”的原始记录复核,该门槛必须早于部署决定写入方案。
这里拒绝多因叙述,决定结果能否成立的只有九百亿词临床语料扩大语言表征。〔资源预算〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。复杂任务相对小模型的净增益须给95%区间。
提出证据见Yang et al., npj Digital Medicine 5, 194 (2022), doi:10.1038/s41746-022-00742-2,最强争议是“扩大临床语言模型是否稳定改善复杂任务”,延续状态为“临床大模型转向指令、检索和本地部署”。GatorTron临床大模型交付3批语料年代、患者结构与下游任务复杂度数据、95%区间、5%尾部和run ID,异常逐例保留。〔资源预算〕落到复现实务,可为GatorTron临床大模型GatorTron建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“九百亿词临床语料扩大语言表征”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。
GatorTron临床大模型不能越过单一医疗系统语料与算力门槛限制复用,基准提升不说明床旁安全。2026年把语料年代、患者结构与下游任务复杂度扫过全量程时,参数越大,复杂任务上的可重复净增益反而可能越小;方向一旦翻转,平均性能再高也不抵销。
验收表首先读取“九百亿词临床语料扩大语言表征”,随后核对语料年代、患者结构与下游任务复杂度。持续24h日志含复杂任务相对小模型的净增益、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺GatorTron临床大模型在独立场景的长周期阴性结果”。〔资源预算〕本条的边界案例应从“尚缺GatorTron临床大模型在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:单一医疗系统语料与算力门槛限制复用,基准提升不说明床旁安全,参数越大,复杂任务上的可重复净增益反而可能越小”究竟是偶发噪声,还是足以改变结论方向的系统反例。
跨域异名为计算精准健康称“连续葡萄糖监测与个体反应”;见第552号第八条“连续血糖个体反应”,不是宽泛类比。它检验〔04 测量不改变被测对象〕扩大临床语言模型是否稳定改善复杂任务;2026年由独立团队复跑原始记录时,语料年代、患者结构与下游任务复杂度的单位、阈值和停止规则保持不变。
第二幕转向规模、闭环与责任。最新纪录只有在失败和资源进入分母后,才足以支持“医学基础模型的决定性机制是可复用表征在跨机构迁移后仍保持临床校准与可追责性,而不是预训练数据或参数增加”。
一、Med-PaLM临床知识编码Med-PaLM
Singhal et al., Nature 620, 172–180 (2023), doi:10.1038/s41586-023-06291-2把Med-PaLM临床知识编码钉在可复算节点:Med-PaLM在多项医学问答基准达到较高分数,并由临床医师评估长答案。用医学指令微调和人类反馈改善问答须与事实性、临床后果与医生接管分账;〔外部复算〕2026年复核保留旧基线、版本与失败运行。
Med-PaLM临床知识编码只锁定一个原因:用医学指令微调和人类反馈改善问答。〔外部复算〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,事实性、临床后果与医生接管不得由峰值代偿。真实病例中的可避免伤害率以95%区间裁决。〔外部复算〕面向下一轮材料,生物医学基础模型与医学AI应优先补齐“尚缺Med-PaLM临床知识编码在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:考试题是封闭知识任务,幻觉、遗漏和群体偏差在真实对话中可能改变治疗,考试分数越高,真实对话中的安全升级缺口反而越难”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
提出卷页由Singhal et al., Nature 620, 172–180 (2023), doi:10.1038/s41586-023-06291-2锁定,反方命题是“医学考试和专家评分能否代表患者照护”,截至2025年的延续为“后续模型改进事实性但仍需真实临床验证”。Med-PaLM临床知识编码复算给3套配置、95%区间、5%尾部和run ID,事实性、临床后果与医生接管失败样本不清洗。
Med-PaLM临床知识编码的硬边界是考试题是封闭知识任务,幻觉、遗漏和群体偏差在真实对话中可能改变治疗。2026年把事实性、临床后果与医生接管推至规格外;考试分数越高,真实对话中的安全升级缺口反而越难察觉,平均基准不能冲销反号结果。〔外部复算〕把Med-PaLM临床知识编码Med-PaLM与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“用医学指令微调和人类反馈改善问答”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。
〔外部复算〕工程验收以“用医学指令微调和人类反馈改善问答”为主读数,连续24h记录真实病例中的可避免伤害率、版本、人工接管与恢复。事实性、临床后果与医生接管未测即保留“尚缺Med-PaLM临床知识编码在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。
Med-PaLM临床知识编码跨域登记为计算精准健康称“高性能医学与人机互补”;见第552号第九条“高性能医学”。〔外部复算〕它共享〔04 测量不改变被测对象〕医学考试和专家评分能否代表患者照护,2026年送往第二平台时,事实性、临床后果与医生接管的对象、量纲与停止阈值均不得改名。〔外部复算〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项医学AI结果能否成立的只有用医学指令微调和人类反馈改善问答”的操作定义,仍能复算“以“用医学指令微调和人类反馈改善问答”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。
二、通用医学基础模型议程Generalist Medical AI
通用医学基础模型议程由Moor et al., Nature 616, 259–265 (2023), doi:10.1038/s41586-023-05881-4固定为历史节点,新意是论文提出医学基础模型可由影像、信号、文本和组学预训练后适配多任务,并列出机会与风险。2026年重读时把以大规模自监督表征支持多种医学任务、任务异质、多模态缺失与机构迁移和实现栈并列,避免把单次纪录误作系统能力。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:通用性若靠模糊任务边界实现,会把每个专科的校准和责任降为平均性能,覆盖任务越多,最差模态与最差机构性能反而越易被均”做至少两轮外部复算,若方向翻转,通用医学基础模型议程Generalist Medical AI的结论必须随之收窄。
可消融的唯一单因是以大规模自监督表征支持多种医学任务:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。跨任务最差亚组性能以95%区间登记。
Moor et al., Nature 616, 259–265 (2023), doi:10.1038/s41586-023-05881-4给出起点,争议由“一个模型能否安全覆盖多任务、多模态和多机构”承担,最新状态是“通用模型研究转向适配成本、漂移与治理”。证据表列3组任务异质、多模态缺失与机构迁移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。
边界判据写作通用性若靠模糊任务边界实现,会把每个专科的校准和责任降为平均性能。当2026年测试越过任务异质、多模态缺失与机构迁移,覆盖任务越多,最差模态与最差机构性能反而越易被均值掩盖;方向翻转须先于均值进入结论。
“以大规模自监督表征支持多种医学任务”承担验收读数,另开任务异质、多模态缺失与机构迁移账。系统跑满24h后保留跨任务最差亚组性能、版本、维修与中止原因;〔反号压力〕余下5%失败及“尚缺通用医学基础模型议程在独立场景的长周期阴性结果”仍入正文。〔反号压力〕在生物医学基础模型与医学AI的这一对象上,复核应把“以“以大规模自监督表征支持多种医学任务”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺通用医学基础模型议程在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。
通用医学基础模型议程的异名接口采用计算精准健康称“多基因风险的祖源公平”;见第552号第十条“PRS祖源不平等”。共同预设是〔13 时间尺度可自由压缩〕一个模型能否安全覆盖多任务、多模态和多机构;第二团队在2026年重放原始记录时,不得以同向代理替换任务异质、多模态缺失与机构迁移。
三、RETFound视网膜基础模型RETFound
在Zhou et al., Nature 622, 156–163 (2023), doi:10.1038/s41586-023-06555-x之前,RETFound视网膜基础模型缺少把局部优化变成系统判断的支点;节点价值在于RETFound以自监督预训练改善眼病及部分系统病预测的数据效率和迁移。2026年评价掩码自编码从大量眼底图像学通用表征时,同时冻结扫描设备、族群与疾病谱外移和对照。
因果账只许留下掩码自编码从大量眼底图像学通用表征这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;扫描设备、族群与疾病谱外移只界定失效域。跨设备外部AUROC与校准差报告95%区间。〔责任链〕落到复现实务,可为RETFound视网膜基础模型RETFound建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“掩码自编码从大量眼底图像学通用表征”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。
来源链依次是Zhou et al., Nature 622, 156–163 (2023), doi:10.1038/s41586-023-06555-x、“视网膜自监督表征能否跨设备和人群泛化”和“外部评估开始检验域外和人口亚组”。原始表公开3档配置、95%区间、5%失败谱及run ID;扫描设备、族群与疾病谱外移导致的中止按失败计入分母。
相机、筛查人群和疾病流行率变化会破坏校准,系统病关联容易受混杂构成RETFound视网膜基础模型的停止线。到2026年,扫描设备、族群与疾病谱外移一旦主导,眼底预训练规模越大,设备外和族群外漂移反而可能越隐蔽,峰值读数便不能代表净效用。〔责任链〕本条的边界案例应从“尚缺RETFound视网膜基础模型在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:相机、筛查人群和疾病流行率变化会破坏校准,系统病关联容易受混杂,眼底预训练规模越大,设备外和族群外漂移反而可能越隐”究竟是偶发噪声,还是足以改变结论方向的系统反例。
部署账把“掩码自编码从大量眼底图像学通用表征”设为主量纲,每24h记录跨设备外部AUROC与校准差、版本、漂移与恢复。扫描设备、族群与疾病谱外移无数据就写“尚缺RETFound视网膜基础模型在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。
与相邻领域的精确链接是计算精准健康称“联邦学习跨医院协作”;见第552号第十一条“医疗联邦学习”。双方共享〔13 时间尺度可自由压缩〕视网膜自监督表征能否跨设备和人群泛化;2026年跨平台转移时,扫描设备、族群与疾病谱外移仍用同一单位、版本与失败阈值。〔责任链〕对RETFound视网膜基础模型RETFound而言,真正需要登记的不是又一个平均分,而是由“决定本项医学AI结果能否成立的只有掩码自编码从大量眼底图像学通用表征”推出的每一步中介、责任人和可撤回条件,〔责任链〕缺少任何一环,都不能把相关性写成机制。
四、MedSAM医学图像分割MedSAM
Ma et al., Nature Communications 15, 654 (2024), doi:10.1038/s41467-024-44824-z使MedSAM医学图像分割从局部演示转为可审计命题,核心观察是MedSAM在多种医学图像与任务上适配Segment Anything,降低任务专用模型门槛。2026年证据包把以大规模掩码适配通用分割表征与三维体素、小病灶与提示依赖分别编号,并保留旧方法对照。〔排除规则〕机构采用MedSAM医学图像分割MedSAM之前还应公布否决门槛:一旦“⇄系统核算后方向反转:交互提示质量和数据分布决定结果,边界看似平滑可能漏掉临床关键微小结构,提示统一度越高,小病灶和三维边界反而越容易被”出现,就暂停扩张并回到“以大规模掩码适配通用分割表征”的原始记录复核,该门槛必须早于部署决定写入方案。
这里拒绝多因叙述,决定结果能否成立的只有以大规模掩码适配通用分割表征。〔排除规则〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。小病灶Dice与失败体素率须给95%区间。
提出证据见Ma et al., Nature Communications 15, 654 (2024), doi:10.1038/s41467-024-44824-z,最强争议是“统一提示分割能否覆盖三维、小病灶和专业协议”,延续状态为“医学版通用分割模型继续扩展多模态与三维数据”。MedSAM医学图像分割交付3批三维体素、小病灶与提示依赖数据、95%区间、5%尾部和run ID,异常逐例保留。〔排除规则〕把MedSAM医学图像分割MedSAM与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“以大规模掩码适配通用分割表征”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。
MedSAM医学图像分割不能越过交互提示质量和数据分布决定结果,边界看似平滑可能漏掉临床关键微小结构。2026年把三维体素、小病灶与提示依赖扫过全量程时,提示统一度越高,小病灶和三维边界反而越容易被平滑掉;方向一旦翻转,平均性能再高也不抵销。
验收表首先读取“以大规模掩码适配通用分割表征”,随后核对三维体素、小病灶与提示依赖。持续24h日志含小病灶Dice与失败体素率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺MedSAM医学图像分割在独立场景的长周期阴性结果”。〔排除规则〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项医学AI结果能否成立的只有以大规模掩码适配通用分割表征”的操作定义,仍能复算“以“以大规模掩码适配通用分割表征”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。
跨域异名为计算精准健康称“十九万外显子组与稀有变异”;见第552号第十二条“英国生物样本库外显子组”,不是宽泛类比。它检验〔13 时间尺度可自由压缩〕统一提示分割能否覆盖三维、小病灶和专业协议;2026年由独立团队复跑原始记录时,三维体素、小病灶与提示依赖的单位、阈值和停止规则保持不变。
五、CONCH病理视觉语言模型CONCH
Lu et al., Nature Medicine 30, 863–874 (2024), doi:10.1038/s41591-024-02856-4把CONCH病理视觉语言模型钉在可复算节点:CONCH用大规模病理图文预训练,在多种分类、分割和检索任务显示迁移能力。对齐切片视觉与病理语言表征须与染色差异、文本捷径与罕见亚型分账;〔基线冻结〕2026年复核保留旧基线、版本与失败运行。
CONCH病理视觉语言模型只锁定一个原因:对齐切片视觉与病理语言表征。〔基线冻结〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,染色差异、文本捷径与罕见亚型不得由峰值代偿。跨中心零样本AUROC以95%区间裁决。〔基线冻结〕面向下一轮材料,生物医学基础模型与医学AI应优先补齐“尚缺CONCH病理视觉语言模型在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:报告和切片配对含选择偏差,零样本标签与临床决策的误差成本不同,图文配对越多,报告措辞捷径反而越能压过组织机制”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
提出卷页由Lu et al., Nature Medicine 30, 863–874 (2024), doi:10.1038/s41591-024-02856-4锁定,反方命题是“图文对齐能否学习病理机制而非报告词汇捷径”,截至2025年的延续为“病理基础模型进入零样本、检索和弱监督分类”。CONCH病理视觉语言模型复算给3套配置、95%区间、5%尾部和run ID,染色差异、文本捷径与罕见亚型失败样本不清洗。
CONCH病理视觉语言模型的硬边界是报告和切片配对含选择偏差,零样本标签与临床决策的误差成本不同。2026年把染色差异、文本捷径与罕见亚型推至规格外;图文配对越多,报告措辞捷径反而越能压过组织机制,平均基准不能冲销反号结果。〔基线冻结〕在生物医学基础模型与医学AI的这一对象上,复核应把“以“对齐切片视觉与病理语言表征”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺CONCH病理视觉语言模型在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。
〔基线冻结〕工程验收以“对齐切片视觉与病理语言表征”为主读数,连续24h记录跨中心零样本AUROC、版本、人工接管与恢复。染色差异、文本捷径与罕见亚型未测即保留“尚缺CONCH病理视觉语言模型在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。
CONCH病理视觉语言模型跨域登记为计算精准健康称“Bridge2AI可用数据”;见第552号第十三条“Bridge2AI数据就绪计划”。〔基线冻结〕它共享〔17 局部最优可加总为整体最优〕图文对齐能否学习病理机制而非报告词汇捷径,2026年送往第二平台时,染色差异、文本捷径与罕见亚型的对象、量纲与停止阈值均不得改名。〔基线冻结〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:报告和切片配对含选择偏差,零样本标签与临床决策的误差成本不同,图文配对越多,报告措辞捷径反而越能压过组织机制”做至少两轮外部复算,若方向翻转,CONCH病理视觉语言模型CONCH的结论必须随之收窄。
六、UNI通用病理编码器UNI
UNI通用病理编码器由Chen et al., Nature Medicine 30, 850–862 (2024), doi:10.1038/s41591-024-02857-3固定为历史节点,新意是UNI从大规模病理图块学习视觉表征,并在多种器官任务上减少标注需求。2026年重读时把用自监督全切片数据训练通用编码器、器官、扫描仪、切片制备与样本稀缺和实现栈并列,避免把单次纪录误作系统能力。〔异常运行〕落到复现实务,可为UNI通用病理编码器UNI建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“用自监督全切片数据训练通用编码器”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。
可消融的唯一单因是用自监督全切片数据训练通用编码器:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。罕见癌小样本线性探针误差以95%区间登记。
Chen et al., Nature Medicine 30, 850–862 (2024), doi:10.1038/s41591-024-02857-3给出起点,争议由“十万级切片预训练能否跨器官与扫描仪保持”承担,最新状态是“通用病理表征开始支持罕见癌和小样本任务”。证据表列3组器官、扫描仪、切片制备与样本稀缺配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔异常运行〕证据链还要把Chen et al., Nature Medicine 30, 850–862 (2024),的起点材料与更新文献放在同一比较表里,并逐项报告“用自监督全切片数据训练通用编码器”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
边界判据写作切片来源集中和扫描色彩差异会形成机构指纹,线性探针优越不等于临床流程优越。当2026年测试越过器官、扫描仪、切片制备与样本稀缺,切片数量越大,主流器官与扫描仪偏置反而越稳定;方向翻转须先于均值进入结论。
“用自监督全切片数据训练通用编码器”承担验收读数,另开器官、扫描仪、切片制备与样本稀缺账。系统跑满24h后保留罕见癌小样本线性探针误差、版本、维修与中止原因;〔异常运行〕余下5%失败及“尚缺UNI通用病理编码器在独立场景的长周期阴性结果”仍入正文。〔异常运行〕对UNI通用病理编码器UNI而言,真正需要登记的不是又一个平均分,而是由“决定本项医学AI结果能否成立的只有用自监督全切片数据训练通用编码器”推出的每一步中介、责任人和可撤回条件,〔异常运行〕缺少任何一环,都不能把相关性写成机制。
UNI通用病理编码器的异名接口采用计算精准健康称“AlphaMissense变异效应预测”;见第552号第十四条“AlphaMissense变异效应”。共同预设是〔17 局部最优可加总为整体最优〕十万级切片预训练能否跨器官与扫描仪保持;第二团队在2026年重放原始记录时,不得以同向代理替换器官、扫描仪、切片制备与样本稀缺。
七、Med-Gemini多模态推理Med-Gemini
在Saab et al., arXiv:2404.18416 (2024)之前,Med-Gemini多模态推理缺少把局部优化变成系统判断的支点;节点价值在于Med-Gemini在问答、长病历和影像基准展示多任务能力,并探索不确定性引导检索。2026年评价把通用多模态模型适配临床推理时,同时冻结长上下文、检索污染与多模态冲突和对照。
因果账只许留下把通用多模态模型适配临床推理这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;长上下文、检索污染与多模态冲突只界定失效域。检索增强后的事实错误率报告95%区间。
来源链依次是Saab et al., arXiv:2404.18416 (2024)、“长上下文和检索增强能否减少幻觉而不制造新错误”和“多模态医学模型加入影像、病历与网络检索”。原始表公开3档配置、95%区间、5%失败谱及run ID;长上下文、检索污染与多模态冲突导致的中止按失败计入分母。
预印本基准和自选示例不构成临床证据,检索来源也可能错误或过时构成Med-Gemini多模态推理的停止线。到2026年,长上下文、检索污染与多模态冲突一旦主导,上下文越长,检索污染与模态冲突反而越难定位,峰值读数便不能代表净效用。〔人工接管〕本条的边界案例应从“尚缺Med-Gemini多模态推理在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:预印本基准和自选示例不构成临床证据,检索来源也可能错误或过时,上下文越长,检索污染与模态冲突反而越难定位”究竟是偶发噪声,还是足以改变结论方向的系统反例。
部署账把“把通用多模态模型适配临床推理”设为主量纲,每24h记录检索增强后的事实错误率、版本、漂移与恢复。长上下文、检索污染与多模态冲突无数据就写“尚缺Med-Gemini多模态推理在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。
与相邻领域的精确链接是计算精准健康称“All of Us多样化全基因组”;见第552号第十五条“多祖源全基因组资源”。双方共享〔17 局部最优可加总为整体最优〕长上下文和检索增强能否减少幻觉而不制造新错误;2026年跨平台转移时,长上下文、检索污染与多模态冲突仍用同一单位、版本与失败阈值。Med-Gemini多模态推理若不能跨版本复现,只保留为局部案例;检索增强后的事实错误率必须公开原始记录。〔人工接管〕机构采用Med-Gemini多模态推理Med-Gemini之前还应公布否决门槛:一旦“⇄系统核算后方向反转:预印本基准和自选示例不构成临床证据,检索来源也可能错误或过时,上下文越长,检索污染与模态冲突反而越难定位”出现,就暂停扩张并回到“把通用多模态模型适配临床推理”的原始记录复核,该门槛必须早于部署决定写入方案。
八、TRIPOD+AI预测模型报告TRIPOD+AI
Collins et al., BMJ 385, e078378 (2024), doi:10.1136/bmj-2023-078378使TRIPOD+AI预测模型报告从局部演示转为可审计命题,核心观察是TRIPOD+AI扩展预测模型研究报告,使训练、验证、缺失、亚组与可用性更可审查。2026年证据包把明确数据、评价、公平与开放要求与数据泄漏、过拟合、公平与开放性分别编号,并保留旧方法对照。〔撤回门槛〕面向下一轮材料,生物医学基础模型与医学AI应优先补齐“尚缺TRIPOD+AI预测模型报告在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:清单不能补救错误设计,作者完整披露后模型仍可能不适合临床用途,报告项目越完整,若数据泄漏未审计则可信错觉反而越强”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
这里拒绝多因叙述,决定结果能否成立的只有明确数据、评价、公平与开放要求。〔撤回门槛〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。TRIPOD+AI条目符合率须给95%区间。
提出证据见Collins et al., BMJ 385, e078378 (2024), doi:10.1136/bmj-2023-078378,最强争议是“更完整报告能否阻止数据泄漏和过度拟合”,延续状态为“AI预测模型报告标准更新替代旧TRIPOD”。TRIPOD+AI预测模型报告交付3批数据泄漏、过拟合、公平与开放性数据、95%区间、5%尾部和run ID,异常逐例保留。〔撤回门槛〕在生物医学基础模型与医学AI的这一对象上,复核应把“以“明确数据、评价、公平与开放要求”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺TRIPOD+AI预测模型报告在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。
TRIPOD+AI预测模型报告不能越过清单不能补救错误设计,作者完整披露后模型仍可能不适合临床用途。2026年把数据泄漏、过拟合、公平与开放性扫过全量程时,报告项目越完整,若数据泄漏未审计则可信错觉反而越强;方向一旦翻转,平均性能再高也不抵销。
验收表首先读取“明确数据、评价、公平与开放要求”,随后核对数据泄漏、过拟合、公平与开放性。持续24h日志含TRIPOD+AI条目符合率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺TRIPOD+AI预测模型报告在独立场景的长周期阴性结果”。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项医学AI结果能否成立的只有明确数据、评价、公平与开放要求”的操作定义,仍能复算“以“明确数据、评价、公平与开放要求”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。
跨域异名为计算精准健康称“多祖源风险预测”;见第552号第十六条“多祖源PRS临床实施”,不是宽泛类比。它检验〔18 干预不回写到被干预者〕更完整报告能否阻止数据泄漏和过度拟合;2026年由独立团队复跑原始记录时,数据泄漏、过拟合、公平与开放性的单位、阈值和停止规则保持不变。
九、AMIE诊断对话系统AMIE
Tu et al., Nature 642, 442–450 (2025), doi:10.1038/s41586-025-08866-7把AMIE诊断对话系统钉在可复算节点:AMIE在结构化文字模拟会诊中与基层医师比较,显示病史采集和鉴别诊断潜力。用自我博弈和推理链训练诊断访谈须与真实患者语言、时间压力与安全升级分账;〔跨域外推〕2026年复核保留旧基线、版本与失败运行。
AMIE诊断对话系统只锁定一个原因:用自我博弈和推理链训练诊断访谈。〔跨域外推〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,真实患者语言、时间压力与安全升级不得由峰值代偿。真实门诊诊断安全升级率以95%区间裁决。〔跨域外推〕证据链还要把Tu et al., Nature 642, 442–450 (2025), doi:10.10的起点材料与更新文献放在同一比较表里,并逐项报告“用自我博弈和推理链训练诊断访谈”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
提出卷页由Tu et al., Nature 642, 442–450 (2025), doi:10.1038/s41586-025-08866-7锁定,反方命题是“模拟病人对话中的优越能否迁移到真实患者”,截至2025年的延续为“对话AI开始接受前瞻性、真实语言与安全升级测试”。AMIE诊断对话系统复算给3套配置、95%区间、5%尾部和run ID,真实患者语言、时间压力与安全升级失败样本不清洗。
AMIE诊断对话系统的硬边界是模拟病人、纯文字和已知答案移除了体检、情绪、时间压力与责任,不可外推独立执业。2026年把真实患者语言、时间压力与安全升级推至规格外;模拟对话优势越大,真实患者表达偏差造成的失误反而越危险,平均基准不能冲销反号结果。〔跨域外推〕对AMIE诊断〔跨域外推〕对话系统AMIE而言,真正需要登记的不是又一个平均分,而是由“决定本项医学AI结果能否成立的只有用自我博弈和推理链训练诊断访谈”推出的每一步中介、责任人和可撤回条件,〔跨域外推〕缺少任何一环,都不能把相关性写成机制。
〔跨域外推〕工程验收以“用自我博弈和推理链训练诊断访谈”为主读数,连续24h记录真实门诊诊断安全升级率、版本、人工接管与恢复。真实患者语言、时间压力与安全升级未测即保留“尚缺AMIE诊断对话系统在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。
AMIE诊断对话系统跨域登记为计算精准健康称“十万全基因组嵌入医疗系统”;见第552号第十七条“基因组罕见病诊断”。〔跨域外推〕它共享〔18 干预不回写到被干预者〕模拟病人对话中的优越能否迁移到真实患者,2026年送往第二平台时,真实患者语言、时间压力与安全升级的对象、量纲与停止阈值均不得改名。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:模拟病人、纯文字和已知答案移除了体检、情绪、时间压力与责任,不可外推独立执业,模拟对话优势越大,真实患者表达偏差造”做至少两轮外部复算,若方向翻转,AMIE诊断对话系统AMIE的结论必须随之收窄。
十、WHO大型多模态模型指南WHO LMM Guidance
WHO大型多模态模型指南由WHO, Ethics and governance of AI for health: guidance on large multi-modal models (2025)固定为历史节点,新意是WHO针对诊疗、患者使用、文书、教育和研究提出透明、审计、人类监督等建议。2026年重读时把按用途和生命周期治理生成式医学AI、跨境数据、商业责任与用途漂移和实现栈并列,避免把单次纪录误作系统能力。〔盲法复核〕落到复现实务,可为WHO大型多模态模型指南WHO LMM Guidance建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“按用途和生命周期治理生成式医学AI”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。
可消融的唯一单因是按用途和生命周期治理生成式医学AI:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。建议转成监管义务的覆盖率以95%区间登记。
WHO, Ethics and governance of AI for health: guidance on large multi-modal models (2025)给出起点,争议由“四十余项建议能否约束跨境商业模型”承担,最新状态是“指南覆盖政府、开发者与医疗提供者责任”。证据表列3组跨境数据、商业责任与用途漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔盲法复核〕本条的边界案例应从“尚缺WHO大型多模态模型指南在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:自愿采纳和快速更新节奏可能留下监管空窗,弱卫生系统也缺乏独立评估资源,建议覆盖越广,没有法律责任映射时执行落差反而”究竟是偶发噪声,还是足以改变结论方向的系统反例。
边界判据写作自愿采纳和快速更新节奏可能留下监管空窗,弱卫生系统也缺乏独立评估资源。当2026年测试越过跨境数据、商业责任与用途漂移,建议覆盖越广,没有法律责任映射时执行落差反而越大;方向翻转须先于均值进入结论。
“按用途和生命周期治理生成式医学AI”承担验收读数,另开跨境数据、商业责任与用途漂移账。系统跑满24h后保留建议转成监管义务的覆盖率、版本、维修与中止原因;〔盲法复核〕余下5%失败及“尚缺WHO大型多模态模型指南在独立场景的长周期阴性结果”仍入正文。〔盲法复核〕机构采用WHO大型多模态模型指南WHO LMM Guidance之前还应公布否决门槛:一旦“⇄系统核算后方向反转:自愿采纳和快速更新节奏可能留下监管空窗,弱卫生系统也缺乏独立评估资源,建议覆盖越广,没有法律责任映射时执行落差反而”出现,就暂停扩张并回到“按用途和生命周期治理生成式医学AI”的原始记录复核,该门槛必须早于部署决定写入方案。
WHO大型多模态模型指南的异名接口采用计算精准健康称“药物基因组临床工作流”;见第552号第十八条“药物基因组嵌入病历”。共同预设是〔18 干预不回写到被干预者〕四十余项建议能否约束跨境商业模型;第二团队在2026年重放原始记录时,不得以同向代理替换跨境数据、商业责任与用途漂移。
十一、医疗AI良好机器学习实践Good Machine Learning Practice
医疗AI早期质量控制常借用普通软件或药械验证:冻结一个版本,在一套数据上过线便进入申报。2021年FDA、Health Canada与MHRA提出GMLP十项原则,2025年1月IMDRF发布终稿,把这套做法推进为国际共同框架。转向之处不是多一张清单,而是承认数据、模型、人机团队和部署环境会一起变化,上市前分数不能独自承担产品全生命周期的可信度。
本条只锁定一个决定因素:开发到部署的证据链是否连续并能追溯。更大的模型、更多训练病例或更高AUROC都不能替代训练测试独立、目标人群代表性与版本后监测。若2026年的申报材料无法把数据来源、预期用途、模型版次、人工接管和更新风险连起来,十项原则只剩宣言;只有失败能沿同一链回到数据与设计选择时,GMLP才成为质量系统。〔结果分母〕把医疗AI良好机器学习实践Good Machine Learning Practice与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“进入正式风险处置的独立失败数/独立测试发现的全部失败数”在这些类别上都可回查,跨研究比较才有意义。
IMDRF终稿列出10项原则,明确要求多学科贯穿总产品生命周期、数据集适合预期人群、训练集与测试集保持独立、评价聚焦人机团队,并监测已部署模型的性能与再训练风险。它建立的是最低共同结构,并未给所有器械统一阈值。最有信息量的读数因此不是“符合10/10”,而是独立测试发现的失败有多少进入申报、标签、PCCP和上市后监测。
边界也写在框架形态里:原则是给监管者、标准组织和产业的行动召唤,并非一套自动产生法律责任的评分表。厂商仍可选择亚组、终点和误差容忍度;若只审文档完整率,表格越齐,最差人群的失败反而越容易被平均性能遮住。2026年真正的反号检验是:当独立外部数据推翻内部结论时,质量系统会不会暂停部署并公开改版,而非补写解释。
落地时应为每个模型版本绑定预期用途、目标人群、训练数据时间窗、独立测试集、人工接管阈值和漂移报警。每24h日志不必上传原始病历,但必须保留版本、失败亚组、近失事件与回滚时间。采购方可用“进入正式风险处置的独立失败数/独立测试发现的全部失败数”作量纲;这个分数为0时,任何总体AUROC与10项原则自评都不能抵销空白。
它与第552号第十九条“计算患者数字孪生”共享持续回写,却关注不同对象:数字孪生问患者模型是否形成闭环,GMLP问组织是否能追踪每次变更。两者在2026年的接口是版本化证据账;同一失败既要回写患者模型,也要进入产品风险管理。未上报的人工纠错、被丢弃的外部测试和未触发正式事件的近失,都必须保留为现行账本的空栏。
十二、临床自适应基础模型Clinically Adaptive Foundation Models
医学基础模型常在大型中心预训练,却在新相机、新机构与长尾病种上掉速;重新标注和完整重训又慢于临床变化。Jiang等2026年提出RetExpert,把“适配”从离线工程移到测试时:系统读取现场彩色眼底图像,在不进行全量重训的情况下调整有限参数。新意不只是提高平均准确率,而是承认基础模型的通用表征仍需面对设备、患病率与共病结构的实时偏移。
本条只承认一个决定因素:现场更新是否由轻量、受约束且可回滚的适配机制完成。更大的预训练集、更多疾病标签或更复杂提示都不能替代回滚。若2026年模型在每批无标签数据到来时任意改写全部权重,性能上升也无法追责;只有适配参数、触发条件、冻结基线与停止阈值同时保存,测试时学习才是临床机制,而不是线上自我改写。
RetExpert在15个公开与私有数据集上评价多种眼底疾病检测。框架把自适应知识单元、随机one-hot激活、长尾感知学习、不确定性感知多标签策略和疾病共现矩阵组合起来;测试时部分以TTUL与TTPL联合,在无需全量重训时动态调参。论文报告其相对眼科基础模型在检测、可靠性和跨域适应上占优,15个数据集比单一中心成绩更接近真实设备迁移。〔未覆盖项〕在生物医学基础模型与医学AI的这一对象上,复核应把“适配后仍不劣于冻结基线的疾病—设备组合数/全部被监测组合数”拆成同一分母下的主结果与失败谱,“未被接受的伪标签、回滚批次、相机掉线和人工覆盖后的未执行预测”要单列编码,不能在汇总时并入其他项。
边界在无标签适配本身:模型可能把疾病患病率变化、相机伪影或错误伪标签当成需要追随的新规律;多轮更新还会积累灾难性遗忘。若没有冻结模型并行对照,2026年的改善与退化都难定位。现场适配次数越多,平均性能可能上升,而罕见病、最差设备或最差亚组的校准反而下降;这类反号必须先于总体AUROC进入结论。
临床部署至少要记录适配前后模型哈希、TTUL与TTPL步数、伪标签接受阈值、最差疾病AUROC、校准差和回滚耗时。每24h窗口同时运行冻结基线,若最差亚组越过预设安全界限便停止更新。更可通约的量纲是“适配后仍不劣于冻结基线的疾病—设备组合数/全部被监测组合数”,它把平均提升与尾部失效放在同一账上。
它与第552号第二十条“AI医疗器械生命周期”直接相接:RetExpert回答如何在现场校正域偏移,监管面板回答谁批准变化、怎样留下版本证据。到2026年,测试时适配不能成为绕过PCCP的暗门;未被接受的伪标签、触发后又回滚的批次、相机掉线与人工覆盖,都要进入空栏。两边共享的接口是每次变更后安全阈值保持的运行时长。
◎ 二十年连起来看
二十个节点连起来,主线不是名词越来越多,而是医学基础模型的决定性机制是可复用表征在跨机构迁移后仍保持临床校准与可追责性,而不是预训练数据或参数增加。早期把对象变得可执行,中期把读数送回决策,近期才开始把异常、资源和责任纳入系统。
这条历史线也显示,局部纪录通常先于完整证据账出现。面板因此保留提出、争议与最新三条来源,避免用今天的术语倒写昨天的因果。
◎ 三个常见误解
第一,自动或量子等标签不自动等于净优势;第二,峰值读数不能替代全流程分母;第三,规模扩大并不会自行消除选择偏差、漂移和外部成本。
三个误解共同源于把代理指标当作对象本身。只要损耗、人工、校准或失败样本被移出账本,任何路线都可能得到过度乐观的结论。
◎ 与相邻领域的接口
本领域向上连接基础理论,向下连接制造、软件、标准和治理。真正有用的接口是让相邻领域用同一失效条件挑战“医学基础模型的决定性机制是可复用表征在跨机构迁移后仍保持临床校准与可追责性,而不是预训练数据或参数增加”。
接口验收要求对手明确、共同预设明确、相反点明确,并能推出一个原领域尚未提出的新实验,而不是把热门名词并排陈列。
◎ 争议现场
支持者强调新的闭环和资源已经把过去不可做的问题变成可运行系统;反方则指出大多数优势仍依赖精心选择的任务、基线和实验环境。
争议的裁决方式不是口号投票,而是冻结版本、同预算对照、跨站点复现与方向反转试验。若失败只被解释成工程细节,理论便失去被反驳的入口。
◎ 往下五年看什么
未来五年要看前瞻性临床试验、外部人群、数据泄漏审计和版本更新能否进入同一评价,并让模型知道何时拒答、升级给医生或撤回建议
应优先观察能否公开完整运行日志、异常分类和阴性结果,以及新一代标准是否要求端到端资源核算。单点纪录仍重要,但不足以单独改变面板判断。
◎ 可与哪些领域对撞
可对撞的领域包括控制论、因果推断、计量学、可靠性工程、科学社会学与技术治理。它们分别追问反馈、归因、溯源、长尾失败、奖励结构和责任。
对撞时应保持对象和量纲不变,只替换一个前提;如果结论因此反号,才说明接口带来了新知识。
◎ 十条可做的研究命题
建立公开失败谱,并比较只用成功数据与全量数据时结论是否反号。
把人工接管、校准和等待时间加入资源分母,重算相对旧方法的净收益。
在至少两个独立平台冻结版本复现同一方向,而非只复现最好数值。
设计移除关键机制的消融试验,检查单因主张能否被直接推翻。
将平均性能换成最坏分位数,观察路线排序是否改变。
对代理指标施加分布外扰动,寻找它与真实目标解耦的阈值。
记录中止与未完成运行,检验幸存者偏差在多大程度上制造领先。
以同总预算而非同设备时间设置经典或旧技术基线。
把能耗、耗材和退役责任延伸到生命周期,测试局部优化是否转移成本。
预注册一个会令主张失败的结果形态,并在数据到来后按原规则裁决。
◎ 资料核验
- Esteva et al., Nature 542, 115–118 (2017), doi:10.1038/nature21056
- Rajpurkar et al., arXiv:1711.05225, CheXNet (2017)
- Alsentzer et al., Clinical Natural Language Processing Workshop, 72–78 (2019)
- Lee et al., Bioinformatics 36, 1234–1240 (2020), doi:10.1093/bioinformatics/btz682
- Li et al., Scientific Reports 10, 7155 (2020), doi:10.1038/s41598-020-62922-y
- Liu et al., Nature Medicine 26, 1364–1374 (2020), doi:10.1038/s41591-020-1034-x
- WHO, Ethics and governance of artificial intelligence for health (2021)
- Yang et al., npj Digital Medicine 5, 194 (2022), doi:10.1038/s41746-022-00742-2
- Singhal et al., Nature 620, 172–180 (2023), doi:10.1038/s41586-023-06291-2
- Moor et al., Nature 616, 259–265 (2023), doi:10.1038/s41586-023-05881-4
- Zhou et al., Nature 622, 156–163 (2023), doi:10.1038/s41586-023-06555-x
- Ma et al., Nature Communications 15, 654 (2024), doi:10.1038/s41467-024-44824-z
- Lu et al., Nature Medicine 30, 863–874 (2024), doi:10.1038/s41591-024-02856-4
- Chen et al., Nature Medicine 30, 850–862 (2024), doi:10.1038/s41591-024-02857-3
- Saab et al., arXiv:2404.18416 (2024)
- Collins et al., BMJ 385, e078378 (2024), doi:10.1136/bmj-2023-078378
- Tu et al., Nature 642, 442–450 (2025), doi:10.1038/s41586-025-08866-7
- WHO, Ethics and governance of AI for health: guidance on large multi-modal models (2025)
- IMDRF, Good Machine Learning Practice for Medical Device Development: Guiding Principles (2025).
- Jiang et al., npj Digital Medicine 9, 300 (2026), doi:10.1038/s41746-026-02480-1
- Moor et al., Foundation models for generalist medical artificial intelligence, Nature 616, 259–265 (2023).
- Singhal et al., Large language models encode clinical knowledge, Nature 620, 172–180 (2023).
- Zhou et al., A foundation model for generalizable disease detection from retinal images, Nature 622, 156–163 (2023).
- WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).
SDEUniverses.com · 新思想前沿 | 第 553 号 | 王德生 亲撰