SDE Universes·新思想前沿医学的组织与人文侧
新思想前沿 · 医学的组织与人文侧

医学教育

近二十年 · 两幕 · 20 个新思想 · 约 26,197 字 · 王德生 亲撰 · 2026 年 8 月

医学教育不是把既有知识从教师搬到学生,而是在病人、学习者、监督者和制度之间生成“谁可以独立行动”的社会许可。近二十年,胜任力本位教育、里程碑和可委托专业活动把培训从固定年限转向可观察能力;模拟、刻意练习和工作场所评价把临床技能从师徒印象转向反馈证据;项目化评价、教练、专业身份和学习环境又揭示,能力不能被一次考试代表。新近的人工智能能力框架与大语言模型冲击进一步迫使医学教育区分:会生成答案、会解释证据、会在病人面前承担责任,是三种不同能力。本块尤其关注视觉诊断、主观评价和隐性课程如何复制肤色、性别、族群与机构偏差,以及患者何时从“教学材料”成为共同教育者。尤其需要警惕的是,项目化评价提高了分辨率,评价语言偏差却可能制造新的边界病例;因此“更精准”必须同时回答谁受益、谁失访、谁被归入不可判定。近期制度锚点是AAMC,2026,《医学生与住院医师人工智能能力框架》,它用指南、流程与责任分配检验研究成果是否真正进入临床。

【第一幕】上一个十年 · 约 2006—2016

第一幕的共同动作,是把培训年限和一次考试拆成可观察任务、反复练习与真实工作中的表现。教学不再只问“讲过没有”,而问学习者在何种监督下可以做什么。里程碑把住院医师成长、刻意练习与患者安全与质量改进共同说明:旧分类一旦被动态机制与纵向证据替代,成功标准也必须随之改写。

甲、胜任力本位教育把培训从年限改成能力证据Competency-Based Medical Education Replaces Time with Evidence

提出Frank等,2010,《Medical Teacher》32:631–637,CBME定义 争议Carraccio等,2002,《Academic Medicine》77:361–367,胜任力本位框架 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定进阶资格的只有学习者是否在真实任务中提供了可重复的胜任证据

在2010年前后,医学教育对“胜任力本位教育”的处理仍依赖一个看似稳固的旧默认:完成规定轮转和年限被视为足以证明可以毕业,能力差异留给带教者总体印象。这套做法能解释典型病例,却经常把非典型病程、共病者与长期后果排除在视野之外(据Frank等2010·胜任力本位教育)。在胜任力本位教育的对象核查中,本项先把“最接近门诊谱却未达门槛的胜任力本位教育患者”放回分母,再判断可见结果是否代表总体。

新命题可以压缩成一句可反驳的话:决定进阶资格的只有学习者是否在真实任务中提供了可重复的胜任证据。

在实证层面,国际共识把结果导向、学习者中心和社会需要设为CBME核心,随后多国课程将能力域映射到训练与评价,出处为Frank等,2010,《Medical Teacher》32:631–637,CBME定义。这些数字让命题承担了明确风险:如果独立样本达不到相近的绝对差、风险比或诊断增量,胜任力本位教育就不能继续以范式转向自居。比较从平均值转向对象级账本,尤其检查被合并、退出和未分类3类记录。以胜任力本位教育为对象,本条固定2项可核量:分子“胜任力本位教育主要结局达标者”与分母“全部分析者”,复核时不得只报前者。 在胜任力本位教育证据链中,原始锚点仍是Frank等,2010,《Medical Teacher》32:631–637,CBME定义;以胜任力本位教育为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。

边界证据提醒我们,能力表过多、证据质量不均和时间可变难以落地,完成清单不等于临床判断成熟,相关质疑见Carraccio等,2002,《Academic Medicine》77:361–367,胜任力本位框架。如果只保留成功病例,胜任力本位教育会显得比真实门诊更稳定;以胜任力本位教育为对象,如果把不能完成检测或治疗的人剔除,适用范围又会被悄悄扩大。对这一转向最严的检验,是在不同人群、不同支付制度和低资源中心复现,而不是在原团队再次获得相同结果(边界:能力表过多、证据质量不均)。 对胜任力本位教育的争议记录是Carraccio等,2002,《Academic Medicine》77:361–367,胜任力本位框架;以胜任力本位教育为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。

最新的制度锚点来自AAMC,2026,《医学生与住院医师人工智能能力框架》,它把患者选择、风险沟通和随访要求写得比早期试验更具体(制度参照:2026·胜任力本位教育)。 围绕胜任力本位教育的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

本项先把“未记录对象”放回分母,再判断可见结果是否代表总体。

位置S——主显露 单因只有胜任力本位教育的目标读数决定判断。 预设〔04 测量不改变被测对象〕排除“最接近门诊谱却未达门槛的胜任力本位教育患者” 量纲胜任力本位教育主要结局达标者/全部分析者 失效若能力表过多、证据质量不均和时间可变难以落地,方向反过来:获益可转为伤害。 自曝原研究已承认〔能力表过多、证据质量不均和时间可变难以落地〕,但传播常弱化此边界。 空栏最接近门诊谱却未达门槛的胜任力本位教育患者。 异名另见第 383 号第 5 条『发作性睡病的HLA与食欲素证据把嗜睡变成免疫性神经元丢失』

乙、里程碑把住院医师成长写成可观察发展序列Milestones Turn Residency Growth into Observable Progressions

提出Nasca等,2012,《New England Journal of Medicine》366:1051–1056,住院医师教育下一认证系统 争议Swing等,2013,《Journal of Graduate Medical Education》5:1–9,里程碑发展 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定发展判断的只有具体行为能否在连续水平上被多次观察并形成一致轨迹

里程碑把住院医师成长写成可观之所以成为近二十年的转向,并不是因为技术突然多了一项,而是因为旧框架在医学教育门诊里不断失灵。在里程碑把住院医的对象核查中,证据责任落在可复算路径:对象如何进入、何处退出、退出后怎样改变结论,三步缺一不可。

决定发展判断的只有具体行为能否在连续水平上被多次观察并形成一致轨迹,这是该条真正要守住的立场。它拒绝用模糊的综合解释把冲突抹平,而是把发生路径推到可被攻击的位置(检验对象:里程碑把住院医师成长写成可观)。

Nasca等,2012,《New England Journal of Medicine》366:1051–1056,住院医师教育下一认证系统把争论从概念推进到可核对读数。研究显示,ACGME里程碑在多个专科定义发展级别并由临床能力委员会定期综合,促使项目识别停滞与提前进阶。在里程碑把住院医的读数核查中,本项把测量窗口固定下来,防止短期改善替代长期结局,也防止版本变化伪装成进步。临床价值来自“谁真正改变了结局”,而不是总体均值是否漂亮;以里程碑把住院医为对象,这也是本条在医学教育知识史中的位置(主证据:Nasca等2012)。就里程碑把住院医的实证锚点而言,本条固定2项可核量:分子“里程碑把住院医师成长写成可观减少事件数”与分母“对照原始事件数”,复核时不得只报前者。 在里程碑把住院医证据链中,原始锚点仍是Nasca等,2012,《New England Journal of Medicine》366:1051–1056,住院医师教育下一认证系统;以里程碑把住院医为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。以里程碑把住院医为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。 在里程碑把住院医证据链中,原始锚点仍是Nasca等,2012,《New England Journal of Medicine》366:1051–1056,住院医师教育下一认证系统;它固定了对象、年份与出处,独立复核不得用异题评论替换。

Swing等,2013,《Journal of Graduate Medical Education》5:1–9,里程碑发展指出,评分膨胀、观察不足、跨项目可比性和文本负担明显,数字水平可能制造虚假精度。有些反对意见质疑样本选择,有些质疑终点能否代表长期功能,还有些发现效果在常规照护中明显缩小(边界:评分膨胀、观察不足、跨项)。 对里程碑把住院医的争议记录是Swing等,2013,《Journal of Graduate Medical Education》5:1–9,里程碑发展;

AAMC,2026,《医学生与住院医师人工智能能力框架》进一步要求把疗效与不良反应、功能与生物标志物、短期响应与长期结局并列呈现(制度参照:2026·里程碑把住院医师成长写成可观)。

证据责任落在可复算路径:对象如何进入、何处退出、退出后怎样改变结论,三步缺一不可。

位置D——主显露 单因只有里程碑把住院医师成长写成可观的实施路径决定成败。 预设〔04 测量不改变被测对象〕排除“因毒性、费用或照护负担退出的里程碑把住院医师成长写” 量纲里程碑把住院医师成长写成可观减少事件数/对照原始事件数 失效若评分膨胀、观察不足、跨项目可比性和文本负担明显,本命题失效,须改用分层结局;越界时允许反转。 自曝支持文献同时报告〔评分膨胀、观察不足、跨项目可比性和文本负担明显〕,指南摘要少作主结论。 空栏因毒性、费用或照护负担退出的里程碑把住院医师成长写成可观病。 异名另见第 385 号第 12 条『RNA测序把DNA意义未明变异转成可观察剪接后果』

丙、可委托专业活动把能力翻译成“我敢不敢让你独立做”EPAs Translate Competence into Entrustment

提出ten Cate,2005,《Medical Education》39:1176–1177,可委托专业活动概念 争议ten Cate与Scheele,2007,《Academic Medicine》82:542–547,胜任力到实践的桥梁 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定独立权限的只有监督者是否愿意把一个完整临床任务交给学习者并承担结果

早期关于可委托专业活动的知识以可见病灶、单项检测或一次疗效判断为中心,隐含前提是能力域彼此抽象分列,沟通、知识和操作高分仍不能回答可否独立照护病人。然而,真实世界里最棘手的并非标准病例,而是边界患者、失访者和多病共存者(据ten Cate2010·可委托专业活动)。2010年前后,ten Cate等人把这一矛盾公开化,使医学教育开始从“给对象命名”转向“追踪对象如何在诊疗过程中改变”。

围绕可委托专业活动,最清楚的可证伪表述是「决定独立权限的只有监督者是否愿意把一个完整临床任务交给学习者并承担结果」。在可委托专业活动的机制核查中,该命题的强处在可反驳:越过“若委托受信任关系、工作负荷、病例难度和监督者风险偏好影响,优势可反转为过度治疗”,结果必须允许翻转。

关键证据来自ten Cate,2005,《Medical Education》39:1176–1177,可委托专业活动概念。EPA框架将病史、交班、处方等完整工作与监督等级连接,使多种能力在任务中被综合观察。这组读数的重要性不只是“统计学显著”,而在于它改变了临床分母:此前被看作噪声或偶然的病例,开始进入主要分析(主证据:ten Cate2010)。研究同时给出可比较的时间点、效应大小或诊断增益,使可委托专业活动能够与传统路径在同一张结果表上对账,而不再只凭专家印象。就可委托专业活动的实证锚点而言,本条固定2项可核量:分子“可委托专业活动可解释差异”与分母“全部观察差异”,复核时不得只报前者。

ten Cate与Scheele,2007,《Academic Medicine》82:542–547,胜任力到实践的桥梁所代表的研究发现,委托受信任关系、工作负荷、病例难度和监督者风险偏好影响,不能被量表分数自动替代。这意味着原结论可能依赖特定中心的熟练度、选择标准或支持性照护,而不是治疗本身(边界:委托受信任关系、工作负荷)。若把这些条件从试验环境中抽掉,效应会衰减,甚至出现反号(边界:委托受信任关系、工作负荷)。因而本条必须同时报告绝对获益、撤药或失败后的结局,以及未进入试验者的去向(边界:委托受信任关系、工作负荷)。

在AAMC,2026,《医学生与住院医师人工智能能力框架》的框架下,临床决策需要把证据等级、患者偏好和可实施条件同时写入记录(制度参照:2026·可委托专业活动)。 围绕可委托专业活动的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

这里的判决不靠术语声望,而靠“共同读数”在独立样本中是否保持方向。

位置E——主显露 单因只有可委托专业活动的条件场决定可迁移性。 预设〔04 测量不改变被测对象〕排除“检测阴性但症状持续的可委托专业活动对象” 量纲可委托专业活动可解释差异/全部观察差异 失效若委托受信任关系、工作负荷、病例难度和监督者风险偏好影响,优势可反转为过度治疗。 自曝本路线自己的数据暴露〔委托受信任关系、工作负荷、病例难度和监督者风险偏好影响〕,足以生成反例。 空栏检测阴性但症状持续的可委托专业活动对象。 异名另见第 384 号第 3 条『社区纳洛酮把过量死亡从专业急救变成旁观者可逆事件』

丁、模拟精熟学习把错误从病床转移到可重复训练场Simulation Mastery Learning Moves Error into Repeatable Practice

提出McGaghie等,2011,《Medical Education》45:50–63,模拟精熟学习综述 争议Cook等,2011,《JAMA》306:978–988,技术增强模拟荟萃 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定技能可靠性的只有学习者能否在安全环境中练到预设最低通过标准

以模拟精熟学习把为对象,真正的断点出现在旧办法不能解释临床反例时。过去的操作逻辑是关键操作通过观摩和有限临床机会学习,病例是否出现决定练习量。但当患者在不同中心得到不同分类,或同一指标改善而生活功能没有改善时,旧逻辑失去解释力(据McGaghie等2011·模拟精熟学习)。

这条转向的单因命题是:决定技能可靠性的只有学习者能否在安全环境中练到预设最低通过标准。

McGaghie等,2011,《Medical Education》45:50–63,模拟精熟学习综述提供了支撑这一命题的主要读数:荟萃显示模拟相对无干预在知识、技能和行为上有中到大效应,精熟学习项目可改善中心静脉置管等临床结果。在模拟精熟学习把的读数核查中,这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。就模拟精熟学习把的实证锚点而言,本条固定2项可核量:分子“模拟精熟学习获益者”与分母“承担治疗风险者”,复核时不得只报前者。 在模拟精熟学习把证据链中,原始锚点仍是McGaghie等,2011,《Medical Education》45:50–63,模拟精熟学习综述; 在模拟精熟学习把证据链中,原始锚点仍是McGaghie等,2011,《Medical Education》45:50–63,模拟精熟学习综述;它固定了对象、年份与出处,独立复核不得用异题评论替换。

模拟精熟学习最值得保留的争论来自Cook等,2011,《JAMA》306:978–988,技术增强模拟荟萃:模拟真实性、迁移、设备成本和评估者一致性限制外推,练会模型不等于应对复杂病人。支持方强调总体方向,质疑方则追问谁承担风险、哪一个替代终点被当成患者价值(边界:模拟真实性、迁移、设备成)。双方要收敛,不能只增加样本量,而要预先分层并设置足够长的随访,使短期改善与长期功能、并发症和资源消耗同时可见(边界:模拟真实性、迁移、设备成)。 对模拟精熟学习把的争议记录是Cook等,2011,《JAMA》306:978–988,技术增强模拟荟萃;以模拟精熟学习把为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。 对模拟精熟学习把的争议记录是Cook等,2011,《JAMA》306:978–988,技术增强模拟荟萃;未公开检验的部分继续保留为未知状态,不并入支持证据。

AAMC,2026,《医学生与住院医师人工智能能力框架》显示,现代推荐已不再把主要终点当作唯一结算,而是要求说明适应证边界、监测频率、停药或撤回条件(制度参照:2026·模拟精熟学习)。 围绕模拟精熟学习把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

旧口径遮住的是失败对象的去向;

位置D——主显露 单因只有模拟精熟学习的目标读数决定判断。 预设〔07 效果可由参与者自己评定〕排除“无法完成金标准检查的模拟精熟学习脆弱患者” 量纲模拟精熟学习获益者/承担治疗风险者 失效若模拟真实性、迁移、设备成本和评估者一致性限制外推,本命题失效,须改用分层结局;越界时允许反转。 自曝研究者未否认〔模拟真实性、迁移、设备成本和评估者一致性限制外推〕,应用论文却少用于反驳。 空栏无法完成金标准检查的模拟精熟学习脆弱患者。 异名另见第 373 号第 7 条『前庭康复把眩晕从病灶等待转向适应训练』

戊、刻意练习把专家成长从天赋改成反馈密度Deliberate Practice Reframes Expertise through Feedback Density

提出McGaghie等,2010,《Academic Medicine》85:706–711,刻意练习与医学模拟 争议Ericsson,2004,《Academic Medicine》79:S70–S81,专家表现与刻意练习 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定技能提高的只有任务难度、即时反馈与针对弱点的重复是否形成闭环

在2010年前后,医学教育对“刻意练习”的处理仍依赖一个看似稳固的旧默认:临床熟练被归于经验年数和天赋,只要多看病例就会自然成为专家。这套做法能解释典型病例,却经常把非典型病程、共病者与长期后果排除在视野之外(据McGaghie等2010·刻意练习)。以刻意练习把专家为对象,若只保存终点图表,第三方无法恢复筛选次序;

新命题可以压缩成一句可反驳的话:决定技能提高的只有任务难度、即时反馈与针对弱点的重复是否形成闭环。在这一立场中,发生路径不是众多因素之一,而是必须首先被检验的决定项(检验对象:刻意练习)。若它只在少数中心成立,也不能再被写成普遍规律(检验对象:刻意练习)。

在实证层面,多项模拟与程序训练研究显示带明确标准和反馈的练习优于相同时间的常规暴露,学习曲线差异显著缩小,出处为McGaghie等,2010,《Academic Medicine》85:706–711,刻意练习与医学模拟。这些数字让命题承担了明确风险:如果独立样本达不到相近的绝对差、风险比或诊断增量,刻意练习就不能继续以范式转向自居。证据能支持的范围止于已观察对象;对“功能改善但中心指标未变的刻意练习患者”的外推必须另行检验。就刻意练习把专家的实证锚点而言,本条固定2项可核量:分子“刻意练习独立复现次数”与分母“全部验证次数”,复核时不得只报前者。 在刻意练习把专家证据链中,原始锚点仍是McGaghie等,2010,《Academic Medicine》85:706–711,刻意练习与医学模拟; 在刻意练习把专家证据链中,原始锚点仍是McGaghie等,2010,《Academic Medicine》85:706–711,刻意练习与医学模拟;它固定了对象、年份与出处,独立复核不得用异题评论替换。

边界证据提醒我们,真实临床任务含不确定性与团队互动,过度分解会训练出局部熟练而非整体判断,相关质疑见Ericsson,2004,《Academic Medicine》79:S70–S81,专家表现与刻意练习。如果只保留成功病例,刻意练习会显得比真实门诊更稳定;对这一转向最严的检验,是在不同人群、不同支付制度和低资源中心复现,而不是在原团队再次获得相同结果(边界:真实临床任务含不确定性与)。 对刻意练习把专家的争议记录是Ericsson,2004,《Academic Medicine》79:S70–S81,专家表现与刻意练习;

最新的制度锚点来自AAMC,2026,《医学生与住院医师人工智能能力框架》,它把患者选择、风险沟通和随访要求写得比早期试验更具体(制度参照:2026·刻意练习)。 围绕刻意练习把专家的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

若只保存终点图表,第三方无法恢复筛选次序;

位置D——主显露 单因只有刻意练习的实施路径决定成败。 预设〔07 效果可由参与者自己评定〕排除“功能改善但中心指标未变的刻意练习患者” 量纲刻意练习独立复现次数/全部验证次数 失效若真实临床任务含不确定性与团队互动,方向反过来:获益可转为伤害。 自曝亚组资料已显示〔真实临床任务含不确定性与团队互动〕,总体结论常将其压平。 空栏功能改善但中心指标未变的刻意练习患者。 异名另见第 383 号第 10 条『舌下神经刺激把气道治疗从持续压力改成睡眠期神经反馈』

己、工作场所评价把真实临床表现带回考核Workplace-Based Assessment Returns Real Clinical Performance to Evaluation

提出Norcini等,2003,《Medical Education》37:364–371,mini-CEX效度研究 争议Pelgrim等,2011,《Medical Teacher》33:893–902,工作场所评价系统综述 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定工作能力可信度的只有多名观察者在多种病例中积累的直接观察能否形成稳定模式

工作场所评价之所以成为近二十年的转向,并不是因为技术突然多了一项,而是因为旧框架在医学教育门诊里不断失灵。该命题的强处在可反驳:越过“若观察者宽严、病例选择、文书仪式化和“都给高分”会使数量增,本命题失效,须改用分层结局;越过该边界,工作场所评价改变决策病例可能上升而对象质量实质恶化,故价值符号反转。Norcini等在2007年的工作把这些“例外”改写成需要被解释的核心事实。

决定工作能力可信度的只有多名观察者在多种病例中积累的直接观察能否形成稳定模式,这是该条真正要守住的立场。

Norcini等,2003,《Medical Education》37:364–371,mini-CEX效度研究把争论从概念推进到可核对读数。研究显示,mini-CEX、DOPS和病例讨论可在短时观察后提供具体反馈,多次跨情境样本能提高可靠性。以工作场所评价把为对象,当场景、尺度或时间窗改变时,先复算共同分母,再讨论机制是否仍成立。临床价值来自“谁真正改变了结局”,而不是总体均值是否漂亮;就工作场所评价把的实证锚点而言,本条固定2项可核量:分子“工作场所评价改变决策病例”与分母“全部受检病例”,复核时不得只报前者。 在工作场所评价把证据链中,原始锚点仍是Norcini等,2003,《Medical Education》37:364–371,mini-CEX效度研究; 在工作场所评价把证据链中,原始锚点仍是Norcini等,2003,《Medical Education》37:364–371,mini-CEX效度研究;它固定了对象、年份与出处,独立复核不得用异题评论替换。

Pelgrim等,2011,《Medical Teacher》33:893–902,工作场所评价系统综述指出,观察者宽严、病例选择、文书仪式化和“都给高分”会使数量增加而信息不增。有些反对意见质疑样本选择,有些质疑终点能否代表长期功能,还有些发现效果在常规照护中明显缩小(边界:观察者宽严、病例选择、文)。以工作场所评价把为对象,原证据保留了一个明确锚点,但没有自动覆盖边界外对象;否则正向平均值很容易被误当成无条件许可(边界:观察者宽严、病例选择、文)。 对工作场所评价把的争议记录是Pelgrim等,2011,《Medical Teacher》33:893–902,工作场所评价系统综述;

AAMC,2026,《医学生与住院医师人工智能能力框架》进一步要求把疗效与不良反应、功能与生物标志物、短期响应与长期结局并列呈现(制度参照:2026·工作场所评价)。 围绕工作场所评价把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 围绕工作场所评价把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

该命题的强处在可反驳:越过“适用边界”,结果必须允许翻转。

位置S——主显露 单因只有工作场所评价的条件场决定可迁移性。 预设〔07 效果可由参与者自己评定〕排除“多病共存而无法归入单一路径的工作场所评价患者” 量纲工作场所评价改变决策病例/全部受检病例 失效若观察者宽严、病例选择、文书仪式化和“都给高分”会使数量增,本命题失效,须改用分层结局;越界时允许反转。 自曝原研究已承认〔观察者宽严、病例选择、文书仪式化和“都给高分”会使数量增加而信〕,但传播常弱化此边界。 空栏多病共存而无法归入单一路径的工作场所评价患者。 异名另见第 382 号第 6 条『神经影像偶然发现把研究者变成潜在临床责任人』

庚、跨专业教育把协作能力从口号变成共同任务Interprofessional Education Turns Collaboration into Shared Work

提出Reeves等,2013,《Cochrane Database of Systematic Reviews》CD002213,跨专业教育综述 争议WHO,2010,《Framework for Action on Interprofessional Education and Collaborative Practice》 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定协作学习效果的只有学生能否围绕真实患者任务共同决策、反馈并承担边界冲突

早期关于跨专业教育的知识以可见病灶、单项检测或一次疗效判断为中心,隐含前提是不同专业分别受训,毕业后被期待自然理解彼此角色并协作。然而,真实世界里最棘手的并非标准病例,而是边界患者、失访者和多病共存者(据Reeves等2013·跨专业教育)。以跨专业教育把协为对象,比较从平均值转向对象级账本,尤其检查被合并、退出和未分类三类记录。

围绕跨专业教育,最清楚的可证伪表述是「决定协作学习效果的只有学生能否围绕真实患者任务共同决策、反馈并承担边界冲突」。

关键证据来自Reeves等,2013,《Cochrane Database of Systematic Reviews》CD002213,跨专业教育综述。系统综述显示部分项目改善团队行为、流程和患者结局,但研究小且干预异质,单纯同堂听课效果有限。本项拒绝把采用率当成效果;以跨专业教育把协为对象,真正的验收量是失败边界出现后读数是否按预期改变。研究同时给出可比较的时间点、效应大小或诊断增益,使跨专业教育能够与传统路径在同一张结果表上对账,而不再只凭专家印象。就跨专业教育把协的实证锚点而言,本条固定2项可核量:分子“跨专业教育净获益”与分母“单位成本”,复核时不得只报前者。 在跨专业教育把协证据链中,原始锚点仍是Reeves等,2013,《Cochrane Database of Systematic Reviews》CD002213,跨专业教育综述; 在跨专业教育把协证据链中,原始锚点仍是Reeves等,2013,《Cochrane Database of Systematic Reviews》CD002213,跨专业教育综述;它固定了对象、年份与出处,独立复核不得用异题评论替换。

反证主要集中在可迁移性(边界:权力差异、排班与评价仍按)。WHO,2010,《Framework for Action on Interprofessional Education and Collaborative Practice》所代表的研究发现,权力差异、排班与评价仍按专业分开时,共同课程容易变成象征性接触。这意味着原结论可能依赖特定中心的熟练度、选择标准或支持性照护,而不是治疗本身(边界:权力差异、排班与评价仍按)。若把这些条件从试验环境中抽掉,效应会衰减,甚至出现反号(边界:权力差异、排班与评价仍按)。因而本条必须同时报告绝对获益、撤药或失败后的结局,以及未进入试验者的去向(边界:权力差异、排班与评价仍按)。 对跨专业教育把协的争议记录是WHO,2010,《Framework for Action on Interprofessional Education and Collaborative Practice》;

在AAMC,2026,《医学生与住院医师人工智能能力框架》的框架下,临床决策需要把证据等级、患者偏好和可实施条件同时写入记录(制度参照:2026·跨专业教育)。 围绕跨专业教育把协的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

比较从平均值转向对象级账本,尤其检查被合并、退出和未分类三类记录。

位置S——主显露 单因只有跨专业教育的目标读数决定判断。 预设〔11 可复现=可重做〕排除“未进入转诊、登记或随访的跨专业教育人群” 量纲跨专业教育净获益/单位成本 失效若权力差异、排班与评价仍按专业分开时,优势可反转为过度治疗。 自曝支持文献同时报告〔权力差异、排班与评价仍按专业分开时〕,指南摘要少作主结论。 空栏未进入转诊、登记或随访的跨专业教育人群。 异名另见第 380 号第 14 条『跨专业疼痛康复把“消除疼痛”改成恢复参与』

辛、患者安全与质量改进把系统错误带入医学课程Patient Safety and Quality Improvement Bring System Error into the Curriculum

提出Weiss等,2014,《Journal of Graduate Medical Education》6:396–398,CLER项目 争议Wong等,2010,《Medical Education》44:1204–1213,患者安全课程综述 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定安全能力的只有学习者能否识别系统条件、报告近失和参与改进循环

但当患者在不同中心得到不同分类,或同一指标改善而生活功能没有改善时,旧逻辑失去解释力(据Weiss等2014·患者安全与质量改进)。在患者安全与质量的对象核查中,本项把测量窗口固定下来,防止短期改善替代长期结局,也防止版本变化伪装成进步。

这条转向的单因命题是:决定安全能力的只有学习者能否识别系统条件、报告近失和参与改进循环。可证伪的判据也随之明确:只要在控制其他常见解释后,这个决定项不能稳定改变方向,命题就应让位(检验对象:患者安全与质量改进)。这样的写法并不否认复杂性,而是强迫研究者说明哪一个环节承担主要因果责任(检验对象:患者安全与质量改进)。

Weiss等,2014,《Journal of Graduate Medical Education》6:396–398,CLER项目提供了支撑这一命题的主要读数:课程与CLER项目把事件分析、交接、感染、疲劳和质量指标纳入训练,部分项目改善知识和局部流程。可迁移性取决于谁被排除以及排除发生在哪一步,这2项都应成为结构化字段。 在患者安全与质量证据链中,原始锚点仍是Weiss等,2014,《Journal of Graduate Medical Education》6:396–398,CLER项目; 在患者安全与质量证据链中,原始锚点仍是Weiss等,2014,《Journal of Graduate Medical Education》6:396–398,CLER项目;它固定了对象、年份与出处,独立复核不得用异题评论替换。

患者安全与质量改进最值得保留的争论来自Wong等,2010,《Medical Education》44:1204–1213,患者安全课程综述:学习者缺乏权力、报告担忧和项目短期化会使“改进项目”只生成海报而不改变系统。支持方强调总体方向,质疑方则追问谁承担风险、哪一个替代终点被当成患者价值(边界:学习者缺乏权力、报告担忧)。 对患者安全与质量的争议记录是Wong等,2010,《Medical Education》44:1204–1213,患者安全课程综述;以患者安全与质量为对象,未公开检验的部分继续保留为未知状态,不并入支持证据。 对患者安全与质量的争议记录是Wong等,2010,《Medical Education》44:1204–1213,患者安全课程综述;未公开检验的部分继续保留为未知状态,不并入支持证据。

AAMC,2026,《医学生与住院医师人工智能能力框架》显示,现代推荐已不再把主要终点当作唯一结算,而是要求说明适应证边界、监测频率、停药或撤回条件(制度参照:2026·患者安全与质量改进)。 围绕患者安全与质量的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 围绕患者安全与质量的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

本项把测量窗口固定下来,防止短期改善替代长期结局,也防止版本变化伪装成进步。

位置D——主显露 单因只有患者安全与质量改进的实施路径决定成败。 预设〔11 可复现=可重做〕排除“被算法以低置信度静默过滤的患者安全与质量改进病例” 量纲患者安全与质量改进正确分类病例/全部参照病例 失效若学习者缺乏权力、报告担忧和项目短期化会使“改进项目”只生,本命题失效,须改用分层结局;越界时允许反转。 自曝本路线自己的数据暴露〔学习者缺乏权力、报告担忧和项目短期化会使“改进项目”只生成海报〕,足以生成反例。 空栏被算法以低置信度静默过滤的患者安全与质量改进病例。 异名另见第 379 号第 19 条『个体化剂量学把固定放射活度改成患者吸收剂量』
【第二幕】这十年 · 约 2016—2026

第二幕把评价推进到纵向证据、身份、环境、公平与AI。能力越被细分,越需要防止表格替代判断、指标驱动行为,以及把病人从教育互动中再次删除。从项目化评价推进到患者作为教育者,每一次性能提升都同时带来新的风险分层、实施门槛与责任归属。因此医学教育的第二幕不只问“能不能做”,还问结果由谁解释、失败由谁承接、资源不足时谁会先被排除。

一、项目化评价把单次考试降为证据网络中的一个节点Programmatic Assessment Makes Each Test One Node in an Evidence Network

提出van der Vleuten等,2012,《Medical Teacher》34:205–214,项目化评价模型 争议Schuwirth与van der Vleuten,2011,《Medical Education》45:478–485,评价效用演进 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定晋级可信度的只有跨方法、跨时间证据能否被有目的地汇总成可解释决策

在2018年前后,医学教育对“项目化评价”的处理仍依赖一个看似稳固的旧默认:每次考试单独判及格或失败,高利害决定依赖一次分数的测量精度。这套做法能解释典型病例,却经常把非典型病程、共病者与长期后果排除在视野之外(据van der Vleuten等2018·项目化评价)。van der Vleuten等所代表的研究把问题重新摆到临床现场,要求先说明究竟是哪一个对象被测量、谁进入分母,以及专科切片是否仍等于病人的整体。

新命题可以压缩成一句可反驳的话:决定晋级可信度的只有跨方法、跨时间证据能否被有目的地汇总成可解释决策。在这一立场中,条件环境不是众多因素之一,而是必须首先被检验的决定项(检验对象:项目化评价)。若它只在少数中心成立,也不能再被写成普遍规律(检验对象:项目化评价)。

在实证层面,项目化评价以大量低利害数据点、叙事反馈和独立决策委员会组成,减少单次偶然性并支持学习,出处为van der Vleuten等,2012,《Medical Teacher》34:205–214,项目化评价模型。这些数字让命题承担了明确风险:如果独立样本达不到相近的绝对差、风险比或诊断增量,项目化评价就不能继续以范式转向自居。相较只报P值的旧习惯,这项工作把患者获益、治疗负担和漏诊代价放进同一尺度,也为后续指南提供了可追溯的阈值(主证据:van der Vleuten等2018)。就项目化评价把单的实证锚点而言,本条固定2项可核量:分子“项目化评价维持反应时长”与分母“全部随访时长”,复核时不得只报前者。 在项目化评价把单证据链中,原始锚点仍是van der Vleuten等,2012,《Medical Teacher》34:205–214,项目化评价模型; 在项目化评价把单证据链中,原始锚点仍是van der Vleuten等,2012,《Medical Teacher》34:205–214,项目化评价模型;它固定了对象、年份与出处,独立复核不得用异题评论替换。

边界证据提醒我们,数据过载、汇总者偏差、学习者策略行为和复杂基础设施可能把整体判断变成不透明黑箱,相关质疑见Schuwirth与van der Vleuten,2011,《Medical Education》45:478–485,评价效用演进。如果只保留成功病例,项目化评价会显得比真实门诊更稳定;对这一转向最严的检验,是在不同人群、不同支付制度和低资源中心复现,而不是在原团队再次获得相同结果(边界:数据过载、汇总者偏差、学)。 对项目化评价把单的争议记录是Schuwirth与van der Vleuten,2011,《Medical Education》45:478–485,评价效用演进;

最新的制度锚点来自AAMC,2026,《医学生与住院医师人工智能能力框架》,它把患者选择、风险沟通和随访要求写得比早期试验更具体(制度参照:2026·项目化评价)。

执行层面的最低责任是同时报告分子、分母和未完成者,而不是只公布最佳批次。

位置E——主显露 单因只有项目化评价的条件场决定可迁移性。 预设〔11 可复现=可重做〕排除“最接近门诊谱却未达门槛的项目化评价患者” 量纲项目化评价维持反应时长/全部随访时长 失效若数据过载、汇总者偏差、学习者策略行为和复杂基础设施可能把,方向反过来:获益可转为伤害。 自曝研究者未否认〔数据过载、汇总者偏差、学习者策略行为和复杂基础设施可能把整体判〕,应用论文却少用于反驳。 空栏最接近门诊谱却未达门槛的项目化评价患者。 异名另见第 382 号第 16 条『异种移植把单个患者风险扩展到公共卫生与动物伦理』

二、委托决定研究把“信任”拆成任务、监督与情境Entrustment Research Decomposes Trust into Task, Supervision, and Context

提出ten Cate等,2016,《Academic Medicine》91:191–198,委托决定框架 争议Hauer等,2014,《Academic Medicine》89:1468–1474,监督者委托因素研究 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定委托级别的只有能力、诚信、可靠性、任务风险和监督可得性是否共同达到阈值

委托决定研究之所以成为近二十年的转向,并不是因为技术突然多了一项,而是因为旧框架在医学教育门诊里不断失灵。在委托决定研究把的对象核查中,这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。ten Cate等在2016年的工作把这些“例外”改写成需要被解释的核心事实。

决定委托级别的只有能力、诚信、可靠性、任务风险和监督可得性是否共同达到阈值,这是该条真正要守住的立场。

ten Cate等,2016,《Academic Medicine》91:191–198,委托决定框架把争论从概念推进到可核对读数。研究显示,质性与量化研究显示监督者同时考虑学习者特征、患者复杂度和自身责任,委托并非单纯能力分数。当这些结果按亚组、中心或随访阶段拆开时,效应并非完全均匀,这反而揭示了转向的真实边界(主证据:ten Cate等2016)。临床价值来自“谁真正改变了结局”,而不是总体均值是否漂亮;这也是本条在医学教育知识史中的位置(主证据:ten Cate等2016)。就委托决定研究把的实证锚点而言,本条固定2项可核量:分子“委托决定研究新增诊断病例”与分母“全部诊断病例”,复核时不得只报前者。 在委托决定研究把证据链中,原始锚点仍是ten Cate等,2016,《Academic Medicine》91:191–198,委托决定框架; 在委托决定研究把证据链中,原始锚点仍是ten Cate等,2016,《Academic Medicine》91:191–198,委托决定框架;它固定了对象、年份与出处,独立复核不得用异题评论替换。

争议并未因此结束(边界:信任受熟悉度和偏见影响)。Hauer等,2014,《Academic Medicine》89:1468–1474,监督者委托因素研究指出,信任受熟悉度和偏见影响,过度标准化又可能消除情境判断,跨观察者可比性有限。有些反对意见质疑样本选择,有些质疑终点能否代表长期功能,还有些发现效果在常规照护中明显缩小(边界:信任受熟悉度和偏见影响)。在委托决定研究把的边界核查中,若发现“因毒性、费用或照护负担退出的委托决定研究病例”需要额外投入,该投入必须入分母。

AAMC,2026,《医学生与住院医师人工智能能力框架》进一步要求把疗效与不良反应、功能与生物标志物、短期响应与长期结局并列呈现(制度参照:2026·委托决定研究)。它还迫使团队重新分工:谁解释不确定性,谁追踪未完成者,谁在指标恶化前启动替代方案(制度参照:2026·委托决定研究)。 围绕委托决定研究把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

这条转向改变的是对象边界:原先称作噪声的余数,现在成为检验机制的反例入口。

位置E——主显露 单因只有委托决定研究的目标读数决定判断。 预设〔21 制度采纳不改变指标含义〕排除“因毒性、费用或照护负担退出的委托决定研究病例” 量纲委托决定研究新增诊断病例/全部诊断病例 失效若信任受熟悉度和偏见影响,本命题失效,须改用分层结局;越界时允许反转。 自曝亚组资料已显示〔信任受熟悉度和偏见影响〕,总体结论常将其压平。 空栏因毒性、费用或照护负担退出的委托决定研究病例。 异名另见第 378 号第 15 条『肌炎特异性抗体把“多发性肌炎”拆成多个临床综合征』

三、专业身份形成把“像医生”从隐性模仿变成可反思过程Professional Identity Formation Makes Becoming a Doctor Reflective

提出Cruess等,2014,《Academic Medicine》89:1446–1451,专业身份形成框架 争议Jarvis-Selinger等,2012,《Academic Medicine》87:1185–1190,身份形成综述 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定专业身份的只有学习者能否把价值、角色、社群反馈与个人经历整合成可承担的自我

早期关于专业身份形成的知识以可见病灶、单项检测或一次疗效判断为中心,隐含前提是专业主义主要用行为规范和违纪清单教授,身份被假定随训练自然形成。然而,真实世界里最棘手的并非标准病例,而是边界患者、失访者和多病共存者(据Cruess等2019·专业身份形成)。

围绕专业身份形成,最清楚的可证伪表述是「决定专业身份的只有学习者能否把价值、角色、社群反馈与个人经历整合成可承担的自我」。

关键证据来自Cruess等,2014,《Academic Medicine》89:1446–1451,专业身份形成框架。纵向研究显示榜样、叙事、归属、冲突与转折事件深刻影响身份,反思和导师关系可使隐性课程可见。只有把反向事件写进主表,读数上升才不至于与实质恶化混为一谈。研究同时给出可比较的时间点、效应大小或诊断增益,使专业身份形成能够与传统路径在同一张结果表上对账,而不再只凭专家印象。就专业身份形成把的实证锚点而言,本条固定2项可核量:分子“专业身份形成主要结局达标者”与分母“全部分析者”,复核时不得只报前者。 在专业身份形成把证据链中,原始锚点仍是Cruess等,2014,《Academic Medicine》89:1446–1451,专业身份形成框架; 在专业身份形成把证据链中,原始锚点仍是Cruess等,2014,《Academic Medicine》89:1446–1451,专业身份形成框架;它固定了对象、年份与出处,独立复核不得用异题评论替换。

Jarvis-Selinger等,2012,《Academic Medicine》87:1185–1190,身份形成综述所代表的研究发现,身份话语可能要求同化、压制文化差异或把结构性困境个人化,不能用“韧性不足”解释环境伤害。这意味着原结论可能依赖特定中心的熟练度、选择标准或支持性照护,而不是治疗本身(边界:身份话语可能要求同化、压)。若把这些条件从试验环境中抽掉,效应会衰减,甚至出现反号(边界:身份话语可能要求同化、压)。 对专业身份形成把的争议记录是Jarvis-Selinger等,2012,《Academic Medicine》87:1185–1190,身份形成综述; 对专业身份形成把的争议记录是Jarvis-Selinger等,2012,《Academic Medicine》87:1185–1190,身份形成综述;未公开检验的部分继续保留为未知状态,不并入支持证据。

在AAMC,2026,《医学生与住院医师人工智能能力框架》的框架下,临床决策需要把证据等级、患者偏好和可实施条件同时写入记录(制度参照:2026·专业身份形成)。 围绕专业身份形成把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。以专业身份形成把为对象,复核时还须冻结对象定义、观察窗口、停止规则与资源预算,并逐一登记退出、未分类和未进入记录的对象。

证据能支持的范围止于已观察对象;

位置S——主显露 单因只有专业身份形成的实施路径决定成败。 预设〔21 制度采纳不改变指标含义〕排除“检测阴性但症状持续的专业身份形成对象” 量纲专业身份形成主要结局达标者/全部分析者 失效若身份话语可能要求同化、压制文化差异或把结构性困境个人化,优势可方向不稳为过度治疗。 自曝原研究已承认〔身份话语可能要求同化、压制文化差异或把结构性困境个人化〕,但传播常弱化此边界。 空栏检测阴性但症状持续的专业身份形成对象。 异名另见第 380 号第 2 条『神经病理性疼痛分级把“痛但没伤口”变成可诊断机制』

四、学术教练把反馈从评判改成纵向发展关系Academic Coaching Turns Feedback into a Longitudinal Development Relationship

提出Deiorio等,2016,《Medical Teacher》38:1146–1150,医学教育教练定义 争议Wolff等,2020,《Medical Education》54:559–570,教练系统综述 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定反馈转化的只有可信教练能否跨时间帮助学习者解释证据、设定目标并检验改变

如果只看教科书定义,学术教练似乎早已被认识;但当患者在不同中心得到不同分类,或同一指标改善而生活功能没有改善时,旧逻辑失去解释力(据Deiorio等2016·学术教练)。

这条转向的单因命题是:决定反馈转化的只有可信教练能否跨时间帮助学习者解释证据、设定目标并检验改变。可证伪的判据也随之明确:只要在控制其他常见解释后,这个决定项不能稳定改变方向,命题就应让位(检验对象:学术教练)。

Deiorio等,2016,《Medical Teacher》38:1146–1150,医学教育教练定义提供了支撑这一命题的主要读数:项目研究显示持续教练可提高反馈使用、自我调节与目标清晰度,尤其在复杂项目化评价中提供导航。 在学术教练把反馈证据链中,原始锚点仍是Deiorio等,2016,《Medical Teacher》38:1146–1150,医学教育教练定义;以学术教练把反馈为对象,它固定了对象、年份与出处,独立复核不得用异题评论替换。就学术教练把反馈的实证锚点而言,本条固定2项可核量:分子“学术教练减少事件数”与分母“对照原始事件数”,复核时不得只报前者。 在学术教练把反馈证据链中,原始锚点仍是Deiorio等,2016,《Medical Teacher》38:1146–1150,医学教育教练定义;它固定了对象、年份与出处,独立复核不得用异题评论替换。

学术教练最值得保留的争论来自Wolff等,2020,《Medical Education》54:559–570,教练系统综述:教练兼评判者会削弱心理安全,时间、匹配与质量差异使形式化会谈可能空转。支持方强调总体方向,质疑方则追问谁承担风险、哪一个替代终点被当成患者价值(边界:教练兼评判者会削弱心理安)。双方要收敛,不能只增加样本量,而要预先分层并设置足够长的随访,使短期改善与长期功能、并发症和资源消耗同时可见(边界:教练兼评判者会削弱心理安)。 对学术教练把反馈的争议记录是Wolff等,2020,《Medical Education》54:559–570,教练系统综述; 对学术教练把反馈的争议记录是Wolff等,2020,《Medical Education》54:559–570,教练系统综述;未公开检验的部分继续保留为未知状态,不并入支持证据。

AAMC,2026,《医学生与住院医师人工智能能力框架》显示,现代推荐已不再把主要终点当作唯一结算,而是要求说明适应证边界、监测频率、停药或撤回条件(制度参照:2026·学术教练)。 围绕学术教练把反馈的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 围绕学术教练把反馈的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

当场景、尺度或时间窗改变时,先复算共同分母,再讨论机制是否仍成立。

位置D——主显露 单因只有学术教练的条件场决定可迁移性。 预设〔21 制度采纳不改变指标含义〕排除“无法完成金标准检查的学术教练脆弱患者” 量纲学术教练减少事件数/对照原始事件数 失效若教练兼评判者会削弱心理安全,本命题失效,须改用分层结局。 自曝支持文献同时报告〔教练兼评判者会削弱心理安全〕,指南摘要少作主结论。 空栏无法完成金标准检查的学术教练脆弱患者。 异名另见第 383 号第 10 条『舌下神经刺激把气道治疗从持续压力改成睡眠期神经反馈』

五、学习环境研究把倦怠从个人韧性缺陷改写为教育系统结果Learning-Environment Research Reframes Burnout as a System Outcome

提出Shanafelt等,2015,《Mayo Clinic Proceedings》90:1600–1613,医师倦怠全国调查 争议Dyrbye等,2019,《Academic Medicine》94:1014–1020,学习环境与医学生倦怠 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定倦怠风险的只有工作量、控制、归属、公平和价值冲突构成的学习环境是否失衡

在2019年前后,医学教育对“学习环境研究”的处理仍依赖一个看似稳固的旧默认:学习者疲惫、抑郁或犬儒被视为个人适应与时间管理问题。这套做法能解释典型病例,却经常把非典型病程、共病者与长期后果排除在视野之外(据Shanafelt等2019·学习环境研究)。

新命题可以压缩成一句可反驳的话:决定倦怠风险的只有工作量、控制、归属、公平和价值冲突构成的学习环境是否失衡。在这一立场中,结局结构不是众多因素之一,而是必须首先被检验的决定项(检验对象:学习环境研究)。若它只在少数中心成立,也不能再被写成普遍规律(检验对象:学习环境研究)。

在实证层面,全国调查显示医师倦怠显著高于一般职业人群;医学教育队列把虐待、低支持和学习环境与倦怠及离校意向相连,出处为Shanafelt等,2015,《Mayo Clinic Proceedings》90:1600–1613,医师倦怠全国调查。这些数字让命题承担了明确风险:如果独立样本达不到相近的绝对差、风险比或诊断增量,学习环境研究就不能继续以范式转向自居。资源成本不是背景变量;在学习环境研究把的读数核查中,若发现“功能改善但中心指标未变的学习环境研究患者”需要额外投入,该投入必须入分母。就学习环境研究把的实证锚点而言,本条固定2项可核量:分子“学习环境研究可解释差异”与分母“全部观察差异”,复核时不得只报前者。 在学习环境研究把证据链中,原始锚点仍是Shanafelt等,2015,《Mayo Clinic Proceedings》90:1600–1613,医师倦怠全国调查; 在学习环境研究把证据链中,原始锚点仍是Shanafelt等,2015,《Mayo Clinic Proceedings》90:1600–1613,医师倦怠全国调查;它固定了对象、年份与出处,独立复核不得用异题评论替换。

边界证据提醒我们,自报量表、横断面和选择退出限制因果,个体干预仍可帮助部分学习者,相关质疑见Dyrbye等,2019,《Academic Medicine》94:1014–1020,学习环境与医学生倦怠。如果只保留成功病例,学习环境研究会显得比真实门诊更稳定;对这一转向最严的检验,是在不同人群、不同支付制度和低资源中心复现,而不是在原团队再次获得相同结果(边界:自报量表、横断面和选择退)。 对学习环境研究把的争议记录是Dyrbye等,2019,《Academic Medicine》94:1014–1020,学习环境与医学生倦怠;

最新的制度锚点来自AAMC,2026,《医学生与住院医师人工智能能力框架》,它把患者选择、风险沟通和随访要求写得比早期试验更具体(制度参照:2026·学习环境研究)。 围绕学习环境研究把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

本项拒绝把采用率当成效果;

位置E——主显露 单因只有学习环境研究的目标读数决定判断。 预设〔22 通过形式审查=实质合规〕排除“功能改善但中心指标未变的学习环境研究患者” 量纲学习环境研究可解释差异/全部观察差异 失效若自报量表、横断面和选择退出限制因果,方向方向不稳:获益可转为伤害。 自曝本路线自己的数据暴露〔自报量表、横断面和选择退出限制因果〕,足以生成反例。 空栏功能改善但中心指标未变的学习环境研究患者。 异名另见第 383 号第 1 条『CBT-I把慢性失眠从“缺少睡眠药”改写为可学习的失调』

六、纵向整合见习把病例连续性变成学习资源Longitudinal Integrated Clerkships Turn Continuity into a Learning Resource

提出Hirsh等,2012,《Academic Medicine》87:145–154,纵向整合见习综述 争议Norris等,2009,《Academic Medicine》84:902–907,纵向整合见习联盟定义 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定临床整合能力的只有学习者能否跨时间追踪患者、疾病与照护系统

纵向整合见习之所以成为近二十年的转向,并不是因为技术突然多了一项,而是因为旧框架在医学教育门诊里不断失灵。此前普遍默认临床教育按数周专科轮转,学生观察疾病片段而很少追踪同一患者和导师;

决定临床整合能力的只有学习者能否跨时间追踪患者、疾病与照护系统,这是该条真正要守住的立场。它拒绝用模糊的综合解释把冲突抹平,而是把发生路径推到可被攻击的位置(检验对象:纵向整合见习)。研究设计需要设置足以让这一因素失败的对照:改变阈值、改变顺序、改变人群或改变支付环境,观察方向是否仍在(检验对象:纵向整合见习)。

Hirsh等,2012,《Academic Medicine》87:145–154,纵向整合见习综述把争论从概念推进到可核对读数。研究显示,多校研究显示LIC学生在知识考试不劣,患者中心、连续关系和部分临床表现更好,并可支持基层职业选择。临床价值来自“谁真正改变了结局”,而不是总体均值是否漂亮; 在纵向整合见习把证据链中,原始锚点仍是Hirsh等,2012,《Academic Medicine》87:145–154,纵向整合见习综述;就纵向整合见习把的实证锚点而言,本条固定2项可核量:分子“纵向整合见习获益者”与分母“承担治疗风险者”,复核时不得只报前者。 在纵向整合见习把证据链中,原始锚点仍是Hirsh等,2012,《Academic Medicine》87:145–154,纵向整合见习综述;它固定了对象、年份与出处,独立复核不得用异题评论替换。

Norris等,2009,《Academic Medicine》84:902–907,纵向整合见习联盟定义指出,排课、病例量、专科深度和评价关系过密会产生新偏差,不能简单复制到所有机构。有些反对意见质疑样本选择,有些质疑终点能否代表长期功能,还有些发现效果在常规照护中明显缩小(边界:排课、病例量、专科深度和)。这里的判决不靠术语声望,而靠“以纵向整合见习获益者占承担治疗风险者的比例核算”在独立样本中是否保持方向。否则正向平均值很容易被误当成无条件许可(边界:排课、病例量、专科深度和)。

AAMC,2026,《医学生与住院医师人工智能能力框架》进一步要求把疗效与不良反应、功能与生物标志物、短期响应与长期结局并列呈现(制度参照:2026·纵向整合见习)。它还迫使团队重新分工:谁解释不确定性,谁追踪未完成者,谁在指标恶化前启动替代方案(制度参照:2026·纵向整合见习)。 围绕纵向整合见习把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

可迁移性取决于谁被排除以及排除发生在哪一步,这两项都应成为结构化字段。

位置S——主显露 单因只有纵向整合见习的实施路径决定成败。 预设〔22 通过形式审查=实质合规〕排除“多病共存而无法归入单一路径的纵向整合见习患者” 量纲纵向整合见习获益者/承担治疗风险者 失效若排课、病例量、专科深度和评价关系过密会产生新偏差,本命题失效,须改用分层结局。 自曝研究者未否认〔排课、病例量、专科深度和评价关系过密会产生新偏差〕,应用论文却少用于反驳。 空栏多病共存而无法归入单一路径的纵向整合见习患者。 异名另见第 375 号第 1 条『eGFR分期把慢性肾病从肌酐异常变成风险连续体』

七、评价语言偏差把性别与族群不平等暴露在叙事反馈中Narrative Assessment Bias Exposes Gender and Racial Inequality

提出Ross等,2017,《Academic Medicine》92:453–458,医学生评价种族差异 争议Rojek等,2019,《Journal of General Internal Medicine》34:684–691,住院医师评价性别语言差异 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定评价公平的只有相同行为是否在不同身份学习者身上被用同等标准和语言描述

早期关于评价语言偏差的知识以可见病灶、单项检测或一次疗效判断为中心,隐含前提是叙事评价被视为比考试更贴近真实表现,文字中的主观性被当作有益丰富性。然而,真实世界里最棘手的并非标准病例,而是边界患者、失访者和多病共存者(据Ross等2017·评价语言偏差)。

围绕评价语言偏差,最清楚的可证伪表述是「决定评价公平的只有相同行为是否在不同身份学习者身上被用同等标准和语言描述」。

关键证据来自Ross等,2017,《Academic Medicine》92:453–458,医学生评价种族差异。多机构研究发现少数族裔学生获得较低等级和不同能力词汇,男性与女性常被赋予不同自主性和人格描述。在评价语言偏差把的读数核查中,本项先把“未进入转诊、登记或随访的评价语言偏差人群”放回分母,再判断可见结果是否代表总体。研究同时给出可比较的时间点、效应大小或诊断增益,使评价语言偏差能够与传统路径在同一张结果表上对账,而不再只凭专家印象。就评价语言偏差把的实证锚点而言,本条固定2项可核量:分子“评价语言偏差独立复现次数”与分母“全部验证次数”,复核时不得只报前者。 在评价语言偏差把证据链中,原始锚点仍是Ross等,2017,《Academic Medicine》92:453–458,医学生评价种族差异; 在评价语言偏差把证据链中,原始锚点仍是Ross等,2017,《Academic Medicine》92:453–458,医学生评价种族差异;它固定了对象、年份与出处,独立复核不得用异题评论替换。

Rojek等,2019,《Journal of General Internal Medicine》34:684–691,住院医师评价性别语言差异所代表的研究发现,身份与轮转、专业选择和观察机会混杂,去除敏感词不能自动消除结构偏差。这意味着原结论可能依赖特定中心的熟练度、选择标准或支持性照护,而不是治疗本身(边界:身份与轮转、专业选择和观)。若把这些条件从试验环境中抽掉,效应会衰减,甚至出现反号(边界:身份与轮转、专业选择和观)。因而本条必须同时报告绝对获益、撤药或失败后的结局,以及未进入试验者的去向(边界:身份与轮转、专业选择和观)。 对评价语言偏差把的争议记录是Rojek等,2019,《Journal of General Internal Medicine》34:684–691,住院医师评价性别语言差异;

在AAMC,2026,《医学生与住院医师人工智能能力框架》的框架下,临床决策需要把证据等级、患者偏好和可实施条件同时写入记录(制度参照:2026·评价语言偏差)。 围绕评价语言偏差把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

原证据保留了一个明确锚点,但没有自动覆盖边界外对象;

位置E——主显露 单因只有评价语言偏差的条件场决定可迁移性。 预设〔22 通过形式审查=实质合规〕排除“未进入转诊、登记或随访的评价语言偏差人群” 量纲评价语言偏差独立复现次数/全部验证次数 失效若身份与轮转、专业选择和观察机会混杂,优势可方向不稳为过度治疗。 自曝亚组资料已显示〔身份与轮转、专业选择和观察机会混杂〕,总体结论常将其压平。 空栏未进入转诊、登记或随访的评价语言偏差人群。 异名另见第 385 号第 15 条『人类泛基因组把单一参考序列的祖源偏差暴露为诊断变量』

八、社会责任教育把医学院成效从毕业生成绩扩展到社区健康Social Accountability Extends Medical-School Outcomes to Community Health

提出Boelen与Woollard,2011,《Medical Teacher》33:614–619,社会责任框架 争议Reeve等,2017,《Medical Teacher》39:286–292,社会责任评价研究 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定学校公共价值的只有招生、课程、服务和毕业流向是否回应其所服务人群的优先需要

但当患者在不同中心得到不同分类,或同一指标改善而生活功能没有改善时,旧逻辑失去解释力(据Boelen与Woollard2020·社会责任教育)。Boelen与Woollard在2020年提出的证据因此不是补丁,而是把专科默认的观察单位换掉。

这条转向的单因命题是:决定学校公共价值的只有招生、课程、服务和毕业流向是否回应其所服务人群的优先需要。

Boelen与Woollard,2011,《Medical Teacher》33:614–619,社会责任框架提供了支撑这一命题的主要读数:偏远与社区导向项目显示本地招生、纵向基层训练和社区合作与农村执业和服务保留相关。样本量、随访长度与效应方向共同说明,变化并非只存在于替代指标(主证据:Boelen与Woollard2020)。更重要的是,研究把失败、停药、复发或不可判定者纳入结果解释,因而可见结局不再等于完整结局(主证据:Boelen与Woollard2020)。对医学教育而言,这一步把“新技术可用”提升为“旧问法必须改写”(主证据:Boelen与Woollard2020)。就社会责任教育把的实证锚点而言,本条固定2项可核量:分子“社会责任教育改变决策病例”与分母“全部受检病例”,复核时不得只报前者。 在社会责任教育把证据链中,原始锚点仍是Boelen与Woollard,2011,《Medical Teacher》33:614–619,社会责任框架; 在社会责任教育把证据链中,原始锚点仍是Boelen与Woollard,2011,《Medical Teacher》33:614–619,社会责任框架;它固定了对象、年份与出处,独立复核不得用异题评论替换。

社会责任教育最值得保留的争论来自Reeve等,2017,《Medical Teacher》39:286–292,社会责任评价研究:地区就业受家庭、政策和薪酬影响,学校难独占因果,社会责任指标也可能被形式化。支持方强调总体方向,质疑方则追问谁承担风险、哪一个替代终点被当成患者价值(边界:地区就业受家庭、政策和薪)。 对社会责任教育把的争议记录是Reeve等,2017,《Medical Teacher》39:286–292,社会责任评价研究; 对社会责任教育把的争议记录是Reeve等,2017,《Medical Teacher》39:286–292,社会责任评价研究;未公开检验的部分继续保留为未知状态,不并入支持证据。

AAMC,2026,《医学生与住院医师人工智能能力框架》显示,现代推荐已不再把主要终点当作唯一结算,而是要求说明适应证边界、监测频率、停药或撤回条件(制度参照:2026·社会责任教育)。 围绕社会责任教育把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。 对社会责任教育把的外推必须另列时间窗、地点、尺度和资源预算; 围绕社会责任教育把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

同名方法在不同机构可能处理不同对象,必须先锁定对象、分母与停止规则。

位置E——主显露 单因只有社会责任教育的目标读数决定判断。 预设〔27 能力可与承载它的人分离〕排除“被算法以低置信度静默过滤的社会责任教育病例” 量纲社会责任教育改变决策病例/全部受检病例 失效若地区就业受家庭、政策和薪酬影响,本命题失效,须改用分层结局。 自曝原研究已承认〔地区就业受家庭、政策和薪酬影响〕,但传播常弱化此边界。 空栏被算法以低置信度静默过滤的社会责任教育病例。 异名另见第 382 号第 11 条『健康人工智能伦理把模型性能扩展到部署后的责任链』

九、虚拟临床学习把“在场”拆成沉浸、反馈与真实责任Virtual Clinical Learning Decomposes Presence into Immersion, Feedback, and Responsibility

提出Wilcha,2020,《BMC Medical Education》20:456,COVID-19在线医学教育综述 争议Kyaw等,2019,《Journal of Medical Internet Research》21:e12959,虚拟现实教育系统综述 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定虚拟学习有效性的只有任务真实性、互动反馈与向真实病人迁移是否同时存在

在2020年前后,医学教育对“虚拟临床学习”的处理仍依赖一个看似稳固的旧默认:临床学习被默认必须身体在病房,数字模拟只能补充知识传递。这套做法能解释典型病例,却经常把非典型病程、共病者与长期后果排除在视野之外(据Wilcha2020·虚拟临床学习)。Wilcha所代表的研究把问题重新摆到临床现场,要求先说明究竟是哪一个对象被测量、谁进入分母,以及专科切片是否仍等于病人的整体。

新命题可以压缩成一句可反驳的话:决定虚拟学习有效性的只有任务真实性、互动反馈与向真实病人迁移是否同时存在。在这一立场中,发生路径不是众多因素之一,而是必须首先被检验的决定项(检验对象:虚拟临床学习)。

在实证层面,系统综述显示VR和数字模拟可改善部分知识与技能,疫情期间远程病例、查房和标准化病人维持了课程连续性,出处为Wilcha,2020,《BMC Medical Education》20:456,COVID-19在线医学教育综述。这些数字让命题承担了明确风险:如果独立样本达不到相近的绝对差、风险比或诊断增量,虚拟临床学习就不能继续以范式转向自居。相较只报P值的旧习惯,这项工作把患者获益、治疗负担和漏诊代价放进同一尺度,也为后续指南提供了可追溯的阈值(主证据:Wilcha2020)。就虚拟临床学习把的实证锚点而言,本条固定2项可核量:分子“虚拟临床学习净获益”与分母“单位成本”,复核时不得只报前者。 在虚拟临床学习把证据链中,原始锚点仍是Wilcha,2020,《BMC Medical Education》20:456,COVID-19在线医学教育综述; 在虚拟临床学习把证据链中,原始锚点仍是Wilcha,2020,《BMC Medical Education》20:456,COVID-19在线医学教育综述;它固定了对象、年份与出处,独立复核不得用异题评论替换。

边界证据提醒我们,设备、眩晕、数字差距和缺乏真实后果会限制专业责任学习,满意度不能替代临床表现,相关质疑见Kyaw等,2019,《Journal of Medical Internet Research》21:e12959,虚拟现实教育系统综述。如果只保留成功病例,虚拟临床学习会显得比真实门诊更稳定;对这一转向最严的检验,是在不同人群、不同支付制度和低资源中心复现,而不是在原团队再次获得相同结果(边界:设备、眩晕、数字差距和缺)。

最新的制度锚点来自AAMC,2026,《医学生与住院医师人工智能能力框架》,它把患者选择、风险沟通和随访要求写得比早期试验更具体(制度参照:2026·虚拟临床学习)。 围绕虚拟临床学习把的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

只有把反向事件写进主表,读数上升才不至于与实质恶化混为一谈。

位置S——主显露 单因只有虚拟临床学习的实施路径决定成败。 预设〔27 能力可与承载它的人分离〕排除“最接近门诊谱却未达门槛的虚拟临床学习患者” 量纲虚拟临床学习净获益/单位成本 失效若设备、眩晕、数字差距和缺乏真实后果会限制专业责任学习,方向方向不稳:获益可转为伤害。 自曝支持文献同时报告〔设备、眩晕、数字差距和缺乏真实后果会限制专业责任学习〕,指南摘要少作主结论。 空栏最接近门诊谱却未达门槛的虚拟临床学习患者。 异名另见第 378 号第 15 条『肌炎特异性抗体把“多发性肌炎”拆成多个临床综合征』

十、人工智能能力框架把“会用工具”扩展为验证、解释与责任AI Competency Frameworks Extend Tool Use to Validation and Accountability

提出AAMC,2026,《Artificial Intelligence Competencies Across the Learning Continuum》 争议中国医学教育协会等,2026,《医学教育人工智能素养与应用能力共识》 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定临床AI能力的只有学习者能否识别适用边界、验证输出、解释不确定性并承担最终责任

人工智能能力框架之所以成为近二十年的转向,并不是因为技术突然多了一项,而是因为旧框架在医学教育门诊里不断失灵。此前普遍默认AI教育被简化为提示词技巧和软件熟练,工具输出正确就被视为能力获得;AAMC在2026年的工作把这些“例外”改写成需要被解释的核心事实。

决定临床AI能力的只有学习者能否识别适用边界、验证输出、解释不确定性并承担最终责任,这是该条真正要守住的立场。它拒绝用模糊的综合解释把冲突抹平,而是把条件环境推到可被攻击的位置(检验对象:人工智能能力框架)。研究设计需要设置足以让这一因素失败的对照:改变阈值、改变顺序、改变人群或改变支付环境,观察方向是否仍在(检验对象:人工智能能力框架)。

AAMC,2026,《Artificial Intelligence Competencies Across the Learning Continuum》把争论从概念推进到可核对读数。研究显示,最新框架把数据素养、偏差、安全、沟通、人机协作和持续监测拆成可观察能力,中国共识提出多维21项指标。当这些结果按亚组、中心或随访阶段拆开时,效应并非完全均匀,这反而揭示了转向的真实边界(主证据:AAMC2026)。临床价值来自“谁真正改变了结局”,而不是总体均值是否漂亮;这也是本条在医学教育知识史中的位置(主证据:AAMC2026)。 在人工智能能力框证据链中,原始锚点仍是AAMC,2026,《Artificial Intelligence Competencies Across the Learning Continuum》; 在人工智能能力框证据链中,原始锚点仍是AAMC,2026,《Artificial Intelligence Competencies Across the Learning Continuum》;它固定了对象、年份与出处,独立复核不得用异题评论替换。

争议并未因此结束(边界:框架尚缺跨学校效果验证)。中国医学教育协会等,2026,《医学教育人工智能素养与应用能力共识》指出,框架尚缺跨学校效果验证,技术变化快于课程,过度列项可能把责任伦理变成清单。有些反对意见质疑样本选择,有些质疑终点能否代表长期功能,还有些发现效果在常规照护中明显缩小(边界:框架尚缺跨学校效果验证)。否则正向平均值很容易被误当成无条件许可(边界:框架尚缺跨学校效果验证)。 对人工智能能力框的争议记录是中国医学教育协会等,2026,《医学教育人工智能素养与应用能力共识》;

AAMC,2026,《医学生与住院医师人工智能能力框架》进一步要求把疗效与不良反应、功能与生物标志物、短期响应与长期结局并列呈现。 围绕人工智能能力框的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

本项的复核单位不是一次成功,而是成功、失败与未知状态组成的完整事件集。

位置S——主显露 单因只有人工智能能力框架的条件场决定可迁移性。 预设〔27 能力可与承载它的人分离〕排除“因毒性、费用或照护负担退出的人工智能能力框架病例” 量纲人工智能能力框架正确分类病例/全部参照病例 失效若框架尚缺跨学校效果验证,本命题失效,须改用分层结局。 自曝本路线自己的数据暴露〔框架尚缺跨学校效果验证〕,足以生成反例。 空栏因毒性、费用或照护负担退出的人工智能能力框架病例。 异名另见第 382 号第 11 条『健康人工智能伦理把模型性能扩展到部署后的责任链』

十一、大语言模型迫使考试区分答案生成与临床推理LLMs Force Assessment to Distinguish Answer Generation from Clinical Reasoning

提出Kung等,2023,《PLOS Digital Health》2:e0000198,ChatGPT与美国执照考试 争议Sallam,2023,《Healthcare》11:887,ChatGPT医学教育系统综述 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定评价有效性的只有任务能否要求学习者验证证据、展示过程并在不确定场景中负责

早期关于大语言模型迫的知识以可见病灶、单项检测或一次疗效判断为中心,隐含前提是闭卷文字答案被视为学习者知识与推理的直接产物,生成过程不可见但默认属于本人。然而,真实世界里最棘手的并非标准病例,而是边界患者、失访者和多病共存者(据Kung等2023·大语言模型迫)。在大语言模型迫使的对象核查中,若发现“检测阴性但症状持续的大语言模型迫对象”需要额外投入,该投入必须入分母。

围绕大语言模型迫,最清楚的可证伪表述是「决定评价有效性的只有任务能否要求学习者验证证据、展示过程并在不确定场景中负责」。在大语言模型迫使的机制核查中,证据责任落在可复算路径:对象如何进入、何处退出、退出后怎样改变结论,三步缺一不可。

关键证据来自Kung等,2023,《PLOS Digital Health》2:e0000198,ChatGPT与美国执照考试。早期研究显示通用大模型可在执照考试达到接近或超过通过线,同时产生流畅但错误解释,证明答案分数与可靠推理可分离。因此过程记录本身属于证据。研究同时给出可比较的时间点、效应大小或诊断增益,使大语言模型迫能够与传统路径在同一张结果表上对账,而不再只凭专家印象。就大语言模型迫使的实证锚点而言,本条固定2项可核量:分子“大语言模型迫维持反应时长”与分母“全部随访时长”,复核时不得只报前者。 在大语言模型迫使证据链中,原始锚点仍是Kung等,2023,《PLOS Digital Health》2:e0000198,ChatGPT与美国执照考试; 在大语言模型迫使证据链中,原始锚点仍是Kung等,2023,《PLOS Digital Health》2:e0000198,ChatGPT与美国执照考试;它固定了对象、年份与出处,独立复核不得用异题评论替换。

反证主要集中在可迁移性(边界:基准泄漏、版本变化和考试)。Sallam,2023,《Healthcare》11:887,ChatGPT医学教育系统综述所代表的研究发现,基准泄漏、版本变化和考试不代表临床工作限制结论,禁止工具也不能恢复旧评价效度。这意味着原结论可能依赖特定中心的熟练度、选择标准或支持性照护,而不是治疗本身(边界:基准泄漏、版本变化和考试)。若把这些条件从试验环境中抽掉,效应会衰减,甚至出现反号(边界:基准泄漏、版本变化和考试)。

在AAMC,2026,《医学生与住院医师人工智能能力框架》的框架下,临床决策需要把证据等级、患者偏好和可实施条件同时写入记录(制度参照:2026·大语言模型迫)。 围绕大语言模型迫使的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

若发现“未记录对象”需要额外投入,该投入必须入分母。

位置S——主显露 单因只有大语言模型迫的目标读数决定判断。 预设〔04 测量不改变被测对象〕排除“检测阴性但症状持续的大语言模型迫对象” 量纲大语言模型迫维持反应时长/全部随访时长 失效若基准泄漏、版本变化和考试不代表临床工作限制结论,优势可方向不稳为过度治疗。 自曝研究者未否认〔基准泄漏、版本变化和考试不代表临床工作限制结论〕,应用论文却少用于反驳。 空栏检测阴性但症状持续的大语言模型迫对象。 异名另见第 385 号第 4 条『人类表型本体把临床描述变成可计算语言』

十二、患者作为教育者把临床故事的所有权带回课程Patients as Educators Return Ownership of Clinical Narratives

提出Towle等,2010,《Medical Education》44:64–74,患者参与医学教育综述 争议Dijk等,2020,《Medical Education》54:1125–1136,患者教育者角色研究 最新AAMC,2026,《医学生与住院医师人工智能能力框架》 关键决定患者参与价值的只有患者能否共同设计目标、提供反馈并控制自身故事如何被使用

如果只看教科书定义,患者作为教育者似乎早已被认识;但当患者在不同中心得到不同分类,或同一指标改善而生活功能没有改善时,旧逻辑失去解释力(据Towle等2024·患者作为教育者)。

这条转向的单因命题是:决定患者参与价值的只有患者能否共同设计目标、提供反馈并控制自身故事如何被使用。可证伪的判据也随之明确:只要在控制其他常见解释后,这个决定项不能稳定改变方向,命题就应让位(检验对象:患者作为教育者)。这样的写法并不否认复杂性,而是强迫研究者说明哪一个环节承担主要因果责任(检验对象:患者作为教育者)。

Towle等,2010,《Medical Education》44:64–74,患者参与医学教育综述提供了支撑这一命题的主要读数:综述显示患者可作为教师、评定者和课程伙伴,学习者在沟通、同理与疾病生活经验方面获得独特反馈。在患者作为教育者的读数核查中,该命题的强处在可反驳:越过“若代表性、情感劳动、报酬和隐私常被低估,本命题失效,须改用分层结局”,结果必须允许翻转。就患者作为教育者的实证锚点而言,本条固定2项可核量:分子“患者作为教育者新增诊断病例”与分母“全部诊断病例”,复核时不得只报前者。 在患者作为教育者证据链中,原始锚点仍是Towle等,2010,《Medical Education》44:64–74,患者参与医学教育综述; 在患者作为教育者证据链中,原始锚点仍是Towle等,2010,《Medical Education》44:64–74,患者参与医学教育综述;它固定了对象、年份与出处,独立复核不得用异题评论替换。

患者作为教育者最值得保留的争论来自Dijk等,2020,《Medical Education》54:1125–1136,患者教育者角色研究:代表性、情感劳动、报酬和隐私常被低估,单个“典型患者”不能代表整个群体。支持方强调总体方向,质疑方则追问谁承担风险、哪一个替代终点被当成患者价值(边界:代表性、情感劳动、报酬和)。双方要收敛,不能只增加样本量,而要预先分层并设置足够长的随访,使短期改善与长期功能、并发症和资源消耗同时可见(边界:代表性、情感劳动、报酬和)。 对患者作为教育者的争议记录是Dijk等,2020,《Medical Education》54:1125–1136,患者教育者角色研究;

AAMC,2026,《医学生与住院医师人工智能能力框架》显示,现代推荐已不再把主要终点当作唯一结算,而是要求说明适应证边界、监测频率、停药或撤回条件(制度参照:2026·患者作为教育者)。 围绕患者作为教育者的复算还需同步保存阳性、阴性、未知与中止4类状态,避免清洗过程改写原始分母。

最终判断由公开数据能否重建对象流决定,而不是作者是否给出肯定结论。

位置D——主显露 单因只有患者作为教育者的实施路径决定成败。 预设〔07 效果可由参与者自己评定〕排除“无法完成金标准检查的患者作为教育者脆弱患者” 量纲患者作为教育者新增诊断病例/全部诊断病例 失效若代表性、情感劳动、报酬和隐私常被低估,本命题失效,须改用分层结局。 自曝亚组资料已显示〔代表性、情感劳动、报酬和隐私常被低估〕,总体结论常将其压平。 空栏无法完成金标准检查的患者作为教育者脆弱患者。 异名另见第 385 号第 4 条『人类表型本体把临床描述变成可计算语言』

◎ 二十年连起来看

第一条贯穿线索是:医学教育从“给病灶或指标命名”转向“追踪患者在路径中如何变化”(第381号第10条)。胜任力本位教育把培训从年限改成能力证据与患者安全与质量改进把系统错误带入医学课程分别从早期机制和临床验证撬动旧默认,后来的纵向整合见习把病例连续性变成学习资源又把选择条件写进结果。二十年间真正改变的不是知识量,而是分母开始包含失败、复发与功能结局(第381号第12条)。

第二条线索是:技术越精准,越需要说明谁被排除(第381号第13条)。模拟精熟学习把错误从病床转移到可重复训练场提高了局部辨别率,学术教练把反馈从评判改成纵向发展关系强化了个体化,但虚拟临床学习把“在场”拆成沉浸、反馈与真实责任提醒我们,无法完成检测、支付或随访的人会从证据中消失。精准化若不补上可及性账本,就会把选择偏倚误写成疗效(第381号第15条)。

第三条线索是:专科结局必须与患者整体重新对账(第381号第16条)。工作场所评价把真实临床表现带回考核、评价语言偏差把性别与族群不平等暴露在叙事反馈中和患者作为教育者把临床故事的所有权带回课程分别把症状、机制和制度推到同一张表上。它们共同否定了“一个专科指标改善就等于病人改善”的旧结算方式(第381号第18条)。

◎ 三个常见误解

误解一:新药、新设备或新模型一旦在随机试验中胜出,就等于适用于全部医学教育患者(第381号第9条)。这个误解容易出现,因为试验给出清楚的平均效应;正确表述是,平均效应必须与入组边界、绝对获益和退出者结局一起解释(第381号第10条)。

误解二:分型越细就必然越接近真实(第381号第12条)。委托决定研究把“信任”拆成任务、监督与情境与社会责任教育把医学院成效从毕业生成绩扩展到社区健康显示,分辨率提高会同时制造新的边界病例与不确定结果;真正的进步是能否改变决策,而不是标签数量是否增加。

误解三:患者报告、影像、实验室指标或算法分数中总有一个天然更“客观”(第381号第15条)。刻意练习把专家成长从天赋改成反馈密度表明,每一种读数都有自己的观察条件;正确做法是建立多尺度结局并预先说明冲突时由谁裁定。

◎ 与相邻领域的接口

与第112号临床试验方法学的分工判据是:第112号判断证据能否识别因果,本块判断同一证据进入医学教育路径后是否仍保留患者整体(第381号第11条)。两边在入组、替代终点和失访处理上必须共用分母(第381号第12条)。

与第109号病理与诊断学的接口在分类边界(第381号第14条)。本块的可委托专业活动把能力翻译成“我敢不敢让你独立做”和专业身份形成把“像医生”从隐性模仿变成可反思过程提供专科对象,第109号则检验组织、分子或诊断标签是否可重复;一旦两者不一致,应优先记录不一致本身。

与第117号医疗器械与诊断技术的接口在实施条件(第381号第17条)。设备性能只是上限,真实效果还取决于操作者、维护、解释和转诊能力;因此本块不能把设备准确率直接当成临床净获益(第381号第18条)。

与第474号残障研究的接口在功能与价值(第381号第20条)。本块描述疾病控制,第474号追问患者能否参与生活、教育和工作;二者的分工使“正常化指标”不再自动压过患者自定目标(第381号第1条)。

◎ 争议现场

争议一围绕跨专业教育把协作能力从口号变成共同任务:机制型分层能否稳定指导个体治疗。要收敛,需在预注册多中心研究中比较“分层后治疗”与“仅记录分层但不改变治疗”,并报告样本外净获益(第381号第8条)。

争议二围绕学习环境研究把倦怠从个人韧性缺陷改写为教育系统结果:快速采用新路径是否会扩大公平差距。要收敛,需把支付、距离、语言和照护者时间纳入主要分析,而不是只做事后社会经济亚组(第381号第11条)。

争议三围绕大语言模型迫使考试区分答案生成与临床推理:长期结局能否由短期替代指标预测。要收敛,必须建立至少三至五年的前瞻随访,并预设替代终点与功能、生存或复发之间的最低可接受关联(第381号第14条)。

◎ 往下五年看什么

看纵向整合见习把病例连续性变成学习资源能否在独立中心把决策改变率稳定提高,同时不增加不可判定病例比例;可观测读数是“改变治疗的新增病例/全部受检者”。

看虚拟临床学习把“在场”拆成沉浸、反馈与真实责任是否真正缩短从首诊到有效干预的中位时间,并分别报告高资源与低资源机构的差值。

看患者作为教育者把临床故事的所有权带回课程能否把患者报告结局、功能结局和传统专科指标放入同一核心结局集;读数是三类结局共同完整报告的试验比例。

看本块新疗法在停药、复发或不良反应后是否仍保留净获益;不能只看治疗期内的响应率(第381号第19条)。

◎ 可与哪些领域对撞

本块第1条「胜任力本位教育」可与第112号第1条临床试验方法学对撞。两边都预设入组分母稳定,但前者以专科结局决定疗效,后者以识别路径决定可信度;若两边都成立,就必须承认还有“未被纳入的患者”这一第三对象(第381号第12条)。

本块第9条“项目化评价把单次考试降为证据网络中的一个节点”可与第117号第6条医疗器械与诊断技术对撞。它们共享“分辨率越高越接近真实”的预设,却在误报与过度治疗方向上相反;矛盾迫使我们把临床决策增益而非技术准确率设为共同量纲(第381号第15条)。

本块第14条“纵向整合见习把病例连续性变成学习资源”可与第474号第4条残障研究对撞。两边都关心功能,但专科常把功能当次要终点,残障研究把参与和自主作为主结局;若二者都成立,患者目标必须成为独立于疾病控制的第三条结算线(第381号第18条)。

本块第20条「患者作为教育者」可与第290号第8条法医学对撞。两边共享“记录存在即可核对”,却分别面向照护与责任追溯;若记录格式完整但事件仍不可复算,就说明证据链的关键对象是互动过程而非文档本身(第381号第1条)。

◎ 十条可做的研究命题

1. 命题:胜任力本位教育把培训从年限改成能力证据的净获益在真实门诊中低于注册试验。做法:前瞻登记全部合格者及未入组原因(第381号第13条)。证伪:校准后绝对获益与试验相同(第381号第14条)。

2. 命题:可委托专业活动把能力翻译成“我敢不敢让你独立做”改变诊断标签多于改变治疗。做法:盲法记录检测前后决策(第381号第16条)。证伪:决策改变率与新增标签率相当(第381号第17条)。

3. 命题:刻意练习把专家成长从天赋改成反馈密度的患者报告与生物标志物冲突具有稳定模式。做法:构建纵向双结局队列(第381号第19条)。证伪:冲突方向随机且不可复现(第381号第20条)。

4. 命题:跨专业教育把协作能力从口号变成共同任务只在具备高强度支持性照护的中心有效。做法:按中心能力分层比较(第381号第2条)。证伪:效应不随能力梯度变化(第381号第3条)。

5. 命题:项目化评价把单次考试降为证据网络中的一个节点的新增检出包含可避免的过度诊断。做法:用长期临床结局回标(第381号第5条)。证伪:新增病例均发生可预测进展(第381号第6条)。

6. 命题:专业身份形成把“像医生”从隐性模仿变成可反思过程的短期指标不能充分替代功能结局。做法:建立替代终点验证(第381号第8条)。证伪:跨试验相关与个体相关均达到预设阈值(第381号第9条)。

7. 命题:学习环境研究把倦怠从个人韧性缺陷改写为教育系统结果在弱势人群中的可及性差距大于疗效差距。做法:分解就诊、支付和完成率(第381号第11条)。证伪:各阶段差值均接近零(第381号第12条)。

8. 命题:评价语言偏差把性别与族群不平等暴露在叙事反馈中的算法性能在跨机构部署后显著衰减。做法:锁模外部验证。证伪:校准与净获益保持稳定(第381号第15条)。

9. 命题:虚拟临床学习把“在场”拆成沉浸、反馈与真实责任会改变患者选择,从而回写原风险模型。做法:比较部署前后行为与基线风险(第381号第17条)。证伪:选择结构不变。

10. 命题:患者作为教育者把临床故事的所有权带回课程只有在多专科共享同一结局账本时才改善整体照护。做法:集群随机实施共享账本(第381号第20条)。证伪:常规分科记录取得同等结果(第381号第1条)。

◎ 资料核验

  1. Frank等,2010,《Medical Teacher》32:631–637,CBME定义
  2. Carraccio等,2002,《Academic Medicine》77:361–367,胜任力本位框架
  3. AAMC,2026,《医学生与住院医师人工智能能力框架》;中国医学教育协会等,2026,《医学教育人工智能素养与应用能力共识(21项指标)》
  4. Nasca等,2012,《New England Journal of Medicine》366:1051–1056,住院医师教育下一认证系统
  5. Swing等,2013,《Journal of Graduate Medical Education》5:1–9,里程碑发展
  6. ten Cate,2005,《Medical Education》39:1176–1177,可委托专业活动概念
  7. ten Cate与Scheele,2007,《Academic Medicine》82:542–547,胜任力到实践的桥梁
  8. McGaghie等,2011,《Medical Education》45:50–63,模拟精熟学习综述
  9. Cook等,2011,《JAMA》306:978–988,技术增强模拟荟萃
  10. McGaghie等,2010,《Academic Medicine》85:706–711,刻意练习与医学模拟
  11. Ericsson,2004,《Academic Medicine》79:S70–S81,专家表现与刻意练习
  12. Norcini等,2003,《Medical Education》37:364–371,mini-CEX效度研究
  13. Pelgrim等,2011,《Medical Teacher》33:893–902,工作场所评价系统综述
  14. Reeves等,2013,《Cochrane Database of Systematic Reviews》CD002213,跨专业教育综述
  15. WHO,2010,《Framework for Action on Interprofessional Education and Collaborative Practice》
  16. Weiss等,2014,《Journal of Graduate Medical Education》6:396–398,CLER项目
  17. Wong等,2010,《Medical Education》44:1204–1213,患者安全课程综述
  18. van der Vleuten等,2012,《Medical Teacher》34:205–214,项目化评价模型
  19. Schuwirth与van der Vleuten,2011,《Medical Education》45:478–485,评价效用演进
  20. ten Cate等,2016,《Academic Medicine》91:191–198,委托决定框架
  21. Hauer等,2014,《Academic Medicine》89:1468–1474,监督者委托因素研究
  22. Cruess等,2014,《Academic Medicine》89:1446–1451,专业身份形成框架
  23. Jarvis-Selinger等,2012,《Academic Medicine》87:1185–1190,身份形成综述
  24. Deiorio等,2016,《Medical Teacher》38:1146–1150,医学教育教练定义
  25. Wolff等,2020,《Medical Education》54:559–570,教练系统综述
  26. Shanafelt等,2015,《Mayo Clinic Proceedings》90:1600–1613,医师倦怠全国调查
  27. Dyrbye等,2019,《Academic Medicine》94:1014–1020,学习环境与医学生倦怠
  28. Hirsh等,2012,《Academic Medicine》87:145–154,纵向整合见习综述
  29. Norris等,2009,《Academic Medicine》84:902–907,纵向整合见习联盟定义
  30. Ross等,2017,《Academic Medicine》92:453–458,医学生评价种族差异
  31. Rojek等,2019,《Journal of General Internal Medicine》34:684–691,住院医师评价性别语言差异
  32. Boelen与Woollard,2011,《Medical Teacher》33:614–619,社会责任框架
  33. Reeve等,2017,《Medical Teacher》39:286–292,社会责任评价研究
  34. Wilcha,2020,《BMC Medical Education》20:456,COVID-19在线医学教育综述
  35. Kyaw等,2019,《Journal of Medical Internet Research》21:e12959,虚拟现实教育系统综述
  36. AAMC,2026,《Artificial Intelligence Competencies Across the Learning Continuum》
  37. 中国医学教育协会等,2026,《医学教育人工智能素养与应用能力共识》
  38. Kung等,2023,《PLOS Digital Health》2:e0000198,ChatGPT与美国执照考试
  39. Sallam,2023,《Healthcare》11:887,ChatGPT医学教育系统综述
  40. Towle等,2010,《Medical Education》44:64–74,患者参与医学教育综述
  41. Dijk等,2020,《Medical Education》54:1125–1136,患者教育者角色研究
  42. Jackson P. et al. Artificial intelligence in medical education—perception among medical students. BMC Medical Education. 2024;24:804. DOI:10.1186/s12909-024-05760-0.
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行八字段碰撞行(位置/单因/预设/量纲/失效/自曝/空栏/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板