SDE Universes·新思想前沿心理健康 · 计算精神医学
新思想前沿 · 心理健康 · 计算精神医学

数字心理健康与计算精神医学

第 559 号 · 近二十年 · 两幕 · 20 个新思想 · 约 21,620 字 · 王德生 亲撰 · 2026 年 8 月

心理健康数字工具最容易把互动频率误写成治疗效果,也最容易在风险最高时暴露无人响应的边界。本面板把机制模型、数字表型、自动干预、临床疗效和危机责任分开。

【第一幕】上一个十年 · 约 2006–2016

第一幕追踪数字心理健康与计算精神医学如何把旧问题变成可执行、可测量的对象;判断标准始终是数字心理健康的决定性机制是把可解释的个体状态估计接到有证据的干预与人工升级,而不是下载量、对话轮次或预测准确率增加。

甲、RDoC研究领域标准Research Domain Criteria

提出Insel et al., American Journal of Psychiatry 167, 748–751 (2010), doi:10.1176/appi.ajp.2010.09091379 争议Insel et al., Research Domain Criteria: Toward a New Classification Framework, American Journal of Psychiatry 167, 748–751 (2010).。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键用行为神经回路和功能维度重组研究

Insel et al., American Journal of Psychiatry 167, 748–751 (2010), doi:10.1176/appi.ajp.2010.09091379确立RDoC研究领域标准的历史节点。2026年把用行为神经回路和功能维度重组研究、RDoC研究领域标准的批次、平台、最差亚组与现场漂移、实现栈与旧基线同时入账。

RDoC研究领域标准只锁定一个原因:用行为神经回路和功能维度重组研究。〔对象清单〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,RDoC研究领域标准的批次、平台、最差亚组与现场漂移不得由峰值代偿。RDoC研究领域标准的外部复现误差率以95%区间裁决。〔〔〔对象清单〕对象清单〕对象清单〕对RDoC研究领域标准Research Domain Criteria而言,真正需要登记的不是又一个平均分,而是由“决定本项计算精神医学结果能否成立的只有用行为神经回路和功能维度重组研究”推出的每一步中介、责任人和可撤回条件,〔对象清单〕缺少任何一环,都不能把相关性写成机制。

提出卷页由Insel et al., American Journal of Psychiatry 167, 748–751 (2010), doi:10.1176/appi.ajp.2010.09091379锁定,反方命题是“跨诊断维度能否改善机制研究而不抹去临床叙事”,截至2025年的延续为“RDoC矩阵扩展发展和环境维度”。RDoC研究领域标准复算给3套配置、95%区间、5%尾部和run ID,RDoC研究领域标准的批次、平台、最差亚组与现场漂移失败样本不清洗。

RDoC研究领域标准的硬边界是研究框架不是诊断系统,量表与神经指标若脱离生活痛苦会产生新的还原主义。2026年把RDoC研究领域标准的批次、平台、最差亚组与现场漂移推至规格外;RDoC研究领域标准覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽,平均基准不能冲销反号结果。〔对象清单〕落到复现实务,可为RDoC研究领域标准Research Domain Criteria建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“用行为神经回路和功能维度重组研究”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。

〔对象清单〕工程验收以“用行为神经回路和功能维度重组研究”为主读数,连续24h记录RDoC研究领域标准的外部复现误差率、版本、人工接管与恢复。RDoC研究领域标准的批次、平台、最差亚组与现场漂移未测即保留“尚缺RDoC研究领域标准在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。

RDoC研究领域标准跨域登记为数字生物标志物与可穿戴健康称“mPower帕金森手机研究mPower”;见第558号第一条“mPower帕金森手机研究mPower”。〔对象清单〕它共享〔01 谁进入分母〕跨诊断维度能否改善机制研究而不抹去临床叙事,2026年送往第二平台时,RDoC研究领域标准的批次、平台、最差亚组与现场漂移的对象、量纲与停止阈值均不得改名。〔对象清单〕本条的边界案例应从“尚缺RDoC研究领域标准在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:研究框架不是诊断系统,量表与神经指标若脱离生活痛苦会产生新的还原主义,RDoC研究领域标准覆盖样本越多,最差亚组的”究竟是偶发噪声,还是足以改变结论方向的系统反例。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有用行为神经回路和功能维度重组研究 预设〔01 谁进入分母〕跨诊断维度能否改善机制研究而不抹去临床叙事 量纲以“用行为神经回路和功能维度重组研究”为主读数,并列样本、误差、周期和对照/RDoC研究领域标准Research Domain Criteria全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:研究框架不是诊断系统,量表与神经指标若脱离生活痛苦会产生新的还原主义;RDoC研究领域标准覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽 自曝对象清单独立核验:RDoC研究领域标准的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在对象清单 空栏尚缺RDoC研究领域标准在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“mPower帕金森手机研究mPower”;见第558号第一条“mPower帕金森手机研究mPower”

乙、计算精神病学议程Computational Psychiatry

提出Montague et al., Trends in Cognitive Sciences 16, 72–80 (2012), doi:10.1016/j.tics.2011.11.018 争议Montague et al., Computational psychiatry, Trends in Cognitive Sciences 16, 72–80 (2012).。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键用形式模型连接行为计算与神经过程

计算精神病学议程由Montague et al., Trends in Cognitive Sciences 16, 72–80 (2012), doi:10.1016/j.tics.2011.11.018固定为历史节点,新意是议程提出以学习、决策和社会互动模型解释症状异质性,并为个体化干预提供参数。2026年重读时把用形式模型连接行为计算与神经过程、计算精神病学议程的批次、平台、最差亚组与现场漂移和实现栈并列,避免把单次纪录误作系统能力。

可消融的唯一单因是用形式模型连接行为计算与神经过程:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。计算精神病学议程的外部复现误差率以95%区间登记。

Montague et al., Trends in Cognitive Sciences 16, 72–80 (2012), doi:10.1016/j.tics.2011.11.018给出起点,争议由“模型参数能否对应可重复的心理机制”承担,最新状态是“生成模型和规范模型进入跨诊断研究”。证据表列3组计算精神病学议程的批次、平台、最差亚组与现场漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔事件时间轴〕机构采用计算精神病学议程Computational Psychiatry之前还应公布否决门槛:一旦“⇄系统核算后方向反转:不同模型可同样拟合行为,参数可辨识和任务重测信度不足会让机制标签虚假精确,计算精神病学议程分辨率越高,捕获效率和跨”出现,就暂停扩张并回到“用形式模型连接行为计算与神经过程”的原始记录复核,该门槛必须早于部署决定写入方案。

边界判据写作不同模型可同样拟合行为,参数可辨识和任务重测信度不足会让机制标签虚假精确。当2026年测试越过计算精神病学议程的批次、平台、最差亚组与现场漂移,计算精神病学议程分辨率越高,捕获效率和跨批一致性反而可能越低;方向翻转须先于均值进入结论。

“用形式模型连接行为计算与神经过程”承担验收读数,另开计算精神病学议程的批次、平台、最差亚组与现场漂移账。系统跑满24h后保留计算精神病学议程的外部复现误差率、版本、维修与中止原因;〔事件时间轴〕余下5%失败及“尚缺计算精神病学议程在独立场景的长周期阴性结果”仍入正文。〔事件时间轴〕把计算精神病学议程Computational Psychiatry与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“用形式模型连接行为计算与神经过程”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。

计算精神病学议程的异名接口采用数字生物标志物与可穿戴健康称“智能手机数字表型Digital Phenotyping”;见第558号第二条“智能手机数字表型Digital Phenotyping”。共同预设是〔01 谁进入分母〕模型参数能否对应可重复的心理机制;第二团队在2026年重放原始记录时,不得以同向代理替换计算精神病学议程的批次、平台、最差亚组与现场漂移。

位置D——把模型、工具、实现、验证与部署串成闭环 单因决定本项计算精神医学结果能否成立的只有用形式模型连接行为计算与神经过程 预设〔01 谁进入分母〕模型参数能否对应可重复的心理机制 量纲以“用形式模型连接行为计算与神经过程”为主读数,并列样本、误差、周期和对照/计算精神病学议程Computational Psychiatry全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:不同模型可同样拟合行为,参数可辨识和任务重测信度不足会让机制标签虚假精确;计算精神病学议程分辨率越高,捕获效率和跨批一致性反而可能越低 自曝事件时间轴独立核验:计算精神病学议程的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在事件时间轴 空栏尚缺计算精神病学议程在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“智能手机数字表型Digital Phenotyping”;见第558号第二条“智能手机数字表型Digital Phenotyping”

丙、手机抑郁行为信号Mobile Sensing for Depression

提出Saeb et al., Journal of Medical Internet Research 17, e175 (2015), doi:10.2196/jmir.4273 争议Insel et al., Research Domain Criteria: Toward a New Classification Framework, American Journal of Psychiatry 167, 748–751 (2010).。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键用被动手机传感关联症状严重度

在Saeb et al., Journal of Medical Internet Research 17, e175 (2015), doi:10.2196/jmir.4273之前,手机抑郁行为信号缺少把局部优化变成系统判断的支点;节点价值在于小样本研究发现活动范围和地点规律等特征与抑郁量表相关,展示无负担测量可能。2026年评价用被动手机传感关联症状严重度时,同时冻结手机抑郁行为信号的批次、平台、最差亚组与现场漂移和对照。

因果账只许留下用被动手机传感关联症状严重度这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;手机抑郁行为信号的批次、平台、最差亚组与现场漂移只界定失效域。手机抑郁行为信号的外部复现误差率报告95%区间。

来源链依次是Saeb et al., Journal of Medical Internet Research 17, e175 (2015), doi:10.2196/jmir.4273、“位置和手机使用能否区分抑郁与社会经济情境”和“数字表型研究转向预注册和跨队列验证”。原始表公开3档配置、95%区间、5%失败谱及run ID;手机抑郁行为信号的批次、平台、最差亚组与现场漂移导致的中止按失败计入分母。

样本很小且相关受工作、住区和设备影响,不能从位置轨迹诊断个体构成手机抑郁行为信号的停止线。到2026年,手机抑郁行为信号的批次、平台、最差亚组与现场漂移一旦主导,手机抑郁行为信号模型越复杂,外部复现后的净增益反而越不稳定,峰值读数便不能代表净效用。〔装置边界〕面向下一轮材料,数字心理健康与计算精神医学应优先补齐“尚缺手机抑郁行为信号在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:样本很小且相关受工作、住区和设备影响,不能从位置轨迹诊断个体,手机抑郁行为信号模型越复杂,外部复现后的净增益反而越”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

部署账把“用被动手机传感关联症状严重度”设为主量纲,每24h记录手机抑郁行为信号的外部复现误差率、版本、漂移与恢复。手机抑郁行为信号的批次、平台、最差亚组与现场漂移无数据就写“尚缺手机抑郁行为信号在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。

与相邻领域的精确链接是数字生物标志物与可穿戴健康称“可穿戴癫痫监测器Wearable Seizure Monitor”;见第558号第三条“可穿戴癫痫监测器Wearable Seizure Monitor”。双方共享〔01 谁进入分母〕位置和手机使用能否区分抑郁与社会经济情境;2026年跨平台转移时,手机抑郁行为信号的批次、平台、最差亚组与现场漂移仍用同一单位、版本与失败阈值。〔装置边界〕在数字心理健康与计算精神医学的这一对象上,复核应把“以“用被动手机传感关联症状严重度”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺手机抑郁行为信号在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。

位置E——把批次、漂移、现场负载与维护纳入环境 单因决定本项计算精神医学结果能否成立的只有用被动手机传感关联症状严重度 预设〔01 谁进入分母〕位置和手机使用能否区分抑郁与社会经济情境 量纲以“用被动手机传感关联症状严重度”为主读数,并列样本、误差、周期和对照/手机抑郁行为信号Mobile Sensing for Depression全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:样本很小且相关受工作、住区和设备影响,不能从位置轨迹诊断个体;手机抑郁行为信号模型越复杂,外部复现后的净增益反而越不稳定 自曝装置边界独立核验:手机抑郁行为信号的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在装置边界 空栏尚缺手机抑郁行为信号在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“可穿戴癫痫监测器Wearable Seizure Monitor”;见第558号第三条“可穿戴癫痫监测器Wearable Seizure Monitor”

丁、计算模型连接症状与回路Models as a Bridge

提出Huys, Maia & Frank, Nature Neuroscience 19, 404–413 (2016), doi:10.1038/nn.4238 争议Huys, Maia & Frank, Computational psychiatry as a bridge, Nature Neuroscience 19, 404–413 (2016).。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键用机制参数连接行为、神经和症状

Huys, Maia & Frank, Nature Neuroscience 19, 404–413 (2016), doi:10.1038/nn.4238使计算模型连接症状与回路从局部演示转为可审计命题,核心观察是综述把计算精神病学定义为规范、机制和数据驱动模型的桥梁,强调可检验预测。2026年证据包把用机制参数连接行为、神经和症状与计算模型连接症状与回路的批次、平台、最差亚组与现场漂移分别编号,并保留旧方法对照。〔样本分层〕对计算模型连接症状与回路Models as a Bridge而言,真正需要登记的不是又一个平均分,而是由“决定本项计算精神医学结果能否成立的只有用机制参数连接行为、神经和症状”推出的每一步中介、责任人和可撤回条件,〔样本分层〕缺少任何一环,都不能把相关性写成机制。

这里拒绝多因叙述,决定结果能否成立的只有用机制参数连接行为、神经和症状。〔样本分层〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。计算模型连接症状与回路的外部复现误差率须给95%区间。

提出证据见Huys, Maia & Frank, Nature Neuroscience 19, 404–413 (2016), doi:10.1038/nn.4238,最强争议是“任务模型能否跨场景保留临床区分度”,延续状态为“层次贝叶斯和纵向任务试图提高可靠性”。计算模型连接症状与回路交付3批计算模型连接症状与回路的批次、平台、最差亚组与现场漂移数据、95%区间、5%尾部和run ID,异常逐例保留。

计算模型连接症状与回路不能越过实验任务的短暂策略不一定代表日常功能,漂亮模型也可能缺乏治疗可行动性。2026年把计算模型连接症状与回路的批次、平台、最差亚组与现场漂移扫过全量程时,计算模型连接症状与回路应用范围越广,版本漂移和未记录失败反而越多;方向一旦翻转,平均性能再高也不抵销。

验收表首先读取“用机制参数连接行为、神经和症状”,随后核对计算模型连接症状与回路的批次、平台、最差亚组与现场漂移。持续24h日志含计算模型连接症状与回路的外部复现误差率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺计算模型连接症状与回路在独立场景的长周期阴性结果”。〔样本分层〕证据链还要把Huys, Maia & Frank, Nature Neuroscience 19, 404–的起点材料与更新文献放在同一比较表里,并逐项报告“用机制参数连接行为、神经和症状”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

跨域异名为数字生物标志物与可穿戴健康称“连续血糖与个体糖型Continuous Glucose Phenotypes”;见第558号第四条“连续血糖与个体糖型Continuous Glucose Phenotypes”,不是宽泛类比。它检验〔02 单一读数代表复杂对象〕任务模型能否跨场景保留临床区分度;2026年由独立团队复跑原始记录时,计算模型连接症状与回路的批次、平台、最差亚组与现场漂移的单位、阈值和停止规则保持不变。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有用机制参数连接行为、神经和症状 预设〔02 单一读数代表复杂对象〕任务模型能否跨场景保留临床区分度 量纲以“用机制参数连接行为、神经和症状”为主读数,并列样本、误差、周期和对照/计算模型连接症状与回路Models as a Bridge全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:实验任务的短暂策略不一定代表日常功能,漂亮模型也可能缺乏治疗可行动性;计算模型连接症状与回路应用范围越广,版本漂移和未记录失败反而越多 自曝样本分层独立核验:计算模型连接症状与回路的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在样本分层 空栏尚缺计算模型连接症状与回路在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“连续血糖与个体糖型Continuous Glucose Phenotypes”;见第558号第四条“连续血糖与个体糖型Continuous Glucose Phenotypes”

戊、Woebot认知行为聊天机器人Woebot

提出Fitzpatrick et al., JMIR Mental Health 4, e19 (2017), doi:10.2196/mental.7785 争议NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022。 最新(2025年文献)988 Lifeline and digital mental health safety protocols, 2022–2025。 关键用自动对话递送认知行为技巧

Fitzpatrick et al., JMIR Mental Health 4, e19 (2017), doi:10.2196/mental.7785确立Woebot认知行为聊天机器人的历史节点。2026年把用自动对话递送认知行为技巧、Woebot跨场景漂移、实现栈与旧基线同时入账。

Woebot认知行为聊天机器人只锁定一个原因:用自动对话递送认知行为技巧。〔版本登记〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,Woebot跨场景漂移不得由峰值代偿。Woebot认知行为聊天机器人的外部复现误差率以95%区间裁决。〔版本登记〕机构采用Woebot认知行为聊天机器人Woebot之前还应公布否决门槛:一旦“⇄系统核算后方向反转:样本年轻、自选、周期短且无盲法,互动新奇感和期待效应难分离,Woebot认知行为聊天机器人覆盖样本越多,最差亚组的”出现,就暂停扩张并回到“用自动对话递送认知行为技巧”的原始记录复核,该门槛必须早于部署决定写入方案。

提出卷页由Fitzpatrick et al., JMIR Mental Health 4, e19 (2017), doi:10.2196/mental.7785锁定,反方命题是“两周自报改善能否代表持续临床疗效”,截至2025年的延续为“心理聊天机器人数量增长并转向更严格比较”。Woebot认知行为聊天机器人复算给3套配置、95%区间、5%尾部和run ID,Woebot跨场景漂移失败样本不清洗。

Woebot认知行为聊天机器人的硬边界是样本年轻、自选、周期短且无盲法,互动新奇感和期待效应难分离。2026年把Woebot跨场景漂移推至规格外;Woebot认知行为聊天机器人覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽,平均基准不能冲销反号结果。〔版本登记〕把Woebot认知行为聊天机器人Woebot与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“用自动对话递送认知行为技巧”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。

〔版本登记〕工程验收以“用自动对话递送认知行为技巧”为主读数,连续24h记录Woebot认知行为聊天机器人的外部复现误差率、版本、人工接管与恢复。Woebot跨场景漂移未测即保留“尚缺Woebot认知行为聊天机器人在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。

Woebot认知行为聊天机器人跨域登记为数字生物标志物与可穿戴健康称“Apple Heart StudyApple Heart Study”;见第558号第五条“Apple Heart StudyApple Heart Study”。〔版本登记〕它共享〔02 单一读数代表复杂对象〕两周自报改善能否代表持续临床疗效,2026年送往第二平台时,Woebot跨场景漂移的对象、量纲与停止阈值均不得改名。〔版本登记〕本条的边界案例应从“尚缺Woebot认知行为聊天机器人在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:样本年轻、自选、周期短且无盲法,互动新奇感和期待效应难分离,Woebot认知行为聊天机器人覆盖样本越多,最差亚组的”究竟是偶发噪声,还是足以改变结论方向的系统反例。

位置D——把模型、工具、实现、验证与部署串成闭环 单因决定本项计算精神医学结果能否成立的只有用自动对话递送认知行为技巧 预设〔02 单一读数代表复杂对象〕两周自报改善能否代表持续临床疗效 量纲以“用自动对话递送认知行为技巧”为主读数,并列样本、误差、周期和对照/Woebot认知行为聊天机器人Woebot全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:样本年轻、自选、周期短且无盲法,互动新奇感和期待效应难分离;Woebot认知行为聊天机器人覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽 自曝版本登记独立核验:Woebot认知行为聊天机器人的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在版本登记 空栏尚缺Woebot认知行为聊天机器人在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“Apple Heart StudyApple Heart Study”;见第558号第五条“Apple Heart StudyApple Heart Study”

己、处方数字疗法reSETreSET

提出US FDA authorization of reSET for substance use disorder (2017) 争议Saeb et al., Journal of Medical Internet Research 17, e175 (2015), doi:10.2196/jmir.4273。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键把认知行为课程和临床管理结合

处方数字疗法reSET由US FDA authorization of reSET for substance use disorder (2017)固定为历史节点,新意是reSET成为较早获FDA许可的处方数字疗法,要求在临床管理框架中使用。2026年重读时把把认知行为课程和临床管理结合、处方数字疗法reSET的批次、平台、最差亚组与现场漂移和实现栈并列,避免把单次纪录误作系统能力。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项计算精神医学结果能否成立的只有把认知行为课程和临床管理结合”的操作定义,仍能复算“以“把认知行为课程和临床管理结合”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。

可消融的唯一单因是把认知行为课程和临床管理结合:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。处方数字疗法reSET的外部复现误差率以95%区间登记。

US FDA authorization of reSET for substance use disorder (2017)给出起点,争议由“软件获批能否保证患者持续使用和支付可行”承担,最新状态是“处方数字疗法经历扩张、报销困难与企业退出”。证据表列3组处方数字疗法reSET的批次、平台、最差亚组与现场漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔失败谱〕面向下一轮材料,数字心理健康与计算精神医学应优先补齐“尚缺处方数字疗法reSET在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:许可基于特定试验和版本,真实世界依从、共病和服务可及性决定净效用,处方数字疗法reSET分辨率越高,捕获效率和跨批”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

边界判据写作许可基于特定试验和版本,真实世界依从、共病和服务可及性决定净效用。当2026年测试越过处方数字疗法reSET的批次、平台、最差亚组与现场漂移,处方数字疗法reSET分辨率越高,捕获效率和跨批一致性反而可能越低;方向翻转须先于均值进入结论。

“把认知行为课程和临床管理结合”承担验收读数,另开处方数字疗法reSET的批次、平台、最差亚组与现场漂移账。系统跑满24h后保留处方数字疗法reSET的外部复现误差率、版本、维修与中止原因;〔失败谱〕余下5%失败及“尚缺处方数字疗法reSET在独立场景的长周期阴性结果”仍入正文。

处方数字疗法reSET的异名接口采用数字生物标志物与可穿戴健康称“可穿戴新冠前症状信号Wearables for Presymptomatic COVID-19”;见第558号第六条“可穿戴新冠前症状信号Wearables for Presymptomatic COVID-19”。共同预设是〔02 单一读数代表复杂对象〕软件获批能否保证患者持续使用和支付可行;第二团队在2026年重放原始记录时,不得以同向代理替换处方数字疗法reSET的批次、平台、最差亚组与现场漂移。

位置E——把批次、漂移、现场负载与维护纳入环境 单因决定本项计算精神医学结果能否成立的只有把认知行为课程和临床管理结合 预设〔02 单一读数代表复杂对象〕软件获批能否保证患者持续使用和支付可行 量纲以“把认知行为课程和临床管理结合”为主读数,并列样本、误差、周期和对照/处方数字疗法reSETreSET全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:许可基于特定试验和版本,真实世界依从、共病和服务可及性决定净效用;处方数字疗法reSET分辨率越高,捕获效率和跨批一致性反而可能越低 自曝失败谱独立核验:处方数字疗法reSET的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在失败谱 空栏尚缺处方数字疗法reSET在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“可穿戴新冠前症状信号Wearables for Presymptomatic COVID-19”;见第558号第六条“可穿戴新冠前症状信号Wearables for Presymptomatic COVID-19”

庚、自动化虚拟现实精神病治疗Automated VR Therapy

提出Freeman et al., Lancet Psychiatry 5, 625–632 (2018), doi:10.1016/S2215-0366(18)30155-8 争议US FTC, BetterHelp prohibited from sharing health data for advertising (2023)。 最新(2024年文献)Regulatory and health-system safety proposals, 2024–2026。 关键用分级虚拟暴露和自动教练训练安全学习

在Freeman et al., Lancet Psychiatry 5, 625–632 (2018), doi:10.1016/S2215-0366(18)30155-8之前,自动化虚拟现实精神病治疗缺少把局部优化变成系统判断的支点;节点价值在于随机试验显示自动VR可减少精神病患者对现实场景的回避与痛苦。2026年评价用分级虚拟暴露和自动教练训练安全学习时,同时冻结自动化虚拟现实精神病治疗的批次、平台、最差亚组与现场漂移和对照。

因果账只许留下用分级虚拟暴露和自动教练训练安全学习这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;自动化虚拟现实精神病治疗的批次、平台、最差亚组与现场漂移只界定失效域。自动化虚拟现实精神病治疗的外部复现误差率报告95%区间。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:头显可及、晕动、治疗师支持和现实风险不同,虚拟完成不等于长期社区参与,自动化虚拟现实精神病治疗模型越复杂,外部复现”做至少两轮外部复算,若方向翻转,自动化虚拟现实精神病治疗Automated VR Therapy的结论必须随之收窄。

来源链依次是Freeman et al., Lancet Psychiatry 5, 625–632 (2018), doi:10.1016/S2215-0366(18)30155-8、“虚拟场景内恐惧下降能否迁移到日常社会功能”和“自动VR扩展到恐高、焦虑和精神病性症状”。原始表公开3档配置、95%区间、5%失败谱及run ID;自动化虚拟现实精神病治疗的批次、平台、最差亚组与现场漂移导致的中止按失败计入分母。

头显可及、晕动、治疗师支持和现实风险不同,虚拟完成不等于长期社区参与构成自动化虚拟现实精神病治疗的停止线。到2026年,自动化虚拟现实精神病治疗的批次、平台、最差亚组与现场漂移一旦主导,自动化虚拟现实精神病治疗模型越复杂,外部复现后的净增益反而越不稳定,峰值读数便不能代表净效用。〔机构接口〕证据链还要把Freeman et al., Lancet Psychiatry 5, 625–632 (20的起点材料与更新文献放在同一比较表里,并逐项报告“用分级虚拟暴露和自动教练训练安全学习”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

部署账把“用分级虚拟暴露和自动教练训练安全学习”设为主量纲,每24h记录自动化虚拟现实精神病治疗的外部复现误差率、版本、漂移与恢复。自动化虚拟现实精神病治疗的批次、平台、最差亚组与现场漂移无数据就写“尚缺自动化虚拟现实精神病治疗在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。

与相邻领域的精确链接是数字生物标志物与可穿戴健康称“V3验证框架V3 Framework”;见第558号第七条“V3验证框架V3 Framework”。双方共享〔04 测量不改变被测对象〕虚拟场景内恐惧下降能否迁移到日常社会功能;2026年跨平台转移时,自动化虚拟现实精神病治疗的批次、平台、最差亚组与现场漂移仍用同一单位、版本与失败阈值。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有用分级虚拟暴露和自动教练训练安全学习 预设〔04 测量不改变被测对象〕虚拟场景内恐惧下降能否迁移到日常社会功能 量纲以“用分级虚拟暴露和自动教练训练安全学习”为主读数,并列样本、误差、周期和对照/自动化虚拟现实精神病治疗Automated VR Therapy全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:头显可及、晕动、治疗师支持和现实风险不同,虚拟完成不等于长期社区参与;自动化虚拟现实精神病治疗模型越复杂,外部复现后的净增益反而越不稳定 自曝机构接口独立核验:自动化虚拟现实精神病治疗的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在机构接口 空栏尚缺自动化虚拟现实精神病治疗在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“V3验证框架V3 Framework”;见第558号第七条“V3验证框架V3 Framework”

辛、即时自适应干预Just-in-Time Adaptive Interventions

提出Nahum-Shani et al., Annals of Behavioral Medicine 52, 446–462 (2018), doi:10.1007/s12160-016-9830-8 争议US FTC, BetterHelp prohibited from sharing health data for advertising (2023)。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键按实时状态决定是否何时给何种支持

Nahum-Shani et al., Annals of Behavioral Medicine 52, 446–462 (2018), doi:10.1007/s12160-016-9830-8使即时自适应干预从局部演示转为可审计命题,核心观察是JITAI框架明确决策点、干预选项、脆弱和可接受状态及近端结果,使适应逻辑可检验。2026年证据包把按实时状态决定是否何时给何种支持与即时自适应干预的批次、平台、最差亚组与现场漂移分别编号,并保留旧方法对照。

这里拒绝多因叙述,决定结果能否成立的只有按实时状态决定是否何时给何种支持。〔资源预算〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。即时自适应干预的外部复现误差率须给95%区间。

提出证据见Nahum-Shani et al., Annals of Behavioral Medicine 52, 446–462 (2018), doi:10.1007/s12160-016-9830-8,最强争议是“此刻预测的脆弱状态能否可靠决定推送时机”,延续状态为“微随机试验用于估计不同情境的近端效应”。即时自适应干预交付3批即时自适应干预的批次、平台、最差亚组与现场漂移数据、95%区间、5%尾部和run ID,异常逐例保留。〔资源预算〕落到复现实务,可为即时自适应干预Just-in-Time Adaptive Interventions建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“按实时状态决定是否何时给何种支持”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。

即时自适应干预不能越过频繁提示会疲劳且状态估计出错,短期响应可能损害自主和长期习惯。2026年把即时自适应干预的批次、平台、最差亚组与现场漂移扫过全量程时,即时自适应干预应用范围越广,版本漂移和未记录失败反而越多;方向一旦翻转,平均性能再高也不抵销。

验收表首先读取“按实时状态决定是否何时给何种支持”,随后核对即时自适应干预的批次、平台、最差亚组与现场漂移。持续24h日志含即时自适应干预的外部复现误差率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺即时自适应干预在独立场景的长周期阴性结果”。〔资源预算〕本条的边界案例应从“尚缺即时自适应干预在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:频繁提示会疲劳且状态估计出错,短期响应可能损害自主和长期习惯,即时自适应干预应用范围越广,版本漂移和未记录失败反而”究竟是偶发噪声,还是足以改变结论方向的系统反例。

跨域异名为数字生物标志物与可穿戴健康称“肤色与光学传感偏差Optical Sensor Skin-Tone Bias”;见第558号第八条“肤色与光学传感偏差Optical Sensor Skin-Tone Bias”,不是宽泛类比。它检验〔04 测量不改变被测对象〕此刻预测的脆弱状态能否可靠决定推送时机;2026年由独立团队复跑原始记录时,即时自适应干预的批次、平台、最差亚组与现场漂移的单位、阈值和停止规则保持不变。

位置D——把模型、工具、实现、验证与部署串成闭环 单因决定本项计算精神医学结果能否成立的只有按实时状态决定是否何时给何种支持 预设〔04 测量不改变被测对象〕此刻预测的脆弱状态能否可靠决定推送时机 量纲以“按实时状态决定是否何时给何种支持”为主读数,并列样本、误差、周期和对照/即时自适应干预Just-in-Time Adaptive Interventions全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:频繁提示会疲劳且状态估计出错,短期响应可能损害自主和长期习惯;即时自适应干预应用范围越广,版本漂移和未记录失败反而越多 自曝资源预算独立核验:即时自适应干预的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在资源预算 空栏尚缺即时自适应干预在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“肤色与光学传感偏差Optical Sensor Skin-Tone Bias”;见第558号第八条“肤色与光学传感偏差Optical Sensor Skin-Tone Bias”
【第二幕】这十年 · 约 2016–2026

第二幕转向规模、闭环与责任。最新纪录只有在失败和资源进入分母后,才足以支持“数字心理健康的决定性机制是把可解释的个体状态估计接到有证据的干预与人工升级,而不是下载量、对话轮次或预测准确率增加”。

一、数字CBT失眠长期试验Digital CBT for Insomnia

提出Espie et al., Lancet Psychiatry 6, 281–289 (2019), doi:10.1016/S2215-0366(18)30472-6 争议Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021)。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键以结构化数字课程递送失眠认知行为治疗

Espie et al., Lancet Psychiatry 6, 281–289 (2019), doi:10.1016/S2215-0366(18)30472-6确立数字CBT失眠长期试验的历史节点。2026年把以结构化数字课程递送失眠认知行为治疗、数字CBT失眠长期试验的批次、平台、最差亚组与现场漂移、实现栈与旧基线同时入账。

数字CBT失眠长期试验只锁定一个原因:以结构化数字课程递送失眠认知行为治疗。〔外部复算〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,数字CBT失眠长期试验的批次、平台、最差亚组与现场漂移不得由峰值代偿。数字CBT失眠长期试验的外部复现误差率以95%区间裁决。

提出卷页由Espie et al., Lancet Psychiatry 6, 281–289 (2019), doi:10.1016/S2215-0366(18)30472-6锁定,反方命题是“睡眠改善能否进一步改善功能与心理健康”,截至2025年的延续为“全自动CBT-I进入卫生系统与长期随访”。数字CBT失眠长期试验复算给3套配置、95%区间、5%尾部和run ID,数字CBT失眠长期试验的批次、平台、最差亚组与现场漂移失败样本不清洗。

数字CBT失眠长期试验的硬边界是高流失、自报终点和自选互联网样本会高估普遍效果,严重共病仍需临床评估。2026年把数字CBT失眠长期试验的批次、平台、最差亚组与现场漂移推至规格外;数字CBT失眠长期试验覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽,平均基准不能冲销反号结果。〔外部复算〕把数字CBT失眠长期试验Digital CBT for Insomnia与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“以结构化数字课程递送失眠认知行为治疗”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。

〔外部复算〕工程验收以“以结构化数字课程递送失眠认知行为治疗”为主读数,连续24h记录数字CBT失眠长期试验的外部复现误差率、版本、人工接管与恢复。数字CBT失眠长期试验的批次、平台、最差亚组与现场漂移未测即保留“尚缺数字CBT失眠长期试验在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。

数字CBT失眠长期试验跨域登记为数字生物标志物与可穿戴健康称“无接触睡眠与呼吸监测Contactless Sleep Sensing”;见第558号第九条“无接触睡眠与呼吸监测Contactless Sleep Sensing”。〔外部复算〕它共享〔04 测量不改变被测对象〕睡眠改善能否进一步改善功能与心理健康,2026年送往第二平台时,数字CBT失眠长期试验的批次、平台、最差亚组与现场漂移的对象、量纲与停止阈值均不得改名。〔外部复算〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项计算精神医学结果能否成立的只有以结构化数字课程递送失眠认知行为治疗”的操作定义,仍能复算“以“以结构化数字课程递送失眠认知行为治疗”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。

位置E——把批次、漂移、现场负载与维护纳入环境 单因决定本项计算精神医学结果能否成立的只有以结构化数字课程递送失眠认知行为治疗 预设〔04 测量不改变被测对象〕睡眠改善能否进一步改善功能与心理健康 量纲以“以结构化数字课程递送失眠认知行为治疗”为主读数,并列样本、误差、周期和对照/数字CBT失眠长期试验Digital CBT for Insomnia全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:高流失、自报终点和自选互联网样本会高估普遍效果,严重共病仍需临床评估;数字CBT失眠长期试验覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽 自曝外部复算独立核验:数字CBT失眠长期试验的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在外部复算 空栏尚缺数字CBT失眠长期试验在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“无接触睡眠与呼吸监测Contactless Sleep Sensing”;见第558号第九条“无接触睡眠与呼吸监测Contactless Sleep Sensing”

二、社交媒体自杀风险预测Social-Media Suicide Prediction

提出Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021) 争议US FDA authorization of reSET for substance use disorder (2017)。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键从语言和行为变化估计自伤风险

社交媒体自杀风险预测由Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021)固定为历史节点,新意是计算研究显示社交媒体文本可与自杀意念或心理症状相关,为早期支持提出可能。2026年重读时把从语言和行为变化估计自伤风险、社交媒体自杀风险预测的批次、平台、最差亚组与现场漂移和实现栈并列,避免把单次纪录误作系统能力。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:标签来源、语境和基率使个体误报很高,秘密监测可能伤害信任并触发执法风险,社交媒体自杀风险预测分辨率越高,捕获效率和”做至少两轮外部复算,若方向翻转,社交媒体自杀风险预测Social-Media Suicide Prediction的结论必须随之收窄。

可消融的唯一单因是从语言和行为变化估计自伤风险:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。社交媒体自杀风险预测的外部复现误差率以95%区间登记。

Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021)给出起点,争议由“公开文本风险信号是否授权平台替用户判断和干预”承担,最新状态是“伦理研究强调同意、误报和危机转介”。证据表列3组社交媒体自杀风险预测的批次、平台、最差亚组与现场漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。

边界判据写作标签来源、语境和基率使个体误报很高,秘密监测可能伤害信任并触发执法风险。当2026年测试越过社交媒体自杀风险预测的批次、平台、最差亚组与现场漂移,社交媒体自杀风险预测分辨率越高,捕获效率和跨批一致性反而可能越低;方向翻转须先于均值进入结论。

“从语言和行为变化估计自伤风险”承担验收读数,另开社交媒体自杀风险预测的批次、平台、最差亚组与现场漂移账。系统跑满24h后保留社交媒体自杀风险预测的外部复现误差率、版本、维修与中止原因;〔反号压力〕余下5%失败及“尚缺社交媒体自杀风险预测在独立场景的长周期阴性结果”仍入正文。〔反号压力〕在数字心理健康与计算精神医学的这一对象上,复核应把“以“从语言和行为变化估计自伤风险”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺社交媒体自杀风险预测在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。

社交媒体自杀风险预测的异名接口采用数字生物标志物与可穿戴健康称“Fitbit房颤大规模研究Fitbit Heart Study”;见第558号第十条“Fitbit房颤大规模研究Fitbit Heart Study”。共同预设是〔13 时间尺度可自由压缩〕公开文本风险信号是否授权平台替用户判断和干预;第二团队在2026年重放原始记录时,不得以同向代理替换社交媒体自杀风险预测的批次、平台、最差亚组与现场漂移。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有从语言和行为变化估计自伤风险 预设〔13 时间尺度可自由压缩〕公开文本风险信号是否授权平台替用户判断和干预 量纲以“从语言和行为变化估计自伤风险”为主读数,并列样本、误差、周期和对照/社交媒体自杀风险预测Social-Media Suicide Prediction全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:标签来源、语境和基率使个体误报很高,秘密监测可能伤害信任并触发执法风险;社交媒体自杀风险预测分辨率越高,捕获效率和跨批一致性反而可能越低 自曝反号压力独立核验:社交媒体自杀风险预测的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在反号压力 空栏尚缺社交媒体自杀风险预测在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“Fitbit房颤大规模研究Fitbit Heart Study”;见第558号第十条“Fitbit房颤大规模研究Fitbit Heart Study”

三、数字疗法真实世界崩塌Digital Therapeutics Market Failure

提出Pear Therapeutics bankruptcy filings and product discontinuity (2023) 争议Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021)。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键把企业存续和数据迁移纳入治疗连续性

在Pear Therapeutics bankruptcy filings and product discontinuity (2023)之前,数字疗法真实世界崩塌缺少把局部优化变成系统判断的支点;节点价值在于处方数字疗法先驱破产显示监管许可、临床试验和市场采用之间存在断裂。2026年评价把企业存续和数据迁移纳入治疗连续性时,同时冻结数字疗法真实世界崩塌的批次、平台、最差亚组与现场漂移和对照。

因果账只许留下把企业存续和数据迁移纳入治疗连续性这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;数字疗法真实世界崩塌的批次、平台、最差亚组与现场漂移只界定失效域。数字疗法真实世界崩塌的外部复现误差率报告95%区间。〔责任链〕落到复现实务,可为数字疗法真实世界崩塌Digital Therapeutics Market Failure建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“把企业存续和数据迁移纳入治疗连续性”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。

来源链依次是Pear Therapeutics bankruptcy filings and product discontinuity (2023)、“临床证据能否脱离商业持续性和服务基础设施”和“行业转向支付证据、互操作与退出计划”。原始表公开3档配置、95%区间、5%失败谱及run ID;数字疗法真实世界崩塌的批次、平台、最差亚组与现场漂移导致的中止按失败计入分母。

患者访问、数据与医生工作流随企业退出中断,疗效评价必须包含产品生命周期构成数字疗法真实世界崩塌的停止线。到2026年,数字疗法真实世界崩塌的批次、平台、最差亚组与现场漂移一旦主导,数字疗法真实世界崩塌模型越复杂,外部复现后的净增益反而越不稳定,峰值读数便不能代表净效用。

部署账把“把企业存续和数据迁移纳入治疗连续性”设为主量纲,每24h记录数字疗法真实世界崩塌的外部复现误差率、版本、漂移与恢复。数字疗法真实世界崩塌的批次、平台、最差亚组与现场漂移无数据就写“尚缺数字疗法真实世界崩塌在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。

与相邻领域的精确链接是数字生物标志物与可穿戴健康称“可穿戴步态数字终点Wearable Gait Endpoints”;见第558号第十一条“可穿戴步态数字终点Wearable Gait Endpoints”。双方共享〔13 时间尺度可自由压缩〕临床证据能否脱离商业持续性和服务基础设施;2026年跨平台转移时,数字疗法真实世界崩塌的批次、平台、最差亚组与现场漂移仍用同一单位、版本与失败阈值。〔责任链〕对数字疗法真实世界崩塌Digital Therapeutics Market Failure而言,真正需要登记的不是又一个平均分,而是由“决定本项计算精神医学结果能否成立的只有把企业存续和数据迁移纳入治疗连续性”推出的每一步中介、责任人和可撤回条件,〔责任链〕缺少任何一环,都不能把相关性写成机制。

位置D——把模型、工具、实现、验证与部署串成闭环 单因决定本项计算精神医学结果能否成立的只有把企业存续和数据迁移纳入治疗连续性 预设〔13 时间尺度可自由压缩〕临床证据能否脱离商业持续性和服务基础设施 量纲以“把企业存续和数据迁移纳入治疗连续性”为主读数,并列样本、误差、周期和对照/数字疗法真实世界崩塌Digital Therapeutics Market Failure全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:患者访问、数据与医生工作流随企业退出中断,疗效评价必须包含产品生命周期;数字疗法真实世界崩塌模型越复杂,外部复现后的净增益反而越不稳定 自曝责任链独立核验:数字疗法真实世界崩塌的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在责任链 空栏尚缺数字疗法真实世界崩塌在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“可穿戴步态数字终点Wearable Gait Endpoints”;见第558号第十一条“可穿戴步态数字终点Wearable Gait Endpoints”

四、在线危机干预升级Crisis Escalation in Digital Care

提出988 Lifeline and digital mental health safety protocols, 2022–2025 争议Insel et al., Research Domain Criteria: Toward a New Classification Framework, American Journal of Psychiatry 167, 748–751 (2010).。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键让高风险对话触发人工和紧急支持

988 Lifeline and digital mental health safety protocols, 2022–2025使在线危机干预升级从局部演示转为可审计命题,核心观察是结构化升级协议可把自杀意念、暴力和急性精神病性症状从自助工具移交专业人员。2026年证据包把让高风险对话触发人工和紧急支持与在线危机干预升级的批次、平台、最差亚组与现场漂移分别编号,并保留旧方法对照。〔排除规则〕机构采用在线危机干预升级Crisis Escalation in Digital Care之前还应公布否决门槛:一旦“⇄系统核算后方向反转:地理定位、语言、服务容量和误报决定实际响应,显示热线并不等于完成救助,在线危机干预升级应用范围越广,版本漂移和未记”出现,就暂停扩张并回到“让高风险对话触发人工和紧急支持”的原始记录复核,该门槛必须早于部署决定写入方案。

这里拒绝多因叙述,决定结果能否成立的只有让高风险对话触发人工和紧急支持。〔排除规则〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。在线危机干预升级的外部复现误差率须给95%区间。

提出证据见988 Lifeline and digital mental health safety protocols, 2022–2025,最强争议是“自动风险分类能否在分钟级把人交给合适服务”,延续状态为“平台开始公开危机检测、人工复核与地区资源边界”。在线危机干预升级交付3批在线危机干预升级的批次、平台、最差亚组与现场漂移数据、95%区间、5%尾部和run ID,异常逐例保留。〔排除规则〕把在线危机干预升级Crisis Escalation in Digital Care与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“让高风险对话触发人工和紧急支持”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。

在线危机干预升级不能越过地理定位、语言、服务容量和误报决定实际响应,显示热线并不等于完成救助。2026年把在线危机干预升级的批次、平台、最差亚组与现场漂移扫过全量程时,在线危机干预升级应用范围越广,版本漂移和未记录失败反而越多;方向一旦翻转,平均性能再高也不抵销。

验收表首先读取“让高风险对话触发人工和紧急支持”,随后核对在线危机干预升级的批次、平台、最差亚组与现场漂移。持续24h日志含在线危机干预升级的外部复现误差率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺在线危机干预升级在独立场景的长周期阴性结果”。

跨域异名为数字生物标志物与可穿戴健康称“声音数字生物标志物Voice Biomarkers”;见第558号第十二条“声音数字生物标志物Voice Biomarkers”,不是宽泛类比。它检验〔13 时间尺度可自由压缩〕自动风险分类能否在分钟级把人交给合适服务;2026年由独立团队复跑原始记录时,在线危机干预升级的批次、平台、最差亚组与现场漂移的单位、阈值和停止规则保持不变。

位置E——把批次、漂移、现场负载与维护纳入环境 单因决定本项计算精神医学结果能否成立的只有让高风险对话触发人工和紧急支持 预设〔13 时间尺度可自由压缩〕自动风险分类能否在分钟级把人交给合适服务 量纲以“让高风险对话触发人工和紧急支持”为主读数,并列样本、误差、周期和对照/在线危机干预升级Crisis Escalation in Digital Care全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:地理定位、语言、服务容量和误报决定实际响应,显示热线并不等于完成救助;在线危机干预升级应用范围越广,版本漂移和未记录失败反而越多 自曝排除规则独立核验:在线危机干预升级的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在排除规则 空栏尚缺在线危机干预升级在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“声音数字生物标志物Voice Biomarkers”;见第558号第十二条“声音数字生物标志物Voice Biomarkers”

五、LLM与医生回答比较LLM Empathy Study

提出Ayers et al., JAMA Internal Medicine 183, 589–596 (2023), doi:10.1001/jamainternmed.2023.1838 争议Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021)。 最新(2024年文献)Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)。 关键语言模型生成被评为更完整和富同理心的回答

Ayers et al., JAMA Internal Medicine 183, 589–596 (2023), doi:10.1001/jamainternmed.2023.1838确立LLM与医生回答比较的历史节点。2026年把语言模型生成被评为更完整和富同理心的回答、LLM与医生回答比较的批次、平台、最差亚组与现场漂移、实现栈与旧基线同时入账。

LLM与医生回答比较只锁定一个原因:语言模型生成被评为更完整和富同理心的回答。〔基线冻结〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,LLM与医生回答比较的批次、平台、最差亚组与现场漂移不得由峰值代偿。LLM与医生回答比较的外部复现误差率以95%区间裁决。〔基线冻结〕面向下一轮材料,数字心理健康与计算精神医学应优先补齐“尚缺LLM与医生回答比较在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:医生原回复受平台时间限制,评审看不到行动后果,好听回答仍可能事实错误,LLM与医生回答比较覆盖样本越多,最差亚组的”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

提出卷页由Ayers et al., JAMA Internal Medicine 183, 589–596 (2023), doi:10.1001/jamainternmed.2023.1838锁定,反方命题是“盲评网络回答偏好能否代表临床安全和关系”,截至2025年的延续为“生成式健康对话研究转向真实工作流与伤害审计”。LLM与医生回答比较复算给3套配置、95%区间、5%尾部和run ID,LLM与医生回答比较的批次、平台、最差亚组与现场漂移失败样本不清洗。

LLM与医生回答比较的硬边界是医生原回复受平台时间限制,评审看不到行动后果;好听回答仍可能事实错误。2026年把LLM与医生回答比较的批次、平台、最差亚组与现场漂移推至规格外;LLM与医生回答比较覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽,平均基准不能冲销反号结果。〔基线冻结〕在数字心理健康与计算精神医学的这一对象上,复核应把“以“语言模型生成被评为更完整和富同理心的回答”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺LLM与医生回答比较在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。

〔基线冻结〕工程验收以“语言模型生成被评为更完整和富同理心的回答”为主读数,连续24h记录LLM与医生回答比较的外部复现误差率、版本、人工接管与恢复。LLM与医生回答比较的批次、平台、最差亚组与现场漂移未测即保留“尚缺LLM与医生回答比较在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。

LLM与医生回答比较跨域登记为数字生物标志物与可穿戴健康称“数字测量缺失机制Wearable Missingness”;见第558号第十三条“数字测量缺失机制Wearable Missingness”。〔基线冻结〕它共享〔17 局部最优可加总为整体最优〕盲评网络回答偏好能否代表临床安全和关系,2026年送往第二平台时,LLM与医生回答比较的批次、平台、最差亚组与现场漂移的对象、量纲与停止阈值均不得改名。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有语言模型生成被评为更完整和富同理心的回答 预设〔17 局部最优可加总为整体最优〕盲评网络回答偏好能否代表临床安全和关系 量纲以“语言模型生成被评为更完整和富同理心的回答”为主读数,并列样本、误差、周期和对照/LLM与医生回答比较LLM Empathy Study全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:医生原回复受平台时间限制,评审看不到行动后果;好听回答仍可能事实错误;LLM与医生回答比较覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽 自曝基线冻结独立核验:LLM与医生回答比较的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在基线冻结 空栏尚缺LLM与医生回答比较在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“数字测量缺失机制Wearable Missingness”;见第558号第十三条“数字测量缺失机制Wearable Missingness”

六、心理健康应用隐私执法Mental-Health App Privacy

提出US FTC, BetterHelp prohibited from sharing health data for advertising (2023) 争议Fitzpatrick et al., JMIR Mental Health 4, e19 (2017), doi:10.2196/mental.7785。 最新(2025年文献)988 Lifeline and digital mental health safety protocols, 2022–2025。 关键以执法把敏感心理数据用途限制落地

心理健康应用隐私执法由US FTC, BetterHelp prohibited from sharing health data for advertising (2023)固定为历史节点,新意是FTC行动指控平台在承诺隐私后仍向广告商披露敏感信息,并要求赔偿与删除。2026年重读时把以执法把敏感心理数据用途限制落地、心理健康应用隐私执法的批次、平台、最差亚组与现场漂移和实现栈并列,避免把单次纪录误作系统能力。

可消融的唯一单因是以执法把敏感心理数据用途限制落地:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。心理健康应用隐私执法的外部复现误差率以95%区间登记。

US FTC, BetterHelp prohibited from sharing health data for advertising (2023)给出起点,争议由“隐私声明能否约束广告和分析生态的数据流”承担,最新状态是“监管开始把心理信息的二次使用视为伤害”。证据表列3组心理健康应用隐私执法的批次、平台、最差亚组与现场漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔异常运行〕证据链还要把US FTC, BetterHelp prohibited from sharing healt的起点材料与更新文献放在同一比较表里,并逐项报告“以执法把敏感心理数据用途限制落地”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

边界判据写作一次和解不能消除第三方SDK和跨境处理,用户同意也常无法理解推断数据。当2026年测试越过心理健康应用隐私执法的批次、平台、最差亚组与现场漂移,心理健康应用隐私执法分辨率越高,捕获效率和跨批一致性反而可能越低;方向翻转须先于均值进入结论。

“以执法把敏感心理数据用途限制落地”承担验收读数,另开心理健康应用隐私执法的批次、平台、最差亚组与现场漂移账。系统跑满24h后保留心理健康应用隐私执法的外部复现误差率、版本、维修与中止原因;〔异常运行〕余下5%失败及“尚缺心理健康应用隐私执法在独立场景的长周期阴性结果”仍入正文。〔异常运行〕对心理健康应用隐私执法Mental-Health App Privacy而言,真正需要登记的不是又一个平均分,而是由“决定本项计算精神医学结果能否成立的只有以执法把敏感心理数据用途限制落地”推出的每一步中介、责任人和可撤回条件,〔异常运行〕缺少任何一环,都不能把相关性写成机制。

心理健康应用隐私执法的异名接口采用数字生物标志物与可穿戴健康称“数字终点监管指南DHT Remote Data Guidance”;见第558号第十四条“数字终点监管指南DHT Remote Data Guidance”。共同预设是〔17 局部最优可加总为整体最优〕隐私声明能否约束广告和分析生态的数据流;第二团队在2026年重放原始记录时,不得以同向代理替换心理健康应用隐私执法的批次、平台、最差亚组与现场漂移。

位置D——把模型、工具、实现、验证与部署串成闭环 单因决定本项计算精神医学结果能否成立的只有以执法把敏感心理数据用途限制落地 预设〔17 局部最优可加总为整体最优〕隐私声明能否约束广告和分析生态的数据流 量纲以“以执法把敏感心理数据用途限制落地”为主读数,并列样本、误差、周期和对照/心理健康应用隐私执法Mental-Health App Privacy全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:一次和解不能消除第三方SDK和跨境处理,用户同意也常无法理解推断数据;心理健康应用隐私执法分辨率越高,捕获效率和跨批一致性反而可能越低 自曝异常运行独立核验:心理健康应用隐私执法的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在异常运行 空栏尚缺心理健康应用隐私执法在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“数字终点监管指南DHT Remote Data Guidance”;见第558号第十四条“数字终点监管指南DHT Remote Data Guidance”

七、生成式AI心理健康治理Generative AI for Mental Health

提出WHO guidance on large multi-modal models, 2024–2025 争议US FTC, BetterHelp prohibited from sharing health data for advertising (2023)。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键按用途、风险和责任治理生成式对话

在WHO guidance on large multi-modal models, 2024–2025之前,生成式AI心理健康治理缺少把局部优化变成系统判断的支点;节点价值在于WHO指南要求透明、人类监督、审计和利益相关者参与,覆盖患者自用和临床应用。2026年评价按用途、风险和责任治理生成式对话时,同时冻结生成式AI心理健康治理的批次、平台、最差亚组与现场漂移和对照。

因果账只许留下按用途、风险和责任治理生成式对话这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;生成式AI心理健康治理的批次、平台、最差亚组与现场漂移只界定失效域。生成式AI心理健康治理的外部复现误差率报告95%区间。

来源链依次是WHO guidance on large multi-modal models, 2024–2025、“通用模型能否在危机与妄想内容中可靠保持边界”和“WHO提出四十余项面向政府开发者和医疗方建议”。原始表公开3档配置、95%区间、5%失败谱及run ID;生成式AI心理健康治理的批次、平台、最差亚组与现场漂移导致的中止按失败计入分母。

建议不是疗效证据,通用模型更新频繁且可能迎合用户,必须独立红队和停用构成生成式AI心理健康治理的停止线。到2026年,生成式AI心理健康治理的批次、平台、最差亚组与现场漂移一旦主导,生成式AI心理健康治理模型越复杂,外部复现后的净增益反而越不稳定,峰值读数便不能代表净效用。〔人工接管〕本条的边界案例应从“尚缺生成式AI心理健康治理在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:建议不是疗效证据,通用模型更新频繁且可能迎合用户,必须独立红队和停用,生成式AI心理健康治理模型越复杂,外部复现后”究竟是偶发噪声,还是足以改变结论方向的系统反例。

部署账把“按用途、风险和责任治理生成式对话”设为主量纲,每24h记录生成式AI心理健康治理的外部复现误差率、版本、漂移与恢复。生成式AI心理健康治理的批次、平台、最差亚组与现场漂移无数据就写“尚缺生成式AI心理健康治理在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。

与相邻领域的精确链接是数字生物标志物与可穿戴健康称“远程患者监测Remote Patient Monitoring”;见第558号第十五条“远程患者监测Remote Patient Monitoring”。双方共享〔17 局部最优可加总为整体最优〕通用模型能否在危机与妄想内容中可靠保持边界;2026年跨平台转移时,生成式AI心理健康治理的批次、平台、最差亚组与现场漂移仍用同一单位、版本与失败阈值。〔人工接管〕机构采用生成式AI心理健康治理Generative AI for Mental Health之前还应公布否决门槛:一旦“⇄系统核算后方向反转:建议不是疗效证据,通用模型更新频繁且可能迎合用户,必须独立红队和停用,生成式AI心理健康治理模型越复杂,外部复现后”出现,就暂停扩张并回到“按用途、风险和责任治理生成式对话”的原始记录复核,该门槛必须早于部署决定写入方案。

位置E——把批次、漂移、现场负载与维护纳入环境 单因决定本项计算精神医学结果能否成立的只有按用途、风险和责任治理生成式对话 预设〔17 局部最优可加总为整体最优〕通用模型能否在危机与妄想内容中可靠保持边界 量纲以“按用途、风险和责任治理生成式对话”为主读数,并列样本、误差、周期和对照/生成式AI心理健康治理Generative AI for Mental Health全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:建议不是疗效证据,通用模型更新频繁且可能迎合用户,必须独立红队和停用;生成式AI心理健康治理模型越复杂,外部复现后的净增益反而越不稳定 自曝人工接管独立核验:生成式AI心理健康治理的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在人工接管 空栏尚缺生成式AI心理健康治理在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“远程患者监测Remote Patient Monitoring”;见第558号第十五条“远程患者监测Remote Patient Monitoring”

八、强化学习精神病学Reinforcement-Learning Psychiatry

提出Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024) 争议Insel et al., Research Domain Criteria: Toward a New Classification Framework, American Journal of Psychiatry 167, 748–751 (2010).。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键把学习率预测误差和探索写成症状机制

Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)使强化学习精神病学从局部演示转为可审计命题,核心观察是强化学习模型可分解患者在奖励和惩罚学习中的行为差异,形成机制假设。2026年证据包把把学习率预测误差和探索写成症状机制与强化学习精神病学的批次、平台、最差亚组与现场漂移分别编号,并保留旧方法对照。〔撤回门槛〕面向下一轮材料,数字心理健康与计算精神医学应优先补齐“尚缺强化学习精神病学在独立场景的长周期阴性结果”的原始记录,并把“⇄系统核算后方向反转:参数高度依赖任务、先验和药物状态,同一诊断内异质性会超过组间差异,强化学习精神病学应用范围越广,版本漂移和未记录失”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

这里拒绝多因叙述,决定结果能否成立的只有把学习率预测误差和探索写成症状机制。〔撤回门槛〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。强化学习精神病学的外部复现误差率须给95%区间。

提出证据见Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024),最强争议是“奖励学习参数差异是否稳定映射诊断和治疗反应”,延续状态为“跨任务层次模型与纵向采样尝试提高信度”。强化学习精神病学交付3批强化学习精神病学的批次、平台、最差亚组与现场漂移数据、95%区间、5%尾部和run ID,异常逐例保留。

强化学习精神病学不能越过参数高度依赖任务、先验和药物状态,同一诊断内异质性会超过组间差异。2026年把强化学习精神病学的批次、平台、最差亚组与现场漂移扫过全量程时,强化学习精神病学应用范围越广,版本漂移和未记录失败反而越多;方向一旦翻转,平均性能再高也不抵销。

验收表首先读取“把学习率预测误差和探索写成症状机制”,随后核对强化学习精神病学的批次、平台、最差亚组与现场漂移。持续24h日志含强化学习精神病学的外部复现误差率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺强化学习精神病学在独立场景的长周期阴性结果”。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项计算精神医学结果能否成立的只有把学习率预测误差和探索写成症状机制”的操作定义,仍能复算“以“把学习率预测误差和探索写成症状机制”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。

跨域异名为数字生物标志物与可穿戴健康称“无袖带血压设备Cuffless Blood Pressure”;见第558号第十六条“无袖带血压设备Cuffless Blood Pressure”,不是宽泛类比。它检验〔18 干预不回写到被干预者〕奖励学习参数差异是否稳定映射诊断和治疗反应;2026年由独立团队复跑原始记录时,强化学习精神病学的批次、平台、最差亚组与现场漂移的单位、阈值和停止规则保持不变。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有把学习率预测误差和探索写成症状机制 预设〔18 干预不回写到被干预者〕奖励学习参数差异是否稳定映射诊断和治疗反应 量纲以“把学习率预测误差和探索写成症状机制”为主读数,并列样本、误差、周期和对照/强化学习精神病学Reinforcement-Learning Psychiatry全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:参数高度依赖任务、先验和药物状态,同一诊断内异质性会超过组间差异;强化学习精神病学应用范围越广,版本漂移和未记录失败反而越多 自曝撤回门槛独立核验:强化学习精神病学的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在撤回门槛 空栏尚缺强化学习精神病学在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“无袖带血压设备Cuffless Blood Pressure”;见第558号第十六条“无袖带血压设备Cuffless Blood Pressure”

九、NICE数字健康证据标准Digital Health Evidence Standards

提出NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022 争议Montague et al., Trends in Cognitive Sciences 16, 72–80 (2012), doi:10.1016/j.tics.2011.11.018。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键让数字工具不再以同一低门槛进入采购

NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022确立NICE数字健康证据标准的历史节点。2026年把让数字工具不再以同一低门槛进入采购、NICE数字健康证据标准的批次、平台、最差亚组与现场漂移、实现栈与旧基线同时入账。

NICE数字健康证据标准只锁定一个原因:让数字工具不再以同一低门槛进入采购。〔跨域外推〕2026年冻结对象和总预算,移除机制而方向仍在便撤回,NICE数字健康证据标准的批次、平台、最差亚组与现场漂移不得由峰值代偿。NICE数字健康证据标准的外部复现误差率以95%区间裁决。〔跨域外推〕证据链还要把NICE, Evidence Standards Framework for Digital H的起点材料与更新文献放在同一比较表里,并逐项报告“让数字工具不再以同一低门槛进入采购”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

提出卷页由NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022锁定,反方命题是“风险分层证据要求能否跟上自适应和生成式产品”,截至2025年的延续为“框架按功能与风险匹配有效性和经济证据”。NICE数字健康证据标准复算给3套配置、95%区间、5%尾部和run ID,NICE数字健康证据标准的批次、平台、最差亚组与现场漂移失败样本不清洗。

NICE数字健康证据标准的硬边界是厂商自报功能分类可能下调要求,算法更新后旧证据也会过期。2026年把NICE数字健康证据标准的批次、平台、最差亚组与现场漂移推至规格外;NICE数字健康证据标准覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽,平均基准不能冲销反号结果。

〔跨域外推〕工程验收以“让数字工具不再以同一低门槛进入采购”为主读数,连续24h记录NICE数字健康证据标准的外部复现误差率、版本、人工接管与恢复。NICE数字健康证据标准的批次、平台、最差亚组与现场漂移未测即保留“尚缺NICE数字健康证据标准在独立场景的长周期阴性结果”,95%成功不能删除5%失败谱。

NICE数字健康证据标准跨域登记为数字生物标志物与可穿戴健康称“智能戒指睡眠与恢复Smart Ring Biomarkers”;见第558号第十七条“智能戒指睡眠与恢复Smart Ring Biomarkers”。〔跨域外推〕它共享〔18 干预不回写到被干预者〕风险分层证据要求能否跟上自适应和生成式产品,2026年送往第二平台时,NICE数字健康证据标准的批次、平台、最差亚组与现场漂移的对象、量纲与停止阈值均不得改名。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:厂商自报功能分类可能下调要求,算法更新后旧证据也会过期,NICE数字健康证据标准覆盖样本越多,最差亚组的反向误差反”做至少两轮外部复算,若方向翻转,NICE数字健康证据标准Digital Health Evidence Standards的结论必须随之收窄。

位置D——把模型、工具、实现、验证与部署串成闭环 单因决定本项计算精神医学结果能否成立的只有让数字工具不再以同一低门槛进入采购 预设〔18 干预不回写到被干预者〕风险分层证据要求能否跟上自适应和生成式产品 量纲以“让数字工具不再以同一低门槛进入采购”为主读数,并列样本、误差、周期和对照/NICE数字健康证据标准Digital Health Evidence Standards全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:厂商自报功能分类可能下调要求,算法更新后旧证据也会过期;NICE数字健康证据标准覆盖样本越多,最差亚组的反向误差反而越易被总体均值遮蔽 自曝跨域外推独立核验:NICE数字健康证据标准的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在跨域外推 空栏尚缺NICE数字健康证据标准在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“智能戒指睡眠与恢复Smart Ring Biomarkers”;见第558号第十七条“智能戒指睡眠与恢复Smart Ring Biomarkers”

十、数字表型可重复性Digital Phenotyping Reproducibility

提出Onnela Lab and multi-cohort benchmark studies, 2020–2025 争议Pear Therapeutics bankruptcy filings and product discontinuity (2023)。 最新(2025年文献)988 Lifeline and digital mental health safety protocols, 2022–2025。 关键检验被动行为特征的跨队列稳定性

数字表型可重复性由Onnela Lab and multi-cohort benchmark studies, 2020–2025固定为历史节点,新意是多队列比较显示活动、睡眠和社交代理可提供纵向信号,也揭示平台实现差异。2026年重读时把检验被动行为特征的跨队列稳定性、数字表型可重复性的批次、平台、最差亚组与现场漂移和实现栈并列,避免把单次纪录误作系统能力。〔盲法复核〕落到复现实务,可为数字表型可重复性Digital Phenotyping Reproducibility建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“以“检验被动行为特征的跨队列稳定性”为主读数,并列样本、误差、周期和对照”统一结算,避免换口径后仍宣称性能提高。

可消融的唯一单因是检验被动行为特征的跨队列稳定性:2026年维持样本、版本与预算不变,仅撤去该机制;若读数仍同向,本条失败。数字表型可重复性的外部复现误差率以95%区间登记。

Onnela Lab and multi-cohort benchmark studies, 2020–2025给出起点,争议由“同名手机特征能否跨操作系统城市和生活阶段复现”承担,最新状态是“研究转向原始数据标准、个体基线和开放代码”。证据表列3组数字表型可重复性的批次、平台、最差亚组与现场漂移配置、95%置信区间、5%尾部和run ID,阴性运行全部进入分母。〔盲法复核〕本条的边界案例应从“尚缺数字表型可重复性在独立场景的长周期阴性结果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“⇄系统核算后方向反转:位置熵、屏幕时间等同名指标的采样规则不同,跨研究合并前必须重算,数字表型可重复性分辨率越高,捕获效率和跨批一致性反”究竟是偶发噪声,还是足以改变结论方向的系统反例。

边界判据写作位置熵、屏幕时间等同名指标的采样规则不同,跨研究合并前必须重算。当2026年测试越过数字表型可重复性的批次、平台、最差亚组与现场漂移,数字表型可重复性分辨率越高,捕获效率和跨批一致性反而可能越低;方向翻转须先于均值进入结论。

“检验被动行为特征的跨队列稳定性”承担验收读数,另开数字表型可重复性的批次、平台、最差亚组与现场漂移账。系统跑满24h后保留数字表型可重复性的外部复现误差率、版本、维修与中止原因;〔盲法复核〕余下5%失败及“尚缺数字表型可重复性在独立场景的长周期阴性结果”仍入正文。

数字表型可重复性的异名接口采用数字生物标志物与可穿戴健康称“可穿戴妊娠生理轨迹Wearables in Pregnancy”;见第558号第十八条“可穿戴妊娠生理轨迹Wearables in Pregnancy”。共同预设是〔18 干预不回写到被干预者〕同名手机特征能否跨操作系统城市和生活阶段复现;第二团队在2026年重放原始记录时,不得以同向代理替换数字表型可重复性的批次、平台、最差亚组与现场漂移。

位置E——把批次、漂移、现场负载与维护纳入环境 单因决定本项计算精神医学结果能否成立的只有检验被动行为特征的跨队列稳定性 预设〔18 干预不回写到被干预者〕同名手机特征能否跨操作系统城市和生活阶段复现 量纲以“检验被动行为特征的跨队列稳定性”为主读数,并列样本、误差、周期和对照/数字表型可重复性Digital Phenotyping Reproducibility全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:位置熵、屏幕时间等同名指标的采样规则不同,跨研究合并前必须重算;数字表型可重复性分辨率越高,捕获效率和跨批一致性反而可能越低 自曝盲法复核独立核验:数字表型可重复性的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在盲法复核 空栏尚缺数字表型可重复性在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“可穿戴妊娠生理轨迹Wearables in Pregnancy”;见第558号第十八条“可穿戴妊娠生理轨迹Wearables in Pregnancy”

十一、WHO引导式心理聊天机器人试验WHO Guided Chatbot

提出Bryant et al., npj Digital Medicine 9, 57 (2026), doi:10.1038/s41746-025-02142-8 争议NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022。 最新(2025年文献)WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).。 关键把循证练习与人工支持边界编码进对话

Bryant et al., npj Digital Medicine 9, 57 (2026), doi:10.1038/s41746-025-02142-8确立WHO引导式心理聊天机器人试验的历史节点。2026年把把循证练习与人工支持边界编码进对话、WHO引导式心理聊天机器人试验的批次、平台、最差亚组与现场漂移、实现栈与旧基线同时入账。

因果账只许留下把循证练习与人工支持边界编码进对话这一项。2026年用相同对象做移除实验,机制消失而优势不变即否证;WHO引导式心理聊天机器人试验的批次、平台、最差亚组与现场漂移只界定失效域。WHO引导式心理聊天机器人试验的外部复现误差率报告95%区间。〔结果分母〕把WHO引导式心理聊天机器人试验WHO Guided Chatbot与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“以“把循证练习与人工支持边界编码进对话”为主读数,并列样本、误差、周期和对照”在这些类别上都可回查,跨研究比较才有意义。

来源链依次是Bryant et al., npj Digital Medicine 9, 57 (2026), doi:10.1038/s41746-025-02142-8、“低资源环境短期改善能否跨语言危机和长期服务维持”和“结构化引导聊天被研究为可扩展心理支持”。原始表公开3档配置、95%区间、5%失败谱及run ID;WHO引导式心理聊天机器人试验的批次、平台、最差亚组与现场漂移导致的中止按失败计入分母。

受试者支持、文化适配和随访长度限定结论,不能外推为通用AI治疗师构成WHO引导式心理聊天机器人试验的停止线。到2026年,WHO引导式心理聊天机器人试验的批次、平台、最差亚组与现场漂移一旦主导,WHO引导式心理聊天机器人试验模型越复杂,外部复现后的净增益反而越不稳定,峰值读数便不能代表净效用。〔结果分母〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定本项计算精神医学结果能否成立的只有把循证练习与人工支持边界编码进对话”的操作定义,仍能复算“以“把循证练习与人工支持边界编码进对话”为主读数,并列样本、误差、周期和对照”,否则所谓转向可能只是数据管线或命名变化。

部署账把“把循证练习与人工支持边界编码进对话”设为主量纲,每24h记录WHO引导式心理聊天机器人试验的外部复现误差率、版本、漂移与恢复。WHO引导式心理聊天机器人试验的批次、平台、最差亚组与现场漂移无数据就写“尚缺WHO引导式心理聊天机器人试验在独立场景的长周期阴性结果”;95%可用也不遮蔽5%反号。

与相邻领域的精确链接是数字生物标志物与可穿戴健康称“联邦可穿戴分析Federated Wearable Learning”;见第558号第十九条“联邦可穿戴分析Federated Wearable Learning”。双方共享〔19 类别互斥且穷尽〕低资源环境短期改善能否跨语言危机和长期服务维持;2026年跨平台转移时,WHO引导式心理聊天机器人试验的批次、平台、最差亚组与现场漂移仍用同一单位、版本与失败阈值。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有把循证练习与人工支持边界编码进对话 预设〔19 类别互斥且穷尽〕低资源环境短期改善能否跨语言危机和长期服务维持 量纲以“把循证练习与人工支持边界编码进对话”为主读数,并列样本、误差、周期和对照/WHO引导式心理聊天机器人试验WHO Guided Chatbot全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:受试者支持、文化适配和随访长度限定结论,不能外推为通用AI治疗师;WHO引导式心理聊天机器人试验模型越复杂,外部复现后的净增益反而越不稳定 自曝结果分母独立核验:WHO引导式心理聊天机器人试验的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在结果分母 空栏尚缺WHO引导式心理聊天机器人试验在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“联邦可穿戴分析Federated Wearable Learning”;见第558号第十九条“联邦可穿戴分析Federated Wearable Learning”

十二、真实世界停用与伤害登记Digital Mental Health Post-Market Registry

提出Regulatory and health-system safety proposals, 2024–2026 争议NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022。 最新(2025年文献)988 Lifeline and digital mental health safety protocols, 2022–2025。 关键把数字产品的退出和伤害作为临床结局

Regulatory and health-system safety proposals, 2024–2026使真实世界停用与伤害登记从局部演示转为可审计命题,核心观察是持续登记可连接版本、使用模式、症状变化、危机升级和停用原因,补足短试验。2026年证据包把把数字产品的退出和伤害作为临床结局与真实世界停用与伤害登记的批次、平台、最差亚组与现场漂移分别编号,并保留旧方法对照。

这里拒绝多因叙述,决定结果能否成立的只有把数字产品的退出和伤害作为临床结局。〔未覆盖项〕2026年固定对象、实现和预算后做删除检验,若方向未变便退稿。真实世界停用与伤害登记的外部复现误差率须给95%区间。

提出证据见Regulatory and health-system safety proposals, 2024–2026,最强争议是“试验后是否有人记录恶化、依赖和错误升级”,延续状态为“研究倡议建立版本、停用原因与不良事件共同登记”。真实世界停用与伤害登记交付3批真实世界停用与伤害登记的批次、平台、最差亚组与现场漂移数据、95%区间、5%尾部和run ID,异常逐例保留。〔未覆盖项〕在数字心理健康与计算精神医学的这一对象上,复核应把“以“把数字产品的退出和伤害作为临床结局”为主读数,并列样本、误差、周期和对照”拆成同一分母下的主结果与失败谱,“尚缺真实世界停用与伤害登记在独立场景的长周期阴性结果”要单列编码,不能在汇总时并入其他项。

真实世界停用与伤害登记不能越过伤害定义和企业报告激励不一致,患者退出后往往最难随访却最重要。2026年把真实世界停用与伤害登记的批次、平台、最差亚组与现场漂移扫过全量程时,真实世界停用与伤害登记应用范围越广,版本漂移和未记录失败反而越多;方向一旦翻转,平均性能再高也不抵销。

验收表首先读取“把数字产品的退出和伤害作为临床结局”,随后核对真实世界停用与伤害登记的批次、平台、最差亚组与现场漂移。持续24h日志含真实世界停用与伤害登记的外部复现误差率、版次、接管和修复;95%成功与5%失败同时发布,缺口写成“尚缺真实世界停用与伤害登记在独立场景的长周期阴性结果”。〔未覆盖项〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“⇄系统核算后方向反转:伤害定义和企业报告激励不一致,患者退出后往往最难随访却最重要,真实世界停用与伤害登记应用范围越广,版本漂移和未记录”做至少两轮外部复算,若方向翻转,真实世界停用与伤害登记Digital Mental Health Post-Market Registry的结论必须随之收窄。

跨域异名为数字生物标志物与可穿戴健康称“数字标志物适用性声明Context of Use for Digital Measures”;见第558号第二十条“数字标志物适用性声明Context of Use for Digital Measures”,不是宽泛类比。它检验〔20 窗口内稳定=长期稳定〕试验后是否有人记录恶化、依赖和错误升级;2026年由独立团队复跑原始记录时,真实世界停用与伤害登记的批次、平台、最差亚组与现场漂移的单位、阈值和停止规则保持不变。

位置S——把可证伪的系统净性能视为决定性资源 单因决定本项计算精神医学结果能否成立的只有把数字产品的退出和伤害作为临床结局 预设〔20 窗口内稳定=长期稳定〕试验后是否有人记录恶化、依赖和错误升级 量纲以“把数字产品的退出和伤害作为临床结局”为主读数,并列样本、误差、周期和对照/真实世界停用与伤害登记Digital Mental Health Post-Market Registry全部纳入比较的样本、运行或决策单元 失效⇄系统核算后方向反转:伤害定义和企业报告激励不一致,患者退出后往往最难随访却最重要;真实世界停用与伤害登记应用范围越广,版本漂移和未记录失败反而越多 自曝未覆盖项独立核验:真实世界停用与伤害登记的计算精神医学证据账只覆盖当前对象、实现和版本,跨平台量纲仍可能不可换算;独立撤回检查落在未覆盖项 空栏尚缺真实世界停用与伤害登记在独立场景的长周期阴性结果 异名数字生物标志物与可穿戴健康称“数字标志物适用性声明Context of Use for Digital Measures”;见第558号第二十条“数字标志物适用性声明Context of Use for Digital Measures”

◎ 二十年连起来看

二十个节点连起来,主线不是名词越来越多,而是数字心理健康的决定性机制是把可解释的个体状态估计接到有证据的干预与人工升级,而不是下载量、对话轮次或预测准确率增加。早期把对象变得可执行,中期把读数送回决策,近期才开始把异常、资源和责任纳入系统。

这条历史线也显示,局部纪录通常先于完整证据账出现。面板因此保留提出、争议与最新三条来源,避免用今天的术语倒写昨天的因果。

◎ 三个常见误解

第一,自动或量子等标签不自动等于净优势;第二,峰值读数不能替代全流程分母;第三,规模扩大并不会自行消除选择偏差、漂移和外部成本。

三个误解共同源于把代理指标当作对象本身。只要损耗、人工、校准或失败样本被移出账本,任何路线都可能得到过度乐观的结论。

◎ 与相邻领域的接口

本领域向上连接基础理论,向下连接制造、软件、标准和治理。真正有用的接口是让相邻领域用同一失效条件挑战“数字心理健康的决定性机制是把可解释的个体状态估计接到有证据的干预与人工升级,而不是下载量、对话轮次或预测准确率增加”。

接口验收要求对手明确、共同预设明确、相反点明确,并能推出一个原领域尚未提出的新实验,而不是把热门名词并排陈列。

◎ 争议现场

支持者强调新的闭环和资源已经把过去不可做的问题变成可运行系统;反方则指出大多数优势仍依赖精心选择的任务、基线和实验环境。

争议的裁决方式不是口号投票,而是冻结版本、同预算对照、跨站点复现与方向反转试验。若失败只被解释成工程细节,理论便失去被反驳的入口。

◎ 往下五年看什么

未来五年要看生成式系统能否在自杀、躁狂、精神病性症状和药物问题上可靠拒答并升级,同时以独立长期试验证明效果不随新奇感消失

应优先观察能否公开完整运行日志、异常分类和阴性结果,以及新一代标准是否要求端到端资源核算。单点纪录仍重要,但不足以单独改变面板判断。

◎ 可与哪些领域对撞

可对撞的领域包括控制论、因果推断、计量学、可靠性工程、科学社会学与技术治理。它们分别追问反馈、归因、溯源、长尾失败、奖励结构和责任。

对撞时应保持对象和量纲不变,只替换一个前提;如果结论因此反号,才说明接口带来了新知识。

◎ 十条可做的研究命题

建立公开失败谱,并比较只用成功数据与全量数据时结论是否反号。

把人工接管、校准和等待时间加入资源分母,重算相对旧方法的净收益。

在至少两个独立平台冻结版本复现同一方向,而非只复现最好数值。

设计移除关键机制的消融试验,检查单因主张能否被直接推翻。

将平均性能换成最坏分位数,观察路线排序是否改变。

对代理指标施加分布外扰动,寻找它与真实目标解耦的阈值。

记录中止与未完成运行,检验幸存者偏差在多大程度上制造领先。

以同总预算而非同设备时间设置经典或旧技术基线。

把能耗、耗材和退役责任延伸到生命周期,测试局部优化是否转移成本。

预注册一个会令主张失败的结果形态,并在数据到来后按原规则裁决。

◎ 资料核验

  1. Insel et al., American Journal of Psychiatry 167, 748–751 (2010), doi:10.1176/appi.ajp.2010.09091379
  2. Montague et al., Trends in Cognitive Sciences 16, 72–80 (2012), doi:10.1016/j.tics.2011.11.018
  3. Saeb et al., Journal of Medical Internet Research 17, e175 (2015), doi:10.2196/jmir.4273
  4. Huys, Maia & Frank, Nature Neuroscience 19, 404–413 (2016), doi:10.1038/nn.4238
  5. Fitzpatrick et al., JMIR Mental Health 4, e19 (2017), doi:10.2196/mental.7785
  6. US FDA authorization of reSET for substance use disorder (2017)
  7. Freeman et al., Lancet Psychiatry 5, 625–632 (2018), doi:10.1016/S2215-0366(18)30155-8
  8. Nahum-Shani et al., Annals of Behavioral Medicine 52, 446–462 (2018), doi:10.1007/s12160-016-9830-8
  9. Espie et al., Lancet Psychiatry 6, 281–289 (2019), doi:10.1016/S2215-0366(18)30472-6
  10. Coppersmith et al., Biomedical Informatics Insights and later studies (2018–2021)
  11. Pear Therapeutics bankruptcy filings and product discontinuity (2023)
  12. 988 Lifeline and digital mental health safety protocols, 2022–2025
  13. Ayers et al., JAMA Internal Medicine 183, 589–596 (2023), doi:10.1001/jamainternmed.2023.1838
  14. US FTC, BetterHelp prohibited from sharing health data for advertising (2023)
  15. WHO guidance on large multi-modal models, 2024–2025
  16. Mkrtchian et al., computational psychiatry studies of learning and mood (2017–2024)
  17. NICE, Evidence Standards Framework for Digital Health Technologies, updated 2022
  18. Onnela Lab and multi-cohort benchmark studies, 2020–2025
  19. Bryant et al., npj Digital Medicine 9, 57 (2026), doi:10.1038/s41746-025-02142-8
  20. Regulatory and health-system safety proposals, 2024–2026
  21. Insel et al., Research Domain Criteria: Toward a New Classification Framework, American Journal of Psychiatry 167, 748–751 (2010).
  22. Montague et al., Computational psychiatry, Trends in Cognitive Sciences 16, 72–80 (2012).
  23. Huys, Maia & Frank, Computational psychiatry as a bridge, Nature Neuroscience 19, 404–413 (2016).
  24. WHO, Ethics and governance of artificial intelligence for health: guidance on large multi-modal models (2025).

SDEUniverses.com · 新思想前沿 | 第 559 号 | 王德生 亲撰