← 专著首页目录📄 在线 PDF⬇ 下载德麦国际专著第 78 号

第二章 待命不等于可用

最低接管维持剂量与接管保真环 ——航空人因工程 × 核设施运行与维修工程 × 运动训练学的跨学科对撞

摘 要:生成式人工智能正从辅助工具转变为长期认知代理,持续承担检索、分析、计算、写作、判断乃至部分执行任务。由此出现一个区别于“哪些能力不能外包”的维护难题:当人曾经真实掌握某项能力,但此后长期缺少独立调用时,怎样在不要求人重复完成全部低价值劳动、也不牺牲AI效率优势的前提下,使关键能力仍然处于可接管状态?本章围绕同一个目标组织三条路径,将航空人因工程关于自动化脱环、情境意识与故障接管的材料,核设施运行与维修工程关于待命系统、潜伏失效、监督试验与试验间隔优化的材料,以及运动训练学关于去训练、最低维持剂量与再适应的材料置于同一冲突面。三门学科共同暴露出一个未被充分说出的前提:能力通常被当成一种可从正常运行表现或单一指标中读取的库存;然而在长期AI代行条件下,正常绩效恰恰可能遮蔽备用的人类路径是否仍可启动。本章据此提出两个工作性概念:最低接管维持剂量(Minimum Takeover Maintenance Dose, MTMD)与接管保真环(Takeover Fidelity Loop, TFL)。前者将能力维护剂量从单一频率改写为异常发现、情境重建、独立裁决、干预执行和恢复验证等分量的向量;后者把能力维护组织为“拆门—微调用—待命暴露累计—风险触发证明—扰动接管—恢复回写”的循环。本章进一步以公开的抗阻训练维持研究作为最低成本压力测试,发现相同低剂量对不同适应指标的保持并不一致,从而否定“一个能力对应一个最低维持剂量”的简单标量模型,并与航空研究中手工操纵相对保持而认知导航、故障识别更易下降的现象形成跨领域重复。本章主张:AI时代能力维护的最低单位不是完整任务重演,而是长期待命后重新进入控制的接管跃迁路径;有效校验也不应只证明能够复现标准答案,而应证明人在AI不可用、AI与现实冲突、多AI分歧或情境越界后,仍能独立完成异常发现、情境重建、判断、干预与恢复。

关键词:生成式人工智能;能力退化;自动化脱环;待命系统;最低维持剂量;证明试验;接管能力;人机协作

Standby Is Not Availability: Minimum Takeover Maintenance Dose and a Takeover Fidelity Loop for Human Capability in the Generative-AI Era

Abstract: As generative AI increasingly performs retrieval, analysis, calculation, writing, judgment support and execution, a new capability-maintenance problem emerges: how can an already acquired human capability remain operationally available after months or years of AI delegation without forcing people to repeat all low-value work manually? This paper collides three bodies of knowledge—aviation human factors on out-of-the-loop performance and takeover, nuclear operations and maintenance engineering on standby systems and latent failures, and exercise science on detraining and minimum maintenance dose. The collision yields a shift from treating capability as a stock to treating it as a standby-to-control transition. We propose Minimum Takeover Maintenance Dose (MTMD), a vector across distinct capability gates, and the Takeover Fidelity Loop (TFL), a maintenance cycle consisting of capability decomposition, minimal real activation, accumulation of standby exposure, risk-triggered proof testing, disruptive takeover, recovery verification and adaptive re-dosing. A proof event is valid only when a person can detect an abnormality, reconstruct task state from sufficiently independent evidence, make an independent judgment, intervene, and verify recovery after AI is unavailable, conflicting, or contextually unreliable. A stress test using published resistance-training maintenance data rejects the simpler hypothesis that one reduced practice dose can represent preservation of an entire capability. The framework therefore argues that mature human-AI systems should minimize unnecessary human labor subject to one constraint: the dormant human pathway must remain demonstrably capable of re-entering control before a real failure demands it.

Keywords: generative AI; human capability; out-of-the-loop performance; skill retention; surveillance testing; minimum maintenance dose; takeover fidelity

引言:从“不可外包”转向“如何维持可接管”

关于生成式人工智能与人类能力的讨论,通常围绕两个问题展开:第一,AI能够替人完成哪些工作;第二,哪些能力即使在AI时代仍然应该由人掌握。这两个问题固然重要,但随着AI从偶尔调用的工具变成长期在线的认知代理,第三个问题开始变得更加基础:一项能力即使已经被人掌握,如果此后几个月、几年主要由AI代行,它还能否在真正需要时被重新调用?

这不是“有没有学会”的问题,而是“学会以后如何不失活”的问题。一个医生、工程师、教师、研究者、律师、财务人员或管理者可能在AI进入工作流以前已经接受多年训练,也曾经能够独立检索、分析、判断和执行。然而,当AI持续承担绝大多数正常工作以后,人从高频执行者逐渐变成监督者、批准者和异常时的最后责任人。真正危险的能力变化,未必首先表现为知识被完全忘记,而可能表现为某些关键环节长期没有被调用,以致一个人仍然能够识别熟悉答案,却已经不能在陌生、冲突或失效情境中迅速重建完整控制。

如果对此采取最保守的方案,即要求人周期性关闭AI、从头到尾重新完成全部任务,技术带来的效率收益会被大量训练成本重新吃掉。尤其在知识工作中,检索、格式化、基础计算、常规摘要和初稿生成等环节恰恰是最适合交给AI的低价值重复劳动。如果所谓能力维护要求人不断重复这些劳动,能力维护就会退化为对技术进步的抵消。

相反,如果组织因为AI在绝大多数时间表现稳定,就把“系统长期没有出事”解释成人工接管能力仍然完好,也会产生另一类错误。长期没有真实故障,只能说明主运行通道没有暴露严重失败,并不能自动证明长期待命的人类备用通道仍然可用。越稳定的自动化系统,越可能减少人获得自然练习与真实接管的机会,这使“正常绩效”和“备用能力”之间出现系统性脱钩。

本章所要解决的因此是一道典型的路径问题:不是重新定义什么叫能力,也不是单纯解释为什么能力会退化,而是建立一条从“长期由AI代行”走到“人在必要时仍能独立接管”的可执行维护路径。这类问题要的是路径而不是维度;本章因此不把三门学科作为并列综述,而是让它们围绕同一个目标给出彼此冲突的维护逻辑,并寻找三者合在一起才会显露的中间结构。

理论边界:能力归属与能力维持不是同一个问题

此前“断代理复闭环判据”已经处理了另一个更基础的问题:当AI参与检索、生成、分析和表达后,正常输出质量不再足以判断某项能力究竟属于人、属于AI,还是只能归属于“人+AI”的联合系统。那项研究提出,能力归属应当在外部代理受到可判定扰动的断面上观察:只有当主体仍能生成独立预期、发现差异、裁决冲突、实施干预并把结果回写到下一轮判断规则中,才有理由继续把该能力归属于主体。

然而,一次通过能力认证并不能自动回答跨时间的维持问题。一个人在今天能够完成断代理后的闭环重建,不代表六个月以后仍然能够完成。相反,若AI在六个月里持续替他执行关键环节,人类能力的各个分量可能以不同速度衰减。因此,能力归属研究回答的是“现在这项能力是否仍然可归于主体”,本章回答的是“怎样让这一判断在长期AI代行条件下继续成立”。

二者的差异决定了本章不能简单重复一次性测试。若维护方案只是每隔一段时间完整重复一次能力认证,就等于用高成本的全量演练代替精细的维护工程。本章真正需要找到的是:哪些子能力需要真实使用,哪些操作可以长期外包;哪些信号能够提前说明备用路径可能失活;以及怎样以尽可能小的训练成本换取足够高的接管可靠性。

因此,本章把“能力”暂时视为一个跨时间的可调用系统,而不是静态知识库存。一个系统可在日常运行时把大量计算、记忆、搜索和表达延伸到外部工具中,但如果在关键扰动发生时,人仍然负有最后责任,那么至少必须保留一条能够从待命状态重新进入观察、判断、控制和恢复的人工路径。本章将这一对象称为“接管跃迁路径”。

三个学科的核心材料与冲突

航空人因工程:自动化越成功,接管越接近一次冷启动

航空自动化研究很早就发现了一个反直觉现象:自动化系统往往把常见、规则化、适合反复练习的任务交给机器,却把稀少、异常、复杂且难以提前预设的任务留给人。Bainbridge在《Ironies of Automation》中指出,自动化越成功,人越少通过日常任务保持对异常处理的熟练度;而真正需要人介入的恰恰是机器最难处理的情况[1]。这使“自动化成功”与“人工备用能力得到练习”之间形成方向相反的关系。

Endsley与Kiris关于out-of-the-loop performance problem的研究进一步显示,当操作者长期处于自动化监督位置时,一旦需要重新接管,故障后的决策与行动会受到情境意识下降和控制参与不足的影响[2]。这意味着接管不是简单地把自动化开关关闭,然后原有人工技能自动上线。人在重新控制之前,需要首先恢复对当前状态、任务进程、可靠信息、约束变化和潜在风险的理解。

Casner等对航空公司飞行员的模拟研究揭示了更细的分化:人工操纵、仪表扫描等部分技能可以保持得相对稳定,而导航程序推进、异常识别和某些认知性人工飞行技能更容易出现下降[3]。这项结果极其重要,因为它否定了“飞行技能”可以由一个总分代表的想法。一个人可能仍然具备基础操作动作,却在重新理解发生了什么、下一步应当做什么的问题上明显变弱。

因此,航空领域给出的不是“人必须经常手工操作”这样简单的建议,而是一条更精确的机制:高度自动化首先改变的是人的位置——从连续控制者变成长期待命的监督者。能力风险因此集中在“重新进入控制”所需的状态转换,而不是只集中在某个动作是否还记得。

核设施运行与维修工程:没有已知故障,不等于备用系统已经被证明可用

核设施运行与维修工程提供了另一种结构。核电站中的许多安全重要系统并不持续运行,而是在正常状态下长期待命,只有在特定需求发生时才启动。对于这种系统,“一直没有出事”不是充分证据,因为潜伏失效可能在待命期间始终不可见,直到监督试验或真实需求到来才暴露[5]。

这一区分与AI时代的人类角色高度相似。当AI承担绝大多数正常工作后,人越来越像一个备用通道。一个组织可以连续一年没有发生必须人工接管的严重AI故障,但这一事实主要证明主通道在过去任务分布中的表现,并不能直接证明人工备用路径在明天仍然能够启动。换言之,零事故记录对备用能力状态的信息量可能非常低。

核工程因此发展了监督试验、在役检查和定期测试制度,用于在真实需求以前识别潜伏失效。IAEA相关安全指南把维护、测试、监督和检查的目标明确指向可靠性与可用性的持续证明,并强调测试结果应当回写到后续纠正措施和维护安排中[5][6]。重要的是,这种证明不是一次性验收,而是持续状态管理。

但核工程同时拒绝“测试越多越安全”的简单逻辑。测试本身可能引入设备扰动、瞬态风险、人员负担和维护成本,因此试验间隔需要在潜伏失效暴露风险与测试诱发风险之间优化[5]。这对AI时代的能力维护尤为关键:如果为了证明人仍然会做,而强迫专业人员频繁脱离AI完整重做全部任务,测试成本本身就会成为系统损失。

核设施工程由此给出第二条机制:长期待命的关键能力不能由主通道的正常绩效来认证;它需要独立的证明事件,但证明事件必须追求信息效率,而不能无限增加频率和强度。

运动训练学:最低维持剂量存在,但剂量不是一个统一数字

运动训练学处理的是另一种长期维持问题:已经通过训练获得的适应,在降低训练量以后能否保留?这使“最低维持剂量”成为一个比“是否继续训练”更精确的问题。Bickel、Cross与Bamman让参与者在16周高频抗阻训练后进入32周去训练或降剂量维持阶段,研究不同剂量对年轻和年长成人训练适应的保持[7]。

这一研究真正重要的地方并不是得出某个可以普遍套用的“每周练几次”,而是说明不同适应分量的保持需求并不一致。力量表现、肌纤维肥大、年龄差异等指标并不会在同一剂量下同步变化。也就是说,同一个人可以在某个显性指标上仍然表现很好,而另一项结构性适应已经开始下降。

更早的技能保持与再学习研究、降低训练频率后的有氧能力维持研究同样说明,保持既有能力所需的剂量通常远低于形成该能力所需的训练量,但保持效果受到能力类型、个体差异、时间间隔和训练刺激特征影响[8][9]。因此,“维持”不是简单重复原训练方案,而是寻找仍足以保持目标适应的最小刺激。

运动训练学由此给出第三条机制:低剂量维护在原则上可行,但最低剂量必须针对具体适应分量来定义。一个保持良好的指标不能被用来替代整个能力系统。

跨学科互否方法:三条路径为什么不能被简单拼接

三条路径的结构

本题的答案形状是一条“从长期AI代行走到人工仍可接管”的路。这类问题的关键不是列出三个解释维度,而是让三条不同的实现路径争夺同一个目标:究竟通过什么过程,才能使长期待命的人类能力仍然在必要时可用。

航空路径把目标放在“重新进入控制”:只要人仍能保持情境参与和接管表现,自动化就可以高度使用。核工程路径把目标放在“证明备用可用”:只要待命系统通过适当的监督和试验,就不必持续运行。运动训练路径把目标放在“最低刺激维持适应”:只要低剂量足以保留目标能力,就没有必要重复原训练量。三者看似互补,但真正执行时会给出不同甚至互相否定的处方。

三家共有但未明说的前提

三条路径争论的表面问题是“人需要参与多少、多久测一次、最低练多少”。但它们共同站在一个更深的前提上:能力似乎可以被当成一个已经存在的库存,只要在某个时点测到它,或者某个指标仍然保持,就可以认为能力仍然可用。

航空研究内部的材料首先推翻了这一前提,因为基础手工技能保持并不保证复杂认知接管保持;核工程内部材料也推翻它,因为一个没有已知故障的待命系统仍可能存在潜伏失效;运动训练内部材料同样推翻它,因为相同剂量对不同训练适应的维持效果并不一致。三门学科都在自己的证据中承认:表面“还在”的某些部分,不能代表整个系统仍具有被需求时的可用性。

由此,真正需要维护的对象不再是“能力库存”,而是一个跨状态的过程:从长期待命状态重新跃迁到有效控制状态。能力的失效也因此出现一种新的形态——零件可能还在,连接零件的路径已经断了。

敌意拓宽:本章不能占用的既有位置

为避免把已有思想换名,本章必须主动承认最危险的占位者。自动化脱环和情境意识研究已经指出长期自动化可能削弱人工接管[1][2][13];Parasuraman与Riley关于自动化使用、误用、不用与滥用的研究已经建立了自动化依赖与人类监督的经典框架[12];劳动过程与deskilling传统早已讨论技术和组织如何改变技能内容[10];核安全领域拥有成熟的监督试验、证明试验和风险化试验间隔思想[5][6];运动训练学已经直接使用最低维持剂量和去训练框架[7]-[9]。

因此,本章不能以“AI用多了人会退化”“人需要定期练习”“备用能力应该测试”“最低训练量可以低于原训练量”等判断声称创新。这些位置已经被充分占用。本章只有在提出一个同时不能被out-of-the-loop、proof testing或minimum maintenance dose单独吸收的判别结构时,才可能构成二阶产物。

本章最终保留的空位是:把长期AI代行后的能力维护对象定义为“待命—接管状态转换”,把维护剂量定义为不同接管门的分量向量,把证明事件定义为扰动后的完整复控,并要求证明结果反向修改下一轮AI授权与人工维持剂量。任意一个既有领域都能解释其中一部分,但不能单独推出这一完整闭环。

二阶涌现:能力维护的最小对象是“接管跃迁路径”

本章将接管跃迁路径定义为:人在长期由AI主导的任务中,从未独立维持完整任务状态的待命位置,重新进入能够独立发现异常、重建情境、作出判断、实施干预并确认恢复的控制状态所必须经历的连续过程。

这一对象转换能够解释一种过去容易被误判的现象:一个人可能“还会做”,却“接不上”。例如,程序员仍然能够写出正确代码,却在AI编程助手不可用且生产系统出现陌生故障时,无法从日志、依赖关系和系统反馈中迅速建立故障模型;研究者仍然会写论文,却在AI给出一段非常流畅但承重引用错误的综述时,无法自己发现问题;管理者仍然记得决策框架,却在多个AI给出互相冲突的建议时,只能继续询问更多AI,而没有独立终止冲突的证据路径。

这种失效与完全遗忘不同。完全遗忘意味着某个知识或动作本身消失;接管路径失效意味着若干局部技能仍然存在,但异常发现、情境定位、证据切换、控制取得或恢复验证中的某个连接长期没有被使用,导致真实异常发生时无法把零件串成一个有效闭环。

因此,AI时代能力维护不应追求“保留全部人工操作”,而应追求“保留足够完整的接管跃迁”。这允许日常流程极大程度自动化,也允许人在绝大多数时间不亲自执行低价值环节;但只要人仍负有关键时刻的最终控制责任,接管路径就必须以某种方式保持可验证。

最低接管维持剂量(MTMD):从单一频率到能力向量

五个接管门

为了使“最低剂量”可操作,首先需要把接管能力拆成可以分别失效的最小门。本章提出五个基本门:异常发现(Detection, D)、情境重建(Reconstruction, R)、独立裁决(Judgment, J)、干预执行(Intervention, I)和恢复验证(Verification, V)。这五门并非声称穷尽所有职业能力,而是作为一个跨任务的最小骨架。

异常发现门要求主体在没有AI明确提示“现在出错”的情况下,能够察觉结果、证据或现实反馈中存在足够重要的差异;情境重建门要求主体能够回到原始信息,识别系统当前状态、可信信息、已发生步骤和变化约束;独立裁决门要求主体能够在AI、数据、规则或多个模型发生冲突时,依据不完全同源的理由作出判断;干预执行门要求判断能够转化为真实改变任务状态的行动;恢复验证门要求主体能够确认干预是否奏效,并识别新的副作用、残余风险和后续学习。

剂量的向量表达

如果不同接管门的衰减速度不同,那么“每月独立做一次”这种标量规定就会失去精度。本章因此把最低接管维持剂量定义为一个向量,而不是一个单一数字。

MTMD = <m_D, m_R, m_J, m_I, m_V> (1)

其中,每个 m_k 不是单一时间频率,而至少包含频率、强度、独立性、情境变异度和现实保真度五个维度。一个人即使每周都“练”,若练习总是提前告诉他哪里有错、所有事实都由同一个AI提供、每次只复现标准答案,那么真正需要维持的异常发现和独立裁决可能仍然接近零调用。

m_k = (f_k, s_k, i_k, v_k, r_k) (2)

式中,f表示调用频率,s表示挑战强度,i表示与日常AI主通道的独立程度,v表示情境变异度,r表示现实保真度。由此,“十分钟训练”与“十分钟真实调用”不再被视为同一个剂量。

这一定义允许维护量远低于生产量。一个研究者可以让AI承担大量搜索、格式整理和初稿生成,却只需在少量关键节点直接阅读原始文献、先于AI写下自己的预期、随机核查承重引用、独立处理一次证据冲突;一个程序员可以大量使用代码生成,却定期独立读日志、定位根因、决定回滚或修复;一个管理者可以让AI完成方案比较,却保留识别关键假设、区分事实判断与价值排序、终止多AI分歧的真实练习。

因此,最低维持剂量的单位不应首先是分钟,而应是“关键接管门被真实激活的次数与质量”。这种单位比传统培训学时更接近需要维护的机制。

接管保真环(TFL):从维护到证明再到回写

六阶段循环

阶段一:能力拆门

对每项高度AI化的任务,不再列出所有工作步骤,而只列出AI失效后人必须亲自完成、否则系统无法恢复的接管门。

阶段二:微调用

在正常AI工作流中嵌入极少量真实人工调用,避免某个关键门长期处于零使用。例如先写预期再看AI结论、随机回查原始材料、由人先判断异常再打开AI建议。

阶段三:待命暴露累计

记录每个接管门距上一次真实独立调用的时间、AI代理比例、模型变化、任务环境变化、后果等级以及最近一次证明中的最弱项。

阶段四:风险触发证明

以固定最大静默期作为后备,同时允许AI升级、环境变化、近失误、多模型冲突、任务后果提高或微调用失败等事件提前触发证明。

阶段五:扰动接管

通过AI断援、AI与现实冲突、多代理分歧或情境越界等预设扰动,要求主体在有限时间内独立完成D-R-J-I-V。

阶段六:恢复与回写

证明不在“答对”时结束,而以系统恢复、后果验证和维护方案更新为终点。最弱门决定下一轮增量训练,严重失败可暂时收紧AI授权或增加双人复核。

为什么必须是闭环而不是考试

传统考试通常在题目中明确告诉受试者“这里有一个问题”,于是异常发现已经被命题者替受试者完成。真实AI错误却可能以流畅、自信、引用齐全和结构完整的形式出现。若测试永远从“请处理下面这个错误”开始,就只能证明人在错误被指出以后会不会解决,而不能证明他还能自己首先发现问题。

因此,至少一部分接管证明必须采用潜伏扰动:参与者知道本轮AI可能可靠也可能不可靠,却不知道错误是否一定存在、出现在哪里、究竟是AI错、原始数据错还是自己的旧知识错。只有这样,异常发现门才被真实调用。

同样,测试也不能在人给出标准答案时停止。若一个人知道正确诊断却不会实施安全处置,或实施以后不验证系统是否恢复,平均知识分再高也无法承担真实接管。接管证明因此必须覆盖从发现到恢复的完整闭环。

接管证明的四类扰动与通过规则

四类基本扰动

串联门而非平均分

对于高后果任务,接管通过条件不应以五项平均分为主。原因在于真实接管通常具有串联系统特征:任一承重环节完全失效,都可能使整体失败。设五项能力标准化得分为 D、R、J、I、V∈[0,1],各自最低阈值为 θ_k,则可以使用门控通过条件:

G = Π(k∈{D,R,J,I,V}) 1(x_k ≥ θ_k) (3)

此外必须设置时间约束。许多能力不是“最后能不能做出来”,而是“能不能在还来得及的时候做出来”。因此对时间敏感任务还需满足:

T_takeover ≤ T_critical (4)

一个人在三小时后终于识别出正确异常,对于允许数天处理的研究任务可能完全合格;对于必须几十秒内接管的实时控制任务则没有意义。通过规则必须由任务的真实关键时间窗定义,而不能套用统一标准。

采用串联门还有另一个管理意义:它可以防止“强项掩盖弱项”。一个人可能知识得分、分析能力和操作技能都很高,但异常发现持续失败;如果用平均分,他会被判定为优秀,真实系统却会在错误从未被他察觉时失去人工冗余。

证明何时触发:固定日历只是后备机制

如果能力衰减速度受调用间隔、AI变化、任务变化和后果等级共同影响,那么统一的“每三个月测试一次”只能作为最粗的后备。本章提出一个用于调度而非直接评价个人的待命暴露指数。它目前属于待验证的工程化框架,而不是已被实证确认的心理学定律。

E_k = (Δt_k / T_0k) · (1 + αA + βC + γH) (5)

其中,Δt_k 表示第k项能力距离上一次真实独立调用的时间,T_0k 是依据历史表现暂定的基准维持间隔,A表示AI系统变化程度,C表示任务情境变化程度,H表示错误后果等级。当E_k超过预设阈值时,触发对应能力门的证明试验。

除此之外,若出现AI未解释异常、多模型对承重结论持续分歧、业务环境或法规发生重大变化、一次人工微校验失败、真实接管明显变慢、任务即将进入更高后果等级等事件,可以直接触发测试,而不必等待固定日期。

这使能力维护从“按时间打卡”转向“按风险暴露管理”。固定时间仍然有价值,因为它可以防止长期没有事件时测试永久消失;但真正决定测试强度的应是长期未调用、变化和后果的组合。

最低成本压力测试:为什么“一个能力一个最低剂量”必须被否定

候选命题与可证伪条件

本章在候选阶段最容易得到的一个简单判断是:既然运动训练存在最低维持剂量,那么每项AI时代能力也可以找到一个统一最低频率,例如“每月独立做一次”或“每季度完成一次无AI任务”。如果这个命题成立,组织实践将非常简单。

但这一命题的可证伪条件也非常明确:若同一个低剂量能维持一种关键能力分量,却不能维持另一种分量,那么“能力=单一剂量”模型就必须放弃。

公开数据真跑与不利结果

Bickel等的公开研究为这一条提供了低成本压力测试材料[7]。参与者在完成16周每周3次抗阻训练后,进入32周的去训练或显著降剂量维持阶段。研究报告显示,训练后形成的不同适应并未在相同维持剂量下表现出完全一致的保持轨迹;年龄也改变了维持某些结构性适应所需要的训练负荷。

如果“最低剂量”是整个能力的单一属性,那么同一个人的不同适应分量不应在相同维持条件下明显分离。但真实数据恰恰出现分离。于是本章原先最简单的标量模型受到不利结果,必须修订。

航空研究提供了第二次跨领域重复。Casner等观察到人工操纵、仪表扫描和某些程序化技能相对保持,而导航、程序推进和异常识别等认知性任务更容易出现问题[3]。这里同样出现“某些部分仍然良好,却不能代表整个接管能力仍然良好”的结构。

因此,本章放弃“一个能力—一个最低维持剂量”的命题,改为“一个接管路径—多个不同衰减速度的能力门—一个由最弱门约束的剂量向量”。这次修订不是为了让理论更复杂,而是因为简单模型无法同时容纳运动训练和航空自动化内部已经存在的不利材料。

正常运行长期没有事故究竟能证明什么

现在可以回答本章最容易被直觉误导的问题:如果AI在绝大多数正常情境中长期稳定,系统没有出现严重事故,这是否证明人机协作越来越成熟?答案是,它可以证明某些东西,但不能证明全部。

它可以说明在已经发生的任务与环境分布中,主运行通道没有暴露严重失败;可以说明AI、流程和人类监督组合在过去获得了较好的总体结果;但它不能单独说明长期待命的人类备用路径仍处于可调用状态。原因并不是我们已经知道人一定退化,而是这项观察对备用通道缺乏识别力。

因此,正确表达不是“零事故说明人已经退化”,也不是“零事故说明人仍然可靠”,而是“零事故不能区分这两种状态”。在安全工程语言里,这意味着备用能力存在可能长期不可见的潜伏失效。

这一逻辑还产生一个悖论:AI越可靠,真实故障越少,人获得自然接管练习的机会也越少。AI可靠性提高一方面降低了主通道风险,另一方面增加了备用能力长期未被需求的时间。最终是否应该延长或缩短人工测试间隔,不能由“AI更强了”直接决定,而必须同时考虑AI失效概率、失效后果、人工能力衰减速度、自然练习频率、环境变化速度与测试成本。

为什么不能等到AI真正失败再验证人会不会接管

“真实故障发生以后再让人接管”看似最节省成本,因为不需要额外演练。但它实际上把训练、测试和正式任务压缩到同一个时刻。如果人通过,系统没有问题;如果人失败,代价已经发生。

对低后果、可逆任务,这种策略完全可能合理。一封普通邮件写坏了可以重写,一个低风险脚本失败可以回滚,一次非关键检索判断错误可以继续搜索。因此,本章并不主张所有AI使用都需要正式接管证明。

但随着错误后果提高、传播范围扩大、可逆性降低、发现延迟增加,第一次验证人工备用能力的时点就必须前移。测试失败可以训练以后再来;真实接管失败则可能没有第二轮。

所以AI治理不仅需要对模型风险分级,也需要对人类备用能力的证明要求分级。低风险任务可以依赖真实工作中的自然学习,高风险任务则需要在真实故障以前用模拟器、沙箱、历史案例回放、数字孪生或安全隔离环境完成证明。

为什么也不能把“完整脱AI重做”当成默认答案

另一个极端是规定每周一天禁止AI、每月完整人工重做、所有关键岗位持续手工完成固定比例任务,或所有AI结果都必须人工完整复算。此类规定看似谨慎,却可能把能力维护变成新的低价值劳动。

核工程的监督试验逻辑提醒我们,测试本身也有成本和风险。人的能力维护同样会占用生产时间、增加认知疲劳、制造抵触,并可能为了“给人练手”而故意放弃原本更安全、更准确的自动化工具。若没有证据表明完整重演比更小的定向刺激带来更高的接管可靠度,那么高成本全量练习本身就需要被证明。

本章因此主张:尽可能彻底地外包低价值生产劳动,同时尽可能精确地保留高价值接管刺激。这两个目标并不冲突。真正成熟的维护制度甚至可能让人比过去更少手工操作,却因为训练更集中地击中异常发现、情境重建和独立裁决,而获得更高的真实接管可靠度。

应用场景:三类知识工作的维护设计

研究者:保留证据链而不是保留全文手工生产

在研究工作中,AI可以长期承担候选文献搜索、摘要、参考文献格式、初稿结构、语言润色和基础统计代码。为了维护研究能力,没有必要要求研究者周期性完全手工重做一篇综述。真正值得保留的最低调用包括:直接阅读少量承重原文;在看AI结论前先写下关键预测;随机核查引用与原文是否一致;处理一次真实或模拟的证据冲突;判断一项统计结果究竟支持什么结论以及什么新证据会推翻它。

对应的接管证明可以是一份总体高质量、但其中一条承重引用被错误解释的AI综述。测试不只看最后能否找到错句,而看研究者是否主动发现异常、能否回到原始论文、能否说明错误影响哪一个推理节点、能否重新形成结论,并改变下一轮检索与引用核验规则。

软件工程师:维护故障闭环而不是维护键盘输入量

在软件工程中,AI可以大量承担模板代码、接口封装、测试样例初稿、文档和常见重构。用“手写代码字符数”作为能力维护指标,会把维护对象放错位置。更关键的是从日志发现异常、理解依赖关系、形成故障假设、阅读陌生代码、决定修复还是回滚、执行安全操作并确认服务恢复。

因此,一个二十分钟的故障注入可能比数小时无AI编程更有信息量:AI助手临时不可用,系统出现一个非显式错误,工程师必须从监控、日志、提交记录和程序行为重建状态。若他能够写大量代码却无法完成这种接管,说明生产技能仍在而备用控制能力已经发生断裂。

管理决策者:维护终止冲突的证据路径

在管理决策中,AI可以承担资料整理、风险表、方案比较、概率估计、会议摘要和情景推演。管理者不需要重做所有计算,却必须保留识别关键假设、知道什么变量改变会推翻结论、区分事实判断与价值排序、在多个AI结论冲突时确定异源证据并承担最终干预后果的能力。

一个有效的证明场景可以让三个AI都支持方案A,同时在原始材料里放入一个已经变化的关键约束。真正需要观察的是管理者是否会回到现实条件,发现这个约束使原问题失效,而不是看他能否复述“决策的五个原则”。

AI本身如何参与能力维护,以及它不能承担什么

AI完全可以成为能力维护基础设施的一部分。它可以生成大量情境、随机改变参数、模拟用户与系统、追踪各接管门的历史表现、识别长期未调用的能力,并根据过去失败自动提高或降低训练难度。若不充分利用AI,能力维护本身很容易变得过于昂贵。

但存在一条不可取消的边界:负责日常工作的同一个失效源,不能同时垄断接管测试的出题、事实来源和最终评分。若同一个AI生成错误答案、告诉人哪里错、再评价人的纠正是否正确,测试很可能只能证明人能够重新服从同一个模型。

因此,高价值接管证明至少需要一个相对独立的外部锚,例如真实原始数据、已人工核验的历史案例、确定性程序测试、独立专家、不同来源模型、真实系统反馈或预先冻结的参考答案。AI可以承担训练成本,但不能垄断真值来源。

维护失败后的处置:从“惩罚个体”转向“校正剂量与授权”

如果一次接管证明失败,最差的管理方式是立即把结果解释为个人能力标签。这样会迅速诱发应试优化,员工开始学习如何通过测试,而不是如何维持真实能力。

本章提出的第一解释应当是:当前维护制度对某一个接管门给出的剂量可能不足。异常发现失败,则增加无提示异常案例和原始数据抽检;情境重建变慢,则增加直接接触原始记录;独立判断失败,则增加冲突证据裁决和先写判断;执行错误,则增加沙箱操作;恢复验证缺失,则强制训练在“结果出现以后继续验证”。

同时,严重失败可以暂时收紧AI授权。例如在重新训练期间增加第二人复核、提高关键任务中的人工参与比例、缩短下一次证明间隔,或暂停某类高后果自动批准。能力恢复以后再逐步放宽。于是测试结果不只是“考试成绩”,而成为下一轮人机任务分配的反馈控制信号。

与近邻概念的判决性划界

其中,与自动化脱环的距离最近。若本章只说“长期用AI会让人失去情境意识,因此要多练”,那么完全可以被既有研究吸收。本章必须额外承担一个更难的预测:在维护总时间相同或更低的情况下,按接管门分配的微调用加低频完整证明,应能比简单增加人工参与比例更有效预测并维持真实接管表现。

与最低训练剂量的边界同样清楚。若把MTMD解释成“运动训练最低剂量在认知工作的类比”,创新仍然不足。真正的新增结构是,剂量不仅维持能力分量,还与待命暴露、扰动证明、AI授权和失败后的再分配闭合为一条循环;其目标不是保持某个成绩,而是保持从AI主控状态重新进入人工控制的能力。

在本书内部,与本章距离最近的是第三章。两章都给出了一条循环:本章是"拆门—微调用—待命暴露累计—风险触发证明—扰动接管—恢复回写",第三章是"首判—协作—差分—盲段—恢复"。相似程度足以让读者怀疑它们是同一条循环换了措辞。

分界在目的,而且这条分界是可判定的。本章的循环是为了让能力保持可用,第三章的循环是为了让能力保持可见。前者若成功,人的真实接管可靠度提高;后者若成功,系统对人的能力状态的判断精度提高,而人的能力本身可能一点没变。二者可以分离:一个组织完全可以做到证据永远新鲜(第三章的读数良好),而所有刷新事件都过于轻量,不足以维持接管门的剂量(本章的读数不合格)。合并条件因此也很清楚:若按第三章的校准回路执行一年,真实接管可靠度的提升与按本章的剂量向量执行没有差别,则维持与校准不是两件事,本章应并入第三章。

与第一章的关系则是处方与判定的关系:第一章给出能力归属在断面上的判定条件,本章不重新定义那个条件,只回答如何以最低成本让它长期保持可满足。

可证伪命题与未来实证设计

六条判决性预测

预测一:定向微剂量可以在更低成本下达到不差于完整任务重演的接管可靠度。

若相同时间预算下,完整无AI重做显著优于分门微调用+低频证明,则本章的压缩维护主张失败。

预测二:普通知识与操作平均分会系统性高估真实接管可靠度。

若传统考试已经能够稳定预测无提示异常发现、情境重建、干预和恢复,则没有必要采用串联门。

预测三:不同接管门在长期AI代行后会出现非同步衰减。

若D、R、J、I、V总是以近似相同比例共同变化,则MTMD向量化缺乏必要性。

预测四:最大静默期+事件触发应优于纯固定日历。

若模型升级、环境变化等事件并不会提高后续接管失败风险,则事件触发部分应被删除。

预测五:同一AI同时承担工作、出题与评分会高估人类独立能力。

若与独立真值源相比完全没有差异,则共同模式验证失效的担忧被削弱。

预测六:一次通过能力认证不能保证未来维护方案有效。

若初始接管成绩对长期高AI代理后的接管表现具有近乎完全稳定的预测力,则持续维护模型价值显著下降。

纵向实验设计

未来最重要的研究不是继续增加理论概念,而是建立纵向数据。可以选择已经熟练掌握某项任务的专业人员,将其随机分为四组:A组持续完整人工练习;B组正常使用AI但按固定周期做完整无AI测试;C组正常使用AI,只保留分量化最低真实调用并采用风险触发的接管证明;D组自由使用AI,不设置专门维护。

观察周期可设为半年至一年。平时记录AI调用比例、人工独立处理量、原始信息接触量、异常发生次数、模型版本变化和任务环境变化。主要终点不应是AI在线时的生产率,而应是隐藏扰动条件下的异常发现率、接管启动时间、情境重建正确率、独立裁决质量、干预成功率和恢复验证完整率。

进一步可以使用生存分析或可靠性模型估计:从上一次真实独立调用开始,某一道接管门失去合格状态的风险怎样随时间变化;不同AI代理比例、任务风险和环境变化速度怎样改变这一曲线。只有到这一步,“最低接管维持剂量”才会从理论构造转化为不同职业、不同任务可经验校准的参数。

伦理与治理边界

把核设施证明试验的结构迁移到人机协作,必须同时拒绝把人简单等同于机器。人的能力受学习、动机、疲劳、迁移、团队关系和组织文化影响,不能通过设备可靠性模型直接外推。本章使用“待命系统”“潜伏失效”“证明试验”等术语,只是在结构层面描述“长期不被真实需求的备用路径怎样获得证据”,并非宣称人的心理机制与设备失效机制相同。

第二,高风险领域不能为了测试人工接管而制造真实危险。优先使用模拟器、沙箱、历史案例回放、数字孪生和安全隔离环境;真实生产系统中的人工接管演练只能在风险可控条件下实施。

第三,接管保真度首先应被用来定位维护制度和任务分配问题,而不是形成不透明的人事排名。若组织将该读数用于岗位、薪酬或晋升决策,必须公开编码规则、最低阈值、数据来源和复核渠道,并允许人员对错误标记和不合理测试条件提出复核。

第四,不能为了让人工备用能力“看起来更强”,而人为阻止本来更安全、更可靠的自动化。在安全关键系统中,人工训练应尽量移入模拟环境,而不是通过真实降低自动化水平来制造练手机会。

讨论:AI时代真正需要保存的不是人工劳动份额,而是异源冗余

随着AI能力持续提高,一个更深的组织结构变化正在出现:过去机器经常是人的备用工具,未来很多任务中,人可能逐渐成为AI主通道的备用路径。传统组织却仍然用“岗位上还有一个人”“最终按钮由人点击”“有人负责审核”来推定人工冗余存在。

这种推定并不可靠。真正的冗余不是组织图上还有一个人,而是系统中仍然存在一条独立、可启动、可运行、可恢复的控制路径。如果一个专业人员连续多年只阅读AI摘要,从不接触原始事实;只批准AI建议,从不形成独立预期;只在AI提示以后处理异常;只会用另一个AI检查第一个AI,那么人虽然仍然在流程中,备用路径却可能已经与主路径高度同源。

这会形成一种新的共同模式失效:AI因为某种系统性偏差判断错误,人因为长期依赖同类信息和同类模型,也以同样方式判断错误。此时所谓“人工监督”并没有提供真正的第二条路径。能力维护的意义于是超越个人成长,成为人机系统保护异源冗余的一部分。

这也改变了“human-in-the-loop”的理想。未来成熟系统未必要求人在每一步持续参与。大量低价值操作完全可以交给AI。更有价值的目标是:人不必始终在场,但必须始终有路回来。前者强调人工劳动占比,后者强调异常发生后人工重新取得控制的可恢复性。

因此,一个成熟的人机系统完全可能让AI承担95%的常规操作,人只承担5%的关键监督、抽检和维护事件;但一旦AI进入不可靠状态,这5%的持续刺激足以使人重新取得100%的必要控制。真正需要设计的不是人与AI永远各做一半,而是正常时期的高效率与异常时期的可接管同时成立。

结论

本章从一个表面简单的问题出发:当一个人已经掌握某项能力,但长期由生成式AI承担检索、分析、计算、写作、判断甚至执行以后,怎样才能既获得AI效率,又不让关键能力在漫长的低调用中失活?

航空人因工程表明,自动化可以提高正常绩效,却使接管越来越像一次从监督状态进入控制状态的冷启动;而且基础操作技能的保持不能代表认知性故障识别与情境重建同样保持。核设施运行与维修工程表明,长期待命而没有已知故障并不能证明备用系统可用,潜伏失效需要独立的证明事件,但证明频率又必须权衡测试成本。运动训练学表明,已经形成的能力可以用远低于形成期的剂量维持,但不同适应分量的最低剂量并不相同。

三者碰撞后,本章将能力维护的对象从“技能库存”改写为“待命—接管状态转换”,提出最低接管维持剂量MTMD与接管保真环TFL。前者要求对异常发现、情境重建、独立裁决、干预执行和恢复验证分别配置真实刺激;后者要求把维护组织成拆门、微调用、待命暴露、风险触发、扰动接管和恢复回写的循环。

由此,AI时代不需要人为保存大量低价值的手工劳动。检索第一遍、写第一稿、格式化、常规计算和机械执行都可以被深度外包。真正需要保护的是少数能够让人从AI主通道重新回到现实、形成独立判断并改变系统的关键能力门。

“系统长期没有出事”不能被当作人工备用能力已经被证明的证据;“还能复述标准答案”也不能等价于能够接管。真正有效的校验必须在AI不可用、AI与现实冲突、多AI分歧或任务越界之后观察:人能否自己发现异常、重建情境、形成判断、实施干预并验证恢复。

因此,AI时代能力维护最重要的目标不是让人一直和机器争夺操作权,而是做到:平时机器可以充分工作,关键时刻人仍然能够回来;而“能够回来”不能靠岗位名称、历史资格、正常绩效或主观信念来证明,只能通过低成本、真实、可裁决的接管事件持续得到证据。

附录A 核心操作定义与编码建议

附录B 研究边界与版本说明

本章属于理论与方法研究。航空、核工程与运动训练材料用于提取可迁移的结构,不主张飞行员、核设施设备、运动适应与知识工作者在心理或生理机制上等同。

MTMD、TFL、五门接管结构及待命暴露指数目前均为工作性理论构造,不是已经获得经验验证的行业标准。任何具体职业的测试间隔、最低剂量、通过阈值与关键时间窗都需要纵向数据校准。

本章对新颖性的主张限于当前检索与既有材料范围。自动化脱环、情境意识、deskilling、监督试验、证明试验、去训练与minimum maintenance dose均构成实质近邻。本章的工作性新意集中于:维护对象的状态转换化、维持剂量的分门向量化、校验的扰动复控化,以及测试结果与AI授权/下一轮剂量之间的闭环回写。若未来研究表明传统固定周期完整重演能以相同或更低成本稳定获得更高真实接管成功率,或普通知识技能测试已经能够充分预测扰动条件下的完整接管,则本章机制应被修订或放弃。

本章附表

学科路径它认为应当优先维护什么天然倾向的处方对另外两家的挑战
航空人因工程情境意识与接管表现让人保持足够的持续参与和近期经验持续参与可能成本过高,且不等于备用系统被真正证明
核设施运行与维修工程待命系统的可用性通过监督试验发现潜伏失效试验能证明可用,但并不直接告诉每个能力分量如何最低成本维持
运动训练学已经形成的适应用低于形成期的最小刺激维持目标适应只谈剂量仍可能漏掉“何时必须从待命跃迁到控制”的系统问题
接管门核心问题典型退化表现最低真实调用示例
D 异常发现我能否先于AI提示发现“不对劲”?只会处理已被标红的问题无提示错误案例、随机原始数据抽检
R 情境重建我能否重新知道系统现在发生了什么?看得懂结论,但离不开AI摘要直接阅读原始记录、日志、论文、数据
J 独立裁决AI冲突时我凭什么结束争议?继续问更多AI,无法独立收敛先写判断、异源证据比对、反例裁决
I 干预执行我的判断能否改变真实任务状态?理论知道,但无法安全操作沙箱操作、回滚、人工处置演练
V 恢复验证我怎么知道真的解决了?答对即停止,不验证后果复测、监控、闭环核验、复盘回写
扰动类型基本设置主要测试对象为什么不能被其他类型替代
A 断援型AI暂时不可用基础路径、原始信息获取、独立执行最容易实施,但受试者从一开始就高度警觉
B 冲突型AI在线但给出与现实证据不一致的合理结论异常发现、独立证据、纠错最接近日常“系统看起来正常但其实错了”
C 多代理分歧型多个高质量AI给出互不兼容建议独立裁决、证据层级、终止规则防止“继续问另一个AI”无限递归
D 越界型AI执行旧规则无错误,但环境或约束已变化问题重定义、适用边界、情境重建测试能否发现“问题已经换了”而不是只找幻觉
近邻概念它已经解决的问题本章不能被其吸收的部分判决性对照
Out-of-the-loop / 情境意识自动化为何削弱监督、故障接管和状态理解如何按能力门配置最低剂量,并让证明结果回写AI授权若仅提高SA即可预测全部D-R-J-I-V,则TFL多余
Proof / surveillance testing怎样发现待命设备潜伏失效并优化试验间隔把人的能力分量、真实调用和AI授权纳入同一维护循环若设备式单一可用/不可用测试足以预测人的复杂接管,则MTMD多余
Minimum maintenance dose / detraining降低训练量后怎样保留身体与技能适应把剂量对象从单一表现改成多门接管状态转换若一个标量剂量即可同时稳定所有接管门,则向量模型错误
Deskilling技术和劳动组织怎样减少技能内容研究已经获得的关键能力如何在长期待命后保持可调用若只测长期技能内容下降即可预测即时接管,则本章无新增量
断代理复闭环判据某一时点能力是否仍归属于主体怎样使这一能力归属跨时间持续成立若一次认证即可长期预测未来接管,无需维护模型
变量建议操作定义不通过示例
D 异常发现在未被告知错误位置前,指出足以改变任务方向的异常并给出依据只在AI提示后才发现;把无关差异误判为关键异常
R 情境重建从至少一个相对独立的原始来源重建当前状态、约束和已完成步骤只能复述AI摘要;无法说明哪些信息仍可信
J 独立裁决在冲突信息中给出可复核理由,并说明什么新证据会使自己改变判断以AI多数票、模型名气或语言流畅度作为唯一理由
I 干预执行在允许环境内实施能够改变任务状态的操作,并控制可预见风险知道答案但不能安全执行;操作与判断不一致
V 恢复验证用预先定义的结果或反馈确认恢复,并检查残余风险与副作用输出正确答案即结束;不确认真实系统是否恢复
© 德麦国际出版社 · 孔凡鹤《一直没出事》· ISBN 979-8-90690-011-1