← 专著首页目录📄 在线 PDF⬇ 下载德麦国际专著第 78 号

第十一章 断口测试自己会被应付掉

一套用于揭露遮蔽的方法,为什么会长出新的遮蔽;四种可预测的应付路径、四条对策及其代价,以及本书愿意接受的降级方案

一个必须由本书自己说出口的问题

前十章的建议可以概括成一句话:不要相信运行良好,要周期性地制造中断,在中断处读数。这套办法的说服力来自它揭露了一种旧办法看不见的东西。但一套办法一旦被组织采纳、写进制度、接上考核,它就不再只是一种观察手段,而成了被观察者所处环境的一部分。观察一旦变成环境,被观察者就会开始适应它。

这不是对本书的外部批评,而是本书自己九章逻辑的直接推论。第四章说得最清楚:当一个指标被用来评价能力,人和组织就会朝这个指标优化,而优化的最省事路径往往不是提高被测量的东西,而是提高测量结果。第七章说得同样清楚:无事故运行会让组织把"制度看起来有效"当成"制度确实有效"。把这两条推论用在本书自己身上,结论无可回避:

断口测试一旦制度化,最省事的达标方式很可能恰恰摧毁它要保护的东西。

第十章把它列为全书三条撤回条款中"最可能发生"的一条。本章的任务是把这条模糊的担忧变成可预测的具体形态、可执行的对策、可观测的预警信号,以及在对策失效时本书愿意接受的降级方案。一个不肯写这一章的理论,等于把自己失败的责任预先推给了执行者。

四条应付路径

应付不会以一种笼统的"敷衍"形式出现。按本书九章的读数结构,它有四条各自具体、各自可预测的路径。

第一条是预告化。 断口的全部价值来自被中断者事先不知道中断会在哪里、以什么形式发生。一旦接管证明被排进季度日历、盲段被固定在每月第一个周五、撤援任务写进培训计划的第三周,被测者所测到的就不再是"长期待命之后重新进入控制",而是"针对一次已知考试的短期准备"。第二章特意区分过这两者:接管的困难不在动作本身,而在冷启动;一次被预告的接管,恰恰把冷启动这一项去掉了。预告化最隐蔽之处在于,它使读数系统性变好——通过率上升,管理者看到的是能力提高。

第二条是题库化。 断口需要扰动,扰动需要被设计出来。设计成本使组织倾向于复用:同一批事实错误、同一组冲突答案、同一个被删掉的关键前提,第二年照旧使用。扰动一旦稳定,它就从"制造一次真实的越界"退化为"一道可以被认出的题"。第六章的边界破坏任务对此最敏感——它要求主体在表面相似而关键前提已改变时主动撤回,可如果这个"关键前提已改变"的信号本身变成了熟悉的题型标志,被测者撤回的依据就不是理解,而是认出了这是一道撤回题。这时读数记录的是应试敏感度,而第六章正是全书里最需要区分"会用"与"知道何时不用"的一章。

第三条是代考化,也是四条里最尖锐的一条。 当断口测试成为一项要通过的任务,人会用手边最有效的工具去准备它——而手边最有效的工具正是那个被测试要暂时切断的代理。研究者可以让模型帮他预演"如果这份综述里有一条引用被错误解释,我应该怎样发现";工程师可以让模型生成一份故障注入的应对清单;学生可以让模型替他准备"当模型出错时我该怎么答"。用被测对象来通过对它的测试,在形式上是荒谬的,在实践中却是最自然的选择。它的危险不在于作弊——多数情况下当事人并不认为自己在作弊——而在于它精确地复现了本书第一章要排除的那种状态:结果看起来是主体产生的,闭环实际上仍由代理闭合。

第四条是记账化。 第三章的证据龄比是全书最容易被制度直接吸收的一个读数,因为它形式简单:距上一次有效独立表现证据过去了多久。简单意味着可以做成字段,字段意味着可以做成看板,看板意味着可以要求它变绿。于是"刷新证据"就变成"把这个字段刷新",而一次为了刷新字段而安排的、时长最短、难度最低、恰好能被记为有效的独立回合,在账面上与一次真正暴露缺口的回合完全等价。第三章自己说过,清偿证据债不等于提升能力——记账化把这句话变成了制度性的常态:债一直在被偿还,能力从来没有被看见。

四条路径有一个共同结构,而这个结构正是本书第四章的循环换了个对象:指标持续变好,被指标指示的东西持续变得不可见。 本书写了十章去揭露这个循环,然后自己造出了它的第十次实例。

这不是执行不力

必须明确一点:上述四条不是"制度设计得不够仔细"或"执行者不够认真"的结果。它们是任何一种把观察接上后果的安排都会产生的。一个用于评价的量会被朝它优化,这是本书第四章引用组织学习与测量理论时就已经承认的机制;本书没有豁免权。

更具体地说,本书的方法有三处结构性弱点,使它比一般指标更容易被应付。

其一,断口是被安排的。 与真实故障不同,断口由人设计、由制度触发,因此它的时间、形式与难度都在组织的控制之内,而组织同时也是被这个读数评价的对象。第二章讨论核设施监督试验时提到过一个类似困境:试验本身有成本和风险,于是存在缩减试验强度的压力,而缩减之后账面上的可用性反而更好看。

其二,本书的多数读数是二值门。 第十章指出五章的读数是串联门型。二值门的好处是不许取平均,坏处是只要通过就没有区分度——它无法区分勉强通过与轻松通过,因此优化的目标非常明确:把每一道门都调到刚好能过。连续量至少还能显示分布变化,二值门不能。

其三,本书为了不让能力维护变成昂贵形式主义,主张最小化。 第二章的最低剂量、第三章的最短证据事件、第八章的最小充分验证,都在往"少而准"的方向压。这个主张本身是对的,但它与应付共享同一句口号:都在寻找通过的最低成本。 区别只在于一个要的是最低成本下的真实暴露,另一个要的是最低成本下的账面达标,而这两者在事前很难从制度文本上区分开。

承认这三处弱点,比声称本书方法足够严密要有用得多,因为对策必须针对具体弱点,而不是针对"态度"。

四条对策,以及每条的代价

以下四条对策与四条应付路径一一对应。每条都写明代价——不写代价的对策,本身就是本书第十章批评过的那种空转。

对策一:不可预告性。 断口的触发应由随机窗口与事件触发共同决定,而不由固定日历决定;被测者可以知道"本季度会有一次",但不应知道是哪一天、哪一个环节、哪一类扰动。第二章的"最大静默期加事件触发"框架已经给出了形式:日历只作后备,真正的触发来自模型版本变更、数据源变化、职责变化、长时间未遇异常等可见事件。

代价: 组织摩擦与信任成本。不可预告意味着人可能在高压时段被抽中,意味着一次失败的读数会被怀疑是时机不巧。若组织不愿承担这个代价,就不应声称自己在做断口测试,而应诚实地说自己在做定期演练——两者的价值不同,不应混用同一套结论。

对策二:扰动要生成,不要枚举。 扰动不应来自一份固定题库,而应从真实事故记录、近失误报告与当期系统变更中持续生成。第七章把近失误称为责任结构的传感器,此处它承担第二个功能:近失误是唯一一种既真实又不昂贵的扰动来源。 一个组织如果每年发生的近失误足够多、记录足够细,就永远不缺新的扰动。

代价: 需要维护一份不被考核的近失误库。这是最难的一条——近失误一旦与考核挂钩,上报量立刻下降,扰动来源随之枯竭。因此这份库必须与任何绩效评价彻底隔离,且隔离必须是可验证的,而不是承诺的。

对策三:断口测试期间禁止使用同一代理。 这一条针对代考化。测试所用的准备资源、判定标准与被测能力,必须与被切断的那个代理在失效模式上低相关。第八章的"证据独立度"与第九章的"独立性折扣"在此处直接可用:如果被测者的准备、执行与自评全部经由同一个模型,那么这次测试的有效独立判断数是一,无论过程看起来多完整。

代价: 成本与可行性。要求异源工具意味着组织要为断口测试单独准备一套不同来源的判定材料,而在某些领域根本不存在真正异源的第二条路径。此时正确的做法不是假装做到了,而是在记录中标注这次测试的独立度不足,并按第九章的折扣规则降低它的证据权重。

对策四:断口读数只用于诊断,不用于个体奖惩。 这一条是四条里最重要的,因为前三条的效力都依赖于它。一旦读数与晋升、考评、留用挂钩,被测者优化读数的动力将大于任何技术性防护:日历会被打听出来,扰动会被交流出来,代理会被用来准备,字段会被刷绿。反过来,如果读数只进入"哪些能力节点正在变空"的诊断,被测者没有理由伪装,一次不通过反而是有用的信息。

代价: 组织不容易接受一项要花钱、要占时间、却不能用于人事决定的测量。这一条的说服只能靠一个论证:读数一旦用于奖惩就会失真,失真之后连诊断价值也没有了;用于诊断的读数是真的,用于奖惩的读数两头落空。

一条不可让步的底线

上一节四条对策不是并列的。对策四是其余三条的前提。 如果断口读数被用于个体奖惩,前三条对策会以可预测的方式失效:不可预告性会被组织内部的信息流动抵消,扰动生成会因近失误上报枯竭而退回题库,异源要求会因成本压力被形式化为一句声明。

因此本书给出一条不可让步的底线,任何声称采用本书方法的组织都应当明示:断口读数不进入个体的绩效、晋升与留用决定。 它可以进入岗位配置的讨论(哪些节点需要更多支持)、进入系统设计的讨论(哪些环节的自动化程度需要调整)、进入培训资源的分配,但不进入对某个人的评价。

这条底线也划出了本书方法的适用边界。在无法保证这条底线的组织里,本书的建议不应被采纳——不是因为它没用,而是因为它在那种环境下会以看起来成功的方式失败,这比明显失败更糟。

怎样知道应付已经发生

对策会失效,底线会被侵蚀。因此需要一组不依赖当事人自述的信号,用来判断断口测试是否已经退化。以下五个信号都可以从记录本身读出,且都指向本节前述的具体路径。

信号一:通过率单调上升,而恢复时间不变。 如果历次断口测试的通过率持续提高,但真实事件中的异常发现速度与恢复时长没有同向改善,那么提高的是应试而非能力。这一条对应预告化与题库化。

信号二:首次边界修订全部发生在提示之后。 第六章的关键读数是撤回由谁发起。如果记录显示几乎所有的撤回都出现在测试者给出提示、追问或倒计时之后,而自主撤回的比例接近零,那么被测者掌握的是应答流程而非结构边界。

信号三:证据刷新集中在窗口末尾。 第三章的证据龄比若被记账化,刷新事件的时间分布会出现明显的尾部堆积——大量刷新恰好发生在窗口到期前的最后几天,且时长与难度显著低于窗口内其他时段的刷新。这是记账化最容易被抓住的痕迹。

信号四:不同人的断口记录趋于同质。 如果不同背景、不同资历的被测者在同类扰动上给出的判断路径、措辞与裁决依据高度相似,多半说明存在共享的准备材料或共同的代理。这一条正是第九章的方法用在本书自己身上:记录之间的相关性上升,意味着这批读数的有效独立数在下降。

信号五:同一扰动复用超过若干次后通过率跃升。 这是题库化最直接的证据,也最容易检验——只需在记录中标注每个扰动的复用次数,观察通过率与复用次数的关系是否出现台阶。

五个信号中,信号一最重要但最慢,信号三与信号五最快也最便宜。任何采用本书方法的组织,至少应当记录扰动的复用次数与刷新事件的时间分布——这是两项几乎零成本的自我监测,却能挡住四条应付路径中的两条。

如果应付不可避免

假设上述对策全部部署,五个信号仍然出现,本书应当怎么办?此处给出两级降级方案,而不是坚持原方案。

第一级降级:缩小到高后果节点。 放弃在全部能力节点上做断口,只保留那些"若 AI 在此出错、未来仍要求人发现、限制或恢复"且后果不可逆的少数节点。节点越少,扰动越可以做到真实且不重复,不可预告性越容易维持。这一级的代价是覆盖率——大量中低后果的能力将不再被观察,本书接受这个结果,因为一份小而真的读数优于一份全而假的读数。

第二级降级:只记录,不结论。 放弃"通过/不通过"的判定,只保留过程记录:谁在什么时间发现了异常、依据什么、下一步做了什么、结果如何。不打分意味着没有可优化的目标,应付的动力随之消失;代价是失去了可比性与聚合能力,读数无法进入任何管理看板。

如果连第二级也无法维持——即组织在没有分数的情况下不愿投入任何资源做中断——那么本书对该组织的建议只剩下一句,且这句话不需要任何制度支持:在把 AI 的结论用于不可逆的行动之前,先写下一句"如果这是错的,最先出问题的会是什么",然后去看那一处。 这是本书全部方法压缩到零成本时剩下的东西。它比什么都不做要好,也比一套被应付掉的制度要好。

本章自己也会被应付

最后必须承认:本章同样可以被应付。一个组织完全可以把本章的五个信号做成一份自查表,每季度填写,全部打勾,然后宣布自己没有发生应付。这正是本书第七章描述的那种情形——形式责任越明确,实质责任越可能落空。

本书对此没有更高一层的解法,而且相信不存在这样的解法:任何一层监督都可以被下一层的形式化吞掉。本书能做的只有两件事。

第一,把判断权留在组织之外。本章的五个信号全部是从原始记录(扰动复用次数、刷新时间戳、撤回发起方、记录文本相似度、恢复时长)算出来的,不依赖任何自评。因此只要原始记录对外部审查者开放,应付就无法只靠自查表完成。本书对采用者的最后一项要求是保存并开放这些原始记录,而不是保存结论。

第二,承认这本书可能是错的,并说明它错在哪里最有价值。如果若干年后回看,本书方法在多数组织里演化成了又一套季度合规动作,而人的接管能力与判断归属并未改善,那么这不会是执行的失败,而是本书第十章第三条撤回条款的兑现。届时值得研究的问题也已经变了:不是"怎样测出人还在不在",而是"为什么每一种用来揭露遮蔽的办法,最后都长成了新的遮蔽"。那个问题比本书大,本书只能把自己作为一个案例交给它。

© 德麦国际出版社 · 孔凡鹤《一直没出事》· ISBN 979-8-90690-011-1