DEMAI INTERNATIONAL PRESS · 专著第 78 号
一直没出事,不能区分两种状态

一直没出事

AI 时代,能力、判断与责任如何先失去可观测性
孔凡鹤 著 · 287 页 · 前言·导读·导论·四编十一章·结语·参考文献·后记 · 约 20.2 万字 · 文献 235 条 · ISBN 979-8-90690-011-1 · 定价 US$22.00
全书写死三条撤回条款:日常绩效若能稳定预测断口读数,工程建议全部撤回;断口读数若不能预测真实失效,本书只是昂贵考试;制度化后最省事的达标方式若摧毁所保护之物,实践上撤回。第十章另点名三对最可能被合并的章节及其合并条件
《一直没出事》封面
母 题 · CORE THESIS

航空用它证明机队适航,核电用它证明备用系统可用,学校用它证明教学没有问题,企业用它证明治理健全。"一直没出事"是人类最常用、也最省钱的安全论证。

这句话有一个从未被明说的前提:产生结果的过程与承担能力的主体,是同一个。一份合格的报告出自一个会写报告的人,一次平稳的着陆出自一个会着陆的飞行员。生成式人工智能抽掉了这个前提。于是它变成一句同时与两种相反状态都相容的话——人仍然完全胜任,以及人早已不能接管。中心判断因此是:能力、判断与责任并不是先失去,而是先失去可观测性;正常运行的成功本身销毁了证明它们仍在的证据,因此它们只能在代理被有意打断的断面上被重新判定。

九次换位

九章从九个互不重叠的学科组合出发,各自被逼出同一条判断。三列不是并列而是递推:正因为第一列失去了分辨力,第二列的中断才必须被主动安排;正因为中断是被安排的,第三列的读数才可能存在。

被当作"还在"的证据断口开在哪里读数
任务结果的质量对代理施加一条可判定的扰动生差·裁差·改向·回写四环节由谁重新闭合
长期正常运行、无事故在真实故障之前主动做接管证明发现·重建·裁决·干预·恢复五门是否全通
辅助状态下的当前表现周期性收回首判、差分、盲段与恢复证据龄比:距上一次独立证据过去多久
持续上升的绩效曲线锚定·扰动·撤援·延迟迁移四层测量绩效对潜在能力的预测力是否下降
最终由人签字、点击、批准扰动·反事实边界·重新发起三类测试是否持有理由、识别失效、主动重开
能解释、能举例、能迁移前提已被破坏的边界破坏任务首次边界修订由谁发起
流程上有明确的责任人事故前置审计与近失误保留认知可达性·因果控制·改写权限是否同在一处
已经检查了很大比例的内容与原生成路径失效模式低相关的程序残余未核错误是否仍足以翻转结论
多数人独立得出同一结论分布外、规则突变与共同盲点任务N_eff = n / [1 + (n−1)ρ]

这本书解决什么难题

公共讨论长期停在"人工智能让人变强还是变弱"。这个问题不可判定——我们观察到的每一个绩效数字,都是人的能力、AI 的能力、人机匹配与任务条件的混合量。争论多年不收敛,不是证据不足,而是用来做判决的那把尺子本身已经被污染。本书把问题换成可判定的那个:我们还能不能看见。

之所以重大,是因为当代有三套关键制度全都建立在那个已经失效的前提上:教育评价(只用产出评价能力的制度不只是测错,它奖励外包,因而主动加速不可见)、人类监督的法律安排(条文能要求"必须有人审核",却没有任何条款要求证明这个人还审得动)、高后果领域的安全结构("自动化常驻、人工可接管"这一假设在常态代行下从未被验证)。一句话:社会正在用一整套已经失去分辨力的仪表,驾驶一架越飞越快的飞机。

还有一层紧迫性:可观测性的丢失是不可逆的。要恢复证据必须先制造断口,而是否值得付这个成本,取决于对能力现状的判断——可那个判断恰恰已经不可得。越看不见,越不知道值不值得去看;越不去看,越看不见。

九个读数只有三种形状

九章的读数看似各不相同,实则只有三型。这决定了本书给组织的最短建议:九章,三种量表,一套记录格式——不要为每一章各造一套指标。

形状共同前提
串联门型一·二·五·六·七失效是路径性的,不是程度性的;一门不过整条路径不通,明令不许取平均
相关折扣型三·四·九有效证据量 = 名义证据量 ×(1 − 冗余度);同源的证据不能重复计数
成本效率型η = ΔR/c;全书唯一"做到哪里为止"的对象,其余都是"有没有"

本书自设盲区:九个读数没有一个是分布量。一个团队完全可能九项全部合格,而合格全部来自其中三个人。凡使用本书方法者,须同时报告参与率与事件集中度。

三对最危险的近亲

一本由九章构成的书最容易受到的攻击不是"这些说法不对",而是"这九章其实是同一章"。本书主动把最危险的三对摆出来,并写死可判定的合并条件——满足条件就合并,不辩解。

分界合并条件
三 ↔ 四
最可能
认识论主张(失去判断依据)vs 因果主张(能力与可见性同时下降)若经验上永远造不出"相关下降而锚定任务证明能力未降"的情形,两章合并,全书降为十章
一 ↔ 五能力可长期待命;判断必须每次重新形成两项测试在同一批受试者上相关高于 0.8
二 ↔ 三保持可用 vs 保持可见按校准回路执行一年,接管可靠度提升与按剂量向量执行无差别

怎么读这本书

导读给了四条路径,读者按自己的位置选一条。

管理者
约三万字
导论 → 第七章(责任与权限)→ 第三章(证据龄比)→ 第十一章 → 第十章换位表。在把这套方法接上考核之前,先读第十一章那条不可让步的底线。
教育工作者
约三万字
导论 → 第四章 → 第六章(越界熟练与边界破坏任务)→ 第三章 → 第十一章。这条路径回答"考试改成什么样才算数"。
研究者
约两万字
导论第三至六节 → 第十章全章 → 各章末尾的划界节。这是最快判断本书哪里可能是错的一条路。
二十分钟导论第一、三、四节,再读第十章那张四列九行的换位表。全书的判断与索引都在那里。

四章带公开数据的压力测试:第一章(四项在线实验,总样本 3,562)、第二章(去训练与维持剂量数据)、第三章(825 名学生的二次分析)、第六章(四项公开实验的反向约束)。四处都得到了对作者不利的结果,并都因此收窄了主张。若只想知道这本书有没有被数据管住,读这四节。

三种读法

姊妹卷:《照护的智慧》处理人与人之间的交接——一次"完成"由谁宣布、未被交出的那一份落在谁身上;本书处理人与外部认知系统之间的交接。两书共享同一种关切:一件事被宣布为妥当之后,还有没有人能够看见它其实没有妥当。

写作与证据声明

本书四章含公开数据的压力测试,所用数据均来自已公开发表的研究及其作者公开的原始数据与代码。四处压力测试均得到对作者不利的结果,并均导致原主张被收窄:第三章从"人工智能会首先让能力下降"收窄为"可以在不损害平均成绩的情况下降低能力信号的保真度";第一章从"闭卷重做"收窄为"定向扰动";第六章撤回了"人工智能代劳会削弱理解"这一宽命题。

本书提出的各项判据与读数尚未经过心理计量学意义上的效度验证,不应直接用作个人能力认证、职业资格判定或人事决定的依据。第十一章给出一条不可让步的底线:断口读数不进入个体的绩效、晋升与留用决定;保证不了这条底线的组织不应采纳本书方法。

本书的写作、检索与结构整理不同程度地使用了生成式人工智能系统。按本书自身的判据,这意味着本书的论证质量不能自动证明作者拥有相应的理解与判断。本书的处置是把每章的承重命题、竞争解释与撤回条件写死在正文里,使检验可以绕过作者进行。

出版信息

著者 孔凡鹤 · 出版发行 德麦国际出版社 Demai International Press · 出版地 美国 · ISBN 979-8-90690-011-1 · 2026 年 8 月第 1 版第 1 次印刷 · 16 开 170mm × 240mm · 287 页 · 约 20.2 万字 · 文献 235 条 · 定价 US$22.00 · 分类:人工智能 / 教育评价 / 组织治理 · 版权所有 侵权必究