读数需要的实验,本书列五个,按可行性排——最便宜、最承重的排前面。每个实验给:要测什么、怎么测、预测什么、什么结果作废什么命题。
排序的原则来自本书作者产线上的一条经验:最便宜 × 最承重。便宜是指可以用现成材料做,不需要招募、不需要审批;承重是指检验的是承重件本身,不是替代物。五个实验里,前两个可以现在做,第三、四个需要一个学期,第五个需要公开语料。
测什么:δ 在四样器具上的三个分量——刀、笔记本、眼镜、AI。
怎么测:每样器具在三个方向各测一次。人际方向:同一器具给两个人用,比较产出(对 AI 就是换人不换刀)。时间方向:同一器具用一天和用一年,比较它带来的差异。互动方向:同一器具连续使用前后,比较。AI 的三个分量用同一个账号、同一个模型做;刀、笔记本、眼镜用同样的框架,只是产出的测法要按器具定(刀测切菜的均匀度,笔记本测记录的可用度,眼镜测视力表)。
预测:刀、笔记本、眼镜三样 δ 三个分量都落在阈值内;AI 三个分量都跳出,且人际方向的差异随使用时长增长。
作废什么:若 AI 的 δ 未跳出阈值,或刀、笔记本、眼镜中有一样跳出——「旧范式是新范式在 δ→0 时的退化情形」降为比喻,第八章重写。
为什么排第一:它是命题一的形式证据。没有这张表,「器具可消去=读数为常数」只是说法,对手一句「你只是重新描述」就能打回转移档。而且它便宜:四样器具都是日常物,两个人、一个账号就能做。前文的「换人不换刀」实测就是这张表里 AI 那一行的人际方向——它是本书第一个要跑的东西。
测什么:器具可消去是不是使用时长的函数——换工具后产出回落的幅度,与原工具使用时长是否正相关。
怎么测:找一批手艺人(木匠、厨师、乐手,各有自己的「那一把」),记录各自现用工具的使用时长,换以同型号新工具,测产出回落幅度(第一周的产出与换前的比)和恢复时间(回到换前水平要几周)。
预测:回落幅度与原工具使用时长正相关;用一年的换掉退几天,用十年的退几周,用三十年的退一个月。
作废什么:若回落幅度与使用时长无关——用一年和用三十年换掉回落一样——「器具可消去是互动时长的函数」作废,器具可消去回到种类属性,第九章重写,第八章的渐变线改为台阶。
为什么排第二:它是第九章「手感在边界上」的直接检验,也是刀和 AI 之间是不是连续谱的判决。便宜:手艺人有的是,工具可以借。
测什么:γ 在学校奖惩上的取值,以及 γ 的个体差异是否大于规则差异。
怎么测:在一次学校奖惩(调座位、不让参加小组、不表扬,或反向的奖励)之前和之后,让学生对同一组情境做排序——先做什么(场)、和谁一起(分布)、哪个好(美)——排序变动量为自我界三号位改变量;与奖惩的现实界改变量之比为 γ。同一规则施于多个学生,比较 γ 的个体差异;同一学生施以不同规则,比较 γ 的规则差异。
预测:同一奖惩规则下 γ 的个体差异大于规则差异——也就是说,谁被罚比怎么罚更决定传导。
作废什么:若 γ 的个体差异不大于规则差异——传导率对教育评价无解释力,第三十八章「评价效力=约束×γ」「改进空间在 γ 上」两条降为假设。
为什么排第三:需要一个学期和一个班,比前两个贵;但它是命题三的第一个实测,也是「因材施教=找接口」这句话能否落地的判决。
测什么:做与不做第三段传导,同类错误的复现率是否不同。
怎么测:取使用 AI 出错后的用户(比如撞了车的写作者),分两组。一组只做自我反省(前两段:文章不发、自己检讨);一组同时被要求重写提示或档案(第三段:把占位者写进档案、在提示里加「先查再说」)。追踪两组在之后若干次同类任务里同类错误的复现率。
预测:做第三段的一组复现率显著低于不做的一组。
作废什么:若两组复现率无差异——「复合体由人代为传导」降为规范建议而非机制描述,第四十一章的操作定义失去第二项。
为什么排第四:它是第四十一章那个真实案例的对照版,也是本书对开篇难题的回答能否成立的判决。它能做,是因为第四十章说的:AI 的直写可以重复,人的传导不能。需要的材料本产线现成——出过错的稿子、可改的档案、可追踪的复现。
测什么:f 被技术抬高之后,收纳词的使用频率是否下降、可记录项是否上升。
怎么测:远程办公普及前后,团队协作的管理文档里「默契」「配合惯了」一类表述的出现频率,与协作软件里可记录的协作项(谁在几点回了谁、哪个决定是谁先提的)的数量。两条线并排,看转折点是否与远程办公比例的转折点重合。第二条线用跨国流动之于「水土」:居住偏好清单的字段数量与「住不惯」类表述的频率。
预测:收纳词频率下降,可记录项上升,转折点重合。
作废什么:若时间序列不呈现预测的转折——「收纳词寿命=分离频率倒数」降为比喻,第五章的边界判据改为定性。
为什么排第五:它需要公开语料和时间跨度,是五个里最贵的;但它是唯一在 AI 之外检验本书命题的实验——如果只在 AI 上成立,本书说的就只是 AI 的事,不是主体性的事。
研究 B(同像异修与描述删除):在不伤害真实学生的沙箱里设置可审计的错误来源,保持当前答案或得分相同,改变来源位置、传播范围或应保留的正当方法。让独立处置者在相同资源预算下分别获得四种描述:只有输出与得分;单端能力描述;完整但不用 SIO 术语的普通过程描述;用三号位组织的同量信息描述。后两组最要紧:若三号位组只因信息更多而获胜,只能证明需要更多过程信息,不能证明三个名字本身带来优势。终点:是否选中可接受修复、诊断成本、复发率、受损方恢复、保护特征损失。删除试验从完整描述中分别删分布、场、美,保持总阅读预算可比;删某类信息不损害任何预定终点,就收缩该类信息的必要性主张。
研究 C(保全性修复与清空式修复):对已定位的错误比较三种方案——只修最终回复;针对路径修复并检查保护集合;全面清空个性化配置——另允许「暂停并进一步诊断」作为安全分支但归为控制风险未完成恢复。判断用约束不用总分:先看风险是否被控制,再看受损条件恢复,最后比较无关正当特征是否仍在。某方案不能达到安全要求,K 再高也不判成功;若全面清空最安全而局部修复不可靠,实践中可能应当清空或停用,同时如实报告特征损失。本书的预测只在「存在有效局部路径修复且保护集合与错误路径可分离」的条件下成立,不是「局部修复永远优于全局重建」。
两个研究都未执行。它们与实验四是同一条线的三个精度:实验四问做不做第三段,研究 C 问第三段怎么做,研究 B 问哪些描述是第三段不可省略的。
五个实验各对一条命题的一处承重:
| 实验 | 读数 | 承重件 | 作废的章 |
|---|---|---|---|
| 一 四器具常数表 | δ | 旧范式=退化情形 | 第 8 章 |
| 二 老木匠换刨子 | δ_时 | 器具可消去=时长的函数 | 第 9 章 |
| 三 教育传导率 | γ | 评价效力=约束×γ | 第 38 章 |
| 四 第三段的复现率 | γ(复合体) | 由人代为传导 | 第 41 章 |
| 五 收纳词时间序列 | f、L | 边界按频率划 | 第 5 章 |
没有一个实验检验命题二,因为命题二是清单命题——第三十四章的逐条对格就是它的检验,能推翻它的不是实验,是清单上出现一条不经三号位的手段。
五个实验目前一个都没跑。下一章说这件事。
本章日常案例:一把刨子,一个班,一份出了错的稿子。
本章术语进场:五个实验的编号与作废对应表。
本章压回命题:命题一(实验一、二、五)、命题三(实验三、四)。
本章来源:五个实验——复合体(《典范革命》论文第十二节);「最便宜×最承重」的排序原则——本产线规程。