跨学科出创新——这几乎是一句不需要论证的常识。而按第 48 章乙家(杂种优势),它需要一个限定:
杂种优势随亲本遗传距离上升而增加,但只到某一点;距离再增,配子不亲和、染色体配对失败、后代不育。
⇒ 移到本编:
预言二:跨学科碰撞的创新产出,对学科距离呈倒 U 形——存在一个最优差异窗。
这条预言与通行说法(越跨越好)直接冲突,因而是可裁决的。⇒ 它也是本编三条预言中最有实际后果的一条:若为倒 U,选源纪律就必须给出距离的上限;若为单调,第 49 章"三家不许挤在同一处"就该改写为"越远越好"。
做法(分类表与距离规则在看关系之前写死):
结果:65 条中 45 条因含不可归类词被丢弃,去重后可用样本 17 条。
| 距离 D | n | 均值 | 中位数 | 范围 |
|---|---|---|---|---|
| 0 | 2 | 136.3 | 136.3 | 132–141 |
| 2 | 7 | 136.9 | 137.0 | 132–142 |
| 3 | 1 | 155.0 | 155.0 | — |
| 4 | 4 | 142.6 | 142.0 | 139–147 |
| 5 | 3 | 139.4 | 139.1 | 138–141 |
二次拟合:IQ = 134.40 + 3.294·D − 0.3877·D²;D² 系数为负,峰值 D ≈ 4.25。⇒ 表面上与预言二一致。
D = 3 那一格只有 1 个点,分值 155。查其来源:它是一个作品索引页,不是一篇论文——抓取时误把索引页当作了论文页。
去掉这一个点之后:
| 处理 | n | D² 系数 | 峰值位置 |
|---|---|---|---|
| 全部 | 17 | −0.3877 | D ≈ 4.25 |
| 去掉那个误抓点 | 16 | −0.0405 | D ≈ 16.8(超出取值范围=无峰) |
| 同作者同组合只取一篇 | 16 | −0.4790 | D ≈ 3.84 |
⇒ 去掉一个误抓的点,倒 U 就塌成了一条近乎水平的线。
正确的结论只能是:数据不足以裁决。三条理由写死:
1. 样本量太小(16–17),且 D 的分布极不均(D=1、6 完全没有样本)。
2. 丢弃率 69%。
3. 未控制任何混淆:作者、题域、年份、评分口径全部未控;而本体系内部已知评分口径的差异可达 13 分。
⚠ 本编拒绝用"方向一致"来暗示支持——一个由单个误抓点撑起来的倒 U,若被写成证据,正是第 24 章所说的"用精度冒充闭合"。
其一,抓取规则必须改,而原因很有意思。
被丢弃的 45 条里,三家写的是构念名而非学科名(如"权力差×请求成本×公共性")——那正是改姓纪律的产物(去母体化要求把学科术语换成本题的本地语)。
⇒ 改姓做得越彻底,从成品反推学科越困难。这与第 41 章 41.15 的发现同形:光滑化使过程不可见。⇒ 正式执行必须从投稿元数据取三学科,而不是从正文正则匹配。
其二,D 的分布暴露了选源实践的现状。
现有样本几乎全部落在 D=2 与 D=4–5,没有 D=6(三家两两跨侧)的样本,也几乎没有 D=0–1。
⇒ 若倒 U 为真,最优区间恰在现有实践的中段;而要检验它,必须刻意生产两端的样本。
结论:这条预言不能靠回溯已有产出来检验。理由是 52.4 的两条合起来——语料的学科标注已被改姓抹掉,而距离的分布被选源习惯限死在中段。
改写后的设计:
1. 预先指定距离:设三档——近(D ≤ 1)· 中(D = 3–4)· 远(D = 6),每档指定若干组三学科组合。
2. 随机分配:作者与题域随机分配到各档,避免"擅长跨界的人被分到远档"这一混淆。
3. 统一口径产出:同一工序、同一体例、同一篇幅要求。
4. 评分者设盲:评分者不知该篇属哪一档,且不知本预言。
5. 判定:中档均分显著高于近档与远档 ⇒ 倒 U 成立;单调上升 ⇒ 预言二被推翻,第 49 章须改写。
⚠ 这个设计的代价必须写明:它要求刻意生产一批预期质量较低的样本(近档与远档)。而在一个以产出质量为目标的体系里,故意生产低质量样本是有成本的——这是本设计最可能被搁置的原因,本书如实标出。
52.5 给了设计的骨架。本节把它写成可以直接交出去执行的方案——因为一个只有骨架的设计,与一个没有设计的说法,在可执行性上差别不大。
按第 52.2 的八域分类表与距离规则(同域 0/同侧 1/跨侧 2,三对之和 D):
| 档 | D 值 | 三家的构成要求 | 示例(仅作示例,正式执行须另行抽取) |
|---|---|---|---|
| 近档 | 0–1 | 三家同域,或至多一对跨域 | 三家同属社会科学;或两家社会科学+一家人文 |
| 中档 | 3–4 | 三家分处不同域,且不全跨侧 | 一家形式科学+一家生命科学+一家社会科学 |
| 远档 | 6 | 三家两两跨侧 | 一家自然—形式—工程侧+两家社会—人文—艺术侧,且互不同域 |
⚠ 一处必须先解决的技术问题:D=6 要求三对两两跨侧,而按本书的距离规则,三家中至少两家必在同一侧(两侧只有两个),于是那一对的距离最多为 1,D 的理论上限其实是 5,不是 6。
⇒ 本书据此修订 52.2 的规则:远档改定义为 D = 5(两家跨侧、一对同侧异域)。这是一次由设计逼出的规则更正,与第 21 章 21.5b 那次措辞修正同类,如实记录。
混淆项:作者能力、题域难度、写作时段、评分口径。
⇒ 最小规模:6 位作者 × 3 档 = 18 篇。⚠ 这个规模只够检出较大的效应;若倒 U 的峰谷差小于 5 分,本设计检不出来——而本体系内部的评分口径差异本身就可达 13 分(第 52.3)。这是本设计最实的一处限制。
⚠ 一处无法消除的漏洞:评分者看得见三家学科名,因而原则上可以自己推出档次。⇒ 本书没有办法堵住这一处,只能记录它,并在结果分析时检查评分者是否表现出与档次相关的系统偏移。
代价一,它要求刻意生产预期质量较低的样本。近档与远档按预言都应当低于中档;在一个以产出质量为目标的体系里,故意生产十二篇预期较差的文章是有成本的。
代价二,它要求作者接受被指定的三家。而本体系的实际工作方式是作者自选三家——被指定的选源本身可能降低产出质量,从而与被检验的效应混淆。⚠ 这一条比代价一更麻烦,因为它是方法论上的:指定选源与自选选源,可能根本不是同一种工艺。
代价三,它要求一个不参与写作的评分组。
⇒ 本书的判断是:这三项代价加起来,使这个实验很可能被无限期搁置。⚠ 而本书选择把它完整写出来,理由只有一条:一个写出来而未被执行的设计,仍然可以被别人执行;一个没写出来的设计,只能被无限期地当作"以后再说"。
其一,回溯版的改良:不改抽样,改数据源。从投稿元数据取三学科(而不是从正文正则匹配),可把 52.2 那 69% 的丢弃率降到接近零,样本量从 17 升到数百。⚠ 但混淆仍未控制,结论仍只能是相关,不能是因果。
其二,自然实验:本体系历史上曾有过选源纪律变更(三闸的先后引入)。⇒ 比较纪律变更前后的产出分数与学科距离分布,若倒 U 为真,纪律引入之后 D 的分布应当向中段收缩,而均分上升。
⚠ 第二条更可行,且数据已经存在。但它有一个致命的混淆:纪律变更的同时,作者也在变熟练。⇒ 无法把"选源变好"与"人变熟"分开。本书如实标明这一点,不假装这是一个干净的替代。
F59 若按 52.5 的设计执行后,产出对距离呈单调上升,则预言二被推翻,第 49 章的位置三分纪律须改写为"三家距离越大越好"。
F60 若三档之间无显著差异,则学科距离与产出无关,第 48 章乙家(D 位)所承担的那条动力在本编中不成立,须换源或降级为比喻。
⚠ 两条之中,F60 的后果更重:它不只推翻一条预言,而是抽掉三家分工中的一家。