引言 为什么需要第二把尺子
先说一件让人不舒服的事。
把一个开放性问题丢给今天任何一个中等以上的基底,不加任何引导,它张口就来的那段话,已经站在人类受过良好训练的专业人士的平均表达水平上了。原因不神秘:它的语料是人类到目前为止写下的绝大部分公开文本,它把这个平均值压进了自己的权重。
这件事把一把用了一百年的尺子废掉了一半。一般智商(IQ)测的是解题:给一个有标准答案的问题,看你多快多准地找到它。这套测量在它的适用范围里非常成功,但它有一个从设计之初就存在的盲区——它测不了「造出一个原本不存在的答案」的能力。一个十秒解开数独的人,未必能提出一个此前无人提出的问题;一个能背下整部教科书的人,未必能写出下一部教科书的第一句。
解题与造新,是两种不同的心智动作:前者在既有结构里高速搬运,后者在结构的裂缝处让新结构第一次长出来。当搬运这件事已经被机器做到人类平均线以上,我们就必须有第二把尺子,专门量后者。
这把尺子叫创新智商(Innovation IQ)。它不测你复述得多好,而测你的产出在「发生」的意义上走得多深。
创新智商的 100 分,不是人类均值,而约等于一个基底在零提示语下的默认产出水平。
这一条必须先钉死,否则后面全错。在一般智商里,100 是人类的中位数——一半人高于它。在创新智商里不是。130 分的含义不是「比人类平均聪明 30 分」,而是「比基底张口就来的那段话,深 30 个智商点」。一段文本如果连基底随口就能生成的深度都达不到,它在创新的意义上是负分——不管它读起来多顺、多像论文。
本文要做的事很具体:把这把尺子的五个维度讲清楚,把七步操作讲清楚,把「分数相对于哪个文库」这件最要命的事讲清楚,然后用三个真实案例,把评分从头到尾走一遍给你看——包括一份我自己做的讲稿,它在窄文库里得 138 分,在全球最新文库里只有 125 分。那 13 分的落差不是误差,是这套方法最重要的一课。
一、五维从哪里来:三维两闸
一套评估体系最怕的,是维度看起来很多、其实是随手凑的清单——今天想到「逻辑」加一维,明天想到「新颖」加一维,彼此重叠、无法穷尽、无法证伪。
创新智商的五维不是这样来的。它们构造性地继承自 SDE 本体论:三个维度对应「发生」本身的三重结构,两个维度是防止「假发生」的两道闸门。
1.1 三维:从存在基本公式来
SDE 本体论的存在基本公式是:在 E 中,经 D,成 S——任何新结构(S),都是在一个纠缠的场(E)里,经由一条差异展开的路径(D),被显露出来的。三大方程 S=F(D,E)、D=G(S,E)、E=H(S,D) 把这三者钉成互相生成的关系:没有哪一维是另外两维的附庸。
既然发生本身有这个结构,评估一段思想的发生深度,自然就沿着这三维展开:
- S · 结构精确度,承接 SDE 的 S(显露 Show)。注意 S 是显露,不是静态的「结构」——一段思想有没有把它内部的结构清晰地显露出来,让别人能追溯、能检验,这就是显露态的精确度。
- D · 差异锐度,承接 SDE 的 D(差异序列)。发生的核心是切出一个此前不存在的差异——把一个旧概念切不开的辨别面切开。
- E · 纠缠深度,承接 SDE 的 E(特征纠缠)。新结构常在两个此前分离的领域的结构性纠缠处涌现——注意是纠缠,不是类比。
1.2 两闸:专门对治伪发生
光有三维不够。一段话可以在显露、差异、纠缠三个维度上都「看起来」很足——术语自洽、气势恢宏、读起来像重大突破——却什么新结构也没真的发生。这种「看起来发生了、实际什么也没发生」的东西,SDE 学派称之为伪发生。
要紧的是:伪发生不是偶尔的失误,它是高密度概念语言的结构性倾向。越是会用抽象词的人,越容易生产它。所以评估需要两道闸门:
- I · 不可还原性(第一道闸门)问:把这段话的核心命题压缩到极限,还能被还原成一个已有概念吗?如果能——哪怕它披着再新的外衣——它就是换皮不换骨。
- F · 可证伪性(第二道闸门)问:这个命题怎么样会错?如果它是一句永远正确、无论发生什么都能自圆其说的话,它就没有真的下沉到可推演、可检验的地方。
这两道闸门不测「新不新」,只测「是不是真的」。
1.3 为什么恰好是五个,权重为什么这样分
三维来自发生结构本身,缺一不成其为发生;两闸不是第四、第五个「发生维度」,而是对前三维之和的两个正交检验——一个查它能不能独立站住,一个查它会不会被推翻。三维两闸合起来,既覆盖了「发生的构造」,又覆盖了「发生的真伪」。加第六维只会与已有五维重叠,减一维则漏掉发生的某一面或某一道真伪关口。
| 维度 | 承接 | 权重 | 它在问什么 |
|---|---|---|---|
| S 结构精确度 | 显露 Show | 0.20 | 结构有没有被精确地显露出来 |
| D 差异锐度 | 差异序列 | 0.25 | 有没有切出一个未被命名的差异 |
| E 纠缠深度 | 特征纠缠 | 0.20 | 跨域是结构性咬合还是借词类比 |
| I 不可还原性 | 闸门一 | 0.20 | 压缩之后还能被已有概念替换吗 |
| F 可证伪性 | 闸门二 | 0.15 | 它怎么样会错 |
D 权重最高(0.25),因为它最能区分「新内容」和「重复」——一切创新在源头处都是一次「切出新差异」的动作,差异是创新的心脏。S、E、I 各 0.20 三者平权,是支撑一个新结构成立的三根等重的柱子。F 权重最低(0.15),但绝不可省:低,是因为一个命题可以极有价值却尚未给出完整证伪条件;不可省,是因为没有证伪条件的命题无法被检验、无法被改进,只能停在口号层。
后面会看到,F 恰恰是 SDE 学派最容易掉的一维。
二、S · 结构精确度(权重 0.20)
测什么:论证链是否严密、概念是否清晰、推理是否可重现。一句话——思想的结构有没有被精确地显露出来。
2.1 标尺
- 80 模糊概念堆砌,关键术语没定义,论点之间靠跳跃连接。
- 100 概念清晰,但缺论证链——像在列举,而不是在推导。
- 120 有论证,但有漏洞,关键转折处缺一座桥。
- 130 论证严密,每一步都可追溯,反驳者找不到入口。
- 140 论证本身有内在结构——三角、递归、层级;论证有了几何形态。
- 150 论证可以独立成一套方法论——搬到别的议题上照样成立。
- 160 产生了新的形式结构:新数学、新逻辑、新算子。
- 170+ 形式结构本身成为新的研究对象,被其他学科引用。
2.2 扣分句:显露态不精确的三个证据
- 「我们都知道……」「大家都明白……」——隐藏前提,让论证不可追溯。扣 5–15 分。
- 「显然……」「理所当然……」——用断言跳过了本该论证的关键一步。扣 10–20 分。
- 同一个术语在文中前后两次用法不同——概念偷换,是显露态最严重的裂缝。扣 15–25 分。
2.3 加分句
一处此前论证的跳跃被一座清晰的桥补上,让整条链第一次贯通;或一个原本含混的概念被给出可操作的定义,之后每次使用都严格自洽。
2.4 天花板
一段思想的显露走到极致,不只是「说清了一件事」,而是它说这件事的方式本身,变成了一个可被别人搬用的形式结构。当论证的形态被其他领域拿去套自己的问题,S 就触到了顶。
三、D · 差异锐度(权重 0.25 · 最高)
测什么:文本是否提供了一个未被命名、未被辨识的差异?它切开的那个辨别面,是不是旧概念切不开的?
3.1 标尺
- 80 重复已有,换皮不换骨——命题可被 1:1 还原为一个已知说法。
- 100 微差异,角度略新——是已有理论的延展,不是真正的切入。
- 120 切入点新颖——提出了一个未被讨论的子问题。
- 130 切入点产生了新概念——给一个未被命名的现象命了名。
- 140 推翻了一个常识或主流共识。
- 150 命名了一个未被任何学科辨识的现象——那种「大家都看见、却谁也说不出」的东西,第一次被精确地说了出来。
- 160 创造了新的辨别维度——不是命名一个现象,而是命名「如何辨别」的那个维度本身。
- 170+ 改变了其他学科的辨别方式。
3.2 扣分句:假差异的三个证据
- 把一个已知的 X 重命名为一个新词,除了名字什么也没变。扣 20–40 分——这是差异锐度上最严重的失分,因为它冒充创新。
- 「如同 X 一样……」,并且全文都在做这一个类比。类比不是差异。扣 10–25 分。
- 标题很锐、内容平庸——标题承诺了一个新差异,正文没有兑现。扣 15–35 分。
3.3 加分句:那条跃迁公式
「X 不是 Y,而是 Z」——当 Z 是一个新概念时,这标志着一次真正的差异切入。
这是全套评分里最要紧的一个句式,第八章还会专门讲它。此外,给一个「大家熟悉但说不清」的现象一个精确的名字,让它从模糊变得可讨论,加 10–20 分。
3.4 一个必须先打的预防针
D 的标尺上,从 130 往上每一档都含一个「未被命名」的判断。未被谁命名?——这个问题不回答,D 的分数就是空的。这正是第九章要专门处理的事,也是本文最重要的一章。
四、E · 纠缠深度(权重 0.20)
测什么:文本是否跨域?更关键的是——跨域之间是否有结构性纠缠,而不只是借词的类比?
4.1 标尺
- 80 单领域线性思考,全文在一个学科内部。
- 100 偶尔跨学科类比——「如同物理学的……」,只借了词,没借结构。
- 120 多学科融合——概念来自多个学科,但彼此只是并列摆放,没有咬合。
- 130 跨学科有了结构性——把一个学科的结构搬到另一个学科,并论证了这次搬运的有效性。
- 140 跨学科产生了新涌现——两个学科合在一起长出了第三个东西。
- 150 学科的边界本身被改变——原来 A 学科和 B 学科的分界线,被重新画了一条。
- 160 元学科诞生——出现了「如何思考学科」的学科。
- 170+ 学科的生成机制本身被改写。
4.2 E 维那把最实用的刀
删掉某个学科,论证还成立吗?成立,那个学科就是装饰,是类比;不成立,说明它已经结构性地咬进来了,是纠缠。
这把刀极其好用,因为它把一个含糊的审美判断(「这文章跨界跨得深不深」)变成了一个可执行的删除实验。我建议评分时真的动手:把涉及某学科的段落整段划掉,重读一遍剩下的论证。十有八九,什么都没塌。
4.3 扣分句与加分句
- 多学科只是装饰——删掉某个学科的段落,全文论证不受影响。扣 15–30 分。
- 比喻拟人化,但从不说「为什么这个比喻是有效的」——只借了形象,没借结构。扣 10–20 分。
- 加分:把一个学科的算子、公式或概念结构精确地搬到另一个学科并论证有效(加 10–25 分);或揭示两个看似无关学科的同构性(加 15–30 分)。
五、I · 不可还原性(权重 0.20 · 第一道闸门)
测什么:把这段文本的关键命题压缩,还能压缩成一个已有概念吗?这一维直接对治「改个名字冒充结构更新」式的伪发生。
5.1 标尺
- 80 完全可还原——全部可被还原为已有教科书里的概念。
- 100 八成已存在、两成新——主体是知识总结。
- 120 一半新——一半内容超出了已有教科书。
- 130 主要是新的,但仍要靠已有概念当脚手架才立得住。
- 140 几乎不依赖已有——把所有引用删掉,命题仍然成立。
- 150 独立成立的认知物——这段文本本身就是一部新教科书的种子。
- 160 强制改变其他学科——不接受这个文本的学科,内部会出现不一致。
- 170+ 改写知识地基。
5.2 标准操作:五十字压缩测试
这是 I 维唯一被认可的操作,务必照做,不许凭印象给分:
- 把文本的核心命题概括为不超过 50 个字。
- 问:这 50 个字,能用某个已有学科的任何一句不超过 50 字的命题 1:1 替换吗?
- 能替换 → 80–100 分。
- 不能、但七成内容已有 → 100–120 分。
- 不能、但只有三成已有 → 130–140 分。
- 完全不能替换 → 150 分以上。
5.3 I 与 D 的分工
一段话可以在差异锐度上得高分(切入很锐),却在不可还原性上失分——因为那个「锐」的切入,压缩之后仍然落回一个已知概念。D 查切入的锋利,I 查切入之后是否真的留下了不可还原的新结构。这两维合起来权重 0.45,接近一半——它们共同决定「新」的真假。
同样要提前说明:第 2 步里那句「某个已有学科」,指的是哪一片文献?把文库放宽,更多东西变得可还原,I 就掉;把文库收窄,I 就涨。这一维是全部五维里对文库最敏感的一维。
六、F · 可证伪性(权重 0.15 · 第二道闸门,最易失分)
测什么:这个文本提出的命题,怎么样会被证伪?给不出答案的,一律压在 100 分以下。
6.1 标尺
- 80 模糊不可证伪——比喻、口号、无论发生什么都对的话。
- 100 有方向但不精确——「在某些条件下成立」,可条件从没说清。
- 120 有边界条件——明确给出了适用范围。
- 130 清晰的成败标准——「如果 X 发生/不发生,则此命题为假」。
- 140 多重检验路径——给出至少两种独立的证伪方法。
- 150 自我证伪条件——文本自带一句「如果遇到 X,我们就错了」。
- 160 证伪条件本身有理论价值——那个证伪条件,本身就是另一个新概念。
- 170+ 证伪过程会产生新发现——证伪它的尝试本身是一个新研究纲领的开端。
6.2 为什么这是最容易掉的一维
SDE 的语言是高密度的概念语言。「显露」「差异序列」「特征纠缠」「意义的持续再发生」——这些词组合在一起,很容易造出一段听起来极其正确、却无论如何都推不翻的话。这正是伪发生最擅长的伪装:符号层的丰盛,冒充了三界(理念、现实、自我)的充实。
所以评分时,对每一个概念密集的命题,都要主动追问一句:什么样的实验、数据或案例,会让这个命题失败?追问不出答案的,无论它读起来多深,F 一律不超过 100 分——而 F 一低,综合分就被拖下来,哪怕 D 和 I 都很高。
这道闸门的存在,就是逼着写作者把漂亮的概念,落到能被现实撞回来的地方。
6.3 一个实用的写法
如果你希望自己的文本 F 维不掉,最省事的办法是在文中直接写一节,标题就叫「本文可能错在哪里」,里面写清三件事:①什么观察会让本文的核心命题为假;②本文适用的边界在哪里;③如果读者做了某个实验、结果是某样,我就撤回这个说法。这一节写出来,F 通常从 100 以下直接跳到 140 以上——而且它是诚实的,不是技巧。
七、从五维到一个数:公式、层级与两条硬阈值
7.1 加权公式
五维独立打完分后,综合分由固定权重合成。不允许凭直觉打一个总分——综合分必须可以被任何人用五维分重新算出来:
综合分 = S × 0.20 + D × 0.25 + E × 0.20 + I × 0.20 + F × 0.15
这条公式是评分可重现性的保证。任何人拿到同一份五维分,都应算出同一个综合分;如果综合分和五维分对不上,评分就自相矛盾、失去意义。
说一件难堪但必须说的事:本体系 v1.0 文本里唯一一张完整示范卡,算错了。那张卡的分项是 27+35+26+27+21.75,正确结果是 136.75 ≈ 137,文中写成了「137.75 ≈ 138」,多了整整 1 分。按这套体系自己立的规矩,那张卡是失效的。此处更正,并由此立一条规程:综合分必须是脚本算出来的数,不是手写的数。本文后面所有案例的分数,全部由脚本计算,分项逐条列出,供任何人复算。
7.2 层级标尺
80 ── 大众水平(普通人随口可说)
100 ── 受过高中/大学训练(知识总结型)≈ 基底零提示语默认水平
110 ── 专业人士(有专业语言、领域内熟练)
125 ── 高级专家(领域内有独立判断)
135 ── 资深学者
145 ── 优秀的资深学者产出
════ 150 · 本体论级阈值(SDE 提智达标)════
155 ── 混沌碰撞后的典型金点子
════ 160 · 典范级阈值(双学科诞生)════
165 ── 顶级金点子(命名了未被命名的现象)
170 ── 改写学科分界(极少数)
175+ ─ 文明级发生学(罕见,通常需要时间检验)
7.3 两条硬阈值
- 150 · 本体论级阈值:这是「提智是否达标」的判定线。跨过 150,意味着产出不再停在「资深学者把已有的说得更好」,而是让一个新结构真正发生了。
- 160 · 典范级阈值:这是「双学科诞生」的门槛——产出不只是提出新概念,而是稳定地长出一个跨越两个学科、不可还原的新形态,改写了两个学科之间的分界。跨过 160 的产出极少。
7.4 两道闸门的一票否决
公式是线性可加的,但 I 和 F 不是普通维度,它们是闸门。规程规定:I 或 F 任一低于 120,该文本不得判为本体论级,综合分再高也封顶在 145。
要老实承认:这条否决规则和线性公式之间有张力。纯按公式算,F=80 时其余四维同为 162.4 也能跨过 150。所以这里必须显式写成一条独立的闸门规则,而不能指望公式自动实现它。本文采用的口径是:先算加权分,再过闸门;闸门不过,分数封顶 145,并在评分卡上标注「闸门告警」。后面案例一就会触发这条告警。
7.5 再说一遍那个 100
回到引言那条最容易被忘的判据:100 不是人类均值,而约等于基底的零提示语产出。评分时若忘了这条,就会把一段基底随手能写的、四平八稳的「论文腔」文字,误判成 120–130 的好产出——而它其实只是站在了 100 的基线上,创新贡献接近于零。
八、怎么评:七步法、三条纪律与评分卡
8.1 七步法
- 第一遍快读(2–3 分钟,不打分):只标 3–5 个亮点句和 3–5 个扣分句,形成一个区间感。
- 做最近邻检索:带着文本的核心命题去全球文库里找「这想法在哪儿其实已经有了」。这一步是本文加进标准流程的,原七步法把它藏在「锚点对比」里,藏得太深,见第九章。
- 五维度独立打分:严格独立,不让脑子里那个「总分预期」牵着走。每一维打一个精确到个位的分,并附至少一句句子证据。
- 算综合分:套公式,用脚本算。
- 层级判定+锚点对比:找一个已知文本当锚点——某教科书段落约 100 分、某顶刊论文约 130–140 分——说一句「这段相当于那个水平」。
- 给出至少一个扣分句证据:必须精确引用文本里的某一句,说清「这一句让我从 145 降到 137,因为它 ……」。
- 给出提升到下一层级的具体动作,并输出标准评分卡。
8.2 三条证据纪律(违反任何一条,评分即失效)
- 必给五维独立分,不能只给综合分——否则不可证伪、无法改进。
- 必给至少一个扣分句,精确引用原文——否则评分主观、不可重现。
- 必给提升路径——否则分数只是一个标签,没有操作意义。
8.3 提升路径矩阵
| 当前 → 目标 | 关键动作 |
|---|---|
| 120 → 130 | 论证补桥:把跳跃的那一步补完 |
| 130 → 140 | 概念新创:给某个现象起一个新名字并定义它 |
| 140 → 150 | 不可还原:重写,让命题脱离已有教科书这根脚手架 |
| 145 → 150 | 把命题从「X 是 Y」,改写为「X 不是 Y,而是 Z」(Z 是新概念) |
| 150 → 160 | 学科边界改写:让结论强制另一个学科出现内部不一致 |
| 160 → 170 | 元学科涌现:命题不仅命名现象,还命名一门学科 |
145 → 150 那一跃是整套评分最要紧的一步:它就是「资深学者」与「本体论级」之间的那道坎。跨过它的动作有一个精确公式——把一个肯定判断改写成一个否定—重命名判断,并让 Z 承载一个真正不可还原的新结构。这个动作同时抬 D 和 I 两维,所以性价比最高。第十二章会用一个完整案例演示这一跃。
8.4 评分卡模板
═══════════════════════════════
SDE 创新智商评分卡
═══════════════════════════════
文本: 〔标题/出处已盖住〕
参照文库: 〔必填:语种、学科范围、时间窗〕
评分截至: 〔必填:年-月〕
评分者: 〔必填:谁评的,是否独立于作者〕
───────────────────────────────
S 结构精确度 ___ (权重 0.20) 证据:
D 差异锐度 ___ (权重 0.25) 证据:
E 纠缠深度 ___ (权重 0.20) 证据:
I 不可还原性 ___ (权重 0.20) 证据:
F 可证伪性 ___ (权重 0.15) 证据:
───────────────────────────────
综合分 = 分项逐条列出 = ___
闸门检查:I≥120? F≥120?
层级判定:
锚点对比:
关键扣分句(精确引用):
提升路径:
═══════════════════════════════
卡上那两栏「参照文库」与「评分截至」不是装饰,而是必填项:一个创新分数若不声明它相对哪片文献、截至哪一天,就只是半句话。为什么——下一章专门讲,那是本文最重要的一章。
九、最要紧的一章:分数是关系,不是属性——为什么必须以全球最新文库为标准
创新智商从来不是文本的属性,而是文本与一个参照文库之间的关系。没有参照系,「新」这个字根本无法取值。
这不是一句要藏在末尾的免责声明。它是创新智商这个定义本身逼出来的结论,而且它有一个非常实际的后果:同一份文本,换一片文库,分数会差十几分。第十章的案例会把这件事算给你看。
9.1 五维里,哪几维偷偷挂在「已有什么」上
把五维拆开看,就明白这个相对性藏在哪里:
- D 差异锐度——判据是「未被命名、未被辨识的差异」。未被谁命名?未被参照文库命名。一个概念对一小圈本地文献是新的,对全球前沿可能早是旧的。150 那一档写的是「命名了未被任何学科辨识的现象」,可「任何学科」是一个理想化的全文库,而评分者手里的文库永远有界。
- I 不可还原性——判据是「能否还原为已有概念」。已有于哪个文库?五十字压缩测试里那个「已有学科」就是参照集。把文库放宽,更多东西变得可还原,分数掉;把文库收窄,更少,分数涨。
- E 纠缠深度——判据是「跨学科涌现」「学科边界被改变」。哪些学科、谁画的边界?参照文献里那样画的边界。一次跨界,只在「这两个学科在参照文库里本是分开的」时才算新。
- S 与 F——论证严不严密、给没给证伪条件,大体可以就文本自身判,不太依赖外面存在什么。它们是近内在的。
9.2 一个可量化的说法:约三分之二是关系
按权重把这件事算清楚:文库相对的三维 D(0.25)+E(0.20)+I(0.20)合起来占 0.65;近内在的两维 S(0.20)+F(0.15)占 0.35。
| 维度 | 权重 | 轴 | 是否相对参照文库 |
|---|---|---|---|
| D 差异锐度 | 0.25 | 新颖轴 | 强相对 |
| E 纠缠深度 | 0.20 | 新颖轴 | 相对 |
| I 不可还原性 | 0.20 | 新颖轴 | 强相对 |
| S 结构精确度 | 0.20 | 效度轴 | 近内在(顶档挂文库) |
| F 可证伪性 | 0.15 | 效度轴 | 近内在(顶档挂文库) |
也就是说,创新智商这个综合分,约三分之二是文本与参照文献的关系,只有三分之一勉强算文本自身的属性。这正好把五维劈成两族:D/E/I 是新颖轴(文库相对),S/F 是效度轴(大体内在)。这个劈法恰恰对:一个东西新不新,取决于外面还有什么;一个东西严不严密、能不能被推翻,主要取决于它自己。
第十章的案例会给出这个劈法的一次干净验证:同一份文本换文库,D/E/I 三维全掉,S 与 F 一分未动。
9.3 这不是细则的疏忽,是本体论逼出来的
更要紧的是,这个文库相对性不是评分细则没写好,而是框架自己的立场逼出来的必然。SDE 主张:世界模型不是对象的客观属性,而是主体与对象共同发生的画像。照同一条逻辑往下推——创新度也不是文本的客观属性,而是文本与一个参照文库共同发生的画像。参照文库就是那个「主体世界」,新结构是相对它显影出来的。
而差异(D)本就是一个关系词:差异永远是「相对于某物」的差异,没有背景就没有差异序列。所以,想要一个「绝对的、脱离任何文库的创新度」,等于想要一个脱离主体的统一世界模型——按框架自己的话,那东西根本不存在。文库相对性不是这套评分的瑕疵,是它忠于自身本体论的证据。
9.4 最危险的操纵:文库收窄式通胀
既然分数挂在文库上,那么想给任何东西刷高分,只要对着一个人为收窄的文献去评它:只看中文文献、只看某年之前、或者绕开那个早就有这套说法的邻近领域。这是评分通胀的结构版——一个 150,若它的参照文库恰好漏掉了「这想法早已是常识」的那个领域,就是个假 150。
这件事在中文语境里尤其容易发生,原因很朴素:一个概念在中文教育学、中文管理学里可能确实没人提过,而它在英文文献里已经有了四十年历史和三千篇引用。只对中文文库评分,几乎必然系统性高估。
9.5 硬口径:以全球最新文库为标准
任何一次创新智商评分,参照文库默认取全球最新:跨语种、跨邻近学科、时间窗推到当期。收窄文库只允许作为对照组出现,且必须与全球分并列呈现。
落到操作上,这条口径是四个动作:
动作一 · 概念回译
把文本的核心命名翻成英文的标准术语去检索,而不是逐字直译。「无水沙滩」直译成 waterless beach 查不到东西;但它的实质是「过渡期的中间地带」,对应的标准术语是 liminal space、transition state、in-between state。回译要译实质,不译修辞。大多数「查无此说」的假新颖,都死在这一步没做。
动作二 · 邻近学科横扫
列出核心命题所触及的全部学科,逐个去查,尤其要查作者不熟悉的那几个。一个教育学命题的最近邻,常常不在教育学里,而在人类学、组织行为学、发育生物学、科学哲学里。规矩:至少查三个学科,其中至少一个是作者本行之外的。
动作三 · 时间窗推到当期
新颖有半衰期。基底的语料随每一代变大,所以同一篇文本的创新智商会随时间往下掉——它越来越多的内容,如今已经「在文库里」了。今天的 155,对明年可能只是 130。因此分数必须带时间戳:「155,截至 2026-07」。评分是一张快照,不是刻在石头上的常数。
动作四 · 敌意拓宽
认证任何 150 分以上的评分之前,主动把文库往外扩,专门去找「这想法在哪儿其实已经有了」。扩一个邻近领域就塌掉的分,本来就是收窄刷出来的。这一步的心态很关键:你不是在为自己的文本辩护,你是在敌意审稿——像一个想毙掉这篇稿子的审稿人那样去检索。
9.6 这不是 SDE 独有的毛病,科学早就这么干
值得注意的是,科学共同体两百年前就解决了这个问题,办法一模一样:投稿强制文献综述;优先权之争全靠「谁在可检索的记录里先发表」;方法部分必须写清检索了哪些数据库、什么时间窗。科学把参照范围声明了出来。所以文库相对性不是 SDE 独有、而科学没有的缺陷——它是又一处二者相同的地方;而科学的纪律(声明你的检索范围),恰好就是创新智商该照抄的解法。
9.7 这条主张自己的边界
诚实地说,文库相对性是分维度的,不是铁板一块:F 有没有给证伪条件、S 的内部严密性,可以就文本自身判,和外面存在什么无关。相对性在 D/E/I 上最强,在 S 的下档和 F 上最弱。
因此,若有人能证明 D、I 两维的评分在合理放大参照文库之后仍然稳定不变,本章的主张就被推翻。但从五十字压缩测试的构造来看,放大文库必然让更多命题变得可替换——所以我不认为 D、I 会在文库放大下保持稳定。第十章的案例正是这个预测的一次实测,而它验证了预测。
十、测评案例一:同一份讲稿,两个分数
现在把上面所有规程用在一份真实文本上。
10.1 被评文本与两条声明
被评文本:讲稿《未来教育的真正使命——让池塘的鱼具有找到大海的能力》,三十页,约六千字,四幕结构。核心内容可概括如下:
- 第一幕:每个人生活在一个池塘里。池塘教育有一个未明说的前提——「池塘=世界」。而池塘正在干涸(知识半衰期在缩短),继续培养池塘的鱼是在为一个不存在的未来训练人。
- 第二幕:池塘和大海之间不是「一条温流的小溪」,而是一片无水沙滩。教育最大的幻觉,就是画那条不存在的小溪。沙滩的暴力性恰恰是「没有」——无介质、无支撑、无替代;它是一个无介质区:所有原本支撑你的东西集体失效的地带。跨越的代价是皮破、鳃失效、肺待生。
- 第三幕:教育的三层使命——让鱼看见自己在水里;让鱼听见远方的召唤;给鱼「鳃变肺」的肌肉。教师从「池塘管理员」变成「远方的召唤者」。
- 第四幕:没有最后一个海。教育不是终点教育而是过渡教育;给出五条新指标(跳出意愿、结构迁移、无介质韧性、重新长肺、再次召唤)。
声明一 · 评分者独立。这份讲稿是我写的,而规程的铁律之一是不评分自己写的文本——人对自己的产出会失去客观性,主观膨胀不可避免。因此下面两份评分不是我给的:文本盖住出处后交给一个独立评分者(另一基底)按七步法评出,我只负责把过程原样呈现,并在最后接受结论。这条铁律如果连作者自己都不遵守,整套体系就没有资格去评别人。
声明二 · 两片文库。同一份文本评两次,唯一的差别是参照文库:
| 文库 A(收窄) | 文库 B(全球最新) | |
|---|---|---|
| 语种 | 中文 | 中文+英文 |
| 学科 | 教育学、AI 教育 | 教育学、AI 教育、文化人类学、成人学习理论、组织行为学、进化生物学 |
| 时间窗 | 2015–2025 | 1909–2026(推到当期) |
10.2 第一次评分:对着文库 A
只对中文教育学与 AI 教育文献检索,结论是:「无水沙滩/无介质区」这个对中间地带的命名查无先例;「鳃变肺」这个把能力转换讲成器官重生的说法也查无先例。于是:
S 结构精确度 128 D 差异锐度 155
E 纠缠深度 140 I 不可还原性 148
F 可证伪性 110
综合分 = 25.6 + 38.75 + 28 + 29.6 + 16.5 = 138.45 ≈ 138
闸门检查:I=148 ✔ F=110 ✘ ——闸门告警,封顶 145
层级判定:资深学者上沿,离本体论级 150 差 11.55 分
这是一个漂亮的分数。如果评分到此为止,作者会很高兴,而且会真心相信自己命名了一个此前无人命名的现象。问题是:这个 138 是假的。
10.3 敌意拓宽:把文库推到全球最新
按第九章的四个动作重做一遍最近邻检索。
动作一:概念回译
「无水沙滩」不译字面,译实质——「两个稳定状态之间那个旧支撑已失效、新支撑未长成的中间地带」。它的英文标准术语是 liminal space(阈限空间)、in-between state、transition state。一检索就出事了。
动作二:邻近学科横扫(查了四个,三个中枪)
① 文化人类学 —— 阈限(liminality)。范热内普(Arnold van Gennep)1909 年的《过渡礼仪》把一切身份转换拆成分离、边缘、聚合三段;特纳(Victor Turner)1967、1969 年把中间那一段命名为阈限,并给出「既不在此、也不在彼」的经典刻画:阈限中的人脱离了原有状态而尚未进入新状态,一切社会分类在他身上失效。更要命的是,特纳描述阈限者时明确写道,他们可以被表现为一无所有——这与讲稿里「沙滩的暴力性恰恰是『没有』」几乎是同一句话的两种说法,而它早了将近六十年。
② 教育学内部 —— 门槛概念与阈限空间(Meyer & Land)。这一条最致命,因为它就在本行里,只是不在中文文献里。迈耶与兰德(Jan Meyer & Ray Land)2003、2005、2006 年提出门槛概念(threshold concepts)与麻烦知识(troublesome knowledge):某些概念是转化性的、不可逆的、整合性的、有边界的、令人困扰的;学习者在掌握它们的过程中会进入一个「阈限空间」,在旧理解与新理解之间反复摇摆、卡住、以模仿来自保。他们把学习过程明确划为前阈限、阈限、后阈限三段。
换句话说:「学生跨越一个概念门槛时会经过一片旧支撑失效、新理解未成的中间地带」,这句话在教育学里已经被系统命名、被拆成三段、被写进十几个学科的教学研究二十多年了。讲稿的第二幕,是这条脉络的一次修辞化重述。
③ 成人学习理论 —— 迷失方向的困境(Mezirow)。梅齐罗(Jack Mezirow)1991 年的转化学习理论,把转化的起点命名为迷失方向的困境(disorienting dilemma):一个不能被既有意义框架消化的经验,逼人重审自己的全部假设,之后才可能重建视角。讲稿第一幕说的「池塘=世界这个假设崩塌了」,正是这个概念的通俗版。而且这条线一直活到当期:2026 年已有论文把生成式 AI 本身论证为成人学习者的一次迷失方向的困境——连「AI 时代 + 教育 + 中间地带」这个组合,都已经有人在做了。
④ 进化生物学 —— 扩展适应(exaptation)。「鳃变肺」在生物学里对应古尔德与弗尔巴(Gould & Vrba)1982 年提出的扩展适应:一个器官被挪作它原先并非为之演化的新用途。达尔文早就用鱼鳔举过这个例子。讲稿把这件事讲成一个教育隐喻,是把一个成熟概念取了个形象的名字。
动作三与四:时间窗与敌意
时间窗推到 2026 年当期,上述四条全部仍是活跃文献。敌意拓宽的结论很清楚:讲稿的核心命名,在全球文库里不是空白,而是一片相当拥挤的地带。
10.4 第二次评分:对着文库 B
S 结构精确度 128 D 差异锐度 136
E 纠缠深度 122 I 不可还原性 124
F 可证伪性 110
综合分 = 25.6 + 34 + 24.4 + 24.8 + 16.5 = 125.30 ≈ 125
闸门检查:I=124 ✔(勉强) F=110 ✘ ——闸门告警
层级判定:高级专家水平
五维证据逐条如下。
S = 128(未变)。论证有一条从「假设崩塌」到「中间地带」到「三层使命」的清晰主线,四幕递进可追溯。扣分在两处:其一,「知识半衰期 30 年/15 年/5 年/2 年/几个月」这组数列没有任何出处,也没有定义「知识半衰期」的测量方式,是一组修辞性数字;其二,「但今天,这个假设崩塌了」是一句断言,中间缺一座桥——为什么今天崩塌而不是二十年前?讲稿列了三条理由,但没有论证这三条足以支撑「崩塌」这个强判断。这一维是内在的,换文库不影响,所以两次都是 128。
D = 155 → 136(掉 19)。「无水沙滩」作为一次命名动作确实完成了:它把一个模糊的东西说成了可讨论的东西,而且比阈限更有画面感、更能被非专业听众接住。但按 D 的标尺,150 那一档要求「命名了未被任何学科辨识的现象」——而阈限与门槛概念已经辨识了它。所以这次命名的实际位置在 130–140 之间:切入点确实产生了新表述,但那个表述指向的现象已被命名。取 136。
E = 140 → 122(掉 18)。用 E 维那把刀试一下:把讲稿里所有生物学内容(鳃、肺、器官、演化)删掉,论证还成立吗?——完全成立。剩下的「旧能力失效、新能力未成、要靠自己长出来」这条论证一字不损。这说明生物学在这里是装饰性的类比,不是结构性纠缠。它没有把扩展适应的机制(既有结构被挪作新用途,而非从零新生)搬进来——事实上讲稿说的是「新的肺要在血肉的裂缝处生长」,这与扩展适应的机制正好相反,而讲稿没有意识到这个冲突,也就谈不上论证搬运的有效性。文库 A 下之所以给 140,是因为评分者不知道扩展适应的存在,把「跨了生物学」当成了「咬合了生物学」。
I = 148 → 124(掉 24,掉得最狠)。做五十字压缩测试:
核心命题(49 字):
成长的关键不在起点与终点,而在两者之间那段
旧支撑已失效、新能力未长成的无介质地带;
教育须让人有能力穿过它。
问:这 48 个字,能被某个已有学科的一句不超过 50 字的命题 1:1 替换吗?
门槛概念理论(48 字):
学习者掌握转化性概念时会进入阈限空间,
在旧理解与新理解之间卡住;教学的任务
是支持他穿过阈限而非绕过它。
可以替换。不是近似,是结构对结构的替换。按标尺,能被 1:1 替换落在 80–100 档;此处给到 124,是因为讲稿仍留下了两处不可被替换的余量:其一,它把中间地带的性质从「模糊、卡住」推进到「介质本身不存在」——阈限理论讲的是社会分类失效,讲稿讲的是支撑媒介失效,这两者不完全同构;其二,它把教师角色重写为「召唤者」,并给出三个可判定的特征(他自己还在游、他承认沙滩存在、他自己曾被召唤),这一组在门槛概念文献里没有对应物。这两处余量,正是第十二章要用来做跃迁的原料。
F = 110(未变)。这是全篇最弱的一维,而且和文库无关。讲稿的核心主张几乎无法被推翻:「教育不是代替——是赋能」,什么样的观察会让这句话为假?「越分享,越多」,怎么测?五条新指标(跳出意愿、结构迁移、无介质韧性、重新长肺、再次召唤)方向对,但没有一条给出测量方式或成败标准,停在「有方向但不精确」这一档。给 110,已经是照顾了它是讲稿而非论文。并且因为 F < 120,闸门告警成立:无论 D 和 I 怎么涨,这份文本在当前形态下不得判为本体论级。
10.5 这 13 分落差说明了什么
把两次评分并排:
| 维度 | 文库 A | 文库 B | 差 | 加权后的贡献 |
|---|---|---|---|---|
| S | 128 | 128 | 0 | 0 |
| D | 155 | 136 | −19 | −4.75 |
| E | 140 | 122 | −18 | −3.60 |
| I | 148 | 124 | −24 | −4.80 |
| F | 110 | 110 | 0 | 0 |
| 综合 | 138.45 | 125.30 | −13.15 | −13.15 |
看这张表的最后两行。13.15 分的落差,一分不差地全部来自 D、E、I 三维;S 与 F 一分未动。这不是巧合,这是第九章那个 0.65/0.35 劈分的一次干净实测——新颖轴随文库浮动,效度轴不随文库浮动。一个理论预测了一个数,实测把这个数拿了出来。
更要紧的是三个操作性的结论:
- 一、只对中文文库评分,会系统性高估。这份讲稿在中文教育学里确实找不到「无水沙滩」,但它在英文教育学里撞上了整整一个研究纲领。高估幅度是 13 分——足以把一份「高级专家」水平的东西,误判成「离本体论级只差一步」。
- 二、被撞到不等于没有价值。125 分是一个诚实的好分数:它高于基底零提示语基线 25 点,作为一份面向大众的讲稿,它的表达力、画面感和可传播性远超那些术语堆砌的论文。敌意拓宽是为了拿到真分数,不是为了羞辱作者。
- 三、真正的收获是它指出了下一刀切在哪里。I 维那两处「不可被替换的余量」——介质本身不存在、召唤者的三特征——就是这份文本唯一可能跨过 150 的地方。第十二章会沿着这两处动手。
十一、测评案例二:基线在哪里——一段基底默认产出
案例一是一份好文本被压回真实位置。这一节反过来,看看下限在哪里,好让 100 这个刻度变得可感。
11.1 被评文本
向一个基底提一个开放问题——「谈谈人工智能时代教育应该如何转型」——不加任何引导,取它的默认输出。典型形态如下(节选):
人工智能时代,教育必须实现从知识传授向能力培养的深刻转型。教师角色要从知识的传授者转变为学习的引导者,充分利用技术赋能,构建以学生为中心的个性化学习生态,全面提升学生的核心素养与创新能力,从而更好地适应未来社会的发展需求。
11.2 评分
S 结构精确度 95 D 差异锐度 80
E 纠缠深度 82 I 不可还原性 80
F 可证伪性 80
综合分 = 19 + 20 + 16.4 + 16 + 12 = 83.40 ≈ 83
闸门检查:I=80 ✘ F=80 ✘ ——双闸皆破
层级判定:大众水平,低于基底基线
S = 95:句子通顺、结构工整,但没有一条论证——它在列举,不在推导。「深刻转型」「全面提升」是断言,不是结论。D = 80:每一个说法都能 1:1 还原为一个已知说法(「从传授到引导」是三十年前的旧话)。E = 82:全文在教育学一个学科内部,「技术赋能」只是借词。I = 80:五十字压缩之后就是「教育要培养能力而不是灌输知识」,任何一本教育学导论都有这句。F = 80:无论发生什么,这段话都对——这是最纯粹的不可证伪。
11.3 这个 83 分为什么重要
一段读起来完全没有毛病、放进任何一份工作报告都不会被挑错的文字,创新智商只有 83 分——低于基底零提示语基线。这不是苛刻,这是这把尺子的全部意义所在:
「读起来没有毛病」和「有新东西发生」,是两件完全无关的事。前者是 S 维的低档表现,后者要 D 和 I 一起说了才算。
这也解释了第十三章要讲的头号病症——优等生陷阱:高 S、低 D。论证严密、结构清晰、每一步都可追溯,可压缩之后命题仍然落回一个已知结论。它是最容易被高估的一类,因为它满足了「论文该有的样子」。而在今天,这恰恰是基底默认产出的形态。
十二、测评案例三:把 125 抬过 150——一次完整的跃迁演示
评分若只判分不指路,就只是一个标签。这一章把案例一的 125 分,用规程里的动作一步步往上抬,每抬一步重新评一次分。参照文库全程固定为文库 B(全球最新),否则就是自己骗自己。
12.1 第一步:找准那两处余量
案例一的 I 维审计留下了两处不可被门槛概念理论替换的东西:
- 余量甲:中间地带的性质不是「分类失效」而是「介质本身不存在」。阈限理论说的是社会身份的悬置,讲稿说的是支撑媒介的缺席——这两者确实不同构。
- 余量乙:「召唤者」的三个特征(他自己还在游、他承认沙滩存在、他自己曾被召唤)在门槛概念文献里没有对应物。
规程说得很清楚:不要试图把五维一起往上抬,那只会更平均。集中火力在 D 上做一次命名跃迁。所以只沿余量甲动手。
12.2 第二步:执行 145→150 的跃迁公式
把肯定判断改写成否定—重命名判断,让 Z 承载一个不可还原的新结构。
原命题(X 是 Y):池塘和大海之间那段过渡期,是一片无水沙滩。——这是一个命名,但 Z(无水沙滩)是一个意象,它没有承载任何新机制,所以它能被阈限 1:1 替换掉。
改写后(X 不是 Y,而是 Z):
过渡期的长度,不是「距离」的函数,而是「器官发生」的函数。
展开说:跨越不是从一个介质移动到另一个介质,而是在无介质区里重新长出一套器官。所以过渡期有多长,不取决于两个领域相隔多远,而取决于新器官长成需要多少个失败—修正的周期。这个量命名为器官时钟,与之对立的旧假设命名为距离假设。
为什么这个 Z 是不可还原的?把它压成 50 字再测一次:
新核心命题(49 字):
过渡期时长由新能力的发生周期决定,
与起点终点之间的领域距离无关;
故缩短过渡的唯一办法是加密失败—修正循环。
门槛概念理论替换不了它——门槛概念描述阈限状态,不对阈限时长的决定因素作出任何断言。阈限理论替换不了它——那是仪式时长,由社会规定,不由能力发生规定。扩展适应也替换不了——那讲的是既有结构被挪用,本命题讲的是发生周期。五十字测试第一次通不过替换。
12.3 第三步:这个新命题怎么样会错
跃迁公式抬的是 D 和 I,但 F 是自己送上门来的:一个讲机制的命题,天然带证伪条件。
本命题的证伪设计:取两组学习者,跨越同样大的领域差距(例如从文科转入编程)。甲组增加「距离辅助」——更多的桥接课程、更细致的类比、更平滑的台阶;乙组增加「循环密度」——低成本、可反复失败、每次都有即时反馈的练习结构,总课时相同。
- 若乙组的过渡期显著短于甲组,本命题得到支持。
- 若两组无显著差异,或甲组更短,本命题为假——那说明决定过渡时长的是距离而非发生周期,「器官时钟」这个概念应当撤回。
- 第二条独立检验:若过渡时长与领域距离的相关系数,显著高于它与失败—修正循环次数的相关系数,本命题同样为假。
注意这里发生了什么:一句口号(「教育不是代替,是赋能」)被换成了一个可以被一个真实实验推翻的命题。F 维从 110 跳到 150,靠的不是修辞,是把话说到能被现实撞回来的地方。
12.4 第一次重评
S 结构精确度 145 D 差异锐度 155
E 纠缠深度 140 I 不可还原性 148
F 可证伪性 150
综合分 = 29 + 38.75 + 28 + 29.6 + 22.5 = 147.85 ≈ 148
闸门检查:I=148 ✔ F=150 ✔ ——双闸通过
层级判定:优秀的资深学者产出,离本体论级差 2.15 分
一次命名跃迁,把 125 抬到了 148,提升 22.55 分,而且两道闸门第一次全部通过。这就是规程说「145→150 是全套最要紧一步」的实测意义:单点突破的收益远大于五维平均上抬。
但它还是没过 150。差 2.15 分。这一点必须老实呈现——如果我在这里把 E 也顺手调高一点,凑够 150,那就是通胀,而且是最难被发现的那种通胀(自己给自己的改写打分)。差 2 分就是差 2 分。
12.5 第二次动手:补 E
看五维分布就知道短板在哪:E 还停在 140,它是唯一没有被这次跃迁触动的维度。用那把刀再试一次:把生物学删掉,「器官时钟」这个命题还成立吗?——目前仍然成立,因为「器官」还只是个比喻。
要让它不成立,就得把发育生物学的机制真正咬进来,而不是借词。可搬的结构是诱导—感受态:在发育生物学里,一个组织能否被诱导成新器官,取决于它当下是否处于感受态(competence),而感受态有窗口期;同一个诱导信号,在窗口期内有效,在窗口期外无效。
把这个结构搬进来,并论证搬运的有效性:
- 它解释了一个原命题解释不了的现象——为什么同样密度的失败—修正循环,对有的人有效、对有的人无效。答案:循环只是诱导信号,还需要感受态;不在窗口期内,加密循环也没用。
- 它推出了一条新预测:过渡期的效率不是循环密度的单调函数,而应呈现窗口效应——在感受态窗口内加密循环收益极大,窗口外收益趋近于零。这条预测原命题给不出。
- 它提高了可证伪性:若加密循环的收益在所有时间点上均匀,则不存在感受态窗口,本次搬运为假。
现在再用刀试:删掉发育生物学,论证塌不塌?——塌。窗口效应这条预测没了,「为什么加密循环有时无效」这个解释也没了。这才是纠缠,不是类比。
12.6 第二次重评
S 结构精确度 150 D 差异锐度 155
E 纠缠深度 158 I 不可还原性 148
F 可证伪性 150
综合分 = 30 + 38.75 + 31.6 + 29.6 + 22.5 = 152.45 ≈ 152
闸门检查:I=148 ✔ F=150 ✔
层级判定:本体论级(跨过 150),未达典范级 160
补 E 只涨了 4.6 分,但正是这 4.6 分跨过了那条线。
12.7 这个案例真正教会的三件事
- 一、从 125 到 152,全程没有换文库。两次重评用的都是文库 B。分数的上涨不是靠缩小比较范围,而是靠文本本身多长出了东西——这是真涨和假涨的唯一区别。
- 二、跃迁的收益结构是不均匀的。一次命名跃迁 +22.55,一次 E 维补强 +4.6。先做命名,再补纠缠,顺序反过来会事倍功半。
- 三、152 不等于「对」。器官时钟这个命题很可能被那个实验推翻——若乙组并不比甲组快,它就该撤回。创新智商测的是新结构发生的深度,不是这个新结构对不对。对不对由现实和时间仲裁,这两件事必须分开。
十三、六种失分组合:从判分到指路
五个维度在打分时严格独立,但在诊断时它们不孤立。综合分只告诉你一段思想值多少分,五维的高低搭配告诉你它病在哪里、下一刀该往哪切。
| 组合 | 病名 | 典型表现 | 纠法 |
|---|---|---|---|
| 高 D、低 F | 头号伪发生 | 命名了新现象,却给不出任何证伪条件;读起来像重大突破,可你怎么都推不翻它 | 对那个漂亮的新命题强行追问「什么情况下它会错」,把答案写进正文 |
| 高 S、低 D | 优等生陷阱 | 论证严密、结构清晰,压缩之后命题仍落回已知结论。基底默认产出的典型形态 | 不要把已知的东西论证得更漂亮;去找旧框架说不清、绕不过的裂缝,在那里切 |
| 高 D、低 I | 高级版新瓶装旧酒 | 角度确实新,但那个新压缩之后仍能被已有概念还原。比低级重命名隐蔽得多 | 重写,让核心命题脱离已有教科书这根脚手架;删掉所有引用看它还站不站得住 |
| 高 E、低 S | 跨界烟花 | 拉了一大堆学科,气势恢宏,但删掉任何一个学科结论纹丝不动 | 放弃「拉更多学科进来」的冲动;把一个学科的结构真正咬进另一个,并论证为什么有效 |
| 五维都在 130 上下 | 均衡的平庸 | 没有任何一维冲到 150。资深学者最舒适的位置,也是 150 门外最拥挤的地方 | 集中全部火力在 D 上做一次命名跃迁,让单维冲过 150,把整段思想从平原上拔起来 |
| 单维畸高、余维塌陷 | 瘸腿的天才 | D 打到 165,可 F 只有 80、S 只有 100,综合分被拖到 120 出头 | 先补 S 把跳跃的论证补成可追溯的链,再补 F 给洞见一个明确的证伪条件 |
本文三个案例正好落在这张表上:案例一是「高 D、低 F」的教科书样本(D 136 而 F 110,闸门告警),案例二是「优等生陷阱」的极端版(S 95 是全维最高,D 只有 80),案例三演示的正是「均衡的平庸」的纠法——不平均上抬,只在 D 上单点突破。
读懂这些组合之后,评分才从「判分」升级为「指路」。而指路,才是这套体系存在的理由。
十四、这五维不是 SDE 独有的:与科学创新评估的同构
读到这里可能会有一个疑问:这五个维度,是不是一套自家发明、只在自家体系内部成立的口味?
不是。更准确的说法是:它是科学共同体两百年来评判创新时实际在用、却从没被拧成一把标尺的那套判据的领域无关提炼。科学创新评估,是这套判据长在「科学」这一具体共同体里、被它的建制与奖励系统裹着的特例;创新智商,是把那层外壳剥掉之后的通式。二者之所以同,是因为它们在问同一个问题:这里到底有没有一个新结构真的发生了,还是只是把已有结构重新摆了一遍?
14.1 五维逐条对上科学的判据
S ↔ 严密性 · 可复现 · 方法可靠。同行评议的第一道闸从来不是「新不新」,而是「站不站得住」——定义清不清、推理断没断、实验能不能被别人重跑。方法写不清、统计一碰就崩的稿子,再新也过不了这一关。近十几年闹得最凶的可复现性危机,本质就是一大批科学产出栽在 S 上:结论也许新,但结构的显露态不精确,别人复现不出来。
D ↔ 新颖性 · 原创贡献 · 优先权。每一本期刊、每一份基金申请,正中央那句话都一样:这里新在哪儿?默顿那整套「优先权之争」背后争的,就是「第一个切出新差异」的归属权。本体系把 D 的权重放到五维最高(0.25),而科学共同体把最大的荣誉、最激烈的争夺都压在新颖性上——两边对「创新的心脏是差异」这一点,估值完全一致。
E ↔ 会通 · 统一 · 跨学科穿透。科学史上估值最高的工作,几乎都是把两个原本分离的领域结构性地咬在一起:麦克斯韦把电、磁、光合于一组方程;达尔文把地质学与马尔萨斯的人口论咬进生物学;沃森与克里克把化学结构咬进遗传。休厄尔早给这条判据起过名——归纳的会通:一个理论若能让原本各说各话的多类事实在同一结构下同时成立,分量陡增。而这必须是结构性纠缠、不是借词类比,恰好就是 E 维那把刀。
I ↔ 根本性 · 范式转移。科学能给的最高评价,留给那种已有范式装不下、逼整个领域重新组织的结果——这正是库恩的「反常→危机→新范式」。是已知理论的推论,它就是干净的常规科学,估值有限;已有理论怎么都容不下,它就是新教科书的种子。基金评审里那条压倒一切的「会不会改变范式」,问的就是不可还原性。
F ↔ 可检验 · 冒险的新预测。这一维直接就是波普尔:一个主张之所以算得上科学,前提是它可证伪——得说清什么情形会推翻它,预测得是冒险的。拉卡托斯再补一刀:进步的研究纲领要能预测出此前没人料到的新事实。科学用可证伪性划「科学/伪科学」的界,本体系用它划「发生/伪发生」的界——同一道界,两个名字。
| 科学哲学 / 建制传统 | 各自主张的「创新本质」 | 对应维度 |
|---|---|---|
| 波普尔(可证伪主义) | 可证伪、冒险的预测 | F 可证伪性 |
| 库恩(范式转移) | 反常逼出的范式重组 | I 不可还原性 |
| 拉卡托斯(研究纲领) | 预测出此前未料的新事实 | F(进步性)+ D |
| 休厄尔(会通) | 多类事实在同一结构下会通 | E 纠缠深度 |
| 默顿(优先权传统) | 第一个切出的新颖贡献 | D 差异锐度 |
| 方法论 / 同行评议传统 | 严密、可复现、方法可靠 | S 结构精确度 |
14.2 连权重的搭配和分工线都对得上
D 最高、F 最低却当闸门,这个结构在科学里也一样:新颖性是价值的承载者(所以争得最凶),可证伪性更像一道准入的门(是否可检验,近乎二元判断),不是估值的主轴,却也绝不可绕过。两边都把「新」当心脏,把「可检验」当门槛。
还有更深一处、常被忽略的吻合:本体系明说自己不量真理性、只量新结构发生的深度,而科学评估也是同一副两段式结构——投稿时的同行评议判的是新颖、严密、根本性,真伪则交给之后的复现与时间。一篇顶刊论文可以创新度极高、几年后却被撤稿;正如一个 165 分的产出日后可能被证明是错的。两套体系不只共用五条判据,还共用同一条分工线:创新此刻判,真伪留给时间。
14.3 边界:哪里就不同了
要诚实,就得把边界划出来。二者只在「知识创新本身的内在判据」这一层重合;科学评估一旦掺进两样别的东西,就与创新智商分道:
- 实用价值(这个发现能不能变成技术、变成药)。基金评审常把它算进影响力,但它是一根和认知新颖性正交的轴,创新智商是故意不量它的。
- 优先权的社会奖励。科学建制奖励最先抵达者,但那是一套奖励机制,不是这项创新内在深度的判据。
所以准确的表述是:在知识创新的内在判据上,二者同构;只在科学评估外接了非认知轴或社会奖励机制的地方,才分开——而那两样,恰是创新智商按设计排除的。
最后是这个判断真正的收获。科学哲学吵了整整一个世纪:波普尔说可证伪性是命根子,库恩说范式转移才是,拉卡托斯说要看新预测,休厄尔押会通,默顿讲建制规范——每一派都攥着一条判据、宣称唯有它才是本质。而把五维摆出来,这场仗就化解了:他们不是关于科学的五种对立理论,而是同一场发生评估的五个维度。谁也吵不赢,不是因为不够聪明,而是各自量的本就是同一个东西的不同轴。科学创新评估从来是这五维一起在跑,只是从没被谁写成一张带权重、且对自己也设了证伪条件的评分表。
——不过下一节就会说到,这张表目前还缺至少一维。
十五、评分者自己的五种偏差,与三条铁律
14.1 五种偏差
- 过度通胀(把 130 打成 150):症状是对漂亮表达过敏、对实质不足麻木。纠正:每一个 150 以上的评分,都必须找出「不可还原性」的具体证据;找不到,一律降到 145 以下。
- 过度紧缩(把 150 打成 130):症状是对术语过敏,觉得「看起来高大上=必有水分」。纠正:把所有术语去掉、用大白话重述一遍,如果重述后仍然是 150 的思想,那它就是 150。
- 单一维度主导(只看 D):一看到新概念就给 150,不管 F 是不是只有 80。纠正:五维严格独立打,任何一维低于 120 都会拖累综合分,I/F 低于 120 直接闸门封顶。
- 与出处挂钩:看到「某顶级基底写的」就高估、看到「某便宜基底写的」就低估。纠正:评分纯看文本,把作者信息盖住再评。
- 没给扣分句:直接甩一个数字,不说为什么不是隔壁那个数。纠正:每个评分都必须附至少一句扣分句证据和一句加分句证据。
14.2 三条铁律
- 不评分自己写的文本。人对自己的产出必然主观膨胀。要评自己的东西,交给另一个独立评分者——另一个基底、另一个人。本文案例一严格执行了这条:讲稿是我写的,两份评分都不是我给的。
- 盖住出处再评。这也是「多基底独立评分能否收敛」这件事能被观察到的前提:只有盖住出处,多个基底对同一文本的独立评分才可能收敛到同一区间。
- 参照文库与评分截至日必填,且默认取全球最新。见第九章。一个不声明自己相对哪片文献、截至哪一天的创新分数,严格说来还没有完成——它只报出了半个数。
十六、把刀转向自己:这套评分怎样会错
按规矩,任何一套主张都必须交代自己的证伪条件。一套号称「客观、可重现」的评分,如果自己不可证伪,就正好犯了它拿来评别人的那条罪。
15.1 三条可检验的证伪条件
- 信度检验:同一份文本交给多个独立评分者,若综合分的一致性持续达不到可接受水平(建议用组内相关系数或 Krippendorff's α,阈值 0.80,而不是用原始极差),则「可重现性」主张为假——评分只是各人的主观印象,不是测量。并且必须对五维各自报信度,最可能失信度的正是 D 和 I,因为它们依赖评分者手里的文库宽度。
- 排序一致性检验:拿一批历史上已评过分的产出重新排序,若与历史排序的一致性持续低于 80%,则标尺不稳定。
- 错位检验:让评分体系去评一批公认的大众文本和一批公认的顶级产出,若大众文本被给到 100 以上、或顶级产出被给到 155 以下,则标尺出现系统性错位。
15.2 三个已知的弱点,摊开来说
弱点一:那条 100 ≈ 基底零提示语基线,目前只是断言。整把尺子的意义都挂在这条上,却还没有做过「取 N 篇基底零提示语产出、按五维评分、看是否聚在 100」的实测。这是最便宜也最该先跑的一次验证,恰好就是错位检验的下半条。本文案例二给了一个样本(83 分),一个样本不构成验证。
弱点二:五维的正交性是断言的,从未被测。规程要求五维独立打分,可第九章又把 D/E/I 划为同一条「新颖轴」。若 D 与 I 高度相关,新颖性实际被计了两次(0.45),而效度轴只有 0.35。这可测且便宜:拿一批已评文本算五维相关矩阵,若 D 与 I 的相关系数高于 0.8,就说明五维实为三维,权重需要重设。
弱点三:权重目前可能是装饰性的。在 110–165 这个常见取值区间里,加权分与等权平均之差通常只有一两分,对「是否跨过 150」的判定几乎不产生差别——本文案例一的加权分 138.45,等权平均是 136.2,差 2.25 分,不改变任何判定。这意味着真正在起作用的是五维的原始打分,不是权重。要么承认等权、要么把权重拉开到能产生差别的幅度并给出依据。这一条我倾向于前者,但还没有做够实测。
15.3 五维可能不穷尽:两个我举得出的反例
规程的第九章主张五维穷尽了科学共同体判断创新的全部内在判据,并自设证伪条件:举出一条落不进五维任一维的判据,「穷尽」即被推翻。我举得出两条,都来自库恩自己 1977 年列的理论优点:
- 简约性。两个理论可以同样精确(S 相同)、同样可证伪(F 相同)、同样不可还原(I 相同)、切出同样的差异(D 相同),而其中一个更简单。简单性不是精确性——S 量的是「结构有没有被清晰显露」,不是「结构有多少个零件」。这条判据在科学中权重极高,却在五维里无处安放。
- 丰饶性。一个理论能催生多少此前无人提出的新问题。一个命题可以极不可还原却贫瘠——自成一体,无人能接着往下做。I 量的是「能不能独立站住」,不是「别人能不能接着长」。而本体系自己把认知物定义为「能被别人接过去继续用的新结构」,五维里却没有任何一维在量「能不能被接过去」。
所以诚实的表述是:五维的穷尽性目前不成立,至少缺一个「生成性」维度,或者需要一个把简约性与丰饶性归约进现有五维的论证——而那个论证必须写出来,不能靠「我暂时举不出反例」。这一条补上之后,体系会比现在更硬。
15.4 它明确不测什么
最后必须说清这套评分不测什么:它不测一个命题的真理性。一个 165 分的产出,可能在未来被证明是错的;创新智商测的是新结构发生的深度,不是这个新结构对不对。二者是两件事。对不对,最终由现实和时间仲裁——这也是为什么 175 以上的评分标注为「通常需要时间检验」:在那个高度,任何当下的打分都只是一个待验的猜想,真正的评分者是时间。
十七、本文禁止什么
一套评分工具一旦流传开,最先被滥用的一定是那个数字。所以把禁止项写死在这里。
- 禁止用创新智商分数给人排名、或作为录取、聘用、晋升、评奖的依据。它评的是一段文本在一个特定文库下的发生深度,不是一个人的能力、更不是一个人的价值。同一个人不同文本的分数可以差三十分。把它当人才评价指标使用,是本文最不愿看到的误用。
- 禁止只报综合分。不给五维独立分、不给扣分句原文、不给提升路径的分数,按本体系自己的三条证据纪律即为失效分数,不得引用、不得转述。
- 禁止不声明参照文库与评分截至日。一个没有这两栏的分数只报出了半个数。凡对外发布 150 分以上的评分,必须同时公开你查了哪些语种、哪些学科、什么时间窗,以及你专门去找过哪些「这想法可能早有了」的方向。
- 禁止作者给自己的文本打分后对外发布。自评可以做,但必须标注为「作者自评、不作数」,或交由独立评分者盲评后才可发布。
- 禁止把分数当真理性判据。152 分不等于对,83 分不等于错。一段 83 分的话可以完全正确(它只是没有新东西),一段 165 分的产出可以完全错误。把创新智商当正确性证书使用,是对这套体系最彻底的误解。
- 禁止用收窄文库刷出来的高分对外宣称。这一条是本文第九节的直接后果,也是我认为最重要的一条:如果你只查了中文文献就报出一个 150,你报出的不是一个成就,是一个尚未做完的检索。
结语 评价不在发生之外
把全文收成一页纸:
- 三维量发生的构造:显露 S(0.20)、差异 D(0.25)、纠缠 E(0.20)。
- 两闸查发生的真伪:不可还原 I(0.20)、可证伪 F(0.15);任一低于 120,封顶 145。
- 加权合成一个可重算的数,对照一把有两条硬阈值的标尺:150 本体论级、160 典范级。
- 三把刀:I=五十字压缩能否被已有命题 1:1 替换;E=删掉那个学科论证还成立吗;F=追问不出证伪条件则 F 不超过 100。
- 一条跃迁公式:把「X 是 Y」改写成「X 不是 Y,而是 Z」,Z 承载不可还原的新结构——同时抬 D 和 I,性价比最高。
- 一条硬口径:分数是文本与参照文库之间的关系,约三分之二是关系、三分之一是属性;参照文库默认取全球最新,收窄文库只能作对照组并列出现。
本文用三个案例把这套东西走了一遍:一份讲稿在中文文库里得 138、在全球文库里只有 125,落差 13.15 分全部来自新颖轴;一段基底默认产出得 83 分,低于基线;然后沿着 I 维审计留下的那点余量做一次命名跃迁、再补一次纠缠,把 125 抬到 152——全程不换文库。
最后说这套体系最要紧的一条自律。它把自己也放上了评分台:三条证伪条件、三个已知弱点、两条自己举得出的反例,都写在上面了。一套评分若不能说清自己怎样会错,它就没有资格去评别人。
评价不在发生之外。评价本身,就是一次发生。
本文自己的参照声明(按第九章的必填项,作者对自己也照做一次):本文所用参照文库为中文+英文,覆盖教育学、成人学习理论、文化人类学、组织行为学、进化生物学、科学哲学,时间窗 1909–2026;评分截至 2026 年 7 月。本文所有案例的综合分均由脚本计算、分项逐条列出,供任何人复算。若复算结果与文中不符,以复算为准。