← 分解之前德麦国际专著第 98 号王德生 · Claude

第四十一章 真跑三:预先声明一场正在发生的争论会长成什么形状

执行状态:预注册已定稿(本章即注册文本),回溯性可行性探针已做,前瞻性编码未开始。

41.1 这一跑与前两跑的性质不同

真跑一检验读数式,真跑二检验实体发生学的一条推论。这一跑检验的是本书的探测法能否在一场尚未结束的争论上预先说出它的形状。

它的价值在于预先这两个字。回溯地说明一场旧争论属于本族,说服力有限——总可以被指为事后配对。而在争论仍在进行时先写下它会怎样发展,再等它发展,是本书能做的最硬的一件事。

⚠ 也正因此,这一跑的成本是时间:注册在今天,检验在若干年后。本章能做的是把注册文本写死,并做一次不构成检验的可行性探针。

41.2 被预言的对象

争论:大型语言模型是否"理解"。

Σ = 理解的构成条件。R = 理解归因。

T:要判定理解,须有一个不再需要进一步说明的理解标志。⟹ 正题:存在判定理解的充分标志。

N:任何被指为标志的东西,仍可被要求说明"它为什么算理解"。⟹ 反题:无终极标志。

⇒ 按第 9 章属族判据,它写得成 T/N,且撤销 (c) 之后(承认归因改写"什么算理解")两条相容。因此本书判定它属于 O₁ 族,与第六组(根据)、第七组(意义)同形。

41.3 预注册的三条预言

以下三条在本书出版之日生效,检验窗口为其后五年的文献。

预言一(形状):该争论的双方主张将持续可被归约为 T 与 N 两条必要条件——即一方主张"存在可判定的标志",另一方主张"任何标志都可被再追问"。不会出现第三种独立于这两条的主张形态。

预言二(卡点):争论将卡在第三步——指认被禁止的推进。即:双方将继续争论"什么算理解",而不会把"归因过程本身改写了什么算理解"作为论题。若这一步被普遍接受为论题,争论的形态将改变。

预言三(判准漂移):随着系统能力变化,"理解"的判准将被反复重设,且每一次重设之后,此前被用作标志的能力将不再被视为充分。⇒ 这正是第 16 章第七组"应用改写规则"在当代的形态。

41.4 编码规则(先写死)

  • 语料:检验窗口内,在指定的会议与期刊上以"理解/meaning/comprehension"为核心论题的论文摘要与结论段。
  • 编码维度:①主张形态(T/N/其他)②是否把"判准的被改写"当作论题(是/否)③所引判准的具体内容与年份。
  • 编码者:两名,独立,对本书设盲。κ ≥0.6。
  • 判定
  •  - 预言一失败:若"其他"类占比 >0.15。

     - 预言二失败:若"把判准的被改写当作论题"的占比 >0.30。

     - 预言三失败:若判准内容在窗口内保持稳定(同一判准被持续接受)。

  • 不利结果预案:任一条失败即如实登载。三条全部失败,则第 20 章的五步与本章的预注册预言在活跃领域无效,须限定其适用范围为已完结的哲学史争论。
  • 41.5 回溯性可行性探针(本书写作现场已做,不构成检验)

    为确认语料可得、类别可辨,本书对该争论已有的代表性文献做了一次快速探视。以下只作可行性说明,不作证据使用——因为它是回溯的,而回溯地找到符合形状的例子,正是本书在第 9 章警告过的那种事后配对。

    探视结果有三点值得记录:

    其一,双方阵营的形状清晰可辨。否定一侧的代表性论证主张:只在形式上训练的系统原则上无法获得意义,因而"理解"这个归因不适用。肯定一侧的代表性论证主张:功能上等价于理解的能力已经出现,或意义不必依赖指称。⇒ 前者是 N 的一种强形式(任何形式标志都不足以充当理解的标志),后者是 T 的一种(存在可判定的功能标志)。类别可辨。

    其二,该争论存在稳定的意见分裂。已有综述提到研究者意见接近对半分。⇒ 持续而对称的分裂,是本族争论的标志(第 17 章 17.2)——若一方明显占优,多半不是本族。

    其三,也是最值得注意的一点:该领域最有影响的一份综述,其结论是"需要界定不同模式的理解"。

    这正是判准漂移的形态:当争论无法在既有判准下裁决时,出路被指向重新划分判准,而不是在既有判准下判定。这与第 16 章"应用改写规则"完全同形。

    ⚠ 但必须立刻说明它的证据地位:这是回溯观察,不是预言的兑现。本书把它记为"预言三在注册之前已有一次符合的观察",而符合先前观察的假设是廉价的——真正的检验只能是前瞻的。

    41.8 基线测量:第一次执行,以及它如何失败

    本节记录一次真实执行。它不是对三条预言的检验——预言的窗口在出版之后;它是基线测量:在窗口开始之前,先量一次当前的分布,作为日后比较的底数。

    语料。从公开预印本库按年分层抓取 2023—2026 年的摘要,检索式为"language model"与"understanding"同时出现,每年取最近 300 篇,合计 1,200 篇

    编码。按第 41.4 条的精神,先写死词表与判定规则,再运行;运行后不修改词表。三项输出:主张形态(T/N/兼有/其他)、是否以"判准被改写"为论题、逐年分布。

    结果:失败。

    题域过滤只通过 21 篇,而这 21 篇的 T/N 编码全部为零,全部落入"其他"。

    两处失败原因,逐条写明:

    其一,抽样框错了。该检索式抓到的绝大多数是工程论文——它们提到"理解"是因为任务名称里有这个词,而不是因为它们在争论理解。本书的题域过滤词表是按哲学争论的措辞写的,而语料是工程文献。

    其二,词表太脆。通过过滤的那 21 篇里,有相当一部分是形如"Do X really understand Y?"的基准论文——它们恰恰是 T 一侧的典型形态(提出一个可判定的标志)。而本书的 T 词表要求"提出"与"基准"在句法上紧邻,实际写法多为"我们提出 X-Bench,一个用于……的基准",于是一条也没有命中。

    一次编码工具与语料的双重错配。本书如实登载这次失败,理由与第 40 章末那句相同:一本把未执行的设计写成已完成检验的书,比一本没有检验的书更坏;而一本把失败的执行藏起来的书,比前者更坏。

    41.9 第二次尝试:探索性的,不作确证

    声明:以下规则集是在看到第一次失败之后写成的。按预注册的纪律,它不能用于检验第 41.3 的三条预言;它只能作为探索,用途是判断这条路值不值得继续走。

    第二次的改动有两处:题域过滤放宽到把"以基准或探针方式追问某系统是否理解"也计入;T/N 词表改为更宽的形态匹配。

    结果(n=93):

    篇数TN兼有其他以判准被改写为论题
    2023155(0.33)0190
    20242914(0.48)12120
    20252719(0.70)3051
    20262216(0.73)1410
    合计935457271(0.011)

    三点读数,全部标为探索性:

    其一,T 一侧压倒性占优,且逐年上升(0.33 → 0.48 → 0.70 → 0.73)。⇒ 在这一文献层面上,争论的实际形态几乎全部是"提出一个新的可判定标志"。这与预言一的方向一致,但不构成对它的支持——因为预言一说的是双方都可被归约为 T 与 N,而这里 N 几乎不出现。

    其二,"以判准被改写为论题"者只有 1 篇(0.011),远低于 0.30 的失败阈值。⇒ 与预言二的方向一致:这一步没有成为论题。⚠ 同样只是方向一致,不是检验。

    其三,"其他"占比 0.29,高于预言一 0.15 的失败阈值。若这是正式检验,预言一在这一语料上已经失败。本书不因为它是探索性的就略过这一点——这是本次执行中对本书最不利的一个数字。

    41.10 从这次执行中学到的三件事

    其一,抽样框是这条路上最难的一步,不是编码。工程文献与哲学争论共用"理解"这个词,而它们不在同一场争论里。⇒ 正式执行必须换一个抽样框:以少量公认的争论文献为种子,沿引用关系扩展,而不是靠关键词检索。本书据此修订第 41.4 的语料条款。

    其二,T 一侧的实际形态是"提出基准"。这是本次执行的唯一实质发现,而且它是预先没有想到的:在工程语境里,T 条件不是以哲学命题的形式出现,而是以一个数据集的形式出现。⇒ 每一个新基准,都是一次"存在可判定标志"的主张;而每一个基准被刷过之后,判准被重设一次——这恰恰是预言三所说的漂移,只是它发生在数据集层面,不发生在论证层面。

    本书据此把预言三的观测口径扩展一条:判准漂移不仅体现在术语的重新界定上,也体现在基准的更替率上。后者更容易测,且有完整记录。

    其三,"其他"占比过高这件事,指向一个本书没有预料的可能:也许这场争论在文献中根本不以"主张形态"的方式呈现,而是被拆散在大量既不表态、也不追问的技术工作里。⇒ 若如此,第 41.3 的三条预言测的可能是一个不存在的对象。这是本次执行给本书提出的最尖锐的问题,本书目前答不上来。

    41.11 本次执行的全部材料

    语料(1,200 条记录)、两次编码脚本与两份编码结果,随书附出,可复核可复跑。任何人都可以用同一份语料换一套词表,得到不同的数字——而这正是本书希望发生的事。

    41.12 第三次执行:换一层取样,因为前两次取的都是已被抹平的那一层

    前两次执行之后,有一处诊断被指出来,而它比本书自己写的"也许对象不存在"要准得多:

    本书所取的语料,是悖论已经被去掉的语料。

    已发表的摘要是什么?是 Π 压缩之后的产物(第 4 章)。一篇论文从争论走到摘要,中间经过写作、内部修改、投稿、审稿、定稿——每一道工序都在做同一件事:把"这里说不清"改写成"我们提出"。摘要是全篇最光滑的一段,而前两次执行恰恰只取摘要。

    用第 25 章的读数式说,这个错误可以说得更精确:本书把取样时点放在了 t 的定格段、n 的高位——而那正是"过程变得不可见"的条件。读数式说的就是这件事。

    本书用一台按"发现"的取样方式造的仪器,去测一个只在"发生"中才显形的东西。

    ⇒ 这不是技术疏漏,是测量本身的终点前置:把学术共同体长过程的终点(定稿)当成了那个过程的样本

    据此重排抽样框,按"被光滑掉多少"分层:

    语料光滑度可得性
    公开审稿意见与作者答辩低——争议在往复中原样保留⚠ 见 41.13
    同一论文 v1 与最新版之间的差异中——改动处即被抹平处可批量
    全文的局限与讨论段可取
    摘要(前两次所用)最易取 ← 错在这里

    41.13 第一层:取不到

    公开审稿平台的接口对匿名请求返回拒绝,论坛页面为脚本渲染,无法批量抽取评审与答辩正文。这一层在本次执行中不可得。

    ⚠ 本书如实记录这一点,因为它本身是一个有分量的事实:最未被光滑化的那一层,恰恰是最不容易被批量获取的一层。⇒ 这与第 4 章 4.7 的推论互为表里:压缩不可逆,而未压缩的材料通常不公开。

    41.14 第二层:执行了,结果是零

    做法:从 1,200 篇语料中取出有第二版及以上、且落在题域内的 57 篇;分别抓取其 v1 摘要最新版摘要;预先写死三组词表(对冲词、强断言词、理解族词),按每千词密度作配对比较;词表运行后不改。

    结果

    每千词净变化(中位数/均值)上升下降不变
    对冲词+0.00 / −0.617615
    强断言词+0.00 / +0.0910117
    理解族词+0.00 / −0.1913114

    57 对中摘要确有改动的 28 篇(49%);三项的符号检验均不显著(p = 1.00、1.00、0.84);长度中位数变化为 0。

    没有任何方向上的系统变化。

    而这个零结果,恰恰支持了 41.12 的那条诊断,只是方向与预想不同:

    本书原以为光滑化发生在 v1 → v2 之间(投稿到定稿)。实测显示不是:v1 的摘要已经是光滑的。光滑化发生在更早——在写作与内部修改阶段,即在文本成为公开语料之前。

    41.15 三次执行合起来说明了什么

    其一,这条真跑在公开文献层面不可执行。不是难做,是测不到:公开的每一层都已经是产物。唯一未光滑的层(审稿往复、写作过程、口头争论)要么不公开,要么不留痕。

    其二,这正是第 4 章 4.7 的经验形态。那里的推论是:Π 不可逆,故从句子出发无法还原事件,因而终点前置在纯思辨中几乎不可能被发现。本次执行把这条推论从哲学命题变成了一个可核对的操作事实——三次取样,三层语料,全部落在产物一侧。

    其三,本书据此修订第 39 章真跑一的语料条款。真跑一取的是"认识论论证的开篇与结论段"——同样是定稿层。按本节,它也必须补一层未光滑语料(讲稿、笔记、通信、修订史),否则它测的将是同一个被抹平的表面。

    而这一修订有一个不好受的连带后果:第 42 章证伪清单里,凡是靠已发表文献做的条件,其效力都要相应打折——因为它们都在定格层取样。本书在此写明这一点,不藏。

    41.16 本次执行留下的一条方法论命题

    凡是要测量一个"被光滑化的东西",就不能在光滑化完成之后的层面上取样;而学术出版的成品,正是光滑化最彻底的一层。

    ⇒ 这条命题对本书自己同样有效:本书也是学术出版的成品。读者若要看本书自己的光滑化,唯一的入口是它保留下来的修改痕迹——第 4 章那句被收回的话、第 25 章那次被反例逼出的让步、第 44 章那笔被改判的账,以及本章这三次失败。那是本书唯一没有被抹平的一层。

    全部材料(语料 1,200 条、三次编码与比对脚本、57 对版本比较的原始计数)随书附出,可复核可复跑。

    41.6 三处必须先承认的弱点

    弱点一,可证伪性偏低。三条预言中,预言一与预言二的失败阈值(0.15、0.30)由本书自定,缺乏外部依据。⚠ 本书如实标明:这两个数字是判断,不是推导。若有人给出更合理的阈值,本书接受替换。

    弱点二,自我实现的风险。若本书被该领域读到,它可能改变该领域的论题选择——尤其是预言二("把判准的被改写当作论题")。一本预言了某种沉默的书,可能自己打破那种沉默。⚠ 处置:若预言二失败,须先检查失败是否由本书自身引起;而这一检查本身很难做。本书承认这是一个结构性的问题,没有干净的解法。

    弱点三,语料边界模糊。"以理解为核心论题"的判定本身需要编码,而这一层编码的一致性未测。⚠ 41.8 的失败已经证实这条弱点是真的,而且比预想的严重。

    弱点四(由执行发现):抽样框可能测不到那个对象。见 41.10 第三条。

    原弱点三续:"以理解为核心论题"的判定本身需要编码,而这一层编码的一致性未测。

    41.7 这一跑成立会得到什么

    若三条预言在五年窗口内成立:本书的探测法在一场当代争论上做出了可核对的预先判断。这将是本书全部主张中最难被解释为事后配对的一条。

    若失败:第 20 章的五步与第 43 章的探测法退回为只适用于已完结争论的回溯工具。⚠ 而这是一个不小的损失——一个只能整理历史的框架,不能预言,也就不能被真正检验。