检验对象:《谁来陪伴我?》(德麦国际专著第 92 号)附录四标为 ★ 的六条判错方式——它们的共同点是不需要招募伴侣、不需要伦理审批之外的条件、周期以周计。
撰写人:王德生 + Claude 日期:二〇二六年八月 状态:六条全部未执行
附录二那二十四条里,第九条已单独出了预注册(《同成品—同接受项—异删除分支》)。那一条要招 194 对伴侣。剩下的六条 ★ 不需要。
把它们按所需材料而不是按章号重排,会发现一件本书写的时候没有注意到的事:
六条里有三条共用同一份材料。
| 条 | 出处 | 被检验的 | 材料 |
|---|---|---|---|
| A1 | 第三章第九节④ | "陪伴"一词的语义收窄 | 研究 A:一份历时语料 |
| A2 | 第八章第八节④ | 四步减法的历史叙事 | 研究 A:同一份语料 |
| A3 | 第五章第九节④ | 凝结窗中位数近十年坍缩 | 研究 A:同一份语料 |
| B | 第九章第八节④ | 删除报告的重测可靠性 | 研究 B:两轮访谈 |
| C | 第六章第九节④ | 外部渠道是否替换了向伴侣开口的压力 | 研究 C:一份行为日志 |
| D | 第四章第十节① | 自述—复述落差的归零时间 | 研究 D:现成对话记录 |
三项研究(A 一次做完三条,B、C、D 各一条),加起来的成本远低于第九条那一个实验。而其中 A3 与 C 若成立,本书将第一次拥有来自真实数据的支持;若不成立,本书要撤掉的东西比第九条那一条更多。
A1(第三章)。 若在近二十年的中文语料中,"陪伴"一词与「倾听/回应/共情/情绪」类词的共现比例没有相对上升,且与「留下/不走/扛/守」类词的共现比例没有相对下降,则第三章第四节的"反向定型"是一个未经检验的修辞,须降级为假设或删去。
A2(第八章)。 若"道歉"及其近邻语境中,「有效道歉的形式要件」一类表述(承认具体行为/不带"但是"/说明补救)没有相对上升,而「我就是想说点什么/我不知道该怎么说」一类表述没有相对下降,则第八章第二节那份四步减法的年表是一个未经检验的历史叙事,须降级。
A3(第五章)。 若在能读出时距的语料(见 A 之三)中,从"摩擦发生"到"首次向他人提取为议题"之间的自报时距中位数近十年没有下降,则第五章第六节那条时代判断错,凝结窗坍缩须收窄为一条与当代无关的一般机制。
必须先说清楚:没有一份现成的中文语料是为这个问题建的。 可用的候选各有缺陷,本节把缺陷写在前面,而不是等审稿人指出来。
| 候选 | 优点 | 致命缺陷 |
|---|---|---|
| 报刊语料(如《人民日报》历时库) | 时间连续、易得、分词成熟 | 语域完全不对——它不是人们谈论自己关系的地方 |
| 公开社交平台文本 | 语域对,量大 | 平台自身的兴衰造成采样断裂;条款限制 |
| 中文问答/论坛的公开求助帖 | 语域最对,且自带时间戳与"事情多久之前发生"的自述 | 平台世代更替;用户构成随时间漂移 |
| 图书与影视字幕 | 跨度长 | 经过编辑,滞后于口语数年 |
本方案的选择:以问答/论坛求助帖为主语料(它同时是 A3 唯一可用的材料),以图书语料为辅做趋势对照。两者结论不一致时,不取其一,如实报告不一致——这一条写在前面,防止事后挑选。
样本框:事前写死时间窗(例如 2006–2025,按年分层),每年随机抽同等数量的帖子(例如每年 2,000 条),主题限定为"亲密关系/夫妻/伴侣"。抽样脚本与随机种子须在取数前公开。
这一节是研究 A 的全部难点。
任何词在二十年里的绝对频次都会变,原因与本书无关:网络语言的整体变化、平台风格的变化、用户群的变化。因此绝不能用绝对频次。
三道防线:
防线一,用比例而不是频次。 A1 的判决量是R = (陪伴 与 情绪类词共现次数) / (陪伴 与 留下类词共现次数)这是一个内部比值,词表两侧同时受基线漂移影响,比值对漂移不敏感。
防线二,安慰剂词(事前指定,不得更改)。 对每条命题各指定一组理应不动的对照:
照顾、相处 —— 若它们的对应比值与"陪伴"同步变化,说明测到的是整体语言漂移,A1 不成立。感谢及其形式要件 —— 若"感谢"也同步形式化,说明测到的是"一切言语行为都在形式化",A2 降级为一般现象,不属于本书的机制。防线三,词表由不知情者构建。 两侧词表(情绪类/留下类等)交给不读过本书的人按定义扩充,避免作者把结论写进词表。词表定稿后公开,不再改动。
A3 需要"摩擦发生"到"首次提取"的时距。语料里没有这个字段,只能用代理:
求助帖中的自述时距——"刚刚吵完架"、"昨天晚上"、"上个星期"、"这事有一个多月了"。用正则+人工校验抽取,归入五档(当日/2–3 日/1 周内/1 月内/更久)。
这是一个弱代理,弱在三处,写明如下:一,它只覆盖那些会去发帖的人;二,"提取给陌生人"与"提取给伴侣"不是同一个动作;三,五档是粗的,抓不住"第九秒"这一档——而第九秒恰恰是本书说的那一档。
因此 A3 的结论只能是单向的:若时距中位数没有下降,第五章的时代判断被推翻(推翻有效);若下降了,只能说"与本书一致",不能说支持——因为代理太弱。这个不对称写在前面。
对每条命题:按年计算判决量 → 拟合线性趋势(年份为自变量)→ 报告斜率与 95% CI → 同时报告安慰剂词的斜率。
判决规则(事前):
不做的事:不做多个词表的探索性尝试后选一个报告。词表与判决量在取数前定稿并公开。
第九章唯一可操作的读数是"分支删除量",取法是事后三问:你当时本来想说什么/为什么没说/不说这一句你自己损失了什么。
若同一批人在不同时间点对同一事件的删除报告一致性低(一致性 < 0.5),则该读数不可用,第九章唯一可操作的东西作废。
样本:40 人(不需要成对),近两周内经历过一次可命名摩擦。T1:访谈,三问,记录:所删句子的文本、想说程度(0–10)、放弃理由(编码为五类)、损失自评。T2:两周后,同一访谈者,同一三问,不出示 T1 的任何内容。
一致性判据(三项分别报告):
通过标准:三项中至少两项 ≥0.5,且语义一致性一项必须 ≥0.5。
T2 本身是一次追问。 按第十章,追问会切割那个活过程;按第四章,一旦提供格式,格式会前移。所以 T1 有可能塑造了 T2 的答案,使一致性被人为抬高。
处置:分半设计。
若甲半一致性显著高于乙半,说明一致性里有相当一部分来自"记住了上次自己怎么说的"而不是"记得当时想说什么",则该读数的可靠性是虚高的,须在正文中标注。
这一条是本方案里唯一一处主动去找自己有利结果的水分的设计。
| 结果 | 处置 |
|---|---|
| 三项均 ≥0.5,甲乙半无差异 | 读数可用,第九章第六节保留 |
| 语义一致性 <0.5 | 读数不可用,第九章第六节撤销,本章除描述外不剩可操作的东西 |
| 三项达标但甲半显著高于乙半 | 读数可用但须标注虚高,并把"T2 前置无关访谈"写成标准程序 |
| 想说程度 ICC 低而语义一致性高 | 删除量的强度分量不可靠,s 的三项合成须降为两项(去掉自评强度) |
第六章第五节主张:外部倾诉渠道拆掉了防卫的天然限速——过去"一句话没地方说"的憋闷会逼着人在某一次说出口,而那一次就是一次成证机会。
若高强度使用外部渠道的一组,其向伴侣开口的频率不低于低强度组,则"限速被拆掉"这条错。
本书原来那条判错方式写得不对,这里改正:按使用强度分组做组间比较,无论结果如何都不能判决。 理由是选择效应——本来就不太向伴侣开口的人,更可能去用外部渠道。组间差异既可解释为"渠道替换了开口",也可解释为"不爱开口的人才去用渠道",两者不可分辨。
改为个体内设计。
样本:60 人,连续 8 周,每日一次简短日志(≤90 秒)。
每日三个字段:
主分析(个体内滞后模型):向伴侣开口(t) ~ 使用外部渠道(t−1) + 使用外部渠道(t−2) + 未说事项累积(t−1) + (1 | 个体)
本书的预测:使用外部渠道(t−1) 的系数为负——昨天说给别人,今天向伴侣开口的概率下降。竞争预测("倾诉是练习"):系数为正——说给别人之后更容易向伴侣开口。
两个方向相反,这是本方案里最干净的一处对照。
次级分析(这一条更接近机制):向伴侣开口(t) ~ 未说事项累积(t−1) × 使用外部渠道(t−1)本书的机制说的不是"渠道减少开口",而是"渠道切断了积压与开口之间的联系"。所以关键在交互项:无渠道时,积压越多越可能开口(正斜率);有渠道时,这条斜率变平。
若主效应为负而交互项不显著,本书只得到一个较弱版本的支持;若交互项不显著且主效应也不显著,第六章第五节错。
第四章第五节主张格式前移:一个人说出粗糙的原话 → 收到一个更好的版本 → 采纳它作为自己的原话。第九节给的读数是自述—复述落差及其归零时间。
若归零时间中位数长于数周,格式前移是被夸大的现象,第五节须撤销为边缘现象。
材料:参与者自愿提供的、与某个软件的历史对话记录,限定于关系主题。必须:本人明确同意、按对话为单位选择性提供(不是全部导出)、去标识(人名、地名、单位、时间点替换)、涉及第三方的段落由参与者自行删除后再提交。
样本:30 人,每人 ≥3 组"原话—回给的版本"配对。
落差:原话与回给的版本之间的嵌入余弦距离;同时报告一个不依赖模型的替代指标——关键名词化词的出现数差(第四章第四之一节那份词表:需求、边界、被看见、情绪价值、安全感、课题分离……)。
归零时间:从首次收到该版本,到参与者在后续自发表述中首次使用该版本的核心措辞(名词化词 ≥2 个命中)之间的时长。
采纳一个措辞,可能只是图省事(在同一个界面里继续对话时顺手用),而不是本书说的替换(那套说法成了他自己的语言)。两者必须分开。
加一个场合判据:该措辞是否出现在没有那个版本可用的场合——参与者向朋友口头讲述、或在与该软件无关的文字里描述同一件事。
这一条把 D 的判决量从"用词重合"提升为"语言归属",也使 D 的结论比原判错方式更硬。
| 条 | 研究 | 材料 | 周期 | 失败则撤销 |
|---|---|---|---|---|
| A1 | A | 历时语料 | 3–4 周 | 第三章第四节(反向定型)降为假设 |
| A2 | A | 同上 | 同上 | 第八章第二节(四步减法年表)降为假设 |
| A3 | A | 同上 | 同上 | 第五章第六节(凝结窗坍缩)收窄为与当代无关 |
| B | B | 40 人两轮访谈 | 5 周 | 第九章第六节(分支删除量读数)撤销 |
| C | C | 60 人 8 周日志 | 10 周 | 第六章第五节(限速被拆掉)错 |
| D | D | 30 人对话记录 | 4 周 | 第四章第五节(格式前移)撤销为边缘现象 |
六条全部失败的情形值得单列:那时本书剩下的将只有第一、二章的两个量(可撤性与质押率,均未验)、枢纽章那个未赋值的乘积式,以及结语那四个问题。本书认为在那种情形下它不应继续被当作一本论著流通,而只能作为一份被推翻的记录。 这句话写在这里,不写在正文里,因为正文里写它更像姿态。
第一,研究 A 的语料没有一份是对的。 语域对的采样断裂,采样连续的语域不对。本方案选了问答帖并公开了它的三处弱,但这不能使它变好。A 的全部效力集中在安慰剂词那一道防线上——如果安慰剂设计不够狠,A 什么也证明不了。
第二,B、C、D 都要求参与者察觉自己的删除、积压与措辞变化。 而本书第四章第五之一节自己说过,第三档"念头前移"在原理上不可察觉。因此这三项研究系统性地只能测到本书机制的前两档,测不到最深那一档。 这不是可以靠增加样本解决的问题。
第三,C 与 D 的日志与访谈本身就是追问(第十章第五节)。每一项研究都在切割它要测的东西。本书没有办法绕开这一点,只能报告它。
第四,这份方案由希望结果成立的一方所写。 唯一的对冲是:每条的判决规则、安慰剂词、词表构建者、分半设计,全部在取数之前定稿并公开。如果执行者认为哪一条还不够紧,请直接改紧——被改紧的版本优先于本版。
本文随《谁来陪伴我?》(德麦国际专著第 92 号,ISBN 979-8-90690-034-0)发布。全文可自由使用、修改与再发布,无须署名。
本文定稿的 SHA-256(对源文 prereg2.md 计算,不含本行):ce3eeb404b0e12db8a42c5195d1a3de358d6ebd41ce9d13f5e16f65a6fc607aa
任何改动都会改变这个值。执行者若修改本文,请重新计算并连同旧值一并公布——按停止规则一节,旧版全文须保留。