本卷结语原本写着一句话:十个读数彼此正交是本卷的核心主张,而本卷没有在同一批材料上把它们一起算过。附录四把这一条列为第 1 号欠账。付印前本卷把它做了,结果记在这里,包括对本卷不利的那一半。
本附录第一版(付印前的内部稿)把第一章的资格第一到达时间做成了一个代理量 r,并据以报出四个读数、六个配对。其中三个配对是错的,现在撤回。
错在哪里。 那个代理把公共落点集合定义成“其余各曲的全部窗口减去本曲自己的窗口”。一个窗口只要出现在本曲里,就必然被这一减法剔出集合,因此本曲的任何窗口都永远不可能落进去。r 于是恒等于删失值,也就是本曲的窗口总数——它测的是曲子有多长,不是资格何时到达。
核查结果:130 首里 130 首的 r 都是删失值。 比例是 100%,不是“大部分”。它那条漂亮的分半信度 0.988,正是因为曲长本来就完全可重复。
这一次是怎么被抓住的。 不是复查代码抓到的,是执行本卷刚给卷二卷三写下的那条纪律时抓到的——“凡读数建在语料规模上的,必须出示饱和曲线”。r 的落点集合由其余各曲构成,所以它在这条线上。做饱和曲线时(预注册 prereg_sat.md,SHA-256 前十六位 3e4441992f7a11a9),语料一放大,r 立刻塌到 0 并触发除零,才反查出定义写错。一条为别人写的纪律,第一次使用就抓到了自己的错。
撤回范围。 表 A5-1 的 r 行、表 A5-2 与表 A5-4 中一切与 r 有关的配对(r×G、r×ν、r×w)、表 A5-3 的 r 行,以及附录六表 A6-1 中依赖 r 的两行(第一章×第八章、第一章×第二章),全部作废,不得引用。本附录以下各节已按三个读数重写。
修不修得回来。 暂时修不回来。把定义改正(落点集合=其余各曲的窗口,不作减法)之后,在 4 到 14 各种窗口长度上重算,r 的中位数不是 0 就是大面积删失:窗口短则语料早已覆盖一切,窗口长则本曲根本落不进去。第一章的资格到达在这个代理形式下测不动,需要换成该章正文里的 E/K/Q 谓词分离设计,而那需要本卷没有的材料。这一条列入附录四第 12 号欠账。
预注册文件 prereg_matrix.md 写于任何相关系数被计算之前,SHA-256 前十六位 88efd9e49512703a。语料为 music21 内置巴赫四声部众赞歌中声部数恰为四者,与第三章第三、四场同一子样本,实际入选 130 首。网格为一个四分音符,随机种子 20260816。
判据在事前写死:六个配对的 Spearman 相关系数绝对值全部小于 0.50 记为支持正交;任一超过 0.70 即触发该对的并入条款,本卷必须写明哪一章并入哪一章,且不得以“代理不完善”为由回避。
撤回 r 之后,能在同一批四声部材料上同时算出来的读数剩三个,因此本场测的是三个,不是十个。三个量都是代理,不是各章的完整读数:第八章的 G 未做尺度律拟合;第二章的 w 用并读窗占比而非墙宽的连续长度;第三章的 ν 只报了 m=1。
本场原本把 r 与 G 的分开单列为 H4,因为两者共享同一个底层机制、只由参照集合一外一内区分。r 撤回后,H4 无从判定,第一章与第八章的分界回到“只有论证、没有数据”的状态。
表 A5-1 三个读数在 130 首上的分布
| 读数 | 中位数 | 四分位距 | 范围 |
|---|---|---|---|
| G(第八章代理,步) | 27.0 | 14.0 | 12 – 54 |
| ν(第三章,净值) | 0.0422 | 0.0855 | −0.104 – 0.262 |
| w(第二章代理,占比) | 0.3311 | 0.1779 | 0.067 – 0.632 |
三个量的四分位距都不为零,作废条款 F1 未触发。样本量 130 过 100,F2 未触发,故本场结果可写入结语。
表 A5-2 Spearman 相关矩阵(n = 130,撤回 r 后)
| G | ν | w | |
|---|---|---|---|
| G(第八章) | 1.000 | −0.112 | +0.125 |
| ν(第三章) | −0.112 | 1.000 | −0.046 |
| w(第二章) | +0.125 | −0.046 | 1.000 |
三个配对的绝对值分别是 0.125、0.112、0.046,最大 0.125,全部远低于 0.50 的支持线,也远低于 0.70 的并入线。
H1 获支持,H2 未触发;H4 因 r 撤回而无从判定。 三对读数没有任何一对触发并入条款。
上面这张表有一个很难看的替代解释:如果四个读数本身都测不准,它们当然互不相关。 一堆随机数彼此也正交。
本卷因此加做了一场分半信度检验:把每首曲子前后各半,用完全相同的口径各算一次四个读数,再算两半之间的相关,最后用 Spearman-Brown 公式校正到全长。
表 A5-3 分半信度(n = 125,撤回 r 后)
| 读数 | 半长相关 | 全长信度 |
|---|---|---|
| G(第八章) | +0.377 | 0.547 |
| ν(第三章) | +0.234 | 0.379 |
| w(第二章) | +0.118 | 0.211 |
这个结果对本卷不利,而且是本场最重要的产出:
第八章的 G 中等(0.547),而第三章的 ν 只有 0.379、第二章的 w 只有 0.211。 也就是说,在单曲这个尺度上,w 与 ν 大部分是噪声。 它们在语料层面上的结论(第二章的族序不一致、第三章的 4% 与无特权持有分)依赖的是跨曲聚合,那些结论不受此影响;但任何人若想拿 w 或 ν 去评价某一首具体作品,本卷现在明确反对。
两个不可靠的量之间,相关系数会被压低,压低的上限是两者信度乘积的平方根。把观测值除以这个上限,得到去衰减后的相关。
表 A5-4 去衰减校正
| 配对 | 观测 ρ | 可能上限 | 去衰减 ρ |
|---|---|---|---|
| G × ν | −0.112 | 0.455 | −0.245 |
| G × w | +0.125 | 0.340 | +0.367 |
| ν × w | −0.046 | 0.283 | −0.163 |
三个去衰减值最大 0.367,仍全部低于 0.50 的支持线。 正交这一条在扣掉不可靠性之后依然成立,不是靠噪声撑出来的。
其一,只测了三个读数,不是十个。 第四、五、六、七、九、十章的读数需要各自的语料(撤载事件、承载者字段、边界标记、交付记录),四声部众赞歌上算不出来。因此“十把量尺”这一说法只被验证了三把,附录四第 1 条只兑现了一部分,剩下的部分改列为新的欠账。
其二,三个都是代理。 见本附录第二节的限度声明。若用各章的完整读数重算,相关可能变化。
其三,只在一个体裁上做。 四声部众赞歌是本卷唯一能同时承载四个读数的语料,也是最规整的一种音乐。在民歌、即兴、电子音乐上重跑是必须的,本卷没有做。
其四,w 与 ν 的低信度没有被修。 本卷只是把它测了出来并写在这里。修法是明确的——加长分析单元、或改用曲内多窗口的稳健统计量——但那要改动第二章与第三章的读数定义,超出付印前所能做的范围。
本附录第六节列了四件没做到的事,其中第三条是“只在一个体裁上做”。付印前做了它的第一步:换一个同样是四声部、但风格与年代都不同的体裁——十六世纪的无伴奏复调。
预注册文件 prereg_cross.md,SHA-256 前十六位 91435891a062ca86,写于第二语料任何统计量之前。口径与巴赫那一场一处不改:四分音符网格、有向音程截断到 ±8、跨曲拼声部作对照、曲级中位数、以曲目为单位自助。语料为 music21 内置 palestrina 目录中声部数恰为四者,实际入选 179 首,过预注册的 100 首门槛。
表 A5-5 三个读数在两个体裁上的对照
| 读数 | 巴赫众赞歌净值中位 | 帕莱斯特里那净值中位 | 巴赫分半信度 | 帕氏分半信度 |
|---|---|---|---|---|
| G(第八章) | — | +18.0 | 0.547 | −0.023 |
| ν(第三章) | +0.0429 | +0.0471 | 0.379 | 0.684 |
| w(第二章) | 0.331(原始占比) | 0.488(原始占比) | 0.211 | 0.277 |
表 A5-6 第二体裁上的三个配对(n = 179)
| 配对 | 观测 ρ | 去衰减上限 | 去衰减 ρ | 判定 |
|---|---|---|---|---|
| G × ν | +0.0089 | 0 | 不可计算 | 不可判定 |
| G × w | −0.2858 | 0 | 不可计算 | 不可判定 |
| ν × w | +0.0069 | 0.435 | +0.0158 | 正交,复现 |
ν 与 w 在第二个体裁上仍然正交,而且比在巴赫上更干净——去衰减后 +0.0158,几乎是零。这一对是本卷唯一在两个体裁上都被检验过、都通过的分界。
G 的分半信度在帕莱斯特里那上是 −0.023。 不是低,是零以下——同一首曲子的前半与后半算出来的 G,彼此毫无关系。信度为零意味着去衰减的上限(两读数信度乘积的平方根)也是零,含 G 的两个配对因此在数学上无法判定:观测到的 +0.0089 与 −0.2858 既可能是真的正交,也可能是两团噪声,本场分不开。
按预注册的 H4,观测与去衰减落在不同档时以去衰减值为准;此处去衰减值不存在,所以这两对只能记为“本设计测不动”,不得记为正交。
预注册的 H3 押的是“三个读数的信度在两个体裁上同序(G > ν > w)”。实测的次序变成了 ν > w > G——不但不同序,最高与最低整个对调。
这条失败推出一个一般结论:分半信度不是读数的性质,是“读数 × 体裁”这一对的性质。 一个量在某类材料上稳,不能推出它在另一类材料上也稳;本卷此前把 0.547、0.379、0.211 三个数当成三把尺子各自的刻度精度来读,这个读法现在被证明是错的。
原因不神秘,而且事前就该想到。G 的定义是曲内最大无回归跨度——它是一个极大值。极大值统计量对样本长度极其敏感:材料越长,最大值越被极端个例支配,也越不可重复。
两个体裁的长度差得很远:巴赫众赞歌的网格长度中位数是 47,帕莱斯特里那是 304,最长的一首到 1776。在四十来格的短曲上,“最大跨度”还勉强代表整曲的疏密;在三百格的长篇复调上,它只代表那一处最长的空档在哪里。
这对第八章是坏消息,本卷不掩饰:灌注半径 λ 的实测代理是一个极大值,而极大值在长篇材料上不可重复。第八章在众赞歌与爱尔兰口传曲调上得到的三个接近的中位数(26、27、31)不因此作废——那是语料级的中位数,靠跨曲聚合;但任何把 G 用在单首长篇作品上的做法,本卷现在明确反对,理由与第二章的 w、第三章的 ν 那一条相同,只是失效得更彻底。
修法是明确的,本卷没有做:把 G 换成分位数(如无回归跨度的第 90 百分位)或长度归一化的量,两者都不是极大值,理应稳得多。这条列入附录四第 13 号欠账。
其一,第二个体裁同样是记谱的、四声部的、规整的。 两个体裁都通过,仍不等于所有音乐都通过。真正的检验在民歌、自由即兴与电子音乐上,本卷仍未做。
其二,仍不触及连续量。 附录四第 7 条欠账不销。
其三,w 在第二体裁上的原始占比从 0.331 涨到 0.488。 这个数本身有意思——十六世纪复调的调性读法歧义远高于巴赫众赞歌,符合常识——但本卷没有把它做成一条可检验的预测再去测,因此只作为观察记录,不作为结论。
正面:本卷最核心的结构主张——十章不是十个互相竞争的答案,而是一个对象的十个不同的量——第一次有了经验证据,而且是在扣掉不可靠性之后仍然成立的证据。并入条款执行了,没有触发。
负面:本卷交出的十把量尺里,至少有两把在单曲尺度上刻度模糊(附录四第 9 条);而第一章那一把的代理根本没做成,连带撤回三个配对(本附录第〇节)。