第十章写死了一条合并规则,第十一章写死了一条对现行指标的强推论。两者都要求同一件事:在同一批学习者身上,同时取到九个读数。 本章给出那份设计。
这不是九个实验的合订本。九章各自已经提出过实验原型,若逐个做,永远无法回答第十章的问题——不同样本、不同任务、不同学期取到的读数无法算相关。本章要的是一份数据、九个读数。
诚实的开头是承认限制。九个读数在同一批学习者身上并非全部可同时取值,原因有三:
第一,决前入链率需要毫秒级的承诺边界与目标线索操纵,通常要求实验室设备(眼动、鼠标轨迹或自定步速阅读);它无法在自然课堂里取到。
第二,桥必要率要求对候选中介做选择性扰动并恢复,而在自然语言学习中很多候选中介不可扰动(例如母语本身)。它只能在可操纵中介的窄任务上取值。
第三,成元余备回收率要求严格无再暴露,而课堂教学天然反复呈现材料。它需要一个与教学隔离的探针时段。
因此本章的设计分两层:课堂可取的六个(脱源重开率、联合兼容缺口、守恒域完整率、举证翻转率、寻址率、写域差)与实验室补取的三个(桥必要率、决前入链率、回收率)。两层共用同一批学习者与同一组语言目标,因此读数之间可以计算相关;但两层的取值条件不同,任何跨层相关都必须报告这一差异,不得当作同质数据。
若连这六加三的配置都做不到,最小可行版见本章第七节。
选三个语言目标,覆盖三个不同的语言层面,且都能在一学期内产生足够事件:
· 语音层:一组浊音起始时间边界受说话人影响的对立(例如某组塞音的清浊判断)
· 形态句法层:一组需要在线选择的形态标记(例如时体或一致标记)
· 语用层:一个形式—功能家系(例如请求,含直接、间接与规约化间接形式)
三个目标不是三个模块的代表,而是三种不同的事件密度:语音层事件多而短,形态句法层事件中等,语用层事件少而长。九个读数在三种密度上取值,能同时检验它们对事件密度是否敏感——这是第十章合并规则之外的一条附带检验。
参与者:两个平行班,每班约二十五人,一学期十六周。全部读数以事件为单位,因此样本量的关键不是人数而是事件数;设计目标是每个读数在每个语言目标上取到不少于三百个合格事件。
一学期分四个条件臂,每臂四周,班级与臂的对应做交叉,以避免时间与班级混淆。
第一臂 撤源臂。 每周设定一次原诱发源(固定教师提示、固定例句、固定搭档或固定界面),在第三周内撤除并制造一次可修复的断裂,观察三轮互动内是否出现功能等价的下一步。→ 产出脱源重开率。同一臂的记录同时提供第九章所需的“来源提示撤除”条件。
第二臂 配对臂。 先用单项测验锁定每名学习者在三个目标上各自达标的能力,再构造联合任务与负荷匹配的对照任务。→ 产出联合兼容缺口。
第三臂 边界臂。 对每个语言目标建立变形图,预注册守恒边与越界边;同时构造同零匹配的高资格/低资格配对探针。→ 同时产出守恒域完整率与举证翻转率。这两个读数共用一套材料,是九读数里唯一天然同源的一对,因此它们之间的高相关不能用作第十章合并规则的证据,必须在报告中单列。
第四臂 地址臂。 对同一表面偏差安排两种来源证据(说话人特异 vs 通道/设备特异),并在延迟且不重新呈现材料的条件下,分层探测词项、语法、说话人、变体、通道五个层的变化;同一批探针另外区分目标域与三个预注册排除域。→ 同时产出寻址率与写域差。
实验室补取的三个读数在学期第八周与第十六周各安排一次两小时时段:桥消融任务、承诺边界任务、后置线索无再暴露任务。
以下八类记录在数据收集前冻结,任何一类缺失都使对应读数不可判,不可判必须单列,不得折算为零。
1. 每一次事件的时间戳与所属臂;
2. 原诱发源的具体内容与撤除方式(含是否被新伙伴功能性复制);
3. 单项达标的判定证据与判定时点(必须先于联合任务);
4. 每条变形边的类型、预注册责任子集与语言学理由;
5. 每一对同零探针的四闸取值(功能机会、可见覆盖、竞争占位、跨来源复现);
6. 承诺边界的定义、验证方式与该次事件的实际判定;
7. 延迟探针的间隔、是否发生再暴露、以及再暴露的具体形式;
8. 失败、拒答、无法分类与设备故障的分别记账——分母必须包含它们。
第八类是最容易被牺牲的一类,也是本书全部读数可信度的地基。删掉困难样本之后剩下的漂亮数据,对九个读数中的任何一个都不构成证据。
结果甲:七个比例型读数两两相关普遍高于 0.8,或第一主成分高于 70%。
→ 按第十章的合并规则执行:全书重编为两章结构,现行三编不保留。作者接受这一结果,不得以“任务不够纯”“样本不够大”为由保留九章。唯一允许的例外是第三臂内的守恒域完整率与举证翻转率这一对,因为它们共用材料,其高相关是设计造成的。
结果乙:出现部分聚类。
→ 按实际聚类重编。目前作者预期最可能聚为一簇的是寻址率与写域差(第十章第五节已指出这是最危险的一对),其次是桥必要率与联合兼容缺口。若聚类结果与这两条预期一致,作者视之为对本书自我诊断能力的支持;若聚类出现在作者未预期的位置,作者必须公开说明预期为何落空,不得事后重述。
结果丙:七个读数相关普遍低于 0.5,且每个都对至少一项外部效标提供其他八个之外的增量预测。
→ 现行九章结构获得第一次经验支持。即便如此,本书仍不主张九个读数已被验证——只主张它们没有在第一次并排检验中被压缩掉。
三种结果的处置在数据收集前公开登记,登记内容包括本节全文、四臂设计、八类记录清单与不可判的处理规则。
其一,操纵不纯会伪造结果甲。 若四个臂在实施中互相污染——例如撤源臂里教师无意中提供了新的固定提示,或地址臂的两种来源证据在学习者眼里没有区分——九个读数会同时退化为一般水平的代理,从而人为制造高相关。因此每臂必须做操纵检查,且操纵检查失败的周次整周剔除,不得只剔除个别事件。
其二,事件密度会伪造结果丙。 语音层事件多、语用层事件少,若某些读数只在高密度层取到足够事件而另一些只在低密度层,低相关可能来自样本不重叠而非构念独立。因此所有相关必须在同一语言目标内部先算一遍,再跨目标合并。
其三,参与率低会同时伪造甲与丙。 第十一章第五节已经指出,事件集中在少数学习者身上时,班级层面的读数意义不明。因此参与率与事件集中度必须作为主要结果之一报告,而不是作为附录里的描述统计。
若无力做完整四臂,可执行的最小版本是:一个班、一个语言目标(建议语用层的请求家系,因为它同时支持边界臂与撤源臂)、八周、四个读数——脱源重开率、守恒域完整率、举证翻转率、写域差。
这个版本回答不了第十章的合并规则,但能回答一个更小、也更急的问题:这四个读数彼此之间是否已经高度共变。 若在最小版本里它们就已经两两相关高于 0.8,完整实验不必再做,本书应当直接进入重编。
一个理论最有价值的实验,往往不是能证明它的那一个,而是能最便宜地把它压缩掉的那一个。本章给出的是后者。