一花一世界 · 网页版全书

第十二章 一份共同的实验:把九个读数放进同一批数据

本章提要 第十章提出的问题(九个读数是不是同一个)不能由论证回答。本章给出回答它的最小设计:同一批现场、同一株对象、同一段时间,九个读数由同一批盲编码者在同一份记录上计算,然后报告相关矩阵。本章还写死三种结果各自的处置办法,其中第一种对本书最不利。做这件事的成本是一次实验,不是九次。

一、为什么这件事已经做了一半

第一、二、三章各自设计了一个四臂对照实验,而三章的设计其实是同一个。三章的《共同数据集上的竞争实验》一节都写着:六个独立学习现场、同类盆栽月季、八周任务,四个组保持课时、核心知识、材料数量、教师反馈分钟数与最终作品要求完全相同,只操纵一种机制。四个臂是:

组别唯一被操纵的机制刻意保持不变
知识丰富对照组教师提供多学科知识与固定探究流程对象定义、角色、时段与观察表全部固定
发起权换手组证据可触发观察路径、角色权限与照料条件的真实变更不强制新背景进入对象字段,不要求整体模型返回
边界迁移组每轮允许一项“其他”因素进入下一轮对象字段角色与资源权限固定,不要求发起权换手
整体返回组整体模型修订后必须返回同一朵花并改变测量操作对象字段与组织权限保持固定

值得注意的是这个设计的形状:每一章把另外两章的机制当作自己的对照臂。第一章的对照组之一是第二章的机制,第二章的对照组之一是第三章的机制。三章因此不只是在概念上互相划界,而是被设计成可以互相实证证伪。

第四至九章各自也有一个四臂设计,但形状不同:它们把自己的机制拆成剂量递进的四段(例如第四章:知识丰富组/多路线组/过渡组/定向闭合组)。这种设计能回答“本章的机制内部哪一段是承重的”,回答不了“本章与别章是不是同一件事”。

本章要做的,就是把第一至三章那个形状扩大到九个。

二、设计

现场与对象。至少六个独立学习现场,同年级、同类盆栽对象(本书九章的案例分别用过月季、风信子、向日葵、牵牛花、昙花、木槿,任选其一,全部现场统一),连续八周。以现场为聚类单位,分析时使用多层模型,不把每个儿童的反应当作独立数据点。

共同的固定量。总课时、核心知识材料、材料数量、教师反馈分钟数、最终作品要求、对象新奇度,六项在全部臂上严格相同。任何一项没有对齐,本次数据不能用来回答第十章的问题。

臂。九臂加一个对照臂是不现实的,也没有必要。第十章要的不是“哪一个机制最有效”,而是“九个读数是否互相独立”。因此本章建议的设计是:

- 一个共同对照臂(知识丰富组,字段与权限全部固定);

- 三个机制臂,各自只操纵一层:起点层(允许发起位置在物质、学习行动与组织条件之间换手)、对象层(允许对象定义、字段与判准被证据改写)、路径层(要求每一阶段的完成物与约束必须被下一阶段接走);

- 四臂各自随机分配到六个现场,每个现场跑一个臂两轮,或用阶梯式设计让每个现场依次经历四臂。

三个机制臂对应第十章第二节分出的三层。这不是九臂的替代品,而是对第十章那个分类的第一次检验:如果三层本身不能被分开,九个读数就更不可能被分开。

关键之处:九个读数在四个臂上全部计算。不是每个臂只算自己的读数。九个读数都从同一份记录上算出来,由同一批盲编码者计算。这一条是整个设计的承重梁,也是它与九章各自设计的唯一实质差别。

三、要留下的记录

九个读数所需的记录是重叠的,因此不需要九套采集。以下八类记录足以支撑全部九个读数:

1. 对象定义的历次版本:每一轮的观察表、字段清单与变量词典,逐版保留,不覆盖。

2. 任务与规则的历次版本:任务单、角色分工、时段安排、权限变更、评价标准,带时间戳。

3. 提议与裁决日志:谁提出改变、提出了什么、是否被采纳、由谁裁决、理由是什么。

4. 课堂录像与音频:用于反解身体执行中的约束是否存活,以及公共分歧如何被处理。

5. 对象状态记录:花的开放、颜色、气味、访问者、照料条件与环境条件的连续记录。

6. 成果物与其被使用的痕迹:每一阶段的产物,以及它在下一阶段被实际使用(而非被引用)的证据。

7. 延迟任务记录:三周后在一个陌生对象上的表现,用于九个读数共同的外部效标。

8. 删除与替代试验记录:第七章要求的 do(O=∅) 与信息量匹配替代物试验,在预注册的两个节点各执行一次。

八类记录中,第一、二、三、五类是任何认真的探究课程本来就会产生的;真正额外的成本落在第四类(录像的转写与编码)与第八类(删除试验需要在课程中制造两次断点)。

四、编码

盲化。编码者不知道所在臂,不知道九个构念的名称,只拿到编码手册(附录二)与记录。手册中九个读数的名称一律替换为编号 R1 至 R9。

顺序。先编码事实项(谁在什么时候改了什么),再编码判定项(是否构成一次换手/一次进入/一次返回)。两步分离是为了让分歧落在可定位的环节上。

信度。两名编码者独立编码不少于全部材料的百分之二十,ICC(2,k) 预设不低于 0.75,报告 95% 置信区间。若某个读数的一致性长期低于 0.6,或“无法判定”的比例超过三成,该读数应先退回定义修订,不进入相关矩阵。这一条对本书不利:它意味着九个读数中可能有几个根本进不了这场检验。

跨章盲判。隐去构念名称后,把材料交给第三批编码者,要求他们判断某段材料属于哪一个读数。九章各自都写了“跨章盲判准确率应达到 80% 以上”。这一条现在可以真做:九个一起判,而不是两两判。若跨章盲判的混淆矩阵显示某两个读数经常互相错判,那两个读数就是第十章第三节没有真正分开的那一对。

五、三种结果与三种处置(在看数据之前写死)

结果甲:普遍高相关。九个读数两两相关普遍高于 0.8,或第一主成分解释方差超过 70%。

处置:本书九个构念合并为一个,全书压缩为一章,其余作为该章的九种记录方式保留。不允许以“侧重不同”为理由保留九章。

结果乙:分散。相关矩阵没有主导成分,跨章盲判混淆低,九个读数各自对延迟迁移有独立的增量解释。

处置:九章的独立性得到第一次实证支持。此时仍不得宣称九个构念已被验证——独立不等于有效。有效性由附录一那九项赌注各自到期时结算。

结果丙:部分聚类。出现两到三个簇。

处置:按数据给出的聚类重编本书,而不是保留现在的三编划分。本书现在的三编是按提问方式(何以/是什么/如何)分的,那是一个来自写作的划分,不是来自数据的划分。若数据给出的簇与三编不重合,以数据为准。

三种处置有一个共同点:都不通过增加解释来保护本书。

六、最小可行版本

上述设计需要六个现场与八周,多数读者拿不到。因此给一个两班一学期的最小版本:

- 两个班,一个学期,同一株对象,只跑三个读数跨轮字段新增数(第二章)、返回操作发生数(第三章)、机制依赖边数(第七章)。选这三个,是因为它们分属三层,且三者的记录成本最低——前两个只需要保留观察表与任务单的历次版本,第三个只需要在两个预定节点各做一次删除试验。

- 只报告三件事:编码一致性、无法判定的比例、三个读数的两两相关。不据此合并或分离任何构念。

- 这一版回答不了第十章的问题,但它能回答一个更基本的问题:这些读数在真实课堂里记得下来吗。如果连三个读数都无法在一学期里稳定编码,那么九个读数的相关矩阵就是一个不必再谈的问题。

七、这一章可能是错的

三处。

第一,四臂的操纵可能不纯。要求“只允许发起权换手而不允许字段变化”,在真实课堂里几乎不可能严格执行——一个学生提出的改变往往同时改动了权限与字段。若操纵不纯,相关矩阵会人为地偏高,从而伪造出“结果甲”。这是本设计最可能出错的地方,也是本书自己给自己埋的最大陷阱:一个不纯的操纵会让本书误以为自己被证否了。处置办法是记录每一次改变实际触及了哪几层,并把“操纵纯度”作为协变量进入模型。

第二,八周可能太短。九个读数中有几个(尤其第五章的远迁移与第八章的延迟反应)需要跨越更长的时间窗。八周的数据可能只能读出前三层。

第三,本章把“九个是不是一个”化约成了相关矩阵。这是一个强假设:它默认构念的独立性可以由读数的统计独立性表征。若两个读数在测量上高度相关而在机制上确实不同(例如它们共享一个上游原因),本章的处置规则会误杀。对此本书没有更好的办法,只能把这条限度写在这里,并要求任何执行本设计的人在报告相关矩阵的同时,报告每一对高相关读数的共同上游候选

← 第十一章 九种最像成功的失败第十三章 这套理论共同的对手 →