本章的判断:二十七个指标里,有二十一个需要跨轮次配对记录,只有六个能在一节课里采完;而最贵的那几个恰好是最不可替代的。任何按成本从低到高采集的方案,都会先采到一批彼此高度相关的代理量,并因此得出“这些概念是虚高的”这一错误结论。
本章不报告新数据。它回答的是一个工程问题:九章提出的二十七个过程指标,一门真实的课能采几个,按什么次序采,采不出来的时候该判谁错。
| 章 | 对象/机制 | 指标一 | 指标二 | 指标三 |
|---|---|---|---|---|
| 一 | 再生形式 | 自主差异生成率 | 跨材料重构率 | 结果回写率 |
| 二 | 可重构敏感域 | 无关扰动保持率 | 结构突变变轨率 | 判差重写率 |
| 三 | 可续建整体 | 部件替换保持率 | 局部故障约束率 | 补丁转构率 |
| 四 | 可复议推进 | 自修权兑现率 | 暂结可追溯率 | 复议转化率 |
| 五 | 限额变奏回流 | 结构差异筛留率 | 活跃未决负荷 | 变奏回流转化率 |
| 六 | 携差换手 | 交接状态完整率 | 异主体首动率 | 差异回写率 |
| 七 | 结算先行 | 提前结算率 | 凭证塑形率 | 账实分叉持续度 |
| 八 | 代偿通行 | 代偿完成率 | 障碍转化率 | 外部首动递增率 |
| 九 | 差异泄压 | 局部清零率 | 安全收敛率 | 差异压缩损失率 |
二十七个指标的形态并不齐整。其中二十四个是比率,一个是负荷计数(活跃未决负荷),两个是持续时间(账实分叉持续度、外部首动递增率的时间形式)。本章统一按“每一个都需要什么样的记录”来分类,而不按它们属于哪一章。
第一层·单节课内可采(六个)。只需要一节课的录像或现场编码,不需要追踪到后面的课。
第二层·需要跨轮次配对(十四个)。必须把本节的某个事件与后续某节的某个事件对上号,才能计算。
跨材料重构率、结构突变变轨率、无关扰动保持率、部件替换保持率、局部故障约束率、结构差异筛留率、变奏回流转化率、复议转化率、差异回写率、代偿完成率、障碍转化率、外部首动递增率、安全收敛率、凭证塑形率。
这一层的共同要求是按个案配对记录:不能只记本节“发生了几次”,必须记清“哪一次的哪一个差异,在后来的哪一节被怎样处理”。班级层面的频次统计做不出这一层。
第三层·需要延迟检验或额外材料(七个)。除了跨轮次记录,还需要专门设计的延迟任务、无提示任务,或课堂之外的记录。
自主差异生成率、结果回写率、判差重写率、补丁转构率、提前结算率、账实分叉持续度、差异压缩损失率。
其中两个最贵:补丁转构率需要连续记录学生的补丁数量及其共同来源,判断他何时停止加补丁转而重画架构——这是一个可能几周才出现一次的事件;差异压缩损失率需要保存公共编码之前的原始差异,再判断哪些内容在编码中丢失,等于要求课堂同时留下一份“未压缩底本”。
按成本从低到高采,是任何真实研究的自然次序。本章要指出的是:这个次序会系统性地误导结论。
第一层六个指标里,有五个测的是“课堂做了什么动作”——给不给自修机会、留不留理由、挂着几个问题、交不交接状态、多久恢复共识。这五个都强烈依赖同一件事:这位教师的课堂组织水平。一位善于组织的教师,五项都会高;一位不善组织的,五项都会低。因此这五个之间的相关必然很高,而这种高相关来自共同的教师因素,不来自它们测的构念是同一个。
若研究者按成本采完第一层,看到五个指标两两相关都在 0.7 以上,最自然的结论是“这五个概念是虚高的,可以合并”。这个结论是错的,或者至少是无根据的——因为它们的共同变异可以完全由教师质量解释,而九章各自的构念差别恰恰要在控制教师之后才显露。
因此本章写死一条:
不能只用两两相关系数决定概念的生死。在同一位教师的不同课时之间做教师内比较之前,或者在把教师质量作为共同因子分离出去之前,任何基于相关矩阵的合并建议都不成立。
这条规则对本书自己不利。它意味着本书最想要的那种便宜验证——采六个指标、算个相关、看看九个构念是不是真的——不能作为判决依据。
做法一·教师内比较。同一位教师,在内容难度相近的不同课时上被随机分配到不同条件。九项赌注中有七项(第二章与第四至九章)采用这一设计;第一、三章为班级间随机,只把教师经验列入控制变量,因此更易受教师质量污染,读数时须留意。它的代价是需要同一位教师配合多轮,且条件之间可能互相污染(教师学会了新做法就回不去了)。第八章的赌注对此做了处理:它比较的是“系统先诊断推送”与“学生先诊断再调用”,两臂的帮助内容与时间相同,只有谁先动不同——即使教师学会了,两臂的差别仍然清楚。
做法二·把五个动作指标做成一个“课堂组织”因子,再看剩余变异。先承认这五个共享一个共同因子,把它提取出来,然后问:扣掉共同因子之后,各章的主指标是否仍然独立预测第三层的延迟结果。若不再预测,说明它们确实只是教师质量的代理。
做法三·取一份无人有动机作假的记录。这是最省事、也最不容易被表演污染的一种。备课笔记、批改留痕、学习单背面、班级问题墙的历史版本——这些东西在被研究之前就已经存在,不是为研究生产的。本书对这类材料给出一条具体预测:在这类记录里,“这个结论在什么条件下应当被重开”与“这个差异后来去了哪里”两栏,出现率应当极低,而它们的出现率高低应当预测延迟迁移。这条预测的好处是它不需要进课堂。
若只能做一件事,本章建议如下。这不是完整验证,只回答一个问题:这些东西采不采得出来。
选哪三个。从三编各取一个,且必须取那一编里最不可替代的:
怎么采。两个平行班,同一位教师,同一门课,连续覆盖三个教学单元。全部课堂录像。两名编码者独立编码,互不通气,编码手册先在第一个单元的前两节课上试编并修订,修订后的手册冻结,此后不得再改。
报什么。只报三件事:
1. 三个指标各自的评分者一致性(比率类报科恩系数,计时类报组内相关系数)。
2. 每个指标在多大比例的课时上根本无法判定(编码者标注“无法判断”的比例)。这个数比一致性更重要——一致性低可以靠改手册补救,无法判定的比例高说明这个指标在真实课堂里没有观察对象。
3. 三个指标两两之间的相关。但不据此下任何合并结论(理由见第三节)。
样本量的如实交代。两个班、三个单元,做不了构念区分,也做不了效标关联。它只能回答“采不采得出来”这一个问题。若一致性系数低于 0.6,或“无法判定”比例高于三成,本书的指标体系应当整体退回重做,而不是解释为“编码者需要更多训练”。
从九个理论对象到可报告的数字,本书的压缩链如下,各级数量在此处固定,全书不得另行改口:
| 层 | 数量 | 说明 |
|---|---|---|
| 理论对象/机制 | 9 | 第一编三个对象、第二编三条机制、第三编三条动力 |
| 过程指标 | 27 | 每章三个 |
| 可单节课采集 | 6 | 第二节第一层 |
| 先导研究主指标 | 3 | 第五节最小集 |
| 外部效标 | 3 | 延迟迁移、无提示问题重构、外部支持撤除后的接管 |
二十七压到三,不是因为另外二十四个不重要,而是因为先导阶段只回答可采性。若三个都采得出来且一致性可接受,下一步应当扩到第一层全部六个,再扩到第二层十四个中与本校最相关的那几个。第三层七个应当留到最后——它们最贵,也最容易在压力下被伪造。
第十章第六节承认了一处缺口:九张表全部以课堂或学习者为单位,没有一张处理收益在学生之间的分配。一间教室可以九项读数都不难看,而收益高度集中在少数几个学生身上,并且这种集中恰恰由前面九条机制的正常运行产生。第十章把这种情形叫作分配性失败,却没有给它任何读数。本节补两个,并说明它为什么不应当被直接写成第十格。
读数一·首动权基尼系数。把一个学期内所有“有认识后果的首动”事件按学生归属统计,计算学生之间的基尼系数。选它的理由有两条:异主体首动率本来就在第一层(单节课可采,见第二节),给每次首动加记一个归属标签的边际成本接近于零;而它恰恰是班级层面看起来最健康时最容易掩盖不均的一项——一个班的异主体首动率可以很高,而全部首动集中在四五个学生身上。
读数二·跨材料重构率的班内下四分位。这一项不新增指标,只新增一条报告规矩:凡报班级层面的跨材料重构率,必须同时报下四分位值。理由是本书九章的全部预测都用班级层面的量检验,而均值对分布无感——一项把班级均值抬起来的机制,完全可能同时把下四分之一压下去。
它是第十格,还是九格的一个侧面。这才是本节真正的问题,而且它可以被判错。
若分配性失败是独立的第十个对象,首动权基尼系数应当与九项主指标大体独立:不均是另一回事,与九格各自的高低无关。
若它是九格共有的一个分布侧面,这个系数应当与其中两项系统相关:随第六章的异主体首动率与差异回写率改善而下降,随第八章的外部首动递增率上升而上升。第二条有具体理由——代偿最先落在最需要帮助的学生身上,而代偿正是以接管首动权的方式恢复通行的;因此代偿越强,首动权越集中,帮助与不均同向增长。
本书预测后者。这条预测对本书不利的一面必须写清楚:若它成立,说明九格没有漏掉一整层,分配问题是九格的投影;若首动权基尼系数与九项指标全部无关,则第十章第六节那个自设的靶子命中——九格没有穷尽标准所能生成的失败形态,本书缺的就不是一个指标,而是一层以个体为单位的理论。
⚠ 本节补的是读数,不是理论。要真正处理分配问题,必须回答“谁被代偿、谁被换手、谁被泄压”,那需要以个体为单位的归属模型,本书九章一个也没有。两个读数写在这里,只是为了让这个缺口从此有办法被量出来,而不是让它显得已经补上了。
本章最脆弱的一处,是第二节的分层假定了“跨轮次配对”比“单节课编码”更贵。这在录像与人工编码的条件下成立,在自动记录的条件下未必。若课堂本来就有完整的转写与操作日志,跨轮次配对的边际成本可能低于人工编码单节课。那样的话,本章的采集次序应当整个重排。
第二处脆弱,是第五节选出的三个指标里有两个来自第一层。这是为了让先导研究可行,代价是先导研究几乎必然低估本书的难度——真正不可替代的补丁转构率与差异压缩损失率都没有进最小集。若有人只做了先导研究就宣布本书的指标体系可行,那是过度推论;本章在此明确拒绝这个推论。