第十三章 二十七个指标怎样压成一门课能跑的最小集

本章的判断:二十七个指标里,有二十一个需要跨轮次配对记录,只有六个能在一节课里采完;而最贵的那几个恰好是最不可替代的。任何按成本从低到高采集的方案,都会先采到一批彼此高度相关的代理量,并因此得出“这些概念是虚高的”这一错误结论。

本章不报告新数据。它回答的是一个工程问题:九章提出的二十七个过程指标,一门真实的课能采几个,按什么次序采,采不出来的时候该判谁错。

一、二十七个指标的全表

对象/机制指标一指标二指标三
再生形式自主差异生成率跨材料重构率结果回写率
可重构敏感域无关扰动保持率结构突变变轨率判差重写率
可续建整体部件替换保持率局部故障约束率补丁转构率
可复议推进自修权兑现率暂结可追溯率复议转化率
限额变奏回流结构差异筛留率活跃未决负荷变奏回流转化率
携差换手交接状态完整率异主体首动率差异回写率
结算先行提前结算率凭证塑形率账实分叉持续度
代偿通行代偿完成率障碍转化率外部首动递增率
差异泄压局部清零率安全收敛率差异压缩损失率

二十七个指标的形态并不齐整。其中二十四个是比率,一个是负荷计数(活跃未决负荷),两个是持续时间(账实分叉持续度、外部首动递增率的时间形式)。本章统一按“每一个都需要什么样的记录”来分类,而不按它们属于哪一章。

二、按记录成本分三层

第一层·单节课内可采(六个)。只需要一节课的录像或现场编码,不需要追踪到后面的课。

第二层·需要跨轮次配对(十四个)。必须把本节的某个事件与后续某节的某个事件对上号,才能计算。

跨材料重构率、结构突变变轨率、无关扰动保持率、部件替换保持率、局部故障约束率、结构差异筛留率、变奏回流转化率、复议转化率、差异回写率、代偿完成率、障碍转化率、外部首动递增率、安全收敛率、凭证塑形率。

这一层的共同要求是按个案配对记录:不能只记本节“发生了几次”,必须记清“哪一次的哪一个差异,在后来的哪一节被怎样处理”。班级层面的频次统计做不出这一层。

第三层·需要延迟检验或额外材料(七个)。除了跨轮次记录,还需要专门设计的延迟任务、无提示任务,或课堂之外的记录。

自主差异生成率、结果回写率、判差重写率、补丁转构率、提前结算率、账实分叉持续度、差异压缩损失率。

其中两个最贵:补丁转构率需要连续记录学生的补丁数量及其共同来源,判断他何时停止加补丁转而重画架构——这是一个可能几周才出现一次的事件;差异压缩损失率需要保存公共编码之前的原始差异,再判断哪些内容在编码中丢失,等于要求课堂同时留下一份“未压缩底本”。

三、一个必须先说清的陷阱

按成本从低到高采,是任何真实研究的自然次序。本章要指出的是:这个次序会系统性地误导结论。

第一层六个指标里,有五个测的是“课堂做了什么动作”——给不给自修机会、留不留理由、挂着几个问题、交不交接状态、多久恢复共识。这五个都强烈依赖同一件事:这位教师的课堂组织水平。一位善于组织的教师,五项都会高;一位不善组织的,五项都会低。因此这五个之间的相关必然很高,而这种高相关来自共同的教师因素,不来自它们测的构念是同一个。

若研究者按成本采完第一层,看到五个指标两两相关都在 0.7 以上,最自然的结论是“这五个概念是虚高的,可以合并”。这个结论是错的,或者至少是无根据的——因为它们的共同变异可以完全由教师质量解释,而九章各自的构念差别恰恰要在控制教师之后才显露。

因此本章写死一条:

不能只用两两相关系数决定概念的生死。在同一位教师的不同课时之间做教师内比较之前,或者在把教师质量作为共同因子分离出去之前,任何基于相关矩阵的合并建议都不成立。

这条规则对本书自己不利。它意味着本书最想要的那种便宜验证——采六个指标、算个相关、看看九个构念是不是真的——不能作为判决依据。

四、把教师分离出去的三种做法

做法一·教师内比较。同一位教师,在内容难度相近的不同课时上被随机分配到不同条件。九项赌注中有七项(第二章与第四至九章)采用这一设计;第一、三章为班级间随机,只把教师经验列入控制变量,因此更易受教师质量污染,读数时须留意。它的代价是需要同一位教师配合多轮,且条件之间可能互相污染(教师学会了新做法就回不去了)。第八章的赌注对此做了处理:它比较的是“系统先诊断推送”与“学生先诊断再调用”,两臂的帮助内容与时间相同,只有谁先动不同——即使教师学会了,两臂的差别仍然清楚。

做法二·把五个动作指标做成一个“课堂组织”因子,再看剩余变异。先承认这五个共享一个共同因子,把它提取出来,然后问:扣掉共同因子之后,各章的主指标是否仍然独立预测第三层的延迟结果。若不再预测,说明它们确实只是教师质量的代理。

做法三·取一份无人有动机作假的记录。这是最省事、也最不容易被表演污染的一种。备课笔记、批改留痕、学习单背面、班级问题墙的历史版本——这些东西在被研究之前就已经存在,不是为研究生产的。本书对这类材料给出一条具体预测:在这类记录里,“这个结论在什么条件下应当被重开”与“这个差异后来去了哪里”两栏,出现率应当极低,而它们的出现率高低应当预测延迟迁移。这条预测的好处是它不需要进课堂。

五、最小集:三个指标,两个班,一学期

若只能做一件事,本章建议如下。这不是完整验证,只回答一个问题:这些东西采不采得出来。

选哪三个。从三编各取一个,且必须取那一编里最不可替代的:

怎么采。两个平行班,同一位教师,同一门课,连续覆盖三个教学单元。全部课堂录像。两名编码者独立编码,互不通气,编码手册先在第一个单元的前两节课上试编并修订,修订后的手册冻结,此后不得再改。

报什么。只报三件事:

1. 三个指标各自的评分者一致性(比率类报科恩系数,计时类报组内相关系数)。

2. 每个指标在多大比例的课时上根本无法判定(编码者标注“无法判断”的比例)。这个数比一致性更重要——一致性低可以靠改手册补救,无法判定的比例高说明这个指标在真实课堂里没有观察对象。

3. 三个指标两两之间的相关。但不据此下任何合并结论(理由见第三节)。

样本量的如实交代。两个班、三个单元,做不了构念区分,也做不了效标关联。它只能回答“采不采得出来”这一个问题。若一致性系数低于 0.6,或“无法判定”比例高于三成,本书的指标体系应当整体退回重做,而不是解释为“编码者需要更多训练”。

六、按这条链子,九个对象最后剩下几个数

从九个理论对象到可报告的数字,本书的压缩链如下,各级数量在此处固定,全书不得另行改口:

数量说明
理论对象/机制9第一编三个对象、第二编三条机制、第三编三条动力
过程指标27每章三个
可单节课采集6第二节第一层
先导研究主指标3第五节最小集
外部效标3延迟迁移、无提示问题重构、外部支持撤除后的接管

二十七压到三,不是因为另外二十四个不重要,而是因为先导阶段只回答可采性。若三个都采得出来且一致性可接受,下一步应当扩到第一层全部六个,再扩到第二层十四个中与本校最相关的那几个。第三层七个应当留到最后——它们最贵,也最容易在压力下被伪造。

七、给分配性失败一个读数

第十章第六节承认了一处缺口:九张表全部以课堂或学习者为单位,没有一张处理收益在学生之间的分配。一间教室可以九项读数都不难看,而收益高度集中在少数几个学生身上,并且这种集中恰恰由前面九条机制的正常运行产生。第十章把这种情形叫作分配性失败,却没有给它任何读数。本节补两个,并说明它为什么不应当被直接写成第十格。

读数一·首动权基尼系数。把一个学期内所有“有认识后果的首动”事件按学生归属统计,计算学生之间的基尼系数。选它的理由有两条:异主体首动率本来就在第一层(单节课可采,见第二节),给每次首动加记一个归属标签的边际成本接近于零;而它恰恰是班级层面看起来最健康时最容易掩盖不均的一项——一个班的异主体首动率可以很高,而全部首动集中在四五个学生身上。

读数二·跨材料重构率的班内下四分位。这一项不新增指标,只新增一条报告规矩:凡报班级层面的跨材料重构率,必须同时报下四分位值。理由是本书九章的全部预测都用班级层面的量检验,而均值对分布无感——一项把班级均值抬起来的机制,完全可能同时把下四分之一压下去。

它是第十格,还是九格的一个侧面。这才是本节真正的问题,而且它可以被判错。

若分配性失败是独立的第十个对象,首动权基尼系数应当与九项主指标大体独立:不均是另一回事,与九格各自的高低无关。

若它是九格共有的一个分布侧面,这个系数应当与其中两项系统相关:随第六章的异主体首动率与差异回写率改善而下降,随第八章的外部首动递增率上升而上升。第二条有具体理由——代偿最先落在最需要帮助的学生身上,而代偿正是以接管首动权的方式恢复通行的;因此代偿越强,首动权越集中,帮助与不均同向增长。

本书预测后者。这条预测对本书不利的一面必须写清楚:若它成立,说明九格没有漏掉一整层,分配问题是九格的投影;若首动权基尼系数与九项指标全部无关,则第十章第六节那个自设的靶子命中——九格没有穷尽标准所能生成的失败形态,本书缺的就不是一个指标,而是一层以个体为单位的理论。

⚠ 本节补的是读数,不是理论。要真正处理分配问题,必须回答“谁被代偿、谁被换手、谁被泄压”,那需要以个体为单位的归属模型,本书九章一个也没有。两个读数写在这里,只是为了让这个缺口从此有办法被量出来,而不是让它显得已经补上了。

八、这一章可能是错的

本章最脆弱的一处,是第二节的分层假定了“跨轮次配对”比“单节课编码”更贵。这在录像与人工编码的条件下成立,在自动记录的条件下未必。若课堂本来就有完整的转写与操作日志,跨轮次配对的边际成本可能低于人工编码单节课。那样的话,本章的采集次序应当整个重排。

第二处脆弱,是第五节选出的三个指标里有两个来自第一层。这是为了让先导研究可行,代价是先导研究几乎必然低估本书的难度——真正不可替代的补丁转构率与差异压缩损失率都没有进最小集。若有人只做了先导研究就宣布本书的指标体系可行,那是过度推论;本章在此明确拒绝这个推论。


← 第十二章 人工智能时代的课堂智慧结 语 两种平静 →
《课堂的智慧》· 阳涌 著 · 德麦国际出版社 · ISBN 978-1-970820-95-9 · 本页 3,987 字 · 阳涌学员专栏