课堂真正的失败形态,恰好长得像成功。
本章的判断:九章各自找到的失败形态,不是九件事,也不是一件事。它们共享同一个生成条件——一个位置只要能被当堂结清,它就会被当堂结清——但落在三个不同的层上,因此不能合并成一章,也不能宣称彼此独立。本章给出判定它们该合并还是该分立的经验办法。
本章不报告新数据。它做的是一件装订成书才有条件做的事:把九章各自的靶格拆下来,放在同一张表上,看它们是不是同一个东西。
九章各有一张二维辨别格,各有一个“最难被识别”的格子。九个格子如下:
| 章 | 靶格 | 两条轴 | 它凭什么通过检查 | 分界在哪里显露 |
|---|---|---|---|---|
| 一 | 熟练复现 | 跨材料再生 × 未来条件回写 | 正确率高、保持久、相似任务能迁移、操作熟练 | 换材料、撤提示、延迟之后能否自行指出决定下一步的差异 |
| 二 | 刚性稳态型 | 选择性不变 × 判据可重写 | 表现稳定、抗干扰、术语完整、自信程度高 | 加入一个使原规则失效的关键变化后,是否主动重设判断规则 |
| 三 | 补丁固化型 | 局部续修 × 整体重构 | 错误越来越少、笔记越来越完整、能调用相应技巧 | 多个局部故障指向同一假设时,是否停止加补丁、改画依赖 |
| 四 | 封闭推进型 | 推进连续性 × 结论可复议性 | 目标清楚、讲练衔接、错误当场处理、环节完整 | 预设触发条件出现后,旧裁决是否真被重开并改写结构 |
| 五 | 预设变式型 | 未决差异未来资格 × 回流改形 | 变式丰富、迁移题精心设计、成绩良好 | 返回的差异是否由学生真实产生,还是由教师提前编排 |
| 六 | 中央整合型 | 发起权换手 × 差异状态连续 | 教师倾听敏锐、每个回答都进入后续、课堂高度生成 | 教师退场后,学生能否接手他人的模型并自主发起 |
| 七 | 提前结算型 | 当前凭证完整度 × 未来转化未决度 | 目标、活动、反馈、作品、成绩、总结一应俱全 | 延迟迁移、无提示发起、陌生材料中的重新组织 |
| 八 | 代偿通行型 | 任务通行度 × 内部重构度 | 正确率、完成度、流畅性、满意度、技术效率俱佳 | 外部通路撤除或情境改变之后的诊断与接管 |
| 九 | 差异泄压型 | 局部释压速度 × 结构改写程度 | 纠错迅速、共识清楚、表达提炼、典型题稳定 | 学生能否在新材料中主动发现同类张力、原规则是否被改写 |
九章是分头写的,九张表也是分头做的。把它们并排放在一起之后,有一件写作时没有预设的事显露出来:
九个靶格没有一个是明显的坏课堂。
九格全都在它被评价的那个维度上合格,多数还优于对照格。第一章的熟练复现比接触性变化分数高;第三章的补丁固化比零件堆积错误少;第五章的预设变式型比即时清零型设计精良;第六章的中央整合型比教师串行型更被称赞;第八章的代偿通行型比暴露停滞型完成度高。九次比较,靶格全部胜出。
由此可以写出本书的一条总判断:
课堂真正的失败形态,恰好长得像成功。明显的失败有自我报警能力,制度会自动处理它;这九种形态没有报警机制,因为每一种都在被评价的维度上是合格的。
这条判断有一个可以立即使用的推论:
凡是只能在当堂观察到的指标,都无法区分这九格与它们各自的健康对照格。
九章的“分界在哪里显露”那一列,没有一处落在当堂。全部落在后面:换材料之后、撤提示之后、教师退场之后、外部通路撤除之后、延迟一段时间之后。这不是九次巧合,也不是作者偏爱延迟测量。它是本书对象的性质决定的——第一编三章界定的三种对象,全都以“是否参与尚未发生的经验”为存在条件;凡以此为存在条件的东西,就不可能在事情结束的那一刻被完整验收。
这条推论直接冲撞现行的课堂评价惯例。听课评课、教学比赛、随堂检测、平台即时数据,全部在当堂完成。按本书的判断,这些手段可以有效识别左下角那一类失败,却在原理上不能识别这九格。
九个靶格共享同一个生成条件,是否意味着它们其实是一个东西?
本书的回答是:不是一个,也不是九个,而是三层三个。理由如下。
第一编的三个靶格(熟练复现、刚性稳态、补丁固化)说的是学习者身上的东西。它们的主语是学生:他能不能跨材料重建、能不能重画判差边界、能不能停止加补丁。撤掉课堂,这三格仍然成立——一个自学者、一位工程师、一个组织,同样可能停在这三格里。
第二编的三个靶格(封闭推进、预设变式、中央整合)说的是课堂这个多人系统的运行方式。它们的主语是课堂:结论有没有重开入口、返回的差异由谁产生、下一轮由谁先动。撤掉多人结构,这三格不成立——一个人自学不存在“发起权换手”的问题。
第三编的三个靶格(提前结算、代偿通行、差异泄压)说的是驱动上述运行方式的力。它们的主语是制度与情境:为什么必须结清、为什么必须恢复通行、为什么必须恢复平稳。它们不描述状态,描述的是把状态往回拉的那股力。撤掉学校这个组织,这三格会变形——家庭辅导、师徒制、自学社群里仍有类似的力,但结算的持有人与时点完全不同。
三层不能互相还原,判据是改变一层能否单独改善另一层:
同层三个之间的关系比跨层更紧张,因为它们的主语相同。这里给出每一层的合并判决办法。
第一编三个。它们处理的是同一个学习者在三个不同时间尺度上的失败:熟练复现是下一次(换个材料就不行),刚性稳态是边界处(变化触及模型边界仍不改道),补丁固化是长期(例外累积却不重画架构)。判决办法:三章各自的主指标——跨材料重构率、结构突变变轨率、补丁转构率——两两相关若持续高于 0.8,说明测不开,应压为一章并说明保留哪一个尺度;若接近零,说明它们不属于同一个构念,第一编的编排本身就是错的,三章应分属不同位置。
第二编三个。它们处理的是课堂对同一批差异的三种时间处置:已经结清的能不能重开(第四章)、尚未结清的能不能保存改形再入(第五章)、正在进行的由谁携带着先动(第六章)。判决办法同上,主指标为复议转化率、变奏回流转化率、异主体首动率。这三个的相关性预计最高,因为一位善于其中一项的教师往往三项都强;因此本书对第二编的合并风险估计也最大。第十三章第四节给出了把教师质量分离出去的做法。
第三编三个。它们处理的是三种不同的关闭方式:账上关闭(第七章)、绕过关闭(第八章)、就地降压关闭(第九章)。这三个最容易被误认为同一件事,因为三者的结果都是“课堂恢复正常”。第九章第三十六节自己写下了判决条件:若提前结算率下降之后局部清零率自然下降,差异泄压只是结算先行的表象;若撤去外部帮助之后学生差异自然获得结构后果,差异泄压只是代偿通行的结果。本书接受这两条,并把它们列为第三编最可能被推翻的地方。
装书时做过一次统计:九章合并去重后的二百四十二条参考文献里,只有五条被三章以上引用。它们是——生产性失败(Kapur, 2008)、为未来学习做准备(Bransford & Schwartz, 1999)、适应性专长(Hatano & Inagaki, 1986)、学习与表现的区分(Soderstrom & Bjork, 2015)、形成性评价(Black & Wiliam, 2009)。
九章各自在局部划过其中几家的界,却没有一章在全书层面处理它们。这一节补上。理由很直接:第二节那条总判断——课堂真正的失败形态恰好长得像成功——正落在这五家共同占据的那片区域里。若它可以被其中任何一家吸收,本书就只是一次重新包装。
与学习与表现的区分。这是最近的一家。它指出当堂表现不是学习的可靠指标:制造流畅感的条件常常损害长期保持与迁移,制造困难的条件常常相反。本书第二节那条推论——凡只能在当堂观察到的指标都无法区分这九格——看起来就是这句话的重述。
分界在于两者说的不是同一件事。那一家说的是测量:表现与学习之间的相关可以为零甚至为负,因此不能用前者代替后者。本书说的是生产:这九种形态不是被误测的学习,而是“必须在当堂可结清”这个条件所生产出来的对象;它们在当堂合格,不是因为测量此刻不灵,而是因为合格正是它们的成立条件。
由此得到一条那一家不会提出的预测:误差有系统方向。若表现只是学习的不可靠指标,当堂高分与延迟低分的搭配应当在各类课堂里大致随机分布;本书预测的却是,在当堂评价维度上得分最高的那一格,恰好是最难识别的失败形态——第二节那九次比较里靶格全部胜出,不是九次巧合。更硬的一条在第七章:随机改变正式结算时点,应当改变九格的出现率,而不只是改变测量的准确度。若延迟测量只是把同一批学生重新排一次序,而九格的出现率不随结算时点变动,本书应当退回学习与表现的区分。
还有一处后果不同。那一家的对策是改测量——延迟测验、加入合意困难。本书第十一章第五节说单独改测量不够:新的测量会被三条动力改造成新的结算格式(后记把这称为本书最可能的坏结局)。这两条主张可以同时检验:若把延迟迁移设为正式记录依据之后,凭证塑形率并不上升,本书的这条担心就是多余的。
与生产性失败。它说的是当堂看起来更差的过程可能带来更好的后续学习。它与本书共享“当堂读数会骗人”这个方向,但站在同一张表的另一格:它处理的是表现差而学习好,本书九格处理的是表现好而学习差。两者不冲突,可以同时成立。
真正的接触点在别处。生产性失败是一份教学处方,本书是一份失败形态学。处方被采纳之后,失败可以换一副样子继续存在——第五章的预设变式型正是探索环节被提前编排好之后的形态,第九章的差异泄压型正是讨论文化被采纳之后的形态。因此本书对这一家有一条可判错的预测:在系统采用生产性失败设计的课堂里,九格的出现率不应显著下降,只应改变构成。若出现率确实随处方的采纳而整体下降,本书关于三条动力的解释就该让位于“教师还没学会这些做法”这个更简单的解释。
与为未来学习做准备。第一章第十七节已经划过一次:那一家测的是下一次学习的速度,本书问的是未来经验的入口本身有没有被改写。书级还要补一条。那一家改造的是评价方法——用“给资源、看后续学习”代替“不给资源、看当下解答”。而本书第七章预测:任何一种可在有限时间内完成、又被用作正式依据的评价,都会被结算化。因此本书对它有一条它不会对自己提出的预测:一旦把这类任务定为正式结算依据,其凭证塑形率应当上升——课堂会开始为这类任务做准备,而准备本身使它失去检验力。
与适应性专长。那一家分的是人的两种专长:常规专长在熟悉情境中高效,适应性专长能在新情境中重构。本书第一编分的是课堂把哪一种生产出来,并且把“适应性”拆成了三件可以分别失败的东西——再生形式、可重构敏感域、可续建整体。第四节要求三个主指标分开测,正是因为一个人可以在其中一项上适应而在另一项上不适应。判决很直接:若适应性专长的现有量表已经能够完全预测这三个指标,第一编三章应当合并并退回那一家。
与形成性评价。这是最容易被误认为同一件事的一家,因为它同样主张评价要服务于后续的教与学。分界在第四章:形成性评价改变的是信息的流向,把结果反馈回教与学;可复议推进要求的是程序资格,预先写下的触发条件出现时旧裁决必须被重开,且重开结果必须回写结构。一堂课可以有充分的形成性评价而完全不重开任何旧结论——反馈全部用于下一题,没有一条用于改写上一次的裁决。判决性预测:控制反馈次数与反馈质量之后,复议转化率应当仍然独立预测延迟迁移。⚠ 必须承认一处可能分不开:Black 与 Wiliam 的“共享成功标准”与本书的“暂结可追溯”在编码上很接近,若两名编码者无法稳定区分,第四章应当退回形成性评价。
五家合起来。本书最危险的还原路径,不是被其中任何一家单独吸收,而是被读成它们的合成:形成性评价加合意困难加生产性失败的一次重新包装。本书能给出的硬区别只有一条——方向。那五家都是改进的处方,说的是“这样做会更好”;本书是失败的生成学,说的是“不这样做,失败会长成哪九种样子,而且长得像成功”。处方可以被采纳而失败依然存在,这正是本书能被判错、而那种合成读法不能被判错的地方。
⚠ 这一节全部是概念上的分界,没有一条得到过数据支持;上列五条判决性预测里有四条需要现有量表与本书指标同时采集,成本高于第十三章第五节的最小集。写在这里,是为了让读者知道本书押在哪几处,不是为了宣布它已经赢了。
把九个靶格并成一张表,最大的风险是事后合理化。九章分头写成,各自都在寻找“最难被识别的那一格”;既然寻找的标准相同,找出来的东西形状相似,可能只是标准的回声,不是世界的结构。
若要说明它不是回声,本书必须承担一个具体的负担:指出一个符合“难被识别”标准、却不落在这九格里的失败形态。若找不到,说明这九格穷尽了标准所能生成的一切,那么它们就是标准的产物;若找得到,说明标准之外还有内容。
作者能想到的一个候选是分配性失败:课堂整体的九项读数都不差,但收益在学生之间高度不均,且不均本身由前八项机制的正常运行产生。它同样难以被识别(班级均值漂亮),却不落在任何一格里,因为九张表全部以“课堂”或“学习者”为单位,没有一张处理个体间分布。这既是本书的一个缺口,也是它不是纯回声的一点证据。第十三章第七节给了它一个读数,但只是一个读数,不是一层理论。
另一个可能的错误在第三节的分层。三层的划分依据是“主语是谁”,而主语是叙述选择,不是自然事实。同一件事可以写成“学生没能重画判差边界”,也可以写成“课堂没有给出判差机会”。若两种写法在经验上不可分辨,三层就只是三种口气。本书对此的回答是第三节末尾那三条“改变一层能否单独改善另一层”——它们是可做的实验,不是修辞。
本章没有给九个靶格排优先次序,也没有说哪一个最该先修。理由在第十一章第五节:三条动力与三条机制是成对相抗的,单独修任何一格都会被与它对位的那条力拉回去。哪一格最该先动,取决于具体学校哪一条力最强,而这需要读数,不需要作者的偏好。