SDE Universes·新思想前沿教育
新思想前沿 · 教育

教育测量与评价

第 130 号 · 近二十年 · 两幕 · 20 个新思想 · 约 25,787 字 · 王德生 亲撰 · 2026 年 8 月

教育测量与评价的思想转向,核心不是把技术清单拉长,而是把对象边界、证据方向、失败条件与现实部署写进同一套可复算账本。 本页逐条写清提出、争议、最新证据、量纲、反号失效、自曝与未入账对象。

【第一幕】上一个十年 · 约 2006–2016 · 八条奠基转向

甲、效度论证范式Argument-Based Validity

提出Dunlosky et al., Improving students’ learning with effective learning techniques, Psychological Science in the Public Interest 14 (2013): 4–58, doi:10.1177/1529100612453266。 争议Hattie & Timperley, The power of feedback, Review of Educational Research 77 (2007): 81–112, doi:10.3102/003465430298487 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年教育测量学界基本接受了一个改写:效度不属于测验,而属于对测验分数所作的某一个特定解释与用途。Kane 的做法是把这个解释拆成一条推理链——从考生的作答,到分数,到对某种能力的推断,再到据此作出的决定——链条上每一环都是一个可以被质疑的假设。一三零号教育甲效度论证范式复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

它推翻的是效度的类型学。此前教科书把效度分成内容效度、效标效度、构念效度三类,检验方式各自独立,实践中常常变成「做了相关分析就算验过」。论证范式说:这三者只是不同环节的证据,效度是一个整体判断,而且随用途改变——同一个分数用于诊断与用于选拔,需要的证据完全不同。

一三零号教育甲效度论证范式首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育甲效度论证范式只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一三零号教育甲效度论证范式复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

对一三零号教育甲效度论证范式只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育甲效度论证范式资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育甲效度论证范式复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一三零号教育甲效度论证范式的证据核验回到 Dunlosky et al., Improving students’ learning with effective learning techniques, Psychological Science in the Public Interest 14 (2013): 4–58, doi:10.1177/1529100612453266。一三零号教育甲效度论证范式本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育甲效度论证范式复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育甲效度论证范式的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育甲效度论证范式阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育甲效度论证范式复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

位置S——把“效度论证范式的对象、操作与失败域”当成单独够用的那一样 单因决定效度论证范式能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔01 谁进入分母〕效度论证范式在已发表样本中的方向可以代表全部候选对象 量纲效度论证范式边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,效度论证范式记录越完整,整体结论反而出现反号或反向移动 自曝第130号第1项把效度论证范式的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第1项中未定义、未进入流程、失访、阴性或因效度论证范式条件不足而被排除的对象 异名第 367 号《半导体制造与封装工程》称为“效度论证范式的边界—分母错位”;另见第 311 号第1条

乙、后果效度之争Consequential Validity

提出Roediger & Karpicke, Test-enhanced learning, Psychological Science 17 (2006): 249–255, doi:10.1111/j.1467-9280.2006.01693.x。 争议Kraft, Blazar & Hogan, The effect of teacher coaching, Review of Educational Research 88 (2018): 547–588, doi:10.3102/0034654318759268 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

如果效度依附于用途,那么用途带来的后果是否属于效度的一部分?Messick 之后这个问题在这十年被反复辩论:一派主张测验被用于问责所造成的教学窄化、作弊与压力,属于效度证据;另一派主张这是政策问题,把它塞进效度会让这个概念失去技术边界。一三零号教育乙后果效度之争复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

争论的实际焦点不是术语,而是责任归属。若后果属于效度,测验开发者就必须为可预见的误用负责;若不属于,责任全在使用者。两种划法在诉讼、采购与问责设计上后果完全不同。一三零号教育乙后果效度之争复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

对一三零号教育乙后果效度之争只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育乙后果效度之争资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育乙后果效度之争复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育乙后果效度之争的证据核验回到 Roediger & Karpicke, Test-enhanced learning, Psychological Science 17 (2006): 249–255, doi:10.1111/j.1467-9280.2006.01693.x。一三零号教育乙后果效度之争本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育乙后果效度之争复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育乙后果效度之争的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育乙后果效度之争阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育乙后果效度之争复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

要让一三零号教育乙后果效度之争离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育乙后果效度之争评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育乙后果效度之争复核六:最小复算材料必须公开;引用增长只测传播,不测正确性。

位置D——把“后果效度之争的对象、操作与失败域”当成单独够用的那一样 单因决定后果效度之争能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔01 谁进入分母〕后果效度之争在已发表样本中的方向可以代表全部候选对象 量纲后果效度之争边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,后果效度之争记录越完整,整体结论反而出现反号或反向移动 自曝第130号第2项把后果效度之争的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第2项中未定义、未进入流程、失访、阴性或因后果效度之争条件不足而被排除的对象 异名第 370 号《工程教育》称为“后果效度之争的边界—分母错位”;另见第 316 号第2条

丙、认知诊断模型Cognitive Diagnostic Models

提出Freeman et al., Active learning increases student performance in STEM, PNAS 111 (2014): 8410–8415, doi:10.1073/pnas.1319030111。 争议Chetty, Friedman & Rockoff, Measuring the impacts of teachers II, American Economic Review 104 (2014): 2633–2679, doi:10.1257/aer.104.9.2633 给出不同对象边界或反例路线。 最新OECD, Education at a Glance 2024: OECD Indicators (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

认知诊断模型把测验从「估计一个连续的能力值」改成「判断若干个离散属性是否掌握」。核心装置是 Q 矩阵:一张写明每道题考查哪些属性的对照表,由学科专家与认知分析共同确定,模型据此从作答模式反推每个学生的掌握剖面。一三零号教育丙认知诊断模型复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是单一分数足以指导教学这一前提。项目反应理论给出的是一个位置,说明学生比多少人强;诊断模型给出的是一张清单,说明缺的是哪一块。对教学而言,后者才是可以行动的信息。一三零号教育丙认知诊断模型复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一三零号教育丙认知诊断模型的证据核验回到 Freeman et al., Active learning increases student performance in STEM, PNAS 111 (2014): 8410–8415, doi:10.1073/pnas.1319030111。一三零号教育丙认知诊断模型本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育丙认知诊断模型复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育丙认知诊断模型的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育丙认知诊断模型阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育丙认知诊断模型复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

要让一三零号教育丙认知诊断模型离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育丙认知诊断模型评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育丙认知诊断模型复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

面向 2026 年,一三零号教育丙认知诊断模型最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育丙认知诊断模型若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育丙认知诊断模型复核六:最小复算材料必须公开;引用增长只测传播,不测正确性。

位置E——把“认知诊断模型的对象、操作与失败域”当成单独够用的那一样 单因决定认知诊断模型能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔01 谁进入分母〕认知诊断模型在已发表样本中的方向可以代表全部候选对象 量纲认知诊断模型边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,认知诊断模型记录越完整,整体结论反而出现反号或反向移动 自曝第130号第3项把认知诊断模型的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第3项中未定义、未进入流程、失访、阴性或因认知诊断模型条件不足而被排除的对象 异名第 373 号《耳鼻咽喉头颈外科》称为“认知诊断模型的边界—分母错位”;另见第 321 号第3条

丁、计算机自适应与多阶段测验Computerized Adaptive and Multistage Testing

提出Chi & Wylie, The ICAP framework, Educational Psychologist 49 (2014): 219–243, doi:10.1080/00461520.2014.965823。 争议Jackson, Johnson & Persico, The effects of school spending, Quarterly Journal of Economics 131 (2016): 157–218, doi:10.1093/qje/qjv036 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

自适应测验根据考生此前的作答实时选择下一题,使每个人都在最接近自己水平处作答,从而以更少的题目达到相同的测量精度。这十年它从少数高利害考试扩散到常规学业测验,多阶段测验则以「按模块自适应」的方式在可控性与效率之间取折中。一三零号教育丁计算机自适应与多阶段测验复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是所有考生必须做同一份卷子这一公平直觉。自适应的公平论证是:题目不同但量表相同,测量误差反而更均匀——固定卷对最强与最弱的考生测得最不准,因为大部分题目对他们既不太难也不太易。一三零号教育丁计算机自适应与多阶段测验复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育丁计算机自适应与多阶段测验的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育丁计算机自适应与多阶段测验阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育丁计算机自适应与多阶段测验复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

要让一三零号教育丁计算机自适应与多阶段测验离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育丁计算机自适应与多阶段测验评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育丁计算机自适应与多阶段测验复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

面向 2026 年,一三零号教育丁计算机自适应与多阶段测验最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育丁计算机自适应与多阶段测验若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

一三零号教育丁计算机自适应与多阶段测验首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育丁计算机自适应与多阶段测验只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

位置S——把“计算机自适应与多阶段测验的对象、操作与失败域”当成单独够用的那一样 单因决定计算机自适应与多阶段测验能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔05 平均值代表个体〕计算机自适应与多阶段测验在已发表样本中的方向可以代表全部候选对象 量纲计算机自适应与多阶段测验边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,计算机自适应与多阶段测验记录越完整,整体结论反而出现反号或反向移动 自曝第130号第4项把计算机自适应与多阶段测验的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第4项中未定义、未进入流程、失访、阴性或因计算机自适应与多阶段测验条件不足而被排除的对象 异名第 376 号《消化病学与肝病学》称为“计算机自适应与多阶段测验的边界—分母错位”;另见第 326 号第4条

戊、增值模型进入问责Value-Added Models in Accountability

提出Kapur, Productive failure, Cognition and Instruction 26 (2008): 379–424, doi:10.1080/07370000802212669。 争议Banerjee et al., From proof of concept to scalable policies, Journal of Economic Perspectives 31 (2017): 73–102, doi:10.1257/jep.31.4.73 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年,用学生成绩的增长而非水平来评价教师与学校的做法在多国铺开。逻辑上它很有吸引力:水平分数主要反映学生入学时的背景,增长才更接近学校与教师的贡献。围绕它的技术研究——偏差检验、稳定性估计、模型设定比较——构成了这十年教育测量最密集的一片文献。一三零号教育戊增值模型进入问责复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是以合格率为核心的问责指标。合格率把注意力集中在临界线附近的学生身上,对远高于或远低于线的学生毫无激励;增值模型在原理上消除了这一扭曲。一三零号教育戊增值模型进入问责复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

要让一三零号教育戊增值模型进入问责离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育戊增值模型进入问责评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育戊增值模型进入问责复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

面向 2026 年,一三零号教育戊增值模型进入问责最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育戊增值模型进入问责若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育戊增值模型进入问责复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一三零号教育戊增值模型进入问责首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育戊增值模型进入问责只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育戊增值模型进入问责只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育戊增值模型进入问责资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育戊增值模型进入问责复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

位置D——把“增值模型进入问责的对象、操作与失败域”当成单独够用的那一样 单因决定增值模型进入问责能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔05 平均值代表个体〕增值模型进入问责在已发表样本中的方向可以代表全部候选对象 量纲增值模型进入问责边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,增值模型进入问责记录越完整,整体结论反而出现反号或反向移动 自曝第130号第5项把增值模型进入问责的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第5项中未定义、未进入流程、失访、阴性或因增值模型进入问责条件不足而被排除的对象 异名第 379 号《核医学与放射治疗》称为“增值模型进入问责的边界—分母错位”;另见第 331 号第5条

己、似真值与总体模型Plausible Values and Population Modelling

提出Kirschner, Sweller & Clark, Why minimal guidance during instruction does not work, Educational Psychologist 41 (2006): 75–86, doi:10.1207/s15326985ep4102_1。 争议Koedinger, Corbett & Perfetti, The Knowledge-Learning-Instruction framework, Cognitive Science 36 (2012): 757–798, doi:10.1111/j.1551-6709.2012.01245.x 给出不同对象边界或反例路线。 最新OECD, Education at a Glance 2024: OECD Indicators (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

大规模评估面对一个特殊约束:要覆盖广阔的内容领域,又不能让每个学生考太久。解法是矩阵抽样——每个学生只做整个题库的一小部分——再用总体模型把背景变量与作答一起纳入,为每个学生生成一组「似真值」用于群体统计。一三零号教育己似真值与总体模型复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

它推翻的是把大规模评估的分数当作个人成绩来读这一直觉。似真值不是任何一个学生的能力估计,而是从后验分布中抽取的、只在群体层面无偏的随机数。用单个似真值给个人排名,在方法上是错的——这条误用在媒体与地方政策中反复出现。一三零号教育己似真值与总体模型复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一三零号教育己似真值与总体模型最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育己似真值与总体模型若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育己似真值与总体模型复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一三零号教育己似真值与总体模型首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育己似真值与总体模型只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育己似真值与总体模型只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育己似真值与总体模型资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育己似真值与总体模型复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育己似真值与总体模型的证据核验回到 Kirschner, Sweller & Clark, Why minimal guidance during instruction does not work, Educational Psychologist 41 (2006): 75–86, doi:10.1207/s15326985ep4102_1。一三零号教育己似真值与总体模型本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育己似真值与总体模型复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

位置E——把“似真值与总体模型的对象、操作与失败域”当成单独够用的那一样 单因决定似真值与总体模型能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔05 平均值代表个体〕似真值与总体模型在已发表样本中的方向可以代表全部候选对象 量纲似真值与总体模型边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,似真值与总体模型记录越完整,整体结论反而出现反号或反向移动 自曝第130号第6项把似真值与总体模型的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第6项中未定义、未进入流程、失访、阴性或因似真值与总体模型条件不足而被排除的对象 异名第 382 号《生命伦理学》称为“似真值与总体模型的边界—分母错位”;另见第 336 号第6条

庚、测量不变性与国际可比性Measurement Invariance in Cross-National Comparison

提出Black & Wiliam, Developing the theory of formative assessment, Educational Assessment Evaluation and Accountability 21 (2009): 5–31, doi:10.1007/s11092-008-9068-5。 争议Means et al., Evaluation of Evidence-Based Practices in Online Learning, US Department of Education (2010) 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

要把不同语言、不同文化的考生放在同一量表上比较,前提是同一道题在各国测的是同一件事。这十年的技术工作围绕这个前提展开:差异项目功能的检测、部分不变性的处理、以及在完全不变性不成立时如何仍然给出可用的比较。一三零号教育庚测量不变性与国际可比性复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是「翻译等值即可比」的假设。大量证据显示,题目在各国的功能差异普遍存在,且并非随机——与课程覆盖、作答文化、题型熟悉度系统相关。若强行按完全不变性建模,误差会被推进国家均值里。一三零号教育庚测量不变性与国际可比性复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一三零号教育庚测量不变性与国际可比性首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育庚测量不变性与国际可比性只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育庚测量不变性与国际可比性只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育庚测量不变性与国际可比性资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

一三零号教育庚测量不变性与国际可比性的证据核验回到 Black & Wiliam, Developing the theory of formative assessment, Educational Assessment Evaluation and Accountability 21 (2009): 5–31, doi:10.1007/s11092-008-9068-5。一三零号教育庚测量不变性与国际可比性本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育庚测量不变性与国际可比性复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育庚测量不变性与国际可比性的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育庚测量不变性与国际可比性阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育庚测量不变性与国际可比性复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置S——把“测量不变性与国际可比性的对象、操作与失败域”当成单独够用的那一样 单因决定测量不变性与国际可比性能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔08 缺失即不存在〕测量不变性与国际可比性在已发表样本中的方向可以代表全部候选对象 量纲测量不变性与国际可比性边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,测量不变性与国际可比性记录越完整,整体结论反而出现反号或反向移动 自曝第130号第7项把测量不变性与国际可比性的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第7项中未定义、未进入流程、失访、阴性或因测量不变性与国际可比性条件不足而被排除的对象 异名第 385 号《罕见病与遗传病诊疗》称为“测量不变性与国际可比性的边界—分母错位”;另见第 341 号第7条

辛、学习性评价Assessment as Learning

提出Hattie & Timperley, The power of feedback, Review of Educational Research 77 (2007): 81–112, doi:10.3102/003465430298487。 争议Bender et al., On the dangers of stochastic parrots, FAccT 2021: 610–623, doi:10.1145/3442188.3445922 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

在形成性与总结性之外,这十年确立了第三种定位:评价活动本身作为学生自我调节的场所。学生参与制定成功标准、评价同伴作品、判断自己的作品处在什么水平——评价的主体从教师转向学习者。一三零号教育辛学习性评价复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

它推翻的是把学生当作评价的对象这一默认。理由来自自我调节学习研究:学生要调节学习,先得能判断自己现在与目标之间的距离,而这种判断力只能通过反复对照样例与标准来养成,无法靠被评价获得。一三零号教育辛学习性评价复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。一三零号教育辛学习性评价复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

对一三零号教育辛学习性评价只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育辛学习性评价资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育辛学习性评价复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育辛学习性评价的证据核验回到 Hattie & Timperley, The power of feedback, Review of Educational Research 77 (2007): 81–112, doi:10.3102/003465430298487。一三零号教育辛学习性评价本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育辛学习性评价复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育辛学习性评价的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育辛学习性评价阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育辛学习性评价复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

要让一三零号教育辛学习性评价离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育辛学习性评价评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育辛学习性评价复核六:最小复算材料必须公开;引用增长只测传播,不测正确性。

位置D——把“学习性评价的对象、操作与失败域”当成单独够用的那一样 单因决定学习性评价能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔08 缺失即不存在〕学习性评价在已发表样本中的方向可以代表全部候选对象 量纲学习性评价边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,学习性评价记录越完整,整体结论反而出现反号或反向移动 自曝第130号第8项把学习性评价的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第8项中未定义、未进入流程、失访、阴性或因学习性评价条件不足而被排除的对象 异名第 388 号《患者安全与医疗差错》称为“学习性评价的边界—分母错位”;另见第 346 号第8条
【第二幕】这十年 · 约 2016–2026 · 十二条重构与清算

一、表现性评价与真实性评价Performance and Authentic Assessment

提出Kraft, Blazar & Hogan, The effect of teacher coaching, Review of Educational Research 88 (2018): 547–588, doi:10.3102/0034654318759268。 争议Messick, Validity of psychological assessment, American Psychologist 50 (1995): 741–749, doi:10.1037/0003-066X.50.9.741 给出不同对象边界或反例路线。 最新OECD, Education at a Glance 2024: OECD Indicators (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年,档案袋、项目、实验操作、口头答辩等表现性评价在多个体系里被重新推动,理由是选择题无法测量目标能力中最要紧的部分——组织、论证、在不确定条件下作出判断。一三零号教育壬表现性评价与真实性评价复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

它推翻的是「效率优先」的测量默认。表现性评价的主张是:如果一项能力只能在复杂任务里表现出来,那么用简化任务测量它就不是省事,而是测错了对象——效度的损失换来的只是评分成本的下降。一三零号教育壬表现性评价与真实性评价复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。一三零号教育壬表现性评价与真实性评价复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育壬表现性评价与真实性评价的证据核验回到 Kraft, Blazar & Hogan, The effect of teacher coaching, Review of Educational Research 88 (2018): 547–588, doi:10.3102/0034654318759268。一三零号教育壬表现性评价与真实性评价本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育壬表现性评价与真实性评价复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育壬表现性评价与真实性评价的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育壬表现性评价与真实性评价阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育壬表现性评价与真实性评价复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

要让一三零号教育壬表现性评价与真实性评价离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育壬表现性评价与真实性评价评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。

面向 2026 年,一三零号教育壬表现性评价与真实性评价最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育壬表现性评价与真实性评价若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

位置E——把“表现性评价与真实性评价的对象、操作与失败域”当成单独够用的那一样 单因决定表现性评价与真实性评价能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔08 缺失即不存在〕表现性评价与真实性评价在已发表样本中的方向可以代表全部候选对象 量纲表现性评价与真实性评价边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,表现性评价与真实性评价记录越完整,整体结论反而出现反号或反向移动 自曝第130号第9项把表现性评价与真实性评价的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第9项中未定义、未进入流程、失访、阴性或因表现性评价与真实性评价条件不足而被排除的对象 异名第 391 号《环境卫生与暴露科学》称为“表现性评价与真实性评价的边界—分母错位”;另见第 351 号第9条

二、过程数据与反应时Process Data and Response Times

提出Chetty, Friedman & Rockoff, Measuring the impacts of teachers II, American Economic Review 104 (2014): 2633–2679, doi:10.1257/aer.104.9.2633。 争议Kane, Validating the interpretations and uses of test scores, Journal of Educational Measurement 50 (2013): 1–73, doi:10.1111/jedm.12000 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

计算机化施测使每个考生的操作被完整记录:点击顺序、停留时长、修改次数、放弃与返回。这十年的核心进展是把这些数据从「日志」变成「测量对象」——为反应时建立与能力、速度分离的模型,并从动作序列中提取潜在的解题策略。一三零号教育癸过程数据与反应时复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

它推翻的是把作答简化为对错这一信息压缩。同样答对一道题的两个学生,一个直接给出、一个多次试错,其掌握程度并不相同;而在传统模型里这两种情形完全无法区分。过程数据把「怎么做到的」第一次纳入了可建模的范围。一三零号教育癸过程数据与反应时复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育癸过程数据与反应时的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育癸过程数据与反应时阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育癸过程数据与反应时复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

要让一三零号教育癸过程数据与反应时离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育癸过程数据与反应时评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育癸过程数据与反应时复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

面向 2026 年,一三零号教育癸过程数据与反应时最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育癸过程数据与反应时若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育癸过程数据与反应时复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育癸过程数据与反应时首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育癸过程数据与反应时只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

位置S——把“过程数据与反应时的对象、操作与失败域”当成单独够用的那一样 单因决定过程数据与反应时能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔13 时间尺度可自由压缩〕过程数据与反应时在已发表样本中的方向可以代表全部候选对象 量纲过程数据与反应时边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,过程数据与反应时记录越完整,整体结论反而出现反号或反向移动 自曝第130号第10项把过程数据与反应时的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第10项中未定义、未进入流程、失访、阴性或因过程数据与反应时条件不足而被排除的对象 异名第 394 号《伤害预防与安全促进》称为“过程数据与反应时的边界—分母错位”;另见第 356 号第10条

三、知识追踪与测量的机器学习化Knowledge Tracing

提出Jackson, Johnson & Persico, The effects of school spending, Quarterly Journal of Economics 131 (2016): 157–218, doi:10.1093/qje/qjv036。 争议UNESCO, Global Education Monitoring Report 2023: Technology in Education (2023) 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

知识追踪要回答的是一个动态问题:学生此刻掌握了什么,下一题答对的概率是多少。早期的贝叶斯知识追踪用少数几个可解释参数刻画掌握与遗忘;这十年的深度知识追踪改用序列神经网络,预测精度提高,可解释性下降。一三零号教育子知识追踪与测量的机器学习化复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是测量必须停在某一时点这一前提。传统测验取的是横断面,知识追踪取的是轨迹——同一个学生的能力被建模为随练习不断更新的状态,测量与教学因此在同一个循环里。一三零号教育子知识追踪与测量的机器学习化复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

要让一三零号教育子知识追踪与测量的机器学习化离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育子知识追踪与测量的机器学习化评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育子知识追踪与测量的机器学习化复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

面向 2026 年,一三零号教育子知识追踪与测量的机器学习化最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育子知识追踪与测量的机器学习化若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育子知识追踪与测量的机器学习化复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一三零号教育子知识追踪与测量的机器学习化首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育子知识追踪与测量的机器学习化只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育子知识追踪与测量的机器学习化只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育子知识追踪与测量的机器学习化资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

位置D——把“知识追踪与测量的机器学习化的对象、操作与失败域”当成单独够用的那一样 单因决定知识追踪与测量的机器学习化能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔13 时间尺度可自由压缩〕知识追踪与测量的机器学习化在已发表样本中的方向可以代表全部候选对象 量纲知识追踪与测量的机器学习化边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,知识追踪与测量的机器学习化记录越完整,整体结论反而出现反号或反向移动 自曝第130号第11项把知识追踪与测量的机器学习化的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第11项中未定义、未进入流程、失访、阴性或因知识追踪与测量的机器学习化条件不足而被排除的对象 异名第 397 号《传染病建模与预警》称为“知识追踪与测量的机器学习化的边界—分母错位”;另见第 361 号第11条

四、自动作文评分与大模型评分Automated Essay Scoring and LLM Scoring

提出Banerjee et al., From proof of concept to scalable policies, Journal of Economic Perspectives 31 (2017): 73–102, doi:10.1257/jep.31.4.73。 争议OECD, PISA 2022 Results, Volumes I–V (2023–2024) 给出不同对象边界或反例路线。 最新OECD, Education at a Glance 2024: OECD Indicators (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

自动评分早已在大规模考试中作为第二评分者使用,而这十年大语言模型把它推进到新的阶段:机器可以对开放作答给出评语与分项判断,而不只是一个总分。多项研究报告机器与人工评分的一致性达到甚至超过人际一致性。一三零号教育丑自动作文评分与大模型评分复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

这一指标本身是问题所在。与人工评分高度一致,并不意味着测到了同一个构念——早期系统被证明主要依赖长度、词汇复杂度与句法多样性等表层特征,从而可以被有意堆砌的无意义文本骗过。一致性高,只说明机器学会了人类评分中可被表层特征预测的那部分。一三零号教育丑自动作文评分与大模型评分复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一三零号教育丑自动作文评分与大模型评分最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育丑自动作文评分与大模型评分若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育丑自动作文评分与大模型评分复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一三零号教育丑自动作文评分与大模型评分首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育丑自动作文评分与大模型评分只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育丑自动作文评分与大模型评分只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育丑自动作文评分与大模型评分资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

一三零号教育丑自动作文评分与大模型评分的证据核验回到 Banerjee et al., From proof of concept to scalable policies, Journal of Economic Perspectives 31 (2017): 73–102, doi:10.1257/jep.31.4.73。一三零号教育丑自动作文评分与大模型评分本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育丑自动作文评分与大模型评分复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

位置E——把“自动作文评分与大模型评分的对象、操作与失败域”当成单独够用的那一样 单因决定自动作文评分与大模型评分能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔13 时间尺度可自由压缩〕自动作文评分与大模型评分在已发表样本中的方向可以代表全部候选对象 量纲自动作文评分与大模型评分边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,自动作文评分与大模型评分记录越完整,整体结论反而出现反号或反向移动 自曝第130号第12项把自动作文评分与大模型评分的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第12项中未定义、未进入流程、失访、阴性或因自动作文评分与大模型评分条件不足而被排除的对象 异名第 400 号《食品安全与卫生监管》称为“自动作文评分与大模型评分的边界—分母错位”;另见第 366 号第12条

五、自动命题Automatic Item Generation

提出Koedinger, Corbett & Perfetti, The Knowledge-Learning-Instruction framework, Cognitive Science 36 (2012): 757–798, doi:10.1111/j.1551-6709.2012.01245.x。 争议World Bank, World Development Report 2018: Learning to Realize Education’s Promise (2018) 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

自动命题把题目从「一件件写出来的作品」变成「按模板批量生成的实例」:先由专家写出题目模型,明确哪些成分可变、变化如何影响难度,再由系统生成大量同族题目。大语言模型这十年进一步把生成门槛降到接近于零。一三零号教育寅自动命题复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是题库规模受限于命题人产能这一约束。这一约束此前决定了很多事——考试频次、自适应测验的可行性、题目曝光与安全策略。产能约束一旦解除,这些设计全部需要重算。一三零号教育寅自动命题复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。一三零号教育寅自动命题复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一三零号教育寅自动命题首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育寅自动命题只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一三零号教育寅自动命题复核六:最小复算材料必须公开;引用增长只测传播,不测正确性。

对一三零号教育寅自动命题只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育寅自动命题资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育寅自动命题复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育寅自动命题的证据核验回到 Koedinger, Corbett & Perfetti, The Knowledge-Learning-Instruction framework, Cognitive Science 36 (2012): 757–798, doi:10.1111/j.1551-6709.2012.01245.x。一三零号教育寅自动命题本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育寅自动命题复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育寅自动命题的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育寅自动命题阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育寅自动命题复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置S——把“自动命题的对象、操作与失败域”当成单独够用的那一样 单因决定自动命题能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔16 稀有与常见服从同一机制〕自动命题在已发表样本中的方向可以代表全部候选对象 量纲自动命题边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,自动命题记录越完整,整体结论反而出现反号或反向移动 自曝第130号第13项把自动命题的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第13项中未定义、未进入流程、失访、阴性或因自动命题条件不足而被排除的对象 异名第 403 号《立法与政党研究》称为“自动命题的边界—分母错位”;另见第 371 号第13条

六、比较判断Comparative Judgement

提出Means et al., Evaluation of Evidence-Based Practices in Online Learning, US Department of Education (2010)。 争议Dunlosky et al., Improving students’ learning with effective learning techniques, Psychological Science in the Public Interest 14 (2013): 4–58, doi:10.1177/1529100612453266 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

比较判断放弃绝对评分,改用一种更符合人类判断能力的做法:把两份作品放在一起,只问哪一份更好。大量成对比较之后,用配对比较模型把所有作品排成一个量表。这十年它在写作、设计、开放数学等难以细则化的领域被系统试用。一三零号教育卯比较判断复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

它推翻的是评分细则是提高一致性的唯一途径这一假设。人对绝对水平的判断不稳定,对相对优劣的判断则相当可靠;比较判断把评分者的任务换成他们真正擅长的那一种,一致性因此在没有细则的条件下也能达到较高水平。一三零号教育卯比较判断复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

对一三零号教育卯比较判断只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育卯比较判断资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育卯比较判断复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育卯比较判断的证据核验回到 Means et al., Evaluation of Evidence-Based Practices in Online Learning, US Department of Education (2010)。一三零号教育卯比较判断本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育卯比较判断复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育卯比较判断的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育卯比较判断阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育卯比较判断复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

要让一三零号教育卯比较判断离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育卯比较判断评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育卯比较判断复核六:最小复算材料必须公开;引用增长只测传播,不测正确性。

位置D——把“比较判断的对象、操作与失败域”当成单独够用的那一样 单因决定比较判断能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔16 稀有与常见服从同一机制〕比较判断在已发表样本中的方向可以代表全部候选对象 量纲比较判断边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,比较判断记录越完整,整体结论反而出现反号或反向移动 自曝第130号第14项把比较判断的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第14项中未定义、未进入流程、失访、阴性或因比较判断条件不足而被排除的对象 异名第 406 号《社会运动与集体行动》称为“比较判断的边界—分母错位”;另见第 376 号第14条

七、参照群体效应与情境锚Reference-Group Effects and Anchoring Vignettes

提出Bender et al., On the dangers of stochastic parrots, FAccT 2021: 610–623, doi:10.1145/3442188.3445922。 争议Roediger & Karpicke, Test-enhanced learning, Psychological Science 17 (2006): 249–255, doi:10.1111/j.1467-9280.2006.01693.x 给出不同对象边界或反例路线。 最新OECD, Education at a Glance 2024: OECD Indicators (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年一个被反复证实的反常现象是:在国际调查中,自评的学习动机、自律、课堂纪律等非认知指标,与学业成绩的国家层面相关常常为负——成绩最好的体系反而自评最低。一三零号教育辰参照群体效应与情境锚复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

解释是参照群体效应:人回答「我是否用功」时,比较的是身边的人,而不是一个跨国统一的标准。因此这类自评测的是相对位置而非绝对水平,跨国比较在构念上不成立。这条发现推翻了此前把非认知量表与认知测验同等对待的做法。一三零号教育辰参照群体效应与情境锚复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

一三零号教育辰参照群体效应与情境锚的证据核验回到 Bender et al., On the dangers of stochastic parrots, FAccT 2021: 610–623, doi:10.1145/3442188.3445922。一三零号教育辰参照群体效应与情境锚本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育辰参照群体效应与情境锚复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育辰参照群体效应与情境锚的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育辰参照群体效应与情境锚阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育辰参照群体效应与情境锚复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

要让一三零号教育辰参照群体效应与情境锚离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育辰参照群体效应与情境锚评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育辰参照群体效应与情境锚复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

面向 2026 年,一三零号教育辰参照群体效应与情境锚最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育辰参照群体效应与情境锚若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

位置E——把“参照群体效应与情境锚的对象、操作与失败域”当成单独够用的那一样 单因决定参照群体效应与情境锚能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔16 稀有与常见服从同一机制〕参照群体效应与情境锚在已发表样本中的方向可以代表全部候选对象 量纲参照群体效应与情境锚边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,参照群体效应与情境锚记录越完整,整体结论反而出现反号或反向移动 自曝第130号第15项把参照群体效应与情境锚的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第15项中未定义、未进入流程、失访、阴性或因参照群体效应与情境锚条件不足而被排除的对象 异名第 409 号《文化社会学》称为“参照群体效应与情境锚的边界—分母错位”;另见第 381 号第15条

八、算法评分的公平性与不可能定理Fairness in Algorithmic Scoring

提出Messick, Validity of psychological assessment, American Psychologist 50 (1995): 741–749, doi:10.1037/0003-066X.50.9.741。 争议Freeman et al., Active learning increases student performance in STEM, PNAS 111 (2014): 8410–8415, doi:10.1073/pnas.1319030111 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

当评分与分班、录取、预警由算法作出,公平就从一个伦理表述变成了可形式化的约束:预测校准、假阳性率均等、假阴性率均等。这十年被反复引用的结论是,当不同群体的基础发生率不同时,这几项不可同时满足。一三零号教育巳算法评分的公平性与不可能定理复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是「只要不使用受保护属性就算公平」这一直觉。删掉属性不会删掉与它相关的其他变量,而在多个公平判据之间,设计者必须选择牺牲哪一个——这是一个价值判断,不是技术优化。一三零号教育巳算法评分的公平性与不可能定理复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育巳算法评分的公平性与不可能定理的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育巳算法评分的公平性与不可能定理阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育巳算法评分的公平性与不可能定理复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

要让一三零号教育巳算法评分的公平性与不可能定理离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育巳算法评分的公平性与不可能定理评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育巳算法评分的公平性与不可能定理复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

面向 2026 年,一三零号教育巳算法评分的公平性与不可能定理最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育巳算法评分的公平性与不可能定理若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

一三零号教育巳算法评分的公平性与不可能定理首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育巳算法评分的公平性与不可能定理只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

位置S——把“算法评分的公平性与不可能定理的对象、操作与失败域”当成单独够用的那一样 单因决定算法评分的公平性与不可能定理能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔24 冗余是浪费〕算法评分的公平性与不可能定理在已发表样本中的方向可以代表全部候选对象 量纲算法评分的公平性与不可能定理边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,算法评分的公平性与不可能定理记录越完整,整体结论反而出现反号或反向移动 自曝第130号第16项把算法评分的公平性与不可能定理的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第16项中未定义、未进入流程、失访、阴性或因算法评分的公平性与不可能定理条件不足而被排除的对象 异名第 412 号《实验经济学》称为“算法评分的公平性与不可能定理的边界—分母错位”;另见第 386 号第16条

九、免考运动与信号价值Test-Optional Admissions

提出Kane, Validating the interpretations and uses of test scores, Journal of Educational Measurement 50 (2013): 1–73, doi:10.1111/jedm.12000。 争议Chi & Wylie, The ICAP framework, Educational Psychologist 49 (2014): 219–243, doi:10.1080/00461520.2014.965823 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年大量高校取消了标准化考试的强制要求,理由是它与家庭背景高度相关、且备考资源分配不均。这一政策变化提供了一次大规模的自然实验:当一个筛选信号被移除,其余信号会承担什么。一三零号教育午免考运动与信号价值复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

它检验的是一个测量学核心命题——分数的增量效度。既有研究显示标准化成绩在控制中学成绩之后仍能预测大学表现,尤其对来自成绩通胀严重的中学的申请者;而反对方指出这种预测力在控制家庭背景后大幅缩小。两边的估计都成立,差别在于把背景变量算作混淆还是算作机制。

要让一三零号教育午免考运动与信号价值离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育午免考运动与信号价值评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一三零号教育午免考运动与信号价值复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一三零号教育午免考运动与信号价值最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育午免考运动与信号价值若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育午免考运动与信号价值复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一三零号教育午免考运动与信号价值首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育午免考运动与信号价值只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育午免考运动与信号价值只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育午免考运动与信号价值资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育午免考运动与信号价值复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置D——把“免考运动与信号价值的对象、操作与失败域”当成单独够用的那一样 单因决定免考运动与信号价值能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔24 冗余是浪费〕免考运动与信号价值在已发表样本中的方向可以代表全部候选对象 量纲免考运动与信号价值边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,免考运动与信号价值记录越完整,整体结论反而出现反号或反向移动 自曝第130号第17项把免考运动与信号价值的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第17项中未定义、未进入流程、失访、阴性或因免考运动与信号价值条件不足而被排除的对象 异名第 415 号《文化与创意经济学》称为“免考运动与信号价值的边界—分母错位”;另见第 391 号第17条

十、独立完成的不可观测性The Unobservability of Independent Work

提出UNESCO, Global Education Monitoring Report 2023: Technology in Education (2023)。 争议Kapur, Productive failure, Cognition and Instruction 26 (2008): 379–424, doi:10.1080/07370000802212669 给出不同对象边界或反例路线。 最新OECD, Education at a Glance 2024: OECD Indicators (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年测量遇到一个前所未有的处境:几乎所有非监考条件下完成的作品,都不再能保证来自学生本人。检测工具在原理上不可靠——它们估计文本的统计特征,而这些特征既可被规避,也会对非母语写作者产生系统性误判。一三零号教育未独立完成的不可观测性复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

它推翻的是长期被视为理所当然的一条前提:作品与作者之间存在稳定对应。教育测量的整套推理链条——从作答到分数到能力推断——第一环就断在这里,而效度论证范式恰恰要求这一环被明确论证。一三零号教育未独立完成的不可观测性复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

面向 2026 年,一三零号教育未独立完成的不可观测性最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一三零号教育未独立完成的不可观测性若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一三零号教育未独立完成的不可观测性复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一三零号教育未独立完成的不可观测性首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育未独立完成的不可观测性只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育未独立完成的不可观测性只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育未独立完成的不可观测性资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育未独立完成的不可观测性复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育未独立完成的不可观测性的证据核验回到 UNESCO, Global Education Monitoring Report 2023: Technology in Education (2023)。一三零号教育未独立完成的不可观测性本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育未独立完成的不可观测性复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

位置E——把“独立完成的不可观测性的对象、操作与失败域”当成单独够用的那一样 单因决定独立完成的不可观测性能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔24 冗余是浪费〕独立完成的不可观测性在已发表样本中的方向可以代表全部候选对象 量纲独立完成的不可观测性边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,独立完成的不可观测性记录越完整,整体结论反而出现反号或反向移动 自曝第130号第18项把独立完成的不可观测性的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第18项中未定义、未进入流程、失访、阴性或因独立完成的不可观测性条件不足而被排除的对象 异名第 418 号《演化与复杂经济学》称为“独立完成的不可观测性的边界—分母错位”;另见第 396 号第18条

十一、测量作为教学的透镜Measurement as an Instructional Lens

提出OECD, PISA 2022 Results, Volumes I–V (2023–2024)。 争议Kirschner, Sweller & Clark, Why minimal guidance during instruction does not work, Educational Psychologist 41 (2006): 75–86, doi:10.1207/s15326985ep4102_1 给出不同对象边界或反例路线。 最新UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

这十年一个明确的取向是把测量的目标从「准确定位」改为「指导下一步」。诊断模型与知识追踪被要求输出的不是一个位置,而是一个可行动的判断:缺的是哪一项前提、哪一处理解是脆弱的、下一步该做什么。一三零号教育申测量作为教学的透镜复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

它推翻的是测量与教学分属两个专业这一分工。此前测量学以量表性质与信度为核心指标,教学决策由教师另行作出;新的取向要求模型在设计时就以教学可用性为约束,哪怕以牺牲部分预测精度为代价。一三零号教育申测量作为教学的透镜复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

一三零号教育申测量作为教学的透镜首先改变的是教育测量与评价的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一三零号教育申测量作为教学的透镜只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一三零号教育申测量作为教学的透镜只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育申测量作为教学的透镜资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一三零号教育申测量作为教学的透镜复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

一三零号教育申测量作为教学的透镜的证据核验回到 OECD, PISA 2022 Results, Volumes I–V (2023–2024)。一三零号教育申测量作为教学的透镜本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育申测量作为教学的透镜复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育申测量作为教学的透镜的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育申测量作为教学的透镜阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一三零号教育申测量作为教学的透镜复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置S——把“测量作为教学的透镜的对象、操作与失败域”当成单独够用的那一样 单因决定测量作为教学的透镜能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔30 未被计价的东西不影响结算〕测量作为教学的透镜在已发表样本中的方向可以代表全部候选对象 量纲测量作为教学的透镜边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,测量作为教学的透镜记录越完整,整体结论反而出现反号或反向移动 自曝第130号第19项把测量作为教学的透镜的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第19项中未定义、未进入流程、失访、阴性或因测量作为教学的透镜条件不足而被排除的对象 异名第 421 号《税法》称为“测量作为教学的透镜的边界—分母错位”;另见第 401 号第19条

十二、大规模评估的政治与技术张力Politics and Technique in Large-Scale Assessment

提出World Bank, World Development Report 2018: Learning to Realize Education’s Promise (2018)。 争议Black & Wiliam, Developing the theory of formative assessment, Educational Assessment Evaluation and Accountability 21 (2009): 5–31, doi:10.1007/s11092-008-9068-5 给出不同对象边界或反例路线。 最新OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

国际大规模评估在这十年既扩张又受质疑。扩张的一面是它被用作全球教育目标的监测工具;质疑的一面是设计目的与监测目的并不吻合——一套为比较学校体系而设计的抽样测验,被用来判断一个国家是否达成了普及性的学习目标。一三零号教育酉大规模评估的政治与技术张力复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

技术批评与政治批评在这里第一次合流。技术上,排名对建模选择敏感、样本排除规则各国不一、部分国家的覆盖率存在争议;政治上,排名的公共影响力远超其精度所能支持的程度,并促成了跨国的政策借用——借的往往是排名靠前国家的表面做法,而非其制度条件。一三零号教育酉大规模评估的政治与技术张力复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

对一三零号教育酉大规模评估的政治与技术张力只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一三零号教育酉大规模评估的政治与技术张力资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

一三零号教育酉大规模评估的政治与技术张力的证据核验回到 World Bank, World Development Report 2018: Learning to Realize Education’s Promise (2018)。一三零号教育酉大规模评估的政治与技术张力本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一三零号教育酉大规模评估的政治与技术张力复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一三零号教育酉大规模评估的政治与技术张力的效应撑得很整齐,边缘对象却给出反向结果。一三零号教育酉大规模评估的政治与技术张力阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。

要让一三零号教育酉大规模评估的政治与技术张力离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一三零号教育酉大规模评估的政治与技术张力评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。

位置D——把“大规模评估的政治与技术张力的对象、操作与失败域”当成单独够用的那一样 单因决定大规模评估的政治与技术张力能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔30 未被计价的东西不影响结算〕大规模评估的政治与技术张力在已发表样本中的方向可以代表全部候选对象 量纲大规模评估的政治与技术张力边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,大规模评估的政治与技术张力记录越完整,整体结论反而出现反号或反向移动 自曝第130号第20项把大规模评估的政治与技术张力的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第130号第20项中未定义、未进入流程、失访、阴性或因大规模评估的政治与技术张力条件不足而被排除的对象 异名第 424 号《公司法与证券监管》称为“大规模评估的政治与技术张力的边界—分母错位”;另见第 406 号第20条

二十年连起来看

教育测量与评价过去二十年的连续变化,不是新术语不断覆盖旧术语,而是研究对象从单点扩到轨迹、从平均值扩到异质性、从成功案例扩到失败分母。第一幕八条定位奠基转向,第二幕十二条把它们推进到真实世界、规模化与公开核验。

因此,“新”由证据结构而不是发表年份决定:旧思想若到近年才获得可计算对象、公开数据或可否证阈值,仍是新的工作方式;2025 年出现却没有独立复核的结果,只能记为候选。

三个常见误解

第一,把一个著名项目当成整个领域;本页用二十条区分机制、测量、制度与基础设施。第二,把样本或数据规模当可靠性;规模不能修复选择偏差、定义漂移与缺失机制。第三,把尚未解决解释为没有进步;把失败区画清、把错误路线排除,本身就是可累积的知识。

与相邻领域的接口

与第 302 号《调和分析》的接口在可迁移表示:对象换场景后,结构与误差能否同时保留。与第 315 号《表面与界面物理》的接口在证据聚合:局部读数怎样进入整体判断而不抹平异常。两处都要求先公开分母,再谈统一。

争议现场

教育测量与评价最实质的争议不是传统与创新,而是复杂研究怎样获得共同体信任。一方强调专家链式核验,另一方要求原始数据、机器证书或独立复做。可判标准是关键结论能否在不依赖原作者口头补充的情况下重建。

第二个争议围绕边界:统一语言提高迁移速度,却可能把不适配对象排出可见范围。因此二十条都保留“空栏”和“自曝”;若异常只在论文之外出现,统一就只是整理成功案例。

往下五年看什么

观察三件事:2024—2026 年候选结果能否形成第二个独立复核;数据库、软件与流程能否保存阴性记录;新人能否在更短依赖路径上进入前沿。若三项只增加产出数量而不降低复核成本,基础设施仍未成熟。

可与哪些领域对撞

教育测量与评价与第 437 号《危机管理与企业声誉》共享“通过检查即可信”的前提,却可能给出相反方向:形式检查越密,未建模的共同原因失效越隐蔽。可测问题是重大修订前的扩散速度/完成独立复核所需时间。

它还可撞第 297 号《科技政策与科研管理》:一个领域追求真值,另一个领域分配注意、经费与声誉。两者都默认高影响结果值得优先复核;相反方向是越抢先的结果可供核验的时间越短。

第三处对撞是第 306 号《生物统计学》:那里担心样本进入分母,这里担心对象、记录或实施场景进入分母。共同前提是已记录对象代表候选总体;相反方向是可测对象越多,难以表示的对象越可能永久缺席。

十条可做的研究命题

一,统计关键结果从提出到独立核验的中位时间。二,把失败参数公开与否作为后续复用率的解释变量。三,比较单中心与多中心研究的依赖树。四,测数据库扩容前后问题类型是否收窄。五,前瞻登记来源三笔互异与重大修订率。

六,随机抽样复核一条中间步骤。七,比较新框架引入前后的训练年限。八,为不可复算却被广泛引用的结果建立退出机制。九,测试跨领域迁移是否增加反例发现率。十,把阴性记录进入公共库的比例设为健康指标,并预先规定何时否定它。

资料核验

  1. Dunlosky et al., Improving students’ learning with effective learning techniques, Psychological Science in the Public Interest 14 (2013): 4–58, doi:10.1177/1529100612453266
  2. Roediger & Karpicke, Test-enhanced learning, Psychological Science 17 (2006): 249–255, doi:10.1111/j.1467-9280.2006.01693.x
  3. Freeman et al., Active learning increases student performance in STEM, PNAS 111 (2014): 8410–8415, doi:10.1073/pnas.1319030111
  4. Chi & Wylie, The ICAP framework, Educational Psychologist 49 (2014): 219–243, doi:10.1080/00461520.2014.965823
  5. Kapur, Productive failure, Cognition and Instruction 26 (2008): 379–424, doi:10.1080/07370000802212669
  6. Kirschner, Sweller & Clark, Why minimal guidance during instruction does not work, Educational Psychologist 41 (2006): 75–86, doi:10.1207/s15326985ep4102_1
  7. Black & Wiliam, Developing the theory of formative assessment, Educational Assessment Evaluation and Accountability 21 (2009): 5–31, doi:10.1007/s11092-008-9068-5
  8. Hattie & Timperley, The power of feedback, Review of Educational Research 77 (2007): 81–112, doi:10.3102/003465430298487
  9. Kraft, Blazar & Hogan, The effect of teacher coaching, Review of Educational Research 88 (2018): 547–588, doi:10.3102/0034654318759268
  10. Chetty, Friedman & Rockoff, Measuring the impacts of teachers II, American Economic Review 104 (2014): 2633–2679, doi:10.1257/aer.104.9.2633
  11. Jackson, Johnson & Persico, The effects of school spending, Quarterly Journal of Economics 131 (2016): 157–218, doi:10.1093/qje/qjv036
  12. Banerjee et al., From proof of concept to scalable policies, Journal of Economic Perspectives 31 (2017): 73–102, doi:10.1257/jep.31.4.73
  13. Koedinger, Corbett & Perfetti, The Knowledge-Learning-Instruction framework, Cognitive Science 36 (2012): 757–798, doi:10.1111/j.1551-6709.2012.01245.x
  14. Means et al., Evaluation of Evidence-Based Practices in Online Learning, US Department of Education (2010)
  15. Bender et al., On the dangers of stochastic parrots, FAccT 2021: 610–623, doi:10.1145/3442188.3445922
  16. Messick, Validity of psychological assessment, American Psychologist 50 (1995): 741–749, doi:10.1037/0003-066X.50.9.741
  17. Kane, Validating the interpretations and uses of test scores, Journal of Educational Measurement 50 (2013): 1–73, doi:10.1111/jedm.12000
  18. UNESCO, Global Education Monitoring Report 2023: Technology in Education (2023)
  19. OECD, PISA 2022 Results, Volumes I–V (2023–2024)
  20. World Bank, World Development Report 2018: Learning to Realize Education’s Promise (2018)
  21. OECD, Education at a Glance 2024: OECD Indicators (2024)
  22. UNESCO, Global Education Monitoring Report 2024/5: Leadership in Education (2024)
  23. OECD, PISA 2022 Results Volume V: Learning Strategies and Attitudes for Life (2024)

核验说明:文献表优先列原始论文、正式方法规范、数据报告与同行评议综述;工作论文或方法更新只用于“最新”定位,不与已复核的因果结果同权。正文数值、适用边界与失败条件以来源原文为准。

新思想前沿 · 第 130 号《教育测量与评价》· 王德生 亲撰 · ← 回到 626 个领域总览