SDE Universes·新思想前沿心理学
新思想前沿 · 心理学

心理测量学

第 146 号 · 近二十年 · 两幕 · 20 个新思想 · 约 26,488 字 · 王德生 亲撰 · 2026 年 8 月

心理测量学的思想转向,核心不是把技术清单拉长,而是把对象边界、证据方向、失败条件与现实部署写进同一套可复算账本。 本页逐条写清提出、争议、最新证据、量纲、反号失效、自曝与未入账对象。

【第一幕】上一个十年 · 约 2006–2016 · 八条奠基转向

甲、效度的因果理论 —— 有效意味着属性存在并导致了作答效度的因果理论 —— 有效意味着属性存在并导致了作答

提出Open Science Collaboration, Estimating the reproducibility of psychological science, Science 349 (2015): aac4716, doi:10.1126/science.aac4716。 争议Kotov et al., The Hierarchical Taxonomy of Psychopathology, Journal of Abnormal Psychology 126 (2017): 454–477, doi:10.1037/abn0000258 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Denny Borsboom、Gideon Mellenbergh 与 Jaap van Heerden 二〇〇四年提出效度的因果理论。主张是:一个测量工具对某属性有效,当且仅当该属性确实存在,且它的变化因果性地导致了测量结果的变化。这把效度从一个关于解释与推论的概念(当时的主流定义),改回一个关于测量工具本身的本体论与因果命题;相关证据不再是效度的定义,而只是判断该命题是否成立的间接线索。

【它顶掉了什么】它顶掉的是自二十世纪五十年代以来占主导的构念效度框架——把效度定义为「对测验分数解释的证据与理论支持的程度」。批评的要点是:这一定义把效度做得无所不包因而无法被否定,任何相关证据都可以算作支持;而在因果理论下,效度是一个可以为假的命题。

一四六号心理甲效度的因果理论首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理甲效度的因果理论只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一四六号心理甲效度的因果理论复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

对一四六号心理甲效度的因果理论只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理甲效度的因果理论资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理甲效度的因果理论复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理甲效度的因果理论的证据核验回到 Open Science Collaboration, Estimating the reproducibility of psychological science, Science 349 (2015): aac4716, doi:10.1126/science.aac4716。一四六号心理甲效度的因果理论本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理甲效度的因果理论复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理甲效度的因果理论的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理甲效度的因果理论阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理甲效度的因果理论复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

位置D——把“效度的因果理论的对象、操作与失败域”当成单独够用的那一样 单因决定效度的因果理论能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔04 测量不改变被测对象〕效度的因果理论在已发表样本中的方向可以代表全部候选对象 量纲效度的因果理论边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,效度的因果理论记录越完整,整体结论反而出现反号或反向移动 自曝第146号第1项把效度的因果理论的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第1项中未定义、未进入流程、失访、阴性或因效度的因果理论条件不足而被排除的对象 异名第 479 号《计算创造力与生成式艺术》称为“效度的因果理论的边界—分母错位”;另见第 487 号第1条

乙、「心理测量学家的攻击」—— 好的测量技术为什么没被用起来「心理测量学家的攻击」—— 好的测量技术为什么没被用起来

提出Klein et al., Investigating variation in replicability, Social Psychology 45 (2014): 142–152, doi:10.1027/1864-9335/a000178。 争议Hayes & Hofmann, Process-Based CBT, New Harbinger (2018) 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Borsboom 二〇〇六年在《心理测量学》上发表的这篇文章主张:过去几十年心理测量学在技术上进展巨大——项目反应理论、结构方程模型、测量不变性检验、潜类别模型——但这些成果几乎没有进入实质心理学研究的日常实践。研究者仍在用总分、用系数 α、用差异分数,仿佛这些技术不存在。诊断是:技术进步与实质研究之间缺少一座桥,因为心理测量学讲的是模型,而心理学家想要的是关于心理的说法。

【它顶掉了什么】它顶掉的是「方法进步会自动扩散」这一假设。文章还顺带顶掉了三件被沿用的东西:操作性定义(把属性等同于测量程序,从而使效度问题消失)、经典测验理论(把真分数定义为重复测量的期望,因而真分数只是分数的性质而不是属性的性质)、以及把构念效度当作万能容器。

对一四六号心理乙心理测量学家的攻击只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理乙心理测量学家的攻击资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理乙心理测量学家的攻击复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理乙心理测量学家的攻击的证据核验回到 Klein et al., Investigating variation in replicability, Social Psychology 45 (2014): 142–152, doi:10.1027/1864-9335/a000178。一四六号心理乙心理测量学家的攻击本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理乙心理测量学家的攻击复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理乙心理测量学家的攻击的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理乙心理测量学家的攻击阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理乙心理测量学家的攻击复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

要让一四六号心理乙心理测量学家的攻击离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理乙心理测量学家的攻击评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。

位置E——把“心理测量学家的攻击的对象、操作与失败域”当成单独够用的那一样 单因决定心理测量学家的攻击能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔04 测量不改变被测对象〕心理测量学家的攻击在已发表样本中的方向可以代表全部候选对象 量纲心理测量学家的攻击边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,心理测量学家的攻击记录越完整,整体结论反而出现反号或反向移动 自曝第146号第2项把心理测量学家的攻击的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第2项中未定义、未进入流程、失访、阴性或因心理测量学家的攻击条件不足而被排除的对象 异名第 482 号《人因工程与工效学》称为“心理测量学家的攻击的边界—分母错位”;另见第 492 号第2条

丙、测量不变性与预测不变性不相容 —— 两种「公平」不能同时成立测量不变性与预测不变性不相容 —— 两种「公平」不能同时成立

提出Nosek et al., The preregistration revolution, PNAS 115 (2018): 2600–2606, doi:10.1073/pnas.1708274114。 争议Hofmann et al., The science of behavior change, Behaviour Research and Therapy 117 (2019): 1–8, doi:10.1016/j.brat.2019.01.006 给出不同对象边界或反例路线。 最新Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】本条的数学结论早已存在,而其含义在二〇〇六年之后被重新推到台前:测量不变性(同一潜变量水平的人,无论属于哪个群体,作答的期望相同)与预测不变性(同一测验分数的人,无论属于哪个群体,效标的期望相同)在一般情况下不能同时成立——除非各群体在潜变量上的分布相同。因此,若两个群体的真实分布有差异,测验必然在一种意义上「不公平」。

【它顶掉了什么】它顶掉的是选拔与教育测评中一个流行的做法:用回归方程的截距与斜率相等(即预测不变)来证明测验没有偏差。这一证明反而与测量层面的无偏相冲突。它同时说明「测验是否有偏」不是一个可以靠单一统计检验回答的问题,而取决于先要问哪一种不变性。一四六号心理丙测量不变性与预测不变性不相容复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一四六号心理丙测量不变性与预测不变性不相容的证据核验回到 Nosek et al., The preregistration revolution, PNAS 115 (2018): 2600–2606, doi:10.1073/pnas.1708274114。一四六号心理丙测量不变性与预测不变性不相容本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理丙测量不变性与预测不变性不相容复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理丙测量不变性与预测不变性不相容的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理丙测量不变性与预测不变性不相容阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。

要让一四六号心理丙测量不变性与预测不变性不相容离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理丙测量不变性与预测不变性不相容评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。

面向 2026 年,一四六号心理丙测量不变性与预测不变性不相容最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理丙测量不变性与预测不变性不相容若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

位置S——把“测量不变性与预测不变性不相容的对象、操作与失败域”当成单独够用的那一样 单因决定测量不变性与预测不变性不相容能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔04 测量不改变被测对象〕测量不变性与预测不变性不相容在已发表样本中的方向可以代表全部候选对象 量纲测量不变性与预测不变性不相容边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,测量不变性与预测不变性不相容记录越完整,整体结论反而出现反号或反向移动 自曝第146号第3项把测量不变性与预测不变性不相容的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第3项中未定义、未进入流程、失访、阴性或因测量不变性与预测不变性不相容条件不足而被排除的对象 异名第 485 号《园艺与设施农业》称为“测量不变性与预测不变性不相容的边界—分母错位”;另见第 497 号第3条

丁、网络心理测量 —— 不假设共同原因,也能建模条目之间的结构网络心理测量 —— 不假设共同原因,也能建模条目之间的结构

提出Munafò et al., A manifesto for reproducible science, Nature Human Behaviour 1 (2017): 0021, doi:10.1038/s41562-016-0021。 争议Henrich, Heine & Norenzayan, The weirdest people in the world?, Behavioral and Brain Sciences 33 (2010): 61–83, doi:10.1017/S0140525X0999152X 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Sacha Epskamp、Gunter Maris、Lourens Waldorp 与 Borsboom 在二〇一〇年代确立的网络心理测量主张:条目作答之间的相关,可以由条目之间的直接相互作用产生,而不必由一个共同潜变量产生。相应的模型是成对马尔可夫随机场(对二值数据即伊辛模型),边表示控制其余所有变量之后仍存在的条件依赖。由此产生了一套新的量:节点中心性、桥接、网络密度与稳定性。

【它顶掉了什么】它顶掉的是「一组条目相关高=背后有一个东西」这一自动推论,也顶掉了以内部一致性系数作为质量指标的做法:若条目互相因果作用,删掉「冗余」条目可能删掉的是网络的枢纽。它把因子结构从前提变成了待检验的假设之一。一四六号心理丁网络心理测量复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理丁网络心理测量的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理丁网络心理测量阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理丁网络心理测量复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

要让一四六号心理丁网络心理测量离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理丁网络心理测量评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理丁网络心理测量复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

面向 2026 年,一四六号心理丁网络心理测量最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理丁网络心理测量若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理丁网络心理测量复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一四六号心理丁网络心理测量首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理丁网络心理测量只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

位置D——把“网络心理测量的对象、操作与失败域”当成单独够用的那一样 单因决定网络心理测量能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔08 缺失即不存在〕网络心理测量在已发表样本中的方向可以代表全部候选对象 量纲网络心理测量边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,网络心理测量记录越完整,整体结论反而出现反号或反向移动 自曝第146号第4项把网络心理测量的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第4项中未定义、未进入流程、失访、阴性或因网络心理测量条件不足而被排除的对象 异名第 488 号《植物病理与植物保护》称为“网络心理测量的边界—分母错位”;另见第 502 号第4条

戊、网络与潜变量的形式等价 —— 数据往往裁决不了两者网络与潜变量的形式等价 —— 数据往往裁决不了两者

提出Lakens, Equivalence tests, Social Psychological and Personality Science 8 (2017): 355–362, doi:10.1177/1948550617697177。 争议Gelfand et al., Differences between tight and loose cultures, Science 332 (2011): 1100–1104, doi:10.1126/science.1197754 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】二〇一〇年代后期的一组形式结果表明:在相当一般的条件下,网络模型与潜变量模型在数学上等价——伊辛模型与多维项目反应模型可以互相转写,二者对同一批横断数据给出相同的拟合。Epskamp 等人二〇一七年提出的「广义网络心理测量」进一步把两者合并,允许模型中同时含有潜变量与残差网络。

【它顶掉了什么】它顶掉了网络运动早期的一个强主张:网络证据能推翻潜变量的存在。等价性说明,两者的差别不在拟合而在解释与其蕴含的干预预测——若症状之间真有因果边,干预一个节点应当波及邻居;若存在共同原因,则不会。因此裁决只能靠实验与个体内的时间序列,不能靠横断拟合。一四六号心理戊网络与潜变量的形式等价复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

要让一四六号心理戊网络与潜变量的形式等价离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理戊网络与潜变量的形式等价评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理戊网络与潜变量的形式等价复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一四六号心理戊网络与潜变量的形式等价最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理戊网络与潜变量的形式等价若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理戊网络与潜变量的形式等价复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理戊网络与潜变量的形式等价首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理戊网络与潜变量的形式等价只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一四六号心理戊网络与潜变量的形式等价只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理戊网络与潜变量的形式等价资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

位置E——把“网络与潜变量的形式等价的对象、操作与失败域”当成单独够用的那一样 单因决定网络与潜变量的形式等价能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔08 缺失即不存在〕网络与潜变量的形式等价在已发表样本中的方向可以代表全部候选对象 量纲网络与潜变量的形式等价边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,网络与潜变量的形式等价记录越完整,整体结论反而出现反号或反向移动 自曝第146号第5项把网络与潜变量的形式等价的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第5项中未定义、未进入流程、失访、阴性或因网络与潜变量的形式等价条件不足而被排除的对象 异名第 491 号《社会创新与社会企业》称为“网络与潜变量的形式等价的边界—分母错位”;另见第 507 号第5条

己、探索性图分析 —— 用网络的社群结构来判定有几个维度探索性图分析 —— 用网络的社群结构来判定有几个维度

提出Borsboom, A network theory of mental disorders, World Psychiatry 16 (2017): 5–13, doi:10.1002/wps.20375。 争议Muthukrishna et al., Beyond Western, Educated, Industrial, Rich, and Democratic psychology, Psychological Science 31 (2020): 678–701, doi:10.1177/0956797620916782 给出不同对象边界或反例路线。 最新Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Hudson Golino 与 Sacha Epskamp 二〇一七年提出探索性图分析(EGA):先用正则化方法估计条目之间的偏相关网络,再用社群检测算法找出条目簇,簇的数目即维度数、簇的成员即各维度的条目。主张是:这一路径比传统的因子数判定规则(特征值大于一、碎石图、平行分析)更准确,尤其在维度相关较高、样本量中等时。

【它顶掉了什么】它顶掉的是延续数十年的因子数判定实践——多数规则要么缺乏理论依据(特征值大于一),要么在相关维度下系统性偏误。它同时把维度性问题从「有几个共同原因」改述为「条目如何聚成结构上连通的组」,这与本页第四条的解释立场一致。一四六号心理己探索性图分析复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一四六号心理己探索性图分析最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理己探索性图分析若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理己探索性图分析复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理己探索性图分析首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理己探索性图分析只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一四六号心理己探索性图分析复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

对一四六号心理己探索性图分析只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理己探索性图分析资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理己探索性图分析复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一四六号心理己探索性图分析的证据核验回到 Borsboom, A network theory of mental disorders, World Psychiatry 16 (2017): 5–13, doi:10.1002/wps.20375。一四六号心理己探索性图分析本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理己探索性图分析复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

位置S——把“探索性图分析的对象、操作与失败域”当成单独够用的那一样 单因决定探索性图分析能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔08 缺失即不存在〕探索性图分析在已发表样本中的方向可以代表全部候选对象 量纲探索性图分析边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,探索性图分析记录越完整,整体结论反而出现反号或反向移动 自曝第146号第6项把探索性图分析的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第6项中未定义、未进入流程、失访、阴性或因探索性图分析条件不足而被排除的对象 异名第 494 号《专业伦理与职业规范》称为“探索性图分析的边界—分母错位”;另见第 512 号第6条

庚、可疑测量实践 —— 统计自由度之外,还有一层测量自由度可疑测量实践 —— 统计自由度之外,还有一层测量自由度

提出Caspi et al., The p factor, Clinical Psychological Science 2 (2014): 119–137, doi:10.1177/2167702613497473。 争议Borsboom et al., The theoretical status of latent variables, Psychological Review 110 (2003): 203–219, doi:10.1037/0033-295X.110.2.203 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Jessica Flake 与 Eiko Fried 二〇二〇年提出「可疑测量实践」(QMP)概念:研究者在测量上所做的、会让人怀疑测量效度的决策——临时删改条目、改动作答选项、把多份量表混合、用未验证的自编量表、不报告量表来源与信效度证据。其核心论证是:这些决策构成了一个与 p 值操纵同等严重却几乎完全不被报告的研究者自由度池,因而对累积性科学构成实质威胁。文章给出了一组研究者应回答的测量问题清单。

【它顶掉了什么】它顶掉的是复制危机讨论中对测量的忽视——改革的注意力集中在样本量、预注册与统计推断上,而被测量的东西是否还是同一个几乎无人过问。若量表在每项研究中都被改动,复制研究就无从谈起:连测的是不是同一件事都不确定。一四六号心理庚可疑测量实践复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

一四六号心理庚可疑测量实践首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理庚可疑测量实践只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一四六号心理庚可疑测量实践只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理庚可疑测量实践资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理庚可疑测量实践复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一四六号心理庚可疑测量实践的证据核验回到 Caspi et al., The p factor, Clinical Psychological Science 2 (2014): 119–137, doi:10.1177/2167702613497473。一四六号心理庚可疑测量实践本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理庚可疑测量实践复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理庚可疑测量实践的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理庚可疑测量实践阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理庚可疑测量实践复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

位置D——把“可疑测量实践的对象、操作与失败域”当成单独够用的那一样 单因决定可疑测量实践能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔11 可复现等于可重做〕可疑测量实践在已发表样本中的方向可以代表全部候选对象 量纲可疑测量实践边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,可疑测量实践记录越完整,整体结论反而出现反号或反向移动 自曝第146号第7项把可疑测量实践的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第7项中未定义、未进入流程、失访、阴性或因可疑测量实践条件不足而被排除的对象 异名第 497 号《同行评审与学术出版》称为“可疑测量实践的边界—分母错位”;另见第 517 号第7条

辛、构念泛滥与 jingle-jangle —— 同名异物与同物异名构念泛滥与 jingle-jangle —— 同名异物与同物异名

提出Kotov et al., The Hierarchical Taxonomy of Psychopathology, Journal of Abnormal Psychology 126 (2017): 454–477, doi:10.1037/abn0000258。 争议McNeish & Wolf, Thinking twice about sum scores, Behavior Research Methods 52 (2020): 2287–2305, doi:10.3758/s13428-020-01398-0 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】这一条把两个古老的谬误在当代语境下重新问题化:jingle 谬误是名称相同而所指不同(两份都叫「心理弹性」的量表相关很低);jangle 谬误是名称不同而所指相同(毅力与尽责性、敬业度与低倦怠)。系统性的主张是:心理学的构念数量在持续增长,而合并与淘汰的机制几乎不存在,于是文献表面上在积累,实际上在分叉。

【它顶掉了什么】它顶掉的是「提出新构念=作出新贡献」这一激励结构。它同时给出了一条可执行的准入规则:新构念必须报告与既有相邻构念的相关及其增量效度。这一规则已在人格面板(毅力)与组织面板(敬业度)留下了具体案例。一四六号心理辛构念泛滥与jinglejangl复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

对一四六号心理辛构念泛滥与jinglejangl只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理辛构念泛滥与jinglejangl资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理辛构念泛滥与jinglejangl复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一四六号心理辛构念泛滥与jinglejangl的证据核验回到 Kotov et al., The Hierarchical Taxonomy of Psychopathology, Journal of Abnormal Psychology 126 (2017): 454–477, doi:10.1037/abn0000258。一四六号心理辛构念泛滥与jinglejangl本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理辛构念泛滥与jinglejangl复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理辛构念泛滥与jinglejangl的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理辛构念泛滥与jinglejangl阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理辛构念泛滥与jinglejangl复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

要让一四六号心理辛构念泛滥与jinglejangl离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理辛构念泛滥与jinglejangl评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理辛构念泛滥与jinglejangl复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

位置E——把“构念泛滥与jinglejangl的对象、操作与失败域”当成单独够用的那一样 单因决定构念泛滥与jinglejangl能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔11 可复现等于可重做〕构念泛滥与jinglejangl在已发表样本中的方向可以代表全部候选对象 量纲构念泛滥与jinglejangl边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,构念泛滥与jinglejangl记录越完整,整体结论反而出现反号或反向移动 自曝第146号第8项把构念泛滥与jinglejangl的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第8项中未定义、未进入流程、失访、阴性或因构念泛滥与jinglejangl条件不足而被排除的对象 异名第 500 号《数字政府与公共服务》称为“构念泛滥与jinglejangl的边界—分母错位”;另见第 522 号第8条
【第二幕】这十年 · 约 2016–2026 · 十二条重构与清算

一、遍历性与个人特异测量 —— 个体内的结构未必等于个体间的结构遍历性与个人特异测量 —— 个体内的结构未必等于个体间的结构

提出Hayes & Hofmann, Process-Based CBT, New Harbinger (2018)。 争议Barr, Levy, Scheepers & Tily, Keep it maximal, Journal of Memory and Language 68 (2013): 255–278, doi:10.1016/j.jml.2012.11.001 给出不同对象边界或反例路线。 最新Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Peter Molenaar 二〇〇四年提出「个人特异范式」:经典测验理论与因子分析都建立在个体间的变异之上,而心理学的多数理论命题讲的是个体内的过程;两者只有在过程遍历(且平稳)时才能互推。二〇一八年 Aaron Fisher 等人在《美国科学院院刊》上给出量化:在六份密集重复测量数据中,个体内的方差是个体间方差的二到四倍,说明非遍历性在心理学数据中是常态。

【它顶掉了什么】它顶掉的是把因子结构、信度与效标关联从群体推给个人的整套做法——包括临床诊断、个体化反馈与选拔决策。它同时改变了「一份量表结构好」的含义:在群体上单维的量表,在某个人身上可以是多维的。一四六号心理壬遍历性与个人特异测量复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一四六号心理壬遍历性与个人特异测量的证据核验回到 Hayes & Hofmann, Process-Based CBT, New Harbinger (2018)。一四六号心理壬遍历性与个人特异测量本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理壬遍历性与个人特异测量复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理壬遍历性与个人特异测量的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理壬遍历性与个人特异测量阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理壬遍历性与个人特异测量复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

要让一四六号心理壬遍历性与个人特异测量离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理壬遍历性与个人特异测量评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理壬遍历性与个人特异测量复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

面向 2026 年,一四六号心理壬遍历性与个人特异测量最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理壬遍历性与个人特异测量若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

位置S——把“遍历性与个人特异测量的对象、操作与失败域”当成单独够用的那一样 单因决定遍历性与个人特异测量能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔11 可复现等于可重做〕遍历性与个人特异测量在已发表样本中的方向可以代表全部候选对象 量纲遍历性与个人特异测量边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,遍历性与个人特异测量记录越完整,整体结论反而出现反号或反向移动 自曝第146号第9项把遍历性与个人特异测量的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第9项中未定义、未进入流程、失访、阴性或因遍历性与个人特异测量条件不足而被排除的对象 异名第 503 号《圣经研究》称为“遍历性与个人特异测量的边界—分母错位”;另见第 527 号第9条

二、经验取样的信度 —— 老信度概念在密集数据上不再适用经验取样的信度 —— 老信度概念在密集数据上不再适用

提出Hofmann et al., The science of behavior change, Behaviour Research and Therapy 117 (2019): 1–8, doi:10.1016/j.brat.2019.01.006。 争议Gelman & Loken, The garden of forking paths, 2013 manuscript 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】随着经验取样与密集追踪成为常规,本领域重新定义了信度:在多层数据中,信度不是一个数,而至少要分成三种——个体内单次测量的信度、个体平均水平(特质部分)的信度、以及个体内变异性与动态参数(如自相关、情绪惯性)的信度。核心结论是:前两者通常可接受,而第三类的信度往往很低,除非每人的观测次数足够多。

【它顶掉了什么】它顶掉的是把系数 α 直接套用在经验取样数据上的做法——α 是为单次施测的个体间数据设计的,用在多层数据上会严重高估。更要紧的是,大量研究把「情绪变异性」「情绪惯性」当作个体差异变量来用,而这些量的信度若很低,则它们与结局的相关会被稀释到接近噪声。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理癸经验取样的信度的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理癸经验取样的信度阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理癸经验取样的信度复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

要让一四六号心理癸经验取样的信度离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理癸经验取样的信度评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理癸经验取样的信度复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一四六号心理癸经验取样的信度最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理癸经验取样的信度若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理癸经验取样的信度复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理癸经验取样的信度首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理癸经验取样的信度只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一四六号心理癸经验取样的信度复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置D——把“经验取样的信度的对象、操作与失败域”当成单独够用的那一样 单因决定经验取样的信度能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔13 时间尺度可自由压缩〕经验取样的信度在已发表样本中的方向可以代表全部候选对象 量纲经验取样的信度边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,经验取样的信度记录越完整,整体结论反而出现反号或反向移动 自曝第146号第10项把经验取样的信度的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第10项中未定义、未进入流程、失访、阴性或因经验取样的信度条件不足而被排除的对象 异名第 506 号《印度宗教与南亚哲学》称为“经验取样的信度的边界—分母错位”;另见第 532 号第10条

三、理论建构方法论与理论危机 —— 心理学缺的不是数据,是理论理论建构方法论与理论危机 —— 心理学缺的不是数据,是理论

提出Henrich, Heine & Norenzayan, The weirdest people in the world?, Behavioral and Brain Sciences 33 (2010): 61–83, doi:10.1017/S0140525X0999152X。 争议Simmons, Nelson & Simonsohn, False-positive psychology, Psychological Science 22 (2011): 1359–1366, doi:10.1177/0956797611417632 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Borsboom、Han van der Maas、Jonas Dalege、Rogier Kievit 与 Brian Haig 二〇二一年提出「理论建构方法论」(TCM),把建构理论拆成可执行的五步:识别一个稳健的经验现象、构造一个能产生该现象的原型模型、把模型形式化、评估它、再评估其整体理论价值。同年 Markus Eronen 与 Laura Bringmann 提出「理论危机」:心理学的复制危机之下还有一层更根本的危机——缺少足够精确、可产生定量预测的理论,因而无法判断一次失败究竟否证了什么。

【它顶掉了什么】它顶掉的是把理论等同于带箭头的方框图与言语假设的做法。这类表述无法产生定量预测,因而任何数据都不构成严格检验。它也顶掉了「先积累数据、理论自然浮现」这一归纳主义的期待——现象要能被识别为稳健,本身就需要理论。一四六号心理子理论建构方法论与理论危机复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

要让一四六号心理子理论建构方法论与理论危机离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理子理论建构方法论与理论危机评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理子理论建构方法论与理论危机复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一四六号心理子理论建构方法论与理论危机最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理子理论建构方法论与理论危机若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理子理论建构方法论与理论危机复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理子理论建构方法论与理论危机首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理子理论建构方法论与理论危机只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一四六号心理子理论建构方法论与理论危机只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理子理论建构方法论与理论危机资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

位置E——把“理论建构方法论与理论危机的对象、操作与失败域”当成单独够用的那一样 单因决定理论建构方法论与理论危机能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔13 时间尺度可自由压缩〕理论建构方法论与理论危机在已发表样本中的方向可以代表全部候选对象 量纲理论建构方法论与理论危机边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,理论建构方法论与理论危机记录越完整,整体结论反而出现反号或反向移动 自曝第146号第11项把理论建构方法论与理论危机的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第11项中未定义、未进入流程、失访、阴性或因理论建构方法论与理论危机条件不足而被排除的对象 异名第 509 号《宗教、法律与政教关系》称为“理论建构方法论与理论危机的边界—分母错位”;另见第 537 号第11条

四、量化谬误 —— 心理属性是不是可加的量,从未被检验量化谬误 —— 心理属性是不是可加的量,从未被检验

提出Gelfand et al., Differences between tight and loose cultures, Science 332 (2011): 1100–1104, doi:10.1126/science.1197754。 争议Funder et al., Improving the dependability of research in personality and social psychology, PSPR 18 (2014): 3–12, doi:10.1177/1088868313507536 给出不同对象边界或反例路线。 最新Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】Joel Michell 提出并在二〇〇〇年代持续论证的主张是:物理学中的量(长度、质量)具备可加结构,因而对它们做算术有意义;而心理学在把量表分数当作数量使用之前,从未检验过心理属性是否具备这种结构。他称这一疏忽为「量化谬误」——把「假定可量化」当成了「已证明可量化」。相关的实证路径是合并测量理论与 Rasch 模型所要求的可加性条件检验。

【它顶掉了什么】它顶掉的是心理测量学的基本操作假设:李克特量表的分数可以相加、求平均、做方差分析。若属性只是序结构而非量结构,那么均值差异与效应量的含义就需要重新界定。这是本页最激进的一条,它质疑的不是某个模型,而是整个统计传统的适用前提。一四六号心理丑量化谬误复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

面向 2026 年,一四六号心理丑量化谬误最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理丑量化谬误若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理丑量化谬误复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

一四六号心理丑量化谬误首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理丑量化谬误只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一四六号心理丑量化谬误复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

对一四六号心理丑量化谬误只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理丑量化谬误资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理丑量化谬误复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理丑量化谬误的证据核验回到 Gelfand et al., Differences between tight and loose cultures, Science 332 (2011): 1100–1104, doi:10.1126/science.1197754。一四六号心理丑量化谬误本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理丑量化谬误复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

位置S——把“量化谬误的对象、操作与失败域”当成单独够用的那一样 单因决定量化谬误能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔13 时间尺度可自由压缩〕量化谬误在已发表样本中的方向可以代表全部候选对象 量纲量化谬误边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,量化谬误记录越完整,整体结论反而出现反号或反向移动 自曝第146号第12项把量化谬误的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第12项中未定义、未进入流程、失访、阴性或因量化谬误条件不足而被排除的对象 异名第 512 号《古希腊与罗马哲学》称为“量化谬误的边界—分母错位”;另见第 542 号第12条

五、项目反应理论的普及与自适应测验 —— 从总分到潜变量刻度项目反应理论的普及与自适应测验 —— 从总分到潜变量刻度

提出Muthukrishna et al., Beyond Western, Educated, Industrial, Rich, and Democratic psychology, Psychological Science 31 (2020): 678–701, doi:10.1177/0956797620916782。 争议American Psychological Association, Publication Manual, 7th ed. (2020) 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】项目反应理论(IRT)在这二十年从专业领域扩散到心理学的日常研究。核心主张是:作答概率是被试潜变量水平与条目参数(难度、区分度)的函数;由此可以把被试与条目放在同一把刻度尺上,使不同条目组成的测验分数可比。计算机自适应测验(CAT)是其直接产物:根据前面的作答动态选题,可在大幅缩短测验长度的同时保持测量精度;大型健康结局条目库正是按这一原理建成的。

【它顶掉了什么】它顶掉的是以总分为核心的经典测验理论——总分的含义依赖于所用的具体条目集,因而不同版本的量表分数不可直接比较;同时也顶掉了「信度是一个常数」的假设:在 IRT 下,测量精度随潜变量水平变化,量表在中间水平精确、在两端粗糙。一四六号心理寅项目反应理论的普及与自适应测验复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一四六号心理寅项目反应理论的普及与自适应测验首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理寅项目反应理论的普及与自适应测验只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一四六号心理寅项目反应理论的普及与自适应测验只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理寅项目反应理论的普及与自适应测验资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。

一四六号心理寅项目反应理论的普及与自适应测验的证据核验回到 Muthukrishna et al., Beyond Western, Educated, Industrial, Rich, and Democratic psychology, Psychological Science 31 (2020): 678–701, doi:10.1177/0956797620916782。一四六号心理寅项目反应理论的普及与自适应测验本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理寅项目反应理论的普及与自适应测验复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理寅项目反应理论的普及与自适应测验的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理寅项目反应理论的普及与自适应测验阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。

位置D——把“项目反应理论的普及与自适应测验的对象、操作与失败域”当成单独够用的那一样 单因决定项目反应理论的普及与自适应测验能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔18 干预不回写到被干预者〕项目反应理论的普及与自适应测验在已发表样本中的方向可以代表全部候选对象 量纲项目反应理论的普及与自适应测验边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,项目反应理论的普及与自适应测验记录越完整,整体结论反而出现反号或反向移动 自曝第146号第13项把项目反应理论的普及与自适应测验的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第13项中未定义、未进入流程、失访、阴性或因项目反应理论的普及与自适应测验条件不足而被排除的对象 异名第 515 号《行动哲学与自由意志》称为“项目反应理论的普及与自适应测验的边界—分母错位”;另见第 547 号第13条

六、差异项目功能与算法公平 —— 老问题在新系统里重演差异项目功能与算法公平 —— 老问题在新系统里重演

提出Borsboom et al., The theoretical status of latent variables, Psychological Review 110 (2003): 203–219, doi:10.1037/0033-295X.110.2.203。 争议Open Science Collaboration, Estimating the reproducibility of psychological science, Science 349 (2015): aac4716, doi:10.1126/science.aac4716 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】差异项目功能(DIF)研究主张:同一潜变量水平的不同群体成员,在某个条目上的作答概率若不同,该条目就存在偏差,需要被检出并处理。二〇一〇年代之后,机器学习领域独立地提出了一组公平性判据(校准、错误率均等、人口统计均等),并证明了一个不可能定理:当各群体的基础发生率不同时,这些判据不能同时满足。两条线在结构上完全同型,只是词汇不同。

【它顶掉了什么】它顶掉的是「只要算法不使用群体变量就公平」这一直觉,也顶掉了把公平当作单一属性的表述。心理测量学的贡献在于提供了一个更早、更细的框架:偏差发生在条目层面而非仅在总分层面,因而可以定位到具体题目并加以修正——这一思路在算法评分中同样适用,却很少被采用。

对一四六号心理卯差异项目功能与算法公平只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理卯差异项目功能与算法公平资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理卯差异项目功能与算法公平复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理卯差异项目功能与算法公平的证据核验回到 Borsboom et al., The theoretical status of latent variables, Psychological Review 110 (2003): 203–219, doi:10.1037/0033-295X.110.2.203。一四六号心理卯差异项目功能与算法公平本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理卯差异项目功能与算法公平复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理卯差异项目功能与算法公平的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理卯差异项目功能与算法公平阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理卯差异项目功能与算法公平复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

要让一四六号心理卯差异项目功能与算法公平离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理卯差异项目功能与算法公平评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。

位置E——把“差异项目功能与算法公平的对象、操作与失败域”当成单独够用的那一样 单因决定差异项目功能与算法公平能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔18 干预不回写到被干预者〕差异项目功能与算法公平在已发表样本中的方向可以代表全部候选对象 量纲差异项目功能与算法公平边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,差异项目功能与算法公平记录越完整,整体结论反而出现反号或反向移动 自曝第146号第14项把差异项目功能与算法公平的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第14项中未定义、未进入流程、失访、阴性或因差异项目功能与算法公平条件不足而被排除的对象 异名第 518 号《技术哲学》称为“差异项目功能与算法公平的边界—分母错位”;另见第 552 号第14条

七、测量误差的下游后果 —— 不可靠的测量会系统性地歪曲结论测量误差的下游后果 —— 不可靠的测量会系统性地歪曲结论

提出McNeish & Wolf, Thinking twice about sum scores, Behavior Research Methods 52 (2020): 2287–2305, doi:10.3758/s13428-020-01398-0。 争议Klein et al., Investigating variation in replicability, Social Psychology 45 (2014): 142–152, doi:10.1027/1864-9335/a000178 给出不同对象边界或反例路线。 最新Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】这一条把久已知晓的衰减公式重新问题化:测量误差会系统性地压低相关,因而效应量被低估;更严重的是,当不可靠的变量被当作控制变量放进回归时,它无法完全吸收其所代表的混杂,残余混杂会被错误地记到其他变量头上。主张是:本领域大量「控制了 X 之后 Y 仍然显著」的结论,其稳健性取决于 X 的信度,而这一点几乎从不被讨论。

【它顶掉了什么】它顶掉的是把信度当作论文方法部分一个交代性数字的做法。信度不是质量标签,而是进入推断的参数:同一批数据,若把测量误差建模进去,结论可以逆转。它也顶掉了「加更多控制变量更严谨」这一直觉——不可靠的控制变量越多,残余混杂的来源越多。一四六号心理辰测量误差的下游后果复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

一四六号心理辰测量误差的下游后果的证据核验回到 McNeish & Wolf, Thinking twice about sum scores, Behavior Research Methods 52 (2020): 2287–2305, doi:10.3758/s13428-020-01398-0。一四六号心理辰测量误差的下游后果本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理辰测量误差的下游后果复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理辰测量误差的下游后果的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理辰测量误差的下游后果阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理辰测量误差的下游后果复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

要让一四六号心理辰测量误差的下游后果离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理辰测量误差的下游后果评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理辰测量误差的下游后果复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

面向 2026 年,一四六号心理辰测量误差的下游后果最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理辰测量误差的下游后果若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

位置S——把“测量误差的下游后果的对象、操作与失败域”当成单独够用的那一样 单因决定测量误差的下游后果能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔18 干预不回写到被干预者〕测量误差的下游后果在已发表样本中的方向可以代表全部候选对象 量纲测量误差的下游后果边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,测量误差的下游后果记录越完整,整体结论反而出现反号或反向移动 自曝第146号第15项把测量误差的下游后果的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第15项中未定义、未进入流程、失访、阴性或因测量误差的下游后果条件不足而被排除的对象 异名第 521 号《中国史》称为“测量误差的下游后果的边界—分母错位”;另见第 557 号第15条

八、预测与解释的分离 —— 机器学习进入心理测量后的第一课预测与解释的分离 —— 机器学习进入心理测量后的第一课

提出Barr, Levy, Scheepers & Tily, Keep it maximal, Journal of Memory and Language 68 (2013): 255–278, doi:10.1016/j.jml.2012.11.001。 争议Nosek et al., The preregistration revolution, PNAS 115 (2018): 2600–2606, doi:10.1073/pnas.1708274114 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】机器学习方法进入心理测量之后确立的主张是:预测精度与解释力是两个不同目标,优化其一常损害其二。相应的实践规范是把样本外预测作为标准评价方式——用交叉验证或独立样本检验模型,而不是报告在同一批数据上的拟合。这一转变揭示了一个普遍事实:心理学中许多被广泛接受的模型,其样本外预测力远低于其解释性叙述所暗示的水平。

【它顶掉了什么】它顶掉的是把回归系数显著性当作模型有效性证据的做法。若一个模型在新样本上几乎无预测力,那么基于它的机制叙述就缺少最基本的支撑。它同时顶掉了「模型越复杂越好」的直觉——在心理数据的信噪比下,复杂模型的样本外优势往往很小。一四六号心理巳预测与解释的分离复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理巳预测与解释的分离的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理巳预测与解释的分离阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理巳预测与解释的分离复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

要让一四六号心理巳预测与解释的分离离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理巳预测与解释的分离评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理巳预测与解释的分离复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

面向 2026 年,一四六号心理巳预测与解释的分离最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理巳预测与解释的分离若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。

一四六号心理巳预测与解释的分离首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理巳预测与解释的分离只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

位置D——把“预测与解释的分离的对象、操作与失败域”当成单独够用的那一样 单因决定预测与解释的分离能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔20 窗口内稳定等于长期稳定〕预测与解释的分离在已发表样本中的方向可以代表全部候选对象 量纲预测与解释的分离边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,预测与解释的分离记录越完整,整体结论反而出现反号或反向移动 自曝第146号第16项把预测与解释的分离的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第16项中未定义、未进入流程、失访、阴性或因预测与解释的分离条件不足而被排除的对象 异名第 524 号《美国史与北美研究》称为“预测与解释的分离的边界—分母错位”;另见第 562 号第16条

九、数字表型与被动测量 —— 记录得到的,未必是想测的数字表型与被动测量 —— 记录得到的,未必是想测的

提出Gelman & Loken, The garden of forking paths, 2013 manuscript。 争议Munafò et al., A manifesto for reproducible science, Nature Human Behaviour 1 (2017): 0021, doi:10.1038/s41562-016-0021 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】数字表型主张:智能手机与可穿戴设备的被动数据(移动轨迹、屏幕使用、通话与消息频次、睡眠与活动、语音与文本)可以作为心理状态与特质的连续、生态化、低负担的测量。主张的理论依据是行为的直接记录优于回顾性自陈;实践上它使高频、长期的个体内测量第一次成为可能。

【它顶掉了什么】它顶掉的是自陈量表作为唯一实用测量手段的地位。但它同时把一个老问题以新形式提了出来:效标是什么。多数研究以自陈量表作为验证标准,于是被动测量的效度上限被自陈量表的效度所限定——若前者预测后者不佳,无法区分是被动测量差还是量表差。一四六号心理午数字表型与被动测量复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

要让一四六号心理午数字表型与被动测量离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理午数字表型与被动测量评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理午数字表型与被动测量复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

面向 2026 年,一四六号心理午数字表型与被动测量最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理午数字表型与被动测量若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理午数字表型与被动测量复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理午数字表型与被动测量首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理午数字表型与被动测量只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一四六号心理午数字表型与被动测量只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理午数字表型与被动测量资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理午数字表型与被动测量复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置E——把“数字表型与被动测量的对象、操作与失败域”当成单独够用的那一样 单因决定数字表型与被动测量能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔20 窗口内稳定等于长期稳定〕数字表型与被动测量在已发表样本中的方向可以代表全部候选对象 量纲数字表型与被动测量边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,数字表型与被动测量记录越完整,整体结论反而出现反号或反向移动 自曝第146号第17项把数字表型与被动测量的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第17项中未定义、未进入流程、失访、阴性或因数字表型与被动测量条件不足而被排除的对象 异名第 527 号《古代近东与埃及学》称为“数字表型与被动测量的边界—分母错位”;另见第 567 号第17条

十、大语言模型作答问卷 —— 「合成被试」的效度问题大语言模型作答问卷 —— 「合成被试」的效度问题

提出Simmons, Nelson & Simonsohn, False-positive psychology, Psychological Science 22 (2011): 1359–1366, doi:10.1177/0956797611417632。 争议Lakens, Equivalence tests, Social Psychological and Personality Science 8 (2017): 355–362, doi:10.1177/1948550617697177 给出不同对象边界或反例路线。 最新Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】二〇二三年之后出现的主张是:大语言模型可以被施以标准心理量表并给出稳定的作答模式,因而或可作为低成本的预试被试——用于探索条目表现、预估效应方向、检验问卷的可理解性。更保守的用法是把模型输出当作训练语料的统计画像来研究,而不当作人的替代。一四六号心理未大语言模型作答问卷复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

【它顶掉了什么】它对本领域的挑战不在于工具本身,而在于它把效度的因果理论(第一条)逼到了极端处境:模型的作答显然不是由「被测属性」导致的,它没有那个属性;因此按因果理论,任何对模型施测的量表在这一用法上都不具效度。这一推论清楚而尖锐,也说明了那条理论并非空谈。

面向 2026 年,一四六号心理未大语言模型作答问卷最重要的更新不是继续增大规模,而是预先登记失败阈值并追踪跨场景迁移。一四六号心理未大语言模型作答问卷若独立团队只复现方向而不能复现量级,应把结论降为局部版本;若方向也翻转,则回到对象定义与测量链重新审计。一四六号心理未大语言模型作答问卷复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理未大语言模型作答问卷首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理未大语言模型作答问卷只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。

对一四六号心理未大语言模型作答问卷只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理未大语言模型作答问卷资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理未大语言模型作答问卷复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一四六号心理未大语言模型作答问卷的证据核验回到 Simmons, Nelson & Simonsohn, False-positive psychology, Psychological Science 22 (2011): 1359–1366, doi:10.1177/0956797611417632。一四六号心理未大语言模型作答问卷本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理未大语言模型作答问卷复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

位置S——把“大语言模型作答问卷的对象、操作与失败域”当成单独够用的那一样 单因决定大语言模型作答问卷能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔20 窗口内稳定等于长期稳定〕大语言模型作答问卷在已发表样本中的方向可以代表全部候选对象 量纲大语言模型作答问卷边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,大语言模型作答问卷记录越完整,整体结论反而出现反号或反向移动 自曝第146号第18项把大语言模型作答问卷的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第18项中未定义、未进入流程、失访、阴性或因大语言模型作答问卷条件不足而被排除的对象 异名第 530 号《记忆研究与公共史学》称为“大语言模型作答问卷的边界—分母错位”;另见第 572 号第18条

十一、常模漂移 —— 分数的意义会随时代改变常模漂移 —— 分数的意义会随时代改变

提出Funder et al., Improving the dependability of research in personality and social psychology, PSPR 18 (2014): 3–12, doi:10.1177/1088868313507536。 争议Borsboom, A network theory of mental disorders, World Psychiatry 16 (2017): 5–13, doi:10.1002/wps.20375 给出不同对象边界或反例路线。 最新Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】常模漂移指:同一份测验在不同年代施测,其分数分布会系统性移动,因而同一个原始分在不同年代代表的相对位置不同。智力测验的长期上升与近年在部分国家的逆转是最著名的例子,人格与心理健康量表同样有记录。主张是:常模不是测验的固定属性,而是特定时代与人群的产物,因而必须定期重新标准化;否则跨年代的比较(包括「某某问题是否在增加」这类公共议题)就建立在漂移的尺子上。

【它顶掉了什么】它顶掉的是把常模当作背景参数的做法,也顶掉了大量基于旧常模的临床划界分数与筛查阈值。更根本的是,它把一个测量问题变成了实质问题:若分数在漂移,那么「上升的是现象还是尺子」无法仅凭分数回答。一四六号心理申常模漂移复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

一四六号心理申常模漂移首先改变的是心理测量学的入账单位:结果不能只按成功样本结算,必须把纳入对象、实施步骤、阴性读数与停止条件放在同一张表。一四六号心理申常模漂移只有这样,题目中的转向才是可检验命题,而不是一个吸引注意的新标签。一四六号心理申常模漂移复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

对一四六号心理申常模漂移只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理申常模漂移资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理申常模漂移复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

一四六号心理申常模漂移的证据核验回到 Funder et al., Improving the dependability of research in personality and social psychology, PSPR 18 (2014): 3–12, doi:10.1177/1088868313507536。一四六号心理申常模漂移本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理申常模漂移复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理申常模漂移的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理申常模漂移阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理申常模漂移复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

位置D——把“常模漂移的对象、操作与失败域”当成单独够用的那一样 单因决定常模漂移能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔28 记录存在即可核对〕常模漂移在已发表样本中的方向可以代表全部候选对象 量纲常模漂移边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,常模漂移记录越完整,整体结论反而出现反号或反向移动 自曝第146号第19项把常模漂移的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第19项中未定义、未进入流程、失访、阴性或因常模漂移条件不足而被排除的对象 异名第 533 号《具身智能》称为“常模漂移的边界—分母错位”;另见第 577 号第19条

十二、动态测量 —— 把状态与特质在时间上分开动态测量 —— 把状态与特质在时间上分开

提出American Psychological Association, Publication Manual, 7th ed. (2020)。 争议Caspi et al., The p factor, Clinical Psychological Science 2 (2014): 119–137, doi:10.1177/2167702613497473 给出不同对象边界或反例路线。 最新Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675。 关键提出、争议与最新为三笔互异来源;本条按原始证据、反例与近年更新分别结算。

【它主张什么】随着密集纵向数据的普及,本领域重新拾起并大幅扩展了状态—特质分解的模型:动态结构方程模型(DSEM)与相关的多层时间序列方法,把一个人的作答分解为稳定的特质成分、随时间自相关的状态成分与测量误差三部分,并允许每个人有自己的动态参数(惯性、波动、跨变量的滞后影响),同时估计这些参数的个体差异。

【它顶掉了什么】它顶掉的是把一次施测的分数当作特质、把重复测量的波动当作误差的传统处理。若状态成分具有自相关结构,那么把它当作误差既低估了信息,也高估了特质的稳定性。它同时给第九条的遍历性问题提供了一个建设性的技术回应:不再争论能不能从群体推个人,而是直接同时估计两层。一四六号心理酉动态测量复核五:中心情形和尾部情形分别结算;若两端反号,只保留局部结论。

对一四六号心理酉动态测量只保留一条单因主张:在公开边界内,关键操作能否稳定改变目标结局。一四六号心理酉动态测量资金、声望、机构级别和样本规模只作环境量,不能替代方向性证据;若离开原团队口头补充便无法重做,本条仍按一次性工艺处理。一四六号心理酉动态测量复核三:失败参数与停止位置保留版本,使下一轮能判断是方法失效还是边界越界。

一四六号心理酉动态测量的证据核验回到 American Psychological Association, Publication Manual, 7th ed. (2020)。一四六号心理酉动态测量本页分别登记对象数量、有效条件、误差或失败分母;这三种读数回答覆盖、强度与不确定性,不能相加为一个无量纲的“突破值”,也不能由发表年份代替证据等级。一四六号心理酉动态测量复核一:分母改成全部候选对象后重新计算方向,未满足纳入条件者不得记成零值。

最锋利的争议位于外推边界:中心样本、标准流程或低噪声场景可能把一四六号心理酉动态测量的效应撑得很整齐,边缘对象却给出反向结果。一四六号心理酉动态测量阴性参数区必须保留;它否定的也许只是聚合次序,而不是所有局部结论。一四六号心理酉动态测量复核二:2024—2026 年更新单列,较晚发表不自动等于更强证据。

要让一四六号心理酉动态测量离开个人技艺,样本、代码、量表、操作规程与修订记录必须带版本公开。一四六号心理酉动态测量评审时还要问谁进入分母、谁能独立复算、一次修订需要多少工时;基础设施的价值由复核成本下降衡量,而不是由文件数量衡量。一四六号心理酉动态测量复核四:报告独立复算成功对象/全部尝试对象,防止成功案例吞掉失败分母。

位置E——把“动态测量的对象、操作与失败域”当成单独够用的那一样 单因决定动态测量能否迁移的只有公开边界内的方向性结论是否可独立复算 预设〔28 记录存在即可核对〕动态测量在已发表样本中的方向可以代表全部候选对象 量纲动态测量边界内独立复算并保持方向的对象数/全部被声称覆盖的候选对象数 失效当边缘对象占比升高时,动态测量记录越完整,整体结论反而出现反号或反向移动 自曝第146号第20项把动态测量的适用条件写进样本、流程或参数;删除该条件,核心推断不成立 空栏第146号第20项中未定义、未进入流程、失访、阴性或因动态测量条件不足而被排除的对象 异名第 536 号《AI系统与基础设施》称为“动态测量的边界—分母错位”;另见第 582 号第20条

二十年连起来看

心理测量学过去二十年的连续变化,不是新术语不断覆盖旧术语,而是研究对象从单点扩到轨迹、从平均值扩到异质性、从成功案例扩到失败分母。第一幕八条定位奠基转向,第二幕十二条把它们推进到真实世界、规模化与公开核验。

因此,“新”由证据结构而不是发表年份决定:旧思想若到近年才获得可计算对象、公开数据或可否证阈值,仍是新的工作方式;2025 年出现却没有独立复核的结果,只能记为候选。

三个常见误解

第一,把一个著名项目当成整个领域;本页用二十条区分机制、测量、制度与基础设施。第二,把样本或数据规模当可靠性;规模不能修复选择偏差、定义漂移与缺失机制。第三,把尚未解决解释为没有进步;把失败区画清、把错误路线排除,本身就是可累积的知识。

与相邻领域的接口

与第 334 号《蛋白质组学与代谢组学》的接口在可迁移表示:对象换场景后,结构与误差能否同时保留。与第 347 号《生物地球化学循环》的接口在证据聚合:局部读数怎样进入整体判断而不抹平异常。两处都要求先公开分母,再谈统一。

争议现场

心理测量学最实质的争议不是传统与创新,而是复杂研究怎样获得共同体信任。一方强调专家链式核验,另一方要求原始数据、机器证书或独立复做。可判标准是关键结论能否在不依赖原作者口头补充的情况下重建。

第二个争议围绕边界:统一语言提高迁移速度,却可能把不适配对象排出可见范围。因此二十条都保留“空栏”和“自曝”;若异常只在论文之外出现,统一就只是整理成功案例。

往下五年看什么

观察三件事:2024—2026 年候选结果能否形成第二个独立复核;数据库、软件与流程能否保存阴性记录;新人能否在更短依赖路径上进入前沿。若三项只增加产出数量而不降低复核成本,基础设施仍未成熟。

可与哪些领域对撞

心理测量学与第 485 号《园艺与设施农业》共享“通过检查即可信”的前提,却可能给出相反方向:形式检查越密,未建模的共同原因失效越隐蔽。可测问题是重大修订前的扩散速度/完成独立复核所需时间。

它还可撞第 297 号《科技政策与科研管理》:一个领域追求真值,另一个领域分配注意、经费与声誉。两者都默认高影响结果值得优先复核;相反方向是越抢先的结果可供核验的时间越短。

第三处对撞是第 306 号《生物统计学》:那里担心样本进入分母,这里担心对象、记录或实施场景进入分母。共同前提是已记录对象代表候选总体;相反方向是可测对象越多,难以表示的对象越可能永久缺席。

十条可做的研究命题

一,统计关键结果从提出到独立核验的中位时间。二,把失败参数公开与否作为后续复用率的解释变量。三,比较单中心与多中心研究的依赖树。四,测数据库扩容前后问题类型是否收窄。五,前瞻登记来源三笔互异与重大修订率。

六,随机抽样复核一条中间步骤。七,比较新框架引入前后的训练年限。八,为不可复算却被广泛引用的结果建立退出机制。九,测试跨领域迁移是否增加反例发现率。十,把阴性记录进入公共库的比例设为健康指标,并预先规定何时否定它。

资料核验

  1. Open Science Collaboration, Estimating the reproducibility of psychological science, Science 349 (2015): aac4716, doi:10.1126/science.aac4716
  2. Klein et al., Investigating variation in replicability, Social Psychology 45 (2014): 142–152, doi:10.1027/1864-9335/a000178
  3. Nosek et al., The preregistration revolution, PNAS 115 (2018): 2600–2606, doi:10.1073/pnas.1708274114
  4. Munafò et al., A manifesto for reproducible science, Nature Human Behaviour 1 (2017): 0021, doi:10.1038/s41562-016-0021
  5. Lakens, Equivalence tests, Social Psychological and Personality Science 8 (2017): 355–362, doi:10.1177/1948550617697177
  6. Borsboom, A network theory of mental disorders, World Psychiatry 16 (2017): 5–13, doi:10.1002/wps.20375
  7. Caspi et al., The p factor, Clinical Psychological Science 2 (2014): 119–137, doi:10.1177/2167702613497473
  8. Kotov et al., The Hierarchical Taxonomy of Psychopathology, Journal of Abnormal Psychology 126 (2017): 454–477, doi:10.1037/abn0000258
  9. Hayes & Hofmann, Process-Based CBT, New Harbinger (2018)
  10. Hofmann et al., The science of behavior change, Behaviour Research and Therapy 117 (2019): 1–8, doi:10.1016/j.brat.2019.01.006
  11. Henrich, Heine & Norenzayan, The weirdest people in the world?, Behavioral and Brain Sciences 33 (2010): 61–83, doi:10.1017/S0140525X0999152X
  12. Gelfand et al., Differences between tight and loose cultures, Science 332 (2011): 1100–1104, doi:10.1126/science.1197754
  13. Muthukrishna et al., Beyond Western, Educated, Industrial, Rich, and Democratic psychology, Psychological Science 31 (2020): 678–701, doi:10.1177/0956797620916782
  14. Borsboom et al., The theoretical status of latent variables, Psychological Review 110 (2003): 203–219, doi:10.1037/0033-295X.110.2.203
  15. McNeish & Wolf, Thinking twice about sum scores, Behavior Research Methods 52 (2020): 2287–2305, doi:10.3758/s13428-020-01398-0
  16. Barr, Levy, Scheepers & Tily, Keep it maximal, Journal of Memory and Language 68 (2013): 255–278, doi:10.1016/j.jml.2012.11.001
  17. Gelman & Loken, The garden of forking paths, 2013 manuscript
  18. Simmons, Nelson & Simonsohn, False-positive psychology, Psychological Science 22 (2011): 1359–1366, doi:10.1177/0956797611417632
  19. Funder et al., Improving the dependability of research in personality and social psychology, PSPR 18 (2014): 3–12, doi:10.1177/1088868313507536
  20. American Psychological Association, Publication Manual, 7th ed. (2020)
  21. Measurement precision and user experience with adaptive versus non-adaptive psychometric tests, Personality and Individual Differences 225 (2024): 112675, doi:10.1016/j.paid.2024.112675
  22. Development and validation of domain-specific school diversity model scales, Journal of School Psychology 107 (2024): 101378, doi:10.1016/j.jsp.2024.101378
  23. Measurement invariance of SCARED across ethnicity, age and sex among youth with depression, Psychiatry Research Communications (2024): 100134, doi:10.1016/j.pmip.2024.100134

核验说明:文献表优先列原始论文、正式方法规范、数据报告与同行评议综述;工作论文或方法更新只用于“最新”定位,不与已复核的因果结果同权。正文数值、适用边界与失败条件以来源原文为准。

新思想前沿 · 第 146 号《心理测量学》· 王德生 亲撰 · ← 回到 626 个领域总览