SDE Universes·新思想前沿经济学的其余
新思想前沿 · 经济学的其余

实验经济学

近二十年 · 两幕 · 20 个新思想 · 约 26,712 字 · 王德生 亲撰 · 2026 年 8 月

实验经济学在过去二十年里经历的不是一条单线进步,而是解释单位的连续搬移:从实验室社会偏好与市场设计,转向复制、预注册、在线互动、巨型研究和模拟代理。第412号实验经济学面板选取20个能够追到作者、年份、资料与争议的转向,既追问理论怎样改写旧默认,也核对实验经济学的测量、比较与制度实践怎样回写研究对象。全块以“受控处理如何在真实制度、异质人群与可复制流程中识别行为机制”为中心量纲,特别保留零效应、反向效应、退出者和未被记录者,让不同学科的同题异名能够进入同一张账。

【第一幕】上一个十年 · 约 2006—2016

2006—2016年的共同动作,是把实验经济学从静态类型学推进到可比较的机制研究。研究者开始用跨国数据、自然实验、网络资料或历史边界检验旧命题,并发现“受控处理如何在真实制度、异质人群与可复制流程中识别行为机制”的方向取决于分母、时间与制度层级;实验经济学第一幕的八条由此奠定了后来转向所使用的证据语言。

甲、田野实验把环境带回因果识别Field Experiments

提出Harrison 与 List,2004年,《Field Experiments》,Journal of Economic Literature 42(4):1009–1055,DOI 10.1257/0022051043004577。 争议Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定外部有效性的只有处理是否嵌入真实对象、任务与制度

从田野实验研究的材料看,2004年前后,实验经济学仍普遍接受“实验室控制越严格,经济行为规律越可靠”这一默认。Harrison 与 List把“未接触、组织拒绝和执行者自行修改处理不进意向性结果解释”从清洗后的余数提升为解释对象;在田野实验把环境带回因果识别中,这一缺项决定了谁能进入全部分配处理者。

田野实验把环境带回因果识别的理论赌注不是相关性大小,而是因果次序:先有真实制度嵌入度,才有本条所描述的结果。只要“真实环境提高噪声并带来伦理与执行偏差,不能取代机制清晰的实验室”出现后在真实环境完成处理者相对全部分配处理者不变,主张就不能外推。

List(2008)用劳动力、慈善和商品市场现场实验说明,自然场景可提高行为真实性,但随机化、干预污染和样本选择仍需单独报告。就田野实验研究的材料边界而言,进入、退出与未登记对象必须分开留痕。田野实验研究的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。田野实验研究的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

核查田野实验研究时,截至2025年的更新并没有消除Galiani 与 Quistorff(2024)提出的“真实环境提高噪声并带来伦理与执行偏差,不能取代机制清晰的实验室”。研究应建立双重抽样框,补访未进入名册者,并公开进入概率,同时保留“未接触、组织拒绝和执行者自行修改处理不进意向性结果解释”;否则在真实环境完成处理者/全部分配处理者只在被选择样本内成立。

政策试验、企业合作与伦理审查最明显,大学实验室采用该思路时,需要为未接触、组织拒绝和执行者自行修改处理不进意向性结果解释设置字段,否则所谓改进只发生在被看见的人身上。 对实验室、在线实验平台和研究资助机构最直接的制度后果,是禁止把“未接触、组织拒绝和执行者自行修改处理不进意向性结果解释”当作清洗残余,并把在真实环境完成处理者、全部分配处理者与实施成本放在同一张表中。

在田野实验研究这条证据链上,其一接口以“上述分子—分母”为共同刻度,并明确“未接触、组织拒绝和执行者自行修改处理不进意向性结果解释”是否进入分母。把田野实验研究放到另见第 164 号第 3 条『集聚经济的因果识别』旁核验:先对齐对象、时间窗和责任人,再检查田野实验研究的核心判断在另一套分母中是否仍同向。

位置E|田野实验研究作环境条件 单因田野实验研究的核心决定项 预设〔01 谁进入分母〕田野实验研究沿用既定对象边界 量纲田野实验研究同向记录数/全部可核对记录数 失效漏掉现有账本没有为“未接触时,田野实验研究读数越高,真实覆盖反而越低 自曝田野实验研究(第1条):原材料未覆盖者需另表 空栏现有账本没有为“未接触 异名另见第 164 号第 3 条『集聚经济的因果识别』

乙、跨文化博弈推翻单一经济人Cross-Cultural Experimental Economics

提出Henrich 等,2005年,《Economic Man in Cross-Cultural Perspective》,Behavioral and Brain Sciences 28(6):795–815,DOI 10.1017/S0140525X05000142。 争议Voelkel 等,2024年,《Megastudy Testing 25 Treatments》,Science 386(6719):eadh4764,DOI 10.1126/science.adh4764。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定博弈行为的只有当地生产、市场整合与社会规范

核查决定博弈行为的判据时,实验经济学在这一题上的旧起点是“自利最大化和公平偏好参数在人类群体中近似相同”。2005年的Henrich 等将“拒绝参与、无法理解匿名和以实物而非现金交换者不进样本”带回资料表,说明遗漏会改变群体内行为差,并非扩大样本即可消除的随机误差。围绕决定博弈行为的判据,源行把原始命题、边界材料与更新状态分开登记。在决定博弈行为的判据这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。

跨文化博弈推翻单一经济人的理论赌注不是相关性大小,而是因果次序:先有制度经验进入博弈的程度,才有本条所描述的结果。只要“实验规则翻译、匿名含义和研究者关系可能改变行为,文化变量也不是单因”出现后群体间行为差相对群体内行为差不变,主张就不能外推。对决定博弈行为的判据而言,可被推翻的责任只落在决定博弈行为的只有当地生产、市场整合与社会规范;如果替代机制同样预测结果,这项解释就应撤回。

Henrich等(2005)在15个小规模社会开展最后通牒、公共品和独裁者实验,报价、拒绝与惩罚差异远超学生样本。就决定博弈行为的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定博弈行为的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

对决定博弈行为的判据做反向检验,Voelkel 等(2024)把争议落在“实验规则翻译、匿名含义和研究者关系可能改变行为,文化变量也不是单因”。这不是一句例行局限:当“实验规则翻译、匿名含义和研究者关系可能改变行为,文化变量也不是单因”出现时,制度经验进入博弈的程度可能从原因变成被选择结果。要使争论收敛,应建立双重抽样框,补访未进入名册者,并公开进入概率,并预先规定群体间行为差相对群体内行为差何种变化算支持、收缩或反号。

让群体间行为差/群体内行为差进入常规审计,并把拒绝参与、无法理解匿名和以实物而非现金交换者不进样本作为结果的一部分,而不是数据清洗后的残余。 对实验室、在线实验平台和研究资助机构最直接的制度后果,是禁止把“拒绝参与、无法理解匿名和以实物而非现金交换者不进样本”当作清洗残余,并把群体间行为差、群体内行为差与实施成本放在同一张表中。

把决定博弈行为的判据放到另见第 181 号第 3 条『市场装置:经济模型会参与制造它描述的市场』旁核验:先对齐对象、时间窗和责任人,再检查决定博弈行为的判据的核心判断在另一套分母中是否仍同向。

位置E|决定博弈行为的判据作环境条件 单因决定博弈行为的判据的核心决定项 预设〔01 谁进入分母〕决定博弈行为的判据沿用既定对象边界 量纲决定博弈行为的判据同向记录数/全部可核对记录数 失效漏掉现有账本没有为“拒绝参与时,决定博弈行为的判据读数越高,真实覆盖反而越低 自曝决定博弈行为的判据(第2条):原材料未覆盖者需另表 空栏现有账本没有为“拒绝参与 异名另见第 181 号第 3 条『市场装置:经济模型会参与制造它描述的市场』

丙、独裁者博弈效应依赖实验情境Dictator Game Context

提出Engel,2011年,《Dictator Games: A Meta Study》,Experimental Economics 14:583–610,DOI 10.1007/s10683-011-9283-7。 争议Zizzo,2010年,《Experimenter Demand Effects in Economic Experiments》,Experimental Economics 13:75–98,DOI 10.1007/s10683-009-9230-z。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定分配结果的只有产权、匿名、选项与受者身份如何被框定

在决定分配结果的判据这条证据链上,围绕独裁者博弈效应依赖实验情境,旧研究常把“给钱行为可以直接测量稳定的利他偏好”当作比较前提。Engel(2011)追问“拒绝游戏、误解产权和实验外补偿不进给予率”为何持续消失;若这种消失具有制度性,该转向的均值只是筛选后人群的均值。

本条拒绝“许多因素都重要”的安全结论,把解释权押在情境框架对给予的影响上。对决定分配结果的判据做反向检验,它预言“决定分配结果的只有产权、匿名、选项与受者身份如何被框定”;在“发表偏差与学生样本仍存在,实验给予也不等于长期公共责任”的案例中若读数保持同向,独裁者博弈效应依赖实验情境的单因排序便失去依据。

Engel的独裁者博弈元分析汇总616个处理、129篇论文和20,000余个观测,显示匿名、权利来源和受试者构成系统改变给予比例。就决定分配结果的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定分配结果的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

Zizzo(2010)把争议落在“发表偏差与学生样本仍存在,实验给予也不等于长期公共责任”。这不是一句例行局限:当“发表偏差与学生样本仍存在,实验给予也不等于长期公共责任”出现时,情境框架对给予的影响可能从原因变成被选择结果。要使争论收敛,应建立双重抽样框,补访未进入名册者,并公开进入概率,并预先规定实际给予额相对可支配总额何种变化算支持、收缩或反号。 资料核验还要求把Engel(2011)、Zizzo(2010)和Balafoutas、Celse、Karakostas 与 Umashev(2025)的证据角色分开:前者承担主证据,中者承担反例或边界,后者只更新证据状态;三者不再互相替代。

实践上的后果首先落在慈善匹配、组织奖励与社会偏好测量,当独裁者博弈效应依赖实验情境进入政府行为洞察团队的评估流程后,政策人员不能只报中心值,还要追踪实际给予额/可支配总额及其分母变化。把决定分配结果的判据放回原窗口,实施该转向时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“拒绝游戏、误解产权和实验外补偿不进给予率”、分母变更和失败路径,避免只优化可见成功。

就决定分配结果的判据的外推边界看,其一接口以“上述分子—分母”为共同刻度,并明确“拒绝游戏、误解产权和实验外补偿不进给予率”是否进入分母。把决定分配结果的判据放到另见第 612 号第 15 条『安全启动效应存在,但大小取决于测量与发表偏差』旁核验:先对齐对象、时间窗和责任人,再检查决定分配结果的判据的核心判断在另一套分母中是否仍同向。

位置S|决定分配结果的判据作结果量 单因决定分配结果的判据的核心决定项 预设〔01 谁进入分母〕决定分配结果的判据沿用既定对象边界 量纲决定分配结果的判据同向记录数/全部可核对记录数 失效漏掉现有账本没有为“拒绝游戏时,决定分配结果的判据读数越高,真实覆盖反而越低 自曝决定分配结果的判据(第3条):原材料未覆盖者需另表 空栏现有账本没有为“拒绝游戏 异名另见第 612 号第 15 条『安全启动效应存在,但大小取决于测量与发表偏差』

丁、惩罚的长期收益取决于重复互动Punishment and Cooperation

提出Gächter、Renner 与 Sefton,2008年,《The Long-Run Benefits of Punishment》,Science 322(5907):1510,DOI 10.1126/science.1164744。 争议Henrich 等,2005年,《Economic Man in Cross-Cultural Perspective》,Behavioral and Brain Sciences 28(6):795–815,DOI 10.1017/S0140525X05000142。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定净收益的只有互动是否重复到足以让合作收益覆盖惩罚成本

2008年的争论暴露了惩罚的长期收益取决于重复互动未说出的前提——惩罚搭便车者必然提高公共品效率。Gächter、Renner 与 Sefton用“退出、报复和被排除成员不进留存组福利”说明,研究对象在进入累计惩罚成本以前已经被资格、边界或记录规则塑形。

命题的锋刃在于把合作收益覆盖惩罚成本的时点置于第一因,并断言“决定净收益的只有互动是否重复到足以让合作收益覆盖惩罚成本”。若“反社会惩罚、权力不对称和现实报复会逆转结果”被触发后仍观察不到长期新增公共品与累计惩罚成本的相对变化,惩罚的长期收益取决于重复互动必须让位于替代机制。

Gächter、Renner与Sefton(2008)把公共品实验延长到50轮;惩罚前期有成本,但在足够长的重复互动中合作收益可覆盖成本。就决定净收益的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定净收益的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。决定净收益的判据的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对决定净收益的判据做反向检验,Henrich 等(2005)把争议落在“反社会惩罚、权力不对称和现实报复会逆转结果”。这不是一句例行局限:当“反社会惩罚、权力不对称和现实报复会逆转结果”出现时,合作收益覆盖惩罚成本的时点可能从原因变成被选择结果。要使争论收敛,应随机改变测量时点、公开度或评定者身份,估计观测回写,并预先规定长期新增公共品相对累计惩罚成本何种变化算支持、收缩或反号。

另一处常被忽略的是社区规则、团队治理与制裁设计,对市场设计与政策试验机构而言,真正要改的不是宣传语言,而是把退出、报复和被排除成员不进留存组福利从附注移入正式记录。 对实验室、在线实验平台和研究资助机构最直接的制度后果,是禁止把“退出、报复和被排除成员不进留存组福利”当作清洗残余,并把长期新增公共品、累计惩罚成本与实施成本放在同一张表中。

若其对象中“退出、报复和被排除成员不进留存组福利”进入分母后,长期新增公共品/累计惩罚成本不再同向,惩罚的长期收益取决于重复互动的外推边界即可被实证划出。把决定净收益的判据放回原窗口,其一接口以“这一比率”为共同刻度,并明确“退出、报复和被排除成员不进留存组福利”是否进入分母。

位置D|决定净收益的判据作生成路径 单因决定净收益的判据的核心决定项 预设〔01 谁进入分母〕决定净收益的判据沿用既定对象边界 量纲决定净收益的判据同向记录数/全部可核对记录数 失效漏掉现有账本没有为“退出时,决定净收益的判据读数越高,真实覆盖反而越低 自曝决定净收益的判据(第4条):原材料未覆盖者需另表 空栏现有账本没有为“退出 异名另见第 520 号第 13 条『平台数据不对称:研究对象由私有接口决定』

戊、市场设计实验连接规则与实施Experimental Market Design

提出Roth,2008年,《What Have We Learned from Market Design?》,Economic Journal 118(527):285–310,DOI 10.1111/j.1468-0297.2007.02121.x。 争议Harrison 与 List,2004年,《Field Experiments》,Journal of Economic Literature 42(4):1009–1055,DOI 10.1257/0022051043004577。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定机制可用性的只有参与者能否理解规则并在实际约束中稳定行动

把市场设计实实施放回原窗口,实验经济学在这一题上的旧起点是“理论机制满足均衡性质即可直接上线”。2008年的Roth将“未提交偏好、系统超时和因规则复杂退出者不进效率率”带回资料表,说明遗漏会改变全部参与者,并非扩大样本即可消除的随机误差。

命题的锋刃在于把机制在行为下的稳健性置于第一因,并断言“决定机制可用性的只有参与者能否理解规则并在实际约束中稳定行动”。若“实验室支付和规模与真实市场不同,成功机制仍需法律、技术和组织支持”被触发后仍观察不到遵循预期策略且获得可行结果者与全部参与者的相对变化,市场设计实验连接规则与实施必须让位于替代机制。

Roth(2008)以肾脏交换、住院医匹配和学校选择为案例,证明实验、理论和实施数据必须在真实制度约束中循环。就市场设计实实施的材料边界而言,进入、退出与未登记对象必须分开留痕。市场设计实实施的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。市场设计实实施的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

就市场设计实实施的外推边界看,Harrison 与 List(2004)把争议落在“实验室支付和规模与真实市场不同,成功机制仍需法律、技术和组织支持”。这不是一句例行局限:当“实验室支付和规模与真实市场不同,成功机制仍需法律、技术和组织支持”出现时,机制在行为下的稳健性可能从原因变成被选择结果。要使争论收敛,应随机改变测量时点、公开度或评定者身份,估计观测回写,并预先规定遵循预期策略且获得可行结果者相对全部参与者何种变化算支持、收缩或反号。

在实验室、在线实验平台和研究资助机构中,验收表不应只列平均结果,还要列“未提交偏好、系统超时和因规则复杂退出者不进效率率”的数量、占比和去向;遵循预期策略且获得可行结果者/全部参与者随后按地区、群体或机构分层复算。市场设计实实施的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

若其对象中“未提交偏好、系统超时和因规则复杂退出者不进效率率”进入分母后,上述分子—分母不再同向,市场设计实验连接规则与实施的外推边界即可被实证划出。围绕市场设计实实施,其一接口以“该复核口径”为共同刻度,并明确“未提交偏好、系统超时和因规则复杂退出者不进效率率”是否进入分母。

位置D|市场设计实实施作生成路径 单因市场设计实实施的核心决定项 预设〔01 谁进入分母〕市场设计实实施沿用既定对象边界 量纲市场设计实实施同向记录数/全部可核对记录数 失效漏掉现有账本没有为“未提交偏好时,市场设计实实施读数越高,真实覆盖反而越低 自曝市场设计实实施(第5条):原材料未覆盖者需另表 空栏现有账本没有为“未提交偏好 异名另见第 272 号第 11 条『市场势力回归:加价与集中会改变工资、投资和创新』

己、实验者需求效应必须进入设计Experimenter Demand Effects

提出Zizzo,2010年,《Experimenter Demand Effects in Economic Experiments》,Experimental Economics 13:75–98,DOI 10.1007/s10683-009-9230-z。 争议Hertwig 与 Ortmann,2001年,《Experimental Practices in Economics: A Methodological Challenge for Psychologists?》,Behavioral and Brain Sciences 24(3):383–403,DOI 10.1017/S0140525X01004181。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定行为偏移的只有他们如何推断研究者期待

就实验者需求效应议题的外推边界看,“受试者只对奖金和规则作反应”曾使实验者需求效应必须进入设计看起来可以直接比较。Zizzo在2010年改变了观察顺序:先记录“不愿报告猜测、怀疑欺骗和把研究者当权威者不进需求测量”,再计算未识别者行为差,把进入数据之前的制度选择纳入解释。

实验者需求效应必须进入设计不是因素清单,而是一项可以失败的主张:决定行为偏移的只有他们如何推断研究者期待。判决标准是受试者对期待的推断能否稳定改变识别研究目的者的行为差/未识别者行为差;“需求效应大小并非总是很大,掩饰目的又可能损害透明与伦理”下没有差异,就足以否定其决定性。

Zizzo(2010)综述实验者需求效应,区分受试者猜测目的、顺从和反抗;单纯隐瞒假设不能证明需求效应消失。就实验者需求效应议题的材料边界而言,进入、退出与未登记对象必须分开留痕。实验者需求效应议题的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。实验者需求效应议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

围绕实验者需求效应议题,Hertwig 与 Ortmann(2001)把争议落在“需求效应大小并非总是很大,掩饰目的又可能损害透明与伦理”。这不是一句例行局限:当“需求效应大小并非总是很大,掩饰目的又可能损害透明与伦理”出现时,受试者对期待的推断可能从原因变成被选择结果。要使争论收敛,应随机改变测量时点、公开度或评定者身份,估计观测回写,并预先规定识别研究目的者的行为差相对未识别者行为差何种变化算支持、收缩或反号。

方法上的延伸直指实验说明、事后询问与盲化程序,在在线受试平台的现实场景中,这一比率应与成本、覆盖和退出人数并列,而不能被一个总体平均替代。沿实验者需求效应议题的责任链,实施实验者需求效应必须进入设计时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“不愿报告猜测、怀疑欺骗和把研究者当权威者不进需求测量”、分母变更和失败路径,避免只优化可见成功。

复算实验者需求效应议题之前,若其对象中“不愿报告猜测、怀疑欺骗和把研究者当权威者不进需求测量”进入分母后,该复核口径不再同向,本项证据的外推边界即可被实证划出。按实验者需求效应议题的对象表,其一接口以“这一比率”为共同刻度,并明确“不愿报告猜测、怀疑欺骗和把研究者当权威者不进需求测量”是否进入分母。

位置D|实验者需求效应议题作生成路径 单因实验者需求效应议题的核心决定项 预设〔01 谁进入分母〕实验者需求效应议题沿用既定对象边界 量纲实验者需求效应议题同向记录数/全部可核对记录数 失效漏掉现有账本没有为“不愿报告猜测时,实验者需求效应议题读数越高,真实覆盖反而越低 自曝实验者需求效应议题(第6条):原材料未覆盖者需另表 空栏现有账本没有为“不愿报告猜测 异名另见第 531 号第 8 条『暗反应:失败实验不是垃圾,而是边界数据』

庚、经济学实验复制率需要量化Replicability of Economics Experiments

提出Camerer 等,2016年,《Evaluating Replicability of Laboratory Experiments in Economics》,Science 351(6280):1433–1436,DOI 10.1126/science.aaf0918。 争议Nosek、Ebersole、DeHaven 与 Mellor,2018年,《The Preregistration Revolution》,Proceedings of the National Academy of Sciences 115(11):2600–2606,DOI 10.1073/pnas.1708274114。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定证据可信度的只有独立团队在预设样本与分析下能否再现方向和精度

围绕决定证据机制,围绕经济学实验复制率需要量化,旧研究常把“顶级期刊实验结论默认可重复”当作比较前提。沿决定证据机制的责任链,Camerer 等(2016)追问“未发表复制、无法取得材料和操作失败不进复制率”为何持续消失;若这种消失具有制度性,该转向的均值只是筛选后人群的均值。

本条拒绝“许多因素都重要”的安全结论,把解释权押在独立复制的效应保留率上。复算决定证据机制之前,它预言“决定证据可信度的只有独立团队在预设样本与分析下能否再现方向和精度”;在“复制项目选择著名、可实施研究,原始设计与新样本环境仍有差异”的案例中若读数保持同向,经济学实验复制率需要量化的单因排序便失去依据。

Camerer等(2016)复制18项经济学实验,11项在同方向上达到显著,复制效应平均约为原效应的66%。就决定证据机制的材料边界而言,进入、退出与未登记对象必须分开留痕。决定证据机制的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

Nosek、Ebersole、DeHaven 与 Mellor(2018)把争议落在“复制项目选择著名、可实施研究,原始设计与新样本环境仍有差异”。这不是一句例行局限:当“复制项目选择著名、可实施研究,原始设计与新样本环境仍有差异”出现时,独立复制的效应保留率可能从原因变成被选择结果。要使争论收敛,应分离实施者、参与者和盲法评定者,并预先规定复制效应量相对原始效应量何种变化算支持、收缩或反号。

预注册、材料共享与期刊政策最明显,政府行为洞察团队采用该思路时,需要为未发表复制、无法取得材料和操作失败不进复制率设置字段,否则所谓改进只发生在被看见的人身上。按决定证据机制的对象表,对实验室、在线实验平台和研究资助机构最直接的制度后果,是禁止把“未发表复制、无法取得材料和操作失败不进复制率”当作清洗残余,并把复制效应量、原始效应量与实施成本放在同一张表中。就决定证据机制的遗漏记录而言,复核表还要标明退出日期、原始责任人和未纳入理由。

对照决定证据机制的主源,双方先统一复制效应量与原始效应量,再检验“复制项目选择著名、可实施研究,原始设计与新样本环境仍有差异”是否造成符号分叉;分叉稳定才构成新问题。 这一接口以“复制效应量/原始效应量”为共同刻度,并明确“未发表复制、无法取得材料和操作失败不进复制率”是否进入分母。

位置E|决定证据机制作环境条件 单因决定证据机制的核心决定项 预设〔01 谁进入分母〕决定证据机制沿用既定对象边界 量纲决定证据机制同向记录数/全部可核对记录数 失效漏掉现有账本没有为“未发表复制时,决定证据机制读数越高,真实覆盖反而越低 自曝决定证据机制(第7条):原材料未覆盖者需另表 空栏现有账本没有为“未发表复制 异名另见第 164 号第 9 条『邻里效应的实验证据』

辛、跨学科高影响实验同样需要复制Replicability of Social Science Experiments

提出Camerer 等,2018年,《Evaluating the Replicability of Social Science Experiments in Nature and Science》,Nature Human Behaviour 2:637–644,DOI 10.1038/s41562-018-0399-z。 争议Camerer 等,2016年,《Evaluating Replicability of Laboratory Experiments in Economics》,Science 351(6280):1433–1436,DOI 10.1126/science.aaf0918。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定主张稳定性的只有跨样本复制后的效应分布

沿决定主张机制的责任链,此前关于跨学科高影响实验同样需要复制的模型依赖“高影响综合期刊提供足够质量筛选”这一简化。复算决定主张机制之前,Camerer 等(2018)证明“没有可行复制路径、材料受限和多结果选择不进简单成功率”并非边缘案例;它进入分母后,该转向原有的分类、排名或平均关系都需重算。

跨学科高影响实验同样需要复制不是因素清单,而是一项可以失败的主张:决定主张稳定性的只有跨样本复制后的效应分布。判决标准是效应量保留而非显著复制能否稳定改变复制效应量/原始效应量;“样本和情境变化可能是真实异质性,显著性二分也过于粗糙”下没有差异,就足以否定其决定性。

Camerer等(2018)复制21项发表于Nature和Science的社会科学实验,13项达到显著复制,平均效应约为原始效应的一半。就决定主张机制的材料边界而言,进入、退出与未登记对象必须分开留痕。决定主张机制的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

按决定主张机制的对象表,反对材料来自Camerer 等(2016)而非另一个领域的泛泛批评,其核心是“样本和情境变化可能是真实异质性,显著性二分也过于粗糙”。本条的可证伪设计是:在“样本和情境变化可能是真实异质性,显著性二分也过于粗糙”条件内外分别报告该复核口径,采用分离实施者、参与者和盲法评定者;若方向不变,反号假说失败。

让上述分子—分母进入常规审计,并把没有可行复制路径、材料受限和多结果选择不进简单成功率作为结果的一部分,而不是数据清洗后的残余。对照决定主张机制的主源,对实验室、在线实验平台和研究资助机构最直接的制度后果,是禁止把“没有可行复制路径、材料受限和多结果选择不进简单成功率”当作清洗残余,并把复制效应量、原始效应量与实施成本放在同一张表中。

在决定主张机制的实施账本里,双方先统一复制效应量与原始效应量,再检验“样本和情境变化可能是真实异质性,显著性二分也过于粗糙”是否造成符号分叉;分叉稳定才构成新问题。从决定主张机制的材料看,其一接口以“这一比率”为共同刻度,并明确“没有可行复制路径、材料受限和多结果选择不进简单成功率”是否进入分母。把决定主张机制放到另见第 141 号第 4 条『新思想 4 · 人格可以被干预改变 —— 二百余项研究给出的效应量』旁核验:先对齐对象、时间窗和责任人,再检查决定主张机制的核心判断在另一套分母中是否仍同向。

位置S|决定主张机制作结果量 单因决定主张机制的核心决定项 预设〔01 谁进入分母〕决定主张机制沿用既定对象边界 量纲决定主张机制同向记录数/全部可核对记录数 失效漏掉现有账本没有为“没有可行复制时,决定主张机制读数越高,真实覆盖反而越低 自曝决定主张机制(第8条):原材料未覆盖者需另表 空栏现有账本没有为“没有可行复制 异名另见第 141 号第 4 条『新思想 4 · 人格可以被干预改变 —— 二百余项研究给出的效应量』
【第二幕】这十年 · 约 2016—2026

2016年之后,危机、平台化与开放数据把实验经济学推入更高频也更脆弱的测量环境。研究一面获得更大样本和更细行为轨迹,另一面不得不处理算法选择、民主回退、组织回写与外部有效性。实验经济学第二幕的十二条因此把反号条件、治理后果与可复现边界置于中心。

一、预注册把分析自由度变成可见对象Preregistration

提出Nosek、Ebersole、DeHaven 与 Mellor,2018年,《The Preregistration Revolution》,Proceedings of the National Academy of Sciences 115(11):2600–2606,DOI 10.1073/pnas.1708274114。 争议Camerer 等,2016年,《Evaluating Replicability of Laboratory Experiments in Economics》,Science 351(6280):1433–1436,DOI 10.1126/science.aaf0918。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定可信度的只有关键假设、样本、结局与分析是否在观察结果前固定

复算预注册研究之前,围绕预注册把分析自由度变成可见对象,旧研究常把“研究计划在数据分析后写清也能保证透明”当作比较前提。Nosek、Ebersole、DeHaven 与 Mellor(2018)追问“未登记探索、临时排除和计划变更理由不进论文摘要”为何持续消失;若这种消失具有制度性,该转向的均值只是筛选后人群的均值。

本条拒绝“许多因素都重要”的安全结论,把解释权押在预先锁定的分析覆盖率上。按预注册研究的对象表,它预言“决定可信度的只有关键假设、样本、结局与分析是否在观察结果前固定”;在“低质量预注册可过度模糊或被频繁偏离,固定计划也不能替代好理论”的案例中若读数保持同向,预注册把分析自由度变成可见对象的单因排序便失去依据。

Nosek等(2018)把预注册分成研究问题、样本、结局和分析计划;注册时间戳使确认性与探索性分析可以区分。就预注册研究的材料边界而言,进入、退出与未登记对象必须分开留痕。预注册研究的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

对照预注册研究的主源,反对材料来自Camerer 等(2016)而非另一个领域的泛泛批评,其核心是“低质量预注册可过度模糊或被频繁偏离,固定计划也不能替代好理论”。本条的可证伪设计是:在“低质量预注册可过度模糊或被频繁偏离,固定计划也不能替代好理论”条件内外分别报告按预注册执行的主要分析/全部主要分析,采用分离实施者、参与者和盲法评定者;若方向不变,反号假说失败。

实践上的后果首先落在期刊注册报告、实验平台与研究训练,当预注册把分析自由度变成可见对象进入大学实验室的评估流程后,政策人员不能只报中心值,还要追踪这一比率及其分母变化。在预注册研究的实施账本里,实施该转向时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“未登记探索、临时排除和计划变更理由不进论文摘要”、分母变更和失败路径,避免只优化可见成功。预注册研究的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

从预注册研究的材料看,其一接口以“该复核口径”为共同刻度,并明确“未登记探索、临时排除和计划变更理由不进论文摘要”是否进入分母。把预注册研究放到另见第 536 号第 12 条『Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言』旁核验:先对齐对象、时间窗和责任人,再检查预注册研究的核心判断在另一套分母中是否仍同向。

位置S|预注册研究作结果量 单因预注册研究的核心决定项 预设〔01 谁进入分母〕预注册研究沿用既定对象边界 量纲预注册研究同向记录数/全部可核对记录数 失效漏掉现有账本没有为“未登记探索时,预注册研究读数越高,真实覆盖反而越低 自曝预注册研究(第9条):原材料未覆盖者需另表 空栏现有账本没有为“未登记探索 异名另见第 536 号第 12 条『Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言』

二、在线互动实验突破共时实验室限制Interactive Online Experiments

提出Arechar、Gächter 与 Molleman,2018年,《Conducting Interactive Experiments Online》,Experimental Economics 21:99–131,DOI 10.1007/s10683-017-9527-2。 争议Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定在线互动质量的只有匹配、等待和掉线机制能否被设计

按决定在线机制的对象表,此前关于在线互动实验突破共时实验室限制的模型依赖“在线实验只能做独立问卷,无法可靠运行互动博弈”这一简化。Arechar、Gächter 与 Molleman(2018)证明“等待超时、网络断开和被机器人检测排除者不进完成样本”并非边缘案例;它进入分母后,该转向原有的分类、排名或平均关系都需重算。

在线互动实验突破共时实验室限制采用明确的单因立场:决定在线互动质量的只有匹配、等待和掉线机制能否被设计。决定方向的被限定为有效互动完成率;若“设备差异、机器人和多账号会影响数据,掉线也常与行为相关”出现,而完成全部互动轮次者/被随机匹配者仍不发生预期变化,这项命题就应撤回。

Arechar、Gächter与Molleman(2018)在网络平台实现实时多人互动,并用等待、重连和掉线规则检验在线实验是否保持实验室结构。就决定在线机制的材料边界而言,进入、退出与未登记对象必须分开留痕。决定在线机制的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。决定在线机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对照决定在线机制的主源,反对材料来自Galiani 与 Quistorff(2024)而非另一个领域的泛泛批评,其核心是“设备差异、机器人和多账号会影响数据,掉线也常与行为相关”。本条的可证伪设计是:在“设备差异、机器人和多账号会影响数据,掉线也常与行为相关”条件内外分别报告该复核口径,采用保存代码、工艺和版本,由独立团队异地重做;若方向不变,反号假说失败。

另一处常被忽略的是全球受试池、快速复制与平台质量控制,对在线受试平台而言,真正要改的不是宣传语言,而是把等待超时、网络断开和被机器人检测排除者不进完成样本从附注移入正式记录。在决定在线机制的实施账本里,实施在线互动实验突破共时实验室限制时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“等待超时、网络断开和被机器人检测排除者不进完成样本”、分母变更和失败路径,避免只优化可见成功。

从决定在线机制的材料看,若其对象中“等待超时、网络断开和被机器人检测排除者不进完成样本”进入分母后,该复核口径不再同向,本项证据的外推边界即可被实证划出。核查决定在线机制时,其一接口以“这一比率”为共同刻度,并明确“等待超时、网络断开和被机器人检测排除者不进完成样本”是否进入分母。

位置D|决定在线机制作生成路径 单因决定在线机制的核心决定项 预设〔01 谁进入分母〕决定在线机制沿用既定对象边界 量纲决定在线机制同向记录数/全部可核对记录数 失效漏掉现有账本没有为“等待超时时,决定在线机制读数越高,真实覆盖反而越低 自曝决定在线机制(第10条):原材料未覆盖者需另表 空栏现有账本没有为“等待超时 异名另见第 258 号第 5 条『在线实验把产品变化变成持续因果基础设施』

三、专家预测本身可以被实验检验Forecasting Experimental Results

提出DellaVigna 与 Pope,2018年,《What Motivates Effort? Evidence and Expert Forecasts》,Review of Economic Studies 85(2):1029–1069,DOI 10.1093/restud/rdx033。 争议Harrison 与 List,2004年,《Field Experiments》,Journal of Economic Literature 42(4):1009–1055,DOI 10.1257/0022051043004577。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定知识校准的只有预测是否在结果揭晓前量化并评分

对照专家预测本身可实证检验的主源,围绕专家预测本身可以被实验检验,旧研究常把“领域专家能够凭理论准确预测实验效应”当作比较前提。在专家预测本身可实证检验的实施账本里,DellaVigna 与 Pope(2018)追问“不愿预测、给宽区间和只报方向者不进精确度排名”为何持续消失;若这种消失具有制度性,该转向的均值只是筛选后人群的均值。

本条拒绝“许多因素都重要”的安全结论,把解释权押在预测校准度上。从专家预测本身可实证检验的材料看,它预言“决定知识校准的只有预测是否在结果揭晓前量化并评分”;在“预测题目和激励会影响校准,熟悉特定文献者可能占优”的案例中若读数保持同向,专家预测本身可以被实验检验的单因排序便失去依据。

DellaVigna与Pope(2018)先收集专家对不同激励处理的量化预测,再与在线努力实验比较;预测误差本身成为可评分数据。就专家预测本身可实证检验的材料边界而言,进入、退出与未登记对象必须分开留痕。专家预测本身可实证检验的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。专家预测本身可实证检验的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

核查专家预测本身可实证检验时,反对材料来自Harrison 与 List(2004)而非另一个领域的泛泛批评,其核心是“预测题目和激励会影响校准,熟悉特定文献者可能占优”。本条的可证伪设计是:在“预测题目和激励会影响校准,熟悉特定文献者可能占优”条件内外分别报告落入预测区间的真实效应/全部预测效应,采用保存代码、工艺和版本,由独立团队异地重做;若方向不变,反号假说失败。

专家预测本身可以被实验检验还改变了研究优先级、众包预测与理论评估的操作顺序:先定义分母和失效条件,再决定是否扩大项目,政府行为洞察团队若倒过来做,规模会放大原有偏差。在专家预测本身可实证检验这条证据链上,其样才能区分真实改善、选择退出和统计边界收窄。

双方先统一落入预测区间的真实效应与全部预测效应,再检验“预测题目和激励会影响校准,熟悉特定文献者可能占优”是否造成符号分叉;分叉稳定才构成新问题。对专家预测本身可实证检验做反向检验,其一接口以“上述分子—分母”为共同刻度,并明确“不愿预测、给宽区间和只报方向者不进精确度排名”是否进入分母。

位置S|专家预测本身可实证检验作结果量 单因专家预测本身可实证检验的核心决定项 预设〔01 谁进入分母〕专家预测本身可实证检验沿用既定对象边界 量纲专家预测本身可实证检验同向记录数/全部可核对记录数 失效漏掉现有账本没有为“不愿预测时,专家预测本身可实证检验读数越高,真实覆盖反而越低 自曝专家预测本身可实证检验(第11条):原材料未覆盖者需另表 空栏现有账本没有为“不愿预测 异名另见第 207 号第 8 条『不稳定预测把专家预警改写为可评分概率』

四、巨型研究让干预同场竞赛Megastudies

提出Milkman 等,2021年,《A Megastudy of Text-Based Nudges Encouraging Patients to Get Vaccinated》,Nature 600:478–483,DOI 10.1038/s41586-021-04128-4。 争议Voelkel 等,2024年,《Megastudy Testing 25 Treatments》,Science 386(6719):eadh4764,DOI 10.1126/science.adh4764。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定优胜判断的只有干预是否共享受试池、结局、时点与分析规则

在决定优胜判断的判据的实施账本里,此前关于巨型研究让干预同场竞赛的模型依赖“不同团队各做一项干预后可直接比较论文效应量”这一简化。从决定优胜判断的判据的材料看,Milkman 等(2021)证明“消息未送达、换号和平台外同时受干预者不进接触率”并非边缘案例;它进入分母后,该转向原有的分类、排名或平均关系都需重算。

对巨型研究让干预同场竞赛而言,共同基准下的净效果被指定为唯一决定项,其余变量只解释幅度。核查决定优胜判断的判据时,其个排他性可由相对共同对照的新增行为/全部被分配干预者检验;“同一平台和短期结局限制外推,优胜差异可能小于实施成本差”若不改变符号,就构成反证。

Milkman等(2021)在同一医疗系统对约689,000名患者测试19种短信干预;最有效的信息强调疫苗已“为你保留”。就决定优胜判断的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定优胜判断的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

在决定优胜判断的判据这条证据链上,Voelkel 等(2024)把争议落在“同一平台和短期结局限制外推,优胜差异可能小于实施成本差”。这不是一句例行局限:当“同一平台和短期结局限制外推,优胜差异可能小于实施成本差”出现时,共同基准下的净效果可能从原因变成被选择结果。要使争论收敛,应保存代码、工艺和版本,由独立团队异地重做,并预先规定相对共同对照的新增行为相对全部被分配干预者何种变化算支持、收缩或反号。

方法上的延伸直指公共卫生、税收遵从与行为政策采购,在市场设计与政策试验机构的现实场景中,这一比率应与成本、覆盖和退出人数并列,而不能被一个总体平均替代。对决定优胜判断的判据做反向检验,实施巨型研究让干预同场竞赛时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“消息未送达、换号和平台外同时受干预者不进接触率”、分母变更和失败路径,避免只优化可见成功。

把决定优胜判断的判据放回原窗口,若其对象中“消息未送达、换号和平台外同时受干预者不进接触率”进入分母后,该复核口径不再同向,本项证据的外推边界即可被实证划出。就决定优胜判断的判据的外推边界看,其一接口以“这一比率”为共同刻度,并明确“消息未送达、换号和平台外同时受干预者不进接触率”是否进入分母。

位置E|决定优胜判断的判据作环境条件 单因决定优胜判断的判据的核心决定项 预设〔01 谁进入分母〕决定优胜判断的判据沿用既定对象边界 量纲决定优胜判断的判据同向记录数/全部可核对记录数 失效若决定优胜判断的判据可由替代机制重现,单因解释撤回 自曝决定优胜判断的判据(第12条):原材料未覆盖者需另表 空栏现有账本没有为“消息未送达 异名另见第 141 号第 4 条『新思想 4 · 人格可以被干预改变 —— 二百余项研究给出的效应量』

五、外部有效性可被分解与重加权External Validity in Practice

提出Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。 争议Harrison 与 List,2004年,《Field Experiments》,Journal of Economic Literature 42(4):1009–1055,DOI 10.1257/0022051043004577。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定外推的只有处理异质性与样本进入机制能否被观测

从外部有效性重加权的材料看,实验经济学在这一题上的旧起点是“随机实验内部有效就能自然外推目标人群”。2024年的Galiani 与 Quistorff将“未被招募、拒绝参与和政策不覆盖者不进实验分母”带回资料表,说明遗漏会改变原始实验样本量,并非扩大样本即可消除的随机误差。

外部有效性可被分解与重加权采用明确的单因立场:决定外推的只有处理异质性与样本进入机制能否被观测。决定方向的被限定为样本到目标总体的可交换性;若“关键效应修饰因素常未测,目标总体也可能在实验后变化”出现,而重加权后有效样本量/原始实验样本量仍不发生预期变化,这项命题就应撤回。

Galiani与Quistorff(2024)把外部有效性分解为样本进入、处理异质性和目标总体权重,要求在目标样本上重新加权。就外部有效性重加权的材料边界而言,进入、退出与未登记对象必须分开留痕。外部有效性重加权的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。外部有效性重加权的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

外部有效性可被分解与重加权的边界由Harrison 与 List(2004)所揭示的“关键效应修饰因素常未测,目标总体也可能在实验后变化”限定。核查外部有效性重加权时,当前争论缺的不是更多概念,而是同时测量局部收益与系统外部性:把“关键效应修饰因素常未测,目标总体也可能在实验后变化”变成事前分层,并公布该层样本量、区间和分母变化。

政策扩展、目标总体登记与多站点试验最明显,大学实验室采用该思路时,需要为未被招募、拒绝参与和政策不覆盖者不进实验分母设置字段,否则所谓改进只发生在被看见的人身上。 本轮把这一延伸落实到实验室、在线实验平台和研究资助机构:新增“未被招募、拒绝参与和政策不覆盖者不进实验分母”字段,并同时保存重加权后有效样本量与原始实验样本量的原始口径。在外部有效性重加权这条证据链上,其样才能区分真实改善、选择退出和统计边界收窄。

双方先统一重加权后有效样本量与原始实验样本量,再检验“关键效应修饰因素常未测,目标总体也可能在实验后变化”是否造成符号分叉;分叉稳定才构成新问题。对外部有效性重加权做反向检验,其一接口以“上述分子—分母”为共同刻度,并明确“未被招募、拒绝参与和政策不覆盖者不进实验分母”是否进入分母。

位置D|外部有效性重加权作生成路径 单因外部有效性重加权的核心决定项 预设〔01 谁进入分母〕外部有效性重加权沿用既定对象边界 量纲外部有效性重加权同向记录数/全部可核对记录数 失效若外部有效性重加权可由替代机制重现,单因解释撤回 自曝外部有效性重加权(第13条):原材料未覆盖者需另表 空栏现有账本没有为“未被招募 异名另见第 257 号第 16 条『可迁移性把“样本内无偏”与“目标人群有效”分开』

六、反民主态度干预具有结局特异性Megastudy of Democratic Attitudes

提出Voelkel 等,2024年,《Megastudy Testing 25 Treatments》,Science 386(6719):eadh4764,DOI 10.1126/science.adh4764。 争议Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定干预价值的只有它能否对多个民主结局分别产生稳定效果

核查决定干预价值的判据时,2024年前后,实验经济学仍普遍接受“降低党派敌意会自动降低反民主和暴力倾向”这一默认。Voelkel 等把“只在一个指标有效、长期失访和真实行为未测者不进“成功”标签”从清洗后的余数提升为解释对象;在反民主态度干预具有结局特异性中,这一缺项决定了谁能进入全部显著干预。围绕决定干预价值的判据,源行把原始命题、边界材料与更新状态分开登记。在决定干预价值的判据这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。

对反民主态度干预具有结局特异性而言,跨结局有效性被指定为唯一决定项,其余变量只解释幅度。对决定干预价值的判据做反向检验,其个排他性可由改善至少两个独立结局的干预/全部显著干预检验;“在线短期读数不等于真实政治行为,事件时点也会改变基线”若不改变符号,就构成反证。

Voelkel等(2024)同场测试25种干预、超过3万名参与者;对党派厌恶有效的措施不一定改善反民主态度。就决定干预价值的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定干预价值的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。决定干预价值的判据的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

把决定干预价值的判据放回原窗口,Galiani 与 Quistorff(2024)把争议落在“在线短期读数不等于真实政治行为,事件时点也会改变基线”。这不是一句例行局限:当“在线短期读数不等于真实政治行为,事件时点也会改变基线”出现时,跨结局有效性可能从原因变成被选择结果。要使争论收敛,应同时测量局部收益与系统外部性,并预先规定改善至少两个独立结局的干预相对全部显著干预何种变化算支持、收缩或反号。

让这一比率进入常规审计,并把只在一个指标有效、长期失访和真实行为未测者不进“成功”标签作为结果的一部分,而不是数据清洗后的残余。 实施反民主态度干预具有结局特异性时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“只在一个指标有效、长期失访和真实行为未测者不进“成功”标签”、分母变更和失败路径,避免只优化可见成功。

把决定干预价值的判据放到另见第 308 号第 19 条『代理变量切换实验:短期读数可服务长期效应,但要校正』旁核验:先对齐对象、时间窗和责任人,再检查决定干预价值的判据的核心判断在另一套分母中是否仍同向。

位置D|决定干预价值的判据作生成路径 单因决定干预价值的判据的核心决定项 预设〔01 谁进入分母〕决定干预价值的判据沿用既定对象边界 量纲决定干预价值的判据同向记录数/全部可核对记录数 失效若决定干预价值的判据可由替代机制重现,单因解释撤回 自曝决定干预价值的判据(第14条):原材料未覆盖者需另表 空栏现有账本没有为“只在一个指标 异名另见第 308 号第 19 条『代理变量切换实验:短期读数可服务长期效应,但要校正』

七、复制激励会改变研究者行为Incentives and Replication

提出Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。 争议Camerer 等,2016年,《Evaluating Replicability of Laboratory Experiments in Economics》,Science 351(6280):1433–1436,DOI 10.1126/science.aaf0918。 最新Nosek、Ebersole、DeHaven 与 Mellor,2018年,《The Preregistration Revolution》,Proceedings of the National Academy of Sciences 115(11):2600–2606,DOI 10.1073/pnas.1708274114。 关键决定复制质量的只有奖励是否覆盖精确度、材料共享和负结果

在决定复制质量的判据这条证据链上,围绕复制激励会改变研究者行为,旧研究常把“研究者只需被要求透明就会自然选择稳健设计”当作比较前提。对决定复制质量的判据做反向检验,Camerer 等(2016)追问“未发表失败、无职业回报的清理工作和数据维护不进产出评价”为何持续消失;若这种消失具有制度性,该转向的均值只是筛选后人群的均值。

复制激励会改变研究者行为不是因素清单,而是一项可以失败的主张:决定复制质量的只有奖励是否覆盖精确度、材料共享和负结果。判决标准是稳健性奖励占比能否稳定改变用于复制与验证的奖励/研究总奖励;“激励可能诱导迎合评分规则,长期学术职业回报仍由发表主导”下没有差异,就足以否定其决定性。

开放科学激励综述比较预注册、材料共享、复制资助和发表规则,证据是多项制度改革而非一个平均处理效应。就决定复制质量的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定复制质量的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。决定复制质量的判据的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

复制激励会改变研究者行为的边界由Camerer 等(2016)所揭示的“激励可能诱导迎合评分规则,长期学术职业回报仍由发表主导”限定。把决定复制质量的判据放回原窗口,当前争论缺的不是更多概念,而是同时测量局部收益与系统外部性:把“激励可能诱导迎合评分规则,长期学术职业回报仍由发表主导”变成事前分层,并公布该层样本量、区间和分母变化。

实践上的后果首先落在资助合同、期刊奖励与团队评价,当上述机制进入政府行为洞察团队的评估流程后,政策人员不能只报中心值,还要追踪这一比率及其分母变化。 实施本项证据时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“未发表失败、无职业回报的清理工作和数据维护不进产出评价”、分母变更和失败路径,避免只优化可见成功。

就决定复制质量的判据的外推边界看,统一分母后仍相反,才需要另立解释。把决定复制质量的判据放到另见第 196 号第 4 条『新思想 4 · 液态新闻业 —— 职业稳定性的消失是结构性的』旁核验:先对齐对象、时间窗和责任人,再检查决定复制质量的判据的核心判断在另一套分母中是否仍同向。

位置S|决定复制质量的判据作结果量 单因决定复制质量的判据的核心决定项 预设〔01 谁进入分母〕决定复制质量的判据沿用既定对象边界 量纲决定复制质量的判据同向记录数/全部可核对记录数 失效若决定复制质量的判据可由替代机制重现,单因解释撤回 自曝决定复制质量的判据(第15条):原材料未覆盖者需另表 空栏现有账本没有为“未发表失败 异名另见第 196 号第 4 条『新思想 4 · 液态新闻业 —— 职业稳定性的消失是结构性的』

八、欺骗禁忌是一种实验公共品No-Deception Norm

提出Hertwig 与 Ortmann,2001年,《Experimental Practices in Economics: A Methodological Challenge for Psychologists?》,Behavioral and Brain Sciences 24(3):383–403,DOI 10.1017/S0140525X01004181。 争议Zizzo,2010年,《Experimenter Demand Effects in Economic Experiments》,Experimental Economics 13:75–98,DOI 10.1007/s10683-009-9230-z。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定实验室可信度的只有受试者能否相信未来说明

对决定实验机制做反向检验,围绕欺骗禁忌是一种实验公共品,旧研究常把“是否允许欺骗只影响单次实验伦理”当作比较前提。把决定实验机制放回原窗口,Hertwig 与 Ortmann(2001)追问“怀疑却未表达、参加多学科实验和从平台外招募者不进信任测量”为何持续消失;若这种消失具有制度性,该转向的均值只是筛选后人群的均值。

本条拒绝“许多因素都重要”的安全结论,把解释权押在说明可信度的跨实验外部性上。就决定实验机制的外推边界看,它预言“决定实验室可信度的只有受试者能否相信未来说明”;在“过度严格也限制研究某些信息与策略行为,心理学使用受控欺骗提供反例”的案例中若读数保持同向,欺骗禁忌是一种实验公共品的单因排序便失去依据。

Hertwig与Ortmann(2001)比较经济学与心理学实验规范,认为欺骗会污染未来受试者对说明的信任,是跨实验的公共品问题。就决定实验机制的材料边界而言,进入、退出与未登记对象必须分开留痕。决定实验机制的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。决定实验机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

反对材料来自Zizzo(2010)而非另一个领域的泛泛批评,其核心是“过度严格也限制研究某些信息与策略行为,心理学使用受控欺骗提供反例”。围绕决定实验机制,本条的可证伪设计是:在“过度严格也限制研究某些信息与策略行为,心理学使用受控欺骗提供反例”条件内外分别报告相信实验说明的参与者/全部受试池成员,采用将阴性结果和失败样本纳入注册报告;若方向不变,反号假说失败。

本轮把这一延伸落实到实验室、在线实验平台和研究资助机构:新增“怀疑却未表达、参加多学科实验和从平台外招募者不进信任测量”字段,并同时保存相信实验说明的参与者与全部受试池成员的原始口径。沿决定实验机制的责任链,其样才能区分真实改善、选择退出和统计边界收窄。决定实验机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

把决定实验机制放到另见第 138 号第 19 条『新思想 19 · 多实验室联合体 —— 婴儿研究把「一个实验室一个结论」这件事改掉了』旁核验:先对齐对象、时间窗和责任人,再检查决定实验机制的核心判断在另一套分母中是否仍同向。

位置E|决定实验机制作环境条件 单因决定实验机制的核心决定项 预设〔01 谁进入分母〕决定实验机制沿用既定对象边界 量纲决定实验机制同向记录数/全部可核对记录数 失效若决定实验机制可由替代机制重现,单因解释撤回 自曝决定实验机制(第16条):原材料未覆盖者需另表 空栏现有账本没有为“怀疑 异名另见第 138 号第 19 条『新思想 19 · 多实验室联合体 —— 婴儿研究把「一个实验室一个结论」这件事改掉了』

九、动态网络实验让关系内生化Dynamic Network Experiments

提出Gächter、Renner 与 Sefton,2008年,《The Long-Run Benefits of Punishment》,Science 322(5907):1510,DOI 10.1126/science.1164744。 争议Henrich 等,2005年,《Economic Man in Cross-Cultural Perspective》,Behavioral and Brain Sciences 28(6):795–815,DOI 10.1017/S0140525X05000142。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定合作演化的只有参与者能否选择、断开和重建关系

把决定合作演化的判据放回原窗口,“互动网络是给定背景,只影响行为传播”曾使动态网络实验让关系内生化看起来可以直接比较。Gächter、Renner 与 Sefton在2008年改变了观察顺序:先记录“未形成连接、沉默退出和平台禁止重连者不进网络演化”,再计算全部连边变化,把进入数据之前的制度选择纳入解释。

本条拒绝“许多因素都重要”的安全结论,把解释权押在关系重连速度上。就决定合作演化的判据的外推边界看,它预言“决定合作演化的只有参与者能否选择、断开和重建关系”;在“实验网络规模小且关系代价简化,现实身份与机构规则更复杂”的案例中若读数保持同向,动态网络实验让关系内生化的单因排序便失去依据。

动态网络实验让参与者选择或切断关系,记录节点度、合作和惩罚随轮次共同变化,关系不再是外生固定矩阵。就决定合作演化的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定合作演化的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。决定合作演化的判据的结构读数拆成3项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

围绕决定合作演化的判据,反对材料来自Henrich 等(2005)而非另一个领域的泛泛批评,其核心是“实验网络规模小且关系代价简化,现实身份与机构规则更复杂”。沿决定合作演化的判据的责任链,本条的可证伪设计是:在“实验网络规模小且关系代价简化,现实身份与机构规则更复杂”条件内外分别报告因行为差异发生的连边变化/全部连边变化,采用将阴性结果和失败样本纳入注册报告;若方向不变,反号假说失败。

动态网络实验让关系内生化还改变了团队组建、社区治理与平台匹配的操作顺序:先定义分母和失效条件,再决定是否扩大项目,大学实验室若倒过来做,规模会放大原有偏差。 在实验室、在线实验平台和研究资助机构中,验收表不应只列平均结果,还要列“未形成连接、沉默退出和平台禁止重连者不进网络演化”的数量、占比和去向;这一比率随后按地区、群体或机构分层复算。

复算决定合作演化的判据之前,若其对象中“未形成连接、沉默退出和平台禁止重连者不进网络演化”进入分母后,该复核口径不再同向,本项证据的外推边界即可被实证划出。按决定合作演化的判据的对象表,其一接口以“这一比率”为共同刻度,并明确“未形成连接、沉默退出和平台禁止重连者不进网络演化”是否进入分母。

位置E|决定合作演化的判据作环境条件 单因决定合作演化的判据的核心决定项 预设〔01 谁进入分母〕决定合作演化的判据沿用既定对象边界 量纲决定合作演化的判据同向记录数/全部可核对记录数 失效若决定合作演化的判据可由替代机制重现,单因解释撤回 自曝决定合作演化的判据(第17条):原材料未覆盖者需另表 空栏现有账本没有为“未形成连接 异名另见第 272 号第 9 条『平台资本主义:数据、网络效应与基础设施形成新租金』

十、大语言模型只能作为模拟代理而非替代人类样本LLMs as Simulated Agents

提出Horton,2023年,《Large Language Models as Simulated Economic Agents》,NBER Working Paper 31184,DOI 10.3386/w31184。 争议Voelkel 等,2024年,《Megastudy Testing 25 Treatments》,Science 386(6719):eadh4764,DOI 10.1126/science.adh4764。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定模拟价值的只有模型能否在未见条件下复制分布、异质性与干预响应

就模拟代理而非研究的外推边界看,2023年前后,实验经济学仍普遍接受“模型生成的选择可直接替代人类实验”这一默认。Horton把“人类沉默、退出和现实约束在模拟代理中没有对应对象”从清洗后的余数提升为解释对象;在大语言模型只能作为模拟代理而非替代人类样本中,这一缺项决定了谁能进入人类分布总变异。

本条拒绝“许多因素都重要”的安全结论,把解释权押在人类分布保真度上。围绕模拟代理而非研究,它预言“决定模拟价值的只有模型能否在未见条件下复制分布、异质性与干预响应”;在“模型没有真实预算、风险和持续身份,输出相关性也不代表社会机制”的案例中若读数保持同向,大语言模型只能作为模拟代理而非替代人类样本的单因排序便失去依据。

Horton(2023)用多个经典经济实验提示测试大语言模型;其证据是模型输出与已知分布的相似度,不能替代人类随机样本。就模拟代理而非研究的材料边界而言,进入、退出与未登记对象必须分开留痕。模拟代理而非研究的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

沿模拟代理而非研究的责任链,截至2025年的更新并没有消除Voelkel 等(2024)提出的“模型没有真实预算、风险和持续身份,输出相关性也不代表社会机制”。研究应将阴性结果和失败样本纳入注册报告,同时保留“人类沉默、退出和现实约束在模拟代理中没有对应对象”;否则模型与人类分布重叠度/人类分布总变异只在被选择样本内成立。

方法上的延伸直指实验预试、机制探索与人类样本保护,在在线受试平台的现实场景中,这一比率应与成本、覆盖和退出人数并列,而不能被一个总体平均替代。复算模拟代理而非研究之前,实施大语言模型只能作为模拟代理而非替代人类样本时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“人类沉默、退出和现实约束在模拟代理中没有对应对象”、分母变更和失败路径,避免只优化可见成功。

按模拟代理而非研究的对象表,其一接口以“该复核口径”为共同刻度,并明确“人类沉默、退出和现实约束在模拟代理中没有对应对象”是否进入分母。把模拟代理而非研究放到另见第 268 号第 15 条『照护经济与基本服务:无偿照护不是福利体系之外的余数』旁核验:先对齐对象、时间窗和责任人,再检查模拟代理而非研究的核心判断在另一套分母中是否仍同向。

位置S|模拟代理而非研究作结果量 单因模拟代理而非研究的核心决定项 预设〔01 谁进入分母〕模拟代理而非研究沿用既定对象边界 量纲模拟代理而非研究同向记录数/全部可核对记录数 失效若模拟代理而非研究可由替代机制重现,单因解释撤回 自曝模拟代理而非研究(第18条):原材料未覆盖者需另表 空栏现有账本没有为“人类沉默 异名另见第 268 号第 15 条『照护经济与基本服务:无偿照护不是福利体系之外的余数』

十一、受试者池多样性成为设计变量Participant-Pool Diversity

提出Henrich 等,2005年,《Economic Man in Cross-Cultural Perspective》,Behavioral and Brain Sciences 28(6):795–815,DOI 10.1017/S0140525X05000142。 争议Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究) 关键决定实验外推的只有年龄、文化、职业和制度经验是否与处理交互

围绕决定实验外推的判据,围绕受试者池多样性成为设计变量,旧研究常把“大学生样本只影响均值,不影响机制方向”当作比较前提。围绕决定实验外推的判据,源行把原始命题、边界材料与更新状态分开登记。沿决定实验外推的判据的责任链,这一步先限定可比较对象,不把缺失值折成零效应。

对受试者池多样性成为设计变量而言,目标总体覆盖度被指定为唯一决定项,其余变量只解释幅度。复算决定实验外推的判据之前,其个排他性可由各关键亚群实际样本/目标总体亚群规模检验;“扩大多样性也不能自动代表目标总体,平台样本仍有数字选择”若不改变符号,就构成反证。对决定实验外推的判据而言,可被推翻的责任只落在决定实验外推的只有年龄、文化、职业和制度经验是否与处理交互;如果替代机制同样预测结果,这项解释就应撤回。

Henrich等(2005)的15个社会显示受试者池文化与制度经验是处理效应的一部分,不能把西方大学生视为无条件基线。就决定实验外推的判据的材料边界而言,进入、退出与未登记对象必须分开留痕。决定实验外推的判据的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。

按决定实验外推的判据的对象表,截至2025年的更新并没有消除Galiani 与 Quistorff(2024)提出的“扩大多样性也不能自动代表目标总体,平台样本仍有数字选择”。研究应同时扩大样本与抽样框,区分精度增加和偏差下降,同时保留“无网络、语言不匹配和不信任研究机构者不进在线样本框”;否则该复核口径只在被选择样本内成立。

多站点合作、分层招募与权重最明显,政府行为洞察团队采用该思路时,需要为无网络、语言不匹配和不信任研究机构者不进在线样本框设置字段,否则所谓改进只发生在被看见的人身上。对照决定实验外推的判据的主源,实施受试者池多样性成为设计变量时,应在实验室、在线实验平台和研究资助机构建立版本化证据账本:记录“无网络、语言不匹配和不信任研究机构者不进在线样本框”、分母变更和失败路径,避免只优化可见成功。

在决定实验外推的判据的实施账本里,其一接口以“该复核口径”为共同刻度,并明确“无网络、语言不匹配和不信任研究机构者不进在线样本框”是否进入分母。把决定实验外推的判据放到另见第 306 号第 14 条『试验外推:入组者不再自动代表目标人群』旁核验:先对齐对象、时间窗和责任人,再检查决定实验外推的判据的核心判断在另一套分母中是否仍同向。

位置E|决定实验外推的判据作环境条件 单因决定实验外推的判据的核心决定项 预设〔01 谁进入分母〕决定实验外推的判据沿用既定对象边界 量纲决定实验外推的判据同向记录数/全部可核对记录数 失效若决定实验外推的判据可由替代机制重现,单因解释撤回 自曝决定实验外推的判据(第19条):原材料未覆盖者需另表 空栏现有账本没有为“无网络 异名另见第 306 号第 14 条『试验外推:入组者不再自动代表目标人群』

十二、实验数据治理进入可追踪时代Experimental Data Governance

提出Nosek、Ebersole、DeHaven 与 Mellor,2018年,《The Preregistration Revolution》,Proceedings of the National Academy of Sciences 115(11):2600–2606,DOI 10.1073/pnas.1708274114。 争议Camerer 等,2016年,《Evaluating Replicability of Laboratory Experiments in Economics》,Science 351(6280):1433–1436,DOI 10.1126/science.aaf0918。 最新Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。 关键决定可复核性的只有同意、版本、代码与再识别风险是否一起治理

沿实验数据治理议题的责任链,“匿名化数据上传即可满足开放科学”曾使实验数据治理进入可追踪时代看起来可以直接比较。Nosek、Ebersole、DeHaven 与 Mellor在2018年改变了观察顺序:先记录“撤回同意、被清洗掉的异常和无法共享合作数据不进开放率”,再计算全部发表实验,把进入数据之前的制度选择纳入解释。

实验数据治理进入可追踪时代不是因素清单,而是一项可以失败的主张:决定可复核性的只有同意、版本、代码与再识别风险是否一起治理。判决标准是可安全复算的实验比例能否稳定改变具有完整代码与受控数据路径的实验/全部发表实验;“过度开放会伤害脆弱群体,商业和政府合作数据也有合法限制”下没有差异,就足以否定其决定性。

实验数据治理应记录同意版本、随机种子、代码、排除与再识别风险;可复核不等于无限制公开个人数据。就实验数据治理议题的材料边界而言,进入、退出与未登记对象必须分开留痕。实验数据治理议题的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。实验数据治理议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

复算实验数据治理议题之前,截至2025年的更新并没有消除Camerer 等(2016)提出的“过度开放会伤害脆弱群体,商业和政府合作数据也有合法限制”。研究应由独立团队从档案复算并记录失败步骤,同时保留“撤回同意、被清洗掉的异常和无法共享合作数据不进开放率”;否则该复核口径只在被选择样本内成立。

让上述分子—分母进入常规审计,并把撤回同意、被清洗掉的异常和无法共享合作数据不进开放率作为结果的一部分,而不是数据清洗后的残余。按实验数据治理议题的对象表,其样才能区分真实改善、选择退出和统计边界收窄。实验数据治理议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

对照实验数据治理议题的主源,统一分母后仍相反,才需要另立解释。在实验数据治理议题的实施账本里,其一接口以“这一比率”为共同刻度,并明确“撤回同意、被清洗掉的异常和无法共享合作数据不进开放率”是否进入分母。把实验数据治理议题放到另见第 531 号第 8 条『暗反应:失败实验不是垃圾,而是边界数据』旁核验:先对齐对象、时间窗和责任人,再检查实验数据治理议题的核心判断在另一套分母中是否仍同向。

位置E|实验数据治理议题作环境条件 单因实验数据治理议题的核心决定项 预设〔01 谁进入分母〕实验数据治理议题沿用既定对象边界 量纲实验数据治理议题同向记录数/全部可核对记录数 失效若实验数据治理议题可由替代机制重现,单因解释撤回 自曝实验数据治理议题(第20条):原材料未覆盖者需另表 空栏现有账本没有为“撤回同意 异名另见第 531 号第 8 条『暗反应:失败实验不是垃圾,而是边界数据』

◎ 二十年连起来看

第一幕从“田野实验把环境带回因果识别”推进到“跨学科高影响实验同样需要复制”,第二幕又由“预注册把分析自由度变成可见对象”走向“实验数据治理进入可追踪时代”。实验经济学二十年的核心变化,是解释单位从静态类别转向可观察的机制、条件与回写过程;Harrison 与 List(2004)和Nosek、Ebersole、DeHaven 与 Mellor(2018)标出这一首尾迁移。

实验经济学的量纲也发生实质变化:第3条以“实际给予额/可支配总额”记录条件,第12条以“相对共同对照的新增行为/全部被分配干预者”记录过程,第18条再以“模型与人类分布重叠度/人类分布总变异”检验结果。实验经济学的问题由“有没有影响”转成“分子相对于哪个分母”。

实验经济学还让失败样本获得正式地位。第5条记录“未提交偏好、系统超时和因规则复杂退出者不进效率率”,第14条记录“只在一个指标有效、长期失访和真实行为未测者不进“成功”标签”;这些对象进入实验经济学的账本后,争论才可转成覆盖率、反号率与实施差距。

◎ 三个常见误解

误解一是把“田野实验把环境带回因果识别”读成新的万能尺度。它之所以诱人,是“在真实环境完成处理者/全部分配处理者”便于排序;正确表述却是:当“真实环境提高噪声并带来伦理与执行偏差,不能取代机制清晰的实验室”出现时,实验经济学的方向可能改变,增加维度不能替代边界检验。

误解二是认为数据越多,实验经济学的偏倚就越小。第19条的“各关键亚群实际样本/目标总体亚群规模”表明,更多文本、轨迹或样本若来自同一选择过程,只会更精确地描画已有覆盖,无法自动补回“无网络、语言不匹配和不信任研究机构者不进在线样本框”。

实验经济学的第三个误解,是把制度采纳等同于实质实施。第12条“巨型研究让干预同场竞赛”与第20条“实验数据治理进入可追踪时代”都显示,规则、平台或组织会围绕考核指标重新行动;实验经济学因此必须同时报告形式通过率、现场执行率和“具有完整代码与受控数据路径的实验/全部发表实验”。

◎ 与相邻领域的接口

与第79号第1条的分工可由“在真实环境完成处理者/全部分配处理者”判定:实验经济学第1条“田野实验把环境带回因果识别”解释真实制度嵌入度如何改变方向,邻块负责另一层级的结果。两边只有共享分母时才构成实验经济学的真实接口,单纯共享术语并不足够。

与第157号第6条的分工可由“识别研究目的者的行为差/未识别者行为差”判定:实验经济学第6条“实验者需求效应必须进入设计”解释受试者对期待的推断如何改变方向,邻块负责另一层级的结果。接口是否成立,最终由“识别研究目的者的行为差/未识别者行为差”能否在两块中复算决定。

与第72号第11条的分工可由“落入预测区间的真实效应/全部预测效应”判定:实验经济学第11条“专家预测本身可以被实验检验”解释预测校准度如何改变方向,邻块负责另一层级的结果。对实验经济学而言,分母不同就只是同名问题;统一“落入预测区间的真实效应/全部预测效应”后才可比较方向。

与第406号第16条的分工可由“相信实验说明的参与者/全部受试池成员”判定:实验经济学第16条“欺骗禁忌是一种实验公共品”解释说明可信度的跨实验外部性如何改变方向,邻块负责另一层级的结果。接口是否成立,最终由“相信实验说明的参与者/全部受试池成员”能否在两块中复算决定。

◎ 争议现场

围绕“独裁者博弈效应依赖实验情境”的争论尚未收敛。Zizzo提出,“发表偏差与学生样本仍存在,实验给予也不等于长期公共责任”会改变解释方向;要收敛,实验经济学需采用“建立双重抽样框并追踪未进入分母者”,并预先规定“实际给予额/可支配总额”何种变化算支持、收缩或反号。

围绕“在线互动实验突破共时实验室限制”的争论尚未收敛。Galiani 与 Quistorff提出,“设备差异、机器人和多账号会影响数据,掉线也常与行为相关”会改变解释方向;要收敛,实验经济学需采用“保存代码、工艺与版本并做异地重做”,并预先规定“完成全部互动轮次者/被随机匹配者”何种变化算支持、收缩或反号。

围绕“动态网络实验让关系内生化”的争论尚未收敛。Henrich 等提出,“实验网络规模小且关系代价简化,现实身份与机构规则更复杂”会改变解释方向;要收敛,实验经济学需采用“把阴性结果与失败样本强制纳入注册报告”,并预先规定“因行为差异发生的连边变化/全部连边变化”何种变化算支持、收缩或反号。

◎ 往下五年看什么

未来五年,第9条“预注册把分析自由度变成可见对象”应连续发布“按预注册执行的主要分析/全部主要分析”,并把“未登记探索、临时排除和计划变更理由不进论文摘要”纳入分母。若“未登记探索、临时排除和计划变更理由不进论文摘要”仍无记录,第9条的进展只能算可见样本内进展。

未来五年,第13条“外部有效性可被分解与重加权”应连续发布“重加权后有效样本量/原始实验样本量”,并把“未被招募、拒绝参与和政策不覆盖者不进实验分母”纳入分母。只有跨制度复制后符号稳定,“外部有效性可被分解与重加权”才可进入常规决策。

未来五年,第17条“动态网络实验让关系内生化”应连续发布“因行为差异发生的连边变化/全部连边变化”,并把“未形成连接、沉默退出和平台禁止重连者不进网络演化”纳入分母。只有跨制度复制后符号稳定,“动态网络实验让关系内生化”才可进入常规决策。

未来五年,第20条“实验数据治理进入可追踪时代”应连续发布“具有完整代码与受控数据路径的实验/全部发表实验”,并把“撤回同意、被清洗掉的异常和无法共享合作数据不进开放率”纳入分母。该读数若不能在独立数据中重算,实验经济学就尚未完成这项转向。

◎ 可与哪些领域对撞

本块第1条“田野实验把环境带回因果识别”可与第79号第1条对撞。双方共享“实验室控制越严格,经济行为规律越可靠”,本条把真实制度嵌入度置于因果链首位,邻块则可能把同一要素视为结果;若用“在真实环境完成处理者/全部分配处理者”复算后两边都成立,实验经济学就必须测量进入分母的选择机制。

本块第2条“跨文化博弈推翻单一经济人”可与第157号第6条对撞。双方共享“自利最大化和公平偏好参数在人类群体中近似相同”,本条把制度经验进入博弈的程度置于因果链首位,邻块则可能把同一要素视为结果;若用“群体间行为差/群体内行为差”复算后两边都成立,实验经济学就必须测量进入分母的选择机制。

本块第3条“独裁者博弈效应依赖实验情境”可与第72号第11条对撞。双方共享“给钱行为可以直接测量稳定的利他偏好”,本条把情境框架对给予的影响置于因果链首位,邻块则可能把同一要素视为结果;若用“实际给予额/可支配总额”复算后两边都成立,实验经济学就必须测量进入分母的选择机制。

本块第18条“大语言模型只能作为模拟代理而非替代人类样本”可与第157号第6条对撞。双方共享“模型生成的选择可直接替代人类实验”,本条把人类分布保真度置于因果链首位,邻块则可能把同一要素视为结果;若用“模型与人类分布重叠度/人类分布总变异”复算后两边都成立,实验经济学就必须测量阴性结果选择。

◎ 十条可做的研究命题

1. 命题:第1条“田野实验把环境带回因果识别”只在“真实环境提高噪声并带来伦理与执行偏差,不能取代机制清晰的实验室”未出现时保持原方向。做法:建立双重抽样框并追踪未进入分母者,以“在真实环境完成处理者/全部分配处理者”为主读数,并追踪“未接触、组织拒绝和执行者自行修改处理不进意向性结果解释”。

2. 命题:第3条“独裁者博弈效应依赖实验情境”只在“发表偏差与学生样本仍存在,实验给予也不等于长期公共责任”未出现时保持原方向。做法:建立双重抽样框并追踪未进入分母者,以“实际给予额/可支配总额”为主读数,并追踪“拒绝游戏、误解产权和实验外补偿不进给予率”。若跨越“发表偏差与学生样本仍存在,实验给予也不等于长期公共责任”后“实际给予额/可支配总额”没有结构变化,第3条的反号命题即被否定。

3. 命题:第5条“市场设计实验连接规则与实施”只在“实验室支付和规模与真实市场不同,成功机制仍需法律、技术和组织支持”未出现时保持原方向。做法:随机改变测量时点、公开程度或评定者身份,以“遵循预期策略且获得可行结果者/全部参与者”为主读数,并追踪“未提交偏好、系统超时和因规则复杂退出者不进效率率”。若跨越“实验室支付和规模与真实市场不同,成功机制仍需法律、技术和组织支持”后“遵循预期策略且获得可行结果者/全部参与者”没有结构变化,第5条的反号命题即被否定。

4. 命题:第7条“经济学实验复制率需要量化”只在“复制项目选择著名、可实施研究,原始设计与新样本环境仍有差异”未出现时保持原方向。做法:把实施者、参与者与盲法评定者分开,以“复制效应量/原始效应量”为主读数,并追踪“未发表复制、无法取得材料和操作失败不进复制率”。若跨越“复制项目选择著名、可实施研究,原始设计与新样本环境仍有差异”后“复制效应量/原始效应量”没有结构变化,第7条的反号命题即被否定。

5. 命题:第9条“预注册把分析自由度变成可见对象”只在“低质量预注册可过度模糊或被频繁偏离,固定计划也不能替代好理论”未出现时保持原方向。做法:把实施者、参与者与盲法评定者分开,以“按预注册执行的主要分析/全部主要分析”为主读数,并追踪“未登记探索、临时排除和计划变更理由不进论文摘要”。

6. 命题:第11条“专家预测本身可以被实验检验”只在“预测题目和激励会影响校准,熟悉特定文献者可能占优”未出现时保持原方向。做法:保存代码、工艺与版本并做异地重做,以“落入预测区间的真实效应/全部预测效应”为主读数,并追踪“不愿预测、给宽区间和只报方向者不进精确度排名”。若跨越“预测题目和激励会影响校准,熟悉特定文献者可能占优”后“落入预测区间的真实效应/全部预测效应”没有结构变化,第11条的反号命题即被否定。

7. 命题:第13条“外部有效性可被分解与重加权”只在“关键效应修饰因素常未测,目标总体也可能在实验后变化”未出现时保持原方向。做法:同时测量局部收益与系统外部性,以“重加权后有效样本量/原始实验样本量”为主读数,并追踪“未被招募、拒绝参与和政策不覆盖者不进实验分母”。若采用统一分母后不同制度中的符号完全一致,实验经济学无需引入该边界条件。

8. 命题:第15条“复制激励会改变研究者行为”只在“激励可能诱导迎合评分规则,长期学术职业回报仍由发表主导”未出现时保持原方向。做法:同时测量局部收益与系统外部性,以“用于复制与验证的奖励/研究总奖励”为主读数,并追踪“未发表失败、无职业回报的清理工作和数据维护不进产出评价”。若独立样本补入“未发表失败、无职业回报的清理工作和数据维护不进产出评价”后方向、大小和区间均不变,本命题不成立。

9. 命题:第17条“动态网络实验让关系内生化”只在“实验网络规模小且关系代价简化,现实身份与机构规则更复杂”未出现时保持原方向。做法:把阴性结果与失败样本强制纳入注册报告,以“因行为差异发生的连边变化/全部连边变化”为主读数,并追踪“未形成连接、沉默退出和平台禁止重连者不进网络演化”。若独立样本补入“未形成连接、沉默退出和平台禁止重连者不进网络演化”后方向、大小和区间均不变,本命题不成立。

10. 命题:第19条“受试者池多样性成为设计变量”只在“扩大多样性也不能自动代表目标总体,平台样本仍有数字选择”未出现时保持原方向。做法:同时扩大样本与抽样框,比较偏差是否真正下降,以“各关键亚群实际样本/目标总体亚群规模”为主读数,并追踪“无网络、语言不匹配和不信任研究机构者不进在线样本框”。若跨越“扩大多样性也不能自动代表目标总体,平台样本仍有数字选择”后“各关键亚群实际样本/目标总体亚群规模”没有结构变化,第19条的反号命题即被否定。

◎ 资料核验

本块共核对17笔互异来源。提出、争议和最新分别承担主证据、边界/反证与更新状态;同行评议论文优先写卷页或DOI,专著写出版社,报告写机构与年份,预印本保留身份。碰撞行量纲不计为原论文实测值。

  1. [原始证据|同行评议论文]Harrison 与 List,2004年,《Field Experiments》,Journal of Economic Literature 42(4):1009–1055,DOI 10.1257/0022051043004577。
  2. [争议/边界|同行评议论文]Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。
  3. [近年更新|同行评议综述]Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。
  4. [原始证据|同行评议论文]Henrich 等,2005年,《Economic Man in Cross-Cultural Perspective》,Behavioral and Brain Sciences 28(6):795–815,DOI 10.1017/S0140525X05000142。
  5. [争议/边界|同行评议论文]Voelkel 等,2024年,《Megastudy Testing 25 Treatments》,Science 386(6719):eadh4764,DOI 10.1126/science.adh4764。
  6. [原始证据|同行评议论文]Engel,2011年,《Dictator Games: A Meta Study》,Experimental Economics 14:583–610,DOI 10.1007/s10683-011-9283-7。
  7. [争议/边界|同行评议论文]Zizzo,2010年,《Experimenter Demand Effects in Economic Experiments》,Experimental Economics 13:75–98,DOI 10.1007/s10683-009-9230-z。
  8. [原始证据|同行评议论文]Gächter、Renner 与 Sefton,2008年,《The Long-Run Benefits of Punishment》,Science 322(5907):1510,DOI 10.1126/science.1164744。
  9. [原始证据|同行评议论文]Roth,2008年,《What Have We Learned from Market Design?》,Economic Journal 118(527):285–310,DOI 10.1111/j.1468-0297.2007.02121.x。
  10. [争议/边界|同行评议论文]Hertwig 与 Ortmann,2001年,《Experimental Practices in Economics: A Methodological Challenge for Psychologists?》,Behavioral and Brain Sciences 24(3):383–403,DOI 10.1017/S0140525X01004181。
  11. [原始证据|同行评议论文]Camerer 等,2016年,《Evaluating Replicability of Laboratory Experiments in Economics》,Science 351(6280):1433–1436,DOI 10.1126/science.aaf0918。
  12. [争议/边界|同行评议论文]Nosek、Ebersole、DeHaven 与 Mellor,2018年,《The Preregistration Revolution》,Proceedings of the National Academy of Sciences 115(11):2600–2606,DOI 10.1073/pnas.1708274114。
  13. [原始证据|同行评议论文]Camerer 等,2018年,《Evaluating the Replicability of Social Science Experiments in Nature and Science》,Nature Human Behaviour 2:637–644,DOI 10.1038/s41562-018-0399-z。
  14. [原始证据|同行评议论文]Arechar、Gächter 与 Molleman,2018年,《Conducting Interactive Experiments Online》,Experimental Economics 21:99–131,DOI 10.1007/s10683-017-9527-2。
  15. [原始证据|同行评议综述]DellaVigna 与 Pope,2018年,《What Motivates Effort? Evidence and Expert Forecasts》,Review of Economic Studies 85(2):1029–1069,DOI 10.1093/restud/rdx033。
  16. [原始证据|同行评议论文]Milkman 等,2021年,《A Megastudy of Text-Based Nudges Encouraging Patients to Get Vaccinated》,Nature 600:478–483,DOI 10.1038/s41586-021-04128-4。
  17. [原始证据|预印本/工作论文]Horton,2023年,《Large Language Models as Simulated Economic Agents》,NBER Working Paper 31184,DOI 10.3386/w31184。
  18. [补录|源行可核验材料]Galiani 与 Quistorff,2024年,《Assessing External Validity in Practice》,Research in Economics 78(3):100964,DOI 10.1016/j.rie.2024.100964。
  19. [补录|源行可核验材料]Balafoutas、Celse、Karakostas 与 Umashev,2025年,《Incentives and the Replication Crisis in Social Sciences: A Critical Review of Open Science Practices》,Journal of Behavioral and Experimental Economics 114:102327,DOI 10.1016/j.socec.2024.102327。(用于更新边界或证据状态,不替代原始研究)
  20. [补录|源行可核验材料]Voelkel 等,2024年,《Megastudy Testing 25 Treatments》,Science 386(6719):eadh4764,DOI 10.1126/science.adh4764。
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行八字段碰撞行(位置/单因/预设/量纲/失效/自曝/空栏/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板