SDE Universes·新思想前沿商业与管理的其余
新思想前沿 · 商业与管理的其余

商业分析与决策科学

近二十年 · 两幕 · 20 个新思想 · 约 25,235 字 · 王德生 亲撰 · 2026 年 8 月

本块观察的不是商业分析与决策科学工具清单,而是模型、看板与组织决策怎样在二十年间更换默认前提。上一个十年以“循证管理要求先公开证据等级 Evidence-Based Management”“行为运营把决策者写进模型 Behavioral Operations”“在线对照实验成为产品决策基础设施 Online Controlled Experiments”为代表,开始质疑数据量、模型精度和管理者经验能否承担全部解释;这一个十年由“因果机器学习从平均效应走向异质效应 Causal Machine Learning”走向“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”,进一步处理技术部署、制度适配和未被结算的代价。二十条共同以可比读数、边界条件、内部限制和未入账对象来约束论证,使决策质量、可追责性与长期绩效能够被复算而不是只被宣称。贯穿全块的问题是:组织把表现写成数之后,被评价者怎样围绕这个数行动,哪些事实又因此从账本中消失。

【第一幕】上一个十年 · 约 2006—2016

上一个十年的八条转向围绕模型、看板与组织决策重新划界。“循证管理要求先公开证据等级 Evidence-Based Management”“预测锦标赛把准确度与信念分开 Forecasting Tournaments”“在线对照实验成为产品决策基础设施 Online Controlled Experiments”分别从对象、路径和条件场说明,中心读数为何会漏掉真实差异。

甲、循证管理要求先公开证据等级Evidence-Based Management

提出Pfeffer 与 Sutton,2006,《Hard Facts, Dangerous Half-Truths, and Total Nonsense》,Harvard Business School Press。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键只有能够追到可复核研究与组织数据的建议才应进入决策

Shmueli(2010)随后用边界材料指出:外部研究的平均效应未必适合特定企业,证据等级也会遗漏实施条件,这使决策日志中的“未发表的零效应项目、被董事会否决的备选方案”不能继续按普通缺失处理。从只有能够机制的材料看,到2024年,OECD把Pfeffer 与 Sutton提出、Shmueli质疑的这条线推进到决策日志的部署后复核:数据产品负责人不仅要解释结果,还要说明产品上线如何回写对象与分母。

“循证管理要求先公开证据等级 Evidence-Based Management”的核心判断由Pfeffer 与 Sutton(2006)写明:只有能够追到可复核研究与组织数据的建议才应进入决策。为了回应Shmueli(2010)对Pfeffer 与 Sutton主张的异议,并接受OECD的新场景检验,解释焦点被放在对象或读数“本项证据”上,本条只保留一个决定因素:决定管理建议可信度的只有证据链等级。

Pfeffer 与 Sutton在2006年提供的主证据是:2006年的系统梳理把大量畅销管理做法判为经验薄弱,后续调查发现,高管仍常以同行模仿和成功故事替代对照证据。Shmueli在2010年对Pfeffer 与 Sutton的反例、以及OECD的新场景说明,只报“可追溯证据条数”无法比较,分析负责人应以“可追溯证据条数/全部关键决策依据数”把分子和分母一起公开。只有能够机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

“该转向 Evidence-Based Management”的适用边界由Shmueli(2010)集中提出:外部研究的平均效应未必适合特定企业,证据等级也会遗漏实施条件。Shmueli对Pfeffer 与 Sutton的压力测试不是简单缩小范围,而是要求直接观察:当证据被纳入奖金与合规评分时,方向反过来:团队会优先生产容易评级而非重要的证据。核查只有能够机制时,Pfeffer2006—Shmueli2010的争议已暴露明确的自我限制。就Pfeffer 与 Sutton提出、Shmueli质疑的命题而言,OECD到2024年的材料仍不能替代预先登记的失效检验。

按照Pfeffer 与 Sutton在2006年建立的口径,业务决策委员会处理模型部署不能只引用“这一比率”,还要让试验注册表保存分子、分母与口径变更。Shmueli(2010)提醒,业务决策委员会必须为Pfeffer 与 Sutton提出而OECD继续检验的“该未登记群体”提供查询位置,在Shmueli所划定的责任边界里,它若没有位置,责任便会在部门之间消失。只有能够机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

就只有能够机制的材料边界而言,进入、退出与未登记对象必须分开留痕。把只有能够机制放到另见第 204 号第 9 条『Bellingcat 把公开碎片组织成可复核调查』旁核验:先对齐对象、时间窗和责任人,再检查只有能够机制的核心判断在另一套分母中是否仍同向。

位置D|只有能够机制作生成路径 单因只有能够机制的核心决定项 预设〔01 谁进入分母〕只有能够机制沿用既定对象边界 量纲只有能够机制同向记录数/全部可核对记录数 失效漏掉未发表的零效应项目、被等漏记者时,只有能够机制读数越高,真实覆盖反而越低 自曝只有能够机制(第1条):原材料未覆盖者需另表 空栏未发表的零效应项目、被等漏记者 异名另见第 204 号第 9 条『Bellingcat 把公开碎片组织成可复核调查』

乙、数据驱动决策被测出组织绩效差异Data-Driven Decision Making

提出Brynjolfsson、Hitt 与 Kim,2011,ICIS论文《Strength in Numbers: How Does Data-Driven Decisionmaking Affect Firm Performance?》。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键数据只有进入资源配置和复盘才能产生绩效差异

就数据机制的材料边界而言,进入、退出与未登记对象必须分开留痕。对照Gigerenzer 与 Brighton(2009)的反例可见,横截面关联无法完全排除优质管理者同时采用数据和其他先进实践,若业务决策委员会删去“会上被展示但未改变任何行动的数据、被撤回的异常读数”,表面稳定很可能只是样本边界被改写。NIST在2023年的材料把Brynjolfsson、Hitt 与 Kim、Gigerenzer 与 Brighton之间的分歧带入试验注册表:同名结果若经历不同模型部署,就不能被视为同一事实。

在Brynjolfsson、Hitt 与 Kim的2011年论证中,“数据驱动决策被测出组织绩效差异 Data-Driven Decision Making”不再只是相关性标签,而明确主张:数据只有进入资源配置和复盘才能产生绩效差异。按Gigerenzer 与 Brighton(2009)给出的反例压力并对照Brynjolfsson、Hitt 与 Kim、NIST两组材料,若行动路径“上述机制”不起决定作用,那么“决定数据价值的只有决策权是否真正使用数据”就应被判错。

把“数据驱动决策被测出组织绩效差异 Data-Driven Decision Making”从观点推进到可核对事实的是Brynjolfsson、Hitt 与 Kim在2011年的材料:对179家大型企业的研究报告,数据驱动程度高一个标准差与约5%—6%的产出和生产率提升相关,相关关系在控制IT投资后仍存在。Gigerenzer 与 Brighton(2009)对Brynjolfsson、Hitt 与 Kim的批评、以及NIST的后续材料,使证据责任落到分母“全部重大决策数”:只有“由数据触发的决策数/全部重大决策数”能区分普遍变化与选择性结果。

“数据驱动决策被测出组织绩效差异 Data-Driven Decision Making”的适用边界由Gigerenzer 与 Brighton(2009)集中提出:横截面关联无法完全排除优质管理者同时采用数据和其他先进实践。Gigerenzer 与 Brighton对Brynjolfsson、Hitt 与 Kim的压力测试不是简单缩小范围,而是要求直接观察:当员工预先知道看板将决定资源时,方向反过来:数据使用越强,指标操纵越集中。核查数据机制时,Brynjolfsson2011—Gigerenzer2009的争议已暴露明确的自我限制。在数据机制这条证据链上,就Brynjolfsson、Hitt 与 Kim提出、Gigerenzer 与 Brighton质疑的命题而言,NIST到2023年的材料仍不能替代预先登记的失效检验。

把Brynjolfsson、Hitt 与 Kim(2011)的证据带入风险定价时,分析负责人应在模型版本册中分别登记“由数据触发的决策数”与“全部重大决策数”,而不是只留下最终比率。为避免Brynjolfsson、Hitt 与 Kim所述指标在Gigerenzer 与 Brighton的边界情形中反客为主,NIST(2023)所对应的制度设计不是再加总分,而是公开口径变更、例外批准与账外成本。数据机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

数据机制的支持材料与边界材料分别编号,不让同一来源同时提出命题又替命题免责。把数据机制放到另见第 301 号第 8 条『Kadison–Singer:随机分割解决纯算子问题』旁核验:先对齐对象、时间窗和责任人,再检查数据机制的核心判断在另一套分母中是否仍同向。

位置E|数据机制作环境条件 单因数据机制的核心决定项 预设〔01 谁进入分母〕数据机制沿用既定对象边界 量纲数据机制同向记录数/全部可核对记录数 失效漏掉会上被展示但未改变任何等漏记者时,数据机制读数越高,真实覆盖反而越低 自曝数据机制(第2条):原材料未覆盖者需另表 空栏会上被展示但未改变任何等漏记者 异名另见第 301 号第 8 条『Kadison–Singer:随机分割解决纯算子问题』

丙、分析能力是一套组织互补品Analytics Capability as Complementarity

提出Davenport 与 Harris,2007,《Competing on Analytics》,Harvard Business School Press。 争议Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。 最新Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。 关键单个模型不能产生优势,只有模型、流程、角色和激励形成闭环才可以

Rai(2020)并未否定问题本身,却证明案例选择偏向成功企业,且“分析型竞争者”的边界随行业变化,从而让“没有被业务采用的模型、在部门之间失去所有者的数据产品”进入例外处置清单的核对范围。在单个模型机制这条证据链上,Milanez、Lemmens 与 Ruggiu在2025年的更新把提问顺序进一步固定为:先确认谁被记录、怎样经过资源配置,再判断“该转向 Analytics Capability as Complementarity”是否在新场景中保持同义。

“分析能力是一套组织互补品 Analytics Capability as Complementarity”的核心判断由Davenport 与 Harris(2007)写明:单个模型不能产生优势,只有模型、流程、角色和激励形成闭环才可以。为了回应Rai(2020)对Davenport 与 Harris主张的异议,并接受Milanez、Lemmens 与 Ruggiu的新场景检验,解释焦点被放在制度条件“本项证据”上,本条只保留一个决定因素:决定分析优势的只有人才流程技术的互补结构。

Davenport 与 Harris(2007)给出的关键读数为:跨行业案例显示,领先企业同时建设数据平台、分析团队和执行流程,只购买软件的项目常停在仪表盘层。单个模型机制的结构读数拆成3项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对Davenport 与 Harris(2007)的主张,Rai在2020年给出的主要反证是:案例选择偏向成功企业,且“分析型竞争者”的边界随行业变化。若按Rai的反例复算Davenport 与 Harris的命题,能够改变结论方向的条件是:当互补结构过度集中于少数专家时,方向反过来:能力越强组织单点脆弱性越高。对单个模型机制做反向检验,Davenport2007—Rai2020之争把证据责任推回边界样本。对照Davenport 与 Harris的主张与Rai的反证,Milanez、Lemmens 与 Ruggiu(2025)虽然扩展了观察场景,却仍需用同一“该复核口径”并列检验支持样本与反例。

把单个模型机制放回原窗口,把Davenport 与 Harris(2007)的证据带入风险定价时,分析负责人应在模型版本册中分别登记“完成闭环的分析项目数”与“全部已部署分析项目数”,而不是只留下最终比率。依据Rai在2020年对Davenport 与 Harris的反例,并承接Milanez、Lemmens 与 Ruggiu的新场景,模型版本册还要显示“这些漏记对象数据产品”的规模与去向,否则未被结算的代价会被误读为没有发生。为避免Davenport 与 Harris所述指标在Rai的边界情形中反客为主,Milanez、Lemmens 与 Ruggiu(2025)所对应的制度设计不是再加总分,而是公开口径变更、例外批准与账外成本。单个模型机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

就单个模型机制的材料边界而言,进入、退出与未登记对象必须分开留痕。把单个模型机制放到另见第 531 号第 19 条『Coscientist与ChemCrow:科研智能体的能力边界在工具链』旁核验:先对齐对象、时间窗和责任人,再检查单个模型机制的核心判断在另一套分母中是否仍同向。

位置E|单个模型机制作环境条件 单因单个模型机制的核心决定项 预设〔01 谁进入分母〕单个模型机制沿用既定对象边界 量纲单个模型机制同向记录数/全部可核对记录数 失效漏掉没有被业务采用的模型、等漏记者时,单个模型机制读数越高,真实覆盖反而越低 自曝单个模型机制(第3条):原材料未覆盖者需另表 空栏没有被业务采用的模型、等漏记者 异名另见第 531 号第 19 条『Coscientist与ChemCrow:科研智能体的能力边界在工具链』

丁、行为运营把决策者写进模型Behavioral Operations

提出Gino 与 Pisano,2008,《Manufacturing & Service Operations Management》10(4):676–691,DOI 10.1287/msom.1070.0205。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键排队、库存与激励模型必须把人的系统反应当成内生变量

Shmueli(2010)随后用边界材料指出:实验室任务可能高估短期反应,现场组织还有学习与权力结构,这使决策日志中的“被标准优化器标记为非理性的保守缓冲、拒绝执行的建议”不能继续按普通缺失处理。对行为运营研究做反向检验,到2024年,OECD把Gino 与 Pisano提出、Shmueli质疑的这条线推进到决策日志的部署后复核:数据产品负责人不仅要解释结果,还要说明产品上线如何回写对象与分母。

Gino 与 Pisano于2008年给出的立场可以直接接受反证:排队、库存与激励模型必须把人的系统反应当成内生变量。Shmueli(2010)迫使Gino 与 Pisano的命题在OECD的新场景中把解释焦点落到对象或读数“行为运营把决策者写进模型”,因此,判断标准被明确为:决定运营偏差的只有真实决策者的行为反应。

Shmueli(2010)对Gino 与 Pisano的批评、以及OECD的后续材料,使证据责任落到分母“全部模型建议数”:只有“受行为反应影响的运营决策数/全部模型建议数”能区分普遍变化与选择性结果。行为运营研究的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

Shmueli(2010)把争论从有没有效应转向何时可识别,其核心异议为:实验室任务可能高估短期反应,现场组织还有学习与权力结构。把Gino 与 Pisano的主张放到Shmueli的边界样本中,最关键的反向情形是:当异常行为本身是对模型遗漏风险的合理防御时,方向反过来:偏离越大长期损失越小。既然文献已经把这项限制说清,为检验Gino 与 Pisano、Shmueli之间的分歧,OECD在2024年之后的研究就必须公开反向结果,否则争论仍不会收敛。

依据Shmueli在2010年对Gino 与 Pisano的反例,并承接OECD的新场景,模型版本册还要显示“这些漏记对象、拒绝执行的建议”的规模与去向,否则未被结算的代价会被误读为没有发生。为避免Gino 与 Pisano所述指标在Shmueli的边界情形中反客为主,OECD(2024)所对应的制度设计不是再加总分,而是公开口径变更、例外批准与账外成本。

Gino 与 Pisano、Dietvorst、Simmons 与 Massey分别从被结算的对象与读数和制度、技术与关系条件解释结果。把行为运营研究放回原窗口,二者并非重复,因为它们虽共同依赖“测量、排名或观察“本项证据”不会改变参与者行为,这组账外材料、拒绝执行的建议不产生回写”,却把因果责任放在不同环节。就行为运营研究的材料边界而言,进入、退出与未登记对象必须分开留痕。在承接两组争议的OECD(2024)和Milanez、Lemmens 与 Ruggiu(2025)新场景中,反向检验写成:异常行为本身是对模型遗漏风险的合理防御,偏离越大长期损失越小。

位置S|行为运营研究作结果量 单因行为运营研究的核心决定项 预设〔01 谁进入分母〕行为运营研究沿用既定对象边界 量纲行为运营研究同向记录数/全部可核对记录数 失效漏掉被标准优化器标记为非理等漏记者时,行为运营研究读数越高,真实覆盖反而越低 自曝行为运营研究(第4条):原材料未覆盖者需另表 空栏被标准优化器标记为非理等漏记者 异名另见第 531 号第 15 条『Halicin与abaucin:模型必须把化学空间带到湿实验验证』

戊、预测锦标赛把准确度与信念分开Forecasting Tournaments

提出Mellers 等,2014,《Psychological Science》25(5):1106–1115,DOI 10.1177/0956797614524255。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键预测者必须用概率、反馈和持续更新承担可检验责任

在Mellers 等(2014)之前,“预测锦标赛把准确度与信念分开 Forecasting Tournaments”常由数据量、模型精度和管理者经验直接结算,研究很少说明行动次序、反馈和转折点怎样改变同一指标的含义。到2023年,NIST把Mellers 等提出、Gigerenzer 与 Brighton质疑的这条线推进到决策日志的部署后复核:数据产品负责人不仅要解释结果,还要说明产品上线如何回写对象与分母。

Mellers 等(2014)把命题收紧为可反驳的一句:预测者必须用概率、反馈和持续更新承担可检验责任。Gigerenzer 与 Brighton在2009年对Mellers 等的边界批评、以及NIST的后续场景,使责任不能分散到笼统因素,必须检验行动路径“预测锦标赛把准确度与信念分开”,判断标准是决定预测质量的只有可校准概率更新。

Gigerenzer 与 Brighton(2009)对Mellers 等的批评、以及NIST的后续材料,使证据责任落到分母“全部预测轮次”:只有“Brier损失下降量/全部预测轮次”能区分普遍变化与选择性结果。预测锦标赛研究的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

Gigerenzer 与 Brighton(2009)把争论从有没有效应转向何时可识别,其核心异议为:竞赛问题有明确结算日,企业战略问题常存在延期、改名和自我实现。把Mellers 等的主张放到Gigerenzer 与 Brighton的边界样本中,最关键的反向情形是:当预测本身触发组织干预并改变事件时,方向反过来:校准越好原问题越不再发生。既然文献已经把这项限制说清,为检验Mellers 等、Gigerenzer 与 Brighton之间的分歧,NIST在2023年之后的研究就必须公开反向结果,否则争论仍不会收敛。

在模型、看板与组织决策的现场,Mellers 等(2014)所给读数必须由数据产品负责人写入决策日志,并说明“全部预测轮次”如何形成。当“这一比率”与预算或问责挂钩时,NIST在2023年的治理场景回应了Mellers 等、Gigerenzer 与 Brighton之间的分歧:应保留申诉、独立复核和第二次测量。

Mellers 等、Gino 与 Pisano分别从行动次序与反馈路径和被结算的对象与读数解释结果。把预测锦标赛研究放回原窗口,二者并非重复,因为它们虽共同依赖“测量、排名或观察“本项证据”不会改变参与者行为,这组账外材料不产生回写”,却把因果责任放在不同环节。就预测锦标赛研究的材料边界而言,进入、退出与未登记对象必须分开留痕。在承接两组争议的NIST(2023)和OECD(2024)新场景中,反向检验写成:预测本身触发组织干预并改变事件,校准越好原问题越不再发生。把预测锦标赛研究放到另见第 204 号第 4 条『预测锦标赛把判断变成可结算概率』旁核验:先对齐对象、时间窗和责任人,再检查预测锦标赛研究的核心判断在另一套分母中是否仍同向。

位置D|预测锦标赛研究作生成路径 单因预测锦标赛研究的核心决定项 预设〔01 谁进入分母〕预测锦标赛研究沿用既定对象边界 量纲预测锦标赛研究同向记录数/全部可核对记录数 失效漏掉没有结算的预测、被管理层改写时,预测锦标赛研究读数越高,真实覆盖反而越低 自曝预测锦标赛研究(第5条):原材料未覆盖者需另表 空栏没有结算的预测、被管理层改写 异名另见第 204 号第 4 条『预测锦标赛把判断变成可结算概率』

己、算法厌恶来自看见机器犯错Algorithm Aversion

提出Dietvorst、Simmons 与 Massey,2015,《Journal of Experimental Psychology: General》144(1):114–126,DOI 10.1037/xge0000033。 争议Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。 最新Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。 关键人们在看到算法犯错后会比看到人犯同类错误更快放弃算法

在Dietvorst、Simmons 与 Massey(2015)之前,“算法厌恶来自看见机器犯错 Algorithm Aversion”常由数据量、模型精度和管理者经验直接结算,研究很少说明制度、技术与关系条件怎样改变同一指标的含义。Rai(2020)随后用边界材料指出:任务风险、专业身份与能否微调算法会改变厌恶强度,这使决策日志中的“算法正确但未被采纳的建议、人工错误被解释为例外的记录”不能继续按普通缺失处理。到2025年,Milanez、Lemmens 与 Ruggiu把Dietvorst、Simmons 与 Massey提出、Rai质疑的这条线推进到决策日志的部署后复核:数据产品负责人不仅要解释结果,还要说明产品上线如何回写对象与分母。

Dietvorst、Simmons 与 Massey于2015年给出的立场可以直接接受反证:人们在看到算法犯错后会比看到人犯同类错误更快放弃算法。Rai(2020)迫使Dietvorst、Simmons 与 Massey的命题在Milanez、Lemmens 与 Ruggiu的新场景中把解释焦点落到制度条件“算法厌恶来自看见机器犯错”,因此,判断标准被明确为:决定人是否弃用算法的只有错误可见性。

Dietvorst、Simmons 与 Massey(2015)给出的关键读数为:三项实验让参与者预测成绩并观察人或算法的误差,即使算法总体优于个人,看到其出错者仍显著降低使用意愿。算法厌恶议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

“算法厌恶来自看见机器犯错 Algorithm Aversion”的适用边界由Rai(2020)集中提出:任务风险、专业身份与能否微调算法会改变厌恶强度。Rai对Dietvorst、Simmons 与 Massey的压力测试不是简单缩小范围,而是要求直接观察:当使用者获得少量覆写权时,方向反过来:看见算法误差反而增加持续采用。就算法厌恶议题的外推边界看,Dietvorst2015—Rai2020的争议已暴露明确的自我限制。就Dietvorst、Simmons 与 Massey提出、Rai质疑的命题而言,Milanez、Lemmens 与 Ruggiu到2025年的材料仍不能替代预先登记的失效检验。

在模型、看板与组织决策的现场,Dietvorst、Simmons 与 Massey(2015)所给读数必须由数据产品负责人写入决策日志,并说明“全部观察者人数”如何形成。当“这一比率”与预算或问责挂钩时,Milanez、Lemmens 与 Ruggiu在2025年的治理场景回应了Dietvorst、Simmons 与 Massey、Rai之间的分歧:应保留申诉、独立复核和第二次测量。

把Dietvorst、Simmons 与 Massey(2015)和Mellers 等(2014)并读,可以看到“本项证据 Algorithm Aversion”追问制度、技术与关系条件,“预测锦标赛把准确度与信念分开 Forecasting Tournaments”追问行动次序与反馈路径,两条命题共享的未言明条件是“测量、排名或观察“这一制度安排”不会改变参与者行为,这组账外材料、人工错误被解释为例外的记录不产生回写”。把算法厌恶议题放到另见第 531 号第 17 条『AlphaTensor与FunSearch:机器发现的对象变成可验证算法』旁核验:先对齐对象、时间窗和责任人,再检查算法厌恶议题的核心判断在另一套分母中是否仍同向。

位置E|算法厌恶议题作环境条件 单因算法厌恶议题的核心决定项 预设〔01 谁进入分母〕算法厌恶议题沿用既定对象边界 量纲算法厌恶议题同向记录数/全部可核对记录数 失效漏掉算法正确但未被采纳的建等漏记者时,算法厌恶议题读数越高,真实覆盖反而越低 自曝算法厌恶议题(第6条):原材料未覆盖者需另表 空栏算法正确但未被采纳的建等漏记者 异名另见第 531 号第 17 条『AlphaTensor与FunSearch:机器发现的对象变成可验证算法』

庚、预测问题与政策问题必须拆开Prediction Policy Problems

提出Kleinberg、Ludwig、Mullainathan 与 Obermeyer,2015,《American Economic Review》105(5):491–495,DOI 10.1257/aer.p20151023。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键高预测精度只有在变量能映射到可改变的行动时才构成决策价值

商业分析与决策科学早期讨论“预测问题与政策问题必须拆开 Prediction Policy Problems”多从数据量、模型精度和管理者经验出发,Kleinberg、Ludwig、Mullainathan 与 Obermeyer在2015年的工作把被结算的对象与汇总读数提升为需要单独识别的层次。Shmueli(2010)并未否定问题本身,却证明决策约束、伦理边界与资源容量可能使最佳预测无法转成最佳政策,从而让“高精度但不可干预的变量、因法规不得使用的特征”进入例外处置清单的核对范围。

在Kleinberg、Ludwig、Mullainathan 与 Obermeyer的2015年论证中,“预测问题与政策问题必须拆开 Prediction Policy Problems”不再只是相关性标签,而明确主张:高预测精度只有在变量能映射到可改变的行动时才构成决策价值。围绕预测问题政策问题,按Shmueli(2010)给出的反例压力并对照Kleinberg、Ludwig、Mullainathan 与 Obermeyer、OECD两组材料,若对象或读数“本项证据”不起决定作用,那么“决定分析能否行动的只有预测量与可干预决策的对应”就应被判错。

经验判断的锚点来自Kleinberg、Ludwig、Mullainathan 与 Obermeyer(2015):2015年的框架用保释、医疗和招聘说明,预测“会发生什么”与决定“做什么”需要不同数据和反事实。预测问题政策问题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

“预测问题与政策问题必须拆开 Prediction Policy Problems”的适用边界由Shmueli(2010)集中提出:决策约束、伦理边界与资源容量可能使最佳预测无法转成最佳政策。Shmueli对Kleinberg、Ludwig、Mullainathan 与 Obermeyer的压力测试不是简单缩小范围,而是要求直接观察:当组织只奖励模型准确率时,方向反过来:预测越准可行动价值越低。沿预测问题政策问题的责任链,Kleinberg2015—Shmueli2010的争议已暴露明确的自我限制。复算预测问题政策问题之前,就Kleinberg、Ludwig、Mullainathan 与 Obermeyer提出、Shmueli质疑的命题而言,OECD到2024年的材料仍不能替代预先登记的失效检验。

把Kleinberg、Ludwig、Mullainathan 与 Obermeyer(2015)的证据带入风险定价时,分析负责人应在模型版本册中分别登记“可被决策规则利用的预测变量数”与“全部高精度变量数”,而不是只留下最终比率。依据Shmueli在2010年对Kleinberg、Ludwig、Mullainathan 与 Obermeyer的反例,并承接OECD的新场景,模型版本册还要显示“该未登记群体”的规模与去向,否则未被结算的代价会被误读为没有发生。为避免Kleinberg、Ludwig、Mullainathan 与 Obermeyer所述指标在Shmueli的边界情形中反客为主,OECD(2024)所对应的制度设计不是再加总分,而是公开口径变更、例外批准与账外成本。

Kleinberg、Ludwig、Mullainathan 与 Obermeyer、Kohavi、Tang 与 Xu分别从被结算的对象与读数和行动次序与反馈路径解释结果。二者并非重复,因为它们虽共同依赖“本项证据”的群体平均关系可直接外推到个体,这些漏记对象不构成异质群体”,却把因果责任放在不同环节。就预测问题政策问题的材料边界而言,进入、退出与未登记对象必须分开留痕。

位置E|预测问题政策问题作环境条件 单因预测问题政策问题的核心决定项 预设〔01 谁进入分母〕预测问题政策问题沿用既定对象边界 量纲预测问题政策问题同向记录数/全部可核对记录数 失效漏掉高精度但不可干预的变量等漏记者时,预测问题政策问题读数越高,真实覆盖反而越低 自曝预测问题政策问题(第7条):原材料未覆盖者需另表 空栏高精度但不可干预的变量等漏记者 异名另见第 533 号第 18 条『Diffusion Policy:动作分布变成条件去噪轨迹』

辛、在线对照实验成为产品决策基础设施Online Controlled Experiments

提出Kohavi、Tang 与 Xu,2020,《Trustworthy Online Controlled Experiments》,Cambridge University Press。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键数字产品应以随机对照而非意见权重决定功能效果

商业分析与决策科学早期讨论“在线对照实验成为产品决策基础设施 Online Controlled Experiments”多从数据量、模型精度和管理者经验出发,Kohavi、Tang 与 Xu在2020年的工作把行动次序、反馈和转折点提升为需要单独识别的层次。Gigerenzer 与 Brighton(2009)并未否定问题本身,却证明网络干扰、长期效应、样本污染和多重检验会破坏简单A/B解释,从而让“未启动、提前停止或因业务压力绕过实验的功能”进入例外处置清单的核对范围。

“在线对照实验成为产品决策基础设施 Online Controlled Experiments”的核心判断由Kohavi、Tang 与 Xu(2020)写明:数字产品应以随机对照而非意见权重决定功能效果。为了回应Gigerenzer 与 Brighton(2009)对Kohavi、Tang 与 Xu主张的异议,并接受NIST的新场景检验,解释焦点被放在行动路径“本项证据”上,本条只保留一个决定因素:决定产品因果结论的只有随机化实验闭环。

Gigerenzer 与 Brighton(2009)对Kohavi、Tang 与 Xu的批评、以及NIST的后续材料,使证据责任落到分母“全部上线变更数”:只有“进入随机对照的产品变更数/全部上线变更数”能区分普遍变化与选择性结果。数字产品机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对Kohavi、Tang 与 Xu(2020)的主张,Gigerenzer 与 Brighton在2009年给出的主要反证是:网络干扰、长期效应、样本污染和多重检验会破坏简单A/B解释。若按Gigerenzer 与 Brighton的反例复算Kohavi、Tang 与 Xu的命题,能够改变结论方向的条件是:当局部指标被反复优化而长期体验未入实验时,方向反过来:实验越多整体产品越碎片化。沿数字产品机制的责任链,Kohavi2020—Gigerenzer2009之争把证据责任推回边界样本。对照Kohavi、Tang 与 Xu的主张与Gigerenzer 与 Brighton的反证,NIST(2023)虽然扩展了观察场景,却仍需用同一“该复核口径”并列检验支持样本与反例。

在模型、看板与组织决策的现场,Kohavi、Tang 与 Xu(2020)所给读数必须由数据产品负责人写入决策日志,并说明“全部上线变更数”如何形成。当“上述分子—分母”与预算或问责挂钩时,NIST在2023年的治理场景回应了Kohavi、Tang 与 Xu、Gigerenzer 与 Brighton之间的分歧:应保留申诉、独立复核和第二次测量。

Kohavi、Tang 与 Xu、Athey 与 Imbens分别从行动次序与反馈路径和制度、技术与关系条件解释结果。二者并非重复,因为它们虽共同依赖“本项证据”的群体平均关系可直接外推到个体,这组账外材料不构成异质群体”,却把因果责任放在不同环节。就数字产品机制的材料边界而言,进入、退出与未登记对象必须分开留痕。把数字产品机制放到另见第 258 号第 5 条『在线实验把产品变化变成持续因果基础设施』旁核验:先对齐对象、时间窗和责任人,再检查数字产品机制的核心判断在另一套分母中是否仍同向。

位置D|数字产品机制作生成路径 单因数字产品机制的核心决定项 预设〔01 谁进入分母〕数字产品机制沿用既定对象边界 量纲数字产品机制同向记录数/全部可核对记录数 失效若数字产品机制可由替代机制重现,单因解释撤回 自曝数字产品机制(第8条):原材料未覆盖者需另表 空栏未启动、提前停止或因业等漏记者 异名另见第 258 号第 5 条『在线实验把产品变化变成持续因果基础设施』
【第二幕】这十年 · 约 2016—2026

2016—2026年的十二条把新框架推入治理现场。“因果机器学习从平均效应走向异质效应 Causal Machine Learning”显示部署后的适应,“机器学习技术债成为决策风险 Hidden Technical Debt in Machine Learning Systems”处理新的风险边界,“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”把责任延伸到持续运行与退出。

一、因果机器学习从平均效应走向异质效应Causal Machine Learning

提出Athey 与 Imbens,2019,《Annual Review of Economics》11:685–725,DOI 10.1146/annurev-economics-080217-053433。 争议Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。 最新Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。 关键只有在独立样本中稳定的异质处理效应才可用于差异化决策

Rai(2020)并未否定问题本身,却证明重叠不足、亚组过小与多次搜索可生成稳定外观的假异质性,从而让“被判为“无个体化价值”的大多数人、重叠不足样本”进入例外处置清单的核对范围。复算只有在独机制之前,Milanez、Lemmens 与 Ruggiu在2025年的更新把提问顺序进一步固定为:先确认谁被记录、怎样经过资源配置,再判断“该转向 Causal Machine Learning”是否在新场景中保持同义。

Athey 与 Imbens于2019年给出的立场可以直接接受反证:只有在独立样本中稳定的异质处理效应才可用于差异化决策。Rai(2020)迫使Athey 与 Imbens的命题在Milanez、Lemmens 与 Ruggiu的新场景中把解释焦点落到制度条件“因果机器学习从平均效应走向异质效应”,因此,判断标准被明确为:决定个体化决策的只有样本外异质效应。

Rai(2020)对Athey 与 Imbens的批评、以及Milanez、Lemmens 与 Ruggiu的后续材料,使证据责任落到分母“目标亚组有效样本量”:只有“样本外效应误差/目标亚组有效样本量”能区分普遍变化与选择性结果。只有在独机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

Rai(2020)把争论从有没有效应转向何时可识别,其核心异议为:重叠不足、亚组过小与多次搜索可生成稳定外观的假异质性。把Athey 与 Imbens的主张放到Rai的边界样本中,最关键的反向情形是:当真实异质性小于估计噪声时,方向反过来:个体化越细平均伤害越大。既然文献已经把这项限制说清,为检验Athey 与 Imbens、Rai之间的分歧,Milanez、Lemmens 与 Ruggiu在2025年之后的研究就必须公开反向结果,否则争论仍不会收敛。

Athey 与 Imbens(2019)的主张若进入实践,第一项治理动作应是改造例外处置清单:由模型风险团队把“这一比率”拆开留痕。对Rai(2020)针对Athey 与 Imbens所指出、并由Milanez、Lemmens 与 Ruggiu继续检验的盲区,最低治理要求是让“这些漏记对象、重叠不足样本”可追溯,而不是在汇总时静默删除。回应Athey 与 Imbens的证据与Rai的边界批评,Milanez、Lemmens 与 Ruggiu(2025)的更新进一步要求分离指标定义者、资源配置批准者与复核者,并在部署后再次测量行为回写。

把Athey 与 Imbens(2019)和Kleinberg、Ludwig、Mullainathan 与 Obermeyer(2015)并读,可以看到“本项证据 Causal Machine Learning”追问制度、技术与关系条件,“预测问题与政策问题必须拆开 Prediction Policy Problems”追问被结算的对象与读数,两条命题共享的未言明条件是“这一制度安排”的群体平均关系可直接外推到个体,这组账外材料、重叠不足样本不构成异质群体”。把只有在独机制放到另见第 257 号第 11 条『因果森林把“平均有效”拆成可推断的异质效应』旁核验:先对齐对象、时间窗和责任人,再检查只有在独机制的核心判断在另一套分母中是否仍同向。

位置E|只有在独机制作环境条件 单因只有在独机制的核心决定项 预设〔01 谁进入分母〕只有在独机制沿用既定对象边界 量纲只有在独机制同向记录数/全部可核对记录数 失效若只有在独机制可由替代机制重现,单因解释撤回 自曝只有在独机制(第9条):原材料未覆盖者需另表 空栏被判为“无个体化价值”的大多 异名另见第 257 号第 11 条『因果森林把“平均有效”拆成可推断的异质效应』

二、算法欣赏在匿名建议中出现Algorithm Appreciation

提出Logg、Minson 与 Moore,2019,《Organizational Behavior and Human Decision Processes》151:90–103,DOI 10.1016/j.obhdp.2018.12.005。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键在未观察算法犯错且任务可量化时,人们可能比重视他人更重视算法

就算法欣赏议题的材料边界而言,进入、退出与未登记对象必须分开留痕。对照Shmueli(2010)的反例可见,专家身份、任务主观性和透明度会削弱算法欣赏,若业务决策委员会删去“被接受但没有留下理由的算法建议、被忽略的人类少数意见”,表面稳定很可能只是样本边界被改写。OECD在2024年的材料把Logg、Minson 与 Moore、Shmueli之间的分歧带入试验注册表:同名结果若经历不同模型部署,就不能被视为同一事实。

Logg、Minson 与 Moore于2019年给出的立场可以直接接受反证:在未观察算法犯错且任务可量化时,人们可能比重视他人更重视算法。Shmueli(2010)迫使Logg、Minson 与 Moore的命题在OECD的新场景中把解释焦点落到对象或读数“算法欣赏在匿名建议中出现”,因此,判断标准被明确为:决定算法建议权重的只有建议来源如何呈现。

Logg、Minson 与 Moore(2019)给出的关键读数为:多项实验中,参与者在估计数量、预测排名等任务上通常更靠近算法建议,尤其当算法与普通人的建议并列。算法欣赏议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

“算法欣赏在匿名建议中出现 Algorithm Appreciation”的适用边界由Shmueli(2010)集中提出:专家身份、任务主观性和透明度会削弱算法欣赏。Shmueli对Logg、Minson 与 Moore的压力测试不是简单缩小范围,而是要求直接观察:当算法被赋予组织权威而非中性建议时,方向反过来:权威越强抵触越大。按算法欣赏议题的对象表,Logg2019—Shmueli2010的争议已暴露明确的自我限制。就Logg、Minson 与 Moore提出、Shmueli质疑的命题而言,OECD到2024年的材料仍不能替代预先登记的失效检验。

对照算法欣赏议题的主源,按照Logg、Minson 与 Moore在2019年建立的口径,业务决策委员会处理模型部署不能只引用“这一比率”,还要让试验注册表保存分子、分母与口径变更。OECD到2024年的材料说明,模型部署实施后参与者会适应,业务决策委员会因而必须沿Logg、Minson 与 Moore、Shmueli之间的争议线观察指标使用前后决策质量、可追责性与长期绩效是否仍同义。

Logg、Minson 与 Moore、Rudin的两组证据可以在本块内部对读:“算法欣赏在匿名建议中出现 Algorithm Appreciation”把解释焦点放在被结算的对象与读数,“可解释性不能代替可理解模型 Interpretable Models over Post-hoc Explanations”则放在制度、技术与关系条件,二者都默认“上述机制”的局部改善可以加总为整体改善,这组账外材料、被忽略的人类少数意见不会造成系统性抵消”。把算法欣赏议题放到另见第 569 号第 15 条『Green Algorithms碳核算』旁核验:先对齐对象、时间窗和责任人,再检查算法欣赏议题的核心判断在另一套分母中是否仍同向。

位置S|算法欣赏议题作结果量 单因算法欣赏议题的核心决定项 预设〔01 谁进入分母〕算法欣赏议题沿用既定对象边界 量纲算法欣赏议题同向记录数/全部可核对记录数 失效若算法欣赏议题可由替代机制重现,单因解释撤回 自曝算法欣赏议题(第10条):原材料未覆盖者需另表 空栏被接受但没有留下理由的等漏记者 异名另见第 569 号第 15 条『Green Algorithms碳核算』

三、人机互补比替代更能解释绩效Hybrid Intelligence

提出Dellermann、Ebel、Söllner 与 Leimeister,2019,《Business & Information Systems Engineering》61:637–643,DOI 10.1007/s12599-019-00595-2。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键机器应承担规模与一致性,人承担语境、目标和异常判断

Gigerenzer 与 Brighton在2009年的异议把难点落到模型版本册:分工规则会随模型进步和人员技能变化,固定接口很快过时,而“在人机交接处失去所有者的案例、无人复核的低置信输出”正是旧账本没有位置的那部分。NIST(2023)由此把“该转向 Hybrid Intelligence”从经验标签改成责任链,要求模型版本册同时保存进入、退出与未分类事件。

在Dellermann、Ebel、Söllner 与 Leimeister的2019年论证中,“人机互补比替代更能解释绩效 Hybrid Intelligence”不再只是相关性标签,而明确主张:机器应承担规模与一致性,人承担语境、目标和异常判断。按Gigerenzer 与 Brighton(2009)给出的反例压力并对照Dellermann、Ebel、Söllner 与 Leimeister、NIST两组材料,若行动路径“本项证据”不起决定作用,那么“决定人机系统质量的只有任务分工结构”就应被判错。

Dellermann、Ebel、Söllner 与 Leimeister在2019年提供的主证据是:混合智能框架把学习、互补和持续适应列为核心,在众包、医疗和内容审核中,简单替代常把边界案例转成系统误差。机器机制的结构读数拆成4项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

Gigerenzer 与 Brighton(2009)把争论从有没有效应转向何时可识别,其核心异议为:分工规则会随模型进步和人员技能变化,固定接口很快过时。把Dellermann、Ebel、Söllner 与 Leimeister的主张放到Gigerenzer 与 Brighton的边界样本中,最关键的反向情形是:当人只处理机器最难的残余案例时,方向反过来:人工表现越差并非能力下降而是任务分布恶化。既然文献已经把这项限制说清,为检验Dellermann、Ebel、Söllner 与 Leimeister、Gigerenzer 与 Brighton之间的分歧,NIST在2023年之后的研究就必须公开反向结果,否则争论仍不会收敛。

把Dellermann、Ebel、Söllner 与 Leimeister(2019)的证据带入风险定价时,分析负责人应在模型版本册中分别登记“互补任务正确完成数”与“全部人机任务数”,而不是只留下最终比率。为避免Dellermann、Ebel、Söllner 与 Leimeister所述指标在Gigerenzer 与 Brighton的边界情形中反客为主,NIST(2023)所对应的制度设计不是再加总分,而是公开口径变更、例外批准与账外成本。机器机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

Dellermann、Ebel、Söllner 与 Leimeister、Logg、Minson 与 Moore分别从行动次序与反馈路径和被结算的对象与读数解释结果。二者并非重复,因为它们虽共同依赖“人机互补比替代更能解释绩效”的局部改善可以加总为整体改善,这组账外材料、无人复核的低置信输出不会造成系统性抵消”,却把因果责任放在不同环节。就机器机制的材料边界而言,进入、退出与未登记对象必须分开留痕。把机器机制放到另见第 563 号第 7 条『Mission Innovation』旁核验:先对齐对象、时间窗和责任人,再检查机器机制的核心判断在另一套分母中是否仍同向。

位置S|机器机制作结果量 单因机器机制的核心决定项 预设〔01 谁进入分母〕机器机制沿用既定对象边界 量纲机器机制同向记录数/全部可核对记录数 失效若机器机制可由替代机制重现,单因解释撤回 自曝机器机制(第11条):原材料未覆盖者需另表 空栏在人机交接处失去所有者等漏记者 异名另见第 563 号第 7 条『Mission Innovation』

四、可解释性不能代替可理解模型Interpretable Models over Post-hoc Explanations

提出Rudin,2019,《Nature Machine Intelligence》1:206–215,DOI 10.1038/s42256-019-0048-x。 争议Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。 最新Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。 关键高风险决策应优先使用可解释模型,而非给黑箱附加近似解释

Rai(2020)随后用边界材料指出:复杂感知任务可能确需深度模型,解释模型也可能掩盖数据偏差,这使决策日志中的“解释器无法覆盖的反事实、被解释图隐藏的交互项”不能继续按普通缺失处理。到2025年,Milanez、Lemmens 与 Ruggiu把Rudin提出、Rai质疑的这条线推进到决策日志的部署后复核:数据产品负责人不仅要解释结果,还要说明产品上线如何回写对象与分母。

Rudin于2019年给出的立场可以直接接受反证:高风险决策应优先使用可解释模型,而非给黑箱附加近似解释。Rai(2020)迫使Rudin的命题在Milanez、Lemmens 与 Ruggiu的新场景中把解释焦点落到制度条件“可解释性不能代替可理解模型”,因此,判断标准被明确为:决定高风险解释可信度的只有模型本身是否可理解。

经验判断的锚点来自Rudin(2019):医疗、司法和信用案例显示,局部解释可能忠实度不足,简单评分表在若干结构化任务上可达到与复杂模型相近的性能。为复核Rudin提出而Rai质疑的命题,按照Milanez、Lemmens 与 Ruggiu(2025)的更新口径,第三方至少要获得原始分母、事件定义和“该未登记群体”清单,不能只接收汇总图表。高风险决策机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

Rai(2020)把争论从有没有效应转向何时可识别,其核心异议为:复杂感知任务可能确需深度模型,解释模型也可能掩盖数据偏差。把Rudin的主张放到Rai的边界样本中,最关键的反向情形是:当透明模型因被操纵而快速失真时,方向反过来:可解释性越强可预测性越弱。既然文献已经把这项限制说清,为检验Rudin、Rai之间的分歧,Milanez、Lemmens 与 Ruggiu在2025年之后的研究就必须公开反向结果,否则争论仍不会收敛。

在高风险决策机制的实施账本里,按照Rudin在2019年建立的口径,业务决策委员会处理模型部署不能只引用“这一比率”,还要让试验注册表保存分子、分母与口径变更。Rai(2020)提醒,业务决策委员会必须为Rudin提出而Milanez、Lemmens 与 Ruggiu继续检验的“该未登记群体”提供查询位置,在Rai所划定的责任边界里,它若没有位置,责任便会在部门之间消失。

Rudin、Dellermann、Ebel、Söllner 与 Leimeister的两组证据可以在本块内部对读:“可解释性不能代替可理解模型 Interpretable Models over Post-hoc Explanations”把解释焦点放在制度、技术与关系条件,“人机互补比替代更能解释绩效 Hybrid Intelligence”则放在行动次序与反馈路径,二者都默认“上述机制”的局部改善可以加总为整体改善,这些漏记对象不会造成系统性抵消”。把高风险决策机制放到另见第 563 号第 7 条『Mission Innovation』旁核验:先对齐对象、时间窗和责任人,再检查高风险决策机制的核心判断在另一套分母中是否仍同向。

位置E|高风险决策机制作环境条件 单因高风险决策机制的核心决定项 预设〔01 谁进入分母〕高风险决策机制沿用既定对象边界 量纲高风险决策机制同向记录数/全部可核对记录数 失效若高风险决策机制可由替代机制重现,单因解释撤回 自曝高风险决策机制(第12条):原材料未覆盖者需另表 空栏解释器无法覆盖的反事实等漏记者 异名另见第 563 号第 7 条『Mission Innovation』

五、公平约束揭露代理变量偏差Algorithmic Fairness Constraints

提出Obermeyer、Powers、Vogeli 与 Mullainathan,2019,《Science》366(6464):447–453,DOI 10.1126/science.aax2342。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键公平首先取决于预测目标,而非删除敏感属性

就公平首先判据的材料边界而言,进入、退出与未登记对象必须分开留痕。对照Shmueli(2010)的反例可见,公平指标彼此可能不可同时满足,且真实需要也受历史不平等影响,若业务决策委员会删去“从未产生高费用却有高需要的人、因获取障碍缺少诊疗记录者”,表面稳定很可能只是样本边界被改写。OECD在2024年的材料把Obermeyer、Powers、Vogeli 与 Mullainathan、Shmueli之间的分歧带入试验注册表:同名结果若经历不同模型部署,就不能被视为同一事实。

Obermeyer、Powers、Vogeli 与 Mullainathan于2019年给出的立场可以直接接受反证:公平首先取决于预测目标,而非删除敏感属性。Shmueli(2010)迫使Obermeyer、Powers、Vogeli 与 Mullainathan的命题在OECD的新场景中把解释焦点落到对象或读数“公平约束揭露代理变量偏差”,因此,判断标准被明确为:决定公平性的只有目标变量是否代表真实需要。

Obermeyer、Powers、Vogeli 与 Mullainathan在2019年提供的主证据是:研究发现美国医疗管理算法以费用代理健康需要,在同一风险分数下黑人患者病情更重,修正目标可把进入重点照护的黑人比例从17.7%提高到46.5%。从公平首先判据的材料看,Shmueli在2010年对Obermeyer、Powers、Vogeli 与 Mullainathan的反例、以及OECD的新场景说明,只报“被识别为高风险的弱势患者数”无法比较,分析负责人应以“被识别为高风险的弱势患者数/全部真实高风险患者数”把分子和分母一起公开。

“公平约束揭露代理变量偏差 Algorithmic Fairness Constraints”的适用边界由Shmueli(2010)集中提出:公平指标彼此可能不可同时满足,且真实需要也受历史不平等影响。Shmueli对Obermeyer、Powers、Vogeli 与 Mullainathan的压力测试不是简单缩小范围,而是要求直接观察:当修正目标提高某群体进入率却资源容量固定时,方向反过来:形式公平增加等待不平等。核查公平首先判据时,Obermeyer2019—Shmueli2010的争议已暴露明确的自我限制。在公平首先判据这条证据链上,就Obermeyer、Powers、Vogeli 与 Mullainathan提出、Shmueli质疑的命题而言,OECD到2024年的材料仍不能替代预先登记的失效检验。

对公平首先判据做反向检验,在模型、看板与组织决策的现场,Obermeyer、Powers、Vogeli 与 Mullainathan(2019)所给读数必须由数据产品负责人写入决策日志,并说明“全部真实高风险患者数”如何形成。把公平首先判据放回原窗口,当“这一比率”与预算或问责挂钩时,OECD在2024年的治理场景回应了Obermeyer、Powers、Vogeli 与 Mullainathan、Shmueli之间的分歧:应保留申诉、独立复核和第二次测量。公平首先判据的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

把公平首先判据放到另见第 258 号第 9 条『公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到』旁核验:先对齐对象、时间窗和责任人,再检查公平首先判据的核心判断在另一套分母中是否仍同向。

位置S|公平首先判据作结果量 单因公平首先判据的核心决定项 预设〔01 谁进入分母〕公平首先判据沿用既定对象边界 量纲公平首先判据同向记录数/全部可核对记录数 失效若公平首先判据可由替代机制重现,单因解释撤回 自曝公平首先判据(第13条):原材料未覆盖者需另表 空栏从未产生高费用 异名另见第 258 号第 9 条『公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到』

六、指标专制把度量变成目标The Tyranny of Metrics

提出Muller,2018,《The Tyranny of Metrics》,Princeton University Press。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键量化指标一旦成为奖惩目标就会改变被考核行为

商业分析与决策科学早期讨论“指标专制把度量变成目标 The Tyranny of Metrics”多从数据量、模型精度和管理者经验出发,Muller在2018年的工作把行动次序、反馈和转折点提升为需要单独识别的层次。NIST在2023年的更新把提问顺序进一步固定为:先确认谁被记录、怎样经过资源配置,再判断“该转向 The Tyranny of Metrics”是否在新场景中保持同义。

Muller(2018)把命题收紧为可反驳的一句:量化指标一旦成为奖惩目标就会改变被考核行为。Gigerenzer 与 Brighton在2009年对Muller的边界批评、以及NIST的后续场景,使责任不能分散到笼统因素,必须检验行动路径“指标专制把度量变成目标”,判断标准是决定指标失真的只有指标是否与奖惩绑定。

Muller(2018)给出的关键读数为:教育、医疗、警务与企业案例反复出现挑选客户、推迟记录和转移成本,问题并非数字本身,而是单一数字独占资源分配。指标专制研究的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对Muller(2018)的主张,Gigerenzer 与 Brighton在2009年给出的主要反证是:多指标组合、审计和职业规范可缓解但不能消除策略适应。若按Gigerenzer 与 Brighton的反例复算Muller的命题,能够改变结论方向的条件是:当指标只用于学习且不与资源绑定时,方向反过来:公开度越高改善越快。核查指标专制研究时,Muller2018—Gigerenzer2009之争把证据责任推回边界样本。对照Muller的主张与Gigerenzer 与 Brighton的反证,NIST(2023)虽然扩展了观察场景,却仍需用同一“该复核口径”并列检验支持样本与反例。

在指标专制研究这条证据链上,按照Muller在2018年建立的口径,业务决策委员会处理模型部署不能只引用“上述分子—分母”,还要让试验注册表保存分子、分母与口径变更。NIST到2023年的材料说明,模型部署实施后参与者会适应,业务决策委员会因而必须沿Muller、Gigerenzer 与 Brighton之间的争议线观察指标使用前后决策质量、可追责性与长期绩效是否仍同义。指标专制研究的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

把Muller(2018)和Sculley 等(2015)并读,可以看到“指标专制把度量变成目标 The Tyranny of Metrics”追问行动次序与反馈路径,“机器学习技术债成为决策风险 Hidden Technical Debt in Machine Learning Systems”追问制度、技术与关系条件,两条命题共享的未言明条件是“上述机制”一旦被制度采用仍测量原来那件事,这组账外材料、未被指标命名的质量不因考核而扩大”。把指标专制研究放到另见第 520 号第 16 条『指标反应性:一旦成为目标,读数就会改变含义』旁核验:先对齐对象、时间窗和责任人,再检查指标专制研究的核心判断在另一套分母中是否仍同向。

位置D|指标专制研究作生成路径 单因指标专制研究的核心决定项 预设〔01 谁进入分母〕指标专制研究沿用既定对象边界 量纲指标专制研究同向记录数/全部可核对记录数 失效漏掉被拒绝的高难度客户时,指标专制研究读数越高,真实覆盖反而越低 自曝指标专制研究(第14条):原材料未覆盖者需另表 空栏被拒绝的高难度客户 异名另见第 520 号第 16 条『指标反应性:一旦成为目标,读数就会改变含义』

七、机器学习技术债成为决策风险Hidden Technical Debt in Machine Learning Systems

提出Sculley 等,2015,NeurIPS论文《Hidden Technical Debt in Machine Learning Systems》。 争议Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。 最新Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。 关键模型上线后的依赖、反馈和数据漂移才是主要成本

Rai在2020年的异议把难点落到模型版本册:论文基于工程经验而非统一样本,债务难以用单一货币量化,而“未被版本控制的数据、失败特征、临时补丁和人工绕行”正是旧账本没有位置的那部分。Milanez、Lemmens 与 Ruggiu(2025)由此把“该转向 Hidden Technical Debt in Machine Learning Systems”从经验标签改成责任链,要求模型版本册同时保存进入、退出与未分类事件。

在Sculley 等的2015年论证中,“机器学习技术债成为决策风险 Hidden Technical Debt in Machine Learning Systems”不再只是相关性标签,而明确主张:模型上线后的依赖、反馈和数据漂移才是主要成本。按Rai(2020)给出的反例压力并对照Sculley 等、Milanez、Lemmens 与 Ruggiu两组材料,若制度条件“本项证据”不起决定作用,那么“决定模型长期成本的只有数据与系统依赖链”就应被判错。

Sculley 等在2015年提供的主证据是:Google团队总结数据依赖、纠缠、反馈回路和管道胶水等债务,指出模型代码只是整个系统很小一部分。机器学习议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对Sculley 等(2015)的主张,Rai在2020年给出的主要反证是:论文基于工程经验而非统一样本,债务难以用单一货币量化。若按Rai的反例复算Sculley 等的命题,能够改变结论方向的条件是:当团队频繁迭代却没有删除旧依赖时,方向反过来:发布越快有效创新越慢。在机器学习议题这条证据链上,Sculley2015—Rai2020之争把证据责任推回边界样本。对照Sculley 等的主张与Rai的反证,Milanez、Lemmens 与 Ruggiu(2025)虽然扩展了观察场景,却仍需用同一“该复核口径”并列检验支持样本与反例。

Sculley 等(2015)的主张若进入实践,第一项治理动作应是改造例外处置清单:由模型风险团队把“上述分子—分母”拆开留痕。对Rai(2020)针对Sculley 等所指出、并由Milanez、Lemmens 与 Ruggiu继续检验的盲区,最低治理要求是让“这些漏记对象、临时补丁和人工绕行”可追溯,而不是在汇总时静默删除。回应Sculley 等的证据与Rai的边界批评,Milanez、Lemmens 与 Ruggiu(2025)的更新进一步要求分离指标定义者、资源配置批准者与复核者,并在部署后再次测量行为回写。

Sculley 等、Obermeyer、Powers、Vogeli 与 Mullainathan的两组证据可以在本块内部对读:“机器学习技术债成为决策风险 Hidden Technical Debt in Machine Learning Systems”把解释焦点放在制度、技术与关系条件,“公平约束揭露代理变量偏差 Algorithmic Fairness Constraints”则放在被结算的对象与读数,二者都默认“上述机制”一旦被制度采用仍测量原来那件事,这组账外材料、临时补丁和人工绕行不因考核而扩大”。把机器学习议题放到另见第 258 号第 8 条『机器学习技术债把模型外部依赖视为主要复杂度』旁核验:先对齐对象、时间窗和责任人,再检查机器学习议题的核心判断在另一套分母中是否仍同向。

位置E|机器学习议题作环境条件 单因机器学习议题的核心决定项 预设〔01 谁进入分母〕机器学习议题沿用既定对象边界 量纲机器学习议题同向记录数/全部可核对记录数 失效若机器学习议题可由替代机制重现,单因解释撤回 自曝机器学习议题(第15条):原材料未覆盖者需另表 空栏未被版本控制的数据、失等漏记者 异名另见第 258 号第 8 条『机器学习技术债把模型外部依赖视为主要复杂度』

八、数字孪生把预测变成连续决策Digital Twins for Prescriptive Decisions

提出Fuller、Fan、Day 与 Barlow,2020,《IEEE Access》8:108952–108971,DOI 10.1109/ACCESS.2020.2998358。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键数字孪生只有持续接收现实反馈并影响行动才区别于静态仿真

在Fuller、Fan、Day 与 Barlow(2020)之前,“数字孪生把预测变成连续决策 Digital Twins for Prescriptive Decisions”常由数据量、模型精度和管理者经验直接结算,研究很少说明被结算的对象与汇总读数怎样改变同一指标的含义。Shmueli(2010)随后用边界材料指出:传感器误差、模型老化和组织不执行建议会切断闭环,这使决策日志中的“离线期间的状态、未装传感器的部件、人工维护经验”不能继续按普通缺失处理。

在Fuller、Fan、Day 与 Barlow的2020年论证中,“数字孪生把预测变成连续决策 Digital Twins for Prescriptive Decisions”不再只是相关性标签,而明确主张:数字孪生只有持续接收现实反馈并影响行动才区别于静态仿真。对数字孪生研究做反向检验,按Shmueli(2010)给出的反例压力并对照Fuller、Fan、Day 与 Barlow、OECD两组材料,若对象或读数“本项证据”不起决定作用,那么“决定孪生价值的只有物理对象与模型闭环同步”就应被判错。

Fuller、Fan、Day 与 Barlow在2020年提供的主证据是:2020年综述梳理制造、城市和医疗应用,指出实时数据、模型更新与双向连接是共同特征。把数字孪生研究放回原窗口,Shmueli在2010年对Fuller、Fan、Day 与 Barlow的反例、以及OECD的新场景说明,只报“同步更新次数”无法比较,分析负责人应以“同步更新次数/全部关键状态变化次数”把分子和分母一起公开。数字孪生研究的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

Shmueli(2010)把争论从有没有效应转向何时可识别,其核心异议为:传感器误差、模型老化和组织不执行建议会切断闭环。把Fuller、Fan、Day 与 Barlow的主张放到Shmueli的边界样本中,最关键的反向情形是:当系统为追随传感器噪声而频繁调整时,方向反过来:同步越快运营越不稳定。既然文献已经把这项限制说清,为检验Fuller、Fan、Day 与 Barlow、Shmueli之间的分歧,OECD在2024年之后的研究就必须公开反向结果,否则争论仍不会收敛。

就数字孪生研究的外推边界看,在模型、看板与组织决策的现场,Fuller、Fan、Day 与 Barlow(2020)所给读数必须由数据产品负责人写入决策日志,并说明“全部关键状态变化次数”如何形成。围绕数字孪生研究,当“这一比率”与预算或问责挂钩时,OECD在2024年的治理场景回应了Fuller、Fan、Day 与 Barlow、Shmueli之间的分歧:应保留申诉、独立复核和第二次测量。数字孪生研究的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

Fuller、Fan、Day 与 Barlow、Jordon、Yoon 与 van der Schaar的两组证据可以在本块内部对读:“本项证据 Digital Twins for Prescriptive Decisions”把解释焦点放在被结算的对象与读数,“合成数据需要测量保真与泄露 Synthetic Data Governance”则放在行动次序与反馈路径,二者都默认“这一制度安排”通过清单与形式审查就等于实质风险受控,这些漏记对象、人工维护经验不必另行验证”。

位置D|数字孪生研究作生成路径 单因数字孪生研究的核心决定项 预设〔01 谁进入分母〕数字孪生研究沿用既定对象边界 量纲数字孪生研究同向记录数/全部可核对记录数 失效若数字孪生研究可由替代机制重现,单因解释撤回 自曝数字孪生研究(第16条):原材料未覆盖者需另表 空栏离线期间的状态、未装传等漏记者 异名另见第 531 号第 17 条『AlphaTensor与FunSearch:机器发现的对象变成可验证算法』

九、合成数据需要测量保真与泄露Synthetic Data Governance

提出Jordon、Yoon 与 van der Schaar,2022,《npj Digital Medicine》5:80,DOI 10.1038/s41746-022-00623-4。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键合成数据不能只看“像不像”,必须同时验证任务效用和隐私泄露

商业分析与决策科学早期讨论“合成数据需要测量保真与泄露 Synthetic Data Governance”多从数据量、模型精度和管理者经验出发,Jordon、Yoon 与 van der Schaar在2022年的工作把行动次序、反馈和转折点提升为需要单独识别的层次。Gigerenzer 与 Brighton(2009)并未否定问题本身,却证明高平均保真可能掩盖稀有群体消失,隐私指标也不等于法规合规,从而让“生成失败的极端样本、被平滑掉的小群体、未记录生成随机种子”进入例外处置清单的核对范围。

“合成数据需要测量保真与泄露 Synthetic Data Governance”的核心判断由Jordon、Yoon 与 van der Schaar(2022)写明:合成数据不能只看“像不像”,必须同时验证任务效用和隐私泄露。为了回应Gigerenzer 与 Brighton(2009)对Jordon、Yoon 与 van der Schaar主张的异议,并接受NIST的新场景检验,解释焦点被放在行动路径“本项证据”上,本条只保留一个决定因素:决定合成数据可用性的只有效用与隐私的联合边界。

经验判断的锚点来自Jordon、Yoon 与 van der Schaar(2022):综述将合成数据分为统计、生成模型与仿真路径,并强调成员推断、属性泄露和少数群体失真测试。合成数据需泄露的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

“合成数据需要测量保真与泄露 Synthetic Data Governance”的适用边界由Gigerenzer 与 Brighton(2009)集中提出:高平均保真可能掩盖稀有群体消失,隐私指标也不等于法规合规。Gigerenzer 与 Brighton对Jordon、Yoon 与 van der Schaar的压力测试不是简单缩小范围,而是要求直接观察:当隐私保护增强并抹去稀有模式时,方向反过来:泄露越少决策歧视越大。把合成数据需泄露放回原窗口,Jordon2022—Gigerenzer2009的争议已暴露明确的自我限制。就合成数据需泄露的外推边界看,就Jordon、Yoon 与 van der Schaar提出、Gigerenzer 与 Brighton质疑的命题而言,NIST到2023年的材料仍不能替代预先登记的失效检验。

围绕合成数据需泄露,按照Jordon、Yoon 与 van der Schaar在2022年建立的口径,业务决策委员会处理模型部署不能只引用“这一比率”,还要让试验注册表保存分子、分母与口径变更。NIST到2023年的材料说明,模型部署实施后参与者会适应,业务决策委员会因而必须沿Jordon、Yoon 与 van der Schaar、Gigerenzer 与 Brighton之间的争议线观察指标使用前后决策质量、可追责性与长期绩效是否仍同义。

Jordon、Yoon 与 van der Schaar提出的“本项证据 Synthetic Data Governance”并非孤立条目,Mitchell 等处理“模型卡把算法责任写成标准字段 Model Cards”时从制度、技术与关系条件解释同类结果,正好检验前者对行动次序与反馈路径的强调是否过强。把合成数据需泄露放到另见第 531 号第 15 条『Halicin与abaucin:模型必须把化学空间带到湿实验验证』旁核验:先对齐对象、时间窗和责任人,再检查合成数据需泄露的核心判断在另一套分母中是否仍同向。

位置D|合成数据需泄露作生成路径 单因合成数据需泄露的核心决定项 预设〔01 谁进入分母〕合成数据需泄露沿用既定对象边界 量纲合成数据需泄露同向记录数/全部可核对记录数 失效若合成数据需泄露可由替代机制重现,单因解释撤回 自曝合成数据需泄露(第17条):原材料未覆盖者需另表 空栏生成失败的极端样本、被等漏记者 异名另见第 531 号第 15 条『Halicin与abaucin:模型必须把化学空间带到湿实验验证』

十、模型卡把算法责任写成标准字段Model Cards

提出Mitchell 等,2019,FAT*论文《Model Cards for Model Reporting》,DOI 10.1145/3287560.3287596。 争议Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。 最新Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。 关键模型应公开预期用途、群体性能、伦理考虑和限制

在Mitchell 等(2019)之前,“模型卡把算法责任写成标准字段 Model Cards”常由数据量、模型精度和管理者经验直接结算,研究很少说明制度、技术与关系条件怎样改变同一指标的含义。Rai(2020)随后用边界材料指出:文档可以完整而模型仍有害,且维护责任常在发布后消失,这使决策日志中的“未记录的数据删除、失败版本、被业务方超范围使用的场景”不能继续按普通缺失处理。到2025年,Milanez、Lemmens 与 Ruggiu把Mitchell 等提出、Rai质疑的这条线推进到决策日志的部署后复核:数据产品负责人不仅要解释结果,还要说明产品上线如何回写对象与分母。

Mitchell 等(2019)把命题收紧为可反驳的一句:模型应公开预期用途、群体性能、伦理考虑和限制。Rai在2020年对Mitchell 等的边界批评、以及Milanez、Lemmens 与 Ruggiu的后续场景,使责任不能分散到笼统因素,必须检验制度条件“模型卡把算法责任写成标准字段”,判断标准是决定模型可问责性的只有用途边界是否被公开。

Rai(2020)对Mitchell 等的批评、以及Milanez、Lemmens 与 Ruggiu的后续材料,使证据责任落到分母“全部必要字段数”:只有“已填写模型卡字段数/全部必要字段数”能区分普遍变化与选择性结果。模型卡研究的结构读数拆成3项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

“该转向 Model Cards”的适用边界由Rai(2020)集中提出:文档可以完整而模型仍有害,且维护责任常在发布后消失。Rai对Mitchell 等的压力测试不是简单缩小范围,而是要求直接观察:当模型卡成为合规勾选而不影响部署权时,方向反过来:文档越完整实质审查越弱。就模型卡研究的外推边界看,Mitchell2019—Rai2020的争议已暴露明确的自我限制。就Mitchell 等提出、Rai质疑的命题而言,Milanez、Lemmens 与 Ruggiu到2025年的材料仍不能替代预先登记的失效检验。

按照Mitchell 等在2019年建立的口径,业务决策委员会处理模型部署不能只引用“这一比率”,还要让试验注册表保存分子、分母与口径变更。Milanez、Lemmens 与 Ruggiu到2025年的材料说明,模型部署实施后参与者会适应,业务决策委员会因而必须沿Mitchell 等、Rai之间的争议线观察指标使用前后决策质量、可追责性与长期绩效是否仍同义。模型卡研究的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

Mitchell 等、Jordon、Yoon 与 van der Schaar的两组证据可以在本块内部对读:“这一制度安排 Model Cards”把解释焦点放在制度、技术与关系条件,“合成数据需要测量保真与泄露 Synthetic Data Governance”则放在行动次序与反馈路径,二者都默认“该研究线索”通过清单与形式审查就等于实质风险受控,这组账外材料、被业务方超范围使用的场景不必另行验证”。

位置E|模型卡研究作环境条件 单因模型卡研究的核心决定项 预设〔01 谁进入分母〕模型卡研究沿用既定对象边界 量纲模型卡研究同向记录数/全部可核对记录数 失效若模型卡研究可由替代机制重现,单因解释撤回 自曝模型卡研究(第18条):原材料未覆盖者需另表 空栏未记录的数据删除、失败等漏记者 异名另见第 258 号第 10 条『模型卡把用途、亚群与失败条件写进产品接口』

十一、生成式人工智能呈现锯齿状能力边界Jagged Technological Frontier

提出Dell’Acqua 等,2023,Harvard Business School Working Paper 24-013《Navigating the Jagged Technological Frontier》。 争议Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。 最新OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。 关键生成式人工智能对同一职业中的不同任务会同时带来提升与失败

Dell’Acqua 等在2023年提出“生成式人工智能呈现锯齿状能力边界 Jagged Technological Frontier”时,面对的旧框架仍以数据量、模型精度和管理者经验为主,被结算的对象与汇总读数只在结果异常后才被追问。Shmueli在2010年的异议把难点落到模型版本册:实验使用特定模型和咨询任务,短期效率不能自动外推组织学习,而“未提交的错误草稿、被人工悄悄修正的幻觉、因工具而未练习的技能”正是旧账本没有位置的那部分。

在Dell’Acqua 等的2023年论证中,“生成式人工智能呈现锯齿状能力边界 Jagged Technological Frontier”不再只是相关性标签,而明确主张:生成式人工智能对同一职业中的不同任务会同时带来提升与失败。按Shmueli(2010)给出的反例压力并对照Dell’Acqua 等、OECD两组材料,若对象或读数“本项证据”不起决定作用,那么“决定生成式工具增益的只有任务是否落在能力边界内”就应被判错。

经验判断的锚点来自Dell’Acqua 等(2023):对758名咨询顾问的实验中,处于模型能力边界内的任务完成速度提高约25%,质量提高约40%,边界外任务则更易出现自信错误。为检验Shmueli(2010)针对Dell’Acqua 等所指出的选择问题,并接续OECD的更新,不能只展示“工具辅助后正确任务数”,而要在试验注册表中按“工具辅助后正确任务数/全部分配任务数”重算。为复核Dell’Acqua 等提出而Shmueli质疑的命题,按照OECD(2024)的更新口径,第三方至少要获得原始分母、事件定义和“该未登记群体、因工具而未练习的技能”清单,不能只接收汇总图表。

Shmueli(2010)把争论从有没有效应转向何时可识别,其核心异议为:实验使用特定模型和咨询任务,短期效率不能自动外推组织学习。把Dell’Acqua 等的主张放到Shmueli的边界样本中,最关键的反向情形是:当员工把边界内成功外推到边界外任务时,方向反过来:经验越多过度信任越强。既然文献已经把这项限制说清,为检验Dell’Acqua 等、Shmueli之间的分歧,OECD在2024年之后的研究就必须公开反向结果,否则争论仍不会收敛。

按照Dell’Acqua 等在2023年建立的口径,业务决策委员会处理模型部署不能只引用“这一比率”,还要让试验注册表保存分子、分母与口径变更。Shmueli(2010)提醒,业务决策委员会必须为Dell’Acqua 等提出而OECD继续检验的“该未登记群体、因工具而未练习的技能”提供查询位置,在Shmueli所划定的责任边界里,它若没有位置,责任便会在部门之间消失。

Dell’Acqua 等、Jordon、Yoon 与 van der Schaar的两组证据可以在本块内部对读:“生成式人工智能呈现锯齿状能力边界 Jagged Technological Frontier”把解释焦点放在被结算的对象与读数,“合成数据需要测量保真与泄露 Synthetic Data Governance”则放在行动次序与反馈路径,二者都默认“上述机制”通过清单与形式审查就等于实质风险受控,这些漏记对象、因工具而未练习的技能不必另行验证”。

位置S|生成式人议题作结果量 单因生成式人议题的核心决定项 预设〔01 谁进入分母〕生成式人议题沿用既定对象边界 量纲生成式人议题同向记录数/全部可核对记录数 失效若生成式人议题可由替代机制重现,单因解释撤回 自曝生成式人议题(第19条):原材料未覆盖者需另表 空栏未提交的错误草稿、被人等漏记者 异名另见第 531 号第 19 条『Coscientist与ChemCrow:科研智能体的能力边界在工具链』

十二、强化学习把预测器变成政策选择器Reinforcement Learning for Decisions

提出Li,2017,《SIAM Review》59(4):640–676,DOI 10.1137/16M1080178。 争议Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。 最新NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。 关键序列决策必须评估动作对未来状态的回写,而非逐次最大化即时预测

商业分析与决策科学早期讨论“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”多从数据量、模型精度和管理者经验出发,Li在2017年的工作把行动次序、反馈和转折点提升为需要单独识别的层次。Gigerenzer 与 Brighton(2009)并未否定问题本身,却证明离线数据受旧策略选择,奖励函数常遗漏公平、疲劳和退出,从而让“未被探索的动作、退出平台的用户、奖励函数之外的伤害”进入例外处置清单的核对范围。

在Li的2017年论证中,“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”不再只是相关性标签,而明确主张:序列决策必须评估动作对未来状态的回写,而非逐次最大化即时预测。按Gigerenzer 与 Brighton(2009)给出的反例压力并对照Li、NIST两组材料,若行动路径“本项证据”不起决定作用,那么“决定序列决策的只有长期回报定义”就应被判错。

Li在2017年提供的主证据是:2017年综述系统化值函数、策略梯度和探索—利用,在推荐、库存和动态定价中,长期回报可与单步点击率产生相反策略。Gigerenzer 与 Brighton在2009年对Li的反例、以及NIST的新场景说明,只报“累计回报”无法比较,分析负责人应以“累计回报/全部决策步数”把分子和分母一起公开。强化学习研究的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

对Li(2017)的主张,Gigerenzer 与 Brighton在2009年给出的主要反证是:离线数据受旧策略选择,奖励函数常遗漏公平、疲劳和退出。若按Gigerenzer 与 Brighton的反例复算Li的命题,能够改变结论方向的条件是:当奖励只写短期转化时,方向反过来:学习越充分长期客户价值越低。Li2017—Gigerenzer2009之争把证据责任推回边界样本。对照Li的主张与Gigerenzer 与 Brighton的反证,NIST(2023)虽然扩展了观察场景,却仍需用同一“该复核口径”并列检验支持样本与反例。

在模型、看板与组织决策的现场,Li(2017)所给读数必须由数据产品负责人写入决策日志,并说明“全部决策步数”如何形成。Gigerenzer 与 Brighton(2009)对Li的边界批评、以及NIST的后续检验,要求“该未登记群体、奖励函数之外的伤害”拥有独立状态,若它被并入一般缺失,决策质量、可追责性与长期绩效就可能因分母收缩而显得改善。当“上述分子—分母”与预算或问责挂钩时,NIST在2023年的治理场景回应了Li、Gigerenzer 与 Brighton之间的分歧:应保留申诉、独立复核和第二次测量。

Li、Mitchell 等分别从行动次序与反馈路径和制度、技术与关系条件解释结果。二者并非重复,因为它们虽共同依赖“本项证据”通过清单与形式审查就等于实质风险受控,这些漏记对象、奖励函数之外的伤害不必另行验证”,却把因果责任放在不同环节。就强化学习研究的材料边界而言,进入、退出与未登记对象必须分开留痕。

位置S|强化学习研究作结果量 单因强化学习研究的核心决定项 预设〔01 谁进入分母〕强化学习研究沿用既定对象边界 量纲强化学习研究同向记录数/全部可核对记录数 失效漏掉未被探索的动作、退出平等漏记者时,强化学习研究读数越高,真实覆盖反而越低 自曝强化学习研究(第20条):原材料未覆盖者需另表 空栏未被探索的动作、退出平等漏记者 异名另见第 531 号第 17 条『AlphaTensor与FunSearch:机器发现的对象变成可验证算法』

◎ 二十年连起来看

第一条线索:比较单位从中心值转向生成结构。“循证管理要求先公开证据等级 Evidence-Based Management”先拆开数据量、模型精度和管理者经验,到“因果机器学习从平均效应走向异质效应 Causal Machine Learning”时,研究已经要求同时观察对象、路径和条件;这使决策质量、可追责性与长期绩效不能再由单一平均数代表。

第二条线索:技术进入制度后会回写被测对象。“预测锦标赛把准确度与信念分开 Forecasting Tournaments”说明测量与行动并不分离,“公平约束揭露代理变量偏差 Algorithmic Fairness Constraints”进一步把激励、适应和申诉写进模型、看板与组织决策;指标越接近考核,越需要二次测量。

第三条线索:账外对象成为新的解释入口。从“合成数据需要测量保真与泄露 Synthetic Data Governance”到“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”,二十年积累把失败、退出与未分类事件从附注移到分母。第432号最重要的收获,不是多一个总分,而是知道哪些对象原本根本不算对象。

◎ 三个常见误解

误解一:把商业分析与决策科学等同于增加数据或工具。之所以容易误读,是因为“分析能力是一套组织互补品 Analytics Capability as Complementarity”确实提供了操作方法;但方法只有在说明“完成闭环的分析项目数/全部已部署分析项目数”的分母、失效条件与账外对象后,才构成可检验转向。

误解二:认为平均改善自动适用于所有对象。“算法欣赏在匿名建议中出现 Algorithm Appreciation”提醒,群体结果可能掩盖选择、异质性或制度适应;正确表述应当同时给出谁进入样本、谁被排除,以及何时方向会反过来。

误解三:把透明、合规或参与当作终点。“模型卡把算法责任写成标准字段 Model Cards”显示,程序被采用后仍可能产生新盲区;通过形式审查并不等于决策质量、可追责性与长期绩效已经得到实质保障。

◎ 与相邻领域的接口

与相邻领域的证据与方法接口可由“数据驱动决策被测出组织绩效差异 Data-Driven Decision Making”判定。第432号负责解释它在模型、看板与组织决策中如何被组织、结算与回写;另见第154号第4条与第149号第6条则提供另一套对象或测量口径。分工标准是:本块追踪决策质量、可追责性与长期绩效的责任链,相邻面板负责其自身层级的机制,二者不应以同名术语互相替代。

与相邻领域的组织与技术接口可由“预测问题与政策问题必须拆开 Prediction Policy Problems”判定。第432号负责解释它在模型、看板与组织决策中如何被组织、结算与回写;另见第130号第5条与第149号第12条则提供另一套对象或测量口径。分工标准是:本块追踪决策质量、可追责性与长期绩效的责任链,相邻面板负责其自身层级的机制,二者不应以同名术语互相替代。

与相邻领域的制度与治理接口可由“可解释性不能代替可理解模型 Interpretable Models over Post-hoc Explanations”判定。第432号负责解释它在模型、看板与组织决策中如何被组织、结算与回写;另见第154号第18条与第156号第9条则提供另一套对象或测量口径。分工标准是:本块追踪决策质量、可追责性与长期绩效的责任链,相邻面板负责其自身层级的机制,二者不应以同名术语互相替代。

与相邻领域的个体与结构接口可由“生成式人工智能呈现锯齿状能力边界 Jagged Technological Frontier”判定。第432号负责解释它在模型、看板与组织决策中如何被组织、结算与回写;另见第152号第20条与第154号第17条则提供另一套对象或测量口径。分工标准是:本块追踪决策质量、可追责性与长期绩效的责任链,相邻面板负责其自身层级的机制,二者不应以同名术语互相替代。

◎ 争议现场

第1场争论围绕“行为运营把决策者写进模型 Behavioral Operations”:实验室任务可能高估短期反应,现场组织还有学习与权力结构。要使争论收敛,需要开展跨机构预注册比较,固定“受行为反应影响的运营决策数/全部模型建议数”的口径,并把“被标准优化器标记为非理性的保守缓冲、拒绝执行的建议”列入结果;当异常行为本身是对模型遗漏风险的合理防御时,方向反过来:偏离越大长期损失越小,就应承认原命题只在限定条件下成立。

第2场争论围绕“人机互补比替代更能解释绩效 Hybrid Intelligence”:分工规则会随模型进步和人员技能变化,固定接口很快过时。要使争论收敛,需要开展纵向部署前后追踪,固定“互补任务正确完成数/全部人机任务数”的口径,并把“在人机交接处失去所有者的案例、无人复核的低置信输出”列入结果;当人只处理机器最难的残余案例时,方向反过来:人工表现越差并非能力下降而是任务分布恶化,就应承认原命题只在限定条件下成立。

第3场争论围绕“数字孪生把预测变成连续决策 Digital Twins for Prescriptive Decisions”:传感器误差、模型老化和组织不执行建议会切断闭环。要使争论收敛,需要开展边界样本与反例样本并列试验,固定“同步更新次数/全部关键状态变化次数”的口径,并把“离线期间的状态、未装传感器的部件、人工维护经验”列入结果;当系统为追随传感器噪声而频繁调整时,方向反过来:同步越快运营越不稳定,就应承认原命题只在限定条件下成立。

◎ 往下五年看什么

未来五年应观察“公平约束揭露代理变量偏差 Algorithmic Fairness Constraints”的外部效度。核心读数是“被识别为高风险的弱势患者数/全部真实高风险患者数”,同时报告“从未产生高费用却有高需要的人、因获取障碍缺少诊疗记录者”在不同年份与机构中的变化;只有独立场景重复出现同方向,才能把试点结果升级为稳定知识。

未来五年应观察“合成数据需要测量保真与泄露 Synthetic Data Governance”的部署后漂移。核心读数是“下游任务性能/原始数据任务性能”,同时报告“生成失败的极端样本、被平滑掉的小群体、未记录生成随机种子”在不同年份与机构中的变化;只有独立场景重复出现同方向,才能把试点结果升级为稳定知识。

未来五年应观察“生成式人工智能呈现锯齿状能力边界 Jagged Technological Frontier”的账外对象规模。核心读数是“工具辅助后正确任务数/全部分配任务数”,同时报告“未提交的错误草稿、被人工悄悄修正的幻觉、因工具而未练习的技能”在不同年份与机构中的变化;只有独立场景重复出现同方向,才能把试点结果升级为稳定知识。

未来五年应观察“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”的跨制度可迁移性。核心读数是“累计回报/全部决策步数”,同时报告“未被探索的动作、退出平台的用户、奖励函数之外的伤害”在不同年份与机构中的变化;只有独立场景重复出现同方向,才能把试点结果升级为稳定知识。

◎ 可与哪些领域对撞

本块“循证管理要求先公开证据等级 Evidence-Based Management”的跨领域对手可沿以下路径查找:另见第147号第3条与第149号第8条。两边共享的未言明条件是“一个围绕“循证管理要求先公开证据等级”形成的汇总分数足以代表多层过程,未发表的零效应项目、被董事会否决的备选方案不会改变解释”,但本条把责任落在被结算的对象与读数,相关研究则从行动次序与反馈路径设置纠错。若证据被纳入奖金与合规评分,团队会优先生产容易评级而非重要的证据,就必须把“未发表的零效应项目、被董事会否决的备选方案”承认为独立对象,用它解释为何同一动作在两种制度中出现相反方向。

本块“算法厌恶来自看见机器犯错 Algorithm Aversion”的跨领域对手可沿以下路径查找:另见第142号第12条与第154号第14条。两边共享的未言明条件是“测量、排名或观察“算法厌恶来自看见机器犯错”不会改变参与者行为,算法正确但未被采纳的建议、人工错误被解释为例外的记录不产生回写”,但本条把责任落在制度、技术与关系条件,相关研究则从行动次序与反馈路径设置纠错。若使用者获得少量覆写权,看见算法误差反而增加持续采用,就必须把“算法正确但未被采纳的建议、人工错误被解释为例外的记录”承认为独立对象,用它解释为何同一动作在两种制度中出现相反方向。

本块“公平约束揭露代理变量偏差 Algorithmic Fairness Constraints”的跨领域对手可沿以下路径查找:另见第156号第11条与第130号第13条。两边共享的未言明条件是“公平约束揭露代理变量偏差”一旦被制度采用仍测量原来那件事,从未产生高费用却有高需要的人、因获取障碍缺少诊疗记录者不因考核而扩大”,但本条把责任落在被结算的对象与读数,相关研究则从行动次序与反馈路径设置纠错。若修正目标提高某群体进入率却资源容量固定,形式公平增加等待不平等,就必须把“从未产生高费用却有高需要的人、因获取障碍缺少诊疗记录者”承认为独立对象,用它解释为何同一动作在两种制度中出现相反方向。

本块“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”的跨领域对手可沿以下路径查找:另见第155号第16条与第148号第19条。两边共享的未言明条件是“强化学习把预测器变成政策选择器”通过清单与形式审查就等于实质风险受控,未被探索的动作、退出平台的用户、奖励函数之外的伤害不必另行验证”,但本条把责任落在行动次序与反馈路径,相关研究则从制度、技术与关系条件设置纠错。若奖励只写短期转化,学习越充分长期客户价值越低,就必须把“未被探索的动作、退出平台的用户、奖励函数之外的伤害”承认为独立对象,用它解释为何同一动作在两种制度中出现相反方向。

◎ 十条可做的研究命题

命题:把“未发表的零效应项目、被董事会否决的备选方案”纳入“可追溯证据条数/全部关键决策依据数”后,“循证管理要求先公开证据等级 Evidence-Based Management”的效应将显著缩小。设计:在两类组织中预注册分母并重算三个周期。证伪:纳入后方向和效应量均不变。

命题:“数据驱动决策被测出组织绩效差异 Data-Driven Decision Making”与“可解释性不能代替可理解模型 Interpretable Models over Post-hoc Explanations”之间存在由“单一读数代表复杂对象”调节的反号关系。设计:构造支持条件与失效条件的成对样本。证伪:两种条件下“由数据触发的决策数/全部重大决策数”保持同一方向。

命题:当“完成闭环的分析项目数/全部已部署分析项目数”被用于资源配置,参与者会把成本转移到“从未产生高费用却有高需要的人、因获取障碍缺少诊疗记录者”。设计:比较考核前后记录、访谈与结果分布。证伪:账外对象规模和成本均未变化。

命题:“行为运营把决策者写进模型 Behavioral Operations”的跨机构迁移取决于是否同时保留“指标专制把度量变成目标 The Tyranny of Metrics”所要求的条件。设计:在两个制度环境中复制同一流程。证伪:移除该条件后,决策质量、可追责性与长期绩效仍稳定改善。

命题:只优化“Brier损失下降量/全部预测轮次”的分子会恶化长期结果。设计:随机比较只报分子、完整报告和不考核三组。证伪:三组在长期决策质量、可追责性与长期绩效上无差异。

命题:“算法正确但未被采纳的建议、人工错误被解释为例外的记录”不是随机缺失,而与“数字孪生把预测变成连续决策 Digital Twins for Prescriptive Decisions”的路径系统相关。设计:建立退出与未分类事件追踪队列。证伪:其发生概率与路径变量独立。

命题:在边界样本中,当组织只奖励模型准确率时,方向反过来:预测越准可行动价值越低。设计:预先锁定失效阈值,比较阈值两侧的“可被决策规则利用的预测变量数/全部高精度变量数”。证伪:方向没有反转且差异落在最小效应以下。

命题:独立复核会降低“在线对照实验成为产品决策基础设施 Online Controlled Experiments”的表面绩效,却提高一年后的决策质量、可追责性与长期绩效。设计:分离指标定义者与评价者并做纵向跟踪。证伪:短期和长期结果均无变化。

命题:“因果机器学习从平均效应走向异质效应 Causal Machine Learning”的平均效应由少数高暴露对象驱动。设计:报告完整分布,并按“生成式人工智能呈现锯齿状能力边界 Jagged Technological Frontier”所界定的条件分层。证伪:分层后各组效应同质。

命题:将“算法欣赏在匿名建议中出现 Algorithm Appreciation”与“强化学习把预测器变成政策选择器 Reinforcement Learning for Decisions”组合,会产生现有总分无法识别的新对象。设计:联合记录两条中未入账对象与可比较读数,进行聚类和机制访谈。证伪:新增类别不提高解释或预测。

◎ 资料核验

  1. Pfeffer 与 Sutton,2006,《Hard Facts, Dangerous Half-Truths, and Total Nonsense》,Harvard Business School Press。
  2. Shmueli,2010,《Statistical Science》25(3):289–310,DOI 10.1214/10-STS330。
  3. OECD,2024,《Using AI in the Workplace: Opportunities, Risks and Policy Responses》,OECD Artificial Intelligence Papers No. 11,DOI 10.1787/73d417f9-en。
  4. Brynjolfsson、Hitt 与 Kim,2011,ICIS论文《Strength in Numbers: How Does Data-Driven Decisionmaking Affect Firm Performance?》。
  5. Gigerenzer 与 Brighton,2009,《Topics in Cognitive Science》1(1):107–143,DOI 10.1111/j.1756-8765.2008.01006.x。
  6. NIST,2023,《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》,NIST AI 100-1,DOI 10.6028/NIST.AI.100-1。
  7. Davenport 与 Harris,2007,《Competing on Analytics》,Harvard Business School Press。
  8. Rai,2020,《Journal of the Association for Information Systems》21(1):137–152。
  9. Milanez、Lemmens 与 Ruggiu,2025,《Algorithmic Management in the Workplace: New Evidence from an OECD Employer Survey》,OECD Artificial Intelligence Papers No. 31,DOI 10.1787/287c13c4-en。
  10. Gino 与 Pisano,2008,《Manufacturing & Service Operations Management》10(4):676–691,DOI 10.1287/msom.1070.0205。
  11. Mellers 等,2014,《Psychological Science》25(5):1106–1115,DOI 10.1177/0956797614524255。
  12. Dietvorst、Simmons 与 Massey,2015,《Journal of Experimental Psychology: General》144(1):114–126,DOI 10.1037/xge0000033。
  13. Kleinberg、Ludwig、Mullainathan 与 Obermeyer,2015,《American Economic Review》105(5):491–495,DOI 10.1257/aer.p20151023。
  14. Kohavi、Tang 与 Xu,2020,《Trustworthy Online Controlled Experiments》,Cambridge University Press。
  15. Athey 与 Imbens,2019,《Annual Review of Economics》11:685–725,DOI 10.1146/annurev-economics-080217-053433。
  16. Logg、Minson 与 Moore,2019,《Organizational Behavior and Human Decision Processes》151:90–103,DOI 10.1016/j.obhdp.2018.12.005。
  17. Dellermann、Ebel、Söllner 与 Leimeister,2019,《Business & Information Systems Engineering》61:637–643,DOI 10.1007/s12599-019-00595-2。
  18. Rudin,2019,《Nature Machine Intelligence》1:206–215,DOI 10.1038/s42256-019-0048-x。
  19. Obermeyer、Powers、Vogeli 与 Mullainathan,2019,《Science》366(6464):447–453,DOI 10.1126/science.aax2342。
  20. Muller,2018,《The Tyranny of Metrics》,Princeton University Press。
  21. Sculley 等,2015,NeurIPS论文《Hidden Technical Debt in Machine Learning Systems》。
  22. Fuller、Fan、Day 与 Barlow,2020,《IEEE Access》8:108952–108971,DOI 10.1109/ACCESS.2020.2998358。
  23. Jordon、Yoon 与 van der Schaar,2022,《npj Digital Medicine》5:80,DOI 10.1038/s41746-022-00623-4。
  24. Mitchell 等,2019,FAT*论文《Model Cards for Model Reporting》,DOI 10.1145/3287560.3287596。
  25. Dell’Acqua 等,2023,Harvard Business School Working Paper 24-013《Navigating the Jagged Technological Frontier》。
  26. Li,2017,《SIAM Review》59(4):640–676,DOI 10.1137/16M1080178。
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行八字段碰撞行(位置/单因/预设/量纲/失效/自曝/空栏/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板