SDE Universes·新思想前沿数学与统计的其余主干
新思想前沿 · 数学与统计的其余主干

时间序列与预测方法

近二十年 · 两幕 · 20 个新思想 · 约 31,176 字 · 王德生 亲撰 · 2026 年 8 月

时间序列预测近二十年的深层变化,不是模型名单从ARIMA换成神经网络,而是评价、数据时间、层级一致性与部署边界都被重写。第一幕建立严格恰当评分、实时nowcasting、组合、层级调和、变点与高维依赖;第二幕则由全球模型、深度概率预测、竞赛清算、共形覆盖与基础模型接力。真正的转向是:预测不再是一列未来点值,而是一份带发布日期、时域、概率分布、加总约束、计算预算和结构变化假设的可审计承诺。选目从严格恰当评分、实时数据、组合、层级调和、变点和高维依赖,推进到全局模型、深度概率预测、竞赛清算、共形覆盖与基础模型。第一幕重写“预测等于给一个点”,第二幕检验跨序列共享和预训练能否在结构变化后仍校准。这里不以单次排行榜定胜负,而要求冻结时间戳、滚动盲测并同时报告误差、覆盖、更新成本和恢复时长。读者应特别区分训练分布内的平均优势与真正未见任务上的零样本能力。阅读时应把每条的主证据年份、关键读数与失效条件连在一起,而不能把标题本身当作已经稳定的共识。

【第一幕】上一个十年 · 约 2006—2016

第一幕把预测从单序列单模型的点误差,扩展到概率评分、实时数据流、组合权重、加总约束与变点计算。从“严格恰当评分:概率预测只能被鼓励说真话”到“高维时间序列:稀疏估计必须先控制谱依赖”,共同动作是把旧默认改写成可反驳的结构命题;主证据均在2016年前形成。

甲、严格恰当评分:概率预测只能被鼓励说真话Strictly Proper Scoring Rules

提出Tilmann Gneiting与Adrian Raftery,2007年《Journal of the American Statistical Association》102(477):359–378,DOI:10.1198/016214506000001437,〈Strictly Proper Scoring Rules, Prediction, and Estimation〉 关键概率预测的评价规则应使预测者在且仅在报告真实信念分布时获得最佳期望分数,并把校准与锐度放在同一决策框架

到2007年前后,常见出发点仍是“概率预测只要区间覆盖率正确或点预测误差小就足以评价”。真正暴露问题的并非一个孤立反例,而是预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“相对得分改进/基准预测平均得分”为何随条件改变。当研究者改用“相对得分改进/基准预测平均得分”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

本条命题是:概率预测的评价规则应使预测者在且仅在报告真实信念分布时获得最佳期望分数,并把校准与锐度放在同一决策框架。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“相对得分改进/基准预测平均得分”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Tilmann Gneiting等在2007年〈Strictly Proper Scoring Rules, Prediction, and Estimation〉中的主结果是本条的证据起点。论文统一对数分数、Brier分数与CRPS 3类严格恰当规则及其熵—散度表示;CRPS把整个预测分布与观测的积分平方差压成1个可比较读数,最优期望分数只在报告真实分布时达到。具体读数“相对得分改进/基准预测平均得分”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:不同评分规则强调尾部、中心或事件概率的方式不同,排名可随规则改变;样本路径依赖和极端事件稀少时,平均分数估计不稳定。失效条件为:当评价规则不恰当、用户真实损失与评分规则不一致或观测被选择性报告时不成立。收敛需统一对象与“相对得分改进/基准预测平均得分”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“相对得分改进/基准预测平均得分”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:机制设计称“激励相容”,贝叶斯统计称“后验预测得分”;另见第307号stacking。共享预设为“概率预测只要区间覆盖率正确或点预测误差小就足以评价”;先统一“相对得分改进/基准预测平均得分”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置E——把『严格恰当评分:概率预测只能被鼓励说真话』成立所需的边界环境作为首要显露 单因决定『严格恰当评分:概率预测只能被鼓励说真话』当前结论的最小充分项只有:概率预测的评价规则应使预测者在且仅在报告真实信念分布时获得最佳期望分数,并把校准与锐度放在同一决策框架 预设〔01 谁进入分母〕概率预测只要区间覆盖率正确或点预测误差小就足以评价 量纲相对得分改进/基准预测平均得分 失效失效边界是『评价规则不恰当、用户真实损失与评分规则不一致或观测被选择性报告时不成立』;越过该边界,相关条件越强,相对得分改进反而越低 自曝『严格恰当评分:概率预测只能被鼓励说真话』的原始材料只直接支持“TilmannGneiting等在2007年〈StrictlyProperScoringRules,Prediction,andEstimation”,没有自动覆盖边界外对象 空栏『严格恰当评分:概率预测只能被鼓励说真话』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机制设计称“激励相容”,贝叶斯统计称“后验预测得分”;另见第 432 号第 5 条『预测锦标赛把准确度与信念分开』

乙、实时Nowcasting:发布日期比观测日期更重要Macroeconomic Nowcasting

提出Domenico Giannone、Lucrezia Reichlin与David Small,2008年《Journal of Monetary Economics》55(4):665–676,DOI:10.1016/j.jmoneco.2008.05.010,〈Nowcasting: The Real-Time Informational Content of Macroeconomic Data〉 关键宏观当前状态应以数据发布流的实时到达顺序更新,混合频率动态因子模型可在季度指标公布前吸收月度与周度信息

2008年前后,本领域常把“时间序列观测在期末一次性齐备,预测者可按最终数据集建模”当作默认起点。它在典型对象上看似稳固,却被预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“每次数据发布带来的预测修正/发布前预测误差”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“每次数据发布带来的预测修正/发布前预测误差”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条命题是:宏观当前状态应以数据发布流的实时到达顺序更新,混合频率动态因子模型可在季度指标公布前吸收月度与周度信息。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“每次数据发布带来的预测修正/发布前预测误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Domenico Giannone等在2008年〈Nowcasting: The Real-Time Informational Content of Macroeconomic Data〉中的主结果给出主证据:作者建立实时数据库和动态因子/Kalman更新,把每1次“新闻”定义为新发布值减旧预测;对美国GDP,调查、就业与工业发布按时间戳逐步改变nowcast,而不是在季度末一次性重估。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“每次数据发布带来的预测修正/发布前预测误差”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:发布日期修订、结构变化和疫情等异常会破坏历史新闻权重;使用最终修订数据回测会严重高估实时表现。失效条件为:当数据同步、无修订且目标低频变量可即时观测时,实时发布结构不再关键。收敛需统一对象与“每次数据发布带来的预测修正/发布前预测误差”,并公开滚动盲测、覆盖率和更新成本及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。最低报告责任包括“每次数据发布带来的预测修正/发布前预测误差”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:流式系统称“事件时间”,新闻分析称“意外分量”;另见第360号在线监控。只有“每次数据发布带来的预测修正/发布前预测误差”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置S——把『实时Nowcasting:发布日期比观测日期更重要』形成的对象结构作为首要显露 单因决定『实时Nowcasting:发布日期比观测日期更重要』当前结论的最小充分项只有:宏观当前状态应以数据发布流的实时到达顺序更新,混合频率动态因子模型可在季度指标公布前吸收月度与周度信息 预设〔01 谁进入分母〕时间序列观测在期末一次性齐备,预测者可按最终数据集建模 量纲每次数据发布带来的预测修正/发布前预测误差 失效失效边界是『数据同步、无修订且目标低频变量可即时观测时,实时发布结构不再关键』;越过该边界,相关条件越强,每次数据发布带来的预测修正反而越低 自曝『实时Nowcasting:发布日期比观测日期更重要』的原始材料只直接支持“DomenicoGiannone等在2008年〈Nowcasting:TheReal-TimeInformationalContentofMacro”,没有自动覆盖边界外对象 空栏『实时Nowcasting:发布日期比观测日期更重要』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名流式系统称“事件时间”,新闻分析称“意外分量”;另见第 437 号第 20 条『人工智能事故披露需要把模型更新纳入危机时间线』

丙、预测组合之谜:估出来的最优权重常输给简单平均Forecast Combination Puzzle

提出Jeremy Smith与Kenneth Wallis,2009年《Oxford Bulletin of Economics and Statistics》71(3):331–355,DOI:10.1111/j.1468-0084.2008.00541.x,〈A Simple Explanation of the Forecast Combination Puzzle〉 关键有限样本中估计组合权重的误差可超过理论最优组合的收益,因此等权平均常击败用历史协方差求出的“最优”权重

在2009年前后的文献中,标准叙事是“理论上最优的组合权重用历史数据估计后仍会在样本外最优”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“样本外组合误差/最佳单模型误差”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“样本外组合误差/最佳单模型误差”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

理论内容不是“再加一种方法”,而是:有限样本中估计组合权重的误差可超过理论最优组合的收益,因此等权平均常击败用历史协方差求出的“最优”权重。它允许以下决定性反例:固定预测起点、实时信息集、时域与评分规则,按“样本外组合误差/最佳单模型误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

Jeremy Smith等在2009年〈A Simple Explanation of the Forecast Combination Puzzle〉中的主结果提供了决定性证据。论文把简单平均写成M个候选各取权重1/M,并以权重估计噪声解释组合谜题;候选高度相关且训练窗短时,估计M个自由权重的样本外MSE可高于无估计的等权方案。这里最有信息量的读数是“样本外组合误差/最佳单模型误差”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:当训练样本足够长、误差协方差稳定且候选差异大时,估计权重可胜出;简单平均也会被系统偏差或冗余模型拖累。失效条件为:当误差协方差稳定且权重估计误差远小于组合收益时,等权优势消失。收敛需统一对象与“样本外组合误差/最佳单模型误差”,并公开滚动盲测、覆盖率和更新成本及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。报告应围绕“样本外组合误差/最佳单模型误差”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为贝叶斯称“stacking与模型平均”,投资称“1/N组合”;另见第307号stacking。碰撞须固定“理论上最优的组合权重用历史数据估计后仍会在样本外最优”并比较“样本外组合误差/最佳单模型误差”;第三项是信息时点、预测时域与结构漂移。

位置D——把『预测组合之谜:估出来的最优权重常输给简单平均』中的操作次序与变化路径作为首要显露 单因决定『预测组合之谜:估出来的最优权重常输给简单平均』当前结论的最小充分项只有:有限样本中估计组合权重的误差可超过理论最优组合的收益,因此等权平均常击败用历史协方差求出的“最优”权重 预设〔01 谁进入分母〕理论上最优的组合权重用历史数据估计后仍会在样本外最优 量纲样本外组合误差/最佳单模型误差 失效失效边界是『误差协方差稳定且权重估计误差远小于组合收益时,等权优势消失』;越过该边界,相关条件越强,样本外组合误差反而越低 自曝『预测组合之谜:估出来的最优权重常输给简单平均』的原始材料只直接支持“JeremySmith等在2009年〈ASimpleExplanationoftheForecastCombinationPuzzle〉中的主结果提”,没有自动覆盖边界外对象 空栏『预测组合之谜:估出来的最优权重常输给简单平均』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名贝叶斯称“stacking与模型平均”,投资称“1/N组合”;另见第 213 号第 11 条『自适应有限元的收敛性与最优性理论』

丁、层级预测:各层加总必须成为优化约束Hierarchical Forecast Reconciliation

提出Rob Hyndman、Roman Ahmed、George Athanasopoulos与Han Lin Shang,2011年《Computational Statistics & Data Analysis》55(9):2579–2589,DOI:10.1016/j.csda.2011.03.006,〈Optimal Combination Forecasts for Hierarchical Time Series〉 关键总量、地区与产品等层级预测应在保持无偏的线性空间中联合调和,而不是各自预测后任意相加或只按比例拆分

2011年前后,旧框架把问题压成一句话:“每个序列单独做到最优,汇总后自然也会一致且最优”。但预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“调和后总平方误差/调和前总平方误差”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“调和后总平方误差/调和前总平方误差”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

新命题明确写成:总量、地区与产品等层级预测应在保持无偏的线性空间中联合调和,而不是各自预测后任意相加或只按比例拆分。这句话可以被反驳,检验方式是:固定预测起点、实时信息集、时域与评分规则,按“调和后总平方误差/调和前总平方误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

主证据来自Rob Hyndman等在2011年〈Optimal Combination Forecasts for Hierarchical Time Series〉中的主结果。作者把m个底层序列经求和矩阵S映到n个层级节点,再用广义最小二乘把不一致基预测投影到相干子空间;bottom-up、top-down均成为同一n×m映射的特殊情形。其关键不是论文规模,而是给出了“调和后总平方误差/调和前总平方误差”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:最优权重依赖基预测误差协方差,实际估计可能奇异;层级随时间变化、非线性约束和概率分布调和超出线性点预测框架。失效条件为:当层级关系错误、节点定义变化或目标不是线性加总时,线性调和不成立。收敛需统一对象与“调和后总平方误差/调和前总平方误差”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“调和后总平方误差/调和前总平方误差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:会计称“勾稽关系”,系统工程称“约束一致性”;另见第352号不变量。共享预设为“每个序列单独做到最优,汇总后自然也会一致且最优”;先统一“调和后总平方误差/调和前总平方误差”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置S——把『层级预测:各层加总必须成为优化约束』形成的对象结构作为首要显露 单因决定『层级预测:各层加总必须成为优化约束』当前结论的最小充分项只有:总量、地区与产品等层级预测应在保持无偏的线性空间中联合调和,而不是各自预测后任意相加或只按比例拆分 预设〔02 单一读数代表复杂对象〕每个序列单独做到最优,汇总后自然也会一致且最优 量纲调和后总平方误差/调和前总平方误差 失效失效边界是『层级关系错误、节点定义变化或目标不是线性加总时,线性调和不成立』;越过该边界,相关条件越强,调和后总平方误差反而越低 自曝『层级预测:各层加总必须成为优化约束』的原始材料只直接支持“主证据来自RobHyndman等在2011年〈OptimalCombinationForecastsforHierarchicalTimeSerie”,没有自动覆盖边界外对象 空栏『层级预测:各层加总必须成为优化约束』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名会计称“勾稽关系”,系统工程称“约束一致性”;另见第 211 号第 1 条『里奇流与几何化:奇点必须成为证明的一部分』

戊、间歇需求:零需求与淘汰风险必须分开更新TSB Intermittent-Demand Forecasting

提出Ruud Teunter、Aris Syntetos与M. Zied Babai,2011年《European Journal of Operational Research》214(3):606–615,DOI:10.1016/j.ejor.2011.05.018,〈Intermittent Demand: Linking Forecasting to Inventory Obsolescence〉 关键对大量零需求序列,应分别平滑需求发生概率与非零需求量,使长期无需求自动降低预测并响应淘汰,而非沿用上次间隔

在2011年前后的文献中,默认判断仍是“零需求只是不规则间隔,最后一次非零需求强度应持续外推”。它没有处理预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“非零需求发生次数/全部时间期数”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“非零需求发生次数/全部时间期数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条把转向压成一句可检验的话:对大量零需求序列,应分别平滑需求发生概率与非零需求量,使长期无需求自动降低预测并响应淘汰,而非沿用上次间隔。可反驳版本为:固定预测起点、实时信息集、时域与评分规则,按“非零需求发生次数/全部时间期数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

证据链的锚点是Ruud Teunter等在2011年〈Intermittent Demand: Linking Forecasting to Inventory Obsolescence〉中的主结果。TSB用2个状态量更新间歇需求:发生概率每期更新,非零大小只在需求出现时更新;模拟显示需求逐渐消失时,比Croston与SBA更快把预测降到0并减少报废库存。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“非零需求发生次数/全部时间期数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:若零来自缺货、数据漏报或季节关闭而非真实无需求,概率衰减会误判淘汰;平滑参数仍需按库存损失而非单纯MSE选择。失效条件为:当零值主要是删失、缺货或可预测季节结构时,TSB的淘汰解释失效。收敛需统一对象与“非零需求发生次数/全部时间期数”,并公开滚动盲测、覆盖率和更新成本及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。最低报告责任包括“非零需求发生次数/全部时间期数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:生存分析称“风险率”,生态学称“零膨胀”;另见第306号事件模型。只有“非零需求发生次数/全部时间期数”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置D——把『间歇需求:零需求与淘汰风险必须分开更新』中的操作次序与变化路径作为首要显露 单因决定『间歇需求:零需求与淘汰风险必须分开更新』当前结论的最小充分项只有:对大量零需求序列,应分别平滑需求发生概率与非零需求量,使长期无需求自动降低预测并响应淘汰,而非沿用上次间隔 预设〔02 单一读数代表复杂对象〕零需求只是不规则间隔,最后一次非零需求强度应持续外推 量纲非零需求发生次数/全部时间期数 失效失效边界是『零值主要是删失、缺货或可预测季节结构时,TSB的淘汰解释失效』;越过该边界,相关条件越强,非零需求发生次数反而越低 自曝『间歇需求:零需求与淘汰风险必须分开更新』的原始材料只直接支持“证据链的锚点是RuudTeunter等在2011年〈IntermittentDemand:LinkingForecastingtoInventory”,没有自动覆盖边界外对象 空栏『间歇需求:零需求与淘汰风险必须分开更新』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生存分析称“风险率”,生态学称“零膨胀”;另见第 432 号第 7 条『预测问题与政策问题必须拆开』

己、PELT:变点数可以在线性期望代价中精确搜索Pruned Exact Linear Time Change Points

提出Rebecca Killick、Paul Fearnhead与Idris Eckley,2012年《Journal of the American Statistical Association》107(500):1590–1598,DOI:10.1080/01621459.2012.737745,〈Optimal Detection of Changepoints with a Linear Computational Cost〉 关键带可加代价和每变点惩罚的最优分割可通过剪枝丢弃不可能成为未来最优的候选,在常见条件下达到期望线性时间且保持精确最优

到2012年前后,常见出发点仍是“精确多变点搜索必须付二次时间或退回贪心近似”。真正暴露问题的并非一个孤立反例,而是预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“保留候选分割点数/全部历史时点数”为何随条件改变。当研究者改用“保留候选分割点数/全部历史时点数”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

本条命题是:带可加代价和每变点惩罚的最优分割可通过剪枝丢弃不可能成为未来最优的候选,在常见条件下达到期望线性时间且保持精确最优。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“保留候选分割点数/全部历史时点数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Rebecca Killick等在2012年〈Optimal Detection of Changepoints with a Linear Computational Cost〉中的主结果是本条的证据起点。论文给出PELT剪枝条件;在满足加性代价与惩罚条件时,计算从动态规划的O(n²)降到期望O(n),并得到与未剪枝算法相同的全局最优分段。具体读数“保留候选分割点数/全部历史时点数”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:线性期望依赖变点数量随长度增长等条件;代价函数、惩罚和最小段长错设会导致过分割或漏检,在线实时检测还需不同目标。失效条件为:当代价不可加、变点极少且剪枝条件不成立或候选无法排除时,线性复杂度保证失效。收敛需统一对象与“保留候选分割点数/全部历史时点数”,并公开滚动盲测、覆盖率和更新成本及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。报告应围绕“保留候选分割点数/全部历史时点数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为算法称“安全剪枝”,信号处理称“分段检测”;另见第304号算法层级。碰撞须固定“精确多变点搜索必须付二次时间或退回贪心近似”并比较“保留候选分割点数/全部历史时点数”;第三项是信息时点、预测时域与结构漂移。

位置E——把『PELT:变点数可以在线性期望代价中精确搜索』成立所需的边界环境作为首要显露 单因决定『PELT:变点数可以在线性期望代价中精确搜索』当前结论的最小充分项只有:带可加代价和每变点惩罚的最优分割可通过剪枝丢弃不可能成为未来最优的候选,在常见条件下达到期望线性时间且保持精确最优 预设〔02 单一读数代表复杂对象〕精确多变点搜索必须付二次时间或退回贪心近似 量纲保留候选分割点数/全部历史时点数 失效失效边界是『代价不可加、变点极少且剪枝条件不成立或候选无法排除时,线性复杂度保证失效』;越过该边界,相关条件越强,保留候选分割点数反而越低 自曝『PELT:变点数可以在线性期望代价中精确搜索』的原始材料只直接支持“RebeccaKillick等在2012年〈OptimalDetectionofChangepointswithaLinearComputation”,没有自动覆盖边界外对象 空栏『PELT:变点数可以在线性期望代价中精确搜索』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名算法称“安全剪枝”,信号处理称“分段检测”;另见第 214 号第 4 条『近端分裂:不可微结构必须由算子而不是平滑替代处理』

庚、贝叶斯结构时间序列:干预效果是未发生路径的预测差Bayesian Structural Time Series Causal Impact

提出Kay Brodersen、Fabian Gallusser、Jim Koehler、Nicolas Remy与Steven Scott,2015年《The Annals of Applied Statistics》9(1):247–274,DOI:10.1214/14-AOAS788,〈Inferring Causal Impact Using Bayesian Structural Time-Series Models〉 关键单个受干预序列的因果效果可由未受影响协变量和结构状态空间模型预测反事实路径,再将观测与后验预测差累计

2015年前后,本领域常把“没有同期随机对照时,时间序列干预无法形成可量化反事实”当作默认起点。它在典型对象上看似稳固,却被预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“干预后累计预测差/反事实预测标准差”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“干预后累计预测差/反事实预测标准差”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条命题是:单个受干预序列的因果效果可由未受影响协变量和结构状态空间模型预测反事实路径,再将观测与后验预测差累计。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“干预后累计预测差/反事实预测标准差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Kay Brodersen等在2015年〈Inferring Causal Impact Using Bayesian Structural Time-Series Models〉中的主结果给出主证据:贝叶斯结构时间序列同时输出逐时效应与累积效应2条后验路径及其区间;模拟和广告案例显示,干预前拟合与对照协变量决定“未发生路径”的预测质量。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“干预后累计预测差/反事实预测标准差”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:协变量必须未受干预且关系在干预后稳定;同期冲击、协变量污染和预选窗口会制造虚假效果,后验区间只条件于模型。失效条件为:当对照协变量受同一干预影响或干预前后关系结构改变时不成立。收敛需统一对象与“干预后累计预测差/反事实预测标准差”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“干预后累计预测差/反事实预测标准差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:计量经济学称“合成控制式反事实”,平台称“causal impact”;另见第308号切换实验。共享预设为“没有同期随机对照时,时间序列干预无法形成可量化反事实”;先统一“干预后累计预测差/反事实预测标准差”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置D——把『贝叶斯结构时间序列:干预效果是未发生路径的预测差』中的操作次序与变化路径作为首要显露 单因决定『贝叶斯结构时间序列:干预效果是未发生路径的预测差』当前结论的最小充分项只有:单个受干预序列的因果效果可由未受影响协变量和结构状态空间模型预测反事实路径,再将观测与后验预测差累计 预设〔03 相关方向等同因果方向〕没有同期随机对照时,时间序列干预无法形成可量化反事实 量纲干预后累计预测差/反事实预测标准差 失效失效边界是『对照协变量受同一干预影响或干预前后关系结构改变时不成立』;越过该边界,相关条件越强,干预后累计预测差反而越低 自曝『贝叶斯结构时间序列:干预效果是未发生路径的预测差』的原始材料只直接支持“KayBrodersen等在2015年〈InferringCausalImpactUsingBayesianStructuralTime-Serie”,没有自动覆盖边界外对象 空栏『贝叶斯结构时间序列:干预效果是未发生路径的预测差』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名计量经济学称“合成控制式反事实”,平台称“causalimpact”;另见第 440 号第 20 条『反事实企业史把“本可不同”变成可检验边界』

辛、高维时间序列:稀疏估计必须先控制谱依赖High-Dimensional Time Series Regularization

提出Sumanta Basu与George Michailidis,2015年《The Annals of Statistics》43(4):1535–1567,DOI:10.1214/15-AOS1315,〈Regularized Estimation in Sparse High-Dimensional Time Series Models〉 关键Lasso等高维估计在相关时间序列中仍可获得误差界但有效样本量由谱密度的稳定

在2015年前后的文献中,标准叙事是“高维独立样本理论只需把样本数换成时间点数即可用于序列”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“有效独立信息量/原始时间点数”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“有效独立信息量/原始时间点数”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

理论内容不是“再加一种方法”,而是:Lasso等高维估计在相关时间序列中仍可获得误差界,但有效样本量由谱密度的稳定上界与下界而非原始时点数决定。它允许以下决定性反例:固定预测起点、实时信息集、时域与评分规则,按“有效独立信息量/原始时间点数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

Sumanta Basu等在2015年〈Regularized Estimation in Sparse High-Dimensional Time Series Models〉中的主结果提供了决定性证据。作者建立平稳高斯过程集中不等式,把误差界拆成稀疏度s、维数项log p与有效样本量n_eff 3个主要量,并应用于稀疏VAR和协方差估计。这里最有信息量的读数是“有效独立信息量/原始时间点数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

主结果没有消灭争议。强长记忆、重尾、非平稳与模型阶数错设会破坏界;变量选择一致性还需要最小信号与不可替代条件。它明确在以下情形失效:当谱密度无界、过程非平稳或重尾超出集中条件时,稀疏误差界不成立。决定性证据应同时给出最强支持对象与最强反例,并登记滚动盲测、覆盖率和更新成本;如果结论只在作者选择的表示、样本或停止规则下成立,就只能称为条件性转向。

另一处后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。最低报告责任包括“有效独立信息量/原始时间点数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:空间统计称“有效样本量”,信号处理称“谱条件数”;另见第310号空间依赖。只有“有效独立信息量/原始时间点数”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置E——把『高维时间序列:稀疏估计必须先控制谱依赖』成立所需的边界环境作为首要显露 单因决定『高维时间序列:稀疏估计必须先控制谱依赖』当前结论的最小充分项只有:Lasso等高维估计在相关时间序列中仍可获得误差界但有效样本量由谱密度的稳定 预设〔03 相关方向等同因果方向〕高维独立样本理论只需把样本数换成时间点数即可用于序列 量纲有效独立信息量/原始时间点数 失效失效边界是『谱密度无界、过程非平稳或重尾超出集中条件时,稀疏误差界不成立』;越过该边界,相关条件越强,有效独立信息量反而越低 自曝『高维时间序列:稀疏估计必须先控制谱依赖』的原始材料只直接支持“SumantaBasu等在2015年〈RegularizedEstimationinSparseHigh-DimensionalTimeSeries”,没有自动覆盖边界外对象 空栏『高维时间序列:稀疏估计必须先控制谱依赖』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名空间统计称“有效样本量”,信号处理称“谱条件数”;另见第 215 号第 19 条『数字孪生等离子体:实时状态估计必须带不确定度』
【第二幕】这十年 · 约 2016—2026

第二幕把跨序列共享、深度架构与大规模基准推到前台,同时用集成、概率赛道、共形覆盖和零样本评测清算“模型更大即预测更好”。从“时间层级:一个序列也有多个聚合尺度”到“时间序列基础模型:预训练可提供零样本预测,但基准边界要重写”,共同动作是接受规模、复制、边界与部署检验;主证据落在2016—2026年。

一、时间层级:一个序列也有多个聚合尺度Temporal Hierarchies

提出George Athanasopoulos、Rob Hyndman、Nikolaos Kourentzes与Fotios Petropoulos,2017年《European Journal of Operational Research》262(1):60–74,DOI:10.1016/j.ejor.2017.02.046,〈Forecasting with Temporal Hierarchies〉 关键日、周、月、季度等同一序列的不同聚合预测可以组成层级并调和,使短期噪声与长期结构相互约束

2017年前后,旧框架把问题压成一句话:“选择一个最合适频率建模后,其余时间聚合只会重复信息”。但预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“跨尺度调和误差/最佳单一时间尺度误差”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“跨尺度调和误差/最佳单一时间尺度误差”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

本条命题是:日、周、月、季度等同一序列的不同聚合预测可以组成层级并调和,使短期噪声与长期结构相互约束。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“跨尺度调和误差/最佳单一时间尺度误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自George Athanasopoulos等在2017年〈Forecasting with Temporal Hierarchies〉中的主结果。作者把同一序列构造成原频率与2种以上非重叠聚合尺度,形成时间求和矩阵;每个尺度先产生基预测,再用结构或方差加权调和,多项需求数据上改善准确度与稳健性。其关键不是论文规模,而是给出了“跨尺度调和误差/最佳单一时间尺度误差”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:聚合边界、节假日与不规则日历会破坏简单整除层级;长期与短期模型的误差协方差难估,概率预测调和更复杂。失效条件为:当序列无稳定多尺度结构或聚合关系随日历改变时,时间层级不增益。收敛需统一对象与“跨尺度调和误差/最佳单一时间尺度误差”,并公开滚动盲测、覆盖率和更新成本及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。报告应围绕“跨尺度调和误差/最佳单一时间尺度误差”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为小波分析称“多分辨率”,复几何称“尺度层级”;另见第302号尺度分解。碰撞须固定“选择一个最合适频率建模后,其余时间聚合只会重复信息”并比较“跨尺度调和误差/最佳单一时间尺度误差”;第三项是信息时点、预测时域与结构漂移。

位置S——把『时间层级:一个序列也有多个聚合尺度』形成的对象结构作为首要显露 单因决定『时间层级:一个序列也有多个聚合尺度』当前结论的最小充分项只有:日、周、月、季度等同一序列的不同聚合预测可以组成层级并调和,使短期噪声与长期结构相互约束 预设〔03 相关方向等同因果方向〕选择一个最合适频率建模后,其余时间聚合只会重复信息 量纲跨尺度调和误差/最佳单一时间尺度误差 失效失效边界是『序列无稳定多尺度结构或聚合关系随日历改变时,时间层级不增益』;越过该边界,相关条件越强,跨尺度调和误差反而越低 自曝『时间层级:一个序列也有多个聚合尺度』的原始材料只直接支持“主证据来自GeorgeAthanasopoulos等在2017年〈ForecastingwithTemporalHierarchies〉中的主结果”,没有自动覆盖边界外对象 空栏『时间层级:一个序列也有多个聚合尺度』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名小波分析称“多分辨率”,复几何称“尺度层级”;另见第 211 号第 14 条『标量曲率的宏观化:曲率约束必须通过宽度和填充判别』

二、MinT:层级调和应最小化全系统总方差Trace-Minimizing Reconciliation

提出Shanika Wickramasuriya、George Athanasopoulos与Rob Hyndman,2019年《Journal of the American Statistical Association》114(526):804–819,DOI:10.1080/01621459.2018.1448825,〈Optimal Forecast Reconciliation for Hierarchical and Grouped Time Series through Trace Minimization〉 关键在无偏相干线性调和类中,应使用基预测误差协方差最小化调和后误差协方差的迹,而非按历史比例拆分

在2019年前后的文献中,默认判断仍是“层级一致性只需满足加总等式,任何调和方式精度相近”。它没有处理预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“调和后误差协方差迹/基预测误差协方差迹”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“调和后误差协方差迹/基预测误差协方差迹”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条把转向压成一句可检验的话:在无偏相干线性调和类中,应使用基预测误差协方差最小化调和后误差协方差的迹,而非按历史比例拆分。可反驳版本为:固定预测起点、实时信息集、时域与评分规则,按“调和后误差协方差迹/基预测误差协方差迹”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这一区分很重要,因为同一个标题可以在更窄对象类上成立、在更大类上失效;若不登记分母与适用域,后来的推广和反例就会被误写成互相矛盾。

证据链的锚点是Shanika Wickramasuriya等在2019年〈Optimal Forecast Reconciliation for Hierarchical and Grouped Time Series through Trace Minimization〉中的主结果。论文把bottom-up、top-down、OLS与WLS等4类层级调和写进统一投影框架,并推导MinT矩阵;协方差收缩使节点多、样本短时仍可稳定计算。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“调和后误差协方差迹/基预测误差协方差迹”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:最优性条件依赖无偏和协方差估计,结构变化会让历史W失效;局部节点的业务损失未必与迹目标一致。失效条件为:当基预测严重有偏、协方差漂移或业务目标加权不等于总迹时,MinT不保证最优。收敛需统一对象与“调和后误差协方差迹/基预测误差协方差迹”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“调和后误差协方差迹/基预测误差协方差迹”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:控制论称“最小方差投影”,会计称“系统勾稽”;另见第301号正交投影。共享预设为“层级一致性只需满足加总等式,任何调和方式精度相近”;先统一“调和后误差协方差迹/基预测误差协方差迹”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置E——把『MinT:层级调和应最小化全系统总方差』成立所需的边界环境作为首要显露 单因决定『MinT:层级调和应最小化全系统总方差』当前结论的最小充分项只有:在无偏相干线性调和类中,应使用基预测误差协方差最小化调和后误差协方差的迹,而非按历史比例拆分 预设〔04 尺度迁移不改变结论〕层级一致性只需满足加总等式,任何调和方式精度相近 量纲调和后误差协方差迹/基预测误差协方差迹 失效当基预测严重有偏、协方差漂移或业务目标加权不等于总迹时,MinT不保证最优 自曝『MinT:层级调和应最小化全系统总方差』的原始材料只直接支持“证据链的锚点是ShanikaWickramasuriya等在2019年〈OptimalForecastReconciliationforHierar”,没有自动覆盖边界外对象 空栏『MinT:层级调和应最小化全系统总方差』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名控制论称“最小方差投影”,会计称“系统勾稽”;另见第 438 号第 1 条『巨型项目的成本低估是系统性而非偶然误差』

三、M4清算:复杂模型没有跨频率普胜,组合仍最稳M4 Forecasting Competition

提出Spyros Makridakis、Evangelos Spiliotis与Vassilios Assimakopoulos,2020年《International Journal of Forecasting》36(1):54–74,DOI:10.1016/j.ijforecast.2019.04.014,〈The M4 Competition: 100,000 Time Series and 61 Forecasting Methods〉 关键在十万条多频率真实序列上,没有单一统计或机器学习方法普遍占优;组合、混合与强基准在样本外仍具有稳定优势

到2020年前后,常见出发点仍是“模型架构更复杂、参数更多就会在广泛时间序列上稳定优于经典方法”。真正暴露问题的并非一个孤立反例,而是预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“相对OWA误差/Naive2基准误差”为何随条件改变。当研究者改用“相对OWA误差/Naive2基准误差”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

可以把命题写为:在十万条多频率真实序列上,没有单一统计或机器学习方法普遍占优;组合、混合与强基准在样本外仍具有稳定优势。与口号不同,它预先承诺了失败方式:固定预测起点、实时信息集、时域与评分规则,按“相对OWA误差/Naive2基准误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。这使研究者不能在结果出现后移动对象边界、改评分规则或删去困难实例;若这些条件必须改变,结论应被重新命名,而不是继续沿用原来的理论标签。

Spyros Makridakis等在2020年〈The M4 Competition: 100,000 Time Series and 61 Forecasting Methods〉中的主结果是本条的证据起点。M4含100,000条年、季、月、周、日、小时序列,统一滚动留出和sMAPE/MASE;获胜方法将指数平滑与神经网络权重结合,纯ML方法整体未统治榜单。具体读数“相对OWA误差/Naive2基准误差”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

反对意见主要针对外延,而非简单否认主结果:竞赛数据代表性、单一留出窗与指标选择受争议;排行榜会诱发对公开测试集过拟合,真实部署还需成本、更新与概率校准。本条的失效条件为:当任务与训练分布高度匹配、数据量巨大且特征丰富时,复杂模型可能显著胜出。要判断边界是否只是技术限制,需把滚动盲测、覆盖率和更新成本与同一分母下的独立复验放在一起;若方向随对象类或归一化改变,就应主动收窄标题。

另一处后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。最低报告责任包括“相对OWA误差/Naive2基准误差”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:机器学习称“基准清算”,系统研究称“排行榜反例”;另见第360号基准方法学。只有“相对OWA误差/Naive2基准误差”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置S——把『M4清算:复杂模型没有跨频率普胜,组合仍最稳』形成的对象结构作为首要显露 单因决定『M4清算:复杂模型没有跨频率普胜,组合仍最稳』当前结论的最小充分项只有:在十万条多频率真实序列上,没有单一统计或机器学习方法普遍占优;组合、混合与强基准在样本外仍具有稳定优势 预设〔04 尺度迁移不改变结论〕模型架构更复杂、参数更多就会在广泛时间序列上稳定优于经典方法 量纲相对OWA误差/Naive2基准误差 失效当任务与训练分布高度匹配、数据量巨大且特征丰富时,复杂模型可能显著胜出 自曝『M4清算:复杂模型没有跨频率普胜,组合仍最稳』的原始材料只直接支持“SpyrosMakridakis等在2020年〈TheM4Competition:100,000TimeSeriesand61Forecasting”,没有自动覆盖边界外对象 空栏『M4清算:复杂模型没有跨频率普胜,组合仍最稳』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“基准清算”,系统研究称“排行榜反例”;另见第 592 号第 8 条『方程无关多尺度计算』

四、FFORMA:不是选模型,而是按序列特征学组合权重Feature-Based Forecast Model Averaging

提出Pablo Montero-Manso、George Athanasopoulos、Rob Hyndman与Thiyanga Talagala,2020年《International Journal of Forecasting》36(1):86–92,DOI:10.1016/j.ijforecast.2019.02.011,〈FFORMA: Feature-Based Forecast Model Averaging〉 关键可从每条序列的趋势、季节、熵、间歇性等特征学习候选模型组合权重,使模型选择成为跨序列监督学习

2020年前后,本领域常把“每条序列必须单独选择一个唯一最佳模型,跨序列信息不可迁移”当作默认起点。它在典型对象上看似稳固,却被预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“组合误差下降/可用训练序列数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“组合误差下降/可用训练序列数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

核心主张是:可从每条序列的趋势、季节、熵、间歇性等特征学习候选模型组合权重,使模型选择成为跨序列监督学习。它不是定义性的正确,而有清楚的否证口:固定预测起点、实时信息集、时域与评分规则,按“组合误差下降/可用训练序列数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。因此,论证责任从“展示一个成功例子”转为说明成功在什么范围保持、失败在什么条件出现,并把存在性、稳定性、可计算性或可迁移性分层报告。

Pablo Montero-Manso等在2020年〈FFORMA: Feature-Based Forecast Model Averaging〉中的主结果给出主证据:FFORMA用梯度提升树最小化候选预测的加权损失,在M4中作为获胜混合方案的重要组件;特征相近的序列共享“何种模型好”的信息。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“组合误差下降/可用训练序列数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:权重学习依赖训练序列覆盖部署分布,特征计算与候选库决定上限;新结构或短序列可能被错误归类,复杂元模型也会过拟合竞赛指标。失效条件为:当部署序列特征超出训练库或候选模型缺少适合方法时,特征权重无法外推。收敛需统一对象与“组合误差下降/可用训练序列数”,并公开滚动盲测、覆盖率和更新成本及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。报告应围绕“组合误差下降/可用训练序列数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为机器学习称“元学习”,贝叶斯称“条件stacking”;另见第307号模型组合。碰撞须固定“每条序列必须单独选择一个唯一最佳模型,跨序列信息不可迁移”并比较“组合误差下降/可用训练序列数”;第三项是信息时点、预测时域与结构漂移。

位置D——把『FFORMA:不是选模型,而是按序列特征学组合权重』中的操作次序与变化路径作为首要显露 单因决定『FFORMA:不是选模型,而是按序列特征学组合权重』当前结论的最小充分项只有:可从每条序列的趋势、季节、熵、间歇性等特征学习候选模型组合权重,使模型选择成为跨序列监督学习 预设〔04 尺度迁移不改变结论〕每条序列必须单独选择一个唯一最佳模型,跨序列信息不可迁移 量纲组合误差下降/可用训练序列数 失效当部署序列特征超出训练库或候选模型缺少适合方法时,特征权重无法外推 自曝『FFORMA:不是选模型,而是按序列特征学组合权重』的原始材料只直接支持“PabloMontero-Manso等在2020年〈FFORMA:Feature-BasedForecastModelAveraging〉中的主结果”,没有自动覆盖边界外对象 空栏『FFORMA:不是选模型,而是按序列特征学组合权重』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“元学习”,贝叶斯称“条件stacking”;另见第 215 号第 20 条『跨装置机器学习:训练集相似不等于物理可运输』

五、DeepAR:跨序列学习完整概率分布DeepAR Probabilistic Forecasting

提出David Salinas、Valentin Flunkert、Jan Gasthaus与Tim Januschowski,2020年《International Journal of Forecasting》36(3):1181–1191,DOI:10.1016/j.ijforecast.2019.07.001,〈DeepAR: Probabilistic Forecasting with Autoregressive Recurrent Networks〉 关键大量相关序列可共享一个自回归循环网络,通过似然训练输出每步条件分布,并用祖先采样生成多步联合预测

在2020年前后的文献中,标准叙事是“每条时间序列应独立拟合,其他实体的历史只会引入偏差”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“加权分位损失/Naive或经典基准损失”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“加权分位损失/Naive或经典基准损失”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

理论内容不是“再加一种方法”,而是:大量相关序列可共享一个自回归循环网络,通过似然训练输出每步条件分布,并用祖先采样生成多步联合预测。它允许以下决定性反例:固定预测起点、实时信息集、时域与评分规则,按“加权分位损失/Naive或经典基准损失”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

David Salinas等在2020年〈DeepAR: Probabilistic Forecasting with Autoregressive Recurrent Networks〉中的主结果提供了决定性证据。DeepAR以1个全局RNN跨多序列共享参数,并用高斯与负二项2类分布头输出概率预测;在零售和服务器数据上,相对独立ARIMA与指数平滑改善分位损失。这里最有信息量的读数是“加权分位损失/Naive或经典基准损失”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:共享训练要求序列同质性与稳定的尺度处理;自回归采样会累积误差,未知事件、分布外实体和不合适似然会损害校准。失效条件为:当序列之间无共享结构、训练实体与新实体分布差异大或似然错设时不成立。收敛需统一对象与“加权分位损失/Naive或经典基准损失”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“加权分位损失/Naive或经典基准损失”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:多任务学习称“全局模型”,贝叶斯称“层级部分汇聚”;另见第307号层次模型。共享预设为“每条时间序列应独立拟合,其他实体的历史只会引入偏差”;先统一“加权分位损失/Naive或经典基准损失”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置S——把『DeepAR:跨序列学习完整概率分布』形成的对象结构作为首要显露 单因决定『DeepAR:跨序列学习完整概率分布』当前结论的最小充分项只有:大量相关序列可共享一个自回归循环网络,通过似然训练输出每步条件分布,并用祖先采样生成多步联合预测 预设〔05 观测与干预不回写对象〕每条时间序列应独立拟合,其他实体的历史只会引入偏差 量纲加权分位损失/Naive或经典基准损失 失效当序列之间无共享结构、训练实体与新实体分布差异大或似然错设时不成立 自曝『DeepAR:跨序列学习完整概率分布』的原始材料只直接支持“DavidSalinas等在2020年〈DeepAR:ProbabilisticForecastingwithAutoregressiveRecur”,没有自动覆盖边界外对象 空栏『DeepAR:跨序列学习完整概率分布』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名多任务学习称“全局模型”,贝叶斯称“层级部分汇聚”;另见第 434 号第 4 条『共享领导用网络分布替代单一英雄』

六、N-BEATS:可解释基函数也能由深度残差堆叠学习N-BEATS

提出Boris Oreshkin、Dmitri Carpov、Nicolas Chapados与Yoshua Bengio,2020年《International Conference on Learning Representations》ICLR 2020:1–31(会议论文),〈N-BEATS: Neural Basis Expansion Analysis for Interpretable Time Series Forecasting〉 关键纯前馈残差块可同时回看历史与生成前景以趋势季节基展开或通用基函数实现强单变量

2020年前后,旧框架把问题压成一句话:“强时间序列预测必须依赖手工状态空间结构或递归网络”。但预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“样本外sMAPE/Naive2或统计基准sMAPE”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“样本外sMAPE/Naive2或统计基准sMAPE”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

新命题明确写成:纯前馈残差块可同时回看历史与生成前景,以趋势、季节基展开或通用基函数实现强单变量预测,无需显式递归或注意力。这句话可以被反驳,检验方式是:固定预测起点、实时信息集、时域与评分规则,按“样本外sMAPE/Naive2或统计基准sMAPE”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

主证据来自Boris Oreshkin等在2020年〈N-BEATS: Neural Basis Expansion Analysis for Interpretable Time Series Forecasting〉中的主结果。N-BEATS每个残差块同时输出backcast与forecast 2个向量并逐块堆叠;在M3、M4与旅游3套数据上取得强准确度,解释版用多项式与谐波基显示趋势季节分解。其关键不是论文规模,而是给出了“样本外sMAPE/Naive2或统计基准sMAPE”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

后续争论集中在:参数量、集成与训练成本较高;“可解释”只针对指定基展开,结构变化与长外推仍可能失败,公开基准调参会放大优势。因此,本条并非无条件有效;当数据极少、需要结构因果解释或预测时域远超训练模式时,N-BEATS优势不保证。收口所需的不是一句“仍需研究”,而是一套双方都可能失败的设计:统一对象、分母、反例族和资源预算,并让“样本外sMAPE/Naive2或统计基准sMAPE”在独立材料上接受复算。

另一处常被略过的是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。当本条进入证明库、课堂、临床、软件或工程流程时,不能只验最终分数,还要记录中间量怎样随尺度、样本或预算变化。若收益来自把代价转移到未计分环节,它并没有兑现原命题。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:调和分析称“基展开”,深度学习称“残差堆叠”;另见第302号函数分解。只有“样本外sMAPE/Naive2或统计基准sMAPE”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置D——把『N-BEATS:可解释基函数也能由深度残差堆叠学习』中的操作次序与变化路径作为首要显露 单因决定『N-BEATS:可解释基函数也能由深度残差堆叠学习』当前结论的最小充分项只有:纯前馈残差块可同时回看历史与生成前景以趋势季节基展开或通用基函数实现强单变量 预设〔05 观测与干预不回写对象〕强时间序列预测必须依赖手工状态空间结构或递归网络 量纲样本外sMAPE/Naive2或统计基准sMAPE 失效当数据极少、需要结构因果解释或预测时域远超训练模式时,N-BEATS优势不保证 自曝『N-BEATS:可解释基函数也能由深度残差堆叠学习』的原始材料只直接支持“主证据来自BorisOreshkin等在2020年〈N-BEATS:NeuralBasisExpansionAnalysisforInterpret”,没有自动覆盖边界外对象 空栏『N-BEATS:可解释基函数也能由深度残差堆叠学习』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名调和分析称“基展开”,深度学习称“残差堆叠”;另见第 432 号第 12 条『可解释性不能代替可理解模型』

七、时间融合Transformer:变量选择、门控与多时域注意力合一Temporal Fusion Transformer

提出Bryan Lim、Sercan Arik、Nicolas Loeff与Tomas Pfister,2021年《International Journal of Forecasting》37(4):1748–1764,DOI:10.1016/j.ijforecast.2021.03.012,〈Temporal Fusion Transformers for Interpretable Multi-horizon Time Series Forecasting〉 关键多时域预测可把静态特征、已知未来输入与历史观测分流编码,再用门控变量选择、局部循环和可解释注意力融合

在2021年前后的文献中,默认判断仍是“多步预测只能递归一步一步生成,变量重要性无法随预测时域变化”。它没有处理预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“多时域分位损失/经典或深度基准损失”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“多时域分位损失/经典或深度基准损失”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条命题是:多时域预测可把静态特征、已知未来输入与历史观测分流编码,再用门控变量选择、局部循环和可解释注意力融合。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“多时域分位损失/经典或深度基准损失”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Bryan Lim等在2021年〈Temporal Fusion Transformers for Interpretable Multi-horizon Time Series Forecasting〉中的主结果。TFT把变量选择、门控残差和多时域注意力3类模块合到同一网络,并一次输出多个预测时域与多个分位;零售、交通和电力数据以分位损失比较。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“多时域分位损失/经典或深度基准损失”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:注意力权重不等于因果贡献,复杂架构计算昂贵且易受超参数与数据泄漏影响;解释稳定性需跨重训练验证。失效条件为:当未来协变量未知、样本不足或注意力结构与真实依赖不匹配时不成立。收敛需统一对象与“多时域分位损失/经典或深度基准损失”,并公开滚动盲测、覆盖率和更新成本及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。报告应围绕“多时域分位损失/经典或深度基准损失”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为人机交互称“可视注意”,统计称“时变特征权重”;另见第353号排序解释。碰撞须固定“多步预测只能递归一步一步生成,变量重要性无法随预测时域变化”并比较“多时域分位损失/经典或深度基准损失”;第三项是信息时点、预测时域与结构漂移。

位置E——把『时间融合Transformer:变量选择、门控与多时域注意力合一』成立所需的边界环境作为首要显露 单因决定『时间融合Transformer:变量选择、门控与多时域注意力合一』当前结论的最小充分项只有:多时域预测可把静态特征、已知未来输入与历史观测分流编码,再用门控变量选择、局部循环和可解释注意力融合 预设〔05 观测与干预不回写对象〕多步预测只能递归一步一步生成,变量重要性无法随预测时域变化 量纲多时域分位损失/经典或深度基准损失 失效当未来协变量未知、样本不足或注意力结构与真实依赖不匹配时不成立 自曝『时间融合Transformer:变量选择、门控与多时域注意力合一』的原始材料只直接支持“证据链的锚点是BryanLim等在2021年〈TemporalFusionTransformersforInterpretableMulti-hor”,没有自动覆盖边界外对象 空栏『时间融合Transformer:变量选择、门控与多时域注意力合一』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名人机交互称“可视注意”,统计称“时变特征权重”;另见第 440 号第 9 条『历史意识让组织以过去解释未来选择』

八、全局与局部:序列数可替代单序列长度Global versus Local Forecasting

提出Pablo Montero-Manso与Rob Hyndman,2021年《International Journal of Forecasting》37(4):1632–1640,DOI:10.1016/j.ijforecast.2020.10.002,〈Principles and Algorithms for Forecasting Groups of Time Series: Locality and Globality〉 关键一个全局模型即使参数更多也能因跨序列共享而比逐序列局部模型拥有更小有效复杂度

到2021年前后,常见出发点仍是“预测模型复杂度必须与单条序列长度比较,跨实体观测不能共同支撑参数”。真正暴露问题的并非一个孤立反例,而是预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“共享参数训练观测数/模型自由度”为何随条件改变。当研究者改用“共享参数训练观测数/模型自由度”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

本条命题是:一个全局模型即使参数更多,也能因跨序列共享而比逐序列局部模型拥有更小有效复杂度;样本量应按所有序列共同计算。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“共享参数训练观测数/模型自由度”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Pablo Montero-Manso等在2021年〈Principles and Algorithms for Forecasting Groups of Time Series: Locality and Globality〉中的主结果是本条的证据起点。作者把全局模型的有效训练量写成“序列数M×每序列可用窗口T”;当单序列短而M大时,跨序列共享可把分母从T扩成近似MT,反驳每条序列只能单独拟合的默认。具体读数“共享参数训练观测数/模型自由度”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:序列异质、实体特征缺失和分布漂移会导致负迁移;全局模型的有效样本并非简单时点总数,跨序列相关会减少信息量。失效条件为:当序列来自互不相关机制且没有可用分组或条件特征时,全局共享会负迁移。收敛需统一对象与“共享参数训练观测数/模型自由度”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“共享参数训练观测数/模型自由度”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:贝叶斯称“部分汇聚”,机器学习称“多任务学习”;另见第307号层次先验。共享预设为“预测模型复杂度必须与单条序列长度比较,跨实体观测不能共同支撑参数”;先统一“共享参数训练观测数/模型自由度”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置D——把『全局与局部:序列数可替代单序列长度』中的操作次序与变化路径作为首要显露 单因决定『全局与局部:序列数可替代单序列长度』当前结论的最小充分项只有:一个全局模型即使参数更多也能因跨序列共享而比逐序列局部模型拥有更小有效复杂度 预设〔06 聚合次序不影响结论〕预测模型复杂度必须与单条序列长度比较,跨实体观测不能共同支撑参数 量纲共享参数训练观测数/模型自由度 失效当序列来自互不相关机制且没有可用分组或条件特征时,全局共享会负迁移 自曝『全局与局部:序列数可替代单序列长度』的原始材料只直接支持“PabloMontero-Manso等在2021年〈PrinciplesandAlgorithmsforForecastingGroupsofTim”,没有自动覆盖边界外对象 空栏『全局与局部:序列数可替代单序列长度』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名贝叶斯称“部分汇聚”,机器学习称“多任务学习”;另见第 432 号第 11 条『人机互补比替代更能解释绩效』

九、疫情预测集成:不确定性质量比单次冠军更重要COVID-19 Forecast Ensembles

提出Estee Cramer、Evan Ray、Velma Lopez等,2022年《Proceedings of the National Academy of Sciences》119(15):e2113561119,DOI:10.1073/pnas.2113561119,〈Evaluation of Individual and Ensemble Probabilistic Forecasts of COVID-19 Mortality in the United States〉 关键在结构快速变化和模型分歧巨大的疫情中,等权或中位数集成可比多数单模型更准确、更稳定,并应按概率区间同时评价

2022年前后,本领域常把“在危机预测中应选择最近表现最好的一个模型,而不是保留多模型分歧”当作默认起点。它在典型对象上看似稳固,却被预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“集成加权区间分数/最佳事前可选单模型分数”为何随条件改变直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“集成加权区间分数/最佳事前可选单模型分数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条命题是:在结构快速变化和模型分歧巨大的疫情中,等权或中位数集成可比多数单模型更准确、更稳定,并应按概率区间同时评价。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“集成加权区间分数/最佳事前可选单模型分数”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Estee Cramer等在2022年〈Evaluation of Individual and Ensemble Probabilistic Forecasts of COVID-19 Mortality in the United States〉中的主结果给出主证据:美国COVID-19 Forecast Hub比较数十模型的一至四周死亡预测;集成在加权区间分数与绝对误差上长期位于前列,且避免单模型灾难性失败。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“集成加权区间分数/最佳事前可选单模型分数”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:报告延迟、政策变化和新变种使历史表现快速失效;集成不能消除共同数据偏差,模型库同质时也会共同错。失效条件为:当候选模型共享同一错误数据或一个模型有稳定结构优势且可事前识别时,简单集成未必最佳。收敛需统一对象与“集成加权区间分数/最佳事前可选单模型分数”,并公开滚动盲测、覆盖率和更新成本及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。最低报告责任包括“集成加权区间分数/最佳事前可选单模型分数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:风险管理称“模型分散”,贝叶斯称“预测组合”;另见第307号stacking。只有“集成加权区间分数/最佳事前可选单模型分数”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置E——把『疫情预测集成:不确定性质量比单次冠军更重要』成立所需的边界环境作为首要显露 单因决定『疫情预测集成:不确定性质量比单次冠军更重要』当前结论的最小充分项只有:在结构快速变化和模型分歧巨大的疫情中,等权或中位数集成可比多数单模型更准确、更稳定,并应按概率区间同时评价 预设〔06 聚合次序不影响结论〕在危机预测中应选择最近表现最好的一个模型,而不是保留多模型分歧 量纲集成加权区间分数/最佳事前可选单模型分数 失效当候选模型共享同一错误数据或一个模型有稳定结构优势且可事前识别时,简单集成未必最佳 自曝『疫情预测集成:不确定性质量比单次冠军更重要』的原始材料只直接支持“EsteeCramer等在2022年〈EvaluationofIndividualandEnsembleProbabilisticForecasts”,没有自动覆盖边界外对象 空栏『疫情预测集成:不确定性质量比单次冠军更重要』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名风险管理称“模型分散”,贝叶斯称“预测组合”;另见第 590 号第 16 条『多模型结构不确定性』

十、M5不确定性赛道:点预测强不代表分位预测可信M5 Uncertainty Competition

提出Spyros Makridakis、Evangelos Spiliotis、Vassilios Assimakopoulos等,2022年《International Journal of Forecasting》38(4):1365–1385,DOI:10.1016/j.ijforecast.2021.10.009,〈The M5 Uncertainty Competition: Results, Findings and Conclusions〉 关键零售层级预测必须同时给出多个分位并在聚合层级评价;点预测排行榜不能替代对尾部、校准和层级一致性的检验

在2022年前后的文献中,标准叙事是“点预测误差低的模型自然也会给出校准的不确定性区间”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“加权分位损失/Naive概率基准损失”为何随条件改变。主证据迫使研究者把对象、表示与验证尺度拆开;以“加权分位损失/Naive概率基准损失”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

理论内容不是“再加一种方法”,而是:零售层级预测必须同时给出多个分位并在聚合层级评价;点预测排行榜不能替代对尾部、校准和层级一致性的检验。它允许以下决定性反例:固定预测起点、实时信息集、时域与评分规则,按“加权分位损失/Naive概率基准损失”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验时必须让支持方与反对方在同一对象、同一误差口径和同一停止规则下比较,否则双方只是在各自定义的成功条件里获胜。

Spyros Makridakis等在2022年〈The M5 Uncertainty Competition: Results, Findings and Conclusions〉中的主结果提供了决定性证据。竞赛使用沃尔玛42,840条层级序列并评价九个分位的加权缩放pinball loss;结果显示混合统计与机器学习方法领先,但高层聚合与低层单品的相对优势不同。这里最有信息量的读数是“加权分位损失/Naive概率基准损失”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:单一公开数据集、固定库存环境与竞赛指标限制外推;分位分别预测可能交叉,层级概率一致性并未完全解决。失效条件为:当业务只需确定性短期点预测且损失对尾部不敏感时,概率赛道增益可能有限。收敛需统一对象与“加权分位损失/Naive概率基准损失”,并公开滚动盲测、覆盖率和更新成本及最强反例。

实践后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。报告应围绕“加权分位损失/Naive概率基准损失”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是本条可与碰撞行登记的相邻学科直接比较。异名为金融称“风险分位”,贝叶斯称“后验预测区间”;另见第307号校准诊断。碰撞须固定“点预测误差低的模型自然也会给出校准的不确定性区间”并比较“加权分位损失/Naive概率基准损失”;第三项是信息时点、预测时域与结构漂移。

位置S——把『M5不确定性赛道:点预测强不代表分位预测可信』形成的对象结构作为首要显露 单因决定『M5不确定性赛道:点预测强不代表分位预测可信』当前结论的最小充分项只有:零售层级预测必须同时给出多个分位并在聚合层级评价;点预测排行榜不能替代对尾部、校准和层级一致性的检验 预设〔06 聚合次序不影响结论〕点预测误差低的模型自然也会给出校准的不确定性区间 量纲加权分位损失/Naive概率基准损失 失效当业务只需确定性短期点预测且损失对尾部不敏感时,概率赛道增益可能有限 自曝『M5不确定性赛道:点预测强不代表分位预测可信』的原始材料只直接支持“SpyrosMakridakis等在2022年〈TheM5UncertaintyCompetition:Results,FindingsandCon”,没有自动覆盖边界外对象 空栏『M5不确定性赛道:点预测强不代表分位预测可信』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名金融称“风险分位”,贝叶斯称“后验预测区间”;另见第 214 号第 16 条『贝叶斯优化:昂贵黑箱由后验不确定性安排试验』

十一、非交换共形预测:覆盖保证也要按时间漂移加权Conformal Prediction beyond Exchangeability

提出Rina Foygel Barber、Emmanuel Candès、Aaditya Ramdas与Ryan Tibshirani,2023年《The Annals of Statistics》51(2):816–845,DOI:10.1214/23-AOS2276,〈Conformal Prediction beyond Exchangeability〉 关键当数据不再可交换时,可用对历史样本的权重和稳定性度量获得近似覆盖误差界,而不应机械宣称有限样本精确覆盖

2023年前后,旧框架把问题压成一句话:“共形预测只在完全可交换数据上有意义,或可忽略时间顺序直接使用”。但预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“实际未覆盖率/名义未覆盖率”为何随条件改变,使同名结论在不同对象上并不可比。这里的卡点不是技巧不足,而是分母缺席:只有把“实际未覆盖率/名义未覆盖率”固定下来,才能区分真结构、近似误差与由选择过程制造的表面一致。

新命题明确写成:当数据不再可交换时,可用对历史样本的权重和稳定性度量获得近似覆盖误差界,而不应机械宣称有限样本精确覆盖。这句话可以被反驳,检验方式是:固定预测起点、实时信息集、时域与评分规则,按“实际未覆盖率/名义未覆盖率”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。它要求同时锁定对象类、归一化和资源预算;若只换一批更有利的数据、放宽失败标准或改用更弱基线,得到的只是另一条命题,不能算对原主张的支持。

主证据来自Rina Foygel Barber等在2023年〈Conformal Prediction beyond Exchangeability〉中的主结果。论文给出目标覆盖1−α下的加权共形与一般非交换误差界;时间序列对最近观测赋更高权重时,覆盖缺口由权重集中度与置换敏感度共同控制。其关键不是论文规模,而是给出了“实际未覆盖率/名义未覆盖率”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:保证可能宽松且依赖稳定性,突变和对抗漂移仍会失效;加权选择也需事前规则,区间宽度可能显著增加。失效条件为:当漂移突发且权重规则无法给近期数据足够质量,或分数高度不稳定时,覆盖界无用。收敛需统一对象与“实际未覆盖率/名义未覆盖率”,并公开滚动盲测、覆盖率和更新成本及最强反例。

由此,对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。对本项证据须公开“实际未覆盖率/名义未覆盖率”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:本条可与碰撞行登记的相邻学科直接比较。异名:质量控制称“覆盖率监控”,在线学习称“漂移适应”;另见第360号SLO。共享预设为“共形预测只在完全可交换数据上有意义,或可忽略时间顺序直接使用”;先统一“实际未覆盖率/名义未覆盖率”,若仍逆向,再检验信息时点、预测时域与结构漂移。

位置E——把『非交换共形预测:覆盖保证也要按时间漂移加权』成立所需的边界环境作为首要显露 单因决定『非交换共形预测:覆盖保证也要按时间漂移加权』当前结论的最小充分项只有:当数据不再可交换时,可用对历史样本的权重和稳定性度量获得近似覆盖误差界,而不应机械宣称有限样本精确覆盖 预设〔01 谁进入分母〕共形预测只在完全可交换数据上有意义,或可忽略时间顺序直接使用 量纲实际未覆盖率/名义未覆盖率 失效当漂移突发且权重规则无法给近期数据足够质量,或分数高度不稳定时,覆盖界无用 自曝『非交换共形预测:覆盖保证也要按时间漂移加权』的原始材料只直接支持“主证据来自RinaFoygelBarber等在2023年〈ConformalPredictionbeyondExchangeability〉中的主结”,没有自动覆盖边界外对象 空栏『非交换共形预测:覆盖保证也要按时间漂移加权』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名质量控制称“覆盖率监控”,在线学习称“漂移适应”;另见第 590 号第 15 条『共形预测』

十二、时间序列基础模型:预训练可提供零样本预测,但基准边界要重写TimesFM Foundation Model

提出Abhimanyu Das、Weihao Kong、Rajat Sen与Yichen Zhou,2024年《Proceedings of Machine Learning Research》235:10148–10167(会议论文),〈A Decoder-Only Foundation Model for Time-Series Forecasting〉 关键对多领域真实与合成序列预训练的解码器模型可把历史切成patch并在未见数据集

在2024年前后的文献中,默认判断仍是“每个新时间序列任务都必须从本地数据重新拟合模型才能获得有竞争力预测”。它没有处理预测起点、当时可见的信息集、预测时域与评分规则会改变同一组模型的样本外排序;旧口径尤其无法解释“零样本预测误差/逐数据集监督模型误差”为何随条件改变,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“零样本预测误差/逐数据集监督模型误差”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条命题是:对多领域真实与合成序列预训练的解码器模型,可把历史切成patch并在未见数据集上零样本预测,接近逐数据集监督模型。否证方式为:固定预测起点、实时信息集、时域与评分规则,按“零样本预测误差/逐数据集监督模型误差”重做;若主张方向不能在独立对象上复现,或落入明确失效条件后读数仍不改变,本命题就应被否定或收窄。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Abhimanyu Das等在2024年〈A Decoder-Only Foundation Model for Time-Series Forecasting〉中的主结果。TimesFM用1个预训练模型在多频率、多时域公开数据上做零样本评测;统一尺度化和patch token使若干任务接近或超过专门监督基准,同时省去每个数据集1次重新训练。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“零样本预测误差/逐数据集监督模型误差”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:预训练语料覆盖、数据泄漏、频率标准化和分布外事件仍决定表现;接近平均基准不等于概率校准、因果解释或在业务损失上占优。失效条件为:当目标域结构、频率、尺度或外生机制超出预训练分布,或需要严格不确定性校准时不成立。收敛需统一对象与“零样本预测误差/逐数据集监督模型误差”,并公开滚动盲测、覆盖率和更新成本及最强反例。

另一处后果是:对本条的评价不能停在一次最终平均值;预测基准应冻结信息集与预测起点,按固定时域报告恰当得分、覆盖率、更新成本和结构变化后的恢复时长,不能只报一次排行榜名次。最低报告责任包括“零样本预测误差/逐数据集监督模型误差”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见本条可与碰撞行登记的相邻学科直接比较。其他领域称:自然语言称“基础模型”,统计称“跨任务全局模型”;另见第353号检索增强模型。只有“零样本预测误差/逐数据集监督模型误差”可换算时才属同一动作;冲突仍在时应测量信息时点、预测时域与结构漂移。

位置E——把『时间序列基础模型:预训练可提供零样本预测,但基准边界要重写』成立所需的边界环境作为首要显露 单因决定『时间序列基础模型:预训练可提供零样本预测,但基准边界要重写』当前结论的最小充分项只有:对多领域真实与合成序列预训练的解码器模型可把历史切成patch并在未见数据集 预设〔02 单一读数代表复杂对象〕每个新时间序列任务都必须从本地数据重新拟合模型才能获得有竞争力预测 量纲零样本预测误差/逐数据集监督模型误差 失效当目标域结构、频率、尺度或外生机制超出预训练分布,或需要严格不确定性校准时不成立 自曝『时间序列基础模型:预训练可提供零样本预测,但基准边界要重写』的原始材料只直接支持“证据链的锚点是AbhimanyuDas等在2024年〈ADecoder-OnlyFoundationModelforTime-SeriesForec”,没有自动覆盖边界外对象 空栏『时间序列基础模型:预训练可提供零样本预测,但基准边界要重写』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名自然语言称“基础模型”,统计称“跨任务全局模型”;另见第 433 号第 10 条『需要基础模型重写和解目标』

◎ 二十年连起来看

第一条贯穿线是:评价函数决定什么叫“好预测”。严格恰当评分、M4/M5、疫情集成和共形覆盖说明,点误差、概率分数、校准与业务损失会给出不同排名;没有声明评分规则,冠军没有稳定含义。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。

第二条贯穿线是:单序列被放回系统。层级与时间层级要求加总一致,全局模型和DeepAR跨实体共享,nowcasting按发布流更新。有效训练集不再等于一条序列长度。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。

第三条贯穿线是:结构变化从异常变成常态。PELT识别分段,因果影响依赖干预前稳定,共形方法给非交换覆盖界,基础模型则面对预训练外新机制。未解的是如何在突变时既快适应又不丢覆盖。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。

◎ 三个常见误解

误解一:时间序列模型只要随机切分训练测试即可。随机切分泄漏未来和修订信息;评估必须按真实发布时间滚动。容易误读,是因为普通机器学习默认样本可交换。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。最容易误读之处,应由反例、边界或样本外结果直接揭示。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。

误解二:深度模型一定比经典统计方法强。M4显示组合与混合方法最稳,优势取决于序列数量、共享结构与调参预算。容易误读,是因为少数热门数据集的最好分数被当作普遍证据。最容易误读之处,应由反例、边界或样本外结果直接揭示。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。

误解三:95%区间就是95%时间覆盖。模型区间常条件于参数与分布假设,结构漂移会破坏覆盖;共形也需交换性或稳定性。容易误读,是因为同一个百分数掩盖了完全不同的保证。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。最容易误读之处,应由反例、边界或样本外结果直接揭示。

◎ 与相邻领域的接口

与第307号贝叶斯统计与计算的接口在状态空间、粒子MCMC、后验预测和模型组合;本块重点是滚动部署与预测损失,第307号重点是后验近似和算法诊断。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

与第310号空间统计的接口在时空过程:时间相关和空间相关共同减少有效样本量;本块处理发布日期、时域和动态状态,第310号处理支持、距离与空间障碍。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。

与第302号调和分析的接口在频率、尺度和稀疏分解。调和分析追求最坏函数上的范数界,时间序列追求给定生成机制下的样本外预测;同一频率语言承担不同证据标准。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。

与第360号系统性能与能效的接口在在线监控和尾部服务级目标:预测模型必须把推断延迟、更新成本与覆盖失败纳入部署指标。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。

◎ 争议现场

第一场争论是大型全局模型是否会终结局部统计模型。支持者以跨序列共享和零样本表现为证,批评者指出泄漏、分布外与校准边界。要收敛,需要冻结时间戳的未见领域、严格重复序列去重和相同计算预算。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。

第二场争论是预测竞赛排名能否代表实践。竞赛提供共同数据与指标,却可能过拟合固定留出和公开基准。要收敛,需要长期滚动盲测、维护成本和结构突变后的恢复时间。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。

第三场争论是非交换环境下覆盖保证的价值。加权共形给误差界,但区间可过宽。要收敛,需要按漂移强度同时报告覆盖、区间宽度和适应延迟,而不是只看名义覆盖。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。

◎ 往下五年看什么

观察点一是时间序列基础模型在真正未见行业中的零样本误差比、概率校准和每条序列推断能耗;三项缺一不可。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

观察点二是公共预测基准是否保存原始发布日期与修订版本,以及用实时数据重跑后模型排名改变多少。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。

观察点三是层级概率预测中,分位交叉率、加总不一致率和层级各层的加权分数能否同时下降。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

观察点四是结构突变后,模型恢复到基准误差所需时长与这一期间的未覆盖率;它比长期平均误差更贴近部署风险。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

◎ 可与哪些领域对撞

本块第三条“预测组合之谜”可与第307号“贝叶斯stacking”对撞。共享预设是候选模型都可能错;相反点是简单平均回避权重估计,stacking主动按留一得分估权。若两边都成立,第三项是权重复杂度相对训练窗的比。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

本块第四条“层级调和”可与第352号形式化方法的“不变量保持”对撞。共享预设是局部输出必须满足全局约束;相反点是预测允许最小方差投影后的数值改动,形式化验证要求程序执行前证明不变量。若两边都成立,第三项是允许多大修正才仍算同一预测。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

本块第七条“因果影响”可与第308号“切换实验”对撞。共享预设是未发生路径必须由对照结构给出;相反点是结构时间序列依赖模型稳定,切换实验依赖随机时间块。若两边都成立,第三项是模型与设计证据如何联合加权。第三项必须能产生新的可证伪读数,不能只是折中措辞。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。

本块第二十条“基础模型”可与第305号“工具支持撤掉后迁移”对撞。共享预设是跨任务经验可迁移;相反点是基础模型把过去序列外包为即时预测,教育要求支持撤掉后能力留在学习者。若两边都成立,第三项是迁移的承载者究竟是模型还是主体。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

◎ 十条可做的研究命题

1. 命题:严格恰当评分规则改变会系统改变概率预测模型排名;在同一盲测集比较CRPS、对数与尾加权分数;若排名高度一致,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

2. 命题:使用实时vintage数据会使宏观nowcasting模型排名与最终修订数据不同;重建发布数据库;若排名不变,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

3. 命题:等权组合优势随权重参数数/训练窗长度增加而扩大;跨数据集回归检验;若无关系,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

4. 命题:MinT协方差收缩在节点数高于时间窗时优于样本协方差;模拟层级漂移;若系统误差不低,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

5. 命题:PELT的实际线性计算只在变点密度超过阈值时出现;控制变点数增长;若所有情形都线性,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

6. 命题:全局模型的收益由跨序列残差相关和实体数共同决定;按两指标分层盲测;若无预测力,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

7. 命题:疫情式结构突变下中位数集成比最近冠军模型恢复更快;在多危机序列测恢复时长;若不更快,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

8. 命题:非交换共形的权重半衰期应接近结构变化时间尺度;跨漂移速度优化;若最优半衰期无关系,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

9. 命题:时间序列基础模型的零样本优势主要来自训练语料频率与目标相似度;建立去重语料审计;若相似度不预测误差,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。

10. 命题:把每焦耳预测得分纳入评价会提升经典轻量模型的相对排名;在CPU/GPU同批测试;若排名不变,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

◎ 资料核验

  1. Tilmann Gneiting与Adrian Raftery,2007年《Journal of the American Statistical Association》102(477):359–378,DOI:10.1198/016214506000001437,〈Strictly Proper Scoring Rules, Prediction, and Estimation〉
  2. Domenico Giannone、Lucrezia Reichlin与David Small,2008年《Journal of Monetary Economics》55(4):665–676,DOI:10.1016/j.jmoneco.2008.05.010,〈Nowcasting: The Real-Time Informational Content of Macroeconomic Data〉
  3. Jeremy Smith与Kenneth Wallis,2009年《Oxford Bulletin of Economics and Statistics》71(3):331–355,DOI:10.1111/j.1468-0084.2008.00541.x,〈A Simple Explanation of the Forecast Combination Puzzle〉
  4. Rob Hyndman、Roman Ahmed、George Athanasopoulos与Han Lin Shang,2011年《Computational Statistics & Data Analysis》55(9):2579–2589,DOI:10.1016/j.csda.2011.03.006,〈Optimal Combination Forecasts for Hierarchical Time Series〉
  5. Ruud Teunter、Aris Syntetos与M. Zied Babai,2011年《European Journal of Operational Research》214(3):606–615,DOI:10.1016/j.ejor.2011.05.018,〈Intermittent Demand: Linking Forecasting to Inventory Obsolescence〉
  6. Rebecca Killick、Paul Fearnhead与Idris Eckley,2012年《Journal of the American Statistical Association》107(500):1590–1598,DOI:10.1080/01621459.2012.737745,〈Optimal Detection of Changepoints with a Linear Computational Cost〉
  7. Kay Brodersen、Fabian Gallusser、Jim Koehler、Nicolas Remy与Steven Scott,2015年《The Annals of Applied Statistics》9(1):247–274,DOI:10.1214/14-AOAS788,〈Inferring Causal Impact Using Bayesian Structural Time-Series Models〉
  8. Sumanta Basu与George Michailidis,2015年《The Annals of Statistics》43(4):1535–1567,DOI:10.1214/15-AOS1315,〈Regularized Estimation in Sparse High-Dimensional Time Series Models〉
  9. George Athanasopoulos、Rob Hyndman、Nikolaos Kourentzes与Fotios Petropoulos,2017年《European Journal of Operational Research》262(1):60–74,DOI:10.1016/j.ejor.2017.02.046,〈Forecasting with Temporal Hierarchies〉
  10. Shanika Wickramasuriya、George Athanasopoulos与Rob Hyndman,2019年《Journal of the American Statistical Association》114(526):804–819,DOI:10.1080/01621459.2018.1448825,〈Optimal Forecast Reconciliation for Hierarchical and Grouped Time Series through Trace Minimization〉
  11. Spyros Makridakis、Evangelos Spiliotis与Vassilios Assimakopoulos,2020年《International Journal of Forecasting》36(1):54–74,DOI:10.1016/j.ijforecast.2019.04.014,〈The M4 Competition: 100,000 Time Series and 61 Forecasting Methods〉
  12. Pablo Montero-Manso、George Athanasopoulos、Rob Hyndman与Thiyanga Talagala,2020年《International Journal of Forecasting》36(1):86–92,DOI:10.1016/j.ijforecast.2019.02.011,〈FFORMA: Feature-Based Forecast Model Averaging〉
  13. David Salinas、Valentin Flunkert、Jan Gasthaus与Tim Januschowski,2020年《International Journal of Forecasting》36(3):1181–1191,DOI:10.1016/j.ijforecast.2019.07.001,〈DeepAR: Probabilistic Forecasting with Autoregressive Recurrent Networks〉
  14. Boris Oreshkin、Dmitri Carpov、Nicolas Chapados与Yoshua Bengio,2020年《International Conference on Learning Representations》ICLR 2020:1–31(会议论文),〈N-BEATS: Neural Basis Expansion Analysis for Interpretable Time Series Forecasting〉
  15. Bryan Lim、Sercan Arik、Nicolas Loeff与Tomas Pfister,2021年《International Journal of Forecasting》37(4):1748–1764,DOI:10.1016/j.ijforecast.2021.03.012,〈Temporal Fusion Transformers for Interpretable Multi-horizon Time Series Forecasting〉
  16. Pablo Montero-Manso与Rob Hyndman,2021年《International Journal of Forecasting》37(4):1632–1640,DOI:10.1016/j.ijforecast.2020.10.002,〈Principles and Algorithms for Forecasting Groups of Time Series: Locality and Globality〉
  17. Estee Cramer、Evan Ray、Velma Lopez等,2022年《Proceedings of the National Academy of Sciences》119(15):e2113561119,DOI:10.1073/pnas.2113561119,〈Evaluation of Individual and Ensemble Probabilistic Forecasts of COVID-19 Mortality in the United States〉
  18. Spyros Makridakis、Evangelos Spiliotis、Vassilios Assimakopoulos等,2022年《International Journal of Forecasting》38(4):1365–1385,DOI:10.1016/j.ijforecast.2021.10.009,〈The M5 Uncertainty Competition: Results, Findings and Conclusions〉
  19. Rina Foygel Barber、Emmanuel Candès、Aaditya Ramdas与Ryan Tibshirani,2023年《The Annals of Statistics》51(2):816–845,DOI:10.1214/23-AOS2276,〈Conformal Prediction beyond Exchangeability〉
  20. Abhimanyu Das、Weihao Kong、Rajat Sen与Yichen Zhou,2024年《Proceedings of Machine Learning Research》235:10148–10167(会议论文),〈A Decoder-Only Foundation Model for Time-Series Forecasting〉
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行碰撞行(预设/量纲/失效/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板