SDE Universes·新思想前沿数学与统计的其余主干
新思想前沿 · 数学与统计的其余主干

空间统计与地理统计

近二十年 · 两幕 · 20 个新思想 · 约 31,745 字 · 王德生 亲撰 · 2026 年 8 月

空间统计近二十年的核心变化,不是地图更精细,而是“位置只是一个协变量”这一默认被彻底放弃。第一幕把海量空间场、采样位置、交叉协方差、点过程、空间混杂与连续—离散计算桥重新定义;第二幕则把最近邻图、多分辨率、结构化验证、极值依赖、非高斯映射和深度空间预测推到可扩展尺度。真正的转向是:一张地图必须同时交代空间支持、相关尺度、采样机制、计算近似、验证距离和不确定性校准。选目从非平稳协方差、空间混杂、低秩近似、优先采样和SPDE,推进到近邻条件图、多分辨率、障碍域、极值依赖、数据整合与新型结点设计。第一幕建立“空间支持、采样位置和连续场都属于模型”的新默认,第二幕则把删边、分区和几何选择纳入公开基准。这里不把地图平滑度当作可信度;真正要核对的是边界附近的预测、区间覆盖、有效样本量和近似图保留了哪些依赖。阅读时应把每条的主证据年份、关键读数与失效条件连在一起,而不能把标题本身当作已经稳定的共识。

【第一幕】上一个十年 · 约 2006—2016

第一幕把密集协方差矩阵拆成有限基、诱导过程、稀疏精度与点过程,同时暴露低秩、采样和空间混杂的第一轮清算。从“固定秩克里金:海量空间场先压到有限基”到“低秩清算:大尺度拟合好不代表局部预测好”,共同动作是把旧默认改写成可反驳的结构命题;主证据均在2016年前形成。

甲、固定秩克里金:海量空间场先压到有限基Fixed Rank Kriging

提出Noel Cressie与Gardar Johannesson,2008年《Journal of the Royal Statistical Society: Series B》70(1):209–226,DOI:10.1111/j.1467-9868.2007.00633.x,〈Fixed Rank Kriging for Very Large Spatial Data Sets〉 争议或最新Michael L. Stein,2014年《Spatial Statistics》8:1–19,DOI:10.1016/j.spasta.2013.06.003,〈Limitations on Low Rank Approximations for Covariance Matrices of Spatial Data〉 关键以r个多尺度基和一个r乘r随机系数协方差表示非平稳场,在r远小于n时仍给出预测均值与均方误差

2008年前后,本领域常把“克里金的最优性意味着必须直接处理全部n乘n协方差矩阵,近似只能靠局部删点”当作默认起点。它在典型对象上看似稳固,却被卫星与传感器数据达到十万级后,O(n³)分解不可执行;同时全球场常非平稳,局部窗口又会破坏长程一致性直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“基函数秩r/观测位置数n”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条命题是:以r个多尺度基和一个r乘r随机系数协方差表示非平稳场,在r远小于n时仍给出预测均值与均方误差。否证方式为:在声明的对象类中,若以r个多尺度基和一个r乘r随机系数协方差表示非平稳场,在r远小于n时仍给出预测均值与均方误差,则按“基函数秩r/观测位置数n”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Cressie与Johannesson在2008年《英国皇家统计学会B辑》70卷209–226页的固定秩克里金提供了决定性证据。论文对173405个全球臭氧观测取r=396,计算量对n近线性;直接反演173405阶协方差不可行,而有限基仍能给出全球预测与标准误。这里最有信息量的读数是“基函数秩r/观测位置数n”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:固定低秩会把未进入基空间的细尺度变化压成噪声;当预测目标依赖短程结构或r随n增长不足时,误差可能不消失。失效条件为:当固定低秩会把未进入基空间的细尺度变化压成噪声时不成立。收敛需统一对象与“基函数秩r/观测位置数n”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“把空间过程投影到固定数量的基函数,可把密集协方差计算从立方代价改成随观测数近线性增长”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“基函数秩r/观测位置数n”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第301号泛函分析相接:两边都问有限维子空间保留多少原对象;本块以样本外克里金误差验收,第301号以算子范数和近似数验收。异名:机器学习称“低秩特征图”,信号处理称“字典展开”,数值线性代数称“秩压缩”;另见第301号有限维逼近。共享预设为“克里金的最优性意味着必须直接处理全部n乘n协方差矩阵,近似只能靠局部删点”;先统一“基函数秩r/观测位置数n”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置S——把『固定秩克里金:海量空间场先压到有限基』形成的对象结构作为首要显露 单因决定『固定秩克里金:海量空间场先压到有限基』当前结论的最小充分项只有:以r个多尺度基和一个r乘r随机系数协方差表示非平稳场,在r远小于n时仍给出预测均值与均方误差 预设〔01 谁进入分母〕克里金的最优性意味着必须直接处理全部n乘n协方差矩阵,近似只能靠局部删点 量纲基函数秩r/观测位置数n 失效失效边界是『固定低秩会把未进入基空间的细尺度变化压成噪声时不成立』;越过该边界,相关条件越强,基函数秩r反而越低 自曝『固定秩克里金:海量空间场先压到有限基』的原始材料只直接支持“Cressie与Johannesson在2008年《英国皇家统计学会B辑》70卷209–226页的固定秩克里金提供了决定性证据”,没有自动覆盖边界外对象 空栏『固定秩克里金:海量空间场先压到有限基』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“低秩特征图”,信号处理称“字典展开”,数值线性代数称“秩压缩”;另见第 213 号第 3 条『随机数值线性代数与草图法』

乙、预测过程:诱导点定义的是一个新随机过程Gaussian Predictive Processes

提出Sudipto Banerjee、Alan E. Gelfand、Andrew O. Finley与Huiyan Sang,2008年《Journal of the Royal Statistical Society: Series B》70(4):825–848,DOI:10.1111/j.1467-9868.2008.00663.x,〈Gaussian Predictive Process Models for Large Spatial Data Sets〉 争议或最新Andrew O. Finley、Huiyan Sang、Sudipto Banerjee与Alan E. Gelfand,2009年《Computational Statistics & Data Analysis》53(8):2873–2884,DOI:10.1016/j.csda.2008.09.008,〈Improving the Performance of Predictive Process Modeling for Large Datasets〉 关键令原过程在m个结点上的取值生成条件期望过程,并把剩余过程显式留作修正项,使近似对象、计算代价和遗漏方差可分开审计

在2008年前后的文献中,标准叙事是“选取若干结点只是计算技巧,不改变被拟合的随机过程,也不会改变不确定性”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:低秩近似常给出看似平滑的均值,却系统低估结点之间的剩余方差;不同结点布局还会改变短程预测。主证据迫使研究者把对象、表示与验证尺度拆开;以“诱导位置数m/观测位置数n”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

本条命题是:令原过程在m个结点上的取值生成条件期望过程,并把剩余过程显式留作修正项,使近似对象、计算代价和遗漏方差可分开审计。否证方式为:在声明的对象类中,若令原过程在m个结点上的取值生成条件期望过程,并把剩余过程显式留作修正项,使近似对象、计算代价和遗漏方差可分开审计,则按“诱导位置数m/观测位置数n”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Banerjee等在2008年《英国皇家统计学会B辑》70卷825–848页的高斯预测过程。原方法把n阶过程投影到m阶结点空间,主要代价约为O(nm²+m³);2009年修正把被低估的点方差加回,显著改善区间覆盖。其关键不是论文规模,而是给出了“诱导位置数m/观测位置数n”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:结点太少会抹平小尺度,结点太多又恢复高代价;对非高斯或强非平稳过程,结点选择和残差结构共同决定偏差。失效条件为:当结点太少会抹平小尺度,结点太多又恢复高代价时不成立。收敛需统一对象与“诱导位置数m/观测位置数n”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“用少量诱导位置条件期望定义低维过程,比把原协方差矩阵机械截断更有概率解释”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“诱导位置数m/观测位置数n”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第307号贝叶斯统计与计算相接:两边都用诱导变量压缩无限或高维对象;空间统计还必须检查诱导点之间遗漏的地理变异是否进入预测区间。其他领域称:机器学习称“inducing points”,有限元称“节点自由度”,贝叶斯计算称“低秩潜变量”;另见第307号变分诱导变量。只有“诱导位置数m/观测位置数n”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置D——把『预测过程:诱导点定义的是一个新随机过程』中的操作次序与变化路径作为首要显露 单因决定『预测过程:诱导点定义的是一个新随机过程』当前结论的最小充分项只有:令原过程在m个结点上的取值生成条件期望过程,并把剩余过程显式留作修正项,使近似对象、计算代价和遗漏方差可分开审计 预设〔01 谁进入分母〕选取若干结点只是计算技巧,不改变被拟合的随机过程,也不会改变不确定性 量纲诱导位置数m/观测位置数n 失效失效边界是『结点太少会抹平小尺度,结点太多又恢复高代价时不成立』;越过该边界,相关条件越强,诱导位置数m反而越低 自曝『预测过程:诱导点定义的是一个新随机过程』的原始材料只直接支持“主证据来自Banerjee等在2008年《英国皇家统计学会B辑》70卷825–848页的高斯预测过程”,没有自动覆盖边界外对象 空栏『预测过程:诱导点定义的是一个新随机过程』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“inducingpoints”,有限元称“节点自由度”,贝叶斯计算称“低秩潜变量”;另见第 213 号第 4 条『随机迭代求解与随机预条件』

丙、多元Matérn:每一对合理不保证整体合法Multivariate Matérn Cross-Covariance

提出Tilmann Gneiting、William Kleiber与Martin Schlather,2010年《Journal of the American Statistical Association》105(491):1167–1177,DOI:10.1198/jasa.2010.tm09420,〈Matérn Cross-Covariance Functions for Multivariate Random Fields〉 争议或最新Tatiyana V. Apanasovich、Marc G. Genton与Ying Sun,2012年《Journal of the American Statistical Association》107(497):180–193,DOI:10.1080/01621459.2011.643197,〈A Valid Matérn Class of Cross-Covariance Functions for Multivariate Random Fields With Any Number of Components〉 关键多变量空间场的交叉协方差必须作为一个整体保持正定,不能逐对独立挑选相关长度与光滑度

2010年前后,旧默认是“温度、降水、污染等每一变量各自用Matérn,再为每一对指定相关系数,就自然得到合法联合模型”,但当变量数增加,逐对合法的协方差可能组成非正定大矩阵,使似然和预测根本无定义;限制条件是模型的一部分而非软件细节。以“合法交叉参数自由度/逐对无约束参数数”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:把边际方差、平滑度、尺度和交叉相关放进共同参数约束,使任意位置和任意变量组合产生的块协方差矩阵都半正定。否证方式为:在声明的对象类中,若把边际方差、平滑度、尺度和交叉相关放进共同参数约束,使任意位置和任意变量组合产生的块协方差矩阵都半正定,则按“合法交叉参数自由度/逐对无约束参数数”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Gneiting、Kleiber与Schlather在2010年《美国统计学会杂志》105卷1167–1177页的多元Matérn模型。2010年工作给出双变量有效条件;2012年推广到任意p个分量,并允许每个分量具有不同平滑度和相关衰减率,同时显式限制交叉参数。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“合法交叉参数自由度/逐对无约束参数数”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:强约束可能牺牲真实不对称与非平稳交互;变量多时参数数仍按p²增长,估计可识别性比数学正定性更早成为瓶颈。失效条件为:当强约束可能牺牲真实不对称与非平稳交互时不成立。收敛需统一对象与“合法交叉参数自由度/逐对无约束参数数”,并公开边界预测、区间覆盖和计算图及最强反例。

实践后果是:这使“多变量空间场的交叉协方差必须作为一个整体保持正定,不能逐对独立挑选相关长度与光滑度”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。报告应围绕“合法交叉参数自由度/逐对无约束参数数”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是与第351号高性能计算相接:合法块协方差决定线性代数能否执行,而并行算法只负责算得快;若模型本身非正定,再快的分解也没有统计含义。异名为多任务学习称“核共正定”,金融称“协方差可实现性”,控制称“联合噪声模型”;另见第351号多变量数值核。碰撞须固定“温度、降水、污染等每一变量各自用Matérn,再为每一对指定相关系数,就自然得到合法联合模型”并比较“合法交叉参数自由度/逐对无约束参数数”;第三项是空间支持、采样位置与依赖尺度。

位置E——把『多元Matérn:每一对合理不保证整体合法』成立所需的边界环境作为首要显露 单因决定『多元Matérn:每一对合理不保证整体合法』当前结论的最小充分项只有:多变量空间场的交叉协方差必须作为一个整体保持正定,不能逐对独立挑选相关长度与光滑度 预设〔01 谁进入分母〕温度、降水、污染等每一变量各自用Matérn,再为每一对指定相关系数,就自然得到合法联合模型 量纲合法交叉参数自由度/逐对无约束参数数 失效失效边界是『强约束可能牺牲真实不对称与非平稳交互时不成立』;越过该边界,相关条件越强,合法交叉参数自由度反而越低 自曝『多元Matérn:每一对合理不保证整体合法』的原始材料只直接支持“证据链的锚点是Gneiting、Kleiber与Schlather在2010年《美国统计学会杂志》105卷1167–1177页的多元Matérn模型”,没有自动覆盖边界外对象 空栏『多元Matérn:每一对合理不保证整体合法』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名多任务学习称“核共正定”,金融称“协方差可实现性”,控制称“联合噪声模型”;另见第 211 号第 16 条『几何深度学习:对称性必须进入模型架构』

丁、优先抽样:采样位置本身也是数据Preferential Sampling

提出Peter J. Diggle、Raquel Menezes与Ting-li Su,2010年《Journal of the Royal Statistical Society: Series C》59(2):191–232,DOI:10.1111/j.1467-9876.2009.00701.x,〈Geostatistical Inference under Preferential Sampling〉 争议或最新Debdeep Pati、Brian J. Reich与David B. Dunson,2011年《Biometrika》98(1):35–48,DOI:10.1093/biomet/asq067,〈Bayesian Geostatistical Modelling with Informative Sampling Locations〉 关键把采样位置建模为强度依赖潜在空间场的点过程,与观测值模型联合估计;偏好参数为零才退回非信息抽样

2010年前后,旧默认是“给定采样坐标后做地统计推断总是无偏;位置只决定在哪里观测,不参与结果生成”,但污染热点加密、生态调查追踪高丰度区和医疗点集中在城市都会使位置与潜在场相关,普通克里金把设计偏好误写成自然结构。以“高潜在值区采样强度/低潜在值区采样强度”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:把采样位置建模为强度依赖潜在空间场的点过程,与观测值模型联合估计;偏好参数为零才退回非信息抽样。否证方式为:在声明的对象类中,若把采样位置建模为强度依赖潜在空间场的点过程,与观测值模型联合估计;偏好参数为零才退回非信息抽样,则按“高潜在值区采样强度/低潜在值区采样强度”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Diggle、Menezes与Su在2010年《英国皇家统计学会C辑》59卷191–232页的优先抽样理论是本条的证据起点。论文把采样位置过程与观测结果写成2部分联合似然,以对数高斯Cox过程表示位置强度;模拟显示忽略偏好会造成均值与协方差参数偏差,联合模型则让位置本身进入预测。具体读数“高潜在值区采样强度/低潜在值区采样强度”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:联合模型依赖位置强度函数正确,且交通、成本等设计变量若遗漏会与潜在场混淆;仅凭一套采样点通常难识别偏好强度。失效条件为:当联合模型依赖位置强度函数正确,且交通、成本等设计变量若遗漏会与潜在场混淆时不成立。收敛需统一对象与“高潜在值区采样强度/低潜在值区采样强度”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“监测点更愿意落在高值或易达地区时,坐标集合携带关于潜在场的信息,不能条件掉”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“高潜在值区采样强度/低潜在值区采样强度”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第308号实验设计与抽样调查相接:两边都否定“样本量大即可代表”;调查侧观察谁进入样本,空间侧还观察进入样本的位置如何依赖未见场。异名:调查统计称“信息抽样”,推荐系统称“曝光偏差”,因果推断称“选择机制”;另见第308号非概率样本。共享预设为“给定采样坐标后做地统计推断总是无偏;位置只决定在哪里观测,不参与结果生成”;先统一“高潜在值区采样强度/低潜在值区采样强度”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置D——把『优先抽样:采样位置本身也是数据』中的操作次序与变化路径作为首要显露 单因决定『优先抽样:采样位置本身也是数据』当前结论的最小充分项只有:把采样位置建模为强度依赖潜在空间场的点过程,与观测值模型联合估计;偏好参数为零才退回非信息抽样 预设〔02 单一读数代表复杂对象〕给定采样坐标后做地统计推断总是无偏;位置只决定在哪里观测,不参与结果生成 量纲高潜在值区采样强度/低潜在值区采样强度 失效失效边界是『联合模型依赖位置强度函数正确,且交通、成本等设计变量若遗漏会与潜在场混淆时不成立』;越过该边界,相关条件越强,高潜在值区采样强度反而越低 自曝『优先抽样:采样位置本身也是数据』的原始材料只直接支持“Diggle、Menezes与Su在2010年《英国皇家统计学会C辑》59卷191–232页的优先抽样理论是本条的证据起点”,没有自动覆盖边界外对象 空栏『优先抽样:采样位置本身也是数据』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名调查统计称“信息抽样”,推荐系统称“曝光偏差”,因果推断称“选择机制”;另见第 436 号第 16 条『推荐系统同时创造发现与暴露偏差』

戊、空间混杂:加一个空间项可能把效应吃掉Spatial Confounding

提出James S. Hodges与Brian J. Reich,2010年《The American Statistician》64(4):325–334,DOI:10.1198/tast.2010.10052,〈Adding Spatially-Correlated Errors Can Mess Up the Fixed Effect You Love〉 争议或最新Mark J. Paciorek,2010年《Environmetrics》21(5):439–455,DOI:10.1002/env.1009,〈The Importance of Scale for Spatial-Confounding Bias and Precision of Spatial Regression Estimators〉 关键把协变量张成的列空间与空间随机效应子空间分开登记,并将系数变化视为可识别性问题而不是一个更好拟合的自然结果

2010年前后,旧默认是“加入空间随机效应只会吸收残差相关并提高标准误,不会改变已有协变量的科学解释”,但社会经济、温度或暴露本身具有空间平滑性;随机效应若在同一尺度上拟合,会把可解释信号和未测空间混杂一起重新分配。以“含空间项系数估计/不含空间项系数估计”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:把协变量张成的列空间与空间随机效应子空间分开登记,并将系数变化视为可识别性问题而不是一个更好拟合的自然结果。否证方式为:在声明的对象类中,若把协变量张成的列空间与空间随机效应子空间分开登记,并将系数变化视为可识别性问题而不是一个更好拟合的自然结果,则按“含空间项系数估计/不含空间项系数估计”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Hodges与Reich在2010年《美国统计学家》64卷325–334页的空间混杂清算给出主证据:斯洛文尼亚胃癌例中,加入1个ICAR空间项后社会经济效应可从显著变为接近消失;尺度分析进一步比较协变量与未测场2种相关长度,偏差方向由两者比例决定。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“含空间项系数估计/不含空间项系数估计”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:正交限制可稳定系数却不能消除未测空间混杂;若协变量完全由位置决定,就没有非空间信息把其效应与潜在场分开。失效条件为:当正交限制可稳定系数却不能消除未测空间混杂时不成立。收敛需统一对象与“含空间项系数估计/不含空间项系数估计”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“空间随机效应与空间平滑协变量共占同一子空间时,回归系数会随空间项的表示和尺度而改变”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“含空间项系数估计/不含空间项系数估计”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第306号生物统计学相接:两边都问调整变量是否吸收了目标效应;生物统计通常以交换性表述,本块必须再写明空间尺度与支持。其他领域称:计量经济学称“空间固定效应吞噬”,机器学习称“表示泄漏”,信号处理称“共线子空间”;另见第306号因果识别。只有“含空间项系数估计/不含空间项系数估计”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置E——把『空间混杂:加一个空间项可能把效应吃掉』成立所需的边界环境作为首要显露 单因决定『空间混杂:加一个空间项可能把效应吃掉』当前结论的最小充分项只有:把协变量张成的列空间与空间随机效应子空间分开登记,并将系数变化视为可识别性问题而不是一个更好拟合的自然结果 预设〔02 单一读数代表复杂对象〕加入空间随机效应只会吸收残差相关并提高标准误,不会改变已有协变量的科学解释 量纲含空间项系数估计/不含空间项系数估计 失效失效边界是『正交限制可稳定系数却不能消除未测空间混杂时不成立』;越过该边界,相关条件越强,含空间项系数估计反而越低 自曝『空间混杂:加一个空间项可能把效应吃掉』的原始材料只直接支持“Hodges与Reich在2010年《美国统计学家》64卷325–334页的空间混杂清算给出主证据:斯洛文尼亚胃癌例中,加入1个ICAR空间项后社会”,没有自动覆盖边界外对象 空栏『空间混杂:加一个空间项可能把效应吃掉』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名计量经济学称“空间固定效应吞噬”,机器学习称“表示泄漏”,信号处理称“共线子空间”;另见第 432 号第 9 条『因果机器学习从平均效应走向异质效应』

己、只在场数据:伪缺席应被点过程取代Presence-Only Point-Process Modeling

提出David I. Warton与Leah C. Shepherd,2010年《The Annals of Applied Statistics》4(3):1383–1402,DOI:10.1214/10-AOAS331,〈Poisson Point Process Models Solve the “Pseudo-Absence Problem” for Presence-Only Data in Ecology〉 争议或最新William Fithian与Trevor Hastie,2013年《The Annals of Applied Statistics》7(4):1917–1939,DOI:10.1214/13-AOAS667,〈Finite-Sample Equivalence in Statistical Models for Presence-Only Data〉 关键只有出现坐标时,正确对象是空间强度而不是人为制造的二元出现—缺席标签

2010年前后,旧默认是“从区域随机抽取足够多背景点,把它们当作缺席做逻辑回归,就能估计物种出现概率”,但背景点数和位置由分析者决定,截距随伪缺席数量漂移;“没记录”还混合真缺席与未被观察,概率解释失真。以“背景点数量/真实出现点数量”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:用Poisson点过程直接建模单位面积出现强度;逻辑回归只在背景点趋多时其斜率和标准误收敛到点过程结果。否证方式为:在声明的对象类中,若用Poisson点过程直接建模单位面积出现强度;逻辑回归只在背景点趋多时其斜率和标准误收敛到点过程结果,则按“背景点数量/真实出现点数量”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Warton与Shepherd在2010年《应用统计年刊》4卷1383–1402页的只在场点过程模型提供了决定性证据。论文证明当均匀伪缺席数m趋于无穷时,逻辑回归斜率与标准误逼近点过程估计;有限m下,伪缺席采样方案仍会改变截距与效率,因此“只在场”不能靠任意背景点修补。这里最有信息量的读数是“背景点数量/真实出现点数量”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:若记录努力随空间变化却未入模型,强度仍混合生态丰度与观察过程;绝对出现概率还需检测率或独立努力数据。失效条件为:当若记录努力随空间变化却未入模型,强度仍混合生态丰度与观察过程时不成立。收敛需统一对象与“背景点数量/真实出现点数量”,并公开边界预测、区间覆盖和计算图及最强反例。

实践后果是:这使“只有出现坐标时,正确对象是空间强度而不是人为制造的二元出现—缺席标签”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。报告应围绕“背景点数量/真实出现点数量”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是与第353号信息检索与推荐相接:只在场数据里的未记录不等于负例,点击日志里的未点击也不等于不喜欢;两边都需建模曝光或观察过程。异名为流行病学称“事件强度”,犯罪学称“风险表面”,检索称“正例—未标注学习”;另见第353号曝光数据。碰撞须固定“从区域随机抽取足够多背景点,把它们当作缺席做逻辑回归,就能估计物种出现概率”并比较“背景点数量/真实出现点数量”;第三项是空间支持、采样位置与依赖尺度。

位置S——把『只在场数据:伪缺席应被点过程取代』形成的对象结构作为首要显露 单因决定『只在场数据:伪缺席应被点过程取代』当前结论的最小充分项只有:只有出现坐标时,正确对象是空间强度而不是人为制造的二元出现—缺席标签 预设〔02 单一读数代表复杂对象〕从区域随机抽取足够多背景点,把它们当作缺席做逻辑回归,就能估计物种出现概率 量纲背景点数量/真实出现点数量 失效失效边界是『若记录努力随空间变化却未入模型,强度仍混合生态丰度与观察过程时不成立』;越过该边界,相关条件越强,背景点数量反而越低 自曝『只在场数据:伪缺席应被点过程取代』的原始材料只直接支持“Warton与Shepherd在2010年《应用统计年刊》4卷1383–1402页的只在场点过程模型提供了决定性证据”,没有自动覆盖边界外对象 空栏『只在场数据:伪缺席应被点过程取代』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名流行病学称“事件强度”,犯罪学称“风险表面”,检索称“正例—未标注学习”;另见第 584 号第 10 条『极端事件的有限时间结构』

庚、SPDE桥:连续Matérn场可以变成稀疏图The SPDE Approach

提出Finn Lindgren、Håvard Rue与Johan Lindström,2011年《Journal of the Royal Statistical Society: Series B》73(4):423–498,DOI:10.1111/j.1467-9868.2011.00777.x,〈An Explicit Link between Gaussian Fields and Gaussian Markov Random Fields: The Stochastic Partial Differential Equation Approach〉 争议或最新David Simpson、Finn Lindgren与Håvard Rue,2012年《Spatial Statistics》1:16–29,DOI:10.1016/j.spasta.2012.02.003,〈Think Continuous: Markovian Gaussian Models in Spatial Statistics〉 关键Matérn高斯场可写成随机偏微分方程的解,再用有限元网格得到稀疏精度矩阵

2011年前后,旧默认是“连续高斯场与离散高斯马尔可夫随机场是两类模型;选择稀疏图只是牺牲连续协方差的工程近似”,但密集协方差使大样本贝叶斯空间模型难以计算,而格点CAR模型又依赖人为分区、难处理不规则位置和边界。以“精度矩阵非零元素数/全部m²矩阵元素”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:把(κ²−Δ)^{α/2}(τx)=W的弱解投影到三角形有限元基,局部基函数使精度矩阵稀疏,同时保留连续域解释。否证方式为:在声明的对象类中,若把(κ²−Δ)^{α/2}(τx)=W的弱解投影到三角形有限元基,局部基函数使精度矩阵稀疏,同时保留连续域解释,则按“精度矩阵非零元素数/全部m²矩阵元素”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Lindgren、Rue与Lindström在2011年《英国皇家统计学会B辑》73卷423–498页的SPDE桥。二维网格中每个节点只连接有限邻居,稀疏Cholesky代价约O(m^{3/2})而非密集O(m³);同一构造可在球面和不规则边界上实现。其关键不是论文规模,而是给出了“精度矩阵非零元素数/全部m²矩阵元素”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:网格过粗会扭曲短程协方差,边界和各向异性需专门处理;并非所有协方差都对应局部Markov SPDE。失效条件为:当网格过粗会扭曲短程协方差,边界和各向异性需专门处理时不成立。收敛需统一对象与“精度矩阵非零元素数/全部m²矩阵元素”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“Matérn高斯场可写成随机偏微分方程的解,再用有限元网格得到稀疏精度矩阵”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“精度矩阵非零元素数/全部m²矩阵元素”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第303号复分析与复几何相接:两边都把几何域上的微分算子转成全局对象;本块以预测和计算误差验收,复几何以解的正则性与曲率验收。异名:有限元称“弱形式离散”,图模型称“稀疏精度”,物理学称“格林函数”;另见第303号复几何上的椭圆方程。共享预设为“连续高斯场与离散高斯马尔可夫随机场是两类模型;选择稀疏图只是牺牲连续协方差的工程近似”;先统一“精度矩阵非零元素数/全部m²矩阵元素”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置E——把『SPDE桥:连续Matérn场可以变成稀疏图』成立所需的边界环境作为首要显露 单因决定『SPDE桥:连续Matérn场可以变成稀疏图』当前结论的最小充分项只有:Matérn高斯场可写成随机偏微分方程的解,再用有限元网格得到稀疏精度矩阵 预设〔03 相关方向等同因果方向〕连续高斯场与离散高斯马尔可夫随机场是两类模型;选择稀疏图只是牺牲连续协方差的工程近似 量纲精度矩阵非零元素数/全部m²矩阵元素 失效失效边界是『网格过粗会扭曲短程协方差,边界和各向异性需专门处理时不成立』;越过该边界,相关条件越强,精度矩阵非零元素数反而越低 自曝『SPDE桥:连续Matérn场可以变成稀疏图』的原始材料只直接支持“主证据来自Lindgren、Rue与Lindström在2011年《英国皇家统计学会B辑》73卷423–498页的SPDE桥”,没有自动覆盖边界外对象 空栏『SPDE桥:连续Matérn场可以变成稀疏图』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名有限元称“弱形式离散”,图模型称“稀疏精度”,物理学称“格林函数”;另见第 211 号第 18 条『几何神经算子的连续极限:离散网格模型必须可迁移』

辛、低秩清算:大尺度拟合好不代表局部预测好Limits of Low-Rank Spatial Approximation

提出Michael L. Stein,2014年《Spatial Statistics》8:1–19,DOI:10.1016/j.spasta.2013.06.003,〈Limitations on Low Rank Approximations for Covariance Matrices of Spatial Data〉 争议或最新Matthew J. Heaton、Abhirup Datta、Andrew O. Finley等,2019年《Journal of Agricultural, Biological and Environmental Statistics》24(3):398–425,DOI:10.1007/s13253-018-00348-w,〈A Case Study Competition among Methods for Analyzing Large Spatial Data〉 关键应把近似误差按预测任务和频率分解,而不是只比较协方差矩阵整体范数;局部任务需要稀疏、分辨率递增或混合方法

2014年前后,旧默认是“只要基函数足够灵活且全局拟合优良,未保留的细尺度可统一放进独立nugget而不影响克里金”,但短程相关决定近邻权重和局部不确定性;独立nugget不能替代有结构的高频过程,且固定r在n增长时信息比例不断下降。以“未表示的短程方差/总空间方差”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:应把近似误差按预测任务和频率分解,而不是只比较协方差矩阵整体范数;局部任务需要稀疏、分辨率递增或混合方法。否证方式为:在声明的对象类中,若应把近似误差按预测任务和频率分解,而不是只比较协方差矩阵整体范数;局部任务需要稀疏、分辨率递增或混合方法,则按“未表示的短程方差/总空间方差”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Stein在2014年《空间统计》8卷1–19页的低秩近似清算。论文构造例子显示低秩协方差对某些Matérn过程的预测效率不能随n自动趋于一;2019年大数据竞赛进一步显示不同近似在同一数据上的误差和区间差异明显。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“未表示的短程方差/总空间方差”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:结论不是“低秩无效”,而是秩、采样密度、平滑度和预测尺度必须共同增长;全局平均预测仍可能适合低秩。失效条件为:当结论不是“低秩无效”,而是秩、采样密度、平滑度和预测尺度必须共同增长时不成立。收敛需统一对象与“未表示的短程方差/总空间方差”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“固定秩近似即使能拟合大尺度协方差,也可能在高频和近邻预测上产生不可忽略的效率损失”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“未表示的短程方差/总空间方差”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第302号调和分析相接:低秩清算相当于问高频尾能否忽略;调和分析给范数上界,本块要把尾部遗漏换成空间预测误差与覆盖率。其他领域称:数值分析称“截断误差”,信号处理称“高频泄漏”,机器学习称“欠参数化核”;另见第302号频率局部化。只有“未表示的短程方差/总空间方差”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置S——把『低秩清算:大尺度拟合好不代表局部预测好』形成的对象结构作为首要显露 单因决定『低秩清算:大尺度拟合好不代表局部预测好』当前结论的最小充分项只有:应把近似误差按预测任务和频率分解,而不是只比较协方差矩阵整体范数;局部任务需要稀疏、分辨率递增或混合方法 预设〔03 相关方向等同因果方向〕只要基函数足够灵活且全局拟合优良,未保留的细尺度可统一放进独立nugget而不影响克里金 量纲未表示的短程方差/总空间方差 失效失效边界是『结论不是“低秩无效”,而是秩、采样密度、平滑度和预测尺度必须共同增长时不成立』;越过该边界,相关条件越强,未表示的短程方差反而越低 自曝『低秩清算:大尺度拟合好不代表局部预测好』的原始材料只直接支持“证据链的锚点是Stein在2014年《空间统计》8卷1–19页的低秩近似清算”,没有自动覆盖边界外对象 空栏『低秩清算:大尺度拟合好不代表局部预测好』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名数值分析称“截断误差”,信号处理称“高频泄漏”,机器学习称“欠参数化核”;另见第 213 号第 19 条『十九、混合精度与迭代精化』
【第二幕】这十年 · 约 2016—2026

第二幕把稀疏邻域、多分辨率和深度表征推向十万至百万位置,并要求验证折、先验、尾依赖与近似后验都能接受独立校准。从“最近邻高斯过程:少数条件邻居也能定义合法全局过程”到“高维空间极值工作流:计算近似也要修正不确定性”,共同动作是接受规模、复制、边界与部署检验;主证据落在2016—2026年。

一、最近邻高斯过程:少数条件邻居也能定义合法全局过程Nearest-Neighbor Gaussian Processes

提出Abhirup Datta、Sudipto Banerjee、Andrew O. Finley与Alan E. Gelfand,2016年《Journal of the American Statistical Association》111(514):800–812,DOI:10.1080/01621459.2015.1044091,〈Hierarchical Nearest-Neighbor Gaussian Process Models for Large Geostatistical Datasets〉 争议或最新Andrew O. Finley、Abhirup Datta、Benjamin C. Cook等,2019年《The R Journal》11(2):179–197,DOI:10.32614/RJ-2019-020,〈Efficient Algorithms for Bayesian Nearest Neighbor Gaussian Processes〉 关键把每个位置只条件于排序在前的m个近邻,可得到稀疏有向图并保持一个合法空间过程

2016年前后,旧默认是“局部条件近似只是把完整似然剪掉若干项,无法保证对任意未观测位置都构成一致随机过程”,但传统Vecchia近似多停留在有限数据似然;若预测点加入后次序变化,模型定义和计算图可能不一致。以“条件邻居数m/全部既往位置数n”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:以参考位置上的稀疏条件密度定义有限维分布,再扩展到连续域,使推断和新位置预测共享同一最近邻规则。否证方式为:在声明的对象类中,若以参考位置上的稀疏条件密度定义有限维分布,再扩展到连续域,使推断和新位置预测共享同一最近邻规则,则按“条件邻居数m/全部既往位置数n”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Datta等在2016年《美国统计学会杂志》111卷800–812页的最近邻高斯过程是本条的证据起点。固定m时存储约O(nm²)、计算约O(nm³),实践常用m约10至20而n可达十万级;海量森林和遥感数据可在普通集群上拟合。具体读数“条件邻居数m/全部既往位置数n”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:近邻选择依赖排序、距离与各向异性;长程或周期依赖若不由少数邻居屏蔽,固定m会低估相关和不确定性。失效条件为:当近邻选择依赖排序、距离与各向异性时不成立。收敛需统一对象与“条件邻居数m/全部既往位置数n”,并公开边界预测、区间覆盖和计算图及最强反例。

实践后果是:这使“把每个位置只条件于排序在前的m个近邻,可得到稀疏有向图并保持一个合法空间过程”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。报告应围绕“条件邻居数m/全部既往位置数n”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是与第357号多智能体系统相接:NNGP假定远方信息可经近邻屏蔽,多智能体协议也假定局部通信足够;若长程依赖不衰减,两边都会失效。异名为图模型称“稀疏DAG”,语言模型称“局部上下文”,分布式系统称“邻域通信”;另见第357号局部协议。碰撞须固定“局部条件近似只是把完整似然剪掉若干项,无法保证对任意未观测位置都构成一致随机过程”并比较“条件邻居数m/全部既往位置数n”;第三项是空间支持、采样位置与依赖尺度。

位置D——把『最近邻高斯过程:少数条件邻居也能定义合法全局过程』中的操作次序与变化路径作为首要显露 单因决定『最近邻高斯过程:少数条件邻居也能定义合法全局过程』当前结论的最小充分项只有:把每个位置只条件于排序在前的m个近邻,可得到稀疏有向图并保持一个合法空间过程 预设〔03 相关方向等同因果方向〕局部条件近似只是把完整似然剪掉若干项,无法保证对任意未观测位置都构成一致随机过程 量纲条件邻居数m/全部既往位置数n 失效失效边界是『近邻选择依赖排序、距离与各向异性时不成立』;越过该边界,相关条件越强,条件邻居数m反而越低 自曝『最近邻高斯过程:少数条件邻居也能定义合法全局过程』的原始材料只直接支持“Datta等在2016年《美国统计学会杂志》111卷800–812页的最近邻高斯过程是本条的证据起点”,没有自动覆盖边界外对象 空栏『最近邻高斯过程:少数条件邻居也能定义合法全局过程』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名图模型称“稀疏DAG”,语言模型称“局部上下文”,分布式系统称“邻域通信”;另见第 214 号第 1 条『压缩感知:稀疏性让欠定系统可恢复』

二、空间交叉验证:随机折会把邻居泄漏成泛化Spatially Structured Cross-Validation

提出David R. Roberts、Volker Bahn、Simone Ciuti等,2017年《Ecography》40(8):913–929,DOI:10.1111/ecog.02881,〈Cross-Validation Strategies for Data with Temporal, Spatial, Hierarchical, or Phylogenetic Structure〉 争议或最新Brianna Valavi、Jane Elith、José J. Lahoz-Monfort与Guillera-Arroita,2019年《Methods in Ecology and Evolution》10(2):225–232,DOI:10.1111/2041-210X.13107,〈blockCV: An R Package for Generating Spatially or Environmentally Separated Folds〉 关键验证折之间的空间距离必须模拟真正部署距离;随机分折在自相关数据上通常只测邻域插值

2017年前后,旧默认是“只要每个观测只出现一次测试集,随机k折就给出无偏泛化误差,空间坐标无需参与分折”,但测试点旁边保留训练邻居,会让模型借助同一局部事件、同一传感器或同一群落结构,误差远低于对新地区外推。以“验证折训练—测试中位距离/实际部署距离”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:按空间块、环境距离、时间或层级留出,并把块尺度与相关范围或部署间距对齐;不同任务应有不同验证几何。否证方式为:在声明的对象类中,若按空间块、环境距离、时间或层级留出,并把块尺度与相关范围或部署间距对齐;不同任务应有不同验证几何,则按“验证折训练—测试中位距离/实际部署距离”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Roberts等在2017年《Ecography》40卷913–929页的结构化交叉验证规程给出主证据:论文把空间、时间、层级和系统发育4类数据泄漏放在同一验证框架,并在案例中显示随机CV可明显乐观;blockCV把块大小与训练—测试距离变成可报告量。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“验证折训练—测试中位距离/实际部署距离”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:块太大时折数少、方差高,块太小仍泄漏;若部署就是同一区域内插值,过度分离又会悲观。失效条件为:当块太大时折数少、方差高,块太小仍泄漏时不成立。收敛需统一对象与“验证折训练—测试中位距离/实际部署距离”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“验证折之间的空间距离必须模拟真正部署距离;随机分折在自相关数据上通常只测邻域插值”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“验证折训练—测试中位距离/实际部署距离”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第360号系统性能与能效相接:随机请求切分可能让同一机器、时间窗和缓存状态同时进入训练测试;两边都需按部署单位做隔离验证。异名:机器学习称“group split”,医学称“按医院外部验证”,软件称“跨版本测试”;另见第360号基准漂移。共享预设为“只要每个观测只出现一次测试集,随机k折就给出无偏泛化误差,空间坐标无需参与分折”;先统一“验证折训练—测试中位距离/实际部署距离”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置S——把『空间交叉验证:随机折会把邻居泄漏成泛化』形成的对象结构作为首要显露 单因决定『空间交叉验证:随机折会把邻居泄漏成泛化』当前结论的最小充分项只有:验证折之间的空间距离必须模拟真正部署距离;随机分折在自相关数据上通常只测邻域插值 预设〔04 尺度迁移不改变结论〕只要每个观测只出现一次测试集,随机k折就给出无偏泛化误差,空间坐标无需参与分折 量纲验证折训练—测试中位距离/实际部署距离 失效失效边界是『块太大时折数少、方差高,块太小仍泄漏时不成立』;越过该边界,相关条件越强,验证折训练—测试中位距离反而越低 自曝『空间交叉验证:随机折会把邻居泄漏成泛化』的原始材料只直接支持“Roberts等在2017年《Ecography》40卷913–929页的结构化交叉验证规程给出主证据:论文把空间、时间、层级和系统发育4类数据泄漏”,没有自动覆盖边界外对象 空栏『空间交叉验证:随机折会把邻居泄漏成泛化』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“groupsplit”,医学称“按医院外部验证”,软件称“跨版本测试”;另见第 592 号第 1 条『离散经验插值降阶』

三、多分辨率近似:全球与局部残差要逐层结算Multi-Resolution Approximation

提出Matthias Katzfuss,2017年《Journal of the American Statistical Association》112(517):201–214,DOI:10.1080/01621459.2015.1123632,〈A Multi-Resolution Approximation for Massive Spatial Datasets〉 争议或最新Huang Huang、Sameh Abdulah、Ying Sun等,2021年《Journal of Agricultural, Biological and Environmental Statistics》26(4):580–595,DOI:10.1007/s13253-021-00449-z,〈Competition on Spatial Statistics for Large Datasets〉 关键一个低秩层不应承担全部尺度;每层解释剩余过程并把更细残差送往下一层

2017年前后,本领域常把“只要增加全局基函数数量,单层低秩模型就能同时保留长程与局部相关”当作默认起点。它在典型对象上看似稳固,却被全局基在细尺度需要指数增长,局部基又难保持跨区连续;单层方案不是漏高频就是失去计算优势直接顶住。真正需要更换的不是符号,而是比较单位:一旦把“最细层局部基数/全部观测数”写进分母,原来混在一起的结构差异便必须分别说明,旧结论也不再能够无条件外推。

本条命题是:在嵌套区域上逐层放置基,上一层捕获大尺度,下一层只近似条件残差,并让不同区域计算可并行。否证方式为:在声明的对象类中,若在嵌套区域上逐层放置基,上一层捕获大尺度,下一层只近似条件残差,并让不同区域计算可并行,则按“最细层局部基数/全部观测数”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Katzfuss在2017年《美国统计学会杂志》112卷201–214页的多分辨率近似提供了决定性证据。MRA在每层增加局部结点并截断跨区残差,固定每区结点时计算随n近线性;卫星数据比较显示其预测误差优于单层预测过程。这里最有信息量的读数是“最细层局部基数/全部观测数”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:分区边界和层数选择会产生人工结构,深层近似的参数估计也可能弱;若过程只有一个尺度,多层代价未必值得。失效条件为:当分区边界和层数选择会产生人工结构,深层近似的参数估计也可能弱时不成立。收敛需统一对象与“最细层局部基数/全部观测数”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“一个低秩层不应承担全部尺度;每层解释剩余过程并把更细残差送往下一层”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“最细层局部基数/全部观测数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第302号调和分析相接:两边都逐尺度分配残差;调和分析要求函数范数重构,本块要求各层残差合成后保持协方差与预测区间。其他领域称:小波分析称“多尺度分解”,图形学称“层次细节”,系统工程称“分层残差预算”;另见第302号小波稀疏性。只有“最细层局部基数/全部观测数”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置D——把『多分辨率近似:全球与局部残差要逐层结算』中的操作次序与变化路径作为首要显露 单因决定『多分辨率近似:全球与局部残差要逐层结算』当前结论的最小充分项只有:一个低秩层不应承担全部尺度;每层解释剩余过程并把更细残差送往下一层 预设〔04 尺度迁移不改变结论〕只要增加全局基函数数量,单层低秩模型就能同时保留长程与局部相关 量纲最细层局部基数/全部观测数 失效当分区边界和层数选择会产生人工结构,深层近似的参数估计也可能弱时不成立 自曝『多分辨率近似:全球与局部残差要逐层结算』的原始材料只直接支持“Katzfuss在2017年《美国统计学会杂志》112卷201–214页的多分辨率近似提供了决定性证据”,没有自动覆盖边界外对象 空栏『多分辨率近似:全球与局部残差要逐层结算』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名小波分析称“多尺度分解”,图形学称“层次细节”,系统工程称“分层残差预算”;另见第 213 号第 6 条『层次矩阵与蝶形分解』

四、复杂度惩罚先验:空间范围与方差要向简单基准收缩Penalised Complexity Priors for Spatial Fields

提出Geir-Arne Fuglstad、Daniel Simpson、Finn Lindgren与Håvard Rue,2019年《Journal of the American Statistical Association》114(525):445–452,DOI:10.1080/01621459.2017.1415907,〈Constructing Priors that Penalize the Complexity of Gaussian Random Fields〉 争议或最新Daniel Simpson、Håvard Rue、Andrea Riebler、Thiago Martins与Sigrunn Sørbye,2017年《Statistical Science》32(1):1–28,DOI:10.1214/16-STS576,〈Penalising Model Component Complexity: A Principled, Practical Approach to Constructing Priors〉 关键以Kullback–Leibler距离定义从基准模型出发的指数惩罚,并用可解释尾概率P(range<r0)=α、P(σ>σ0)=α标定

在2019年前后的文献中,标准叙事是“只要给范围和边际方差放宽广先验,就能让数据自行决定空间相关,不会造成实质影响”。这个叙事之所以长期有效,是因为经典例子没有暴露如下缺口:有限域内似然常无法同时识别范围和方差,宽先验会把质量推向极短范围、高方差或不稳定后验。主证据迫使研究者把对象、表示与验证尺度拆开;以“先验尾概率α/声明阈值r0或σ0”重新计量后,过去被当作技术噪声的部分,成为决定结论方向的变量。

本条命题是:以Kullback–Leibler距离定义从基准模型出发的指数惩罚,并用可解释尾概率P(range<r0)=α、P(σ>σ0)=α标定。否证方式为:在声明的对象类中,若以Kullback–Leibler距离定义从基准模型出发的指数惩罚,并用可解释尾概率P(range<r0)=α、P(σ>σ0)=α标定,则按“先验尾概率α/声明阈值r0或σ0”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Fuglstad、Simpson、Lindgren与Rue在2019年《美国统计学会杂志》114卷445–452页的空间PC先验。论文给出1至3维Matérn场的PC先验;用户用范围阈值r0与方差阈值σ0共2个尾概率声明复杂度预算,模拟显示比参考先验产生更稳定且覆盖接近名义的区间。其关键不是论文规模,而是给出了“先验尾概率α/声明阈值r0或σ0”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:基准“范围无限、方差为零”并非所有科学问题都合理;非平稳场与未知平滑度仍需额外结构,先验敏感性不能省略。失效条件为:当基准“范围无限、方差为零”并非所有科学问题都合理时不成立。收敛需统一对象与“先验尾概率α/声明阈值r0或σ0”,并公开边界预测、区间覆盖和计算图及最强反例。

实践后果是:这使“空间协方差先验应从无空间效应这一基准出发,按模型距离为方差和范围扩张付费”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。报告应围绕“先验尾概率α/声明阈值r0或σ0”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是与第307号贝叶斯统计与计算相接:PC先验把每次离开简单模型的距离货币化;第307号关注通用构造,本块给空间范围和方差的可解释阈值。异名为模型选择称“奥卡姆惩罚”,正则化称“向零收缩”,可靠性工程称“复杂部件罚金”;另见第307号复杂度先验。碰撞须固定“只要给范围和边际方差放宽广先验,就能让数据自行决定空间相关,不会造成实质影响”并比较“先验尾概率α/声明阈值r0或σ0”;第三项是空间支持、采样位置与依赖尺度。

位置E——把『复杂度惩罚先验:空间范围与方差要向简单基准收缩』成立所需的边界环境作为首要显露 单因决定『复杂度惩罚先验:空间范围与方差要向简单基准收缩』当前结论的最小充分项只有:以Kullback–Leibler距离定义从基准模型出发的指数惩罚,并用可解释尾概率P(range<r0)=α、P(σ>σ0)=α标定 预设〔04 尺度迁移不改变结论〕只要给范围和边际方差放宽广先验,就能让数据自行决定空间相关,不会造成实质影响 量纲先验尾概率α/声明阈值r0或σ0 失效当基准“范围无限、方差为零”并非所有科学问题都合理时不成立 自曝『复杂度惩罚先验:空间范围与方差要向简单基准收缩』的原始材料只直接支持“主证据来自Fuglstad、Simpson、Lindgren与Rue在2019年《美国统计学会杂志》114卷445–452页的空间PC先验”,没有自动覆盖边界外对象 空栏『复杂度惩罚先验:空间范围与方差要向简单基准收缩』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名模型选择称“奥卡姆惩罚”,正则化称“向零收缩”,可靠性工程称“复杂部件罚金”;另见第 438 号第 6 条『建筑信息模型的收益来自跨阶段信息复用』

五、空间极值依赖类:近处相关与远处尾独立可同模出现Unknown Extremal Dependence Class

提出Raphaël Huser与Jennifer L. Wadsworth,2019年《Journal of the American Statistical Association》114(525):434–444,DOI:10.1080/01621459.2017.1411813,〈Modeling Spatial Processes with Unknown Extremal Dependence Class〉 争议或最新Anthony C. Davison、Simone A. Padoan与Mathieu Ribatet,2012年《Statistical Science》27(2):161–186,DOI:10.1214/11-STS376,〈Statistical Modeling of Spatial Extremes〉 关键空间极端相关可以随距离和阈值从渐近依赖平滑过渡到渐近独立,不能预先锁定一类

2019年前后,旧默认是“观测到高相关就应使用max-stable渐近依赖模型,相关减弱则直接改用尾独立模型”,但有限阈值下强相关不等于极限中同时超阈概率为正;选错依赖类会把超出观测范围的联合重现期放大或缩小数个数量级。以“高阈值联合超越概率/边际超越概率”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:用尺度混合空间过程在一个参数族中覆盖完全依赖、渐近依赖、渐近独立及其连续过渡,让数据决定尾类。否证方式为:在声明的对象类中,若用尺度混合空间过程在一个参数族中覆盖完全依赖、渐近依赖、渐近独立及其连续过渡,让数据决定尾类,则按“高阈值联合超越概率/边际超越概率”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Huser与Wadsworth在2019年《美国统计学会杂志》114卷434–444页的未知极端依赖类模型。模型以χ(u,d)=P(Y1>Fu^{-1}|Y2>Fu^{-1})随u趋近1的极限区分依赖类,并在两个海洋数据集上显示真实尾类并不明确。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“高阈值联合超越概率/边际超越概率”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:极端样本稀少使依赖类弱可识别,阈值选择和边际标准化会改变结论;中等距离上的好拟合不保证百年事件外推。失效条件为:当极端样本稀少使依赖类弱可识别,阈值选择和边际标准化会改变结论时不成立。收敛需统一对象与“高阈值联合超越概率/边际超越概率”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“空间极端相关可以随距离和阈值从渐近依赖平滑过渡到渐近独立,不能预先锁定一类”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“高阈值联合超越概率/边际超越概率”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第239号电气与电力工程相接:电网共因故障的联合尾概率决定冗余是否真实;若只用普通相关,极端同时失效风险会被误估。异名:金融称“尾部相关”,可靠性称“共因失效”,网络称“级联尾依赖”;另见第239号电网极端事件。共享预设为“观测到高相关就应使用max-stable渐近依赖模型,相关减弱则直接改用尾独立模型”;先统一“高阈值联合超越概率/边际超越概率”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置D——把『空间极值依赖类:近处相关与远处尾独立可同模出现』中的操作次序与变化路径作为首要显露 单因决定『空间极值依赖类:近处相关与远处尾独立可同模出现』当前结论的最小充分项只有:空间极端相关可以随距离和阈值从渐近依赖平滑过渡到渐近独立,不能预先锁定一类 预设〔05 观测与干预不回写对象〕观测到高相关就应使用max-stable渐近依赖模型,相关减弱则直接改用尾独立模型 量纲高阈值联合超越概率/边际超越概率 失效当极端样本稀少使依赖类弱可识别,阈值选择和边际标准化会改变结论时不成立 自曝『空间极值依赖类:近处相关与远处尾独立可同模出现』的原始材料只直接支持“证据链的锚点是Huser与Wadsworth在2019年《美国统计学会杂志》114卷434–444页的未知极端依赖类模型”,没有自动覆盖边界外对象 空栏『空间极值依赖类:近处相关与远处尾独立可同模出现』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名金融称“尾部相关”,可靠性称“共因失效”,网络称“级联尾依赖”;另见第 587 号第 8 条『相依网络级联』

六、Vecchia总框架:排序与条件集本身就是模型选择General Vecchia Approximations

提出Matthias Katzfuss与Joseph Guinness,2021年《Statistical Science》36(1):124–141,DOI:10.1214/19-STS755,〈A General Framework for Vecchia Approximations of Gaussian Processes〉 争议或最新Matthias Katzfuss、Joseph Guinness、Wenlong Gong与Daniel Zilber,2020年《Journal of Agricultural, Biological and Environmental Statistics》25(3):383–414,DOI:10.1007/s13253-020-00401-7,〈Vecchia Approximations of Gaussian-Process Predictions〉 关键把观测、潜在过程和预测量统一成有向条件分解,显式枚举排序与条件策略,使NNGP、稀疏Cholesky和若干预测法成为特例

在2021年前后的文献中,默认判断仍是“所有Vecchia方法只是同一个“每点取m个近邻”的算法,排序和条件对象不会实质影响结果”。它没有处理同样m下,坐标顺序、maximin顺序、条件于观测还是潜变量会产生不同稀疏精度、计算图和预测误差,因此会把局部成功写成一般规律,或把尚未测量写成不存在。本条转向首先做了一次口径清算:以“每点条件变量数m/可用前序变量数”为共同尺度,重新规定哪些对象、误差和边界有资格进入结论。

本条命题是:把观测、潜在过程和预测量统一成有向条件分解,显式枚举排序与条件策略,使NNGP、稀疏Cholesky和若干预测法成为特例。否证方式为:在声明的对象类中,若把观测、潜在过程和预测量统一成有向条件分解,显式枚举排序与条件策略,使NNGP、稀疏Cholesky和若干预测法成为特例,则按“每点条件变量数m/可用前序变量数”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Katzfuss与Guinness在2021年《统计科学》36卷124–141页的Vecchia总框架是本条的证据起点。框架显示固定m时复杂度约O(nm³),但maximin排序和合理条件集可用相同预算大幅降低KL散度与预测误差;预测版还区分逐点和联合不确定性。具体读数“每点条件变量数m/可用前序变量数”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:最优排序本身可贵,且不同任务的最佳策略不同;局部条件对长程依赖、周期边界和密集重复点仍可能失效。失效条件为:当最优排序本身可贵,且不同任务的最佳策略不同时不成立。收敛需统一对象与“每点条件变量数m/可用前序变量数”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“高斯过程近似的质量不只由邻居数决定,还由变量排序、观测与潜变量的组合以及预测结构决定”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“每点条件变量数m/可用前序变量数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第352号形式化方法相接:两边都由依赖图决定哪些信息必须保留;空间近似允许有界误差,程序证明则要求遗漏依赖不能改变性质。其他领域称:概率图称“变量消元顺序”,稀疏矩阵称“填充排序”,编译称“依赖调度”;另见第352号证明依赖图。只有“每点条件变量数m/可用前序变量数”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置E——把『Vecchia总框架:排序与条件集本身就是模型选择』成立所需的边界环境作为首要显露 单因决定『Vecchia总框架:排序与条件集本身就是模型选择』当前结论的最小充分项只有:把观测、潜在过程和预测量统一成有向条件分解,显式枚举排序与条件策略,使NNGP、稀疏Cholesky和若干预测法成为特例 预设〔05 观测与干预不回写对象〕所有Vecchia方法只是同一个“每点取m个近邻”的算法,排序和条件对象不会实质影响结果 量纲每点条件变量数m/可用前序变量数 失效当最优排序本身可贵,且不同任务的最佳策略不同时不成立 自曝『Vecchia总框架:排序与条件集本身就是模型选择』的原始材料只直接支持“Katzfuss与Guinness在2021年《统计科学》36卷124–141页的Vecchia总框架是本条的证据起点”,没有自动覆盖边界外对象 空栏『Vecchia总框架:排序与条件集本身就是模型选择』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名概率图称“变量消元顺序”,稀疏矩阵称“填充排序”,编译称“依赖调度”;另见第 432 号第 20 条『强化学习把预测器变成政策选择器』

七、联合空间分位:地图应描述整条条件分布而非均值Joint Spatial Quantile Regression

提出Xu Chen与Surya T. Tokdar,2021年《Journal of the Royal Statistical Society: Series B》83(4):826–852,DOI:10.1111/rssb.12467,〈Joint Quantile Regression for Spatial Data〉 争议或最新Brian J. Reich、Montserrat Fuentes与David B. Dunson,2011年《Journal of the American Statistical Association》106(493):6–20,DOI:10.1198/jasa.2010.ap09237,〈Bayesian Spatial Quantile Regression〉 关键用联合随机函数构造所有τ上的非交叉分位曲面,再以高斯或t过程copula描述跨位置依赖

到2021年前后,常见出发点仍是“先对每个分位独立做空间回归,再把结果叠在一起即可描述条件分布”。真正暴露问题的并非一个孤立反例,而是独立拟合会产生分位交叉、忽略跨分位共享信息,并把均值附近的相关结构误用于极端尾部。当研究者改用“极端分位MAE/中位数或基准模型MAE”比较时,旧叙事中被隐藏的代价、边界或层级差异显现出来;这也是本条能够成为新思想而不是普通技术改良的原因。

本条命题是:用联合随机函数构造所有τ上的非交叉分位曲面,再以高斯或t过程copula描述跨位置依赖。否证方式为:在声明的对象类中,若用联合随机函数构造所有τ上的非交叉分位曲面,再以高斯或t过程copula描述跨位置依赖,则按“极端分位MAE/中位数或基准模型MAE”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Chen与Tokdar在2021年《英国皇家统计学会B辑》83卷826–852页的联合空间分位回归给出主证据:论文在重尾模拟中显示t-copula过程对极端分位的平均绝对误差比高斯copula低约10%至20%,并给出美国臭氧数据的整分布地图。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“极端分位MAE/中位数或基准模型MAE”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:高维τ网格和空间点数使计算昂贵;尾部数据少,copula选择和边际分位函数仍会共同影响极端预测。失效条件为:当高维τ网格和空间点数使计算昂贵时不成立。收敛需统一对象与“极端分位MAE/中位数或基准模型MAE”,并公开边界预测、区间覆盖和计算图及最强反例。

实践后果是:这使“空间风险面应联合估计多个分位并保证它们不交叉,尾部还可具有不同空间依赖”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。报告应围绕“极端分位MAE/中位数或基准模型MAE”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是与第309号时间序列与预测方法相接:时间预测用分位评价未来路径,空间分位绘制地点间尾部;若二者都成立,第三项是时空联合分位必须同时不交叉且保持空间相干。异名为风险管理称“条件VaR曲面”,医学称“生长曲线”,气象称“分位映射”;另见第309号概率预测。碰撞须固定“先对每个分位独立做空间回归,再把结果叠在一起即可描述条件分布”并比较“极端分位MAE/中位数或基准模型MAE”;第三项是空间支持、采样位置与依赖尺度。

位置S——把『联合空间分位:地图应描述整条条件分布而非均值』形成的对象结构作为首要显露 单因决定『联合空间分位:地图应描述整条条件分布而非均值』当前结论的最小充分项只有:用联合随机函数构造所有τ上的非交叉分位曲面,再以高斯或t过程copula描述跨位置依赖 预设〔05 观测与干预不回写对象〕先对每个分位独立做空间回归,再把结果叠在一起即可描述条件分布 量纲极端分位MAE/中位数或基准模型MAE 失效当高维τ网格和空间点数使计算昂贵时不成立 自曝『联合空间分位:地图应描述整条条件分布而非均值』的原始材料只直接支持“Chen与Tokdar在2021年《英国皇家统计学会B辑》83卷826–852页的联合空间分位回归给出主证据:论文在重尾模拟中显示t-copula过”,没有自动覆盖边界外对象 空栏『联合空间分位:地图应描述整条条件分布而非均值』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名风险管理称“条件VaR曲面”,医学称“生长曲线”,气象称“分位映射”;另见第 439 号第 14 条『员工福祉是服务利润链的前置条件而非副产品』

八、Spatial+:先从协变量中剥离空间趋势Spatial+

提出Emiko Dupont、Simon N. Wood与Nicole H. Augustin,2022年《Biometrics》78(4):1279–1290,DOI:10.1111/biom.13656,〈Spatial+: A Novel Approach to Spatial Confounding〉 争议或最新Brian J. Reich、Isa Marques、Thomas Kneib、Alexandra M. Schmidt与Georgia Papadogeorgou,2022年《Biometrics》78(4):1291–1308(系列讨论),DOI:10.1111/biom.13651等 关键当协变量既有空间趋势又有非空间变化时,可先残差化协变量,再用剩余变化识别其效应

2022年前后,旧默认是“处理空间混杂只能限制随机效应不进入协变量空间;修改协变量会丢失科学信息”,但限制空间回归虽消除共线性,却可能把未测混杂的效应并入回归系数;普通空间模型又会因平滑惩罚产生偏差。以“Spatial+系数绝对偏差/普通空间模型系数绝对偏差”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:先用空间平滑解释协变量,把残差作为回归输入,同时保留响应的空间项;非空间分量承担效应识别。否证方式为:在声明的对象类中,若先用空间平滑解释协变量,把残差作为回归输入,同时保留响应的空间项;非空间分量承担效应识别,则按“Spatial+系数绝对偏差/普通空间模型系数绝对偏差”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Dupont、Wood与Augustin在2022年《Biometrics》78卷1279–1290页的Spatial+提供了决定性证据。Spatial+采用2步处理:先用空间平滑从协变量中剥离位置趋势,再用残差估计结局效应;模拟与森林数据表明,当协变量不完全由位置决定时,系数偏差与平滑敏感性下降。这里最有信息量的读数是“Spatial+系数绝对偏差/普通空间模型系数绝对偏差”:它把抽象争论压成别人能够复算的比例、维数、阈值、误差阶或有效样本量。数字并非装饰,而是说明究竟哪一层默认被改写。

争议边界是:当协变量几乎完全空间化或其相关尺度与未测混杂相同,残差中信息太少;标准误传播与多协变量扩展仍有争议。失效条件为:当协变量几乎完全空间化或其相关尺度与未测混杂相同,残差中信息太少时不成立。收敛需统一对象与“Spatial+系数绝对偏差/普通空间模型系数绝对偏差”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“当协变量既有空间趋势又有非空间变化时,可先残差化协变量,再用剩余变化识别其效应”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“Spatial+系数绝对偏差/普通空间模型系数绝对偏差”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第306号生物统计学相接:双重机器学习也先剥离nuisance结构;Spatial+的特殊之处是剥离由坐标和尺度定义,而非任意协变量预测器。异名:因果推断称“残差化暴露”,经济学称“within变换”,信号处理称“去趋势”;另见第306号正交化。共享预设为“处理空间混杂只能限制随机效应不进入协变量空间;修改协变量会丢失科学信息”;先统一“Spatial+系数绝对偏差/普通空间模型系数绝对偏差”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置E——把『Spatial+:先从协变量中剥离空间趋势』成立所需的边界环境作为首要显露 单因决定『Spatial+:先从协变量中剥离空间趋势』当前结论的最小充分项只有:当协变量既有空间趋势又有非空间变化时,可先残差化协变量,再用剩余变化识别其效应 预设〔06 聚合次序不影响结论〕处理空间混杂只能限制随机效应不进入协变量空间;修改协变量会丢失科学信息 量纲Spatial+系数绝对偏差/普通空间模型系数绝对偏差 失效当协变量几乎完全空间化或其相关尺度与未测混杂相同,残差中信息太少时不成立 自曝『Spatial+:先从协变量中剥离空间趋势』的原始材料只直接支持“Dupont、Wood与Augustin在2022年《Biometrics》78卷1279–1290页的Spatial+提供了决定性证据”,没有自动覆盖边界外对象 空栏『Spatial+:先从协变量中剥离空间趋势』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名因果推断称“残差化暴露”,经济学称“within变换”,信号处理称“去趋势”;另见第 582 号第 11 条『正则化去噪RED』

九、网格化高斯过程:区域分块也能拼成合法概率模型Meshed Gaussian Processes

提出Michele Peruzzi、Sudipto Banerjee与Andrew O. Finley,2022年《Journal of the American Statistical Association》117(538):969–982,DOI:10.1080/01621459.2020.1833889,〈Highly Scalable Bayesian Geostatistical Modeling via Meshed Gaussian Processes on Partitioned Domains〉 争议或最新Michele Peruzzi、Sudipto Banerjee、Andrew O. Finley与Alan E. Gelfand,2022年《Bayesian Analysis》17(4):1091–1119,DOI:10.1214/21-BA1297,〈Highly Scalable Bayesian Geostatistical Modeling via Meshed Gaussian Processes on Partitioned Domains: Discussion and Extensions〉 关键在镶嵌域上定义块条件分布和DAG,令每块只依赖少数父块;由这些条件密度生成合法的Meshed GP并支持并行Gibbs

2022年前后,旧默认是“域分解只能用于数值近似,分块后各区域独立会在边界产生不连续,不能被当作概率过程”,但海量时空数据中逐点NNGP更新串行,单一全局基又漏局部;块之间既要共享依赖又要避免全局密集矩阵。以“每块父邻居数/全部空间块数”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:在镶嵌域上定义块条件分布和DAG,令每块只依赖少数父块;由这些条件密度生成合法的Meshed GP并支持并行Gibbs。否证方式为:在声明的对象类中,若在镶嵌域上定义块条件分布和DAG,令每块只依赖少数父块;由这些条件密度生成合法的Meshed GP并支持并行Gibbs,则按“每块父邻居数/全部空间块数”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

主证据来自Peruzzi、Banerjee与Finley在2022年《美国统计学会杂志》117卷969–982页的网格化高斯过程。Q-MGP把区域组织为“块内结点+有限父块”2层有向图;固定父块数时可缓存块矩阵并行计算,论文用塞伦盖蒂NDVI数据恢复数百万位置的多元时空随机效应。其关键不是论文规模,而是给出了“每块父邻居数/全部空间块数”这一可核对读数;它使同一命题能够跨对象、跨样本或跨尺度复验。后来工作可以扩大范围、改进常数或增加样本,却不能替代这笔证据在历史上的归幕位置。

争议边界是:网格形状、父块选择和边界会影响近似,规则格并非所有地形合适;分块过细会增加通信,过粗会恢复大矩阵。失效条件为:当网格形状、父块选择和边界会影响近似,规则格并非所有地形合适时不成立。收敛需统一对象与“每块父邻居数/全部空间块数”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“把空间域切成网格块并用块级有向图连接,可在保持过程一致性的同时并行更新大规模潜在场”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“每块父邻居数/全部空间块数”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第351号高性能与并行计算相接:MGP把统计条件独立变成并行边界;若块间通信占比超过局部计算,理论可扩展性不会兑现为墙钟时间。其他领域称:分布式系统称“分区DAG”,有限元称“域分解”,数据库称“分片依赖”;另见第351号并行工作流。只有“每块父邻居数/全部空间块数”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置S——把『网格化高斯过程:区域分块也能拼成合法概率模型』形成的对象结构作为首要显露 单因决定『网格化高斯过程:区域分块也能拼成合法概率模型』当前结论的最小充分项只有:在镶嵌域上定义块条件分布和DAG,令每块只依赖少数父块;由这些条件密度生成合法的MeshedGP并支持并行Gibbs 预设〔06 聚合次序不影响结论〕域分解只能用于数值近似,分块后各区域独立会在边界产生不连续,不能被当作概率过程 量纲每块父邻居数/全部空间块数 失效当网格形状、父块选择和边界会影响近似,规则格并非所有地形合适时不成立 自曝『网格化高斯过程:区域分块也能拼成合法概率模型』的原始材料只直接支持“主证据来自Peruzzi、Banerjee与Finley在2022年《美国统计学会杂志》117卷969–982页的网格化高斯过程”,没有自动覆盖边界外对象 空栏『网格化高斯过程:区域分块也能拼成合法概率模型』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名分布式系统称“分区DAG”,有限元称“域分解”,数据库称“分片依赖”;另见第 431 号第 19 条『人工智能降低语言成本却扩大模型依赖』

十、DeepKriging:空间基可以进入非线性网络DeepKriging

提出Wanfang Chen、Yuxiao Li、Brian J. Reich与Ying Sun,2024年《Statistica Sinica》34:291–311,DOI:10.5705/ss.202021.0277,〈DeepKriging: Spatially Dependent Deep Neural Networks for Spatial Prediction〉 争议或最新Pratik Nag、Ying Sun与Marc G. Genton,2023年《Spatial Statistics》57:100773,DOI:10.1016/j.spasta.2023.100773,〈Spatio-Temporal DeepKriging for Interpolation and Probabilistic Forecasting〉 关键用固定或多尺度径向基将位置展开成高维空间特征,再由DNN联合学习响应与不确定性;高斯线性情形可回到克里金联系

2024年前后,旧默认是“神经网络若加入经纬度就已具有空间能力;克里金的协方差结构无需显式编码”,但普通DNN把坐标当两维连续数,难表示局部与多尺度邻近;经典克里金又受线性、高斯和平稳假设及O(N³)计算限制。以“DeepKriging测试误差/经典克里金测试误差”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:用固定或多尺度径向基将位置展开成高维空间特征,再由DNN联合学习响应与不确定性;高斯线性情形可回到克里金联系。否证方式为:在声明的对象类中,若用固定或多尺度径向基将位置展开成高维空间特征,再由DNN联合学习响应与不确定性;高斯线性情形可回到克里金联系,则按“DeepKriging测试误差/经典克里金测试误差”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

证据链的锚点是Chen、Li、Reich与Sun在2024年《Statistica Sinica》34卷291–311页的DeepKriging。DeepKriging把多尺度空间基映入1个非线性神经网络,避免构造n×n协方差矩阵;理论、模拟与美国大陆PM2.5应用显示,在非高斯非平稳场上测试误差低于经典克里金。若只保留结论而删去读数,读者无法知道改变发生在对象数、尺度、覆盖、计算复杂度还是预测误差;“DeepKriging测试误差/经典克里金测试误差”因此是本条最应被复核的部分,也是后续反例必须对齐的分母。

争议边界是:不确定性来自密度预测或重抽样而非闭式协方差,校准需单独验证;基函数布局和网络调参可能在随机空间切分中受泄漏。失效条件为:当不确定性来自密度预测或重抽样而非闭式协方差,校准需单独验证时不成立。收敛需统一对象与“DeepKriging测试误差/经典克里金测试误差”,并公开边界预测、区间覆盖和计算图及最强反例。

实践后果是:这使“将多尺度空间基作为坐标嵌入输入神经网络,可在非高斯、非平稳场中学习非线性预测而不反演协方差矩阵”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。报告应围绕“DeepKriging测试误差/经典克里金测试误差”同时列出失败对象、资源成本与敏感性结果,排除筛选或未计成本造成的表面优势。

跨域入口是与第302号调和分析相接:空间基把位置分解成尺度,神经网络再组合;若基没有覆盖决定性频率,深层非线性也无法恢复被遗漏的空间信息。异名为机器学习称“位置编码”,图学习称“结构嵌入”,调和分析称“多尺度基展开”;另见第302号尺度字典。碰撞须固定“神经网络若加入经纬度就已具有空间能力;克里金的协方差结构无需显式编码”并比较“DeepKriging测试误差/经典克里金测试误差”;第三项是空间支持、采样位置与依赖尺度。

位置D——把『DeepKriging:空间基可以进入非线性网络』中的操作次序与变化路径作为首要显露 单因决定『DeepKriging:空间基可以进入非线性网络』当前结论的最小充分项只有:用固定或多尺度径向基将位置展开成高维空间特征,再由DNN联合学习响应与不确定性;高斯线性情形可回到克里金联系 预设〔06 聚合次序不影响结论〕神经网络若加入经纬度就已具有空间能力;克里金的协方差结构无需显式编码 量纲DeepKriging测试误差/经典克里金测试误差 失效当不确定性来自密度预测或重抽样而非闭式协方差,校准需单独验证时不成立 自曝『DeepKriging:空间基可以进入非线性网络』的原始材料只直接支持“证据链的锚点是Chen、Li、Reich与Sun在2024年《StatisticaSinica》34卷291–311页的DeepKriging”,没有自动覆盖边界外对象 空栏『DeepKriging:空间基可以进入非线性网络』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名机器学习称“位置编码”,图学习称“结构嵌入”,调和分析称“多尺度基展开”;另见第 585 号第 15 条『多尺度机器学习本构』

十一、贝叶斯运输映射:非高斯空间场也能稀疏化Scalable Bayesian Transport Maps

提出Matthias Katzfuss与Florian Schäfer,2024年《Journal of the American Statistical Association》119(546):1409–1423,DOI:10.1080/01621459.2023.2197158,〈Scalable Bayesian Transport Maps for High-Dimensional Non-Gaussian Spatial Fields〉 争议或最新Daniel Marzouk、Tarek Moselhy、Matthew Parno与Alessio Spantini,2016年《Handbook of Uncertainty Quantification》:1–41,DOI:10.1007/978-3-319-11259-6_23-1,〈Sampling via Measure Transport〉 关键按空间排序构造单调三角运输,每个分量只依赖少数近邻;稀疏结构借用Vecchia思想但允许非线性非高斯条件分布

2024年前后,旧默认是“可扩展空间方法必须保留高斯性,因为只有协方差和稀疏精度能支撑大规模计算”,但降水、浓度和极端场常偏斜、多峰或尾重;高斯变换不足,通用流模型又忽略距离屏蔽而参数爆炸。以“每维运输条件变量数/全部空间维数”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:按空间排序构造单调三角运输,每个分量只依赖少数近邻;稀疏结构借用Vecchia思想但允许非线性非高斯条件分布。否证方式为:在声明的对象类中,若按空间排序构造单调三角运输,每个分量只依赖少数近邻;稀疏结构借用Vecchia思想但允许非线性非高斯条件分布,则按“每维运输条件变量数/全部空间维数”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Katzfuss与Schäfer在2024年《美国统计学会杂志》119卷1409–1423页的空间运输映射是本条的证据起点。论文以每个位置只依赖k个邻居而非全部n个位置的稀疏三角运输映射近似非高斯场;固定k时训练和评估可扩展,样本外对数分数与条件预测优于高斯或低阶变换基线。具体读数“每维运输条件变量数/全部空间维数”把旧默认送上同一口径的检验台:纯数学中它表现为结构降维、常数或端点,统计与教育研究中则表现为样本、效应、覆盖或预测损失。共同点是结论不再只靠叙述成立。

争议边界是:映射阶数、排序和邻域大小决定近似;复杂尾部若需要长程条件依赖,固定稀疏图会低估联合极端。失效条件为:当映射阶数、排序和邻域大小决定近似时不成立。收敛需统一对象与“每维运输条件变量数/全部空间维数”,并公开边界预测、区间覆盖和计算图及最强反例。

由此,这使“用稀疏三角运输把复杂非高斯空间分布变换到简单参考分布,可同时得到采样、密度和条件预测”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。对本项证据须公开“每维运输条件变量数/全部空间维数”、失败对象和资源成本;只报最优结果不足以支持迁移。

接口:与第353号信息检索相接:运输映射和向量索引都依赖局部邻域压缩高维结构;前者必须保持概率密度,后者只需保持近邻排序。异名:生成模型称“normalizing flow”,数值概率称“transport map”,图模型称“稀疏三角因子”;另见第353号向量生成检索。共享预设为“可扩展空间方法必须保留高斯性,因为只有协方差和稀疏精度能支撑大规模计算”;先统一“每维运输条件变量数/全部空间维数”,若仍逆向,再检验空间支持、采样位置与依赖尺度。

位置S——把『贝叶斯运输映射:非高斯空间场也能稀疏化』形成的对象结构作为首要显露 单因决定『贝叶斯运输映射:非高斯空间场也能稀疏化』当前结论的最小充分项只有:按空间排序构造单调三角运输,每个分量只依赖少数近邻;稀疏结构借用Vecchia思想但允许非线性非高斯条件分布 预设〔01 谁进入分母〕可扩展空间方法必须保留高斯性,因为只有协方差和稀疏精度能支撑大规模计算 量纲每维运输条件变量数/全部空间维数 失效当映射阶数、排序和邻域大小决定近似时不成立 自曝『贝叶斯运输映射:非高斯空间场也能稀疏化』的原始材料只直接支持“Katzfuss与Schäfer在2024年《美国统计学会杂志》119卷1409–1423页的空间运输映射是本条的证据起点”,没有自动覆盖边界外对象 空栏『贝叶斯运输映射:非高斯空间场也能稀疏化』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生成模型称“normalizingflow”,数值概率称“transportmap”,图模型称“稀疏三角因子”;另见第 590 号第 18 条『数字孪生连续贝叶斯更新』

十二、高维空间极值工作流:计算近似也要修正不确定性Robust High-Dimensional Spatial Extremes

提出Silius M. Vandeskog、Sara Martino与Raphaël Huser,2024年《Statistics and Computing》34:137,DOI:10.1007/s11222-024-10448-y,〈An Efficient Workflow for Modelling High-Dimensional Spatial Extremes〉 争议或最新Emma Simpson、Jennifer Wadsworth、Raphaël Huser与Håvard Rue,2023年《Spatial Statistics》56:100763,DOI:10.1016/j.spasta.2023.100763,〈High-Dimensional Modeling of Spatial and Spatio-Temporal Conditional Extremes Using INLA and Gaussian Markov Random Fields〉 关键以空间条件极值描述依赖类随距离变化,用INLA快速拟合,再以Godambe型曲率修正后验尺度以补偿模型错设

2024年前后,旧默认是“只要把极值模型写成潜在高斯形式并用快速近似,标准贝叶斯后验区间就仍具有原来的频率解释”,但多个条件站点反复使用同一观测,复合似然把依赖项当独立;SPDE和高斯残差又是计算便利假设,未经校正会使区间过窄。以“校正后区间实际覆盖率/名义覆盖率”重新计量后,原先混在一起的边界和代价必须分别说明。

本条命题是:以空间条件极值描述依赖类随距离变化,用INLA快速拟合,再以Godambe型曲率修正后验尺度以补偿模型错设。否证方式为:在声明的对象类中,若以空间条件极值描述依赖类随距离变化,用INLA快速拟合,再以Godambe型曲率修正后验尺度以补偿模型错设,则按“校正后区间实际覆盖率/名义覆盖率”比较应出现稳定的方向;若方向系统反转,命题即被否定。检验必须固定对象类、分母与失败标准,不能在结果出现后改用更弱基线。

Vandeskog、Martino与Huser在2024年《Statistics and Computing》34卷第137号文章的高维空间极值工作流给出主证据:挪威案例含31×31公里网格的961个位置,每点25512个2010—2021夏季小时观测;工作流同时利用多条件站点并修正复合似然不确定性。这项工作的力量在于把问题从“有人相信什么”移到“什么数值或结构量可以重做”。按“校正后区间实际覆盖率/名义覆盖率”组织证据后,支持结果、零结果与失败对象可以放进同一张账本,不再依靠术语声望比较。

争议边界是:边际标准化未联合传播,阈值与网格选择仍影响尾部;校正恢复的是局部曲率,不保证远超样本范围的百年重现期正确。失效条件为:当边际标准化未联合传播,阈值与网格选择仍影响尾部时不成立。收敛需统一对象与“校正后区间实际覆盖率/名义覆盖率”,并公开边界预测、区间覆盖和计算图及最强反例。

另一处后果是:这使“空间条件极值可用SPDE与INLA扩展到近千位置,但复合似然和高斯近似造成的过度确定必须事后校正”从定性判断变成可报告的结构量,并要求负结果与失败对象同样进入公共记录。最低报告责任包括“校正后区间实际覆盖率/名义覆盖率”、最坏对象与成本账本,负结果属于理论边界而非附注。

接口见与第360号系统性能与能效相接:快速近似把计算成本降下来,却可能把置信度抬高;两边都需把速度收益与错设校准后的尾部风险同时报告。其他领域称:复合似然称“sandwich校正”,机器学习称“后验温度校准”,安全工程称“模型错设裕度”;另见第360号尾风险。只有“校正后区间实际覆盖率/名义覆盖率”可换算时才属同一动作;冲突仍在时应测量空间支持、采样位置与依赖尺度。

位置D——把『高维空间极值工作流:计算近似也要修正不确定性』中的操作次序与变化路径作为首要显露 单因决定『高维空间极值工作流:计算近似也要修正不确定性』当前结论的最小充分项只有:以空间条件极值描述依赖类随距离变化,用INLA快速拟合,再以Godambe型曲率修正后验尺度以补偿模型错设 预设〔02 单一读数代表复杂对象〕只要把极值模型写成潜在高斯形式并用快速近似,标准贝叶斯后验区间就仍具有原来的频率解释 量纲校正后区间实际覆盖率/名义覆盖率 失效当边际标准化未联合传播,阈值与网格选择仍影响尾部时不成立 自曝『高维空间极值工作流:计算近似也要修正不确定性』的原始材料只直接支持“Vandeskog、Martino与Huser在2024年《StatisticsandComputing》34卷第137号文章的高维空间极值工作流给”,没有自动覆盖边界外对象 空栏『高维空间极值工作流:计算近似也要修正不确定性』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名复合似然称“sandwich校正”,机器学习称“后验温度校准”,安全工程称“模型错设裕度”;另见第 590 号第 5 条『模型校准与差异项』

◎ 二十年连起来看

第一条贯穿线是:空间支持从背景变成模型对象。优先抽样、只在场点过程、空间交叉验证和Spatial+都说明,坐标如何被选、观测覆盖多大区域、训练点离测试点多远,会改变估计目标本身。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。

第二条贯穿线是:可扩展性靠结构稀疏,而不是把数据随意删小。固定秩、预测过程、SPDE、NNGP、MRA、Meshed GP与运输映射分别压缩秩、精度、条件集或域依赖;每种压缩都有自己漏掉的尺度。若换一类对象便反转,它只是局部家族,不是二十年主线。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。

第三条贯穿线是:不确定性比均值地图更难。空间混杂、极端依赖类、分位曲面、复合似然与DeepKriging都可能给出好看的平均预测,却在区间覆盖、尾部联合风险或系数解释上失败。还要确认第二幕确实复用了或清算了第一幕的判据。检验时应把相关条目的量纲并列,查看同一分母是否保持方向。若换一类对象便反转,它只是局部家族,不是二十年主线。

◎ 三个常见误解

误解一:空间样本量就是监测点数量。真正的信息量还受相关范围、采样位置与空间支持决定;密集聚在同一区域的一万个点可能不如分散的一百个点。容易误读,是因为独立同分布公式把坐标当成标签。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。最容易误读之处,应由反例、边界或样本外结果直接揭示。

误解二:加入空间随机效应总会让回归更可信。它能吸收残差相关,也可能与空间协变量竞争并改变系数。容易误读,是因为拟合优度提高被误当成因果解释改善。最容易误读之处,应由反例、边界或样本外结果直接揭示。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。

误解三:大数据空间模型只需选一种近似。低秩、邻域、网格和深度方法保留的是不同结构;最佳选择由预测距离、尾部目标和尺度决定。容易误读,是因为计算复杂度常被单独报告而不报近似误差。若正确表述不能排除一种常见错误用法,这个澄清仍不完整。判断标准不是术语是否流行,而是换一分母后结论是否仍成立。

◎ 与相邻领域的接口

与第308号实验设计与抽样调查的接口在代表性与采样机制:第308号主要处理谁进入样本,本块还要处理进入样本的位置如何依赖潜在场,以及相关结构如何改变有效样本量。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

与第309号时间序列与预测方法的接口在时空过程:时间侧强调发布日期、滚动窗口和结构突变,空间侧强调支持、距离与障碍;时空预测必须同时防止未来泄漏和邻域泄漏。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。

与第242号环境工程的接口在监测网络、污染面与极端事件。环境工程负责传感器、处理流程和决策阈值,本块负责采样偏倚、空间插值与尾部联合风险。若只能共享比喻而不能共享读数,就不应称为真正接口。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。

与第353号信息检索的接口在“未观察不等于负例”和邻域近似;检索系统用曝光与向量邻居,空间统计用观察努力与地理邻居,两边都需说明谁被看见。分工判据是:对象定义与核心量纲归本块,识别、实现或制度条件归对方面板。接口只有在两边能用同一分母复算时才成立。若只能共享比喻而不能共享读数,就不应称为真正接口。

◎ 争议现场

第一场争论是低秩、NNGP、SPDE与MRA谁最适合大空间数据。各方都有同一数据上的优势,却保留不同尺度和不确定性。要收敛,需要按预测距离、尾部目标、墙钟预算和覆盖率分层盲测,而不是只报均方误差。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。

第二场争论是空间混杂能否由一个通用修正解决。RSR稳定系数,Spatial+利用协变量的非空间分量,尺度派强调没有完全可识别。要收敛,需要模拟和真实负对照同时改变协变量、混杂场和空间尺度,并预注册目标效应。双方还应在同一批最强反例上接受检验。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。

第三场争论是深度空间模型是否仍属于可校准地统计。支持方以非高斯和非平稳预测改善为证,批评方指出空间切分泄漏与区间失准。要收敛,需要跨区域外部验证、联合分布评分和真正无邻居的新地点测试。若只在各自挑选的数据上成立,争论就不会真正结束。收敛设计应统一对象、分母、对照与资源预算,并预先声明失败条件。

◎ 往下五年看什么

观察点一是大型空间基准是否同时报告随机折、空间块折和跨区域外部测试三套误差,以及三者之间的乐观比。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

观察点二是可扩展模型在每百万位置上的墙钟时间、峰值内存、联合区间覆盖和短程变异保留率能否同时改善。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。

观察点三是空间混杂研究能否给出公开的尺度敏感度曲线:协变量相关长度/潜在场相关长度变化时,系数偏差在哪个阈值翻转。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。

观察点四是空间极值模型在新年份、新区域和更高阈值上的联合超越概率校准,而不只是训练期内的边际分位拟合。五年后应按固定基线、公开分母和独立数据直接复核。除平均改进外,还要报告失败比例、区间或计算代价。若读数无法跨年份复算,它仍只是愿望而非观察点。五年后应按固定基线、公开分母和独立数据直接复核。

◎ 可与哪些领域对撞

本块第四条“优先抽样”可与第308号第九条“非概率样本推断”对撞。共享预设是观察机制可被忽略;相反点是调查以参照样本校正进入,空间模型联合位置强度与潜在场。若两边都成立,第三项是把个体与位置合成同一纳入概率。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

本块第十条“空间交叉验证”可与第360号基准方法学对撞。共享预设是测试集代表部署;相反点是系统基准强调负载与硬件隔离,空间验证强调地理距离隔离。若两边都成立,第三项是部署差异应被写成多维距离而非单一随机留出。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。第三项必须能产生新的可证伪读数,不能只是折中措辞。

本块第十三条“空间极值依赖类”可与第239号电网稳定与共因故障对撞。共享预设是普通工况相关能代表极端联动;相反点是空间极值允许相关很高却尾独立,工程安全常按共因最坏情形设计。若两边都成立,第三项是风险设计需要一条从经验阈值到极限尾类的转换规则。第三项必须能产生新的可证伪读数,不能只是折中措辞。

本块第十九条“贝叶斯运输映射”可与第353号向量检索对撞。共享预设是局部邻域足以压缩高维结构;相反点是检索只保持排序,运输映射还要保持密度和条件概率。若两边都成立,第三项是邻域近似的验收必须区分几何保真与概率保真。可执行的碰撞设计,应在同一对象上同时测量两边的量纲。若矛盾在统一分母后消失,说明差异只是异名;若仍存在,才需要第三项。

◎ 十条可做的研究命题

1. 命题:空间随机k折对新区域预测的误差至少乐观20%;在多领域数据上同时做随机折、块折和跨区外测;若三者误差无系统差异,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。

2. 命题:低秩近似的局部预测损失由未表示短程方差占比决定;控制Matérn平滑度与秩做仿真;若该占比不预测误差,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

3. 命题:优先抽样偏差在位置强度比超过某阈值后快于一除以根号n下降;用可控监测网络仿真;若偏差仍随n消失,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

4. 命题:Spatial+只在协变量具有至少一定比例非空间残差时优于普通空间回归;扫过尺度与残差比;若无阈值关系,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

5. 命题:NNGP的最佳邻居数由实际部署距离而非训练点密度决定;跨密度与距离盲测;若最佳m只随n变化,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

6. 命题:空间极值依赖类错设会使百年联合重现概率误差远大于边际误差;在已知尾类模拟与真实回测比较;若两类误差同阶,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。

7. 命题:DeepKriging的优势在空间块验证下显著小于随机验证;复现实验并固定网络预算;若优势不变,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

8. 命题:Meshed GP的墙钟收益在块通信时间/局部计算时间超过一时消失;跨集群测量;若仍近线性加速,则命题被证伪。另做跨样本复现和至少一种敏感性分析。若主要结果只在单一口径成立,也视为对命题的削弱。

9. 命题:联合空间分位模型能把极端分位交叉率降为零且不牺牲尾部MAE;与独立分位拟合比较;若MAE更高且覆盖不改善,则命题被证伪。若主要结果只在单一口径成立,也视为对命题的削弱。分析应预注册主要分母、排除规则与停止条件。

10. 命题:复合似然后验的曲率校正能恢复名义覆盖但会增大极端重现期区间;在961位置雷达类模拟复核;若覆盖不改善,则命题被证伪。分析应预注册主要分母、排除规则与停止条件。另做跨样本复现和至少一种敏感性分析。

◎ 资料核验

# 附录:跨面板碰撞索引

结构与尺度。第301号把范数、维数与有限近似写成算子结构;第302号把尺度分解、稀疏控制和频率局部化写成可比较的上界;第303号在复几何中把曲率、稳定性与退化接起来;第310号则把同一“尺度”问题落到空间支持、协方差与预测误差。

可计算与近似。第304号给出哪些对象即使定义清楚也不存在统一算法;第307号说明贝叶斯后验即便存在,近似算法也可能改变目标;第309号把计算预算与预测时窗纳入比较。三块共同要求把“算出了一个数”拆成可终止、可校准与可重放。

抽样、偏倚与外推。第306号在生物医学数据中处理混杂、选择与高维多重性;第308号从设计概率与非应答机制出发决定谁能代表谁;第310号则揭示空间邻近和采样位置会改变有效样本量。共同判据是:分母不是记录条数,而是由设计与依赖决定的信息量。

学习与证据。第305号关注学生是否获得可迁移的数学表示;第308号关注干预比较是否由设计支撑;第307号与第309号关注模型的不确定性是否被校准。它们共同反对把一次正确、一次显著或一次低误差当作稳定能力。

跨面板最密接口。301↔302(非交换调和分析与算子范数)、301↔304(存在性与可计算性)、302↔309(频率分解与时间预测)、303↔310(几何结构与空间支持)、305↔308(课堂干预设计)、306↔307(贝叶斯生物统计)、306↔310(空间流行病学)、307↔309(贝叶斯动态模型)、308↔310(空间抽样)、309↔310(时空预测)。

  1. Noel Cressie与Gardar Johannesson,2008年《Journal of the Royal Statistical Society: Series B》70(1):209–226,DOI:10.1111/j.1467-9868.2007.00633.x,〈Fixed Rank Kriging for Very Large Spatial Data Sets〉
  2. Michael L. Stein,2014年《Spatial Statistics》8:1–19,DOI:10.1016/j.spasta.2013.06.003,〈Limitations on Low Rank Approximations for Covariance Matrices of Spatial Data〉
  3. Sudipto Banerjee、Alan E. Gelfand、Andrew O. Finley与Huiyan Sang,2008年《Journal of the Royal Statistical Society: Series B》70(4):825–848,DOI:10.1111/j.1467-9868.2008.00663.x,〈Gaussian Predictive Process Models for Large Spatial Data Sets〉
  4. Andrew O. Finley、Huiyan Sang、Sudipto Banerjee与Alan E. Gelfand,2009年《Computational Statistics & Data Analysis》53(8):2873–2884,DOI:10.1016/j.csda.2008.09.008,〈Improving the Performance of Predictive Process Modeling for Large Datasets〉
  5. Tilmann Gneiting、William Kleiber与Martin Schlather,2010年《Journal of the American Statistical Association》105(491):1167–1177,DOI:10.1198/jasa.2010.tm09420,〈Matérn Cross-Covariance Functions for Multivariate Random Fields〉
  6. Tatiyana V. Apanasovich、Marc G. Genton与Ying Sun,2012年《Journal of the American Statistical Association》107(497):180–193,DOI:10.1080/01621459.2011.643197,〈A Valid Matérn Class of Cross-Covariance Functions for Multivariate Random Fields With Any Number of Components〉
  7. Peter J. Diggle、Raquel Menezes与Ting-li Su,2010年《Journal of the Royal Statistical Society: Series C》59(2):191–232,DOI:10.1111/j.1467-9876.2009.00701.x,〈Geostatistical Inference under Preferential Sampling〉
  8. Debdeep Pati、Brian J. Reich与David B. Dunson,2011年《Biometrika》98(1):35–48,DOI:10.1093/biomet/asq067,〈Bayesian Geostatistical Modelling with Informative Sampling Locations〉
  9. James S. Hodges与Brian J. Reich,2010年《The American Statistician》64(4):325–334,DOI:10.1198/tast.2010.10052,〈Adding Spatially-Correlated Errors Can Mess Up the Fixed Effect You Love〉
  10. Mark J. Paciorek,2010年《Environmetrics》21(5):439–455,DOI:10.1002/env.1009,〈The Importance of Scale for Spatial-Confounding Bias and Precision of Spatial Regression Estimators〉
  11. David I. Warton与Leah C. Shepherd,2010年《The Annals of Applied Statistics》4(3):1383–1402,DOI:10.1214/10-AOAS331,〈Poisson Point Process Models Solve the “Pseudo-Absence Problem” for Presence-Only Data in Ecology〉
  12. William Fithian与Trevor Hastie,2013年《The Annals of Applied Statistics》7(4):1917–1939,DOI:10.1214/13-AOAS667,〈Finite-Sample Equivalence in Statistical Models for Presence-Only Data〉
  13. Finn Lindgren、Håvard Rue与Johan Lindström,2011年《Journal of the Royal Statistical Society: Series B》73(4):423–498,DOI:10.1111/j.1467-9868.2011.00777.x,〈An Explicit Link between Gaussian Fields and Gaussian Markov Random Fields: The Stochastic Partial Differential Equation Approach〉
  14. David Simpson、Finn Lindgren与Håvard Rue,2012年《Spatial Statistics》1:16–29,DOI:10.1016/j.spasta.2012.02.003,〈Think Continuous: Markovian Gaussian Models in Spatial Statistics〉
  15. Matthew J. Heaton、Abhirup Datta、Andrew O. Finley等,2019年《Journal of Agricultural, Biological and Environmental Statistics》24(3):398–425,DOI:10.1007/s13253-018-00348-w,〈A Case Study Competition among Methods for Analyzing Large Spatial Data〉
  16. Abhirup Datta、Sudipto Banerjee、Andrew O. Finley与Alan E. Gelfand,2016年《Journal of the American Statistical Association》111(514):800–812,DOI:10.1080/01621459.2015.1044091,〈Hierarchical Nearest-Neighbor Gaussian Process Models for Large Geostatistical Datasets〉
  17. Andrew O. Finley、Abhirup Datta、Benjamin C. Cook等,2019年《The R Journal》11(2):179–197,DOI:10.32614/RJ-2019-020,〈Efficient Algorithms for Bayesian Nearest Neighbor Gaussian Processes〉
  18. David R. Roberts、Volker Bahn、Simone Ciuti等,2017年《Ecography》40(8):913–929,DOI:10.1111/ecog.02881,〈Cross-Validation Strategies for Data with Temporal, Spatial, Hierarchical, or Phylogenetic Structure〉
  19. Brianna Valavi、Jane Elith、José J. Lahoz-Monfort与Guillera-Arroita,2019年《Methods in Ecology and Evolution》10(2):225–232,DOI:10.1111/2041-210X.13107,〈blockCV: An R Package for Generating Spatially or Environmentally Separated Folds〉
  20. Matthias Katzfuss,2017年《Journal of the American Statistical Association》112(517):201–214,DOI:10.1080/01621459.2015.1123632,〈A Multi-Resolution Approximation for Massive Spatial Datasets〉
  21. Huang Huang、Sameh Abdulah、Ying Sun等,2021年《Journal of Agricultural, Biological and Environmental Statistics》26(4):580–595,DOI:10.1007/s13253-021-00449-z,〈Competition on Spatial Statistics for Large Datasets〉
  22. Geir-Arne Fuglstad、Daniel Simpson、Finn Lindgren与Håvard Rue,2019年《Journal of the American Statistical Association》114(525):445–452,DOI:10.1080/01621459.2017.1415907,〈Constructing Priors that Penalize the Complexity of Gaussian Random Fields〉
  23. Daniel Simpson、Håvard Rue、Andrea Riebler、Thiago Martins与Sigrunn Sørbye,2017年《Statistical Science》32(1):1–28,DOI:10.1214/16-STS576,〈Penalising Model Component Complexity: A Principled, Practical Approach to Constructing Priors〉
  24. Raphaël Huser与Jennifer L. Wadsworth,2019年《Journal of the American Statistical Association》114(525):434–444,DOI:10.1080/01621459.2017.1411813,〈Modeling Spatial Processes with Unknown Extremal Dependence Class〉
  25. Anthony C. Davison、Simone A. Padoan与Mathieu Ribatet,2012年《Statistical Science》27(2):161–186,DOI:10.1214/11-STS376,〈Statistical Modeling of Spatial Extremes〉
  26. Matthias Katzfuss与Joseph Guinness,2021年《Statistical Science》36(1):124–141,DOI:10.1214/19-STS755,〈A General Framework for Vecchia Approximations of Gaussian Processes〉
  27. Matthias Katzfuss、Joseph Guinness、Wenlong Gong与Daniel Zilber,2020年《Journal of Agricultural, Biological and Environmental Statistics》25(3):383–414,DOI:10.1007/s13253-020-00401-7,〈Vecchia Approximations of Gaussian-Process Predictions〉
  28. Xu Chen与Surya T. Tokdar,2021年《Journal of the Royal Statistical Society: Series B》83(4):826–852,DOI:10.1111/rssb.12467,〈Joint Quantile Regression for Spatial Data〉
  29. Brian J. Reich、Montserrat Fuentes与David B. Dunson,2011年《Journal of the American Statistical Association》106(493):6–20,DOI:10.1198/jasa.2010.ap09237,〈Bayesian Spatial Quantile Regression〉
  30. Emiko Dupont、Simon N. Wood与Nicole H. Augustin,2022年《Biometrics》78(4):1279–1290,DOI:10.1111/biom.13656,〈Spatial+: A Novel Approach to Spatial Confounding〉
  31. Brian J. Reich、Isa Marques、Thomas Kneib、Alexandra M. Schmidt与Georgia Papadogeorgou,2022年《Biometrics》78(4):1291–1308(系列讨论),DOI:10.1111/biom.13651等
  32. Michele Peruzzi、Sudipto Banerjee与Andrew O. Finley,2022年《Journal of the American Statistical Association》117(538):969–982,DOI:10.1080/01621459.2020.1833889,〈Highly Scalable Bayesian Geostatistical Modeling via Meshed Gaussian Processes on Partitioned Domains〉
  33. Michele Peruzzi、Sudipto Banerjee、Andrew O. Finley与Alan E. Gelfand,2022年《Bayesian Analysis》17(4):1091–1119,DOI:10.1214/21-BA1297,〈Highly Scalable Bayesian Geostatistical Modeling via Meshed Gaussian Processes on Partitioned Domains: Discussion and Extensions〉
  34. Wanfang Chen、Yuxiao Li、Brian J. Reich与Ying Sun,2024年《Statistica Sinica》34:291–311,DOI:10.5705/ss.202021.0277,〈DeepKriging: Spatially Dependent Deep Neural Networks for Spatial Prediction〉
  35. Pratik Nag、Ying Sun与Marc G. Genton,2023年《Spatial Statistics》57:100773,DOI:10.1016/j.spasta.2023.100773,〈Spatio-Temporal DeepKriging for Interpolation and Probabilistic Forecasting〉
  36. Matthias Katzfuss与Florian Schäfer,2024年《Journal of the American Statistical Association》119(546):1409–1423,DOI:10.1080/01621459.2023.2197158,〈Scalable Bayesian Transport Maps for High-Dimensional Non-Gaussian Spatial Fields〉
  37. Daniel Marzouk、Tarek Moselhy、Matthew Parno与Alessio Spantini,2016年《Handbook of Uncertainty Quantification》:1–41,DOI:10.1007/978-3-319-11259-6_23-1,〈Sampling via Measure Transport〉
  38. Silius M. Vandeskog、Sara Martino与Raphaël Huser,2024年《Statistics and Computing》34:137,DOI:10.1007/s11222-024-10448-y,〈An Efficient Workflow for Modelling High-Dimensional Spatial Extremes〉
  39. Emma Simpson、Jennifer Wadsworth、Raphaël Huser与Håvard Rue,2023年《Spatial Statistics》56:100763,DOI:10.1016/j.spasta.2023.100763,〈High-Dimensional Modeling of Spatial and Spatio-Temporal Conditional Extremes Using INLA and Gaussian Markov Random Fields〉
  40. Noel Cressie、Catherine A. Calder、James S. Clark、Jay M. Ver Hoef与Christopher K. Wikle,2009年《Ecological Applications》19(3):553–570,DOI:10.1890/07-0744.1,〈Accounting for Uncertainty in Ecological Analysis: The Strengths and Limitations of Hierarchical Statistical Modeling〉
  41. Yiping Hong、Yan Song、Sameh Abdulah、Ying Sun、Hatem Ltaief、David E. Keyes与Marc G. Genton,2023年《Journal of Agricultural, Biological and Environmental Statistics》28(4):618–635,DOI:10.1007/s13253-023-00560-3,〈The Third Competition on Spatial Statistics for Large Datasets〉
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行碰撞行(预设/量纲/失效/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板