SDE Universes·新思想前沿既有大类补漏
新思想前沿 · 既有大类补漏

数值分析与科学计算

近二十年 · 20 个新理论 · 约 20200 字 · 王德生 亲撰 · 2026 年 8 月

这二十年,数值分析发生的根本变化可以用一句话概括:「精确」不再是默认追求,「够用而且知道差多少」成了新的标准。二十世纪的数值分析以确定性算法与最坏情形误差界为骨架;这二十年里,随机性从一种不得已的近似手段,变成了算法设计的第一原理——草图、抽样、多层估计各自都被证明能在保证精度的前提下把复杂度整整降一个量级。与此同时,另一条线索在反方向用力:结构保持、外微分、虚拟元、自适应最优性,都在追问「离散之后,原来那个方程的哪些性质必须一并被保住」。第三条线索是这十年才成形的——机器学习闯进来,先以物理信息网络与神经算子的姿态承诺替代求解器,再在一轮轮基准测试里被逼着交代自己到底赢在哪里。下面二十条按这三条线索排列:前七条是随机化与压缩,中七条是结构与自适应,后六条是数据驱动与可信性。

二十年 · 二十个理论 · 约 2006–2026

一、压缩感知与稀疏恢复Compressed Sensing and Sparse Recovery

提出Candès、Romberg 与 Tao,Donoho,2006 年。关键信号若稀疏,测量数可以远低于奈奎斯特率,且恢复是凸问题。

奈奎斯特采样定理统治了半个世纪:要不失真地重建一个信号,采样率必须至少是带宽的两倍。这条在工程上被当作物理定律看待,所有采集系统的设计都从它出发。压缩感知说的是另一件事——如果信号在某个基下是稀疏的(只有少数系数非零),那么用远少于奈奎斯特率的随机测量就足以精确重建,而且重建可以由一个凸的 l¹ 最小化问题完成,不必解组合搜索。

它靠两件东西立住。一是**受限等距性质**:随机测量矩阵以极高概率把所有稀疏向量的长度近似保持住,于是稀疏解是唯一的;二是 l¹ 与 l⁰ 在这一条件下等价的定理,把一个 NP 难的组合问题换成了可解的凸问题。两条合起来给出了一个可以写进工程手册的判据:需要多少次测量,是稀疏度与信号维数的显式函数,而不是靠试。

它的影响远超信号处理本身。磁共振成像的扫描时间因此可以大幅压缩并进入临床;单像素相机、雷达、天文成像各自出现了新的采集架构;更重要的是,它把「先采全部再压缩」这种延续几十年的工作流,改成了「直接采压缩后的东西」。在数值分析内部,它开启了整个「随机测量 + 结构先验」的方法论,是后面几条随机化算法的思想源头。

边界这十年被讲得很清楚。理论保证依赖随机测量矩阵,而许多真实系统的测量算子是确定的、结构化的,受限等距性质在那里未必成立甚至不可验证;稀疏性本身也常常是近似的。这十年主流的处理是把稀疏先验换成更弱、也更贴近数据的先验——低秩、流形、乃至学习出来的生成先验——这条演化最终把压缩感知与深度学习接到了一起。

还有一个方法论上的遗产值得单说:压缩感知是「先验知识可以换取测量成本」这一交易第一次被写成定理。此后二十年,数值分析中几乎每一次复杂度的量级下降,都可以被读成同一笔交易的不同版本——低秩换取存储、多层换取样本、结构保持换取长时稳定性。知道要解的东西长什么样,比把算法写得更快更值钱,这条在这二十年被反复证实。

位置D|它把“信号若稀疏,测量数可以远低于奈奎斯特率,且恢复是凸问题”当成单独够用的那一样 单因测量数可以远低于奈奎斯特率 预设〔16 稀有与常见服从同一机制〕默认“奈奎斯特采样定理统治了半个世纪:要不失真地重建一个信号”在比较前已经稳定 量纲压缩感知与稀疏恢复误差界保持的算例/全部同精度复算算例 失效当“这十年主流的处理是把稀疏先验换成更弱、也更贴近数据的先验——低秩”不成立时,压缩感知与稀疏恢复停止外推 自曝压缩感知与稀疏恢复自己留下的反证入口是第四段所承认的“这十年主流的处理是把稀疏先验换成更弱、也更贴近数据的先验——低秩、流形” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这十年主流的处理是把稀疏先验换成更弱”被排除的对象 异名本条的“测量数可以远低于奈奎斯特率”在邻域称作“长尾机制”;另见第 100 号第一幕甲条《世俗化修正:现代化不再等于宗教单向消失》 

二、矩阵浓度不等式Matrix Concentration Inequalities

提出Ahlswede–Winter 2002 起,Tropp 2012 定型为「用户友好」的形式。关键把标量的 Chernoff 界整体搬到随机矩阵的和上。

随机化算法的分析长期卡在一个技术瓶颈上:要证明一个由许多随机矩阵相加得到的估计量以高概率接近真值,需要控制这个和的最大特征值。标量情形有 Chernoff 与 Bernstein 不等式,一页纸就能算;矩阵情形因为不可交换,指数矩量的处理完全失效,早期只能靠维数上界极其粗糙的估计。

Tropp 把 Lieb 的一条凹性定理转化为矩阵版本的矩量生成函数控制,得到了一整套形式与标量情形几乎一样的不等式:只要知道每个随机矩阵的范数上界与方差参数,就能给出和的谱范数偏差概率,且常数是显式的。这套结果被写成「用户友好」的模板,工程师不需要懂证明也能直接套。

它的作用是**基础设施性质**的:此后十余年,随机 SVD 的误差界、草图法的子空间嵌入保证、随机 Kaczmarz 的收敛率、图稀疏化、矩阵补全、乃至随机梯度方法的方差分析,全部建立在它之上。可以说,若没有这套不等式,随机数值线性代数只会停留在「实验上有效」的阶段,不可能进入定理与软件库。

这一条也是数值分析与概率论关系变化的标志。二十世纪的数值分析借概率论作直觉,证明仍靠确定性估计;这二十年反过来——**概率不等式成了数值算法正确性证明的主干**,误差界本身带着失败概率这个参数。数值分析的结论形态因此改变了:从「误差不超过 ε」变成「误差以不低于 1−δ 的概率不超过 ε」。

边界在两处。第一,矩阵浓度给出的界通常带一个对数维数因子,在极大规模问题上并不锐利,最优常数至今是活跃问题。第二,它要求随机矩阵之间独立或至少是鞅差;许多实际算法(自适应抽样、依赖历史的重启)不满足这一条,其分析仍需一事一议,这也是这十年细粒度分析工作集中的地方。

位置E|它把“把标量的 Chernoff 界整体搬到随机矩阵的和上”当成单独够用的那一样 单因把标量的 Chernoff 界整体搬到随机矩阵的和 预设〔17 局部最优可加总为整体最优〕默认“随机化算法的分析长期卡在一个技术瓶颈上”在比较前已经稳定 量纲矩阵浓度不等式误差界保持的算例/全部同精度复算算例 失效若把“这二十年反过来——**概率不等式成了数值算法正确性证明的主干”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝矩阵浓度不等式自己留下的反证入口是第四段所承认的“这二十年反过来——**概率不等式成了数值算法正确性证明的主干**,误差界本身带着失败概率这个参数” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这二十年反过来——**概率不等式成了数值算法正确性证明的主干**”被排除的对象 异名本条的“把标量的 Chernoff 界整体搬”在邻域称作“局部—整体错位”;另见第 035 号第一幕乙条《合成基因电路:用造出来的回路检验机制》 

三、随机数值线性代数与草图法Randomized Numerical Linear Algebra and Sketching

提出Halko、Martinsson 与 Tropp,2011 年《SIAM 评论》的综述定型;Martinsson–Tropp 2020 年《数值学报》。关键先用随机投影把矩阵压小,再在小矩阵上做确定性分解。

求一个大矩阵的低秩近似,经典办法是截断奇异值分解,代价随矩阵规模三次方增长,在数据规模上来之后不可承受。此前的加速手段是 Krylov 方法,但它需要多次遍历矩阵,在数据只能流式读取或存在分布式存储上的场合并不适用。

随机化的做法极其简单:用一个随机高斯矩阵右乘原矩阵,得到一个瘦长的草图;这个草图的列空间以极高概率捕获了原矩阵主要奇异方向所张成的空间;于是把原矩阵投影到这个空间,在低维里做确定性分解即可。整个流程只需**一到两遍**读取原矩阵,且天然并行。误差界由矩阵浓度不等式给出,且可以在运行时后验估计。

它的实际后果在这十年才完全显现。随机 SVD 成为主成分分析、推荐系统、基因组学中的默认工具;草图—预条件方法让超定最小二乘的求解快了一个量级;随机化的 Nyström 方法把核方法推到了百万样本量级。2023 年起,美国能源部支持的 RandLAPACK 项目开始把这些算法写进 LAPACK 这一层——**这是随机算法从论文进入基础数值软件栈的标志性一步**。

值得注意的是它改变了「精度」的含义。经典数值线性代数追求达到机器精度,随机算法则明确以「用户指定的精度」为目标,并把速度与精度做成可调的旋钮。对多数下游应用(数据分析、机器学习、模型降阶),四五位有效数字已经足够,多出来的精度是纯浪费——这个认识本身花了十年才在社群里成为共识。

边界很实在。随机方法在奇异值谱衰减快时表现优异,谱衰减慢(近似满秩)时优势消失甚至变差;需要高精度或涉及病态问题时,仍必须回到确定性方法或用随机结果作预条件。另一处未决是可复现性:随机算法每次运行结果不同,对需要逐位复现的科学计算流程是新的制度性麻烦。

位置E|它把“先用随机投影把矩阵压小,再在小矩阵上做确定性分解”当成单独够用的那一样 单因先用随机投影把矩阵压小,再在小矩阵上做确定性分解 预设〔12 成本可外置而不改变结论〕默认“求一个大矩阵的低秩近似,经典办法是截断奇异值分解,代价随矩阵规模三次方增长”在比较前已经稳定 量纲随机数值线性代数与草图法误差界保持的算例/全部同精度复算算例 失效若把“对多数下游应用(数据分析、机器学习、模型降阶)”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝随机数值线性代数与草图法自己留下的反证入口是第四段所承认的“对多数下游应用(数据分析、机器学习、模型降阶),四五位有效数字已经足够” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“对多数下游应用(数据分析、机器学习、模型降阶)”被排除的对象 异名本条的“先用随机投影把矩阵压小”在邻域称作“外部性核算”;另见第 126 号第一幕乙条《镜像疗法:运动可以先由视觉替身启动》 

四、随机迭代求解与随机预条件Randomized Iterative Solvers and Preconditioning

提出Strohmer–Vershynin 2009 随机 Kaczmarz 的收敛证明;Avron–Maymounkov–Toledo 2010 的 Blendenpik;此后十余年的系统化。关键把随机性放进迭代的每一步,而不只是预处理阶段。

Kaczmarz 方法自 1937 年就存在:轮流把当前解投影到每一个方程对应的超平面上。它简单、内存友好,但收敛速度依赖方程的排列顺序,理论上无法保证。这使它在七十年里一直是工程技巧而非正规算法。

Strohmer 与 Vershynin 证明:如果每一步按行范数的平方**随机**选取方程,期望收敛率有显式的指数界,且只依赖矩阵的缩放条件数。一个随机化的动作把一个没有理论的老方法变成了有定理的方法。同一时期,Blendenpik 展示了另一条路:用随机变换生成一个廉价而高质量的预条件子,再交给标准的 LSQR 迭代——在中等规模的稠密最小二乘上,速度超过了 LAPACK。

此后这条线被系统化为「草图—预条件」范式:随机部分只负责把问题的条件数压下来,收敛与精度由确定性迭代保证。这个分工使得**随机性不影响最终精度,只影响达到精度所需的时间**,从而绕开了随机算法最被诟病的那一点。近年的工作把它推广到 Krylov 子空间方法(草图化的 GMRES 与 Arnoldi)、矩阵函数计算与序列线性系统。

同一时期一批细粒度分析工作把收敛率与矩阵谱的关系讲得更细,说明为什么随机块方法在某些谱分布下远快于理论最坏界。这类「平均情形比最坏情形好得多」的结论,正在把数值线性代数的分析范式从最坏情形推向典型情形——与算法理论中同期的转向同形。

边界在于:随机迭代方法的优势区间是「中等精度、超大规模、内存受限」。在需要机器精度或矩阵规模适中的场合,经典直接法仍然更快更稳。另外多数收敛保证是期望意义或高概率意义的,单次运行的最坏表现仍可能很差,实际部署时需要额外的停止准则与不确定性量化。

位置S|它把“把随机性放进迭代的每一步,而不只是预处理阶段”当成单独够用的那一样 单因把随机性放进迭代的每一步,而不只是预处理阶段 预设〔10 更多数据必然减少偏倚〕默认“Kaczmarz 方法自 1937 年就存在”在比较前已经稳定 量纲随机迭代求解与随机预条件误差界保持的算例/全部同精度复算算例 失效当“这类「平均情形比最坏情形好得多」的结论”不成立时,随机迭代求解与随机预条件停止外推 自曝随机迭代求解与随机预条件自己留下的反证入口是第四段所承认的“这类「平均情形比最坏情形好得多」的结论” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这类「平均情形比最坏情形好得多」的结论”被排除的对象 异名本条的“把随机性放进迭代的每一步”在邻域称作“规模偏倚”;另见第 099 号第一幕乙条《远读:文学史从少数经典移向大规模分布》 

五、张量列车与层次张量格式Tensor Train and Hierarchical Tensor Formats

提出Oseledets 2011 年《SIAM 科学计算》(张量列车);Hackbusch–Kühn 2009(层次 Tucker)。关键用一串小的三阶核张量把高维数组的存储从指数降到线性。

维数灾难是高维问题的根本障碍:一个 d 维、每维 n 个格点的数组有 n^d 个元素,d 稍大就无法存储。经典的 Tucker 分解只是把底数变小,指数仍在;CP 分解虽然存储线性,但最佳近似不一定存在,数值上极不稳定,五十年没能成为可靠工具。

张量列车的做法是把 d 阶张量写成 d 个三阶核张量的链式收缩,存储量是 d·n·r² 级——**对维数线性**。关键在于这种格式的最佳低秩近似可以由一串奇异值分解逐级得到,因而既有存在性又有稳定的算法,还继承了矩阵情形的所有误差控制。物理学中同一结构以矩阵乘积态的名义已用了十余年,这次是数值分析一侧独立把它变成了通用的张量格式。

它的应用面在这十年迅速扩展:高维偏微分方程(Fokker–Planck、主方程)的直接求解、参数化模型的整场存储、不确定性量化中的高维积分、量子多体模拟、以及大规模神经网络的权重压缩。配套的算法体系(张量列车上的交叉逼近、ALS 与 DMRG 型优化、张量格式下的线性系统求解)也基本成形。

更深一层的意义是它改变了「维数灾难」这个概念的地位。灾难并没有被消除,而是被**转移到了秩上**:只要问题的张量秩随维数增长得慢,计算就是可行的。于是问题变成「什么样的物理与统计结构会导致低秩」,这把一个纯数值问题拉回到了对被计算对象本身的理解上。

边界是清楚的:不是所有高维函数都低秩,而判断一个具体问题是否低秩通常只能靠数值试探;秩随维数增长的先验估计只在少数结构(低相互作用阶、局部耦合)下有严格结果。另外张量格式对维度的排列顺序敏感,重排可能让秩相差几个数量级,最优排序问题本身是组合难题。

位置D|它把“用一串小的三阶核张量把高维数组的存储从指数降到线性”当成单独够用的那一样 单因用一串小的三阶核张量把高维数组的存储从指数降到线性 预设〔02 单一读数代表复杂对象〕默认“维数灾难是高维问题的根本障碍:一个 d 维”在比较前已经稳定 量纲张量列车与层次张量格式误差界保持的算例/全部同精度复算算例 失效当“灾难并没有被消除,而是被**转移到了秩上**”时,张量列车与层次张量格式停止外推 自曝张量列车与层次张量格式自己留下的反证入口是第四段所承认的“灾难并没有被消除,而是被**转移到了秩上**:只要问题的张量秩随维数增长得慢,计算就是可行的” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“灾难并没有被消除,而是被**转移到了秩上**”被排除的对象 异名本条的“用一串小的三阶核张量把高维数组的存储”在邻域称作“代理测量”;另见第 091 号第一幕甲条《实验哲学:直觉不再被当作无条件起点》 

六、层次矩阵与蝶形分解Hierarchical Matrices and Butterfly Factorization

提出Hackbusch 自 1999 年起的 H-矩阵,2000 年代的 H²、HSS 格式;蝶形分解在 2010 年代成熟。关键把稠密矩阵按「远场低秩」的几何结构分块压缩。

积分方程离散后得到的是稠密矩阵:每个自由度与其它所有自由度都有相互作用,存储与求解代价是平方与立方级。快速多极子方法自 1987 年起解决了矩阵—向量乘的问题,但没有解决求逆与分解——而工程上最需要的恰恰是能反复使用的分解。

层次矩阵的观察是:势场型的核函数在源点与场点相距足够远时是数值低秩的。于是把矩阵按几何递归分块,近场块保留稠密,远场块用低秩因子存储,整个矩阵的存储与运算复杂度降到近线性。更关键的是,这套格式对加法、乘法、求逆与 LU 分解是**封闭的**——分解出来的因子仍是层次矩阵,可以反复使用。

蝶形分解针对的是另一类核:高频振荡的核(Helmholtz、雷达散射)不满足远场低秩,但满足一个更弱的「互补低秩」条件。蝶形结构利用这一条把振荡核压到近线性,使高频波散射、成像与快速变换类问题第一次有了可扩展的直接求解器。这十年它被推广为可以从矩阵—向量乘黑箱中自动构造的通用工具。

这一支的意义在于它给出了「稠密但有结构」这一类问题的标准答案。此前的选择只有两个极端:要么当稀疏矩阵处理(丢掉相互作用),要么当稠密矩阵处理(付不起代价)。层次格式提供了中间地带,并把「结构」的含义从零元素模式扩展到了**低秩模式**——这个观念此后被移植到协方差矩阵、核矩阵与机器学习中的注意力矩阵。

边界在于:层次格式的常数因子不小,只有规模足够大时才赢;核函数不满足低秩或互补低秩条件时(强非光滑、高维空间中的一般核)整套失效。另外多层次并行下的负载均衡与通信仍是工程难点,这也是为什么它在超算上的普及慢于理论上的成熟。

位置S|它把“把稠密矩阵按「远场低秩」的几何结构分块压缩”当成单独够用的那一样 单因把稠密矩阵按「远场低秩」的几何结构分块压缩 预设〔18 干预不回写到被干预者〕默认“积分方程离散后得到的是稠密矩阵:每个自由度与其它所有自由度都有相互作用”在比较前已经稳定 量纲层次矩阵与蝶形分解误差界保持的算例/全部同精度复算算例 失效当“有结构」这一类问题的标准答案”不成立时,层次矩阵与蝶形分解停止外推 自曝层次矩阵与蝶形分解自己留下的反证入口是第四段所承认的“有结构」这一类问题的标准答案” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“有结构」这一类问题的标准答案”被排除的对象 异名本条的“把稠密矩阵按「远场低秩」”在邻域称作“干预反身性”;另见第 095 号第一幕乙条《神经现象学:第一人称训练进入实验循环》 

七、多层蒙特卡洛Multilevel Monte Carlo

提出Giles,2008 年《运筹学》;Heinrich 1998 的思想前身。关键把估计量拆成一串精度递增的差分,让绝大多数样本落在最便宜的那一层。

蒙特卡洛的老问题是效率:要把统计误差减半,样本要翻四倍;而每个样本本身若来自一个需要细网格求解的偏微分方程或随机微分方程,离散误差又要求网格加密,两项代价相乘,总复杂度极高。二十年前这是随机偏微分方程与金融衍生品定价共同的瓶颈。

多层蒙特卡洛的构造异常简洁:把细网格上的期望写成粗网格期望加上一串相邻两层之差的期望。粗层便宜,可以取大量样本;细层昂贵,但相邻两层之差的方差很小,只需少量样本。把每层的样本数按方差与代价的比例最优分配,总复杂度可以从 ε^{-3} 降到 ε^{-2}——**在很多情形下达到与直接求一次细网格解相同的量级**。

它的普及速度在应用数学里少见。金融风险计算、地下水与油藏模拟中的不确定性量化、随机偏微分方程、贝叶斯反问题(多层 MCMC 与多层序贯蒙特卡洛)、以及粒子输运,各自都在几年内出现了多层版本。配套理论也齐备:最优层数与样本分配有闭式解,方差衰减率与离散格式的强收敛阶直接挂钩。

从方法论上看,它是本面板前几条那笔交易的又一个版本:**用「不同精度的解之间高度相关」这一结构,换取样本量的量级下降**。它同时给数值格式的设计增加了一个新的目标函数——不再只看单层的收敛阶,还要看相邻层之差的方差衰减,这直接催生了一批为多层框架专门设计的耦合格式。

边界在于:多层的收益依赖相邻层解之间的强相关性,若解对网格的依赖是不连续的(相变、自由边界、路径依赖的支付函数),方差衰减会大幅变慢;此时需要额外的光滑化或改用多指标框架。另外层与层之间的耦合实现细节繁琐,容易引入难以察觉的偏差。

位置E|它把“把估计量拆成一串精度递增的差分,让绝大多数样本落在最便宜的那一层”当成单独够用的那一样 单因让绝大多数样本落在最便宜的那一层 预设〔16 稀有与常见服从同一机制〕默认“蒙特卡洛的老问题是效率:要把统计误差减半,样本要翻四倍”在比较前已经稳定 量纲多层蒙特卡洛误差界保持的算例/全部同精度复算算例 失效若把“它同时给数值格式的设计增加了一个新的目标函数—”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝多层蒙特卡洛自己留下的反证入口是第四段所承认的“它同时给数值格式的设计增加了一个新的目标函数——不再只看单层的收敛阶” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“它同时给数值格式的设计增加了一个新的目标函数—”被排除的对象 异名本条的“让绝大多数样本落在最便宜的那一层”在邻域称作“长尾机制”;另见第 100 号第一幕甲条《世俗化修正:现代化不再等于宗教单向消失》 

八、有限元外微分Finite Element Exterior Calculus

提出Arnold、Falk 与 Winther,2006 与 2010 年《数值学报》。关键用微分形式与上同调把「哪种有限元空间是稳定的」变成一个结构问题。

混合有限元长期有一个令人不安的现象:某些看似合理的元会给出完全错误的解——出现伪模态、锁定或不收敛。稳定性由 inf-sup 条件保证,但这个条件对每一个元、每一个问题都要单独验证,几十年积累下来是一本经验手册而不是一套理论。

有限元外微分把这件事结构化。它注意到麦克斯韦方程、Darcy 流、弹性力学等一大批问题在微分形式的语言下都是 de Rham 复形上的 Hodge–Laplace 问题;于是稳定性问题变成:离散空间是否构成一个与连续复形**上同调等价**的离散复形,且存在有界的插值算子与之交换。满足这两条,稳定性自动成立。

这个框架一举解释了历史上那些「碰巧好用」的元为什么好用——Raviart–Thomas、Nédélec、Brezzi–Douglas–Marini 全都落在同一个族里,各自对应不同次数的微分形式;同时它系统地生成了此前没有的新元。麦克斯韦方程的伪模态问题、弹性的对称应力元问题,都在这套语言里得到了干净的解释与解法。

更一般的含义是:**离散化必须保住的不是精度,而是结构**。上同调、恰当序列、积分守恒这些性质如果在离散中被破坏,误差不会随网格加密而消失,因为破坏的是方程的定性内容而非定量内容。这条认识与几何数值积分中的辛结构保持、以及守恒律格式中的熵稳定性,属于同一种思路的三个分支。

边界在于:外微分框架对由 de Rham 复形刻画的问题极其有力,对不具备这种结构的方程(一般非线性、多物理耦合)没有直接对应。弹性复形与更一般的 BGG 复形是这十年的推进方向,但复杂度显著上升。另外这套语言的抽象度较高,进入工程软件的速度明显慢于它在理论上的成熟。

位置E|它把“用微分形式与上同调把「哪种有限元空间是稳定的」变成一个结构问题”当成单独够用的那一样 单因用微分形式与上同调把「哪种有限元空间是稳定的」 预设〔03 有限近似控制无限对象〕默认“混合有限元长期有一个令人不安的现象”在比较前已经稳定 量纲有限元外微分误差界保持的算例/全部同精度复算算例 失效当“这条认识与几何数值积分中的辛结构保持、以及守恒律格式中的熵稳定性”不成立时,有限元外微分停止外推 自曝有限元外微分自己留下的反证入口是第四段所承认的“这条认识与几何数值积分中的辛结构保持、以及守恒律格式中的熵稳定性,属于同一种思路的三个分支” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这条认识与几何数值积分中的辛结构保持”被排除的对象 异名本条的“用微分形式与上同调把「哪种有限元空」”在邻域称作“有限截断”;另见第 097 号第一幕乙条《贝叶斯年代模型:测年从单点变成事件序列》 

九、等几何分析Isogeometric Analysis

提出Hughes、Cottrell 与 Bazilevs,2005 年《计算方法应用力学与工程》。关键用计算机辅助设计所用的样条基函数直接作有限元基,取消几何近似这一步。

工业仿真流程里有一道长期被低估的成本:设计模型是样条曲面(NURBS)表达的,而有限元网格是分片多项式的,两者之间的转换(网格生成与几何清理)常常占去整个分析流程八成的人力。而且这一步引入几何误差——分析的其实不是设计的那个物体。

等几何分析的提议直截了当:既然样条基函数本身就是一组具有高阶连续性的基,那就直接拿它当有限元的形函数。几何是精确的(无论网格多粗),细化过程不改变几何,且基函数天然有 C^{p−1} 连续性——远高于经典有限元的 C⁰。

高连续性带来了此前拿不到的能力:四阶问题(薄板薄壳、Cahn–Hilliard、流固耦合中的结构)不需要混合格式就能直接离散;谱性质更好,波传播与结构动力学中的频率误差显著降低;壳单元不再需要各种防锁定的特殊技巧。这些在工程上是可直接兑现的收益,因此它的采纳速度远快于多数数值方法。

它同时给数值分析提出了新的理论任务:样条空间的逼近性质、局部细化(T 样条、层次样条、LR 样条)的线性无关性与稳定性、以及跨面片的连续性拼接,都是全新的问题。「高连续性到底值多少精度」这个问题,直到这十年才有了较系统的回答——收益主要在每自由度精度与谱正确性上,而不在渐近收敛阶上。

边界很实际:局部细化是它最大的短板,样条的张量积结构天然抵抗局部加密,各种解决方案都在线性无关性与实现复杂度之间权衡;三维实体的样条参数化(从曲面模型生成体模型)至今没有稳健的自动方法,这是它未能完全取代传统有限元的主要原因。

位置D|它把“用计算机辅助设计所用的样条基函数直接作有限元基”当成单独够用的那一样 单因用计算机辅助设计所用的样条基函数直接作有限元基 预设〔03 有限近似控制无限对象〕默认“工业仿真流程里有一道长期被低估的成本”在比较前已经稳定 量纲等几何分析误差界保持的算例/全部同精度复算算例 失效当“它同时给数值分析提出了新的理论任务:样条空间的逼近性质”不成立时,等几何分析停止外推 自曝等几何分析自己留下的反证入口是第四段所承认的“它同时给数值分析提出了新的理论任务:样条空间的逼近性质、局部细化(T 样条、层次样条)” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“它同时给数值分析提出了新的理论任务:样条空间的逼近性质”被排除的对象 异名本条的“用计算机辅助设计所用的样条基函数直接”在邻域称作“有限截断”;另见第 035 号第一幕乙条《合成基因电路:用造出来的回路检验机制》 

十、虚拟元法与多面体网格Virtual Element Method and Polytopal Meshes

提出Beirão da Veiga、Brezzi、Cangiani、Manzini、Marini 与 Russo,2013 年。关键基函数不需要被显式算出,只需要它的若干个矩可以精确计算。

有限元几十年来受制于单元形状:三角形、四边形、四面体、六面体,网格生成必须迁就这些形状,复杂几何与自适应加密因此代价高昂。多面体网格能大幅缓解,但在多面体上构造多项式基并保证协调性是长期难题。

虚拟元法给出的答案是绕过构造。它的局部空间中除了多项式,还含有一些满足特定偏微分方程的「虚拟」函数——这些函数没有闭式表达,也不需要求值。关键在于:刚度矩阵只依赖这些函数的某些多项式投影与一个稳定化项,而这两者都可以由自由度精确算出。**基函数从未被计算,方法却是协调的、可分析的**。

这条思路一旦打开就快速铺开:任意多面体(包括非凸、含悬挂节点、退化边)都可作单元;高阶与高连续性版本随之出现;混合、非协调、间断的变体各自被建立;理论上误差分析与经典有限元同构,只是多了一个稳定化项的常数需要控制。

它的深层含义是对「一个有限元方法是什么」的重新定义:不是「一组显式基函数」,而是「一组自由度加一套能算出所需积分的规则」。这个视角随后回过头来澄清了若干经典方法(无网格法、混合有限体积、间断伽辽金)之间的关系,也让自适应网格上的悬挂节点从技术难题变成了非问题。

边界在于稳定化项:它的选取影响常数甚至条件数,最优选法在一般单元形状下仍无定论;退化程度极高的单元上误差常数会爆掉,几何假设的最弱形式仍在推进。工程软件的支持也才刚起步,生态成熟度远不及传统有限元。

位置E|它把“基函数不需要被显式算出,只需要它的若干个矩可以精确计算”当成单独够用的那一样 单因只需要它的若干个矩可以精确计算 预设〔18 干预不回写到被干预者〕默认“有限元几十年来受制于单元形状:三角形、四边形、四面体、六面体”在比较前已经稳定 量纲虚拟元法与多面体网格误差界保持的算例/全部同精度复算算例 失效若把“这个视角随后回过头来澄清了若干经典方法(无网格法)”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝虚拟元法与多面体网格自己留下的反证入口是第四段所承认的“这个视角随后回过头来澄清了若干经典方法(无网格法、混合有限体积、间断伽辽金)之间的关系” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这个视角随后回过头来澄清了若干经典方法(无网格法、混合有限体积)”被排除的对象 异名本条的“只需要它的若干个矩可以精确计算”在邻域称作“干预反身性”;另见第 095 号第一幕乙条《神经现象学:第一人称训练进入实验循环》 

十一、自适应有限元的收敛性与最优性理论Convergence and Optimality of Adaptive FEM

提出Binev–Dahmen–DeVore 2004、Stevenson 2007、Cascón–Kreuzer–Nochetto–Siebert 2008。关键证明「估计—标记—加密—求解」这个循环不仅收敛,而且达到最优收敛率。

自适应有限元自 1970 年代就在工程中广泛使用,效果显著,理论却长期空白:没有人能证明这个循环一定收敛,更不用说它比均匀加密好。工程师用了三十年的方法,数学上处于「据说有效」的状态。

突破分两步。第一步证明收敛性:借助后验误差估计的可靠性与有效性,加上加密策略的一个体积条件,证明误差单调下降到零。第二步是更难也更有价值的最优性:证明自适应循环产生的自由度数,与在所有可能网格中最优的那一个相比,只差一个常数因子——也就是说**自适应算法自动逼近了最优网格,尽管它并不知道解长什么样**。

这套证明引入的工具本身影响深远:解的正则性被换成了逼近类的语言(解属于某个非线性逼近空间),误差单调性由一个「误差 + 数据振荡」的组合量刻画,标记策略的 Dörfler 条件被证明是最优性的关键。这些概念随后被移植到边界元、间断伽辽金、混合方法与时间自适应上。

它对整个学科的意义是补上了一块最尴尬的空白:一个被广泛使用三十年的算法,终于被证明它做的正是它该做的事。这类「事后为既有实践建立理论」的工作,在数值分析里往往比新算法更受重视,因为它同时给出了改进的方向——比如标记参数如何选、误差估计子的哪一部分真正要紧。

边界在于:最优性结果集中在线性椭圆问题与协调有限元,非线性、时间依赖、鞍点与不定问题的对应理论要弱得多;常数依赖网格形状正则性,各向异性自适应至今没有同等强度的理论。而实践中最有价值的目标导向自适应(只求某个泛函精确),其最优性理论仍不完整。

位置D|它把“证明「估计—标记—加密—求解」这个循环不仅收敛”当成单独够用的那一样 单因证明「估计—标记—加密—求解」这个循环不仅收敛 预设〔18 干预不回写到被干预者〕默认“自适应有限元自 1970 年代就在工程中广泛使用,效果显著”在比较前已经稳定 量纲自适应有限元的收敛性与最优性理论误差界保持的算例/全部同精度复算算例 失效当“这类「事后为既有实践建立理论」的工作”不成立时,自适应有限元的收敛性与最优性理论停止外推 自曝自适应有限元的收敛性与最优性理论自己留下的反证入口是第四段所承认的“这类「事后为既有实践建立理论」的工作,在数值分析里往往比新算法更受重视” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这类「事后为既有实践建立理论」的工作”被排除的对象 异名本条的“证明「估计—标记—加密—求解」”在邻域称作“干预反身性”;另见第 126 号第一幕甲条《约束诱导运动疗法:把能动改成真正在用》 

十二、间断伽辽金与高阶方法的成熟Discontinuous Galerkin and High-Order Methods

提出Cockburn–Shu 自 1989 年起的 RKDG 系列;2000 年代的统一分析与 2010 年代的工业化。关键单元之间不要求连续,靠数值通量传递信息,从而把高阶、并行与守恒三件事同时拿到。

计算流体力学长期停在二阶精度:高阶格式在复杂几何与非结构网格上难以构造,且在激波附近会震荡。而二阶精度对湍流与气动声学这类长时间、多尺度问题是不够的——数值耗散会把要研究的物理抹掉。

间断伽辽金放弃了单元间的连续性要求,每个单元有自己的多项式解,单元之间只通过数值通量耦合。代价是自由度变多,收益却是三重的:任意阶精度可以在非结构网格上直接构造;单元间耦合极其局部,天然适合大规模并行与 GPU;守恒性逐单元严格成立。限制器与加权本质无震荡重构解决了激波附近的震荡问题。

这二十年真正的变化是它从理论走向了工业:统一的稳定性与误差分析框架(含 Brezzi 等人的统一形式)建立;高效实现(张量积基、和—因子化、矩阵自由算子)把高阶方法的每自由度成本降到与低阶可比;一批开源与工业求解器把它做成了默认选项。同期发展的谱元法与通量重构方法与它汇流,形成了统一的高阶方法族。

它还带来一条被广泛接受的判据变化:**衡量一个格式好不好,不再看每自由度成本,而看达到给定精度所需的总成本**。在这个判据下高阶方法在中高精度区间明显胜出,这一认识改变了大量工程仿真的默认配置,也是这二十年计算流体力学最实在的一次范式移动。

边界仍在:显式时间推进的稳定性限制随阶数平方增长,隐式求解又面临大而稠密的块结构;激波捕捉的限制器在高阶下仍是艺术多于科学;网格生成对高阶曲面单元的要求(高阶网格的有效性与质量)至今是瓶颈。熵稳定的高阶格式是这十年的主要推进方向。

位置D|它把“从而把高阶、并行与守恒三件事同时拿到”当成单独够用的那一样 单因从而把高阶、并行与守恒三件事同时拿到 预设〔17 局部最优可加总为整体最优〕默认“计算流体力学长期停在二阶精度:高阶格式在复杂几何与非结构网格上难以构造”在比较前已经稳定 量纲间断伽辽金与高阶方法的成熟误差界保持的算例/全部同精度复算算例 失效若把“它还带来一条被广泛接受的判据变化:**衡量一个格式好不好”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝间断伽辽金与高阶方法的成熟自己留下的反证入口是第四段所承认的“它还带来一条被广泛接受的判据变化:**衡量一个格式好不好,不再看每自由度成本” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“它还带来一条被广泛接受的判据变化:**衡量一个格式好不好”被排除的对象 异名本条的“从而把高阶、并行与守恒三件事同时拿到”在邻域称作“局部—整体错位”;另见第 035 号第一幕乙条《合成基因电路:用造出来的回路检验机制》 

十三、广义多项式混沌与随机配点Generalized Polynomial Chaos and Stochastic Collocation

提出Xiu 与 Karniadakis,2002 年起;稀疏网格配点在 2005–2010 年成形。关键把随机参数当作额外的坐标,用正交多项式展开解对参数的依赖。

工程仿真的输入几乎总是不确定的:材料参数、边界条件、几何公差。传统做法是蒙特卡洛——反复采样反复求解,代价高得只能取几十个样本,统计量极不可靠。而工程决策真正需要的是分布的尾部,正是蒙特卡洛最不擅长的部分。

多项式混沌的做法是把解写成随机输入的正交多项式级数,未知量变成级数系数。若解对参数是光滑的,级数收敛是谱速的——几十个系数就能达到蒙特卡洛几万样本的精度。广义化的一步是让多项式族匹配输入的概率分布(高斯配 Hermite、均匀配 Legendre 等),使收敛性对一大类分布成立。

求系数有两条路:侵入式的伽辽金投影(需要改写求解器)与非侵入式的随机配点(只需在若干参数点上调用已有求解器)。后者配合稀疏网格,把参数维数的诅咒推迟了几个维度,因而成为工业界的主流——**能不改动已有求解器,是一个不确定性量化方法能否被采用的决定性条件**。

这套方法把不确定性量化从「跑很多次仿真」提升为一门有逼近论基础的学科:收敛率与解对参数的解析性直接挂钩,敏感度分析(Sobol 指数)可以从展开系数直接读出,模型降阶与它天然衔接。这也解释了它为何在核工程、气候、油藏与航空适航中被迅速制度化。

边界很硬:解对参数不光滑时(分岔、激波位置随参数跳变、长时间混沌)谱收敛失效,多项式展开甚至会出现 Gibbs 型震荡;高参数维数下即使稀疏网格也力不从心。这十年的应对是把它与低秩张量格式、多层方法、以及主动子空间结合,本质上都是在找参数空间中的低维结构。

位置S|它把“把随机参数当作额外的坐标,用正交多项式展开解对参数的依赖”当成单独够用的那一样 单因用正交多项式展开解对参数的依赖 预设〔12 成本可外置而不改变结论〕默认“工程仿真的输入几乎总是不确定的:材料参数、边界条件、几何公差”在比较前已经稳定 量纲广义多项式混沌与随机配点误差界保持的算例/全部同精度复算算例 失效当“这也解释了它为何在核工程、气候、油藏与航空适航中被迅速制度化”不成立时,广义多项式混沌与随机配点停止外推 自曝广义多项式混沌与随机配点自己留下的反证入口是第四段所承认的“这也解释了它为何在核工程、气候、油藏与航空适航中被迅速制度化” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这也解释了它为何在核工程、气候、油藏与航空适航中被迅速制度化”被排除的对象 异名本条的“用正交多项式展开解对参数的依赖”在邻域称作“外部性核算”;另见第 126 号第一幕乙条《镜像疗法:运动可以先由视觉替身启动》 

十四、缩减基与经验插值Reduced Basis Methods and Empirical Interpolation

提出Barrault、Maday、Nguyen 与 Patera 2004(经验插值),Chaturantabut–Sorensen 2010(离散经验插值)。关键用少数几个已算好的解张成的空间代替整个解空间,并把非线性项也一并压缩。

参数化偏微分方程在优化、控制与实时决策中需要被求解成千上万次,每次全阶求解都不可承受。降阶模型的想法很老(本征正交分解自 1960 年代就有),但两个障碍长期存在:一是不知道需要多少个基、误差有多大;二是即使解空间被压到十维,非线性项的求值仍要在全阶网格上做,加速失效。

缩减基方法解决第一个:用贪心算法离线挑选参数点,每次挑选后验误差估计最大的那个,从而在线阶段可以给出**带保证的误差界**,并对基的数量给出与 Kolmogorov n 宽度挂钩的收敛结果。经验插值与其离散版本解决第二个:只在少数几个精心选出的「磁点」上求值非线性项,再插值回缩减空间,使在线代价彻底脱离全阶维数。

两件合起来使实时仿真成为可能:结构健康监测、心血管血流的床旁计算、参数辨识与设计优化各自出现了可用的实现。更一般的收益是给出了一个**离线—在线分工**的标准架构:昂贵的准备一次性完成,在线部分只与缩减维数有关。这个架构此后被大量数据驱动方法沿用。

理论上最有价值的一环是把可降阶性与 Kolmogorov n 宽度的衰减率挂钩:n 宽度衰减快的问题可降阶,慢的不可降阶。而输运主导、激波运动的问题 n 宽度衰减极慢——这条给出了降阶方法适用范围的**先验判据**,而不是事后试。

边界正在此:输运主导问题的降阶至今没有令人满意的通解,各种「移动坐标」「非线性流形」方案都只在特定情形有效;长时间积分中的稳定性也是老问题,缩减模型常在物理上发散。这十年的主要推进方向是把降阶与机器学习的非线性流形表示结合起来。

位置S|它把“用少数几个已算好的解张成的空间代替整个解空间”当成单独够用的那一样 单因用少数几个已算好的解张成的空间代替整个解空间 预设〔16 稀有与常见服从同一机制〕默认“参数化偏微分方程在优化、控制与实时决策中需要被求解成千上万次”在比较前已经稳定 量纲缩减基与经验插值误差界保持的算例/全部同精度复算算例 失效若把“理论上最有价值的一环是把可降阶性与 Kolmogorov n”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝缩减基与经验插值自己留下的反证入口是第四段所承认的“理论上最有价值的一环是把可降阶性与 Kolmogorov n 宽度的衰减率挂钩” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“理论上最有价值的一环是把可降阶性与 Kolmogorov n 宽”被排除的对象 异名本条的“用少数几个已算好的解张成的空间代替整”在邻域称作“长尾机制”;另见第 033 号第一幕甲条《宏基因组:不可培养的多数第一次进入分母》 

十五、算子推断与数据驱动的动力学发现Operator Inference, DMD and SINDy

提出Schmid 2010(动态模态分解);Brunton–Proctor–Kutz 2016(SINDy);Peherstorfer–Willcox 2016 起(算子推断),Kramer–Peherstorfer–Willcox 2024 年《流体力学年评》综述。关键不改动仿真代码,只从解的快照里把降阶算子回归出来。

经典的降阶方法是侵入式的:要把方程投影到缩减空间,必须能拿到并改写全阶求解器的内部算子。而工业界的求解器往往是黑箱——商用软件、遗留代码或多物理耦合平台,改不动也不许改。这使降阶模型在最需要它的地方反而用不上。

算子推断的做法是:只收集黑箱产生的解快照与输入,假定降阶模型具有某个已知的结构形式(例如线性加二次),然后用最小二乘把降阶算子直接回归出来。因为结构形式来自方程的物理形式而非拟合,得到的模型**在结构上与投影所得的模型一致**,且在数据充分时可证明收敛到它。这是它与纯黑箱拟合的根本区别。

同一时期的两个亲戚各有分工。动态模态分解从快照中提取线性演化算子的谱,给出频率与增长率,并与 Koopman 算子理论接上——把非线性动力学在观测函数空间中线性化。SINDy 则用稀疏回归从候选函数库中挑出真正在场的项,直接得到可读的控制方程。三者共同点是:**把「发现方程」变成了一个带结构先验的回归问题**。

这条线的意义在于它给数据驱动建模划出了一条与深度学习不同的路:模型仍然是方程,参数少、可解释、可分析稳定性,只是参数来自数据而非推导。工程界对它的接受度明显高于神经网络方法,原因正在此——它交出的东西仍然是工程师能读懂并追问的对象。

边界与风险同样清楚:结构形式若假设错了,回归会给出一个拟合良好但外推灾难的模型;快照数据必须充分激发所关心的动力学,否则算子不可辨识;噪声与时间导数估计对 SINDy 类方法极其敏感。Koopman 一支还面临连续谱问题——有限维的线性表示对一大类混沌系统根本不存在。

位置E|它把“不改动仿真代码,只从解的快照里把降阶算子回归出来”当成单独够用的那一样 单因不改动仿真代码,只从解的快照里把降阶算子回归出来 预设〔10 更多数据必然减少偏倚〕默认“经典的降阶方法是侵入式的:要把方程投影到缩减空间”在比较前已经稳定 量纲算子推断与数据驱动的动力学发现误差界保持的算例/全部同精度复算算例 失效若把“工程界对它的接受度明显高于神经网络方法”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝算子推断与数据驱动的动力学发现自己留下的反证入口是第四段所承认的“工程界对它的接受度明显高于神经网络方法,原因正在此——它交出的东西仍然是工程师能读懂并追问的对象” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“工程界对它的接受度明显高于神经网络方法”被排除的对象 异名本条的“只从解的快照里把降阶算子回归出来”在邻域称作“规模偏倚”;另见第 033 号第一幕甲条《宏基因组:不可培养的多数第一次进入分母》 

十六、物理信息神经网络Physics-Informed Neural Networks

提出Raissi、Perdikaris 与 Karniadakis,2019 年《计算物理杂志》。关键把方程残差写进损失函数,让网络在没有标注数据的情况下也能被方程约束。

把神经网络用于偏微分方程的想法在 1990 年代就有,但一直不实用:没有自动微分,残差的高阶导数难算;也没有足够的算力。这十年两件事都齐备了,于是网络可以被当成一个可微的函数逼近器,直接放进方程里。

做法是把解参数化为网络,损失函数由三部分组成:内部点上的方程残差、边界与初值的失配、以及可选的观测数据项。训练即求解。它的两个卖点很有吸引力:**无网格**,因而高维与复杂几何不构成障碍;**天然处理反问题**,未知系数与解可以同时被优化出来,这在传统框架里需要完全不同的算法。

反问题这一侧是它至今最站得住的战场。从稀疏的、带噪声的观测中同时恢复场与参数,传统方法需要构造伴随、正则化与网格,而物理信息网络把它变成一个统一的优化问题。血流建模、材料参数辨识、地球物理反演中都有可复现的成功案例。数据同化型问题——数据与方程都不完整——也是它的天然领域。

但这十年的基准测试也把它的位置压得很实:**在传统求解器适用的正问题上,它通常更慢且精度更低**,往往差几个数量级。原因不在表达能力,而在优化——损失曲面病态、多目标之间的权重难调、残差在解的奇异结构附近极难收敛。已有大量工作在改进(自适应采样、损失加权、区域分解、硬约束边界),但没有改变基本结论。

由此形成的共识值得记下:物理信息网络不是求解器的替代品,而是**反问题与数据同化的新工具**。这个位置的划定花了大约五年,期间的过度承诺与随后的纠正,与其他学科在同一时期经历的机器学习热潮完全同形。

位置S|它把“让网络在没有标注数据的情况下也能被方程约束”当成单独够用的那一样 单因让网络在没有标注数据的情况下也能被方程约束 预设〔17 局部最优可加总为整体最优〕默认“把神经网络用于偏微分方程的想法在 1990 年代就有”在比较前已经稳定 量纲物理信息神经网络误差界保持的算例/全部同精度复算算例 失效若把“这十年的基准测试也把它的位置压得很实”排除在分母外,表面支持越强,完整分母上的可迁移性反而越低 自曝物理信息神经网络自己留下的反证入口是第四段所承认的“这十年的基准测试也把它的位置压得很实:**在传统求解器适用的正问题上,它通常更慢且精度更低**” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这十年的基准测试也把它的位置压得很实”被排除的对象 异名本条的“让网络在没有标注数据的情况下也能被方”在邻域称作“局部—整体错位”;另见第 035 号第一幕乙条《合成基因电路:用造出来的回路检验机制》 

十七、神经算子Neural Operators

提出Lu、Jin 与 Karniadakis 2021(DeepONet);Li 等 2021(傅里叶神经算子)。关键学的不是一个解,而是从参数函数到解函数的整个映射。

物理信息网络每换一组参数就要重新训练,这使它在需要反复求解的场合毫无优势。神经算子改变了目标:直接学习无穷维空间之间的算子——输入一个初值或系数场,输出对应的解场。训练一次,之后每次求解只是一次前向推理。

两条主要架构各有依据。DeepONet 基于万能算子逼近定理,用一个分支网络编码输入函数、一个主干网络编码求值位置,二者内积给出输出。傅里叶神经算子则在频域做参数化的线性变换加非线性激活,因而具有**分辨率不变性**:在粗网格上训练的模型可以直接在细网格上推理,这一点是它区别于普通卷积网络的关键。

在若干标准问题上它们展示了惊人的推理速度——比传统求解器快三到四个数量级。天气预报是最有说服力的落地:数据驱动的全球预报模型在中期预报的多项指标上追平乃至超过了传统数值天气预报,同时把一次预报的成本从超算机时降到单卡推理。这是这条线索至今最硬的成绩。

然而它的可信性问题一直没解决。误差没有可靠的先验界,泛化到训练分布之外时会静默失效;守恒律、正定性、长时间稳定性通常不被保证;而在科学计算中,一个不知道自己什么时候错的模型很难被放进决策链。这十年后半段的主要工作正是给它加约束——把守恒律硬编码、把算子做成结构保持的、或把它当作预条件子而不是求解器。

由此形成的位置判断是:神经算子在**需要海量重复求解、可容忍中等精度、且训练分布覆盖良好**的场合(天气、参数扫描、设计优化的初筛)已经站住;在需要保证的场合仍需传统方法兜底。混合架构——网络给初值、传统求解器做修正——被普遍认为是更现实的形态。

位置D|它把“学的不是一个解,而是从参数函数到解函数的整个映射”当成单独够用的那一样 单因学的不是一个解,而是从参数函数到解函数的整个映射 预设〔10 更多数据必然减少偏倚〕默认“物理信息网络每换一组参数就要重新训练,这使它在需要反复求解的场合毫无优势”在比较前已经稳定 量纲神经算子误差界保持的算例/全部同精度复算算例 失效当“它的可信性问题一直没解决”不成立时,神经算子停止外推 自曝神经算子自己留下的反证入口是第四段所承认的“它的可信性问题一直没解决” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“它的可信性问题一直没解决”被排除的对象 异名本条的“而是从参数函数到解函数的整个映射”在邻域称作“规模偏倚”;另见第 033 号第一幕甲条《宏基因组:不可培养的多数第一次进入分母》 

十八、可微编程与自动微分Differentiable Programming and Automatic Differentiation

提出自动微分理论自 1970 年代就有,2015 年后随深度学习框架成熟并反向渗透进科学计算;可微物理仿真在 2019 年后成形。关键让整条仿真流水线对参数可导,伴随法从手工推导变成编译器的工作。

科学计算中的优化、参数辨识与设计问题都需要梯度。伴随法自 1970 年代就是标准答案,但它要求为每一个求解器手工推导并实现伴随方程——这项工作往往比正向求解器本身更繁重,且一旦模型改动就要重做。这使梯度信息在实践中成为奢侈品。

自动微分把它变成了机械操作:任何由基本运算复合而成的程序,其导数可以由链式法则自动生成,反向模式的代价与正向计算同阶而与参数个数无关——这正是伴随法的本质。深度学习框架把这套工具打磨到工业强度之后,科学计算社群开始反向借用,出现了可微的流体求解器、分子动力学、气候模式与光学仿真。

带来的能力变化不是量的:**整条流水线可以被当作一个可优化的对象**。网格、格式参数、亚格子模型、乃至求解器内部的迭代策略,都可以进入优化循环;混合建模(物理求解器 + 可学习修正项)也因此可行——修正项的梯度可以穿过求解器传回来。这是这十年「科学机器学习」这个方向得以成立的技术前提。

工程上的坑同样具体:反向模式需要保存中间状态,长时间积分的内存开销可能超过可用显存,于是检查点技术成为必修;迭代求解器与不动点的微分不能简单展开,必须用隐函数定理走捷径;混沌系统的梯度会随时间指数放大而失去意义——这一条是最本质的限制,也催生了最小二乘影子法等专门技术。

从学科关系看,这是这二十年里机器学习对科学计算影响最深、争议却最小的一项。它不改变任何数值方法的正确性,只是把一件人做了四十年的苦工交给了编译器。**一个工具被接受得最快的时候,往往是它不要求任何人改变自己的判断标准的时候**。

位置D|它把“让整条仿真流水线对参数可导,伴随法从手工推导变成编译器的工作”当成单独够用的那一样 单因让整条仿真流水线对参数可导 预设〔12 成本可外置而不改变结论〕默认“科学计算中的优化、参数辨识与设计问题都需要梯度”在比较前已经稳定 量纲可微编程与自动微分误差界保持的算例/全部同精度复算算例 失效当“迭代求解器与不动点的微分不能简单展开,必须用隐函数定理走捷径”时,可微编程与自动微分停止外推 自曝可微编程与自动微分自己留下的反证入口是第四段所承认的“迭代求解器与不动点的微分不能简单展开,必须用隐函数定理走捷径” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“迭代求解器与不动点的微分不能简单展开,必须用隐函数定理走捷径”被排除的对象 异名本条的“让整条仿真流水线对参数可导”在邻域称作“外部性核算”;另见第 126 号第一幕甲条《约束诱导运动疗法:把能动改成真正在用》 

十九、混合精度与迭代精化Mixed Precision and Iterative Refinement

提出Carson–Higham 2017–2018 的三精度迭代精化分析;随 GPU 半精度硬件普及而落地。关键在低精度里做重活,用少量高精度运算把误差拉回来。

硬件的发展方向与数值分析的传统假设分了岔:为深度学习优化的加速器提供了半精度乃至更低精度的极高吞吐,而双精度单元的比例越来越小。科学计算若坚持全程双精度,等于放弃了硬件上大部分算力。

迭代精化是 1940 年代就有的老技术:先算一个近似解,再算残差,再解一次修正方程。Carson 与 Higham 给出了它在**三种精度**混用下的完整舍入误差分析,明确了在什么条件下低精度分解 + 高精度残差可以恢复到全精度解,并给出了条件数的可容许上界。这把一个经验做法变成了有判据的算法。

落地很快。稠密线性系统的求解在 GPU 上用半精度分解加双精度精化,速度提升数倍而精度不变;同一思路推广到最小二乘、特征值问题与 Krylov 方法;配套的低精度稳定性研究(随机舍入、补偿求和、混合精度的稳定性分析)也系统展开。超算的性能榜单为此专门增设了混合精度的基准。

更深的影响是它改变了「精度」在算法设计中的地位:精度从一个全局设定变成了**可以在算法内部按需分配的资源**。哪一步需要多少位有效数字,成为与选择格式、选择预条件子同等的设计决策。这个观念此后扩散到了整个科学计算栈。

边界在于:低精度的动态范围很窄,半精度容易上溢下溢,必须配合缩放策略;病态问题超出条件数上界时精化不收敛;而不同硬件的低精度语义(舍入模式、非规格数处理)并不统一,可复现性因此变差。随机舍入被认为是缓解误差累积的有力手段,但硬件支持尚未普及。

位置E|它把“在低精度里做重活,用少量高精度运算把误差拉回来”当成单独够用的那一样 单因在低精度里做重活,用少量高精度运算把误差拉回来 预设〔03 有限近似控制无限对象〕默认“硬件的发展方向与数值分析的传统假设分了岔”在比较前已经稳定 量纲混合精度与迭代精化误差界保持的算例/全部同精度复算算例 失效当“这个观念此后扩散到了整个科学计算栈”不成立时,混合精度与迭代精化停止外推 自曝混合精度与迭代精化自己留下的反证入口是第四段所承认的“这个观念此后扩散到了整个科学计算栈” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“这个观念此后扩散到了整个科学计算栈”被排除的对象 异名本条的“用少量高精度运算把误差拉回来”在邻域称作“有限截断”;另见第 035 号第一幕乙条《合成基因电路:用造出来的回路检验机制》 

二十、可验证计算与数值证明Verified Computing and Computer-Assisted Proof

提出区间算术自 1960 年代(Moore),Taylor 模型与严格 Newton–Kantorovich 验证在 2000 年代后系统化;这十年与形式化验证接轨。关键让数值计算输出的不是一个近似值,而是一个包含真值的严格区间。

浮点计算给出的是近似值,误差通常只有启发式估计。对多数工程用途这已足够,但当计算被用来支持一个数学断言——某个解存在、某个系统稳定、某个不等式成立——启发式估计就不够了。这个缺口在混沌系统、动力系统与偏微分方程的定性研究中尤其致命。

可验证计算的做法是把每一次浮点运算的舍入误差显式向外扩张,使输出区间严格包含真值。配合 Taylor 模型(多项式加严格余项区间)与 Newton–Kantorovich 型的存在性判据,可以严格证明「在这个小球内存在唯一解」。整条链条上不出现任何未量化的近似。

这十年它进入了主流数学的证明现场:Lorenz 吸引子存在性、Kepler 猜想的部分环节、三维 Euler 的有限时间爆破、多个非线性方程的自相似轮廓,其关键步骤都是由这类验证完成的。数值分析因此获得了一个此前没有的角色——**它不只是解方程的工具,还是产出定理的工具**。

同时也带来新问题:这类证明依赖数千到数万行验证代码,传统的同行评议无法逐行核查。这十年的应对是与证明助手接轨——把区间算术的正确性、验证判据与最终推理放进同一个可机检的内核,使信任链闭合。若干爆破证明与动力系统结果已开始按这条路重做。

边界在于成本与可及性:严格验证的运算量常是普通计算的几十倍,能处理的问题规模有限;区间的过度扩张(wrapping effect)在长时间积分中会让界失去意义,必须用 Taylor 模型或坐标变换抑制。而形式化那一层的工时成本至今是原证明的数倍,普及速度受制于库的覆盖度。

位置S|它把“让数值计算输出的不是一个近似值,而是一个包含真值的严格区间”当成单独够用的那一样 单因让数值计算输出的不是一个近似值 预设〔03 有限近似控制无限对象〕默认“浮点计算给出的是近似值,误差通常只有启发式估计”在比较前已经稳定 量纲可验证计算与数值证明误差界保持的算例/全部同精度复算算例 失效当“同时也带来新问题:这类证明依赖数千到数万行验证代码”时,可验证计算与数值证明停止外推 自曝可验证计算与数值证明自己留下的反证入口是第四段所承认的“同时也带来新问题:这类证明依赖数千到数万行验证代码,传统的同行评议无法逐行核查” 空栏误差、稳定性、复杂度与失败算例账本没有单列因“同时也带来新问题:这类证明依赖数千到数万行验证代码”被排除的对象 异名本条的“让数值计算输出的不是一个近似值”在邻域称作“有限截断”;另见第 097 号第一幕乙条《贝叶斯年代模型:测年从单点变成事件序列》 
◎ 二十年连起来看

把二十条摆在一起,第一条线索是「随机」从噪声变成了资源。压缩感知用随机测量换取采样成本,草图法用随机投影换取分解成本,多层蒙特卡洛用层间相关换取样本成本,随机预条件用随机换取条件数。它们共享同一笔交易:接受一个可控的失败概率,换取一个量级的复杂度下降。这笔交易之所以能做,靠的是矩阵浓度不等式这类工具把「可控」变成了可写下来的数——没有那一步,这些方法至今仍会停在「实验上有效」。数值分析的结论形态也因此永久改变了:误差界现在普遍带着一个失败概率参数。

第二条线索走的是相反的方向:离散化必须保住的不是精度,而是结构。有限元外微分保住上同调,等几何保住几何,虚拟元保住协调性,间断伽辽金保住逐单元守恒,自适应最优性理论保住「算法逼近最优网格」这条性质本身。这一支的共同发现是:结构一旦在离散中被破坏,误差不会随网格加密而消失——因为被破坏的是方程的定性内容。这与随机化那一支并不矛盾,两者分工明确:随机化管的是算得起,结构保持管的是算得对

第三条线索是这十年才展开的,也最未定:机器学习进来之后,学科被迫重新回答「什么叫一个可信的计算结果」。物理信息网络与神经算子交出的是没有先验误差界、可能静默失效的结果;可验证计算与形式化验证交出的是带严格区间、可机检的结果。两者在同一个十年里同时加速,方向正好相反。目前形成的分工是:数据驱动的方法在需要重复求解、可容忍中等精度的地方站住,传统与可验证的方法在需要保证的地方兜底;混合架构被普遍认为是更现实的形态。而真正未决的问题不是哪一方赢,是这两套判据能否被写进同一个框架——一个模型什么时候可以被信任,目前仍然是靠场景约定,而不是靠定理。

新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。既有大类补漏这一组采用加密体例——每块列二十个近二十年真正立住的新理论,每个理论讲清它推翻了什么、靠什么证据立住、以及它自己的边界。 · ← 回到学科面板