全书目录 · 专著第 100 号 · 📕 在线翻书 · ⬇ PDF

第六章 已交付项——什么可以被撤掉

摘要 「为学日益,为道日损。损之又损,以至于无为,无为而无不为」是《道德经》中形式最完整的一条路径陈述,却留下两个从未被正面回答的问题:损什么?为什么反复地减不会把整体减空? 历代注家的答案(损私欲、损知见、反虚无、忘知)全部是规范性的,因而不可检验。本文取林学的自疏与间伐、机器学习的剪枝与正则化、材料学的去应力退火为三家不相往来的源,三家各锁一个不同终点、各持一条互斥的路径主张;并从三家共有而未言明的前提——被移除的那一部分是多余的——出发,以林学与机器学习自身的材料推翻它。本文的判断是:「损」的对象既不是多余的,也不是有害的,更不是欲望或知见,而是已经把自身作用转成系统结构性条件、因而其本体的继续持有已无必要的那一部分。 本文称之为已交付项,读数为接续保持率 δ——移除该部分并允许系统重新平衡之后的性能保持率。该定义与消融实验的分野是本文最实质的一处:消融测"删掉立刻掉多少",δ 测"删掉之后能不能重新长回来",两者可给出相反判定。本文执行了一次预注册的可复算实验:在 90% 稀疏度下,消融口径判为损失约 17%(关键),本文口径判为完全恢复(已交付),三个随机种子全部复现;交付边界可定位在 95% 与 98% 之间。同时,四条预注册假设中有两条被推翻:低稀疏度下再训练无益(δ_B 略低于 δ_A),且从未观察到"剪枝后优于基线"。更要紧的是本文自己发现的一处致命敏感性:同一批权重,平衡期 1 轮判为未交付、200 轮判为已交付,且曲线连续爬升、无平台、无自然截断点——δ 因此必须与平衡期一并报告,单独的 δ 值无意义。

关键词 已交付项;接续保持率;自疏与间伐;剪枝;去应力退火;为道日损;无为而无不为

一 · 引论:两个从未被正面回答的问题

《道德经》第四十八章开篇十六字:

为学日益,为道日损。损之又损,以至于无为,无为而无不为。

这是全书形式最完整的一条路径陈述:它给了两个方向相反的操作(日益/日损)、一个反复施加的动作(损之又损)、一个终点(以至于无为),还给了终点处的性质(无为而无不为)。从哪儿起、经过什么、实现什么、终点如何——四件齐全。

而它留下两个问题,两千年来没有被正面回答。

第一问:损什么? 历代的答案高度一致地落在规范性的一侧。王弼注「为道日损」四字:务欲反虚无也——要返归虚静无欲的状态。河上公把此章题为「忘知章」。宋人苏辙讲得更细:一旦知道,回看万物无一不妄,去妄以求复性。当代通俗解则大体作损私欲、损执着、损念头。

这些答案的共同性质是:该损什么由价值判断给出,因而不可计量。 一个说"损私欲"的读法,无法告诉你在一个具体的系统里哪一部分该被移除。

第二问,而且更少被问:为什么反复地减不会把整体减空? 一个持续做减法的过程,凭什么收敛到「无不为」,而不是收敛到零?苏辙给出了这一问的最精细版本——去妄之后"去妄的那个心"仍在,须连这个心也一并忘掉;但他仍未回答减法为何有底。王弼的答案是"反虚无",即终点就是空——这至少是自洽的,但它与「无不为」正面冲突:若终点是空,何来无不为?

本文的进路是把这两问合并成一个可计量的问题:

一部分是怎样变得"可以被移除"的?而在什么条件下它移不得?

这个问题在三门与老子学毫无往来的学科里有实质性的、彼此不相容的答案。

林学说:林分密度越过界限之后自疏必然发生,间伐不是阻止死亡,是替换掉死亡的选择方式;而过早或过强的间伐会使保留木分枝低、干形变差——被淘汰的那些树,不是一直多余的。

机器学习说:一个过参数化的网络可以被删掉绝大部分权重而不损失精度;但那些最终被删掉的权重,正是好子网得以形成的条件——中奖子网离不开事先的稠密训练。

材料学反手把两家撇开:你们争的"多余"根本不是实体。残余应力不对应任何一块可指的材料;退火之后构件的质量、成分、形状都没有变,变的是一个分布在整个构件里的场

三家在"该减什么"上互不相容,却共享一件从未说出口的事——而拆掉它,正是本文的工作。

本文的结论可以先说「损」的对象不是多余的东西,是已经交付完毕的东西。 一部分之所以变得可以被移除,不是因为它本来无用,而是因为它已经把自己的作用转成了系统的一个结构性条件;而这个转化需要它在场,也需要时间。「损之又损」之所以收敛而不至于空,是因为每一轮只能损掉上一轮刚刚交付完的那一层。

本文余下部分:第二节交代方法、自我限定与和同批前四篇的强制划界。第三至五节陈述三家的完整路径。第六、七节取共有前提并推翻它。第八至十一节建立构念、读数、辨别格与靶格。第十二节给出十处兑现。第十三、十四节回到文本。第十五节处理「无为而无不为」,并与本产线前一篇给出的另一种无为对接。 第十六节与十家近邻逐条划界——其中方法学侧的那一位曾占满本文的读数,并逼出了本文最实质的一处修订。 第十七节取第二层共有前提。第十八节写明三处让步。第十九节报告一次已执行的可复算实验:四条预注册假设中两条成立、两条被推翻,另有一处致命敏感性由本文自己查出。 第二十节给出分层引用、自反检验与反噬预言。第二十一节结论。

二 · 方法、自我限定与前篇划界

2.1 题型与三家的选法

本文问的是一条路——从哪儿起、经过什么、实现什么,以及在哪一步可以插手。因此三家必须各锁一个不同的终点,并各给出一条完整路径与一个可插手处。

2.2 一条否定性的选源理由

「少即是多」与极简主义对「日损」的解释已是通行表述,属于已被吸收的一族。凡以它们为源,撞出来的结论会被现成说法一比一替换掉。本文三家均不属之,第 16.5 节将正面切开。

2.3 与同批前四篇的强制划界

本文与同批前四篇属同一产线。前四篇的对象分别是:被放弃而仍在场的余料、从未进入受理的资格、下一轮的发起处、知道了却动不了的等待。

这四者的共同形状是"账上没有的东西"。本文第一次处理的是账上有、而且应当被划掉的东西。

与其中最近的一篇须再划一道:那一篇的对象是被动放弃的(选了别的,它没被选中),且它的作用没有留下来,只是仍在场;本文的对象是主动移除的(移除是正确的),且它的作用已经留在系统里。一个是"没选它",一个是"它已经把自己变成了别的"。

五篇不得互相引用为对方的证据:同一条产线的五次产出,互引会造成虚假的相互支持。

2.4 自我限定

本文对源做过预先排除:不取哲学、国学、政治学、伦理学作为三家之一。代价与前四篇相同——本文只能处理"哪一部分变得可移除"的结构,不能处理"该不该移除"的规范问题。

这一处限定在本篇比在前四篇更重,因为历代对「损」的解释恰恰全部落在规范一侧。本文因此不是在补充旧解,而是在换一个不重叠的问题;第 20.2 节的自反检验将指出,按本文自己的读数,这次替换的代价是可测且不小的。

三 · 第一家:林学·自疏与间伐

3.1 完整路径与可插手处

从过密的幼林出发,经由光、水、养分的竞争,走向稳定的成熟林相。可插手处是间伐——在自疏替你做之前先做。

奠基层有两处:Reineke 1933 年的林分密度指数,与 Yoda 等 1963 年提出的自疏法则——单株平均生物量与密度呈幂律,指数约为 −3/2。

3.2 三条支撑

其一,自疏是必然的,不是失误。 密度越过界限,死亡即开始。间伐不能阻止这个过程,它只能替换掉死亡的选择方式:由竞争来选,还是由人来选。

其二,被压木在早期是有贡献的。 下层被压木提供侧方庇荫,抑制保留木的低位分枝、改善干形。过早或过强的间伐会使保留木分枝低、尖削度大,形干质量下降。 这是营林规程里的常识。

其三,最优点不是常数。 自疏线的斜率随树种与立地变化,而这些差异被归因于种内与种间的耐阴性差异。

3.3 一段值得写进正文的学科史

自疏法则曾被称为"植物生态学唯一的定律",随后被大批学者系统质疑其普遍性;因其被证明缺乏普遍性且没有支撑理论,学界改称之为"规则"而非"定律"。至今仍有斜率究竟是 −3/2 还是 −4/3 的争论。

这段学科史对本文有直接用处:它说明"该留多少"这个问题在一门成熟学科里也没有普遍答案,因而任何主张"损到某个固定比例"的读法都应当被怀疑。

3.4 自曝与停步之处

自曝:过早间伐反而有害——这门学科自己承认,移除的时机比移除的数量更要紧。

它为什么停在这里:林学的问题是"这一林分该留多少株"。密度是标量,而"交付"不是。 一旦目标被写成密度,被移除者的历史贡献就不再是一个需要建模的对象。

四 · 第二家:机器学习·剪枝与正则化

4.1 完整路径与可插手处

从过参数化的网络出发,经由数据与训练动力学,走向能泛化的结构。可插手处是每一轮剪枝—再训练循环。

奠基层:LeCun 等 1989 年的最优脑损伤;Tibshirani 1996 年的套索;Frankle 与 Carbin 2019 年的彩票假说。

4.2 三条支撑

其一,奥卡姆之丘。 随剪枝进行,测试精度先升后降——原始的过参数化模型复杂度过高,而被极度剪枝的模型复杂度又太低。这是一条倒 U 形曲线,它直接给出"损之又损"为什么必须停。

其二,必须先有"多"才能得到"少"。 后续研究指出,既有的中奖子网离不开事先的稠密训练,这一点使该假说作为"直接训练稀疏网络"的用途受到怀疑

反过来读,这正是本文要的:那些最终被剪掉的参数不是浪费,它们是子网得以变好的条件。「为学日益」不是「为道日损」的对立面,是它的前提。

其三,"能不能重来"有一条界线。 在某个稀疏度以内,剪枝后重新随机初始化再训练也能达到原精度;越过该点之后,初始化才开始要紧。

4.3 自曝与停步之处

自曝:稀疏双下降表明,过参数化区间里"更大反而更好"——这与"减法有益"正面对立,且至今未决。

它为什么停在这里:这门学科的问题是"如何用更少的参数达到同样精度"。目标是效率,因而被剪掉的参数只需要一个负面标签(冗余)就够了;"它交付过什么"不是一个需要回答的问题。

五 · 第三家:材料学·去应力退火

5.1 完整路径与可插手处

从加工完毕、内含残余应力的构件出发,经由温度—时间历程,走向应力松弛的状态。可插手处是退火的温度与保温时间。

5.2 三条支撑

其一,减的不是物质,是场。 残余应力不对应任何一块可指的材料;退火之后构件的质量、成分、形状都没有变。这一条把本文从"移除某个部件"的直觉里拉出来。

其二,"损"是历程量不是动作。 松弛需要温度与时间的组合,同一效果可由高温短时或低温长时达成。它可以被交换,因而它有速率。

其三,有一类残余应力是被故意打进去的。 喷丸强化的全部目的正是往表层引入残余压应力以提高疲劳寿命,而去应力退火会把它一并抹掉。该减的与该留的在同一个物理量里,靠符号与位置区分,不靠种类。

5.3 自曝与停步之处

自曝:两种工艺互相抵消——这门学科自己承认,同一个操作在不同目标下是对治与破坏两回事。

它为什么停在这里:材料学在这个问题上一开始就把对象判为有害(残余应力是缺陷)。一个被定义为有害的东西,不会被追问它交付过什么。

五之二 · 三条路径为什么不能并成一条

三家的路径形状相似——都是"移除一部分而整体更好"——为什么不并成通式?

第一,三家移除的对象在本体层级上不同:一株树是个体,一个权重是参数,一份残余应力是场。并成通式只能并成"某物被移除了",不产生任何预测。

第二,三家的"重新平衡"机制不同:林分靠生长(以年计),网络靠再训练(以轮计),构件靠热激活松弛(以小时计)。而本文的读数恰恰依赖平衡期——三家的平衡期在量级上差了好几个数量级,通式里没有它的位置。 第 19.5 节的致命敏感性正是从这里来的。

第三,并成通式会消掉本文的第二根轴。 通式只保留"减了更好",而本文的全部锋利之处在"当下有用"与"移除后可恢复"之间的分离——这个分离只在具体体系的具体重平衡机制里存在。

由此得到一条方法上的判断:跨领域的结构类比在越过"重新平衡机制"这一层时会失效。 这与本产线前两篇分别在"作用符号"与"制度性排期"那一层得到的判断,是同一条纪律的第三个实例。

六 · 三家争什么,与它们共同没说出口的那一条

6.1 争论的同一句式

三家争的是:哪一部分该被移除。

林学按被压等级与竞争地位定;机器学习按权重幅度或显著性打分定;材料学按残余应力的符号与分布定。

6.2 共有前提

三家共同假定:被移除的那一部分是多余的——它的价值是负的或零。

具体表现是:三家为被减者设的字段,名字全是负面的——被压木(损耗)、冗余参数(浪费)、有害残余应力(缺陷)。念给三家听,三家都会说「这还用说吗」。

没有一家设"它已经把作用交出去了"这个字段。

七 · 推翻它的两件材料

7.1 第一件:被压木的侧方庇荫(来自林学自己)

在林分早期,下层被压木提供侧方庇荫,抑制保留木的低位分枝、改善干形;过早或过强的间伐会使保留木分枝低、尖削度大

被自疏淘汰的那些树,不是一直多余的——它们先把干形塑造这件事完成了,然后才成为可移除的。

这件材料在林学自己的领域里回答的是「间伐起始期与强度怎么定」——一个营林作业问题。没有人拿它去质疑"被淘汰者是多余的"这个前提。

7.2 第二件:中奖子网离不开稠密训练(来自机器学习自己)

既有的中奖子网必须由完整网络的迭代剪枝才能找到;这一点在该领域内被用来质疑该假说的实用价值。而本文反过来读它:被剪掉的那些参数,是好子网得以形成的条件。

这件材料在机器学习自己的领域里回答的是「能不能跳过稠密训练直接训练稀疏网络」——一个效率问题。没有人拿它去质疑"被剪者是冗余"这个前提。

共有前提当场不成立:被移除的那一部分不是多余的,它是已经交付完毕的。

八 · 已交付项

8.1 承重命题

「损」的对象既不是多余的东西(林学:损耗),也不是有害的东西(材料学:缺陷),更不是低使用的东西(机器学习:冗余),也不是欲望与知见(历代注家),而是——已经把自身作用转成系统结构性条件、因而其本体的继续持有已无必要的那一部分。

三重否定中的三项恰是三家的划界标准,第四项是注疏传统的标准。

8.2 定义与三条要点

已交付项:已把自身作用转移为系统的结构性条件,因而可以被移除、而移除之后其作用仍留在系统里的那一部分。

其一,它与"无用"相反。 已交付项在被移除的那一刻通常仍在出力——正因为它在出力,任何基于当下贡献的评估都会判它重要。

其二,交付需要在场,也需要时间。 被压木必须先庇荫若干年,稠密网络必须先训练,残余应力必须经历足够的温度—时间历程。未交付的部分损不掉,损了就塌。

其三,「损之又损」因此是有层次的。 每一轮只能损掉上一轮刚刚交付完的那一层;交付需要时间,所以减法不能一次做完,也不会做到零。

8.3 三家为什么都到不了

三家都不是疏忽,是各自问题结构的影子。

九 · 接续保持率 δ

9.1 定义,以及它与消融实验的分野

δ = 移除该部分、并允许系统重新平衡之后的性能 ÷ 移除之前的性能。

"允许重新平衡"这五个字是全篇最要紧的五个字,因为去掉它,δ 就退化成一个早已存在的东西。

消融实验的做法是:删掉一个部件,立刻测性能下降多少。它问的是"它有没有用",测的是即时依赖。 本文问的是"它的用是否已经转成结构",因而必须给系统一段时间去重新组织。

两者可以给出相反的判定,而这正是本文构念可被检验的全部依据

第十九节的实验证实了第一类的存在,且三个随机种子全部复现。

9.2 一处必须写死的致命敏感性

δ 强烈依赖平衡期的长度。 第 19.5 节的实测:同一批被移除的权重,再平衡 1 轮时 δ = 0.868(会被判为未交付),200 轮时 δ = 0.991(判为已交付);而从 0.868 到 0.991 是一条连续爬升的曲线,没有平台,也没有自然的截断点。

后果是严厉的:单独的一个 δ 值没有意义。 任何"δ ≥ 某阈值即判为已交付"的规则,都可以靠加长平衡期达成。

因此本文规定:δ 必须与平衡期一并报告,且必须报告 δ 随平衡期变化的整条曲线,不得只报终值。 这一条写入清点手册,并在第 20.3 节的反噬预言里再次出现——它是本文自己看不到出口的那个洞。

9.3 清点手册

读数名:接续保持率 符号:δ

定义:δ = 移除并重新平衡之后的性能 ÷ 移除之前的性能

必报两项(缺一则该 δ 值无效):

 ① 平衡期长度(以该体系自身的自然单位计:生长季/再训练轮/保温小时)

 ② δ 随平衡期变化的曲线,至少 5 个采样点

粒度:一次「移除」= 一个可指认的、边界明确的部分被去掉

   边界例一:移除后系统自行补入功能等价物 → 仍计为已交付(交付的是作用不是本体)

   边界例二:平衡期内施加了额外资源(补种、加数据、升温超出规程)→ 该次作废

   边界例三:性能指标在移除前后口径不同 → 该次作废

编码规则:

 ① 平衡期必须先于测量确定,不得因结果不理想而延长

 ② 性能必须取该体系自身在用的那个指标,不得另造

 ③ 报告 δ 时必须同时报告同一移除下的即时值(即消融口径),供对照

 ④ 单次 δ 不得用于判决;须至少三次独立重复(不同随机划分或不同林分)

表头:移除项|移除比例|即时值 δ_A|平衡期|δ 曲线|终值 δ_B|重复次数

不适用:无重新平衡机制的一次性系统

三处引用一致性:正文 §9.1 = 证伪 §19.2 = 赌注 §19.7

9.4 一句零情态词的判据

把它去掉,让系统重新平衡一段时间,它能不能回到原来的水平?

这与通行的问法"把它去掉会掉多少"完全不同。 五个场景,五个互不相同的答案,其中四个必须真做才知道:

场景答案
林分间伐后若干生长季,保留木的断面积生长能否补足被移除部分
网络剪枝后再训练,精度能否回到剪枝前
构件去应力退火后疲劳寿命能否维持(若原有喷丸压应力,则不能)
岗位岗位撤销并经过一个完整周期后,职能是否被系统自行接住
条款条款废止并经过一个执行周期后,秩序是否自行维持

后两处正是「无为而无不为」的可操作版本——不是不做,而是做过的事已经不需要谁继续持有。

十 · 二维辨别格

轴一:这一部分当下是否仍在承担作用。轴二:移除并重新平衡之后,系统能否恢复(δ 是否接近 1)

重平衡后能恢复(δ→1)重平衡后恢复不了(δ≪1)
仍在承担作用已交付项(靶格):还在出力,但它出的力系统已经能自己接住了承重项:真正的不可移除者,移除即塌
不再承担作用残迹:已经不起作用,移除无争议形式空缺:本身不出力,而移除后系统也长不回来

左上是靶格,且它的位置极为反直觉这一格里的东西,在任何"它还有没有用"的检验中都会被判为有用——因为它确实还在出力。只有加上"移除后允许重新平衡"这一步,它才与右上的承重项分开。 而这一步在多数体系里从不执行:它昂贵,而且没有人有理由去做——你为什么要花一整个生长季去证明一批树可以被砍掉?

右下的形式空缺格是本文的一个副产品:一个自身不出力、移除后却长不回来的位置——通常是接口、中介、或"看起来没什么用的中间层"。它与残迹在当下的读数上完全同形,而命运相反。 组织里被裁撤的中层、流程里被简化掉的过渡环节,多半落在这两格的混淆处。

十一 · 靶格:已交付项的三条签名

11.1 所有现场证据都支持保留它

它还在出力,删掉立刻有损失;任何基于当下贡献的评估都会判它重要,而这个判断是准确的。 保留它是完全正确的决策。没有人做错事。

11.2 它的代价不在本期显现

自疏造成的死亡、奥卡姆之丘的右降段、残余应力引起的变形与开裂——代价都是累积的、延后的、且归因困难。 于是在本期账上,保留它是零成本的。

11.3 越精细的评估越倾向于保留它

评估越细,越能测出它当下的贡献;而当下贡献恰恰是它最强的地方。 一个把"贡献度"测得越准的体系,越会把已交付项当作承重项保留下来。

处方与病因同向:一旦因保留过多而出问题(拥挤、过拟合、变形),结论通常是"评估不够精确,误删了有用的",于是下一轮把贡献度评估做得更细——而这只会让已交付项更牢固地留下来。

十一之二 · 三条签名合起来是一个吸引子

第一条与第二条合取,取消了内部纠错:保留有立即可见的收益,代价永远不在本期显现。

第三条把过程锁死:代价显现时被读作"评估不够准",而对策是加强当下贡献的评估——这直接强化了已交付项的留存理由。

三条合起来,这一格不是失误而是吸引子任何一个以"当下贡献"为唯一评估依据、且不执行重平衡检验的体系,都会自发地积累已交付项。

与同批前四篇的三条签名形状相同而内容不同——那四篇分别是余料的失落、资格的漏检、注意力的错配、时间的隐形,本篇是贡献的滞留。五篇因此指向同一个更一般的形状,但按第 2.3 节的纪律,五篇不得互相引用为证据。

十二 · 十处兑现

一 · 间伐:过早强度间伐的立木干形指标(分枝高度、尖削度)显著变差。

二 · 剪枝:同一稀疏度下,不再训练的 δ 显著低于再训练的(第十九节已实测)。

三 · 退火:经喷丸处理的构件,去应力退火后疲劳寿命下降。

四 · 脚手架:撤除后结构的自持能力与撤除时机相关,而与脚手架本身的质量无关。

五 · 导师制:导师制撤销后绩效是否下降,取决于同侪网络是否已经建成——而同侪网络的建成需要导师在场的那段时间

六 · 日落条款:带日落条款的临时立法到期后,秩序是否自持,可按条款到期后一个执行周期的合规率检验。

七 · 补贴退坡:退坡后产业规模能否维持,取决于配套(供应链、标准、人才)是否已建成,而非补贴额度本身。

八 · 临床支持撤除:体外支持撤除后器官功能能否自持,是标准的撤机试验——这是本文的读数在医学里的现成实现。

九 · 教学提示:撤走提示后学生的独立解题率,且撤走时机比提示质量更要紧。

十 · 中间管理层:撤并后信息流是否被流程接住,取决于流程在撤并之前是否已经承接了该层的协调功能。

第八处值得单列:撤机试验的做法正是"移除支持、观察一段时间、看能否自持"——它与本文的 δ 在操作上完全一致,而且它规定了明确的观察时长。 这说明本文的读数不是空想,它在一个高风险领域里已经是标准操作;本文所做的只是把它从一种临床程序,提升为一个跨领域的存在类判据。

十二之二 · 在不做完整重平衡检验的条件下能做什么

第 19.5 节表明 δ 依赖平衡期,而完整的重平衡检验昂贵——一片林子要等若干生长季,一个组织要等几个周期。但"做不起完整检验"与"无事可做"不是一回事。 本节给出三条成本递增的做法。

做法一 · 先记下移除前后的两个数(成本几乎为零)。 现行的评估只记一个数:这个部分当下贡献多少。再加一个数:如果移除它,多久之后系统才可能恢复到原水平——哪怕只是估计。 这个估计不需要准,它只需要存在,因为它会立刻把"当下贡献"与"可移除性"分成两个问题。

做法二 · 做局部的、小比例的移除试验。 不必对整个系统做,取一小部分先移除、观察一个自然周期。林业的做法正是这样:设置间伐试验样地,而不是拿整片林子去赌。 这类小规模试验的价值不在结论本身,在它迫使体系为"平衡期"选一个具体的数字——而那个数字一旦被写下来,就可以被讨论。

做法三 · 借用已有的撤除程序(成本最高,但最可靠)。 第十二节第八处指出,临床上的撤机试验与本文的读数在操作上完全一致,而且它规定了明确的观察时长。凡是本领域已有成熟撤除程序的,直接借它的时长规定,不要另造。这条做法承认了本文第三个洞的存在——本文给不出普遍的平衡期,那就用各领域自己已经沉淀下来的那个数。

三条做法的共同要点:它们都不要求体系相信本文的承重命题,只要求体系把"移除后多久能恢复"当成一个需要有答案的问题。 而这正是第 20.3 节那个自我封闭循环唯一可能的松动处。

十三 · 回到文本之一:损什么

第四十八章的第一问是「损什么」。本文的答案是:损已交付的那一层。

这个答案与历代注解的关系是不重叠而非对立。旧解说损私欲、损知见、损妄——这些都是该不该损的判断;本文说损已交付项——这是能不能损的判断。一个规范,一个结构。

但两者有一处实质的分歧,必须写明:旧解都默认"被损的东西是不好的"。 私欲、执着、妄见、多余的规定性——全部带负面标签。而本文主张被损的那一部分恰恰是有功的:它出过力,而且它的力还在系统里。

这个差别不是措辞。 若被损者是不好的,那么损得越早越好、越彻底越好;若被损者是有功的,那么损早了会塌,因为它还没把作用交出去。 两者预测相反,且可以分开检验——这正是第十二节十处兑现的用处。

「为学日益」由此也得到了新的位置。 通行读法把这两句当作对比(做学问是加法,修道是减法),而本文的框架要求它们是次序:先益,是后损的前提。未交付的东西损不掉,而交付需要它先在场。 机器学习那一家把这件事说得最直白——中奖子网离不开事先的稠密训练。

十四 · 回到文本之二:为什么损不空

第二问是「为什么反复地减不会把整体减空」。

本文的答案有两层。

第一层:因为每一轮只能损掉刚刚交付完的那一层,而交付需要时间。 这给出了减法的速率上限——你不能损得比交付更快。 这一层解释了「损之又损」为什么是一个持续的过程而不是一次动作。

第二层,也是更硬的一层:因为有一部分永远不会交付。 承重项(第十节右上格)不是"还没交付完",而是它的作用无法被系统的其他部分接住。一个网络剪到 98% 以上,再怎么训练也回不来;一片林子砍到某个密度以下,就不再是林子。

这两层合起来给出了「以至于无为」的位置:终点不是零,是所有可交付的都已交付完毕、剩下的全是承重项的状态。

这与王弼的"反虚无"正面对立,而且这次对立是可判决的。 若终点是虚无,则损到尽头应当什么都不剩;若终点是本文所说的状态,则损到尽头应当功能齐备而无一处冗余。第十九节的数据支持后者:在 90% 稀疏度下,系统删掉九成权重而性能完全恢复;剩下的那一成不是"虚无",是一套完整可用的结构。

14.3 与苏辙二阶的划界

苏辙对这一章的注给出了「损之又损」的二阶结构:去妄之后,"去妄的那个心"仍在,须连这个心也一并忘掉,然后才无所不为而不失于无为。他已经做出了二阶——损掉"损"这个动作本身。

本文若只讲"反复地减",就是复述他。 本文能保住的只有两处:

其一,二阶的对象不同。 苏辙的第二阶是心理自反(忘掉去妄之心);本文的第二阶是交付的层次(这一轮只能损掉上一轮刚交付完的那一层)。前者是同一个主体对自己的态度,后者是不同层次之间的次序关系。

其二,苏辙没有"损不掉"这一格。 在他那里,只要修养到位,什么都可以被忘;本文主张未交付的损不掉,损了就塌,而且这一点可测。 这是本文全部可检验性的来源,也是本文与整个忘学传统最干净的分界。

14.4 一处本文无法在文本层面判定的争议

第十三、十四节给出的读法有一个明显的软肋:它把「损」的对象从规范物(欲望、知见)换成了结构物(已交付项),而这个替换在文本上没有直接证据。

《道德经》第四十八章本身没有说损什么。"损私欲"是注家补的,"损已交付项"也是本文补的——两者在文本上的地位是对称的。

本文能主张的只有三条较弱的东西:其一,本文的补法产生可查的推论(第十二节十处),而旧解不产生;其二,本文的补法能同时回答第二问(为什么损不空),而旧解或者不回答,或者以"反虚无"回答从而与「无不为」冲突;其三,本文的补法与本章的次序结构一致——「为学日益」在前,而本文的框架要求先益后损,旧解则大多把两句读成对比。

这三条都不构成训诂上的证据。 本文因此明确:这是一个补法之间的比较,不是一个对错的判定。 读者若认为"损私欲"更合文本原意,本文没有材料反驳;本文只主张自己的补法可以被检验,而这一点是旧解不具备的。

十四之二 · 作用在两处并存,而「损」撤掉的是重复的那一处

前两节分别回答了「损什么」与「为什么损不空」。本节把两条并成一个结构,因为这个结构比两条分述更简单,也更容易被检验。

14a. 交付完成之后,那件事在系统里有两份

一个部分把作用转移出去之后,这件事在系统里同时存在于两处

「损」撤掉的是前一处,不是后一处。 而这就是本文与一切"减损"义读法的根本分野:减掉的不是能力,是重复的持有。

一个直接的后果:损之后系统的作用一份不少。前一处撤销了,后一处照旧运转。这不是补偿,也不是"虽然损失了但换来别的",是那件事本来就还在。

14b. 「无为而无不为」由此不再是悖论

把上一段的结构直接读到第四十八章的末句上:

无不为:作用一份不少——它们都在系统的条件里运转着。
无为:没有任何一份还需要被谁单独持有——重复的那一处已经全部撤销。

两句说的是同一个状态的两面:作用全在,持有全无。 它们之所以在字面上像矛盾,是因为通行读法把"为"理解成了作用本身;而本文把"为"理解成持有作用的那个动作作用与持有分开,矛盾就消失了。

14c. 三种情形由同一个结构生出

这个结构还顺带把本文散在各处的三个判断收成一组,它们不是三条规则,是同一件事的三种时相。

其一,损不掉的(承重项)=转移尚未完成的那一份。 系统的条件里还没有第二份,撤掉它就真的没有了。这解释了为什么损早了会塌——不是因为损这个动作有害,是因为那时候还只有一份。

其二,损了没意义的(浅损)=转移还没开始的那一份。 第 19.4 节实测的低稀疏度那一格属于此类:在浅层的移除上重新平衡毫无收益,因为那部分的转移过程根本还没运行到。 这解释了「损之又损」中的"又"为什么是必要条件而非修辞强调。

其三,「以至于无为」=系统里再没有任何一份是重复持有的。 不是空,是每一件仍在运转的事都只存在于该在的那一处

14d. 转移需要的是运行,不是时间本身

必须补一句,否则上面的结构会被读成一个纯粹的时间函数。

转移不是"放着放着就完成了",它需要系统持续运转。 一辆停在车库里三年的自行车,辅助轮拆下来照样摔——三年过去了,而骑的那个过程一次也没发生。 网络那一侧同理:第 19.5 节量的是再训练的轮数,不是挂机的时长;不训练,挂再久 δ 也不动。

所以"交付需要时间"这句话严格说是不准的,准确的说法是"交付需要运行",而运行恰好要占用时间。这个区别有实际后果:一个想让某部分尽快变得可移除的人,该做的不是等,是让系统多跑——多骑几次、多训练几轮、多经历几个周期。

14e. 这一节与本文其余部分的关系

本节没有引入新的构念,也没有新的读数——它只是把第八节的定义、第十节的四格与第十九节的三处实测,压成一个可以一句话记住的形状

作用在两处并存,损撤掉重复的那一处;未成两份者不可损,未起转移者损之无益,两份俱无者即是无为。

本文认为这一句比本文的承重命题更可能长久,因为它不依赖 δ 这个读数是否可操作——即便第 19.5 节的敏感性最终使 δ 不可用,这个结构本身仍然给出一组可分辨的情形。

十五 · 「无为而无不为」的第二种落法

本产线前一篇曾把「无为」落成一条时机规程:不在窗口之外动手。本篇给出的是第二种无为,它与前一种不同,且两者可以并存。

在本篇的读法里,「无为而无不为」不是悖论,而是一个状态描述无不为是因为作用全在,无为是因为没有一样还需要被持有。

这个落法有三个可检验的后果。

其一,它把"无为"从态度变成了状态。 一个系统是不是处在无为状态,可以用 δ 去测:若它的每一个仍在出力的部分都满足 δ→1,则它处在无为状态——所有作用都已交付,没有一处需要被持有。

其二,它解释了为什么无为需要漫长的准备。 交付需要在场与时间,因此「无为」不是一个可以直接进入的状态,它只能是长期在场之后的结果。这与「为学日益」在前、「为道日损」在后的次序一致。

其三,它给出了假无为的判据。 一个尚未交付就被清空的系统,看上去也是"什么都不做"——但它的 δ 显著小于 1,它不是无为,它是塌了。第十九节的高稀疏度区间(98% 以上)正是这种状态的实测形态:删得干干净净,而系统只剩三成性能。

两种无为的关系,本文只能给出一个不完整的说法:前一种是关于"什么时候动手",后一种是关于"还需不需要有人持有"。它们可能是同一件事的两个阶段——先只在窗口内动手,动作的成果逐层交付,最终连窗口也不需要了。但本文没有材料支持这个统一,故只作提示,不作主张。

十六 · 近邻划界

16.1 消融实验——曾占满本文读数的那一位

它的问题:一个部件对系统性能有多重要。做法是删掉再测,与本文的读数在操作上几乎同形。

分离线,且这一条逼出了本文的实质修订:消融测的是即时依赖(删掉立刻掉多少),本文测的是交付完成度(删掉之后能不能重新长回来)。本文因此把读数的定义从"删后保持率"改为"删除并允许重新平衡之后的保持率",读数名亦随之改定。

两者可给出相反判定,第十九节已实测:90% 稀疏度下,消融判为损失约 17%(关键),本文判为完全恢复(已交付)。

16.2 脚手架

分离线:脚手架是外来的辅助物,本就打算拆,且它不进入产物;已交付项是系统自身的一部分,而且它的作用留在了产物里。 检验方式:脚手架撤除后,产物中找不到它的痕迹;已交付项移除后,它的作用仍在运行。

16.3 突触修剪

分离线:修剪的判据是使用频率(用得少的被剪),本文的判据是交付完成度两者可以相反——一个高频使用而未交付的部件不该被剪,一个低频而已交付的部件可以剪。

16.4 奥卡姆剃刀与最小描述长度

分离线:其判据是描述长度,与"作用是否已转成结构"无关;且它不预测"损到某处会变差"——而奥卡姆之丘正是这样一条曲线。

16.5 「少即是多」与极简主义

分离线:这一族主张少本身是好的;本文主张少是交付完成的结果,而不是目标本文预测:以"更少"为直接目标的削减会系统性地伤及未交付项,因为它按数量而非按交付度来选。这一条可检验,且它是本文与整个极简一族最干净的分界。

16.6 正则化

分离线:正则化是训练过程中同时进行的压制,本文是分层的、事后的移除,且要求被移除者先在场并起作用。

16.7 彩票假说

分离线:它主张"大网络里本来就含有好的小网络";本文主张"大是小变好的条件"。 而这门学科自己已经把本文这一侧写出来了——中奖子网离不开事先的稠密训练。本文与它不是竞争,而是把它的一个副产品立为主张。

16.8 王弼与苏辙

见第十四节。与王弼在这一章上正面对立(终点是虚无 vs 终点是功能齐备而无冗余),与苏辙的分界在二阶的对象与"损不掉"这一格。

16.9 神秀与慧能之争

「时时勤拂拭」对「本来无一物」——这是"损"在中文思想史上最著名的一场争论,且它正好对应两个端点:一个主张持续减,一个主张根本无可减。

分离线:那场争论的焦点是要不要有减这个动作;本文的焦点是减的对象是怎样变成可减的本文对渐顿不表态,但本文的框架有一个推论:若"可减"依赖交付、而交付需要时间,则纯顿不可能——没有哪一层能跳过在场的那一段。这是本文对一场旧争论的可检验推论,也是本文必须承担的风险。

16.10 作者本人及本刊既发研究

见第 2.3 节。五篇的对象与读数互不通约,且不得互相引用为证据。

十六之二 · 本文最可能的失败方式

一个诚实的论文应当说明自己最可能怎样被推翻。本文认为最可能的失败方式有三种,按可能性排列。

第一种,也是最可能的:δ 被证明只是"冗余度"的一个昂贵别名。 若有人证明——在所有可测系统中,"移除后可重新平衡恢复"与"该部分在信息意义上冗余"是同一件事,那么本文的构念应当被并入冗余理论,而 δ 只是测冗余的一种慢方法。

本文对此的抵抗只有一条,且它来自第七节的第一件材料:被压木在早期不冗余——移除它们会使干形变差。冗余度是一个当下的量,而交付是一个历史过程。 若这条抵抗不成立,本文即应被降级。

第二种:平衡期敏感性使构念不可操作。 第 19.5 节已经把这个风险摆出来了。若在多个领域的实测中都找不到平台段(δ 随平衡期一直缓升而不收敛),那么"已交付"就不是一个可判定的状态,而只是一个关于"给多长时间"的约定。本文认为这是最严重的一种失败,因为它不推翻构念,而是使构念失去边界

第三种:本文所说的两层(交付需要时间、承重项不可交付)在真实系统里不可分。 本文用剪枝把两层分开了(90% 可恢复、98% 不可恢复),但那是一个人工系统。在自然与社会系统里,"还没交付完"与"永远交付不了"可能没有清晰的分界,而只是一条连续变化的恢复概率。若如此,第十节的 2×2 就该改成一个连续场,而本文的四格划分是过度离散化。

本文承认第三种在直觉上很可能是对的,并把这一处作为后续工作的首要方向。

十七 · 第二层共有前提

从上节各位近邻的结构性盲区取交集:消融——只问即时依赖;脚手架——外来物;突触修剪——按使用频率;MDL——按描述长度;极简主义——少本身是好的;正则化——同时压制;彩票假说——好子网本来就在;王弼——终点是虚无;苏辙——什么都可以被忘。

交集是一条:

一个部分的价值,可以在移除它的那一刻被判定。

也就是说:整个相关传统共同默认,"它有多重要"是一个当下可测的量。无论用性能下降、使用频率、描述长度还是修养程度来测,都默认答案在移除的那一刻就已经确定。

本文的全部工作是对这一条的否定:一个部分的价值只有在移除之后、系统重新平衡完毕时才显现,而这段时间没有自然的长度。

而第 9.2 节的敏感性表明,这个否定的代价是严重的:如果价值只有在重平衡之后才显现,而重平衡该多久没有客观标准,那么"它有多重要"这个问题就不再有唯一答案。 本文承认这是一个不受欢迎的结论。

十八 · 三家反过来给本文加的约束

18.1 机器学习:削掉「损使系统更好」

本文原本要写的更强的话:损不但无害,而且有益(奥卡姆之丘的左升段)。

削它的材料:第十九节的实测——七个稀疏度下,δ 从未越过 1。在这个规模的模型与数据上,没有观察到"剪了反而更好"。

削掉之后:本文只能主张"损到某个界线之内不使系统变差"。这弱了一档,但仍然反直觉——能删掉九成而毫发无损,与"该部分有用"的现场证据完全冲突。

18.2 林学:削掉「最优点存在且可求」

本文原本要写的更强的话:每个系统都有一个可求的最优移除比例。

削它的材料:自疏法则的学科史——一条曾被称为"唯一定律"的关系,因缺乏普遍性与支撑理论而被降格为"规则",斜率至今有争。

削掉之后:本文不能给出任何普遍的比例。"损到多少"在每个系统里都要重测,且可能没有稳定答案。

18.3 材料学:削掉「该减的与该留的可以事先分类」

本文原本要写的更强的话:已交付项与承重项是两类不同的东西。

削它的材料:喷丸与退火——该减的与该留的在同一个物理量里,靠符号与位置区分,不靠种类。

削掉之后已交付项不是一个种类,是一个状态。同一个部分在不同时刻分属不同格;而"它现在在哪一格"只能测,不能推。

18.4 一处本文自己发现的、尚未解决的内部张力

三处让步之外,本文在写作中发现了一处自身的张力,此处如实列出。

张力:本文主张"损不能快于交付",因而减法有速率上限。但本文同时主张(第 19.4 节)浅损无效——要损得有意义得先损到相当深度。 这两条合起来产生一个实际困难:如果每次只能损掉刚交付完的一薄层,而薄层的损又无效,那么正确的做法究竟是什么?

可能的调和是:"每次损一薄层"与"损到相当深度"分属两个尺度——单次移除的比例受交付速率限制,而累积的移除深度必须足够。也就是"多次少量"而非"一次大量"。这与「损之又损」的字面结构恰好一致,因而它在文本上是自洽的。

但本文没有数据支持这个调和。 第十九节的实验是一次性剪到目标稀疏度,不是迭代式的多次少量剪枝;而该领域的既有经验恰恰认为迭代剪枝优于一次性剪枝。若迭代剪枝确实优于一次性,本文的调和就得到支持;若不然,这两条主张之间的张力就是真的。 本文未做这个对照实验,如实登记为未做。

十九 · 一次已执行的可复算实验

19.1 预注册(跑前写死)

数据与模型:公开内置手写数字数据集(1797 样本、64 特征、10 类),分层划分训练 70%/测试 30%,随机种子写死;多层感知机,隐层 128,最大迭代 600。基线测试准确率 acc₀,全部权重 9472 个。

处理:按权重绝对值做全局幅度剪枝,稀疏度取 {0.5, 0.7, 0.8, 0.9, 0.95, 0.98, 0.99}。

假设(阈值写死)

19.2 结果

基线准确率 0.9704。

稀疏度存活权重δ_A(消融口径)δ_B(本文口径)
0.5047360.99050.9885−0.0019
0.7028420.98280.9885+0.0057
0.8018950.95800.9905+0.0324
0.909480.82630.9905+0.1641
0.954740.50950.9542+0.4447
0.981900.20800.5458+0.3378
0.99950.12790.3053+0.1775

19.3 逐条判定

H4 成立,而且干净。 在 0.90 稀疏度处:δ_A = 0.826(消融判为损失约 17%、属关键),δ_B = 0.991(本文判为完全恢复、属已交付)。 两个口径对同一批权重给出相反判定。

三个独立随机种子全部复现,无一例外:δ_A ∈ [0.807, 0.853],δ_B ∈ [0.9905, 0.9981]。

H2 成立。 90% 的权重可被移除而系统完全恢复——在这个系统里,已交付项占权重总数的九成。

交付边界可定位。 δ_B 在 0.95 → 0.98 之间从 0.954 掉到 0.546。第十节 2×2 左上格与右上格的分界,在这个系统里落在 95% 与 98% 之间。

H1 的严格形式被推翻,而且两次。 其一,0.50 稀疏度处 δ_B 反而略低(−0.0019)——低稀疏度下再训练没有帮助。其二,差值非单调:峰值在 0.95,其后回落,因为到 0.98 以上连再训练也救不回来。本文原来的表述写得太满。

H3 被推翻。 七个稀疏度下 δ_B 最高 0.9905,从未越过 1。在此规模上没有观察到"剪枝后优于基线"。第 18.1 节的让步即由此而来。

19.4 低稀疏度那一格是新的

0.50 处的 δ_B < δ_A 是一个本文事先没有预料、三家里也没有一家提到的现象:在浅层的移除上,重新平衡不但无益,还略微有害。

这一格对文本读法有直接后果:它意味着"损"在早期没有收益——要损得有意义,得先损到相当深度。而这与「损之又损」的通行读法(每损一分即近道一分)不符。本文因此主张:「损之又损」中的"又"不是修辞上的强调,是必要条件——浅损无效。

19.5 一处致命敏感性(本文自己查出)

固定稀疏度 0.90,只改再训练轮数:

再平衡轮数125102050100200
δ_B0.8680.9140.9490.9700.9750.9810.9810.991

同一批权重,平衡期 1 轮判为未交付,200 轮判为已交付。 而这条曲线连续爬升,没有平台,也没有自然的截断点

后果是严厉的:任何"δ ≥ 阈值即判为已交付"的规则,都可以靠加长平衡期达成。δ 不是一个自足的读数,它是一个二元组(δ,平衡期)。 第 9.2 节与清点手册已据此写死报告要求。

本文不掩饰这一点是本文最大的弱点。 它意味着第十节的 2×2 在实践中的分界是可以被操纵的,而本文给不出客观的平衡期标准——第五之二节已指出,三家的平衡期在量级上相差好几个数量级,本文没有共同的时间尺度可用。

19.6 三条必须写明的限制

其一,规模。本实验的模型与数据都很小,H3(剪枝后优于基线)在更大规模上是否出现,本实验无从判断。本文不主张 H3 在一般情况下为假,只报告它在本设置下未出现。

其二,单一领域。三家中只有机器学习一家可在本机上真做;林学与材料学的对应实验(间伐后若干生长季、退火后疲劳试验)本文未执行,其兑现全部停留在文献层面。

其三,剪枝准则单一。只用了全局幅度剪枝一种准则。不同准则下"哪些被判为可删"会不同,因而 δ 的分布也会不同,本文未做比较。

19.7 一条写死日期的赌注

至 2028 年 8 月 19 日,若有公开可复算的研究,在至少两个不同领域(例如林分间伐与临床撤机)按本文口径测得 δ 曲线,而其中"当下仍在出力且移除后可完全恢复"的部分占比不足 10%,则「已交付项普遍存在」这一主张判负。

什么不算命中一并写死:仅报告移除后的即时性能变化(消融口径)的研究,一律不算——本文已证明该口径与本文口径可给出相反判定;仅报终值 δ 而不报平衡期与曲线的研究,亦不算,理由见第 19.5 节。

二十 · 分层引用、自反检验与反噬预言

20.1 三层结构

本文的可信度主要落在第二、三层,以及第十九节 H4 那一条实测。

20.2 自反检验

本文自己就是一次"损"。 它把第四十八章的多种旧解——损私欲、损知见、反虚无、忘知——全部移除,只留一条结构性读法。

按本文自己的判据,这次移除是否正确,要看移除之后"重新平衡"能否恢复原有的解释力:本文能不能解释旧解能解释的一切?

答案是不能。 旧解能处理"该不该损"的规范问题,本文按第 2.4 节的自我限定不能。因此本文这一次损的 δ 显著小于 1——本文移除的不只是已交付项,还包括了一部分承重项。

这不是谦辞。 按第十节的 2×2,本文自己落在右上格:移除了、而恢复不了。 一个提出"未交付的损不掉"的人,自己做了一次损不掉的损。本文如实记下这一点,并认为读者据此下调本文的可信度是合理的。

20.3 反噬预言

本命题一旦被采用,最省事的落地方式是"凡是删掉能恢复的都删掉"。这会以两步毁掉它。

第一步,重新平衡需要时间与代价,而急于验证的体系会缩短平衡期。由第 19.5 节,缩短平衡期会把已交付项误判为承重项(保留了不该保留的);而为了通过验收而延长平衡期,又会把承重项误判为已交付项(删掉了不该删的)。两个方向的错都会发生,且方向取决于验收压力的方向。

第二步,"我们做过 δ 测试"成为一个可勾选的合规项;而一个缩短了平衡期的 δ 测试,与消融实验没有任何区别——本文最要紧的那处分野在落地时最先被抹掉。

我看不到出口。 δ 的有效性完全依赖平衡期的长度,而平衡期该多长本文给不出判据:林学是若干生长季,网络是若干轮再训练,组织是几个周期?没有共同的时间尺度,而任何被规定下来的时长都会立刻成为被优化的对象。

20.4 关于两条被推翻假设的可信度声明

本文的实验里有两条预注册假设被推翻(H1 的严格形式、H3),另有一处致命敏感性由本文自己查出。按通行的出版激励,最省事的处理是把 H1 改写成"在中高稀疏度下成立",把 H3 悄悄删去,并把平衡期敏感性放进附录。本文三者都没有做。

理由是结构性的:按本文第 11.2 条签名,已交付项之所以难以被发现,正是因为它的代价不在本期显现。 一篇论证"延后的代价不会自己出现"的文章,如果自己把不利结果延后到附录,它在方法上就成了它所描述的那种体系。

因此本文的可信度应当被这样评估:

本文不主张自己已被证实。本文主张的是:它已经把自己被推翻的方式、以及自己被绕过的方式,都写清楚了。

二十一 · 结论

本文论证:《道德经》第四十八章「为道日损」的对象,既不是多余的东西,也不是有害的东西,更不是欲望与知见,而是已经把自身作用转成系统结构性条件、因而其本体的继续持有已无必要的那一部分——本文称之为已交付项。「损之又损」之所以收敛而不至于空,有两层原因:每一轮只能损掉上一轮刚交付完的那一层,而交付需要时间;且有一部分(承重项)永远不会交付。「以至于无为」因此不是零,是所有可交付的都已交付完毕的状态;「无为而无不为」不是悖论,是"作用全在、持有全无"。

本文给出读数接续保持率 δ,其与消融实验的分野在于"允许系统重新平衡"这一步。一次预注册的可复算实验在四条假设上给出如下结果:核心分野(H4)成立且三种子复现——90% 稀疏度下消融判为关键(δ_A = 0.826)而本文判为已交付(δ_B = 0.991);已交付项的存在(H2)成立,占权重九成,交付边界落在 95% 与 98% 之间;而 H1 的严格形式与 H3 被推翻——低稀疏度下重平衡无益,且从未观察到"剪枝后优于基线"。

本文最重要的一个负面发现由本文自己查出:δ 强烈依赖平衡期长度,同一批权重在 1 轮与 200 轮下得到相反判定,而曲线连续爬升、无平台、无自然截断点。δ 因此不是一个自足的读数,而是一个二元组;单独的 δ 值无意义。

本文最后交出三个自己解不了的洞。其一,时间尺度:三家的重平衡机制相差数个数量级,本文没有共同的平衡期标准,而这直接决定了 δ 的判定。其二,规范:该不该移除,本文因自我限定而无力处理,而这恰恰是历代注解全部落脚的地方。其三,自反:本文自己这一次损的 δ 显著小于 1——本文移除了一部分它并不能接住的东西,而这按本文自己的判据即是"损早了"。

本章文献

1. Reineke, L. H. (1933). Perfecting a stand-density index for even-aged forests. Journal of Agricultural Research, 46(7), 627–638.

2. Yoda, K., Kira, T., Ogawa, H., & Hozumi, K. (1963). Self-thinning in overcrowded pure stands under cultivated and natural conditions. Journal of Biology, Osaka City University, 14, 107–129.

3. Hutchings, M. J. (1983). Ecology's law in search of a theory. New Scientist, 98, 765–767.

4. Weller, D. E. (1987). A reevaluation of the −3/2 power rule of plant self-thinning. Ecological Monographs, 57(1), 23–43.

5. Zeide, B. (1987). Analysis of the 3/2 power law of self-thinning. Forest Science, 33(2), 517–537.

6. Lonsdale, W. M. (1990). The self-thinning rule: dead or alive? Ecology, 71(4), 1373–1388.

7. LeCun, Y., Denker, J. S., & Solla, S. A. (1989). Optimal brain damage. Advances in Neural Information Processing Systems, 2, 598–605.

8. Tibshirani, R. (1996). Regression shrinkage and selection via the lasso. Journal of the Royal Statistical Society B, 58(1), 267–288.

9. Frankle, J., & Carbin, M. (2019). The lottery ticket hypothesis: Finding sparse, trainable neural networks. ICLR 2019.

10. Liu, Z., Sun, M., Zhou, T., Huang, G., & Darrell, T. (2019). Rethinking the value of network pruning. ICLR 2019.

11. Rissanen, J. (1978). Modeling by shortest data description. Automatica, 14(5), 465–471.

12. Rasmussen, C. E., & Ghahramani, Z. (2001). Occam's razor. Advances in Neural Information Processing Systems, 13.

13. Wood, D., Bruner, J. S., & Ross, G. (1976). The role of tutoring in problem solving. Journal of Child Psychology and Psychiatry, 17(2), 89–100.

14. Totten, G. E. (Ed.) (2006). Steel Heat Treatment: Metallurgy and Technologies (2nd ed.). Boca Raton: CRC Press.

15. 王弼:《老子道德经注》第四十八章,载楼宇烈《王弼集校释》,北京:中华书局,1980 年。

16. 苏辙:《老子解》,载《苏辙集》,北京:中华书局,1990 年。

17. 河上公:《老子道德经河上公章句》,王卡点校,北京:中华书局,1993 年。

18. 楼宇烈:《王弼集校释》,北京:中华书局,1980 年。

数据可得性声明 第十九节的实验使用公开内置数据集与公开机器学习库,全部随机种子、划分方式、网络结构、剪枝准则与再训练轮数均在正文写明,且预注册文本(含四条假设与全部阈值)在运行之前写定并存档。任何人可用同一参数复算。三个独立随机种子的结果与平衡期敏感性曲线均已完整报告,不利结果(H1 严格形式与 H3 被推翻)无一省略。

与同批论文的关系声明 本文与同批前四篇为同一产线的五次独立产出,问题类型与构念互不通约。五文不得互相引用为对方的证据。

利益冲突声明 无。

附录 · 五篇的位置关系与「德」的接口

问题类型构念对象的性质读数
第一篇是什么落项被放弃而仍在场落项量
第二篇是什么未入册者从未进入判定封册率
第三篇为什么待征位读数低而无人看低位命中率
第四篇怎么办滞改带完全可见而动不了滞改比
本文怎么办已交付项完全可见、仍在出力、而应当被移除接续保持率

前四篇处理的都是"账上没有的东西";本文第一次处理的是"账上有、而且应当被划掉的东西"。

「德」的接口:本产线前一篇曾指出,「德」可能正是用来命名"真无为与被追认的无为"这一分别的那个词。本文给出了第二条线索:若「无为」是"所有作用都已交付、无一处需要被持有"的状态,那么「德」很可能是那个"接住"的能力本身——不是被交付的作用,也不是交付的过程,而是系统据以承接的那样东西

已知的最大风险:这条线索极易滑向"德即容量"或"德即结构"这类过于顺滑的表述,而容量与结构都是标量或静态物,无法区分第十节的四格后续工作若产出一个标量,即应视为失败信号——这与前一篇给出的风险警告是同一条。


← 第五章 必朽中介——为什么必经一第四编 记与量 →