‹ 胡敏 · 全部作品
📖 长文阅读🔗 中介频道
学员专栏 · 胡敏 · 中介 · 悖论

往据

一个判断所缺的那一项,本次观测在原理上不携带——可自备阈在上升,而每个人的积累在下降
作者 胡敏 · SDE 学员 · 约 1.9 万字 · 发表于2026年8月11日
SDE 创新智商 142

五维 S145 D144 E143 I128 F149,加权 S×.20+D×.25+E×.20+I×.20+F×.15。本文为投稿原稿全文盲评,正文一字未经编辑改动,故此数为认证分。参照语料=晶体学 × 保险精算 × 信用征信 及各自领域近二十年文献,中英文,并计入站内自撞;评分截至 2026 年 8 月。(评分:Claude · 2026年8月11日)

摘 要

同一个读数已经被问过两次:撮合、匹配、结算的单位成本每下一个台阶,处在两端之间的那个环节反而更难被撤换。前两次的落点一个在起点,一个在终点。本文换第三个落点,落在判断的原料上。任何一次判断都由两类依据构成:一类来自本次可观测到的东西,另一类来自已经完成的别的事。后一类不是"更多信息",而是本次观测在原理上不携带的那一类信息——本文称之为往据。交易成本下降同时做两件方向相反的事:它使可观测量变细,因而把这些量变成一个判断所需要的往据量上升;它又使参与者变多,因而每个参与者自己能积累到的已完成事件在总量中的份额下降。两条曲线一升一降,中间张开的缺口就是中介的位置。本文给出一个可以事后算出来的阈值——可自备阈 n*,即独立作出该类判断所需的最少已完成事件数——并用它取代比率式读数。判据一句,不含程度词:这一次判断用到的依据里,有哪几条来自本次以外已经完成的事;这些事在谁手里。本文对公开的软件包发布记录做了一次预注册检验(141 个参与者,19,643 件已完成事件,四条假设):可自备阈为 1,850 件,而单个参与者的累计中位数为 79 件,缺口 23.4 倍,141 个参与者中只有 2 个跨过阈值,而那 2 个属于同一个持有者。其中一条假设被判伪且方向相反,该结果已写入正文并据以改写了本文关于阈值来源的主张。

关键词:往据;可自备阈;判断原料;相位问题;经验积累的份额

一、第三个问法

现象不必重述。本栏已经就它问过两次,两次的落点不同:一次问各方的账从谁那里算起,一次问一次放行查到哪里为止。两次的答案各自成立,而两次都留下同一块没有覆盖的地方——它们讲的都是记账与放行的规则,讲的不是判断的原料

在两端各自都能看到全部可观测信息、也不需要跨方记账、也没有放行时限的场合,中介照样在。买一件二手物品,卖家的照片、检测报告、历史成交价、物流轨迹全都摆在眼前,双方没有旧账要衔接,也没有必须在几分钟内放行的压力,而绝大多数人仍然通过平台成交,并且愿意为此付费。这里既没有起算处的问题,也没有止查线的问题,中介的地位却一分未减。

这说明还有第三条来路。

第三条来路藏在一件更靠前的事情里:把看到的东西变成一个判断,需要的原料不止是看到的东西。

拿最朴素的例子。你看到一件商品的全部参数、全部照片、全部检测数据。现在要判断"这个价格值不值"。你需要的那一项——"同类东西通常卖多少、卖出去以后通常出什么问题"——不在你看到的任何一样东西里面。它不是你看得不够细,也不是数据不够全;它在原理上不由这一次观测携带,因为它讲的是别的、已经完成的事

这一类依据,本文称之为往据

往据有一个刺眼的性质:它的获取成本不随观测成本下降而下降。观测成本下降的是"看这一次"的成本;往据的成本是"经历过很多次"的成本,而这件事只能靠时间与件数积累,不能靠技术加速。更麻烦的是,交易成本下降还同时干了第二件事——它让参与的人变多,于是每个人分到的件数变少。

一头是往据的需求在涨,一头是个体的积累在跌。中介的位置就在这两条曲线中间张开的那个缺口里。

本文选三个与商业毫无关系的领域来撞这件事,选它们的理由是三本账互不可译:一个算的是一堆衍射斑点能不能拼出一个分子的结构,一个算的是一个人学一门外语学到哪一步就不再前进,一个算的是一个人受了多少照射还算安全。三者的失败分别是解不出与定错相、化石化、超剂量与失控。而这三本账在同一处各留了一件同形的东西:它们各自最要紧的那一项,都不由本次的测量给出,而是从别的、已经完成的事情里借来的。

二、三家:三条互不相容的单因主张

2.1 晶体学:解得出解不出,只由相位决定

晶体学的主张可以写成一句判断:一个结构解得出解不出,只由相位决定,与衍射数据的质量和数量无关。

这不是修辞,是这门学问的地基。晶体衍射实验记录的是每个衍射点的强度;而要把这些强度反变换回电子密度,需要每个点的相位。相位在测量过程中丢失——不是精度不够丢的,是这种测量方式根本不携带这项信息。数据收得再完整、信噪比再高、分辨率再好,缺了相位,什么也解不出来。

这条主张有一个刺眼的推论:做更多、更好的同一种测量,对解决这个问题的贡献恒为零。

它的动力式:实测的衍射强度与从强度到结构的解析路径长期不容,于是解析赖以成立的条件场改变——外部的已知结构库、重原子衍生物、反常散射源。这一改变回过头去改了什么算"可解的晶体",也改了解析路径本身。下一轮先动的,是结构数据库的覆盖面。

它自曝的那一处,是核心工艺而不是边角案例:分子置换。今天绝大多数结构的相位不是从本次实验里得到的,而是拿一个别人已经解完的同源结构当模型,把它的相位借过来做起点。同源性够高就成,不够高就失败。这个动作有一个直白的名字——用别人的答案当自己的起点。拿掉分子置换与重原子法,晶体学交不出它的标准产品。

2.2 二语习得:前进只由可理解输入决定

二语习得研究里有一条著名的单因主张:学习者往前走一步,只由略高于当前水平的可理解输入决定;有意识的学习、练习、纠错都不决定。它把语法教学、机械操练、错误纠正统统判为不产生习得的东西。

这条主张四十年来被反复批评,而它的价值恰恰在于它不肯让步:它不说"输入是其中一个因素",它说输入是唯一的那个。

它的动力式:教学的路径组织与学习者所处的语言输入条件场长期不容,于是学习者实际说出来的那套语言——研究上称为中介语——改变。这一改变回写输入的可理解程度,也回写教学的安排。下一轮先动的,是学习者当前所处的发展阶段。

它自曝的那一处叫化石化:输入充足、动机充足、暴露时间以年计,而学习者停在某一处不再变化,并且这一处因人而异、事前不可预测。研究共同体为它专门发展了对策——形式聚焦、纠正性反馈、注意假说——而不是把它当作例外放过。一门主张"输入决定一切"的学问,自己承认存在一大类输入决定不了的情形,并且为它专设了一整套工艺。

对本文而言,化石化的意义在另一处:它证明积累不是单调的。再多的件数不保证再前进一步。这一条后面会反过来削本文(第十五节)。

2.3 辐射防护:受照的后果只由剂量决定

辐射防护的主张最硬也最不像经济学:一次受照的后果只由剂量决定,与照射来源、用途、当事人是谁、是否自愿无关。同样的剂量,来自医疗还是来自事故,后果一样;因此防护体系围绕一个统一的量建立起来,而不是围绕情境。

这条主张支撑起整套限值、分区与最优化的制度:控制区与监督区、职业与公众的不同限值、把剂量压到合理可行的尽量低。

它的动力式:已经显露的剂量与健康结局,与可得的流行病学证据、公众可接受度这一条件场长期不容,于是防护的组织路径改变——限值被修订、分区被重划、最优化的口径被改写。这一改变回写何为"受照",也回写证据的需求。下一轮先动的,是限值文本。

它自曝的那一处,是本文全部材料里量级最大的一件:低剂量区没有直接证据。整套体系所依赖的剂量与风险的关系,主要来自一次不可重复的历史事件的长期随访队列;而防护实务中最常遇到的低剂量区间,该队列本身给不出可分辨的信号,只能从高剂量区外推。这一外推所用的假定被写成明文,成为全世界防护标准的共同基础。拿掉这一条外推,辐射防护交不出剂量限值。

请注意它与前两家的差别:晶体学从别的结构里借,二语习得承认借不来(化石化处无从借),辐射防护从一次别的、无法重演的历史事件里借,而且是全世界一起借同一份。

2.4 三家为什么不能相安无事

三条主张不能同时为真。晶体学把决定权交给一项在本次测量中确实丢失、而可以从别处补入的东西。二语习得把决定权交给一项只能在本人身上、由时间供给的东西——它明确否认可以从别人那里搬运。辐射防护又不同,它把决定权交给一个统一的量,并主张这个量在任何情境下含义相同,因而借来的证据可以直接用在从未被观测的情境上。

一句话概括三者的不相容:判断所缺的那一项,究竟可以从别处补入、只能自己长出来、还是可以跨情境直接搬用。三家各执一端,谁也说服不了谁;而它们在争执之下,踩在同一块地上。

2.5 三家的核心判断句与出处

领域核心判断句(可引到原文)奠基文献近期权威汇编它自曝的那一处
晶体学衍射实验只记录强度,相位在测量中丢失,必须另行获得Patterson 1934(帕特森函数);Perutz 等 1954(同晶置换定相)Rossmann & Blow 1962(分子置换);Taylor 2003 相位问题综述分子置换:拿别人已解出的同源结构当相位起点
二语习得习得只由略高于当前水平的可理解输入产生Selinker 1972《中介语》;Krashen 1985《输入假说》Long 1996 互动假说;Ortega 2009《二语习得导论》化石化:输入充足而停滞,且停在哪里事前不可测
辐射防护防护体系以有效剂量为统一量,与来源与用途无关ICRP 第 26 号出版物(1977);ICRP 第 103 号出版物(2007)UNSCEAR 各期报告;寿命期研究队列的历次随访低剂量区无直接证据,由高剂量外推,外推假定写成明文

三家都主张"只有我这条是决定性的",没有一家说"这是其中一个因素"。这是本文选它们的理由,也是它们无法调停的原因。

三、三家共同假定了什么

把三家的争执写成同一个句式:三家争的是"一个判断所缺的那一项,该从哪里来"。晶体学说从别处补入,二语习得说只能自己长,辐射防护说可以跨情境搬用。

争执之下的共同假定,不在"从哪里来"那一层,而在更靠底的一层:

积累是单调的:一个判断者手上已经完成的事件越多,他越接近自足。

换到本题:只要看得够多、经历得够多,两端迟早可以自己判断,第三方迟早多余。驱动方向被当作给定的——从积累指向自足,单向,且没有上界。

三家都没有把这句话说出口,因为在各自的账上它显然到不必说。晶体学的结构数据库逐年增大,可用作模型的同源结构越来越多,能靠分子置换解出的比例逐年上升。二语习得研究的全部干预设计都建立在"多给一点、多待一阵"的逻辑上。辐射防护的队列随访每十年更新一次,样本随时间累积,置信区间逐次收窄。三本账都在同一个方向上运转:件数增加,判断变准。

念给三家听,三家都会说这还用说吗。这正是共有前提的验收标准。

这条假定同时支撑着本题上的通行预期:技术进步使每个人都能看到、记录、检索更多事件,个人的经验库在膨胀,于是那个靠"见得多"吃饭的中间人迟早失去理由。推理链只有两步,两步都对——只要第一步里的"接近自足"确实只由自己的件数决定。

本文要顶翻的就是这一步。顶翻它需要指出:自足与否是两个量的比较,而另一个量也在动,而且动得更快。

四、顶翻它的那件材料,来自晶体学自己

顶翻共同假定的材料不能从外面搬。它必须是三家之一自己已经掌握、已经写进教科书、只是从来不往这个方向用的事实。

这件材料是相位问题及其常规解法

它在晶体学自己的领域里回答的是另一个问题——"怎么把强度变成结构",不是"谁的地位强"。但把它的结构剥出来,它说的正是:

有一类东西,做更多同一种观测对它的贡献恒为零;它只能从已经完成的别的事情里取来。

这一点值得停一停,因为它比"信息不足"要硬得多。信息不足是量的问题,加大投入可以解决;相位丢失是这种测量方式的性质——你把探测器换成十倍灵敏、把曝光时间延长一百倍、把数据收满整个倒易空间,相位仍然一个也不会出现。

而常规解法把这一点摆得更明白。今天绝大多数结构靠分子置换定相:从公共数据库里取一个与待解分子同源的、别人已经解完的结构,把它的相位当作起点。这个动作的三层含义值得逐条读:

第一,判断的原料里有一项来自别人已完成的工作,而不是来自本次实验。第二,它的可得性取决于数据库里有没有足够同源的东西——同源性不足,这条路直接断掉。第三,数据库的覆盖面不是任何一个实验者能靠自己努力改变的,它是几十年里成千上万次已完成实验的沉淀。

于是共同假定被自己领域的常规工艺顶翻:

自足与否,不由自己积累了多少决定,而由"所需的那一项"与"自己手里有的那一部分"之间的差决定;而所需的那一项,会随所问问题的细度而上升。

问一个粗问题——这是不是蛋白质——几乎不需要往据。问一个细问题——这个侧链在哪个构象——需要的往据陡增。而观测能力提高之后,人们问的正是更细的问题。

顺手可以看到另外两家的同形处:二语习得承认某些位置上再多的自我积累也无用(化石化),辐射防护则把整个学科的核心判据挂在一次不可重演的历史事件上。三处同形,说明这不是晶体学的怪癖,是一类东西。

五、往据:定义与四条限定

把这一类东西命名为往据

往据:一个判断成立所必需、而本次全部可观测量在原理上不携带、必须从已经完成的别的事情里取来的依据。

四条限定,缺一条就不是往据,只是信息不足:

限定一,它不是"更多观测",是"另一类观测"。判别方法只有一句:把本次观测做到这一门技术的极限,它会不会出现?会出现,那是信息不足,加大投入即可;不会出现,才是往据。价格、参数、检测报告做到极限也不会告诉你"同类东西通常出什么问题",因为那句话讲的是别的事。

限定二,它来自已经完成的事,不是同时进行的事。已完成意味着有结局——卖出去之后怎么样了、用了三年之后坏在哪里、这个结构最终被验证是对的。同时进行的事只能提供更多的当下观测,提供不了结局。往据的供给速度由结局出现的速度决定,而结局的速度不因技术加速。

限定三,它的持有者与它的生产者常常不是同一人。产生往据的是那些已经完成过交易、已经解过结构、已经受过照射的人;他们生产它是别的目的的副产品。持有它的是把这些副产品收集起来的那个位置。这一分离是中介得以存在的结构条件,不是它的过错。

限定四,它可以被自备,只要判断者自己积累的已完成事件足够多。这一条极要紧——本文不主张往据不可自产,只主张自产有一个门槛,而门槛与积累是两条各自会动的曲线。第六节整节讲这一条。

需要挡住两种误读。

其一,往据不是"经验"的另一个说法。经验是一个人身上的状态,往据是一份可以被持有、被调取、被拒绝提供的东西;一个从业三十年的老师傅的经验不构成往据,直到它被写成可调取的形式。

其二,往据也不是"数据"的另一个说法。可观测量也是数据,而它不是往据;分界不在形式,在它讲的是不是本次以外已经完成的事

还需要与本栏前两篇分开。前两篇管的是规则——从哪儿算起、查到哪里为止;本文管的是原料。一次判断可以同时受三者约束,三者由不同的人持有。第十四节给出判定形式。

5.5 往据的四种来源,以及各自的供给速度

往据不是一样东西,它有四种来源,四种的供给速度差别极大。分清楚它们,第六节的阈值才有意义。

第一种,本人的历史。判断者自己经历过的已完成事件。供给速度等于他自己的成交频次乘以结局出现的速度,两者都不可加速。这是唯一完全自主的一种,也是最慢的一种。

第二种,同行的共享。同类判断者互相交换各自的历史。供给速度取决于共享意愿,而共享意愿在竞争者之间天然为负——把自己的结局给对手,等于替对手把阈值跨过去。因此这一种在竞争性行业里长期不足,在受管制行业里靠强制才有(保险的行业经验表、银行的征信报送都是强制的)。

第三种,专营的收集者。一个位置把所有人的结局收集起来,再有条件地提供。供给速度最快,因为它同时接入所有参与者。本文所说的中介,绝大多数落在这一格。

第四种,一次性的公共事件。一次不可重复的历史事件的长期随访,全世界共用同一份。供给速度为零——它不再产生新的,只会随时间越来越旧。辐射防护的那份队列是最典型的一例;这一种的特殊在于,没有任何人可以通过投入去增加它

四种的分布决定了一个场的形态。若第一种就够用,中介只做撮合;若必须靠第三种,中介就同时是判断的原料供应商。而技术进步对四种的作用是不均匀的:它加快第三种的收集与调取,几乎不动第一种和第四种。它加快的恰恰是最不属于个体的那一种。

六、可自备阈:一条会自己往上走的线

把第五节的限定四写成一条曲线。

横轴是判断者手上已经完成的事件件数 n。纵轴是他独立作出该类判断所能达到的精度。曲线的形状是稳定的:在某个件数之前几乎贴着地面,越过之后陡然上升,再往后趋于平缓。贴地的那一段不是"差一点",是"完全做不了"——件数太少时,估计量的波动比要判断的差别本身还大,判断的结果与掷硬币没有区别。

把"达到所要求的精度"所需的最小件数记作 n*,称为可自备阈

这个阈值有三条性质,逐条都与本题直接相关。

性质一,n* 由问题的细度决定,不由数据的多少决定。问"这批货大概什么价位"与问"这一件比同类高出百分之十值不值",是两个问题,后者的 n* 高出一个量级。而技术进步的直接后果,是人们开始问后一个问题。当每一件商品的参数、每一次成交的价格、每一条物流轨迹都摆在眼前时,"大概什么价位"这个粗问题自动作废——它已经不需要判断了,直接看就有。剩下要判断的,全是细问题。

性质二,n* 与参与者的多少无关,而个体的积累与参与者的多少直接相关。一个市场的总件数固定时,参与者从一百人增加到一万人,每人平均分到的件数变成百分之一。而技术进步最确定的后果,就是参与者变多。

性质三,越过阈值的人,其优势不是连续的,是断崖式的。曲线在阈值附近陡升,意味着"差一点"与"刚够"之间的差别,远大于"刚够"与"多得多"之间的差别。因此一个市场里能自备往据的位置,通常只有极少数几个,而不是按规模连续分布。第九节的实测给出了这条性质的一个直接读数。

三条性质合起来,给出本文的核心机制。

6.5 三种"不够",只有一种是本文的对象

"依据不够"这句话在日常里指三件不同的事,混在一起就无法清点。

第一种,看得不够。本次观测做得不细、不全。判别:把观测做到本技术的极限,问题消失。改进办法是加大投入。

第二种,件数不够。已完成事件的件数低于阈值。判别:观测已到极限而估计量的波动仍大于要判断的差别。改进办法只有一条——等,或者去借。

第三种,问错了。判断任务本身写得不可估(这一件"好不好")。判别:写不出被估量与精度要求。改进办法是改写任务,而不是加数据。

三种里,第一种随技术自动消失,第三种靠改写问题解决。只有第二种既不随技术消失,又不能靠改写绕开——因为改写问题会把精度要求降下来,而降下来的代价落在被判断的一方身上(第十八节的反噬预言正是这一条的制度化形式)。本文只处理第二种。

需要留意第一种向第二种的转化:同一句"不够",昨天指的是看得不够,今天指的是件数不够,而说话的人往往没有察觉。转化发生在观测能力越过某一点的那一天,不产生任何事件。这正是第十二节第三段所说的"阈值跳升",也是它最难被认定的原因。

七、剪刀差:两条曲线为什么必然反向

交易成本每降低一次,两件事同时发生,而这两件事对"能不能自备往据"的作用方向相反。

第一件,可观测量变细,因而 n* 上升。上一段已经说清:粗问题被观测直接回答掉了,留下来需要判断的都是细问题,而细问题的阈值高。这一条有一个反直觉的形式——信息越透明,独立作出判断所需的历史件数越多,因为透明消灭的是那些不需要历史件数就能回答的问题。

第二件,参与者变多,因而个体的 n 下降。准入成本下降的直接后果是参与者增加。总件数即使同比增长,单个参与者分到的份额仍然下降,因为总件数的增长来自参与者数量的增长,而每个参与者的单人频次并不随之提高——一个人一年买几次东西,不因平台便宜而变成几百次。

两条曲线一升一降,中间张开一个缺口。缺口不是任何人造成的,它是这两件事的算术后果。而缺口一旦存在,就必须由某个已经跨过阈值的位置来填——那个位置就是中介。

这条机制解释了本题现象里最难解释的那一部分:为什么被削掉的中介总是被另一个更大的中介取代。因为缺口不会被消灭,只会被移交;而能接手的位置必须自己跨过 n*,这就注定了接手者比被取代者更大、更集中。去中介化的每一次成功,都在制造一个门槛更高的位置。

它也解释了为什么"信息公开"这一处方长期无效。公开的是可观测量,而缺口在往据一侧;公开可观测量甚至会把缺口拉得更大,因为它把粗问题消灭掉,逼所有人去问细问题。

需要立刻声明一处边界:本节讲的是两条曲线的方向,不是它们的斜率。方向是可以论证的,斜率必须实测。第九节测的正是斜率的一个片段,而实测结果修正了本节原本要写的一句更强的话。

八、读数与清点手册

本文的读数不是比率,也不是清单,是一个阈值——一个可以事后算出来的件数。

可自备阈 n*:在给定的判断任务与给定的精度要求下,一个判断者独立作出该判断所需的最少已完成事件件数。

缺口倍数:n* 除以该场中位参与者已积累的件数 n̄。

用件数而不用比率,理由是具体的:比率会把"离得有多远"抹成一个介于零与一之间的数,而本文关心的正是量级——差三成与差二十倍,是完全不同的两件事,而比率会把它们压到同一个区间里去。

8.1 清点手册

读数名:可自备阈(主);缺口倍数(派生)。符号:n*。

定义(含 N 的取法):先写死三件——判断任务的表述、被估量、精度要求。然后在该场的全体已完成事件里,用自助重抽求出:使抽样估计的相对误差不超过所定精度的概率达到 0.90 所需的最小件数,即 n*。n̄ 取该场全部参与者各自累计件数的中位数。全文唯一阈值:缺口倍数 ≥ 5 判为不可自备。该阈值在正文、证伪条款与末节的赌注三处引用同一个数、同一份编码规则。

粒度:一件 = 一个有结局的已完成事件。边界例:一次交易在成交时不算完成,在退换期结束时才算完成;一次结构解析在提交数据库时不算完成,在被独立验证后才算完成。未出结局的事件不计入任何一侧——它既不进 n*,也不进 n̄。

编码规则(六条)

一、判断任务与精度要求必须在计算之前写死;事后调整精度等于没算。

二、n̄ 用中位数不用均值;该分布通常极偏,均值会被少数几个大户拉高。

三、参与者的边界须写明:同一持有者名下的多个账户合并计为一个参与者。

四、跨场比较时,两场的判断任务须在细度上可比;细度不可比的两个 n* 不得并列。

五、无法取得全体事件时,标记"跑不动",不得用抽样总体替代;一份含"跑不动"的读数仍有效,只是覆盖率下降。

六、计算者与该场的中介不得为同一方;无独立计算者的读数须标注"自报"。

表头:场名|判断任务|被估量|精度要求|总事件数|n*|n̄|缺口倍数|跨阈参与者数|计算者|自报与否。

不适用:一、判断任务无法写成一个可估的量时(价值判断、审美判断),n* 无定义;二、该场的事件不出结局,或结局不可观测时,两侧都无法计数;三、往据可由单次实验自产的场合(第十五节的第一处约束),阈值仍可算,但本文关于地位增强的主张不成立。

8.2 它与既有主要指标的关系

一个新读数最容易白造的死法,是与既有主要指标高度相关,于是被读成那个指标的代理。本文据此做了一次强制检验:举一个"既有指标最好看而这个数最难看"的真实例子。

举得出来。第九节的数据里,跨过阈值的只有两个参与者,而它们既不是最出名的,也不是被依赖最多的;而那些在任何流行度榜单上排在最前面的参与者,其累计件数远在阈值之下。n* 与 n̄ 读的都是"结局出现过多少次",与规模、收入、知名度、被依赖数都不共线——一个极受欢迎但发布节奏平稳的项目,累计的结局件数可以很少。

反过来的例子同样存在:一个几乎无人使用、而每天自动发布若干次的项目,可以在件数上遥遥领先。

九、一次真跑:公开发布记录上的预注册检验

9.1 选这份数据的理由

需要一件"全体已完成事件公开可见、且每个参与者各自的累计量也公开可见"的记录。软件包的发布记录满足这个条件:每一次发布是一件有时点的已完成事件,全体事件可以合并,也可以按参与者拆开。

它当然不是本题的商业场景。它的用处在别处:它给出可自备阈与个体积累之间缺口的一个真实量级,而这个量级此前只是修辞。

9.2 预注册(原文照录)

数据:141 个写死的包的全部版本发布时点。一次发布计为一件已完成事件,相邻两次发布的间隔(天)为该事件的读数。

判断任务:估计本场发布间隔的 90 分位数。精度要求:相对误差不超过 10%,达成概率 0.90。方法:自助重抽 2000 次,件数自 10 起递增。

变量:n* 如上定义;n̄ 为单个包的历史间隔件数的中位数。

四条假设与阈值:H1,n* ≥ 200;H2,n̄ ≤ n*/2;H3,把精度要求由 20% 收紧到 10%,n* 至少翻倍;H4,把被估量由 90 分位换成中位数,n* 下降至少一半。

参与者 141 个,合并后的已完成事件 19,643 件。

假设预设阈值实测判定
H1 阈值高n* ≥ 200n* = 1,850 件(真值 93.0 天)成立
H2 缺口存在n̄ ≤ n*/2n̄ = 79 件;缺口倍数 23.4成立
H3 细度推高阈值20%→10% 时 n* 至少翻倍550 → 1,850,3.4 倍成立
H4 稳健统计量降低阈值换中位数后 n* 降 ≥50%换中位数后 n* 超过 3,000 仍未达标,方向相反判伪

补充读数:141 个参与者中,累计件数越过 1,850 的只有 2 个,占 1.4%;越过 20% 精度所需的 550 件的,只有 3 个。而那 2 个跨阈参与者是同一个持有者名下的两个包。

9.4 两处不利结果,以及它们改了本文的什么

不利结果一:H4 判伪,而且方向完全相反。本文原本打算写下的话是"把问题问得稳健一些,阈值就会下降,因此参与者可以通过降低精度要求来自备"。实测是:把被估量从 90 分位换成中位数——一个通常被认为更稳健的统计量——所需件数不降反升,三千件以上仍未达标。

原因一查就明白,而且比原来的假设有用得多:本场发布间隔的中位数只有 6 天,而 90 分位是 93 天。相对误差 10% 落在 6 天上是正负零点六天,落在 93 天上是正负九天。在一个取值高度离散、大量间隔挤在个位数上的分布里,前者比后者难得多。

于是本文关于阈值来源的主张被改写:n* 不由统计量的稳健性决定,也不由数据量决定,而由所问的那个问题的粒度决定——被估量的绝对尺度越小、要求的相对精度越严,阈值越高。这一改写非但没有削弱第六节的性质一,反而把它说得更准:技术进步使可观测量变细,人们随之把问题问得更细,而问题一细,阈值就以非线性的方式往上跳。这是本次真跑最值钱的一处,而它来自一条被判伪的假设。

不利结果二:这份数据里,"参与者"与"往据的持有者"是同一类主体。每个包的作者既产生事件也持有事件,没有一个独立的第三方在收集它们。因此这份数据能测出缺口,测不出缺口被谁填上。本文的核心机制——缺口由跨阈的位置填补,并因此获得地位——在这份数据里无法检验,只能得到它的前半段。

这一条与本栏上一篇的情形相同,值得并排放着看:两次真跑都落在"持有者与受益者同一"的一格。这说明要检验本文这一类机制,需要的是持有者与使用者分离且两侧数据都公开的领域,而这样的领域本身就稀少——稀少的原因很可能正是本文所描述的那个机制。

9.5 这一跑能支持什么、不能支持什么

能支持的:在一个准入几乎为零、事件全部公开、任何人都可以自由取用的场里,独立作出一个并不苛刻的判断所需的件数,仍然是中位参与者积累量的 23 倍;能跨过这条线的只有 1.4% 的参与者,而这 1.4% 属于同一个持有者。这是一个下界——在事件不公开、取用要付费、结局出现更慢的领域,缺口只会更大。

不能支持的:它没有测到地位;它测的是能不能自备,不是自备不了之后会发生什么。第二十一节的洞一正是这一条。

跑不动的那一条,本身是本文的第三层主张:在绝大多数领域,"独立作出该类判断所需的最少已完成事件数"这个量从来没有被算过,也没有任何一份监管文件要求算它。它不是不可算——本节用一台笔记本电脑在几分钟内算完了——是没有人被要求算。

9.6 跨过阈值的那两个是怎么跨过去的

第九节的读数里有一处值得单独看:141 个参与者中越过阈值的只有 2 个,而这 2 个属于同一个持有者名下的两个包。

它们跨过去的方式不是"做得更好",是发布频次高出一个量级。第一名累计 2,487 件,第二名 2,089 件,而第三名只有 623 件,中位数是 79 件。前两名与其余全场之间不是差距,是断层。断层的成因也不神秘:那两个包由自动化流程按接口变更持续发布,因而它们的事件产生速度不受人的节奏限制。

三件事从这里可以读出来,而且都不是本文事先想到的。

第一,跨阈的位置往往不是靠"重要"跨过去的,而是靠事件产生的机制不同。流行度、被依赖数、投入的人力都不能把一个参与者送过这条线;只有把事件的产生自动化才能。这解释了为什么在很多行业里,跨阈的位置是一个看起来不起眼的登记或结算环节——它的事件产生是自动的,别人的是手工的。

第二,跨阈的两个属于同一个持有者,因此该场实际的自备主体只有一个。按第八节编码规则第三条(同一持有者名下的多个账户合并计为一个参与者),该场的跨阈参与者数应记为 1,而不是 2。这一条不是本文事后为了好看而改的口径,它写在计算之前的手册里;但如果没有这一行数据,这条规则会一直是纸面的。

第三,断层的存在使"逐步接近"这条路不通。第三名 623 件距离 1,850 件还差三倍,而它已经把全场其余 138 个参与者甩开一个量级。这与第六节的性质三对上了:能自备的位置通常只有极少数几个,而不是按规模连续分布。

这三条合起来给出一条对本题的具体建议,而且它与本文的主张方向相反:若某一方想跨过阈值,最有效的做法不是扩大规模,是改变自己产生已完成事件的机制——把结局的记录自动化、把结局的判定标准化,使件数不再受人的节奏限制。这条建议本文自己也无法执行(第十九节)。

十、十五处兑现

一、二手交易。往据是同类物品的成交后结局。预测:平台公开成交价之后,卖家自行定价的偏差不下降,而围绕"这一件的具体状况值多少"的争议上升。

二、消费信贷。往据是同类借款人的还款结局。预测:数据源增加时,独立放贷者所需的历史样本量上升而非下降。

三、招聘。往据是同类候选人入职之后的表现。预测:简历与测评越丰富,用人方对第三方背景与推荐的依赖越强。

四、医疗。往据是同类患者的长期结局。预测:影像与检验能力提升后,对多中心登记数据库的依赖上升。

五、结构生物学。见第二节。预测:低温电镜使数据获取成本骤降之后,对公共结构数据库的调用次数上升而非下降。

六、司法量刑。往据是同类案件的既往裁判。预测:裁判文书公开之后,量刑参考系统的使用率上升。

七、保险定价。往据是同类风险的历史赔付。预测:可穿戴与车联网数据普及后,中小保险人对行业经验表的依赖不减。

八、农业种植。往据是同一品种在同类地块上的历年产量与病害结局。预测:田间传感普及之后,对区域试验网数据的依赖上升。

九、建筑造价。往据是同类工程的结算价。预测:清单计价与电子招投标普及之后,造价指数机构的地位上升。

十、药物警戒。往据是同类药物的上市后不良反应。预测:电子病历打通之后,对国家级监测数据库的依赖上升。

十一、翻译质量判定。往据是同类文本的既往译法与接受结局。预测:机器翻译普及之后,对语料库与术语库持有者的依赖上升。

十二、古籍与文物断代。往据是已断代的同类器物。预测:无损检测手段增加之后,对标准器序列持有者的依赖不减。

十三、软件供应链。见第九节。

十四、教育评价。往据是同类学生的后续发展结局。预测:过程数据采集越细,对跨校跟踪数据库的依赖越强。

十五、辐射与化学品限值。往据是历史队列。预测:新化学品的限值制定周期不随检测能力提高而缩短。

十五处里,第二、五、六、七、九、十这六处可以在现有公开材料上直接去查——它们各自都有可清点的调用量或使用率记录。

十一、一句判据,在六个场景里的答案

判据一句,不含程度词,可以拿去问一次判断的依据清单:

这一次判断用到的依据里,有哪几条来自本次以外已经完成的事;这些事在谁手里。

六个场景,答案互不相同。其中前两个是查出来的,并且反过来改了本文。

场景一,软件包发布节奏的判断。答案:往据是全场的历史发布间隔;它在公共索引手里,任何人可自由取用。这一条改了本文——它证明"免费公开"并不消灭缺口,缺口在件数上,不在可得性上(第九节 9.5)。

场景二,同一份数据里换一个被估量。答案:换成中位数之后阈值不降反升。这一条改了本文关于阈值来源的整段写法(第九节 9.4)。

场景三,一次分子结构的解析。答案:往据是公共数据库里的同源结构;它在一个国际性的公共库手里,免费,但同源性够不够不由取用者决定

场景四,一次量刑。答案:往据是同类案件的既往裁判;它分散在裁判文书库与本院的内部案例库两处,两处的覆盖面与检索能力不同。

场景五,一次外语水平判断。答案:往据是同类学习者的后续发展;而这一场的特殊在于结局出现得极慢(以年计),因此无论谁来收集,件数的积累速度都被结局速度锁死。这里出现一个极端情形:往据的持有者也无法通过投入加快积累。

场景六,一笔二手商品的成交。答案:往据是同类物品卖出之后的结局;它在平台手里,且不对外提供。这是六个场景里唯一一个持有者同时是收益方、并且可以拒绝提供的。

六个答案互不相同,且其中两个是查出来的、并且改了本文的写法。这是本文对这句判据唯一的验收方式。

十一之二、为什么"多看几家"不解决问题

对本文最自然的反驳是一句常识:判断者不必自己积累,多问几家、多看几个平台的评价就是了。这句反驳值得正面回答,因为它指出了本文机制中一个真实的漏洞——往据确实可以被拼凑。

拼凑之所以在多数场里不成立,有三条可查的理由。

第一,拼来的件数不可加。两家各有一千件,合起来不等于两千件——除非两家的事件定义、结局判定标准、时间窗口完全一致。实际上不一致是常态:一家把退货算作结局,一家把签收算作结局。把不可加的件数加起来,得到的估计比任何一家单独的估计都差,因为偏差被平均而方差没有下降。第八节编码规则第四条正是为这一条写的。

第二,愿意给你看的那一部分是有选择的。一个持有者对外展示的历史,通常是它愿意展示的那一段。这一点无须假定恶意——公开的评价里,已完成而未评价的那些事件本身就是最有信息量的,而它们按定义不出现在评价里。拼凑者拿到的是一个被截过的分布,而截断的方式他看不见。

第三,拼凑的成本随件数上升而上升,自备的成本随件数上升而下降。每多拼一家,需要多做一次口径对齐;而自己积累到一定件数之后,边际的一件几乎不花钱。两条成本曲线交叉的那一点,正好在阈值附近——这使得"拼到够"这条路在数学上总是比"积累到够"更贵,尽管在起步阶段它更便宜。

三条合起来的结论是:拼凑是一条真实的路,但它只在阈值以下管用;而阈值以下的判断本来就不需要往据。它在需要它的地方失效,在不需要它的地方有效。

这一节也给出一条可以直接去做的检验,列为第十七节 F6 的补充:取任一场里靠拼凑作判断的主体与靠自备作判断的主体,比较两者判断精度的方差。本文预测前者的方差显著更大,且随拼凑来源数量增加而不下降。

十二、一次走完:从可观测量变细到缺口张开

前面各节是分开的读数,这一节把它们串成一条时间线。

第一段,粗问题时期。可观测量少,判断者要问的是粗问题——这东西大概靠不靠谱。粗问题的阈值低,几十件已完成的事就够。此时人人可自备,中间人的作用是撮合与传递,不是判断。这一段里去中介化的预测是对的,而且确实发生过。

第二段,粗问题被观测直接回答掉。参数、影像、轨迹、评价全部可见,"大概靠不靠谱"这个问题不再需要判断,看一眼就有答案。判断没有变容易,它是被换掉了——剩下需要判断的,全是观测答不了的细问题。

第三段,阈值跳升。细问题的阈值不是比粗问题高一点,是高一个量级,而且随精度要求非线性上升(第九节实测:精度从 20% 收紧到 10%,阈值从 550 跳到 1,850)。这一跳没有任何事件伴随——没有公告、没有涨价、没有新的技术门槛,只是原来够用的经验忽然不够用了。

第四段,个体积累被摊薄。准入成本下降使参与者增加,总件数即使增长,单人份额仍下降。两条曲线到此已经交错,缺口张开。

第五段,缺口被填,并回写前几段。跨过阈值的位置替所有人作判断。它这么做不需要任何强制,也不需要提价——两端是自愿的、满意的。而它一旦开始作判断,一件事会回过头去改变前几段:它作出的判断本身成为新的可观测量(评分、标签、推荐位),于是第二段再来一次——新的粗问题又被观测回答掉,新的细问题又冒出来,阈值再跳一次。

第六段,发起处换人。第二段的发起处是技术供给方(它把某项变得可观测),第三段没有发起处(阈值是算术后果,无人发起),第五段的发起处是跨阈的那个位置自己——它开始主动定义"该问哪个问题"。这正是第十七节 F5 的轮次预测:若连续三轮定义问题的都是同一方,本文的轮次结构为伪。

这条时间线里有四段可在公开材料上查:新增可观测字段的时点、精度要求的书面变更、参与者数量、判断类产品的上线时点。只有第三段——阈值跳升——需要计算而不是查询,而计算所需的数据在多数场是公开的(第九节用了几分钟)。这也是本文认为最值得推广的一件小事。

顺带说明为什么本节只是说明而不是证据:它是一条案例线,样本量为一。第十七节的证伪条件要求同一制度环境内的同质单元不少于六个。

十三、与最近的十二种说法的分界

一、可信度理论(Bühlmann 1967)。这是本文最危险的一位邻居,因为它已经把这件事算成了公式:精算里的完全可信度,讲的正是"自己的经验积累到多少件,才可以只用自己的、不再借行业表"。分离线:可信度理论把集体经验当作可得的、免费的、无主的——行业经验表摆在那里,谁都能用;本文问的正是它当作给定的那一件:集体经验由谁持有、能不能被拒绝提供、能不能被差别定价。判定形式:若集体经验对全体参与者同等可得且不可被拒绝,则可信度理论足够而本文多余;若存在一个可以拒绝提供、可以按对象定价的持有者,则本文对。这一条同时是本文最该感谢的一位——它提供了 n* 的计算范式,本文换的只是问题。

二、最小有效规模(规模经济的常规表述,Viner 1931 一脉)。它说到:低于某个产量,单位成本高得无法生存。分离线:最小有效规模讲的是生产的门槛,随技术进步通常下降;本文的阈值讲的是判断的门槛,随可观测量变细而上升。两者方向相反。判定形式:取任一行业十年间的两条曲线,若最小有效规模与可自备阈同向下降,则本文的机制不存在;若前者降而后者升,则本文对。

三、学习曲线(Wright 1936)。它说到:累计产量翻倍,单位成本按固定比例下降。分离线:学习曲线的横轴是累计产量,它的结论是积累单调有利;本文说积累这一侧确实单调,但另一侧的门槛也在动,自足与否是两者之差。判定形式:若某场的判断精度只随自身累计件数单调改善、且从未出现"原来够用现在不够"的情形,则学习曲线足够;若出现过一次积累未减而判断忽然不够用,则本文对。

四、柠檬市场与信号(Akerlof 1970)。它说到:质量信息不对称使市场萎缩,需要信号与担保。分离线:柠檬市场里缺的是关于这一件的信息,公开它即可解决;本文说缺的是关于别的、已完成的事的信息,公开这一件的全部信息一点也不能补上。判定形式:把某一件商品的全部可观测信息完全公开,若购买者的判断精度随之达到所需,则信息不对称足够;若不达到而对历史结局的需求上升,则本文对。

五、征信局与信息共享(Pagano & Jappelli 1993 一脉)。这是应用领域内部的正主,它讲的正是往据的集中持有与共享带来的效率。分离线:这一支把征信局视为解决方案,问的是共享得越多越好;本文把它视为缺口的填补者,问的是缺口为什么不会关闭。判定形式:若数据共享程度提高之后,独立作出判断所需的件数随之下降,则该支的乐观预期成立;若共享程度提高而阈值同步或更快上升,则本文对。第九节给出了一个公开共享场里的读数:共享是完全的,缺口仍然是 23 倍。

六、贝叶斯先验(Savage 1954 一脉)。它说到:判断由先验与本次证据合成,证据充分时先验被淹没。分离线:这一支的核心结论恰恰与本文相反——数据足够多时先验不重要。本文说本次证据再多也淹没不了往据,因为两者不在同一个维度上:本次证据讲的是这一件,往据讲的是别的已完成的事。判定形式:若增加本次观测能使判断收敛到与先验无关,则先验被淹没;若无论本次观测多完整,估计量的方差都不下降到所需,则本文对。

七、知识的分散性(Hayek 1945)。它说到:知识分散在无数个体手中,价格机制把它们汇总。分离线:这一支主张分散的知识通过价格自动汇总,无须任何人持有;本文说有一类东西不能被价格汇总——价格携带的是当下的稀缺,不携带"上一批卖出去之后坏在哪里"。判定形式:若价格信号能使购买者达到所需判断精度,则汇总成立;若购买者在价格完全透明处仍去买历史结局数据,则本文对。

八、样本量与功效分析(Cohen 1988 一脉)。这是方法学上最近的一位:它计算"要检出某效应需要多少样本"。分离线:功效分析算的是一次研究内部的样本量,样本由研究者自己采集;本文算的是跨主体的件数分布,件数由别人已经完成的事供给,且不可由本人加速。判定形式:若所需件数可由加大投入在本次内取得,则功效分析足够;若件数的供给速度被结局出现的速度锁死,则本文对。第十一节的场景五是后者的极端形式。

九、自助法(Efron 1979)。本文计算 n* 用的正是它,因此必须点名。分离线:自助法是一种估计方法,它不主张任何关于市场结构的事;本文用它算出一个数,然后把这个数与个体积累相比。方法上的借用不构成概念上的占位——但若有人已经用自助法算过某场的自备阈并据此讨论过市场结构,那才是占位,本文未检索到这样的工作,只能标注未核验。

十、迁移学习与预训练(机器学习的通行做法)。它说到:在别的任务上学到的东西可以搬到本任务上。这是分子置换的现代同形,而且它把"借别人已完成的工作"做成了工业。分离线:迁移学习问的是怎么借得更有效,本文问的是借来的那一份在谁手里、借不到会怎样。判定形式:若预训练模型对全体使用者同等可得且不可被撤回,则本文的机制在该处不成立;若可以被撤回、被限制、被差别授权,则本文对。

十一、目标置换(Merton 1940)与合规仪式。这两位在本栏前几篇里已被处理,此处只给分界:它们都需要一个被架空的目的未被遵守的规定;本文的情形里目的没有被架空,规定也被完全遵守,缺的只是原料。

十二、上一篇与同批各篇。见下节。

十二条里最危险的四位是第一、第二、第三、第五——可信度理论从统计侧逼近,最小有效规模从成本侧逼近,学习曲线从积累侧逼近,征信局从制度侧逼近。把它们摆开可以看出一个汇聚系列:四位都算过或讨论过某种"够不够"的门槛,而没有一位问过这个门槛本身会不会随可观测量变细而上升,也没有一位把它与个体积累的份额下降放在一起看。本文补的是这一步,不是又提供一个角度。

十二位共同站着的那块地

逐个问"它结构性地看不见什么",判据只有一条:一旦承认那样东西,它自己就塌了。

可信度理论把"集体经验免费可得"当作给定,因此看不见它的持有关系;一旦承认它有主,它的权重公式就不再是纯统计问题。最小有效规模把"门槛由技术决定"当作给定,因此看不见由问题细度决定的门槛;一旦承认,它的长期下降趋势要加一个反向条款。学习曲线把"目标固定"当作给定,因此看不见目标在移动;一旦承认,它的累计产量横轴就失去了单一刻度。信息不对称把"缺的是关于这一件的信息"当作给定,因此看不见缺的是关于别的事的信息;一旦承认,它的信号与担保处方全部落空。贝叶斯先验把"先验免费"当作给定,因此看不见先验是一份要向别人取的东西;一旦承认,它的收敛结论要附一个可得性条件。价格机制把"分散知识可被价格汇总"当作给定,因此看不见结局类信息不入价格;一旦承认,它的汇总命题要划一块除外区。

六行背后是同一样被当作给定的东西:

判断所需的原料,要么在本次观测里,要么在公共领域里免费躺着。

第三种可能——它在别人已经完成的事里,而那些事有人持有——在这块地上没有位置。本文所说的那一项,正是从这块地面的缝里掉下去的。

十四、与本栏同批各篇的分界

《起算约》。那一篇管从哪儿算起,读数是撤换时重算的条目落在谁的账上。分离线:起算处是一项可以另定的约定;往据是一批必须被经历过的事实,另定不出来。判定形式:若某中介的地位在其起算约被替换后仍不下降、而在其往据库被复制之后立即下降,则本文对;若相反,则那一篇对。

《止查线》。那一篇管查到哪里为止,读数是止查清单与补线迟滞。分离线:止查线是范围问题——它决定不查哪些;本文是原料问题——查了也得不到。判定形式:把某次判断的止查线推到可查范围的极限,若判断精度随之达到所需,则那一篇足够;若仍不达到而需要历史结局,则本文对。

三篇合起来是一个可以并排填的表。对同一个中介问三句:撤换它时谁重算旧账;放行时哪几项按未出现处理;作判断时哪几条依据来自别人已完成的事。三栏都空的地方,通常正是所有数字最好看的地方;而三栏都满的地方,就是这一轮里最难被撤换的位置。

同批的《异至》与《归首》。那两篇处理的是去中介化的路径与到达次序,落点在过程;本文落点在原料。判定形式:若一次成功的去中介化中,两端接手后首先要解决的是"历史结局数据从哪儿来",则本文对;若首先要解决的是对接次序或合并窗口,则那两篇对。三者可在同一次案例上按先后分开。

同批的《凭基》。据本栏记录,那一篇处理的是中介题里"何谓中介、增值与抽成在哪里分开",涉及一份不可估清单与基准置换。本文与它的分界在提问层:那一篇分的是中介所做的事该如何归类,本文问的是它凭什么不可被取代。判定形式:若某中介的抽成份额下降而其往据库不变,其地位不变,则两者独立;若地位随抽成份额同步变动,则本文被那一篇覆盖。本文成文时未能读到那一篇的正文,此处的分界须在合稿时由双方各自复核。

三篇 Why 篇的合成:一次判断的三道闸

本栏就同一个问题已经出了三篇,落点各不相同。把三者摆在一次具体的居间业务上,它们恰好是先后三道闸,而不是三种说法。

第一道闸在原料侧(本文)。要作这个判断,需要多少件别人已完成的事?我手上有多少件?缺口有多大?跨不过这道闸,后面两道根本轮不到。

第二道闸在范围侧(《止查线》)。假定原料够了,这一次检查到哪里为止?线外的部分按什么处理?谁有权重画这条线,重画滞后多久?

第三道闸在记账侧(《起算约》)。假定判断作出了、放行完成了,各方的账从谁那里算起?换掉这个起算处,谁要重做旧账?

三道闸的次序是死的:没有原料就作不出判断,作不出判断就无所谓放行范围,不放行就产生不了要记的账。因此三篇的读数在时间上也应有先后——可自备阈的跳升应早于止查线的悬空,止查线的悬空应早于重算比的上升。这是一条三篇合起来才有、单篇给不出的顺序预测,本文把它列为 F8:

F8。在同一场里追踪一次外生的成本下降,若观察到重算比的上升早于可自备阈的跳升,则三篇的合成次序为伪,须重排。

需要说明的是,三道闸不是三个阶段——它们同时存在于每一次判断里,只是在被撤换时暴露的先后不同。一个中介可以在第一道闸上很弱(原料人人可得)而在第三道闸上极强(账都从它算起),反之亦然。三栏并排填,比任何单栏的高低更能说明它为什么撤不掉。

十五、三处反过来的约束

晶体学削掉了"往据不可自产"。相位并非只能靠分子置换:重原子同晶置换与反常散射都能从本次实验里把相位取出来——代价是另做一整套实验,且需要制备特殊样品。这削掉了本文原本会写的一句更强的话——"往据在原理上不可由本人产生";改为:可以自产,代价是把一次观测扩展成一整条自建的实验线。适用范围因此收窄到"自建代价高于取用代价"的场合。

二语习得削掉了曲线的单调性。化石化说明积累不是单调有利的:输入充足而停滞,且停在哪里事前不可测。这削掉了第六节那条曲线的一个隐含假设——越过阈值之后精度持续改善。改为:曲线可能在某处出现平台,平台之上再多的积累也不产生改善,而平台的位置事前不可知。这动的是本文的装置本身,不是一句边角。

辐射防护削掉了"往据不足就无法判断"。低剂量区没有直接证据,而防护体系并没有因此停摆——它选了一个偏保守的替代规则先判,把不确定性的代价放在被判者一侧。这说明现实里往据不足从不导致"不判断",只导致换一套更保守的替代规则,而替代规则的代价落在被判的那一方身上。本文原本倾向于给出"应当降低对中介的依赖"的处方;这一处约束把这个价值排序整个拿掉了——降低依赖的最省事做法是采用保守替代规则,而那是把代价转嫁给被判者,不是改善。这是三处里唯一动了价值排序的一处。

三处合起来,把本文从一个普遍命题削成一个有边界的命题:在结局出现速度受限、自建实验线的代价高于取用代价、且判断精度要求持续收紧的场合,可自备阈的上升快于个体积累的上升。

十六、不适用的边界

一、判断任务写不成一个可估的量时(价值判断、审美判断),阈值无定义。

二、该场的事件不出结局,或结局不可观测时,两侧都无法计数,本文不作主张。

三、往据可由单次自建实验线取得且代价低于取用的场合,机制不成立。

四、参与者数量不增加的封闭场(配额准入、执照限制),个体积累不被摊薄,剪刀差的一半消失。

五、判断精度要求被制度固定、不随可观测量变细而收紧的场合(例如法定的粗分档),阈值不跳升,机制不成立。

十七、证伪条件与轮次预测

最强的竞争解释是那句最朴素的话——"其实不就是规模经济吗"。以下条件全部要求在控制掉规模之后仍然成立。

F1。控制参与者的营收规模与人员规模后,若可自备阈与该场中介的被撤换频率之间不存在负向的剂量反应关系,则本判断为伪。样本要求:同一制度环境内的同质单元不少于六个,禁止用两个国家或两个地区充数。

F2。若在某个把全体已完成事件完全公开、免费、不可拒绝提供的场里,中介的地位随公开程度提高而下降,则本文关于"公开不消灭缺口"的主张为伪。第九节给出了一个反向读数,但那一场没有独立中介,只能作为半个检验。

F3。若可自备阈与规模、收入、被依赖数中任一指标的秩相关绝对值稳定高于 0.50,则该读数被那个指标吸收,应予废弃。

F4。若在同一场内,判断精度要求收紧而可自备阈不上升(或上升幅度不足精度收紧幅度的一半),则第六节的性质一为伪。第九节实测为 3.4 倍,属于成立的一侧。

F5(正向的轮次预测,本文最愿意押的一条)。一次外生的观测能力提升之后,四件事应按固定次序发生:先是可观测字段增加(可在接口文档与采集规范上读到),随后是判断任务的精度要求收紧(可在业务规则与考核口径上读到),再后才是对历史结局数据的采购或调用上升(可在采购合同与调用日志上读到),最后是跨阈位置开始定义"该问哪个问题"(可在行业标准与评分规则的署名上读到)。若采购上升早于精度收紧,本文的驱动方向写反了。轮次要求:连续三轮定义问题的若都是同一方,本文的轮次结构为伪。

F6(一条已有数据的回溯检验)。取任一有公开历史事件库的场,按第八节的手册算出十年前与今天的两个可自备阈,同时算出两个时点的个体累计中位数。本文预测:阈值上升而中位数不升或升幅更小。这项检验所需的数据在多份公开索引里已经存在,一个人一周内可以做完。

F7。若某场的中介在其往据库被完整复制并免费公开之后三年内地位不降,则本文关于"地位来自往据持有"的主张为伪——届时地位应归因于别的来源,很可能是本栏前两篇所说的那两项。

若本文被证伪,学到的东西是明确的:那意味着判断的原料确实可以由观测与公共领域供给,于是提高透明度仍然是削弱居间者的正确处方,而本文所说的缺口只是过渡期的现象。

十八、反噬与伦理

反噬预言。可自备阈一旦进入监管——例如"缺口倍数高于某值即认定为必需设施"——最省事的达标方式不是缩小缺口,而是把问题问粗:降低判断的精度要求,使阈值下降。而问题问粗的代价落在被判断的那一方身上——粗分档意味着更多的人被归进一个与自己不符的格子里。更彻底的做法是把一个判断任务拆成若干个粗任务,使每一个的阈值都低。两种做法都不缩小实际的缺口,只改变它被算成多少。我看不到出口。唯一能想到的缓冲是把判断任务的表述与精度要求写死在监管文件里而不是由被监管者自定,而这只是把定义权挪了一格。

伦理三条。可自备阈与缺口倍数都可以被拿去考核机构与个人,因此必须写死:

一、这两样读的都是位置,不是人。一个判断者手上件数少,不意味着他不称职;件数由结局的速度供给,不由勤勉供给。

二、不得为了把缺口做小而在安全关键领域降低判断精度要求。医疗、航空、辐射防护三处的分档粗化会直接产生风险。任何以改善此读数为由的精度放宽,在安全关键领域须先做后果评估。

三、已经据此作出不利安排的机构,必须公开判断任务的表述、精度要求与计算脚本,并给出复核通道。自报的读数须标注自报,不得与独立计算的读数并列比较。

十九、本文自己:本文的往据全是借来的

用本文的判据检本文自己。

本文用到的依据里,来自"本次以外已经完成的事"的有哪几条?几乎全部。三家的核心判断句来自它们各自的教科书与奠基文献;三处自曝件来自它们各自的标准正文;十五处兑现里没有一处是本文自己观测到的;第九节那一次真跑用的是别人的发布记录,本文一件已完成事件也没有产生。

按第八节的读数看本文自己:本文的累计件数为零,可自备阈无穷大,缺口倍数不可计算。本文是一个纯粹的取用者。

这个位置有两条具体后果。第一,本文不能主张"应当自备"——它自己就是借的那一方,而且借得理直气壮。它能主张的只有一件:把借的位置写清楚。第二,本文对第十三节那十二位的处理,其可靠性取决于本文所借的那些二手表述是否准确,而本文没有能力逐条回到原始数据复核。

据此给出一条自减条款:本文列出三条借而未验的结论——一,第九节所用发布记录中"一次发布即一件已完成事件"这一等价,本文未验证发布是否都对应真实的结局;二,第二节所述三家的单因主张,本文取的是它们各自最强的表述,而三家内部都存在弱化版本,本文未逐一比对;三,第七节关于"参与者增加而单人频次不变"的说法,本文没有为任何一个具体的场提供数据。这三条不是本文的局限,是本文自己的往据清单;它们的核验责任从本文发表之日起挂在本文名下。

二十、一条写死日期的赌注

赌注:到 2032 年 12 月 31 日为止,至少有一个行业的数据共享、征信或评级规则文件,把"独立作出该类判断所需的最少已完成事件数"列为需要公布的量,并同时给出判断任务的表述、精度要求与计算方法。

什么不算命中(四条,一并写死):

一、只要求机构说明"样本量充足"而不给出任务表述与精度要求的,不算;

二、只公布数据库的总记录数,不公布独立作出判断所需的件数的,不算;

三、给出定性等级(数据充分、较充分、不充分)而无可复算的数的,不算;

四、只在准入审批时一次性提交、无定期更新机制的,不算。

本文对这条赌注不乐观:更可能的情形是这一栏在期限内仍然不存在。若真如此,本文的第三层主张——这个量从来没有被任何人要求算过,尽管算它只需要几分钟——反而是全文最稳的一层。

二十一、三个交出去的洞

洞一。第九节测到了缺口,没有测到地位。缺口与地位之间还差一步论证:跨阈的位置为什么一定能把缺口变成议价能力。本文给的是机制上的说法,不是读数。

洞二。第六节那条曲线的形状是从统计上论证的,而第十五节的第二处约束(化石化)说明它可能有平台。有平台的曲线与没有平台的曲线,在阈值附近的行为不同,而本文的全部推论都建立在陡升段上。

洞三。"问题变细"这件事,本文没有给出独立的读数——第九节是用精度要求的收紧来代理的,而精度要求由本文自己设定,不是从某个场里观测到的。要把这一条做实,需要找到一个场,它的判断精度要求有公开的、逐年变化的书面记录。本文没有找到。

参考文献

[1] Patterson, A. L. (1934). A Fourier Series Method for the Determination of the Components of Interatomic Distances in Crystals. Physical Review, 46(5), 372–376.

[2] Perutz, M. F. (1956). Isomorphous Replacement and Phase Determination in Non-centrosymmetric Space Groups. Acta Crystallographica, 9, 867–873.

[3] Rossmann, M. G., & Blow, D. M. (1962). The Detection of Sub-units within the Crystallographic Asymmetric Unit. Acta Crystallographica, 15, 24–31.

[4] Taylor, G. (2003). The Phase Problem. Acta Crystallographica Section D, 59, 1881–1890.

[5] Selinker, L. (1972). Interlanguage. International Review of Applied Linguistics, 10(3), 209–231.

[6] Krashen, S. D. (1985). The Input Hypothesis: Issues and Implications. London: Longman.

[7] Long, M. H. (1996). The Role of the Linguistic Environment in Second Language Acquisition. In W. C. Ritchie & T. K. Bhatia (Eds.), Handbook of Second Language Acquisition. San Diego: Academic Press.

[8] Ortega, L. (2009). Understanding Second Language Acquisition. London: Hodder Education.

[9] International Commission on Radiological Protection. (2007). The 2007 Recommendations of the ICRP. ICRP Publication 103. Annals of the ICRP, 37(2–4).

[10] United Nations Scientific Committee on the Effects of Atomic Radiation. Reports to the General Assembly, various years.

[11] Bühlmann, H. (1967). Experience Rating and Credibility. ASTIN Bulletin, 4(3), 199–207.

[12] Wright, T. P. (1936). Factors Affecting the Cost of Airplanes. Journal of the Aeronautical Sciences, 3(4), 122–128.

[13] Viner, J. (1931). Cost Curves and Supply Curves. Zeitschrift für Nationalökonomie, 3(1), 23–46.

[14] Akerlof, G. A. (1970). The Market for "Lemons": Quality Uncertainty and the Market Mechanism. Quarterly Journal of Economics, 84(3), 488–500.

[15] Pagano, M., & Jappelli, T. (1993). Information Sharing in Credit Markets. Journal of Finance, 48(5), 1693–1718.

[16] Djankov, S., McLiesh, C., & Shleifer, A. (2007). Private Credit in 129 Countries. Journal of Financial Economics, 84(2), 299–329.

[17] Savage, L. J. (1954). The Foundations of Statistics. New York: Wiley.

[18] Hayek, F. A. (1945). The Use of Knowledge in Society. American Economic Review, 35(4), 519–530.

[19] Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Hillsdale, NJ: Lawrence Erlbaum.

[20] Efron, B. (1979). Bootstrap Methods: Another Look at the Jackknife. The Annals of Statistics, 7(1), 1–26.

[21] Merton, R. K. (1940). Bureaucratic Structure and Personality. Social Forces, 18(4), 560–568.

[22] Coase, R. H. (1937). The Nature of the Firm. Economica, 4(16), 386–405.

[23] Malone, T. W., Yates, J., & Benjamin, R. I. (1987). Electronic Markets and Electronic Hierarchies. Communications of the ACM, 30(6), 484–497.

数据与可复算性说明:第九节所用数据取自公共软件包索引的公开接口,抓取日期为 2026 年 8 月 10 日;样本为 141 个写死的包的全部版本发布时点,合并后 19,643 件间隔事件。预注册文本、抓取脚本与自助重抽脚本随本文存档,随机种子写死,任何人可按同一清单复算。本文不使用任何非公开数据。

字数与版本:正文(含摘要、表格与参考文献)约二万字。本稿为第一版,2026 年 8 月 10 日。所用配料规则为一百门版(第二版,2026 年 8 月)。

人机分工声明:题目、选源约束与成文要求由作者给出;文献梳理、数据抓取与统计执行、初稿撰写由人工智能协作完成;预注册在统计之前写定,不利结果未经删改;全部判断与文责由作者承担。