这篇要交付什么
《合虚》给出了一个可以真正动手算的量:一个多段干预领域里,各段各自声明的效果按覆盖率加权求和(名义降幅),减去整体独立实测的降幅,差就是这个领域的合虚量。本文把它落成一套任何多段治理领域都能照做的审计流程——医疗、教育、公共政策、企业经营皆可用。你不需要新数据,只需要两组本来就存在、却从没被放在一起对账的数字。
流程共六步,外加一张可复用的审计表、三条把合虚与相邻概念分开的操作判据、以及最便宜的第一步。核心纪律只有一条:不评判任何单段的好坏,只算段与段之间加不起来的那一块。
第一步:切段,列出每一段的效果声明
先把要审计的领域切成互斥的"段",并为每一段登记它公开声明的效果。切段的原则是按干预类型、不按行政部门——同一个部门可能横跨几段,同一段也可能有几家在做。
以一个癌种为例,标准切法是五段:一级预防、二级预防(筛查)、局部治疗、系统治疗、支持姑息。为每段填三栏:声明效果(相对风险下降或绝对降幅,注明来自哪项注册试验)、声明所依据的人群(试验入组条件)、声明主体(谁做的、发在哪、进了哪份指南)。
这一步的产出,是一张"段—声明"清单。它本身就有价值:把散落在无数试验、刊物、指南里的声明第一次归到一张表上,你往往当场就能看出几段在盯同一批人。登记声明主体这一栏尤其关键——它会暴露"每段都有主、总账无主"这个结构空位。
第二步:算名义降幅——按覆盖率加权,不按试验值直接相加
最常见的错误,是把各段试验里的效果直接相加。试验值说的是"在被覆盖到的那部分人身上"的效果,而人群死亡率承受的是全体。所以每一段的声明必须先乘以它在目标人群中的实际覆盖率,再相加。
名义降幅 = Σ(第 i 段声明的绝对降幅 × 第 i 段的人群覆盖率)。
举个算例:某癌种筛查在试验里降死亡风险 30%,但人群里只有 50% 的适龄者真正规律参加、且落在可检出窗口——它对整体的名义贡献是 30%×50%=15%,不是 30%。系统治疗试验里延长生存、折算成人群死亡率降幅 10%,但只有 40% 的患者用得上、用得起、耐受——名义贡献 4%。把各段这样加权后的贡献加起来,才是"账面上整体应该降多少"。
这一步单独做完,就已经能挤掉大量水分——很多"各项加起来降了一大截"的说法,在乘上真实覆盖率之后就瘪了一半。
第三步:取整体独立实测
去拿同一时期、同一人群、由独立于各段主体的体系统计出来的整体降幅。医疗里是癌症登记体系的年龄标化死亡率;教育里是全体学生的整体成效指标(而非各项目自报的提分);公司里是整体营收/利润/客户净增(而非各部门自报的KPI改善);政策里是总目标指标(总排放、总发案、总量)。
"独立"是这一步的命门。 如果这个整体数是由做各段的人自己汇总的,它会自动被各段声明"喂"成一致,合虚就被抹平了。必须找一个职责是"数数"、不负责"解释",也不受各段业绩考核约束的第三方来源。
第四步:算合虚量,并定单位
合虚量 = 名义降幅 − 整体实测降幅。
单位跟你所用的整体指标一致:医疗是"每十万人年",教育是"整体均分/达标率",公司是"营收百分点"。把单位写死,是为了让合虚量成为一个可比较、可追踪、可挂到某个岗位KPI上的硬数字,而不是一句"感觉对不上"。
一旦这个数被算出并公布,它本身就会改变行为:因为第一次有了一个"谁也不能独占功劳、只能共同为之负责"的整体口径。
第五步:三条来源归因,各给一个可测代理
合虚量算出来还不够,要把它拆到三条来源上,否则无法干预。三条来源各自给一个可观测的代理变量:
来源一·重复计入。 代理 = 各段声明所依据人群的重叠度。把各段的目标人群拉出来求交集;交集越大,重复计入越多。降它的办法:让各段声明"增量效果"(在前序段已覆盖人群之上的额外贡献),而不是各报各的绝对值。
来源二·未分保的自留。 代理 = 1 − Σ各段覆盖率在全体中的并集。没被任何一段有效覆盖到的人群比例越高,自留越大。医疗里"间期癌"就是筛查段的自留。降它的办法:补覆盖缺口,或至少把缺口显式记账。
来源三·序贯改写。 代理 = 相邻两段之间的时间间隔与人群构成变化。间隔越短、前段越强地改变了后段面对的人群,改写越大。降它的办法:让后段的效果声明按前段处理后的人群重新估计,而不是沿用独立试验值。
三条来源都能在拿到最终数据之前推出方向为正,这是合虚区别于"事后拟合"的地方——你可以先预测哪个领域合虚量大,再去验证。
第六步:验证方向——单段应趋零,多段应变大
审计要自带一个证伪检查,防止把别的东西误算成合虚。两条可直接验的推论:
其一,只有一段的领域,合虚量应当接近零。医疗里慢性髓性白血病、睾丸癌符合;任何"一个主体从头干到尾、无交接"的领域也应符合。若你算出的单段领域合虚量很大,说明你的名义降幅或实测降幅取错了,回去查。
其二,投入越大、分段越细的领域,合虚量应当越大,且与效率指标正交——一个领域可以每项效率都好看而合虚极大。若你发现合虚量随分段数下降,同样是取数出了问题。
一个从头到尾的算例
把六步在一个简化癌种上走一遍,数字是示意用的,重在流程。
切段与声明(第一、二步)。 五段,各自乘上真实覆盖率:
| 段 | 试验声明降幅 | 人群覆盖率 | 加权贡献 |
|---|---|---|---|
| 一级预防 | 20% | 40% | 8.0% |
| 二级预防·筛查 | 30% | 50% | 15.0% |
| 局部治疗 | 15% | 70% | 10.5% |
| 系统治疗 | 10% | 40% | 4.0% |
| 支持姑息 | 5% | 60% | 3.0% |
名义降幅(第二步收口)。 直觉上会把 8.0+15.0+10.5+4.0+3.0 = 40.5% 当成答案。但降幅不是简单相加(30% 之后再降 15%,是在剩下的 70% 上降,不是在原始基线上降)。按"逐段作用于前一段之后剩余风险"的方式复合,实际名义降幅约 34%——这一步本身就已经挤掉了 6 个百分点的"重复计入"水分。记住:降幅要复合,不要线性相加,这是第一道防虚闸。
整体实测(第三步)。 登记体系给出同期该癌种年龄标化死亡率实测降幅 22%。
合虚量(第四步)。 34% − 22% = 12 个百分点,折成每十万人年的绝对数登记备案。这 12 个百分点,就是这个癌种在这段时期的合虚量。
三来源拆解(第五步)。 查人群重叠:筛查段与局部治疗段目标人群交集达 60%(筛出来的早期患者正是手术的主要对象)——重复计入贡献了约一半合虚;查自留:并集覆盖率只到 78%,22% 的人群未被任何段有效覆盖(含间期癌)——贡献约三成;序贯改写:筛查—系统治疗间隔短、前段大幅改变了后段人群构成——贡献其余。
方向验证(第六步)。 该癌种五段、投入大 → 合虚量应大,符合;同口径下只有一段的对照癌种应趋零,若不趋零则回查取数。
一套走完,产出的不是"某段不好",而是一个能挂到对账岗位上的硬数字 12 个百分点,和它可干预的三个把手。
事先就能定方向:把审计做成预注册
合虚区别于"事后找茬"的关键,是它的三条来源都能在拿到最终数据之前推出符号为正、并推出它随什么变大。这给了审计一个强得多的做法——预注册:
在算之前,先书面登记三件事:①你预测这个领域合虚量为正(而非零或负);②你预测它随分段数、人群重叠、序贯紧密度增大;③你预设一个"如果实测差值符号为负或随分段数下降,则本审计判定失败"的推翻条件。先登记,再取数,再核对。 这样算出来的合虚量不是拟合出来的,是被预测命中的——它的说服力和"事后凑一个模型解释剩余"完全不是一个量级。
这一步几乎不花额外成本,却把"合虚是不是真东西"从争论变成可裁决:符合预注册方向,它就站住了;不符合,就老实收回。
把合虚与三个近邻分开:操作判据
现场最容易把合虚和三样东西混起来。各给一条可操作的判据:
与"误差"分开: 误差方向随机、随样本收敛;合虚方向固定(名义 > 实测)、随样本更清晰。判据:把时间窗口拉长,看差值符号是否稳定为正。 稳定为正,是合虚不是误差。
与"真实世界打折"分开: 打折让每段各自缩水、段间关系不变。判据:把每段的试验值全部替换成真实世界值后重算——若差值大幅缩小,那是打折;若差值依旧,那才是合虚。 《合虚》第十八节即用此法把两者分离。
与"尚未算出的效率"分开: 效率的分子分母在同一主体手里,本可自算。判据:问"这个数能不能由做某一段的人独立算出"——能,是效率;不能(需要跨段声明+独立整体实测),才是合虚。
主体缺位的制度解:设一个"结总账"的岗位
合虚的根在于结构空位:每段有主、总账无主。所以最根本的干预不是技术,是设岗。
具体做法:设立一个对账职能,其唯一KPI就是合虚量本身——不做任何单段干预,只负责按上述六步定期出一份"名义降幅 vs 整体实测"的对账报告,并公开合虚量及其三来源拆解。它必须独立于所有单段主体的考核,否则会被同化。医疗里可挂在登记体系之上加一个"归因对账"层;企业里就是一个不背任何单部门KPI、只对整体口径负责的岗位;教育、政策同理。
这个岗位一旦存在,合虚量就从"没人能算"变成"有人在算"——这本身就是《合虚》最实的一条应用:它不要求你多做一项干预,只要求你补上一个一直缺席的对账人。
对账岗位的三种制度形态
"设一个结总账的岗位"落到实处,有三种可选形态,按干预力度递增:
形态一·报告层(最轻)。 在现有独立统计体系之上,加一个不改变任何流程、只定期产出"名义 vs 实测"对账报告的分析职能。它没有权力,只有公开权——把合虚量和三来源拆解挂到明处。适合起步:几乎零阻力,却第一次让"差账"可见。
形态二·守门层(中)。 让对账岗位掌握一道闸:任何单段要新增声明、进指南、扩预算,必须先提交"本段增量效果(在前序段已覆盖人群之上)"而非绝对值。这一步直接从源头压重复计入——它不否定任何单段,只要求每段说清"我在别人之上多贡献了多少"。
形态三·预算层(重)。 把一部分资源的分配,从"奖励单段亮眼"改为"奖励整体实测改善与合虚量下降"。这会遇到最大阻力,因为它动了各段的激励;但它是唯一能从根上扭转"越加段越虚"的形态。建议只在合虚量已被前两层稳定测量、且跨期可比之后才引入。
三种形态可叠加、可分期。共同的铁律是:对账岗位的考核,绝不能与任何单段的业绩挂钩,否则它会被同化,整体实测数会被慢慢喂成与各段声明一致,合虚被抹平。
常见反对与回应
"每段都是真有效的,你这是否定努力。" 不。合虚承认每段都真有效,只质疑"直接相加等于整体"这个假设。指出合虚,恰恰是为了让每段的真实贡献不被重复计入和缝隙漏损所掩盖。
"对不上是因为真实世界打折,不是什么新东西。" 用第八节的判据:把每段试验值换成真实世界值重算,若差值大幅缩小,那确实是打折;若差值依旧,才是合虚。两者能同时存在、也能分开算。
"没有干净的整体实测数怎么办?" 那么这个领域的第一优先级,不是再做一项干预,而是先把独立的整体口径建起来——没有整体实测,连自己在不在原地打转都不知道。
跨领域落地清单
医疗: 选一个分段多、投入大的癌种(乳腺、前列腺),按六步算合虚量,重点查筛查段与系统治疗段的人群重叠(序贯改写)和间期癌(自留)。
教育: 把一所学校/一个学区的各项提分干预列全,乘真实覆盖率求名义提分,取整体统考成效实测,算差;重点查"各项目盯同一批优等生"的重叠度。
企业: 把各部门自报的KPI改善按其影响的客户/营收占比加权,与整体营收/利润实测对账;重点查跨部门重复归功。
公共政策: 把各项措施的声明效果按覆盖人口加权,与总目标指标实测对账;重点查"没被任何措施覆盖到"的人群自留。
失败模式
把合虚当误差放过。 一看差值就归为"统计噪声",于是永不干预。用上面的符号稳定性判据挡它。
只优化单段,不设对账。 每段继续各自变好,合虚继续变大——因为你在往一个没有总账房的系统里不断加段。
用效率掩盖合虚。 拿一堆漂亮的效率指标(每元降幅、投入产出比)宣布领域健康,回避整体实测对账。判据:效率再好,也答不出"名义与实测的差是多少、谁在算"。
让做各段的人自己汇总整体数。 整体实测被喂成与各段声明一致,合虚被抹平。必须第三方、独立、只数数不解释。
一张可复用的合虚审计表
| 栏目 | 填什么 |
|---|---|
| 段 | 按干预类型互斥切分 |
| 声明效果 | 绝对降幅+来源试验 |
| 依据人群 | 试验入组条件 |
| 覆盖率 | 该段在目标人群中的实际覆盖 |
| 加权贡献 | 声明效果 × 覆盖率 |
| 声明主体 | 谁做/发在哪/进哪份指南 |
| 名义降幅 | Σ 加权贡献 |
| 整体实测 | 独立第三方口径 |
| 合虚量 | 名义 − 实测(定单位) |
| 三来源拆解 | 重叠度/自留率/序贯间隔 |
先审计哪个领域:优先级排序
资源有限时,不必对所有领域同时做合虚审计。按合虚量的预期大小排优先级——而三条来源恰好给了你事先排序的依据,不用先算就能大致判断:
优先级最高:分段最多、投入最大、各段主体最分散、且各段目标人群高度重叠的领域。这类领域合虚量大、且"每项都好看"的假象最强,最容易在一片捷报里整体停滞——医疗里的乳腺癌、前列腺癌,教育里的重点校提分工程,都是典型。
优先级次之:有独立整体实测、但从未与各段声明对过账的领域。这类领域数据都现成,只差有人把两个数放到一起,做起来最快见效。
优先级最低:本来就只有一段、或已有对账机制在运行的领域——它们合虚量小,审计边际价值低。
一个实用的判断口诀:哪里的捷报最多、整体却最不动,哪里的合虚就最大,就先审哪里。
最便宜的第一步
不必一上来就做全套。先只取两个数:你所在领域"各项声明加权后的名义降幅",和"整体独立实测的降幅"。把这两个数并排放在一张纸上,看它们差多少、以及——最关键的——问一句这笔差账现在归谁算。
如果你发现没有人在算,那么恭喜,你刚刚发现了这个领域的合虚,并且已经站在了那个一直空着的岗位门口。补上它,比再多做一项亮眼的干预,往往更能真正推动整体。