学 员 专 栏 · 并 蒂 文 · 诠释文

来过一次就没再来的那些人,在哪一栏里

用一家店的会员名册和一件统计学常识,读懂《单遇》
理论母文作者:胡敏 · 并蒂文:SDE 编辑部 · 发表于2026年8月16日 · 全文约5000字
① 理论母文
原作者的理论判断
② 诠释文
日常类比与通俗解释
③ 实用文
技术、流程与应用
THEORY SOURCE · 理论母文
《单遇》
本文只负责把母文的核心判断翻译或落地,不替代原文。建议读完本篇后回到母文,核对哪些来自原作者,哪些属于解释与应用层的展开。

同一个梯度,第二种读法

年龄结构扣掉之后,医疗资源越充足的地区,慢性病的标化患病率仍然更高。

胡敏这篇《单遇》与他同题的另一篇《撤终》方向相反,而且他自己把这一点写在了正文里:那一篇说高资源地区的分子里多了一类人;这一篇说低资源地区的分子里少了一类人——碰到过一次而无法被再次找到的人。

这篇的入口是一句很朴素的话:一个人群的患病率,测的从来不是有多少人病了,是有多少人能被再次找到并且病了。

那家店的会员名册

先离开医学。

一家店办会员,规矩是:单次消费达到某个数额,且在两个月内再来一次,才算正式会员。这规矩不是刁难——店家要确认这不是路过的一次性消费,是真的常客。

于是店里有了一份会员名册。名册上的人有生日礼、有回访、有专属折扣,年底的报表上写着「会员数」「会员复购率」「会员满意度」。

现在问一句:一个人第一次来就消费很高,明明够格,而他从此再没出现过——他在哪一栏里?

会员数里没有他。「流失会员」里也没有他——流失的前提是入过会。他只在那天的流水单上,是一笔金额。

这不是店员漏登记。规矩就是这么定的,店员做得完全正确。也不是他不够格——他那次的金额远超门槛。他是在这套账里不可能成为一条记录的那种人。

慢性病诊断里内建的第二次

这个结构在慢性病诊断标准里是明文,可以逐字去查。

高血压:以诊室血压为主,一百四十/九十毫米汞柱为界,非同日三次超标确诊。国际高血压学会二〇二〇年的全球实践指南写得更明确——尽量不要一次就诊即做出诊断,确诊需要测量两到三次诊室血压,通常间隔一到四周;若用家庭血压诊断,要求连续七天监测。

糖尿病:中国二型糖尿病防治指南写着,没有典型临床症状时必须重复检测以确认诊断,证据级别为 A。

慢性肾脏病:定义本身就含时间——肾脏结构或功能异常持续三个月以上。一次肌酐升高、一次尿蛋白阳性,在定义上不构成慢性肾脏病,无论数值多难看。

慢性阻塞性肺疾病:诊断依据是支气管舒张试验的一秒率,这要求同一次检查内的两次测量。

这四条合起来就是跨时点构成:一个条目不是在某一刻被读出来的,是被两次相隔的接触共同做出来的。把四条并排,会看到一个从未被当作一件事说出来的共同结构:四条讲的病种、器官、机制毫不相干,而它们的标准都是阈值加时间跨度这同一个形状。

阈值那一半人人都在讨论——一百四十还是一百三十,糖化血红蛋白六点五合不合适,这是过度诊断与概念扩张的战场。时间跨度那一半从来没有人当作变量,它被当成一道保证准确性的手续。

它不是。它是一道资格门槛,而门槛的高低不由病人决定,由这个人能不能被再次找到决定。

单遇

单遇:一件身体麻烦,它已经被这套体系碰到过一次,那一次的读数已经越过某项慢性病诊断标准的阈值,而因为不存在符合该标准要求的第二次接触,它在该标准的定义下不可能成立为一个条目

分清它与两样东西,这一步比命名本身重要。

它不是漏诊。 漏诊是一次判断上的失误:本可以诊断而没有诊断——有主体(谁漏了)、有分母(本可诊断者)、有责任、有可追溯的改进办法。单遇没有主体,没有任何一个医生做错了什么;没有分母,它不在「本可诊断者」里,因为在只有一次接触的条件下它本不可被诊断。

它也不是失访。 失访的前提是已经入组:这个人已经是一个条目,只是后来找不到了,所以失访率的分母是已纳入者。单遇是入组之前的事。

它更不是「检查做得少」。 检查做得少是量的问题,加大投入就变多。单遇是资格问题——即使给一个无法被再次找到的人做十次检查,只要这十次都在同一天,高血压仍然不能确诊,因为标准要的是非同日。

先把这几个词摊开

统计学那件材料:零的倒数不存在

推翻那条共同假定的材料,不是从外面搬来的,是统计学自己写进教科书六十年的东西,叫覆盖误差

抽样调查的第一步是建抽样框——一份名单,从里面抽人。框和总体从来不完全重合。统计学把这些叫覆盖误差,并给出一条硬结论:入选概率为零的单元,其造成的偏差不能靠加权修正。

加权能做的,是把入选概率不等的差别扳回来——按入选概率的倒数放大权重。而零的倒数不存在。你不能把一个从未有机会被抽中的人,通过给别人加权重的方式变出来。

这条结论在统计学里回答的是另一个问题(调查设计里该花多少钱补名单、什么时候必须换框)。而它把单点可判这条假定推翻得很彻底,一共三层:

它区分了两种「没有数」。 一种是入选概率大于零而恰好没被抽中——有分布、有方差、有置信区间。另一种是入选概率等于零——它不在估计的定义域内,它压根不是这套算法的对象。不是测不准,是不在可测的范围里。

偏差的方向是固定的。 框外的通常不是随机的人,是流动的、无固定住址的、新迁入的、脱离登记的。这不是随机噪声,它随组织化程度的差异而系统性扩大。

框是被造出来的,不是给定的,而造框的能力与那个人群的组织化程度是同一件事。名单从户籍、参保、签约、建档里来。

平移过来:慢性病标准里内建的第二次接触,功能上就是一道抽样框——你必须能被再找到一次,才有资格进入这本账。因此「控制掉检出强度之后剩下的真实患病率」这个量,在原理上不存在,就像「扣掉抽样框之后的真值」不存在一样。

一张缺席清单

这篇文章不给一张分类格,给一张缺席清单——要辨认的不是几种不同的条目,是一类根本不会作为条目出现的东西。分类格只能整理已经在册的。

清单上的五条,每一条都不是漏记,都是「在现行标准下不可能」:

一位在体检中查出血压一百六十/一百的建筑工人,三周后工地转场,此后再未在本地任何机构留下记录——非同日三次这一条永远无法被满足。

一位空腹血糖八点二、无「三多一少」症状的外卖骑手,被告知一周后复查,未再出现——指南明文要求无典型症状时必须重复检测。

一位急诊查出肌酐一百八十的老人,急性问题处理完出院,由子女接去外地——定义要求持续三个月以上,而这三个月在此人身上不存在。

一位在两次接触之间死于其他原因的人——他甚至不会进入失访统计,因为他从未入组。

一位无本地参保关系、只在自费门诊看过一次的人——他会出现在门诊人次里、出现在收入里、出现在检验室的样本量里,而不会出现在任何需要跨时点确认的条目里。

这份名录就是这篇文章的读数,他叫它单遇清单。它不取比率——比率需要一个分母,而全文的力气正是用来指出这件事没有分母;硬造一个分母(比如除以门诊人次),会立刻把它变成「复查依从率」的换名,那是一个已有指标、已有考核、已有几十年文献的东西。

单遇清单还有第二个用法,比第一个更要紧:把它按人群特征分层。同一份检验室数据,按参保状态、按户籍是否本地、按行业、按年龄分层之后,清单的长度分布会显示出这个体系的资格门槛实际落在谁身上。这一层分布,是现行任何一项指标都不产出的。

清单上每一条为什么都不算缺陷

上面五条,没有一条会被任何一次质控标为缺陷。

第一条里,那位医生在体检报告上写了「血压偏高,建议复查」,完全正确;没有任何一条规范要求医生把一个转场的工人追回来。第二条里,告知一周后复查是标准动作,指南就是这么写的。第三条里,急诊处理急性问题、出院时建议随访,无可指摘。五条里没有一处失职、没有一处违规、没有一处记录错误。

它有三条性质,三条一起才构成靶子。

它不产生任何缺陷记录,所以质量管理够不着它。 漏诊有分母、有责任岗位、有改进措施,所以质量管理抓得住漏诊;单遇的分母是「曾经越阈而未获条目资格的接触」,而这个集合在现行口径里不存在。一个没有分母的东西,任何以「率」为工具的管理体系都够不着。

它的量与诊断的严谨程度正相关,而严谨被普遍读成质量。 标准要求的复查次数越多、确认窗口越长、可重复性要求越硬,能满足这些要求的人就越少,清单就越长。一个体系把诊断做得越规范,它在低可回访人群上产出的单遇就越多——而规范化本身是每一次质量评价都要加分的事。这一条与过度诊断那一支方向完全相反:他们担心标准太松放进太多人,这篇指出标准变严会在特定人群里制造出一整类不可能进来的人,而两件事同时发生,且发生在不同的人身上

它的减少与「病人变多」是同一件事的两个读法。 一个地区的可回访份额上去了,单遇清单就短,而患病率读数就高。 把人锚住——签约、建档、参保、纳入网格化管理——之后,原本的单遇转成条目,患病率读数上升。这个上升被读成「慢病负担加重」,进而成为加大投入的理由;而加大投入最有效的方式恰恰是把更多人锚住,于是读数继续上升。清单变短的过程,在报表上表现为患病率变高。

一句可以拿去问检验室的话

这个库里,单次结果已经越过阈值、而其后规定窗口内没有第二条记录的人有多少;他们与有第二条记录的人,在哪些字段上不同。

胡敏把它拿到六个场合去问,答案互不相同。挑四个:

一家三级医院的检验信息系统:可以直接算,而且是一次查询的事。库里有每一次检验的个体标识、项目、结果与日期,把越阈记录抽出来、按窗口回查第二条,是一段标准的结构化查询。这一处的意义在于——要的东西在技术上极其便宜,而没有人算过它。

基层慢性病管理系统:算不出来,因为这个库的入口就是「已确诊」。系统里每一个人都已经是一个条目。管理系统的可见范围,恰好就是这篇文章要打的那个东西的补集。

居民健康档案:部分可以,但有一个反向问题——档案的建档率本身在不同人群间差异极大,所以从档案里算出的清单会系统性低估流动人口那一层。用一个覆盖不全的框去数框外的人,这正是覆盖误差那条材料所警告的。

医保结算数据:覆盖面最好,但只覆盖参保人;而预期清单最长的那一层,恰恰是无本地参保关系的人。同一个陷阱的第二次出现。

六个答案连起来给出一个形状:这件事在技术上一算就出,而每一个被用来做人群统计的库都恰好把它排除在外,且排除的方式各不相同。

清点结果改了作者自己

这一节是全篇最硬的地方,因为它推翻了作者原本要写的那句话。

胡敏动笔前锁定了一条最便宜的检验:对四部现行诊断标准的条文做一次清点。结果有两条与预期不同。

第一条与预期相反:单时点即可确诊的通道确实存在。 糖尿病指南写的是「没有典型临床症状时必须重复检测」——这句话的另一面就是:有典型症状时,一次血糖达标即可诊断。高血压那边也有例外:血压达到一百八十/一百一十且已有罹患心血管疾病证据的情形。原本的主张「慢性病诊断在定义上一律需要两个时点」是错的,必须撤。

而这条不利结果没有毁掉文章,它把文章改窄了,改窄之后更结实。看那两条例外的入口条件:一条是「有典型临床症状」,另一条是「极高读数加已有靶器官损害证据」——两条例外的门槛都落在已经露出症状的那一侧。而跨地区梯度的主要来源恰恰是无症状与早期那一档:高血压的绝大多数、糖尿病的相当一部分、慢性肾脏病的早期分期,都是在没有任何症状的情况下被查出来的。

于是承重命题改成:在无症状那一档上,慢性病条目的成立在定义上需要第二次接触;而无症状那一档正是跨地区梯度的主要产地。

第二条超出预期:国际高血压学会那份指南把标准分成「基本」与「理想」两套,明写基本标准适用于资源相对匮乏地区、理想标准适用于资源充沛地区。这意味着「诊断程序按资源分档」不是这篇文章的推论,是已经写在国际指南里的制度安排。所以他不能主张发现了一件没人知道的事——他发现的是一件人人知道而没有人算过后果的事:两套标准下产出的患病率数字每天被放在同一张表上比较,而没有任何一份文件说过它们可比。

一个今天就能做的实验

这篇文章的证伪主件不是一个写死日期的等待,是一个现在就能做的实验,便宜到不需要立项。

取任一家二级以上医院最近五年的检验信息系统数据——不需要跨机构串联,不需要新增采集。抽出所有单次已越阈的记录;对每一条回查确认窗口内有无第二条;把没有第二条的列成清单,按参保状态、户籍、年龄、就诊科室分层;比对两组人的分布差异。

判定阈值写在跑数之前:若清单在无本地参保关系一层的占比,与在本地参保一层的占比之差小于十个百分点,核心预测失败——这说明可回访份额并不随参保状态系统性变化,而整套机制建立在它变化之上。作者没有给自己留退路。

代理变量的问题他也写明了:检验室记录不等于接触。一个人可能在别处完成了确认,也可能在同一家医院用了另一个标识。清单会因此高估,方向固定,幅度未知——这是全文最大的一处不确定。

它不能被这样误用

不能读成「标准应该放松」。 那句「非同日三次」是为保证诊断准确写的,它是对的。这篇文章指出的是它顺带充当了一道抽样框,而没有人负责补这道框——不是它不该存在。

不能用在个人身上,也不构成任何医疗建议。 这是一个人群与制度层面的读数。一个人自己血压高不高、要不要复查、要不要用药,取决于他的医生依据当下最好的证据给出的判断。看到这篇文章,不要因此跳过复查,也不要据此自行判断自己有没有病。

不能拿去考核医生或科室。 清单长恰恰可能是标准执行得最严的地方——考核最好看的机构,清单最长。把它做成考核指标,最省事的达标方式是放松确认要求,那比现状更糟。

什么情况下它是错的。 五条证伪里最锋利的两条:把个体按「检查总次数」与「检查所跨天数」双向分层,若在总次数相同时跨天数不影响诊断率,判断为伪,检出强度足够;取诊断标准里含病程要求的病种与不含病程要求的病种各若干,若两类在流动人口中的确诊率下降幅度相同,判断为伪——跨时点要求不是那道门槛。

三个最容易混的说法

检出强度与知晓率(现行卫生统计的标准解释):医疗资源多的地方查得多、知晓率高,所以患病率读数高。分开的办法很具体——检出强度是一个连续量,预测投入与检出之间是平滑的剂量关系;这篇说的是一道离散的资格门槛:在无法满足第二次接触的人身上,投入再多也不产出条目。检出强度预测「检查次数多的人诊断率高」,这篇预测「检查次数多而全部集中在一天的人诊断率不高」。

抽样框覆盖误差(基什一九六五;汉森、赫维茨与马多一九五三):这是借来的地基,也是最危险的方法学邻居。分离线是——覆盖误差讲的是研究设计里的框,调查者知道自己在建框,可以去补;这篇讲的是诊断标准里的框,写指南的人不认为自己在建框,因而没有人负责补。可判之处:若用同一份抽样框、同一套调查方法在各地重做,差异消失,这篇只是覆盖误差的一个应用;若差异仍随可回访份额而变,框就在标准里。

反向照护定律(图德·哈特,一九七一):良好医疗照护的可及性与它所服务人群的需要成反比。分开的办法最容易被忽略——可及性讲的是人能不能到达医疗,这篇讲的是医疗能不能再次到达这个人。两者可以分离:一个人可以有充分的可及性(随时能挂上号)而完全不可回访(每次去的都是不同的城市)。取可及性指标相同而人口流动率不同的两组地段,若患病率无差异,这篇只是可及性的一个侧面。

一篇理论,三种读法,放在一起

先看理论母文,再用诠释文听懂,最后用实用文做出第一步。

读理论母文读实用文