给你的流程做一次通道台账:四栏、三问与途生率
把母文的通道台账、ν 的算法与四条清点纪律,做成一份能在自己行当里跑完的工序
SDE 编辑部 · 2026年8月
导语 母文是一篇音乐发生学的论文,但它留下的是一套记账规程。这一篇把那套规程从音乐里取出来,写成任何一条「有东西进、有东西出、而出来的账本上没有来源栏」的流程都能照着跑的步骤。
这套方法做什么,不做什么
做:帮你查清一条流程的出口账本上,有多大一份是这条流程自己生产的、却被下游当成"本来就有的"在用;并给出把这一份算成一个数的具体办法。
不做:不判断这些被生产出来的成员是好是坏。母文写死了一句:**被生产出来,不等于是假的。**本方法不产生"清除途生项"的建议,只产生"把来源栏补上"的建议。
适用:任何有记录环节的流程——会议纪要、工单分类、病历编码、验收判定、标注与打标签、报表口径转换、翻译与转写、档案著录、数据字典映射。
不适用:出口账本已经有来源栏并且被认真填写的流程。那种情况下,多出来的成员是已标注的加工,不是本文所说的途生项,直接看那一栏即可。
第一步:判断你的账本有没有来源栏
拿一份你每周都在生产或使用的记录,回答四问。
| 问 | 答不上来意味着 |
|---|---|
| 这份记录里,哪几项是当场从材料里读出来的,哪几项是记录者按规矩填上去的? | 你的账本没有来源栏 |
| 下游的人能不能只看这份记录就分辨出这两类? | 分辨不出=条件 U 成立 |
| 这份记录会不会成为下一轮工作的输入? | 会=条件 R 成立 |
| 两个人分别记同一份材料,哪些格会不一样? | 不一样的那几格就是候选途生项 |
第二问和第三问同时为"是",这条流程就一定在生产途生项。剩下的工作是把它数出来。
安全边界:先写死不做什么
- 不追责。查出某几项是记录者生产的,不等于记录者做错了。母文的两条结构条件里根本没有"人"这一项。任何把本方法用于问责的做法都不在授权范围内。
- 不删。不要因为一项被判定为途生项就把它从流程里去掉。它多半正是下游能运转的原因——纪要里没有标点就没法读,工单没有类别就没法派。要补的是那一栏,不是砍掉那一项。
- 不在医疗、法务、安全的强制记录上擅自加栏。这些记录的格式由规定决定,改格式要走规定的路。本方法在这些场合只做旁路测量。
- 不把 ν 当质量分。ν 高不代表流程差。有些材料天然 ν 接近 1(转录一段没有稳定节奏的演奏、给一段开放式访谈打标签),那是材料的性质。
- 不把探索性结果当结论。母文把好几处标成探索性、不让它们承担论证。照做。
第二步:把通道画成四栏
母文的通道台账只有四栏,一栏也不能省。
I(入口清单):进去的时候能被独立测到的东西。要点是"独立测到"——你得能在不看出口的情况下,把它一样一样点出来。
O(出口清单):下游实际在用的那些项。注意是"实际在用",不是"记录表上印了的"。没人看的格不算。
R(再进入点):出口在哪一步重新变成输入。写不出这一步的位置,就不成立。
U(来源栏):账本格式里有没有区分来源的栏位。有/没有,二选一。
举一个填好的:一条客服工单流程。I=客户说的那段话与工单文本;O=工单上的问题类别、紧急度、处理结论;R=类别进入报表、进入知识库、进入下一批坐席的培训材料;U=报表里不区分"客户明确说的"与"坐席按下拉框归的"。
第三步:零情态词三问
母文给了三问,答案必须能被具体记录,不许出现"可能""某种程度上"这类词:
- 这个成员在入口清单里能不能被独立测得?
- 下游账本里有没有一栏记它的来源?
- 出口再进入输入的那一步,具体发生在哪里?
三问答完,就知道手上这一项是不是途生项。母文自己填这张表的时候,有一行是空的——听者那一行,因为它没有数据。它把空着写在正文里,说明"这是本文的实际状态,不是修辞谦逊"。你填的时候也照此办理:填不出就留空,不要用"大概"补上。
第四步:按四种形态找候选
不知道该怀疑哪一项时,按四种形态各问一句:
| 形态 | 自查问题 | 流程里的常见位置 |
|---|---|---|
| 无中生有型 | 有没有哪一项,材料里根本没有对应物,但每份记录上都有? | 分段、优先级、"整体印象"评级 |
| 转化型 | 有没有哪一项,在流转途中变成了别的东西还沿用原名? | 口径换算、单位统一、术语归并 |
| 放大型 | 有没有哪一项,出口的数量明显大于入口? | 派生指标、拆分后的子项、复制传播的引用 |
| 编码型 | 有没有哪一项,是为了方便记录而加的标记? | 类别、编号、标点、日期、状态字段 |
母文的实测只做了编码型这一种,并把这写成自己覆盖面上最大的限制。编码型也是你最容易入手的一种——它离散、可判定、常有多人独立版本可比。先从编码型做起。
第五步:算 ν
理想情况下 ν 可以直接数,但来源栏恰恰是缺的,所以必须走替代路线:
- 找一个只看内容的最好可得预测器 M。规则、模型、算法都行,但必须是现成公认的,不许为了让结果好看而调参、不许取每条材料上的最优。
- 找一个不看内容、只按约定行事的参照者 C。另一位独立记录者是最好的 C;此外还要放一个常数预测器(一律填最常见的那个值)作对照。
- 让 M 与 C 做同一件事、对同一个目标,各自算 Cohen 的 κ(扣掉蒙对的那部分)。
- 然后:ν̂ = 1 − κ_M / κ_C
母文的实测:κ_M = 0.1530,κ_C = 0.2721,ν̂ = 0.4375。
读法:出口成员中,约 44% 是参照者能稳定给出、而入口内容给不出的那一份。ν̂ = 0 表示出口完全由入口决定;ν̂ 趋近 1 表示几乎不由入口决定,却仍被稳定给出。
四条清点纪律(照抄,一条也不能省)
**其一,ν 必须与 M 配报。**弱预测器会把 ν 抬高。报 ν 的时候必须同时说清 M 是什么、凭什么它是"最好可得",并允许别人用更强的 M 复算。ν 天生是一个可以被别人降低的量——这是它的优点,不是缺点。
其二,零模型不能用均匀分布。出口成员的分布通常极不均匀,用"1 除以选项数"当机会水平会系统性高估你的预测器。正确的零模型是破坏内容结构之后的同一个预测器(把材料内部顺序打乱再跑一遍)。母文正是在这一条上栽过一次,事后才把它写成纪律,并注明修订是看到结果之后作的、正式复验必须先冻结零模型再取数。
**其三,参照者自己的一致度要报。**若 κ_C 也很低,那出口成员既不由内容决定、也没被稳定共享——那是噪声,不是途生。母文的 κ_C 只有 0.2721,它自己写了一句:任何把结论读成"共同体牢牢规定了一切"的解释,都被这个数挡住。
**其四,不可区分性要单独检验。**账上没有来源栏,不等于来源在原则上不可恢复。必须专门做一场(见第七步)。
第六步:留意默认值这个陷阱
这是最容易把结论做漂亮、也最容易骗过自己的一处。
母文的数据里,起拍取默认值的占 77.4%。于是两位转录者的原始一致率有 0.7806,看起来"共识极高";扣掉蒙对之后,κ 只剩 0.2721。原始一致率里绝大部分只是两个人都选了默认值。
自查办法:先算你那一栏的多数类占比。占比越高,原始一致率越没意义,越必须报 κ。凡是看到"一致率九成以上"的字样,第一件事是去查多数类占了多少。
母文还标出了第二个陷阱:它的数据里拍号一致率是 1.0000,看着像是"共同体高度一致"的铁证,它拒绝把这当证据——更可能是数据库层面的规范化或界面默认,也就是说那一栏根本不是各人独立填的。凡是一致率恰好等于 1,先怀疑它是同一个来源的复制,不是共识。
第七步:不可区分性检验
问法:两个人在某一栏上不一致的时候,这分歧是来自同一份材料上的不同生产,还是来自他们记的本来就是不同的材料?
做法:把配对分成"该栏一致"与"该栏不一致"两组,分别度量两组的材料内容差异,比较两组的分布。若不一致组的内容差异显著更大,说明分歧主要来自材料本身,途生解释被削弱。
母文这一场按预注册口径被驳了,它如实保留。事后诊断发现其中一半是对齐方式造成的假象——改用最佳移位对齐后差值正好减半,剩下的仍然显著。于是结论写成"部分被驳",并把"不可区分"这条主张降级:
不可区分是账本格式层面的,不是统计层面的。单条记录读不出来源,大样本上可以部分反推。
这条降级对你有实际用处:它意味着你确实可以用大样本去部分反推来源——这正是补来源栏之前的过渡办法。
走完一遍:客服工单的"问题类别"
- 四栏:I=工单文本与通话内容;O=问题类别(十二选一);R=类别进报表、进知识库、进培训;U=报表无来源栏。
- 零情态词三问:类别在入口能不能独立测到——不能,客户不会说"我这是第七类";账本有没有来源栏——没有;再进入在哪一步——类别进了本月报表,报表决定下月的人力配置。三问齐了,"问题类别"是编码型途生项的候选。
- 算 ν:M=用工单文本跑一个现成的关键词规则分类器(不调参);C₁=另一位坐席对同一批工单的独立归类;C₂=常数预测器(一律填占比最高的那个类)。分别算 κ。
- 陷阱检查:先算多数类占比。若"其他/咨询"占了六成,原始一致率立刻作废,只看 κ。
- 零模型:把工单文本的句子顺序打乱后重跑同一个分类器,用它作机会水平——不是用 1/12。
- 不可区分性:把两位坐席归类一致与不一致的工单分两组,比较两组工单文本的差异。若不一致那组的文本差异并不更大,说明分歧确实来自同一份材料上的不同生产。
- 结论怎么用:假设算出 ν 在 0.4 上下,正确的处置不是要求坐席"归得更准"(内容里本来就没有那么多信息),而是两件事:一,在报表里给"类别"加一栏来源或置信标记;二,承认下月人力配置有相当一份是建立在约定而非客户内容之上的,并在决策文档里写明这一点。
这个例子里最值钱的一步是零模型那一步:不换零模型,分类器的成绩会被高估,ν 会被低估,然后所有人都会以为"类别基本反映了客户的问题"。
读数与代价
- **代价一:要有第二个记录者。**没有独立的 C,κ_C 就没有,ν 算不出来。这意味着要拿出一批材料做双记。
- 代价二:要留出打乱重跑的算力与时间,用来做零模型。
- **代价三:结论常常是"补一栏",而不是"改进准确率"。**很多组织不接受这种结论,因为它不指向任何人的努力。事先说好,比事后争执便宜。
- 一条读数:如果你算出的 ν 接近 0 或接近 1,先怀疑仪器——ν≈0 多半是 M 太强或者目标选错了(选了一个本来就能从内容读出的字段),ν≈1 多半是 κ_C 太低,也就是那一栏其实是噪声。
三种典型事故
**事故一:拿一致率当共识。**多数类占比一高,一致率就好看。必报 κ。
**事故二:为了让 ν 好看而挑了一个弱预测器当 M。**这是本方法最容易被滥用的一处。防法是把 M 写进报告并邀请别人复算。
**事故三:查出途生项就把它砍掉。**砍掉标点,纪要就不能读;砍掉类别,工单就不能派。要补的是来源栏。
什么时候停手
- 涉及强制格式的记录(病历、法律文书、安全记录),停在旁路测量,不动格式。
- 一旦有人开始用 ν 给记录者排名,停手。
- 找不到独立的第二记录者时,停在第一步到第四步——定位与画通道仍然有用,但不要报 ν。
什么时候该怀疑这套理论本身
母文给了两条自我证伪条款,这里写成你能执行的三条:
- 一个更强的内容模型把恢复率推到 0.90 以上——那说明这一栏其实可以由内容决定,途生率趋近于零,本方法在这条通道上失败。母文自己写死了这条线,也就是说它的命题随着该领域的进步而承担风险。
- ν 随"记录者受过多少训练"单调变化,而不随通道的结构(R 的强度、U 的完备度)变化——那说明起作用的是人的模型,不是通道结构,第二层命题失败。
- 一条完全无人参与、也不含任何学习模型的流程,测出的 ν 不显著大于零——那说明途生确实需要主体。母文说这是它最愿意被检验、也尚未做的一场。
四种常见反对
**「这不就是说记录不客观吗?」**不是。母文明说被生产出来不等于是假的。它主张的是账本格式里缺一栏,不是记录不可信。
**「补一栏来源,成本太高。」**不必全补。先在一批抽样材料上补,算出 ν,再决定值不值得在全量上补。多数情况下,抽样测量就够支撑决策了。
**「我们两个人记出来一样,说明没问题。」**先算多数类占比。两个人都填默认值,不叫一致。
「这跟'人会带入主观'有什么区别?」区别在两处:本方法要求你把那一份算成一个数,并且主张这件事在没有人的流程里(数据管道、自动标注、指标派生)同样发生。第二处才是母文真正想说的。
三个岗位怎么跑
- 做数据与报表的:派生字段是重灾区。任何"由其他字段算出来的"列,都是候选途生项;R 就发生在它被写回明细表的那一刻。
- 做质量与审核的:判定档次(合格/让步接收/返修)通常 ν 很高。先算,再决定要不要把判定依据单列一栏。
- 带团队的:绩效评语里的形容词是典型的编码型途生项。做一次双评,算一次 κ,比开三次校准会有用。
一个人的自查版
- 挑一份你每周都在写的记录,用两种颜色的笔标一遍:从材料里读出来的一种颜色,按规矩填上去的另一种颜色。
- 数一数第二种颜色占了多少格。这是你自己的 ν 的一个粗估。
- 找出这份记录在哪一步成为下一轮的输入。找到那一步,你就找到了 R。
两周最小实验
第一天:选定一栏(一个字段、一类标记),写下你对"另一个人会不会填得跟我一样"的预测,封存。
第二到第十三天:正常工作,另找一位同事对同一批材料独立填同一栏,两人互不通气。什么流程都不改。
第十四天:打开封存的预测,算三个数——原始一致率、多数类占比、κ。如果原始一致率很高而 κ 很低,你刚刚亲手复现了母文最关键的那一课。
本文用到的母文词,各在哪一步
| 母文词 | 用在第几步 |
|---|---|
| 通道台账(I / O / R / U 四栏) | 第二步 |
| 条件 R(输出再进入输入)、条件 U(账无来源栏) | 第一步定位与第二步画通道 |
| 零情态词三问 | 第三步 |
| 四种形态(无中生有/转化/放大/编码) | 第四步找候选 |
| 途生率 ν̂ = 1 − κ_M/κ_C | 第五步 |
| 四条清点纪律 | 第五步之后,逐条执行 |
| 多数类与默认值陷阱 | 第六步 |
| 不可区分性、以及它被降级为「账本格式层面的」 | 第七步 |
| 「被生产出来不等于是假的」 | 安全边界与事故三 |
| F9 / F10 两条自我证伪 | 「什么时候该怀疑这套理论本身」 |
来源说明
本文由 SDE 编辑部撰写,是对 Judy《途生项》一文的方法与流程转写,不替代原文,不代表原作者措辞。文中全部判据、公式、纪律与两处修订的教训均取自母文;客服工单那个例子为本文所造,用于演示流程,不是母文的检验之一,也不构成母文主张的证据。母文自己声明:音乐上的核心主张仍是待检验假说,且第三条推论(无主体通道也应测到 ν 大于零)尚未执行。医疗、法务、安全等有强制记录格式的场合,一律以现行规定为准。