从理论对象到可运行系统
母文《残判》提出的不是一个现成行业标准,而是一个待验证的构念:重算率。本篇把它翻译为技术对象、数据字段、计算口径、实施流程和最小试点。技术化的目标不是宣布理论已经被证明,而是让不相信理论的人也能按照同一规则采集材料,并有机会把它推翻。
本方案的观测对象是:仍对当前分流、资源、权限或解释产生影响的一条历史判定。最小分析单位是:一个判定版本及其全部后续证据窗口。这两个口径必须在项目开始前写死。若一边采集一边改变对象,任何漂亮结果都可能只是定义随数据移动。
实施上应坚持三条原则。第一,先影子运行,指标不进入考核、不自动改变人的待遇;第二,原始事件、编码判断和管理决策三层分开保存;第三,任何合成分数都必须晚于对字段缺失、编码一致性和反例的检查。理论创新最容易在技术化时被绩效化吞掉,这三条是最低护栏。
技术应用不是把一个概念做成分数,而是把它做成一条别人能够复查、反驳和停止的程序。
最小数据模型:先记录位置,再讨论原因
建议建立独立的事件表,而不是直接在人员主表上增加标签。事件表回答“这一次发生了什么”,人员表容易滑向“这个人是什么”。字段允许未知值;未知不是零,也不能被默认成健康或异常。
建议字段
- verdict_id:判定及初始时间。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- subject:承受判定的对象。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- basis:原始证据与判据。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- active:当前是否仍参与决策。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- new_evidence:判定后新增证据。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- trigger:重算阈值与触发事件。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- review_version:最近一次重算版本。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
- downstream:受该判定影响的系统与同步状态。字段应保存采集来源、时间和版本;若由算法推断,必须另存置信度与人工复核状态。
数据模型还要增加三个横向字段:source_type 表示来自日志、观察、访谈还是系统推断;coder 表示谁作出编码;evidence_pointer 指向可复核的原始片段。没有这三项,台账会从“记录互动位置”退化为“记录管理者印象”。敏感数据应采用最短保留期和最小访问权,能用事件匿名码就不保存真实身份。
核心读数及其解释边界
读数至少同时报告分子、分母、缺失项和不可判定项,不能只给百分比。小样本阶段应给出事件清单而不是追求显著性;扩大后再报告置信区间、编码一致率与敏感性分析。若改变未知项的处理方式就能让方向翻转,结论必须标成不稳定。
指标解释遵循“事件—机制—后果”三层。事件层只说某种结构被观察到;机制层需要时间次序或干预证据;后果层需要独立终点。不能从一次高指标直接跳到“这个人会失败”或“这个组织有恶意”。构念的技术价值在于区分,而不是替动机审判。
建议始终保留原有业务指标作为并行对照。新读数若只是换一种方式重复旧绩效,它没有增量;若它与旧指标方向相反,应通过预注册试点检验哪一个更能预测后续,而不是凭理论偏好裁决。最有价值的靶格通常正是旧指标最好看、新读数报警的那一格。
八步实施流程
- 第1步:建立有效判定清单,区分历史存档与当前生效。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第2步:为每类判定写下证据保质期、复核阈值和最迟重算日。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第3步:把新增证据流映射到可能受影响的旧判,而非只写入个人档案。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第4步:触发后冻结旧版本,按当时公开的判据重新计算。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第5步:保留旧判、重算过程与新版本,禁止无痕改写。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第6步:把新状态同步到推荐、分班、权限、风控等下游。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第7步:通知被判定者结果与理由,并提供可执行申诉。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
- 第8步:季度审计达到阈值却未重算的残判和同步失败。 每一步都应指定责任人、完成证据和停止条件;若缺一项,就不得自动进入下一步。
执行时建议采用双轨:业务照常运行,影子台账并行采集。前两周只检查字段能否稳定填写、编码者是否理解一致;不展示部门排名。第三周才比较新旧读数,第四周只选择一个低风险接口做微小改动。大规模改制应等待重复观察,而不是被一次新奇结果推动。
最小技术架构可以分四层:采集层接日志、表单或人工观察;事件层按预注册规则切分单位;分析层计算分子、分母、缺失和时间序列;治理层保存版本、审批、申诉和回滚。每层都应能独立停用。尤其不要把分析模型直接接到奖惩系统,否则被观察者会迅速学习如何制造指标,而理论要看的那件事再次消失。
一份真正能交给团队执行的操作说明
项目启动包至少包含六个文件,而不是只发一张指标定义表。第一份是对象说明,写清楚什么算事件、什么不算;第二份是字段字典,给每个值配正例、反例和未知例;第三份是编码手册,规定时间窗与去重;第四份是试点预注册,写下主终点和失败条件;第五份是伦理与权限表;第六份是回滚方案。六份缺任何一份,技术团队都可能在实现时替理论偷偷补前提。
每次数据流入要经过三个闸门。格式闸门只检查时间、来源和必填结构,不对内容作价值判断;语义闸门由受训编码者判断事件是否满足定义;治理闸门决定该记录能否进入分析、是否需要脱敏或征得额外同意。把三道闸合成一次自动判定,虽然省事,却会让采集错误直接变成人的标签。
输出也应分层。面向研究者,提供逐事件记录、缺失率、分歧与敏感性分析;面向现场团队,只提供可以改变流程的位置和对应证据;面向管理者,提供总体趋势、成本与风险,不提供个人排行榜;面向当事人,提供与自己有关的记录、解释和更正入口。不同读者看到不同的最小必要信息,才能兼顾可复查与隐私。
上线前做一次“敌意演练”:请一位不接受该理论的人按照手册编码同一批事件,并要求他主动寻找能让结论翻转的案例。如果系统只能在相信理论的人手里工作,它仍然是学派语言,不是技术。敌意演练发现的问题必须进入版本日志,不能只在会议上口头消化。
三个可落地试点
试点 1 · 学校数据库SQL审计
设计:选择一个年级,查询仍生效的早期能力标签与后续成绩冲突达到阈值却未复核的记录。 先用一至两个自然周期,保留现行流程作为基线,并在开始前写下理论若错会出现什么。
观察:先只出影子报告,不立即改变学生分流;验证字段和误报。 除主要终点外,同时记录工作量、等待、退出与意外副作用,避免把成本转移到不在场的人。
限制:学生数据必须脱敏,任何实际调整需校方与监护流程批准。 若限制条件无法满足,试点应暂停,而不是通过缩小记录范围让结果变得好看。
判决方式:先看事件结构是否按预测变化,再看后续终点是否变化。只有第一层变化而后果不变,说明概念可以描述现场但机制主张过强;两层都不变,则应退回字段定义或放弃该应用。
试点 2 · 招聘标签到期机制
设计:给面试标签设置期限,只有新证据达到门槛才延长或撤销。 先用一至两个自然周期,保留现行流程作为基线,并在开始前写下理论若错会出现什么。
观察:比较人工复核负担、候选人回流与错误拒绝。 除主要终点外,同时记录工作量、等待、退出与意外副作用,避免把成本转移到不在场的人。
限制:不得以重算名义重新引入受保护属性。 若限制条件无法满足,试点应暂停,而不是通过缩小记录范围让结果变得好看。
判决方式:先看事件结构是否按预测变化,再看后续终点是否变化。只有第一层变化而后果不变,说明概念可以描述现场但机制主张过强;两层都不变,则应退回字段定义或放弃该应用。
试点 3 · 模型决策版本图
设计:为风险模型建立判定—证据—重算—下游四节点追踪图。 先用一至两个自然周期,保留现行流程作为基线,并在开始前写下理论若错会出现什么。
观察:检测模型升级了但个体旧结论未重跑的孤岛。 除主要终点外,同时记录工作量、等待、退出与意外副作用,避免把成本转移到不在场的人。
限制:上线前需完成公平、合规和回滚评估。 若限制条件无法满足,试点应暂停,而不是通过缩小记录范围让结果变得好看。
判决方式:先看事件结构是否按预测变化,再看后续终点是否变化。只有第一层变化而后果不变,说明概念可以描述现场但机制主张过强;两层都不变,则应退回字段定义或放弃该应用。
质量控制、反例与证伪
每个试点至少安排百分之十到二十的双人独立编码。争议不能只靠开会统一口径,应保留原始分歧并计算一致率。若一致率持续偏低,说明构念还没有达到技术化程度;此时最诚实的成果不是一个分数,而是一张“哪些事件无法判定”的清单。
证伪优先于扩张。事前写下三类失败:第一,核心字段无法由不了解理论的人稳定编码;第二,新读数不能区分母文声称不同的两类事件;第三,调整新读数后,预言的后续差异不出现。出现任何一类,都要按事先规则降格:从因果机制退为描述分类,或从通用理论退为局部现象。
还要主动寻找反向案例:指标很高但系统后续健康,或指标很低但后续失败。不要把它们叫噪声;逐例检查是否暴露第三变量、错误时间窗、错误分母或适用域。真正成熟的技术规范往往由这些失败案例写成,而不是由成功案例写成。
治理与伦理红线
- 不得无痕删除历史记录。
- 重算规则不能在看到结果后临时改写。
- 高风险判定必须保留人工复核和解释。
- 被判定者的申诉不能只成为另一条不触发行动的数据。
- 重算率不是绩效越高越好,必须同时报告错误翻转和制度稳定性。
在治理上,建议设立“不可自动化决定清单”:哪些新读数只能用于研究、哪些可以触发人工复核、哪些在独立验证前绝不能改变资源与权利。任何被指标影响的人都应能知道记录了什么、为什么这样编码、如何请求更正。技术团队不能因为模型准确率高就取得本来属于教育、医疗、法律或组织治理者的决定权。
隐私遵循目的限制。只为验证事件结构,就不要顺手收集完整身份、聊天历史和心理画像;只需汇总,就不要保存原始内容。数据删除、访问日志和安全事件响应应先于正式采集上线。涉及儿童、患者、员工等权力不对等群体时,必须增加独立伦理审查。
四周最小落地计划
第一周:定义。确定对象、单位、观察窗、字段、未知值和三条失败条件;选择十至三十个历史事件做盲编码,不改任何流程。目标是发现定义漏洞,不是得到分数。
第二周:影子采集。在真实运行中并行记录,培训两名编码者,检查漏记、时间戳和一致率。向现场人员说明指标不进入考核,允许退出非必要观察。
第三周:微干预。只改变一个低风险位置,例如后置模板、增加一次重算、开放一个自留区或保留一个中间体。其余条件尽量不变,并记录成本转移。
第四周:裁决。按预注册终点复盘支持、不支持和不可判定三类结果;公开不利结果,决定继续、改窄或停止。若继续,下一阶段才讨论自动采集与系统集成。
结语:应用的终点不是上线一个分数
重算率一旦进入系统,就会反过来改变人们的行为。最危险的情形,是组织开始追求漂亮的新指标,结果把理论原本要揭示的互动再次格式化。因此,成功标准不是“全员使用”,而是三件更朴素的事:以前混在一起的两类事件能被稳定分开;分开后出现可检验的不同后果;指标被用坏时有明确的停用、申诉和回滚路径。
这套方案可以直接支持小规模试点,但仍然是研究与设计框架,不是经过多机构验证的行业标准。它应当和母文的证据边界一起被引用。任何超出边界的应用,都必须重新建立自己的文献、伦理和实证基础。