〔章首〕本章给方程添的第四条本体性质:续签性——署名是一份没有到期日、却已经会到期的凭据,效力只能在自己产物的延长线上被当场重做;在人机连续参与的产物上,"谁做的"并不存在一个等待查明的历史事实,针对本人产物的追问因此不是取样,而是该量的生成。读数是脱稿成立率 q。本章的独门证据是三项字段审计:两份互相独立的学习记录标准合计八十四个类,无一为"延长线上的即时应答"设过带类型字段,而全部失效机制的触发条件都在签发方一侧——记录体系只有签发方时间,没有持有者时间。本章也带着十章里最坦白的一处失误登记:交互式口头评估这位现役正主是写完后复查才找到的,四条分离(验证与构成之别为首)随失误同页。本章欠的账:判者一致性预实验(功效计算已备,约需一百二十次追问)与用人侧标准的第四次审计,均未做。
一个厨师拿了金奖,奖状挂在墙上。奖状不会过期。但如果今天你走进他的后厨,指着他的招牌菜说:"就着这个,现在给我配一道搭它的菜。"——他能不能当场做出来,是另一回事。
《脱稿步》讲的就是这个差别:发生留下的署名,没有到期日,却已经会到期。它的效力不在档案里,只能在你自己产物的延长线上被当场重做一次。
这话听起来抽象,落到操作上却极其简单:拿着他做的东西,问下一步。
不是问"你当时怎么做的"(那是回忆,可以背),不是问"你怎么看这个行业"(那是观点,可以准备),而是指着他交出来的这个东西的具体某处,问它往前一步该怎么走。续得上,署名有效;续不上,档案再厚也只是一张褪色的收据。
为什么今天要紧?
因为在人和机器共同参与的产物上,"到底是谁做的"这个问题,没有一个等待被查明的历史事实。你查不出来,任何工具都查不出来,因为那条界线在过程中就是混的。
这是很多人还没接受的一件事:查重、检测、痕迹分析,全都是在追问一个已经不存在答案的问题。而《脱稿步》给了一条出路:既然"谁做的"查不出来,那就不要查——当场再让它发生一次。这时候"谁做的"不再是被查明的,而是被生成的。
它不是什么?
它不是面试。面试问的是关于你的问题;脱稿步问的是关于你交出来的这一件东西的问题,而且必须是无脚本的、临时的、从具体某处出发的。
它也不是"抽查"或"防作弊"。防作弊的心态会把它做成对抗;它的正确姿态是验收——像收房时业主拿着图纸让工人当场演示某个开关一样自然。
读数是什么?
叫脱稿成立率 q:针对本人产物发起的若干次追问中,续签成立的比例。这里有一个书里查出来的、让人有点意外的事实:现有的学习记录标准与人事系统里,没有一个字段能记下"这个人在自己产物的延长线上当场应答过"这件事——所有字段记的都是签发方的时间与结论,没有持有者的时间。这不是疏忽,是那个时代不需要它。现在需要了。
一个小场景。
招聘最后一轮,两位候选人交上来的作品集难分高下。面试官不再问"讲讲你这个项目",而是打开候选人自己的作品,指着第 7 页的一个取舍问:"如果这里的数据是反的,这一整页要怎么改?"
甲愣了两秒,说出了三种改法,并指出第二种会破坏第 12 页的一个前提。乙给出了一段流畅、正确、但明显是重述第 7 页已有内容的回答。
差别不在口才。差别在于:甲还站在这个产物的延长线上,乙已经不在了。
再看两个身边的例子。
教孩子做题。孩子交上来一份全对的作业。你想知道他是不是真会,不需要审问,也不需要查他有没有抄——你只要指着其中一道题问:"这一步如果换成另一个数,会怎么样?"会不会,三十秒就分明了。注意你没有去追查过去,你是让它当场再发生一次。
买二手车。卖家给你一沓完整的保养记录,看起来无懈可击。有经验的买家不会花时间去验证每一张单据的真伪,他会说:"发动机盖打开,你现在跟我讲讲这里为什么换过。"能当场讲通、并且讲到你没问的地方,那沓记录才算数。
三种常见的误读。
第一种:以为是在抓作弊。这是最容易走偏的一种,而且一旦走偏,整套设计就会失效。因为对抗的姿态会让对方进入防御,而防御的人会准备——准备好的表演正是这套设计要绕开的东西。正确的姿态是验收:不是"我要证明你不行",而是"我要看看这个东西还活着没有"。
第二种:以为可以事先给题。给了题就不叫脱稿。这一点没有折中余地:追问一旦题库化,被测的东西当场消失,剩下的只是另一种可以准备的产物。
第三种:以为答不上来就等于没做。不一定。一个诚实的"这里我确实没想过,但我会这样去弄清楚",往往比一段流利的重述更能说明他在延长线上——因为他知道自己站在哪里,也知道下一步往哪走。真正的失败信号不是"不知道",是只能复述已有内容、无法往前走一步。
给自己做个小检查。打开你最近交出去的一份东西,随便翻到一页,指着任意一处问自己:"如果这里的条件变了,往下怎么走?"答得出来的地方,是你真的做过的;答不出来的地方,你心里其实早就知道。
它和旁边几个概念的区别。
和《他手无事账》最容易混,两者也确实经常一起用,但变量完全不同:这一章的变量是从哪里出发(必须从本人产物的延长线出发),那一章的变量是时刻由谁定(必须不由被读者选)。一次事先约好的、就着本人作品的追问,仍然算脱稿步(因为它从他的产物出发、无脚本),但不算他择(因为时刻是约好的)。四种组合都存在,两轴正交。
和《盲遍》的分工在时间轴的两端:盲遍读形成期,脱稿步读事后。一份档案再厚,如果从没被追问过,那么它的 q 根本没有定义——不是零,是没有定义。
和《底流》有一个有趣的接口:每一次成功的续签,本身就是一次三成分齐备的执行(有真实后果、无辅助、亲手)。所以经常被追问的人,顺带也在被喂。
一句话记住它:这一章管的是还接不接得上——你和你交出去的那个东西,现在还连着吗。
个人层面。
交出任何东西之前,给自己做一次"下一步测试":指着自己作品里的任意三处,问自己下一步怎么走。答不上来的地方,就是你其实没有真正参与的地方。这个测试三分钟就能做完,而且它比任何自查都诚实。
大学发生学教育:把答辩从"讲述"改为"续做"。
这一条是本书里对大学最直接可用的一条,因为它不需要新增任何环节——现有的答辩、汇报、作业面批,全都可以直接改口径。
教师的动作。
第一,追问必须从学生的东西出发,不从教师的知识出发——问"你这一页",不问"教材第几章"。第二,允许学生说"我不知道,但我会这样找"——那也是一种成立的续签,而且往往是最真实的一种。第三,教师自己要示范一次被追问:让学生就教师的讲义临场提问,教师当场续做。
最容易做坏的地方。
变成刁难。追问的目的不是问倒学生,是看他还在不在自己的产物的延长线上。一个善意的、就事论事的追问,和一个想显示自己更高明的追问,在学生那里的效果完全相反:后者会逼出准备好的表演,而准备好的表演正是这一整套设计要绕开的东西。
脱稿步:论人工智能时代大学毕业生核心竞争力的载体转移
——从"可验证的作者身份"到"可续签的署名",兼对三份记录标准的字段审计
版本:第四版(正式稿) 完稿日期:2026 年 9 月 参照语料截止:2026 年 9 月
分类:教育经济学 · 劳动力市场信号 · 教育测量 · 学习记录互操作标准
摘要
研究问题:当交付物可以被廉价代做、可陈述技能可以被普遍供给,大学毕业生凭什么被认作有能力?
核心论点:本文提出,人工智能时代大学毕业生的核心竞争力,不是可陈述技能的加权总分,不是名下产物的存量与光泽,不是落入有利条件场的先在位置,也不是一次被验证过的作者身份,而是可续签的署名——署名是一份没有到期日、却已经会到期的凭据,其效力只能在自己产物的延长线上被当场重做。重做的那个动作,本文称为脱稿步:在自己名下产物的延长线上、无脚本走出可核的下一步。本文主张,在人机连续参与的产物上,"谁做的"并不存在一个等待被查明的历史事实;因此针对本人产物的当场追问不是对某个既存量的取样,而是该量的生成。
方法:(一)理论构造。取三个与劳动力市场无关且彼此不相容的领域——数量遗传学的选择指数理论、攀登伦理中的风格判定、群落生态学的中性理论——识别其共同前提,并以其中第一领域自身的实测结果与制度事实推翻该前提。(二)三项事先登记的字段审计。对两份来源相互独立的学习记录互操作标准(美国主导的一份、欧盟委员会的一份)合计 84 个数据模型类,检验两个问题:是否存在记录该动作的带类型字段;凭据失效的触发条件位于哪一侧。判负条款、不利结果处置与停止规则均在读取数据之前写死。(三)制度场景比较。以一句不含程度词的判据询问五类用人与评价制度。
主要发现:(1)两份标准合计 84 个类中,无一类为"在本人既有产物延长线上的即时、非预设应答"设立带类型、可比较、可加权的字段;(2)两份标准均设有完整的失效机制族(有效期、凭据状态、审查日期、刷新服务),而其触发条件全部位于签发方一侧,无一绑定于持有者当下的表现——本文称之为记录体系"只有签发方时间,没有持有者时间";(3)五类制度中,仅民航飞行员定期检查一类将持有者时间写入正式字段,其存在依赖于失效后果极端、监管强制、成本全行业分摊三个条件同时成立。
已被自己推翻的两处:第一项审计中"标准里没有任何可容纳该记录的位置"这一强主张,按本文事先写死的条款判负(存在自由文本插槽且数据模型可扩展);"课堂追问一律不进入任何字段"这一事实判断亦被推翻(交互式口头评估有评分量表并计入课程成绩)。两处均在正文原样保留并给出收窄后的主张。
局限:三项审计均为文本层的类目审计,非属性穷举;判者一致性阈值为设计值而非实测值(第 6.6 节给出预注册的检验方案与功效计算);核心因果主张尚无个体层面的追踪数据支持。
关键词:可续签的署名;脱稿步;脱稿成立率;代走光泽;签发方时间与持有者时间;学习记录互操作标准;承认与存留
Title: The Off-Script Step: On the Displacement of Graduate Competitiveness in the Age of Artificial Intelligence — From Verifiable Authorship to a Renewable Signature, with Field Audits of Three Record Standards
Abstract
Problem. When deliverables can be cheaply produced on a person's behalf and articulable skills are universally supplied, on what basis is a graduate recognised as competent?
Argument. This paper proposes that the core competitiveness of graduates in the AI era is neither the weighted sum of articulable skills, nor the stock and polish of artifacts bearing one's name, nor a prior position in a favourable environment, nor a once-verified authorship, but a renewable signature: authorship is a credential with no expiry date that nevertheless expires, and its force can only be remade, on the spot, on the extension line of one's own artifact. The act of remaking it is the off-script step — an immediate, unscripted, checkable next move on one's own prior work. Where human and machine contribution is continuous, no pre-existing fact of authorship awaits discovery; probing anchored to one's own artifact therefore does not sample a quantity, it generates one.
Method. (i) Theory construction from three mutually incompatible source fields — selection-index theory in quantitative genetics, style judgement in climbing ethics, and neutral theory in community ecology — whose shared premise is overturned using empirical results and an institutional fact drawn from the first of them. (ii) Three pre-registered field audits across two independently developed learning-record interoperability standards (84 data-model classes in total), asking whether a typed field exists for such an act, and on which side the triggers for credential invalidation lie. Falsification conditions, handling of unfavourable results, and stopping rules were fixed before data inspection. (iii) A five-scenario institutional comparison driven by a single modality-free diagnostic question.
Findings. (1) Of 84 classes, none provides a typed, comparable, weightable field for an immediate, unscripted response on the holder's own prior artifact. (2) Both standards carry a full family of invalidation mechanisms — expiry date, credential status, review date, refresh service — whose triggers lie wholly on the issuer's side, none bound to the holder's present performance. Records keep issuer-side time but not holder-side time. (3) Of five institutional scenarios, only recurrent airline pilot checking writes holder-side time into a formal field, and does so only where extreme failure consequences, regulatory mandate, and industry-wide cost sharing coincide.
Two claims the paper falsifies against itself. The strong form of finding (1) — that no place exists in the standard to record such an act — fails the paper's own pre-registered condition (free-text slots exist and the model is extensible). The factual claim that classroom probing never enters any field is also refuted (interactive oral assessment is rubric-graded and enters course marks). Both are retained verbatim with narrowed replacements.
Keywords: renewable signature; off-script step; off-script rate; borrowed polish; issuer-side versus holder-side time; learning-record interoperability standards; recognition versus survival
1 引言
1.1 一个已经不再自动成立的推论
两份简历摆在桌上。甲的档案很厚:绩点高、三段实习、一个开源项目、一份数据分析报告,报告干净,图表配色考究,结论也站得住。乙的档案薄得多:绩点中游、一段实习、一个没做完的小工具。按任何一份现行评分表,甲赢,且赢得没有争议。
面试当天,面试官不问通用题,只问甲自己那份报告:"你这张图里第三季度的跳点,如果把统计口径换成按下单时间而不是按发货时间,跳点还在不在?在的话,你的第二个结论要改哪一句?"甲说,这个我得回去看一下数据。
同一问题的等价物问乙:"你这个小工具卡在哪儿了?现在给你半小时,你先改哪一行?"乙当场说出卡在什么地方、为什么那条路走不通、他试过哪两种绕法、哪一种更省事但会在什么时候咬人。
三年前,这场追问不会发生,因为不必发生:能做出那份报告的人,几乎必然答得上那个跳点。本文处理的正是这条推论失效之后的问题。
1.2 失效的不是某一种证据,而是一整族证据的共同挂点
一切大规模筛选制度都建立在一个不曾言明的便利之上:看东西比看人便宜。看一个人要时间、要在场、要反复;看一件东西只要一眼。于是社会发明了一整套用东西代表人的办法——文凭代表受过训练,作品集代表做得出来,绩效记录代表干得成,推荐信代表别人验过。
这套办法之所以曾经可靠,不在于东西本身,而在于一条隐含的约束:做出那件东西所需要走的路,只能由本人走。产物因而是路径的一个无偏估计——有噪声,无系统偏差。
本文的第一个论点是:这四类证据并非四种独立证据,它们共享同一个挂点;因此当挂点松动时,它们不是逐个失效,而是同批失效。这解释了一件让许多机构困惑的事实:为什么招聘、升学、评审、绩效考核会在同一个时间段内一起出问题。
需要立刻排除一种误读。这里没有人在造假。学历是真的,作品是真提交的,绩效是真入账的,所有形式审查都能通过;工具使用可以完全合规、完整披露。变化的只有一件事:做出它所需要走的那条路,缩短了、外包了,或者根本不必走了。因此本文与"学术诚信"或"作弊检测"文献处理的不是同一个对象(详见 2.3 节)。
1.3 本文的贡献
本文提出四项可分别评估、可分别推翻的贡献:
贡献一(本体论层,最强、最易倒):在人机连续参与的产物上,"谁做的"不存在一个等待被查明的历史事实。署名因此不是可核实的事实,而是需要被反复重做的凭据。竞争力的落点随之从"能力存量"移到"署名的现行效力"。
贡献二(测量层):给出脱稿成立率 q 这一读数、七条编码规程与一份可直接使用的记录表(第 4 节、附录 A),使贡献一可被清点。
贡献三(诊断层):给出以"档案厚薄 × q 高低"为轴的二维辨别装置,识别出代走光泽格——档案很厚而延长线走不出来。该格具备三个签名:短期指标全面改善、失效不产生信号、越正规化越严重(第 5 节)。
贡献四(经验层,最稳、最易检验):对两份独立标准合计 84 个类的三项事先登记审计,得出"记录体系只有签发方时间,没有持有者时间"这一可复算的结论(第 6 节)。
四项贡献是分层的:贡献一若被推翻,贡献四仍然成立,且其本身已是一件值得动手去补的事。
1.4 结构安排
第 2 节回顾邻近文献与现役实务,指出尚未被占据的位置;第 3 节构造理论;第 4 节给出测量;第 5 节给出辨别装置与机制解释;第 6 节报告三项审计与一项预注册的待做检验;第 7 节报告五类制度场景;第 8 节讨论;第 9 节列出三处反过来削弱本文的约束;第 10 节局限;第 11 节证伪条件与一条写死日期的赌注;第 12 节自反性说明;第 13 节结论。
2 文献回顾与本文的定位
2.1 三种现成回答及其共同的失效点
关于"人工智能时代毕业生靠什么",现有回答大体分三种。
第一种:更高级的技能。低阶、重复、可陈述的工作被接管,剩下分析思维、创造性思维、复杂问题解决等(World Economic Forum, 2025)。其失效方式是内生的:清单一旦公开,所列各项即开始被课程化、被批量供给。稀缺不源于高级,而源于难获得;获得路径一旦写成教学大纲,稀缺物即变为入场券。清单越权威,磨平越快。
第二种:与机器协作的能力。其失效方式同样内生:工具厂商的核心目标正是压低使用门槛;且这类能力天然可陈述、可演示、可写入简历,因而立刻落回第一种的命运。
第三种:位置与关系。行业、地域、家庭、时机决定大半(Thurow, 1975; Hirsch, 1976)。这一支多半正确,但回答的是另一个问题:它解释谁能存留,不解释谁被认作有能力。
三者的共同失效点是同一个:它们都默认,那个要被评价的东西还能显露出来。争论集中在"该看哪一样",无人追问"这几样还看得见吗"。
2.2 十种邻近说法与本文的分界
表 1 逐条给出判定形式。本文的立场是:"更强调""更深入""视角不同"不构成分界;说不出判定形式,即等于承认被覆盖。
表 1 与十种邻近说法的分界及其判定形式
| # | 邻近说法 | 它说到哪一步 | 分离线 | 判决性对照预测 |
|---|---|---|---|---|
| 1 | 专用人力资本(Becker, 1964) | 有些技能只在特定组织值钱 | 它讲技能的适用范围,本文讲技能与持有者之间的绑定是否可见 | 不换组织而档案由工具代做:本文判其落靶格,它预测无变化 |
| 2 | 隐性知识(Polanyi, 1966) | 我们所知多于所能言说 | 隐性知识是存量,脱稿步是显露事件 | 完全可言说的知识亦能产生脱稿步(当场做出未准备的推论),该族预测不出 |
| 3 | 信号理论(Spence, 1973) | 昂贵到不可伪造的信号才可信 | 它测信号的成本,本文测信号与所指之间的绑定 | 昂贵信号成本回升(如恢复闭卷手写)而 q 不回升 → 本文对、它错 |
| 4 | 让分原理(Zahavi, 1975) | 累赘因昂贵而诚实 | 它要求信号昂贵,本文要求信号不可预备 | 便宜而不可预备的追问:本文预测有判别力,它预测没有 |
| 5 | 位置财与岗位竞争(Hirsch, 1976; Thurow, 1975) | 文凭是排队号码牌 | 它们说排队,本文说队列已不可读;可共存 | 队列位置分布不变而承认标准转移的时期(本文预测工具普及后 3–7 年) |
| 6 | 适应性专长(Hatano & Inagaki, 1986) | 惯例型专长 vs 适应型专长 | 那是对个体的分类,本文是对账本的诊断 | 两位适应性专长相同者,机构一设追问一不设:本文预测承认差异巨大,该族预测无差异 |
| 7 | 可托付专业活动(ten Cate, 2005) | 按活动类别授予托付等级 | 它前瞻、按类别;本文回溯、锚定此人这一件产物,判据在追问那一刻生成 | 托付等级高而答不出关于自己上周病历的延长线追问:它判合格,本文判落靶格 |
| 8 | 挑战应答式认证(密码学) | 不可重放的现场应答 | 结构同构;它验证持有静态密钥,本文验证走过一段不可复制的路 | 以随机题库替换锚定追问:它照常有效,本文预测判别力大幅下降 |
| 9 | 预测便宜、判断值钱(Agrawal et al., 2018) | 工具压低预测成本,判断成为互补品 | 它讲要素价格,本文讲要素归属的可核性 | 判断由工具生成而本人能推下去:本文判合格,它无从判定 |
| 10 | 结构化行为面试(实务) | 过去行为预测未来行为 | 它问叙述,而叙述是最易被代做的一环 | 回溯编码区分"要求叙述"与"要求在本人材料上推进":本文预测只有后者与后续胜任评级相关 |
十家共同踩着的第二层前提。逐一问"它把什么当作给定",九行归于同一句:
一个人的能力,原则上可以在他不在场的时候,由他留下的东西来代表。
承认这句不成立,上述各家都须重写其测量端。需要立刻补充一句:这句前提在过去是真的——它不是错误,是过期的真理(论证见 5.3 节)。
2.3 最近的一位:现役实务中的交互式口头评估
有一位比表 1 中任何一位都近,且是在本文初稿完成之后的敌意复查中才被找到的。此处如实记录这一遗漏,它是本文写作过程中的一处真实失误。
近两年,英语高等教育中迅速铺开一种称为交互式口头评估(interactive oral assessment, IOA)的做法。一所大学的两位教师已连续运行两年:学生就自己已提交的作业与教师进行结构化对话,以追问探查其推理而非核对记忆;因问题因人而异、实时展开,故难以外包——机器可产出文本,却撑不住一场关于本人作品的追问(Richter & Dodd, 2025)。另有面向本科生物科学课程的实证研究,报告该形式对包括生成式工具误用在内的学术不端具有抗性(Assessment & Evaluation in Higher Education, 2025)。
必须承认:这套做法与本文第 3.4 节的四条约束几乎逐条同形。若本文的落点停在"应当用这种追问来评价人",则本文只是这套现役实务的事后理论包装。
分界只有一条,即本文 3.3 节的落点:
那套做法是在验证一个事实;本文说的是构成一份凭据。
表 2 将其展开为四处可判的差别。
表 2 验证与构成:本文与交互式口头评估的四处差别
| 维度 | 交互式口头评估 | 本文 | 判定形式 |
|---|---|---|---|
| 待测量 | 预设存在(这份作业是不是你写的),追问是取样 | 主张不存在,追问是生成 | 若能在人机连续产物上做出可复现、判者间一致的贡献分解,本文第一层即伪(见 11 节 F9) |
| 动因与人群 | 学术诚信,默认代做是违规 | 明写"没有人在造假",指向结构性解绑 | 取一批工具使用完全合规、披露完整者:诚信路径判其无问题,本文预测其中仍有可观比例落入靶格 |
| 作用域 | 课程之内;读数进入课程成绩 | 课程之外;缺口正在无课可上的在职者身上 | 查其读数是否曾进入可携带凭据(第 6 节审计给出否定答案) |
| 时间结构 | 产出签发型凭据:通过即登记,此后不再到期 | 要求持有者时间:效力挂在最近一次续签上 | 两年前表现优异、今日答不出:它不作处理,本文判署名已失效 |
这一发现同时为本文提供了一处正面证据:该做法出现在教育系统而非用人系统,恰与 5.4 节的三条稳定条件一致——课程内候选人不过剩、判者本来在场、时滞短。它出现在缺口最浅处,而在缺口最深处(大规模匿名的用人筛选)至今未出现。
2.4 尚未被占据的位置
综合 2.1–2.3,本文所处的位置可精确表述为三点:(i)不是更好的测评方法,而是关于竞争力是什么的主张;(ii)不是诚信问题,而是诚实情形下同样成立的结构性解绑;(iii)不是缺一个字段,而是记录体系在时间结构上的系统性偏侧。
3 理论框架
3.1 三个来源领域
为避免与就业研究内部共享过多前提,本文取三个与劳动力市场无关的领域。
3.1.1 把优劣合成一个可携带指数。动植物育种在 20 世纪三四十年代解决过结构相同的难题:个体身上有多个可测性状,价值不一且彼此相关,如何挑出最优者?答案是选择指数:按经济权重把各性状合成一个数,使其与总遗传价值的相关最大化,再按此数排序(Smith, 1936; Hazel, 1943)。两条内部主张需记住:其一,补偿原则——该法明确允许某项的多余优点抵消另一项的轻微缺陷,"优"因而被定义为可加总、可折算的量,此法在与逐项设卡淘汰的竞争中以效率胜出(Hazel & Lush, 1942);其二,该总分挂在个体身上,因为它要预测"用此个体作亲本,下代能改进多少",故必须随个体走。其立场:看显露出来的加权总分就够了。
3.1.2 把同一顶点按到达方式重新计价。登山界很早发现"登顶了"这句话不含信息量——用直升机上去也是上去。于是攀登被划为若干种游戏,每种由一串"不许"定义:不许固定绳、不许膨胀钉、不许补氧、不许提前铺路。两个特征反常识:规则负面表述而目的正面——保住根本挑战不被技术侵蚀,技术每让一事变易,规则即多加一条禁令(Tejada-Flores, 1967);判定权在共同体手中且可事后追认撤销——一次极著名的首登声称因拿不出足以服人的路径物证,在数十年后被整个共同体划掉(UIAA, 2002)。其立场:看它经什么路径做成就够了;显露本身不算数。
3.1.3 把个体差异按定义清零。群落生态学中的中性理论假设同一营养层内所有物种的所有个体在出生、死亡、扩散乃至成种的人均速率上完全等价;物种在形态、生理上可以千差万别,只要人均生命速率不差,模型即成立(Hubbell, 2001, 2005)。其立场:看那片条件场就够了;个体高下不必进入模型。
三者不可通过"判谁对"化解。同一次交付,第一家计出总分,第二家可能计零(若总分靠被禁手段取得),第三家称此分差本不该进模型。三者不在同一语域作答,而共用的标尺并不存在。唯一出路是下探:它们共同站在什么上面,才使这场争论有意义?
3.2 共同前提及其反证
共同前提:
一个个体的"优",是可以脱离具体显露场合、随身携带、跨场结转的东西。
育种将其写成与环境无关的总遗传价值;登山把风格声誉追认给攀登者本人,此后随身;中性理论取消个体间差别,却仍把"等价"按人均安在个体头上。三者争的是这份"优"记在谁名下、算多少,而"它是可有归属、可随身走的东西"被共同视为不必论证。
反证来自最依赖它的那一家自己,且在该领域内部属常识,只是从未被用来回答"优是否随身"。表 3 列出三件材料。
表 3 推翻共同前提的三件材料(均来自第一来源领域自身)
| 类型 | 内容 | 出处 |
|---|---|---|
| 形式化 | 同一性状在两个环境中,形式上应被当作两个遗传相关的性状,而非同一性状的两次测量;仅当相关系数等于 1 时跨环境结转才成立 | Falconer (1952) |
| 实测值 | 国际种畜评估常年公布跨国遗传相关矩阵,产奶等核心性状的跨国相关显著小于 1;其直接后果不是分数缩水而是排名重排 | Interbull 例行评估;参见 Schaeffer (1994) |
| 制度事实 | 因重排普遍存在,国际评估于 1990 年代中期放弃全球统一榜,改按各国尺度分别出榜——在全球最大的遗传评估体系的正式产出中,"世界最优个体"这一栏不存在 | Schaeffer (1994) 及此后的多国评估实践 |
结论:
"优"不是随身之物,而是配对读数。离开具体条件场,它不缩水,它换算;换算带折损,折损率为 1 减去该相关系数。
方法学声明(双重身份):本文的分析工具取自第一来源领域,而被推翻的共同前提亦由该领域自身材料推翻。此处有一条硬约束:用于推翻的只能是它测出来的东西,不能是它主张的东西。表 3 三件均为观察结果与制度事实;其主张("优可合成为可携带指数")正是被推翻的对象,不得同时充当推翻工具。
3.3 从"优不随身"到"可续签的署名"
命题的推导分六步,每步都短。
第一步:若"优"不随身,则随身的只剩一件事——此人走过某段路,而路会改写走它的人。这是历史事实,不是存量。
第二步:历史事实自身不显露,历来靠代理显露(文凭、作品集、绩效、推荐信)。
第三步:这些代理共享同一挂点(1.2 节)。
第四步:挂点被一次性剪断,全部旧代理同批失效。
第五步:还能显露"路改写过此人"的,只剩一种形式:把他放回自己那件产物的延长线上,当场索取一步未经预备的动作。
第六步(本文的落点):上述五步只说到"该看哪里",未说清被看的那个东西是什么。通常的答案是"谁做的变得难以核实了",据此加强核实——查重、检测、留痕。该答案预设"谁做的"仍是一个已存在、只是暂时看不清的历史事实。
本文主张该预设不成立。一份由人给出方向、由工具生成主体、由人做最后取舍的产物,"它是谁做的"不存在一个等待被查明的答案:这里没有隐瞒者,也没有被隐藏的真相;参与是连续的、交织的、逐句不同的。要求指认唯一作者,近似于要求指认一场合唱中"这个和弦是谁唱的"。
由此得到命题 1(承重命题):
人工智能时代大学毕业生的核心竞争力,不是一份能力存量,也不是一次被验证过的作者身份,而是「可续签的署名」——署名是一份没有到期日、却已经会到期的凭据,其效力只能在自己产物的延长线上被当场重做。
推论 1.1:脱稿步不是一种考核手段,而是这份凭据被续签的那个动作本身。这是本文与一切"更好的测评方法"的分水岭:测评方法预设一个待测量,追问只是取样;此处没有待测量——追问不是在读一个数,它是在生成那个数。
推论 1.2:读数 q 测的不是能力,而是署名的续签成功率。因此 4.1 节"分母只能是已发起的追问次数"不再仅是技术规定,而是该凭据定义的一部分:一个从未被追问过的人不是 q 为零,而是其署名从未被要求续签。
推论 1.3:辨别装置必然是二维的。若署名是事实,一根轴即足够(做没做);正因署名是凭据,才必然有"凭据在手"与"凭据现在还灵不灵"两件独立的事——档案是前者,q 是后者(第 5 节)。
3.4 定义 1:脱稿步的四条约束
定义 1 脱稿步(off-script step)指同时满足以下四条的一次动作:
(一)锚定本人产物。不是通用题,而是他自己交出的这一件。通用题可刷,锚定追问不可刷——题目的一半由他自己写就,而出题人事先并不知道他会交什么。此条同时保证不可预备性与可判性(判者手中有其产物作为对照)。
(二)在延长线上。不是复述已有内容(那是记忆),而是往前推一步。三种合格形态:换口径重算;往下推一步(若此结论成立,接下来必然出现什么);指出其在何种条件下会塌。
(三)无脚本。不预告、不给题库。此条最贵也最脆:它带来本文的全部判别力,也带来本文最严重的反噬(8.3 节)。
(四)可核。走出的那一步须能被当场判对错或判合理,非印象分。
边界厘清(三种像它而不是它的东西):压力面试测情绪耐受;刁难细节考记忆——判法:该问题的答案在提问之前存在吗?存在者为记忆题,须在应答那一刻被做出者才是脱稿步;"讲讲你的项目"是复述,而复述恰是最易被代做的一环。
3.5 定义 2:签发方时间与持有者时间
命题 1 把竞争力改写为"会到期的凭据",随之带来一个可查的问题:现行记录体系如何处理"到期"?第 6 节给出审计结果,此处先给出所需的两个概念。
定义 2a 签发方时间:凭据的有效期、撤销与更新,由签发方的日历与行政判断决定。
定义 2b 持有者时间:凭据是否仍然有效,取决于持有者此刻能否将其续上。
命题 2:现行学习与用人记录体系只有签发方时间,没有持有者时间。
命题 2 强于"缺一个字段":缺席可通过增设一栏补上;偏侧不能——在签发方一侧增设任意多栏,都不会长出持有者一侧的时间。
3.6 三个来源领域在命题 2 上的分工
三者在此各贡献一块,且不可互换:
删去任一家,命题 2 塌一角。
4 测量:脱稿成立率 q
一个不能被清点的判断只是感叹。本节把命题 1 做成可操作的读数。
4.1 定义与计算式
读数名:脱稿成立率 符号:q
定义:在一段时期内,针对某人名下产物发起的全部延长线追问中,其应答被判为成立的比例:
q =(判为成立的次数 + 0.5 × 判为部分成立的次数)÷ 已发起的追问总次数
分母纪律:分母必须是已发起的追问次数,不得包含"应当发起而未发起"的次数。后者不可清点;一个从未被追问过的人,其 q 无定义而非为零(推论 1.2)。空位按定义数不出来,一旦写入分母,该读数即废。
4.2 编码规程(七条)
规程 1(粒度) 一次追问 = 一个锚定问题 + 一次完整应答;中间的追加澄清计为同一次。边界例:问"这个跳点是什么原因",答"口径问题",再追问"换成下单口径会怎样"——计一次(第二问是第一问的完成);若转向同一份报告的另一张图,计第二次。
规程 2(锚定判定) 追问须指向被评者名下具体产物的具体部位。通用情境题、行业常识题、假设性案例题不计入分母。操作判法:把该问题原样交给另一位候选人,若他也能答,则不是锚定追问。
规程 3(在场与查阅) 应答须在场完成。允许查阅本人原始材料(数据、代码、笔记),不允许离场准备、求助他人或工具。允许查阅的理由:走过路的人知道去哪里查;此条与规程 5 配合,构成全套规程中区分力最强的一对。
规程 4(判定与不一致率) 由两名判者独立给出成立/部分成立/不成立;不一致时按偏严一侧计,并单独记录不一致率。不一致率高于 0.30 的场次整场作废——该情形指向追问本身出得不清楚,而非被评者的问题。(该阈值为设计值,尚未实测;见 6.6 节与第 10 节。)
规程 5(部分成立) "我不知道,但我知道该去看哪里、看什么、大概会看到什么"计部分成立(0.5)。此条是全套规程中最要紧的一条:它把"记住了"与"走过了"分开——走过那条路的人即使忘了细节,也知道路的形状;未走过的人连该往哪儿找都说不出。
规程 6(零分与不适用) 拒答、顾左右而言他、把问题重新解释成另一个自己能答的问题,计零。以下三种记不适用,不得记零:团队产物中无法界定本人承担部分;涉及保密无法当场展开;被评者当日健康或语言条件明显受限。
规程 7(口径唯一) 本文正文、检验条款(第 11 节)与赌注三处引用的 q,使用同一定义、同一套规程、同一粒度。一个读数若在三处用三种粒度,写死日期的赌注即无法裁决,而不可裁决的赌注等于没有赌。
记录表见附录 A;编码示例见附录 B。
4.3 q 的使用限制
(一)不得跨机构直接比大小。依据来自第一来源领域自身的教训:可遗传性随环境而变,同一量在不同场中不是同一量。q 是场内读数——同一机构、同一套判者、同一时段内可比;跨机构比较须先报告场差,或不比。
(二)不得用于排序发薪、一票否决或解雇的单一依据(伦理三条见 8.5 节)。
(三)不适用于尚无"自己名下产物"的人群(如在校低年级学生),锚定追问的前提是有东西可锚。
5 辨别装置与机制
5.1 二维四格
表 4 辨别装置:档案厚薄 × 脱稿成立率
| q 高 | q 低 | |
|---|---|---|
| 档案厚 | ① 实走者 | ② 代走光泽格(靶格) |
| 档案薄 | ③ 被低估者 | ④ 常规格 |
① 实走者:产物与路径仍绑在一起。要点:在代理制年代,此格是默认——凡档案厚者几乎必在此格;今天它不再是默认,而是一个需要被单独确认的结果。本文的实践含义可压缩为这一句:从前不必确认的事,现在必须确认。
② 代走光泽格:档案厚而延长线走不出来。按推论 1.3,它不是"造假被抓"的那一格,而是持有一份已经过期、却无人有权宣告其过期的凭据的那一格。
③ 被低估者:路走过了,但未变成可展示的产物——项目烂尾、单位不给署名、缺乏包装资源、岗位不产出成果。本文对此格作一条明确预测:它是价值重估幅度最大的一格。理由是对称的:当产物不再能证明能力,产物的缺席也就不再能证伪能力。
④ 常规格:路没走,产物也没有。判定它不需要本文。
为何靶格是②而非④:一个需要用框架才能看见的靶格才是真靶格。④一眼可见,任何人都不需要这套装置。
5.2 靶格的三个签名
签名一:短期指标表现为改善。不是"看起来还行",而是各项指标真的更好:产出更多、交付更快、格式更规范、文档更完整。管理者看到的是一次成功的效率提升,而该判断在其自身的时间尺度上是正确的。
签名二:失效不产生任何信号。现行流程中没有任何环节负责发起延长线追问:面试问通用题,考核看交付物,评审看成果,晋升看履历。缺口不是"被发现得晚",而是没有任何装置会发现它。后果的形态是:落入②格者可能三年内一路顺利,直到遇到一件必须自己往前推一步的事——一次没有先例的故障、一个客户临时改了口径、一份没有模板可循的判断。届时缺口第一次显影,而此人可能已带团队。信号来得太晚,且以最贵的形式到达。
签名三:自我加固。越代走,档案越厚;档案越厚,越无人好意思追问——资历本身屏蔽追问。问一位新人"这个跳点怎么回事"是正常面试,问一位工作八年者同样的问题会被读作冒犯。缺口越大,被光泽盖得越严。
三者合起来解释一个反直觉现象:该问题会随评价体系越正规化而越严重——越正规的体系越依赖可归档、可比对、可审计的材料,而这些材料恰恰最易被代做。
5.3 机制:以产物代理路径,在其自身范围内是正确的
指出缺口只完成三分之一。缺口不会自己出现,它是被某一步操作压掉的;要证明这是机制而非事故,必须找到那一步并证明那一步是正确的。
那一步是:以产物代理路径。其正确性有三层,一层比一层硬:
第一层:它便宜一个数量级。
第二层:在产物只能由本人做出的年代,它是无偏估计——噪声有,系统偏差无。用一个无偏且便宜的估计替代昂贵的直接观测,是任何工程师都会做的选择。
第三层(最硬):在那个年代,直接观测路径反而更差。路径观测需要判者在场、需要主观判断、需要为每人单独安排,因而引入判者之间的分歧与机会的不平等——谁被资深者带过,谁就被看见。以产物代理路径不仅便宜,而且更公平、更可审计、更能抵抗人情。20 世纪的考试与文凭制度正是靠这一点战胜荐举制。
机制/事故判别句:把这一步改对,缺口会消失吗?改对它意味着回到"产物是路径无偏估计"的世界,而该世界的成立条件(做出它只能由本人走)已经过去。改不回去。因此这不是失误、疏忽或资源不足,而是一个在自身条件下正确的操作,在条件改变后留下的缺口。
推论(处方形态):不应责怪任何环节的执行者。招聘官没有偷懒,教务处没有失职,人力资源部门没有失察——他们执行的是一个曾经正确的设计。要改的是设计,不是执行。
5.4 稳定条件与边界条件
缺口能长期存在而不被察觉,需要三条同时成立:
条件 1(供给过剩):合格候选人多于岗位时,筛选方无动机做更贵的观测。追问是只有在"选不出来"时才值得付的成本。
条件 2(成本无科目):一次锚定追问需判者事先阅读被评者产物,通常 15–30 分钟,两名判者则加倍;这笔时间在多数机构的招聘预算中没有对应科目,因而永远排在最后。
条件 3(反馈时滞):错判的后果通常在 2–4 年后显露,届时决策者可能已换人,反馈回不到评价环节。没有反馈的系统不会自我纠正。
边界条件(三条全部不成立之处):熟人劳动市场——师徒制、家族企业、小镇诊所、乡村学校。那里候选人不过剩、判者天天在场、时滞极短。因此那里不存在本文所说的缺口:路径不需要被记录,因为它从未离开视野。
由此得到一条尖锐的推论:本文所描述的缺口是大规模匿名筛选的副产品,而非人工智能的副产品。人工智能只是把它从潜在变为现实——它一直在那里,只是从前有一根绳子替我们兜着。
6 研究设计与三项字段审计
6.1 总体设计
命题 2 是一个关于现存文档的经验主张,可用最低成本检验:去查账本里有没有这个字段、失效由哪一侧触发。本文执行三项审计,均在读取数据之前写死三件:判负条款、不利结果处置、停止规则。
表 5 三项审计的设计与结果概览
| 审计一 | 审计二 | 审计三 | |
|---|---|---|---|
| 对象 | 学习记录互操作标准 A(1EdTech CLR 2.0,2024-04-02 候选终版) | 同上(同一份对象) | 学习记录互操作标准 B(欧洲学习模型 ELM,本体 v3.2.0) |
| 来源 | 美国主导的非营利标准组织 | 同上 | 欧盟委员会(EMPL 总司) |
| 单位 | 共享凭证数据模型 32 个类 | 同上 | 本体 52 个类及其对象/数据属性 |
| 检验问题 | 有无记录该动作的带类型字段 | 失效触发条件在哪一侧 | 两个问题同时检验(独立复算) |
| 结果 | 0/32 命中判负条款;强主张按自设条款判负 | 0/32;三类失效机制全在签发方一侧 | 0/52;独立复算成功,两个结论均复现 |
| 独立性 | — | 与审计一共用对象,非独立样本 | 与前两项来源、机构、法域、技术谱系均不同 |
6.2 审计一:是否存在带类型的字段
事先写死:(判负条款)若在标准中找到任一具名字段,其定义要求记录"学习者在其自身既有产物延长线上的一次即时、非预设的应答",则"账本无此字段"判负。(不利结果处置)无论方向如何原样写入,不改主张再跑第二份。(停止规则)只查该标准正式发布版本的共享凭证数据模型这一份清单,逐类查完即停。
结果:0/32 命中。三个最接近者均不是:证据类定义为"支持某项主张的信息,例如指向学习者所产出物件的链接"——记的是物件;成就类挂"达成标准",属预先写定的条件,与定义 1 第三条直接冲突;结果类挂评分量表与等级描述,同样预设。
两处不利结果,原样写入。其一,该标准设有背书机制:当个人对自身知识或技能做出自我断言时,认可机构可出具背书表示同意,背书凭证带有与成就凭证大体相同的元数据并允许附加文字说明——这是一个可以把脱稿步塞进去的自由文本插槽。其二,该标准明写数据模型可扩展。
因此"账本里没有这个字段"这一强主张,按本文自设条款判负。修订后仍成立的是:
账本中没有为它设置的、带类型、可比较、可加权、可被查询的字段。它只能以非结构化叙述附着于其他字段,因而进不了任何排序、筛选与绩效计算。
此句弱于原句而更准,并把本文推到更硬的位置:缺的不是存储空间,是可比较性。一件事只要不能被比较,在任何选拔制度中即等于不存在——哪怕它被完整记录。
6.3 审计二:失效的触发条件在哪一侧
事先写死:(判负条款)若存在任一字段,其失效或撤销的触发条件绑定于持有者当下的一次表现,则"失效只由签发方一侧触发"判负。(处置与停止规则同上。)
先报告不利于本文初稿的发现:该标准有失效机制,且不止一处。第一类,有效期——断言元数据带签发日与到期日;第二类,凭据状态——数据模型设有专门的类表达凭据当前状态,撤销通过它表达,用例中亦明确写到证照被吊销或失效的情形;第三类,刷新服务——持有者钱包可据此回到签发方拉取最新版本。故"记录体系里根本没有到期这回事"这句话是错的,此处划掉。
但三类并排即见其共同点:触发条件全部落在同一侧。有效期由签发时预设的日历决定,与持有者此后所为无关;撤销由签发方的行政判断触发(发错了、资格取消了、政策变了);刷新是回到签发方去问最新状态。
逐类核对:0/32 命中判负条款。
6.4 审计三:在一份来源独立的标准上复算
动机:审计一与审计二共用同一对象,不是两个独立样本。为消除这一缺陷,本文在一份来源、机构、法域与技术谱系均不同的标准上重跑同样两个问题。
对象:欧洲学习模型(European Learning Model, ELM)本体 v3.2.0,由欧盟委员会就业、社会事务与包容总司下属单位维护,为欧洲数字学习凭据(EDC)、资历数据集登记(QDR)等应用剖面提供统一词汇;官方说明称其在各应用剖面上共有五百余项属性。本次审计单位为本体列出的 52 个类及其对象属性与数据属性清单。
事先写死:判负条款、不利结果处置与停止规则与审计一、二逐字相同,仅替换对象;停止规则限定为"只查本体文档所列的类与属性清单,查完即停,不追加应用剖面的 SHACL 约束文件"。
结果 A(对应审计一的问题):0/52 命中。最接近的三处均不是:
结果 B(对应审计二的问题):0/52 命中判负条款,且失效机制族更完整。本体中与失效相关的至少有五处:到期日(expiryDate 数据属性);凭据状态类(定义为"关于某可验证凭据当前状态的发现信息");权利状态(entitlementStatus,挂在学习权利规范上);审查日期(reviewDate,挂在认证/质量保证上);核验检查类及其状态属性。逐一考察其触发方:到期日由签发时写定;凭据状态由签发方维护;权利状态与审查日期由主管或质量保证机构掌握;核验检查是验证方对凭据完整性的检查,检查对象是凭据本身而非持有者的表现。
结论:两份来源独立的标准,在两个问题上给出一致结果。命题 2 由此获得一次独立复算:
现行学习记录体系只有签发方时间,没有持有者时间。
代理变量与覆盖率:两份标准均属学历与学习凭据一侧;企业人力资源数据交换标准与各国学历核验系统尚未审计,留作复算(见第 11 节 F10)。
6.5 三项审计共同的方法局限
本文读取的是标准的类定义、术语表与属性清单,不是每个类的全部属性的逐条穷举,也未读取各应用剖面的约束文件。若某类的某个属性带有本文所需语义而未在上述文档中体现,本次审计会漏掉它。这是一处真实的分辨率不足,不作辩解。其方向是保守的还是激进的,本文无法先验判断:漏掉一个字段会使结论偏向本文,因此第 11 节 F10 将复算列为优先待办。
6.6 研究四(预注册的待做检验):判者一致性
规程 4 中 0.30 的不一致率阈值为设计值而非实测值。本文在此给出一份可直接执行的预注册方案,并明确声明该研究尚未实施,其结果不进入本文任何结论。
设计:在单一机构内,招募两名经培训的判者,对同一批被评者的同一批锚定追问独立评级(成立/部分成立/不成立)。追问由第三方按定义 1 生成,判者互不通气。
主要终点:两判者之间的加权 kappa 一致性系数。
样本量:以 Donner & Eliasziw (1992) 的方法,取零假设 κ₀=0.40、备择 κ₁=0.70、α=0.05(双侧)、检验功效 0.80、三分类近似等边际分布,所需追问次数约为 110 次;按每位被评者 3 次追问计,约需 37 人。本文取 N=120 次追问(40 人)以留出不适用与作废场次的余量。
判负条款(事先写死):若加权 kappa 的 95% 置信区间下界低于 0.40,则规程 4 不可用,脱稿成立率 q 在当前编码规程下不具备可复现性,第 4 节须整体重写。
为何这是本文最优先的一项:q 的全部合法性依赖于两名判者能否对"成立"给出一致判断。若不能,本文的贡献二与贡献三同时塌陷,而贡献一与贡献四不受影响(分层引用见 13 节)。
7 五类制度场景
第 3.5 节的两类时间是否有现实对应?本节以一句不含任何程度词的判据询问五类制度:
在这家机构的录用与考核流程中,"交付合格之后、锚定本人产物的当场追问或变体重做"被记录在哪个字段、占多少权重?
五个答案互不相同,其中两个(场景四、场景五)推翻了本文的先验预期。
表 6 五类制度场景的判据答案
| 场景 | 追问是否发生 | 是否进入字段 | 是否可携带 | 时间类型 |
|---|---|---|---|---|
| 一 · 高校学位答辩与课内口头评估 | 是 | 部分(见下) | 否 | 签发方 |
| 二 · 公务员考录 | 否(非锚定) | 是(面试分) | 否 | 签发方 |
| 三 · 软件业代码审查 | 是 | 否 | 否 | 签发方 |
| 四 · 民航飞行员定期检查 | 是 | 是 | 是(绑定执照) | 持有者 |
| 五 · 学术同行评审 | 是 | 是(对稿件) | 不适用 | 对象不是人 |
场景一 · 高校学位答辩与课内口头评估。答案分两半,第二半推翻了本文初稿。前一半:学位答辩中追问确实发生(委员会当场提问、锚定本人论文),但追问表现不进入成绩单的任何字段——成绩单上只有"通过/不通过"与总评等级,追问内容与应答质量留在答辩记录中,此后不再被任何人读取。后一半:2.3 节所述的交互式口头评估有评分量表并计入课程成绩。因此"答辩类追问一律不进字段"这句话是错的,此处划掉。修订后的准确表述:它进入课程成绩,不进入任何可跨机构携带、可查询的凭据——按定义 2,它产出的仍是签发型凭据,一次登记,此后不再到期。
场景二 · 公务员考录。面试环节权重公开(多地占最终成绩的一半),但测评要素为通用素质清单(综合分析、计划组织、人际沟通、应变),不锚定考生自身的既有产物。按规程 2,此类一律不计入分母。权重很高,锚定为零。
场景三 · 软件业代码审查。这是既有实践中最接近脱稿步者——审查者对着此人提交的这段代码提问,问题往前推("并发情况下这里会怎样""这个边界值你试过吗")。但其记录形式为逐条评论与"通过/需修改",没有任何字段记录提交者当场回应的质量。动作齐全,读数被扔掉。
场景四 · 民航飞行员定期检查。这是五类中唯一把持有者时间写入正式字段者:周期性模拟机复训与检查中,检查员临时植入未预告的异常状态,考察机组处置;结果以"合格/需补训/不合格"记入个人技术档案,并直接绑定执照有效性。本文原本预期没有任何场景会命中,而它命中了。它同时给出边界条件:该字段之所以能存在,依赖失效后果极端、监管强制、成本全行业分摊三者同时成立——同时具备这三条的场合,全社会大概不超过几个。
场景五 · 学术同行评审。追问发生(审稿意见锚定本稿),但它测的是稿件而非作者——作者身份常被匿名化,评审结论不写入任何关于作者能力的记录。追问的对象是产物,不是人。此条反过来给本文加了一条限制:一个成熟的、以追问为核心的制度,可以完全不产生关于人的读数。
五个答案的分布本身即是一项结果:不进字段(一)/权重高但不锚定(二)/动作有而读数被扔(三)/完整写入字段(四)/对象不是人(五)。只有第四个是完整的,而它是社会成本最高的那一个。
8 讨论
8.1 三项发现的合并含义
三项审计给出一条比"缺一个字段"更硬的结论:记录体系在时间结构上系统性偏侧。这一结论解释了三件此前解释不了的事。
其一,为什么学历越老越不被追问。在签发方时间里,一份 2018 年的学位与一份 2025 年的学位效力完全相同——两者都未到期、都未被撤销。年份在这套时间里只是属性,不是损耗。资历因此天然屏蔽追问(签名三的机制来源)。
其二,为什么"增设一门课"这类对策注定无效。它增发的是新凭据,而问题不在凭据不够多,在已发出的凭据无法在持有者一侧到期。
其三,为什么场景四是唯一完整的一例。它是本文查到的唯一把执照有效性绑定在周期性、未预告的当场处置表现上的制度,而其存在条件苛刻到几乎不可复制。
8.2 对三方的启示
对毕业生。其一,保留一条自己走过的路,并知道它在哪儿:不必多,一件足矣,包括做错的部分、绕过的弯路、最后没解决的那个问题。烂尾的项目不是污点,而是延长线最长的那种材料——因为你知道它卡在哪里,而卡住的地方是代做不出来的。其二,用工具,但保留判断的落点:判断的痕迹不在结论里,在被放弃的那些选项里。其三,主动求追问:缺口在被雇佣之前暴露,代价最小。
对大学。本文的处方不是加课,而是在已有环节上装一个读数口。场景一显示,答辩中的追问已经发生,只是读数被扔掉;把它捡起来的成本接近于零。课程层面最便宜的改动,是在既有作业与实验中加一个延长线环节:交完之后随机抽取一部分学生,就其自己交的这一份问一个往前推的问题——抽样即可,不必普测(理由见 8.3 节)。
对雇主。场景三显示,代码审查已在做锚定追问,只是不记读数;最便宜的改动是把已有动作的结果记下来,而非新增流程。招聘中把"讲讲你的项目"换成"就你交的这份材料,往前推一步",同样时间,判别力完全不同。晋升中须格外小心:q 越往高层用越危险——签名三说明高层最不习惯被追问,而对高层追问最易被读作羞辱;建议仅在新岗位交接时刻由交接双方共同参与,而非作为定期考核。
8.3 反噬预言:最省事的实现方式会毁掉它
把延长线追问标准化成一套题库。
这几乎必然发生,且不因有人心怀恶意,而因机构需要可比、可培训、可审计的东西,而无脚本恰恰不可比、不可培训、不可审计。一个不能培训的环节,在任何有培训部门的机构里都活不过两年。题库一出,次日即有人开始刷;刷完之后,脱稿步变回脚本步,判据自毁。
这不是副作用,而是本文的核心性质:它的判别力全部来自"不可预备",而任何制度化努力都在制造可预备性。
更糟的一层:该读数一旦进入考核,最省事的达标办法通常是在文书上做手脚——把常规问答记成"延长线追问",把 q 做成人人 0.9 的数字。届时它既不再判别任何东西,又占着一个正式字段。
本文看不到出口。能想到的最好办法只是延缓:抽样而非普测(普测必然催生题库)、判者具名并轮换、追问文本随记录留存且可被申诉、明令禁止公布题目样例。因此本文反对将其写入任何普遍适用的评分表,亦反对作为全行业标准推广。它应以抽查形式存在,而非以指标形式存在。一个不能被普遍化的判据在制度上是笨拙的;而它笨拙的原因恰是它有效的原因。
8.4 与同一批两项研究的关系
本文与另外两项处理同一问题的研究互为最近邻,须给出分界。
与《现配优势》(该文主张:竞争差不是存量,而是每次交手由可传构件加一手不入账的配组当场做出的显露;读数为留种率,即把完备交接清单交给同资历者执行后原表现的复现份额)。分界:该文锚在人与场之间,本文锚在产物与走出它的路之间。判决性对照:取一批档案很厚、且从未被追问过的人——该文仍给出读数(交接清单复现份额),本文不给读数(q 在追问未发起时无定义)。反之,若观察到"清单交接后复现率高、而延长线追问答不出"的人群稳定存在,本文对而该文错:这说明优势可被交接(非现配),而此人仍不是走出它的那个。互补:该文解释"带走一个人不等于带走表现",本文解释"看着一份产物不等于看见做它的人";两者叠加时后果相乘。
与《零判份》(该文主张:一次合格产出中有一部分判别力为零——不是低质量、不是抄袭,可能恰是最原创最费力的一段;读数为未见率,即交付日一个本科水平者用公开资源在 30 分钟内能否产出功能等价物)。分界:该文锚在产出与世界现存样本之间,本文锚在产物与路径之间。二者测同一份产出的两件不同的事:未见率高而并非由署名者走出,或未见率为零而署名者确实一步步走过,皆可能。判决性对照:取一人在同组织、同配组、完全不变条件下连续五年的交付——该文预测判别力单调下降,本文对此情形不作预测(q 只在追问被发起时有读数)。这是三项研究间最清晰的一条分界:前两项读产出,本文读一次被发起的追问。若三者在同一份台账上给出相反评价,取发起过追问的那一份为准——因为另两者都在读一个已不能代表人的东西。
一处坦白:三项研究都在处理"能力的显露出了问题",因而不是三个独立发现,而是同一件事的三个切面。本文新增的部分只有一件:把缺口定位在记录端而非能力端,并给出可清点的追问读数。
8.5 伦理
本读数会被拿去考核人,故三条须写死。三条缺一,本文的处方不应被采用。
其一 · 该读数指的是位置,不是人。q 很低者,可能只是从未有人给过他一次可以往前走的追问,也可能其岗位从不产生"自己名下的产物"。把 q 读成"此人不行"是误用——它首先是对机构的诊断。
其二 · 不得为使该数好看而制造追问。尤其不得在有安全后果的岗位上安排突击追问以充实样本。读数服从工作,不是工作服从读数。
其三 · 据此做出不利安排的机构,必须公开编码规程并给出复核通道。当事人有权要求换判者重做,有权查看追问原文与两位判者各自的判定,有权对"锚定是否成立"提出异议(按规程 2,一个另一位候选人也能答的问题不算锚定追问)。
附加一条(常识而非伦理):q 不得用于本科低年级、不得作为实习生转正的一票否决、不得作为解雇的单一依据。抽查读数不承担一票否决的重量。
9 三处反过来削弱本文的约束
一篇文章若三个来源都只在支持它,则这三个来源多半是被挑出来的。以下三处真的削弱了本文,每处都削掉了本文原本想说的一句更强的话。
其一,来自中性理论:本文不得声称脱稿步决定谁能就业。存留大量由行业周期、地域、家庭、时机、第一份工作的平台决定,这些与 q 无关。被削掉的更强主张:"脱稿步是竞争力本身";现只能说"脱稿步是承认的凭据"。适用范围削去一半——本文管"谁被认作是他自己",不管"谁能活下来"。实际后果须写明:q 很高者可能仍找不到工作,q 很低者可能一路顺风。本文不预测就业结果,只预测"当一次锚定追问被发起时会发生什么"。
其二,来自攀登伦理:判据必须由具名共同体持有,并可事后追认撤销。这直接毁掉本文最自然、最好卖的处方——做一个自动化追问装置给所有人打一个 q。理由是硬的:判据一旦交给不具名、不可抗辩的装置,立刻退化为新题库,而题库可刷;被误判者没有可申诉的对象。被削掉的是价值排序:本文宁可要慢的、抽样的、可申诉的人工判定,也不要快的、全覆盖的自动判定。这与效率方向相反,而效率恰是此类方法最易被采纳的理由。本文在此放弃了它最大的一块市场。
其三,来自育种的实测:可遗传性随环境而变。被削掉的更强主张:"q 可以成为一个通用分数"。这是此类读数最有诱惑力的一条路——一个全球可比的数字。本文关掉了它:跨场比较必须先报告场差,或不比。
10 局限
(一)审计的分辨率不足。见 6.5 节:三项审计读的是类定义、术语表与属性清单,非属性穷举,亦未读应用剖面的约束文件。
(二)审计的覆盖率不足。两份标准均属学历与学习凭据一侧;企业人力资源数据交换标准与各国学历核验系统尚未审计。
(三)判者一致性未经实测。规程 4 的阈值为设计值;第 6.6 节的预注册研究尚未实施。这是本文当前最重的一笔欠账——q 的全部合法性系于此。
(四)核心因果主张无个体层面追踪数据。q 与后续胜任之间的剂量—反应关系(F1)尚未检验。
(五)五类场景中有两类来自公开资料的二手描述(场景四、场景五),未做一手核对;若其字段实况与本文所述不符,表 6 的分布结论须改。
(六)本文无法排除选择效应。q 高者是否本来就更愿意接受追问?观察数据不能分离意愿与能力,需随机指派追问的设计。
11 证伪条件与一条写死日期的赌注
11.1 证伪条件
F1(主检验 · 机制证伪) 最强的竞争解释是"这不过是面试老手对生手"(表达能力与临场经验)。故:控制表达能力评分(结构化沟通量表)与既往面试次数后,若 q 与入职 12 个月后的实际胜任评级之间不存在剂量—反应关系,则本判断为伪——届时应归因于一般临场表达能力,而非"路径是否改写过此人"。样本纪律:同一制度环境内 N≥6 个单元(同一公司多部门、同一医院多科室、同一学校多院系),不得以两个国家或两家文化迥异的公司充数。
F2(顺序而非相关) 在同一机构内,追问环节的设立应早于用人偏好的转移。若观察到偏好先变、追问后设,则本文因果方向写反。
F3(锚定必要性) 以随机题库替换锚定追问,若判别力不显著下降,则定义 1 第一条为伪,本文与挑战应答式认证的分界(表 1 第 8 行)随之失效。
F4(部分成立档) 若规程 5 的 0.5 档与"完全答不出"在后续胜任评级上无差异,则规程 5 为伪,本文的核心区分(走过 vs 记住)塌掉一半。
F5(最便宜的一条) 任取一家已做结构化面试的机构,从其既有面试录音中回溯编码:每个问题是"要求叙述"还是"要求在候选人自己材料上推进",再与入职后评级对照。该数据在多数机构的既有记录中已经存在,一人两周可跑完。这是本文最应先跑的一条。
F6(判者一致性) 见 6.6 节判负条款。
F7(反向条件) 若在熟人劳动市场中亦测到同样的 q—胜任关联,则 5.4 节的边界写错,本文的机制解释应让位于更朴素的解释(追问只是好的面试技巧)。
F8(杀死条款) 若在三个不同行业各取一批人,其档案厚度与 q 的相关系数稳定高于 0.7,则②格在经验上近乎不存在,靶格选错,全文作废。
F9(针对贡献一) 若能在人机连续参与的产物上,给出一套可复现、判者间一致的贡献分解方法,把"哪一部分是此人做的"稳定查出,则命题 1 为伪,本文应退回"更好的验证方法"这一族。这是本文最愿意被推翻的一条:若被推翻,问题将有一个远比追问便宜的解法。
F10(针对命题 2) 在企业人力资源数据交换标准、各国学历核验系统中任取一份,若查出任一字段其失效触发条件绑定于持有者当下的一次表现,则命题 2 收窄为"该标准之外成立"。场景四已说明此类字段并非不可能,只是极罕见。
若被证伪,我们学到什么:若 q 与胜任无关,则说明产物与路径的解绑并未真的发生,或市场已找到别的代理。那个代理是什么,会是比本文重要得多的一个发现。
11.2 赌注
赌注:到 2029 年 12 月 31 日之前,至少有三家员工数超过一万人的机构,在其公开的招聘或晋升规程中写入一个锚定候选人本人既有产物的当场追问环节,并说明其在最终决定中的权重。
不算命中者(须写死,否则赌注不可裁决):泛称的"结构化面试""行为面试""案例面试"不算——必须锚定候选人自己提交的材料;仅存在于内部文件、未公开规程者不算;仅要求"讲述你的项目"者不算——讲述是复述,不是延长线;机构自行声明"我们很重视这一点"而无可执行条款者不算;现场编程测试、笔试、案例分析不算——它们锚定的是题目,不是候选人自己的既有产物。
作者押其命中。若到期未命中,本文的判断即便在道理上成立,也说明它挑错了显露形式——届时应回去问:制度实际找到的替代显露是什么?
12 自反性说明
本文是一件产物。
按其自身主张,产物不显露路径,故本文没有资格用自身证明自己。它现在躺在读者面前:结构完整、有表、有数、有事先登记的检验、有自我推翻的记录。这些恰是靶格的签名——短期指标全面改善,形式审查全部通过。
诚实的做法只有一个:把它交给延长线追问。此处先给出三问,供人验:
问一:把 6.4 节的审计对象换成企业人力资源数据交换标准,结论要改哪一句?(提示:该族标准以岗位与胜任力为中心,本文预期其字段更接近"能做什么"而非"走过什么",故修订版主张不变;但若其带有"评估记录"类的结构化字段,6.2 节的修订版须再收窄一次。)
问二:把规程 5("不知道但知道去哪儿看"计 0.5)改为计零,表 4 的哪一格会松动?(提示:③被低估者一格会大幅缩小,因为薄档案者最常见的合格形态正是这一档。)
问三:5.4 节称缺口是"大规模匿名筛选的副产品",那么在完全匿名的开源协作中,为什么反而看得见人?(提示:那里的产物自带过程——提交历史、讨论记录、被拒绝的方案。这是一个对本文有利的观察,但它同时暗示了一条本文没有走的路:让产物重新带上过程,可能是比追问更根本的解法。此条记为欠账,见 13.3 节。)
答不出来,本文即落在自己的靶格里,且本文自己不会发出任何信号。
另有一处更硬的:本文主张判据必须由具名共同体持有并可追认撤销,故本文自己亦必须可被追认撤销。若 11.2 节的赌注被打脸,本文不作修补,作废重写。
13 结论
13.1 主要结论
我们用一个世纪把"看人"这件昂贵的事替换成"看东西"这件便宜的事。该替换在当时是正确的:它使大规模、匿名、抗人情的选拔成为可能,其社会收益怎么估计都不为过。
现在东西与人之间的那根线松了。松了之后,全部旧办法同时失灵——不是某一种失灵,而是同一根线上挂着的所有办法一起失灵。
剩下的只有一个很笨的办法:把人叫到他自己做的东西跟前,问他一句他没准备过的话。它慢、贵、不可规模化、不能自动打分、且随时可能因被制度化而自毁。但它是仅剩的那一个,而它笨拙的理由与它有效的理由是同一个:它要求那个人当场在场。
比办法更要紧的是:我们一直以为问题在于"看不清是谁做的",于是把力气花在看得更清上。这条路走不通,不是工具不够好,而是那个要被看清的东西已经不在了。一旦承认这一点,署名就从"曾经发生过、可被核实"的事,变成"必须不断被重做"的事。它有了时效,而我们的账本仍是永久台账:签发日写得清清楚楚,撤销权攥在签发方手里,唯独没有一栏留给持有者——没有一栏,用来记这个人今天还能不能把它续上。
补这一栏,是本文唯一的请求。
13.2 三层引用
本文可分层引用,读者不必全盘接受:
13.3 四个本文解释不了的洞
1. q 高者是否本来就更愿意接受追问?若选择效应主导,则测到的可能是意愿而非能力(见局限六)。
2. 落入②格者会否在岗位上很快把路补上?若三个月内补齐,则②格只是短暂错配,而非结构性缺口。本文无追踪数据。
3. 机器能否学会脱稿?若一个模型可实时接管某人的延长线追问并答得成立,则定义 1 第三条失去技术前提,本文全部结论须重写。作者认为这是最可能先发生的一条。
4. 让产物重新带上过程,是否比追问更根本?开源协作中的提交历史、讨论记录、被拒绝的方案使产物自带路径。若这条路走得通,本文所主张的追问只是一个过渡方案。这是最大的一笔欠账。
声明
伦理声明:本研究不涉及人类受试者,三项审计的对象均为公开发布的技术标准文档。第 6.6 节的待做研究若实施,须先获所在机构伦理审查批准,并遵守 8.5 节三条。
利益冲突:作者声明无利益冲突。本文不受任何标准制定组织、评测服务提供商或人力资源技术企业资助。
数据可得性:三项审计的对象均为公开文档,任何人可按 6.2–6.4 节的停止规则原样复算。审计过程未产生除本文表格之外的中间数据集。
工具使用声明:本文的论证结构、承重命题、读数定义与编码规程、三项审计的事先登记条款与判定,由作者负责;文献检索与文字整理由人机协作完成。三处不利结果(6.2 节的强主张判负、6.3 节的失效机制存在、7 节场景一的自我推翻)未作任何修饰。按本文自身的主张,此声明不能证明本文的署名成立——它只能在延长线上被重做(第 12 节)。
附录 A 追问记录表(可直接使用)
| 字段 | 说明 | 示例 |
|---|---|---|
| 被评者代号 | 匿名化 | C-021 |
| 产物标识 | 具体到部位 | 实习报告 v3 · 第 4 节图 2 |
| 追问序号 | 同一场次内连号 | 2 |
| 追问文本 | 原话记录,不得事后润色 | "把统计口径换成下单时间,这个跳点还在不在?在的话第二个结论要改哪一句?" |
| 应答摘要 | 判者记录,不超过 100 字 | 指出跳点会消失,并指出第二条结论中"季度末冲量"一句须删 |
| 是否查阅原始材料 | 是/否(允许,仅作记录) | 是 |
| 判者甲 | 成立/部分/不成立 | 成立 |
| 判者乙 | 同上 | 部分 |
| 计分 | 不一致按偏严一侧 | 0.5 |
| 不适用标记 | 规程 6 三种情形之一 | — |
| 备注 | 场次条件、异常情况 | 判者乙认为口径定义不清 |
场次汇总另记三项:追问总次数、不一致率、不适用次数。三项缺一,该场次的 q 不得引用。
附录 B 编码示例(四例,含两处边界)
| # | 追问 | 应答 | 判定 | 依据 |
|---|---|---|---|---|
| 1 | 就本人报告的口径变更提问 | 当场指出跳点会消失并改正结论 | 成立(1.0) | 定义 1 四条齐 |
| 2 | 同上 | "我不知道,但这要看订单表的时间戳字段,改了之后季度末那一段会平掉" | 部分成立(0.5) | 规程 5:知道路的形状 |
| 3 | "请讲讲你这个项目的亮点" | 流畅讲述 | 不计入分母 | 规程 2:叙述题非锚定追问 |
| 4 | "你报告第 17 页第三行的数字是多少" | 准确复述 | 不计入分母 | 定义 1 第二条:答案在提问前已存在,属记忆题 |
附录 C 三处工具粗糙处的登记
诚实要求把方法的钝处写出来,而非等审读者发现。
其一 · 审计的分辨率。见 6.5 节。未做逐属性穷举,是分辨率不足,不是覆盖率不足;覆盖率不足另见局限(二)。
其二 · 判者一致性未实测。规程 4 的 0.30 阈值是设计值。真实判者分歧可能远高于此,届时该读数的可用性须重估。这是最需要先做的一次预实验(6.6 节)。
其三 · 五类场景中两类为二手描述。场景四与场景五未作一手核对。
参考文献
1. Agrawal, A., Gans, J., & Goldfarb, A. (2018). Prediction Machines: The Simple Economics of Artificial Intelligence. Harvard Business Review Press.
2. Becker, G. S. (1964). Human Capital: A Theoretical and Empirical Analysis. University of Chicago Press.
3. Donner, A., & Eliasziw, M. (1992). A goodness-of-fit approach to inference procedures for the kappa statistic. Statistics in Medicine, 11(11), 1511–1519.
4. European Commission (2024). European Learning Model (ELM) Ontology, Revision 3.2.0. Directorate-General for Employment, Social Affairs and Inclusion. http://data.europa.eu/snb/model/elm
5. Falconer, D. S. (1952). The problem of environment and selection. The American Naturalist, 86(830), 293–298.
6. Falconer, D. S., & Mackay, T. F. C. (1996). Introduction to Quantitative Genetics (4th ed.). Longman.
7. Hatano, G., & Inagaki, K. (1986). Two courses of expertise. In H. Stevenson, H. Azuma, & K. Hakuta (Eds.), Child Development and Education in Japan (pp. 262–272). Freeman.
8. Hazel, L. N. (1943). The genetic basis for constructing selection indexes. Genetics, 28(6), 476–490.
9. Hazel, L. N., & Lush, J. L. (1942). The efficiency of three methods of selection. Journal of Heredity, 33(11), 393–399.
10. Hirsch, F. (1976). Social Limits to Growth. Harvard University Press.
11. Hubbell, S. P. (2001). The Unified Neutral Theory of Biodiversity and Biogeography. Princeton University Press.
12. Hubbell, S. P. (2005). Neutral theory in community ecology and the hypothesis of functional equivalence. Functional Ecology, 19(1), 166–172.
13. 1EdTech Consortium (2024). Comprehensive Learner Record Standard, Version 2.0 (Candidate Final Public, 2 April 2024).
14. Polanyi, M. (1966). The Tacit Dimension. Doubleday.
15. Richter, S., & Dodd, P. (2025, October 2). The case for oral exams in the age of AI. University of Auckland. (另见 The Conversation, 2026 年 1 月转载)
16. Schaeffer, L. R. (1994). Multiple-country comparison of dairy sires. Journal of Dairy Science, 77(9), 2671–2678.
17. Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
18. Smith, H. F. (1936). A discriminant function for plant selection. Annals of Eugenics, 7(3), 240–250.
19. Spence, M. (1973). Job market signaling. The Quarterly Journal of Economics, 87(3), 355–374.
20. Tejada-Flores, L. (1967). Games climbers play. Ascent (Sierra Club), May 1967.
21. ten Cate, O. (2005). Entrustability of professional activities and competency-based training. Medical Education, 39(12), 1176–1177.
22. Thurow, L. C. (1975). Generating Inequality: Mechanisms of Distribution in the U.S. Economy. Basic Books.
23. UIAA (2002). Tyrol Declaration on Best Practice in Mountain Sports.
24. World Economic Forum (2025). The Future of Jobs Report 2025.
25. Zahavi, A. (1975). Mate selection—a selection for a handicap. Journal of Theoretical Biology, 53(1), 205–214.
26. Assessment & Evaluation in Higher Education (2025). Utilising one-on-one interactive oral assessments as the major final assessment within a bioscience course. DOI: 10.1080/02602938.2025.2502577.
本文为一次性写就的学术论文稿,全文机检 19,337 汉字。作者不为本文自行印发任何评分。
本体层回答了"发生长什么样",立刻引出一个前四章都不回答的问题:这样的能力靠什么活着?它不是认证过就封存的资产——第二部已经证明它须被续签;那么续签的本钱从哪里来?
《底流》独占这一层,因为它做的事与其余九章方向相反:九章都站在读数侧(能力怎么被读出),它换到供给侧(能力靠什么被喂养)。它的发现毫不浪漫:喂养发生学能力的,从来不是任何专款——不是培训预算、不是刻意练习的课时、不是传承制度的补贴——而是日常工作里最低价值那部分的联合副产:无辅助、有真实赌注、亲手完成的产出流。正因为它从来没被记过账,它被智能系统按面值接走时,三本账全在改善,断供无声。
本部只有一章,但它在全书里的位置像房子的水管:平时看不见,断了才知道其余一切都靠它。它还带着全书最刺的一条推论——晋升是底流的第一大杀手,早于 AI——以及全书最诚实的一句自白,那句话本书留到结语再引。