← 专著页 · 分章目录 · 上一节 · 下一节

第三章 读得出的那一部分,恰恰不是整体性

文心探幽·卷一 · 正文 20,679 汉字 + 编者补节 912 汉字

SDE V3.9 · WHAT 型概念研究

从内生判差到异源回判

作文整体性的三学科碰撞、 公开语料反证与概念重建

超分子化学 × 第三体摩擦学 × 射电干涉闭合相位

研究问题何谓作文?作文是什么?
证据路径三源机制提取 → 候选概念 → 预注册扰动 → 公开语料反证 → 概念重建
本轮裁决淘汰“内生判差”的当前操作化;提出“异源回判”作为待检验假说

研究论文 · 证据版本 V1.0

完成日期:2026 年 8 月 17 日

目录

论文结构与主要裁决路径

摘要3
引言:把“作文是什么”从常识中重新取出3
一、作文研究的四条既有路线及其定义缺口4
二、研究程序:SDE V3.9 的 What 型三维度路线6
三、三种源机制的厚描及其边界7
四、第一次概念碰撞:“内生判差”与“偏差分流”9
五、公开语料先导研究:从概念到可失败测量10
六、结果:高覆盖率为何构成警报12
七、对抗性边界:一个定义如何同时过宽与过窄13
八、概念重建:从“内部有判断”到“远距异源回判”15
九、对“作文是什么”的阶段性回答18
十、教学、评价与写作技术的含义19
十一、限制与确认性研究方案21
十二、SDE V3.9 门控与研究裁决22
结论23
附录 A:样本锁定与可复现信息24
附录 B:V2 最小编码记录模板24
参考文献25

提示:目录条目可点击跳转;页码依据最终排版生成。

▌摘要

“作文是什么”常被“怎样写好作文”替代。前者追问对象的构成方式与边界,后者则预设对象已经存在,只讨论训练、评分和改进。本文把问题重新置于本体论与测量论的交界处:作文何以不是句子的集合、一般连贯文本或任务合规产品?为寻找能够经受反例的回答,研究依照 SDE V3.9 的 What 型三维度程序,引入三种彼此遥远而又可操作的源机制:超分子化学的多点识别、协同性与可逆组装,第三体摩擦学的负载传递、速度调节与物质流,射电干涉测量的闭合相位及其对站点型误差的不变性。三者第一次碰撞形成候选概念“内生判差”及“偏差分流”机制:一处局部改动进入全文关系网后,可能被排斥、被结构承载、被高层关系消隐,或仍然不可判定。本文没有把这一新概念直接宣布为定义,而是把它改写成可失败的操作命题,并在 Argument Annotated Essays v2(AAE2)公开语料上实施确定性抽样的审计性先导研究。十二篇作文各接受六类最小扰动,共七十二项判断。结果表面上极强:全文判差覆盖率为 70/72(0.9722);但 63/72(0.8750)的全文判断仅凭改动句与一条邻句即可还原,越过预注册的 0.80 淘汰线。删除全部中等把握编码后,近邻可还原率反而升至 59/63(0.9365)。更严重的是,扰动类型与命运类别的描述性 Cramér’s V 为 0.7007;不读作文、只看操作标签,逐篇留一预测即可命中 62/72(0.8611)。这说明现有量表主要测到了局部语义保持、邻接矛盾和显式让步,并且把实验者预先设计的操作性质误认成文本自身的组织能力。依照预注册,本文否决“作文是内生判差体”这一肯定性定义,暂停“偏差分流”的独立机制地位,但不据此否定三学科组合的理论潜力。反证推动概念由“内部能判断”转向“远距、异源、可回判”:作文整体性不在全文总命中率,而在移除邻句、中心句复述与同源线索以后,远处且关系类型不同的文本路径能否提供超过局部基线的判断增益。本文据此提出“异源回判”假说与远距增益指标 Δ_remote,并把作文暂定为:将经验、立场与语言选择组织成远距、异源、可回判关系的一种书面行动。该表述不是终极定义,而是一项经过首轮失败后变得更窄、更难伪装、也更可检验的研究纲领。

关键词:作文;整体性;跨学科概念研究;内生判差;异源回判;公开语料;预注册;反证

▌引言:把“作文是什么”从常识中重新取出

作文研究有一个不易察觉的起点问题。日常教育语言把“作文”当作一个无需定义的对象:有题目,有篇幅,有开头、主体和结尾,有评分者,便似乎已有作文。研究于是自然转向写作过程、策略训练、篇章连贯、体裁知识、评价量规与自动评分。这些工作都重要,却没有自动回答一个更基础的问题:当一组句子遵守语法、围绕同一主题、甚至取得高分时,使它成为一篇作文的究竟是什么?反过来,一篇极短、跳跃、故意留白但仍被读者确认为作文的文本,又凭什么没有被排除?

如果把作文定义为“学生按题目写成的文章”,定义就依赖学校制度,无法解释制度外的习作、随笔和公共写作;如果定义为“表达思想感情的文章”,说明书、社论、书信和诉状都会涌入外延;如果定义为“有中心、有材料、有结构的书面语篇”,数学证明、合同与技术规范同样具有内部结构。许多定义事实上是教学要求、原型描述或质量标准,而不是能够区分对象、解释边界并承担反例的理论定义。

本文从三个判断出发。第一,作文不能仅由局部性质定义。句子的正确、段落的顺滑和连接词的齐全可以逐项达成,却仍可能形成同题拼盘。第二,作文也不能仅由外部制度定义。题目、评分表和作者身份能规定任务,却不能完全替代成文之后可被读者审计的关系。第三,任何声称抓住“整体性”的理论,都必须区分作文级关系与一般局部连贯,并与证明、合同、说明书等高度约束文本进行对照,否则极易把“复杂文本共有的组织性”误称为“作文的本质”。

研究问题因此被写成四层:其一,三个碰撞学科分别能提供什么可迁移机制,而不只是修辞形象?其二,这些机制能否共同生成一个关于作文整体性的可失败命题?其三,公开真实文本能否迫使这一命题承担否决风险?其四,如果首轮操作化失败,失败暴露的是理论本体、测量方式,还是概念外延中的哪一处混淆?

本文的贡献不在提出一个听起来新颖的名词,而在展示概念如何被不利数据改写。研究先由三源碰撞得到“内生判差”,再用预注册的局部窗口检验把它否决为作文定义,最后提出“异源回判”作为下一轮假说。这个顺序有意反转概念写作中常见的确认路径:新概念不是终点,而是必须接受破坏性测试的中间模型。由此,“作文是什么”不再只是思辨命题,也成为可以设计扰动、设置对照、报告失败并逐轮收窄的经验问题。

▌一、作文研究的四条既有路线及其定义缺口

(一)过程路线:作文是认知活动,但活动边界不等于对象边界

Flower 与 Hayes(1981)的认知过程理论把写作描述为计划、转译和复核之间递归而非线性的活动,改变了“先想好再写下”的简单阶段观。Bereiter 与 Scardamalia(1987)进一步区分知识陈述与知识转化,说明成熟写作者会让内容问题与修辞问题相互作用。Hayes(2012)的修订模型又把动机、工作记忆、转录技术以及任务环境纳入系统。过程研究因此回答了写作者在做什么、资源如何分配、困难在哪里发生。

然而,从“写作是一组递归过程”不能直接推出“什么成品算作文”。购物清单、实验记录、判决书和程序注释也可能经过计划、转译与复核。过程模型擅长解释生成,却未必提供对象的排他边界。更关键的是,成文一旦进入阅读,作者当时的心理步骤常不可见;若对象身份完全依赖不可重建的过程,读者就无法仅凭文本与情境判断它是什么。因此,本文吸收过程路线对行动性和递归性的强调,但不把某种心理流程当作作文的充分条件。

(二)文本路线:衔接与连贯说明“如何相连”,却未穷尽“为何成篇”

Halliday 与 Hasan(1976)系统描述指称、替代、省略、连接和词汇衔接,使跨句联系成为可分析对象。de Beaugrande 与 Dressler(1981)提出衔接、连贯、意向性、可接受性、信息性、情境性和互文性七项文本性标准,把文本从句法扩展为交际事件。Witte 与 Faigley(1981)则提醒,衔接数量与写作质量不是简单同一;显性的连接手段不能保证概念结构充分。Mann 与 Thompson(1988)的修辞结构理论进一步以核心—卫星和功能关系解释语篇组织,提供了目的、证据、让步、条件等关系的分析语言。

这些理论为本文的“关系路径”提供基础,却也暴露两个限制。其一,局部衔接能够在低质量文本中大量出现:代词有先行项,句间有 because 或 however,段落仍可能只是并置。其二,连贯具有读者建构成分。一个熟悉主题的读者可能为稀疏文本补足关系,另一个读者则不能。若把“读起来连贯”直接视为作文的本体属性,就会把读者能力、世界知识与文本结构混为一体。本文因而要求每次判定都能指出文本锚点,并区分局部窗口已经足够的关系与必须调用远程结构的关系。

(三)互惠与体裁路线:社会行动解释用途,但类别成员仍有开放边缘

Nystrand(1986)把书面交流理解为写者与读者之间的互惠过程;文本并非封闭容器,而是参与者协调预期的媒介。Miller(1984)提出“体裁即社会行动”,使体裁不再只是形式清单,而成为对反复出现情境的类型化回应。Beaufort(2007)把写作专长置于话语共同体、主题、体裁、修辞和过程知识的交汇处。这一路线有力地说明,作文不是去情境的语言物,题目、课堂、公共议题、读者角色与评价制度都会进入其意义。

但社会行动定义也可能过宽。“完成一个书面任务”包括填表、报税、签约和发布操作指令。若仅凭行动目的区分,许多混合体裁难以归类;若仅凭教育制度区分,则“作文”变成管理标签。体裁理论本身强调类别的历史性、原型性和可变性,因此它更适合提醒我们保留边界弹性,而不是为作文提供一条机械的充分必要条件。本文将在结论中把作文理解为书面行动,但为这种行动增加开放的不完备性、异源关系组织和回判能力三项结构条件。

(四)论证挖掘路线:可计算关系提供数据,却可能把标注模式当成文本全貌

论证挖掘把主张、前提、支持和攻击关系转化为可标注结构。Stab 与 Gurevych(2017)的 AAE2 包含 402 篇说服性学生作文、7,116 个句子和 147,271 个词元,为真实作文的关系研究提供了重要公共基准。该语料含 6,089 个论证成分,其中支持关系 3,613 条、攻击关系 219 条;23% 的段落存在未链接论证成分,20.9% 的论证呈串联结构。这些统计说明学生作文不是整齐的模板树,也说明反方关系远少于支持关系。

然而,标注方案服务于特定任务。AAE2 把作文建模为由总主张统摄、段内论证构成的连接树,并不系统标注跨段前提关系、叙事时间、语气回响、词汇复现、例证—概括等所有可能的整体联系。数据中没有某类边,不能被解释为文本中没有这种关系。相反,如果研究者只使用既有标注,他会把标注本体的边界误当成作文的本体边界。本文因此以 AAE2 原文为主要判断材料,以 BRAT 标注定位论证单元,却不把论证树视为完整的作文模型。

(五)共同缺口:需要区分局部连贯、一般文本性与作文整体性

四条路线分别抓住生成、文本、社会和计算层面,却留下一个共同难题:什么证据表明某一局部选择受到了“整篇”的约束,而不只是受到邻句、题目模板或评分常规的约束?这一问题不是要求每一篇作文都必须复杂,也不是把整体性等同于高质量;它要求研究者说明,所谓整体何时产生了不可由局部替代的可观察后果。

本文把“局部扰动的命运”作为切入口。若改动一个词、否定一条前提、移入同题句或删除让步单元,文本其余部分会发生什么?有些改动被多个关系排斥,有些看似冲突的单元实际上承载结构功能,有些形式变化不改变高层承诺,还有些改动仅凭文本无法判断。这个问题能够把抽象的整体性变成反事实比较;但它也有危险:邻句足以完成的判断会伪装成全文能力。先导研究的核心正是让这一危险显形。

▌二、研究程序:SDE V3.9 的 What 型三维度路线

(一)程序定位与三项纪律

本文将 SDE V3.9 作为概念发现与淘汰程序,而不是已经获得普遍承认的学科理论。What 型路线不从现成定义出发,而从三个异质知识域提取机制,经碰撞形成候选概念,再以现实数据和边界反例执行门控。组合一规定:S(粒子维度)取超分子化学,D(波动/过程维度)取第三体摩擦学,E(场/关系维度)取射电干涉的闭合相位。

程序遵守三项纪律。第一是“源机制吸收”:每个学科必须贡献可陈述的因果或测量结构,不能只提供词汇装饰。第二是“不可直译”:分子、磨粒、天线与句子不存在自然同一性,任何迁移都只能保留关系形式,不能把物理定律冒充语言定律。第三是“否决优先”:碰撞所得概念必须在成文前写出何种结果会使其降级或淘汰,并在失败时保留不利证据。

(二)机制提取而非意象拼贴

表 1 给出三种源机制的最小提取。其目的不是证明作文“像”分子、摩擦副或干涉阵列,而是寻找三个互补问题:局部单元怎样被多点关系确定?进入界面的偏差可以有哪些去向?怎样构造不依赖单一外部校准源的关系量?

表 1 三学科源机制、可迁移关系与禁止直译

学科源原学科中的核心机制可迁移的关系形式明确禁止的直译
超分子化学分子识别、多价作用、协同性、可逆自组装单点弱约束可由多点配合获得选择性;整体结构反过来限定局部位置不把词句称作真实分子,不用结合能替代语义证据
第三体摩擦学第三体传载、速度调节、界面分离、源流—循环—泄漏偏差不只有删除一种命运;中介单元可承压、缓冲、转移或逸出不把删改等同于磨损率,不宣称文本服从接触力学方程
闭合相位闭合回路消去站点型相位误差;闭合量有信息损失与协方差判断应尽量由多边关系闭合,不依赖单一评者或中心句;关系量也有盲区不把语义关系当作傅里叶相位,不宣称三句相加即可得到真值

(三)碰撞有效性的判准

三源之间设计了二十七个概念碰撞单元,每个单元检验一种跨源组合是否产生了新增问题、可观测后果和反例条件。二十一个被判为有效,两个处于边界,四个无效。有效碰撞通常同时满足三点:源机制都不可删除;产物不能由某一学科单独改名得到;产物能够改变后续数据设计。无效碰撞主要有两类:一类只制造华丽同义词,例如把“连接”改称“结合”;另一类错误地把闭合相位的数学消元直接投射为意义正确。边界碰撞则具有解释价值,但尚不能产生独立测量。

这一门控的意义在于,跨学科新颖性不能由距离本身保证。学科越远,滥用隐喻的风险越高。真正有效的碰撞必须带来“若如此,应该看见什么;若看不见,放弃什么”的研究后果。组合一最终留下的不是三个名词,而是一条可受攻击的链:多点关系赋予局部选择以命运;中介结构使命运不止对错两类;关系回路使判断减少对单一外部锚点的依赖。

(四)研究证据的分层

本文区分四种证据。源文献证据说明原学科机制;结构推演证据说明迁移后的逻辑可能性;公开语料证据检验当前操作量能否识别作文级结构;对抗性反例检验概念外延。四者不得互相替代。尤其是,三学科机制在原领域成立,并不证明迁移概念成立;先导语料运行得到高比例,也不证明定义成立;反例能够淘汰过宽定义,却不能独自给出新定义。

▌三、三种源机制的厚描及其边界

(一)超分子化学:整体不是强键,而是受组织的多点关系

Lehn(1988)把超分子化学概括为超越单个分子的化学,核心包括分子识别、互补性与由非共价作用形成的高阶组织。此后他进一步把自组织理解为信息化学系统通过组分之间的识别与选择生成有序结构的过程(Lehn, 2002)。这里对作文研究最有价值的,不是“句子如分子”的类比,而是对整体性的重新刻画:整体不一定由一条不可破坏的强键维持,也可能由许多方向性、可逆、强弱不一的接触共同稳定。

多价作用使这一点更清楚。Mammen、Choi 与 Whitesides(1998)讨论生物系统中的 polyvalent interactions:多个配体—受体接触同时或连续参与,可以产生高于单个接触的总体亲合与选择效应。多价并不意味着把每个弱作用机械相加;几何匹配、局部浓度、协同性、熵代价和重绑定都会改变整体。对文本而言,可迁移的不是热力学数值,而是一个判准:一个局部单元若同时进入指称、因果、论证、语气或例证等不同关系,其命运可能由这些关系的组合决定,而非由最近的一条连接决定。

这一机制还带来可逆性。超分子组装常由非共价作用维持,结构能够在条件变化时重排。作文修改也不是简单地把“错误句”从成品中剔除;改写一个词可能保持高层承诺,移动一个例子可能重建论证,删除一句让步却可能使远处回应失去对象。可逆性提示我们研究“扰动后的结构再平衡”,而不是只统计语病。

但迁移边界必须严格。第一,文本关系没有可直接测量的结合自由能;所谓“稳定”只能由可标记证据、读者一致性或任务表现间接估计。第二,多点联系可能完全同源:总论点在首尾重复三次,看似有三个锚点,实则只有一个信息源。第三,关系越多不等于作文越好;冗余、套话和模板也能制造高连接度。因此,超分子机制只支持“多点与协同值得检验”,不能支持“多点即作文”。

(二)第三体摩擦学:偏差进入界面以后并非只有清除

传统摩擦叙述容易只看两个接触固体,但真实接触常产生磨屑、转移膜、氧化物或环境颗粒。Godet(1984)的第三体进路把这些介于两个第一体之间的物质视为接触机制的组成部分,而非纯粹废物。Iordanoff 等(2002)的综述概括了第三体的三项功能:传递负载、调节两第一体之间的速度差、把第一体分隔开以减少直接损伤;并讨论五个速度调节位置、四种调节模式以及源流、内流、外循环和泄漏等物质流。相关框架后来在速度调节位置、固体第三体流变和离散元磨损模型中继续展开(Berthier et al., 1992; Descartes & Berthier, 2002; Fillot et al., 2007a, 2007b)。第三体可能保护表面,也可能参与磨损;关键不在它“好”或“坏”,而在它怎样被接触系统生产、输送和排出。

这为作文修改提供一个重要纠偏。学校评价常把偏差想象成必须清除的异物:矛盾删掉,离题删掉,重复删掉。然而,成熟文本中的反方声音、犹疑、插叙、语体突变和局部摩擦可能承担负载。它们让结论不是无阻力的口号,使立场通过回应而形成,使叙事转折获得张力。删除表面不协调的单元,全文反而可能变弱。第三体机制因此启发“承载”命运:局部偏差不是被容忍的噪声,而可能成为结构传力的中介。

同时,第三体的流动视角阻止我们把文本看成静态网络。一个例子可以从经验材料转化为论证前提,一句反方意见可以在后文被重述、限定并回应,一处关键词可以循环出现而改变语义负载。单元的身份取决于它在生成、再进入与逸出过程中的位置。由此,研究对象不只是“这句话与哪句话相连”,还包括“这句话的功能如何沿全文迁移”。

迁移仍有三重限制。其一,物质流有守恒和力学条件,语义功能没有同等的物理量;“流”只能被操作为指称延续、立场转换或关系重编码。其二,第三体属于接触系统的一般机制,不具有作文特异性。合同中的定义条款、证明中的引理同样可以承担中介负载。其三,R、B、C 三种命运容易被实验操作预先写入:同义替换天然趋向消隐,命题否定天然趋向排斥,删除让步天然趋向承载。先导研究后来证实了这一设计混淆。

(三)闭合相位:关系不变量、信息损失与相关误差

在射电干涉测量中,一条基线的观测相位不仅包含天体源结构,也包含两端台站的相位误差。用简化式表示,基线 ij 的测得相位可写为:

φᵐᵢⱼ = φˢᵢⱼ + θᵢ − θⱼ + εᵢⱼ。

当三条有向基线构成闭合三角形时,三条相位相加:

ψ₁₂₃ = φᵐ₁₂ + φᵐ₂₃ + φᵐ₃₁,

各台站误差 θ₁、θ₂、θ₃ 以相反符号成对消去,留下与源结构有关的闭合相位以及不能闭合的噪声项。Jennison(1958)奠定了这种相位敏感测量方法。Chael 等(2018)指出,闭合相位与闭合振幅对站点型校准误差免疫,因而可直接用于成像;但闭合量也丢失信息,例如仅用闭合相位不能确定图像质心,仅用闭合振幅不能确定总流量,重建仍需正则化或附加约束。Blackburn 等(2020)又强调,闭合量虽对天线增益稳健,却往往在线性和统计上相关;忽视协方差会造成有偏推断,低信噪比和非闭合误差也不能由“闭合”二字自动消除。

对作文研究而言,真正可迁移的是三条方法论。第一,判断应寻找在某类观察者或局部锚点变化下仍保持的关系量,而不是依赖单一评分者、题目说明或中心句。第二,闭合不等于完整;一个对某类误差不变的指标可能同时丢失对象信息。第三,多条回路不等于多条独立证据;它们可能共享边、具有协方差,或只是同一中心命题的重复组合。

这直接修正了最初的“内部”想法。遮去题目和评分表后,文本内部仍能给出判断,似乎具有闭合性;但若所有判断都源于一句总论点,或者全文协调地重复同一错误,所谓闭合只是相关误差的共同传播。作文中的“独立路径”因此不能按空间数量计算,必须要求关系类型和信息来源的异质性。也正是在这里,“异源”成为后续概念重建的必要条件。

(四)三源的共同约束:整体性必须产生增量,而非只留下网络图

三种机制汇合后,整体性可以被初步写成:局部单元进入多点、流动且可回路检验的关系系统,系统使其在扰动后呈现可区分的命运。但这一表述仍过宽。分子网络、接触界面和干涉阵列都提醒我们,结构存在必须产生可测后果。对作文而言,这个后果不应是“全文里能找到两句相关话”,因为大多数文本都能做到;它应是远程关系相对于局部关系带来的新增判断能力。

因此,本研究没有把网络密度、连接词数量或全文一致率直接视为整体性。最初仍把“全文能判差”当作候选量,同时预先设置近邻窗口 N 作为破坏性对照。事实证明,真正推动理论进步的不是高全文命中率,而是 N 把高命中率拆穿了。

▌四、第一次概念碰撞:“内生判差”与“偏差分流”

(一)候选定义

第一次碰撞形成如下核心命题:遮去题目、评分表和作者说明后,文本其余部分仍以至少两条非同源关系路径,对某一局部改动给出可审计的命运判定。这里的“内生”不是拒绝世界知识,而是要求判定理由在当前文本中留下至少两个相互分离的锚点;“判差”不是发现所有事实错误,而是判断改动进入关系系统以后如何改变结构。

为了避免把所有偏差归入“错误”,研究定义四种命运。排斥(R)指改动破坏至少两处相互分离的文本关系,恢复原单元后两处破坏同时解除。承载(B)指表面不协调的单元承担反例、转折、声音差异、情节摩擦或概念桥接,删除后至少两处关系变弱。消隐(C)指局部形式改变,但至少两条高层推论或叙事承诺保持不变。未定(U)指命运只能诉诸题目、评分表、作者说明、一般语法或常识,或者文本内部只能找到一条证据路径。

这四类构成“偏差分流”。它吸收超分子化学的多点约束、第三体的不同流向与承载功能,以及闭合相位的内部关系检验。与简单纠错不同,它允许文本保持矛盾、吸收变化或拒绝变化;与纯解释不同,它要求扰动前后可比较;与评分不同,它不先规定哪种命运更优秀。

(二)独立路径规则

两条证据路径只有同时满足四项条件才计为独立。其一,跨度不同,不能只是同一句或邻句的复述;其二,至少分属因果、时间、指称、论证、声音、例证—概括、问题—回应等不同关系类型;其三,进行留一锚点检验,遮去最近的共同中心句后,至少一条路径仍保留原判断;其四,两条路径若都由题目、总论点或同一模板槽位推出,视为同源。

这个规则试图回应闭合量的相关性问题,却仍有漏洞。“至少两个锚点”可以由分析者在全文中事后搜寻;“关系类型不同”也可能只是标注语言不同,底层信息仍相同。更重要的是,只要一个局部矛盾同时触发邻句中的指称和因果关系,就能满足两类关系,却没有证明整篇参与了判断。近邻对照因此不是附属指标,而是区分局部与整体的关键否决器。

(三)为什么必须先写下失败条件

研究在读取本轮样本正文前写死五类裁决。最关键的一条是:若近邻可还原率 N≥0.80,则淘汰当前操作化,因为指标未超出一般局部连贯。另有保留条件要求原文平均 J 比顺序对照与同题拼盘合并均值至少高 0.15,且至少八篇方向一致;若差值仅为 0.05—0.15 或只有六至七篇方向一致,则定义降级为质量属性;若 R、B、C 中任意两类不能稳定区分,则淘汰三分机制;若多路关系主要由同一中心句派生,则必须加入正交来源条件。

把失败线写在结果之前,有两项作用。一是阻止研究者把任何高比例解释为支持。二是把“整体性”的理论承诺具体化:如果一条邻句已经足够,全文关系就没有产生增量。这正是预注册把预测与事后解释分开的功能(Nosek et al., 2018)。后来的结果恰好触发这一不利条件,说明预注册并非装饰。

(四)与邻近概念的区别

“内生判差”不等于衔接。衔接可以由局部形式标记完成,判差要求扰动后的关系命运。“内生判差”也不等于逻辑一致。一篇作文可以承载反方声音和未解决张力;内部一致的文本也可能全篇重复同一事实错误。它还不等于自动评分,因为命运类别不是分数,承载不低于排斥,消隐也不天然优于变化。

然而,候选概念与一般复杂文本之间的边界仍不清楚。定理证明、合同和技术规范都具有多路内部约束,甚至比多数学生作文更能判定局部改动。若“内部能判差”是充分条件,这些文本都会被误收。极短而优秀的寓言或随笔又可能因缺乏两条显式路径被误拒。这种外延同时过宽与过窄的征兆,要求现实语料之外再加入对抗性类别测试。

▌五、公开语料先导研究:从概念到可失败测量

(一)数据、样本与证据等级

主语料为 Argument Annotated Essays v2。原论文报告 402 篇说服性学生作文;本研究通过公开加载脚本固定的数据提交取得 402 组正文与 BRAT 标注。压缩包及辅助文件均保存 SHA-256 校验值,以防后续数据漂移。研究者在预注册前知道语料规模和论文中的克隆主题示例,因此明确排除该示例;实际检索确认它是作者另写的说明文本,不在 402 篇语料中。

样本以确定性规则抽取:计算 SHA256(essay_id + “SDE-V3.9-PANCHA-20260817”),按哈希升序选取满足正文、标注、语言和至少八句条件的十二篇。入样编号依次为 essay238、essay326、essay178、essay039、essay056、essay161、essay057、essay162、essay082、essay049、essay045 和 essay115。每篇实施六类扰动,总计七十二项。

本轮只有一名知晓假说与阈值的分析者,不具备盲法,也没有独立编码者。因此它是审计性小试运行,不是确认性实验。研究的可信度来自规则公开、样本锁定、逐项编码和不利结果保留,而不是来自总体推断。任何比例都只描述这七十二项,不外推到所有作文。

(二)六类最小扰动

六类扰动分别为:S1 表层同义替换;S2 保持基本命题的句法改写;P1 对主要前提作最小否定;P2 把关键实体、数量或属性替换为同主题但不相容的值;R1 从另一篇近题作文移入一条语法通顺的前提;R2 删除反方、例外、转折、回应或桥接单元,若原文无此类单元则删除主要例证。所有扰动保持局部语法基本通顺,避免把语法错误伪装成关系错误。

目标选择采用固定规则而非逐篇挑选。S1 选择最早含可替换实词的主张,S2 选择最早且不少于八词的前提句,P1 选择最早前提,P2 选择第二早前提,R1 用全库题目词级一至二元 TF-IDF 相似度选择来源作文并取其最早合格前提,R2 按最早反方主张、显式让步/转折、最长前提的顺序选择。这些细则中有一部分在已读四篇正文、尚未进行命运编码时补充,构成程序性迟注册,论文据此降低证据等级。

(三)全文条件与近邻条件

每个扰动在两个阅读条件下编码。全文条件允许读取整篇正文;近邻条件只读改动句及其后一条句子,无后句时读前一句。R2 则读取被删原句及其后一条句子。两个条件使用同一 R/B/C/U 规则独立判断,再比较是否一致。

全文判差覆盖率定义为:

J(T) = 获得 R、B 或 C 且存在两条合格证据路径的有效扰动数 ÷ 全部有效扰动数。

近邻可还原率定义为:

N(T) = 近邻条件与全文条件命运相同的扰动数 ÷ 全部有效扰动数。

J 高只说明分析者能在全文中为大多数扰动找到命运;若 N 同样高,则这种能力主要来自局部窗口,不能归功于作文整体。研究还记录单源依赖率、承载检出率和关系型穿透率,但本轮裁决以 N 的预注册阈值为优先。

(四)停止规则与运行例外

预注册规定,一旦原文 N≥0.80,便满足淘汰当前操作化的充分条件;顺序对照和同题拼盘不再可能把裁决改回“保留”。实际运行触发该条件,因此研究停止保留性检验,没有生成两个对照。这个决定使本轮无法估计原文与对照的 J 差值,也不能对“降级”条件作完整判断;它能支持的只有更窄而明确的结论:当前量表未能把作文级整体性与局部连贯区分开。

另有三项例外被保留。essay049 与 essay045 的最早反方主张和总主张同句,若整句删除会同时移除被检验的总立场,故跳到下一条独立让步;essay178 的 not only…but also 被粗略的 but 检索误识别为反方标记,实际依照后备规则删除最长例证。这些调整都可能提高 R2 的承载可见度,因而不应被用于强化有利解释。

▌六、结果:高覆盖率为何构成警报

(一)主要计数

七十二项扰动全部可运行。全文命运分布为 R=25、B=13、C=32、U=2,J=70/72=0.9722。若只看这一数字,几乎可以宣称作文内部广泛存在判差能力。然而,近邻与全文同判达到 63/72,即 N=0.8750,越过 0.80 淘汰线 0.075。全文相对于近邻新增的可判定项仅 9/72=0.1250;其余全文—近邻不一致为零。

表 2 公开语料先导研究的主要计数与预注册解释

指标结果预注册解释
有效扰动72/72数据可运行
全文判差覆盖率 J70/72 = 0.9722无对照且可能通胀,不能单独支持保留
近邻可还原率 N63/72 = 0.8750超过 0.80,淘汰当前操作化
全文独有可判定增量9/72 = 0.1250真正调用远程关系的案例很少
高把握子集的 N59/63 = 0.9365删除全部中等把握项后反证更强

九项编码被标为中等把握。若担心不确定判断抬高 N,把它们全部删除,剩余六十三项中的五十九项近邻—全文同判,比例反而升至 0.9365。由此,不利结果不是由少数模糊案例制造。

两个 U 都来自 essay039 的 P 类扰动:否定“太空照片显示地球为圆”,以及把“地球绕太阳”改为“太阳绕地球”。外部常识能立即判断后者错误,但正文没有第二条独立锚点反驳它。这个案例显示,内部可判定不等于事实正确;若量表借用常识把它强行编码为 R,就会把外部校准源偷偷带回“内生”指标。

(二)操作类型预编码了命运

更严重的结果来自扰动类型与命运的耦合。S1、S2 全部为 C;P1、P2 各有十一项为 R、一项为 U;R2 有十项为 B、两项为 C;只有 R1 呈混合分布。六乘四列联表的描述性 Cramér’s V 为 0.7007,显示强关联。使用逐篇留一方案,仅凭 S1/S2/P1/P2/R1/R2 标签、完全不读作文内容,就能预测 62/72(0.8611)的全文命运;总体众数 C 的基线为 32/72(0.4444)。

表 3 六类扰动与全文命运的描述性分布

扰动族RBCU众数命运
S1 同义替换00120C(12/12)
S2 句法改写00120C(12/12)
P1 命题否定11001R(11/12)
P2 不相容替换11001R(11/12)
R1 近题移植3360C(6/12)
R2 关系单元删除01020B(10/12)

这不是显著性推断,而是设计诊断。S 操作按定义保存命题,几乎必然产生消隐;P 操作按定义制造否定或不相容,容易在邻接位置形成排斥;R2 专门选择反方、让步或例证,删除后容易被判为承载。换言之,实验者先把 C、R、B 的典型性质写进操作,再从结果中“发现”三分机制。量表回答的主要是“这种编辑通常会造成什么”,而非“这一篇作文怎样决定它的命运”。

(三)三类通胀

第一是消隐通胀。同义替换与保义改写在操作层面已规定高层命题不变;只要编码手册把高层承诺保持视为 C,十二加十二项命中几乎是定义重述。第二是排斥通胀。最早前提往往与下一句例证或推论直接相连,命题否定和不相容替换自然制造邻接冲突,N 因而升高。第三是承载通胀。R2 优先删除显式让步与反方,邻句中的 however、this 或回应句会立即暴露功能,不需要全文。

三类通胀共同解释了一个看似矛盾的现象:J 越高,越可能不是作文整体越强,而是操作和编码规则越同构。这里的教训具有一般性。概念研究若只报告高命中,不检查命中能否由标签、模板或局部窗口预测,就会把测量装置的结构当成对象的结构。

(四)九项远程增量透露了什么

虽然当前量表被淘汰,九项全文新增可判定案例仍具有探索价值。例如,某篇作文移入“英语促进国家间交流”的同题句,近邻窗口只显示话题顺接,全文却显示它只是已有交流论证的冗余;另有移入句在全文的“户外活动—社交—健康”两条支线之间形成桥接,近邻无法识别。删除某些句子后,只有远处的指称回接、结尾重述或反方回应同时受损,才显露承载功能。

这些案例不能用来挽救原定义,因为它们是结果后观察,数量很少,也由单一分析者判断。但它们指出下一轮测量应主动遮蔽邻句与中心句,预先定位跨段关系,并比较远程异源证据相对于局部基线的增益。失败并未让三学科组合失去内容,反而把真正需要测量的部分从高 J 的表面中分离出来。

▌七、对抗性边界:一个定义如何同时过宽与过窄

语料先导只检验了说服性学生作文,无法回答候选概念是否具有作文特异性。为此,本文构造五类边界反例。它们不是概率样本,也不用于估计比例;其作用类似单元测试:只要定义在清楚案例上产生系统性误收或误拒,就必须解释或修改。

(一)定理证明、合同与技术规范:内部约束不是作文专有

一个形式良好的定理证明具有高度内生的判差能力。改变定义、否定引理或删去推导步骤,多个后续结论都会受损;恢复原步骤,关系重新闭合。合同中的定义、义务、例外与救济条款也会相互制约;技术规范的参数、接口与验收标准更可能形成远距一致性检查。按“至少两条内部路径决定局部改动命运”的规则,这些文本比许多学生作文更符合候选定义。

这说明“语言对象 + 内部多路约束”不足以区分作文。问题不在这些文本没有整体性,而在整体性是上位属性。作文定义必须加入其特有或至少更典型的行动结构:面对并非由规则完全封闭的问题,写作者把经验、立场和表达选择组织成可供他人回判的关系。证明和合同当然也需要判断,但其局部命运更大程度由公理、定义或制度规则预先规定;作文则通常保留材料选择、视角、价值权衡和表述方式的开放空间。这里是程度差异而非绝对二分,因而最终定义应以原型性条件而非僵硬的逻辑围墙表达。

(二)协调一致的全局错误:闭合不能清除相关误差

设一篇文章从开头到结尾都把某一错误事实当作共同前提,并在多个段落协调地展开。内部关系可以非常一致:例证支持错误前提,结论回扣错误前提,关键词稳定复现。任何单点检查都可能被全文“消隐”。这与干涉测量中的非闭合误差和相关误差问题相似:闭合相位消去站点型误差,并不消去所有误差;共享来源的偏差可在多条关系中同步传播。

该反例迫使“非同源”升级为“异源”。空间分离不够,关系标签不同也不够。因果链与例证链若都依赖同一未经检验的事实,它们仍非正交。未来编码至少要区分经验来源、价值前提、论证功能和语言实现四个层面;只有来自不同层面的关系在遮蔽共同中心后仍能回判,才提供较强证据。即便如此,异源回判也不保证事实真,只保证某一局部选择受到多种内部承诺的约束。

(三)局部连贯的同题拼盘:主题一致可以冒充整体

从多篇同题作文中各取一段,保留正确连接词,再让每段围绕同一总主题,就能形成局部流畅的拼盘。多数同义替换、句法改写和邻接否定仍可被准确判断;甚至每一段内部都存在主张—理由—例证结构。然而,段落之间可能没有材料递进、立场修正、概念迁移或声音回应。原量表的高 N 正说明这种文本可能被误判为具有整体性。

因此,下一轮必须让非作文对照在长度、主题、语法、段内连贯和操作分布上与作文匹配,只破坏跨段关系。若指标不能把原文与这种困难对照区分,就只能被解释为一般段落连贯指标。简单打乱句序的低质量对照不足以承担这一任务,因为任何表面指标都能轻易获胜。

(四)极短而优秀的随笔或寓言:显式多路不是必要条件

反方向的错误来自极短文本。几句话的随笔、寓言或片段可以通过省略、反讽和文化互文形成强烈整体效果,却未必在字面上留下两条可标记的独立路径。如果定义坚持“至少两个文本内部锚点”,这些作品会被排除。读者之所以承认它们,可能正因为文本把一部分关系委托给体裁惯例、共同知识和沉默位置。

这表明内生性不能等于自给自足。任何作文都处在语言、文化和情境中;完全排除外部知识既不可能,也会偏向长篇显性论证。更合理的要求是:外部知识可以参与理解,但关于某一局部选择为何在这篇作品中成立的理由,必须受到文本中可指认的回判信号约束。短文本的信号可以是标题—正文反差、首尾语义反转、叙述声音与事实的不一致,不一定需要两条完整句链。未来研究应按篇幅和体裁分层,避免把长篇论证作文的显性结构当作作文的普遍本质。

(五)含反方—回应—回扣的长文:组合一真正有解释力的区域

候选概念最有解释力的案例,是一篇长文先引入反方,随后用经验材料限定它,在结尾重新解释开头问题。若删除反方,后文回应失去对象;若改变经验细节,结尾价值判断不再有同样根据;若只读邻句,这些损失不可见。在这里,多点识别、第三体承载和闭合回路确实共同解释了远程组织。

但这一能力更像作文质量的一个维度,而不是作文身份的必要条件。初学者的作文、故意碎片化的作文或简短习作可能缺乏这种结构,却仍是作文。组合一因而应从“定义所有作文”降到“解释作文整体性如何增强”:它研究的不是一篇文字何时跨过作文身份门槛,而是写作行动何时让局部选择受到远距异源关系的共同回判。

(六)边界测试的合并裁决

五类反例与语料结果指向同一裁决:内生判差既有外延过宽,也有外延过窄;其量表又受局部窗口和操作标签支配。因此它不能作为作文的充分必要定义。最合理的保留方式,是把它拆成一个可分级的结构能力,并把“内生”改写为带有外部情境但不被单一外部锚点决定的“异源回判”。

▌八、概念重建:从“内部有判断”到“远距异源回判”

(一)为什么“内生”需要被撤回

“内生”容易引发两种误解。一种是封闭文本观,仿佛作文可以脱离题目、读者、文化和事实独自确定意义;另一种是内部证据数量观,仿佛在全文找到两处支持便已完成证明。先导研究显示,近邻窗口足以还原大多数命运;边界测试又显示,全篇一致可能只是共同误差。继续保留“内生”会遮蔽问题的真正难点:证据是否远距,来源是否异质,判定是否相对于局部基线产生增量。

“回判”比“判差”更合适,因为它强调关系的往返。局部选择向外投射承诺,远处单元又返回来限制对该选择的理解;结尾可以重估开头,例证可以限定总论点,反方声音可以使回应获得必要性。判断不是文本中央的一次裁决,而是局部与远程位置之间的往复约束。“异源”则要求这些返回路径不能都是中心句的复制品。

(二)异源回判的工作定义

本文提出以下 V2 假说:作文的结构能力,不在于局部改动能否被全文判断,而在于移除目标邻句、重复总论点和同源复述后,远处且来源异质的关系仍能共同决定该改动是被排斥、被承载、被消隐,还是保持未定。

这一定义有五个组成条件。第一,存在局部选择 x,可以是词语、命题、例证、声音或结构单元。第二,至少有一个远程位置 r,与 x 跨段或跨功能区域。第三,r 与局部证据 l 不共享唯一信息源,关系可以来自经验、立场、叙事、指称或语言形式中的不同层面。第四,在遮去 l 和共同中心句后,r 仍改变对 x 的命运判断。第五,这种改变能够由盲评者根据预先手册复现,而不是由研究者事后阐释。

“共同决定”不要求每条路径都单独充分。正如多价关系的总体作用不能简化为单个接触,两个异源路径可以只有在结合时才使判断稳定。不过,这种协同必须通过遮蔽或消融实验显示,不能凭网络图想象。

(三)远距增益指标

下一轮的主量不应再是全文总覆盖率 J,而应比较远程异源条件与局部条件:

Δ_remote(T) = J_remote,orthogonal(T) − J_local(T)。

其中,J_local 只允许目标句及预设邻域;J_remote,orthogonal 遮去该邻域、重复总论点、题目提示和同源复述,只允许预注册的跨段异源锚点。Δ_remote>0 表示远程关系提供了局部窗口没有的判断信息。若原文的 Δ_remote 高于主题、长度、语法和段内连贯均匹配的同题拼盘,且在盲评者之间稳定,才可把它解释为作文整体性的候选证据。

该差值仍不应被神化。J_remote 与 J_local 可能受任务难度、文本长度、编码者知识和锚点数量影响;两个条件也可能不是统计独立。参考闭合统计对协方差的警告,确认性分析应在篇内配对、报告分层分布,避免把大量相关扰动当作独立观测。最合适的单位可能是“篇”而非“扰动”,并以多层模型或随机化检验处理篇内聚类。

(四)异源性的四层操作化

为避免“关系类型不同”沦为换标签,本文提出四层来源编码。经验源回答材料从何而来,包括事件、观察、事实或想象场景;立场源回答什么价值或判断承诺在起作用;组织源回答单元承担论证、叙事、解释、反方或回应中的何种功能;语言源回答指称、词汇复现、语气和句法如何实现联系。两条路径只有至少跨越其中两个层面,并在遮蔽共同中心后仍保留部分判力,才暂记为异源。

例如,“共享单车减少短途汽车出行”与后文“我在雨天仍选择打车”并不只是一正一反。前者是一般因果主张,后者是经验反例;若结尾据此把立场修正为“基础设施与天气条件决定替代程度”,则经验源、立场源和组织源发生回判。相反,开头说“共享单车环保”,结尾说“总之共享单车对环境有益”,只是同源复述,即使相隔数段也不构成异源。

(五)R、B、C、U 的重新定位

先导结果表明,四类命运仍有分析价值,但不能由固定操作族直接触发。V2 设计应让每种操作都有可能进入 R、B、C 或 U。例如,同一类“关系中性替换”在不同文本中可能破坏远程隐喻而被 R,可能保留全部承诺而被 C,也可能因证据不足为 U;同一类删除可能移除冗余而被 C,也可能移除桥接而被 B。只有当操作类别与命运的可预测性显著下降,命运差异才有机会归因于文本结构。

此外,B 不应只由删除让步测量。可以对一处疑似摩擦单元进行三种等长度替代:删去、改成同向陈述、改成另一异源反例。若后两种对远程关系造成不同影响,才能识别该单元到底承载了“反方位置”、具体经验内容,还是仅占据一个模板槽。第三体机制由此从形象的“容纳异物”转为可操纵的中介功能检验。

(六)理论身份:不是新本质,而是可检验的研究纲领

经过反证,“异源回判”不再被宣称为作文的本质。它首先是一项中层假说:在某些作文中,局部选择会受到跨段、跨来源关系的返回性约束,这种约束可用遮蔽后的远距增益测量,并可能与读者感知的整体性、修改质量和迁移能力相关。若后续研究发现 Δ_remote 不能区分作文与匹配的非作文文本,它仍可降级为一般复杂文本能力;若它与质量评价无关,则可能只是一种结构类型;若盲评无法复现,概念应被进一步修改或放弃。

(七)竞争解释与判别预测

异源回判要获得理论地位,不能只比被淘汰的“内生判差”更精细,还必须战胜能够解释同一现象的较简单模型。第一种竞争解释是纯局部连贯模型:读者对改动命运的判断,主要来自目标句附近的语义相容、指称连续和话语标记;所谓远程证据只是分析者在全文中的事后搜寻。该模型预测,只要局部窗口包含相同词汇、实体与连接标记,原文和跨段关系被破坏的拼盘在判断上不会稳定分开。异源回判模型则预测,在控制局部窗口后,遮去远程异源锚点会使部分判断系统性退化为 U,且这种退化在原文显著多于拼盘。两者的分歧不在全文是否“看起来更顺”,而在远程消融是否产生篇级增量。

第二种竞争解释是任务合规模型。考试或课堂作文共享题目、立场模板和评分习惯,远处段落之所以相互可预测,可能只是都在响应同一任务,而非彼此形成回判。该模型预测:保留题目与通用总论点、但替换具体经验材料以后,判断能力基本不变;不同作文中同一模板槽的句子可以相互替换。异源回判模型则预测,经验、立场和组织功能之间一旦形成具体耦合,同题移植不能完全保持原命运。确认性研究可设置“同题同立场—异材料”与“同材料—异立场”两个正交对照,检验真正发挥作用的是题目一致,还是文本内部的异源组合。

第三种竞争解释是一般复杂性模型。较长文本拥有更多句子、更多潜在锚点和更多被分析者选中的机会,因此 Δ_remote 可能只是长度、词汇多样性或关系密度的函数。若如此,篇幅匹配的合同、证明和技术说明应取得同等甚至更高的远距增益,作文身份没有解释增量。异源回判理论对此作出较窄预测:复杂非作文文本当然可以有强回判,但其路径更多由定义、公理或制度规则预先封闭;作文中较典型的模式应跨越经验选择、立场修正与语言实现。分析时必须先用长度、段数和锚点候选量建立基线,再检验来源层数与开放问题情境是否增加解释力。若没有增加,理论应降级为一般文本复杂性指标。

第四种竞争解释是读者补足模型。远距关系或许主要存在于熟练读者的推理,而不是文本信号中。同一篇短文,熟悉体裁者能恢复反讽与省略,不熟悉者则不能。若回判完全依赖读者背景,文本锚点的一致性会很低,遮蔽实验的结果也会随专业知识而剧烈变化。异源回判并不否认读者参与,却要求补足受到成文信号约束。未来可让不同背景读者先独立指出锚点,再交换理由;若他们虽给出不同解释,却反复指向相同的标题反差、语气转换或结尾回扣,说明文本提供了约束。若锚点无稳定聚集,只能依靠外部知识讲出合理故事,则该案例不应计为强回判。

四种竞争解释还要求改变模型比较方式。不能只问异源回判指标是否与总体评分相关,因为长度、词汇与任务合规同样可能相关。更严格的顺序是:先拟合局部窗口信息,再加入题目与模板信息,再加入长度和一般复杂性,最后才加入预注册的远程异源特征;只有最后一步带来跨文本验证中的新增预测,才支持理论增量。对单篇案例也应采用同样逻辑:先给出最省力的局部解释,再证明它为何不足,不能一开始便把所有远处联系收入概念。

这一判别框架使“异源回判”承担双重风险。它既可能被局部模型击败,也可能被更一般的复杂文本模型吸收。前者意味着远程增量不存在,后者意味着增量存在但没有作文特异性。只有当原文在困难拼盘上显示远程优势、这种优势不能由题目与长度解释、路径又跨越不同来源层并能被盲评者复现时,组合一才获得下一阶段的经验资格。

▌九、对“作文是什么”的阶段性回答

(一)从文本物转向书面行动

先导失败提示,作文不能仅被定义为具有某种静态网络的文本物。写作者面对一个不完全封闭的问题,从可能材料中选择经验,形成或试探立场,并以语言形式安排这些选择;读者随后沿文本关系回判这些选择。作文因此更接近一种书面行动,其产物是文本,但其身份同时包含问题情境、选择过程和可读关系。

“行动”并不意味着必须知道作者的心理史。成文中会留下行动痕迹:为何选择这个例子而不是另一个,为何在此处转折,为何结尾重新命名开头的问题。读者不必还原真实意图,只需判断这些选择是否在文本与情境之间形成可审计关系。行动性由此兼顾过程研究与文本研究:它承认生成,却把可检验对象放在成文关系上。

(二)三个原型条件

本文提出作文的三个原型条件,而非充分必要条件。

第一是开放的不完备性。作文所面对的问题不能被既定规则完全算出。即使题目要求明确,材料取舍、视角、立场、语气和组织仍有多种可辩护方案。开放性区别于纯粹填空,却不排斥论证规则和体裁约束。

第二是远距异质组织。作文不只是连续造句,而是让经验、立场与语言选择在不同位置、不同关系类型中相互改变意义。这里的远距是功能距离,不必机械等于若干段;短文中的标题—结尾反转也可以具有高功能距离。异质则要求不把重复当作多路。

第三是可回判性。文本为读者提供足够信号,使局部选择能够被后续或先前关系重新判断:它为何必要、为何可替换、为何构成张力、为何保持未定。可回判不是唯一正确解释,而是解释需要受文本证据约束。

(三)阶段性定义句

在当前证据下,较稳妥的回答是:

作文不是能在局部发现矛盾的文本;作文更可能是一种把经验、立场与语言选择组织成远距、异源、可回判关系的书面行动。

这句话有意保留“更可能”。它既不是词典释义,也不是完成了普遍验证的本体论。它是组合一经首轮现实数据否决后留下的最小承诺。与“内生判差体”相比,它撤回了封闭性,加入关系来源异质性,把局部总命中改为远距增量,并把对象从静态成品恢复为书面行动。

(四)身份与质量的分离

一篇关系单薄、主要靠邻接推进的学生文字仍可能是作文,只是整体性较弱。反之,合同或证明具有很强远距回判,也不因而成为作文,因为其问题开放度、行动目的与体裁制度不同。异源回判最适合描述作文质量与成熟度中的结构维度,而作文身份仍由开放书面行动的原型情境共同决定。

这种分离防止理论变成排斥初学者的门槛。教育研究尤其不能把高水平结构能力倒过来定义对象,否则“写得不好”会被偷换成“不是作文”。概念的任务不是取消低质量成员,而是解释同一对象类别内部为何出现不同程度的整体组织。

▌十、教学、评价与写作技术的含义

(一)教学目标:从“句句正确”转向“远处能回来”

组合一对教学最直接的启示,是不要把修改压缩为局部纠错。教师可以要求学生为一个关键句画出三类回判:它由前文什么经验支持,被后文什么立场限定,在语言上与哪一处词语或声音发生回响。若所有箭头都指向相邻句或中心句复述,学生看到的就不是“没有结构”,而是远程增量尚未形成。

一种可行练习是“遮蔽阅读”。先遮去题目和总论点,让同伴只凭正文判断一处例子的功能;再遮去例子邻句,看远处是否仍提供线索;最后恢复全部文本,比较判断如何变化。练习的重点不是追求唯一答案,而是让学生区分局部可懂、主题相关与全文必要三种不同性质。

另一种练习是“承载测试”。选取一处反方、犹疑、转折或叙事摩擦,分别删去、改成同向句、换成另一个反例,观察结尾和中段哪些位置随之失去功能。这样,所谓“详略得当”“照应”不再只是教师评语,而成为可被学生操作和观察的关系变化。

(二)评价量规:把整体性拆成增量证据

传统量规常列“中心明确、结构完整、衔接自然”。这些维度容易诱发模板写作:首尾重复中心,段首加连接词,便获得表面完整。异源回判取向的量规可以增加三个观察项:是否有跨功能区域的关系;这些关系是否来自不同信息层;遮去邻句与重复中心后,是否仍能说明局部选择的作用。

评价时不宜直接计算箭头数量。高密度关系图可能奖励冗余。更有意义的是提供一到两个“差异性证据”:某句若改动,远处哪些不同性质的承诺会改变;某段若删除,后文回应、结尾判断或叙述声音是否随之失去对象。量规由此从静态特征清单转向反事实解释。

同时,U 应被保留为合法结果。文本内部不能判断某个事实,不代表作文失败;它可能提醒写作者补充证据,也可能表明该事实需要引用外部来源。强迫所有扰动落入 R/B/C 会鼓励评分者用常识替代文本证据。对事实性写作,应把外部可核验性与内部回判性分成两个维度。

(三)反馈语言:指出关系去向而非只贴标签

“不连贯”“离题”“这里删掉”对学习帮助有限,因为它们没有说明偏差如何进入全文。教师反馈可以改写为关系描述:“这句话在局部与上一句顺接,但后文没有再使用它提供的区别,因此目前像同题移植”;“这处反方看似绕开中心,却让结尾的限定成立,删除会使结论变成无条件口号”;“首尾都重复观点,但证据来源相同,还没有形成异源回判。”

这种语言不要求教师使用跨学科术语。超分子、第三体和闭合相位属于研究者的发现工具,课堂只需保留其操作后果:多处关系、不同来源、遮蔽测试、功能去向。否则概念创新会变成新的术语负担。

(四)自动写作评价与生成式人工智能

自动评分系统容易利用长度、连接词、主题相似度和局部流畅度,这些特征可能与分数相关,却正好复制本研究暴露的高 N 问题。生成式模型也能稳定生成段内连贯、首尾回扣的文本,但重复中心句不等于异源关系。一个更严格的系统应实施反事实消融:遮去邻句和总论点后预测某一单元的功能,再检测来自不同段落与不同关系层的证据是否提供增量。

不过,自动系统不能把 Δ_remote 直接当作新的总分。算法可能通过长度和主题线索间接猜中,也可能对短文、隐喻和文化互文不公平。合理用途是诊断与提问:指出哪些判断完全由局部完成,邀请写作者检查远处承诺;而不是把“远距越多”设为普遍规范。任何自动化版本都需要与人工盲评、困难非作文对照和不同语言体裁共同验证。

(五)课程设计:从一次成文转向关系重构

若作文被理解为组织选择的书面行动,课程就不应只比较初稿与终稿的分数,而应记录关系如何改变。学生可以提交“关系变更说明”:本轮新增了哪条异源证据,删除了哪处伪远距复述,哪一处原被当作错误的摩擦单元被重新确认有承载功能。教师由此评价的不是修改数量,而是判断是否变得更有依据。

这种设计也有助于区分文体。议论文的回判可能发生在主张、反例与限定之间;记叙文可能发生在早期细节、角色选择与结局重释之间;抒情散文可能依靠意象复现、声音转调和题旨浮现。异源回判不是把所有作文变成论证树,而是提供一个跨文体问题:远处的不同关系是否让局部选择获得了后来才显现的必要性?

▌十一、限制与确认性研究方案

(一)当前证据的六项限制

第一,样本只有十二篇且均为英语说服性学生作文,不能代表中文作文、叙事文、考试作文或专业散文。第二,七十二项扰动嵌套于篇内,不是七十二个独立文本;本文只报告描述性比例,没有进行总体显著性推断。第三,单一分析者知晓假说与阈值,编码可能受期待影响,也无法估计评者一致性。第四,操作细则存在迟注册,两处 R2 运行例外可能提高承载命中。第五,因充分停止规则触发,没有生成顺序与拼盘对照,故不能估计原文的相对优势。第六,AAE2 的标注本体偏重段内论证树,远程异源关系需要另行标注。

还有一个更深限制:扰动研究测量的是文本对人为编辑的响应,不一定等于自然写作中的结构形成。写作者可能在生成过程中使用读者无法恢复的计划,读者也可能通过体裁知识补足未显式关系。反事实编辑是一扇窗口,不是整体性的全部。

(二)确认性样本与对照

下一轮建议至少纳入三十六篇公开作文,按文体、长度和质量分层;同时为每篇建立三类困难对照。第一类为同题拼盘,保持段内连贯和主题分布,只破坏跨段来源关系。第二类为中心句复制对照,保持高词汇复现与首尾一致,检验同源重复是否冒充多路。第三类为非作文复杂文本,包括证明、合同或规范的短片段,匹配长度与内部约束强度,检验作文特异性。

中文研究不能简单翻译英语操作。汉语省略、零形回指、话题链和意合关系会改变邻域定义;考试作文的题目材料又可能成为全文不可移除的共同源。应预注册“题目依赖”作为独立维度,而不是一律遮去。短文与长文还需使用相对功能距离,不宜以固定句数定义远距。

(三)操作—命运解耦设计

每类操作都应经过预试,使其在理论上可能产生四种命运。可以采用“内容中性操作库”:对目标单元分别实施保义改写、立场反转、来源替换和功能位置迁移,再由与编码者分离的操作团队生成材料。命运编码者不知道操作类别和研究假说,只看到随机化后的条件。若仅凭操作标签的交叉验证准确率仍远高于文本模型,说明混淆未被解除。

R、B、C、U 的手册需加入否定性证据。例如判 B 不只要说明删除后哪里变弱,还要证明这种变弱不能由纯长度减少或指称断裂解释;判 C 要证明远程承诺保持,而非“意思差不多”的直觉;判 R 要排除语法和外部常识的单源判断;判 U 则要记录缺少哪种锚点。编码者应先独立标注路径,再标命运,以减少用结果反推证据。

(四)盲评、可靠性与统计单位

至少两名不知道原假说的编码者独立工作;分歧在主要分析冻结后再仲裁。名义命运类别可报告 Krippendorff’s α,路径跨度和异源层数可报告适合其尺度的可靠性指标。仅有高总体一致率不够,还要分别报告稀少类别与路径判定的一致性,因为类别不平衡会使表面一致率虚高(Krippendorff, 2004, 2018)。

主要推断单位应为作文。可先在每篇内计算 Δ_remote,再报告篇级分布与置信区间;若使用扰动级模型,应以篇为随机效应并考虑操作类型。验证集必须在编码手册冻结后一次性运行。探索性分析与确认性分析分开报告,不把先导研究的九项远程案例重新用于确认。

(五)预注册裁决建议

V2 可以写下更严格的保留条件:原文的篇级 Δ_remote 中位数为正;相对于同题拼盘的配对优势达到预设最小效应;至少三分之二作文方向一致;操作标签单独预测命运的准确率不超过预设上限;盲评者对命运及异源路径达到可接受可靠性;复杂非作文对照不得取得同等模式。若只能区分高低质量而不能区分类别,则明确降级为作文质量维度;若 Δ_remote 接近零或由长度完全解释,则淘汰当前测量;若异源路径无法可靠编码,则暂停概念。

这种裁决比追求一次“显著”更重要。概念研究的危险不是没有数据,而是任何数据都能被重新叙述为支持。预注册的任务是限制叙述自由,让概念必须为某些结果付出代价。

▌十二、SDE V3.9 门控与研究裁决

(一)六道门的结果

表 4 SDE V3.9 六道门控及本轮裁决

门控状态裁决依据
三学科源机制吸收通过三源分别改变了关系、命运与测量设计,非装饰性比喻
碰撞有效性通过27 个碰撞中 21 个有效、2 个边界、4 个无效
理论新颖性暂通过“局部命运由多路关系分流”及其失败后的远距增益仍具研究增量
可复现性通过但折损数据版本、哈希规则、样本编号与逐项编码保存;存在迟注册和例外
现实数据门未通过N=0.8750 触发预注册淘汰线;操作标签预测率 0.8611
反证公开通过高 J 与不利 N、设计混淆、停止规则和边界反例同时报告

源机制门与现实数据门可以给出不同结果。三学科确实产生了新的问题与测量想法,不等于第一次量表已经有效。同样,量表失败也不自动证明所有理论直觉错误。严格裁决必须说明失败发生在哪一层:本轮被否决的是“全文高判差覆盖率足以表示作文整体性”的操作化;没有被直接检验的是经修订的远距异源增益;不能再肯定的是“作文就是内生判差体”。

(二)必须撤回、可以保留与尚待检验的命题

必须撤回三项。第一,不能把“内生判差”写成作文定义。第二,不能用 J=0.9722 宣称获得经验支持。第三,不能把 R/B/C 分布当作文本自发分流的证据,因为操作类别强烈预编码命运。

可以保留三项。第一,局部扰动的命运比简单对错更丰富,承载与消隐值得继续研究。第二,局部窗口是任何整体性指标必须战胜的强基线。第三,闭合量的协方差警告可以转化为文本路径的异源性要求。

尚待检验的也有三项。第一,Δ_remote 是否在作文中稳定大于零。第二,它能否区分作文与匹配的复杂非作文文本,还是只区分一般整体性。第三,它与人工质量判断、修改收益和跨任务迁移是否相关。把三类命题分开,是避免“理论没有被彻底证伪”被偷换为“理论已经成立”的必要条件。

(三)失败的知识价值

若研究只追求肯定结论,本轮会被描述成 97.22% 的成功率。但预注册的 N 使同一数据显露相反意义:97.22% 中大部分是局部可还原和操作预编码。失败由此不是研究的附录,而是概念精度的来源。它迫使“内部”变成“异源”,“全文命中”变成“远距增量”,“两条路径”变成“遮蔽共同源后仍有判力的路径”。

这种改写也回应了 What 型研究的基本责任。回答“是什么”不能只提供一个悦耳定义,还要说明什么不算、什么会使定义失败、失败后对象应如何重新划界。组合一的贡献,恰在它没有保护自己的第一次答案。

▌结论

本文从“作文是什么”而非“怎样写作文”出发,将超分子化学、第三体摩擦学与射电干涉闭合相位置于同一概念试验中。三者分别提供多点协同、偏差去向和关系不变量,第一次碰撞形成“内生判差”与 R/B/C/U 的偏差分流。若研究停在理论推演,这一概念足够新颖,也足够诱人;但公开语料的审计性先导给出了决定性的反证。

十二篇 AAE2 作文、七十二项最小扰动中,全文判差覆盖率达到 0.9722,却有 0.8750 的判断可由改动句和一条邻句复现;高把握子集的近邻可还原率更高。操作标签本身能够预测 0.8611 的全文命运。高命中因此主要来自局部连贯与设计同构,而不是已被证明的作文整体。依预注册,“作文是内生判差体”必须撤回,“偏差分流”不得宣称独立成立。

不过,反证没有让组合一归零。它把真正的问题从“全文能否判断”推进到“远处且来源不同的关系是否提供超过局部基线的判断增量”。据此,本文提出异源回判及 Δ_remote:遮去邻句、重复总论点与同源复述后,跨段、跨层关系仍能否改变局部单元的命运。这个指标需要新的盲评、困难对照与篇级统计,当前尚未得到确认。

对“作文是什么”的阶段性回答因而是谨慎的:作文不是能在局部发现矛盾的文本;它更可能是一种把经验、立场与语言选择组织成远距、异源、可回判关系的书面行动。这里的“更可能”不是软弱措辞,而是证据边界。一个经受过失败的假说,比一个从未允许自己失败的定义更接近研究。

▌附录 A:样本锁定与可复现信息

确定性种子为 SDE-V3.9-PANCHA-20260817。十二篇样本按 SHA-256 升序锁定:essay238、essay326、essay178、essay039、essay056、essay161、essay057、essay162、essay082、essay049、essay045、essay115。原始压缩包 brat-project-final.zip 的 SHA-256 为 9f49a6d388896d0f390445592ccc9dbfc87325553e3fe3f988eb252de7cdc4b5;train-test-split.csv 为 903176797ea73c45e3848019bc390882a2bdab520e5feb4b28fd75d95ec44285;prompts.csv 为 5ad978f277c5420a491df8a87bb62cb2efeecea62f18bdcfff2fe1412182b6f4。

本轮句数纳入规则采用正则 [.!?]+(?=(?:["’”)]?\s)|$) 识别句末标点组。预注册文本曾因 Markdown 排版显示为双反斜线,运行前、读取入样正文语义内容前完成勘误。按可执行规则,402 篇均达到八句门槛。样本在正文阅读后不得因主题、文体、质量或结果方向替换。

▌附录 B:V2 最小编码记录模板

后续每项扰动至少记录:作文编号;文体与长度层;操作生成者;操作类别;目标跨度;局部窗口;被遮蔽的中心句与同源复述;远程锚点位置;经验源、立场源、组织源、语言源的层别;局部命运;远程异源命运;全文命运;判断把握;否定性证据;编码者编号;分歧与仲裁。主要分析冻结前不得查看操作标签—命运列联表。

▌参考文献

Beaufort, A. (2007). College Writing and Beyond: A New Framework for University Writing Instruction. Logan, UT: Utah State University Press.

Bereiter, C., & Scardamalia, M. (1987). The Psychology of Written Composition. Hillsdale, NJ: Lawrence Erlbaum Associates.

Berthier, Y., Vincent, L., & Godet, M. (1992). Velocity accommodation sites and modes in tribology. European Journal of Mechanics A/Solids, 11(1), 35–47.

Blackburn, L., Pesce, D. W., Johnson, M. D., Wielgus, M., Chael, A. A., Christian, P., & Doeleman, S. S. (2020). Closure statistics in interferometric data. The Astrophysical Journal, 894, 31. doi:10.3847/1538-4357/ab8469

Chael, A. A., Johnson, M. D., Bouman, K. L., Blackburn, L. L., Akiyama, K., & Narayan, R. (2018). Interferometric imaging directly with closure phases and closure amplitudes. The Astrophysical Journal, 857, 23. doi:10.3847/1538-4357/aab6a8

de Beaugrande, R.-A., & Dressler, W. U. (1981). Introduction to Text Linguistics. London: Longman.

Descartes, S., & Berthier, Y. (2002). Rheology and flows of solid third bodies: Background and application to an MoS1.6 coating. Wear, 252, 546–556. doi:10.1016/S0043-1648(02)00008-X

Fillot, N., Iordanoff, I., & Berthier, Y. (2007a). Modelling third body flows with a discrete element method—A tool for understanding wear with adhesive particles. Tribology International, 40(6), 973–981. doi:10.1016/j.triboint.2006.02.056

Fillot, N., Iordanoff, I., & Berthier, Y. (2007b). Wear modeling and the third body concept. Wear, 262(7–8), 949–957. doi:10.1016/j.wear.2006.10.011

Flower, L., & Hayes, J. R. (1981). A cognitive process theory of writing. College Composition and Communication, 32(4), 365–387. doi:10.2307/356600

Godet, M. (1984). The third-body approach: A mechanical view of wear. Wear, 100(1–3), 437–452. doi:10.1016/0043-1648(84)90025-5

Halliday, M. A. K., & Hasan, R. (1976). Cohesion in English. London: Longman.

Hayes, J. R. (2012). Modeling and remodeling writing. Written Communication, 29(3), 369–388. doi:10.1177/0741088312451260

Iordanoff, I., Berthier, Y., Descartes, S., & Heshmat, H. (2002). A review of recent approaches for modeling solid third bodies. Journal of Tribology, 124(4), 725–735. doi:10.1115/1.1467632

Jennison, R. C. (1958). A phase sensitive interferometer technique for the measurement of the Fourier transforms of spatial brightness distributions of small angular extent. Monthly Notices of the Royal Astronomical Society, 118(3), 276–284. doi:10.1093/mnras/118.3.276

Krippendorff, K. (2004). Reliability in content analysis: Some common misconceptions and recommendations. Human Communication Research, 30(3), 411–433. doi:10.1111/j.1468-2958.2004.tb00738.x

Krippendorff, K. (2018). Content Analysis: An Introduction to Its Methodology (4th ed.). Thousand Oaks, CA: Sage.

Lehn, J.-M. (1988). Supramolecular chemistry—Scope and perspectives: Molecules, supermolecules, and molecular devices. Angewandte Chemie International Edition in English, 27(1), 89–112. doi:10.1002/anie.198800891

Lehn, J.-M. (2002). Toward complex matter: Supramolecular chemistry and self-organization. Proceedings of the National Academy of Sciences, 99(8), 4763–4768. doi:10.1073/pnas.072065599

Mammen, M., Choi, S.-K., & Whitesides, G. M. (1998). Polyvalent interactions in biological systems: Implications for design and use of multivalent ligands and inhibitors. Angewandte Chemie International Edition, 37(20), 2754–2794. doi:10.1002/(SICI)1521-3773(19981102)37:20%3C2754::AID-ANIE2754%3E3.0.CO;2-3

Mann, W. C., & Thompson, S. A. (1988). Rhetorical structure theory: Toward a functional theory of text organization. Text, 8(3), 243–281. doi:10.1515/text.1.1988.8.3.243

Miller, C. R. (1984). Genre as social action. Quarterly Journal of Speech, 70(2), 151–167. doi:10.1080/00335638409383686

Nosek, B. A., Ebersole, C. R., DeHaven, A. C., & Mellor, D. T. (2018). The preregistration revolution. Proceedings of the National Academy of Sciences, 115(11), 2600–2606. doi:10.1073/pnas.1708274114

Nystrand, M. (1986). The Structure of Written Communication: Studies in Reciprocity Between Writers and Readers. Orlando, FL: Academic Press.

Stab, C., & Gurevych, I. (2017). Parsing argumentation structures in persuasive essays. Computational Linguistics, 43(3), 619–659. doi:10.1162/COLI_a_00295

Witte, S. P., & Faigley, L. (1981). Coherence, cohesion, and writing quality. College Composition and Communication, 32(2), 189–204. doi:10.58680/ccc198115912


第三章 补节 读得出的那一部分,恰恰不是整体性

(一)最近的祖宗与分离线

本章最硬的一段,是它对自己的否决:全文判差覆盖率 0.9722 看似极强,但 63/72 的判断只用改动句加一条邻句即可还原;更严重的是,不读作文、只看施加了哪一类扰动,逐篇留一预测即可命中 62/72(0.8611)

这个发现有一个精确的祖宗,本章零命中。

古鲁兰甘等人《自然语言推理数据中的标注人工痕迹》(Gururangan, Swayamdipta, Levy, Schwartz, Bowman & Smith, NAACL 2018)与波利亚克等人的「只看假设」基线(Poliak et al., \*SEM 2018)。两篇同时发现:在当时最主流的推理数据集上,只看假设句、完全不看前提,模型就能大幅超过多数类基线——因为标注者在构造样本时留下了系统性的表层痕迹(否定词、含糊语、长度)。此后这一支长成了「捷径学习」的完整文献(McCoy et al. 2019 的词汇重叠启发式;Geirhos et al., *Nature Machine Intelligence* 2020)。

本章那条 0.8611 就是标准的「只看假设」基线:操作标签相当于假设,作文相当于前提,而预测只用了前者。本章把它诊断为「实验者预先设计的操作性质被误认成文本自身的组织能力」——诊断完全正确,但这套诊断已有成熟名字、成熟的对策清单(对照集、去偏采样、人工痕迹审计)和成熟的报告规范。

分离线:那一支处理的是数据集与模型,本章处理的是概念与量表。古鲁兰甘等人的结论是「这个基准测不出它声称要测的能力」,补救办法是换数据;本章的结论是「这个操作化定义把实验设计的性质算进了对象的性质」,补救办法是换定义——本章据此把「内生判差」整个撤下,改提远距增益。前者修数据以保住概念,后者弃概念以保住诚实。这是一处真实的差别,而且对本章有利。但正因为有利,更不该省略:一个已经在别的领域被命名、被制度化的失败模式,在本领域第一次出现时应当被认领,而不是重新描述。

编者的判断:本章补上这条分界之后,它的方法论价值不但不降,反而上升——它成为「捷径学习审计」在写作研究中的第一个案例,并且证明了这套审计可以推翻的不止是数据集,还有概念。

(二)与本卷其他章的关系

本章与第七章有一条隐蔽的接口,两边原稿都未写。本章证明的是「局部窗口能还原的判断,不构成整体性证据」;第七章证明的是「关闭动作不进任何账」。合起来是一条更强的话:我们现有的账本不但漏记了一些东西,它记下的那部分还会系统性地高估自己的解释力。建议在成书时于第七章末互引一句。

(三)本章欠账

样本仅十二篇作文、七十二项判断,且原稿自陈存在迟注册与例外。「异源回判」是本章反证之后提出的新假说,尚未被任何数据检验——本章的可信度目前几乎全部来自它否决旧概念的那部分,而非它提出新概念的那部分。读者应据此把本章读成一份证否报告加一个待检假说,而不是一个已成立的理论。