← 专著页 · 分章目录 · 上一节 · 下一节

数据 · 证据 · 人机分工声明

文心探幽·卷二 作文如何发生? · 约 965 汉字

本卷九章由九篇独立研究改编而成。为免各章重复声明、口径不一,编者把原分散在各章末尾的数据说明、证据边界与人机分工声明合并于此,各章末尾此后只留文献。

一 · 数据与可复算

本卷九章中,有四章带有在成文之前完成的预注册统计,其数据全部来自公开可获取的资源,任何人可按各章所载的编码规则与阈值复算:

第二章使用一份公开的中学生作文语料,取其前四万行,剔除清洗后汉字少于一百的篇目,最终样本三万九千六百七十二篇;统计用秩相关与非参数检验。

第三章使用一份公开的英文写作键击语料的任务级元数据,样本一千零六名参与者;模型与阈值在取数之前写定。

第六章使用一份公开的学生作文评分语料的同一题组,按人工总分分层各取两篇,共十二篇,做探索性编码;该编码为单编码者试跑,不作为量表效度证据。

第九章使用六个公开源码仓库的完整提交历史,纳入文件级改动四万二千一百四十六次;仓库选择规则在取数之前写定,不按星标数、不按活跃度筛选,也不在看过结果之后更换仓库。

各章数据的具体地址、字段与清洗规则载于对应章节的方法节与附录。

二 · 预注册

上述四章的预注册文本均先于统计写就并存档,事后未作修改。凡使用回溯数据或事后分析者,各章正文均已明确标注为事后分析,不与预注册结果混报。

三 · 不利结果

本卷的体例是:不利结果原样保留在正文里,不移入附录,不作缺陷说明。

第三章的预注册二次项方向与预期相反且不显著,作者据此删掉了整条第三层主张;第九章的三条假设全部未通过,作者据此撤回了跨域主张并给机制增加了第三个条件;第二章的分布诊断暴露了读数在高值区失去分辨力,作者据此把适用区间收窄;第六章的探索性编码出现天花板,作者据此撤回了「读数越高作文越好」。

四处修订全部保留在各章正文中,编者一处未删。

四 · 证据边界

本卷各章对其取源学科的叙述依据公开学术资料。跨学科转译不意味着来源学科已经认可这些概念在写作研究中的用法;各章提出的新对象与读数属于研究假说,不是已获确证的结论。

各章的读数均为机制读数,不是质量评分。本卷明确禁止把其中任何一个读数直接用于学生排名、评优或处罚。 一旦这类读数进入奖惩,被测行为立刻改变,最省事的达标方式恰恰摧毁读数的真实性——这一点第二章与第三章各有专节论证。

五 · 人机分工

选题、取源学科的选定、成文方向与全部判断的取舍由著者决定。文献核对、语料获取、统计计算、初稿撰写与文档排版使用了生成式人工智能辅助。各章预注册文本均在运行统计之前写定。最终的理论主张、引文准确性、研究伦理与对外使用责任由署名著者承担;本卷对其中的全部错误负责。

← 专著页 · 分章目录 · 上一节 · 下一节