SDE Universes·新思想前沿语言、文学与艺术的其余
新思想前沿 · 语言、文学与艺术的其余

语料库与量化语言学

近二十年 · 两幕 · 20 个新思想 · 约 23,516 字 · 王德生 亲撰 · 2026 年 8 月

语料库与量化语言学在过去二十年完成了从“更多文本”到“可审计数据基础设施”的转向。Web语料、COCA、Google Books Ngram、通用依存树库、分布语义和统一信息密度,首次让规模、时间、体裁和量纲系统进入语言研究;与此同时,搜索可见性、分词、标签与概率模型也显示,语料从来不是语言的透明容器。2016年以后,Data Statements、词向量去偏失败、C4审计、去重与记忆泄漏、时间错位、Dolma、CulturaX、DataComp-LM和FineWeb把过滤日志、版本、许可、撤回和文化覆盖推到前台。万亿词元不是结论,逐语言保留率、测试污染、有效多样性和同计算预算下的增益才是可复算对象。本面板因此把“谁进入分母、谁在清洗中消失、版本怎样回写结果”作为二十条共同主线。全文以20个转向而非年代事件串联语料抽样、编码、过滤、版本与量化指标,每条分别交代旧卡点、单因命题、关键读数、争议边界、实践后果和跨面板接口。正文同时保留提出、争议、最新三笔来源与八字段供料层,使读者能区分:结论来自对象本身,还是来自网页抓取、树库、词向量、去重日志、数据卡与开放语料、样本分母、版本与制度选择。最终标准不是“读起来像综述”,而是20条均能被反查、被证伪、被换算。

【第一幕】上一个十年 · 约 2006—2016

第一幕从Web语料、动态平衡语料、文化组学、依存树库、分布语义与信息密度出发,让抽样机制和分母进入语言理论。从Web即语料库、COCA的动态平衡语料、文化组学与Google Books Ngram等8条可见,这一幕的共同判据是:旧分类遇到边缘材料时,必须用分层读数而不是“例外”收口,并公开谁被排除。

甲、Web即语料库Web as Corpus

提出Baroni, M. et al. (2009). The WaCky Wide Web: a collection of very large linguistically processed web-crawled corpora. Language Resources and Evaluation, 43, 209–226. 争议Kilgarriff, A. & Grefenstette, G. (2003). Introduction to the special issue on the Web as corpus. Computational Linguistics, 29, 333–347. 最新Data, Data Everywhere: A Guide for Pretraining Dataset Construction. EMNLP 2024, 10471–10503. 关键大规模网页采样与可重复清洗

从Web即议题的材料看,Web即语料库在2009年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。核查Web即议题时,该转向出现以前,研究者多把“传统语料库规模有限且更新慢,网络数据则被视为太脏而不能研究”当作无需再问的背景。被robots规则、付费墙和失效链接挡在语料外的文本一旦被删去,分类稳定性便无法与记录偏差分开。

在Web即议题这条证据链上,本条不是说大规模网页采样与可重复清洗“也很重要”,而是要求先结算这一项。Baroni(2009)的最小检验是保留文档数/原始抓取文档数;当网页可见性由平台优化主导时,更大网络样本会反过来放大商业偏差。一旦把这些漏记对象外的文本重新计入,Web即语料库原来的平均值、类别边界和责任归属都可能同时改变。

ukWaC网页语料规模超过20亿词,并把抓取、去重和语言识别步骤显式化。对Web即议题做反向检验,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。只要该研究线索仍把这组账外材料外的文本在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。Web即议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

尚未收敛的部分是搜索引擎与爬取策略会不会把商业可见性误当语言频率。该转向的失效条件是:当网页可见性由平台优化主导时,更大网络样本会反过来放大商业偏差。上述机制的关键不是增加术语,而是让这一比率在独立材料和尾部对象上能够被别人复算。

由此产生的实践后果是:语料发布应保存URL、抓取日期、过滤日志和被删样本,而非只给清洁文本。在语料发布、模型训练、基准评测与数据治理中,应把这组账外材料外的文本设为固定字段,并按该复核口径发布分层结果。Data(2024)进一步要求把这一制度安排的版本、人工修订与这些漏记对象外的文本的失败记录连成可追踪链。Web即议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

把Web即议题放回原窗口,两边共享“谁进入分母”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入这组账外材料外的文本,才能判断互证、反号或第三项。把Web即议题放到另见第 233 号第 12 条『新说者研究把母语者边界改写为实践归属』旁核验:先对齐对象、时间窗和责任人,再检查Web即议题的核心判断在另一套分母中是否仍同向。

位置S|Web即议题作结果量 单因Web即议题的核心决定项 预设〔01 谁进入分母〕Web即议题沿用既定对象边界 量纲Web即议题同向记录数/全部可核对记录数 失效漏掉被robots规则时,Web即议题读数越高,真实覆盖反而越低 自曝Web即议题(第1条):原材料未覆盖者需另表 空栏被robots规则 异名另见第 233 号第 12 条『新说者研究把母语者边界改写为实践归属』

乙、COCA的动态平衡语料Monitor Corpus

提出Davies, M. (2008–). The Corpus of Contemporary American English (COCA). Brigham Young University. 争议Biber, D. (1993). Representativeness in corpus design. Literary and Linguistic Computing, 8, 243–257. 最新Egbert, J., Biber, D. & Gray, B. (2022). Designing and Evaluating Language Corpora. Cambridge University Press. 关键跨体裁、跨年份的配额更新

核查COCA议题时,Davies(2008)把COCA的动态平衡语料改写成一个分母问题。这项转向最初针对的是平衡语料常一次建成后长期不变,体裁比例被当作永久代表性。在COCA议题这条证据链上,只有让未被传统体裁表容纳的播客、即时通信和平台评论获得可比较位置,旧边界才可能接受反例检验。只要该转向仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

对COCA议题做反向检验,Davies(2008)把跨体裁、跨年份的配额更新置于解释次序的第一位,并用某体裁年度词数/当年语料总词数作为成败读数。边界是:当新媒体取代旧体裁时,维持旧配额会反过来降低现实代表性;一旦COCA的动态平衡语料触发这一条件,就不能再用其他修饰条件保护中心主张。与其继续扩大本项证据的总体样本,不如先检验谁进入分母是否在不同装置和人群中仍然成立。

COCA以多体裁平衡和持续更新为核心,年度版本使时间变化与体裁差异可以分开。把COCA议题放回原窗口,其使COCA的动态平衡语料从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。该研究线索由此把谁进入分母从背景假定移到检验台上,使支持者与反对者必须使用同一分母。就COCA议题的外推边界看,对该研究线索而言,其一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。围绕COCA议题,该研究线索另固定2项结构读数、3类材料与4次版本复核。

争议集中在固定体裁配额能否代表媒体结构迅速变化后的语言总体。Biber(1993)的复核指出:当新媒体取代旧体裁时,维持旧配额会反过来降低现实代表性。沿COCA议题的责任链,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。

另一处常被略过的是,监测语料需同时发布配额、来源变动和新增平台,时间趋势不能与采集方式变化混写。本项证据在2022年的实践验收应同时公开某体裁年度词数、说明当年语料总词数,并给该未登记群体留下可撤回、可修订的记录。COCA议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

在该研究线索中,两边共享“谁进入分母”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。这也意味着,语料发布、模型训练、基准评测与数据治理处理这项命题时不能只保存成功案例,还要保留排除理由、版本与反号结果。

位置E|COCA议题作环境条件 单因COCA议题的核心决定项 预设〔01 谁进入分母〕COCA议题沿用既定对象边界 量纲COCA议题同向记录数/全部可核对记录数 失效漏掉未被传统体裁表容纳的播客时,COCA议题读数越高,真实覆盖反而越低 自曝COCA议题(第2条):原材料未覆盖者需另表 空栏未被传统体裁表容纳的播客 异名另见第 534 号第 7 条『RefCOCO:语言第一次必须落到一个具体区域』

丙、文化组学与Google Books NgramCulturomics

提出Michel, J.-B. et al. (2011). Quantitative analysis of culture using millions of digitized books. Science, 331, 176–182. 争议Pechenick等(2015). Characterizing the Google Books corpus. PLoS ONE, 10, e0137041. 最新Younes, N. & Reips, U.-D. (2019). Guideline for improving the reliability of Google Ngram studies. PLoS ONE, 14, e0213554. 关键超长时间序列中的词频变化

在文化组学Goog这条证据链上,Michel(2011)首先定位了文化组学与Google Books Ngram的历史卡点。长期以来,文化史多靠少量经典文本举例,定量语料研究又缺少跨世纪规模;在2006—2016阶段,无法OCR、未数字化和版权受限的书籍不再只是边缘案例,而成为判断对象边界是否成立的证据。

对文化组学Goog做反向检验,本条不是说超长时间序列中的词频变化“也很重要”,而是要求先结算这一项。Michel(2011)的最小检验是目标词年度出现次数/该年度全部词数;当某时期扫描质量显著更差时,词频下降会反过来反映OCR缺失而非文化衰退。只要文化组学与Google Books Ngram仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

Google Books Ngram使用约520万册图书、约5000亿词,覆盖1800年以后的长时段变化。只有把目标词年度出现次数和该年度全部词数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。该研究线索最怕一个总分,因为中心样本改善时,这组账外材料可能正以更快速度退出可见范围。文化组学Goog的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

该转向的争论并不在于有没有阳性案例,而在于OCR错误、出版偏差、语言分类和版本重复会不会制造历史曲线。Pechenick(2015)把边界写成:当某时期扫描质量显著更差时,词频下降会反过来反映OCR缺失而非文化衰退。把文化组学Goog放回原窗口,其时,这一比率不再支持原方向;提出路线自己还承认“项目自己报告馆藏和OCR偏差,公众曲线却常省略置信区间”。反号因此必须进入主分析。

这项转向的连带结果是历史词频必须与OCR置信度、馆藏结构和书籍元数据共同发布,不把图书语料当全社会语言。就文化组学Goog的外推边界看,Younes(2019)表明,本项证据落地后不能只问“能否使用”。语料发布、模型训练、基准评测与数据治理还要记录该复核口径、版本号、人工修订与这组账外材料。这一制度安排的关键不是增加术语,而是让这一比率在独立材料和尾部对象上能够被别人复算。

围绕这项命题,双方同以“谁进入分母”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。该转向由此把谁进入分母从背景假定移到检验台上,使支持者与反对者必须使用同一分母。把文化组学Goog放到另见第 309 号第 20 条『时间序列基础模型:预训练可提供零样本预测,但基准边界要重写』旁核验:先对齐对象、时间窗和责任人,再检查文化组学Goog的核心判断在另一套分母中是否仍同向。

位置E|文化组学Goog作环境条件 单因文化组学Goog的核心决定项 预设〔01 谁进入分母〕文化组学Goog沿用既定对象边界 量纲文化组学Goog同向记录数/全部可核对记录数 失效漏掉无法OCR、未数字化和版权受时,文化组学Goog读数越高,真实覆盖反而越低 自曝文化组学Goog(第3条):原材料未覆盖者需另表 空栏无法OCR、未数字化和版权受 异名另见第 309 号第 20 条『时间序列基础模型:预训练可提供零样本预测,但基准边界要重写』

丁、多语言依存树库的统一接口Universal Dependencies Precursors

提出McDonald, R. et al. (2013). Universal Dependency Annotation for Multilingual Parsing. ACL 2013, 92–97. 争议Nivre, J. et al. (2016). Universal Dependencies v1: a multilingual treebank collection. LREC 2016. 最新Zeman, D. et al. (2024). Universal Dependencies 2.15 release and documentation. UniversalDependencies.org. 关键跨语言一致的句法标注

对多语言依议题做反向检验,McDonald(2013)使多语言依存树库的统一接口原有分类失去不证自明的地位。在2006—2016年,该转向面对的旧卡点是:每种语言使用不同树库和标签,解析器准确率无法直接比较。把多语言依议题放回原窗口,旧框架若继续排除被压入misc标签或无法统一映射的关系,看似整齐的规律就可能只是删选结果。就多语言依议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。

边界是:当本地范畴无法映射时,统一标签会反过来降低分析有效性;一旦多语言依存树库的统一接口触发这一条件,就不能再用其他修饰条件保护中心主张。对多语言依议题而言,可被推翻的责任只落在跨语言一致的句法标注;如果替代机制同样预测结果,这项解释就应撤回。

Universal Dependencies早期版本包含33种语言和37个树库,统一接口同时保留本地扩展。围绕多语言依议题,多语言依存树库的统一接口由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。与其继续扩大该研究线索的总体样本,不如先检验单一读数代表复杂对象是否在不同装置和人群中仍然成立。

反对意见主要指向统一标签会不会抹掉语言特有结构,树库大小和注释质量如何进入分数。争议的可检验部分由Nivre(2016)给出:当本地范畴无法映射时,统一标签会反过来降低分析有效性。沿多语言依议题的责任链,此时须重新计算该复核口径。复算多语言依议题之前,支持方同时记录“UD文档承认语言特有扩展必要,排行榜却偏好单一总体得分”,说明对象会被样本和制度回写。

上述机制还会重排实践的验收顺序:共享层应允许本地扩展,并。按多语言依议题的对象表,本项证据进入语料发布、模型训练、基准评测与数据治理后,工作流须先保存该未登记群体,再进行压缩、排名或展示。对照多语言依议题的主源,Zeman(2024)提醒,总分不能替代上述分子—分母。这一制度安排由此把单一读数代表复杂对象从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

在多语言依议题的实施账本里,本面板测这一比率,对方检验“单一读数代表复杂对象”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把多语言依议题放到另见第 303 号第 8 条『Fano流形上的Yau–Tian–Donaldson定理』旁核验:先对齐对象、时间窗和责任人,再检查多语言依议题的核心判断在另一套分母中是否仍同向。

位置S|多语言依议题作结果量 单因多语言依议题的核心决定项 预设〔01 谁进入分母〕多语言依议题沿用既定对象边界 量纲多语言依议题同向记录数/全部可核对记录数 失效漏掉被压入misc标签或无法统一时,多语言依议题读数越高,真实覆盖反而越低 自曝多语言依议题(第4条):原材料未覆盖者需另表 空栏被压入misc标签或无法统一 异名另见第 303 号第 8 条『Fano流形上的Yau–Tian–Donaldson定理』

戊、分布语义的可计算词义Distributional Semantics

提出Mikolov, T. et al. (2013). Efficient estimation of word representations in vector space. ICLR Workshop 2013. 争议Levy, O. & Goldberg, Y. (2014). Neural word embedding as implicit matrix factorization. NeurIPS 2014. 最新Ethayarajh, K. (2019). How contextual are contextualized word representations? EMNLP-IJCNLP 2019, 55–65. 关键上下文共现形成的向量关系

把分布语义议题放回原窗口,分布语义的可计算词义在2013年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。就分布语义议题的外推边界看,该转向出现以前,研究者多把“词义研究依靠词典释义或人工特征,跨百万词项无法统一计算”当作无需再问的背景。围绕分布语义议题,低频词、未登录词和被过滤的敏感语境一旦被删去,分类稳定性便无法与记录偏差分开。

沿分布语义议题的责任链,本条不是说上下文共现形成的向量关系“也很重要”,而是要求先结算这一项。Mikolov(2013)的最小检验是目标词邻域稳定项数/全部近邻项数;当语料域改变或词被社会重新占用时,邻域方向会反过来漂移。对分布语义的可计算词义而言,这一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

复算分布语义议题之前,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。按分布语义议题的对象表,分布语义的可计算词义形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。对照分布语义议题的主源,该研究线索另固定2项结构读数、3类材料与4次版本复核。

尚未收敛的部分是共现相似是否等于意义,频率、语料域和社会偏差会不会重塑向量。该转向的失效条件是:当语料域改变或词被社会重新占用时,邻域方向会反过来漂移。这也意味着,语料发布、模型训练、基准评测与数据治理处理上述机制时不能只保存成功案例,还要保留排除理由、版本与反号结果。

由此产生的实践后果是:使用向量时应同时报告语料来源、频率分层和反事实邻域,不把相似度当作指称。在分布语义议题的实施账本里,在语料发布、模型训练、基准评测与数据治理中,应把该未登记群体设为固定字段,并按上述分子—分母发布分层结果。Ethayarajh(2019)进一步要求把这一制度安排的版本、人工修订与这组账外材料的失败记录连成可追踪链。

从分布语义议题的材料看,两边共享“单一读数代表复杂对象”,但本条把上述首因置于决定位置。核查分布语义议题时,只有把这一比率换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把分布语义议题放到另见第 233 号第 12 条『新说者研究把母语者边界改写为实践归属』旁核验:先对齐对象、时间窗和责任人,再检查分布语义议题的核心判断在另一套分母中是否仍同向。

位置S|分布语义议题作结果量 单因分布语义议题的核心决定项 预设〔01 谁进入分母〕分布语义议题沿用既定对象边界 量纲分布语义议题同向记录数/全部可核对记录数 失效漏掉低频词、未登录词和被过滤的敏时,分布语义议题读数越高,真实覆盖反而越低 自曝分布语义议题(第5条):原材料未覆盖者需另表 空栏低频词、未登录词和被过滤的敏 异名另见第 233 号第 12 条『新说者研究把母语者边界改写为实践归属』

己、统一信息密度Uniform Information Density

提出Jaeger, T. F. (2010). Redundancy and reduction: speakers manage syntactic information density. Cognitive Psychology, 61, 23–62. 争议Levy, R. & Jaeger, T. F. (2007). Speakers optimize information density through syntactic reduction. NeurIPS 2006 Workshop. 最新Aylett, M. & Turk, A. (2004). The smooth signal redundancy hypothesis. Language and Speech, 47, 31–56. 关键信息率而非句长的分布

就统一信息议题的外推边界看,Jaeger(2010)把统一信息密度改写成一个分母问题。围绕统一信息议题,只有让被转写规范删除的停顿、重启和拖长音获得可比较位置,旧边界才可能接受反例检验。该转向由此把单一读数代表复杂对象从背景假定移到检验台上,使支持者与反对者必须使用同一分母。沿统一信息议题的责任链,对该转向而言,其一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

复算统一信息议题之前,Jaeger(2010)把信息率而非句长的分布置于解释次序的第一位,并用局部信息峰值/句子平均信息率作为成败读数。边界是:当交流目标强调惊奇或艺术突出时,不均匀信息峰会反过来提高效果;一旦统一信息密度触发这一条件,就不能再用其他修饰条件保护中心主张。本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。

按统一信息议题的对象表,其使统一信息密度从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。对照统一信息议题的主源,该研究线索最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。

争议集中在信息均匀究竟来自说话者规划、听者适应还是语法限制。Levy(2007)的复核指出:当交流目标强调惊奇或艺术突出时,不均匀信息峰会反过来提高效果。在统一信息议题的实施账本里,此时该复核口径失去原有解释力;而“UID研究承认不同概率模型会改变峰值位置,却常把一个模型的惊异度当心理真值”又显示,稳定对象也可能由工具制造。从统一信息议题的材料看,只要该转向仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

另一处常被略过的是,语料分析需比较可选形式、语速和听者群体,并公开概率模型的训练域。本项证据在2004年的实践验收应同时公开局部信息峰值、说明句子平均信息率,并给这组账外材料留下可撤回、可修订的记录。这也意味着,语料发布、模型训练、基准评测与数据治理处理这一制度安排时不能只保存成功案例,还要保留排除理由、版本与反号结果。

在这项命题中,两边共享“单一读数代表复杂对象”,却把决定位置放在不同项上;一旦该未登记群体入账,原有对象、路径与条件场都要重画。该转向的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。

位置D|统一信息议题作生成路径 单因统一信息议题的核心决定项 预设〔01 谁进入分母〕统一信息议题沿用既定对象边界 量纲统一信息议题同向记录数/全部可核对记录数 失效漏掉被转写规范删除的停顿时,统一信息议题读数越高,真实覆盖反而越低 自曝统一信息议题(第6条):原材料未覆盖者需另表 空栏被转写规范删除的停顿 异名另见第 146 号第 16 条『新思想 16 · 预测与解释的分离 —— 机器学习进入心理测量后的第一课』

庚、定量语言规律的跨语料检验Quantitative Linguistic Laws

提出Ferrer-i-Cancho, R. & Liu, H. (2014). The risks of mixing dependency lengths from sequences of different length. Glottometrics, 27, 1–20. 争议Piantadosi, S. T. (2014). Zipf’s word frequency law in natural language: a critical review and future directions. Psychonomic Bulletin & Review, 21, 1112–1130. 最新Koplenig, A. (2021). Language structure is influenced by the number of speakers but seemingly not by the proportion of non-native speakers. Royal Society Open Science, 8, 201872. 关键幂律、长度与依存关系的可复算参数

围绕定量语言规律的实证检验,Ferrer-i-Cancho(2014)首先定位了定量语言规律的跨语料检验的历史卡点。该转向的关键不是增加术语,而是让控制谱系后的规律效应/未控制总体效应在独立材料和尾部对象上能够被别人复算。围绕定量语言规律的实证检验,源行把原始命题、边界材料与更新状态分开登记。沿定量语言规律的实证检验的责任链,这一步先限定可比较对象,不把缺失值折成零效应。

复算定量语言规律的实证检验之前,本条不是说幂律、长度与依存关系的可复算参数“也很重要”,而是要求先结算这一项。Ferrer-i-Cancho(2014)的最小检验是这一比率;当改变分词或标点处理时,部分幂律和长度关系会反向或消失。定量语言规律的跨语料检验由此把同名即同物从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

2010年代大规模树库和词频数据把幂律指数、平均依存距离与词长关系放进跨语言比较;2014年的提出文献没有一项可包办全部材料的总分;定量语言规律的跨语料检验因此保留2层读数:控制谱系后的规律效应及其分母未控制总体效应。只有把控制谱系后的规律效应和未控制总体效应同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。按定量语言规律的实证检验的对象表,该研究线索另固定2项结构读数、3类材料与4次版本复核。

该转向的争论并不在于有没有阳性案例,而在于谱系相关、分词标准和语料体裁会不会制造“普遍规律”。Piantadosi(2014)把边界写成:当改变分词或标点处理时,部分幂律和长度关系会反向或消失。对照定量语言规律的实证检验的主源,其时,这一比率不再支持原方向;提出路线自己还承认“跨语料研究承认预处理决定参数,却常只发布最终指数”。反号因此必须进入主分析。

这项转向的连带结果是类型学应采用谱系分层、多个分词方案和外部语料复算,不把语言点当独立样本。在定量语言规律的实证检验的实施账本里,Koplenig(2021)表明,本项证据落地后不能只问“能否使用”。语料发布、模型训练、基准评测与数据治理还要记录该复核口径、版本号、人工修订与这些漏记对象。

围绕该研究线索,双方同以“同名即同物”为前提,量纲却不天然等价;必须先换算上述分子—分母,再谈类比。与其继续扩大这项命题的总体样本,不如先检验同名即同物是否在不同装置和人群中仍然成立。把定量语言规律的实证检验放到另见第 531 号第 8 条『暗反应:失败实验不是垃圾,而是边界数据』旁核验:先对齐对象、时间窗和责任人,再检查定量语言规律的实证检验的核心判断在另一套分母中是否仍同向。

位置D|定量语言规律的实证检验作生成路径 单因定量语言规律的实证检验的核心决定项 预设〔01 谁进入分母〕定量语言规律的实证检验沿用既定对象边界 量纲定量语言规律的实证检验同向记录数/全部可核对记录数 失效漏掉无法稳定切词的语言时,定量语言规律的实证检验读数越高,真实覆盖反而越低 自曝定量语言规律的实证检验(第7条):原材料未覆盖者需另表 空栏无法稳定切词的语言 异名另见第 531 号第 8 条『暗反应:失败实验不是垃圾,而是边界数据』

辛、社交媒体方言与人口变异Computational Sociolinguistics

提出Eisenstein, J. et al. (2014). Diffusion of lexical change in social media. PLoS ONE, 9, e113114. 争议Nguyen, D. et al. (2016). Computational sociolinguistics: a survey. Computational Linguistics, 42, 537–593. 最新How socioeconomic status affects language technology interactions. ACL 2025, 17934–17960. 关键地理与社群条件下的语言变体

沿社交媒体方人口变异的责任链,Eisenstein(2014)使社交媒体方言与人口变异原有分类失去不证自明的地位。在2006—2016年,该转向面对的旧卡点是:社会语言学依赖访谈和小型社区,互联网文本又常被当作匿名同质语料。复算社交媒体方人口变异之前,旧框架若继续排除无定位、私密账号、被删帖和不使用平台的人,看似整齐的规律就可能只是删选结果。按社交媒体方人口变异的对象表,这一步先限定可比较对象,不把缺失值折成零效应。

对照社交媒体方人口变异的主源,Eisenstein(2014)把地理与社群条件下的语言变体置于解释次序的第一位,并用可定位用户数/全部平台用户数作为成败读数。边界是:当平台迁移或算法推荐改变可见性时,更大样本会反过来降低人口代表性;一旦社交媒体方言与人口变异触发这一条件,就不能再用其他修饰条件保护中心主张。在社交媒体方人口变异的实施账本里,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。

关键证据是Eisenstein等2014用美国地理定位推文建模词汇变体,显示网络语言可恢复区域与人口模式;现有社交媒体方言与人口变异文献缺少单一可移植效应量,因此把可定位用户数和全部平台用户数分别作为2项结构读数,并在中心与尾部材料中重算。该研究线索由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。

反对意见主要指向平台用户并不代表人口,自动人口标签还可能重生产刻板印象。争议的可检验部分由Nguyen(2016)给出:当平台迁移或算法推荐改变可见性时,更大样本会反过来降低人口代表性。从社交媒体方人口变异的材料看,此时须重新计算该复核口径。核查社交媒体方人口变异时,支持方同时记录“计算社会语言学承认自动标签不可靠,却常在回归中当作真实人口属性”,说明对象会被样本和制度回写。

上述机制还会重排实践的验收顺序:研究应报告用户覆盖、地理缺口、标签置信度和被平台封锁的数据。本项证据进入语料发布、模型训练、基准评测与数据治理后,工作流须先保存这些漏记对象,再进行压缩、排名或展示。相关更新(2025)提醒,总分不能替代上述分子—分母。

本面板测这一比率,对方检验“同名即同物”在另一对象上是否反号;这组账外材料是两边共同漏掉的候选。在社交媒体方人口变异这条证据链上,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。

位置E|社交媒体方人口变异作环境条件 单因社交媒体方人口变异的核心决定项 预设〔01 谁进入分母〕社交媒体方人口变异沿用既定对象边界 量纲社交媒体方人口变异同向记录数/全部可核对记录数 失效漏掉无定位、私密账号时,社交媒体方人口变异读数越高,真实覆盖反而越低 自曝社交媒体方人口变异(第8条):原材料未覆盖者需另表 空栏无定位、私密账号 异名另见第 233 号第 16 条『算法语言治理把被删除内容改写为平台语言秩序』
【第二幕】这十年 · 约 2016—2026

第二幕把语料当成可审计基础设施:Data Statements、去偏失败、C4审计、去重、时间错位、Dolma、CulturaX、DataComp-LM与FineWeb共同暴露数据管线的权力。从语境化表示成为语料仪器、Data Statements进入语料治理、词向量去偏的幻觉等12条可见,这一幕不以排行榜为终点,而追踪训练外表现、版本差异、制度采用、社区权利与长期维护。

一、语境化表示成为语料仪器Contextual Embeddings as Instruments

提出Peters, M. E. et al. (2018). Deep contextualized word representations. NAACL 2018, 2227–2237. 争议Hewitt, J. & Liang, P. (2019). Designing and interpreting probes with control tasks. EMNLP-IJCNLP 2019, 2733–2743. 最新Belinkov, Y. (2022). Probing classifiers: promises, shortcomings, and advances. Computational Linguistics, 48, 207–219. 关键词在具体句中的动态表示

复算语境化表议题之前,语境化表示成为语料仪器在2018年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。按语境化表议题的对象表,探针无法分类但模型仍正确处理的项目一旦被删去,分类稳定性便无法与记录偏差分开。对照语境化表议题的主源,这一步先限定可比较对象,不把缺失值折成零效应。

在语境化表议题的实施账本里,本条不是说词在具体句中的动态表示“也很重要”,而是要求先结算这一项。Peters(2018)的最小检验是控制基线后的探针增益/原始探针得分;当标签可由词频或位置捷径预测时,探针高分会反过来夸大结构知识。语境化表示成为语料仪器真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。

BERT基础版和大型版约为1.10亿与3.40亿参数;同一语料切片的表示漂移需按层和版本报告。从语境化表议题的材料看,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。该研究线索由此把同名即同物从背景假定移到检验台上,使支持者与反对者必须使用同一分母。核查语境化表议题时,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。

尚未收敛的部分是探针高分是否说明模型真的编码结构,层选择和频率捷径会不会制造结果。该转向的失效条件是:当标签可由词频或位置捷径预测时,探针高分会反过来夸大结构知识。在语境化表议题这条证据链上,Hewitt(2019)与提出方的自我限制“模型层中可读出信息不等于生成时使用该信息,探针文献自己反复提醒这一点”共同表明,方向反转不能只留在讨论末段。

由此产生的实践后果是:语料研究应使用控制任务、随机基线和因果干预,不把线性可读出等同机制。对语境化表议题做反向检验,在语料发布、模型训练、基准评测与数据治理中,应把这些漏记对象设为固定字段,并按该复核口径发布分层结果。

把语境化表议题放回原窗口,两边共享“同名即同物”,但本条把上述首因置于决定位置。就语境化表议题的外推边界看,只有把上述分子—分母换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把语境化表议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查语境化表议题的核心判断在另一套分母中是否仍同向。

位置S|语境化表议题作结果量 单因语境化表议题的核心决定项 预设〔01 谁进入分母〕语境化表议题沿用既定对象边界 量纲语境化表议题同向记录数/全部可核对记录数 失效漏掉探针无法分类但模型仍正确处理时,语境化表议题读数越高,真实覆盖反而越低 自曝语境化表议题(第9条):原材料未覆盖者需另表 空栏探针无法分类但模型仍正确处理 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

二、Data Statements进入语料治理Data Statements

提出Bender, E. M. & Friedman, B. (2018). Data Statements for Natural Language Processing. TACL, 6, 587–604. 争议Gebru, T. et al. (2021). Datasheets for datasets. Communications of the ACM, 64(12), 86–92. 最新Longpre, S. et al. (2024). A Pretrainer’s Guide to Training Data. NAACL 2024, 2957–2977. 关键数据的语言、人口与采集语境

按DataSta议题的对象表,Bender(2018)把Data Statements进入语料治理改写成一个分母问题。这项转向最初针对的是数据集论文只报规模和任务,不说明说话者、标注者、许可与使用限制。对照DataSta议题的主源,只有让拒绝自我分类、无法追溯来源和撤回后的数据获得可比较位置,旧边界才可能接受反例检验。一旦把该未登记群体重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。

在DataSta议题的实施账本里,Bender(2018)把数据的语言、人口与采集语境置于解释次序的第一位,并用已填写治理字段数/全部必要字段数作为成败读数。本项证据真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。

实证支点来自Bender与Friedman 2018提出Data Statements,要求记录语言变体、人口属性、采集、标注和推荐用途;Data Statements进入语料治理不以“显著”充当读数;依Bender(2018)的论证,至少应公开已填写治理字段数和全部必要字段数这2项结构量。这使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。从DataSta议题的材料看,该研究线索最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。

争议集中在表格填全是否就等于伦理充分,敏感属性能否被安全公开。Gebru(2021)的复核指出:当人口属性本身敏感且无法安全公开时,更完整披露会反过来增加风险。核查DataSta议题时,此时该复核口径失去原有解释力;而“治理框架承认文件不能替代问责,机构却容易把清单当合规终点”又显示,稳定对象也可能由工具制造。该转向的关键不是增加术语,而是让这一比率在独立材料和尾部对象上能够被别人复算。

另一处常被略过的是,语料发布应把未知、拒绝披露和社区限制设为正式字段,不能用“其他”吞并。本项证据在2024年的实践验收应同时公开已填写治理字段数、说明全部必要字段数,并给该未登记群体留下可撤回、可修订的记录。这一制度安排由此把局部最优可加总为整体最优从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

在这项命题中,两边共享“局部最优可加总为整体最优”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。在DataSta议题这条证据链上,对该转向而言,其一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

位置E|DataSta议题作环境条件 单因DataSta议题的核心决定项 预设〔01 谁进入分母〕DataSta议题沿用既定对象边界 量纲DataSta议题同向记录数/全部可核对记录数 失效漏掉拒绝自我分类、无法追溯来源和时,DataSta议题读数越高,真实覆盖反而越低 自曝DataSta议题(第10条):原材料未覆盖者需另表 空栏拒绝自我分类、无法追溯来源和 异名另见第 517 号第 16 条『语言去殖民:语言不是可以脱离说话者抽取的数据集』

三、词向量去偏的幻觉Debiasing Illusion

提出Bolukbasi, T. et al. (2016). Man is to computer programmer as woman is to homemaker? NeurIPS 2016. 争议Gonen, H. & Goldberg, Y. (2019). Lipstick on a pig: debiasing methods cover up systematic gender biases in word embeddings. NAACL 2019, 609–614. 最新Goldfarb-Tarrant, S. et al. (2021). Intrinsic bias metrics do not correlate with application bias. ACL 2021, 1926–1940. 关键偏差结构而非单一方向

对照词向量去议题的主源,Bolukbasi(2016)首先定位了词向量去偏的幻觉的历史卡点。长期以来,早期去偏方法把性别偏差当作一个向量方向,投影删除后即宣布中性;在2016—2026阶段,不符合二元性别分类的词、人和语境不再只是边缘案例,而成为判断对象边界是否成立的证据。与其继续扩大该转向的总体样本,不如先检验局部最优可加总为整体最优是否在不同装置和人群中仍然成立。

在词向量去议题的实施账本里,本条不是说偏差结构而非单一方向“也很重要”,而是要求先结算这一项。从词向量去议题的材料看,Bolukbasi(2016)的最小检验是去偏后群体错误差/去偏前群体错误差;当去掉显式方向却保留邻域结构时,内在指标变好而下游差异会反向恶化。一旦把这些漏记对象重新计入,词向量去偏的幻觉原来的平均值、类别边界和责任归属都可能同时改变。

Bolukbasi(2016)主要给出理论或方法论论证;可证伪入口是去偏后群体错误差与去偏前群体错误差两项结构量,而不是一项并不存在的总体效应。只有把去偏后群体错误差和去偏前群体错误差同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。核查词向量去议题时,该研究线索另固定2项结构读数、3类材料与4次版本复核。

该转向的争论并不在于有没有阳性案例,而在于偏差该由关联、决策差异还是社会伤害哪一种量定义。在词向量去议题这条证据链上,Gonen(2019)把边界写成:该反向情形。对词向量去议题做反向检验,其时,该复核口径不再支持原方向;提出路线自己还承认“去偏论文承认指标彼此不一致,排行榜仍常用单一关联分数”。反号因此必须进入主分析。

这项转向的连带结果是评估需跨内在指标、下游任务和真实群体,记录去偏后新产生的错误。把词向量去议题放回原窗口,Goldfarb-Tarrant(2021)表明,本项证据落地后不能只问“能否使用”。就词向量去议题的外推边界看,语料发布、模型训练、基准评测与数据治理还要记录上述分子—分母、版本号、人工修订与该未登记群体。这一制度安排真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。

围绕这项命题,双方同以“局部最优可加总为整体最优”为前提,量纲却不天然等价;必须先换算上述分子—分母,再谈类比。围绕词向量去议题,只要该转向仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

位置S|词向量去议题作结果量 单因词向量去议题的核心决定项 预设〔02 单一读数代表复杂对象〕词向量去议题沿用既定对象边界 量纲词向量去议题同向记录数/全部可核对记录数 失效漏掉不符合二元性别分类的词时,词向量去议题读数越高,真实覆盖反而越低 自曝词向量去议题(第11条):原材料未覆盖者需另表 空栏不符合二元性别分类的词 异名另见第 234 号第 7 条『多语转向把单语局部最优改写为整体语言能力』

四、C4语料的审计C4 Audit

提出Dodge, J. et al. (2021). Documenting large webtext corpora: a case study on the Colossal Clean Crawled Corpus. EMNLP 2021, 1286–1305. 争议Bender, E. M. et al. (2021). On the dangers of stochastic parrots. FAccT 2021, 610–623. 最新Longpre, S. et al. (2024). A Pretrainer’s Guide to Training Data. NAACL 2024, 2957–2977. 关键过滤规则的社会后果

在C语料的议题的实施账本里,Dodge(2021)使C4语料的审计原有分类失去不证自明的地位。在2016—2026年,该转向面对的旧卡点是:大型预训练语料被描述为“清洗后的网页”,具体删选及其群体影响不进入模型说明。从C语料的议题的材料看,旧框架若继续排除被规则删除后不留可复核记录的网页,看似整齐的规律就可能只是删选结果。核查C语料的议题时,这一步先限定可比较对象,不把缺失值折成零效应。

在C语料的议题这条证据链上,Dodge(2021)把过滤规则的社会后果置于解释次序的第一位,并用某群体页面被过滤数/该群体原始页面数作为成败读数。与其继续扩大本项证据的总体样本,不如先检验局部最优可加总为整体最优是否在不同装置和人群中仍然成立。对C语料的议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

C4审计至少追踪来源域、重复、机器生成和“坏词”过滤4类问题。对C语料的议题做反向检验,C4语料的审计由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索由此把局部最优可加总为整体最优从背景假定移到检验台上,使支持者与反对者必须使用同一分母。把C语料的议题放回原窗口,对该研究线索而言,其一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

反对意见主要指向公开一个清洗规则表能否恢复被删除语境,C4版本之间是否可比较。就C语料的议题的外推边界看,争议的可检验部分由Bender(2021)给出:该反向情形。围绕C语料的议题,此时须重新计算该复核口径。沿C语料的议题的责任链,支持方同时记录“清洗管线承认误删,但模型卡常没有被删内容的分布”,说明对象会被样本和制度回写。

上述机制还会重排实践的验收顺序:模型论文应发布域构成、过滤命中、样本示例与版本哈希,不只写token规模。复算C语料的议题之前,本项证据进入语料发布、模型训练、基准评测与数据治理后,工作流须先保存该未登记群体,再进行压缩、排名或展示。按C语料的议题的对象表,Longpre(2024)提醒,总分不能替代上述分子—分母。

对照C语料的议题的主源,本面板测这一比率,对方检验“局部最优可加总为整体最优”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。在C语料的议题的实施账本里,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。

位置S|C语料的议题作结果量 单因C语料的议题的核心决定项 预设〔01 谁进入分母〕C语料的议题沿用既定对象边界 量纲C语料的议题同向记录数/全部可核对记录数 失效若C语料的议题可由替代机制重现,单因解释撤回 自曝C语料的议题(第12条):原材料未覆盖者需另表 空栏被规则删除后不留可复核记录的 异名另见第 538 号第 7 条『数据表:训练材料的来历进入模型保证边界』

五、去重与记忆泄漏Deduplication and Memorization

提出Lee, K. et al. (2022). Deduplicating training data makes language models better. ACL 2022, 8424–8445. 争议Kandpal, N. et al. (2022). Deduplicating training data mitigates privacy risks in language models. ICML 2022. 最新Data, Data Everywhere: A Guide for Pretraining Dataset Construction. EMNLP 2024, 10471–10503. 关键重复文档对泛化与隐私的影响

从去重记忆泄漏的材料看,去重与记忆泄漏在2022年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。核查去重记忆泄漏时,该转向出现以前,研究者多把“网页重复被当作只增加训练量,训练集与测试集重合也常被视为不可避免”当作无需再问的背景。在去重记忆泄漏这条证据链上,被聚成重复簇而整簇删除的少数语言文档一旦被删去,分类稳定性便无法与记录偏差分开。

对去重记忆泄漏做反向检验,本条不是说重复文档对泛化与隐私的影响“也很重要”,而是要求先结算这一项。把去重记忆泄漏放回原窗口,其也意味着,语料发布、模型训练、基准评测与数据治理处理去重与记忆泄漏时不能只保存成功案例,还要保留排除理由、版本与反号结果。

就去重记忆泄漏的外推边界看,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。该研究线索真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。围绕去重记忆泄漏,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。

尚未收敛的部分是去重阈值会不会误删合法重复体裁和少数语言,成员推断能否可靠识别训练文本。沿去重记忆泄漏的责任链,该转向的失效条件是:该反向情形。复算去重记忆泄漏之前,Kandpal(2022)与提出方的自我限制“去重研究承认阈值改变数据分布,模型论文却常只写「已去重」”共同表明,方向反转不能只留在讨论末段。

由此产生的实践后果是:应报告精确重复、模糊重复和测试污染三套分母,保存被删簇的代表与规模。按去重记忆泄漏的对象表,在语料发布、模型训练、基准评测与数据治理中,应把这些漏记对象设为固定字段,并按该复核口径发布分层结果。对照去重记忆泄漏的主源,Data(2024)进一步要求把本项证据的版本、人工修订与该未登记群体的失败记录连成可追踪链。

在去重记忆泄漏的实施账本里,两边共享“通过形式审查=实质合规”,但本条把上述首因置于决定位置。从去重记忆泄漏的材料看,只有把上述分子—分母换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把去重记忆泄漏放到另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』旁核验:先对齐对象、时间窗和责任人,再检查去重记忆泄漏的核心判断在另一套分母中是否仍同向。

位置D|去重记忆泄漏作生成路径 单因去重记忆泄漏的核心决定项 预设〔01 谁进入分母〕去重记忆泄漏沿用既定对象边界 量纲去重记忆泄漏同向记录数/全部可核对记录数 失效若去重记忆泄漏可由替代机制重现,单因解释撤回 自曝去重记忆泄漏(第13条):原材料未覆盖者需另表 空栏被聚成重复簇 异名另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』

六、训练数据的时间错位Temporal Alignment of Data

提出Longpre, S. et al. (2024). A Pretrainer’s Guide to Training Data. NAACL 2024, 2957–2977. 争议Luu, K. et al. (2022). Time waits for no one! Analysis and challenges of temporal misalignment. NAACL 2022, 5944–5958. 最新Word predictability estimates from language models are not robust. CoNLL 2026. 关键训练截止时间与目标年代

核查训练数据议题时,Longpre(2024)把训练数据的时间错位改写成一个分母问题。在训练数据议题这条证据链上,只有让无时间戳、被复制到新网页的旧文本获得可比较位置,旧边界才可能接受反例检验。对训练数据议题做反向检验,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。把训练数据议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。

就训练数据议题的外推边界看,Longpre(2024)把训练截止时间与目标年代置于解释次序的第一位,并用目标年代内训练token数/全部训练token数作为成败读数。只要本项证据仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

时间错位研究比较2013、2016、2019和2022四个版本,并在新闻、社交媒体和科学任务上交叉评测。围绕训练数据议题,其使训练数据的时间错位从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。沿训练数据议题的责任链,与其继续扩大该研究线索的总体样本,不如先检验通过形式审查=实质合规是否在不同装置和人群中仍然成立。一旦把这组账外材料重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。复算训练数据议题之前,该研究线索另固定2项结构读数、3类材料与4次版本复核。

争议集中在年代效应与域漂移、模型规模是否可分,网页时间戳本身是否可靠。按训练数据议题的对象表,Luu(2022)的复核指出:该反向情形。该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。

另一处常被略过的是,预训练语料应发布时间分布与截止验证,评测。本项证据在2026年的实践验收应同时公开目标年代内训练token数、说明全部训练token数,并给这些漏记对象留下可撤回、可修订的记录。这一制度安排由此把通过形式审查=实质合规从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

在这项命题中,两边共享“通过形式审查=实质合规”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把训练数据议题放到另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』旁核验:先对齐对象、时间窗和责任人,再检查训练数据议题的核心判断在另一套分母中是否仍同向。

位置D|训练数据议题作生成路径 单因训练数据议题的核心决定项 预设〔01 谁进入分母〕训练数据议题沿用既定对象边界 量纲训练数据议题同向记录数/全部可核对记录数 失效若训练数据议题可由替代机制重现,单因解释撤回 自曝训练数据议题(第14条):原材料未覆盖者需另表 空栏无时间戳、被复制到新网页的旧 异名另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』

七、Dolma开放三万亿词元语料Dolma Open Corpus

提出Soldaini, L. et al. (2024). Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research. ACL 2024, 15725–15788. 争议Dodge, J. et al. (2021). Documenting large webtext corpora: a case study on the Colossal Clean Crawled Corpus. EMNLP 2021, 1286–1305. 最新Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset. ACL 2025. 关键可追溯开放数据管线

在Dolm议题这条证据链上,Soldaini(2024)首先定位了Dolma开放三万亿词元语料的历史卡点。长期以来,大模型训练集规模巨大却不可下载、不可复现,研究者只能比较黑箱模型;在2016—2026阶段,后来撤回、来源消失或个人要求删除的文本不再只是边缘案例,而成为判断对象边界是否成立的证据。

对Dolm议题做反向检验,本条不是说可追溯开放数据管线“也很重要”,而是要求先结算这一项。把Dolm议题放回原窗口,Dolma开放三万亿词元语料形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。就Dolm议题的外推边界看,其也意味着,语料发布、模型训练、基准评测与数据治理处理本项证据时不能只保存成功案例,还要保留排除理由、版本与反号结果。

Dolma开放语料约含3万亿词元,发布时同步给出来源、过滤与版本信息。只有把可追溯token数和全部训练token数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。只要Dolma开放三万亿词元语料仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。围绕Dolm议题,与其继续扩大该研究线索的总体样本,不如先检验通过形式审查=实质合规是否在不同装置和人群中仍然成立。Dolm议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

该转向的争论并不在于有没有阳性案例,而在于开放能否自动带来可核对,来源许可和删除请求如何在派生模型中传播。沿Dolm议题的责任链,Dodge(2021)把边界写成:该反向情形。复算Dolm议题之前,其时,该复核口径不再支持原方向;提出路线自己还承认“Dolma承认网页许可与个人同意不是同一件事,开放许可证却易被当成充分授权”。反号因此必须进入主分析。

这项转向的连带结果是开放语料需提供版本、哈希、删除日志和派生模型清单,下载可得不等于责任可追。按Dolm议题的对象表,相关更新(2025)表明,本项证据落地后不能只问“能否使用”。对照Dolm议题的主源,语料发布、模型训练、基准评测与数据治理还要记录上述分子—分母、版本号、人工修订与该未登记群体。Dolm议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

在Dolm议题的实施账本里,围绕该研究线索,双方同以“通过形式审查=实质合规”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。一旦把这些漏记对象重新计入,这项命题原来的平均值、类别边界和责任归属都可能同时改变。

位置D|Dolm议题作生成路径 单因Dolm议题的核心决定项 预设〔02 单一读数代表复杂对象〕Dolm议题沿用既定对象边界 量纲Dolm议题同向记录数/全部可核对记录数 失效若Dolm议题可由替代机制重现,单因解释撤回 自曝Dolm议题(第15条):原材料未覆盖者需另表 空栏后来撤回、来源消失或个人要求 异名另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』

八、CulturaX多语言清洗CulturaX

提出Nguyen, T. et al. (2024). CulturaX: a cleaned, enormous, and multilingual dataset for large language models in 167 languages. LREC-COLING 2024. 争议Kreutzer, J. et al. (2022). Quality at a glance: an audit of web-crawled multilingual datasets. TACL, 10, 50–72. 最新Assessing the Role of Data Quality in Training Bilingual Language Models. Findings of EMNLP 2025. 关键多语言质量控制与尾部保留

对Cult议题做反向检验,Nguyen(2024)使CulturaX多语言清洗原有分类失去不证自明的地位。在2016—2026年,该转向面对的旧卡点是:多语言训练集常由英语管线平移,低资源语言被语言识别和质量过滤大量误删。旧框架若继续排除被判为乱码但实际上是混合文字、方言或非标准拼写的页面,看似整齐的规律就可能只是删选结果。

把Cult议题放回原窗口,Nguyen(2024)把多语言质量控制与尾部保留置于解释次序的第一位,并用某语言保留token数/该语言原始token数作为成败读数。对本项证据而言,这一步把这些漏记对象、方言或非标准拼写的页面从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

CulturaX汇集约6.3万亿词元、167种语言,并执行语言识别、URL级与文档级去重。就Cult议题的外推边界看,CulturaX多语言清洗由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索最怕一个总分,因为中心样本改善时,这组账外材料、方言或非标准拼写的页面可能正以更快速度退出可见范围。该研究线索的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。Cult议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

反对意见主要指向相同质量阈值是否惩罚非标准正字法、口语化网页和少数字符体系。围绕Cult议题,争议的可检验部分由Kreutzer(2022)给出:该反向情形。此时须重新计算这一比率。沿Cult议题的责任链,支持方同时记录“多语言数据集承认英语质量模型更强,却仍用同一排序过滤全部语言”,说明对象会被样本和制度回写。

上述机制还会重排实践的验收顺序:每种语言应单独报告保留率、过滤原因和人工抽查,不用统一质量分数。本项证据进入语料发布、模型训练、基准评测与数据治理后,工作流须先保存这组账外材料、方言或非标准拼写的页面,再进行压缩、排名或展示。复算Cult议题之前,相关更新(2025)提醒,总分不能替代该复核口径。

本面板测上述分子—分母,对方检验“未被计价的东西不影响结算”在另一对象上是否反号;该未登记群体、方言或非标准拼写的页面是两边共同漏掉的候选。把Cult议题放到另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』旁核验:先对齐对象、时间窗和责任人,再检查Cult议题的核心判断在另一套分母中是否仍同向。

位置E|Cult议题作环境条件 单因Cult议题的核心决定项 预设〔01 谁进入分母〕Cult议题沿用既定对象边界 量纲Cult议题同向记录数/全部可核对记录数 失效若Cult议题可由替代机制重现,单因解释撤回 自曝Cult议题(第16条):原材料未覆盖者需另表 空栏被判为乱码但实际上是混合文字 异名另见第 258 号第 17 条『去重与污染审计证明训练数据规模不能按原始token计数』

九、DataComp-LM的数据中心基准DataComp-LM

提出Li, J. et al. (2024/2025). DataComp-LM: In search of the next generation of training sets for language models. arXiv:2406.11794, v4 2025. 争议Gadre, S. et al. (2023). DataComp: in search of the next generation of multimodal datasets. NeurIPS 2023. 最新Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models. ACL 2025. 关键固定模型预算下的数据选择实验

把Data议题放回原窗口,DataComp-LM的数据中心基准在2024年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。就Data议题的外推边界看,被低质量模型过滤掉的少数文化与非标准体裁一旦被删去,分类稳定性便无法与记录偏差分开。围绕Data议题,这一步先限定可比较对象,不把缺失值折成零效应。

沿Data议题的责任链,本条不是说固定模型预算下的数据选择实验“也很重要”,而是要求先结算这一项。Li(2024)的最小检验是性能增益/新增训练计算量;当过滤模型偏好基准式文本时,质量分数提高会反过来缩窄真实数据多样性。对Data议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

DataComp-LM从约240万亿候选词元中构造训练集,设置53项评测;代表性赛道训练约26万亿词元并比较7B模型。复算Data议题之前,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。

尚未收敛的部分是固定评测是否过度奖励教育文本和英语,过滤器能否把基准知识泄漏进训练集。按Data议题的对象表,该转向的失效条件是:该反向情形。对照Data议题的主源,Gadre(2023)与提出方的自我限制“基准承认数据选择与评测集存在同生态关联,却仍以统一总分选冠军”共同表明,方向反转不能只留在讨论末段。

由此产生的实践后果是:数据基准需加入语言、领域、时间和污染审计,并报告同预算下的尾部损失。在Data议题的实施账本里,在语料发布、模型训练、基准评测与数据治理中,应把该未登记群体设为固定字段,并按上述分子—分母发布分层结果。相关更新(2025)进一步要求把本项证据的版本、人工修订与这组账外材料的失败记录连成可追踪链。Data议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。Data议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

从Data议题的材料看,两边共享“未被计价的东西不影响结算”,但本条把上述首因置于决定位置。核查Data议题时,只有把这一比率换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把Data议题放到另见第 360 号第 2 条『仓库级计算机:数据中心才是性能分析单元』旁核验:先对齐对象、时间窗和责任人,再检查Data议题的核心判断在另一套分母中是否仍同向。

位置D|Data议题作生成路径 单因Data议题的核心决定项 预设〔01 谁进入分母〕Data议题沿用既定对象边界 量纲Data议题同向记录数/全部可核对记录数 失效若Data议题可由替代机制重现,单因解释撤回 自曝Data议题(第17条):原材料未覆盖者需另表 空栏被低质量模型过滤掉的少数文化 异名另见第 360 号第 2 条『仓库级计算机:数据中心才是性能分析单元』

十、FineWeb与行级质量过滤FineWeb Data Quality

提出Penedo, G. et al. (2024). The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. NeurIPS Datasets and Benchmarks 2024. 争议Lozhkov, A. et al. (2024). FineWeb-Edu: the finest collection of educational content. Hugging Face technical report, 2024. 最新FinerWeb-10BT: Refining Web Data with LLM-Based Line-Level Quality Assessment. NoDaLiDa 2025. 关键文档内部的细粒度质量差异

就FineW行级质量的外推边界看,Penedo(2024)把FineWeb与行级质量过滤改写成一个分母问题。这项转向最初针对的是网页过滤把整篇文档判为好或坏,局部导航、模板、广告和高质量段落一起保留或删除。只有让文档中被整段删除、但对语境不可缺的引用和方言行获得可比较位置,旧边界才可能接受反例检验。围绕FineW行级质量,源行把原始命题、边界材料与更新状态分开登记。围绕FineW行级质量,这一步先限定可比较对象,不把缺失值折成零效应。

沿FineW行级质量的责任链,Penedo(2024)把文档内部的细粒度质量差异置于解释次序的第一位,并用高质量保留行数/全部网页行数作为成败读数。复算FineW行级质量之前,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。

FineWeb覆盖96个Common Crawl快照,总规模约15万亿词元,行级和文档级过滤需分别审计。按FineW行级质量的对象表,其使FineWeb与行级质量过滤从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。对照FineW行级质量的主源,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。这也意味着,语料发布、模型训练、基准评测与数据治理处理该研究线索时不能只保存成功案例,还要保留排除理由、版本与反号结果。

争议集中在用大模型打质量标签会不会把其偏好和语言能力复制到新语料。在FineW行级质量的实施账本里,Lozhkov(2024)的复核指出:该反向情形。从FineW行级质量的材料看,此时该复核口径失去原有解释力;而“模型过滤承认标签来自另一个模型,却容易被写成客观质量”又显示,稳定对象也可能由工具制造。该转向由此把未被计价的东西不影响结算从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

另一处常被略过的是,过滤器应发布标签定义、人工一致率和按语言误删率。本项证据在2025年的实践验收应同时公开高质量保留行数、说明全部网页行数,并给这些漏记对象行留下可撤回、可修订的记录。只要这一制度安排仍把该未登记群体行在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

在这项命题中,两边共享“未被计价的东西不影响结算”,却把决定位置放在不同项上;一旦这些漏记对象行入账,原有对象、路径与条件场都要重画。把FineW行级质量放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查FineW行级质量的核心判断在另一套分母中是否仍同向。

位置S|FineW行级质量作结果量 单因FineW行级质量的核心决定项 预设〔01 谁进入分母〕FineW行级质量沿用既定对象边界 量纲FineW行级质量同向记录数/全部可核对记录数 失效若FineW行级质量可由替代机制重现,单因解释撤回 自曝FineW行级质量(第18条):原材料未覆盖者需另表 空栏文档中被整段删除 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

十一、数据多样性成为独立量Measuring Data Diversity

提出We Need to Measure Data Diversity in NLP — Better and Broader. EMNLP 2025. 争议Egbert, J., Biber, D. & Gray, B. (2022). Designing and Evaluating Language Corpora. Cambridge University Press. 最新ORBIT: Cost-Effective Dataset Curation for Large Language Model Pretraining. Findings of ACL 2025. 关键覆盖不同结构而非只增加规模

相关研究(2025)首先定位了数据多样性成为独立量的历史卡点。围绕数据多样议题,其也意味着,语料发布、模型训练、基准评测与数据治理处理该转向时不能只保存成功案例,还要保留排除理由、版本与反号结果。沿数据多样议题的责任链,这一步先限定可比较对象,不把缺失值折成零效应。

复算数据多样议题之前,本条不是说覆盖不同结构而非只增加规模“也很重要”,而是要求先结算这一项。相关研究(2025)的最小检验是有效覆盖簇数/全部样本数;当新增样本只是模板改写时,数据量增加会反过来降低单位信息多样性。数据多样性成为独立量最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。对数据多样议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

2025年EMNLP工作系统比较语料代表性、统计多样性与任务覆盖,提出从词汇、语义、结构和来源多面测量;数据多样性成为独立量目前缺少可跨研究直接合并的效应量;固定有效覆盖簇数和全部样本数这2项结构量后,后续结果才可比较。只有把有效覆盖簇数和全部样本数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。

该转向的争论并不在于有没有阳性案例,而在于多样性提高是否总有利,稀有噪声与有价值尾部如何区分。按数据多样议题的对象表,Egbert(2022)把边界写成:该反向情形。对照数据多样议题的主源,其时,该复核口径不再支持原方向;提出路线自己还承认“多样性研究承认代表性没有统一定义,却容易再造一个单一总分”。反号因此必须进入主分析。

这项转向的连带结果是语料卡应同时报告多样性、质量和目标人群覆盖,不把一个综合指数当答案。在数据多样议题的实施账本里,相关更新(2025)表明,本项证据落地后不能只问“能否使用”。从数据多样议题的材料看,语料发布、模型训练、基准评测与数据治理还要记录上述分子—分母、版本号、人工修订与该未登记群体。

核查数据多样议题时,围绕该研究线索,双方同以“更多数据必然减少偏倚”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。这项命题的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。把数据多样议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查数据多样议题的核心判断在另一套分母中是否仍同向。

位置S|数据多样议题作结果量 单因数据多样议题的核心决定项 预设〔01 谁进入分母〕数据多样议题沿用既定对象边界 量纲数据多样议题同向记录数/全部可核对记录数 失效若数据多样议题可由替代机制重现,单因解释撤回 自曝数据多样议题(第19条):原材料未覆盖者需另表 空栏无法落入预先主题簇的新体裁和 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

十二、低资源语言的数据扩展Data-efficient Language Expansion

提出A Data-Efficient Path to Multilingual LLMs: Language Expansion via Router Tuning. ACL 2026. 争议Assessing the Role of Data Quality in Training Bilingual Language Models. Findings of EMNLP 2025. 最新Aleph-Alpha-GermanWeb: Improving German-Language LLM Pretraining Data. EACL 2026. 关键少量原生数据与跨语言路由

相关研究(2026)使低资源语言的数据扩展原有分类失去不证自明的地位。在2016—2026年,该转向面对的旧卡点是:多语模型常假定为新语言加入越多翻译或合成数据越好,原生语料比例不被单独控制。沿低资源语议题的责任链,旧框架若继续排除只有口语、未数字化和社区限制使用的数据,看似整齐的规律就可能只是删选结果。复算低资源语议题之前,这一步先限定可比较对象,不把缺失值折成零效应。

相关研究(2026)把少量原生数据与跨语言路由置于解释次序的第一位,并用原生语言有效token数/全部扩展token数作为成败读数。按低资源语议题的对象表,边界是:当翻译数据占比过高时,更多数据会反过来降低本地自然度与文化适切;一旦低资源语言的数据扩展触发这一条件,就不能再用其他修饰条件保护中心主张。一旦把这些漏记对象重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。

低资源扩展至少应报告3个读数:新增目标语词元、同语系迁移增益和本地人工修订率。对照低资源语议题的主源,低资源语言的数据扩展由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。该研究线索的数值链至少保留2组对照、3项读数和4个复核字段。

反对意见主要指向机器翻译数据会不会把英语句法和文化语境写入目标语言,路由收益能否跨语系复制。争议的可检验部分由相关争议(2025)给出:该反向情形。此时须重新计算这一比率。在低资源语议题的实施账本里,支持方同时记录“扩展论文承认英语高质量数据易得,模型却常把翻译腔误当目标语言规范”,说明对象会被样本和制度回写。

上述机制还会重排实践的验收顺序:扩展实验应分别报告原生、翻译、合成和社区数据,并在本地任务上验收。从低资源语议题的材料看,本项证据进入语料发布、模型训练、基准评测与数据治理后,工作流须先保存该未登记群体,再进行压缩、排名或展示。核查低资源语议题时,相关更新(2026)提醒,总分不能替代该复核口径。

本面板测上述分子—分母,对方检验“能力可与承载它的人分离”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。在低资源语议题这条证据链上,该研究线索最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。

位置E|低资源语议题作环境条件 单因低资源语议题的核心决定项 预设〔02 单一读数代表复杂对象〕低资源语议题沿用既定对象边界 量纲低资源语议题同向记录数/全部可核对记录数 失效若低资源语议题可由替代机制重现,单因解释撤回 自曝低资源语议题(第20条):原材料未覆盖者需另表 空栏只有口语、未数字化和社区限制 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

◎ 二十年连起来看

第一条线索是语言数据从手选例句扩展到网页、图书、树库与平台日志,分母第一次成为理论的一部分。

第二条线索是向量、惊异度与定量规律提供了跨领域量纲,但每个读数都依赖分词、语料域和概率模型。

第三条线索是万亿词元时代把过滤、许可、撤回和维护推到前台;数据管线开始像理论一样接受审计。

◎ 三个常见误解

1. 误解一是“语料越大越代表语言”。规模只能减少抽样波动,不能修复平台可见性、许可和体裁缺口。

2. 误解二是“清洗只是删除噪声”。过滤器会改变语言、社群和文体的分布,清洗本身就是理论选择。

3. 误解三是“开放下载等于可复现”。没有版本、哈希、过滤日志和撤回机制的开放语料仍不可核对。

◎ 与相邻领域的接口

第461号音系学与形态学:分词、标签与低资源形态如何改变语料分布。分工判据是:本块以网页抓取、树库、词向量、去重日志、数据卡与开放语料回答语料抽样、编码、过滤、版本与量化指标的内部机制;对方只能在自己的对象与分母上验证同名结构。

第462号句法学:树库、依存距离和结构探针如何使用语料。接口成立的最低条件,是两块分别公开样本进入规则、失败样本和量纲换算;术语相同不能代替网页抓取、树库、词向量、去重日志、数据卡与开放语料的证据。

第463号语义学与语用学:向量、语境和话语含意如何获得量化表示。两块的分工线在于:本面板追踪语料抽样、编码、过滤、版本与量化指标,对方追踪另一条路径或条件场;只有方向和分母都可比较时才构成互证。

第466号古文字与文献学:版本、OCR和缺卷怎样进入历史语料。若双方的排除规则、版本或授权不同,就必须分别命名结论,并把差异写进语料发布、模型训练、基准评测与数据治理的验收表。

◎ 争议现场

“代表性”能否被一个指标表示;收敛需给定目标总体、抽样机制和站外人群校验。收敛设计须在网页抓取、树库、词向量、去重日志、数据卡与开放语料中使用同一材料、同一排除规则和预注册主量纲,并把反号结果列入主分析。

质量过滤是否在提高基准分的同时压低文化与语言多样性;收敛需固定计算预算并报告尾部退化。在语料发布、模型训练、基准评测与数据治理场景中,双方应共同提交数据、代码与盲评方案,预先说明零效应、方向反转和退出样本怎样解释。

训练数据的许可、撤回和衍生模型责任如何追踪;收敛需可执行的删除与物料清单机制。只有跨实验室或跨机构在独立材料上重现效应量及其边界,并公开语料抽样、编码、过滤、版本与量化指标的尾部误差,这场争论才算推进。

◎ 往下五年看什么

数据集是否开始发布逐语言保留率、被删样本和过滤器版本,而不只报token总量。验收读数:逐语言保留率、被删样本数、过滤器版本和尾部性能差。

DataComp-LM后续赛道能否加入污染、时间和非英语现场任务。验收读数:固定计算预算下的污染率、时间错位损失与非英语现场任务得分。

2026语言扩展方法是否在跨语系、口语和社区受限数据上复制。验收读数:跨语系、口语及社区受限数据中的迁移增益和人工修订率。

训练语料的删除请求能否在模型版本与派生数据中被追踪。验收读数:删除请求在训练集、派生集和模型版本中的可定位率与完成时长。

◎ 可与哪些领域对撞

本块第十三条“去重与记忆泄漏”与第466号第十八条“不确定性进入数字校本”构成一对。它们共享的预设是“冗余只会污染数据,应当删除”。相反点在于:语料去重把重复视为泄漏,数字校本却把重复、异文和分支当作传播证据。若两边都成立,就必须把重复的来源、功能与版本关系作为第三项纳入,并同时报告“去重后独立文档数/原始文档数”与“保留可追溯候选数/全部曾提出读法数”。

本块第十七条“DataComp-LM的数据中心基准”与第306号第十六条“预测模型样本量”构成一对。它们共享的预设是“扩大数据规模必然提高可靠性”。相反点在于:DataComp-LM固定计算预算比较数据质量,预测模型样本量则指出候选自由度增长会吞掉样本。若两边都成立,就必须把有效信息量而非词元总量作为第三项纳入,并同时报告“性能增益/新增训练计算量”与“有效事件数/候选参数自由度”。

本块第十条“Data Statements进入语料治理”与第306号第八条“TRIPOD”构成一对。它们共享的预设是“报告字段齐全就意味着数据可被信任”。相反点在于:Data Statements要求交代语言、人口和采集语境,TRIPOD也承认清单无法替代数据与代码。若两边都成立,就必须把未进入数据卡的排除与版本作为第三项纳入,并同时报告“已填写治理字段数/全部必要字段数”与“已报告清单项目数/TRIPOD全部22项”。

本块第十四条“训练数据的时间错位”与第306号第九条“目标试验模拟”构成一对。它们共享的预设是“时间顺序可以在训练与评测之间自由压缩”。相反点在于:训练数据时间错位要求按目标年代切分,目标试验模拟同样要求时间零点严格对齐。若两边都成立,就必须把数据生成时钟与部署时钟作为第三项纳入,并同时报告“目标年代内训练token数/全部训练token数”与“成功映射的协议要素数/目标试验全部要素数”。

◎ 十条可做的研究命题

1. 在同规模语料上比较域数量与有效多样性;若模型尾部表现无差异,则证伪多样性独立价值。

2. 将C4过滤命中按身份词分层;若误删率相同,则证伪群体偏差。

3. 对同一模型训练有无模糊去重版本;若记忆和泛化均无差异,则证伪去重效应。

4. 把训练截止严格置于事件前;若时间错位不影响新闻任务,则证伪时间对齐。

5. 在十种低资源语言上比较统一与本地质量阈值;若保留率和性能相同,则证伪语言特有过滤。

6. 让UD同一树库跨三个版本复算;若结论完全稳定,则证伪版本漂移。

7. 将去偏词向量用于五个真实任务;若内外指标一致,则证伪去偏幻觉。

8. 在FineWeb中保留被行级过滤的方言段;若多样性与性能不变,则证伪空栏价值。

9. 对Dolma实施一次来源撤回演练;若所有派生位置均可定位,则证伪治理债。

10. 比较原生与翻译扩展数据;若本地人工评价无差异,则证伪翻译腔风险。

◎ 资料核验

碰撞供料矩阵:碰撞供料矩阵:以下六族均覆盖S、D、E三个位置;第19、20条为位置余量。;01 谁进入分母 —— S 甲、Web即语料库/D 乙、COCA的动态平衡语料/E 丙、文化组学与Google Books Ngram;02 单一读数代表复杂对象 —— S 丁、多语言依存树库的统一接口/D 戊、分布语义的可计算词义/E 己、统一信息密度;15 同名即同物 —— S 庚、定量语言规律的跨语料检验/D 辛、社交媒体方言与人口变异/E 一、语境化表示成为语料仪器;17 局部最优可加总为整体最优 —— S 二、Data Statements进入语料治理/D 三、词向量去偏的幻觉/E 四、C4语料的审计;22 通过形式审查=实质合规 —— S 五、去重与记忆泄漏/D 六、训练数据的时间错位/E 七、Dolma开放三万亿词元语料;30 未被计价的东西不影响结算 —— S 八、CulturaX多语言清洗/D 九、DataComp-LM的数据中心基准/E 十、FineWeb与行级质量过滤。

  1. Baroni, M. et al. (2009). The WaCky Wide Web: a collection of very large linguistically processed web-crawled corpora. Language Resources and Evaluation, 43, 209–226.
  2. Kilgarriff, A. & Grefenstette, G. (2003). Introduction to the special issue on the Web as corpus. Computational Linguistics, 29, 333–347.
  3. Data, Data Everywhere: A Guide for Pretraining Dataset Construction. EMNLP 2024, 10471–10503.
  4. Davies, M. (2008–). The Corpus of Contemporary American English (COCA). Brigham Young University.
  5. Biber, D. (1993). Representativeness in corpus design. Literary and Linguistic Computing, 8, 243–257.
  6. Egbert, J., Biber, D. & Gray, B. (2022). Designing and Evaluating Language Corpora. Cambridge University Press.
  7. Michel, J.-B. et al. (2011). Quantitative analysis of culture using millions of digitized books. Science, 331, 176–182.
  8. Pechenick, E. A., Danforth, C. M. & Dodds, P. S. (2015). Characterizing the Google Books corpus. PLoS ONE, 10, e0137041.
  9. Younes, N. & Reips, U.-D. (2019). Guideline for improving the reliability of Google Ngram studies. PLoS ONE, 14, e0213554.
  10. McDonald, R. et al. (2013). Universal Dependency Annotation for Multilingual Parsing. ACL 2013, 92–97.
  11. Nivre, J. et al. (2016). Universal Dependencies v1: a multilingual treebank collection. LREC 2016.
  12. Zeman, D. et al. (2024). Universal Dependencies 2.15 release and documentation. UniversalDependencies.org.
  13. Mikolov, T. et al. (2013). Efficient estimation of word representations in vector space. ICLR Workshop 2013.
  14. Levy, O. & Goldberg, Y. (2014). Neural word embedding as implicit matrix factorization. NeurIPS 2014.
  15. Ethayarajh, K. (2019). How contextual are contextualized word representations? EMNLP-IJCNLP 2019, 55–65.
  16. Jaeger, T. F. (2010). Redundancy and reduction: speakers manage syntactic information density. Cognitive Psychology, 61, 23–62.
  17. Levy, R. & Jaeger, T. F. (2007). Speakers optimize information density through syntactic reduction. NeurIPS 2006 Workshop.
  18. Aylett, M. & Turk, A. (2004). The smooth signal redundancy hypothesis. Language and Speech, 47, 31–56.
  19. Ferrer-i-Cancho, R. & Liu, H. (2014). The risks of mixing dependency lengths from sequences of different length. Glottometrics, 27, 1–20.
  20. Piantadosi, S. T. (2014). Zipf’s word frequency law in natural language: a critical review and future directions. Psychonomic Bulletin & Review, 21, 1112–1130.
  21. Koplenig, A. (2021). Language structure is influenced by the number of speakers but seemingly not by the proportion of non-native speakers. Royal Society Open Science, 8, 201872.
  22. Eisenstein, J. et al. (2014). Diffusion of lexical change in social media. PLoS ONE, 9, e113114.
  23. Nguyen, D. et al. (2016). Computational sociolinguistics: a survey. Computational Linguistics, 42, 537–593.
  24. How socioeconomic status affects language technology interactions. ACL 2025, 17934–17960.
  25. Peters, M. E. et al. (2018). Deep contextualized word representations. NAACL 2018, 2227–2237.
  26. Hewitt, J. & Liang, P. (2019). Designing and interpreting probes with control tasks. EMNLP-IJCNLP 2019, 2733–2743.
  27. Belinkov, Y. (2022). Probing classifiers: promises, shortcomings, and advances. Computational Linguistics, 48, 207–219.
  28. Bender, E. M. & Friedman, B. (2018). Data Statements for Natural Language Processing. TACL, 6, 587–604.
  29. Gebru, T. et al. (2021). Datasheets for datasets. Communications of the ACM, 64(12), 86–92.
  30. Longpre, S. et al. (2024). A Pretrainer’s Guide to Training Data. NAACL 2024, 2957–2977.
  31. Bolukbasi, T. et al. (2016). Man is to computer programmer as woman is to homemaker? NeurIPS 2016.
  32. Gonen, H. & Goldberg, Y. (2019). Lipstick on a pig: debiasing methods cover up systematic gender biases in word embeddings. NAACL 2019, 609–614.
  33. Goldfarb-Tarrant, S. et al. (2021). Intrinsic bias metrics do not correlate with application bias. ACL 2021, 1926–1940.
  34. Dodge, J. et al. (2021). Documenting large webtext corpora: a case study on the Colossal Clean Crawled Corpus. EMNLP 2021, 1286–1305.
  35. Bender, E. M. et al. (2021). On the dangers of stochastic parrots. FAccT 2021, 610–623.
  36. Lee, K. et al. (2022). Deduplicating training data makes language models better. ACL 2022, 8424–8445.
  37. Kandpal, N. et al. (2022). Deduplicating training data mitigates privacy risks in language models. ICML 2022.
  38. Luu, K. et al. (2022). Time waits for no one! Analysis and challenges of temporal misalignment. NAACL 2022, 5944–5958.
  39. Word predictability estimates from language models are not robust. CoNLL 2026.
  40. Soldaini, L. et al. (2024). Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research. ACL 2024, 15725–15788.
  41. Dodge, J. et al. (2021). Documenting large webtext corpora. EMNLP 2021.
  42. Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset. ACL 2025.
  43. Nguyen, T. et al. (2024). CulturaX: a cleaned, enormous, and multilingual dataset for large language models in 167 languages. LREC-COLING 2024.
  44. Kreutzer, J. et al. (2022). Quality at a glance: an audit of web-crawled multilingual datasets. TACL, 10, 50–72.
  45. Assessing the Role of Data Quality in Training Bilingual Language Models. Findings of EMNLP 2025.
  46. Li, J. et al. (2024/2025). DataComp-LM: In search of the next generation of training sets for language models. arXiv:2406.11794, v4 2025.
  47. Gadre, S. et al. (2023). DataComp: in search of the next generation of multimodal datasets. NeurIPS 2023.
  48. Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models. ACL 2025.
  49. Penedo, G. et al. (2024). The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. NeurIPS Datasets and Benchmarks 2024.
  50. Lozhkov, A. et al. (2024). FineWeb-Edu: the finest collection of educational content. Hugging Face technical report, 2024.
  51. FinerWeb-10BT: Refining Web Data with LLM-Based Line-Level Quality Assessment. NoDaLiDa 2025.
  52. We Need to Measure Data Diversity in NLP — Better and Broader. EMNLP 2025.
  53. ORBIT: Cost-Effective Dataset Curation for Large Language Model Pretraining. Findings of ACL 2025.
  54. A Data-Efficient Path to Multilingual LLMs: Language Expansion via Router Tuning. ACL 2026.
  55. Aleph-Alpha-GermanWeb: Improving German-Language LLM Pretraining Data. EACL 2026.
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行八字段碰撞行(位置/单因/预设/量纲/失效/自曝/空栏/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板