音系学与形态学
过去二十年,音系学与形态学并没有沿着“规则越来越复杂、模型越来越大”单线前进,而是不断改写什么算音段、词形、范式与可推广证据。2006年前后的梯度音系、范例音系、词本位形态、构式形态和低条件熵,使连续判断、完整词形、社会索引与范式预测获得独立地位;2016年后的SIGMORPHON共享任务、PhonologyBench、陌生词根泛化和脑内音系编码,则把标签、切分、数据覆盖和测试分母提升为理论条件。手语音系、去殖民语音技术和语言记录进一步提醒:统一格式并不自动等于公平,公开数据也不自动等于社区可持续使用。本面板因此不把二十条写成工具清单,而把每条都落在单位、读数、失效边界和未设字段上,检验一种语言结构是在材料中被发现,还是在记录制度中被制造。全文以20个转向而非年代事件串联音系、词形、范式与语言记录,每条分别交代旧卡点、单因命题、关键读数、争议边界、实践后果和跨面板接口。正文同时保留提出、争议、最新三笔来源与八字段供料层,使读者能区分:结论来自对象本身,还是来自共享任务、词表、发音转写与范式数据库、样本分母、版本与制度选择。最终标准不是“读起来像综述”,而是20条均能被反查、被证伪、被换算。
第一幕从梯度音系、范例记忆、词本位形态与低条件熵出发,把“天然单位”改写为可由使用、范式和概率检验的结构。从梯度音系约束、范例音系与社会索引、自然类不再预先给定等8条可见,这一幕的共同判据是:旧分类遇到边缘材料时,必须用分层读数而不是“例外”收口,并公开谁被排除。
甲、梯度音系约束Gradient Phonotactics
从梯度音系议题的材料看,梯度音系约束在2008年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:音系规则通常把词形判为合格或不合格,连续可接受度只能被塞进例外表。核查梯度音系议题时,被标成“不像词”而未进入词典的新造词与方言词一旦被删去,分类稳定性便无法与记录偏差分开。
在梯度音系议题这条证据链上,本条不是说词形合法性的概率权重而非二值许可“也很重要”,而是要求先结算这一项。Hayes(2008)的最小检验是模型预测误差/人类等级判断总变异;当测试词与训练词高度相似时,方向反过来:词汇记忆会压过抽象约束。梯度音系约束由此把一个连续得分足以代表多层音系合法性从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
Hayes与Wilson在2008年的最大熵模型中把多个约束加权,后续实验用若干新造词等级比较预测与人类判断,模型能同时给出排序和置信差。梯度音系约束目前缺少可跨研究直接合并的效应量;固定模型预测误差和人类等级判断总变异这2项结构量后,后续结果才可比较。对梯度音系议题做反向检验,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。
边界并不隐蔽:梯度判断究竟来自语法表征还是词汇相似度;该转向的失效条件是:当测试词与训练词高度相似时,方向反过来:词汇记忆会压过抽象约束。这也意味着,词典编纂、语音教学、低资源语言记录与语音技术处理上述机制时不能只保存成功案例,还要保留排除理由、版本与反号结果。
由此还产生了一条实践后果:语音教学与语音识别应报告边缘音节的概率,而不只给词典内命中率。把梯度音系议题放回原窗口,在词典编纂、语音教学、低资源语言记录与语音技术中,应把这些漏记对象设为固定字段,并按上述分子—分母发布分层结果。就梯度音系议题的外推边界看,相关更新(2024)进一步要求把这一制度安排的版本、人工修订与该未登记群体的失败记录连成可追踪链。梯度音系议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
围绕梯度音系议题,两边共享“一个连续得分足以代表多层音系合法性”,但本条把上述首因置于决定位置。沿梯度音系议题的责任链,只有把这一比率换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。
乙、范例音系与社会索引Exemplar Phonology
核查范例音系社会索引时,相关研究(2006)把范例音系与社会索引改写成一个分母问题。此前,传统音系常把社会身份视为语音规则之外的附加变量,词项只保留抽象音段。在范例音系社会索引这条证据链上,只有让匿名化处理中被去掉的口音、年龄与社群线索获得可比较位置,旧边界才可能接受反例检验。对范例音系社会索引做反向检验,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。把范例音系社会索引放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。
就范例音系社会索引的外推边界看,相关研究(2006)把带说话人信息的记忆痕迹置于解释次序的第一位,并用带身份元数据的词例命中率/全部词例命中率作为成败读数。对范例音系社会索引而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
在实证层面,2006年前后范例模型用大量带声学细节的词例解释频率、口音和风格迁移;范例音系与社会索引不以“显著”充当读数;依相关研究(2006)的论证,至少应公开带身份元数据的词例命中率和全部词例命中率这2项结构量。围绕范例音系社会索引,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。
争议集中在范例数量是否会无限膨胀,以及抽象类别是否仍然必要。相关争议(2006)的复核指出:当听者对说话人身份毫无经验时,方向反过来:抽象音类比社会索引更能预测识别。沿范例音系社会索引的责任链,此时该复核口径失去原有解释力;而“范例模型承认压缩与遗忘不可避免,却常不报告哪些社会群体先被压缩”又显示,稳定对象也可能由工具制造。
另一处常被略过的是,语音数据库需要保留说话人、场景与风格元数据,过度平均会删除社会意义。上述机制在2021年的实践验收应同时公开带身份元数据的词例命中率、说明全部词例命中率,并给这些漏记对象留下可撤回、可修订的记录。本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
在该研究线索中,两边共享“记录中的说话人标签能够代表真实社会身份”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把范例音系社会索引放到另见第 606 号第 20 条『自然相关披露:位置依赖不能压成一个分数』旁核验:先对齐对象、时间窗和责任人,再检查范例音系社会索引的核心判断在另一套分母中是否仍同向。
丙、自然类不再预先给定Emergent Features
在自然类不议题这条证据链上,相关研究(2008)首先定位了自然类不再预先给定的历史卡点。这个问题曾长期被写成技术细节,核心却是区别特征常被当作跨语言预装的最小积木,语言只负责从清单中选择。对自然类不议题做反向检验,在2006—2016阶段,无法放入既有特征矩阵的混合类与过渡音不再只是边缘案例,而成为判断对象边界是否成立的证据。
把自然类不议题放回原窗口,本条不是说声学—发音模式的反复共现“也很重要”,而是要求先结算这一项。相关研究(2008)的最小检验是被同一特征覆盖的活跃类数/全部活跃类数;当一组音段在多语言中反复共同活动时,方向反过来:预设特征比局部涌现更简洁。自然类不再预先给定最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
Mielke汇总561种语言,登记6077个活跃音类;超过四分之一无法由三套常用区别特征体系中的任何一套完整表示。只有把被同一特征覆盖的活跃类数和全部活跃类数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。对自然类不再预先给定而言,这一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。该研究线索的复算口径至少分开2类对照、3项切片和4个误差字段。
这里尚未收敛的部分是涌现特征会不会失去对儿童习得和类型学限制的预测力。相关争议(2014)把边界写成:当一组音段在多语言中反复共同活动时,方向反过来:预设特征比局部涌现更简洁。就自然类不议题的外推边界看,其时,该复核口径不再支持原方向;提出路线自己还承认“涌现论依赖研究者对「共同活动」的编码,而编码本身可能继承旧特征表”。反号因此必须进入主分析。
在方法之外,语言记录应先保存原始发音维度,再决定是否合并为“自然类”。围绕自然类不议题,Nature(2025)表明,上述机制落地后不能只问“能否使用”。词典编纂、语音教学、低资源语言记录与语音技术还要记录上述分子—分母、版本号、人工修订与这组账外材料。
围绕该研究线索,双方同以“跨语言数据库中的同名音段可被当作同一对象比较”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。把自然类不议题放到另见第 519 号第 5 条『多层选择:选择单位不是预先给定,而由因果问题决定』旁核验:先对齐对象、时间窗和责任人,再检查自然类不议题的核心判断在另一套分母中是否仍同向。
丁、词本位形态学Word-based Morphology
对词本位形议题做反向检验,相关研究(2006)使词本位形态学原有分类失去不证自明的地位。在这一转向出现以前,词素切分被视为形态分析的唯一入口,不规则词只能靠补充列表维持。把词本位形议题放回原窗口,旧框架若继续排除没有完整范式、只留下一个文献见例的词形,看似整齐的规律就可能只是删选结果。就词本位形议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。
围绕词本位形议题,相关研究(2006)把完整词形之间的推断关系置于解释次序的第一位,并用可由范式推回的词形数/全部词形数作为成败读数。边界是:当派生透明且词素边界稳定时,方向反过来:切分模型更省表示;一旦词本位形态学触发这一条件,就不能再用其他修饰条件保护中心主张。本项证据真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。对词本位形议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
沿词本位形议题的责任链,该研究线索由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。
反对意见主要来自词本位模型怎样避免把每个词都记成孤立条目。争议的可检验部分由相关争议(2010)给出:当派生透明且词素边界稳定时,方向反过来:切分模型更省表示。复算词本位形议题之前,此时须重新计算该复核口径。
这项转向对实践的连带影响是词典与教学应把范式预测写成网络,不必强迫每个词形切出一一对应词素。按词本位形议题的对象表,上述机制进入词典编纂、语音教学、低资源语言记录与语音技术后,工作流须先保存该未登记群体,再进行压缩、排名或展示。对照词本位形议题的主源,相关更新(2017)提醒,总分不能替代上述分子—分母。
在词本位形议题的实施账本里,本面板测这一比率,对方检验“一个完整词形可用单一词位编号代表其内部多层结构”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把词本位形议题放到另见第 515 号第 8 条『法兰克福案例:替代可能不是责任的唯一入口』旁核验:先对齐对象、时间窗和责任人,再检查词本位形议题的核心判断在另一套分母中是否仍同向。
戊、构式形态学Construction Morphology
把形式意义判据放回原窗口,构式形态学在2010年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:形态规则与句法构式分属两个模块,词内模式被认为不能共享句法式的网络机制。就形式意义判据的外推边界看,被编辑者判为“一次性造词”而不建图式的形式一旦被删去,分类稳定性便无法与记录偏差分开。围绕形式意义判据,这一步先限定可比较对象,不把缺失值折成零效应。
沿形式意义判据的责任链,本条不是说形式—意义构式网络“也很重要”,而是要求先结算这一项。相关研究(2010)的最小检验是新词命中某图式的次数/全部新词次数;当词内形式具有严格局部组合时,方向反过来:模块化规则比构式网络更可压缩。复算形式意义判据之前,一旦把这些漏记对象重新计入,构式形态学原来的平均值、类别边界和责任归属都可能同时改变。
Booij在2010年用荷兰语、英语等多组派生与复合模式建立构式图式,比较局部图式对新词可接受度的解释。构式形态学属于结构性转向,原文没有统一样本效应量;数值入口仍有2个:新词命中某图式的次数与全部新词次数,并须在独立材料上重算。按形式意义判据的对象表,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。
边界并不隐蔽:图式数量增加会不会只是把词表重新命名。该转向的失效条件是:当词内形式具有严格局部组合时,方向反过来:模块化规则比构式网络更可压缩。对照形式意义判据的主源,本项证据真正需要比较的不是一句“是否有效”,而是这一比率在材料、群体和版本改变后是否同向。
由此还产生了一条实践后果:词典编纂可把复合、派生与短语模板放进同一网络,并报告生产力阈值。在词典编纂、语音教学、低资源语言记录与语音技术中,应把该未登记群体设为固定字段,并按该复核口径发布分层结果。SIGMORPHON(2025)进一步要求把该研究线索的版本、人工修订与这组账外材料的失败记录连成可追踪链。
在形式意义判据的实施账本里,两边共享“先后建立局部图式与整体网络不会改变对生产力的判断”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把形式意义判据放到另见第 525 号第 11 条『私有化与寡头:产权不是一次转移,而是持续的关系结算』旁核验:先对齐对象、时间窗和责任人,再检查形式意义判据的核心判断在另一套分母中是否仍同向。
己、形态组与自主组织Morphomes
就形态组自主组织的外推边界看,相关研究(2011)把形态组与自主组织改写成一个分母问题。此前,主流研究常把形态变化被假定总能由语音条件或意义功能解释,剩余格子只是历史偶然。围绕形态组自主组织,只有让只在少量手稿中保留、未被现代语法录入的范式格获得可比较位置,旧边界才可能接受反例检验。沿形态组自主组织的责任链,这一步先限定可比较对象,不把缺失值折成零效应。
边界是:当语义对立重新进入范式时,方向反过来:功能解释会取代自主形态组织;一旦形态组与自主组织触发这一条件,就不能再用其他修饰条件保护中心主张。对形态组自主组织而言,可被推翻的责任只落在范式内部的形式联结;如果替代机制同样预测结果,这项解释就应撤回。
复算形态组自主组织之前,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。按形态组自主组织的对象表,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。对照形态组自主组织的主源,该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。
争议集中在形态组是否只是描述标签,能否预测新变化。相关争议(2009)的复核指出:当语义对立重新进入范式时,方向反过来:功能解释会取代自主形态组织。在形态组自主组织的实施账本里,此时该复核口径失去原有解释力;而“自主论承认形态组依赖传统传递,却常不测量说话人是否真正心理表征该组”又显示,稳定对象也可能由工具制造。
另一处常被略过的是,历史形态学应把“无明显功能却可复制”的格局当作对象,而不是删作残余。上述机制在2013年的实践验收应同时公开跨时期保留同一格局的范式格数、说明全部范式格数,并给这些漏记对象留下可撤回、可修订的记录。一旦把该未登记群体重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。
从形态组自主组织的材料看,在该研究线索中,两边共享“没有明显功能的形式格局也能作为独立类别被完整列举”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把形态组自主组织放到另见第 606 号第 20 条『自然相关披露:位置依赖不能压成一个分数』旁核验:先对齐对象、时间窗和责任人,再检查形态组自主组织的核心判断在另一套分母中是否仍同向。
庚、低条件熵范式Low Conditional Entropy
围绕低条件熵议题,Ackerman(2013)首先定位了低条件熵范式的历史卡点。沿低条件熵议题的责任链,在2006—2016阶段,没有完整范式的低频词与方言词不进入熵计算不再只是边缘案例,而成为判断对象边界是否成立的证据。复算低条件熵议题之前,其也意味着,词典编纂、语音教学、低资源语言记录与语音技术处理该转向时不能只保存成功案例,还要保留排除理由、版本与反号结果。
按低条件熵议题的对象表,本条不是说少量已知格对其余格的可预测性“也很重要”,而是要求先结算这一项。Ackerman(2013)的最小检验是未知格条件熵/已知格所含信息量;当高频范式含大量异补时,方向反过来:格子越多会带来更高不可预测性。与其继续扩大低条件熵范式的总体样本,不如先检验局部可预测性的改善能够加总成整个范式的可学性是否在不同装置和人群中仍然成立。
Ackerman与Malouf对10种形态差异很大的语言计算范式条件熵;许多条件均值低于1比特,随机化检验用999个重排版本校验低熵并非偶然。只有把未知格条件熵和已知格所含信息量同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。低条件熵范式的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。
这里尚未收敛的部分是样本词典大小与频率分布会不会人为压低条件熵。相关争议(2009)把边界写成:当高频范式含大量异补时,方向反过来:格子越多会带来更高不可预测性。对照低条件熵议题的主源,其时,这一比率不再支持原方向;提出路线自己还承认“低熵研究承认词典缺失会把不存在的变体误当成规则一致”。反号因此必须进入主分析。
在方法之外,教学可以优先选择信息量最高的“主导词形”,而不是平均背诵每个格子。在低条件熵议题的实施账本里,相关更新(2021)表明,上述机制落地后不能只问“能否使用”。从低条件熵议题的材料看,词典编纂、语音教学、低资源语言记录与语音技术还要记录该复核口径、版本号、人工修订与这些漏记对象。核查低条件熵议题时,本项证据真正需要比较的不是一句“是否有效”,而是这一比率在材料、群体和版本改变后是否同向。
围绕该研究线索,双方同以“局部可预测性的改善能够加总成整个范式的可学性”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。这项命题由此把局部可预测性的改善能够加总成整个范式的可学性从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
辛、跨语言形态再屈折共享任务Morphological Reinflection Shared Tasks
沿跨语言形议题的责任链,相关研究(2016)使跨语言形态再屈折共享任务原有分类失去不证自明的地位。在这一转向出现以前,计算形态学长期使用各自数据与标签,系统间的“最好”无法直接比较。复算跨语言形议题之前,旧框架若继续排除无法映射到统一特征表的本地范畴与多答案词形,看似整齐的规律就可能只是删选结果。按跨语言形议题的对象表,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。对照跨语言形议题的主源,这一步先限定可比较对象,不把缺失值折成零效应。
在跨语言形议题的实施账本里,相关研究(2016)把统一输入输出下的可复算误差置于解释次序的第一位,并用盲测正确词形数/全部盲测词形数作为成败读数。对跨语言形议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
SIGMORPHON(2016)覆盖10种语言、11个系统、9个团队和11家机构;2017年扩展到52种语言。从跨语言形议题的材料看,跨语言形态再屈折共享任务由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。核查跨语言形议题时,一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。
反对意见主要来自统一数据会不会把语言特有结构削成同一标签表。争议的可检验部分由Kann(2016)给出:当标签体系遗漏语言特有范畴时,方向反过来:统一基准会压低真正语言知识。在跨语言形议题这条证据链上,此时须重新计算该复核口径。
这项转向对实践的连带影响是共享任务推动了公开训练集、盲测集与错误分析,但也需记录标签无法表达的类别。对跨语言形议题做反向检验,上述机制进入词典编纂、语音教学、低资源语言记录与语音技术后,工作流须先保存该未登记群体,再进行压缩、排名或展示。把跨语言形议题放回原窗口,相关更新(2019)提醒,总分不能替代上述分子—分母。
就跨语言形议题的外推边界看,本面板测这一比率,对方检验“统一标签与测试集能够代表不同语言的实质难度”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把跨语言形议题放到另见第 251 号第 11 条『数据中心作为一台计算机』旁核验:先对齐对象、时间窗和责任人,再检查跨语言形议题的核心判断在另一套分母中是否仍同向。
第二幕把问题推进到共享任务、神经编码、手语、模型公平与社区治理:模型分数不再能替代语言覆盖、陌生词根泛化和多年维护。从神经再屈折与低资源迁移、语境化形态分析、音系能力基准化等12条可见,这一幕不以排行榜为终点,而追踪训练外表现、版本差异、制度采用、社区权利与长期维护。
一、神经再屈折与低资源迁移Neural Reinflection
复算神经再屈折低资源迁之前,神经再屈折与低资源迁移在2017年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:形态生成依赖手写有限状态规则,迁移到新语言需要重新编码。按神经再屈折低资源迁的对象表,训练集中从未出现的新词根与非标准拼写一旦被删去,分类稳定性便无法与记录偏差分开。对照神经再屈折低资源迁的主源,这一步先限定可比较对象,不把缺失值折成零效应。
在神经再屈折低资源迁的实施账本里,本条不是说字符序列到范式格的路径学习“也很重要”,而是要求先结算这一项。从神经再屈折低资源迁的材料看,神经再屈折与低资源迁移形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
2019年的跨语言任务设置100个语言对,涉及66种语言,直接显示高资源迁移与标签错配可以同时发生。核查神经再屈折低资源迁时,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。在神经再屈折低资源迁这条证据链上,其也意味着,词典编纂、语音教学、低资源语言记录与语音技术处理神经再屈折与低资源迁移时不能只保存成功案例,还要保留排除理由、版本与反号结果。
边界并不隐蔽:模型究竟学到形态规则还是训练词根的拼写相似。该转向的失效条件是:当测试词根全部见过时,方向反过来:记忆型系统会看似优于规则归纳。上述机制真正需要比较的不是一句“是否有效”,而是这一比率在材料、群体和版本改变后是否同向。
由此还产生了一条实践后果:语言技术项目需分别报告熟词、陌生词根与复杂特征束的准确率。在词典编纂、语音教学、低资源语言记录与语音技术中,应把这些漏记对象设为固定字段,并按该复核口径发布分层结果。对神经再屈折低资源迁做反向检验,相关更新(2025)进一步要求把这一制度安排的版本、人工修订与该未登记群体的失败记录连成可追踪链。
把神经再屈折低资源迁放回原窗口,两边共享“有限训练词根足以覆盖开放词汇的形态组合”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把神经再屈折低资源迁放到另见第 358 号第 4 条『多语迁移:低资源语言可借共享声学结构学习』旁核验:先对齐对象、时间窗和责任人,再检查神经再屈折低资源迁的核心判断在另一套分母中是否仍同向。
二、语境化形态分析Contextual Morphology
按语境化形议题的对象表,相关研究(2019)把语境化形态分析改写成一个分母问题。此前,形态标注常把每个词独立处理,同形异析只靠词典优先级。对照语境化形议题的主源,只有让被强制压成一个标签的真正歧义词获得可比较位置,旧边界才可能接受反例检验。该转向由此把更多上下文必然稀释词形歧义而不会引入新偏差从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
在语境化形议题的实施账本里,相关研究(2019)把句内语境对同形词的消歧置于解释次序的第一位,并用完整特征束正确数/全部词项数作为成败读数。从语境化形议题的材料看,对本项证据而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
在实证层面,2019年共享任务把形态分析放入句子语境,在多语树库上比较独立标注与上下文模型。现有语境化形态分析文献缺少单一可移植效应量,因此把完整特征束正确数和全部词项数分别作为2项结构读数,并在中心与尾部材料中重算。核查语境化形议题时,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。在语境化形议题这条证据链上,该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。
争议集中在上下文模型是否会把主题与位置偏差当作语法。相关争议(2017)的复核指出:当语境主题与形态类别发生反相关时,方向反过来:上下文会误导消歧。对语境化形议题做反向检验,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
另一处常被略过的是,部署时应做跨体裁测试,并保存模型拒绝的多分析候选。本项证据在2025年的实践验收应同时公开完整特征束正确数、说明全部词项数,并给该未登记群体留下可撤回、可修订的记录。这也意味着,词典编纂、语音教学、低资源语言记录与语音技术处理这一制度安排时不能只保存成功案例,还要保留排除理由、版本与反号结果。
在这项命题中,两边共享“更多上下文必然稀释词形歧义而不会引入新偏差”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把语境化形议题放到另见第 606 号第 20 条『自然相关披露:位置依赖不能压成一个分数』旁核验:先对齐对象、时间窗和责任人,再检查语境化形议题的核心判断在另一套分母中是否仍同向。
三、音系能力基准化PhonologyBench
对照音系能力议题的主源,相关研究(2024)首先定位了音系能力基准化的历史卡点。这个问题曾长期被写成技术细节,核心却是大模型语言能力多由文字任务衡量,音节、押韵与音素转换被当作自动获得。在音系能力议题的实施账本里,在2016—2026阶段,未被标准词典收录的方言读音与多重合法押韵不再只是边缘案例,而成为判断对象边界是否成立的证据。
从音系能力议题的材料看,本条不是说显式音系任务上的人机差距“也很重要”,而是要求先结算这一项。相关研究(2024)的最小检验是模型正确项数/人类正确项数;当任务只需记忆常见拼写词时,方向反过来:大模型可超过非专业人类。音系能力基准化由此把三项任务的汇总分足以代表复杂音系能力从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
只有把模型正确项数和人类正确项数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。核查音系能力议题时,音系能力基准化真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
这里尚未收敛的部分是英文文字与发音映射能否代表跨语言音系能力。BabyLM(2024)把边界写成:当任务只需记忆常见拼写词时,方向反过来:大模型可超过非专业人类。在音系能力议题这条证据链上,其时,这一比率不再支持原方向;提出路线自己还承认“基准承认没有单一模型在3项任务上都领先,排行榜仍倾向给出总冠军”。反号因此必须进入主分析。对音系能力议题做反向检验,其也意味着,词典编纂、语音教学、低资源语言记录与语音技术处理该转向时不能只保存成功案例,还要保留排除理由、版本与反号结果。
在方法之外,语言模型用于诗歌、朗读与教育前,应单列音系验收而非沿用文本总分。相关更新(2024)表明,本项证据落地后不能只问“能否使用”。把音系能力议题放回原窗口,词典编纂、语音教学、低资源语言记录与语音技术还要记录该复核口径、版本号、人工修订与这些漏记对象。对这一制度安排而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
围绕这项命题,双方同以“三项任务的汇总分足以代表复杂音系能力”为前提,量纲却不天然等价;必须先换算上述分子—分母,再谈类比。该转向最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
四、形态组合泛化清算Morphological Compositional Generalization
在形态组合议题的实施账本里,相关研究(2025)使形态组合泛化清算原有分类失去不证自明的地位。在这一转向出现以前,大模型在自然文本上的高概率输出被等同于掌握了形态生产力。从形态组合议题的材料看,旧框架若继续排除模型拒答或输出多个候选时被评测脚本丢弃的答案,看似整齐的规律就可能只是删选结果。核查形态组合议题时,这一步先限定可比较对象,不把缺失值折成零效应。
在形态组合议题这条证据链上,相关研究(2025)把陌生词根上的系统组合置于解释次序的第一位,并用陌生组合正确数/全部合法陌生组合数作为成败读数。边界是:当测试词根来自高频训练词时,方向反过来:表面流畅会掩盖系统性不足;一旦形态组合泛化清算触发这一条件,就不能再用其他修饰条件保护中心主张。本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对形态组合议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
2025年的组合泛化研究同时测试土耳其语、芬兰语2种黏着语与4个主流模型家族,并按陌生词根和词缀复杂度分层。对形态组合议题做反向检验,形态组合泛化清算由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
反对意见主要来自人工构造词根是否过度偏离真实使用。争议的可检验部分由相关争议(2017)给出:当测试词根来自高频训练词时,方向反过来:表面流畅会掩盖系统性不足。把形态组合议题放回原窗口,此时须重新计算该复核口径。
这项转向对实践的连带影响是评测应把已见词根、未见词根与反事实特征束分开报告。就形态组合议题的外推边界看,上述机制进入词典编纂、语音教学、低资源语言记录与语音技术后,工作流须先保存该未登记群体,再进行压缩、排名或展示。围绕形态组合议题,SIGMORPHON(2025)提醒,总分不能替代上述分子—分母。
沿形态组合议题的责任链,本面板测这一比率,对方检验“局部词缀知识能够加总为整体形态生产力”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把形态组合议题放到另见第 358 号第 18 条『群体词错率:平均WER会掩盖系统性不平等』旁核验:先对齐对象、时间窗和责任人,再检查形态组合议题的核心判断在另一套分母中是否仍同向。
五、共享与语言特有的脑内音系编码Shared and Language-specific Neural Coding
从共享语言特有的材料看,共享与语言特有的脑内音系编码在2025年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:听觉皮层常被描述为先做普遍声学处理,再由高层独立完成语言特有解释。核查共享语言特有时,未达到显著解码阈值但可能承载个体差异的电极一旦被删去,分类稳定性便无法与记录偏差分开。在共享语言特有这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。
对共享语言特有做反向检验,本条不是说语言经验调制词级解码“也很重要”,而是要求先结算这一项。共享与语言特有的脑内音系编码真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。对共享语言特有而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
2025年颞叶研究纳入34名患者,其中20名单语者、8名双语者;883个语音响应电极中约79.84%同时响应两种语言。把共享语言特有放回原窗口,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。对共享与语言特有的脑内音系编码而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
边界并不隐蔽:侵入式记录样本有限,临床人群能否代表一般听者。就共享语言特有的外推边界看,该转向的失效条件是:该反向情形。围绕共享语言特有,相关争议(2008)与提出方的自我限制“研究自己显示同一脑区同时含共享与特有信息,单一模块标签不足”共同表明,方向反转不能只留在讨论末段。
由此还产生了一条实践后果:神经语言学应同时报告跨语言共享轴与熟练度相关轴,而非二选一。在词典编纂、语音教学、低资源语言记录与语音技术中,应把该未登记群体设为固定字段,并按上述分子—分母发布分层结果。相关更新(2021)进一步要求把本项证据的版本、人工修订与这组账外材料的失败记录连成可追踪链。
沿共享语言特有的责任链,两边共享“少量临床电极的中位模式能够代表总体语言分布”,但本条把上述首因置于决定位置。只有把这一比率换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把共享语言特有放到另见第 598 号第 6 条『时间精细结构把正常阈值后的听觉编码显影』旁核验:先对齐对象、时间窗和责任人,再检查共享语言特有的核心判断在另一套分母中是否仍同向。
六、手语音系的同等本体地位Sign Language Phonology
核查手语音系议题时,相关研究(2012)把手语音系的同等本体地位改写成一个分母问题。此前,主流研究常把音系理论常默认声音是必要媒介,手语被放到“特殊沟通”而非一般语言结构中。在手语音系议题这条证据链上,只有让未进入转写的面部、身体与空间层信息获得可比较位置,旧边界才可能接受反例检验。对手语音系议题做反向检验,这一步先限定可比较对象,不把缺失值折成零效应。
把手语音系议题放回原窗口,相关研究(2012)把手形—位置—运动的组合约束置于解释次序的第一位,并用可形成最小对立的手语参数数/全部编码参数数作为成败读数。对手语音系议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
在实证层面,Sandler等研究把手形、位置和运动拆成可组合层级,并用多种手语的最小对立与韵律域证明结构性;2012年的证据没有统一冠军数字;对手语音系的同等本体地位更合适的做法是同时报告可形成最小对立的手语参数数、全部编码参数数这2项结构量及其反例变化。就手语音系议题的外推边界看,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。围绕手语音系议题,该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。
争议集中在视觉—动作通道是否能直接套用口语音系单位。相关争议(2008)的复核指出:该反向情形。沿手语音系议题的责任链,此时该复核口径失去原有解释力;而“手语音系承认转写系统会丢失非手部标记,却常以手部标签作为主分数”又显示,稳定对象也可能由工具制造。
另一处常被略过的是,音系课程和基准应把手语纳入核心数据,而非只作为附录反例。上述机制在2020年的实践验收应同时公开可形成最小对立的手语参数数、说明全部编码参数数,并给这些漏记对象留下可撤回、可修订的记录。只要本项证据仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
复算手语音系议题之前,在该研究线索中,两边共享“口语和手语中的同名「音系单位」具有可比本体”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把手语音系议题放到另见第 511 号第 17 条『动物沟通连续谱:信息、意图与组合性不能只设一道门槛』旁核验:先对齐对象、时间窗和责任人,再检查手语音系议题的核心判断在另一套分母中是否仍同向。
七、音系复杂度的权衡Phonological Complexity Trade-offs
在音系复杂议题这条证据链上,相关研究(2021)首先定位了音系复杂度的权衡的历史卡点。对音系复杂议题做反向检验,在2016—2026阶段,无法进入标准词表的借词、语码转换与多读音词不再只是边缘案例,而成为判断对象边界是否成立的证据。与其继续扩大该转向的总体样本,不如先检验局部编码成本可无损加总为整体语言复杂度是否在不同装置和人群中仍然成立。把音系复杂议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。
就音系复杂议题的外推边界看,本条不是说词库与音系规则之间的总成本“也很重要”,而是要求先结算这一项。围绕音系复杂议题,一旦把这些漏记对象重新计入,音系复杂度的权衡原来的平均值、类别边界和责任归属都可能同时改变。对音系复杂议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
跨106种语言、1016个基本概念的比较把词长与每音位信息量放在同一尺度上,二者相关约为−0.74。只有把音系编码成本和可区分词汇信息量同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。沿音系复杂议题的责任链,音系复杂度的权衡真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
这里尚未收敛的部分是数据库覆盖和谱系相关会不会制造负相关。Ackerman(2013)把边界写成:该反向情形。复算音系复杂议题之前,其时,这一比率不再支持原方向;提出路线自己还承认“权衡研究承认相关方向依赖编码选择,却常把一个编码版本写成普遍规律”。反号因此必须进入主分析。
在方法之外,类型学报告应给出总成本与各层分解,而非宣布某语言更简单。按音系复杂议题的对象表,Nature(2025)表明,上述机制落地后不能只问“能否使用”。词典编纂、语音教学、低资源语言记录与语音技术还要记录该复核口径、版本号、人工修订与该未登记群体。本项证据最怕一个总分,因为中心样本改善时,这组账外材料可能正以更快速度退出可见范围。
围绕该研究线索,双方同以“局部编码成本可无损加总为整体语言复杂度”为前提,量纲却不天然等价;必须先换算上述分子—分母,再谈类比。这项命题的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。
八、去殖民化的语音技术Decolonising Speech Technology
对去殖民化议题做反向检验,相关研究(2020)使去殖民化的语音技术原有分类失去不证自明的地位。在这一转向出现以前,低资源技术常把“获得更多语料”视为唯一目标,默认采集者拥有清洗、标注和再利用权。旧框架若继续排除已录音但按社区规则不得公开或不得商业训练的材料,看似整齐的规律就可能只是删选结果。把去殖民化议题放回原窗口,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。就去殖民化议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。
围绕去殖民化议题,相关研究(2020)把社区对数据与输出的治理权置于解释次序的第一位,并用社区许可材料数/全部训练材料数作为成败读数。对去殖民化议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
关键证据来自Bird等2020年前后的工作以澳大利亚原住民语言项目说明,数据许可、社区目标与维护能力会直接改变技术是否可用;去殖民化的语音技术尚无统一效应量,但至少可保存2个数:社区许可材料数与全部训练材料数,再比较中心材料和边缘材料的差。沿去殖民化议题的责任链,该研究线索由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。
反对意见主要来自治理要求会不会减慢模型开发并降低公开复用。复算去殖民化议题之前,争议的可检验部分由相关争议(2021)给出:该反向情形。按去殖民化议题的对象表,此时须重新计算该复核口径。对照去殖民化议题的主源,支持方同时记录“技术团队承认开放许可并不等于知情同意,公开排行榜却仍奖励数据规模”,说明对象会被样本和制度回写。
这项转向对实践的连带影响是项目验收需记录谁能撤回数据、谁维护词典、收益是否回到说话社群。上述机制进入词典编纂、语音教学、低资源语言记录与语音技术后,工作流须先保存这些漏记对象料,再进行压缩、排名或展示。在去殖民化议题的实施账本里,Nature(2025)提醒,总分不能替代上述分子—分母。
本面板测这一比率,对方检验“未被公开计价的治理与维护成本不会改变技术结论”在另一对象上是否反号;这组账外材料料是两边共同漏掉的候选。把去殖民化议题放到另见第 517 号第 6 条『非洲哲学与种族化理性:谁被允许拥有理论能力』旁核验:先对齐对象、时间窗和责任人,再检查去殖民化议题的核心判断在另一套分母中是否仍同向。
九、形态丰富语言的模型公平性Morphology and Model Fairness
把形态丰富议题放回原窗口,形态丰富语言的模型公平性在2021年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:多语模型以总体平均分证明“跨语言能力”,高资源、分析型语言占据主要分母。就形态丰富议题的外推边界看,没有标准分词器、无法进入统一测试集的语言一旦被删去,分类稳定性便无法与记录偏差分开。围绕形态丰富议题,这一步先限定可比较对象,不把缺失值折成零效应。
沿形态丰富议题的责任链,本条不是说按形态类型分层的错误率“也很重要”,而是要求先结算这一项。复算形态丰富议题之前,其也意味着,词典编纂、语音教学、低资源语言记录与语音技术处理形态丰富语言的模型公平性时不能只保存成功案例,还要保留排除理由、版本与反号结果。对形态丰富议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
跨语评测显示,词形丰富、资源稀少语言常在分词、标注和生成上承受更高错误;相关研究(2021)未报告可跨研究合并的统一效应量;可核查的结构量是形态丰富语言错误数与该组全部测试项,二者须在同一排除规则下取得。按形态丰富议题的对象表,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。形态丰富语言的模型公平性另固定2项结构读数、3类材料与4次版本复核。
边界并不隐蔽:形态复杂度与语料规模高度相关,责任如何分开。对照形态丰富议题的主源,该转向的失效条件是:该反向情形。在形态丰富议题的实施账本里,相关争议(2019)与提出方的自我限制“模型在总体分数提升时仍可能让尾部语言退化,而版本说明不设退化清单”共同表明,方向反转不能只留在讨论末段。
从形态丰富议题的材料看,在词典编纂、语音教学、低资源语言记录与语音技术中,应把这些漏记对象设为固定字段,并按上述分子—分母发布分层结果。SIGMORPHON(2025)进一步要求把本项证据的版本、人工修订与该未登记群体的失败记录连成可追踪链。
核查形态丰富议题时,两边共享“总体性能的局部改进会自动惠及每一种语言”,但本条把上述首因置于决定位置。在形态丰富议题这条证据链上,只有把这一比率换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。
十、字素、音素与分词单位之争Grapheme–Phoneme Tokenization
就字素音素分词单位的外推边界看,相关研究(2024)把字素、音素与分词单位之争改写成一个分母问题。此前,主流研究常把文本模型的子词切分被当作中性工程选择,默认不会改变学到的语言结构。围绕字素音素分词单位,只有让没有可靠字音转换器的语言与多音字词获得可比较位置,旧边界才可能接受反例检验。沿字素音素分词单位的责任链,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。复算字素音素分词单位之前,这一步先限定可比较对象,不把缺失值折成零效应。
按字素音素分词单位的对象表,相关研究(2024)把输入单位对语法与音系学习的塑形置于解释次序的第一位,并用音素输入模型得分/字素输入模型得分作为成败读数。对照字素音素分词单位的主源,边界是:当正字法极不透明时,方向反过来:音素输入可能比字素输入更接近可学结构;一旦字素、音素与分词单位之争触发这一条件,就不能再用其他修饰条件保护中心主张。
相关比较把字素、音素和字符等至少3种输入单位置于相同数据预算下,而不是只比较模型参数量。这使字素、音素与分词单位之争从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。在字素音素分词单位的实施账本里,该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。
争议集中在音素转换器本身会引入英语中心偏差。BabyLM(2024)的复核指出:该反向情形。从字素音素分词单位的材料看,此时该复核口径失去原有解释力;而“研究承认转换质量决定音素模型上限,却常把转换错误算进模型能力”又显示,稳定对象也可能由工具制造。只要该转向仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
另一处常被略过的是,小数据模型应把输入单位作为实验变量,而非固定前处理。本项证据在2024年的实践验收应同时公开音素输入模型得分、说明字素输入模型得分,并给这组账外材料留下可撤回、可修订的记录。这一制度安排最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
在这项命题中,两边共享“输入表示只是冗余编码,压缩后不会改变可学对象”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把字素音素分词单位放到另见第 533 号第 4 条『GelSight:接触被改写成一幅可学习的图像』旁核验:先对齐对象、时间窗和责任人,再检查字素音素分词单位的核心判断在另一套分母中是否仍同向。
十一、语言记录中的计算形态学缺口Documentation Gap
围绕语言记录议题,SIGMORPHON(2025)首先定位了语言记录中的计算形态学缺口的历史卡点。这个问题曾长期被写成技术细节,核心却是计算工具常以论文测试集结束,默认高分模型自然能进入濒危语言记录现场。沿语言记录议题的责任链,在2016—2026阶段,模型失败后由本地人员手工修回但未回流的数据不再只是边缘案例,而成为判断对象边界是否成立的证据。复算语言记录议题之前,这一步先限定可比较对象,不把缺失值折成零效应。
按语言记录议题的对象表,本条不是说可维护分析而非一次性模型“也很重要”,而是要求先结算这一项。对照语言记录议题的主源,语言记录中的计算形态学缺口形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。对语言记录议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
2025年SIGMORPHON与语言记录讨论指出,很多形态工具缺少长期维护、可编辑词典和社区接口;2025年的提出文献没有一项可包办全部材料的总分;语言记录中的计算形态学缺口因此保留2层读数:人工修订分钟数及其分母每百个自动分析词。只有把人工修订分钟数和每百个自动分析词同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。该研究线索另固定2项结构读数、3类材料与4次版本复核。
这里尚未收敛的部分是小型社区项目难以承担持续工程成本。相关争议(2020)把边界写成:该反向情形。在语言记录议题的实施账本里,其时,该复核口径不再支持原方向;提出路线自己还承认“论文自己报告模型依赖特定环境,发布后却不跟踪两年后的可运行性”。反号因此必须进入主分析。语言记录议题的边界记录为:Bird,S.(2020).DecolonisingSpeechandLanguageTechnology.ProceedingsofC。这笔材料只限制外推,不重复充当支持证据。
在方法之外,研究资助应把五年维护、培训与数据回流列为成果,而不只算发表时准确率。从语言记录议题的材料看,相关更新(2021)表明,上述机制落地后不能只问“能否使用”。词典编纂、语音教学、低资源语言记录与语音技术还要记录上述分子—分母、版本号、人工修订与这些漏记对象。
围绕这一制度安排,双方同以“通过一次技术验收就等于形成可持续的语言记录能力”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。把语言记录议题放到另见第 531 号第 8 条『暗反应:失败实验不是垃圾,而是边界数据』旁核验:先对齐对象、时间窗和责任人,再检查语言记录议题的核心判断在另一套分母中是否仍同向。
十二、人类—模型音系协作Human-in-the-loop Phonology
BabyLM(2024)使人类—模型音系协作原有分类失去不证自明的地位。在这一转向出现以前,自动分析与人工语言学被安排成替代关系,性能越高就越少需要专家。沿人类模型议题的责任链,旧框架若继续排除专家怀疑但暂不确定、没有最终标签的候选分析,看似整齐的规律就可能只是删选结果。围绕人类模型议题,源行把原始命题、边界材料与更新状态分开登记。复算人类模型议题之前,这一步先限定可比较对象,不把缺失值折成零效应。
BabyLM(2024)把专家修订对自动分析的闭环置于解释次序的第一位,并用交互流程修订时长/纯人工修订时长作为成败读数。按人类模型议题的对象表,对本项证据而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
人机闭环的最小可复算设计至少要分开3类记录:机器首答、专家修改和再次运行后的保留修改。对照人类模型议题的主源,人类—模型音系协作由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。在人类模型议题的实施账本里,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。该研究线索的数值链至少保留2组对照、3项读数和4个复核字段。
反对意见主要来自专家反馈会不会只修正熟悉类型,反而固化偏见。从人类模型议题的材料看,争议的可检验部分由相关争议(2024)给出:该反向情形。核查人类模型议题时,此时须重新计算该复核口径。在人类模型议题这条证据链上,支持方同时记录“系统承认专家常接受看似流畅的错误候选,自动化偏误并未被总工时反映”,说明对象会被样本和制度回写。
这项转向对实践的连带影响是界面应保存被拒绝候选与修订理由,使反馈成为新数据而不是一次性操作。对人类模型议题做反向检验,上述机制进入词典编纂、语音教学、低资源语言记录与语音技术后,工作流须先保存该未登记群体,再进行压缩、排名或展示。把人类模型议题放回原窗口,SIGMORPHON(2025)提醒,总分不能替代上述分子—分母。
就人类模型议题的外推边界看,本面板测这一比率,对方检验“自动建议中的冗余候选可以被压缩而不损失专家判断”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把人类模型议题放到另见第 182 号第 10 条『儿童保护风险算法:预测不能替代关系性判断』旁核验:先对齐对象、时间窗和责任人,再检查人类模型议题的核心判断在另一套分母中是否仍同向。
◎ 二十年连起来看
从梯度音系到共享任务,第一条贯穿线索是音段与词形不再被当作天然单位;连续判断、完整范式和陌生词根使旧余数获得读数。
第二条线索是规模化计算并未取消理论,反而把分词、标签和训练切分提升为因果条件;总体分数越高,尾部语言越需要单列。
第三条线索是语言技术的成功标准从一次准确率扩展到社区授权、修订成本与多年维护;可持续性开始进入结论。
◎ 三个常见误解
误解一是“音系学与形态学的新进展等于神经网络替代规则”。正确表述是:模型把旧单位选择暴露得更清楚,陌生词根与手语空栏仍要求理论解释。
误解二是“梯度就意味着没有结构”。梯度音系与低条件熵恰好用连续读数标出结构在哪里变强、在哪里失效;没有边界条件的二值规则才最难反驳。
误解三是“跨语言统一标签天然公平”。SIGMORPHON与PHOIBLE保证格式可交换,却不能保证语言特有范畴已被表示;公共层必须与本地扩展层并存。
◎ 与相邻领域的接口
第462号句法学:可接受度与结构单位如何共同漂移。分工判据是:本块以共享任务、词表、发音转写与范式数据库回答音系、词形、范式与语言记录的内部机制;对方只能在自己的对象与分母上验证同名结构。
第463号语义学与语用学:形式概率何时能承载意义。接口成立的最低条件,是两块分别公开样本进入规则、失败样本和量纲换算;术语相同不能代替共享任务、词表、发音转写与范式数据库的证据。
第465号语料库与量化语言学:抽样、分母与总体分数。两块的分工线在于:本面板追踪音系、词形、范式与语言记录,对方追踪另一条路径或条件场;只有方向和分母都可比较时才构成互证。
第466号古文字与文献学:异体、残片和版本如何进入记录。若双方的排除规则、版本或授权不同,就必须分别命名结论,并把差异写进词典编纂、语音教学、低资源语言记录与语音技术的验收表。
◎ 争议现场
梯度音系究竟属于语法还是词汇记忆;收敛需同一批新造词在跨说话人、跨词表条件下预注册比较。收敛设计须在共享任务、词表、发音转写与范式数据库中使用同一材料、同一排除规则和预注册主量纲,并把反号结果列入主分析。
神经形态模型是否真正系统组合;收敛需按陌生词根和形态复杂度分层的盲测。在词典编纂、语音教学、低资源语言记录与语音技术场景中,双方应共同提交数据、代码与盲评方案,预先说明零效应、方向反转和退出样本怎样解释。
统一跨语言标签是否公平;收敛需允许语言特有范畴并同时报告宏平均与尾部退化。只有跨实验室或跨机构在独立材料上重现效应量及其边界,并公开音系、词形、范式与语言记录的尾部误差,这场争论才算推进。
◎ 往下五年看什么
PhonologyBench后续是否增加非英语与手语任务,并把人类基线固定为可复算数据。验收读数:非英语与手语任务占比、每种语言的人类基线和尾部错误率。
SIGMORPHON是否把修订时长、五年维护率和社区许可比例纳入排行榜。验收读数:专家修订时长、社区许可比例、五年后仍可运行的工具比例。
富形态低资源语言在字符、词素、音素三种输入下的错误差距是否缩小。验收读数:三种输入单位的错误差、未知词根准确率和分词撤回次数。
共享与语言特有神经编码能否在非临床、更大样本中复制。验收读数:跨语言脑编码复制率、熟练度调制效应及其独立样本区间。
◎ 可与哪些领域对撞
本块第一条“梯度音系约束”与第462号第五条“岛效应的加工解释”构成一对。它们共享的预设是“一个连续得分足以代表多层结构”。相反点在于:梯度音系把连续权重当作结构读数,岛效应加工解释却把同样的梯度归因于处理负荷。若两边都成立,就必须把词汇相似度与在线资源的共同分层作为第三项纳入,并同时报告“模型预测误差/人类等级判断总变异”与“岛内依存惩罚/匹配非岛依存惩罚”。
本块第十六条“去殖民化的语音技术”与第466号第十九条“古文献数据主权与数字返还”构成一对。它们共享的预设是“公开记录天然带来公平与可核对”。相反点在于:去殖民语音技术要求社区保留控制权,古文献数据主权也表明开放下载可能扩大机构控制。若两边都成立,就必须把来源社群的撤回权与维护权作为第三项纳入,并同时报告“社区许可材料数/全部训练材料数”与“社区授权材料数/全部数字化材料数”。
本块第十七条“形态丰富语言的模型公平性”与第306号第十七条“校准”构成一对。它们共享的预设是“单一总体分数足以代表所有亚组”。相反点在于:形态丰富语言的公平评估要求尾部语言单列,校准则要求预测概率与观察发生率逐区间对齐。若两边都成立,就必须把亚组进入分母的规则作为第三项纳入,并同时报告“形态丰富语言错误数/该组全部测试项”与“预测概率与观察发生率之差/风险区间宽度”。
本块第七条“低条件熵范式”与第306号第十六条“预测模型样本量”构成一对。它们共享的预设是“更多样本会自动稳定复杂结构”。相反点在于:低条件熵范式强调有限范式可预测结构,样本量框架却提醒候选自由度增长会反向放大过拟合。若两边都成立,就必须把范式复杂度消耗的有效自由度作为第三项纳入,并同时报告“未知格条件熵/已知格所含信息量”与“有效事件数/候选参数自由度”。
◎ 十条可做的研究命题
1. 在五种形态类型上比较字素、音素与词素分词,若尾部错误差不超过2个百分点则否证输入单位效应。
2. 把未知词根与已见词根严格分离,若组合复杂度增加时准确率不下降则否证系统性缺口。
3. 建立手语非手部标记基准,若加入面部与身体层后最小对立识别不提高则否证空栏价值。
4. 对同一社区比较开放许可与本地许可工具的五年留存,若开放组维护率不低则否证治理反转。
5. 在三种词表规模上重估最大熵约束,若权重排序完全稳定则否证词表依赖。
6. 把模型拒答纳入分母,若宏平均与原排行榜差异小于1%则否证失败样本偏差。
7. 用跨谱系抽样重测复杂度权衡,若控制谱系后相关消失则否证普遍权衡。
8. 比较纯自动、纯人工、人机协作三流程,若协作不减修订时长则否证闭环优势。
9. 给范例模型加入受控遗忘,若社会索引预测不受影响则否证记忆痕迹必要性。
10. 将PHOIBLE同名音段按声学实测拆分,若类型学结论不变则否证“同名即同物”问题。
◎ 资料核验
碰撞供料矩阵:以下六族均覆盖S、D、E三个位置;第19、20条为位置余量。02 单一读数代表复杂对象 —— S 甲、梯度音系约束/D 乙、范例音系与社会索引/E 丙、自然类不再预先给定;04 测量不改变被测对象 —— S 丁、词本位形态学/D 戊、构式形态学/E 己、形态组与自主组织;15 同名即同物 —— S 庚、低条件熵范式/D 辛、跨语言形态再屈折共享任务/E 一、神经再屈折与低资源迁移;17 局部最优可加总为整体最优 —— S 二、语境化形态分析/D 三、音系能力基准化/E 四、形态组合泛化清算;22 通过形式审查=实质合规 —— S 五、共享与语言特有的脑内音系编码/D 六、手语音系的同等本体地位/E 七、音系复杂度的权衡;24 冗余是浪费 —— S 八、去殖民化的语音技术/D 九、形态丰富语言的模型公平性/E 十、字素、音素与分词单位之争。
- Hayes, B. & Wilson, C. (2008). A Maximum Entropy Model of Phonotactics and Phonotactic Learning. Linguistic Inquiry, 39(3), 379–440. DOI: 10.1162/ling.2008.39.3.379.
- Daland, R., Hayes, B., White, J., Garellek, M., Davis, A. & Norrmann, I. (2011). Explaining Sonority Projection Effects. Cognition, 118(2), 259–273.
- Pierrehumbert, J. B. (2006). The Next Toolkit. Journal of Phonetics, 34, 516–530.
- Johnson, K. (2006). Resonance in an Exemplar-based Lexicon: The Emergence of Social Identity and Phonology. Journal of Phonetics, 34, 485–499.
- Mielke, J. (2008). The Emergence of Distinctive Features. Oxford University Press.
- Blevins, J. P. (2006). Word-based Morphology. Journal of Linguistics, 42(3), 531–573.
- Booij, G. (2010). Construction Morphology. Oxford University Press.
- Maiden, M., Smith, J. C., Goldbach, M. & Hinzelin, M.-O. (eds.) (2011). Morphological Autonomy: Perspectives from Romance Inflectional Morphology. Oxford University Press.
- Ackerman, F., Blevins, J. P. & Malouf, R. (2009). Parts and Wholes: Implicative Patterns in Inflectional Paradigms. In Analogy in Grammar. Oxford University Press.
- Moran, S., McCloy, D. & Wright, R. (eds.) (2014). PHOIBLE Online. Max Planck Institute for Evolutionary Anthropology.
- Cotterell, R. et al. (2016). The SIGMORPHON 2016 Shared Task—Morphological Reinflection. Proceedings of SIGMORPHON 2016, 10–22. DOI: 10.18653/v1/W16-2002.
- Kann, K. & Schütze, H. (2016). Single-Model Encoder-Decoder with Explicit Morphological Representation for Reinflection. Proceedings of ACL 2016.
- Cotterell, R. et al. (2017). CoNLL-SIGMORPHON 2017 Shared Task: Universal Morphological Reinflection in 52 Languages. Proceedings of CoNLL-SIGMORPHON 2017.
- McCarthy, A. D. et al. (2019). The SIGMORPHON 2019 Shared Task: Morphological Analysis in Context and Cross-Lingual Transfer. Proceedings of SIGMORPHON 2019.
- Ackerman, F. & Malouf, R. (2013). Morphological Organization: The Low Conditional Entropy Conjecture. Language, 89(3), 429–464.
- Sandler, W. (2012). The Phonological Organization of Sign Languages. Language and Linguistics Compass, 6, 162–182.
- Bender, E. M., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots. Proceedings of FAccT 2021, 610–623.
- Suvarna, A., Khandelwal, H. & Peng, N. (2024). PhonologyBench: Evaluating Phonological Skills of Large Language Models. Proceedings of KnowLLM 2024, ACL.
- Weissweiler, L. et al. (2025). Assessing Morphological Productivity and Systematicity in Large Language Models for Turkish and Finnish. Proceedings of NAACL 2025, 36 pages.
- Shared and Language-Specific Phonological Processing in the Human Temporal Lobe. Nature (2025). DOI: 10.1038/s41586-025-09748-8.
- Proceedings of the 22nd SIGMORPHON Workshop on Computational Research in Phonetics, Phonology, and Morphology. Association for Computational Linguistics, 2025.
- Bird, S. (2020). Decolonising Speech and Language Technology. Proceedings of COLING 2020.
- Pimentel, T., Roark, B. & Cotterell, R. (2021). Phonotactic Complexity and Its Trade-offs in the Lexicon. Transactions of the Association for Computational Linguistics.
- Proceedings of the BabyLM Challenge 2024. Association for Computational Linguistics, 2024.
- Bunzeck, B., Duran, D., Schade, L. & Zarrieß, S. (2024). Graphemes vs. Phonemes: Battling It Out in Character-based Language Models. BabyLM 2024.