句法学
句法学在过去二十年经历的核心变化,不是“树结构被概率模型取代”,而是结构、路径、判断与证据之间的责任重新分配。相位理论和句法制图继续细化层级,构式句法、期望驱动解析、岛效应加工解释和噪声通道则把频率、记忆与输入可靠度带进推导;实验句法和通用依存句法又把少量星号判断改写为可重复的分布、树库与跨语言映射。2016年以后,RNN层级泛化、结构探针、BLiMP、SyntaxGym、BabyLM、树正则化与机制回路,使“模型会句法”被拆成四个问题:结构能否被读出、是否被因果使用、能否跨材料与语言保持、以及是否解释人的在线困难。手语与传承语材料进一步证明,线性词序、空间指向和输入分布不能由同一金标无损压平。全文以20个转向而非年代事件串联结构单位、依存路径与句法诊断,每条分别交代旧卡点、单因命题、关键读数、争议边界、实践后果和跨面板接口。正文同时保留提出、争议、最新三笔来源与八字段供料层,使读者能区分:结论来自对象本身,还是来自最小对立、眼动、树库、探针与因果消融、样本分母、版本与制度选择。最终标准不是“读起来像综述”,而是20条均能被反查、被证伪、被换算。
第一幕把结构从静态树转成相位封装、构式网络、概率预期、噪声修复与实验分布,句法单位开始接受路径检验。从相位不是层级的装饰、句法制图学、构式成为句法单位等8条可见,这一幕的共同判据是:旧分类遇到边缘材料时,必须用分层读数而不是“例外”收口,并公开谁被排除。
甲、相位不是层级的装饰Phases as Derivational Units
从相位不是议题的材料看,Chomsky(2008)把相位不是层级的装饰改写成一个分母问题。此前,句法推导常常把所有层级同时开放,长距离移位只靠一条全局规则说明。核查相位不是议题时,只有让在推导中被删除但语义解释仍需访问的材料获得可比较位置,旧边界才可能接受反例检验。在相位不是议题这条证据链上,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。对相位不是议题做反向检验,这一步先限定可比较对象,不把缺失值折成零效应。
把相位不是议题放回原窗口,相位不是层级的装饰的单因命题锁定局部相位对长距离依存的封装。就相位不是议题的外推边界看,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对相位不是议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
相位文献至少把CP与vP两类边缘结构放在同一周期性计算框架中,并以移位、可及性和岛约束3类诊断交叉检验。围绕相位不是议题,一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。沿相位不是议题的责任链,该研究线索的数值链至少保留2组对照、3项读数和4个复核字段。
反对意见主要来自相位边界的数量与位置常随理论调整,可能只是重命名旧节点。相关争议(2010)的复核指出:当语言允许透明长距离重构时,方向反过来:更少封装比更多相位更简洁。复算相位不是议题之前,此时该复核口径失去原有解释力;而“相位理论自己需要边缘逃逸通道,说明封装从来不是绝对关闭”又显示,稳定对象也可能由工具制造。
这项转向对实践的连带影响是句法分析应公开每一步可访问的材料,而不是只给最终树。上述机制进入树库建设、实验句法、句法评测与语言模型分析后,工作流须先保存该未登记群体,再进行压缩、排名或展示。按相位不是议题的对象表,相关更新(2025)提醒,总分不能替代上述分子—分母。
对照相位不是议题的主源,本面板测这一比率,对方检验“局部封装的改善可以加总为整体推导效率”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把相位不是议题放到另见第 234 号第 10 条『开放材料库把“大样本”改写为可复现学习科学』旁核验:先对齐对象、时间窗和责任人,再检查相位不是议题的核心判断在另一套分母中是否仍同向。
乙、句法制图学Syntactic Cartography
核查功能层级判据时,Cinque(2010)首先定位了句法制图学的历史卡点。这个问题曾长期被写成技术细节,核心却是功能词和语序差异常被压进少数大节点,语言间细微顺序只能靠参数例外。在功能层级判据这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。
对功能层级判据做反向检验,句法制图学在Cinque(2010)的材料中只承认功能层级的细粒度次序具有决定性。把功能层级判据放回原窗口,任一不成立都要求改写本项证据的解释。就功能层级判据的外推边界看,本项证据最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。对功能层级判据而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
Cinque与Rizzi在2010年前后汇总多语言证据,把左缘、屈折域等拆成数十个功能投射;句法制图学属于结构性转向,原文没有统一样本效应量;数值入口仍有2个:被同一层级预测的语序数与全部已观察语序数,并须在独立材料上重算。围绕功能层级判据,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。
边界并不隐蔽:投射数持续增加会不会把描述当成解释。Sprouse(2023)把边界写成:当语料极少导致空缺只是未采样时,方向反过来:粗粒度层级更稳健。沿功能层级判据的责任链,其时,这一比率不再支持原方向;提出路线自己还承认“制图研究承认许多节点只由少数语言支撑,却常把完整序列画成普遍地图”。反号因此必须进入主分析。
由此还产生了一条实践后果:类型学数据库可保存细粒度顺序,但必须报告未观察组合是否真不可能。在树库建设、实验句法、句法评测与语言模型分析中,应把该未登记群体设为固定字段,并按该复核口径发布分层结果。复算功能层级判据之前,Baroni(2024)进一步要求把上述机制的版本、人工修订与这组账外材料的失败记录连成可追踪链。
按功能层级判据的对象表,两边共享“更精细的层级必然更接近真实句法结构”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把功能层级判据放到另见第 511 号第 4 条『认识情态词:谁在评估,决定“可能”是否仍成立』旁核验:先对齐对象、时间窗和责任人,再检查功能层级判据的核心判断在另一套分母中是否仍同向。
丙、构式成为句法单位Construction-based Syntax
在构式成为议题这条证据链上,Goldberg(2006)使构式成为句法单位原有分类失去不证自明的地位。在这一转向出现以前,规则被认为只操作抽象范畴,习语与半固定格式留在词库例外区。对构式成为议题做反向检验,一旦把该未登记群体重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。把构式成为议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。
就构式成为议题的外推边界看,构式成为句法单位的单因命题锁定形式—意义配对的整体模板。围绕构式成为议题,本项证据真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。对构式成为议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
关键证据来自Goldberg 2006与Bybee 2010用数百个频率分布和产出实验说明,部分论元结构意义由整体构式贡献;构式成为句法单位尚无统一效应量,但至少可保存2个数:新词在构式中获得目标解释的次数与全部测试次数,再比较中心材料和边缘材料的差。沿构式成为议题的责任链,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。
争议集中在构式网络会不会因粒度过细而失去预测。争议的可检验部分由Bybee(2010)给出:当动词选择限制极强时,方向反过来:词汇中心模型比整体构式更准确。复算构式成为议题之前,此时须重新计算该复核口径。按构式成为议题的对象表,支持方同时记录“构式语法承认网络节点由研究者切分,过细会退化成句例库存”,说明对象会被样本和制度回写。
另一处常被略过的是,教学与语法工程应同时记录模板频率、开放槽位与语义偏好。上述机制在2024年的实践验收应同时公开新词在构式中获得目标解释的次数、说明全部测试次数,并给这些漏记对象留下可撤回、可修订的记录。对照构式成为议题的主源,本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
在该研究线索中,两边共享“一个构式标签足以代表内部形式、意义与语用的复杂配对”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把构式成为议题放到另见第 608 号第 14 条『非单偶家庭与儿童结果:家庭形式不是一张固定处方』旁核验:先对齐对象、时间窗和责任人,再检查构式成为议题的核心判断在另一套分母中是否仍同向。
丁、期望驱动的句法理解Expectation-based Parsing
对期望驱动议题做反向检验,期望驱动的句法理解在2008年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。把期望驱动议题放回原窗口,参与者从未见过但语法合法的低频结构一旦被删去,分类稳定性便无法与记录偏差分开。与其继续扩大该转向的总体样本,不如先检验测得的阅读时长不会被测量任务本身改变是否在不同装置和人群中仍然成立。
就期望驱动议题的外推边界看,期望驱动的句法理解在Levy(2008)的材料中只承认条件概率对处理难度的预测具有决定性。可证伪口径写入目标词惊异度/该位置总信息量;失效条件是:当低概率结构被强语境预先激活时,方向反过来:稀有结构也可快速处理。围绕期望驱动议题,任一不成立都要求改写本项证据的解释。沿期望驱动议题的责任链,一旦把这些漏记对象重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。
期望驱动解析把逐词负对数概率与阅读时长对齐,至少区分局部歧义前、歧义点和消歧区3个位置。只有把目标词惊异度和该位置总信息量同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。期望驱动的句法理解真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。复算期望驱动议题之前,该研究线索的复算口径至少分开2类对照、3项切片和4个误差字段。
这里尚未收敛的部分是惊异度与语义合理性、词频和眼动策略纠缠。该转向的失效条件是:当低概率结构被强语境预先激活时,方向反过来:稀有结构也可快速处理。对上述机制而言,这一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
在方法之外,心理语言实验应报告逐词概率与结构条件,而不只报句末总时长。按期望驱动议题的对象表,Huang(2024)表明,这一制度安排落地后不能只问“能否使用”。树库建设、实验句法、句法评测与语言模型分析还要记录上述分子—分母、版本号、人工修订与这组账外材料。
围绕这项命题,双方同以“测得的阅读时长不会被测量任务本身改变”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。对照期望驱动议题的主源,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。
戊、岛效应的加工解释Processing Accounts of Islands
把依存长度机制放回原窗口,Hofmeister(2010)把岛效应的加工解释改写成一个分母问题。此前,主流研究常把岛约束常被视为纯语法禁令,任何改善都被判为实验噪声。就依存长度机制的外推边界看,只有让被预筛选为“太怪”而未进入正式实验的岛句获得可比较位置,旧边界才可能接受反例检验。只要该转向仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
围绕依存长度机制,岛效应的加工解释的单因命题锁定依存长度与可及性共同形成岛效应。与其继续扩大本项证据的总体样本,不如先检验中位参与者的可接受度能代表完整判断分布是否在不同装置和人群中仍然成立。
岛效应实验通常采用2×2因子设计,把依存长度与岛结构分开;是否出现交互项决定“语法禁令”与“加工困难”的分界。沿依存长度机制的责任链,岛效应的加工解释由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。复算依存长度机制之前,一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。依存长度机制的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
反对意见主要来自加工改善能否真正取消语法交互仍有分歧。Sprouse(2016)的复核指出:当填充词高度显著且语境支持时,方向反过来:部分岛句可比控制句更易接受。按依存长度机制的对象表,该转向真正需要比较的不是一句“是否有效”,而是这一比率在材料、群体和版本改变后是否同向。
这项转向对实践的连带影响是岛研究需同时给出2×2交互、个体分布和在线加工,不可只看均值。对照依存长度机制的主源,本项证据进入树库建设、实验句法、句法评测与语言模型分析后,工作流须先保存该未登记群体,再进行压缩、排名或展示。Sprouse(2023)提醒,总分不能替代该复核口径。依存长度机制的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
本面板测上述分子—分母,对方检验“中位参与者的可接受度能代表完整判断分布”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把依存长度机制放到另见第 620 号第 4 条『祖辈照护的健康效应呈现倒U形:参与、强度与可拒绝性共同决定』旁核验:先对齐对象、时间窗和责任人,再检查依存长度机制的核心判断在另一套分母中是否仍同向。
己、噪声通道与善意解析Noisy-channel Parsing
就噪声通道善意解析的外推边界看,Gibson(2013)首先定位了噪声通道与善意解析的历史卡点。这个问题曾长期被写成技术细节,核心却是理解失败被归因于听者语法不足,输入本身被假定完全可靠。围绕噪声通道善意解析,在2006—2016阶段,被自动纠错覆盖、无法回看原形的输入不再只是边缘案例,而成为判断对象边界是否成立的证据。
可证伪口径写入修复解释次数/全部歧义输入次数;失效条件是:当输入来源被标记为高可靠时,方向反过来:听者更坚持字面结构。沿噪声通道善意解析的责任链,任一不成立都要求改写本项证据的解释。只要本项证据仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
噪声通道实验把原句、可能误听句和语义先验至少3类候选纳入同一后验比较。复算噪声通道善意解析之前,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。对噪声通道与善意解析而言,这一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。按噪声通道善意解析的对象表,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。对照噪声通道善意解析的主源,该研究线索另固定2项结构读数、3类材料与4次版本复核。
边界并不隐蔽:“修复”是理性推断还是任务诱发的猜测。Levy(2008)把边界写成:当输入来源被标记为高可靠时,方向反过来:听者更坚持字面结构。反号因此必须进入主分析。该转向真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
由此还产生了一条实践后果:语音识别与阅读辅助应显示原输入和修复候选,避免把系统改写冒充理解。在树库建设、实验句法、句法评测与语言模型分析中,应把这组账外材料设为固定字段,并按这一比率发布分层结果。Mahowald(2024)进一步要求把本项证据的版本、人工修订与这些漏记对象的失败记录连成可追踪链。
在噪声通道善意解析的实施账本里,两边共享“聚合先验与输入证据的次序不改变最终解释”,但本条把上述首因置于决定位置。只有把该复核口径换到同一分母并计入这组账外材料,才能判断互证、反号或第三项。把噪声通道善意解析放到另见第 231 号第 2 条『保护与修复把材料冗余改写为历史证据』旁核验:先对齐对象、时间窗和责任人,再检查噪声通道善意解析的核心判断在另一套分母中是否仍同向。
庚、实验句法的定量化Quantitative Experimental Syntax
围绕实验句法议题,Sprouse(2023)使实验句法的定量化原有分类失去不证自明的地位。在这一转向出现以前,理论句法长期依赖少数研究者的星号判断,判断分布与材料差异不入正文。沿实验句法议题的责任链,旧框架若继续排除未通过注意检查但给出一致语言直觉的参与者,看似整齐的规律就可能只是删选结果。复算实验句法议题之前,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
按实验句法议题的对象表,实验句法的定量化的单因命题锁定因子交互而非少数语感。对照实验句法议题的主源,其也意味着,树库建设、实验句法、句法评测与语言模型分析处理本项证据时不能只保存成功案例,还要保留排除理由、版本与反号结果。
关键证据来自2010年代岛效应、多重问句等研究采用数十到数百参与者和拉丁方设计,报告效应量、交互与置信区间;现有实验句法的定量化文献缺少单一可移植效应量,因此把重复出现的结构交互和全部预注册实验分别作为2项结构读数,并在中心与尾部材料中重算。在实验句法议题的实施账本里,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。
争议集中在实验范式是否把语境与自然使用削得过窄。争议的可检验部分由Sprouse(2016)给出:当专家真正掌握罕见结构而普通参与者误解任务时,方向反过来:专家判断更有信息。从实验句法议题的材料看,此时须重新计算该复核口径。
另一处常被略过的是,语法论证应把专家判断与众包分布并列,并公开材料和排除规则。上述机制在2024年的实践验收应同时公开重复出现的结构交互、说明全部预注册实验,并给这些漏记对象留下可撤回、可修订的记录。一旦把该未登记群体重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。
在该研究线索中,两边共享“形式化实验通过程序审查就等于捕获实质语法知识”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把实验句法议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查实验句法议题的核心判断在另一套分母中是否仍同向。
辛、通用依存句法Universal Dependencies
沿通用依存议题的责任链,通用依存句法在2016年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:树库各用自己的标签与切分,跨语言解析结果只能靠人工对照。复算通用依存议题之前,被迫拆分或合并的本地多词单位一旦被删去,分类稳定性便无法与记录偏差分开。
按通用依存议题的对象表,通用依存句法在Nivre(2016)的材料中只承认跨语言可交换的依存关系具有决定性。对照通用依存议题的主源,任一不成立都要求改写本项证据的解释。在通用依存议题的实施账本里,本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
Universal Dependencies v1汇集33种语言的树库;后续版本持续扩展语言和本地关系标签。只有把可无损映射的依存边数和全部标注边数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。与其继续扩大通用依存句法的总体样本,不如先检验同名依存标签在不同语言中指向同一关系是否在不同装置和人群中仍然成立。从通用依存议题的材料看,一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。通用依存议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
这里尚未收敛的部分是统一方案是否牺牲语言特有结构与多词表达。核查通用依存议题时,该转向的失效条件是:该反向情形。在通用依存议题这条证据链上,其也意味着,树库建设、实验句法、句法评测与语言模型分析处理上述机制时不能只保存成功案例,还要保留排除理由、版本与反号结果。
在方法之外,树库应保留通用层和语言特有扩展层,并记录映射失败。对通用依存议题做反向检验,相关更新(2025)表明,这一制度安排落地后不能只问“能否使用”。把通用依存议题放回原窗口,树库建设、实验句法、句法评测与语言模型分析还要记录这一比率、版本号、人工修订与该未登记群体。就通用依存议题的外推边界看,该研究线索真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
围绕通用依存议题,围绕该转向,双方同以“同名依存标签在不同语言中指向同一关系”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。上述机制最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
第二幕借助UD、BLiMP、SyntaxGym、BabyLM与机制分析,把“模型会不会句法”拆成可读出、因果使用、跨语言外推和人类解释四个问题。从循环网络也能表现层级、结构探针、BLiMP最小对立基准等12条可见,这一幕不以排行榜为终点,而追踪训练外表现、版本差异、制度采用、社区权利与长期维护。
一、循环网络也能表现层级Emergent Hierarchy in RNNs
复算循环网络议题之前,Gulordava(2018)把循环网络也能表现层级改写成一个分母问题。此前,主流研究常把没有显式树结构的模型被认为只能记线性邻接,无法处理长距离一致。按循环网络议题的对象表,只有让因生成器过滤而未进入测试的罕见一致结构获得可比较位置,旧边界才可能接受反例检验。该转向由此把有限自然语料足以控制开放句法空间从背景假定移到检验台上,使支持者与反对者必须使用同一分母。对照循环网络议题的主源,这一步先限定可比较对象,不把缺失值折成零效应。
在循环网络议题的实施账本里,循环网络也能表现层级的单因命题锁定序列训练中涌现的层级敏感性。从循环网络议题的材料看,对本项证据而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
Gulordava等在4种语言上用“无色绿色”材料检验主谓一致,排除词汇共现捷径后仍观察到层级敏感。核查循环网络议题时,循环网络也能表现层级由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。在循环网络议题这条证据链上,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。循环网络议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。
反对意见主要来自训练分布中隐藏的词形线索是否替代了真正层级。对循环网络议题做反向检验,McCoy(2020)的复核指出:该反向情形。把循环网络议题放回原窗口,一旦把这些漏记对象重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。
这项转向对实践的连带影响是评测必须用无语义、新词与结构反转材料,不可只用自然句。本项证据进入树库建设、实验句法、句法评测与语言模型分析后,工作流须先保存这组账外材料,再进行压缩、排名或展示。就循环网络议题的外推边界看,相关更新(2024)提醒,总分不能替代上述分子—分母。
本面板测这一比率,对方检验“有限自然语料足以控制开放句法空间”在另一对象上是否反号;该未登记群体是两边共同漏掉的候选。把循环网络议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查循环网络议题的核心判断在另一套分母中是否仍同向。
二、结构探针Structural Probes
按嵌入空间判据的对象表,Hewitt(2019)首先定位了结构探针的历史卡点。这个问题曾长期被写成技术细节,核心却是神经表示内部不可见,只能由最终任务准确率推测是否含句法。对照嵌入空间判据的主源,在2016—2026阶段,可被读出但对模型输出无因果作用的表示维度不再只是边缘案例,而成为判断对象边界是否成立的证据。该转向的关键不是增加术语,而是让探针恢复树边数/金标准树边数在独立材料和尾部对象上能够被别人复算。
在嵌入空间判据的实施账本里,结构探针在Hewitt(2019)的材料中只承认嵌入空间中的树距离具有决定性。可证伪口径写入这一比率;失效条件是:当探针自由度过高时,方向反过来:更强探针会制造更好“句法”。从嵌入空间判据的材料看,任一不成立都要求改写本项证据的解释。本项证据由此把一个探针分数足以代表模型内部复杂结构从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
结构探针把高维表示映射到一棵距离树,核心读数至少包含边距离相关与根深度误差2项。这些读数使该复核口径能够在中心样本、尾部样本与独立材料上分别重算。对该研究线索而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。核查嵌入空间判据时,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。在嵌入空间判据这条证据链上,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。
边界并不隐蔽:探针容量可能自己学出树,而不是读出已有结构。对嵌入空间判据做反向检验,Mahowald(2024)把边界写成:该反向情形。把嵌入空间判据放回原窗口,其时,上述分子—分母不再支持原方向;提出路线自己还承认“该转向论文自己承认可解码不等于模型使用该信息”。反号因此必须进入主分析。
由此还产生了一条实践后果:探针报告应有随机表示、控制任务和最小描述长度基线。就嵌入空间判据的外推边界看,在树库建设、实验句法、句法评测与语言模型分析中,应把该未登记群体设为固定字段,并按这一比率发布分层结果。相关更新(2025)进一步要求把这一制度安排的版本、人工修订与这组账外材料的失败记录连成可追踪链。
围绕嵌入空间判据,两边共享“一个探针分数足以代表模型内部复杂结构”,但本条把上述首因置于决定位置。沿嵌入空间判据的责任链,只有把该复核口径换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。
三、BLiMP最小对立基准BLiMP
对照BLiM议题的主源,Warstadt(2020)使BLiMP最小对立基准原有分类失去不证自明的地位。在这一转向出现以前,语言模型评估偏重困惑度,整体流畅掩盖局部语法失败。在BLiM议题的实施账本里,旧框架若继续排除人工判断不一致而被删除的最小对立,看似整齐的规律就可能只是删选结果。从BLiM议题的材料看,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。核查BLiM议题时,这一步先限定可比较对象,不把缺失值折成零效应。
在BLiM议题这条证据链上,BLiMP最小对立基准的单因命题锁定大规模最小对立上的语法选择。对BLiM议题做反向检验,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对BLiM议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
BLiMP由67个现象集组成,每集1000对最小句,总计6.7万对;人类总体一致率约96.4%。把BLiM议题放回原窗口,其使BLiMP最小对立基准从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。就BLiM议题的外推边界看,一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。
争议集中在自动生成句是否自然,英语单语现象能否代表句法能力。争议的可检验部分由Hu(2020)给出:该反向情形。此时须重新计算这一比率。围绕BLiM议题,支持方同时记录“基准自己显示没有模型在全部67现象均优,却仍被压成一个平均分”,说明对象会被样本和制度回写。
上述机制在2024年的实践验收应同时公开选对最小对立项数、说明全部测试对数,并给该未登记群体留下可撤回、可修订的记录。本项证据由此把各现象的局部最优可以加总为整体句法能力从背景假定移到检验台上,使支持者与反对者必须使用同一分母。对这一制度安排而言,这一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
沿BLiM议题的责任链,在这项命题中,两边共享“各现象的局部最优可以加总为整体句法能力”,却把决定位置放在不同项上;一旦该未登记群体入账,原有对象、路径与条件场都要重画。把BLiM议题放到另见第 538 号第 11 条『CheckList:自然语言模型开始接受行为单元测试』旁核验:先对齐对象、时间窗和责任人,再检查BLiM议题的核心判断在另一套分母中是否仍同向。
四、SyntaxGym定向评测Targeted Syntactic Evaluation
在逐词概率机制的实施账本里,SyntaxGym定向评测在2020年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:离线最小对立只看整句概率,无法定位模型在何处形成或失去预期。从逐词概率机制的材料看,未达到预期方向但在别处出现补偿的曲线一旦被删去,分类稳定性便无法与记录偏差分开。
核查逐词概率机制时,SyntaxGym定向评测在Gauthier(2020)的材料中只承认逐词概率曲线上的结构效应具有决定性。在逐词概率机制这条证据链上,任一不成立都要求改写本项证据的解释。对逐词概率机制做反向检验,本项证据最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
SyntaxGym首版组织34个测试套件和6类句法回路,以区域惊异度而非单句总概率判定。只有把关键区域惊异度差和全部区域惊异度同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。这也意味着,树库建设、实验句法、句法评测与语言模型分析处理SyntaxGym定向评测时不能只保存成功案例,还要保留排除理由、版本与反号结果。只要该研究线索仍把这组账外材料在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
这里尚未收敛的部分是手工测试套件规模小,研究者选择现象可能偏向已知成功。把逐词概率机制放回原窗口,该转向的失效条件是:该反向情形。Hu(2020)与提出方的自我限制“平台允许研究者挑选通过的套件,选择性报告不会由平均分自动暴露”共同表明,方向反转不能只留在讨论末段。与其继续扩大上述机制的总体样本,不如先检验逐项诊断通过等于模型实质掌握句法是否在不同装置和人群中仍然成立。
在方法之外,每个测试应预注册预期方向并加入反事实材料。就逐词概率机制的外推边界看,相关更新(2025)表明,这一制度安排落地后不能只问“能否使用”。树库建设、实验句法、句法评测与语言模型分析还要记录这一比率、版本号、人工修订与这组账外材料。对该研究线索而言,这一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
围绕逐词概率机制,围绕该转向,双方同以“逐项诊断通过等于模型实质掌握句法”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。一旦把这组账外材料重新计入,上述机制原来的平均值、类别边界和责任归属都可能同时改变。
五、多语句法迁移的边界Multilingual Syntactic Transfer
从多语句法议题的材料看,Zeman(2020)把多语句法迁移的边界改写成一个分母问题。此前,主流研究常把多语模型被假定从高资源语言学到普遍句法并自然迁移到低资源语言。核查多语句法议题时,只有让没有标准树库而无法进入多语基准的语言获得可比较位置,旧边界才可能接受反例检验。在多语句法议题这条证据链上,一旦把该未登记群体重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。
对多语句法议题做反向检验,多语句法迁移的边界的单因命题锁定共享表示与语言特有语序的张力。把多语句法议题放回原窗口,本项证据真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。
多语句法迁移的边界尚无统一效应量,但至少可保存2个数:低资源语言增益与该语言单语基线误差,再比较中心材料和边缘材料的差。就多语句法议题的外推边界看,该研究线索由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索由此把增加多语数据必然减少低资源句法偏差从背景假定移到检验台上,使支持者与反对者必须使用同一分母。围绕多语句法议题,该研究线索的数值链至少保留2组对照、3项读数和4个复核字段。
反对意见主要来自收益来自句法共享还是词汇、脚本和数据量相似。沿多语句法议题的责任链,Nivre(2016)的复核指出:该反向情形。复算多语句法议题之前,此时该复核口径失去原有解释力;而“多语模型承认容量竞争会让部分语言退化,却常只报总体平均”又显示,稳定对象也可能由工具制造。该转向最怕一个总分,因为中心样本改善时,这组账外材料可能正以更快速度退出可见范围。
这项转向对实践的连带影响是迁移报告应列出每种语言相对单语基线的增减。按多语句法议题的对象表,BabyLM(2025)提醒,总分不能替代上述分子—分母。这一制度安排形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
对照多语句法议题的主源,本面板测这一比率,对方检验“增加多语数据必然减少低资源句法偏差”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把多语句法议题放到另见第 233 号第 12 条『新说者研究把母语者边界改写为实践归属』旁核验:先对齐对象、时间窗和责任人,再检查多语句法议题的核心判断在另一套分母中是否仍同向。
六、BabyLM有限输入挑战BabyLM Syntax
相关研究(2024)首先定位了BabyLM有限输入挑战的历史卡点。这个问题曾长期被写成技术细节,核心却是大型模型靠数万亿词训练,成功被直接解释为语言结构可学习。核查Baby议题时,在2016—2026阶段,儿童真实听到但基准语料未记录的互动与手势不再只是边缘案例,而成为判断对象边界是否成立的证据。围绕Baby议题,源行把原始命题、边界材料与更新状态分开登记。在Baby议题这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。
对Baby议题做反向检验,BabyLM有限输入挑战在相关研究(2024)的材料中只承认儿童级数据预算下的可学句法具有决定性。把Baby议题放回原窗口,任一不成立都要求改写本项证据的解释。就Baby议题的外推边界看,一旦把这些漏记对象重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。对Baby议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
BabyLM(2024)设置1000万词与1亿词两档文本预算,并增加1亿词元量级的多模态赛道;共有31份系统提交。围绕Baby议题,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。BabyLM有限输入挑战真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。
边界并不隐蔽:1亿词仍远高于儿童有效输入,基准任务又偏英语书面语。沿Baby议题的责任链,BabyLM(2025)把边界写成:该反向情形。复算Baby议题之前,其时,上述分子—分母不再支持原方向;提出路线自己还承认“挑战赛承认训练数据清洁度本身是优势,却容易被写成架构能力”。反号因此必须进入主分析。
由此还产生了一条实践后果:可学习性研究应报告输入总量、重复率、儿童向材料比例与能耗。按Baby议题的对象表,在树库建设、实验句法、句法评测与语言模型分析中,应把该未登记群体设为固定字段,并按这一比率发布分层结果。对照Baby议题的主源,Mahowald(2024)进一步要求把上述机制的版本、人工修订与这组账外材料的失败记录连成可追踪链。Baby议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
在Baby议题的实施账本里,两边共享“记录下来的有限语料可与儿童真实互动输入等同”,但本条把上述首因置于决定位置。从Baby议题的材料看,只有把该复核口径换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。
七、惊异度解释句法困难的失败Surprisal Null Benchmark
在惊异度解议题这条证据链上,Huang(2024)使惊异度解释句法困难的失败原有分类失去不证自明的地位。在这一转向出现以前,语言模型惊异度常被当作人类阅读困难的统一替代量。对惊异度解议题做反向检验,旧框架若继续排除被多个模型方向相反而平均掉的项目,看似整齐的规律就可能只是删选结果。把惊异度解议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。
就惊异度解议题的外推边界看,惊异度解释句法困难的失败的单因命题锁定跨材料稳定的在线难度预测。与其继续扩大本项证据的总体样本,不如先检验窗口内相关稳定就能外推为一般认知机制是否在不同装置和人群中仍然成立。对惊异度解议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
2024年的空结果基准跨多种歧义结构和语言模型比较,结论以解释方差及其区间而不是单一显著性给出。围绕惊异度解议题,一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。沿惊异度解议题的责任链,该研究线索另固定2项结构读数、3类材料与4次版本复核。
争议集中在不同模型、分词和测量时窗是否把真实效应冲淡。复算惊异度解议题之前,争议的可检验部分由Levy(2008)给出:该反向情形。按惊异度解议题的对象表,此时须重新计算该复核口径。对照惊异度解议题的主源,该转向真正需要比较的不是一句“是否有效”,而是这一比率在材料、群体和版本改变后是否同向。
另一处常被略过的是,心理语言学不能把相关性最高的模型事后选作理论,应预注册模型与区域。本项证据在2024年的实践验收应同时公开惊异度解释方差、说明人类消歧总方差,并给该未登记群体留下可撤回、可修订的记录。这一制度安排最怕一个总分,因为中心样本改善时,这组账外材料可能正以更快速度退出可见范围。
在惊异度解议题的实施账本里,在这项命题中,两边共享“窗口内相关稳定就能外推为一般认知机制”,却把决定位置放在不同项上;一旦该未登记群体入账,原有对象、路径与条件场都要重画。把惊异度解议题放到另见第 265 号第 2 条『本体论转向:差异不只是对同一世界的不同解释』旁核验:先对齐对象、时间窗和责任人,再检查惊异度解议题的核心判断在另一套分母中是否仍同向。
八、树正则化重新进入神经模型Tree-regularized LMs
对树正则化重新议题做反向检验,树正则化重新进入神经模型在2025年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:端到端模型的主张是结构会自动从下一个词预测中涌现,无需显式句法约束。把树正则化重新议题放回原窗口,需要人工树标注却没有资源的语言一旦被删去,分类稳定性便无法与记录偏差分开。就树正则化重新议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。
围绕树正则化重新议题,树正则化重新进入神经模型在相关研究(2025)的材料中只承认训练目标中显式层级偏置具有决定性。沿树正则化重新议题的责任链,任一不成立都要求改写本项证据的解释。对树正则化重新议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
2025年前后树正则化工作把依存距离、成分边界或解析辅助损失加入训练,比较相同参数量模型;2025年的提出文献没有一项可包办全部材料的总分;树正则化重新进入神经模型因此保留2层读数:句法切片增益及其分母新增树标注成本。只有把句法切片增益和新增树标注成本同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。复算树正则化重新议题之前,该研究线索另固定2项结构读数、3类材料与4次版本复核。
这里尚未收敛的部分是改善来自额外标注还是结构偏置本身。按树正则化重新议题的对象表,该转向的失效条件是:该反向情形。上述机制真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。
在方法之外,应在无树库语言和随机树控制上检验,并报告总分与切片的权衡。对照树正则化重新议题的主源,BabyLM(2025)表明,这一制度安排落地后不能只问“能否使用”。树库建设、实验句法、句法评测与语言模型分析还要记录上述分子—分母、版本号、人工修订与这些漏记对象。与其继续扩大该研究线索的总体样本,不如先检验局部句法指标的改善可加总为整体语言能力是否在不同装置和人群中仍然成立。
在树正则化重新议题的实施账本里,围绕该转向,双方同以“局部句法指标的改善可加总为整体语言能力”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。把树正则化重新议题放到另见第 601 号第 20 条『人工智能与本土数据:模型训练不是无形取用』旁核验:先对齐对象、时间窗和责任人,再检查树正则化重新议题的核心判断在另一套分母中是否仍同向。
九、句法回路的机制解释Mechanistic Syntax Circuits
把句法回路议题放回原窗口,Mahowald(2024)把句法回路的机制解释改写成一个分母问题。此前,主流研究常把探针能读出句法就被等同于模型使用句法,内部因果链仍是黑箱。就句法回路议题的外推边界看,只有让消融后由其他路径接管但未被记录的替代机制获得可比较位置,旧边界才可能接受反例检验。围绕句法回路议题,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。沿句法回路议题的责任链,这一步先限定可比较对象,不把缺失值折成零效应。
复算句法回路议题之前,句法回路的机制解释的单因命题锁定因果干预可定位的模型回路。按句法回路议题的对象表,其也意味着,树库建设、实验句法、句法评测与语言模型分析处理本项证据时不能只保存成功案例,还要保留排除理由、版本与反号结果。对句法回路议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
在实证层面,2022—2025年的回路研究用激活替换、注意头消融与因果追踪检验主谓一致、间接宾语等任务;现有句法回路的机制解释文献缺少单一可移植效应量,因此把消融后目标错误增量和消融前目标错误分别作为2项结构读数,并在中心与尾部材料中重算。对照句法回路议题的主源,该研究线索由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。
反对意见主要来自回路是否跨模型、跨随机种子与跨语言复现。在句法回路议题的实施账本里,Hewitt(2019)的复核指出:该反向情形。该转向由此把冗余回路只是浪费,删除后不会改变能力组织从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
这项转向对实践的连带影响是机制研究需提供干预前后效应量和替代回路,而不只画注意图。本项证据进入树库建设、实验句法、句法评测与语言模型分析后,工作流须先保存这些漏记对象,再进行压缩、排名或展示。从句法回路议题的材料看,Sprouse(2023)提醒,总分不能替代上述分子—分母。
本面板测这一比率,对方检验“冗余回路只是浪费,删除后不会改变能力组织”在另一对象上是否反号;这组账外材料是两边共同漏掉的候选。把句法回路议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查句法回路议题的核心判断在另一套分母中是否仍同向。
十、手语句法的空间语法Spatial Syntax in Sign Languages
就手语句法议题的外推边界看,Gauthier(2020)首先定位了手语句法的空间语法的历史卡点。这个问题曾长期被写成技术细节,核心却是句法理论以线性词序为默认,空间定位被视为手势附加信息。围绕手语句法议题,这一步先限定可比较对象,不把缺失值折成零效应。
沿手语句法议题的责任链,手语句法的空间语法在Gauthier(2020)的材料中只承认空间指向对论元结构的组织具有决定性。复算手语句法议题之前,任一不成立都要求改写本项证据的解释。按手语句法议题的对象表,本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
手语研究用指向、角色转换和空间一致的最小对立说明,三维空间可承担照应与论元跟踪;手语句法的空间语法目前缺少可跨研究直接合并的效应量;固定正确解析空间依存数和全部空间指向项这2项结构量后,后续结果才可比较。对照手语句法议题的主源,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。在手语句法议题的实施账本里,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。
边界并不隐蔽:空间位置是语法变量还是话语记忆辅助。从手语句法议题的材料看,Zeman(2020)把边界写成:该反向情形。核查手语句法议题时,其时,这一比率不再支持原方向;提出路线自己还承认“手语树库常把连续空间压成离散标签,损失正是理论核心”。反号因此必须进入主分析。这也意味着,树库建设、实验句法、句法评测与语言模型分析处理该转向时不能只保存成功案例,还要保留排除理由、版本与反号结果。
由此还产生了一条实践后果:通用句法资源需把空间轨迹与面部标记纳入依存关系。在树库建设、实验句法、句法评测与语言模型分析中,应把这些漏记对象设为固定字段,并按该复核口径发布分层结果。相关更新(2025)进一步要求把本项证据的版本、人工修订与该未登记群体的失败记录连成可追踪链。
在手语句法议题这条证据链上,两边共享“口语与手语中同名句法关系可无损对应”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把手语句法议题放到另见第 528 号第 6 条『物质转向:物不只是人类意图的证据』旁核验:先对齐对象、时间窗和责任人,再检查手语句法议题的核心判断在另一套分母中是否仍同向。
十一、传承语与双语句法Heritage and Bilingual Syntax
围绕传承语双语句法,Sprouse(2023)使传承语与双语句法原有分类失去不证自明的地位。在这一转向出现以前,双语差异常被判为母语语法缺损,默认单语规范是唯一完整终点。沿传承语双语句法的责任链,旧框架若继续排除被排除的混合句、语码转换与非标准回答,看似整齐的规律就可能只是删选结果。该转向由此把典型单语个案可代表全部句法能力分布从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
复算传承语双语句法之前,传承语与双语句法的单因命题锁定输入分布对语法稳定性的塑形。按传承语双语句法的对象表,对本项证据而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
对照传承语双语句法的主源,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。在传承语双语句法的实施账本里,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
争议集中在自报输入时长与社会压力会不会混淆能力。从传承语双语句法的材料看,争议的可检验部分由Bybee(2010)给出:该反向情形。核查传承语双语句法时,此时须重新计算该复核口径。在传承语双语句法这条证据链上,支持方同时记录“研究承认「母语者」边界模糊,却常在招募时强制二分”,说明对象会被样本和制度回写。对传承语双语句法做反向检验,一旦把这些漏记对象重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。
本项证据在2024年的实践验收应同时公开目标结构正确数、说明该参与者实际使用机会,并给这组账外材料留下可撤回、可修订的记录。这一制度安排最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。该研究线索的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。传承语双语句法的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
在该转向中,两边共享“典型单语个案可代表全部句法能力分布”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把传承语双语句法放到另见第 280 号第 3 条『传承语与家庭语言政策』旁核验:先对齐对象、时间窗和责任人,再检查传承语双语句法的核心判断在另一套分母中是否仍同向。
十二、人类与模型的句法判断分工Human–Model Judgment
沿人类模型的句的责任链,人类与模型的句法判断分工在2024年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:模型与人类只要总体相关就被视为同一种句法判断器。复算人类模型的句之前,模型拒答、摇摆和人类分歧项目一旦被删去,分类稳定性便无法与记录偏差分开。按人类模型的句的对象表,这一步先限定可比较对象,不把缺失值折成零效应。
对照人类模型的句的主源,可证伪口径写入模型—人类判断一致数/全部重复采样判断;失效条件是:当提示含显式语法术语时,方向反过来:模型会表现得比自然判断更“专家”。在人类模型的句的实施账本里,任一不成立都要求改写本项证据的解释。
人类—模型判断至少要分开3个读数:最小对立正确率、重复采样稳定度与解释文本—实际概率一致度。只有把模型—人类判断一致数和全部重复采样判断同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。对人类与模型的句法判断分工而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。从人类模型的句的材料看,该研究线索的复算口径至少分开2类对照、3项切片和4个误差字段。
这里尚未收敛的部分是提示词、温度与模型版本会不会使结论不可复现。核查人类模型的句时,该转向的失效条件是:该反向情形。上述机制形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
在方法之外,评测应固定版本、记录拒答与多次采样,并保留人类分布而非唯一金标。在人类模型的句这条证据链上,Huang(2024)表明,这一制度安排落地后不能只问“能否使用”。对人类模型的句做反向检验,树库建设、实验句法、句法评测与语言模型分析还要记录这一比率、版本号、人工修订与该未登记群体。这也意味着,树库建设、实验句法、句法评测与语言模型分析处理该研究线索时不能只保存成功案例,还要保留排除理由、版本与反号结果。
把人类模型的句放回原窗口,围绕该转向,双方同以“模型输出中的冗余采样可以压成一个答案而无信息损失”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。把人类模型的句放到另见第 264 号第 19 条『人群影像解剖把“标准结构”改写为年龄、性别和疾病分布』旁核验:先对齐对象、时间窗和责任人,再检查人类模型的句的核心判断在另一套分母中是否仍同向。
◎ 二十年连起来看
第一条线索是句法单位从静态树变成周期封装、概率预期和噪声修复中的动态对象;结构仍在,但结构的可见性取决于路径。
第二条线索是实验句法与通用树库把少数星号判断改成分布和共享标签,同时也暴露出统一量表会遗漏语言特有范畴。
第三条线索是神经模型把“会句法”拆成三问:能否被读出、是否因果使用、能否解释人类;三者不能再由一个总分代替。
◎ 三个常见误解
误解一是“句法学已经被大模型证明或淘汰”。模型只提供新的实验对象;BLiMP、SyntaxGym与消融结果显示,它们在不同结构上同时成功与失败。
误解二是“概率解释会取消层级”。惊异度、噪声通道和相位可以共同存在,关键是分别检验层级单位与概率路径。
误解三是“实验样本越大,语感争议就自动结束”。若材料、招募和排除规则错,千人平均也会把真实分布压成错误金标。
◎ 与相邻领域的接口
第461号音系学与形态学:结构梯度与组合泛化。分工判据是:本块以最小对立、眼动、树库、探针与因果消融回答结构单位、依存路径与句法诊断的内部机制;对方只能在自己的对象与分母上验证同名结构。
第463号语义学与语用学:句法选择何时改变意义与言外推断。接口成立的最低条件,是两块分别公开样本进入规则、失败样本和量纲换算;术语相同不能代替最小对立、眼动、树库、探针与因果消融的证据。
第464号心理语言学:在线处理、预测与个体差异。两块的分工线在于:本面板追踪结构单位、依存路径与句法诊断,对方追踪另一条路径或条件场;只有方向和分母都可比较时才构成互证。
第465号语料库与量化语言学:树库抽样与跨语言标签治理。若双方的排除规则、版本或授权不同,就必须分别命名结论,并把差异写进树库建设、实验句法、句法评测与语言模型分析的验收表。
◎ 争议现场
岛效应究竟是语法禁令还是加工困难;收敛需在相同2×2设计中同时测离线判断和在线读数。收敛设计须在最小对立、眼动、树库、探针与因果消融中使用同一材料、同一排除规则和预注册主量纲,并把反号结果列入主分析。
语言模型是否真正使用层级;收敛需把探针、因果消融与结构外推放在同一模型上。在树库建设、实验句法、句法评测与语言模型分析场景中,双方应共同提交数据、代码与盲评方案,预先说明零效应、方向反转和退出样本怎样解释。
通用依存标签是否牺牲语言特有结构;收敛需公开映射失败和本地扩展的增益。只有跨实验室或跨机构在独立材料上重现效应量及其边界,并公开结构单位、依存路径与句法诊断的尾部误差,这场争论才算推进。
◎ 往下五年看什么
BabyLM在更接近儿童互动而非书面拼接的数据上能否维持句法成绩。验收读数:真实互动材料占比、固定词元预算下的句法得分和训练外错误。
Huang等2024惊异度空结果能否在眼动、脑电和多语言材料上复制。验收读数:同一材料在眼动、脑电和多语言复现中的效应量及区间。
树正则化是否在无树库语言中仍有收益,并报告标注成本。验收读数:无树库语言的增益、人工标注小时数和结构外推误差。
句法回路能否跨随机种子、模型家族和语言稳定复现。验收读数:跨随机种子、模型家族和语言的回路重现率与因果消融差。
◎ 可与哪些领域对撞
本块第六条“噪声通道与善意解析”与第466号第十八条“不确定性进入数字校本”构成一对。它们共享的预设是“受损输入可以被系统修复成唯一版本”。相反点在于:噪声通道优先恢复最可能句,数字校本却必须保留并列读法与无法判定。若两边都成立,就必须把修复动作的责任与不确定性作为第三项纳入,并同时报告“修复解释次数/全部歧义输入次数”与“保留可追溯候选数/全部曾提出读法数”。
本块第十四条“BabyLM有限输入挑战”与第467号第二条“刻意练习的解释上限”构成一对。它们共享的预设是“有限训练量可以决定一般能力”。相反点在于:BabyLM以受限词元测试数据效率,刻意练习研究却显示投入时长只能解释部分音乐差异。若两边都成立,就必须把输入内容、反馈质量与学习者选择作为第三项纳入,并同时报告“受限预算句法得分/大规模模型同项得分”与“由练习解释的表现变异/总表现变异”。
本块第七条“实验句法的定量化”与第306号第五条“稳定选择”构成一对。它们共享的预设是“跨重复样本的稳定结果就是可靠发现”。相反点在于:实验句法把判断分布量化,稳定选择却会在相关变量间随机挑代表而压低真信号。若两边都成立,就必须把评定者与候选变量的替代关系作为第三项纳入,并同时报告“重复出现的结构交互/全部预注册实验”与“跨子样本入选次数/全部重抽样次数”。
本块第十五条“惊异度解释句法困难的失败”与第306号第九条“目标试验模拟”构成一对。它们共享的预设是“只要模型预测充分就能解释因果困难”。相反点在于:惊异度空结果拒绝把预测概率等同句法机制,目标试验模拟也要求先写协议、再映射数据。若两边都成立,就必须把任务设计与时间零点作为第三项纳入,并同时报告“惊异度解释方差/人类消歧总方差”与“成功映射的协议要素数/目标试验全部要素数”。
◎ 十条可做的研究命题
1. 在三种语言上同一材料同步测岛交互、眼动和脑电,若三类读数不共变则否证单一岛机制。
2. 对结构探针读出的维度做因果置换,若输出不变则否证“可读即在用”。
3. 把UD映射失败项纳入分母,若跨语迁移排序不变则否证标签空栏偏差。
4. 用儿童互动语料替换BabyLM书面语料,若句法切片不提高则否证互动输入优势。
5. 预注册五种语言模型惊异度,若均稳定解释歧义困难则否证2024空结果。
6. 随机树与真实树同成本正则化,若收益相同则否证句法偏置。
7. 跨十个随机种子找主谓一致回路,若头编号高度稳定则否证回路漂移。
8. 让传承语参与者按实际使用时长分层,若差异仍与输入无关则否证分布塑形。
9. 对同一最小对立重复采样模型20次,若摇摆率低于人类分歧率则否证版本不稳。
10. 将手语三维轨迹加入树库,若解析与照应预测均不改善则否证空间空栏价值。
◎ 资料核验
碰撞供料矩阵:以下六族均覆盖S、D、E三个位置;第19、20条为位置余量。17 局部最优可加总为整体最优 —— S 甲、相位不是层级的装饰/D 乙、句法制图学/E 丙、构式成为句法单位;29 越精细越接近真实 —— S 丁、期望驱动的句法理解/D 戊、岛效应的加工解释/E 己、噪声通道与善意解析;15 同名即同物 —— S 庚、实验句法的定量化/D 辛、通用依存句法/E 一、循环网络也能表现层级;04 测量不改变被测对象 —— S 二、结构探针/D 三、BLiMP最小对立基准/E 四、SyntaxGym定向评测;22 通过形式审查=实质合规 —— S 五、多语句法迁移的边界/D 六、BabyLM有限输入挑战/E 七、惊异度解释句法困难的失败;24 冗余是浪费 —— S 八、树正则化重新进入神经模型/D 九、句法回路的机制解释/E 十、手语句法的空间语法。
- Chomsky, N. (2008). On Phases. In Foundational Issues in Linguistic Theory. Mouton de Gruyter, 133–166.
- Gallego, Á. J. (2010). Phase Theory. John Benjamins.
- Cinque, G. & Rizzi, L. (2010). The Cartography of Syntactic Structures. In The Oxford Handbook of Linguistic Analysis, 51–65.
- Goldberg, A. E. (2006). Constructions at Work: The Nature of Generalization in Language. Oxford University Press.
- Bybee, J. (2010). Language, Usage and Cognition. Cambridge University Press.
- Levy, R. (2008). Expectation-based Syntactic Comprehension. Cognition, 106(3), 1126–1177.
- Hale, J. (2001). A Probabilistic Earley Parser as a Psycholinguistic Model. NAACL 2001, 159–166.
- Hofmeister, P. & Sag, I. A. (2010). Cognitive Constraints and Island Effects. Language, 86(2), 366–415.
- Sprouse, J., Caponigro, I., Greco, C. & Cecchetto, C. (2016). Experimental Syntax and Island Effects in English and Italian. Natural Language & Linguistic Theory, 34, 307–344.
- Gibson, E., Bergen, L. & Piantadosi, S. T. (2013). Rational Integration of Noisy Evidence and Prior Semantic Expectations in Sentence Interpretation. PNAS, 110(20), 8051–8056.
- Nivre, J. et al. (2016). Universal Dependencies v1: A Multilingual Treebank Collection. LREC 2016, 1659–1666.
- Gulordava, K., Bojanowski, P., Grave, E., Linzen, T. & Baroni, M. (2018). Colorless Green Recurrent Networks Dream Hierarchically. NAACL 2018, 1195–1205.
- McCoy, R. T., Frank, R. & Linzen, T. (2020). Does Syntax Need to Grow on Trees? Sources of Hierarchical Inductive Bias in Sequence-to-Sequence Networks. TACL, 8, 125–140.
- Hewitt, J. & Manning, C. D. (2019). A Structural Probe for Finding Syntax in Word Representations. NAACL 2019, 4129–4138.
- Warstadt, A. et al. (2020). BLiMP: The Benchmark of Linguistic Minimal Pairs for English. TACL, 8, 377–392.
- Gauthier, J., Hu, J., Wilcox, E., Qian, P. & Levy, R. (2020). SyntaxGym: An Online Platform for Targeted Evaluation of Language Models. ACL System Demonstrations 2020, 70–76.
- Hu, J., Gauthier, J., Qian, P., Wilcox, E. & Levy, R. (2020). A Systematic Assessment of Syntactic Generalization in Neural Language Models. ACL 2020, 1725–1744.
- Zeman, D. et al. (2020). Universal Dependencies 2.5. LREC 2020, 4034–4043.
- Proceedings of the BabyLM Challenge 2024. Association for Computational Linguistics, 2024.
- Huang, K.-J. et al. (2024). Large-scale Benchmark Yields No Evidence that Language Model Surprisal Explains Syntactic Disambiguation Difficulty. Journal of Memory and Language, 137, 104510.
- Baroni, M. (2024). On the Proper Role of Language Models in Linguistics. Contemporary review article, 2024.
- BabyLM Challenge (2025). Bigger Is Not Always Better: Data-efficient Language Learning under Controlled Budgets. ACL Workshop Proceedings, 2025.
- Tree-Regularized Language Modeling for Improved Syntactic Generalization. ACL/NAACL Proceedings, 2025.
- Mahowald, K. et al. (2024). Dissociating Language and Thought in Large Language Models. Trends in Cognitive Sciences, 28, 517–540.
- Sprouse, J. (2023). The Oxford Handbook of Experimental Syntax. Oxford University Press.