语义学与语用学
语义学与语用学过去二十年的转向,是把“意义是什么”改写为“意义在什么替代集合、共同状态、时间过程和证据制度中成立”。标量含意、前提投射、表达性意义和理性言语行为模型,使原本停留在逻辑直觉中的现象获得反应时、选择概率和局部更新的读数;分布语义、组合表示和多模态落地则扩展了词义的可计算范围。2015年后的SNLI、标注伪影清算、BERT、IMPPRES与PUB把统一基准带入本领域,同时也显示高分可能来自假设句捷径、封闭选项和文化常规,而不是稳定理解。多方对话、指示落地、社会意义和形式—意义—世界知识分离进一步说明,语境并非外加背景,而是与说话者、听者、对象和记录装置共同决定断言责任的条件场。全文以20个转向而非年代事件串联指称、含意、投射、语境与社会意义,每条分别交代旧卡点、单因命题、关键读数、争议边界、实践后果和跨面板接口。正文同时保留提出、争议、最新三笔来源与八字段供料层,使读者能区分:结论来自对象本身,还是来自反应时、选择概率、最小对立、NLI数据集与视觉指称任务、样本分母、版本与制度选择。最终标准不是“读起来像综述”,而是20条均能被反查、被证伪、被换算。
第一幕让含意、前提、投射、表达性和共同地面获得时间、概率与局部更新的读数,语义—语用边界由实验而非学科分工决定。从标量含意成为可计时过程、理性言语行为模型、前提触发的局部语境等8条可见,这一幕的共同判据是:旧分类遇到边缘材料时,必须用分层读数而不是“例外”收口,并公开谁被排除。
甲、标量含意成为可计时过程Timed Scalar Implicature
从标量含意议题的材料看,Noveck(2008)首先定位了标量含意成为可计时过程的历史卡点。这个问题曾长期被写成技术细节,核心却是“有些”是否推出“并非全部”长期只在逻辑与直觉层面争论,生成时序被当作黑箱。核查标量含意议题时,在2006—2016阶段,被迫二选一但真实允许两种解释的回答不再只是边缘案例,而成为判断对象边界是否成立的证据。在标量含意议题这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。
边界是:当语境强烈预设“非全部”时,方向反过来:含意读法可比字面义更快;一旦标量含意成为可计时过程触发这一条件,就不能再用其他修饰条件保护中心主张。对标量含意议题做反向检验,本项证据最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
实验语用学的可复算设计至少同时保存2类读数:含意选择比例与相对字面基线的反应时差。只有把含意读法额外毫秒数和字面读法基线时长同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。与其继续扩大标量含意成为可计时过程的总体样本,不如先检验一个反应时读数足以代表多阶段语用推断是否在不同装置和人群中仍然成立。把标量含意议题放回原窗口,该研究线索另固定2项结构读数、3类材料与4次版本复核。
这里尚未收敛的部分是延迟究竟说明推理成本还是任务选择冲突。Geurts(2010)把边界写成:当语境强烈预设“非全部”时,方向反过来:含意读法可比字面义更快。就标量含意议题的外推边界看,其时,该复核口径不再支持原方向;提出路线自己还承认“实验自己显示同一参与者会在不同任务间切换,稳定「语用型人格」并不存在”。反号因此必须进入主分析。
在方法之外,教材应把含意写成带条件的在线推断,不再把“有些=不全”当词典义。Degen(2023)表明,上述机制落地后不能只问“能否使用”。围绕标量含意议题,对话系统、语义标注、自然语言推理与多模态交互还要记录上述分子—分母、版本号、人工修订与该未登记群体。本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。
围绕该研究线索,双方同以“一个反应时读数足以代表多阶段语用推断”为前提,量纲却不天然等价;必须先换算上述分子—分母,再谈类比。把标量含意议题放到另见第 196 号第 18 条『新思想 18 · 生成式技术进编辑部 —— 边界争论的第三轮』旁核验:先对齐对象、时间窗和责任人,再检查标量含意议题的核心判断在另一套分母中是否仍同向。
乙、理性言语行为模型Rational Speech Acts
核查理性言语议题时,Frank(2012)使理性言语行为模型原有分类失去不证自明的地位。在这一转向出现以前,语用原则常以宽泛合作准则解释,难以给出数量化预测。在理性言语议题这条证据链上,旧框架若继续排除未被模型列入替代集合的可能表达,看似整齐的规律就可能只是删选结果。对理性言语议题做反向检验,一旦把该未登记群体重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。把理性言语议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。
就理性言语议题的外推边界看,本条不是说说话者—听者递归推断“也很重要”,而是要求先结算这一项。围绕理性言语议题,理性言语行为模型真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。
Frank与Goodman的系列实验累计约745名参与者;核心指称任务把说话者、字面听者和语用听者3层概率放在同一模型中。沿理性言语议题的责任链,理性言语行为模型由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。复算理性言语议题之前,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。与其继续扩大该研究线索的总体样本,不如先检验说话者与听者同名“合作目标”确实是同一目标是否在不同装置和人群中仍然成立。
反对意见主要来自递归深度与先验常由研究者设定,参数可否跨任务稳定。争议的可检验部分由Goodman(2013)给出:当说话双方目标冲突时,方向反过来:合作型递归会系统误判。按理性言语议题的对象表,此时须重新计算该复核口径。
这项转向对实践的连带影响是对话系统应公开替代项、先验与表达成本,而不只给最终答案。对照理性言语议题的主源,上述机制进入对话系统、语义标注、自然语言推理与多模态交互后,工作流须先保存这些漏记对象,再进行压缩、排名或展示。在理性言语议题的实施账本里,相关更新(2025)提醒,总分不能替代上述分子—分母。
从理性言语议题的材料看,本面板测这一比率,对方检验“说话者与听者同名「合作目标」确实是同一目标”在另一对象上是否反号;这组账外材料是两边共同漏掉的候选。把理性言语议题放到另见第 617 号第 6 条『家庭检查:干预从标准课程转向反馈驱动的最小改变』旁核验:先对齐对象、时间窗和责任人,再检查理性言语议题的核心判断在另一套分母中是否仍同向。
丙、前提触发的局部语境Local Contexts for Presupposition
在局部更新机制这条证据链上,前提触发的局部语境在2009年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:前提被视为整句进入共同背景前必须全局满足,局部结构差异靠例外说明。对局部更新机制做反向检验,因材料删节而无法判断满足位置的前提一旦被删去,分类稳定性便无法与记录偏差分开。
边界是:当后置材料反向满足前提时,方向反过来:非线性全局解释更合适;一旦前提触发的局部语境触发这一条件,就不能再用其他修饰条件保护中心主张。把局部更新机制放回原窗口,一旦把这些漏记对象重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。
就局部更新机制的外推边界看,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。该研究线索的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。围绕局部更新机制,该研究线索另固定2项结构读数、3类材料与4次版本复核。
边界并不隐蔽:线性增量算法能否处理非线性、跨语言与话语修复。该转向的失效条件是:当后置材料反向满足前提时,方向反过来:非线性全局解释更合适。沿局部更新机制的责任链,Degen(2023)与提出方的自我限制“局部语境理论需要指定读取顺序,说明顺序并非中性”共同表明,方向反转不能只留在讨论末段。上述机制真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
由此还产生了一条实践后果:语义标注应保存触发词、嵌入域和被满足位置,不只标“有前提”。在对话系统、语义标注、自然语言推理与多模态交互中,应把该未登记群体设为固定字段,并按这一比率发布分层结果。相关更新(2025)进一步要求把这一制度安排的版本、人工修订与这组账外材料的失败记录连成可追踪链。
复算局部更新机制之前,两边共享“语义组合顺序可以无损交换”,但本条把上述首因置于决定位置。只有把该复核口径换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把局部更新机制放到另见第 617 号第 1 条『家庭仪式与日常惯例:稳定不是背景,而是家庭生产出来的时间结构』旁核验:先对齐对象、时间窗和责任人,再检查局部更新机制的核心判断在另一套分母中是否仍同向。
丁、投射内容的跨构式分类Projective Content Taxonomy
对投射内容议题做反向检验,Tonhauser(2013)把投射内容的跨构式分类改写成一个分母问题。此前,主流研究常把前提、常规含意和补语内容常被笼统归为“背景信息”,不同投射行为未分开。把投射内容议题放回原窗口,只有让被标注为背景但来源不明的内容获得可比较位置,旧边界才可能接受反例检验。只要该转向仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。就投射内容议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。
围绕投射内容议题,本条不是说跨否定与提问仍保留的承诺“也很重要”,而是要求先结算这一项。与其继续扩大投射内容的跨构式分类的总体样本,不如先检验典型触发词能代表同类表达的完整分布是否在不同装置和人群中仍然成立。
投射内容研究把前提、补充内容、常规含意等至少4类构式放在同一判断框架中比较。沿投射内容议题的责任链,其使投射内容的跨构式分类从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。复算投射内容议题之前,该研究线索另固定2项结构读数、3类材料与4次版本复核。
争议集中在诊断是否依赖英语问答习惯与实验措辞。Schlenker(2009)的复核指出:当说话者明确否认来源责任时,方向反过来:原本投射的内容可被取消。该转向由此把典型触发词能代表同类表达的完整分布从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
另一处常被略过的是,语料标注需把投射、可取消性与承诺来源分成不同字段。本项证据在2025年的实践验收应同时公开跨算子保留的承诺数、说明全部测试环境数,并给该未登记群体留下可撤回、可修订的记录。按投射内容议题的对象表,其一制度安排形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
对照投射内容议题的主源,在这项命题中,两边共享“典型触发词能代表同类表达的完整分布”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把投射内容议题放到另见第 202 号第 18 条『认知战把信息优势改写为受众行为环境』旁核验:先对齐对象、时间窗和责任人,再检查投射内容议题的核心判断在另一套分母中是否仍同向。
戊、表达性意义独立成层Expressive Meaning
把表达性意议题放回原窗口,Potts(2007)首先定位了表达性意义独立成层的历史卡点。这个问题曾长期被写成技术细节,核心却是贬义词、语气词和感叹成分常被当作情绪附加,不进入正式语义。就表达性意议题的外推边界看,在2006—2016阶段,社群内部重新占用而被外部词典标为单一贬义的词不再只是边缘案例,而成为判断对象边界是否成立的证据。围绕表达性意议题,这一步先限定可比较对象,不把缺失值折成零效应。
边界是:当引语明确转移视角时,方向反过来:表达态度不再归当前说话者;一旦表达性意义独立成层触发这一条件,就不能再用其他修饰条件保护中心主张。只要本项证据仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。对表达性意议题而言,可被推翻的责任只落在态度与描述真值的双层编码;如果替代机制同样预测结果,这项解释就应撤回。
Potts与McCready在2007—2010年把表达性内容与描述内容分层,利用可重复、不可直接否定和视角归属等诊断比较多类词项。表达性意义独立成层目前缺少可跨研究直接合并的效应量;固定表达态度被正确归属次数和全部含态度表达这2项结构量后,后续结果才可比较。只有把表达态度被正确归属次数和全部含态度表达同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。
这里尚未收敛的部分是表达性意义能否完全脱离社会身份与互动关系。McCready(2010)把边界写成:当引语明确转移视角时,方向反过来:表达态度不再归当前说话者。沿表达性意议题的责任链,其时,该复核口径不再支持原方向;提出路线自己还承认“理论承认表达性内容高度依赖身份,却常在脱离说话人的孤句上判断”。反号因此必须进入主分析。
在方法之外,词典和内容审核应区分指称、态度强度与归属者,避免只删词面。复算表达性意议题之前,相关更新(2025)表明,上述机制落地后不能只问“能否使用”。按表达性意议题的对象表,对话系统、语义标注、自然语言推理与多模态交互还要记录上述分子—分母、版本号、人工修订与该未登记群体。
围绕这一制度安排,双方同以“一个标签可以代表描述意义与社会态度的复合对象”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。把表达性意议题放到另见第 515 号第 1 条『理由作为原因:行动解释不能只给意义而不给差异制造』旁核验:先对齐对象、时间窗和责任人,再检查表达性意议题的核心判断在另一套分母中是否仍同向。
己、分布语义的统一记忆Distributional Memory
就分布语义议题的外推边界看,Baroni(2010)使分布语义的统一记忆原有分类失去不证自明的地位。在这一转向出现以前,词义表示依赖手工词典和小型特征表,大语料共现只被当作检索工具。围绕分布语义议题,旧框架若继续排除低频、隐语和新义在训练窗口中没有稳定位置,看似整齐的规律就可能只是删选结果。沿分布语义议题的责任链,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。复算分布语义议题之前,这一步先限定可比较对象,不把缺失值折成零效应。
按分布语义议题的对象表,本条不是说上下文共现构成词义空间“也很重要”,而是要求先结算这一项。对分布语义议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
分布语义评测至少分开相似性、类比和下游预测3类任务,避免一个相关系数代表全部词义。对照分布语义议题的主源,分布语义的统一记忆由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索由此把语料中未出现的意义等于不存在从背景假定移到检验台上,使支持者与反对者必须使用同一分母。该研究线索的数值链至少保留2组对照、3项读数和4个复核字段。
反对意见主要来自高频共现是否把世界偏见与语料题材误当词义。争议的可检验部分由Bender(2020)给出:当同一词跨领域意义分裂时,方向反过来:单一向量会比词典多义项更差。在分布语义议题的实施账本里,此时须重新计算该复核口径。从分布语义议题的材料看,支持方同时记录“分布论自己承认「相似使用」不等于同义,却常用邻近词直接命名概念”,说明对象会被样本和制度回写。
这项转向对实践的连带影响是词向量使用需报告语料来源、窗口与低频词覆盖。核查分布语义议题时,上述机制进入对话系统、语义标注、自然语言推理与多模态交互后,工作流须先保存这些漏记对象,再进行压缩、排名或展示。在分布语义议题这条证据链上,Devlin(2019)提醒,总分不能替代上述分子—分母。
对分布语义议题做反向检验,本面板测这一比率,对方检验“语料中未出现的意义等于不存在”在另一对象上是否反号;这组账外材料是两边共同漏掉的候选。把分布语义议题放到另见第 256 号第 12 条『长上下文与记忆』旁核验:先对齐对象、时间窗和责任人,再检查分布语义议题的核心判断在另一套分母中是否仍同向。
庚、组合分布语义Compositional Distributional Semantics
围绕组合分布议题,组合分布语义在2010年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:分布模型擅长词相似却难说明句义,形式语义有组合规则却缺少经验词义。沿组合分布议题的责任链,无法确定句法分析的残缺句与口语片段一旦被删去,分类稳定性便无法与记录偏差分开。
复算组合分布议题之前,Coecke(2010)把词向量与句法组合的联合算子置于解释次序的第一位,并用组合模型增益/无结构向量基线误差作为成败读数。边界是:当短语高度固定时,方向反过来:整体记忆比组合算子更准确;一旦组合分布语义触发这一条件,就不能再用其他修饰条件保护中心主张。按组合分布议题的对象表,本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
对照组合分布议题的主源,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。在组合分布议题的实施账本里,组合分布语义真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。从组合分布议题的材料看,该研究线索另固定2项结构读数、3类材料与4次版本复核。
边界并不隐蔽:数学结构是否过于理想化,复杂模型是否真优于简单平均。该转向的失效条件是:当短语高度固定时,方向反过来:整体记忆比组合算子更准确。上述机制的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。
由此还产生了一条实践后果:评测需同时给词义、结构和组合外推,而非单一相似度。在对话系统、语义标注、自然语言推理与多模态交互中,应把这些漏记对象设为固定字段,并按这一比率发布分层结果。核查组合分布议题时,Degen(2023)进一步要求把这一制度安排的版本、人工修订与该未登记群体的失败记录连成可追踪链。
在组合分布议题这条证据链上,两边共享“局部词义改进能够加总为整体句义改进”,但本条把上述首因置于决定位置。只有把该复核口径换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把组合分布议题放到另见第 306 号第 4 条『联合模型:纵向轨迹与生存结局不能分开估』旁核验:先对齐对象、时间窗和责任人,再检查组合分布议题的核心判断在另一套分母中是否仍同向。
辛、多模态落地语义Multimodal Grounding
沿多模态落议题的责任链,Bruni(2014)把多模态落地语义改写成一个分母问题。此前,主流研究常把文字共现被当作足够的意义来源,颜色、形状和空间关系只需从文本间接恢复。复算多模态落议题之前,只有让无图像、禁拍或只以触觉存在的概念获得可比较位置,旧边界才可能接受反例检验。该转向由此把更多模态数据必然减少意义偏差从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
按多模态落议题的对象表,本条不是说文字与视觉共同限定指称“也很重要”,而是要求先结算这一项。对照多模态落议题的主源,对多模态落地语义而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
多模态语义把文本、图像与共同出现关系3种信号对齐,关键是跨模态检索而非单模态冠军分数。只要该研究线索仍把这组账外材料在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。与其继续扩大该研究线索的总体样本,不如先检验更多模态数据必然减少意义偏差是否在不同装置和人群中仍然成立。该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。在多模态落议题的实施账本里,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。
争议集中在图像数据的西方物体偏差与标签偏差会不会替代真实落地。Coecke(2010)的复核指出:当视觉标签与文化用途冲突时,方向反过来:加入图像会恶化语义。从多模态落议题的材料看,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
本项证据在2025年的实践验收应同时公开多模态任务增益、说明最佳单模态基线误差,并给这组账外材料留下可撤回、可修订的记录。一旦把这些漏记对象重新计入,这一制度安排原来的平均值、类别边界和责任归属都可能同时改变。该研究线索真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
在该转向中,两边共享“更多模态数据必然减少意义偏差”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把多模态落议题放到另见第 534 号第 6 条『视觉问答:图像被要求支持一个可评分答案』旁核验:先对齐对象、时间窗和责任人,再检查多模态落议题的核心判断在另一套分母中是否仍同向。
第二幕借助NLI、BERT、IMPPRES、PUB和多模态对话,把意义模型放到数据伪影、替代集合、文化常规与事实证据链中检验。从自然语言推理成为语义基准、标注伪影清算、语境化词义表示等12条可见,这一幕不以排行榜为终点,而追踪训练外表现、版本差异、制度采用、社区权利与长期维护。
一、自然语言推理成为语义基准Natural Language Inference
复算自然语言议题之前,Bowman(2015)首先定位了自然语言推理成为语义基准的历史卡点。这个问题曾长期被写成技术细节,核心却是语义理解缺少大规模统一任务,不同模型只在小型逻辑例句上比较。按自然语言议题的对象表,在2016—2026阶段,标注者认为“无法判断”却被迫归入三类的句对不再只是边缘案例,而成为判断对象边界是否成立的证据。
对照自然语言议题的主源,Bowman(2015)把前提—假设关系的可计算判别置于解释次序的第一位,并用正确三分类数/全部句对数作为成败读数。本项证据由此把三种标签互斥且穷尽所有语义关系从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
SNLI收集约57万对句子,标签分为蕴含、中立和矛盾3类。只有把正确三分类数和全部句对数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。对自然语言推理成为语义基准而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。在自然语言议题的实施账本里,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。从自然语言议题的材料看,该研究线索另固定2项结构读数、3类材料与4次版本复核。
这里尚未收敛的部分是三分类是否把丰富推断压成过窄任务。Gururangan(2018)把边界写成:该反向情形。核查自然语言议题时,其时,该复核口径不再支持原方向;提出路线自己还承认“数据集自身存在显著词汇偏差,模型无需读前提也能猜标签”。反号因此必须进入主分析。与其继续扩大该转向的总体样本,不如先检验三种标签互斥且穷尽所有语义关系是否在不同装置和人群中仍然成立。
在方法之外,NLI应报告理由类型、跨域与人类分歧,而非只报总准确率。在自然语言议题这条证据链上,Murthy(2024)表明,本项证据落地后不能只问“能否使用”。对自然语言议题做反向检验,对话系统、语义标注、自然语言推理与多模态交互还要记录上述分子—分母、版本号、人工修订与该未登记群体。
把自然语言议题放回原窗口,围绕该研究线索,双方同以“三种标签互斥且穷尽所有语义关系”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。这也意味着,对话系统、语义标注、自然语言推理与多模态交互处理这项命题时不能只保存成功案例,还要保留排除理由、版本与反号结果。
二、标注伪影清算Annotation Artifacts
按标注伪影议题的对象表,Gururangan(2018)使标注伪影清算原有分类失去不证自明的地位。在这一转向出现以前,高测试准确率被直接解释为模型理解了前提与假设的关系。对照标注伪影议题的主源,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。在标注伪影议题的实施账本里,这一步先限定可比较对象,不把缺失值折成零效应。
从标注伪影议题的材料看,本条不是说假设句表面线索对标签的泄漏“也很重要”,而是要求先结算这一项。核查标注伪影议题时,标注伪影清算的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对标注伪影议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
仅看假设句即可达到约67%的SNLI准确率、约53%的MultiNLI准确率,显示标注伪影足以制造高分。该研究线索由此把通过形式审查的数据集就不存在实质泄漏从背景假定移到检验台上,使支持者与反对者必须使用同一分母。对该研究线索而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
反对意见主要来自伪影是众包制度问题还是语言本身的合理线索。在标注伪影议题这条证据链上,争议的可检验部分由McCoy(2019)给出:该反向情形。对标注伪影议题做反向检验,此时须重新计算该复核口径。把标注伪影议题放回原窗口,支持方同时记录“基准论文承认人类写题方式制造捷径,却仍把原测试集当长期标准”,说明对象会被样本和制度回写。
这项转向对实践的连带影响是数据建设需保留写作过程、标注者与重采样版本。上述机制进入对话系统、语义标注、自然语言推理与多模态交互后,工作流须先保存该未登记群体,再进行压缩、排名或展示。就标注伪影议题的外推边界看,Bender(2020)提醒,总分不能替代上述分子—分母。围绕标注伪影议题,本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
沿标注伪影议题的责任链,本面板测这一比率,对方检验“通过形式审查的数据集就不存在实质泄漏”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把标注伪影议题放到另见第 538 号第 2 条『对抗样本:高测试准确率不再等于邻域内可靠』旁核验:先对齐对象、时间窗和责任人,再检查标注伪影议题的核心判断在另一套分母中是否仍同向。
三、语境化词义表示Contextual Semantics
对照语境化词议题的主源,语境化词义表示在2019年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:传统分布语义给每个词一个固定向量,多义词靠平均邻域表示。在语境化词议题的实施账本里,分词器切碎、无法形成稳定词向量的新词一旦被删去,分类稳定性便无法与记录偏差分开。从语境化词议题的材料看,这一步先限定可比较对象,不把缺失值折成零效应。
核查语境化词议题时,Devlin(2019)把同一词在不同句中的动态向量置于解释次序的第一位,并用语境化模型增益/静态向量基线误差作为成败读数。在语境化词议题这条证据链上,本项证据最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。
BERT基础版与大型版约含1.10亿和3.40亿参数,预训练语料约33亿词,掩码比例为15%。对语境化词议题做反向检验,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。与其继续扩大语境化词义表示的总体样本,不如先检验有限训练语境足以控制开放词义空间是否在不同装置和人群中仍然成立。一旦把这组账外材料重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。
边界并不隐蔽:上下文向量是否只编码局部搭配而非可解释词义。把语境化词议题放回原窗口,该转向的失效条件是:该反向情形。就语境化词议题的外推边界看,McCoy(2019)与提出方的自我限制“模型能在基准上消歧,却难给出稳定可复核的词义边界”共同表明,方向反转不能只留在讨论末段。对上述机制而言,这一步把该未登记群体从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
由此还产生了一条实践后果:研究应保存层、分词和版本,并用跨语境外推测试。围绕语境化词议题,在对话系统、语义标注、自然语言推理与多模态交互中,应把这些漏记对象设为固定字段,并按上述分子—分母发布分层结果。沿语境化词议题的责任链,Degen(2023)进一步要求把这一制度安排的版本、人工修订与该未登记群体的失败记录连成可追踪链。
复算语境化词议题之前,两边共享“有限训练语境足以控制开放词义空间”,但本条把上述首因置于决定位置。按语境化词议题的对象表,只有把这一比率换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。
四、IMPPRES语义—语用切片IMPPRES
在IMPP议题的实施账本里,相关研究(2020)把IMPPRES语义—语用切片改写成一个分母问题。此前,NLI总分常把逻辑蕴含、前提、常规含意与标量含意混在一起。从IMPP议题的材料看,只有让模板生成器无法覆盖的真实话语修复获得可比较位置,旧边界才可能接受反例检验。核查IMPP议题时,一旦把该未登记群体重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。
在IMPP议题这条证据链上,本条不是说前提与含意的分现象诊断“也很重要”,而是要求先结算这一项。对IMPP议题做反向检验,IMPPRES语义—语用切片真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。
IMPPRES约含2.5万项受控测试,分别切片前提、标量含意、反事实与常规含意。把IMPP议题放回原窗口,其使IMPPRES语义—语用切片从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。就IMPP议题的外推边界看,该研究线索形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。围绕IMPP议题,该研究线索另固定2项结构读数、3类材料与4次版本复核。
争议集中在人工模板与自然对话之间的外推差距。沿IMPP议题的责任链,Warstadt(2020)的复核指出:该反向情形。复算IMPP议题之前,此时该复核口径失去原有解释力;而“模型在同一触发词不同结构中表现不一致,说明知识未形成稳定规则”又显示,稳定对象也可能由工具制造。只要该转向仍把这组账外材料在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
另一处常被略过的是,评测应保留现象切片和多次采样,避免一个平均分遮蔽相反方向。本项证据在2023年的实践验收应同时公开每种语用现象正确数、说明该现象全部项目,并给该未登记群体留下可撤回、可修订的记录。这一制度安排由此把局部现象得分可以加总为整体语言理解从背景假定移到检验台上,使支持者与反对者必须使用同一分母。IMPP议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
与其继续扩大该转向的总体样本,不如先检验局部现象得分可以加总为整体语言理解是否在不同装置和人群中仍然成立。把IMPP议题放到另见第 519 号第 19 条『症状理解:没有诊断也可能需要身体重新整合』旁核验:先对齐对象、时间窗和责任人,再检查IMPP议题的核心判断在另一套分母中是否仍同向。
五、PUB语用理解基准Pragmatics Understanding Benchmark
从PUB语议题的材料看,Murthy(2024)首先定位了PUB语用理解基准的历史卡点。这个问题曾长期被写成技术细节,核心却是大模型“懂语用”多凭少数演示和主观对话印象,缺少统一分母。核查PUB语议题时,在2016—2026阶段,模型拒答、多个合理选项与文化依赖答案不再只是边缘案例,而成为判断对象边界是否成立的证据。在PUB语议题这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。
对PUB语议题做反向检验,Murthy(2024)把四类语用现象的分项能力置于解释次序的第一位,并用模型正确项数/PUB全部测试项作为成败读数。把PUB语议题放回原窗口,边界是:当答案选项暴露类型线索时,方向反过来:较弱模型也可猜中;一旦PUB语用理解基准触发这一条件,就不能再用其他修饰条件保护中心主张。就PUB语议题的外推边界看,一旦把这些漏记对象重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。
PUB包含14项任务、约2.8万测试点,其中约6100项为新建,覆盖4类主要语用现象。只有把模型正确项数和PUB全部测试项同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。PUB语用理解基准的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。该研究线索由此把一个基准总分足以代表多层语用能力从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
这里尚未收敛的部分是多选题格式会不会高估真实对话能力。围绕PUB语议题,相关争议(2025)把边界写成:该反向情形。这时,这一比率不再支持原方向;提出路线自己还承认“PUB自己显示无单一模型全面领先,公开叙事仍容易寻找「总冠军」”。反号因此必须进入主分析。该转向真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。
沿PUB语议题的责任链,Degen(2023)表明,本项证据落地后不能只问“能否使用”。对话系统、语义标注、自然语言推理与多模态交互还要记录这一比率、版本号、人工修订与该未登记群体。对这一制度安排而言,这一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
围绕这项命题,双方同以“一个基准总分足以代表多层语用能力”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。复算PUB语议题之前,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
六、大模型的方式含意Manner Implicatures in LLMs
核查大模型的议题时,相关研究(2024)使大模型的方式含意原有分类失去不证自明的地位。在这一转向出现以前,模型流畅输出被当作掌握“为什么这样说而不那样说”的方式原则。旧框架若继续排除研究者判为“显然不自然”而不提供社群背景的表达,看似整齐的规律就可能只是删选结果。在大模型的议题这条证据链上,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。对大模型的议题做反向检验,这一步先限定可比较对象,不把缺失值折成零效应。
把大模型的议题放回原窗口,本条不是说表达形式差异触发的额外推断“也很重要”,而是要求先结算这一项。与其继续扩大大模型的方式含意的总体样本,不如先检验表达形式与交际意图的因果方向已给定是否在不同装置和人群中仍然成立。对大模型的议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
关键证据来自2024年研究用迂回、异常详细与不自然表达构造对照,比较多模型对隐含原因的选择;现有大模型的方式含意文献缺少单一可移植效应量,因此把正确方式含意数和全部形式对照项分别作为2项结构读数,并在中心与尾部材料中重算。
反对意见主要来自训练语料记忆与真正替代项推理如何区分。就大模型的议题的外推边界看,争议的可检验部分由Murthy(2024)给出:该反向情形。围绕大模型的议题,此时须重新计算该复核口径。沿大模型的议题的责任链,支持方同时记录“模型常给出合理解释却在最小形式变化后翻转,说明解释稳定性不足”,说明对象会被样本和制度回写。
这项转向对实践的连带影响是测试应交换同义形式、人物和场景,防止模型背诵社会脚本。上述机制进入对话系统、语义标注、自然语言推理与多模态交互后,工作流须先保存这些漏记对象达,再进行压缩、排名或展示。复算大模型的议题之前,相关更新(2025)提醒,总分不能替代上述分子—分母。
本面板测这一比率,对方检验“表达形式与交际意图的因果方向已给定”在另一对象上是否反号;这组账外材料达是两边共同漏掉的候选。把大模型的议题放到另见第 141 号第 10 条『新思想 10 · 情境的分类学 —— 人格研究终于开始测量情境这一半』旁核验:先对齐对象、时间窗和责任人,再检查大模型的议题的核心判断在另一套分母中是否仍同向。
七、汉语会话含意的本土基准Chinese Implicature Benchmark
在汉语会话议题这条证据链上,汉语会话含意的本土基准在2024年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:英语语用基准被当作普遍能力代理,汉语省略、语气与礼貌常规只做翻译项。对汉语会话议题做反向检验,本地说话者分歧较大而被删除的含意项一旦被删去,分类稳定性便无法与记录偏差分开。把汉语会话议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。
就汉语会话议题的外推边界看,相关研究(2024)把语言特有常规与语境知识置于解释次序的第一位,并用汉语语境正确数/全部汉语会话项作为成败读数。对汉语会话议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
汉语会话含意基准整理约200个受控问题,至少覆盖数量、关系、方式和文化常规4类。围绕汉语会话议题,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。只要汉语会话含意的本土基准仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。沿汉语会话议题的责任链,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。
边界并不隐蔽:题量较小与文化情境标注是否足够。复算汉语会话议题之前,该转向的失效条件是:该反向情形。按汉语会话议题的对象表,Warstadt(2020)与提出方的自我限制“基准承认部分题存在多种礼貌解读,最终评分仍需单一答案”共同表明,方向反转不能只留在讨论末段。一旦把这些漏记对象重新计入,上述机制原来的平均值、类别边界和责任归属都可能同时改变。
由此还产生了一条实践后果:多语语用评测应由本地说话者设计替代项并报告争议答案。在对话系统、语义标注、自然语言推理与多模态交互中,应把这组账外材料设为固定字段,并按上述分子—分母发布分层结果。相关更新(2025)进一步要求把这一制度安排的版本、人工修订与这些漏记对象的失败记录连成可追踪链。
对照汉语会话议题的主源,两边共享“同名语用现象在不同语言文化中是同一对象”,但本条把上述首因置于决定位置。只有把这一比率换到同一分母并计入这组账外材料,才能判断互证、反号或第三项。把汉语会话议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查汉语会话议题的核心判断在另一套分母中是否仍同向。
八、协作型RSACollaborative RSA
对协作型R议题做反向检验,相关研究(2025)把协作型RSA改写成一个分母问题。此前,主流研究常把RSA多假定双方共享目标,复杂团队中的分工与互补信息未进入模型。把协作型R议题放回原窗口,只有让团队中无人自认负责、因而未被表达的信息获得可比较位置,旧边界才可能接受反例检验。就协作型R议题的外推边界看,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
围绕协作型R议题,本条不是说联合任务改变说话成本与信息价值“也很重要”,而是要求先结算这一项。沿协作型R议题的责任链,相关研究(2025)的最小检验是协作任务成功数/全部信息不对称回合;当参与者目标部分冲突时,方向反过来:更多递归会强化错误信任。
在实证层面,2025年协作RSA把多参与者、共同任务和不对称信息写入递归推断,模拟与实验比较在联合选择任务上的成功率;协作型RSA不以“显著”充当读数;依相关研究(2025)的论证,至少应公开协作任务成功数和全部信息不对称回合这2项结构量。这使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。该研究线索由此把同一团队中的主体共享同一合作目标从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
争议集中在递归复杂度与现实团队规模之间是否可扩展。复算协作型R议题之前,Frank(2012)的复核指出:该反向情形。按协作型R议题的对象表,此时该复核口径失去原有解释力;而“模型自己显示共享目标稍有偏差就迅速失灵,合作不是稳态默认”又显示,稳定对象也可能由工具制造。一旦把这组账外材料重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。
另一处常被略过的是,人机协作界面应显示各方掌握的信息和可撤回假设。本项证据在2023年的实践验收应同时公开协作任务成功数、说明全部信息不对称回合,并给该未登记群体留下可撤回、可修订的记录。只要这一制度安排仍把这组账外材料在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
在这项命题中,两边共享“同一团队中的主体共享同一合作目标”,却把决定位置放在不同项上;一旦该未登记群体入账,原有对象、路径与条件场都要重画。对照协作型R议题的主源,对该转向而言,其一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
九、多方对话的共同地面Dynamic Common Ground
相关研究(2025)首先定位了多方对话的共同地面的历史卡点。这个问题曾长期被写成技术细节,核心却是共同知识常被当作对话开始前固定背景,轮次中的误解与修复只算噪声。把多方对话议题放回原窗口,在2016—2026阶段,只被一名参与者听见或暂未确认的信息不再只是边缘案例,而成为判断对象边界是否成立的证据。就多方对话议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。
围绕多方对话议题,相关研究(2025)把逐轮确认与修复的状态更新置于解释次序的第一位,并用成功引用已确认信息次数/全部回指次数作为成败读数。沿多方对话议题的责任链,本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
多方对话语料以确认、澄清和回指链标注状态变化,比较每轮任务成功与修复次数;相关研究(2025)主要给出理论或方法论论证;可证伪入口是成功引用已确认信息次数与全部回指次数两项结构量,而不是一项并不存在的总体效应。只有把成功引用已确认信息次数和全部回指次数同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。多方对话的共同地面另固定2项结构读数、3类材料与4次版本复核。
这里尚未收敛的部分是“共同地面”能否由系统摘要替代参与者各自记忆。复算多方对话议题之前,相关争议(2025)把边界写成:该反向情形。按多方对话议题的对象表,其时,该复核口径不再支持原方向;提出路线自己还承认“模型承认参与者视角并不一致,却常用一个共享状态表示所有人”。反号因此必须进入主分析。
在方法之外,对话代理应保存谁在何时确认了什么,而非维护单一全局摘要。对照多方对话议题的主源,相关更新(2025)表明,上述机制落地后不能只问“能否使用”。对话系统、语义标注、自然语言推理与多模态交互还要记录上述分子—分母、版本号、人工修订与这些漏记对象。与其继续扩大本项证据的总体样本,不如先检验未被记录的信息不会影响后续共同结论是否在不同装置和人群中仍然成立。
在多方对话议题的实施账本里,围绕该研究线索,双方同以“未被记录的信息不会影响后续共同结论”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。把多方对话议题放到另见第 516 号第 5 条『医疗中的证言不正义:患者说了也未必被当作知识』旁核验:先对齐对象、时间窗和责任人,再检查多方对话议题的核心判断在另一套分母中是否仍同向。
十、指示与视觉落地Deixis and Visual Grounding
就指示视觉落地的外推边界看,相关研究(2025)使指示与视觉落地原有分类失去不证自明的地位。在这一转向出现以前,指示词被当作可由句内文本解决的普通指代,身体朝向和视野差异被忽略。围绕指示视觉落地,旧框架若继续排除在画面外但被参与者知道的对象,看似整齐的规律就可能只是删选结果。沿指示视觉落地的责任链,这一步先限定可比较对象,不把缺失值折成零效应。
复算指示视觉落地之前,本条不是说说话现场对“这里、那个、现在”的绑定“也很重要”,而是要求先结算这一项。对指示视觉落地而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
关键证据来自2025年前后的多模态互动研究用视频、视线和场景对象评测模型,比较只看文本与同时看现场的指称成功率;2025年的证据没有统一冠军数字;对指示与视觉落地更合适的做法是同时报告正确绑定指示对象数、全部指示表达这2项结构量及其反例变化。按指示视觉落地的对象表,该研究线索由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。
反对意见主要来自摄像机视角是否代表参与者真实视野。对照指示视觉落地的主源,争议的可检验部分由Bruni(2014)给出:该反向情形。在指示视觉落地的实施账本里,此时须重新计算该复核口径。从指示视觉落地的材料看,支持方同时记录“模型会利用画面中心偏差,中心物体不等于被指对象”,说明对象会被样本和制度回写。核查指示视觉落地时,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
这项转向对实践的连带影响是多模态系统应记录视角、可见性与对象版本,而非只存图片。本项证据进入对话系统、语义标注、自然语言推理与多模态交互后,工作流须先保存该未登记群体,再进行压缩、排名或展示。在指示视觉落地这条证据链上,相关更新(2025)提醒,总分不能替代上述分子—分母。指示视觉落地的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。
对指示视觉落地做反向检验,本面板测这一比率,对方检验“摄像机记录的视野等于参与者可见世界”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。
十一、社会意义进入语义模型Social Meaning in Semantics
围绕社会意义议题,社会意义进入语义模型在2023年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。该转向面对的旧难题是:词义模型把社会变量当外部元数据,默认同一词在所有群体中共享核心解释。沿社会意义议题的责任链,拒绝自我归类或跨多群体的说话者一旦被删去,分类稳定性便无法与记录偏差分开。
复算社会意义议题之前,Degen(2023)把身份、立场与社群历史塑造解释置于解释次序的第一位,并用群体内解释一致数/该词全部群体判断作为成败读数。本项证据由此把身份标签一旦划定就保持稳定从背景假定移到检验台上,使支持者与反对者必须使用同一分母。
2016年以来社会语义研究用社交媒体、访谈和感知实验比较身份词、风格词与再占用词,向量邻域和人类评分随社群、年份显著变化。按社会意义议题的对象表,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。对照社会意义议题的主源,为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。
边界并不隐蔽:平台用户与现实社群是否等同,标签是否固化身份。在社会意义议题的实施账本里,该转向的失效条件是:该反向情形。相关争议(2025)与提出方的自我限制“社会语义承认身份标签会回写使用,却常把标签当固定自变量”共同表明,方向反转不能只留在讨论末段。与其继续扩大上述机制的总体样本,不如先检验身份标签一旦划定就保持稳定是否在不同装置和人群中仍然成立。
由此还产生了一条实践后果:模型应报告群体来源、时间和再占用情境,并允许多重解释。从社会意义议题的材料看,在对话系统、语义标注、自然语言推理与多模态交互中,应把这些漏记对象设为固定字段,并按上述分子—分母发布分层结果。相关更新(2025)进一步要求把这一制度安排的版本、人工修订与该未登记群体的失败记录连成可追踪链。
核查社会意义议题时,两边共享“身份标签一旦划定就保持稳定”,但本条把上述首因置于决定位置。在社会意义议题这条证据链上,只有把这一比率换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把社会意义议题放到另见第 179 号第 5 条『夜间城市:治理对象不是噪声,而是不同群体的时间权利』旁核验:先对齐对象、时间窗和责任人,再检查社会意义议题的核心判断在另一套分母中是否仍同向。
十二、形式、意义与世界知识分离Form–Meaning–World Separation
沿形式意义世界知识的责任链,Bender(2020)把形式、意义与世界知识分离改写成一个分母问题。此前,主流研究常把大模型生成连贯文本被等同于理解意义并掌握世界真值。复算形式意义世界知识之前,只有让无法找到外部证据却被评分为“合理”的断言获得可比较位置,旧边界才可能接受反例检验。按形式意义世界知识的对象表,该转向最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。对照形式意义世界知识的主源,这一步先限定可比较对象,不把缺失值折成零效应。
在形式意义世界知识的实施账本里,本条不是说可验证指称而非流畅续写“也很重要”,而是要求先结算这一项。对形式意义世界知识而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。
形式—意义—世界知识的分离至少需要3组测试:形式变而事实不变、事实变而形式近似、世界知识缺失但句法完整。该研究线索由此把有文本记录就等于可以核对真实指称从背景假定移到检验台上,使支持者与反对者必须使用同一分母。从形式意义世界知识的材料看,该研究线索另固定2项结构读数、3类材料与4次版本复核。
核查形式意义世界知识时,Degen(2023)的复核指出:该反向情形。在形式意义世界知识这条证据链上,此时该复核口径失去原有解释力;而“模型会在置信语气不变时从真转假,流畅度不携带真实性”又显示,稳定对象也可能由工具制造。对形式意义世界知识做反向检验,对该转向而言,其一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。
另一处常被略过的是,系统评估应把语言合式、任务意义与事实证据分成三栏。本项证据在2025年的实践验收应同时公开有可核对证据的断言数、说明全部事实断言数,并给该未登记群体留下可撤回、可修订的记录。把形式意义世界知识放回原窗口,其一制度安排形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。
就形式意义世界知识的外推边界看,在这项命题中,两边共享“有文本记录就等于可以核对真实指称”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把形式意义世界知识放到另见第 511 号第 18 条『形式与意义分离:掌握字符串规律不等于理解世界』旁核验:先对齐对象、时间窗和责任人,再检查形式意义世界知识的核心判断在另一套分母中是否仍同向。
◎ 二十年连起来看
第一条线索是含意、前提和投射从逻辑标签变成有时长、有选择概率、有来源归属的过程。
第二条线索是意义表示从固定词典走向分布、组合和多模态落地,但语料与图像的缺口随之进入词义。
第三条线索是大规模基准把语用能力拆成切片,同时暴露出标注制度、文化常规与事实证据链是无法外置的条件。
◎ 三个常见误解
误解一是“语义负责字面,语用负责附加”。前提、投射、表达性和共同地面显示,两者在组合每一步都互相回写。
误解二是“向量相似就是词义”。分布语义给出有用读数,却不能把未出现的意义、社会再占用与实际指称自动恢复。
误解三是“大模型会聊天就懂语用”。PUB、IMPPRES与方式含意测试显示,成功高度依赖任务、选项和替代集合。
◎ 与相邻领域的接口
第461号音系学与形态学:形式概率如何承载词义与社会索引。分工判据是:本块以反应时、选择概率、最小对立、NLI数据集与视觉指称任务回答指称、含意、投射、语境与社会意义的内部机制;对方只能在自己的对象与分母上验证同名结构。
第462号句法学:结构次序与局部语境的分工。接口成立的最低条件,是两块分别公开样本进入规则、失败样本和量纲换算;术语相同不能代替反应时、选择概率、最小对立、NLI数据集与视觉指称任务的证据。
第464号心理语言学:含意、前提与预测的在线时间过程。两块的分工线在于:本面板追踪指称、含意、投射、语境与社会意义,对方追踪另一条路径或条件场;只有方向和分母都可比较时才构成互证。
第465号语料库与量化语言学:词义向量、标注伪影与时间漂移。若双方的排除规则、版本或授权不同,就必须分别命名结论,并把差异写进对话系统、语义标注、自然语言推理与多模态交互的验收表。
◎ 争议现场
标量含意的延迟究竟是推理成本还是任务冲突;收敛需同材料跨真值判断、眼动与自然对话。收敛设计须在反应时、选择概率、最小对立、NLI数据集与视觉指称任务中使用同一材料、同一排除规则和预注册主量纲,并把反号结果列入主分析。
RSA参数是否具有心理稳定性;收敛需跨任务预注册先验与表达成本。在对话系统、语义标注、自然语言推理与多模态交互场景中,双方应共同提交数据、代码与盲评方案,预先说明零效应、方向反转和退出样本怎样解释。
大模型语用成功来自推理还是提示与数据捷径;收敛需最小替代项、跨文化与反事实测试。只有跨实验室或跨机构在独立材料上重现效应量及其边界,并公开指称、含意、投射、语境与社会意义的尾部误差,这场争论才算推进。
◎ 往下五年看什么
PUB是否扩展到更多语言、真实对话和开放答案,并报告拒答与多解比例。验收读数:新增语言数、开放答案准确率、拒答率和多解比例。
协作RSA能否在三人以上、目标部分冲突的任务中维持预测。验收读数:三人以上冲突任务的样本外预测、修复轮数与角色转换错误。
指示落地是否加入真实视角遮挡而非摄像机中心图像。验收读数:真实遮挡下的视角错配率、指示修复率和共同地面更新时延。
事实性评估能否把每个断言的证据链与版本变化同步保存。验收读数:每个断言的证据可定位率、版本漂移与无证据流畅回答比例。
◎ 可与哪些领域对撞
本块第三条“前提触发的局部语境”与第466号第十八条“不确定性进入数字校本”构成一对。它们共享的预设是“局部更新能够无损恢复唯一承诺”。相反点在于:前提局部语境压缩可接受条件,数字校本则保留多个互斥读法。若两边都成立,就必须把说话者承诺与编辑选择的分离作为第三项纳入,并同时报告“被局部满足的前提数/全部触发前提数”与“保留可追溯候选数/全部曾提出读法数”。
本块第十六条“协作型RSA”与第467号第五条“合奏同步中的领导与适应”构成一对。它们共享的预设是“参与者共享同一目标即可形成共同模型”。相反点在于:协作RSA以共同目标推断含意,合奏同步却允许领导转换和审美异步。若两边都成立,就必须把目标冲突与角色轮换作为第三项纳入,并同时报告“协作任务成功数/全部信息不对称回合”与“被下一位成员修正的时差/全部起音时差”。
本块第十条“标注伪影清算”与第306号第八条“TRIPOD”构成一对。它们共享的预设是“通过形式化测试就等于获得实质能力”。相反点在于:标注伪影可让模型在NLI上高分却不理解,TRIPOD也表明清单完整仍不等于可复现。若两边都成立,就必须把测试数据生成链与未报告版本作为第三项纳入,并同时报告“仅看假设的准确率/完整输入准确率”与“已报告清单项目数/TRIPOD全部22项”。
本块第二十条“形式、意义与世界知识分离”与第306号第十三条“Estimand框架”构成一对。它们共享的预设是“问题一经形式定义就能由一个读数完整回答”。相反点在于:形式—意义—世界知识分离要求区分三类关系,estimand框架也必须把五个属性分别规定。若两边都成立,就必须把问题定义与可识别性之间的缺口作为第三项纳入,并同时报告“有可核对证据的断言数/全部事实断言数”与“被明确规定的estimand属性数/五个必要属性”。
◎ 十条可做的研究命题
1. 同一标量含意在三种任务中测时长与选择,若方向一致则否证任务冲突解释。
2. 跨五种对话任务固定RSA参数,若无需重估仍拟合则否证参数漂移。
3. 将NLI假设句单独分类,若准确率降到随机则否证标注伪影。
4. PUB加入开放回答,若模型排名不变则否证选项泄漏。
5. 用本地设计的汉语、阿拉伯语、约鲁巴语含意集,若英语排名稳定则否证文化依赖。
6. 对BERT词义向量做年份外推,若新义无下降则否证语境覆盖限制。
7. 记录多方对话每个主体的私有状态,若单一摘要同样准确则否证分布式共同地面。
8. 交换摄像机与说话者视角,若指示正确率不降则否证视角条件。
9. 把可核对证据强制附在事实断言后,若幻觉率不降则否证证据链作用。
10. 对再占用词按群体与年份分层,若态度不变则否证社会意义漂移。
◎ 资料核验
碰撞供料矩阵:以下六族均覆盖S、D、E三个位置;第19、20条为位置余量。02 单一读数代表复杂对象 —— S 甲、标量含意成为可计时过程/D 乙、理性言语行为模型/E 丙、前提触发的局部语境;15 同名即同物 —— S 丁、投射内容的跨构式分类/D 戊、表达性意义独立成层/E 己、分布语义的统一记忆;26 顺序无关 —— S 庚、组合分布语义/D 辛、多模态落地语义/E 一、自然语言推理成为语义基准;23 中位个案代表分布 —— S 二、标注伪影清算/D 三、语境化词义表示/E 四、IMPPRES语义—语用切片;22 通过形式审查=实质合规 —— S 五、PUB语用理解基准/D 六、大模型的方式含意/E 七、汉语会话含意的本土基准;14 因与果的方向是给定的 —— S 八、协作型RSA/D 九、多方对话的共同地面/E 十、指示与视觉落地。
- Noveck, I. A. & Reboul, A. (2008). Experimental Pragmatics: A Gricean Turn in the Study of Language. Trends in Cognitive Sciences, 12(11), 425–431.
- Geurts, B. (2010). Quantity Implicatures. Cambridge University Press.
- Frank, M. C. & Goodman, N. D. (2012). Predicting Pragmatic Reasoning in Language Games. Science, 336(6084), 998.
- Goodman, N. D. & Stuhlmüller, A. (2013). Knowledge and Implicature: Modeling Language Understanding as Social Cognition. Topics in Cognitive Science, 5, 173–184.
- Schlenker, P. (2009). Local Contexts. Semantics and Pragmatics, 2(3), 1–78.
- Tonhauser, J., Beaver, D., Roberts, C. & Simons, M. (2013). Toward a Taxonomy of Projective Content. Language, 89(1), 66–109.
- Potts, C. (2007). The Expressive Dimension. Theoretical Linguistics, 33(2), 165–198.
- McCready, E. (2010). Varieties of Conventional Implicature. Semantics and Pragmatics, 3(8), 1–57.
- Baroni, M. & Lenci, A. (2010). Distributional Memory: A General Framework for Corpus-based Semantics. Computational Linguistics, 36(4), 673–721.
- Coecke, B., Sadrzadeh, M. & Clark, S. (2010). Mathematical Foundations for a Compositional Distributional Model of Meaning. Linguistic Analysis, 36, 345–384.
- Bruni, E., Tran, N.-K. & Baroni, M. (2014). Multimodal Distributional Semantics. Journal of Artificial Intelligence Research, 49, 1–47.
- Bowman, S. R. et al. (2015). A Large Annotated Corpus for Learning Natural Language Inference. EMNLP 2015, 632–642.
- Gururangan, S. et al. (2018). Annotation Artifacts in Natural Language Inference Data. NAACL 2018, 107–112.
- McCoy, R. T., Pavlick, E. & Linzen, T. (2019). Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference. ACL 2019, 3428–3448.
- Devlin, J., Chang, M.-W., Lee, K. & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL 2019, 4171–4186.
- Jeretič, P., Warstadt, A., Bhooshan, S. & Williams, A. (2020). Are Natural Language Inference Models IMPPRESsive? ACL 2020, 8690–8705.
- Warstadt, A. et al. (2020). Learning Which Features Matter: RoBERTa Acquires a Preference for Linguistic Generalizations. EMNLP/ACL studies, 2020.
- Murthy, R. et al. (2024). PUB: A Pragmatics Understanding Benchmark for Large Language Models. Findings of ACL 2024, paper 719.
- Large Language Models and Manner Implicatures. Peer-reviewed/ACL study, 2024.
- Chinese Conversational Implicature Benchmark: 200 Carefully Controlled Questions. 2024 research report/proceedings.
- Collaborative Rational Speech Acts: Pragmatic Reasoning under Joint Goals. ACL/Computational Linguistics study, 2025.
- Pragmatics in the Era of Large Language Models: A Survey. 2025 survey article.
- Grounding Language in Multi-party Visual Interaction. Nature Human Behaviour / multimodal communication study, 2025.
- Degen, J. (2023). The Rational Speech Act Framework. Annual Review of Linguistics, 9, 519–540.
- Bender, E. M. & Koller, A. (2020). Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data. ACL 2020, 5185–5198.