SDE Universes·新思想前沿语言、文学与艺术的其余
新思想前沿 · 语言、文学与艺术的其余

心理语言学

近二十年 · 两幕 · 20 个新思想 · 约 23,891 字 · 王德生 亲撰 · 2026 年 8 月

心理语言学的二十年变化,可以概括为三次“拆平均”:把最终答案拆成逐词和逐毫秒过程,把平均听者拆成经验、年龄、听力与语言背景的分布,再把模型—脑相似拆成输出相关、内部轨迹和因果机制。惊异度、分层预测、善意理解、双流加工和具身语义重画了理解路径;词汇巨型实验、双语优势争论、跨文化轮替和统计学习可靠性则让材料、实验室与个体差异进入主结论。2016年以后,N400大规模复现、自然故事脑图、跨主体解码、脑—模型对齐、多语言眼动、听觉努力与ManyBabies合作,把预注册、开放数据和跨实验室异质性变成理论的一部分。本面板据此拒绝用“显著”“更类人”或“更大模型”代替时间窗、样本分母、资源预算和反号条件。全文以20个转向而非年代事件串联语言的时间加工、脑机制、身体条件与互动轮替,每条分别交代旧卡点、单因命题、关键读数、争议边界、实践后果和跨面板接口。正文同时保留提出、争议、最新三笔来源与八字段供料层,使读者能区分:结论来自对象本身,还是来自阅读时、N400、眼动、脑成像、皮层记录与多实验室复制、样本分母、版本与制度选择。最终标准不是“读起来像综述”,而是20条均能被反查、被证伪、被换算。

【第一幕】上一个十年 · 约 2006—2016

第一幕把理解改写为逐词概率更新、善意解析、双流加工、具身效应和跨文化轮替,并以巨型实验与复制争议拆开平均效应。从惊异度进入逐词加工、预测不再等于猜下一个词、善意理解与残留误读等8条可见,这一幕的共同判据是:旧分类遇到边缘材料时,必须用分层读数而不是“例外”收口,并公开谁被排除。

甲、惊异度进入逐词加工Surprisal in Incremental Processing

提出Levy, R. (2008). Expectation-based syntactic comprehension. Cognition, 106(3), 1126–1177. 争议Kuperberg, G. R. & Jaeger, T. F. (2016). What do we mean by prediction in language comprehension? Language, Cognition and Neuroscience, 31(1), 32–59. 最新Word predictability estimates from language models are not robust. CoNLL 2026, ACL Anthology. 关键词到来前的条件概率

从惊异度议题的材料看,Levy(2008)使惊异度进入逐词加工原有分类失去不证自明的地位。在2006—2016年,该转向面对的旧卡点是:阅读困难主要由词频与句法节点分开解释,语境概率没有统一尺度。核查惊异度议题时,旧框架若继续排除读者熟悉而公共语料极少的专业词和社群词,看似整齐的规律就可能只是删选结果。在惊异度议题这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。

对惊异度议题做反向检验,惊异度进入逐词加工在Levy(2008)的材料中只承认词到来前的条件概率具有决定性。把惊异度议题放回原窗口,任一不成立都要求改写本项证据的解释。对惊异度议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

Levy式分析把逐词惊异度与数千词位的阅读时长对齐,统一读数是每词比特信息与毫秒增量。就惊异度议题的外推边界看,其使惊异度进入逐词加工从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。围绕惊异度议题,只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。沿惊异度议题的责任链,该研究线索另固定2项结构读数、3类材料与4次版本复核。

争议集中在公共语料模型的概率能否代表具体读者经验,以及概率与整合负荷是否被混在一起。争议的可检验部分由Kuperberg(2016)给出:当语境强烈预激活低频专业词时,方向会反过来,低频项可比高频项更快。复算惊异度议题之前,此时须重新计算该复核口径。

另一处常被略过的是,阅读研究应同时保存词频、个体熟悉度、语境概率和回视路径,教育文本也应。上述机制在2026年的实践验收应同时公开惊异度解释的阅读时长变异、说明全部可解释时长变异,并给该未登记群体留下可撤回、可修订的记录。本项证据最怕一个总分,因为中心样本改善时,这组账外材料可能正以更快速度退出可见范围。

按惊异度议题的对象表,在该研究线索中,两边共享“单一读数代表复杂对象”,却把决定位置放在不同项上;一旦该未登记群体入账,原有对象、路径与条件场都要重画。把惊异度议题放到另见第 511 号第 4 条『认识情态词:谁在评估,决定“可能”是否仍成立』旁核验:先对齐对象、时间窗和责任人,再检查惊异度议题的核心判断在另一套分母中是否仍同向。

位置E|惊异度议题作环境条件 单因惊异度议题的核心决定项 预设〔01 谁进入分母〕惊异度议题沿用既定对象边界 量纲惊异度议题同向记录数/全部可核对记录数 失效漏掉读者熟悉时,惊异度议题读数越高,真实覆盖反而越低 自曝惊异度议题(第1条):原材料未覆盖者需另表 空栏读者熟悉 异名另见第 511 号第 4 条『认识情态词:谁在评估,决定“可能”是否仍成立』

乙、预测不再等于猜下一个词Layered Prediction

提出Kuperberg, G. R. & Jaeger, T. F. (2016). What do we mean by prediction in language comprehension? Language, Cognition and Neuroscience, 31(1), 32–59. 争议Huettig, F. & Mani, N. (2016). Is prediction necessary to understand language? Trends in Cognitive Sciences, 20(7), 459–461. 最新Nieuwland, M. S. et al. (2018). Large-scale replication study reveals a limit on probabilistic prediction in language comprehension. eLife, 7, e33468. 关键多层表征的概率预激活

核查预测不再议题时,预测不再等于猜下一个词在2016年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。在预测不再议题这条证据链上,该转向出现以前,研究者多把“预测加工常被简化为提前猜中具体词,猜错就被视为没有预测”当作无需再问的背景。对预测不再议题做反向检验,没有具体词预测但已经形成事件结构预期的试次一旦被删去,分类稳定性便无法与记录偏差分开。把预测不再议题放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。

就预测不再议题的外推边界看,预测不再等于猜下一个词的单因命题锁定多层表征的概率预激活。围绕预测不再议题,与其继续扩大本项证据的总体样本,不如先检验单一读数代表复杂对象是否在不同装置和人群中仍然成立。对预测不再议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

Kuperberg与Jaeger 2016区分词形、语义、句法和事件层预测,汇总脑电、眼动与行为证据;预测不再等于猜下一个词目前缺少可跨研究直接合并的效应量;固定词前预激活效应和词后整合效应这2项结构量后,后续结果才可比较。只有把词前预激活效应和词后整合效应同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。

该转向的争论并不在于有没有阳性案例,而在于词前预激活与词后更新的时间边界仍可被分析窗口重新解释。上述机制的失效条件是:当输入可靠度很低时,强预测会放大误导,弱预测反而提高最终理解。沿预测不再议题的责任链,Huettig(2016)与提出方的自我限制“理论自己承认不同层级可在事后被重新命名,时间窗选择会改变结论”共同表明,方向反转不能只留在讨论末段。

这项转向的连带结果是实验需交叉操纵多个层级,并预注册词前、词中和词后窗口,不用单一ERP峰值代表全部预测。复算预测不再议题之前,Nieuwland(2018)表明,这一制度安排落地后不能只问“能否使用”。按预测不再议题的对象表,眼动与脑电实验、听力评估、语言教育和人机交互还要记录这一比率、版本号、人工修订与这些漏记对象。

对照预测不再议题的主源,围绕这项命题,双方同以“单一读数代表复杂对象”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。在预测不再议题的实施账本里,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。

位置S|预测不再议题作结果量 单因预测不再议题的核心决定项 预设〔01 谁进入分母〕预测不再议题沿用既定对象边界 量纲预测不再议题同向记录数/全部可核对记录数 失效漏掉没有具体词预测但已经形成事件时,预测不再议题读数越高,真实覆盖反而越低 自曝预测不再议题(第2条):原材料未覆盖者需另表 空栏没有具体词预测但已经形成事件 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

丙、善意理解与残留误读Good-enough Comprehension

提出Ferreira, F. & Patson, N. D. (2007). The good enough approach to language comprehension. Language and Linguistics Compass, 1, 71–83. 争议Slattery, T. J. et al. (2013). Lingering misinterpretation in native and nonnative sentence processing. Journal of Memory and Language, 69, 104–120. 最新Karimi, H. & Ferreira, F. (2024). Good-enough language processing: current evidence and open questions. Psychonomic Bulletin & Review. 关键快速可用解释优先于完整重分析

在善意理解残留误读这条证据链上,Ferreira(2007)把善意理解与残留误读改写成一个分母问题。这项转向最初针对的是理解被假定最终会形成完整无矛盾的句法—语义表示,暂时误读只是瞬时错误。只有让参与者保留双重解释或犹豫、却被编码成单一错答的试次获得可比较位置,旧边界才可能接受反例检验。对善意理解残留误读做反向检验,这一步先限定可比较对象,不把缺失值折成零效应。

把善意理解残留误读放回原窗口,善意理解与残留误读在Ferreira(2007)的材料中只承认快速可用解释优先于完整重分析具有决定性。就善意理解残留误读的外推边界看,任一不成立都要求改写本项证据的解释。围绕善意理解残留误读,与其继续扩大本项证据的总体样本,不如先检验单一读数代表复杂对象是否在不同装置和人群中仍然成立。

善意理解实验至少比较初始误读、显式纠正和延迟复测3个阶段,残留错误率而非最终正确率是关键。沿善意理解残留误读的责任链,善意理解与残留误读由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索最怕一个总分,因为中心样本改善时,该未登记群体、却被编码成单一错答的试次可能正以更快速度退出可见范围。该研究线索的数值链至少保留2组对照、3项读数和4个复核字段。

反对意见主要指向错误回答究竟来自浅加工、记忆提取还是任务策略。Slattery(2013)的复核指出:当任务要求逐步核验每个角色且允许回看时,完整重分析会压过快速解释。复算善意理解残留误读之前,此时该复核口径失去原有解释力;而“善意理解理论承认「够用」由任务决定,却常把实验任务外推为一般阅读策略”又显示,稳定对象也可能由工具制造。

上述机制还会重排实践的验收顺序:法律、医疗和教育文本应测试读者最后作出的因果推断,而不能只测能否复述原句。本项证据进入眼动与脑电实验、听力评估、语言教育和人机交互后,工作流须先保存该未登记群体、却被编码成单一错答的试次,再进行压缩、排名或展示。按善意理解残留误读的对象表,Karimi(2024)提醒,总分不能替代上述分子—分母。

本面板测这一比率,对方检验“单一读数代表复杂对象”在另一对象上是否反号;这些漏记对象、却被编码成单一错答的试次是两边共同漏掉的候选。把善意理解残留误读放到另见第 511 号第 4 条『认识情态词:谁在评估,决定“可能”是否仍成立』旁核验:先对齐对象、时间窗和责任人,再检查善意理解残留误读的核心判断在另一套分母中是否仍同向。

位置E|善意理解残留误读作环境条件 单因善意理解残留误读的核心决定项 预设〔01 谁进入分母〕善意理解残留误读沿用既定对象边界 量纲善意理解残留误读同向记录数/全部可核对记录数 失效漏掉参与者保留双重解释或犹豫时,善意理解残留误读读数越高,真实覆盖反而越低 自曝善意理解残留误读(第3条):原材料未覆盖者需另表 空栏参与者保留双重解释或犹豫 异名另见第 511 号第 4 条『认识情态词:谁在评估,决定“可能”是否仍成立』

丁、双流语音加工Dual-stream Speech Processing

提出Hickok, G. & Poeppel, D. (2007). The cortical organization of speech processing. Nature Reviews Neuroscience, 8, 393–402. 争议Rauschecker, J. P. & Scott, S. K. (2009). Maps and streams in the auditory cortex. Nature Neuroscience, 12, 718–724. 最新Mapping the neuronal building blocks of human language. Nature, 2026. 关键背侧感觉运动映射与腹侧声音意义映射

对双流语音议题做反向检验,Hickok(2007)首先定位了双流语音加工的历史卡点。长期以来,语音理解常被画成从声音到词义的一条流水线,病灶只。在2006—2016阶段,无法归入单一通路的混合病灶和代偿连接不再只是边缘案例,而成为判断对象边界是否成立的证据。这也意味着,眼动与脑电实验、听力评估、语言教育和人机交互处理该转向时不能只保存成功案例,还要保留排除理由、版本与反号结果。

把双流语音议题放回原窗口,双流语音加工的单因命题锁定背侧感觉运动映射与腹侧声音意义映射。Hickok(2007)要求以背侧任务受损程度/腹侧任务受损程度检验;失效边界是:当语义判断要求精确保持发音时,背侧通路会反过来主导理解任务。只要本项证据仍把这些漏记对象在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

就双流语音议题的外推边界看,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。与其继续扩大双流语音加工的总体样本,不如先检验局部最优可加总为整体最优是否在不同装置和人群中仍然成立。围绕双流语音议题,该研究线索另固定2项结构读数、3类材料与4次版本复核。

尚未收敛的部分是两条通路是否把动态、重叠和个体代偿网络画得过于整齐。Rauschecker(2009)把边界写成:当语义判断要求精确保持发音时,背侧通路会反过来主导理解任务。沿双流语音议题的责任链,其时,这一比率不再支持原方向;提出路线自己还承认“双流模型自己呈现大量通路交叠,示意图边界比实证网络更清楚”。反号因此必须进入主分析。

由此产生的实践后果是:康复评估应分开测复述、理解、语音运动与噪声中听辨,不用一个“语言分”概括损伤。在眼动与脑电实验、听力评估、语言教育和人机交互中,应把该未登记群体设为固定字段,并按该复核口径发布分层结果。复算双流语音议题之前,相关更新(2026)进一步要求把上述机制的版本、人工修订与这组账外材料的失败记录连成可追踪链。

按双流语音议题的对象表,两边共享“局部最优可加总为整体最优”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把双流语音议题放到另见第 253 号第 12 条『行为改变技术的证据清算』旁核验:先对齐对象、时间窗和责任人,再检查双流语音议题的核心判断在另一套分母中是否仍同向。

位置S|双流语音议题作结果量 单因双流语音议题的核心决定项 预设〔01 谁进入分母〕双流语音议题沿用既定对象边界 量纲双流语音议题同向记录数/全部可核对记录数 失效漏掉无法归入单一通路的混合病灶和时,双流语音议题读数越高,真实覆盖反而越低 自曝双流语音议题(第4条):原材料未覆盖者需另表 空栏无法归入单一通路的混合病灶和 异名另见第 253 号第 12 条『行为改变技术的证据清算』

戊、具身语义的动作效应Embodied Semantics

提出Pulvermüller, F. (2005). Brain mechanisms linking language and action. Nature Reviews Neuroscience, 6, 576–582. 争议Mahon, B. Z. & Caramazza, A. (2008). A critical look at the embodied cognition hypothesis. Journal of Physiology-Paris, 102, 59–70. 最新Meteyard, L. et al. (2012). Coming of age: a review of embodiment and the neuroscience of semantics. Cortex, 48, 788–804. 关键感觉运动系统对动作词的在线贡献

Pulvermüller(2005)使具身语义的动作效应原有分类失去不证自明的地位。在2006—2016年,该转向面对的旧卡点是:词义被当作脱离身体的抽象符号,动作皮层活动只算伴随联想。把具身语义议题放回原窗口,旧框架若继续排除没有清楚身体对应却具有丰富意义的抽象词,看似整齐的规律就可能只是删选结果。就具身语义议题的外推边界看,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。围绕具身语义议题,这一步先限定可比较对象,不把缺失值折成零效应。

具身语义的动作效应在Pulvermüller(2005)的材料中只承认感觉运动系统对动作词的在线贡献具有决定性。可证伪口径写入动作区干预效应/全部语义反应变异;失效条件是:当任务完全不要求动作想象时,抽象语言网络往往比运动区更能预测词义。沿具身语义议题的责任链,任一不成立都要求改写本项证据的解释。

2005年的证据没有统一冠军数字;对具身语义的动作效应更合适的做法是同时报告动作区干预效应、全部语义反应变异这2项结构量及其反例变化。复算具身语义议题之前,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。

争议集中在效应是任务诱发想象、词汇联想,还是构成词义不可缺的机制。争议的可检验部分由Mahon(2008)给出:当任务完全不要求动作想象时,抽象语言网络往往比运动区更能预测词义。按具身语义议题的对象表,此时须重新计算该复核口径。对照具身语义议题的主源,支持方同时记录“具身研究承认效应量高度依赖任务,却常把阳性任务写成普遍语义机制”,说明对象会被样本和制度回写。

另一处常被略过的是,实验应同时设置自动阅读、语义判断、动作执行和抽象词控制,报告干预而不只报激活。上述机制在2012年的实践验收应同时公开动作区干预效应、说明全部语义反应变异,并给这些漏记对象留下可撤回、可修订的记录。只要本项证据仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

在该研究线索中,两边共享“局部最优可加总为整体最优”,却把决定位置放在不同项上;一旦这些漏记对象入账,原有对象、路径与条件场都要重画。把具身语义议题放到另见第 617 号第 16 条『家庭专属网络:平均亲职效应在具体家庭里可能反号』旁核验:先对齐对象、时间窗和责任人,再检查具身语义议题的核心判断在另一套分母中是否仍同向。

位置D|具身语义议题作生成路径 单因具身语义议题的核心决定项 预设〔01 谁进入分母〕具身语义议题沿用既定对象边界 量纲具身语义议题同向记录数/全部可核对记录数 失效漏掉没有清楚身体对应时,具身语义议题读数越高,真实覆盖反而越低 自曝具身语义议题(第5条):原材料未覆盖者需另表 空栏没有清楚身体对应 异名另见第 617 号第 16 条『家庭专属网络:平均亲职效应在具体家庭里可能反号』

己、词汇巨型实验Lexical Megastudies

提出Balota, D. A. et al. (2007). The English Lexicon Project. Behavior Research Methods, 39(3), 445–459. 争议Keuleers, E. et al. (2012). The British Lexicon Project. Behavior Research Methods, 44, 287–304. 最新Brysbaert, M. et al. (2024). Megastudy resources and the limits of lexical norms. Behavior Research Methods. 关键连续词表上的项目与个体分布

就词汇巨型议题的外推边界看,词汇巨型实验在2007年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。围绕词汇巨型议题,拼写合法却不在标准词表的社群新词和变体一旦被删去,分类稳定性便无法与记录偏差分开。

沿词汇巨型议题的责任链,词汇巨型实验的单因命题锁定连续词表上的项目与个体分布。复算词汇巨型议题之前,对本项证据而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

English Lexicon Project覆盖40481个词和40481个非词;词汇判断有816名参与者,命名任务另有444名。只有把可解释的项目时长变异和全部项目时长变异同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。词汇巨型实验的关键不是增加术语,而是让上述分子—分母在独立材料和尾部对象上能够被别人复算。该研究线索由此把局部最优可加总为整体最优从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

该转向的争论并不在于有没有阳性案例,而在于线上与实验室条件、母语背景、重复暴露和低频尾部会不会改变基准。上述机制的失效条件是:当问题聚焦稀有结构或社群新词时,巨型平均库会反过来不如定向样本。按词汇巨型议题的对象表,Keuleers(2012)与提出方的自我限制“巨型实验承认高频标准词覆盖最好,低频和多义尾部噪声更大”共同表明,方向反转不能只留在讨论末段。

这项转向的连带结果是研究应公开逐项目与逐参与者数据,允许。对照词汇巨型议题的主源,Brysbaert(2024)表明,这一制度安排落地后不能只问“能否使用”。眼动与脑电实验、听力评估、语言教育和人机交互还要记录上述分子—分母、版本号、人工修订与该未登记群体。这也意味着,眼动与脑电实验、听力评估、语言教育和人机交互处理该研究线索时不能只保存成功案例,还要保留排除理由、版本与反号结果。词汇巨型议题的复核表还保留退出日期、原记录者和未纳入理由,不用零值代替缺失。

围绕该转向,双方同以“局部最优可加总为整体最优”为前提,量纲却不天然等价;必须先换算这一比率,再谈类比。上述机制形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。把词汇巨型议题放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查词汇巨型议题的核心判断在另一套分母中是否仍同向。

位置S|词汇巨型议题作结果量 单因词汇巨型议题的核心决定项 预设〔01 谁进入分母〕词汇巨型议题沿用既定对象边界 量纲词汇巨型议题同向记录数/全部可核对记录数 失效漏掉拼写合法时,词汇巨型议题读数越高,真实覆盖反而越低 自曝词汇巨型议题(第6条):原材料未覆盖者需另表 空栏拼写合法 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

庚、双语优势的复制危机Bilingual Advantage Debate

提出Bialystok, E., Craik, F. I. M. & Luk, G. (2012). Bilingualism: consequences for mind and brain. Trends in Cognitive Sciences, 16, 240–250. 争议Paap, K. R. & Greenberg, Z. I. (2013). There is no coherent evidence for a bilingual advantage in executive processing. Cognitive Psychology, 66, 232–258. 最新Lehtonen, M. et al. (2018). Is bilingualism associated with enhanced executive functioning in adults? Psychological Bulletin, 144, 394–425. 关键双语使用场景而非二元身份标签

围绕双语优势议题,Bialystok(2012)把双语优势的复制危机改写成一个分母问题。这项转向最初针对的是早期小样本把双语经验与抑制控制优势直接连接,阳性结果迅速成为教育常识。沿双语优势议题的责任链,只有让混合方言、第三语言与不对称使用经验获得可比较位置,旧边界才可能接受反例检验。该转向由此把类别互斥且穷尽从背景假定移到检验台上,使支持者与反对者必须使用同一分母。复算双语优势议题之前,这一步先限定可比较对象,不把缺失值折成零效应。

按双语优势议题的对象表,双语优势的复制危机在Bialystok(2012)的材料中只承认双语使用场景而非二元身份标签具有决定性。对照双语优势议题的主源,任一不成立都要求改写本项证据的解释。对双语优势议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

双语优势元分析汇总891个效应量、152项研究并区分6类执行功能域;平均效应与发表偏差必须同时报告。在双语优势议题的实施账本里,双语优势的复制危机由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。一旦把该未登记群体重新计入,该研究线索原来的平均值、类别边界和责任归属都可能同时改变。

反对意见主要指向双语类型、熟练度、切换需求与移民经历是否被“单语/双语”粗标签抹平。Paap(2013)的复核指出:当双语切换需求很低时,双语经验可能增加词汇检索成本而没有控制收益。从双语优势议题的材料看,此时该复核口径失去原有解释力;而“支持方也承认不存在单一的「双语状态」,二元分组却长期没有退出”又显示,稳定对象也可能由工具制造。

上述机制还会重排实践的验收顺序:研究需连续记录每日语言使用、切换场景和教育背景,并预注册零效应和亚组分析。核查双语优势议题时,本项证据进入眼动与脑电实验、听力评估、语言教育和人机交互后,工作流须先保存该未登记群体,再进行压缩、排名或展示。在双语优势议题这条证据链上,Lehtonen(2018)提醒,总分不能替代上述分子—分母。

对双语优势议题做反向检验,本面板测这一比率,对方检验“类别互斥且穷尽”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。该研究线索真正需要比较的不是一句“是否有效”,而是上述分子—分母在材料、群体和版本改变后是否同向。

位置D|双语优势议题作生成路径 单因双语优势议题的核心决定项 预设〔01 谁进入分母〕双语优势议题沿用既定对象边界 量纲双语优势议题同向记录数/全部可核对记录数 失效漏掉混合方言、第三语言与不对称使时,双语优势议题读数越高,真实覆盖反而越低 自曝双语优势议题(第7条):原材料未覆盖者需另表 空栏混合方言、第三语言与不对称使 异名另见第 138 号第 15 条『新思想 15 · 内隐心理理论的复制危机 —— 一整条被广泛接受的证据线出了问题』

辛、会话轮替的跨文化基线Turn-taking Universals

提出Stivers, T. et al. (2009). Universals and cultural variation in turn-taking in conversation. PNAS, 106(26), 10587–10592. 争议Kendrick, K. H. & Torreira, F. (2015). The timing and construction of preference. Frontiers in Psychology, 6, 284. 最新Inoue, K. et al. (2024). Multilingual turn-taking prediction using voice activity projection. LREC-COLING 2024. 关键响应间隔的分布与社会动作

沿会话轮替议题的责任链,Stivers(2009)首先定位了会话轮替的跨文化基线的历史卡点。长期以来,轮替时长常用英语礼貌常识解释,停顿被视为各文化任意选择;在2006—2016阶段,重叠发言、手势先答和未完成轮次不再只是边缘案例,而成为判断对象边界是否成立的证据。该转向的关键不是增加术语,而是让目标语言响应间隔/全部轮替间隔在独立材料和尾部对象上能够被别人复算。

复算会话轮替议题之前,会话轮替的跨文化基线的单因命题锁定响应间隔的分布与社会动作。Stivers(2009)要求以这一比率检验;失效边界是:当回答是拒绝或不受欢迎动作时,较长停顿会反过来承担社会意义,而非表示加工慢。本项证据由此把类别互斥且穷尽从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

Stivers等比较10种语言,会话回答间隔多集中在0—200毫秒,并大多落在500毫秒以内。按会话轮替议题的对象表,其些读数使该复核口径能够在中心样本、尾部样本与独立材料上分别重算。对照会话轮替议题的主源,只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。会话轮替议题的结构读数拆成2项:主命题、替代机制、缺失对象与时间窗分别核对,任一项都不由总均值代填。

尚未收敛的部分是录音场景、问题类型、拒绝动作和转写边界会不会制造所谓文化差异。Kendrick(2015)把边界写成:当回答是拒绝或不受欢迎动作时,较长停顿会反过来承担社会意义,而非表示加工慢。这时,上述分子—分母不再支持原方向;提出路线自己还承认“同一语言内部的轮替分布很宽,中位数却常被写成整种文化的性格”。反号因此必须进入主分析。

由此产生的实践后果是:会话系统应学习分布、凝视与修复信号,不能用固定五百毫秒阈值决定抢话。在眼动与脑电实验、听力评估、语言教育和人机交互中,应把该未登记群体设为固定字段,并按这一比率发布分层结果。Inoue(2024)进一步要求把上述机制的版本、人工修订与这组账外材料的失败记录连成可追踪链。

在会话轮替议题的实施账本里,两边共享“类别互斥且穷尽”,但本条把上述首因置于决定位置。只有把该复核口径换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把会话轮替议题放到另见第 145 号第 4 条『新思想 4 · 文化任务分析 —— 文化不是装在头脑里,而是分布在日常任务中』旁核验:先对齐对象、时间窗和责任人,再检查会话轮替议题的核心判断在另一套分母中是否仍同向。

位置E|会话轮替议题作环境条件 单因会话轮替议题的核心决定项 预设〔01 谁进入分母〕会话轮替议题沿用既定对象边界 量纲会话轮替议题同向记录数/全部可核对记录数 失效漏掉重叠发言、手势先答和未完成轮时,会话轮替议题读数越高,真实覆盖反而越低 自曝会话轮替议题(第8条):原材料未覆盖者需另表 空栏重叠发言、手势先答和未完成轮 异名另见第 145 号第 4 条『新思想 4 · 文化任务分析 —— 文化不是装在头脑里,而是分布在日常任务中』
【第二幕】这十年 · 约 2016—2026

第二幕转向可靠性、自然故事、跨主体解码、脑—模型对齐、多语言眼动、听力努力与ManyBabies,使资源预算和实验室层级进入结论。从统计学习的个体差异清算、N400预测效应的大规模复现、自然语音的皮层语义地图等12条可见,这一幕不以排行榜为终点,而追踪训练外表现、版本差异、制度采用、社区权利与长期维护。

一、统计学习的个体差异清算Statistical Learning Reliability

提出Siegelman, N., Bogaerts, L. & Frost, R. (2017). Measuring individual differences in statistical learning. Journal of Memory and Language, 95, 144–163. 争议Arnon, I. (2020). Do current statistical learning tasks capture stable individual differences? Journal of Memory and Language, 112, 104094. 最新Frost, R. et al. (2024). Reconsidering the measurement of statistical learning. Cognitive Science. 关键跨任务可重复的学习参数

复算统计学习议题之前,Siegelman(2017)使统计学习的个体差异清算原有分类失去不证自明的地位。在2016—2026年,该转向面对的旧卡点是:统计学习常用一个短任务给每位参与者贴上能力标签,再拿该分数解释阅读和语法差异。旧框架若继续排除完成任务但采用不同策略、无法归入单一能力轴的参与者,看似整齐的规律就可能只是删选结果。按统计学习议题的对象表,这一步先限定可比较对象,不把缺失值折成零效应。

可证伪口径写入跨任务相关/同任务重测相关;失效条件是:当任务表面线索高度相似时,记忆策略会反过来制造看似稳定的统计学习能力。对照统计学习议题的主源,任一不成立都要求改写本项证据的解释。对统计学习议题而言,可被推翻的责任只落在跨任务可重复的学习参数;如果替代机制同样预测结果,这项解释就应撤回。

可靠性研究至少区分分半信度、重测信度和跨任务相关3项指标;单次显著并不等于稳定个体差异。在统计学习议题的实施账本里,其使统计学习的个体差异清算从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。该研究线索由此把类别互斥且穷尽从背景假定移到检验台上,使支持者与反对者必须使用同一分母。该研究线索的量纲含2项结构量,跨3类材料时另列4个误差切片。

争议集中在低信度究竟说明能力不存在,还是任务只采样了能力的一小部分。争议的可检验部分由Arnon(2020)给出:当任务表面线索高度相似时,记忆策略会反过来制造看似稳定的统计学习能力。从统计学习议题的材料看,此时须重新计算该复核口径。

另一处常被略过的是,研究应使用多任务潜变量、重复测量和项目反应模型,不把一次正确率当作永久能力。上述机制在2024年的实践验收应同时公开跨任务相关、说明同任务重测相关,并给这些漏记对象参与者留下可撤回、可修订的记录。一旦把该未登记群体参与者重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。

在该研究线索中,两边共享“类别互斥且穷尽”,却把决定位置放在不同项上;一旦这些漏记对象参与者入账,原有对象、路径与条件场都要重画。把统计学习议题放到另见第 141 号第 7 条『新思想 7 · 黑暗因子 D —— 各种「黑暗特质」可能只是同一个倾向的不同口味』旁核验:先对齐对象、时间窗和责任人,再检查统计学习议题的核心判断在另一套分母中是否仍同向。

位置D|统计学习议题作生成路径 单因统计学习议题的核心决定项 预设〔01 谁进入分母〕统计学习议题沿用既定对象边界 量纲统计学习议题同向记录数/全部可核对记录数 失效漏掉完成任务但采用不同策略时,统计学习议题读数越高,真实覆盖反而越低 自曝统计学习议题(第9条):原材料未覆盖者需另表 空栏完成任务但采用不同策略 异名另见第 141 号第 7 条『新思想 7 · 黑暗因子 D —— 各种「黑暗特质」可能只是同一个倾向的不同口味』

二、N400预测效应的大规模复现N400 Replication

提出Nieuwland, M. S. et al. (2018). Large-scale replication study reveals a limit on probabilistic prediction in language comprehension. eLife, 7, e33468. 争议DeLong, K. A., Urbach, T. P. & Kutas, M. (2005). Probabilistic word pre-activation during language comprehension inferred from electrical brain activity. Nature Neuroscience, 8, 1117–1121. 最新Spurious alignment between large language models and brains can arise from confounds. Nature Communications, 2026. 关键预注册多实验室的效应量

按预注册多机制的对象表,N400预测效应的大规模复现在2018年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。对照预注册多机制的主源,该转向出现以前,研究者多把“经典冠词—名词实验被解释为听者提前激活具体词及其形式特征,一个小样本效应被普遍化”当作无需再问的背景。在预注册多机制的实施账本里,因伪迹剔除而集中退出困难条件的脑电试次一旦被删去,分类稳定性便无法与记录偏差分开。从预注册多机制的材料看,这一步先限定可比较对象,不把缺失值折成零效应。

核查预注册多机制时,N400预测效应的大规模复现的单因命题锁定预注册多实验室的效应量。本项证据真正需要比较的不是一句“是否有效”,而是该复核口径在材料、群体和版本改变后是否同向。对预注册多机制而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

Nieuwland等的预注册复制由9个实验室完成,纳入334名参与者和25849个有效试次;名词N400复制,冠词效应没有稳定复制。只有把复制效应量和原始效应量同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。N400预测效应的大规模复现最怕一个总分,因为中心样本改善时,该未登记群体可能正以更快速度退出可见范围。

该转向的争论并不在于有没有阳性案例,而在于跨语言冠词系统、基线窗口和材料自然度会不会影响空结果。在预注册多机制这条证据链上,上述机制的失效条件是:该反向情形。对预注册多机制做反向检验,DeLong(2005)与提出方的自我限制“复制计划显示部分经典效应不稳,旧综述却常继续引用原始大效应”共同表明,方向反转不能只留在讨论末段。

这项转向的连带结果是脑电研究应分开报告语义可预期、具体词预测和前置形式线索,并公开逐项目波形。把预注册多机制放回原窗口,相关更新(2026)表明,这一制度安排落地后不能只问“能否使用”。眼动与脑电实验、听力评估、语言教育和人机交互还要记录这一比率、版本号、人工修订与该未登记群体。

就预注册多机制的外推边界看,围绕这项命题,双方同以“平均值代表个体”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。该转向的关键不是增加术语,而是让这一比率在独立材料和尾部对象上能够被别人复算。

位置E|预注册多机制作环境条件 单因预注册多机制的核心决定项 预设〔01 谁进入分母〕预注册多机制沿用既定对象边界 量纲预注册多机制同向记录数/全部可核对记录数 失效若预注册多机制可由替代机制重现,单因解释撤回 自曝预注册多机制(第10条):原材料未覆盖者需另表 空栏因伪迹剔除 异名另见第 143 号第 11 条『新思想 11 · 成长型思维:从效应到边界 —— 全国实验给出的是一个有条件的结论』

三、自然语音的皮层语义地图Naturalistic Semantic Maps

提出Huth, A. G. et al. (2016). Natural speech reveals the semantic maps that tile human cerebral cortex. Nature, 532, 453–458. 争议Wehbe, L. et al. (2014). Simultaneously uncovering the patterns of brain regions involved in different story reading subprocesses. PLoS ONE, 9, e112575. 最新Contextual feature extraction hierarchies converge in large language models and the brain. Nature Machine Intelligence, 2024. 关键连续故事中的分布式语义响应

对照连续故事机制的主源,Huth(2016)把自然语音的皮层语义地图改写成一个分母问题。这项转向最初针对的是脑成像常用孤立词和短句,把真实叙事中的语义流压成少量条件块。一旦把该未登记群体重新计入,该转向原来的平均值、类别边界和责任归属都可能同时改变。在连续故事机制的实施账本里,这一步先限定可比较对象,不把缺失值折成零效应。

从连续故事机制的材料看,任一不成立都要求改写本项证据的解释。核查连续故事机制时,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对连续故事机制而言,可被推翻的责任只落在连续故事中的分布式语义响应;如果替代机制同样预测结果,这项解释就应撤回。

Huth等让7名参与者分别聆听超过2小时自然叙事,并用独立故事检验语义地图。在连续故事机制这条证据链上,自然语音的皮层语义地图由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。对连续故事机制做反向检验,只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

反对意见主要指向少量参与者、高维正则化和故事题材会不会过拟合出漂亮脑图。把连续故事机制放回原窗口,Wehbe(2014)的复核指出:该反向情形。就连续故事机制的外推边界看,此时该复核口径失去原有解释力;而“高维地图依赖标签体系和正则化,图上色块并不是天然脑区”又显示,稳定对象也可能由工具制造。围绕连续故事机制,该笔材料只限制外推,不重复充当支持证据。

上述机制还会重排实践的验收顺序:自然刺激研究应使用独立故事、公开特征字典和个体地图,不只展示组平均颜色边界。沿连续故事机制的责任链,本项证据进入眼动与脑电实验、听力评估、语言教育和人机交互后,工作流须先保存该未登记群体,再进行压缩、排名或展示。复算连续故事机制之前,相关更新(2024)提醒,总分不能替代上述分子—分母。

按连续故事机制的对象表,本面板测这一比率,对方检验“平均值代表个体”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把连续故事机制放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查连续故事机制的核心判断在另一套分母中是否仍同向。

位置S|连续故事机制作结果量 单因连续故事机制的核心决定项 预设〔01 谁进入分母〕连续故事机制沿用既定对象边界 量纲连续故事机制同向记录数/全部可核对记录数 失效若连续故事机制可由替代机制重现,单因解释撤回 自曝连续故事机制(第11条):原材料未覆盖者需另表 空栏未达显著阈值 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

四、跨主体脑语义解码Cross-subject Semantic Decoding

提出Pereira, F. et al. (2018). Toward a universal decoder of linguistic meaning from brain activation. Nature Communications, 9, 963. 争议Toneva, M. & Wehbe, L. (2019). Interpreting and improving natural-language processing models with natural language-processing data. NeurIPS 2019. 最新Mapping the neuronal building blocks of human language. Nature, 2026. 关键共享语义空间对新主体的迁移

在跨主体脑议题的实施账本里,Pereira(2018)首先定位了跨主体脑语义解码的历史卡点。与其继续扩大该转向的总体样本,不如先检验平均值代表个体是否在不同装置和人群中仍然成立。从跨主体脑议题的材料看,这一步先限定可比较对象,不把缺失值折成零效应。

核查跨主体脑议题时,跨主体脑语义解码的单因命题锁定共享语义空间对新主体的迁移。在跨主体脑议题这条证据链上,Pereira(2018)要求以跨主体正确解码数/主体内正确解码数检验;失效边界是:当个体语言经验差异很大时,个体模型会反过来明显优于共享空间。一旦把这些漏记对象重新计入,本项证据原来的平均值、类别边界和责任归属都可能同时改变。对跨主体脑议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

跨主体解码研究用3名参与者、每人约16小时训练材料建立共享语义空间,并在新句上验证。对跨主体脑议题做反向检验,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。对跨主体脑语义解码而言,这一步把这组账外材料从残差改成可追踪对象,并要求解释它为何长期没有进入分母。为达到可重放性,该研究线索至少区分2类样本、3个切片和4项日志字段。

尚未收敛的部分是扫描任务、词表和对齐算法是否把个体强行压入共同空间。把跨主体脑议题放回原窗口,Toneva(2019)把边界写成:该反向情形。就跨主体脑议题的外推边界看,其时,这一比率不再支持原方向;提出路线自己还承认“「通用解码」仍依赖训练人群、任务和语言,离任意人任意文本很远”。反号因此必须进入主分析。

由此产生的实践后果是:临床应用前必须报告跨人迁移、个体失败者和语言背景,不只给组平均。在眼动与脑电实验、听力评估、语言教育和人机交互中,应把这组账外材料设为固定字段,并按该复核口径发布分层结果。相关更新(2026)进一步要求把上述机制的版本、人工修订与这些漏记对象的失败记录连成可追踪链。

围绕跨主体脑议题,两边共享“平均值代表个体”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入这组账外材料,才能判断互证、反号或第三项。把跨主体脑议题放到另见第 141 号第 7 条『新思想 7 · 黑暗因子 D —— 各种「黑暗特质」可能只是同一个倾向的不同口味』旁核验:先对齐对象、时间窗和责任人,再检查跨主体脑议题的核心判断在另一套分母中是否仍同向。

位置D|跨主体脑议题作生成路径 单因跨主体脑议题的核心决定项 预设〔01 谁进入分母〕跨主体脑议题沿用既定对象边界 量纲跨主体脑议题同向记录数/全部可核对记录数 失效若跨主体脑议题可由替代机制重现,单因解释撤回 自曝跨主体脑议题(第12条):原材料未覆盖者需另表 空栏因头动或低信噪被整名排除的参 异名另见第 141 号第 7 条『新思想 7 · 黑暗因子 D —— 各种「黑暗特质」可能只是同一个倾向的不同口味』

五、下一词预测与脑响应对齐Brain–Language Model Alignment

提出Schrimpf, M. et al. (2021). The neural architecture of language: integrative modeling converges on predictive processing. PNAS, 118, e2105646118. 争议Caucheteux, C. & King, J.-R. (2022). Brains and algorithms partially converge in natural language processing. Communications Biology, 5, 134. 最新Spurious alignment between large language models and brains can arise from confounds. Nature Communications, 2026. 关键预测目标形成的共享计算轴

从下一词预测脑响应对的材料看,Schrimpf(2021)使下一词预测与脑响应对齐原有分类失去不证自明的地位。在2016—2026年,该转向面对的旧卡点是:人工模型与人脑的相似过去多凭任务结果类比,缺少统一神经与行为读数。核查下一词预测脑响应对时,旧框架若继续排除低于噪声上限、无法评价的参与者和电极,看似整齐的规律就可能只是删选结果。在下一词预测脑响应对这条证据链上,这一步先限定可比较对象,不把缺失值折成零效应。

对下一词预测脑响应对做反向检验,任一不成立都要求改写本项证据的解释。与其继续扩大本项证据的总体样本,不如先检验通过形式审查=实质合规是否在不同装置和人群中仍然成立。对下一词预测脑响应对而言,可被推翻的责任只落在预测目标形成的共享计算轴;如果替代机制同样预测结果,这项解释就应撤回。

关键证据是Schrimpf等2021比较数十模型对神经和行为数据的预测,下一词性能较好的模型通常更能预测语言区;下一词预测与脑响应对齐不以“显著”充当读数;依Schrimpf(2021)的论证,至少应公开模型脑预测分数和人类数据噪声上限这2项结构量。把下一词预测脑响应对放回原窗口,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。

争议集中在相关对齐是否说明同一机制,模型规模、架构与训练数据是否共同造成假相关。就下一词预测脑响应对的外推边界看,争议的可检验部分由Caucheteux(2022)给出:该反向情形。围绕下一词预测脑响应对,此时须重新计算该复核口径。沿下一词预测脑响应对的责任链,支持方同时记录“最佳模型仍在部分脑区和时间窗失败,总体相关掩盖层级差异”,说明对象会被样本和制度回写。

另一处常被略过的是,需要目标函数对照、因果干预、资源匹配和未见故事外推,不能把相关分数写成机制证明。上述机制在2026年的实践验收应同时公开模型脑预测分数、说明人类数据噪声上限,并给这些漏记对象留下可撤回、可修订的记录。本项证据由此把通过形式审查=实质合规从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

在该研究线索中,两边共享“通过形式审查=实质合规”,却把决定位置放在不同项上;一旦这组账外材料入账,原有对象、路径与条件场都要重画。把下一词预测脑响应对放到另见第 531 号第 4 条『材料基因组数据库:计算结果从论文附件变成公共检索层』旁核验:先对齐对象、时间窗和责任人,再检查下一词预测脑响应对的核心判断在另一套分母中是否仍同向。

位置S|下一词预测脑响应对作结果量 单因下一词预测脑响应对的核心决定项 预设〔01 谁进入分母〕下一词预测脑响应对沿用既定对象边界 量纲下一词预测脑响应对同向记录数/全部可核对记录数 失效漏掉低于噪声上限、无法评价的参与时,下一词预测脑响应对读数越高,真实覆盖反而越低 自曝下一词预测脑响应对(第13条):原材料未覆盖者需另表 空栏低于噪声上限、无法评价的参与 异名另见第 531 号第 4 条『材料基因组数据库:计算结果从论文附件变成公共检索层』

六、共享计算原则与资源错配Shared Computational Principles

提出Goldstein, A. et al. (2022). Shared computational principles for language processing in humans and deep language models. Nature Neuroscience, 25, 369–380. 争议Warstadt, A. et al. (2023). BabyLM challenge: sample-efficient pretraining on a developmentally plausible corpus. CoNLL 2023. 最新Increasing alignment of large language models with language processing in the human brain. Nature Computational Science, 2025. 关键词前预测与词后误差的时间对应

核查共享计算原资源错配时,共享计算原则与资源错配在2022年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。在共享计算原资源错配这条证据链上,该转向出现以前,研究者多把“模型和人脑只要输出相似就被当作共享机制,训练资源差异很少进入比较”当作无需再问的背景。对共享计算原资源错配做反向检验,模型见过而实验参与者不可能见过的文本片段一旦被删去,分类稳定性便无法与记录偏差分开。

把共享计算原资源错配放回原窗口,共享计算原则与资源错配的单因命题锁定词前预测与词后误差的时间对应。就共享计算原资源错配的外推边界看,其也意味着,眼动与脑电实验、听力评估、语言教育和人机交互处理本项证据时不能只保存成功案例,还要保留排除理由、版本与反号结果。

Goldstein等2022在自然叙事神经记录中比较深度语言模型和大脑的词前、词后响应,报告共享预测与误差结构;Goldstein(2022)主要给出理论或方法论论证;可证伪入口是资源匹配模型的脑对齐与全量模型脑对齐两项结构量,而不是一项并不存在的总体效应。只有把资源匹配模型的脑对齐和全量模型脑对齐同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。共享计算原则与资源错配另固定2项结构读数、3类材料与4次版本复核。

该转向的争论并不在于有没有阳性案例,而在于共享读数是否由文本统计、任务设计或模型规模共同驱动。围绕共享计算原资源错配,上述机制的失效条件是:该反向情形。沿共享计算原资源错配的责任链,Warstadt(2023)与提出方的自我限制“研究承认人类与模型的暴露量相差多个数量级,却仍按同一总分排序”共同表明,方向反转不能只留在讨论末段。

这项转向的连带结果是认知模型比较应匹配训练词数、上下文长度和记忆容量,并报告超人资源带来的增益。复算共享计算原资源错配之前,相关更新(2025)表明,这一制度安排落地后不能只问“能否使用”。按共享计算原资源错配的对象表,眼动与脑电实验、听力评估、语言教育和人机交互还要记录这一比率、版本号、人工修订与这些漏记对象。

对照共享计算原资源错配的主源,围绕这项命题,双方同以“通过形式审查=实质合规”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。与其继续扩大该转向的总体样本,不如先检验通过形式审查=实质合规是否在不同装置和人群中仍然成立。

位置E|共享计算原资源错配作环境条件 单因共享计算原资源错配的核心决定项 预设〔02 单一读数代表复杂对象〕共享计算原资源错配沿用既定对象边界 量纲共享计算原资源错配同向记录数/全部可核对记录数 失效漏掉模型见过时,共享计算原资源错配读数越高,真实覆盖反而越低 自曝共享计算原资源错配(第14条):原材料未覆盖者需另表 空栏模型见过 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

七、多语言眼动语料Multilingual Eye-movement Corpus

提出Siegelman, N. et al. (2022). Expanding horizons of cross-linguistic research on reading: the Multilingual Eye-movement Corpus. Behavior Research Methods, 54, 2843–2863. 争议Kuperman, V. et al. (2024). New data on text reading in English as a second language: the wave 2 expansion of MECO. Studies in Second Language Acquisition. 最新Quantifying word informativeness and its impact on eye-movement control across languages. Behavior Research Methods, 2025. 关键同材料与本地材料的双重可比性

在多语言眼议题这条证据链上,Siegelman(2022)把多语言眼动语料改写成一个分母问题。这项转向最初针对的是阅读机制常在英语单一实验室上建立,再把词长、词频和跳读规则当作普遍规律。对多语言眼议题做反向检验,只有让无法稳定切成词的书写系统、连写与多词表达获得可比较位置,旧边界才可能接受反例检验。把多语言眼议题放回原窗口,该转向形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。就多语言眼议题的外推边界看,这一步先限定可比较对象,不把缺失值折成零效应。

围绕多语言眼议题,任一不成立都要求改写本项证据的解释。沿多语言眼议题的责任链,其也意味着,眼动与脑电实验、听力评估、语言教育和人机交互处理本项证据时不能只保存成功案例,还要保留排除理由、版本与反号结果。

MECO第二波纳入654名读者、13种语言、16个实验室和15个国家,统一保存眼动与个体背景。复算多语言眼议题之前,只要该研究线索仍把该未登记群体在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。与其继续扩大该研究线索的总体样本,不如先检验通过形式审查=实质合规是否在不同装置和人群中仍然成立。

反对意见主要指向不同书写系统中的“词”、词长和分词单位不完全可比,统一材料也可能失去自然度。按多语言眼议题的对象表,Kuperman(2024)的复核指出:该反向情形。对照多语言眼议题的主源,此时该复核口径失去原有解释力;而“MECO承认「词」与分词跨语言不等价,却仍需要共同字段才能汇总”又显示,稳定对象也可能由工具制造。

上述机制还会重排实践的验收顺序:跨语言阅读研究应同时保留统一任务和本地适配任务,公布地点层、语言层与个体层方差。在多语言眼议题的实施账本里,本项证据进入眼动与脑电实验、听力评估、语言教育和人机交互后,工作流须先保存该未登记群体,再进行压缩、排名或展示。从多语言眼议题的材料看,相关更新(2025)提醒,总分不能替代上述分子—分母。

核查多语言眼议题时,本面板测这一比率,对方检验“通过形式审查=实质合规”在另一对象上是否反号;这些漏记对象是两边共同漏掉的候选。把多语言眼议题放到另见第 143 号第 11 条『新思想 11 · 成长型思维:从效应到边界 —— 全国实验给出的是一个有条件的结论』旁核验:先对齐对象、时间窗和责任人,再检查多语言眼议题的核心判断在另一套分母中是否仍同向。

位置D|多语言眼议题作生成路径 单因多语言眼议题的核心决定项 预设〔01 谁进入分母〕多语言眼议题沿用既定对象边界 量纲多语言眼议题同向记录数/全部可核对记录数 失效若多语言眼议题可由替代机制重现,单因解释撤回 自曝多语言眼议题(第15条):原材料未覆盖者需另表 空栏无法稳定切成词的书写系统 异名另见第 143 号第 11 条『新思想 11 · 成长型思维:从效应到边界 —— 全国实验给出的是一个有条件的结论』

八、大模型层级与脑时间层级Layer–Time Correspondence

提出Temporal structure of natural language processing in the human brain corresponds to layered hierarchy of large language models. Nature Communications, 2025, DOI 10.1038/s41467-025-65518-0. 争议Incremental accumulation of linguistic context in artificial and biological neural networks. Nature Communications, 2025. 最新Author Correction: Temporal structure of natural language processing in the human brain corresponds to layered hierarchy of large language models. Nature Communications, 2026. 关键模型层级与脑加工时序的对应

对大模型层级脑时间层做反向检验,相关研究(2025)首先定位了大模型层级与脑时间层级的历史卡点。长期以来,模型层和脑时间窗常被任意配对,层号被误当成心理阶段;在2016—2026阶段,没有显著最佳层、呈宽平台的脑区和参与者不再只是边缘案例,而成为判断对象边界是否成立的证据。把大模型层级脑时间层放回原窗口,这一步先限定可比较对象,不把缺失值折成零效应。

就大模型层级脑时间层的外推边界看,大模型层级与脑时间层级的单因命题锁定模型层级与脑加工时序的对应。本项证据形成的责任链很具体:先说明谁被计入,再说明如何测量,最后公开何时方向反转。对大模型层级脑时间层而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

2025年《Nature Communications》研究用自然语言神经记录显示,大模型从早层到后层的表征层级与脑中由局部到长上下文的时间动态对应,并在独立材料验证。大模型层级与脑时间层级属于结构性转向,原文没有统一样本效应量;数值入口仍有2个:最佳层—时间对齐分数与可解释神经上限,并须在独立材料上重算。围绕大模型层级脑时间层,其些读数使上述分子—分母能够在中心样本、尾部样本与独立材料上分别重算。

尚未收敛的部分是层号与毫秒对应是否会随模型架构、分词和训练目标改变。相关争议(2025)把边界写成:该反向情形。沿大模型层级脑时间层的责任链,其时,这一比率不再支持原方向;提出路线自己还承认“论文强调层级对应而非一一同构,媒体叙事却容易写成「模型就是大脑」”。反号因此必须进入主分析。

由此产生的实践后果是:比较应跨模型、故事、脑区和语言报告稳定区间,而不是寻找一条唯一层—时点曲线。在眼动与脑电实验、听力评估、语言教育和人机交互中,应把这些漏记对象设为固定字段,并按该复核口径发布分层结果。相关更新(2026)进一步要求把上述机制的版本、人工修订与该未登记群体的失败记录连成可追踪链。

复算大模型层级脑时间层之前,两边共享“记录存在即可核对”,但本条把上述首因置于决定位置。只有把上述分子—分母换到同一分母并计入这些漏记对象,才能判断互证、反号或第三项。把大模型层级脑时间层放到另见第 256 号第 16 条『语言模型作为语言学研究对象』旁核验:先对齐对象、时间窗和责任人,再检查大模型层级脑时间层的核心判断在另一套分母中是否仍同向。

位置E|大模型层级脑时间层作环境条件 单因大模型层级脑时间层的核心决定项 预设〔01 谁进入分母〕大模型层级脑时间层沿用既定对象边界 量纲大模型层级脑时间层同向记录数/全部可核对记录数 失效若大模型层级脑时间层可由替代机制重现,单因解释撤回 自曝大模型层级脑时间层(第16条):原材料未覆盖者需另表 空栏没有显著最佳层、呈宽平台的脑 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

九、内部类人、外部超人Human-like Internally

提出Kuribayashi, T. et al. (2025). Large Language Models Are Human-Like Internally. Transactions of the ACL, 13, 1743–1766. 争议Lampinen, A. K. (2023). Can language models handle recursively nested grammatical structures? Cognition, 237, 105429. 最新Spurious alignment between large language models and brains can arise from confounds. Nature Communications, 2026. 关键内部表征轨迹而非最终准确率

把内部类人议题放回原窗口,Kuribayashi(2025)使内部类人、外部超人原有分类失去不证自明的地位。在2016—2026年,该转向面对的旧卡点是:模型只要最终得分超过人类,就被认为不适合作为认知模型。就内部类人议题的外推边界看,旧框架若继续排除最终答对但路径完全不同的模型试次,看似整齐的规律就可能只是删选结果。该转向由此把记录存在即可核对从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

围绕内部类人议题,内部类人、外部超人在Kuribayashi(2025)的材料中只承认内部表征轨迹而非最终准确率具有决定性。沿内部类人议题的责任链,任一不成立都要求改写本项证据的解释。复算内部类人议题之前,对本项证据而言,其一步把这些漏记对象从残差改成可追踪对象,并要求解释它为何长期没有进入分母。

关键证据是Kuribayashi等2025比较语言模型隐藏状态、错误类型与人类行为,发现某些模型输出表现超人,但内部处理轨迹仍与人类数据相似;内部类人、外部超人尚无统一效应量,但至少可保存2个数:内部类人相关与最终输出类人相关,再比较中心材料和边缘材料的差。按内部类人议题的对象表,其使该研究线索从案例变成可重放证据:更换材料或版本后,分子与分母仍可独立核查。

争议集中在内部相似是否只是共同语料统计,隐藏层指标能否跨任务复现。对照内部类人议题的主源,争议的可检验部分由Lampinen(2023)给出:该反向情形。在内部类人议题的实施账本里,此时须重新计算该复核口径。从内部类人议题的材料看,支持方同时记录“论文承认不同类人指标可能给出相反排名,却仍需要选一个汇总分”,说明对象会被样本和制度回写。

另一处常被略过的是,认知评估应同时报告最终得分、错误结构、学习曲线与中间状态,不用单一排行榜裁决类人性。上述机制在2026年的实践验收应同时公开内部类人相关、说明最终输出类人相关,并给该未登记群体留下可撤回、可修订的记录。只要本项证据仍把这组账外材料在入库前删除,所谓稳定边界就可能只是筛选程序制造的整齐。

核查内部类人议题时,在该研究线索中,两边共享“记录存在即可核对”,却把决定位置放在不同项上;一旦该未登记群体入账,原有对象、路径与条件场都要重画。一旦把这组账外材料重新计入,这项命题原来的平均值、类别边界和责任归属都可能同时改变。

位置S|内部类人议题作结果量 单因内部类人议题的核心决定项 预设〔01 谁进入分母〕内部类人议题沿用既定对象边界 量纲内部类人议题同向记录数/全部可核对记录数 失效若内部类人议题可由替代机制重现,单因解释撤回 自曝内部类人议题(第17条):原材料未覆盖者需另表 空栏最终答对但路径完全不同的模型 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

十、多模态轮替预测Multimodal Turn-taking Prediction

提出Visual Cues Enhance Predictive Turn-Taking for Two-Party Human-Robot Interaction. Findings of ACL 2025. 争议Ekstedt, E. & Skantze, G. (2022). Voice Activity Projection: self-supervised learning of turn-taking events. Interspeech 2022. 最新Analysing Next Speaker Prediction in Multi-Party Conversation with Multimodal LLMs. IWSDS 2026. 关键声音、凝视与头部动作的联合时序

就多模态轮议题的外推边界看,多模态轮替预测在2025年前后的争点不是多添术语,而是重新说明谁算对象、什么记录算证据。围绕多模态轮议题,该转向出现以前,研究者多把“会话模型主要看语音活动,把凝视、表情和身体姿态当成可有可无的附加信息”当作无需再问的背景。沿多模态轮议题的责任链,手势已完成回应却没有语音的轮次一旦被删去,分类稳定性便无法与记录偏差分开。复算多模态轮议题之前,这一步先限定可比较对象,不把缺失值折成零效应。

按多模态轮议题的对象表,多模态轮替预测的单因命题锁定声音、凝视与头部动作的联合时序。对照多模态轮议题的主源,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对多模态轮议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

MM-VAP把音频与面部、头姿和凝视结合,保持/换人预测准确率由约79%提高到84%。只有把多模态正确换人预测数和全部换人事件同时公开,后续研究才能判断增益来自对象、编码、装置还是数据选择。在多模态轮议题的实施账本里,其也意味着,眼动与脑电实验、听力评估、语言教育和人机交互处理多模态轮替预测时不能只保存成功案例,还要保留排除理由、版本与反号结果。

该转向的争论并不在于有没有阳性案例,而在于摄像机视角、遮挡、文化凝视规则和多人场景会不会使视觉线索失效。从多模态轮议题的材料看,上述机制的失效条件是:该反向情形。核查多模态轮议题时,Ekstedt(2022)与提出方的自我限制“模型承认视觉信息依赖拍摄位置,但实验通常使用理想正面视频”共同表明,方向反转不能只留在讨论末段。

这项转向的连带结果是系统应报告视角错配、遮挡和文化迁移错误,并保存手势先答与重叠发言。在多模态轮议题这条证据链上,相关更新(2026)表明,这一制度安排落地后不能只问“能否使用”。对多模态轮议题做反向检验,眼动与脑电实验、听力评估、语言教育和人机交互还要记录这一比率、版本号、人工修订与这些漏记对象。

把多模态轮议题放回原窗口,围绕这项命题,双方同以“记录存在即可核对”为前提,量纲却不天然等价;必须先换算该复核口径,再谈类比。与其继续扩大该转向的总体样本,不如先检验记录存在即可核对是否在不同装置和人群中仍然成立。

位置D|多模态轮议题作生成路径 单因多模态轮议题的核心决定项 预设〔10 更多数据必然减少偏倚〕多模态轮议题沿用既定对象边界 量纲多模态轮议题同向记录数/全部可核对记录数 失效若多模态轮议题可由替代机制重现,单因解释撤回 自曝多模态轮议题(第18条):原材料未覆盖者需另表 空栏手势已完成回应 异名另见第 256 号第 16 条『语言模型作为语言学研究对象』

十一、听力损失的隐性语言努力Listening Effort

提出Peelle, J. E. & Wingfield, A. (2016). The neural consequences of age-related hearing loss. Trends in Neurosciences, 39, 486–497. 争议Pichora-Fuller, M. K. et al. (2016). Hearing impairment and cognitive energy: the FUEL framework. Ear and Hearing, 37, 5S–27S. 最新Personalized and gamified auditory-cognitive training improves speech-in-noise comprehension. npj Science of Learning, 2025. 关键正确率之外的认知代价

围绕听力损失议题,Peelle(2016)把听力损失的隐性语言努力改写成一个分母问题。这项转向最初针对的是老年听者只要复述正确,就被视为语言理解没有受损,额外努力不进结论。沿听力损失议题的责任链,只有让答对却消耗过多努力、事后记忆下降的试次获得可比较位置,旧边界才可能接受反例检验。复算听力损失议题之前,这一步先限定可比较对象,不把缺失值折成零效应。

按听力损失议题的对象表,听力损失的隐性语言努力在Peelle(2016)的材料中只承认正确率之外的认知代价具有决定性。对照听力损失议题的主源,任一不成立都要求改写本项证据的解释。在听力损失议题的实施账本里,本项证据的关键不是增加术语,而是让该复核口径在独立材料和尾部对象上能够被别人复算。对听力损失议题而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

从听力损失议题的材料看,听力损失的隐性语言努力由此区分总体改善、局部反号和平均不变但误差重排3种结果,避免单一汇总值吞掉分布。该研究线索由此把窗口内稳定=长期稳定从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

反对意见主要指向努力读数是否被一般疲劳、助听器适配和任务难度混淆。核查听力损失议题时,Pichora-Fuller(2016)的复核指出:该反向情形。在听力损失议题这条证据链上,此时该复核口径失去原有解释力;而“临床量表承认「听清」不等于「轻松」,但常规验收仍只记录正确字数”又显示,稳定对象也可能由工具制造。对听力损失议题做反向检验,该笔材料只限制外推,不重复充当支持证据。

上述机制还会重排实践的验收顺序:听觉语言研究应同时测正确率、瞳孔、反应时间和延迟记忆,康复不能只追求听清。本项证据进入眼动与脑电实验、听力评估、语言教育和人机交互后,工作流须先保存这些漏记对象,再进行压缩、排名或展示。把听力损失议题放回原窗口,相关更新(2025)提醒,总分不能替代上述分子—分母。

本面板测这一比率,对方检验“窗口内稳定=长期稳定”在另一对象上是否反号;这组账外材料是两边共同漏掉的候选。把听力损失议题放到另见第 233 号第 11 条『种族语言意识形态把“听见错误”改写为听者位置』旁核验:先对齐对象、时间窗和责任人,再检查听力损失议题的核心判断在另一套分母中是否仍同向。

位置E|听力损失议题作环境条件 单因听力损失议题的核心决定项 预设〔01 谁进入分母〕听力损失议题沿用既定对象边界 量纲听力损失议题同向记录数/全部可核对记录数 失效若听力损失议题可由替代机制重现,单因解释撤回 自曝听力损失议题(第19条):原材料未覆盖者需另表 空栏答对 异名另见第 233 号第 11 条『种族语言意识形态把“听见错误”改写为听者位置』

十二、ManyBabies与发展复制ManyBabies Collaboration

提出ManyBabies Consortium (2020). Quantifying sources of variability in infancy research using the infant-directed-speech preference. Advances in Methods and Practices in Psychological Science, 3, 24–52. 争议Byers-Heinlein, K. et al. (2021). A multilab study of bilingual infants. Developmental Science, 24, e13087. 最新ManyBabies Consortium (2024). Best practices for large-scale collaborative infant research. Infancy. 关键实验室层级的可重复性

沿ManyB发展复制的责任链,相关研究(2020)首先定位了ManyBabies与发展复制的历史卡点。该转向真正需要比较的不是一句“是否有效”,而是复制实验室数/全部参与实验室数在材料、群体和版本改变后是否同向。围绕ManyB发展复制,源行把原始命题、边界材料与更新状态分开登记。复算ManyB发展复制之前,这一步先限定可比较对象,不把缺失值折成零效应。

按ManyB发展复制的对象表,ManyBabies与发展复制的单因命题锁定实验室层级的可重复性。相关研究(2020)要求以这一比率检验;失效边界是:当统一材料不适合本地语言时,更严格一致会反过来降低实质可比性。本项证据最怕一个总分,因为中心样本改善时,这些漏记对象可能正以更快速度退出可见范围。对ManyB发展复制而言,可被推翻的责任只落在这一排他性解释;如果替代机制同样预测结果,这项解释就应撤回。

ManyBabies 1由67个实验室完成,最终样本2329名婴儿;统一协议仍保留地点与程序异质性。对照ManyB发展复制的主源,其些读数使该复核口径能够在中心样本、尾部样本与独立材料上分别重算。ManyBabies与发展复制的关键不是增加术语,而是让这一比率在独立材料和尾部对象上能够被别人复算。该研究线索由此把成本可外置而不改变结论从背景假定移到检验台上,使支持者与反对者必须使用同一分母。

尚未收敛的部分是统一协议是否会压掉语言、招募和本地互动方式的差异。在ManyB发展复制的实施账本里,Byers-Heinlein(2021)把边界写成:该反向情形。这时,该复核口径不再支持原方向;提出路线自己还承认“联盟自己显示地点效应和退出率不小,摘要却仍倾向给一个总体效应”。反号因此必须进入主分析。

由此产生的实践后果是:开放复制应保留实验室层级、退出原因和本地适配版本,不把总效应当作唯一结论。在眼动与脑电实验、听力评估、语言教育和人机交互中,应把该未登记群体设为固定字段,并按上述分子—分母发布分层结果。从ManyB发展复制的材料看,相关更新(2024)进一步要求把上述机制的版本、人工修订与这组账外材料的失败记录连成可追踪链。

核查ManyB发展复制时,两边共享“成本可外置而不改变结论”,但本条把上述首因置于决定位置。只有把这一比率换到同一分母并计入该未登记群体,才能判断互证、反号或第三项。把ManyB发展复制放到另见第 138 号第 19 条『新思想 19 · 多实验室联合体 —— 婴儿研究把「一个实验室一个结论」这件事改掉了』旁核验:先对齐对象、时间窗和责任人,再检查ManyB发展复制的核心判断在另一套分母中是否仍同向。

位置D|ManyB发展复制作生成路径 单因ManyB发展复制的核心决定项 预设〔01 谁进入分母〕ManyB发展复制沿用既定对象边界 量纲ManyB发展复制同向记录数/全部可核对记录数 失效若ManyB发展复制可由替代机制重现,单因解释撤回 自曝ManyB发展复制(第20条):原材料未覆盖者需另表 空栏因本地适配失败 异名另见第 138 号第 19 条『新思想 19 · 多实验室联合体 —— 婴儿研究把「一个实验室一个结论」这件事改掉了』

◎ 二十年连起来看

第一条线索是理解从最终答案变成逐词、逐毫秒、逐轮次更新的过程,预测、误读和修复都获得独立读数。

第二条线索是平均听者被拆成双语经验、统计学习、听力老化与语言背景不同的分布,个体差异不再只是噪声。

第三条线索是大模型和脑数据的相似被拆成输出、内部轨迹与因果机制,训练资源也成为比较条件。

◎ 三个常见误解

1. 误解一是“预测就是提前猜中下一个词”。心理语言学中的预测可发生在语义、句法和事件层,具体词未命中不等于没有先验。

2. 误解二是“脑区激活证明某种意义由身体构成”。激活、干预与任务依赖必须分开,具身效应在无动作任务中可能显著减弱。

3. 误解三是“模型越强越像人”。超人记忆和海量暴露可提高总分,却可能降低错误结构与时间过程的类人性。

◎ 与相邻领域的接口

第461号音系学与形态学:声音和词形单位怎样进入在线学习。分工判据是:本块以阅读时、N400、眼动、脑成像、皮层记录与多实验室复制回答语言的时间加工、脑机制、身体条件与互动轮替的内部机制;对方只能在自己的对象与分母上验证同名结构。

第462号句法学:结构预测、噪声通道与花园路径。接口成立的最低条件,是两块分别公开样本进入规则、失败样本和量纲换算;术语相同不能代替阅读时、N400、眼动、脑成像、皮层记录与多实验室复制的证据。

第463号语义学与语用学:含意、前提和共同地面的时间过程。两块的分工线在于:本面板追踪语言的时间加工、脑机制、身体条件与互动轮替,对方追踪另一条路径或条件场;只有方向和分母都可比较时才构成互证。

第467号音乐表演与音乐教育:听动耦合、同步和表演焦虑。若双方的排除规则、版本或授权不同,就必须分别命名结论,并把差异写进眼动与脑电实验、听力评估、语言教育和人机交互的验收表。

◎ 争议现场

预测效应究竟是词前激活还是词后整合;收敛需预注册时间窗,并在脑电、眼动和行为上同材料复现。收敛设计须在阅读时、N400、眼动、脑成像、皮层记录与多实验室复制中使用同一材料、同一排除规则和预注册主量纲,并把反号结果列入主分析。

双语优势是否存在稳定亚型;收敛需连续测量使用场景、社会经济背景和切换需求并公开零效应。在眼动与脑电实验、听力评估、语言教育和人机交互场景中,双方应共同提交数据、代码与盲评方案,预先说明零效应、方向反转和退出样本怎样解释。

大模型脑对齐是否同因;收敛需资源匹配、目标函数对照、因果干预和站外近邻检验。只有跨实验室或跨机构在独立材料上重现效应量及其边界,并公开语言的时间加工、脑机制、身体条件与互动轮替的尾部误差,这场争论才算推进。

◎ 往下五年看什么

2025—2026年的脑—模型层级对应能否在更多语言、自然故事和非侵入大样本中复制。验收读数:跨语言自然故事中的层级对应、独立样本区间和因果干预效应。

多模态轮替模型在遮挡、远程会议、多人对话和文化差异下的错误率是否公开。验收读数:遮挡、远程、多人和跨文化条件下的换人错误率与接管时延。

MECO是否扩展到更多书写系统并解决“词”不可比与本地适配问题。验收读数:新增书写系统、词边界不可比项和本地适配后的眼动预测增益。

老年语言研究是否把听觉努力/正确率之比列为固定结局。验收读数:听觉努力/正确率、不同听力组的尾部差和独立实验室复制率。

◎ 可与哪些领域对撞

本块第八条“会话轮替的跨文化基线”与第467号第十条“网络合奏的时延预算”构成一对。它们共享的预设是“稳定时间窗口可以跨场景直接迁移”。相反点在于:会话轮替把短停顿视为协调信号,网络合奏则可能把同量级时延判为破坏同步。若两边都成立,就必须把任务目的与感知阈值作为第三项纳入,并同时报告“目标语言响应间隔/全部轮替间隔”与“可同步往返时延/一个拍点时长”。

本块第十三条“下一词预测与脑响应对齐”与第470号第十九条“传感器与文物数字孪生”构成一对。它们共享的预设是“表征相似就意味着机制相同”。相反点在于:脑—模型对齐常以预测相关证明接近,数字孪生却要求几何、传感与维护事件共同回写。若两边都成立,就必须把因果干预与版本历史作为第三项纳入,并同时报告“模型脑预测分数/人类数据噪声上限”与“被人工确认的预警数/全部系统预警数”。

本块第七条“双语优势的复制危机”与第306号第十四条“试验外推”构成一对。它们共享的预设是“平均效应可以直接外推到所有人群”。相反点在于:双语优势争议显示使用场景和社会背景会改写方向,试验外推也要求选择可交换性与参与正值性。若两边都成立,就必须把人群选择与效应修饰作为第三项纳入,并同时报告“复制出同方向优势的实验数/全部预注册实验数”与“目标人群有效样本量/原始试验样本量”。

本块第十七条“内部类人、外部超人”与第306号第十一条“因果森林”构成一对。它们共享的预设是“平均准确率能够代表个体层机制”。相反点在于:内部类人、外部超人把轨迹与终点拆开,因果森林也警告真实异质性可能小于估计噪声。若两边都成立,就必须把个体有效样本量与轨迹稳定度作为第三项纳入,并同时报告“内部类人相关/最终输出类人相关”与“样本外处理效应误差/亚组有效样本量”。

◎ 十条可做的研究命题

1. 对同一文本建立个体化语料概率;若不比公共模型更好预测阅读时长,则证伪经验差异的首要地位。

2. 在三种统计学习任务中重复测量;若跨任务相关稳定高于0.5,则证伪任务特异性清算。

3. 预注册多实验室双语研究;若各使用场景均出现同向优势,则证伪复制危机。

4. 把听力校正后正确率相同者按努力分层;若延迟记忆无差异,则证伪隐性代价。

5. 对资源受限与超大模型比较脑对齐;若规模越大始终越类人,则证伪资源匹配。

6. 跨十种语言复制N400冠词预测;若效应稳定接近原始值,则证伪2018边界。

7. 交换摄像机视角测试轮替;若视听模型不降,则证伪视角错配。

8. 让共享脑解码器适配新语言;若跨主体准确率不降,则证伪训练人群限制。

9. 对自然故事换题材重测语义地图;若体素排序稳定,则证伪题材依赖。

10. 统一协议与本地适配协议并行;若实验室异质性相同,则证伪适配价值。

◎ 资料核验

碰撞供料矩阵:碰撞供料矩阵:以下六族均覆盖S、D、E三个位置;第19、20条为位置余量。;02 单一读数代表复杂对象 —— S 甲、惊异度进入逐词加工/D 乙、预测不再等于猜下一个词/E 丙、善意理解与残留误读;17 局部最优可加总为整体最优 —— S 丁、双流语音加工/D 戊、具身语义的动作效应/E 己、词汇巨型实验;19 类别互斥且穷尽 —— S 庚、双语优势的复制危机/D 辛、会话轮替的跨文化基线/E 一、统计学习的个体差异清算;05 平均值代表个体 —— S 二、N400预测效应的大规模复现/D 三、自然语音的皮层语义地图/E 四、跨主体脑语义解码;22 通过形式审查=实质合规 —— S 五、下一词预测与脑响应对齐/D 六、共享计算原则与资源错配/E 七、多语言眼动语料;28 记录存在即可核对 —— S 八、大模型层级与脑时间层级/D 九、内部类人、外部超人/E 十、多模态轮替预测。

  1. Levy, R. (2008). Expectation-based syntactic comprehension. Cognition, 106(3), 1126–1177.
  2. Kuperberg, G. R. & Jaeger, T. F. (2016). What do we mean by prediction in language comprehension? Language, Cognition and Neuroscience, 31(1), 32–59.
  3. Word predictability estimates from language models are not robust. CoNLL 2026, ACL Anthology.
  4. Huettig, F. & Mani, N. (2016). Is prediction necessary to understand language? Trends in Cognitive Sciences, 20(7), 459–461.
  5. Nieuwland, M. S. et al. (2018). Large-scale replication study reveals a limit on probabilistic prediction in language comprehension. eLife, 7, e33468.
  6. Ferreira, F. & Patson, N. D. (2007). The good enough approach to language comprehension. Language and Linguistics Compass, 1, 71–83.
  7. Slattery, T. J. et al. (2013). Lingering misinterpretation in native and nonnative sentence processing. Journal of Memory and Language, 69, 104–120.
  8. Karimi, H. & Ferreira, F. (2024). Good-enough language processing: current evidence and open questions. Psychonomic Bulletin & Review.
  9. Hickok, G. & Poeppel, D. (2007). The cortical organization of speech processing. Nature Reviews Neuroscience, 8, 393–402.
  10. Rauschecker, J. P. & Scott, S. K. (2009). Maps and streams in the auditory cortex. Nature Neuroscience, 12, 718–724.
  11. Mapping the neuronal building blocks of human language. Nature, 2026.
  12. Pulvermüller, F. (2005). Brain mechanisms linking language and action. Nature Reviews Neuroscience, 6, 576–582.
  13. Mahon, B. Z. & Caramazza, A. (2008). A critical look at the embodied cognition hypothesis. Journal of Physiology-Paris, 102, 59–70.
  14. Meteyard, L. et al. (2012). Coming of age: a review of embodiment and the neuroscience of semantics. Cortex, 48, 788–804.
  15. Balota, D. A. et al. (2007). The English Lexicon Project. Behavior Research Methods, 39(3), 445–459.
  16. Keuleers, E. et al. (2012). The British Lexicon Project. Behavior Research Methods, 44, 287–304.
  17. Brysbaert, M. et al. (2024). Megastudy resources and the limits of lexical norms. Behavior Research Methods.
  18. Bialystok, E., Craik, F. I. M. & Luk, G. (2012). Bilingualism: consequences for mind and brain. Trends in Cognitive Sciences, 16, 240–250.
  19. Paap, K. R. & Greenberg, Z. I. (2013). There is no coherent evidence for a bilingual advantage in executive processing. Cognitive Psychology, 66, 232–258.
  20. Lehtonen, M. et al. (2018). Is bilingualism associated with enhanced executive functioning in adults? Psychological Bulletin, 144, 394–425.
  21. Stivers, T. et al. (2009). Universals and cultural variation in turn-taking in conversation. PNAS, 106(26), 10587–10592.
  22. Kendrick, K. H. & Torreira, F. (2015). The timing and construction of preference. Frontiers in Psychology, 6, 284.
  23. Inoue, K. et al. (2024). Multilingual turn-taking prediction using voice activity projection. LREC-COLING 2024.
  24. Siegelman, N., Bogaerts, L. & Frost, R. (2017). Measuring individual differences in statistical learning. Journal of Memory and Language, 95, 144–163.
  25. Arnon, I. (2020). Do current statistical learning tasks capture stable individual differences? Journal of Memory and Language, 112, 104094.
  26. Frost, R. et al. (2024). Reconsidering the measurement of statistical learning. Cognitive Science.
  27. DeLong, K. A., Urbach, T. P. & Kutas, M. (2005). Probabilistic word pre-activation during language comprehension inferred from electrical brain activity. Nature Neuroscience, 8, 1117–1121.
  28. Spurious alignment between large language models and brains can arise from confounds. Nature Communications, 2026.
  29. Huth, A. G. et al. (2016). Natural speech reveals the semantic maps that tile human cerebral cortex. Nature, 532, 453–458.
  30. Wehbe, L. et al. (2014). Simultaneously uncovering the patterns of brain regions involved in different story reading subprocesses. PLoS ONE, 9, e112575.
  31. Contextual feature extraction hierarchies converge in large language models and the brain. Nature Machine Intelligence, 2024.
  32. Pereira, F. et al. (2018). Toward a universal decoder of linguistic meaning from brain activation. Nature Communications, 9, 963.
  33. Toneva, M. & Wehbe, L. (2019). Interpreting and improving natural-language processing models with natural language-processing data. NeurIPS 2019.
  34. Schrimpf, M. et al. (2021). The neural architecture of language: integrative modeling converges on predictive processing. PNAS, 118, e2105646118.
  35. Caucheteux, C. & King, J.-R. (2022). Brains and algorithms partially converge in natural language processing. Communications Biology, 5, 134.
  36. Goldstein, A. et al. (2022). Shared computational principles for language processing in humans and deep language models. Nature Neuroscience, 25, 369–380.
  37. Warstadt, A. et al. (2023). BabyLM challenge: sample-efficient pretraining on a developmentally plausible corpus. CoNLL 2023.
  38. Increasing alignment of large language models with language processing in the human brain. Nature Computational Science, 2025.
  39. Siegelman, N. et al. (2022). Expanding horizons of cross-linguistic research on reading: the Multilingual Eye-movement Corpus. Behavior Research Methods, 54, 2843–2863.
  40. Kuperman, V. et al. (2024). New data on text reading in English as a second language: the wave 2 expansion of MECO. Studies in Second Language Acquisition.
  41. Quantifying word informativeness and its impact on eye-movement control across languages. Behavior Research Methods, 2025.
  42. Temporal structure of natural language processing in the human brain corresponds to layered hierarchy of large language models. Nature Communications, 2025, DOI 10.1038/s41467-025-65518-0.
  43. Incremental accumulation of linguistic context in artificial and biological neural networks. Nature Communications, 2025.
  44. Author Correction: Temporal structure of natural language processing in the human brain corresponds to layered hierarchy of large language models. Nature Communications, 2026.
  45. Kuribayashi, T. et al. (2025). Large Language Models Are Human-Like Internally. Transactions of the ACL, 13, 1743–1766.
  46. Lampinen, A. K. (2023). Can language models handle recursively nested grammatical structures? Cognition, 237, 105429.
  47. Visual Cues Enhance Predictive Turn-Taking for Two-Party Human-Robot Interaction. Findings of ACL 2025.
  48. Ekstedt, E. & Skantze, G. (2022). Voice Activity Projection: self-supervised learning of turn-taking events. Interspeech 2022.
  49. Analysing Next Speaker Prediction in Multi-Party Conversation with Multimodal LLMs. IWSDS 2026.
  50. Peelle, J. E. & Wingfield, A. (2016). The neural consequences of age-related hearing loss. Trends in Neurosciences, 39, 486–497.
  51. Pichora-Fuller, M. K. et al. (2016). Hearing impairment and cognitive energy: the FUEL framework. Ear and Hearing, 37, 5S–27S.
  52. Personalized and gamified auditory-cognitive training improves speech-in-noise comprehension. npj Science of Learning, 2025.
  53. ManyBabies Consortium (2020). Quantifying sources of variability in infancy research using the infant-directed-speech preference. Advances in Methods and Practices in Psychological Science, 3, 24–52.
  54. Byers-Heinlein, K. et al. (2021). A multilab study of bilingual infants. Developmental Science, 24, e13087.
  55. ManyBabies Consortium (2024). Best practices for large-scale collaborative infant research. Infancy.
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行八字段碰撞行(位置/单因/预设/量纲/失效/自曝/空栏/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板