SDE Universes·新思想前沿计算与人工智能
新思想前沿 · 计算与人工智能

基础模型与大语言模型

近二十年与经典层 · 两幕 20 个新思想 + 20 个经典思想 · 约 37,666 字 · 王德生 亲撰 · 2026 年 8 月

基础模型的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。

【第一幕】上一个十年 · 约 2006–2016

第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。

甲、词向量:语言关系被压进连续空间Distributed Word Representations

提出Mikolov、Chen、Corrado、Dean,2013 年 arXiv:1301.3781《Efficient Estimation of Word Representations in Vector Space》。 争议(未见反对;边界:单一词向量把多义词和语境平均,社会偏见也随共现统计进入空间。) 最新(2024—2026年未见直接更新。)。 关键邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算。

起点要放回2013年的Efficient Estimation of Word Representations in Vector Space:Mikolov、Chen、Corrado、Dean不再允许基础模型与大语言模型在词向量上继续为每项语言任务另造专用管线。Mikolov、Chen、Corrado、Dean逐项核对token、语料、提示与外部检索里的词向量;数据来源、推理预算与下游责任由上下文预训练另行登记。在Efficient Estimation of Word Representations in Vector Space的证据账上,由十亿词语料上的skip-gram以较低计算学习类比与语义邻近起步,上下文预训练进入解释对照;本条残差不能靠改名消失。

词向量的可反驳立场是:邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算。Mikolov、Chen、Corrado、Dean这一路线据此把决定性解释锁在一个对象上,上下文预训练的“掩码语言模型和双向上下文可形成可微调的通用语言表示”不能替代本条;边界是单一词向量把多义词和语境平均。若换样本后再问仍不能保持方向,上下文预训练便构成词向量的近邻反例;Efficient Estimation of Word Representations in Vector Space对词向量仅支持原任务。

可核对的主证据是Mikolov、Chen、Corrado、Dean,2013 年 arXiv:1301.3781《Efficient Estimation of Word Representations in Vector Space》:十亿词语料上的skip-gram以较低计算学习类比与语义邻近。skip-gram使用约10亿词训练语料。上下文预训练要求把2013年的词向量样本与对照结算,再核查上下文预训练的任务、观察窗和单一词向量把多义词和语境平均。对词向量,上下文预训练仅作近邻;支点仍是Mikolov、Chen、Corrado、Dean在Efficient Estimation of Word Representations in Vector Space的原始比较。

词向量自己留下的反证入口是:单一词向量把多义词和语境平均,社会偏见也随共现统计进入空间。用正交量纲重测时,Mikolov、Chen、Corrado、Dean的解释可能缩小、反号,或让位给上下文预训练的路径。上下文预训练给出复核Efficient Estimation of Word Representations in Vector Space的近邻条件:把不显著结果一并公开;词向量负责记录中止、排除和不显著对象。回到Efficient Estimation of Word Representations in Vector Space的取样方式,词向量要用上下文预训练证明原分母没有删去最容易失败的对象。

十亿词语料上的skip-gram以较低计算学习类比与语义邻近改变登记顺序:token、语料、提示与外部检索归词向量,数据来源、推理预算与下游责任交上下文预训练核查。2019年的上下文预训练以“掩码语言模型和双向上下文可形成可微调的通用语言表示”作近邻;两者若结论不同,应以单一词向量把多义词和语境平均为分账边界;上下文预训练不得与本条合成一个平均分。

2013年,词向量据十亿词语料上的skip-gram以较低计算学习类比与语义邻近对接第256号第八条。跨过去,单一词向量把多义词和语境平均迫使词向量重新检验可见读数。词向量以单一词向量把多义词和语境平均施加反向压力。该接口若仍支持相反方向,单一词向量把多义词和语境平均要求词向量增加第三条件,同时容纳两边的失效样本。

位置E——它把词向量的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有词向量是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲达到目标质量的任务数/全部单位推理计算预算 失效当单一词向量把多义词和语境平均,主指标越高,边界外保持率反而越低 自曝原始纳入标准首先暴露:单一词向量把多义词和语境平均 空栏词向量中与“单一词向量把多义词和语境平均”有关却未入分母的失败对象 异名另见第256号第八条“分词与文本表示的底层”

乙、序列到序列:翻译由端到端条件生成取代分段管线Sequence-to-Sequence Models

提出Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112。 争议(未见反对;边界:固定状态压缩长句,自动指标也不等于意义忠实与可用性。) 最新(2024—2026年未见直接更新。)。 关键编码器把源序列变成状态,解码器逐词生成目标序列。

真正的断点出现在2014年的NeurIPS:Sutskever、Vinyals、Le不再允许基础模型与大语言模型在序列到序列上继续为每项语言任务另造专用管线。Sutskever、Vinyals、Le逐项核对token、语料、提示与外部检索里的序列到序列;数据来源、推理预算与下游责任由少样本提示另行登记。在NeurIPS的证据账上,由四层LSTM在英语法语任务达到34.8 BLEU起步,少样本提示进入解释对照;本条残差不能靠改名消失。

序列到序列的可反驳立场是:编码器把源序列变成状态,解码器逐词生成目标序列。Sutskever、Vinyals、Le这一路线据此把决定性解释锁在一个对象上,少样本提示的“大规模自回归模型可从提示中的示例改变输出,无需更新权重”不能替代本条;边界是固定状态压缩长句。若把时间窗拉长再看仍不能保持方向,少样本提示便构成序列到序列的近邻反例;NeurIPS对序列到序列仅支持原任务。

可核对的主证据是Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112:四层LSTM在英语法语任务达到34.8 BLEU,并可重排候选翻译。4层LSTM在英法翻译达到34.8 BLEU。少样本提示要求把2014年的序列到序列样本与对照结算,再核查少样本提示的任务、观察窗和固定状态压缩长句。对序列到序列,少样本提示仅作近邻;支点仍是Sutskever、Vinyals、Le在NeurIPS的原始比较。回到NeurIPS的取样方式,序列到序列要用少样本提示证明原分母没有删去最容易失败的对象。

序列到序列自己留下的反证入口是:固定状态压缩长句,自动指标也不等于意义忠实与可用性。撤去界面提示再验时,Sutskever、Vinyals、Le的解释可能缩小、反号,或让位给少样本提示的路径。少样本提示给出复核NeurIPS的近邻条件:按个体轨迹而非均值检查;序列到序列负责记录中止、排除和不显著对象。拿少样本提示作近邻检验,可辨认Sutskever、Vinyals、Le观察到的是独有路径,还是另一条路线的表面同义词。

四层LSTM在英语法语任务达到34.8 BLEU改变登记顺序:token、语料、提示与外部检索归序列到序列,数据来源、推理预算与下游责任交少样本提示核查。2020年的少样本提示以“大规模自回归模型可从提示中的示例改变输出,无需更新权重”作近邻;两者若结论不同,应以固定状态压缩长句为分账边界;少样本提示不得与本条合成一个平均分。

2014年,序列到序列据四层LSTM在英语法语任务达到34.8 BLEU对接第256号第一条。跨过去,固定状态压缩长句迫使序列到序列重新检验可见读数。序列到序列以固定状态压缩长句施加反向压力。该接口若仍支持相反方向,固定状态压缩长句要求序列到序列增加第三条件,同时容纳两边的失效样本。

位置S——它把序列到序列所定义的结构、表示或可判结果当成单独够用的那一样 单因只有序列到序列是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲序列到序列在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当固定状态压缩长句,主指标越高,边界外保持率反而越低 自曝主要终点自己留下:固定状态压缩长句 空栏序列到序列中与“固定状态压缩长句”有关却未入分母的失败对象 异名另见第256号第一条“任务体系的坍缩”

丙、注意力补丁:解码器每一步重新查看源序列Neural Attention

提出Bahdanau、Cho、Bengio,2015 年《ICLR》论文“Neural Machine Translation by Jointly Learning to Align and Translate”。 争议(未见反对;边界:注意权重可帮助检查却不必等同因果解释,多个分布能给出相同输出。) 最新(2024—2026年未见直接更新。)。 关键动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置。

旧账最先在2015年的ICLR:Bahdanau、Cho、Bengio不再允许基础模型与大语言模型在注意力补丁上继续为每项语言任务另造专用管线。Bahdanau、Cho、Bengio逐项核对token、语料、提示与外部检索里的注意力补丁;数据来源、推理预算与下游责任由基础模型命名另行登记。在ICLR的证据账上,由在长句翻译上显著超过固定编码器起步,基础模型命名进入解释对照;本条残差不能靠改名消失。

注意力补丁的可反驳立场是:动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置。Bahdanau、Cho、Bengio这一路线据此把决定性解释锁在一个对象上,基础模型命名的“同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散”不能替代本条;边界是注意权重可帮助检查却不必等同因果解释。若保留失败对象后检验仍不能保持方向,基础模型命名便构成注意力补丁的近邻反例;ICLR对注意力补丁仅支持原任务。

可核对的主证据是Bahdanau、Cho、Bengio,2015 年《ICLR》论文“Neural Machine Translation by Jointly Learning to Align and Translate”:在长句翻译上显著超过固定编码器,并产生可视化对齐矩阵。基础模型命名要求把2015年的注意力补丁样本与对照结算,再核查基础模型命名的任务、观察窗和注意权重可帮助检查却不必等同因果解释。对注意力补丁,基础模型命名仅作近邻;支点仍是Bahdanau、Cho、Bengio在ICLR的原始比较。

注意力补丁自己留下的反证入口是:注意权重可帮助检查却不必等同因果解释,多个分布能给出相同输出。按亚组分别结算时,Bahdanau、Cho、Bengio的解释可能缩小、反号,或让位给基础模型命名的路径。基础模型命名给出复核ICLR的近邻条件:加入反事实条件;注意力补丁负责记录中止、排除和不显著对象。

在长句翻译上显著超过固定编码器改变登记顺序:token、语料、提示与外部检索归注意力补丁,数据来源、推理预算与下游责任交基础模型命名核查。2021年的基础模型命名以“同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散”作近邻;两者若结论不同,应以注意权重可帮助检查却不必等同因果解释为分账边界;基础模型命名不得与本条合成一个平均分。

2015年,注意力补丁据在长句翻译上显著超过固定编码器对接第049号第一幕乙。跨过去,注意权重可帮助检查却不必等同因果解释迫使注意力补丁重新检验可见读数。注意力补丁以注意权重可帮助检查却不必等同因果解释施加反向压力。该接口若仍支持相反方向,注意权重可帮助检查却不必等同因果解释要求注意力补丁增加第三条件,同时容纳两边的失效样本。

位置D——它把注意力补丁的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有注意力补丁是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲遵守任务意图且未触发风险的回答数/全部边界提示数 失效当注意权重可帮助检查却不必等同因果解释,主指标越高,边界外保持率反而越低 自曝配平资源后突出:注意权重可帮助检查却不必等同因果解释 空栏注意力补丁中与“注意权重可帮助检查却不必等同因果解释”有关却未入分母的失败对象 异名另见第049号第一幕乙“梯度显著图:输入微扰对类别分数的局部导数成为解释”

丁、子词建模:开放词表问题被拆成可复用片段Subword Units

提出Sennrich、Haddow、Birch,2016 年《ACL》:1715–1725,DOI 10.18653/v1/P16-1162。 争议(未见反对;边界:切分偏好高资源语言,形态、文字系统和输入成本的不平等仍会进入token账本。) 最新(2024—2026年未见直接更新。)。 关键高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词。

转折并非始于2016年的ACL:Sennrich、Haddow、Birch不再允许基础模型与大语言模型在子词建模上继续为每项语言任务另造专用管线。Sennrich、Haddow、Birch逐项核对token、语料、提示与外部检索里的子词建模;数据来源、推理预算与下游责任由缩放律修订另行登记。在ACL的证据账上,由BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU起步,缩放律修订进入解释对照;本条残差不能靠改名消失。

子词建模的可反驳立场是:高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词。Sennrich、Haddow、Birch这一路线据此把决定性解释锁在一个对象上,缩放律修订的“固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者”不能替代本条;边界是切分偏好高资源语言。若改用地点外资料复核仍不能保持方向,缩放律修订便构成子词建模的近邻反例;ACL对子词建模仅支持原任务。

可核对的主证据是Sennrich、Haddow、Birch,2016 年《ACL》:1715–1725,DOI 10.18653/v1/P16-1162:BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU。BPE在英德、英俄2组翻译方向检验稀有词。缩放律修订要求把2016年的子词建模样本与对照结算,再核查缩放律修订的任务、观察窗和切分偏好高资源语言。对子词建模,缩放律修订仅作近邻;支点仍是Sennrich、Haddow、Birch在ACL的原始比较。回到ACL的取样方式,子词建模要用缩放律修订证明原分母没有删去最容易失败的对象。

子词建模自己留下的反证入口是:切分偏好高资源语言,形态、文字系统和输入成本的不平等仍会进入token账本。改变任务顺序后追踪时,Sennrich、Haddow、Birch的解释可能缩小、反号,或让位给缩放律修订的路径。缩放律修订给出复核ACL的近邻条件:用盲法重跑关键判断;子词建模负责记录中止、排除和不显著对象。

BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU改变登记顺序:token、语料、提示与外部检索归子词建模,数据来源、推理预算与下游责任交缩放律修订核查。2022年的缩放律修订以“固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者”作近邻;两者若结论不同,应以切分偏好高资源语言为分账边界;缩放律修订不得与本条合成一个平均分。

2016年,子词建模据BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU对接第256号第八条。跨过去,切分偏好高资源语言迫使子词建模重新检验可见读数。子词建模以切分偏好高资源语言施加反向压力。该接口若仍支持相反方向,切分偏好高资源语言要求子词建模增加第三条件,同时容纳两边的失效样本。

位置E——它把子词建模的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有子词建模是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲子词建模在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当切分偏好高资源语言,主指标越高,边界外保持率反而越低 自曝作者在方法附录承认:切分偏好高资源语言 空栏子词建模中与“切分偏好高资源语言”有关却未入分母的失败对象 异名另见第256号第八条“分词与文本表示的底层”

戊、GloVe:全局共现与局部预测被放进同一目标Global Vectors

提出Pennington、Socher、Manning,2014 年《EMNLP》:1532–1543,DOI 10.3115/v1/D14-1162。 争议(未见反对;边界:静态表示仍把历史语料偏见固化为几何距离,更新新义也需重训。) 最新(2024—2026年未见直接更新。)。 关键词与词的共现比率携带语义关系,可由加权矩阵分解学习。

问题的入口是2014年的EMNLP:Pennington、Socher、Manning不再允许基础模型与大语言模型在基础模型与大语言模型里的GloVe上继续为每项语言任务另造专用管线。Pennington、Socher、Manning逐项核对token、语料、提示与外部检索里的基础模型与大语言模型里的GloVe;数据来源、推理预算与下游责任由指令调优另行登记。在EMNLP的证据账上,由在类比、相似度和命名实体任务上以较少训练获得强表示起步,指令调优进入解释对照;本条残差不能靠改名消失。

基础模型与大语言模型里的GloVe的可反驳立场是:词与词的共现比率携带语义关系,可由加权矩阵分解学习。Pennington、Socher、Manning这一路线据此把决定性解释锁在一个对象上,指令调优的“对多任务自然语言指令微调可提高未见任务的零样本执行”不能替代本条;边界是静态表示仍把历史语料偏见固化为几何距离。若让替代路径进入对照仍不能保持方向,指令调优便构成基础模型与大语言模型里的GloVe的近邻反例;EMNLP对基础模型与大语言模型里的GloVe仅支持原任务。

可核对的主证据是Pennington、Socher、Manning,2014 年《EMNLP》:1532–1543,DOI 10.3115/v1/D14-1162:在类比、相似度和命名实体任务上以较少训练获得强表示。GloVe在6项相似度与类比基准上比较。指令调优要求把2014年的基础模型与大语言模型里的GloVe样本与对照结算,再核查指令调优的任务、观察窗和静态表示仍把历史语料偏见固化为几何距离。对基础模型与大语言模型里的GloVe,指令调优仅作近邻;支点仍是Pennington、Socher、Manning在EMNLP的原始比较。

基础模型与大语言模型里的GloVe自己留下的反证入口是:静态表示仍把历史语料偏见固化为几何距离,更新新义也需重训。让独立团队预注册时,Pennington、Socher、Manning的解释可能缩小、反号,或让位给指令调优的路径。指令调优给出复核EMNLP的近邻条件:将短期与长期拆账;基础模型与大语言模型里的GloVe负责记录中止、排除和不显著对象。

在类比、相似度和命名实体任务上以较少训练获得强表示改变登记顺序:token、语料、提示与外部检索归基础模型与大语言模型里的GloVe,数据来源、推理预算与下游责任交指令调优核查。2022年的指令调优以“对多任务自然语言指令微调可提高未见任务的零样本执行”作近邻;两者若结论不同,应以静态表示仍把历史语料偏见固化为几何距离为分账边界;指令调优不得与本条合成一个平均分。

2014年,基础模型与大语言模型里的GloVe据在类比、相似度和命名实体任务上以较少训练获得强表示对接第256号第八条。跨过去,静态表示仍把历史语料偏见固化为几何距离迫使基础模型与大语言模型里的GloVe重新检验可见读数。基础模型与大语言模型里的GloVe以静态表示仍把历史语料偏见固化为几何距离施加反向压力。该接口若仍支持相反方向,静态表示仍把历史语料偏见固化为几何距离要求基础模型与大语言模型里的GloVe增加第三条件,同时容纳两边的失效样本。

位置S——它把基础模型与大语言模型里的GloVe所定义的结构、表示或可判结果当成单独够用的那一样 单因只有基础模型与大语言模型里的GloVe是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲基础模型与大语言模型里的GloVe在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当静态表示仍把历史语料偏见固化为几何距离,主指标越高,边界外保持率反而越低 自曝换到独立样本时暴露:静态表示仍把历史语料偏见固化为几何距离 空栏基础模型与大语言模型里的GloVe中与“静态表示仍把历史语料偏见固化为几何距离”有关却未入分母的失败对象 异名另见第256号第八条“分词与文本表示的底层”

己、神经机器翻译系统化:端到端模型第一次进入大规模服务GNMT at Scale

提出Wu 等,2016 年 arXiv:1609.08144《Google’s Neural Machine Translation System》。 争议(未见反对;边界:高资源语对改善不能外推低资源语言,平均人工分掩盖实体和数字错误。) 最新(2024—2026年未见直接更新。)。 关键残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统。

先看被改写的对象2016年的Google’s Neural Machine Translation System:Wu 等不再允许基础模型与大语言模型在神经机器翻译系统化上继续为每项语言任务另造专用管线。Wu 等逐项核对token、语料、提示与外部检索里的神经机器翻译系统化;数据来源、推理预算与下游责任由人类反馈对齐另行登记。在Google’s Neural Machine Translation System的证据账上,由在WMT英语法语与英语西班牙语上将人工评分错误降低约60%起步,人类反馈对齐进入解释对照;本条残差不能靠改名消失。

神经机器翻译系统化的可反驳立场是:残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统。Wu 等这一路线据此把决定性解释锁在一个对象上,人类反馈对齐的“人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好”不能替代本条;边界是高资源语对改善不能外推低资源语言。若把排除者放回分母仍不能保持方向,人类反馈对齐便构成神经机器翻译系统化的近邻反例;Google’s Neural Machine Translation System对神经机器翻译系统化仅支持原任务。

可核对的主证据是Wu 等,2016 年 arXiv:1609.08144《Google’s Neural Machine Translation System》:在WMT英语法语与英语西班牙语上将人工评分错误降低约60%。人类反馈对齐要求把2016年的神经机器翻译系统化样本与对照结算,再核查人类反馈对齐的任务、观察窗和高资源语对改善不能外推低资源语言。对神经机器翻译系统化,人类反馈对齐仅作近邻;支点仍是Wu 等在Google’s Neural Machine Translation System的原始比较。

神经机器翻译系统化自己留下的反证入口是:高资源语对改善不能外推低资源语言,平均人工分掩盖实体和数字错误。把不显著结果一并公开时,Wu 等的解释可能缩小、反号,或让位给人类反馈对齐的路径。人类反馈对齐给出复核Google’s Neural Machine Translation System的近邻条件:把人工接管计入结果;神经机器翻译系统化负责记录中止、排除和不显著对象。

在WMT英语法语与英语西班牙语上将人工评分错误降低约60%改变登记顺序:token、语料、提示与外部检索归神经机器翻译系统化,数据来源、推理预算与下游责任交人类反馈对齐核查。2022年的人类反馈对齐以“人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好”作近邻;两者若结论不同,应以高资源语对改善不能外推低资源语言为分账边界;人类反馈对齐不得与本条合成一个平均分。

2016年,神经机器翻译系统化据在WMT英语法语与英语西班牙语上将人工评分错误降低约60%对接第043号第一幕辛。跨过去,高资源语对改善不能外推低资源语言迫使神经机器翻译系统化重新检验可见读数。神经机器翻译系统化以高资源语对改善不能外推低资源语言施加反向压力。该接口若仍支持相反方向,高资源语对改善不能外推低资源语言要求神经机器翻译系统化增加第三条件,同时容纳两边的失效样本。

位置D——它把神经机器翻译系统化的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有神经机器翻译系统化是决定因素 预设〔17 局部最优可加总为整体最优〕单项性能会自然形成系统收益 量纲神经机器翻译系统化在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当高资源语对改善不能外推低资源语言,主指标越高,边界外保持率反而越低 自曝消融或假对照提醒:高资源语对改善不能外推低资源语言 空栏神经机器翻译系统化中与“高资源语对改善不能外推低资源语言”有关却未入分母的失败对象 异名另见第043号第一幕辛“开源框架:计算图与自动微分把复现成本降到团队可承受”

庚、阅读理解基准:模型被要求从段落中定位答案Machine Reading Benchmarks

提出Rajpurkar、Zhang、Lopyrev、Liang,2016 年《EMNLP》:2383–2392,DOI 10.18653/v1/D16-1264。 争议(未见反对;边界:答案都在段落且问题由段落反向生成,捷径与标注边界限制“理解”解释。) 最新(2024—2026年未见直接更新。)。 关键问答把语言表示从句级分类推进到条件检索和答案跨度预测。

争论应从2016年的EMNLP:Rajpurkar、Zhang、Lopyrev、Liang不再允许基础模型与大语言模型在阅读理解基准上继续为每项语言任务另造专用管线。Rajpurkar、Zhang、Lopyrev、Liang逐项核对token、语料、提示与外部检索里的阅读理解基准;数据来源、推理预算与下游责任由检索增强另行登记。在EMNLP的证据账上,由SQuAD含十万余问答对起步,检索增强进入解释对照;本条残差不能靠改名消失。

阅读理解基准的可反驳立场是:问答把语言表示从句级分类推进到条件检索和答案跨度预测。Rajpurkar、Zhang、Lopyrev、Liang这一路线据此把决定性解释锁在一个对象上,检索增强的“生成时检索可更新的文档库,让事实知识不必全部固化在参数中”不能替代本条;边界是答案都在段落且问题由段落反向生成。若固定资源预算后比较仍不能保持方向,检索增强便构成阅读理解基准的近邻反例;EMNLP对阅读理解基准仅支持原任务。

可核对的主证据是Rajpurkar、Zhang、Lopyrev、Liang,2016 年《EMNLP》:2383–2392,DOI 10.18653/v1/D16-1264:SQuAD含十万余问答对,统一了训练与人机比较。SQuAD初版含10万余个问答对。检索增强要求把2016年的阅读理解基准样本与对照结算,再核查检索增强的任务、观察窗和答案都在段落且问题由段落反向生成。对阅读理解基准,检索增强仅作近邻;支点仍是Rajpurkar、Zhang、Lopyrev、Liang在EMNLP的原始比较。回到EMNLP的取样方式,阅读理解基准要用检索增强证明原分母没有删去最容易失败的对象。

阅读理解基准自己留下的反证入口是:答案都在段落且问题由段落反向生成,捷径与标注边界限制“理解”解释。按个体轨迹而非均值检查时,Rajpurkar、Zhang、Lopyrev、Liang的解释可能缩小、反号,或让位给检索增强的路径。检索增强给出复核EMNLP的近邻条件:审计数据近邻与泄漏;阅读理解基准负责记录中止、排除和不显著对象。

SQuAD含十万余问答对改变登记顺序:token、语料、提示与外部检索归阅读理解基准,数据来源、推理预算与下游责任交检索增强核查。2020年的检索增强以“生成时检索可更新的文档库,让事实知识不必全部固化在参数中”作近邻;两者若结论不同,应以答案都在段落且问题由段落反向生成为分账边界;检索增强不得与本条合成一个平均分。

2016年,阅读理解基准据SQuAD含十万余问答对对接第256号第三条。跨过去,答案都在段落且问题由段落反向生成迫使阅读理解基准重新检验可见读数。阅读理解基准以答案都在段落且问题由段落反向生成施加反向压力。该接口若仍支持相反方向,答案都在段落且问题由段落反向生成要求阅读理解基准增加第三条件,同时容纳两边的失效样本。

位置E——它把阅读理解基准的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有阅读理解基准是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲能由给定来源支持的事实陈述数/全部事实陈述数 失效当答案都在段落且问题由段落反向生成,主指标越高,边界外保持率反而越低 自曝长期随访没有保留:答案都在段落且问题由段落反向生成 空栏阅读理解基准中与“答案都在段落且问题由段落反向生成”有关却未入分母的失败对象 异名另见第256号第三条“评测的构念效度危机”

辛、并行训练准备:数据并行让亿级参数成为日常工程Large-Scale Distributed Training

提出Dean 等,2012 年《NeurIPS》25:1223–1231。 争议(未见反对;边界:异步陈旧梯度与基础设施成本不进入单一精度,规模优势会集中于少数机构。) 最新(2024—2026年未见直接更新。)。 关键异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模。

历史坐标落在2012年的NeurIPS:Dean 等不再允许基础模型与大语言模型在并行训练准备上继续为每项语言任务另造专用管线。Dean 等逐项核对token、语料、提示与外部检索里的并行训练准备;数据来源、推理预算与下游责任由视觉语言对齐另行登记。在NeurIPS的证据账上,由DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练起步,视觉语言对齐进入解释对照;本条残差不能靠改名消失。

并行训练准备的可反驳立场是:异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模。Dean 等这一路线据此把决定性解释锁在一个对象上,视觉语言对齐的“大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移”不能替代本条;边界是异步陈旧梯度与基础设施成本不进入单一精度。若用正交量纲重测仍不能保持方向,视觉语言对齐便构成并行训练准备的近邻反例;NeurIPS对并行训练准备仅支持原任务。

可核对的主证据是Dean 等,2012 年《NeurIPS》25:1223–1231:DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练。DistBelief展示十亿级参数的分布式训练。视觉语言对齐要求把2012年的并行训练准备样本与对照结算,再核查视觉语言对齐的任务、观察窗和异步陈旧梯度与基础设施成本不进入单一精度。对并行训练准备,视觉语言对齐仅作近邻;支点仍是Dean 等在NeurIPS的原始比较。

并行训练准备自己留下的反证入口是:异步陈旧梯度与基础设施成本不进入单一精度,规模优势会集中于少数机构。加入反事实条件时,Dean 等的解释可能缩小、反号,或让位给视觉语言对齐的路径。视觉语言对齐给出复核NeurIPS的近邻条件:先登记停止线再部署;并行训练准备负责记录中止、排除和不显著对象。

DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练改变登记顺序:token、语料、提示与外部检索归并行训练准备,数据来源、推理预算与下游责任交视觉语言对齐核查。2021年的视觉语言对齐以“大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移”作近邻;两者若结论不同,应以异步陈旧梯度与基础设施成本不进入单一精度为分账边界;视觉语言对齐不得与本条合成一个平均分。

2012年,并行训练准备据DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练对接第251号第十一条。跨过去,异步陈旧梯度与基础设施成本不进入单一精度迫使并行训练准备重新检验可见读数。并行训练准备以异步陈旧梯度与基础设施成本不进入单一精度施加反向压力。该接口若仍支持相反方向,异步陈旧梯度与基础设施成本不进入单一精度要求并行训练准备增加第三条件,同时容纳两边的失效样本。

位置S——它把并行训练准备所定义的结构、表示或可判结果当成单独够用的那一样 单因只有并行训练准备是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲达到目标质量的任务数/全部单位推理计算预算 失效当异步陈旧梯度与基础设施成本不进入单一精度,主指标越高,边界外保持率反而越低 自曝不同站点之间显出:异步陈旧梯度与基础设施成本不进入单一精度 空栏并行训练准备中与“异步陈旧梯度与基础设施成本不进入单一精度”有关却未入分母的失败对象 异名另见第251号第十一条“数据中心作为一台计算机”
【第二幕】这个十年 · 约 2016–2026

第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。

一、Transformer:注意力把序列训练变成高度并行The Transformer

提出Vaswani 等,2017 年《NeurIPS》30:5998–6008。 争议(未见反对;边界:二次注意力成本、位置表示和数据饥渴没有消失;架构并非全部系统。) 最新(2024—2026年未见直接更新。)。 关键自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐。

第一处裂缝来自2017年的NeurIPS:Vaswani 等不再允许基础模型与大语言模型在基础模型与大语言模型里的Transformer上继续为每项语言任务另造专用管线。Vaswani 等逐项核对token、语料、提示与外部检索里的基础模型与大语言模型里的Transformer;数据来源、推理预算与下游责任由多模态通用接口另行登记。在NeurIPS的证据账上,由在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型起步,多模态通用接口进入解释对照;本条残差不能靠改名消失。

基础模型与大语言模型里的Transformer的可反驳立场是:自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐。Vaswani 等这一路线据此把决定性解释锁在一个对象上,多模态通用接口的“冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态”不能替代本条;边界是二次注意力成本、位置表示和数据饥渴没有消失。若撤去界面提示再验仍不能保持方向,多模态通用接口便构成基础模型与大语言模型里的Transformer的近邻反例;NeurIPS对基础模型与大语言模型里的Transformer仅支持原任务。

可核对的主证据是Vaswani 等,2017 年《NeurIPS》30:5998–6008:在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型。Transformer在WMT14英德翻译达到28.4 BLEU。多模态通用接口要求把2017年的基础模型与大语言模型里的Transformer样本与对照结算,再核查多模态通用接口的任务、观察窗和二次注意力成本、位置表示和数据饥渴没有消失。对基础模型与大语言模型里的Transformer,多模态通用接口仅作近邻;支点仍是Vaswani 等在NeurIPS的原始比较。

基础模型与大语言模型里的Transformer自己留下的反证入口是:二次注意力成本、位置表示和数据饥渴没有消失;架构并非全部系统。用盲法重跑关键判断时,Vaswani 等的解释可能缩小、反号,或让位给多模态通用接口的路径。多模态通用接口给出复核NeurIPS的近邻条件:换样本后再问;基础模型与大语言模型里的Transformer负责记录中止、排除和不显著对象。

在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型改变登记顺序:token、语料、提示与外部检索归基础模型与大语言模型里的Transformer,数据来源、推理预算与下游责任交多模态通用接口核查。2022年的多模态通用接口以“冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态”作近邻;两者若结论不同,应以二次注意力成本、位置表示和数据饥渴没有消失为分账边界;多模态通用接口不得与本条合成一个平均分。

2017年,基础模型与大语言模型里的Transformer据在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型对接第043号第二幕四。跨过去,二次注意力成本、位置表示和数据饥渴没有消失迫使基础模型与大语言模型里的Transformer重新检验可见读数。基础模型与大语言模型里的Transformer以二次注意力成本、位置表示和数据饥渴没有消失施加反向压力。该接口若仍支持相反方向,二次注意力成本、位置表示和数据饥渴没有消失要求基础模型与大语言模型里的Transformer增加第三条件,同时容纳两边的失效样本。

位置S——它把基础模型与大语言模型里的Transformer所定义的结构、表示或可判结果当成单独够用的那一样 单因只有基础模型与大语言模型里的Transformer是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲达到目标质量的任务数/全部单位推理计算预算 失效当二次注意力成本、位置表示和数据饥渴没有消失,主指标越高,边界外保持率反而越低 自曝失败试次放回分母后看到:二次注意力成本、位置表示和数据饥渴没有消失 空栏基础模型与大语言模型里的Transformer中与“二次注意力成本、位置表示和数据饥渴没有消失”有关却未入分母的失败对象 异名另见第043号第二幕四“神经缩放律:损失随模型、数据和计算呈近似幂律”

二、上下文预训练:同一个词随句子获得不同表示Contextual Pretraining

提出Devlin、Chang、Lee、Toutanova,2019 年《NAACL》:4171–4186,DOI 10.18653/v1/N19-1423。 争议(未见反对;边界:预训练目标与使用目标不同,基准提升仍可能来自语料记忆和表面线索。) 最新(2024—2026年未见直接更新。)。 关键掩码语言模型和双向上下文可形成可微调的通用语言表示。

研究单位改在2019年的NAACL:Devlin、Chang、Lee、Toutanova不再允许基础模型与大语言模型在上下文预训练上继续为每项语言任务另造专用管线。Devlin、Chang、Lee、Toutanova逐项核对token、语料、提示与外部检索里的上下文预训练;数据来源、推理预算与下游责任由混合专家另行登记。在NAACL的证据账上,由BERT在十一项自然语言理解任务刷新结果起步,混合专家进入解释对照;本条残差不能靠改名消失。

上下文预训练的可反驳立场是:掩码语言模型和双向上下文可形成可微调的通用语言表示。Devlin、Chang、Lee、Toutanova这一路线据此把决定性解释锁在一个对象上,混合专家的“稀疏路由使参数量增长与每token计算部分解耦”不能替代本条;边界是预训练目标与使用目标不同。若按亚组分别结算仍不能保持方向,混合专家便构成上下文预训练的近邻反例;NAACL对上下文预训练仅支持原任务。

可核对的主证据是Devlin、Chang、Lee、Toutanova,2019 年《NAACL》:4171–4186,DOI 10.18653/v1/N19-1423:BERT在十一项自然语言理解任务刷新结果,少量任务头即可迁移。BERT在11项自然语言理解任务上复测迁移。混合专家要求把2019年的上下文预训练样本与对照结算,再核查混合专家的任务、观察窗和预训练目标与使用目标不同。对上下文预训练,混合专家仅作近邻;支点仍是Devlin、Chang、Lee、Toutanova在NAACL的原始比较。

上下文预训练自己留下的反证入口是:预训练目标与使用目标不同,基准提升仍可能来自语料记忆和表面线索。将短期与长期拆账时,Devlin、Chang、Lee、Toutanova的解释可能缩小、反号,或让位给混合专家的路径。混合专家给出复核NAACL的近邻条件:把时间窗拉长再看;上下文预训练负责记录中止、排除和不显著对象。回到NAACL的取样方式,上下文预训练要用混合专家证明原分母没有删去最容易失败的对象。

BERT在十一项自然语言理解任务刷新结果改变登记顺序:token、语料、提示与外部检索归上下文预训练,数据来源、推理预算与下游责任交混合专家核查。2022年的混合专家以“稀疏路由使参数量增长与每token计算部分解耦”作近邻;两者若结论不同,应以预训练目标与使用目标不同为分账边界;混合专家不得与本条合成一个平均分。

2019年,上下文预训练据BERT在十一项自然语言理解任务刷新结果对接第043号第二幕二。跨过去,预训练目标与使用目标不同迫使上下文预训练重新检验可见读数。上下文预训练以预训练目标与使用目标不同施加反向压力。该接口若仍支持相反方向,预训练目标与使用目标不同要求上下文预训练增加第三条件,同时容纳两边的失效样本。

位置D——它把上下文预训练的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有上下文预训练是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲上下文预训练在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当预训练目标与使用目标不同,主指标越高,边界外保持率反而越低 自曝切换评价口径便会看到:预训练目标与使用目标不同 空栏上下文预训练中与“预训练目标与使用目标不同”有关却未入分母的失败对象 异名另见第043号第二幕二“掩码自编码:预测缺失部分取代逐对样本比较”

三、少样本提示:任务说明开始进入上下文本身In-Context Few-Shot Learning

提出Brown 等,2020 年《NeurIPS》33:1877–1901。 争议(未见反对;边界:提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。) 最新(2024—2026年未见直接更新。)。 关键大规模自回归模型可从提示中的示例改变输出,无需更新权重。

回到原始设计2020年的NeurIPS:Brown 等不再允许基础模型与大语言模型在少样本提示上继续为每项语言任务另造专用管线。Brown 等逐项核对token、语料、提示与外部检索里的少样本提示;数据来源、推理预算与下游责任由测试时计算另行登记。在NeurIPS的证据账上,由GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善起步,测试时计算进入解释对照;本条残差不能靠改名消失。

少样本提示的可反驳立场是:大规模自回归模型可从提示中的示例改变输出,无需更新权重。Brown 等这一路线据此把决定性解释锁在一个对象上,测试时计算的“固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界”不能替代本条;边界是提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。若改变任务顺序后追踪仍不能保持方向,测试时计算便构成少样本提示的近邻反例;NeurIPS对少样本提示仅支持原任务。

可核对的主证据是Brown 等,2020 年《NeurIPS》33:1877–1901:GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善。测试时计算要求把2020年的少样本提示样本与对照结算,再核查测试时计算的任务、观察窗和提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。对少样本提示,测试时计算仅作近邻;支点仍是Brown 等在NeurIPS的原始比较。

少样本提示自己留下的反证入口是:提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。把人工接管计入结果时,Brown 等的解释可能缩小、反号,或让位给测试时计算的路径。测试时计算给出复核NeurIPS的近邻条件:保留失败对象后检验;少样本提示负责记录中止、排除和不显著对象。

GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善改变登记顺序:token、语料、提示与外部检索归少样本提示,数据来源、推理预算与下游责任交测试时计算核查。2024年的测试时计算以“固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界”作近邻;两者若结论不同,应以提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分为分账边界;测试时计算不得与本条合成一个平均分。

2020年,少样本提示据GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善对接第256号第二条。跨过去,提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分迫使少样本提示重新检验可见读数。少样本提示以提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分施加反向压力。该接口若仍支持相反方向,提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分要求少样本提示增加第三条件,同时容纳两边的失效样本。

位置E——它把少样本提示的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有少样本提示是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲少样本提示在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分,主指标越高,边界外保持率反而越低 自曝训练分布之外出现:提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分 空栏少样本提示中与“提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分”有关却未入分母的失败对象 异名另见第256号第二条“上下文学习”

四、基础模型命名:一次训练成为许多系统的共同上游Foundation Models

提出Bommasani 等,2021 年 arXiv:2108.07258《On the Opportunities and Risks of Foundation Models》。 争议(未见反对;边界:宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。) 最新Dubey 等,2024 年 arXiv:2407.21783《The Llama 3 Herd of Models》。 关键同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散。

这一路线先拆掉2021年的On the Opportunities and Risks of Foundation Models:Bommasani 等不再允许基础模型与大语言模型在基础模型命名上继续为每项语言任务另造专用管线。Bommasani 等逐项核对token、语料、提示与外部检索里的基础模型命名;数据来源、推理预算与下游责任由词向量另行登记。在On the Opportunities and Risks of Foundation Models的证据账上,由报告把同质化、涌现、适配和社会影响放在共同研究议程起步,词向量进入解释对照;本条残差不能靠改名消失。

基础模型命名的可反驳立场是:同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散。Bommasani 等这一路线据此把决定性解释锁在一个对象上,词向量的“邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算”不能替代本条;边界是宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。若让独立团队预注册仍不能保持方向,词向量便构成基础模型命名的近邻反例;On the Opportunities and Risks of Foundation Models对基础模型命名仅支持原任务。

可核对的主证据是Bommasani 等,2021 年 arXiv:2108.07258《On the Opportunities and Risks of Foundation Models》:报告把同质化、涌现、适配和社会影响放在共同研究议程。词向量要求把2021年的基础模型命名样本与对照结算,再核查词向量的任务、观察窗和宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。对基础模型命名,词向量仅作近邻;支点仍是Bommasani 等在On the Opportunities and Risks of Foundation Models的原始比较。

基础模型命名自己留下的反证入口是:宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。审计数据近邻与泄漏时,Bommasani 等的解释可能缩小、反号,或让位给词向量的路径。词向量给出复核On the Opportunities and Risks of Foundation Models的近邻条件:改用地点外资料复核;基础模型命名负责记录中止、排除和不显著对象。

报告把同质化、涌现、适配和社会影响放在共同研究议程改变登记顺序:token、语料、提示与外部检索归基础模型命名,数据来源、推理预算与下游责任交词向量核查。2013年的词向量以“邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算”作近邻;两者若结论不同,应以宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别为分账边界;词向量不得与本条合成一个平均分。

2021年,基础模型命名据报告把同质化、涌现、适配和社会影响放在共同研究议程对接第048号第二幕十一。跨过去,宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别迫使基础模型命名重新检验可见读数。基础模型命名以宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别施加反向压力。该接口若仍支持相反方向,宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别要求基础模型命名增加第三条件,同时容纳两边的失效样本。

位置S——它把基础模型命名所定义的结构、表示或可判结果当成单独够用的那一样 单因只有基础模型命名是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲基础模型命名在未见语言任务上正确迁移的任务数/全部预注册任务数 失效当宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别,主指标越高,边界外保持率反而越低 自曝参数识别检验告诉我们:宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别 空栏基础模型命名中与“宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别”有关却未入分母的失败对象 异名另见第048号第二幕十一“治理落地:模型卡把限制写进发布接口”

五、缩放律修订:模型与数据要按计算预算共同增长Compute-Optimal Scaling

提出Hoffmann 等,2022 年《NeurIPS》35:30016–30030。 争议(未见反对;边界:训练损失最优不等于推理成本、数据权利和下游风险最优。) 最新(2024—2026年未见直接更新。)。 关键固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者。

需要先恢复2022年的NeurIPS:Hoffmann 等不再允许基础模型与大语言模型在缩放律修订上继续为每项语言任务另造专用管线。Hoffmann 等逐项核对token、语料、提示与外部检索里的缩放律修订;数据来源、推理预算与下游责任由序列到序列另行登记。在NeurIPS的证据账上,由Chinchilla以700亿参数和1.4万亿token超过更大模型起步,序列到序列进入解释对照;本条残差不能靠改名消失。

缩放律修订的可反驳立场是:固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者。Hoffmann 等这一路线据此把决定性解释锁在一个对象上,序列到序列的“编码器把源序列变成状态,解码器逐词生成目标序列”不能替代本条;边界是训练损失最优不等于推理成本、数据权利和下游风险最优。若把不显著结果一并公开仍不能保持方向,序列到序列便构成缩放律修订的近邻反例;NeurIPS对缩放律修订仅支持原任务。

可核对的主证据是Hoffmann 等,2022 年《NeurIPS》35:30016–30030:Chinchilla以700亿参数和1.4万亿token超过更大模型,重写训练预算。Chinchilla用700亿参数和1.4万亿token重排计算预算。序列到序列要求把2022年的缩放律修订样本与对照结算,再核查序列到序列的任务、观察窗和训练损失最优不等于推理成本、数据权利和下游风险最优。对缩放律修订,序列到序列仅作近邻;支点仍是Hoffmann 等在NeurIPS的原始比较。

缩放律修订自己留下的反证入口是:训练损失最优不等于推理成本、数据权利和下游风险最优。先登记停止线再部署时,Hoffmann 等的解释可能缩小、反号,或让位给序列到序列的路径。序列到序列给出复核NeurIPS的近邻条件:让替代路径进入对照;缩放律修订负责记录中止、排除和不显著对象。

Chinchilla以700亿参数和1.4万亿token超过更大模型改变登记顺序:token、语料、提示与外部检索归缩放律修订,数据来源、推理预算与下游责任交序列到序列核查。2014年的序列到序列以“编码器把源序列变成状态,解码器逐词生成目标序列”作近邻;两者若结论不同,应以训练损失最优不等于推理成本、数据权利和下游风险最优为分账边界;序列到序列不得与本条合成一个平均分。

2022年,缩放律修订据Chinchilla以700亿参数和1.4万亿token超过更大模型对接第047号第二幕九。跨过去,训练损失最优不等于推理成本、数据权利和下游风险最优迫使缩放律修订重新检验可见读数。缩放律修订以训练损失最优不等于推理成本、数据权利和下游风险最优施加反向压力。该接口若仍支持相反方向,训练损失最优不等于推理成本、数据权利和下游风险最优要求缩放律修订增加第三条件,同时容纳两边的失效样本。

位置D——它把缩放律修订的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有缩放律修订是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲达到目标质量的任务数/全部单位推理计算预算 失效当训练损失最优不等于推理成本、数据权利和下游风险最优,主指标越高,边界外保持率反而越低 自曝任务重测把弱点定位为:训练损失最优不等于推理成本、数据权利和下游风险最优 空栏缩放律修订中与“训练损失最优不等于推理成本、数据权利和下游风险最优”有关却未入分母的失败对象 异名另见第047号第二幕九“涌现争论:离散指标可把平滑变化画成突然跳跃”

六、指令调优:任务集合把语言模型改造成可调用接口Instruction Tuning

提出Wei 等,2022 年《ICLR》论文“Finetuned Language Models Are Zero-Shot Learners”。 争议(未见反对;边界:任务措辞和模板覆盖决定迁移,遵循指令也不等于事实可靠。) 最新(2024—2026年未见直接更新。)。 关键对多任务自然语言指令微调可提高未见任务的零样本执行。

证据链从2022年的ICLR:Wei 等不再允许基础模型与大语言模型在指令调优上继续为每项语言任务另造专用管线。Wei 等逐项核对token、语料、提示与外部检索里的指令调优;数据来源、推理预算与下游责任由注意力补丁另行登记。在ICLR的证据账上,由FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译起步,注意力补丁进入解释对照;本条残差不能靠改名消失。

指令调优的可反驳立场是:对多任务自然语言指令微调可提高未见任务的零样本执行。Wei 等这一路线据此把决定性解释锁在一个对象上,注意力补丁的“动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置”不能替代本条;边界是任务措辞和模板覆盖决定迁移。若按个体轨迹而非均值检查仍不能保持方向,注意力补丁便构成指令调优的近邻反例;ICLR对指令调优仅支持原任务。

可核对的主证据是Wei 等,2022 年《ICLR》论文“Finetuned Language Models Are Zero-Shot Learners”:FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译。注意力补丁要求把2022年的指令调优样本与对照结算,再核查注意力补丁的任务、观察窗和任务措辞和模板覆盖决定迁移。对指令调优,注意力补丁仅作近邻;支点仍是Wei 等在ICLR的原始比较。

指令调优自己留下的反证入口是:任务措辞和模板覆盖决定迁移,遵循指令也不等于事实可靠。换样本后再问时,Wei 等的解释可能缩小、反号,或让位给注意力补丁的路径。注意力补丁给出复核ICLR的近邻条件:把排除者放回分母;指令调优负责记录中止、排除和不显著对象。回到ICLR的取样方式,指令调优要用注意力补丁证明原分母没有删去最容易失败的对象。

FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译改变登记顺序:token、语料、提示与外部检索归指令调优,数据来源、推理预算与下游责任交注意力补丁核查。2015年的注意力补丁以“动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置”作近邻;两者若结论不同,应以任务措辞和模板覆盖决定迁移为分账边界;注意力补丁不得与本条合成一个平均分。

2022年,指令调优据FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译对接第256号第一条。跨过去,任务措辞和模板覆盖决定迁移迫使指令调优重新检验可见读数。指令调优以任务措辞和模板覆盖决定迁移施加反向压力。该接口若仍支持相反方向,任务措辞和模板覆盖决定迁移要求指令调优增加第三条件,同时容纳两边的失效样本。

位置E——它把指令调优的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有指令调优是决定因素 预设〔17 局部最优可加总为整体最优〕单项性能会自然形成系统收益 量纲遵守任务意图且未触发风险的回答数/全部边界提示数 失效当任务措辞和模板覆盖决定迁移,主指标越高,边界外保持率反而越低 自曝横跨人群后原结论暴露:任务措辞和模板覆盖决定迁移 空栏指令调优中与“任务措辞和模板覆盖决定迁移”有关却未入分母的失败对象 异名另见第256号第一条“任务体系的坍缩”

七、人类反馈对齐:偏好模型把“有用”变成可优化奖励RLHF for Instruction Following

提出Ouyang 等,2022 年《NeurIPS》35:27730–27744。 争议(未见反对;边界:标注者分布、提示集与奖励代理决定“对齐”含义,迎合可能替代真实帮助。) 最新OpenAI,2024 年 arXiv:2412.16720《Deliberative Alignment》。 关键人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好。

决定性变化始于2022年的NeurIPS:Ouyang 等不再允许基础模型与大语言模型在人类反馈对齐上继续为每项语言任务另造专用管线。Ouyang 等逐项核对token、语料、提示与外部检索里的人类反馈对齐;数据来源、推理预算与下游责任由子词建模另行登记。在NeurIPS的证据账上,由1.3B InstructGPT的人评偏好超过175B基础模型起步,子词建模进入解释对照;本条残差不能靠改名消失。

人类反馈对齐的可反驳立场是:人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好。Ouyang 等这一路线据此把决定性解释锁在一个对象上,子词建模的“高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词”不能替代本条;边界是标注者分布、提示集与奖励代理决定“对齐”含义。若加入反事实条件仍不能保持方向,子词建模便构成人类反馈对齐的近邻反例;NeurIPS对人类反馈对齐仅支持原任务。

可核对的主证据是Ouyang 等,2022 年《NeurIPS》35:27730–27744:1.3B InstructGPT的人评偏好超过175B基础模型,并降低部分有害输出。1.3B参数的InstructGPT在人评中胜过175B基础模型。子词建模要求把2022年的人类反馈对齐样本与对照结算,再核查子词建模的任务、观察窗和标注者分布、提示集与奖励代理决定“对齐”含义。对人类反馈对齐,子词建模仅作近邻;支点仍是Ouyang 等在NeurIPS的原始比较。

人类反馈对齐自己留下的反证入口是:标注者分布、提示集与奖励代理决定“对齐”含义,迎合可能替代真实帮助。把时间窗拉长再看时,Ouyang 等的解释可能缩小、反号,或让位给子词建模的路径。子词建模给出复核NeurIPS的近邻条件:固定资源预算后比较;人类反馈对齐负责记录中止、排除和不显著对象。

1.3B InstructGPT的人评偏好超过175B基础模型改变登记顺序:token、语料、提示与外部检索归人类反馈对齐,数据来源、推理预算与下游责任交子词建模核查。2016年的子词建模以“高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词”作近邻;两者若结论不同,应以标注者分布、提示集与奖励代理决定“对齐”含义为分账边界;子词建模不得与本条合成一个平均分。

2022年,人类反馈对齐据1.3B InstructGPT的人评偏好超过175B基础模型对接第048号第二幕四。跨过去,标注者分布、提示集与奖励代理决定“对齐”含义迫使人类反馈对齐重新检验可见读数。人类反馈对齐以标注者分布、提示集与奖励代理决定“对齐”含义施加反向压力。该接口若仍支持相反方向,标注者分布、提示集与奖励代理决定“对齐”含义要求人类反馈对齐增加第三条件,同时容纳两边的失效样本。

位置D——它把人类反馈对齐的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有人类反馈对齐是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲遵守任务意图且未触发风险的回答数/全部边界提示数 失效当标注者分布、提示集与奖励代理决定“对齐”含义,主指标越高,边界外保持率反而越低 自曝误差分解把漏项指向:标注者分布、提示集与奖励代理决定“对齐”含义 空栏人类反馈对齐中与“标注者分布、提示集与奖励代理决定“对齐”含义”有关却未入分母的失败对象 异名另见第048号第二幕四“宪法式监督:规则集可生成自我批评与偏好数据”

八、检索增强:知识可从参数外部查询并保留出处Retrieval-Augmented Generation

提出Lewis 等,2020 年《NeurIPS》33:9459–9474。 争议(未见反对;边界:召回失败、恶意文档和引用错配会把错误从生成器移到检索链。) 最新(2024—2026年未见直接更新。)。 关键生成时检索可更新的文档库,让事实知识不必全部固化在参数中。

最早被迫重写的是2020年的NeurIPS:Lewis 等不再允许基础模型与大语言模型在检索增强上继续为每项语言任务另造专用管线。Lewis 等逐项核对token、语料、提示与外部检索里的检索增强;数据来源、推理预算与下游责任由基础模型与大语言模型里的GloVe另行登记。在NeurIPS的证据账上,由RAG在开放域问答提高事实性与可追溯性起步,基础模型与大语言模型里的GloVe进入解释对照;本条残差不能靠改名消失。

检索增强的可反驳立场是:生成时检索可更新的文档库,让事实知识不必全部固化在参数中。Lewis 等这一路线据此把决定性解释锁在一个对象上,基础模型与大语言模型里的GloVe的“词与词的共现比率携带语义关系,可由加权矩阵分解学习”不能替代本条;边界是召回失败、恶意文档和引用错配会把错误从生成器移到检索链。若用盲法重跑关键判断仍不能保持方向,基础模型与大语言模型里的GloVe便构成检索增强的近邻反例;NeurIPS对检索增强仅支持原任务。

可核对的主证据是Lewis 等,2020 年《NeurIPS》33:9459–9474:RAG在开放域问答提高事实性与可追溯性,并能更换索引而不重训。基础模型与大语言模型里的GloVe要求把2020年的检索增强样本与对照结算,再核查基础模型与大语言模型里的GloVe的任务、观察窗和召回失败、恶意文档和引用错配会把错误从生成器移到检索链。对检索增强,基础模型与大语言模型里的GloVe仅作近邻;支点仍是Lewis 等在NeurIPS的原始比较。

检索增强自己留下的反证入口是:召回失败、恶意文档和引用错配会把错误从生成器移到检索链。保留失败对象后检验时,Lewis 等的解释可能缩小、反号,或让位给基础模型与大语言模型里的GloVe的路径。基础模型与大语言模型里的GloVe给出复核NeurIPS的近邻条件:用正交量纲重测;检索增强负责记录中止、排除和不显著对象。

RAG在开放域问答提高事实性与可追溯性改变登记顺序:token、语料、提示与外部检索归检索增强,数据来源、推理预算与下游责任交基础模型与大语言模型里的GloVe核查。2014年的基础模型与大语言模型里的GloVe以“词与词的共现比率携带语义关系,可由加权矩阵分解学习”作近邻;两者若结论不同,应以召回失败、恶意文档和引用错配会把错误从生成器移到检索链为分账边界;基础模型与大语言模型里的GloVe不得与本条合成一个平均分。

2020年,检索增强据RAG在开放域问答提高事实性与可追溯性对接第256号第九条。跨过去,召回失败、恶意文档和引用错配会把错误从生成器移到检索链迫使检索增强重新检验可见读数。检索增强以召回失败、恶意文档和引用错配会把错误从生成器移到检索链施加反向压力。该接口若仍支持相反方向,召回失败、恶意文档和引用错配会把错误从生成器移到检索链要求检索增强增加第三条件,同时容纳两边的失效样本。

位置E——它把检索增强的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有检索增强是决定因素 预设〔04 测量不改变被测对象〕记录、提示与界面不会回写行为 量纲能由给定来源支持的事实陈述数/全部事实陈述数 失效当召回失败、恶意文档和引用错配会把错误从生成器移到检索链,主指标越高,边界外保持率反而越低 自曝开放材料使外部团队发现:召回失败、恶意文档和引用错配会把错误从生成器移到检索链 空栏检索增强中与“召回失败、恶意文档和引用错配会把错误从生成器移到检索链”有关却未入分母的失败对象 异名另见第256号第九条“检索增强生成”

九、视觉语言对齐:图文对成为开放词汇分类器Contrastive Language–Image Pretraining

提出Radford 等,2021 年《ICML》139:8748–8763。 争议(未见反对;边界:网络图文偏见、文本提示和数据记忆决定结果,罕见文化对象覆盖不足。) 最新(2024—2026年未见直接更新。)。 关键大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移。

这一条先处理2021年的ICML:Radford 等不再允许基础模型与大语言模型在视觉语言对齐上继续为每项语言任务另造专用管线。Radford 等逐项核对token、语料、提示与外部检索里的视觉语言对齐;数据来源、推理预算与下游责任由神经机器翻译系统化另行登记。在ICML的证据账上,由CLIP在三十余数据集零样本评估中接近有监督基线起步,神经机器翻译系统化进入解释对照;本条残差不能靠改名消失。

视觉语言对齐的可反驳立场是:大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移。Radford 等这一路线据此把决定性解释锁在一个对象上,神经机器翻译系统化的“残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统”不能替代本条;边界是网络图文偏见、文本提示和数据记忆决定结果。若将短期与长期拆账仍不能保持方向,神经机器翻译系统化便构成视觉语言对齐的近邻反例;ICML对视觉语言对齐仅支持原任务。

可核对的主证据是Radford 等,2021 年《ICML》139:8748–8763:CLIP在三十余数据集零样本评估中接近有监督基线,并可开放词汇检索。CLIP在30余个数据集做零样本评测。神经机器翻译系统化要求把2021年的视觉语言对齐样本与对照结算,再核查神经机器翻译系统化的任务、观察窗和网络图文偏见、文本提示和数据记忆决定结果。对视觉语言对齐,神经机器翻译系统化仅作近邻;支点仍是Radford 等在ICML的原始比较。

视觉语言对齐自己留下的反证入口是:网络图文偏见、文本提示和数据记忆决定结果,罕见文化对象覆盖不足。改用地点外资料复核时,Radford 等的解释可能缩小、反号,或让位给神经机器翻译系统化的路径。神经机器翻译系统化给出复核ICML的近邻条件:撤去界面提示再验;视觉语言对齐负责记录中止、排除和不显著对象。

CLIP在三十余数据集零样本评估中接近有监督基线改变登记顺序:token、语料、提示与外部检索归视觉语言对齐,数据来源、推理预算与下游责任交神经机器翻译系统化核查。2016年的神经机器翻译系统化以“残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统”作近邻;两者若结论不同,应以网络图文偏见、文本提示和数据记忆决定结果为分账边界;神经机器翻译系统化不得与本条合成一个平均分。

2021年,视觉语言对齐据CLIP在三十余数据集零样本评估中接近有监督基线对接第050号第二幕四。跨过去,网络图文偏见、文本提示和数据记忆决定结果迫使视觉语言对齐重新检验可见读数。视觉语言对齐以网络图文偏见、文本提示和数据记忆决定结果施加反向压力。该接口若仍支持相反方向,网络图文偏见、文本提示和数据记忆决定结果要求视觉语言对齐增加第三条件,同时容纳两边的失效样本。

位置S——它把视觉语言对齐所定义的结构、表示或可判结果当成单独够用的那一样 单因只有视觉语言对齐是决定因素 预设〔07 训练分布代表部署分布〕未见环境仍服从原样本边界 量纲遵守任务意图且未触发风险的回答数/全部边界提示数 失效当网络图文偏见、文本提示和数据记忆决定结果,主指标越高,边界外保持率反而越低 自曝一次真正的边界检验显示:网络图文偏见、文本提示和数据记忆决定结果 空栏视觉语言对齐中与“网络图文偏见、文本提示和数据记忆决定结果”有关却未入分母的失败对象 异名另见第050号第二幕四“视觉语言合流:自然语言把封闭类别表打开”

十、多模态通用接口:文本、图像、音频被放进同一交互回路Multimodal Foundation Models

提出Alayrac 等,2022 年《NeurIPS》35:23716–23736《Flamingo》。 争议(未见反对;边界:语言先验会在未看清图像时猜答案;多模态分数需拆开感知与推理。) 最新Liang 等,2024 年 arXiv:2407.03418《Holistic Evaluation of Multimodal Foundation Models》。 关键冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态。

原论文正面碰到2022年的NeurIPS:Alayrac 等不再允许基础模型与大语言模型在多模态通用接口上继续为每项语言任务另造专用管线。Alayrac 等逐项核对token、语料、提示与外部检索里的多模态通用接口;数据来源、推理预算与下游责任由阅读理解基准另行登记。在NeurIPS的证据账上,由Flamingo用少样本提示在多项图像与视频任务达到强结果起步,阅读理解基准进入解释对照;本条残差不能靠改名消失。

多模态通用接口的可反驳立场是:冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态。Alayrac 等这一路线据此把决定性解释锁在一个对象上,阅读理解基准的“问答把语言表示从句级分类推进到条件检索和答案跨度预测”不能替代本条;边界是语言先验会在未看清图像时猜答案。若把人工接管计入结果仍不能保持方向,阅读理解基准便构成多模态通用接口的近邻反例;NeurIPS对多模态通用接口仅支持原任务。

可核对的主证据是Alayrac 等,2022 年《NeurIPS》35:23716–23736《Flamingo》:Flamingo用少样本提示在多项图像与视频任务达到强结果。阅读理解基准要求把2022年的多模态通用接口样本与对照结算,再核查阅读理解基准的任务、观察窗和语言先验会在未看清图像时猜答案。对多模态通用接口,阅读理解基准仅作近邻;支点仍是Alayrac 等在NeurIPS的原始比较。

多模态通用接口自己留下的反证入口是:语言先验会在未看清图像时猜答案;多模态分数需拆开感知与推理。让替代路径进入对照时,Alayrac 等的解释可能缩小、反号,或让位给阅读理解基准的路径。阅读理解基准给出复核NeurIPS的近邻条件:按亚组分别结算;多模态通用接口负责记录中止、排除和不显著对象。

Flamingo用少样本提示在多项图像与视频任务达到强结果改变登记顺序:token、语料、提示与外部检索归多模态通用接口,数据来源、推理预算与下游责任交阅读理解基准核查。2016年的阅读理解基准以“问答把语言表示从句级分类推进到条件检索和答案跨度预测”作近邻;两者若结论不同,应以语言先验会在未看清图像时猜答案为分账边界;阅读理解基准不得与本条合成一个平均分。

2022年,多模态通用接口据Flamingo用少样本提示在多项图像与视频任务达到强结果对接第050号第二幕十。跨过去,语言先验会在未看清图像时猜答案迫使多模态通用接口重新检验可见读数。多模态通用接口以语言先验会在未看清图像时猜答案施加反向压力。该接口若仍支持相反方向,语言先验会在未看清图像时猜答案要求多模态通用接口增加第三条件,同时容纳两边的失效样本。

位置D——它把多模态通用接口的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有多模态通用接口是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲跨模态证据一致的回答数/全部跨模态问题数 失效当语言先验会在未看清图像时猜答案,结论只留在原任务内 自曝部署或临床记录反证:语言先验会在未看清图像时猜答案 空栏多模态通用接口中与“语言先验会在未看清图像时猜答案”有关却未入分母的失败对象 异名另见第050号第二幕十“多模态VLM:视觉问答必须把看见与推理分账”

十一、混合专家:每个token只调用部分参数Sparse Mixture of Experts

提出Fedus、Zoph、Shazeer,2022 年《JMLR》23(120):1–39。 争议(未见反对;边界:负载不均、路由不稳和通信开销会吞掉理论效率,专家分工也未必可解释。) 最新(2024—2026年未见直接更新。)。 关键稀疏路由使参数量增长与每token计算部分解耦。

方法转向发生在2022年的JMLR:Fedus、Zoph、Shazeer不再允许基础模型与大语言模型在混合专家上继续为每项语言任务另造专用管线。Fedus、Zoph、Shazeer逐项核对token、语料、提示与外部检索里的混合专家;数据来源、推理预算与下游责任由并行训练准备另行登记。在JMLR的证据账上,由Switch Transformer把模型扩到万亿参数起步,并行训练准备进入解释对照;本条残差不能靠改名消失。

混合专家的可反驳立场是:稀疏路由使参数量增长与每token计算部分解耦。Fedus、Zoph、Shazeer这一路线据此把决定性解释锁在一个对象上,并行训练准备的“异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模”不能替代本条;边界是负载不均、路由不稳和通信开销会吞掉理论效率。若审计数据近邻与泄漏仍不能保持方向,并行训练准备便构成混合专家的近邻反例;JMLR对混合专家仅支持原任务。

可核对的主证据是Fedus、Zoph、Shazeer,2022 年《JMLR》23(120):1–39:Switch Transformer把模型扩到万亿参数,同时保持近似固定计算。Switch Transformer把总参数扩到万亿量级。并行训练准备要求把2022年的混合专家样本与对照结算,再核查并行训练准备的任务、观察窗和负载不均、路由不稳和通信开销会吞掉理论效率。对混合专家,并行训练准备仅作近邻;支点仍是Fedus、Zoph、Shazeer在JMLR的原始比较。

混合专家自己留下的反证入口是:负载不均、路由不稳和通信开销会吞掉理论效率,专家分工也未必可解释。把排除者放回分母时,Fedus、Zoph、Shazeer的解释可能缩小、反号,或让位给并行训练准备的路径。并行训练准备给出复核JMLR的近邻条件:改变任务顺序后追踪;混合专家负责记录中止、排除和不显著对象。

Switch Transformer把模型扩到万亿参数改变登记顺序:token、语料、提示与外部检索归混合专家,数据来源、推理预算与下游责任交并行训练准备核查。2012年的并行训练准备以“异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模”作近邻;两者若结论不同,应以负载不均、路由不稳和通信开销会吞掉理论效率为分账边界;并行训练准备不得与本条合成一个平均分。

2022年,混合专家据Switch Transformer把模型扩到万亿参数对接第043号第二幕九。跨过去,负载不均、路由不稳和通信开销会吞掉理论效率迫使混合专家重新检验可见读数。混合专家以负载不均、路由不稳和通信开销会吞掉理论效率施加反向压力。该接口若仍支持相反方向,负载不均、路由不稳和通信开销会吞掉理论效率要求混合专家增加第三条件,同时容纳两边的失效样本。

位置E——它把混合专家的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有混合专家是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲达到目标质量的任务数/全部单位推理计算预算 失效当负载不均、路由不稳和通信开销会吞掉理论效率,结论只留在原任务内 自曝不显著结果没有消失而是说明:负载不均、路由不稳和通信开销会吞掉理论效率 空栏混合专家中与“负载不均、路由不稳和通信开销会吞掉理论效率”有关却未入分母的失败对象 异名另见第043号第二幕九“效率独立成题:准确率要除以能耗、内存与延迟”

十二、测试时计算:答案质量开始由推理阶段预算调节Test-Time Compute

提出Snell、Lee、Xu、Kumar,2024 年 arXiv:2408.03314《Scaling LLM Test-Time Compute Optimally》。 争议(未见反对;边界:验证器错误和任务可判定性决定收益;更长思维链也可能只是更长的自信错误。) 最新Guo 等,2025 年 arXiv:2501.12948《DeepSeek-R1》。 关键固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界。

这项工作首先校正2024年的Scaling LLM Test-Time Compute Optimally:Snell、Lee、Xu、Kumar不再允许基础模型与大语言模型在测试时计算上继续为每项语言任务另造专用管线。Snell、Lee、Xu、Kumar逐项核对token、语料、提示与外部检索里的测试时计算;数据来源、推理预算与下游责任由基础模型与大语言模型里的Transformer另行登记。在Scaling LLM Test-Time Compute Optimally的证据账上,由在数学任务上起步,基础模型与大语言模型里的Transformer进入解释对照;本条残差不能靠改名消失。

测试时计算的可反驳立场是:固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界。Snell、Lee、Xu、Kumar这一路线据此把决定性解释锁在一个对象上,基础模型与大语言模型里的Transformer的“自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐”不能替代本条;边界是验证器错误和任务可判定性决定收益。若先登记停止线再部署仍不能保持方向,基础模型与大语言模型里的Transformer便构成测试时计算的近邻反例;Scaling LLM Test-Time Compute Optimally对测试时计算仅支持原任务。

可核对的主证据是Snell、Lee、Xu、Kumar,2024 年 arXiv:2408.03314《Scaling LLM Test-Time Compute Optimally》:在数学任务上,合适的测试时策略可超过单纯扩大基础模型的计算收益。基础模型与大语言模型里的Transformer要求把2024年的测试时计算样本与对照结算,再核查基础模型与大语言模型里的Transformer的任务、观察窗和验证器错误和任务可判定性决定收益。对测试时计算,基础模型与大语言模型里的Transformer仅作近邻;支点仍是Snell、Lee、Xu、Kumar在Scaling LLM Test-Time Compute Optimally的原始比较。

测试时计算自己留下的反证入口是:验证器错误和任务可判定性决定收益;更长思维链也可能只是更长的自信错误。固定资源预算后比较时,Snell、Lee、Xu、Kumar的解释可能缩小、反号,或让位给基础模型与大语言模型里的Transformer的路径。基础模型与大语言模型里的Transformer给出复核Scaling LLM Test-Time Compute Optimally的近邻条件:让独立团队预注册;测试时计算负责记录中止、排除和不显著对象。

在数学任务上改变登记顺序:token、语料、提示与外部检索归测试时计算,数据来源、推理预算与下游责任交基础模型与大语言模型里的Transformer核查。2017年的基础模型与大语言模型里的Transformer以“自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐”作近邻;两者若结论不同,应以验证器错误和任务可判定性决定收益为分账边界;基础模型与大语言模型里的Transformer不得与本条合成一个平均分。

2024年,测试时计算据在数学任务上对接第251号第十三条。跨过去,验证器错误和任务可判定性决定收益迫使测试时计算重新检验可见读数。测试时计算以验证器错误和任务可判定性决定收益施加反向压力。该接口若仍支持相反方向,验证器错误和任务可判定性决定收益要求测试时计算增加第三条件,同时容纳两边的失效样本。

位置S——它把测试时计算所定义的结构、表示或可判结果当成单独够用的那一样 单因只有测试时计算是决定因素 预设〔17 局部最优可加总为整体最优〕单项性能会自然形成系统收益 量纲达到目标质量的任务数/全部单位推理计算预算 失效当验证器错误和任务可判定性决定收益,结论只留在原任务内 自曝近期复核仍保留的自我否定是:验证器错误和任务可判定性决定收益 空栏测试时计算中与“验证器错误和任务可判定性决定收益”有关却未入分母的失败对象 异名另见第251号第十三条“为推理而生的系统层”

◎ 二十年连起来看

第一幕不是旧成果清单,而是基础模型与大语言模型第一次为自己建立可失败的比较尺。词向量收紧了旧默认,子词建模把隐含过程拆成可估参数,并行训练准备又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。

第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。基础模型与大语言模型里的Transformer扩展了表示或分布,人类反馈对齐改变了研究单位,测试时计算则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。

二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。注意力补丁说明干预能改变路径,基础模型命名说明单一读数会混合层级,多模态通用接口又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。

◎ 三个常见误解

误解一:序列到序列已经给出了稳定的通用解释。它容易取信,是因为编码器把源序列变成状态,解码器逐词生成目标序列确实改变了旧的研究方式。但固定状态压缩长句,自动指标也不等于意义忠实与可用性,所以正确表述只能限于原设计可识别的那一段责任链。

误解二:少样本提示等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但大规模自回归模型可从提示中的示例改变输出,无需更新权重仍只是一个可检验命题。提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分说明,没有干预、替代解释和边界样本,可读不等于因果正确。

误解三:混合专家的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把负载不均、路由不稳和通信开销会吞掉理论效率,专家分工也未必可解释藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。

◎ 与相邻领域的接口

词向量与第256号第八条“分词与文本表示的底层”的分工在于:本页负责邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。

阅读理解基准可与第256号第三条“评测的构念效度危机”交换制度或工程中的回写证据。前者的核心命题是问答把语言表示从句级分类推进到条件检索和答案跨度预测,但答案都在段落且问题由段落反向生成,捷径与标注边界限制“理解”解释;后者则能检验同一接口是否把选择成本转移给了另一个主体。

检索增强与第256号第九条“检索增强生成”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用召回失败、恶意文档和引用错配会把错误从生成器移到检索链给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。

◎ 争议现场

基础模型与大语言模型里的GloVe的争议是静态表示仍把历史语料偏见固化为几何距离,更新新义也需重训。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。

基础模型命名的争议是宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。

多模态通用接口的争议是语言先验会在未看清图像时猜答案;多模态分数需拆开感知与推理。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。

◎ 往下五年看什么

到2031年,看基础模型与大语言模型里的Transformer的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。

看缩放律修订在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。

看视觉语言对齐的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。

看测试时计算的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。

◎ 可与哪些领域对撞

词向量与第256号第八条“分词与文本表示的底层”共享“可见读数能代表真实对象”的预设。本条用单一词向量把多义词和语境平均,社会偏见也随共现统计进入空间给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。

并行训练准备与第251号第十一条“数据中心作为一台计算机”共享“局部表现能够结算整体能力”的预设。并行训练准备主张异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。

检索增强与第256号第九条“检索增强生成”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是召回失败、恶意文档和引用错配会把错误从生成器移到检索链。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。

◎ 十条可做的研究命题

  1. 在时间外数据上重做词向量;方向保持率低于二分之一即证伪其稳定性。
  2. 把序列到序列的中止与排除对象放回分母;主效应反号即否定原总结。
  3. 为注意力补丁配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
  4. 由独立团队预注册子词建模的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
  5. 对基础模型与大语言模型里的GloVe的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
  6. 主动改变神经机器翻译系统化的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
  7. 对少样本提示做反事实干预;可视化不随关键参数变化即证伪忠实性。
  8. 把人类反馈对齐交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
  9. 公开混合专家的最强失败实现;下一方法只在原基准改善即判定为换题。
  10. 为测试时计算事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。

◎ 资料核验

  1. Mikolov、Chen、Corrado、Dean,2013 年 arXiv:1301.3781《Efficient Estimation of Word Representations in Vector Space》。
  2. Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112。
  3. Bahdanau、Cho、Bengio,2015 年《ICLR》论文“Neural Machine Translation by Jointly Learning to Align and Translate”。
  4. Sennrich、Haddow、Birch,2016 年《ACL》:1715–1725,DOI 10.18653/v1/P16-1162。
  5. Pennington、Socher、Manning,2014 年《EMNLP》:1532–1543,DOI 10.3115/v1/D14-1162。
  6. Wu 等,2016 年 arXiv:1609.08144《Google’s Neural Machine Translation System》。
  7. Rajpurkar、Zhang、Lopyrev、Liang,2016 年《EMNLP》:2383–2392,DOI 10.18653/v1/D16-1264。
  8. Dean 等,2012 年《NeurIPS》25:1223–1231。
  9. Vaswani 等,2017 年《NeurIPS》30:5998–6008。
  10. Devlin、Chang、Lee、Toutanova,2019 年《NAACL》:4171–4186,DOI 10.18653/v1/N19-1423。
  11. Brown 等,2020 年《NeurIPS》33:1877–1901。
  12. Bommasani 等,2021 年 arXiv:2108.07258《On the Opportunities and Risks of Foundation Models》。
  13. Hoffmann 等,2022 年《NeurIPS》35:30016–30030。
  14. Wei 等,2022 年《ICLR》论文“Finetuned Language Models Are Zero-Shot Learners”。
  15. Ouyang 等,2022 年《NeurIPS》35:27730–27744。
  16. Lewis 等,2020 年《NeurIPS》33:9459–9474。
  17. Radford 等,2021 年《ICML》139:8748–8763。
  18. Alayrac 等,2022 年《NeurIPS》35:23716–23736《Flamingo》。
  19. Fedus、Zoph、Shazeer,2022 年《JMLR》23(120):1–39。
  20. Snell、Lee、Xu、Kumar,2024 年 arXiv:2408.03314《Scaling LLM Test-Time Compute Optimally》。
  21. Dubey 等,2024 年 arXiv:2407.21783《The Llama 3 Herd of Models》。
  22. Guo 等,2025 年 arXiv:2501.12948《DeepSeek-R1》。
  23. OpenAI,2024 年 arXiv:2412.16720《Deliberative Alignment》。
  24. Liang 等,2024 年 arXiv:2407.03418《Holistic Evaluation of Multimodal Foundation Models》。
  25. Peters、Neumann、Iyyer 等,2018 年《NAACL》:2227–2237,DOI 10.18653/v1/N18-1202。
  26. Raffel、Shazeer、Roberts 等,2020 年《JMLR》21(140):1–67。
  27. Wei 等,2022 年《NeurIPS》35:24824–24837。
【学科经典思想汇集部分】1950–2006 · 20 条经典学科思想

以下二十条是基础模型与大语言模型在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。

经一、机器翻译备忘录:一份把整件事低估了四十年的提案Classic 01 · Foundation Models and LLMs

提出Warren Weaver,1949 年备忘录于 1955 年正式刊入《机器翻译》文集(Technology Press)。 流变其密码破译式的类比支撑了第一代词对词系统;1966 年的 ALPAC 报告据实际效果切断了大部分经费。 今用本块乙「序列到序列:翻译由端到端条件生成取代分段管线」是同一目标在七十年后的兑现方式。 关键翻译可被视为解码问题:一篇俄文本质上是被编了码的英文,可用统计与密码学方法还原。

这份提案的价值在于它第一次把翻译规定成可计算的问题,而不是艺术。它提出的三条线索——统计规律、语言共性、逻辑推理——此后各自长成一整片研究领域。它也促成了第一批实际系统与第一批公开演示,把这件事从设想推进到可被检验的阶段。

低估同样彻底。密码类比默认信息在编码中完整保留,只是被打乱;而语言之间大量的东西是不可逆丢失或必须由语境补出的。这一误判在十几年后由 ALPAC 报告结算:质量远低于承诺,经费大幅削减。这一条示范了一件事——问题的可计算化与它的可解性,是两回事;把一件事写成方程,不保证方程里的量都存在。

位置S——它把「翻译即解码」这一次类比当成单独够用的那一样 预设〔01 信息在编码中守恒〕默认源语言中的全部内容在目标语言中有对应可还原项 量纲源文中被判定可还原的信息项数∶须由语境或世界知识补出的信息项数 失效当大量内容必须由上下文补出而非从源文还原时,解码模型不足以刻画任务 异名信息论称「有损信道」,翻译研究称「不可译性」;另见本块乙

经二、短语结构与转换:语言能力被写成一套可枚举的规则Classic 02 · Foundation Models and LLMs

提出Noam Chomsky,1957 年《句法结构》(Mouton)。 流变形式语言层级成为计算机科学的基础;而「靠规则写出全部合法句」在工程上被统计方法逐步取代。 今用本块甲「词向量:语言关系被压进连续空间」走的是与规则枚举完全相反的一条路。 关键自然语言的句法可由有限的规则集递归生成无限多合法句子,且不能由有限状态机充分刻画。

这本书同时立起了两样东西:一个关于人类语言能力的理论主张,和一套形式语言的层级。后者对计算机科学的影响甚至比对语言学更持久——编译器、正则表达式与解析算法都建立在这套层级上。它把「什么样的机器能处理什么样的语言」变成了可证明的问题。

工程上的分歧出在生成方向。规则路线要求把合法性写完,而真实语言里的合法性是渐变的、带概率的、随语域漂移的。统计方法放弃了写完,改为从语料估计倾向。此后半个世纪的胜负很清楚,但值得注意的是分歧点不在「语言有没有结构」,而在「结构该被写下来还是被估计出来」。

位置D——它把「一套可枚举的生成规则」当成单独够用的那一样 预设〔02 合法性是二值的〕默认一个句子要么合法要么不合法,不存在程度 量纲规则集判为合法的句子数∶母语者实际接受的句子数 失效当可接受性随语域与频率连续变化时,二值判定无法覆盖边界,规则集须无限增补 异名形式语言理论称「乔姆斯基层级」,法学称「成文法的漏洞」;另见本块甲

经三、分布假说:一个词的意思,看它常和谁一起出现Classic 03 · Foundation Models and LLMs

提出Zellig Harris,1954 年《语言》10:146–162;John Firth 于 1957 年给出那句广为引用的表述。 流变从共现计数到潜在语义分析,再到神经词向量与上下文表示,操作化方式换了三代而假说本身未变。 今用本块二「上下文预训练:同一个词随句子获得不同表示」是这条假说被推到极致的形态。 关键词义可由其在语料中的分布特征刻画,分布相似的词在意义上也相近。

这条假说的好处是它把语义变成了可计数的东西:不需要定义「意思」是什么,只需要统计谁和谁一起出现。整个计算语义学建立在这一步上,而它成立到什么程度,至今仍是这个领域最根本的经验问题。

它的边界同样清楚。分布相似不区分同义与反义——「好」与「坏」出现的位置高度相似;它也抓不到指称,语料里没有的世界知识不会凭空出现。这两条限制在词向量时代表现为「向量算术看起来能做类比但常出错」,在大模型时代表现为事实性错误,问题的形状没有变过:分布告诉你词怎么用,不告诉你世界是什么样。

位置E——它把「共现分布」当成单独够用的那一样 预设〔03 分布相似即语义相近〕默认上下文重叠度可作为意义接近度的充分刻画 量纲分布相似度排名靠前的词对数∶其中语义确实相近而非相反的词对数 失效当反义词与同义词共享几乎相同的上下文时,分布度量无法区分极性,需另加信号 异名词典学称「用法定义」,社会学称「由交往圈判断身份」;另见本块二

经四、贝尔实验室的转折:让数据说话,而不是让语言学家说话Classic 04 · Foundation Models and LLMs

提出Frederick Jelinek 及 IBM 语音识别组,1970 年代中期起以噪声信道模型重构语音识别与翻译。 流变统计方法在二十年内取得压倒性优势;其代价是可解释性下降与对语料规模的依赖成为常态。 今用本块己「神经机器翻译系统化:端到端模型第一次进入大规模服务」是同一条路线的第三代。 关键识别与翻译可写成在给定观测下最大化后验概率的解码问题,模型参数从大规模语料估计而来。

这条路线把领域的评价标准换了:不再问模型是否符合语言学理论,只问在留出数据上的错误率。噪声信道框架把语言模型与翻译模型分开估计再合成,各自都可以独立改进——这种可分解性是它能持续进步二十年的工程原因。

代价是语料成了瓶颈,也成了权力。谁有大规模平行语料谁就领先,而这与语言学洞察无关。今天的争论仍然沿这条线:模型规模与数据规模是否可以无限替代对结构的理解。这一条经典的用处是提醒——那场争论已经进行了五十年,每一轮都是同样的两方,而每一轮的胜负都由当期可得的数据规模决定。

位置S——它把「留出集上的错误率」当成单独够用的那一样 预设〔04 评测指标可代表任务〕默认在固定测试集上错误率下降即任务能力提高 量纲测试集错误率的下降幅度∶实际使用场景中被用户判为可用的比例变化 失效当测试集与使用场景在分布上分离时,指标改进不传导到实际效用,优化目标与目的脱钩 异名运筹学称「代理目标」,管理学称「考核什么就得到什么」;另见本块己

经五、隐马尔可夫模型:先假定看不见的那一层,再把它估出来Classic 05 · Foundation Models and LLMs

提出Leonard Baum 等,1970 年《数理统计年刊》41:164–171 给出重估算法;Lawrence Rabiner 于 1989 年的教程使其普及。 流变统治语音与序列标注二十余年;其一阶马尔可夫与输出独立两条假设在长程依赖任务上系统性失败。 今用本块丙「注意力补丁:解码器每一步重新查看源序列」正是对「状态必须压成一个定长向量」这一限制的解除。 关键可观测序列由一条不可观测的状态链生成,状态转移与输出概率可由期望最大化从无标注数据估出。

它的关键动作是引入了一层看不见的东西,并且给出了在没有标注的情况下把它估出来的算法。这使得序列建模第一次可以在大规模未标注数据上进行。前向后向与维特比两套算法至今仍是所有序列模型讲解的起点。

两条假设是它的天花板:当前状态只依赖前一个状态,观测只依赖当前状态。这意味着所有历史必须被压进一个有限的状态里。长句、跨句指代、篇章一致性都撞在这里。此后每一次序列建模的进步——条件随机场、循环网络、注意力——都可以读成对这两条假设的一次放宽,而放宽的代价一律是计算量。

位置D——它把「一条有限状态链」当成单独够用的那一样 预设〔05 历史可压入有限状态〕默认全部相关历史信息能被当前状态完整承载 量纲状态空间可承载的历史信息量∶任务实际要求的依赖跨度 失效当依赖跨度超出状态容量时,模型仍能给出解码结果而错误无法由参数估计改善 异名控制论称「状态空间模型」,档案学称「摘要替代全文」;另见本块丙

经六、潜在语义分析:把词—文档矩阵压扁,意思就浮出来了Classic 06 · Foundation Models and LLMs

提出Scott Deerwester、Susan Dumais 等,1990 年《美国信息科学学会杂志》41:391–407。 流变概率化版本与主题模型接续了这条线;其线性与词袋假设则被上下文表示整体越过。 今用本块戊「GloVe:全局共现与局部预测被放进同一目标」正是对「全局矩阵分解」这一路的重新接续。 关键对词—文档共现矩阵作奇异值分解并截断,可得到能反映同义与主题关系的低维表示。

它解决的是检索里的老问题:查「汽车」找不到写着「轿车」的文档。降维之后,两个从不共同出现的同义词可以因为共享上下文而在低维空间里靠近。这是「用线性代数处理语义」第一次真正奏效,也是后来一切嵌入方法的直接祖先。

它的两条限制都在假设里。词袋丢掉了语序,因而「狗咬人」与「人咬狗」同表示;线性分解假定语义关系可加,而多义词被压成一个向量,其结果是若干义项的加权平均,罕见义项被主导义项压住。上下文表示解决的正是后一条——同一个词在不同句子里拿不同的向量,多义不再需要被平均掉。

位置E——它把「一次线性降维」当成单独够用的那一样 预设〔06 一词一表示足够〕默认每个词可由单一向量刻画其全部义项 量纲多义词的义项数∶模型为该词提供的表示数 失效当高频多义词的义项分布悬殊时,单一向量偏向主导义项,次要义项的检索系统性失败 异名统计学称「主成分分析」,图书馆学称「主题标引」;另见本块戊

经七、宾州树库:先把标注做出来,方法才有地方生长Classic 07 · Foundation Models and LLMs

提出Mitchell Marcus、Beatrice Santorini 与 Mary Ann Marcinkiewicz,1993 年《计算语言学》19:313–330。 流变它使有监督句法分析成为可能,也让整个领域的进展被绑定在少数几个标注规范上;标注体系本身的选择被视为中立而少受检验。 今用本块庚「阅读理解基准:模型被要求从段落中定位答案」延续的正是「建标注、定赛道」这条制度路线。 关键一份规模足够大、标注规范一致的句法树库,可使统计句法分析器的训练与评测成为可能。

这项工作的性质是基础设施而非方法:几百万词的人工句法标注,规范文件比多数论文都长。它的效果立竿见影——有监督分析器的准确率在十年内从七成升到九成以上,整个方向被它带起来。没有它,那十年的方法论文一篇也写不出来。

它同时把一整套理论选择固化成了默认。树库采用哪种句法框架、如何处理省略与并列,这些决定进入了所有在其上训练的模型,也进入了所有以它为准的评测。领域后来花了很大力气才重新讨论这些选择。基准数据集的中立性是一种错觉——它总是某一套理论的具体化。

位置S——它把「一份标注规范」当成单独够用的那一样 预设〔07 标注体系是中立的〕默认标注规范只记录事实,不预先决定何为正确分析 量纲标注规范中需作理论选择的决策点数∶被后续研究显式讨论过的决策点数 失效当评测与训练共用同一套规范时,符合该规范成为「正确」的定义,替代框架无法被比较 异名测量学称「操作定义的锁定」,标准化组织称「事实标准」;另见本块庚

经八、IBM 模型与词对齐:翻译的最小单位是被算出来的Classic 08 · Foundation Models and LLMs

提出Peter Brown、Stephen Della Pietra 等,1993 年《计算语言学》19:263–311。 流变词级对齐让位于短语与层次短语模型;对齐这一中间表示则一直沿用到神经方法出现前夜。 今用本块丁「子词建模:开放词表问题被拆成可复用片段」处理的是同一件事——翻译单位由谁决定。 关键源语与目标语之间的对应关系可作为隐变量,从无标注的平行语料中用期望最大化估计出来。

这项工作最漂亮的一步是不预设翻译单位。词典与短语表不是人编的,是从平行句对里估出来的——哪个词对哪个词,由数据决定。这让翻译系统第一次可以只靠平行语料构建,不需要任何语言学资源,因而可以迅速铺到许多语言对上。

对齐这个中间表示后来成了包袱也成了遗产。包袱在于它把翻译强行拆成局部对应,处理不了语序大幅重排与一对多的情形;遗产在于注意力机制被提出时,人们立刻看出它是一种软的、可微的对齐——同一个概念换了实现方式,而且不再需要显式的中间表示。

位置D——它把「词与词的对应」当成单独够用的那一样 预设〔08 翻译单位可预先固定〕默认存在一层稳定的对应粒度可覆盖全部语言对 量纲可由词级对齐解释的译文片段数∶需要跨度重排或多对多才能解释的片段数 失效当语言对在形态与语序上差异极大时,固定粒度的对齐系统性失败而模型仍会输出结果 异名会计学称「逐笔对账」,制造业称「工序拆分粒度」;另见本块丁

经九、BLEU:一个用来省钱的指标,最后决定了整个领域做什么Classic 09 · Foundation Models and LLMs

提出Kishore Papineni、Salim Roukos 等,2002 年《ACL 会议论文集》311–318。 流变与人工判断的相关性在系统间差距缩小后显著下降;其对流畅度与充分性的不敏感被反复证明,却因惯性长期作为主要终点。 今用本块四「基础模型命名:一次训练成为许多系统的共同上游」之后,评测的这一处旧账变得更难还。 关键机器译文与若干参考译文之间的多元语法重叠度,可作为翻译质量的自动近似。

它解决的是一个现实问题:人工评测太慢太贵,无法支持每天多次的迭代。有了它,翻译研究第一次可以像工程一样快速试错。它的设计也很克制——作者明确说它是近似,只在系统间比较时有意义,不宜作绝对质量指标。

后来发生的事与作者的告诫无关。指标成了论文能否发表的门槛,于是所有改进都朝着提高这个数的方向做,而它对语义正确性、指代一致性与事实性几乎不敏感。当系统质量接近时,它与人工判断的相关性大幅下降,却仍被沿用了十几年。这是「指标一旦成为目标就不再是好指标」在这门学科里最清楚的案例。

位置E——它把「与参考译文的表层重叠」当成单独够用的那一样 预设〔09 自动指标可代替人工判断〕默认表层重叠度与人类质量评价保持单调关系 量纲指标分数的提升幅度∶同批译文人工评分的提升幅度 失效当系统间质量差距缩小时,两者的相关性下降甚至消失,指标继续上升而质量不再改善 异名教育评价称「应试化」,管理学称「指标俘获」;另见本块四

经十、最大熵与判别式建模:不再假装知道数据是怎么生成的Classic 10 · Foundation Models and LLMs

提出Adam Berger、Stephen Della Pietra 与 Vincent Della Pietra,1996 年《计算语言学》22:39–71。 流变条件随机场把它推广到结构化输出;判别式路线随后成为默认,而生成式建模在大规模预训练时代又回来了。 今用本块一「Transformer:注意力把序列训练变成高度并行」所在的整条路线,仍在这条判别与生成之争上摆动。 关键在满足全部已知约束的分布中选择熵最大的那个,可在不引入额外假设的前提下融合任意特征。

它给出的是一条方法论原则:只承诺你确实知道的东西,其余保持最不确定。工程上的后果是特征可以随便加——词形、词性、前后缀、词典命中,不必假设它们互相独立。这一点解决了朴素贝叶斯长期的痛处,也让领域知识可以直接以特征形式注入。

它与生成式建模的分工此后反复翻转。判别式在标注数据充足时更准,生成式在数据稀少或需要合成时更有用。大规模预训练把天平又拨了回去——先用生成目标学表示,再判别式微调。这条经典的价值在于它把「要不要对数据生成过程作假设」这个选择明确成了一个可讨论的问题。

位置S——它把「约束下的最大熵解」当成单独够用的那一样 预设〔10 已知约束已被穷举〕默认写进模型的特征集覆盖了全部有效信息 量纲特征集覆盖的现象数∶任务中实际起作用的现象数 失效当有效信息无法被人工特征表达时,最大熵原则保证的是在错误约束集下的最优,而非任务最优 异名统计物理称「最大熵原理」,法学称「无罪推定」;另见本块一

经十一、词类归纳与无监督分割:不给答案,也能把结构切出来Classic 11 · Foundation Models and LLMs

提出Peter Brown 等,1992 年《计算语言学》18:467–479,基于互信息的层次化词类归纳。 流变Brown 聚类长期作为特征来源被使用;其硬聚类与单义假设最终被连续表示取代。 今用本块五「缩放律修订:模型与数据要按计算预算共同增长」处理的是同一件事的另一面——结构从数据里长出来,代价是它随规模而变。 关键仅凭词的共现统计即可自动归纳出与语言学词类高度吻合的层次聚类,无需任何标注。

这项工作的说服力在于对照:算法完全不知道什么是名词动词,却切出了与语言学分类高度吻合的类别。这为「结构可以从分布中被发现」提供了直接证据,也提供了一种廉价的特征——在标注数据稀缺的年代,Brown 类别是许多系统性能提升的主要来源。

它的两条硬约束是硬聚类与单义:一个词只能属于一个类,而层次结构一旦建成不随上下文改变。真实语言里大量词跨类使用,且类别边界本身模糊。连续向量取消了这两条约束——一个词的位置可以在多个类别之间,而上下文表示进一步让它随句子移动。

位置D——它把「一次硬聚类」当成单独够用的那一样 预设〔11 一词属一类〕默认词的类别归属唯一且不随上下文变化 量纲被归入单一类别的词数∶实际跨类使用的词数 失效当跨类使用普遍时,硬聚类必须为每个词挑一个主导类,其余用法的信息在特征层丢失 异名生物学称「分类阶元」,图书馆学称「单一分类号」;另见本块五

经十二、神经概率语言模型:先给每个词一个向量,再预测下一个词Classic 12 · Foundation Models and LLMs

提出Yoshua Bengio、Réjean Ducharme 等,2003 年《机器学习研究杂志》3:1137–1155。 流变因输出层归一化代价高而长期难以规模化;层次化 softmax 与负采样解决这一点后,词向量方法迅速普及。 今用本块三「少样本提示:任务说明开始进入上下文本身」所依赖的整个建模范式,起点就在这里。 关键把词映射为稠密向量并用神经网络预测下一个词,可同时学到分布式表示与语言模型,缓解维数灾难。

这项工作把两件此前分开的事合成了一件:表示学习与语言建模。n 元语法模型对没见过的组合无能为力,因为它把词当成互不相干的符号;把词嵌入连续空间之后,相似的词自动共享统计强度,没见过的组合可以由相邻的组合推出。今天的一切都建立在这一步上。

它没有立刻流行的原因是工程性的:输出层要对整个词表归一化,词表几万时每一步都极贵。这个瓶颈被绕开之后,同一思路才在几年内铺开。这条经典因此是「想法与可算性之间隔着一道工程闸」的又一个例子——闸没打开时,正确的想法看上去像不实用的想法。

位置E——它把「稠密向量加神经预测」当成单独够用的那一样 预设〔12 归一化代价可忽略〕默认在全词表上做概率归一化不构成规模化障碍 量纲每一步更新的计算量∶词表规模 失效当词表规模与计算预算之比超出可承受范围时,模型在数学上成立而在工程上不可训练 异名计算复杂性称「常数因子决定可用性」,制造业称「工艺瓶颈」;另见本块三

经十三、短语翻译模型:把对齐结果打包成可查的表Classic 13 · Foundation Models and LLMs

提出Philipp Koehn、Franz Och 与 Daniel Marcu,2003 年《北美 ACL 会议论文集》48–54。 流变成为此后十年的工业标准并催生开源工具链;其局部性假设在语序差异大的语言对上始终无法克服。 今用本块六「指令调优:任务集合把语言模型改造成可调用接口」取代的是同一类接缝——多段拼装换成一次统一训练。 关键以连续词串而非单词作为翻译单位,并对短语表、语言模型与重排序模型作对数线性加权,可显著提高译文质量。

它的进步来自一个朴素观察:很多翻译对应是成串的,拆成词反而丢信息。把短语当单位既保留了局部语序,又把常见搭配整体记住。加上对数线性框架,各个子模型的权重可以在开发集上直接调优——这使系统工程化,也使小团队能参与。

它的天花板也在同一处。短语是局部的,长距离重排必须靠单独的重排序模型硬撑,而对日语与英语这样语序差异极大的语言对,效果始终有限。整条流水线由多个独立训练的模块拼成,误差逐级累积且无法联合优化——端到端方法最大的一次收益,就来自取消这些接缝。

位置S——它把「局部短语对应」当成单独够用的那一样 预设〔13 流水线各模块误差可加〕默认分别优化各模块能逼近整体最优 量纲各模块单独评测的准确率乘积∶端到端联合训练可达的准确率 失效当模块间误差相互放大且无法联合调整时,局部最优的组合远离整体最优 异名系统工程称「接缝损失」,供应链称「牛鞭效应」;另见本块六

经十四、Kneser–Ney 平滑:没见过的组合,该给它多少概率Classic 14 · Foundation Models and LLMs

提出Reinhard Kneser 与 Hermann Ney,1995 年 IEEE 声学、语音与信号处理国际会议论文集 181–184。 流变长期是 n 元语法的最强平滑方法;神经语言模型出现后,它作为强基线又存活了很久。 今用本块辛「并行训练准备:数据并行让亿级参数成为日常工程」之后,稀疏性问题被规模而非平滑解决。 关键未见组合的概率应按低阶分布的「续接多样性」而非其频次来回退,方能正确估计新语境下的可能性。

这条方法的洞察极精细:一个词出现次数多,不代表它容易出现在新语境里。如「Francisco」频次很高但几乎只跟在「San」后面,回退时不该给它高概率。改用「它跟过多少种不同的前文」来估计,效果明显更好。这是对「频次即倾向」这一直觉的一次精确修正。

它的历史位置很特别:它是符号统计方法做到极致的产物,几乎无法再改进,因而成了衡量神经方法是否真有进步的硬标尺。很长一段时间里,神经语言模型必须与它插值才能超过它。稀疏性最终不是被更聪明的平滑解决的,而是被表示的连续化与数据规模解决的。

位置D——它把「续接多样性」当成单独够用的那一样 预设〔14 稀疏可由平滑补足〕默认未见组合的概率能从已见统计中被正确推断 量纲测试语料中未在训练集出现的组合比例∶平滑后仍被严重误估的比例 失效当语境长度增加使绝大多数组合未见时,任何基于计数的平滑都退化,须改换表示方式 异名统计学称「未见事件质量」,保险精算称「无经验风险定价」;另见本块辛

经十五、WordNet:把词义关系手工织成一张网Classic 15 · Foundation Models and LLMs

提出George Miller 等,1990 年《国际词典学杂志》3:235–244;1998 年《WordNet:电子词汇数据库》(MIT Press)成书。 流变被广泛用于词义消歧与语义相似度计算;其义项划分过细、覆盖有限与更新缓慢三处问题在语料规模扩大后凸显。 今用本块八「检索增强:知识可从参数外部查询并保留出处」是同一目标——外部知识——的可扩展版本。 关键词汇语义可组织为同义词集之间的上下位、部分整体与反义等有限几类关系构成的网络。

它给了计算语义学一份可直接使用的结构化知识:不是词表,是关系网。上下位链让「猫是动物」这类推理可以被查出来而不必被学到。二十年里几乎所有语义相似度工作都以它为基准或资源,它也是「符号知识可以与统计方法互补」这一主张最有力的实物证据。

三处限制都来自手工:义项划分细到母语者也难以分辨,标注一致性因而很低;覆盖限于常用词,专业与新兴词汇长期缺失;更新依赖人力,跟不上语言变化。这些不是设计缺陷而是手工路线的固有代价,也正是后来「把知识放在可检索的外部语料里」这条路要绕开的东西。

位置E——它把「人工构建的关系网」当成单独够用的那一样 预设〔15 义项可穷举划分〕默认词义可被切成有限个互斥义项并被标注者一致识别 量纲词典中列出的义项数∶标注者之间能达成一致的义项数 失效当义项粒度细于人类判别能力时,标注一致性下降,基于该划分的评测本身不可靠 异名本体工程称「知识库维护成本」,制图学称「比例尺与更新周期」;另见本块八

经十六、条件随机场:给整条序列打分,而不是逐位置打分Classic 16 · Foundation Models and LLMs

提出John Lafferty、Andrew McCallum 与 Fernando Pereira,2001 年《国际机器学习会议论文集》282–289。 流变成为序列标注的标准方法十余年;其对特征工程的依赖在表示学习兴起后成为主要成本。 今用本块十一「混合专家:每个token只调用部分参数」处理的是另一种「按需分配计算」的思路,与逐位置独立解码的旧做法同样构成对照。 关键对整个标注序列建立全局归一化的条件模型,可避免逐位置局部归一化导致的标签偏置。

它修的是一个具体而隐蔽的毛病:逐位置归一化的模型会偏爱后继状态少的路径,因为那些路径上的概率被摊得少——与观测无关的结构性偏置。全局归一化取消了这一点,代价是要在整条序列上做配分函数计算,好在动态规划让它可行。

它把特征工程推到了顶峰,也因此埋下了自己的终点。性能主要取决于特征模板设计得好不好,而这需要领域专家逐任务重来。当表示可以从数据里学出来时,这部分成本整块消失。这条经典因此标记了一次分工转移:从「人设计特征、机器估权重」到「机器同时做两件事」。

位置S——它把「全局归一化的序列打分」当成单独够用的那一样 预设〔16 特征模板可由专家穷举〕默认有效特征能被人事先枚举进模型 量纲人工设计的特征模板数∶在新任务上须重新设计的模板数 失效当任务迁移时特征模板不可复用,性能优势被重新设计的成本抵消 异名运筹学称「全局最优与局部最优」,会计学称「合并报表」;另见本块十一

经十七、词义消歧与「一次语篇一个义项」:一条被反复引用的经验规则Classic 17 · Foundation Models and LLMs

提出William Gale、Kenneth Church 与 David Yarowsky,1992 年《人类语言技术研讨会论文集》233–237。 流变规则在多数情形成立,其准确率随语篇长度与领域而变;后被用作自举式无监督消歧的主要约束。 今用本块九「视觉语言对齐:图文对成为开放词汇分类器」用的是同一类弱监督思路——用可得的共现约束替代人工标注。 关键同一个多义词在同一篇文档中的多次出现,绝大多数情况下取同一个义项。

这是一条极便宜的约束:不需要任何标注,只需要文档边界。把它与「一次搭配一个义项」合用,可以从少量种子出发自举出大规模的消歧器。它示范了弱监督的基本手法——找到一个几乎总是成立的结构性事实,把它当作免费的标注信号。

它的可靠性随文本类型变化:新闻里成立得好,长篇技术文档与文学作品里则常被打破。更要紧的是自举过程会放大早期错误——种子选偏了,整个迭代会朝错误方向收敛且看不出来。这两条至今是所有弱监督与自训练方法的共同风险,而且都不会在训练指标上显形。

位置D——它把「篇内义项一致」这一经验规则当成单独够用的那一样 预设〔17 弱监督信号无系统偏差〕默认免费获得的约束不会在特定子集上系统性失效 量纲规则成立的文档数∶自举迭代中被错误标注放大的文档数 失效当规则在某类文本上系统性不成立时,自举把该类样本上的错误逐轮放大且无外部信号纠正 异名统计学称「弱工具变量」,教育学称「错误示范的固化」;另见本块九

经十八、ALPAC 报告:一次把整条路线叫停十年的评估Classic 18 · Foundation Models and LLMs

提出美国国家科学院自动语言处理咨询委员会,1966 年《语言与机器》报告。 流变其结论在当时的证据下站得住,但对「机器翻译无实用前景」的推断在二十年后被完全推翻;评估口径的选择成为后世反复检讨的对象。 今用本块十二「测试时计算:答案质量开始由推理阶段预算调节」提醒的正是同一件事——能力边界随资源条件移动。 关键当时的机器翻译系统在质量与成本上均不及人工翻译,不值得继续大规模投入。

报告本身是认真的:它做了对照评测,算了成本,结论与数据相符。它的正当性在于当时确实没有可用系统,而经费不是无限的。把它读成「短视」并不公平——在给定的技术条件下,它的判断是合理的。

问题出在推断的射程。报告实际证明的是「在这套方法与这个算力下不可行」,被采纳的却是「这个方向不可行」,后果是一代人的经费与人才流失。这与本层《感知机》那一条是同构的失败:一个条件内的否定结论,被搬到条件之外。评估越权威,这种越界的代价越大——因为它同时关掉了检验它自己的那条路。

位置E——它把「一次成本效益评估」当成单独够用的那一样 预设〔18 当前不可行即长期不可行〕默认评估时点的技术条件在可预见期内不发生量级变化 量纲评估所依据的算力与语料规模∶二十年后同一任务可用的规模 失效当资源条件发生数量级变化时,据旧条件作出的可行性判断整条失效而结论已被制度化 异名技术预测称「时点谬误」,投资学称「按当期现金流估值」;另见本块十二

经十九、数据并行训练:把一个模型摊到许多台机器上Classic 19 · Foundation Models and LLMs

提出数据并行的随机梯度框架在 2004 年前后的分布式学习工作中成型,MapReduce 同年发表提供了配套的编程模型。 流变此后由参数服务器、异步更新与大批量优化逐步完善;通信开销取代计算成为新瓶颈。 今用本块七「人类反馈对齐:偏好模型把「有用」变成可优化奖励」所依赖的整套大规模训练流程,前提就是这一步。 关键同一模型的多个副本在不同数据分片上并行计算梯度并汇总更新,可使训练规模随机器数近似线性扩展。

这一步把模型规模从「一台机器装得下多少」中解放出来。它在算法上几乎不改变什么——梯度是可加的,分片求和与整批求和在数学上等价——难的全在系统:如何同步、掉队的机器怎么办、通信带宽够不够。规模问题第一次成为工程问题而非算法问题。

它带来的新约束至今在起作用。批量增大后学习率必须相应调整,否则泛化下降;同步等待使最慢的节点决定整体速度;通信量随参数量增长而带宽不随之增长。今天关于模型结构的许多选择——包括让每个输入只激活一部分参数——直接源于这些约束,而不是源于对语言的理解。

位置D——它把「梯度的可加性」当成单独够用的那一样 预设〔19 并行可线性扩展〕默认增加机器数带来按比例的训练速度提升 量纲参与训练的机器数∶实际获得的加速倍数 失效当通信开销与同步等待占比上升时,加速比偏离线性并最终饱和,规模收益由系统而非算法决定 异名并行计算称「阿姆达尔定律」,管理学称「协调成本」;另见本块七

经二十、斯坦福依存关系:让句法结果直接可用于下游Classic 20 · Foundation Models and LLMs

提出Marie-Catherine de Marneffe、Bill MacCartney 与 Christopher Manning,2006 年《语言资源与评测会议论文集》449–454。 流变后发展为跨语言的通用依存标注体系;而「统一标注是否损害了各语言的特性」始终有争议。 今用本块十「多模态通用接口:文本、图像、音频被放进同一交互回路」追求的是同一件事——一套跨来源可用的统一表示。 关键把短语结构树转换为词与词之间带标签的依存关系,可给出更贴近语义、更便于下游使用的表示。

它的动机是实用的:短语结构树对语言学家有用,对做信息抽取的人不好用——他们要知道谁是主语、谁修饰谁。依存表示把这些关系直接标出来,于是句法分析的结果第一次可以被下游任务原样消费。这一步大幅提高了句法研究的外部效用。

它随后的推广提出了一个更难的问题:一套标注体系要覆盖几十种语言,就必须在「统一可比」与「忠实于各语言的形态句法」之间取舍。取统一,某些语言的特有现象被压平;取忠实,跨语言比较与迁移就失去共同基础。这个两难在多模态统一接口上以完全相同的形状再次出现。

位置S——它把「一套统一的关系标签」当成单独够用的那一样 预设〔20 统一表示无损〕默认一套跨来源通用的标注能保留各来源的关键区分 量纲统一体系覆盖的语言数∶其中特有现象须被压平处理的语言数 失效当统一带来的可比性收益小于被压平的信息损失时,通用接口反而降低下游可用性 异名标准化组织称「互操作与本地化的取舍」,翻译研究称「归化与异化」;另见本块十

◎ 这一层怎么用

先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。

三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(Shannon 的信息论、Turing 的可计算性、Zipf 的频次定律)只在流变栏里被点名。其二,经典身份不提供豁免——本层有四条今天已被明确修正:机器翻译备忘录的密码类比低估了不可还原的部分、ALPAC 报告把条件内结论推成方向判决、BLEU 在系统接近时与人工判断脱钩、分布假说至今分不开同义与反义。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。

本层四条路的落点:机制路(分布假说、隐马尔可夫、潜在语义分析、最大熵、神经概率语言模型、条件随机场)问「靠什么算得出意思」;测量路(BLEU、Kneser–Ney、词类归纳、一次语篇一个义项)问「凭什么说它译对了」;制度路(贝尔实验室转折、宾州树库、短语翻译模型、数据并行、斯坦福依存)问「谁定赛道、谁付得起入场费」;人的路(机器翻译备忘录、《句法结构》之争、ALPAC 报告、WordNet 的手工代价)问「一次外推或一次评估的代价由谁承担」。⚠ 这门学科反复出现的母题是评测口径决定研究方向——BLEU 与 ALPAC 是同一件事的两端,一个让方向走得太顺,一个让方向停得太早。

◎ 经典层资料核验

  1. Weaver, W. Translation. In Locke, W. N. and Booth, A. D. (eds.) Machine Translation of Languages. Cambridge, MA: Technology Press, 1955(专著)。
  2. Hutchins, W. J. Machine Translation: Past, Present, Future. Chichester: Ellis Horwood, 1986(专著)。
  3. Chomsky, N. Syntactic Structures. The Hague: Mouton, 1957(专著)。
  4. Chomsky, N. Three models for the description of language. IRE Transactions on Information Theory 2 (1956): 113–124。
  5. Harris, Z. S. Distributional structure. Word 10 (1954): 146–162。
  6. Firth, J. R. A synopsis of linguistic theory 1930–1955. In Studies in Linguistic Analysis. Oxford: Blackwell, 1957(专著)。
  7. Jelinek, F. Statistical Methods for Speech Recognition. Cambridge, MA: MIT Press, 1997(专著)。
  8. Baum, L. E. et al. A maximization technique occurring in the statistical analysis of probabilistic functions of Markov chains. Annals of Mathematical Statistics 41 (1970): 164–171。
  9. Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proceedings of the IEEE 77 (1989): 257–286。
  10. Deerwester, S. et al. Indexing by latent semantic analysis. Journal of the American Society for Information Science 41 (1990): 391–407。
  11. Landauer, T. K. and Dumais, S. T. A solution to Plato’s problem. Psychological Review 104 (1997): 211–240。
  12. Marcus, M. P., Santorini, B. and Marcinkiewicz, M. A. Building a large annotated corpus of English: the Penn Treebank. Computational Linguistics 19 (1993): 313–330。
  13. Brown, P. F. et al. The mathematics of statistical machine translation: parameter estimation. Computational Linguistics 19 (1993): 263–311。
  14. Brown, P. F. et al. Class-based n-gram models of natural language. Computational Linguistics 18 (1992): 467–479。
  15. Papineni, K., Roukos, S., Ward, T. and Zhu, W.-J. BLEU: a method for automatic evaluation of machine translation. Proceedings of ACL (2002): 311–318。
  16. Callison-Burch, C., Osborne, M. and Koehn, P. Re-evaluating the role of BLEU in machine translation research. Proceedings of EACL (2006): 249–256。
  17. Berger, A. L., Della Pietra, S. A. and Della Pietra, V. J. A maximum entropy approach to natural language processing. Computational Linguistics 22 (1996): 39–71。
  18. Bengio, Y., Ducharme, R., Vincent, P. and Jauvin, C. A neural probabilistic language model. Journal of Machine Learning Research 3 (2003): 1137–1155。
  19. Koehn, P., Och, F. J. and Marcu, D. Statistical phrase-based translation. Proceedings of NAACL-HLT (2003): 48–54。
  20. Koehn, P. Statistical Machine Translation. Cambridge: Cambridge University Press, 2010(专著)。
  21. Kneser, R. and Ney, H. Improved backing-off for m-gram language modeling. Proceedings of ICASSP (1995): 181–184。
  22. Chen, S. F. and Goodman, J. An empirical study of smoothing techniques for language modeling. Computer Speech and Language 13 (1999): 359–394。
  23. Miller, G. A. et al. Introduction to WordNet: an on-line lexical database. International Journal of Lexicography 3 (1990): 235–244。
  24. Fellbaum, C. (ed.) WordNet: An Electronic Lexical Database. Cambridge, MA: MIT Press, 1998(专著)。
  25. Lafferty, J., McCallum, A. and Pereira, F. Conditional random fields. Proceedings of ICML (2001): 282–289。
  26. Gale, W. A., Church, K. W. and Yarowsky, D. One sense per discourse. Proceedings of the Workshop on Speech and Natural Language (1992): 233–237。
  27. Yarowsky, D. Unsupervised word sense disambiguation rivaling supervised methods. Proceedings of ACL (1995): 189–196。
  28. Automatic Language Processing Advisory Committee. Language and Machines: Computers in Translation and Linguistics. Washington, DC: National Academy of Sciences, 1966(专著)。
  29. Dean, J. and Ghemawat, S. MapReduce: simplified data processing on large clusters. Proceedings of OSDI (2004): 137–150。
  30. Chu, C.-T. et al. Map-Reduce for machine learning on multicore. Advances in Neural Information Processing Systems 19 (2006): 281–288(专著)。
  31. de Marneffe, M.-C., MacCartney, B. and Manning, C. D. Generating typed dependency parses from phrase structure parses. Proceedings of LREC (2006): 449–454。
  32. Manning, C. D. and Schütze, H. Foundations of Statistical Natural Language Processing. Cambridge, MA: MIT Press, 1999(专著)。
  33. Jurafsky, D. and Martin, J. H. Speech and Language Processing. 2nd ed. Upper Saddle River: Prentice Hall, 2009(专著)。
  34. Church, K. W. and Hanks, P. Word association norms, mutual information, and lexicography. Computational Linguistics 16 (1990): 22–29。
  35. Och, F. J. and Ney, H. A systematic comparison of various statistical alignment models. Computational Linguistics 29 (2003): 19–51。
新思想前沿 · 第 44 号《基础模型》· 20 条现代思想 + 20 条 1950–2006 经典思想 · 双层资料核验 · 王德生 亲撰 · ← 回到 626 个领域总览