基础模型与大语言模型
基础模型的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。
第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。
甲、词向量:语言关系被压进连续空间Distributed Word Representations
起点要放回2013年的Efficient Estimation of Word Representations in Vector Space:Mikolov、Chen、Corrado、Dean不再允许基础模型与大语言模型在词向量上继续为每项语言任务另造专用管线。Mikolov、Chen、Corrado、Dean逐项核对token、语料、提示与外部检索里的词向量;数据来源、推理预算与下游责任由上下文预训练另行登记。在Efficient Estimation of Word Representations in Vector Space的证据账上,由十亿词语料上的skip-gram以较低计算学习类比与语义邻近起步,上下文预训练进入解释对照;本条残差不能靠改名消失。
词向量的可反驳立场是:邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算。Mikolov、Chen、Corrado、Dean这一路线据此把决定性解释锁在一个对象上,上下文预训练的“掩码语言模型和双向上下文可形成可微调的通用语言表示”不能替代本条;边界是单一词向量把多义词和语境平均。若换样本后再问仍不能保持方向,上下文预训练便构成词向量的近邻反例;Efficient Estimation of Word Representations in Vector Space对词向量仅支持原任务。
可核对的主证据是Mikolov、Chen、Corrado、Dean,2013 年 arXiv:1301.3781《Efficient Estimation of Word Representations in Vector Space》:十亿词语料上的skip-gram以较低计算学习类比与语义邻近。skip-gram使用约10亿词训练语料。上下文预训练要求把2013年的词向量样本与对照结算,再核查上下文预训练的任务、观察窗和单一词向量把多义词和语境平均。对词向量,上下文预训练仅作近邻;支点仍是Mikolov、Chen、Corrado、Dean在Efficient Estimation of Word Representations in Vector Space的原始比较。
词向量自己留下的反证入口是:单一词向量把多义词和语境平均,社会偏见也随共现统计进入空间。用正交量纲重测时,Mikolov、Chen、Corrado、Dean的解释可能缩小、反号,或让位给上下文预训练的路径。上下文预训练给出复核Efficient Estimation of Word Representations in Vector Space的近邻条件:把不显著结果一并公开;词向量负责记录中止、排除和不显著对象。回到Efficient Estimation of Word Representations in Vector Space的取样方式,词向量要用上下文预训练证明原分母没有删去最容易失败的对象。
十亿词语料上的skip-gram以较低计算学习类比与语义邻近改变登记顺序:token、语料、提示与外部检索归词向量,数据来源、推理预算与下游责任交上下文预训练核查。2019年的上下文预训练以“掩码语言模型和双向上下文可形成可微调的通用语言表示”作近邻;两者若结论不同,应以单一词向量把多义词和语境平均为分账边界;上下文预训练不得与本条合成一个平均分。
2013年,词向量据十亿词语料上的skip-gram以较低计算学习类比与语义邻近对接第256号第八条。跨过去,单一词向量把多义词和语境平均迫使词向量重新检验可见读数。词向量以单一词向量把多义词和语境平均施加反向压力。该接口若仍支持相反方向,单一词向量把多义词和语境平均要求词向量增加第三条件,同时容纳两边的失效样本。
乙、序列到序列:翻译由端到端条件生成取代分段管线Sequence-to-Sequence Models
真正的断点出现在2014年的NeurIPS:Sutskever、Vinyals、Le不再允许基础模型与大语言模型在序列到序列上继续为每项语言任务另造专用管线。Sutskever、Vinyals、Le逐项核对token、语料、提示与外部检索里的序列到序列;数据来源、推理预算与下游责任由少样本提示另行登记。在NeurIPS的证据账上,由四层LSTM在英语法语任务达到34.8 BLEU起步,少样本提示进入解释对照;本条残差不能靠改名消失。
序列到序列的可反驳立场是:编码器把源序列变成状态,解码器逐词生成目标序列。Sutskever、Vinyals、Le这一路线据此把决定性解释锁在一个对象上,少样本提示的“大规模自回归模型可从提示中的示例改变输出,无需更新权重”不能替代本条;边界是固定状态压缩长句。若把时间窗拉长再看仍不能保持方向,少样本提示便构成序列到序列的近邻反例;NeurIPS对序列到序列仅支持原任务。
可核对的主证据是Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112:四层LSTM在英语法语任务达到34.8 BLEU,并可重排候选翻译。4层LSTM在英法翻译达到34.8 BLEU。少样本提示要求把2014年的序列到序列样本与对照结算,再核查少样本提示的任务、观察窗和固定状态压缩长句。对序列到序列,少样本提示仅作近邻;支点仍是Sutskever、Vinyals、Le在NeurIPS的原始比较。回到NeurIPS的取样方式,序列到序列要用少样本提示证明原分母没有删去最容易失败的对象。
序列到序列自己留下的反证入口是:固定状态压缩长句,自动指标也不等于意义忠实与可用性。撤去界面提示再验时,Sutskever、Vinyals、Le的解释可能缩小、反号,或让位给少样本提示的路径。少样本提示给出复核NeurIPS的近邻条件:按个体轨迹而非均值检查;序列到序列负责记录中止、排除和不显著对象。拿少样本提示作近邻检验,可辨认Sutskever、Vinyals、Le观察到的是独有路径,还是另一条路线的表面同义词。
四层LSTM在英语法语任务达到34.8 BLEU改变登记顺序:token、语料、提示与外部检索归序列到序列,数据来源、推理预算与下游责任交少样本提示核查。2020年的少样本提示以“大规模自回归模型可从提示中的示例改变输出,无需更新权重”作近邻;两者若结论不同,应以固定状态压缩长句为分账边界;少样本提示不得与本条合成一个平均分。
2014年,序列到序列据四层LSTM在英语法语任务达到34.8 BLEU对接第256号第一条。跨过去,固定状态压缩长句迫使序列到序列重新检验可见读数。序列到序列以固定状态压缩长句施加反向压力。该接口若仍支持相反方向,固定状态压缩长句要求序列到序列增加第三条件,同时容纳两边的失效样本。
丙、注意力补丁:解码器每一步重新查看源序列Neural Attention
旧账最先在2015年的ICLR:Bahdanau、Cho、Bengio不再允许基础模型与大语言模型在注意力补丁上继续为每项语言任务另造专用管线。Bahdanau、Cho、Bengio逐项核对token、语料、提示与外部检索里的注意力补丁;数据来源、推理预算与下游责任由基础模型命名另行登记。在ICLR的证据账上,由在长句翻译上显著超过固定编码器起步,基础模型命名进入解释对照;本条残差不能靠改名消失。
注意力补丁的可反驳立场是:动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置。Bahdanau、Cho、Bengio这一路线据此把决定性解释锁在一个对象上,基础模型命名的“同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散”不能替代本条;边界是注意权重可帮助检查却不必等同因果解释。若保留失败对象后检验仍不能保持方向,基础模型命名便构成注意力补丁的近邻反例;ICLR对注意力补丁仅支持原任务。
可核对的主证据是Bahdanau、Cho、Bengio,2015 年《ICLR》论文“Neural Machine Translation by Jointly Learning to Align and Translate”:在长句翻译上显著超过固定编码器,并产生可视化对齐矩阵。基础模型命名要求把2015年的注意力补丁样本与对照结算,再核查基础模型命名的任务、观察窗和注意权重可帮助检查却不必等同因果解释。对注意力补丁,基础模型命名仅作近邻;支点仍是Bahdanau、Cho、Bengio在ICLR的原始比较。
注意力补丁自己留下的反证入口是:注意权重可帮助检查却不必等同因果解释,多个分布能给出相同输出。按亚组分别结算时,Bahdanau、Cho、Bengio的解释可能缩小、反号,或让位给基础模型命名的路径。基础模型命名给出复核ICLR的近邻条件:加入反事实条件;注意力补丁负责记录中止、排除和不显著对象。
在长句翻译上显著超过固定编码器改变登记顺序:token、语料、提示与外部检索归注意力补丁,数据来源、推理预算与下游责任交基础模型命名核查。2021年的基础模型命名以“同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散”作近邻;两者若结论不同,应以注意权重可帮助检查却不必等同因果解释为分账边界;基础模型命名不得与本条合成一个平均分。
2015年,注意力补丁据在长句翻译上显著超过固定编码器对接第049号第一幕乙。跨过去,注意权重可帮助检查却不必等同因果解释迫使注意力补丁重新检验可见读数。注意力补丁以注意权重可帮助检查却不必等同因果解释施加反向压力。该接口若仍支持相反方向,注意权重可帮助检查却不必等同因果解释要求注意力补丁增加第三条件,同时容纳两边的失效样本。
丁、子词建模:开放词表问题被拆成可复用片段Subword Units
转折并非始于2016年的ACL:Sennrich、Haddow、Birch不再允许基础模型与大语言模型在子词建模上继续为每项语言任务另造专用管线。Sennrich、Haddow、Birch逐项核对token、语料、提示与外部检索里的子词建模;数据来源、推理预算与下游责任由缩放律修订另行登记。在ACL的证据账上,由BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU起步,缩放律修订进入解释对照;本条残差不能靠改名消失。
子词建模的可反驳立场是:高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词。Sennrich、Haddow、Birch这一路线据此把决定性解释锁在一个对象上,缩放律修订的“固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者”不能替代本条;边界是切分偏好高资源语言。若改用地点外资料复核仍不能保持方向,缩放律修订便构成子词建模的近邻反例;ACL对子词建模仅支持原任务。
可核对的主证据是Sennrich、Haddow、Birch,2016 年《ACL》:1715–1725,DOI 10.18653/v1/P16-1162:BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU。BPE在英德、英俄2组翻译方向检验稀有词。缩放律修订要求把2016年的子词建模样本与对照结算,再核查缩放律修订的任务、观察窗和切分偏好高资源语言。对子词建模,缩放律修订仅作近邻;支点仍是Sennrich、Haddow、Birch在ACL的原始比较。回到ACL的取样方式,子词建模要用缩放律修订证明原分母没有删去最容易失败的对象。
子词建模自己留下的反证入口是:切分偏好高资源语言,形态、文字系统和输入成本的不平等仍会进入token账本。改变任务顺序后追踪时,Sennrich、Haddow、Birch的解释可能缩小、反号,或让位给缩放律修订的路径。缩放律修订给出复核ACL的近邻条件:用盲法重跑关键判断;子词建模负责记录中止、排除和不显著对象。
BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU改变登记顺序:token、语料、提示与外部检索归子词建模,数据来源、推理预算与下游责任交缩放律修订核查。2022年的缩放律修订以“固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者”作近邻;两者若结论不同,应以切分偏好高资源语言为分账边界;缩放律修订不得与本条合成一个平均分。
2016年,子词建模据BPE在英语德语和英语俄语翻译改善稀有词处理与BLEU对接第256号第八条。跨过去,切分偏好高资源语言迫使子词建模重新检验可见读数。子词建模以切分偏好高资源语言施加反向压力。该接口若仍支持相反方向,切分偏好高资源语言要求子词建模增加第三条件,同时容纳两边的失效样本。
戊、GloVe:全局共现与局部预测被放进同一目标Global Vectors
问题的入口是2014年的EMNLP:Pennington、Socher、Manning不再允许基础模型与大语言模型在基础模型与大语言模型里的GloVe上继续为每项语言任务另造专用管线。Pennington、Socher、Manning逐项核对token、语料、提示与外部检索里的基础模型与大语言模型里的GloVe;数据来源、推理预算与下游责任由指令调优另行登记。在EMNLP的证据账上,由在类比、相似度和命名实体任务上以较少训练获得强表示起步,指令调优进入解释对照;本条残差不能靠改名消失。
基础模型与大语言模型里的GloVe的可反驳立场是:词与词的共现比率携带语义关系,可由加权矩阵分解学习。Pennington、Socher、Manning这一路线据此把决定性解释锁在一个对象上,指令调优的“对多任务自然语言指令微调可提高未见任务的零样本执行”不能替代本条;边界是静态表示仍把历史语料偏见固化为几何距离。若让替代路径进入对照仍不能保持方向,指令调优便构成基础模型与大语言模型里的GloVe的近邻反例;EMNLP对基础模型与大语言模型里的GloVe仅支持原任务。
可核对的主证据是Pennington、Socher、Manning,2014 年《EMNLP》:1532–1543,DOI 10.3115/v1/D14-1162:在类比、相似度和命名实体任务上以较少训练获得强表示。GloVe在6项相似度与类比基准上比较。指令调优要求把2014年的基础模型与大语言模型里的GloVe样本与对照结算,再核查指令调优的任务、观察窗和静态表示仍把历史语料偏见固化为几何距离。对基础模型与大语言模型里的GloVe,指令调优仅作近邻;支点仍是Pennington、Socher、Manning在EMNLP的原始比较。
基础模型与大语言模型里的GloVe自己留下的反证入口是:静态表示仍把历史语料偏见固化为几何距离,更新新义也需重训。让独立团队预注册时,Pennington、Socher、Manning的解释可能缩小、反号,或让位给指令调优的路径。指令调优给出复核EMNLP的近邻条件:将短期与长期拆账;基础模型与大语言模型里的GloVe负责记录中止、排除和不显著对象。
在类比、相似度和命名实体任务上以较少训练获得强表示改变登记顺序:token、语料、提示与外部检索归基础模型与大语言模型里的GloVe,数据来源、推理预算与下游责任交指令调优核查。2022年的指令调优以“对多任务自然语言指令微调可提高未见任务的零样本执行”作近邻;两者若结论不同,应以静态表示仍把历史语料偏见固化为几何距离为分账边界;指令调优不得与本条合成一个平均分。
2014年,基础模型与大语言模型里的GloVe据在类比、相似度和命名实体任务上以较少训练获得强表示对接第256号第八条。跨过去,静态表示仍把历史语料偏见固化为几何距离迫使基础模型与大语言模型里的GloVe重新检验可见读数。基础模型与大语言模型里的GloVe以静态表示仍把历史语料偏见固化为几何距离施加反向压力。该接口若仍支持相反方向,静态表示仍把历史语料偏见固化为几何距离要求基础模型与大语言模型里的GloVe增加第三条件,同时容纳两边的失效样本。
己、神经机器翻译系统化:端到端模型第一次进入大规模服务GNMT at Scale
先看被改写的对象2016年的Google’s Neural Machine Translation System:Wu 等不再允许基础模型与大语言模型在神经机器翻译系统化上继续为每项语言任务另造专用管线。Wu 等逐项核对token、语料、提示与外部检索里的神经机器翻译系统化;数据来源、推理预算与下游责任由人类反馈对齐另行登记。在Google’s Neural Machine Translation System的证据账上,由在WMT英语法语与英语西班牙语上将人工评分错误降低约60%起步,人类反馈对齐进入解释对照;本条残差不能靠改名消失。
神经机器翻译系统化的可反驳立场是:残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统。Wu 等这一路线据此把决定性解释锁在一个对象上,人类反馈对齐的“人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好”不能替代本条;边界是高资源语对改善不能外推低资源语言。若把排除者放回分母仍不能保持方向,人类反馈对齐便构成神经机器翻译系统化的近邻反例;Google’s Neural Machine Translation System对神经机器翻译系统化仅支持原任务。
可核对的主证据是Wu 等,2016 年 arXiv:1609.08144《Google’s Neural Machine Translation System》:在WMT英语法语与英语西班牙语上将人工评分错误降低约60%。人类反馈对齐要求把2016年的神经机器翻译系统化样本与对照结算,再核查人类反馈对齐的任务、观察窗和高资源语对改善不能外推低资源语言。对神经机器翻译系统化,人类反馈对齐仅作近邻;支点仍是Wu 等在Google’s Neural Machine Translation System的原始比较。
神经机器翻译系统化自己留下的反证入口是:高资源语对改善不能外推低资源语言,平均人工分掩盖实体和数字错误。把不显著结果一并公开时,Wu 等的解释可能缩小、反号,或让位给人类反馈对齐的路径。人类反馈对齐给出复核Google’s Neural Machine Translation System的近邻条件:把人工接管计入结果;神经机器翻译系统化负责记录中止、排除和不显著对象。
在WMT英语法语与英语西班牙语上将人工评分错误降低约60%改变登记顺序:token、语料、提示与外部检索归神经机器翻译系统化,数据来源、推理预算与下游责任交人类反馈对齐核查。2022年的人类反馈对齐以“人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好”作近邻;两者若结论不同,应以高资源语对改善不能外推低资源语言为分账边界;人类反馈对齐不得与本条合成一个平均分。
2016年,神经机器翻译系统化据在WMT英语法语与英语西班牙语上将人工评分错误降低约60%对接第043号第一幕辛。跨过去,高资源语对改善不能外推低资源语言迫使神经机器翻译系统化重新检验可见读数。神经机器翻译系统化以高资源语对改善不能外推低资源语言施加反向压力。该接口若仍支持相反方向,高资源语对改善不能外推低资源语言要求神经机器翻译系统化增加第三条件,同时容纳两边的失效样本。
庚、阅读理解基准:模型被要求从段落中定位答案Machine Reading Benchmarks
争论应从2016年的EMNLP:Rajpurkar、Zhang、Lopyrev、Liang不再允许基础模型与大语言模型在阅读理解基准上继续为每项语言任务另造专用管线。Rajpurkar、Zhang、Lopyrev、Liang逐项核对token、语料、提示与外部检索里的阅读理解基准;数据来源、推理预算与下游责任由检索增强另行登记。在EMNLP的证据账上,由SQuAD含十万余问答对起步,检索增强进入解释对照;本条残差不能靠改名消失。
阅读理解基准的可反驳立场是:问答把语言表示从句级分类推进到条件检索和答案跨度预测。Rajpurkar、Zhang、Lopyrev、Liang这一路线据此把决定性解释锁在一个对象上,检索增强的“生成时检索可更新的文档库,让事实知识不必全部固化在参数中”不能替代本条;边界是答案都在段落且问题由段落反向生成。若固定资源预算后比较仍不能保持方向,检索增强便构成阅读理解基准的近邻反例;EMNLP对阅读理解基准仅支持原任务。
可核对的主证据是Rajpurkar、Zhang、Lopyrev、Liang,2016 年《EMNLP》:2383–2392,DOI 10.18653/v1/D16-1264:SQuAD含十万余问答对,统一了训练与人机比较。SQuAD初版含10万余个问答对。检索增强要求把2016年的阅读理解基准样本与对照结算,再核查检索增强的任务、观察窗和答案都在段落且问题由段落反向生成。对阅读理解基准,检索增强仅作近邻;支点仍是Rajpurkar、Zhang、Lopyrev、Liang在EMNLP的原始比较。回到EMNLP的取样方式,阅读理解基准要用检索增强证明原分母没有删去最容易失败的对象。
阅读理解基准自己留下的反证入口是:答案都在段落且问题由段落反向生成,捷径与标注边界限制“理解”解释。按个体轨迹而非均值检查时,Rajpurkar、Zhang、Lopyrev、Liang的解释可能缩小、反号,或让位给检索增强的路径。检索增强给出复核EMNLP的近邻条件:审计数据近邻与泄漏;阅读理解基准负责记录中止、排除和不显著对象。
SQuAD含十万余问答对改变登记顺序:token、语料、提示与外部检索归阅读理解基准,数据来源、推理预算与下游责任交检索增强核查。2020年的检索增强以“生成时检索可更新的文档库,让事实知识不必全部固化在参数中”作近邻;两者若结论不同,应以答案都在段落且问题由段落反向生成为分账边界;检索增强不得与本条合成一个平均分。
2016年,阅读理解基准据SQuAD含十万余问答对对接第256号第三条。跨过去,答案都在段落且问题由段落反向生成迫使阅读理解基准重新检验可见读数。阅读理解基准以答案都在段落且问题由段落反向生成施加反向压力。该接口若仍支持相反方向,答案都在段落且问题由段落反向生成要求阅读理解基准增加第三条件,同时容纳两边的失效样本。
辛、并行训练准备:数据并行让亿级参数成为日常工程Large-Scale Distributed Training
历史坐标落在2012年的NeurIPS:Dean 等不再允许基础模型与大语言模型在并行训练准备上继续为每项语言任务另造专用管线。Dean 等逐项核对token、语料、提示与外部检索里的并行训练准备;数据来源、推理预算与下游责任由视觉语言对齐另行登记。在NeurIPS的证据账上,由DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练起步,视觉语言对齐进入解释对照;本条残差不能靠改名消失。
并行训练准备的可反驳立场是:异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模。Dean 等这一路线据此把决定性解释锁在一个对象上,视觉语言对齐的“大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移”不能替代本条;边界是异步陈旧梯度与基础设施成本不进入单一精度。若用正交量纲重测仍不能保持方向,视觉语言对齐便构成并行训练准备的近邻反例;NeurIPS对并行训练准备仅支持原任务。
可核对的主证据是Dean 等,2012 年《NeurIPS》25:1223–1231:DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练。DistBelief展示十亿级参数的分布式训练。视觉语言对齐要求把2012年的并行训练准备样本与对照结算,再核查视觉语言对齐的任务、观察窗和异步陈旧梯度与基础设施成本不进入单一精度。对并行训练准备,视觉语言对齐仅作近邻;支点仍是Dean 等在NeurIPS的原始比较。
并行训练准备自己留下的反证入口是:异步陈旧梯度与基础设施成本不进入单一精度,规模优势会集中于少数机构。加入反事实条件时,Dean 等的解释可能缩小、反号,或让位给视觉语言对齐的路径。视觉语言对齐给出复核NeurIPS的近邻条件:先登记停止线再部署;并行训练准备负责记录中止、排除和不显著对象。
DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练改变登记顺序:token、语料、提示与外部检索归并行训练准备,数据来源、推理预算与下游责任交视觉语言对齐核查。2021年的视觉语言对齐以“大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移”作近邻;两者若结论不同,应以异步陈旧梯度与基础设施成本不进入单一精度为分账边界;视觉语言对齐不得与本条合成一个平均分。
2012年,并行训练准备据DistBelief在语音与视觉网络上展示数十亿参数和海量样本训练对接第251号第十一条。跨过去,异步陈旧梯度与基础设施成本不进入单一精度迫使并行训练准备重新检验可见读数。并行训练准备以异步陈旧梯度与基础设施成本不进入单一精度施加反向压力。该接口若仍支持相反方向,异步陈旧梯度与基础设施成本不进入单一精度要求并行训练准备增加第三条件,同时容纳两边的失效样本。
第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。
一、Transformer:注意力把序列训练变成高度并行The Transformer
第一处裂缝来自2017年的NeurIPS:Vaswani 等不再允许基础模型与大语言模型在基础模型与大语言模型里的Transformer上继续为每项语言任务另造专用管线。Vaswani 等逐项核对token、语料、提示与外部检索里的基础模型与大语言模型里的Transformer;数据来源、推理预算与下游责任由多模态通用接口另行登记。在NeurIPS的证据账上,由在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型起步,多模态通用接口进入解释对照;本条残差不能靠改名消失。
基础模型与大语言模型里的Transformer的可反驳立场是:自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐。Vaswani 等这一路线据此把决定性解释锁在一个对象上,多模态通用接口的“冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态”不能替代本条;边界是二次注意力成本、位置表示和数据饥渴没有消失。若撤去界面提示再验仍不能保持方向,多模态通用接口便构成基础模型与大语言模型里的Transformer的近邻反例;NeurIPS对基础模型与大语言模型里的Transformer仅支持原任务。
可核对的主证据是Vaswani 等,2017 年《NeurIPS》30:5998–6008:在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型。Transformer在WMT14英德翻译达到28.4 BLEU。多模态通用接口要求把2017年的基础模型与大语言模型里的Transformer样本与对照结算,再核查多模态通用接口的任务、观察窗和二次注意力成本、位置表示和数据饥渴没有消失。对基础模型与大语言模型里的Transformer,多模态通用接口仅作近邻;支点仍是Vaswani 等在NeurIPS的原始比较。
基础模型与大语言模型里的Transformer自己留下的反证入口是:二次注意力成本、位置表示和数据饥渴没有消失;架构并非全部系统。用盲法重跑关键判断时,Vaswani 等的解释可能缩小、反号,或让位给多模态通用接口的路径。多模态通用接口给出复核NeurIPS的近邻条件:换样本后再问;基础模型与大语言模型里的Transformer负责记录中止、排除和不显著对象。
在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型改变登记顺序:token、语料、提示与外部检索归基础模型与大语言模型里的Transformer,数据来源、推理预算与下游责任交多模态通用接口核查。2022年的多模态通用接口以“冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态”作近邻;两者若结论不同,应以二次注意力成本、位置表示和数据饥渴没有消失为分账边界;多模态通用接口不得与本条合成一个平均分。
2017年,基础模型与大语言模型里的Transformer据在WMT14英德翻译达到28.4 BLEU且训练成本显著低于循环模型对接第043号第二幕四。跨过去,二次注意力成本、位置表示和数据饥渴没有消失迫使基础模型与大语言模型里的Transformer重新检验可见读数。基础模型与大语言模型里的Transformer以二次注意力成本、位置表示和数据饥渴没有消失施加反向压力。该接口若仍支持相反方向,二次注意力成本、位置表示和数据饥渴没有消失要求基础模型与大语言模型里的Transformer增加第三条件,同时容纳两边的失效样本。
二、上下文预训练:同一个词随句子获得不同表示Contextual Pretraining
研究单位改在2019年的NAACL:Devlin、Chang、Lee、Toutanova不再允许基础模型与大语言模型在上下文预训练上继续为每项语言任务另造专用管线。Devlin、Chang、Lee、Toutanova逐项核对token、语料、提示与外部检索里的上下文预训练;数据来源、推理预算与下游责任由混合专家另行登记。在NAACL的证据账上,由BERT在十一项自然语言理解任务刷新结果起步,混合专家进入解释对照;本条残差不能靠改名消失。
上下文预训练的可反驳立场是:掩码语言模型和双向上下文可形成可微调的通用语言表示。Devlin、Chang、Lee、Toutanova这一路线据此把决定性解释锁在一个对象上,混合专家的“稀疏路由使参数量增长与每token计算部分解耦”不能替代本条;边界是预训练目标与使用目标不同。若按亚组分别结算仍不能保持方向,混合专家便构成上下文预训练的近邻反例;NAACL对上下文预训练仅支持原任务。
可核对的主证据是Devlin、Chang、Lee、Toutanova,2019 年《NAACL》:4171–4186,DOI 10.18653/v1/N19-1423:BERT在十一项自然语言理解任务刷新结果,少量任务头即可迁移。BERT在11项自然语言理解任务上复测迁移。混合专家要求把2019年的上下文预训练样本与对照结算,再核查混合专家的任务、观察窗和预训练目标与使用目标不同。对上下文预训练,混合专家仅作近邻;支点仍是Devlin、Chang、Lee、Toutanova在NAACL的原始比较。
上下文预训练自己留下的反证入口是:预训练目标与使用目标不同,基准提升仍可能来自语料记忆和表面线索。将短期与长期拆账时,Devlin、Chang、Lee、Toutanova的解释可能缩小、反号,或让位给混合专家的路径。混合专家给出复核NAACL的近邻条件:把时间窗拉长再看;上下文预训练负责记录中止、排除和不显著对象。回到NAACL的取样方式,上下文预训练要用混合专家证明原分母没有删去最容易失败的对象。
BERT在十一项自然语言理解任务刷新结果改变登记顺序:token、语料、提示与外部检索归上下文预训练,数据来源、推理预算与下游责任交混合专家核查。2022年的混合专家以“稀疏路由使参数量增长与每token计算部分解耦”作近邻;两者若结论不同,应以预训练目标与使用目标不同为分账边界;混合专家不得与本条合成一个平均分。
2019年,上下文预训练据BERT在十一项自然语言理解任务刷新结果对接第043号第二幕二。跨过去,预训练目标与使用目标不同迫使上下文预训练重新检验可见读数。上下文预训练以预训练目标与使用目标不同施加反向压力。该接口若仍支持相反方向,预训练目标与使用目标不同要求上下文预训练增加第三条件,同时容纳两边的失效样本。
三、少样本提示:任务说明开始进入上下文本身In-Context Few-Shot Learning
回到原始设计2020年的NeurIPS:Brown 等不再允许基础模型与大语言模型在少样本提示上继续为每项语言任务另造专用管线。Brown 等逐项核对token、语料、提示与外部检索里的少样本提示;数据来源、推理预算与下游责任由测试时计算另行登记。在NeurIPS的证据账上,由GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善起步,测试时计算进入解释对照;本条残差不能靠改名消失。
少样本提示的可反驳立场是:大规模自回归模型可从提示中的示例改变输出,无需更新权重。Brown 等这一路线据此把决定性解释锁在一个对象上,测试时计算的“固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界”不能替代本条;边界是提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。若改变任务顺序后追踪仍不能保持方向,测试时计算便构成少样本提示的近邻反例;NeurIPS对少样本提示仅支持原任务。
可核对的主证据是Brown 等,2020 年《NeurIPS》33:1877–1901:GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善。测试时计算要求把2020年的少样本提示样本与对照结算,再核查测试时计算的任务、观察窗和提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。对少样本提示,测试时计算仅作近邻;支点仍是Brown 等在NeurIPS的原始比较。
少样本提示自己留下的反证入口是:提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分。把人工接管计入结果时,Brown 等的解释可能缩小、反号,或让位给测试时计算的路径。测试时计算给出复核NeurIPS的近邻条件:保留失败对象后检验;少样本提示负责记录中止、排除和不显著对象。
GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善改变登记顺序:token、语料、提示与外部检索归少样本提示,数据来源、推理预算与下游责任交测试时计算核查。2024年的测试时计算以“固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界”作近邻;两者若结论不同,应以提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分为分账边界;测试时计算不得与本条合成一个平均分。
2020年,少样本提示据GPT-3在翻译、问答和闭卷任务呈现规模相关的零样本与少样本改善对接第256号第二条。跨过去,提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分迫使少样本提示重新检验可见读数。少样本提示以提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分施加反向压力。该接口若仍支持相反方向,提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分要求少样本提示增加第三条件,同时容纳两边的失效样本。
四、基础模型命名:一次训练成为许多系统的共同上游Foundation Models
这一路线先拆掉2021年的On the Opportunities and Risks of Foundation Models:Bommasani 等不再允许基础模型与大语言模型在基础模型命名上继续为每项语言任务另造专用管线。Bommasani 等逐项核对token、语料、提示与外部检索里的基础模型命名;数据来源、推理预算与下游责任由词向量另行登记。在On the Opportunities and Risks of Foundation Models的证据账上,由报告把同质化、涌现、适配和社会影响放在共同研究议程起步,词向量进入解释对照;本条残差不能靠改名消失。
基础模型命名的可反驳立场是:同一大模型经适配进入多任务后,上游缺陷会沿供应链扩散。Bommasani 等这一路线据此把决定性解释锁在一个对象上,词向量的“邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算”不能替代本条;边界是宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。若让独立团队预注册仍不能保持方向,词向量便构成基础模型命名的近邻反例;On the Opportunities and Risks of Foundation Models对基础模型命名仅支持原任务。
可核对的主证据是Bommasani 等,2021 年 arXiv:2108.07258《On the Opportunities and Risks of Foundation Models》:报告把同质化、涌现、适配和社会影响放在共同研究议程。词向量要求把2021年的基础模型命名样本与对照结算,再核查词向量的任务、观察窗和宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。对基础模型命名,词向量仅作近邻;支点仍是Bommasani 等在On the Opportunities and Risks of Foundation Models的原始比较。
基础模型命名自己留下的反证入口是:宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。审计数据近邻与泄漏时,Bommasani 等的解释可能缩小、反号,或让位给词向量的路径。词向量给出复核On the Opportunities and Risks of Foundation Models的近邻条件:改用地点外资料复核;基础模型命名负责记录中止、排除和不显著对象。
报告把同质化、涌现、适配和社会影响放在共同研究议程改变登记顺序:token、语料、提示与外部检索归基础模型命名,数据来源、推理预算与下游责任交词向量核查。2013年的词向量以“邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算”作近邻;两者若结论不同,应以宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别为分账边界;词向量不得与本条合成一个平均分。
2021年,基础模型命名据报告把同质化、涌现、适配和社会影响放在共同研究议程对接第048号第二幕十一。跨过去,宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别迫使基础模型命名重新检验可见读数。基础模型命名以宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别施加反向压力。该接口若仍支持相反方向,宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别要求基础模型命名增加第三条件,同时容纳两边的失效样本。
五、缩放律修订:模型与数据要按计算预算共同增长Compute-Optimal Scaling
需要先恢复2022年的NeurIPS:Hoffmann 等不再允许基础模型与大语言模型在缩放律修订上继续为每项语言任务另造专用管线。Hoffmann 等逐项核对token、语料、提示与外部检索里的缩放律修订;数据来源、推理预算与下游责任由序列到序列另行登记。在NeurIPS的证据账上,由Chinchilla以700亿参数和1.4万亿token超过更大模型起步,序列到序列进入解释对照;本条残差不能靠改名消失。
缩放律修订的可反驳立场是:固定计算下,许多大模型参数过多、训练数据不足;最优配比应同步增加两者。Hoffmann 等这一路线据此把决定性解释锁在一个对象上,序列到序列的“编码器把源序列变成状态,解码器逐词生成目标序列”不能替代本条;边界是训练损失最优不等于推理成本、数据权利和下游风险最优。若把不显著结果一并公开仍不能保持方向,序列到序列便构成缩放律修订的近邻反例;NeurIPS对缩放律修订仅支持原任务。
可核对的主证据是Hoffmann 等,2022 年《NeurIPS》35:30016–30030:Chinchilla以700亿参数和1.4万亿token超过更大模型,重写训练预算。Chinchilla用700亿参数和1.4万亿token重排计算预算。序列到序列要求把2022年的缩放律修订样本与对照结算,再核查序列到序列的任务、观察窗和训练损失最优不等于推理成本、数据权利和下游风险最优。对缩放律修订,序列到序列仅作近邻;支点仍是Hoffmann 等在NeurIPS的原始比较。
缩放律修订自己留下的反证入口是:训练损失最优不等于推理成本、数据权利和下游风险最优。先登记停止线再部署时,Hoffmann 等的解释可能缩小、反号,或让位给序列到序列的路径。序列到序列给出复核NeurIPS的近邻条件:让替代路径进入对照;缩放律修订负责记录中止、排除和不显著对象。
Chinchilla以700亿参数和1.4万亿token超过更大模型改变登记顺序:token、语料、提示与外部检索归缩放律修订,数据来源、推理预算与下游责任交序列到序列核查。2014年的序列到序列以“编码器把源序列变成状态,解码器逐词生成目标序列”作近邻;两者若结论不同,应以训练损失最优不等于推理成本、数据权利和下游风险最优为分账边界;序列到序列不得与本条合成一个平均分。
2022年,缩放律修订据Chinchilla以700亿参数和1.4万亿token超过更大模型对接第047号第二幕九。跨过去,训练损失最优不等于推理成本、数据权利和下游风险最优迫使缩放律修订重新检验可见读数。缩放律修订以训练损失最优不等于推理成本、数据权利和下游风险最优施加反向压力。该接口若仍支持相反方向,训练损失最优不等于推理成本、数据权利和下游风险最优要求缩放律修订增加第三条件,同时容纳两边的失效样本。
六、指令调优:任务集合把语言模型改造成可调用接口Instruction Tuning
证据链从2022年的ICLR:Wei 等不再允许基础模型与大语言模型在指令调优上继续为每项语言任务另造专用管线。Wei 等逐项核对token、语料、提示与外部检索里的指令调优;数据来源、推理预算与下游责任由注意力补丁另行登记。在ICLR的证据账上,由FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译起步,注意力补丁进入解释对照;本条残差不能靠改名消失。
指令调优的可反驳立场是:对多任务自然语言指令微调可提高未见任务的零样本执行。Wei 等这一路线据此把决定性解释锁在一个对象上,注意力补丁的“动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置”不能替代本条;边界是任务措辞和模板覆盖决定迁移。若按个体轨迹而非均值检查仍不能保持方向,注意力补丁便构成指令调优的近邻反例;ICLR对指令调优仅支持原任务。
可核对的主证据是Wei 等,2022 年《ICLR》论文“Finetuned Language Models Are Zero-Shot Learners”:FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译。注意力补丁要求把2022年的指令调优样本与对照结算,再核查注意力补丁的任务、观察窗和任务措辞和模板覆盖决定迁移。对指令调优,注意力补丁仅作近邻;支点仍是Wei 等在ICLR的原始比较。
指令调优自己留下的反证入口是:任务措辞和模板覆盖决定迁移,遵循指令也不等于事实可靠。换样本后再问时,Wei 等的解释可能缩小、反号,或让位给注意力补丁的路径。注意力补丁给出复核ICLR的近邻条件:把排除者放回分母;指令调优负责记录中止、排除和不显著对象。回到ICLR的取样方式,指令调优要用注意力补丁证明原分母没有删去最容易失败的对象。
FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译改变登记顺序:token、语料、提示与外部检索归指令调优,数据来源、推理预算与下游责任交注意力补丁核查。2015年的注意力补丁以“动态对齐解除固定向量瓶颈,使生成每个词时选择相关源位置”作近邻;两者若结论不同,应以任务措辞和模板覆盖决定迁移为分账边界;注意力补丁不得与本条合成一个平均分。
2022年,指令调优据FLAN在数十任务上微调后显著提高自然语言推断、问答与翻译对接第256号第一条。跨过去,任务措辞和模板覆盖决定迁移迫使指令调优重新检验可见读数。指令调优以任务措辞和模板覆盖决定迁移施加反向压力。该接口若仍支持相反方向,任务措辞和模板覆盖决定迁移要求指令调优增加第三条件,同时容纳两边的失效样本。
七、人类反馈对齐:偏好模型把“有用”变成可优化奖励RLHF for Instruction Following
决定性变化始于2022年的NeurIPS:Ouyang 等不再允许基础模型与大语言模型在人类反馈对齐上继续为每项语言任务另造专用管线。Ouyang 等逐项核对token、语料、提示与外部检索里的人类反馈对齐;数据来源、推理预算与下游责任由子词建模另行登记。在NeurIPS的证据账上,由1.3B InstructGPT的人评偏好超过175B基础模型起步,子词建模进入解释对照;本条残差不能靠改名消失。
人类反馈对齐的可反驳立场是:人类比较可训练奖励模型,再用强化学习使输出更符合使用偏好。Ouyang 等这一路线据此把决定性解释锁在一个对象上,子词建模的“高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词”不能替代本条;边界是标注者分布、提示集与奖励代理决定“对齐”含义。若加入反事实条件仍不能保持方向,子词建模便构成人类反馈对齐的近邻反例;NeurIPS对人类反馈对齐仅支持原任务。
可核对的主证据是Ouyang 等,2022 年《NeurIPS》35:27730–27744:1.3B InstructGPT的人评偏好超过175B基础模型,并降低部分有害输出。1.3B参数的InstructGPT在人评中胜过175B基础模型。子词建模要求把2022年的人类反馈对齐样本与对照结算,再核查子词建模的任务、观察窗和标注者分布、提示集与奖励代理决定“对齐”含义。对人类反馈对齐,子词建模仅作近邻;支点仍是Ouyang 等在NeurIPS的原始比较。
人类反馈对齐自己留下的反证入口是:标注者分布、提示集与奖励代理决定“对齐”含义,迎合可能替代真实帮助。把时间窗拉长再看时,Ouyang 等的解释可能缩小、反号,或让位给子词建模的路径。子词建模给出复核NeurIPS的近邻条件:固定资源预算后比较;人类反馈对齐负责记录中止、排除和不显著对象。
1.3B InstructGPT的人评偏好超过175B基础模型改变登记顺序:token、语料、提示与外部检索归人类反馈对齐,数据来源、推理预算与下游责任交子词建模核查。2016年的子词建模以“高频词保留整体、稀有词拆成片段,可兼顾词表大小与未登录词”作近邻;两者若结论不同,应以标注者分布、提示集与奖励代理决定“对齐”含义为分账边界;子词建模不得与本条合成一个平均分。
2022年,人类反馈对齐据1.3B InstructGPT的人评偏好超过175B基础模型对接第048号第二幕四。跨过去,标注者分布、提示集与奖励代理决定“对齐”含义迫使人类反馈对齐重新检验可见读数。人类反馈对齐以标注者分布、提示集与奖励代理决定“对齐”含义施加反向压力。该接口若仍支持相反方向,标注者分布、提示集与奖励代理决定“对齐”含义要求人类反馈对齐增加第三条件,同时容纳两边的失效样本。
八、检索增强:知识可从参数外部查询并保留出处Retrieval-Augmented Generation
最早被迫重写的是2020年的NeurIPS:Lewis 等不再允许基础模型与大语言模型在检索增强上继续为每项语言任务另造专用管线。Lewis 等逐项核对token、语料、提示与外部检索里的检索增强;数据来源、推理预算与下游责任由基础模型与大语言模型里的GloVe另行登记。在NeurIPS的证据账上,由RAG在开放域问答提高事实性与可追溯性起步,基础模型与大语言模型里的GloVe进入解释对照;本条残差不能靠改名消失。
检索增强的可反驳立场是:生成时检索可更新的文档库,让事实知识不必全部固化在参数中。Lewis 等这一路线据此把决定性解释锁在一个对象上,基础模型与大语言模型里的GloVe的“词与词的共现比率携带语义关系,可由加权矩阵分解学习”不能替代本条;边界是召回失败、恶意文档和引用错配会把错误从生成器移到检索链。若用盲法重跑关键判断仍不能保持方向,基础模型与大语言模型里的GloVe便构成检索增强的近邻反例;NeurIPS对检索增强仅支持原任务。
可核对的主证据是Lewis 等,2020 年《NeurIPS》33:9459–9474:RAG在开放域问答提高事实性与可追溯性,并能更换索引而不重训。基础模型与大语言模型里的GloVe要求把2020年的检索增强样本与对照结算,再核查基础模型与大语言模型里的GloVe的任务、观察窗和召回失败、恶意文档和引用错配会把错误从生成器移到检索链。对检索增强,基础模型与大语言模型里的GloVe仅作近邻;支点仍是Lewis 等在NeurIPS的原始比较。
检索增强自己留下的反证入口是:召回失败、恶意文档和引用错配会把错误从生成器移到检索链。保留失败对象后检验时,Lewis 等的解释可能缩小、反号,或让位给基础模型与大语言模型里的GloVe的路径。基础模型与大语言模型里的GloVe给出复核NeurIPS的近邻条件:用正交量纲重测;检索增强负责记录中止、排除和不显著对象。
RAG在开放域问答提高事实性与可追溯性改变登记顺序:token、语料、提示与外部检索归检索增强,数据来源、推理预算与下游责任交基础模型与大语言模型里的GloVe核查。2014年的基础模型与大语言模型里的GloVe以“词与词的共现比率携带语义关系,可由加权矩阵分解学习”作近邻;两者若结论不同,应以召回失败、恶意文档和引用错配会把错误从生成器移到检索链为分账边界;基础模型与大语言模型里的GloVe不得与本条合成一个平均分。
2020年,检索增强据RAG在开放域问答提高事实性与可追溯性对接第256号第九条。跨过去,召回失败、恶意文档和引用错配会把错误从生成器移到检索链迫使检索增强重新检验可见读数。检索增强以召回失败、恶意文档和引用错配会把错误从生成器移到检索链施加反向压力。该接口若仍支持相反方向,召回失败、恶意文档和引用错配会把错误从生成器移到检索链要求检索增强增加第三条件,同时容纳两边的失效样本。
九、视觉语言对齐:图文对成为开放词汇分类器Contrastive Language–Image Pretraining
这一条先处理2021年的ICML:Radford 等不再允许基础模型与大语言模型在视觉语言对齐上继续为每项语言任务另造专用管线。Radford 等逐项核对token、语料、提示与外部检索里的视觉语言对齐;数据来源、推理预算与下游责任由神经机器翻译系统化另行登记。在ICML的证据账上,由CLIP在三十余数据集零样本评估中接近有监督基线起步,神经机器翻译系统化进入解释对照;本条残差不能靠改名消失。
视觉语言对齐的可反驳立场是:大规模自然图文对可把视觉类别映射到文本空间,支持提示式零样本迁移。Radford 等这一路线据此把决定性解释锁在一个对象上,神经机器翻译系统化的“残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统”不能替代本条;边界是网络图文偏见、文本提示和数据记忆决定结果。若将短期与长期拆账仍不能保持方向,神经机器翻译系统化便构成视觉语言对齐的近邻反例;ICML对视觉语言对齐仅支持原任务。
可核对的主证据是Radford 等,2021 年《ICML》139:8748–8763:CLIP在三十余数据集零样本评估中接近有监督基线,并可开放词汇检索。CLIP在30余个数据集做零样本评测。神经机器翻译系统化要求把2021年的视觉语言对齐样本与对照结算,再核查神经机器翻译系统化的任务、观察窗和网络图文偏见、文本提示和数据记忆决定结果。对视觉语言对齐,神经机器翻译系统化仅作近邻;支点仍是Radford 等在ICML的原始比较。
视觉语言对齐自己留下的反证入口是:网络图文偏见、文本提示和数据记忆决定结果,罕见文化对象覆盖不足。改用地点外资料复核时,Radford 等的解释可能缩小、反号,或让位给神经机器翻译系统化的路径。神经机器翻译系统化给出复核ICML的近邻条件:撤去界面提示再验;视觉语言对齐负责记录中止、排除和不显著对象。
CLIP在三十余数据集零样本评估中接近有监督基线改变登记顺序:token、语料、提示与外部检索归视觉语言对齐,数据来源、推理预算与下游责任交神经机器翻译系统化核查。2016年的神经机器翻译系统化以“残差LSTM、注意力、字词混合和分布式训练可组成生产级翻译系统”作近邻;两者若结论不同,应以网络图文偏见、文本提示和数据记忆决定结果为分账边界;神经机器翻译系统化不得与本条合成一个平均分。
2021年,视觉语言对齐据CLIP在三十余数据集零样本评估中接近有监督基线对接第050号第二幕四。跨过去,网络图文偏见、文本提示和数据记忆决定结果迫使视觉语言对齐重新检验可见读数。视觉语言对齐以网络图文偏见、文本提示和数据记忆决定结果施加反向压力。该接口若仍支持相反方向,网络图文偏见、文本提示和数据记忆决定结果要求视觉语言对齐增加第三条件,同时容纳两边的失效样本。
十、多模态通用接口:文本、图像、音频被放进同一交互回路Multimodal Foundation Models
原论文正面碰到2022年的NeurIPS:Alayrac 等不再允许基础模型与大语言模型在多模态通用接口上继续为每项语言任务另造专用管线。Alayrac 等逐项核对token、语料、提示与外部检索里的多模态通用接口;数据来源、推理预算与下游责任由阅读理解基准另行登记。在NeurIPS的证据账上,由Flamingo用少样本提示在多项图像与视频任务达到强结果起步,阅读理解基准进入解释对照;本条残差不能靠改名消失。
多模态通用接口的可反驳立场是:冻结视觉与语言骨干并用跨注意力连接,可在上下文中处理交错模态。Alayrac 等这一路线据此把决定性解释锁在一个对象上,阅读理解基准的“问答把语言表示从句级分类推进到条件检索和答案跨度预测”不能替代本条;边界是语言先验会在未看清图像时猜答案。若把人工接管计入结果仍不能保持方向,阅读理解基准便构成多模态通用接口的近邻反例;NeurIPS对多模态通用接口仅支持原任务。
可核对的主证据是Alayrac 等,2022 年《NeurIPS》35:23716–23736《Flamingo》:Flamingo用少样本提示在多项图像与视频任务达到强结果。阅读理解基准要求把2022年的多模态通用接口样本与对照结算,再核查阅读理解基准的任务、观察窗和语言先验会在未看清图像时猜答案。对多模态通用接口,阅读理解基准仅作近邻;支点仍是Alayrac 等在NeurIPS的原始比较。
多模态通用接口自己留下的反证入口是:语言先验会在未看清图像时猜答案;多模态分数需拆开感知与推理。让替代路径进入对照时,Alayrac 等的解释可能缩小、反号,或让位给阅读理解基准的路径。阅读理解基准给出复核NeurIPS的近邻条件:按亚组分别结算;多模态通用接口负责记录中止、排除和不显著对象。
Flamingo用少样本提示在多项图像与视频任务达到强结果改变登记顺序:token、语料、提示与外部检索归多模态通用接口,数据来源、推理预算与下游责任交阅读理解基准核查。2016年的阅读理解基准以“问答把语言表示从句级分类推进到条件检索和答案跨度预测”作近邻;两者若结论不同,应以语言先验会在未看清图像时猜答案为分账边界;阅读理解基准不得与本条合成一个平均分。
2022年,多模态通用接口据Flamingo用少样本提示在多项图像与视频任务达到强结果对接第050号第二幕十。跨过去,语言先验会在未看清图像时猜答案迫使多模态通用接口重新检验可见读数。多模态通用接口以语言先验会在未看清图像时猜答案施加反向压力。该接口若仍支持相反方向,语言先验会在未看清图像时猜答案要求多模态通用接口增加第三条件,同时容纳两边的失效样本。
十一、混合专家:每个token只调用部分参数Sparse Mixture of Experts
方法转向发生在2022年的JMLR:Fedus、Zoph、Shazeer不再允许基础模型与大语言模型在混合专家上继续为每项语言任务另造专用管线。Fedus、Zoph、Shazeer逐项核对token、语料、提示与外部检索里的混合专家;数据来源、推理预算与下游责任由并行训练准备另行登记。在JMLR的证据账上,由Switch Transformer把模型扩到万亿参数起步,并行训练准备进入解释对照;本条残差不能靠改名消失。
混合专家的可反驳立场是:稀疏路由使参数量增长与每token计算部分解耦。Fedus、Zoph、Shazeer这一路线据此把决定性解释锁在一个对象上,并行训练准备的“异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模”不能替代本条;边界是负载不均、路由不稳和通信开销会吞掉理论效率。若审计数据近邻与泄漏仍不能保持方向,并行训练准备便构成混合专家的近邻反例;JMLR对混合专家仅支持原任务。
可核对的主证据是Fedus、Zoph、Shazeer,2022 年《JMLR》23(120):1–39:Switch Transformer把模型扩到万亿参数,同时保持近似固定计算。Switch Transformer把总参数扩到万亿量级。并行训练准备要求把2022年的混合专家样本与对照结算,再核查并行训练准备的任务、观察窗和负载不均、路由不稳和通信开销会吞掉理论效率。对混合专家,并行训练准备仅作近邻;支点仍是Fedus、Zoph、Shazeer在JMLR的原始比较。
混合专家自己留下的反证入口是:负载不均、路由不稳和通信开销会吞掉理论效率,专家分工也未必可解释。把排除者放回分母时,Fedus、Zoph、Shazeer的解释可能缩小、反号,或让位给并行训练准备的路径。并行训练准备给出复核JMLR的近邻条件:改变任务顺序后追踪;混合专家负责记录中止、排除和不显著对象。
Switch Transformer把模型扩到万亿参数改变登记顺序:token、语料、提示与外部检索归混合专家,数据来源、推理预算与下游责任交并行训练准备核查。2012年的并行训练准备以“异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模”作近邻;两者若结论不同,应以负载不均、路由不稳和通信开销会吞掉理论效率为分账边界;并行训练准备不得与本条合成一个平均分。
2022年,混合专家据Switch Transformer把模型扩到万亿参数对接第043号第二幕九。跨过去,负载不均、路由不稳和通信开销会吞掉理论效率迫使混合专家重新检验可见读数。混合专家以负载不均、路由不稳和通信开销会吞掉理论效率施加反向压力。该接口若仍支持相反方向,负载不均、路由不稳和通信开销会吞掉理论效率要求混合专家增加第三条件,同时容纳两边的失效样本。
十二、测试时计算:答案质量开始由推理阶段预算调节Test-Time Compute
这项工作首先校正2024年的Scaling LLM Test-Time Compute Optimally:Snell、Lee、Xu、Kumar不再允许基础模型与大语言模型在测试时计算上继续为每项语言任务另造专用管线。Snell、Lee、Xu、Kumar逐项核对token、语料、提示与外部检索里的测试时计算;数据来源、推理预算与下游责任由基础模型与大语言模型里的Transformer另行登记。在Scaling LLM Test-Time Compute Optimally的证据账上,由在数学任务上起步,基础模型与大语言模型里的Transformer进入解释对照;本条残差不能靠改名消失。
测试时计算的可反驳立场是:固定模型也可通过采样、验证与搜索分配更多推理计算,改变能力边界。Snell、Lee、Xu、Kumar这一路线据此把决定性解释锁在一个对象上,基础模型与大语言模型里的Transformer的“自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐”不能替代本条;边界是验证器错误和任务可判定性决定收益。若先登记停止线再部署仍不能保持方向,基础模型与大语言模型里的Transformer便构成测试时计算的近邻反例;Scaling LLM Test-Time Compute Optimally对测试时计算仅支持原任务。
可核对的主证据是Snell、Lee、Xu、Kumar,2024 年 arXiv:2408.03314《Scaling LLM Test-Time Compute Optimally》:在数学任务上,合适的测试时策略可超过单纯扩大基础模型的计算收益。基础模型与大语言模型里的Transformer要求把2024年的测试时计算样本与对照结算,再核查基础模型与大语言模型里的Transformer的任务、观察窗和验证器错误和任务可判定性决定收益。对测试时计算,基础模型与大语言模型里的Transformer仅作近邻;支点仍是Snell、Lee、Xu、Kumar在Scaling LLM Test-Time Compute Optimally的原始比较。
测试时计算自己留下的反证入口是:验证器错误和任务可判定性决定收益;更长思维链也可能只是更长的自信错误。固定资源预算后比较时,Snell、Lee、Xu、Kumar的解释可能缩小、反号,或让位给基础模型与大语言模型里的Transformer的路径。基础模型与大语言模型里的Transformer给出复核Scaling LLM Test-Time Compute Optimally的近邻条件:让独立团队预注册;测试时计算负责记录中止、排除和不显著对象。
在数学任务上改变登记顺序:token、语料、提示与外部检索归测试时计算,数据来源、推理预算与下游责任交基础模型与大语言模型里的Transformer核查。2017年的基础模型与大语言模型里的Transformer以“自注意力直接连接任意位置,摆脱循环依赖并提高并行吞吐”作近邻;两者若结论不同,应以验证器错误和任务可判定性决定收益为分账边界;基础模型与大语言模型里的Transformer不得与本条合成一个平均分。
2024年,测试时计算据在数学任务上对接第251号第十三条。跨过去,验证器错误和任务可判定性决定收益迫使测试时计算重新检验可见读数。测试时计算以验证器错误和任务可判定性决定收益施加反向压力。该接口若仍支持相反方向,验证器错误和任务可判定性决定收益要求测试时计算增加第三条件,同时容纳两边的失效样本。
◎ 二十年连起来看
第一幕不是旧成果清单,而是基础模型与大语言模型第一次为自己建立可失败的比较尺。词向量收紧了旧默认,子词建模把隐含过程拆成可估参数,并行训练准备又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。
第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。基础模型与大语言模型里的Transformer扩展了表示或分布,人类反馈对齐改变了研究单位,测试时计算则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。
二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。注意力补丁说明干预能改变路径,基础模型命名说明单一读数会混合层级,多模态通用接口又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。
◎ 三个常见误解
误解一:序列到序列已经给出了稳定的通用解释。它容易取信,是因为编码器把源序列变成状态,解码器逐词生成目标序列确实改变了旧的研究方式。但固定状态压缩长句,自动指标也不等于意义忠实与可用性,所以正确表述只能限于原设计可识别的那一段责任链。
误解二:少样本提示等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但大规模自回归模型可从提示中的示例改变输出,无需更新权重仍只是一个可检验命题。提示敏感、校准差和训练污染使“学会新任务”与模式续写难以区分说明,没有干预、替代解释和边界样本,可读不等于因果正确。
误解三:混合专家的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把负载不均、路由不稳和通信开销会吞掉理论效率,专家分工也未必可解释藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。
◎ 与相邻领域的接口
词向量与第256号第八条“分词与文本表示的底层”的分工在于:本页负责邻近上下文可把词的用法压成稠密向量,使关系能用距离和方向计算,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。
阅读理解基准可与第256号第三条“评测的构念效度危机”交换制度或工程中的回写证据。前者的核心命题是问答把语言表示从句级分类推进到条件检索和答案跨度预测,但答案都在段落且问题由段落反向生成,捷径与标注边界限制“理解”解释;后者则能检验同一接口是否把选择成本转移给了另一个主体。
检索增强与第256号第九条“检索增强生成”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用召回失败、恶意文档和引用错配会把错误从生成器移到检索链给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。
◎ 争议现场
基础模型与大语言模型里的GloVe的争议是静态表示仍把历史语料偏见固化为几何距离,更新新义也需重训。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。
基础模型命名的争议是宽泛命名可能把完全不同数据、架构和责任关系压成一个产业类别。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。
多模态通用接口的争议是语言先验会在未看清图像时猜答案;多模态分数需拆开感知与推理。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。
◎ 往下五年看什么
到2031年,看基础模型与大语言模型里的Transformer的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。
看缩放律修订在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。
看视觉语言对齐的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。
看测试时计算的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。
◎ 可与哪些领域对撞
词向量与第256号第八条“分词与文本表示的底层”共享“可见读数能代表真实对象”的预设。本条用单一词向量把多义词和语境平均,社会偏见也随共现统计进入空间给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。
并行训练准备与第251号第十一条“数据中心作为一台计算机”共享“局部表现能够结算整体能力”的预设。并行训练准备主张异步参数服务器把模型更新分散到大量CPU机器,改变可承担的搜索规模。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。
检索增强与第256号第九条“检索增强生成”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是召回失败、恶意文档和引用错配会把错误从生成器移到检索链。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。
◎ 十条可做的研究命题
- 在时间外数据上重做词向量;方向保持率低于二分之一即证伪其稳定性。
- 把序列到序列的中止与排除对象放回分母;主效应反号即否定原总结。
- 为注意力补丁配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
- 由独立团队预注册子词建模的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
- 对基础模型与大语言模型里的GloVe的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
- 主动改变神经机器翻译系统化的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
- 对少样本提示做反事实干预;可视化不随关键参数变化即证伪忠实性。
- 把人类反馈对齐交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
- 公开混合专家的最强失败实现;下一方法只在原基准改善即判定为换题。
- 为测试时计算事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。
◎ 资料核验
- Mikolov、Chen、Corrado、Dean,2013 年 arXiv:1301.3781《Efficient Estimation of Word Representations in Vector Space》。
- Sutskever、Vinyals、Le,2014 年《NeurIPS》27:3104–3112。
- Bahdanau、Cho、Bengio,2015 年《ICLR》论文“Neural Machine Translation by Jointly Learning to Align and Translate”。
- Sennrich、Haddow、Birch,2016 年《ACL》:1715–1725,DOI 10.18653/v1/P16-1162。
- Pennington、Socher、Manning,2014 年《EMNLP》:1532–1543,DOI 10.3115/v1/D14-1162。
- Wu 等,2016 年 arXiv:1609.08144《Google’s Neural Machine Translation System》。
- Rajpurkar、Zhang、Lopyrev、Liang,2016 年《EMNLP》:2383–2392,DOI 10.18653/v1/D16-1264。
- Dean 等,2012 年《NeurIPS》25:1223–1231。
- Vaswani 等,2017 年《NeurIPS》30:5998–6008。
- Devlin、Chang、Lee、Toutanova,2019 年《NAACL》:4171–4186,DOI 10.18653/v1/N19-1423。
- Brown 等,2020 年《NeurIPS》33:1877–1901。
- Bommasani 等,2021 年 arXiv:2108.07258《On the Opportunities and Risks of Foundation Models》。
- Hoffmann 等,2022 年《NeurIPS》35:30016–30030。
- Wei 等,2022 年《ICLR》论文“Finetuned Language Models Are Zero-Shot Learners”。
- Ouyang 等,2022 年《NeurIPS》35:27730–27744。
- Lewis 等,2020 年《NeurIPS》33:9459–9474。
- Radford 等,2021 年《ICML》139:8748–8763。
- Alayrac 等,2022 年《NeurIPS》35:23716–23736《Flamingo》。
- Fedus、Zoph、Shazeer,2022 年《JMLR》23(120):1–39。
- Snell、Lee、Xu、Kumar,2024 年 arXiv:2408.03314《Scaling LLM Test-Time Compute Optimally》。
- Dubey 等,2024 年 arXiv:2407.21783《The Llama 3 Herd of Models》。
- Guo 等,2025 年 arXiv:2501.12948《DeepSeek-R1》。
- OpenAI,2024 年 arXiv:2412.16720《Deliberative Alignment》。
- Liang 等,2024 年 arXiv:2407.03418《Holistic Evaluation of Multimodal Foundation Models》。
- Peters、Neumann、Iyyer 等,2018 年《NAACL》:2227–2237,DOI 10.18653/v1/N18-1202。
- Raffel、Shazeer、Roberts 等,2020 年《JMLR》21(140):1–67。
- Wei 等,2022 年《NeurIPS》35:24824–24837。
以下二十条是基础模型与大语言模型在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。
经一、机器翻译备忘录:一份把整件事低估了四十年的提案Classic 01 · Foundation Models and LLMs
这份提案的价值在于它第一次把翻译规定成可计算的问题,而不是艺术。它提出的三条线索——统计规律、语言共性、逻辑推理——此后各自长成一整片研究领域。它也促成了第一批实际系统与第一批公开演示,把这件事从设想推进到可被检验的阶段。
低估同样彻底。密码类比默认信息在编码中完整保留,只是被打乱;而语言之间大量的东西是不可逆丢失或必须由语境补出的。这一误判在十几年后由 ALPAC 报告结算:质量远低于承诺,经费大幅削减。这一条示范了一件事——问题的可计算化与它的可解性,是两回事;把一件事写成方程,不保证方程里的量都存在。
经二、短语结构与转换:语言能力被写成一套可枚举的规则Classic 02 · Foundation Models and LLMs
这本书同时立起了两样东西:一个关于人类语言能力的理论主张,和一套形式语言的层级。后者对计算机科学的影响甚至比对语言学更持久——编译器、正则表达式与解析算法都建立在这套层级上。它把「什么样的机器能处理什么样的语言」变成了可证明的问题。
工程上的分歧出在生成方向。规则路线要求把合法性写完,而真实语言里的合法性是渐变的、带概率的、随语域漂移的。统计方法放弃了写完,改为从语料估计倾向。此后半个世纪的胜负很清楚,但值得注意的是分歧点不在「语言有没有结构」,而在「结构该被写下来还是被估计出来」。
经三、分布假说:一个词的意思,看它常和谁一起出现Classic 03 · Foundation Models and LLMs
这条假说的好处是它把语义变成了可计数的东西:不需要定义「意思」是什么,只需要统计谁和谁一起出现。整个计算语义学建立在这一步上,而它成立到什么程度,至今仍是这个领域最根本的经验问题。
它的边界同样清楚。分布相似不区分同义与反义——「好」与「坏」出现的位置高度相似;它也抓不到指称,语料里没有的世界知识不会凭空出现。这两条限制在词向量时代表现为「向量算术看起来能做类比但常出错」,在大模型时代表现为事实性错误,问题的形状没有变过:分布告诉你词怎么用,不告诉你世界是什么样。
经四、贝尔实验室的转折:让数据说话,而不是让语言学家说话Classic 04 · Foundation Models and LLMs
这条路线把领域的评价标准换了:不再问模型是否符合语言学理论,只问在留出数据上的错误率。噪声信道框架把语言模型与翻译模型分开估计再合成,各自都可以独立改进——这种可分解性是它能持续进步二十年的工程原因。
代价是语料成了瓶颈,也成了权力。谁有大规模平行语料谁就领先,而这与语言学洞察无关。今天的争论仍然沿这条线:模型规模与数据规模是否可以无限替代对结构的理解。这一条经典的用处是提醒——那场争论已经进行了五十年,每一轮都是同样的两方,而每一轮的胜负都由当期可得的数据规模决定。
经五、隐马尔可夫模型:先假定看不见的那一层,再把它估出来Classic 05 · Foundation Models and LLMs
它的关键动作是引入了一层看不见的东西,并且给出了在没有标注的情况下把它估出来的算法。这使得序列建模第一次可以在大规模未标注数据上进行。前向后向与维特比两套算法至今仍是所有序列模型讲解的起点。
两条假设是它的天花板:当前状态只依赖前一个状态,观测只依赖当前状态。这意味着所有历史必须被压进一个有限的状态里。长句、跨句指代、篇章一致性都撞在这里。此后每一次序列建模的进步——条件随机场、循环网络、注意力——都可以读成对这两条假设的一次放宽,而放宽的代价一律是计算量。
经六、潜在语义分析:把词—文档矩阵压扁,意思就浮出来了Classic 06 · Foundation Models and LLMs
它解决的是检索里的老问题:查「汽车」找不到写着「轿车」的文档。降维之后,两个从不共同出现的同义词可以因为共享上下文而在低维空间里靠近。这是「用线性代数处理语义」第一次真正奏效,也是后来一切嵌入方法的直接祖先。
它的两条限制都在假设里。词袋丢掉了语序,因而「狗咬人」与「人咬狗」同表示;线性分解假定语义关系可加,而多义词被压成一个向量,其结果是若干义项的加权平均,罕见义项被主导义项压住。上下文表示解决的正是后一条——同一个词在不同句子里拿不同的向量,多义不再需要被平均掉。
经七、宾州树库:先把标注做出来,方法才有地方生长Classic 07 · Foundation Models and LLMs
这项工作的性质是基础设施而非方法:几百万词的人工句法标注,规范文件比多数论文都长。它的效果立竿见影——有监督分析器的准确率在十年内从七成升到九成以上,整个方向被它带起来。没有它,那十年的方法论文一篇也写不出来。
它同时把一整套理论选择固化成了默认。树库采用哪种句法框架、如何处理省略与并列,这些决定进入了所有在其上训练的模型,也进入了所有以它为准的评测。领域后来花了很大力气才重新讨论这些选择。基准数据集的中立性是一种错觉——它总是某一套理论的具体化。
经八、IBM 模型与词对齐:翻译的最小单位是被算出来的Classic 08 · Foundation Models and LLMs
这项工作最漂亮的一步是不预设翻译单位。词典与短语表不是人编的,是从平行句对里估出来的——哪个词对哪个词,由数据决定。这让翻译系统第一次可以只靠平行语料构建,不需要任何语言学资源,因而可以迅速铺到许多语言对上。
对齐这个中间表示后来成了包袱也成了遗产。包袱在于它把翻译强行拆成局部对应,处理不了语序大幅重排与一对多的情形;遗产在于注意力机制被提出时,人们立刻看出它是一种软的、可微的对齐——同一个概念换了实现方式,而且不再需要显式的中间表示。
经九、BLEU:一个用来省钱的指标,最后决定了整个领域做什么Classic 09 · Foundation Models and LLMs
它解决的是一个现实问题:人工评测太慢太贵,无法支持每天多次的迭代。有了它,翻译研究第一次可以像工程一样快速试错。它的设计也很克制——作者明确说它是近似,只在系统间比较时有意义,不宜作绝对质量指标。
后来发生的事与作者的告诫无关。指标成了论文能否发表的门槛,于是所有改进都朝着提高这个数的方向做,而它对语义正确性、指代一致性与事实性几乎不敏感。当系统质量接近时,它与人工判断的相关性大幅下降,却仍被沿用了十几年。这是「指标一旦成为目标就不再是好指标」在这门学科里最清楚的案例。
经十、最大熵与判别式建模:不再假装知道数据是怎么生成的Classic 10 · Foundation Models and LLMs
它给出的是一条方法论原则:只承诺你确实知道的东西,其余保持最不确定。工程上的后果是特征可以随便加——词形、词性、前后缀、词典命中,不必假设它们互相独立。这一点解决了朴素贝叶斯长期的痛处,也让领域知识可以直接以特征形式注入。
它与生成式建模的分工此后反复翻转。判别式在标注数据充足时更准,生成式在数据稀少或需要合成时更有用。大规模预训练把天平又拨了回去——先用生成目标学表示,再判别式微调。这条经典的价值在于它把「要不要对数据生成过程作假设」这个选择明确成了一个可讨论的问题。
经十一、词类归纳与无监督分割:不给答案,也能把结构切出来Classic 11 · Foundation Models and LLMs
这项工作的说服力在于对照:算法完全不知道什么是名词动词,却切出了与语言学分类高度吻合的类别。这为「结构可以从分布中被发现」提供了直接证据,也提供了一种廉价的特征——在标注数据稀缺的年代,Brown 类别是许多系统性能提升的主要来源。
它的两条硬约束是硬聚类与单义:一个词只能属于一个类,而层次结构一旦建成不随上下文改变。真实语言里大量词跨类使用,且类别边界本身模糊。连续向量取消了这两条约束——一个词的位置可以在多个类别之间,而上下文表示进一步让它随句子移动。
经十二、神经概率语言模型:先给每个词一个向量,再预测下一个词Classic 12 · Foundation Models and LLMs
这项工作把两件此前分开的事合成了一件:表示学习与语言建模。n 元语法模型对没见过的组合无能为力,因为它把词当成互不相干的符号;把词嵌入连续空间之后,相似的词自动共享统计强度,没见过的组合可以由相邻的组合推出。今天的一切都建立在这一步上。
它没有立刻流行的原因是工程性的:输出层要对整个词表归一化,词表几万时每一步都极贵。这个瓶颈被绕开之后,同一思路才在几年内铺开。这条经典因此是「想法与可算性之间隔着一道工程闸」的又一个例子——闸没打开时,正确的想法看上去像不实用的想法。
经十三、短语翻译模型:把对齐结果打包成可查的表Classic 13 · Foundation Models and LLMs
它的进步来自一个朴素观察:很多翻译对应是成串的,拆成词反而丢信息。把短语当单位既保留了局部语序,又把常见搭配整体记住。加上对数线性框架,各个子模型的权重可以在开发集上直接调优——这使系统工程化,也使小团队能参与。
它的天花板也在同一处。短语是局部的,长距离重排必须靠单独的重排序模型硬撑,而对日语与英语这样语序差异极大的语言对,效果始终有限。整条流水线由多个独立训练的模块拼成,误差逐级累积且无法联合优化——端到端方法最大的一次收益,就来自取消这些接缝。
经十四、Kneser–Ney 平滑:没见过的组合,该给它多少概率Classic 14 · Foundation Models and LLMs
这条方法的洞察极精细:一个词出现次数多,不代表它容易出现在新语境里。如「Francisco」频次很高但几乎只跟在「San」后面,回退时不该给它高概率。改用「它跟过多少种不同的前文」来估计,效果明显更好。这是对「频次即倾向」这一直觉的一次精确修正。
它的历史位置很特别:它是符号统计方法做到极致的产物,几乎无法再改进,因而成了衡量神经方法是否真有进步的硬标尺。很长一段时间里,神经语言模型必须与它插值才能超过它。稀疏性最终不是被更聪明的平滑解决的,而是被表示的连续化与数据规模解决的。
经十五、WordNet:把词义关系手工织成一张网Classic 15 · Foundation Models and LLMs
它给了计算语义学一份可直接使用的结构化知识:不是词表,是关系网。上下位链让「猫是动物」这类推理可以被查出来而不必被学到。二十年里几乎所有语义相似度工作都以它为基准或资源,它也是「符号知识可以与统计方法互补」这一主张最有力的实物证据。
三处限制都来自手工:义项划分细到母语者也难以分辨,标注一致性因而很低;覆盖限于常用词,专业与新兴词汇长期缺失;更新依赖人力,跟不上语言变化。这些不是设计缺陷而是手工路线的固有代价,也正是后来「把知识放在可检索的外部语料里」这条路要绕开的东西。
经十六、条件随机场:给整条序列打分,而不是逐位置打分Classic 16 · Foundation Models and LLMs
它修的是一个具体而隐蔽的毛病:逐位置归一化的模型会偏爱后继状态少的路径,因为那些路径上的概率被摊得少——与观测无关的结构性偏置。全局归一化取消了这一点,代价是要在整条序列上做配分函数计算,好在动态规划让它可行。
它把特征工程推到了顶峰,也因此埋下了自己的终点。性能主要取决于特征模板设计得好不好,而这需要领域专家逐任务重来。当表示可以从数据里学出来时,这部分成本整块消失。这条经典因此标记了一次分工转移:从「人设计特征、机器估权重」到「机器同时做两件事」。
经十七、词义消歧与「一次语篇一个义项」:一条被反复引用的经验规则Classic 17 · Foundation Models and LLMs
这是一条极便宜的约束:不需要任何标注,只需要文档边界。把它与「一次搭配一个义项」合用,可以从少量种子出发自举出大规模的消歧器。它示范了弱监督的基本手法——找到一个几乎总是成立的结构性事实,把它当作免费的标注信号。
它的可靠性随文本类型变化:新闻里成立得好,长篇技术文档与文学作品里则常被打破。更要紧的是自举过程会放大早期错误——种子选偏了,整个迭代会朝错误方向收敛且看不出来。这两条至今是所有弱监督与自训练方法的共同风险,而且都不会在训练指标上显形。
经十八、ALPAC 报告:一次把整条路线叫停十年的评估Classic 18 · Foundation Models and LLMs
报告本身是认真的:它做了对照评测,算了成本,结论与数据相符。它的正当性在于当时确实没有可用系统,而经费不是无限的。把它读成「短视」并不公平——在给定的技术条件下,它的判断是合理的。
问题出在推断的射程。报告实际证明的是「在这套方法与这个算力下不可行」,被采纳的却是「这个方向不可行」,后果是一代人的经费与人才流失。这与本层《感知机》那一条是同构的失败:一个条件内的否定结论,被搬到条件之外。评估越权威,这种越界的代价越大——因为它同时关掉了检验它自己的那条路。
经十九、数据并行训练:把一个模型摊到许多台机器上Classic 19 · Foundation Models and LLMs
这一步把模型规模从「一台机器装得下多少」中解放出来。它在算法上几乎不改变什么——梯度是可加的,分片求和与整批求和在数学上等价——难的全在系统:如何同步、掉队的机器怎么办、通信带宽够不够。规模问题第一次成为工程问题而非算法问题。
它带来的新约束至今在起作用。批量增大后学习率必须相应调整,否则泛化下降;同步等待使最慢的节点决定整体速度;通信量随参数量增长而带宽不随之增长。今天关于模型结构的许多选择——包括让每个输入只激活一部分参数——直接源于这些约束,而不是源于对语言的理解。
经二十、斯坦福依存关系:让句法结果直接可用于下游Classic 20 · Foundation Models and LLMs
它的动机是实用的:短语结构树对语言学家有用,对做信息抽取的人不好用——他们要知道谁是主语、谁修饰谁。依存表示把这些关系直接标出来,于是句法分析的结果第一次可以被下游任务原样消费。这一步大幅提高了句法研究的外部效用。
它随后的推广提出了一个更难的问题:一套标注体系要覆盖几十种语言,就必须在「统一可比」与「忠实于各语言的形态句法」之间取舍。取统一,某些语言的特有现象被压平;取忠实,跨语言比较与迁移就失去共同基础。这个两难在多模态统一接口上以完全相同的形状再次出现。
◎ 这一层怎么用
先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。
三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(Shannon 的信息论、Turing 的可计算性、Zipf 的频次定律)只在流变栏里被点名。其二,经典身份不提供豁免——本层有四条今天已被明确修正:机器翻译备忘录的密码类比低估了不可还原的部分、ALPAC 报告把条件内结论推成方向判决、BLEU 在系统接近时与人工判断脱钩、分布假说至今分不开同义与反义。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。
本层四条路的落点:机制路(分布假说、隐马尔可夫、潜在语义分析、最大熵、神经概率语言模型、条件随机场)问「靠什么算得出意思」;测量路(BLEU、Kneser–Ney、词类归纳、一次语篇一个义项)问「凭什么说它译对了」;制度路(贝尔实验室转折、宾州树库、短语翻译模型、数据并行、斯坦福依存)问「谁定赛道、谁付得起入场费」;人的路(机器翻译备忘录、《句法结构》之争、ALPAC 报告、WordNet 的手工代价)问「一次外推或一次评估的代价由谁承担」。⚠ 这门学科反复出现的母题是评测口径决定研究方向——BLEU 与 ALPAC 是同一件事的两端,一个让方向走得太顺,一个让方向停得太早。
◎ 经典层资料核验
- Weaver, W. Translation. In Locke, W. N. and Booth, A. D. (eds.) Machine Translation of Languages. Cambridge, MA: Technology Press, 1955(专著)。
- Hutchins, W. J. Machine Translation: Past, Present, Future. Chichester: Ellis Horwood, 1986(专著)。
- Chomsky, N. Syntactic Structures. The Hague: Mouton, 1957(专著)。
- Chomsky, N. Three models for the description of language. IRE Transactions on Information Theory 2 (1956): 113–124。
- Harris, Z. S. Distributional structure. Word 10 (1954): 146–162。
- Firth, J. R. A synopsis of linguistic theory 1930–1955. In Studies in Linguistic Analysis. Oxford: Blackwell, 1957(专著)。
- Jelinek, F. Statistical Methods for Speech Recognition. Cambridge, MA: MIT Press, 1997(专著)。
- Baum, L. E. et al. A maximization technique occurring in the statistical analysis of probabilistic functions of Markov chains. Annals of Mathematical Statistics 41 (1970): 164–171。
- Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proceedings of the IEEE 77 (1989): 257–286。
- Deerwester, S. et al. Indexing by latent semantic analysis. Journal of the American Society for Information Science 41 (1990): 391–407。
- Landauer, T. K. and Dumais, S. T. A solution to Plato’s problem. Psychological Review 104 (1997): 211–240。
- Marcus, M. P., Santorini, B. and Marcinkiewicz, M. A. Building a large annotated corpus of English: the Penn Treebank. Computational Linguistics 19 (1993): 313–330。
- Brown, P. F. et al. The mathematics of statistical machine translation: parameter estimation. Computational Linguistics 19 (1993): 263–311。
- Brown, P. F. et al. Class-based n-gram models of natural language. Computational Linguistics 18 (1992): 467–479。
- Papineni, K., Roukos, S., Ward, T. and Zhu, W.-J. BLEU: a method for automatic evaluation of machine translation. Proceedings of ACL (2002): 311–318。
- Callison-Burch, C., Osborne, M. and Koehn, P. Re-evaluating the role of BLEU in machine translation research. Proceedings of EACL (2006): 249–256。
- Berger, A. L., Della Pietra, S. A. and Della Pietra, V. J. A maximum entropy approach to natural language processing. Computational Linguistics 22 (1996): 39–71。
- Bengio, Y., Ducharme, R., Vincent, P. and Jauvin, C. A neural probabilistic language model. Journal of Machine Learning Research 3 (2003): 1137–1155。
- Koehn, P., Och, F. J. and Marcu, D. Statistical phrase-based translation. Proceedings of NAACL-HLT (2003): 48–54。
- Koehn, P. Statistical Machine Translation. Cambridge: Cambridge University Press, 2010(专著)。
- Kneser, R. and Ney, H. Improved backing-off for m-gram language modeling. Proceedings of ICASSP (1995): 181–184。
- Chen, S. F. and Goodman, J. An empirical study of smoothing techniques for language modeling. Computer Speech and Language 13 (1999): 359–394。
- Miller, G. A. et al. Introduction to WordNet: an on-line lexical database. International Journal of Lexicography 3 (1990): 235–244。
- Fellbaum, C. (ed.) WordNet: An Electronic Lexical Database. Cambridge, MA: MIT Press, 1998(专著)。
- Lafferty, J., McCallum, A. and Pereira, F. Conditional random fields. Proceedings of ICML (2001): 282–289。
- Gale, W. A., Church, K. W. and Yarowsky, D. One sense per discourse. Proceedings of the Workshop on Speech and Natural Language (1992): 233–237。
- Yarowsky, D. Unsupervised word sense disambiguation rivaling supervised methods. Proceedings of ACL (1995): 189–196。
- Automatic Language Processing Advisory Committee. Language and Machines: Computers in Translation and Linguistics. Washington, DC: National Academy of Sciences, 1966(专著)。
- Dean, J. and Ghemawat, S. MapReduce: simplified data processing on large clusters. Proceedings of OSDI (2004): 137–150。
- Chu, C.-T. et al. Map-Reduce for machine learning on multicore. Advances in Neural Information Processing Systems 19 (2006): 281–288(专著)。
- de Marneffe, M.-C., MacCartney, B. and Manning, C. D. Generating typed dependency parses from phrase structure parses. Proceedings of LREC (2006): 449–454。
- Manning, C. D. and Schütze, H. Foundations of Statistical Natural Language Processing. Cambridge, MA: MIT Press, 1999(专著)。
- Jurafsky, D. and Martin, J. H. Speech and Language Processing. 2nd ed. Upper Saddle River: Prentice Hall, 2009(专著)。
- Church, K. W. and Hanks, P. Word association norms, mutual information, and lexicography. Computational Linguistics 16 (1990): 22–29。
- Och, F. J. and Ney, H. A systematic comparison of various statistical alignment models. Computational Linguistics 29 (2003): 19–51。