SDE Universes·新思想前沿AI与知识生产
新思想前沿 · AI与知识生产

多模态智能

近二十年 · 两幕 · 20 个新思想 · 约 21,930 字 · 王德生 亲撰 · 2026 年 8 月

多模态智能不是把图片、声音和文字都接进一个聊天框,而是研究不同感知与符号系统怎样对齐、互补、冲突,并在缺失、噪声与时间错位中仍形成可核验判断。2010年前后,共同语义空间、跨模态深度学习、视觉语义嵌入、图像描述、视觉问答、指代表达与以视觉监督声音,先把“两种数据如何相遇”变成可训练问题。2019年以后,跨注意力、互联网规模对比学习、交错上下文、轻量桥接器、六模态嵌入、视觉指令调优、多语种语音翻译、百万token长上下文、统一理解—生成与原生全模态系统,把对象从配对样本扩成连续媒体流。二十条不按产品热度排列,而按接口如何改变:每条同时登记能力增量、配对分母、模态缺口、反号失效与可复算证据。

【第一幕】共同空间与任务化 · 约 2010–2016

第一幕完成的是“异质信号可以被同一问题检验”。图像与文本先在共同空间里相互检索,声音与嘴形证明一条模态能监督另一条;随后,生成描述、回答问题、定位指称和从视频迁移声音标签,把对齐从相似度推进到语言输出与空间落点。每次成功也留下同一警报:配对不等于因果,缺失模态不等于缺失信息,数据集答案更不等于对世界的共同理解。

甲、跨模态检索:共同语义空间第一次接受双向查询Cross-Modal Retrieval: A Shared Semantic Space Accepts Queries from Either Side

提出Rasiwasia、Costa Pereira、Coviello等,2010年ACM Multimedia论文《A New Approach to Cross-Modal Multimedia Retrieval》,DOI 10.1145/1873951.1873987。 争议Mikolov, T. et al. (2013). Distributed Representations of Words and Phrases and their Compositionality. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键检索单位由同模态特征距离改为跨模态语义相关,使文字可以找图、图也可以找文字。

2010年前,多媒体检索通常各自为政:图片由SIFT或视觉词查询,文档由词频或主题查询,跨库搜索依靠人工标签作中介。Rasiwasia等把图像和文本分别投到一个相关性空间,使查询端和返回端不必共享原始特征。多模态由“多种文件并存”改成“任一模态可以成为另一模态的索引”,共同语义空间因而成为此后二十年的基础接口。

〔对象清单〕本条主张,决定双向跨模态检索能否成立的只有异质特征能否在保留语义邻近的共同坐标中比较。2010年的方案以典型相关分析及其语义版本连接图像和文本,训练目标不要求生成句子,只要求匹配对在潜在空间更近。它把模态差异从不可比较的维数问题,改写为可以用排序、召回率与零样本迁移检验的几何问题。对跨模态检索:共同语义空间第一次接受双向查询Cross-Modal Retrieval: A Shared Semantic Space Accepts Queries from Either Side而言,真正需要登记的不是又一个平均分,而是由“决定双向检索能否成立的只有异质特征能否进入保留语义邻近的共同坐标”推出的每一步中介、责任人和可撤回条件;〔对象清单〕缺少任何一环,都不能把相关性写成机制。

ACM Multimedia 2010论文在Wikipedia图文数据上以10个语义类别组织2,866篇配图文章,分别测“图找文”和“文找图”;语义相关匹配优于只追求线性相关的CCA基线。真正的读数不是二维投影图是否好看,而是Recall@K、mean average precision及双向差值。只有同一查询集、候选库和相关性标注都固定,跨模态平均精度才可复算。

共同空间容易把共现错认成含义。Wikipedia图片与正文共享栏目、命名习惯和编辑选择,模型可能借背景词猜类别,而没有识别图中对象;2025年若把CAD与平面图也锚到RGB,数据源越同质,检索排名反而越会放大采集管线的共同偏差。稀有语言、抽象图示和没有文字说明的图像会被主流配对挤到空间边缘。

工程验收应拆成三组:见过类别的新实例、未见类别的零样本、以及刻意破坏背景线索的反事实配对。2024年后的系统还需按语言、图像来源和长尾类别报告Recall@1与Recall@10,并记录一图多义、一文多图和无正确候选。若只用闭集类别标签判相关,共同空间可能只是把两个分类器的答案合并。

它与第050号第六条“图像与语言第一次被接起来”共享历史对象,但本条把关键点落在可双向查询的坐标;与第353号“信息检索与推荐系统”关于排序评估的接口,是相关集合如何定义。2010年的结论只证明共同空间可改善给定库排序,未证明模态之间已经获得同一概念,更未证明一种模态能补足另一种未被采样的经验。

位置S——把共同语义坐标本身当成跨模态可比性的决定性载体 单因决定双向检索能否成立的只有异质特征能否进入保留语义邻近的共同坐标 预设〔01 谁进入分母〕进入Wikipedia配对库的10类图文足以代表开放世界的跨模态对象 量纲双向查询中正确对象进入前10名的次数/全部可判定查询次数 失效当配对来源共享栏目与编辑线索时,数据越大,检索精度反而越可能放大共同采集偏差 自曝对象清单独立核验:原始方案只在2,866篇配图文章的闭集相关标注上验证,尚未区分语义与版面共现;独立撤回检查落在对象清单 空栏无文字图像、稀有语言、抽象图表、一图多义及候选库中不存在答案的查询 异名计算机视觉称“图像与语言第一次被接起来”;见第050号第六条“图像与语言第一次被接起来”

乙、多模态深度学习:一条模态开始为另一条模态预训练Multimodal Deep Learning: One Modality Pretrains Another

提出Ngiam、Khosla、Kim、Nam、Lee与Ng,2011年ICML论文《Multimodal Deep Learning》,第689–696页。 争议Srivastava, N. & Salakhutdinov, R. (2012). Multimodal Learning with Deep Boltzmann Machines. NeurIPS.。 最新(2024年文献)Wu, C. et al. (2024). Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation. arXiv:2410.13848.。 关键联合表示若在训练时吸收另一模态结构,测试时即使只保留一种输入也可能更好。

2011年的关键不只是网络比手工融合更深,而是Ngiam等把三个问题分开:怎样融合、怎样跨模态学习、怎样在测试时缺一条通道。视听语音提供了清楚场景,嘴形和声谱来自同一发音事件,却有不同噪声。模型先用音频与视频共同学习中层表征,再检查只给音频或只给视频时是否仍受益,多模态训练由此不再等于永久依赖多传感器。

〔事件时间轴〕本条的单因命题是:决定缺失模态下是否保留增益的只有联合训练能否学到跨通道共享而非各自私有的潜变量。2011年的双模态深度自动编码器通过重建与共享隐层,使一个通道可以激活由另一通道塑造的特征。若模型只是把两组特征拼接,测试时删去一半输入通常会改变尺度;若共享结构真实存在,单模态读出仍应优于只用该模态训练。

ICML 2011论文在视听语音分类中比较audio-only、video-only、简单融合及联合深度表征,并以发音类别准确率验证跨模态预训练;论文页码689–696,实验还加入单通道噪声与缺失条件。最重要读数是“训练含双模态、测试仅单模态”的准确率增量,而不是双模态齐全时的最高分。它第一次把缺失模态写进主要设计,而非部署后的异常。〔事件时间轴〕机构采用多模态深度学习:一条模态开始为另一条模态预训练Multimodal Deep Learning: One Modality Pretrains Another之前还应公布否决门槛:一旦“当同步或身份线索主导共享层时,联合越紧,跨设备单模态表现反而越差”出现,就暂停扩张并回到“联合表示若在训练时吸收另一模态结构,测试时即使只保留一种输入也可能更好”的原始记录复核,该门槛必须早于部署决定写入方案。

同一摄录室中的嘴形与声音天然同步,背景、说话者和标签也共享;2011年的模型可能学到身份或时间线索,而非音素—视素结构。若部署音频来自电话、视频来自压缩会议或二者有200毫秒错位,训练时越紧密的联合编码,单通道表现反而越可能受错误相关牵连。完全缺失、随机缺失与“坏但存在”的传感器不是同一种条件。

复核应把缺失机制预注册为MCAR、与内容相关缺失和传感器故障3类,并同时测同步扰动、说话者留出及跨设备迁移。2025年的模型还应报告每个模态单独、任意组合与质量下降曲线,而不能只公布全模态平均值。门控网络要接受“输入存在但不可信”的测试,因为零向量掩码比现实故障更容易识别。

它与第044号第十一条“生成模型与多模态”都讨论通道扩展,但本条的验收对象是缺失通道下的迁移,不是输出是否多样。2011年的贡献也为第534号后续ImageBind提供反例:共享表征可以借桥接模态形成,却必须证明移除桥梁后仍保留方向一致的收益,否则“多模态”只是训练时额外监督。

位置D——把联合预训练与缺失模态读出组成部署路径 单因决定缺失模态下能否保留增益的只有联合训练是否学到共享而非私有潜变量 预设〔02 单一读数代表复杂对象〕一次视听语音准确率足以代表同步、噪声、身份与缺失机制的全部组合 量纲测试仅留一种模态时准确率增量/双模态齐全时准确率增量 失效当同步或身份线索主导共享层时,联合越紧,跨设备单模态表现反而越差 自曝事件时间轴独立核验:视听发音任务天然同源且同步,不能证明任意两种现实传感都存在可迁移共享因子;独立撤回检查落在事件时间轴 空栏内容相关缺失、坏而未断的传感器、跨设备时延、说话者口音及复位后的校准成本 异名基础模型称“生成模型与多模态”;见第044号第十一条“生成模型与多模态”

丙、多模态深度玻尔兹曼机:缺失通道被写进联合概率模型Multimodal Deep Boltzmann Machines: Missing Channels Enter a Joint Density

提出Srivastava与Salakhutdinov,2012年NeurIPS论文《Multimodal Learning with Deep Boltzmann Machines》;扩展版发表于2014年《JMLR》15:2949–2980。 争议Srivastava, N. & Salakhutdinov, R. (2012). Multimodal Learning with Deep Boltzmann Machines. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键学习联合密度后,系统可由图像采文本、由文本补图像,并为缺失模态保留概率而非定值。

早期融合常把模态拼成一个向量,却无法回答缺失部分有哪些可能值。Srivastava与Salakhutdinov在2012年为图像—文本、音频—视频分别建立专属隐层,再以更高层连接成联合深度玻尔兹曼机。生成式目标允许模型从可见模态推断共同隐变量,再采样另一模态;跨模态检索、分类和补全第一次被同一个联合概率解释。

本条声称,决定缺失通道能否以概率方式补全的只有系统是否学习了模态联合分布,而不是一条确定映射。2014年JMLR版本强调,联合模型既能用全部模态,也能在任意子集可见时近似后验。若图像对应多种合理描述,模型应保留多峰;如果只回归平均句向量,输出会把“不确定”伪装成一种中性答案。

JMLR 2014论文跨15卷2949–2980页,实验覆盖Mir Flickr图文和CUAVE视听语音;模型用分层预训练、变分近似与MCMC学习,并比较检索、分类及缺失模态生成。关键读数应是held-out joint likelihood的可比代理、跨模态检索精度和补全校准,而非挑选的一张生成图。多任务改进说明联合密度可复用,却不证明密度已被精确估计。

联合概率模型会偏爱高维、易重建或噪声较小的通道;像素误差可能压过文本语义,近似后验又会把多峰压平。2012年的DBM需要迭代推断,链混合与配分函数难核验。若一条模态实际上由另一条的标签生成,补全越逼真,反而越可能复刻数据制作规则,而不是恢复未观测世界。〔装置边界〕面向下一轮材料,多模态智能应优先补齐“不可识别的多解、配对制作规则、模态冲突、链未混合与本来不存在唯一真值的情形”的原始记录,并把“当高维像素重建支配联合似然时,生成样本越逼真,语义条件一致率反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

今天复用这条思想,应报告条件分布而非单个补全:同一文本采样多少幅图、真实值在置信集合中的覆盖率、移除高资源模态后校准怎样变化。2024年扩散补全或2025年生成式大模型仍需与简单条件频率基线比较,并在配对被打乱、模态冲突和真值本来不存在时允许拒绝生成。

它与第045号第八条“把生成变成可控的采样”共享从点预测转向分布的逻辑,但本条的条件是另一模态;也与第050号第六条“图像与语言第一次被接起来”互为概率化版本。2014年的结果没有消除不可识别性:从一句“海边”无法恢复唯一照片,系统只能表达数据集条件下的可能,而不能声称找回事实。〔装置边界〕在多模态智能的这一对象上,复核应把“真实缺失值落入条件置信集合的次数/全部可核验补全次数”拆成同一分母下的主结果与失败谱,“不可识别的多解、配对制作规则、模态冲突、链未混合与本来不存在唯一真值的情形”要单列编码,不能在汇总时并入其他项。

位置E——把配对数据分布、模态维数与缺失机制当成联合生成的环境 单因决定缺失通道能否概率补全的只有系统是否学习模态联合分布 预设〔03 缺失即不存在〕未被传感器记录的模态被当成可由已观测通道唯一约束的随机缺失 量纲真实缺失值落入条件置信集合的次数/全部可核验补全次数 失效当高维像素重建支配联合似然时,生成样本越逼真,语义条件一致率反而越低 自曝装置边界独立核验:DBM的变分与MCMC近似没有给出联合密度的精确可算值,漂亮样本不能证明校准;独立撤回检查落在装置边界 空栏不可识别的多解、配对制作规则、模态冲突、链未混合与本来不存在唯一真值的情形 异名生成模型称“把生成变成可控的采样”;见第045号第八条“把生成变成可控的采样”

丁、DeViSE:类别名被换成可迁移的语言向量DeViSE: Class Names Become Transferable Language Vectors

提出Frome、Corrado、Shlens等,2013年NeurIPS论文《DeViSE: A Deep Visual-Semantic Embedding Model》。 争议Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. ICML, PMLR 139:8748–8763.。 最新(2026年文献)OpenAI (2026). GPT-Live: A New Generation of Voice Models. Technical release.。 关键分类器不再为每个标签训练独立输出,而把图像映到由语言关系组织的类别空间。

封闭分类器的最后一层通常只有训练时见过的1,000个类别;加入一个新标签就要再收集图像并重训输出。DeViSE在2013年把图像网络输出映到预训练词向量,让“虎”“狮”“猫”的语言邻近参与视觉判断。系统即使没见某个类别的训练图,也可把图像投向其名称附近,零样本分类因而从属性表工程转向互联网语义迁移。〔样本分层〕对DeViSE:类别名被换成可迁移的语言向量DeViSE: Class Names Become Transferable Language Vectors而言,真正需要登记的不是又一个平均分,而是由“决定视觉类别能否越过训练标签集的只有输出空间是否由可迁移语言语义组织”推出的每一步中介、责任人和可撤回条件,〔样本分层〕缺少任何一环,都不能把相关性写成机制。

〔样本分层〕本条的单因命题是:决定视觉类别能否越过训练标签集的只有输出空间是否由可迁移语言语义组织。2013年的排序损失拉近图像与正确词向量,推远错误词,预测时可以在ImageNet 21K标签中寻找邻近名称。标签不再只是无结构编号,而成为带关系的坐标;同一嵌入还能返回语义上合理却非精确同名的错误。

NeurIPS 2013论文报告,在数千个未见标签的零样本检验上,相对既有方法最高提升约65%,并在大标签空间得到最高约10%的语义命中率;见过1K类的准确率也可与softmax基线竞争。第三段的可核验对象是flat hit@k与hierarchical precision@k,因为“错成同属动物”与“错成家具”不能只算同一错误。

2013年的语言空间来自文本共现,不等于视觉可分性:两个词语义接近却外观不同,或外观相似却命名层级不同。词频高的标签成为hub,长尾与非英语名称被挤出邻域。候选标签越扩到21K,模型反而越可能选择一个语言上常见、视觉上错误的近邻;开放词汇能力会把语料偏见带入视觉结果。

复核应冻结视觉编码器,分别替换词向量、标签释义和多语种名称,观察零样本排序是否稳健;还要按WordNet深度、频率和文化语境报告。2025年的开放词汇模型应在候选集含未知、同义和拒绝项时评估,而不能假设正确标签必在表内。若改写提示就大幅改类,语义接口仍未校准。〔样本分层〕证据链还要把Frome、Corrado、Shlens等,2013年NeurIPS论文《DeViSE: A D的起点材料与更新文献放在同一比较表里,并逐项报告“分类器不再为每个标签训练独立输出,而把图像映到由语言关系组织的类别空间”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

它与第050号第七条“封闭集合的终结”是直接异名,本条把终结机制精确到语言向量替代固定输出;与第044号第八条“预训练、涌现与「基础模型」”相接时,必须区分迁移自文本结构还是视觉数据规模。2013年的65%是相对改进,不是绝对正确率,若忽略分母就会把低基线上的提升写成开放世界已解决。

位置S——把语言组织的输出空间当成开放类别迁移的决定性载体 单因决定视觉类别能否越过训练标签集的只有输出空间是否由可迁移语言语义组织 预设〔04 测量不改变被测对象〕扩大候选标签与改写类别名称不会改变零样本分类本身 量纲未见类别的hierarchical precision@5/见过类别的precision@5 失效当高频词形成嵌入枢纽时,候选标签越多,长尾类别召回反而越低 自曝样本分层独立核验:最高约65%是相对基线增幅,而数千未见标签上的绝对语义命中仍约10%量级;独立撤回检查落在样本分层 空栏非英语命名、同义词、层级深度、正确标签不在候选表及语料中的职业与地域偏见 异名计算机视觉称“封闭集合的终结”;见第050号第七条“封闭集合的终结”

戊、Show and Tell:图像描述被端到端地写成一句话Show and Tell: Image Captioning Becomes End-to-End Sentence Generation

提出Vinyals、Toshev、Bengio与Erhan,2015年CVPR论文《Show and Tell: A Neural Image Caption Generator》,第3156–3164页。 争议Yu, J. et al. (2022). CoCa: Contrastive Captioners are Image-Text Foundation Models. TMLR.。 最新(2026年文献)OpenAI (2026). GPT-Live: A New Generation of Voice Models. Technical release.。 关键卷积视觉编码器与LSTM语言解码器可在同一似然目标下从像素直接生成开放句子。

2015年前,自动描述常由检测器先列对象和动作,再用模板或句法规则拼句,错误沿模块传递。Show and Tell把CNN的图像表示作为LSTM起始条件,逐词最大化参考描述概率。任务从“给图片选一个标签”变为“生成长度不定的句子”,视觉系统第一次大规模接受语言模型的开放输出空间与序列误差。

〔版本登记〕本条主张,决定像素能否产生开放描述的只有视觉编码与语言解码是否在同一端到端似然中联合优化。2015年的NIC模型用ImageNet预训练CNN提供图像向量,再由LSTM预测下一个词;训练信号来自整句参考,不需手写物体—关系模板。视觉表示由分类特征变成生成条件,语言流畅性与图像相关性被压进同一个损失。机构采用Show and Tell:图像描述被端到端地写成一句话Show and Tell: Image Captioning Becomes End-to-End Sentence Generation之前还应公布否决门槛:一旦“当语言先验奖励常见套话时,BLEU越高,罕见对象召回反而越低”出现,就暂停扩张并回到“卷积视觉编码器与LSTM语言解码器可在同一似然目标下从像素直接生成开放句子”的原始记录复核;该门槛必须早于部署决定写入方案。

CVPR 2015论文在Pascal上得到BLEU约59,先前方法约25、人类约69;Flickr30k约66对56,SBU约28对19,并在MS COCO报告BLEU-4约27.7。多个数据集的同向改进比单张示例更关键,但BLEU是与参考n-gram的重合率;它不能判断“桌上有狗”是否把不存在对象写得很自然。

最大似然奖励常见句式,“一个男人站在……”可以在许多图片得分;一图仅5条左右参考又把未写出的真事实误当错误。若模型用更强语言先验,BLEU越高,罕见对象与精确关系反而可能越被安全套话覆盖。描述还会从数据继承性别、职业和地域刻板印象,把看不出的属性写成确定陈述。

验收应把句子拆成对象、属性、计数、关系与不确定性,逐项用图像证据核对,并并列BLEU、CIDEr、SPICE与人工幻觉率。2024年后的模型还要在反事实遮挡、罕见组合和无人物属性标签上测试;允许说“无法看清”应计为校准,而不是把每幅图都逼成完整故事。

它与第050号第十条“视觉与语言合流之后”共享描述任务,本条聚焦端到端句子生成怎样确立;与第045号第三条“自回归这条稳妥的路”对接时,多出的约束是每个词必须由图像证据承担。2015年的BLEU进步证明序列模型可学参考风格,不等于生成内容在部署中可作无障碍替代文本或事实记录。〔版本登记〕本条的边界案例应从“参考未覆盖的真事实、臆造对象、不可见属性、无障碍用户误用与刻板印象的个体伤害”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当语言先验奖励常见套话时,BLEU越高,罕见对象召回反而越低”究竟是偶发噪声,还是足以改变结论方向的系统反例。

位置D——把视觉编码、LSTM解码与句子似然串成端到端描述路径 单因决定像素能否产生开放描述的只有视觉编码与语言解码是否在同一似然联合优化 预设〔05 缺失即不存在〕参考描述没有提及的对象与关系被默认对评价无关或不存在 量纲有图像证据支撑的生成事实数/生成句子中的全部可核验事实数 失效当语言先验奖励常见套话时,BLEU越高,罕见对象召回反而越低 自曝版本登记独立核验:Pascal约59分接近人类约69分只针对BLEU重合,未核验每个名词是否真实存在;独立撤回检查落在版本登记 空栏参考未覆盖的真事实、臆造对象、不可见属性、无障碍用户误用与刻板印象的个体伤害 异名计算机视觉称“视觉与语言合流之后”;见第050号第十条“视觉与语言合流之后”

己、视觉问答:图像被要求支持一个可评分答案Visual Question Answering: Images Must Support Scorable Answers

提出Antol、Agrawal、Lu等,2015年ICCV论文《VQA: Visual Question Answering》,第2425–2433页。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键同一图像由自然问题指定当前需要的证据,视觉理解由全图描述改成条件化求解。

图像描述要求系统主动决定“什么值得说”,很难区分漏说与没看见。VQA在2015年把问题作为视觉注意的条件:给出图片与一句自然语言,系统回答颜色、数量、对象、活动或常识。研究对象由一幅图对应一段总括描述,变为同一图可被不同问题反复探测;答案还能通过一致评分形成公开排行榜。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定图像能否支持可诊断推理的只有问题是否把所需视觉证据限定为可评分答案”的操作定义,仍能复算“移除图像后会由对变错的题数/模型原本答对的全部题数”,否则所谓转向可能只是数据管线或命名变化。

〔失败谱〕本条的单因命题是:决定图像能否支持可诊断推理的只有问题是否把所需视觉证据限定为可评分答案。2015年的数据由人对真实照片和抽象场景提问,再让多名答题者作答;模型融合CNN与问题编码。问题提供任务上下文,图像提供现场约束,二者都不可被名义上省略,否则只是语言问答或无条件分类。

ICCV论文给出约25万幅图、76万道问题与1,000万条人工答案;项目统计每图平均5.4问、每问10个ground-truth答案。评分按与人类答案的共识软计,不要求唯一字符串。可核验读数除overall accuracy外,还要拆Yes/No、Number与Other,因为总体分可能被高频“是/否”问题主导,而计数题仍明显更难。〔失败谱〕面向下一轮材料,多模态智能应优先补齐“文化多解、低视力可见性、题目歧义、标注者分歧及答对却依据错误区域的样本”的原始记录,并把“当题型语言先验稳定时,题库越大,不看图模型的表观能力反而越强”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

数据收集方式制造强语言先验:“香蕉是什么颜色”多半可猜黄,“图中是否有……”常偏向是。一个不看图的模型在2015年VQA上也能获得非零甚至可观成绩;十人共识把文化差异、可见性和合理多解压成主流答案。若题库越大却沿用相同提问模板,排行榜反而越会奖励问题统计而非视觉证据。

检验应加入配对反事实:问题不变换图、图不变换问题、遮住决定性区域,并报告答案翻转率。2025年的MMMU-Pro做了更激进清算,移除约30%无需图像即可回答的题,并把4选项扩到10选项。VQA系统还应输出证据区域与不确定性,但热图只算解释候选,必须由遮挡或干预验证。

它与第044号第五条“评测把注意力引向阅读理解”共享“数据集塑造能力”的逻辑,只是这里把图像加入证据;与第050号第十条“视觉与语言合流之后”相比,本条多出问句条件和十人共识分母。2015年的1,000万答案证明可规模标注,不证明模型已把图像当作必要信息,文本单独基线必须始终保留。

位置E——把问题模板、答案分布与十人共识规则当成视觉推理的评价环境 单因决定图像能否支持可诊断推理的只有问题是否把所需视觉证据限定为可评分答案 预设〔06 通过形式审查=实质合规〕答中多数答案就等于使用了题目要求的视觉证据 量纲移除图像后会由对变错的题数/模型原本答对的全部题数 失效当题型语言先验稳定时,题库越大,不看图模型的表观能力反而越强 自曝失败谱独立核验:约76万问题和1,000万答案扩大了评测规模,却没有自动保证每道题必须依赖图像;独立撤回检查落在失败谱 空栏文化多解、低视力可见性、题目歧义、标注者分歧及答对却依据错误区域的样本 异名基础模型称“评测把注意力引向阅读理解”;见第044号第五条“评测把注意力引向阅读理解”

庚、RefCOCO:语言第一次必须落到一个具体区域RefCOCO: Language Must Land on a Specific Region

提出Yu、Po、Yang等,2016年ECCV论文《Modeling Context in Referring Expressions》,DOI 10.1007/978-3-319-46475-6_5。 争议Seamless Communication Team (2023). Seamless: Multilingual Expressive and Streaming Speech Translation. arXiv:2312.05187.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键模型不能只说图里有“人”,还必须利用关系语言判定“桌子左边穿红衣的人”是哪一个。

图像描述和VQA都允许一句话不明确落到像素;模型说对类别,仍可能看错对象。RefCOCO系列在2016年把指代表达与COCO中的具体实例框绑定,问题变成给一句“右边拿伞的人”,在多个同类对象中选择目标。语言中的颜色、位置、关系与比较级由附加信息变成可直接判错的空间约束。

本条声称,决定语言是否真正落地的只有表达能否在同类干扰物之间唯一改变目标区域排序。2016年的模型分别编码候选对象、全局场景和与其他对象的关系,评价预测框是否与真值实例一致。若只有一个“狗”,答对可能靠类别词;若有3只狗,方位与关系才暴露模型是否把句法映成空间比较。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当表达本来歧义或目标缺席时,模型置信越高,错误指认的交互伤害反而越大”做至少两轮外部复算,若方向翻转,RefCOCO:语言第一次必须落到一个具体区域RefCOCO: Language Must Land on a Specific Region的结论必须随之收窄。

RefCOCO含19,994幅图、50,000个对象和142,210条指称表达,平均约3.5词;RefCOCO+限制部分绝对位置词,迫使模型更多使用外观与关系。关键读数是testA与testB等人物/非人物切分上的定位准确率,并应同时看IoU阈值。一个框只要IoU超过0.5便算对,会掩盖边界与遮挡误差。

表达由受控界面中的说话者生成,他们知道候选图和任务,常选择最省力区分词;现实对话可能含历史、手势、误称和共同注意。数据越强调唯一答案,模型反而越不学会澄清“你指哪一个”。随机图像切分还可能让相似COCO场景和类别组合同时出现在训练与测试,夸大开放落地。〔机构接口〕证据链还要把Yu、Po、Yang等,2016年ECCV论文《Modeling Context in Refe的起点材料与更新文献放在同一比较表里,并逐项报告“模型不能只说图里有“人”,还必须利用关系语言判定“桌子左边穿红衣的人”是哪一个”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

部署评估应加入不可唯一指称、目标不存在和关系冲突3类,允许模型请求澄清;视频场景还需跟踪表达所指对象随时间移动。2025年的指称分割要同时报告框IoU、mask IoU、同类混淆率与交互轮数。若模型给出高置信区域却忽略“不是左边那个”等否定词,应按危险误指而非普通定位误差记账。

它与第253号第九条“自然语言作为界面”对接:界面把意图转成对象选择,本条提供空间可验证性;也与第050号第八条“可提示的通用模型”形成前史,后者用点、框和文本提示扩展分割。RefCOCO证明短表达能监督实例定位,却未覆盖真实协作中的授权、澄清和多轮共同注意。

位置S——把指称表达对候选区域的排序改变当成语言落地的决定性证据 单因决定语言是否真正落地的只有表达能否在同类干扰物之间唯一改变目标区域排序 预设〔07 唯一标签代表真实意图〕每条指称都存在一个无需澄清的唯一目标实例 量纲含至少2个同类干扰物时正确定位数/全部同类干扰物指称数 失效当表达本来歧义或目标缺席时,模型置信越高,错误指认的交互伤害反而越大 自曝机构接口独立核验:142,210条短表达来自受控界面,未复现多轮对话、手势和说话者改口;独立撤回检查落在机构接口 空栏无唯一目标、否定表达、历史共同注意、遮挡移动、说话障碍及误指后的撤销成本 异名人机交互称“自然语言作为界面”;见第253号第九条“自然语言作为界面”

辛、SoundNet:无标签声音借用视觉教师获得语义SoundNet: Unlabeled Audio Borrows Semantics from a Visual Teacher

提出Aytar、Vondrick与Torralba,2016年NeurIPS论文《SoundNet: Learning Sound Representations from Unlabeled Video》。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键视频中的天然时间共现可把成熟视觉识别器当作教师,为数百万段无标注音频提供监督。

环境声音标注昂贵,一段音频可能同时含说话、交通和机械声;2016年前的声学数据远小于图像库。SoundNet利用网络视频的天然配对:视觉网络先在帧上预测对象与场景,音频网络学习复现这些预测。教师不需要人工逐段听录,2百万条无标签视频由此成为声音表示的弱监督来源。

〔资源预算〕本条的单因命题是:决定无标签声音能否获得对象语义的只有同步视频是否提供可迁移的视觉教师信号。2016年的一维卷积网络直接处理原始波形,以视觉ImageNet与Places分类器的soft target训练;之后把中层特征迁到声学场景和对象任务。监督来源不是声音标签,而是另一模态在同一时间窗内的预测分布。

NeurIPS 2016论文用约2,000,000个Flickr视频训练SoundNet,并在声学场景分类、对象分类和少样本条件下超过从零训练及若干手工特征基线;8层版本通常优于5层版本。应核验的读数是固定标注量下线性分类准确率及迁移增量,因为全量微调会混入下游标签能力,难判断视觉教师贡献。〔资源预算〕落到复现实务,可为SoundNet:无标签声音借用视觉教师获得语义SoundNet: Unlabeled Audio Borrows Semantics from a Visual Teacher建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“纯音频留出域的线性探针增量/声画同域验证集的线性探针增量”统一结算,避免换口径后仍宣称性能提高。

2016年的网页视频并非现实声学的随机样本:镜头可能剪辑,音乐可能后加,视觉中可见汽车却声音来自旁白。视觉教师也会把自己的分类边界和偏见复制给音频,没视觉对应的气味、内部机械故障或远处声源无处获得监督。视频量越大而剪辑规律越强,声音语义反而越可能学成平台类型与制作风格,并在现场录音迁移时暴露域差。

复核应按声画同步误差、原声/配乐、室内/室外和视觉不可见声源分层,并与时间打乱负样本比较。2025年的物体交互声音可记录碰、切、敲等动作与接触时刻,提供更强因果锚;仍需报告视觉教师错时学生是否重复错误,以及纯音频留出域的线性探针表现。〔资源预算〕本条的边界案例应从“画外声源、后期配乐、听觉障碍场景、教师误判、同步漂移及平台视频删除后的可追溯性”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当配乐和剪辑主导共现时,视频越多,学生对真实声源的定位反而越差”究竟是偶发噪声,还是足以改变结论方向的系统反例。

它与第050号第十二条“数据、偏斜与真实性”共享网页数据审计,只是偏斜沿视觉教师跨模态传播;与第534号第二条的视听语音相比,本条用大规模弱同步取代精确发音对齐。2016年的2百万视频证明跨模态监督可扩张,不证明声音表示超越视觉可命名的世界。

位置D——把视频采集、视觉教师与音频学生蒸馏串成无标签学习路径 单因决定无标签声音能否获得对象语义的只有同步视频是否提供可迁移视觉教师信号 预设〔08 同步等于同因〕同一视频时间窗中的画面与声音被默认由同一事件产生 量纲纯音频留出域的线性探针增量/声画同域验证集的线性探针增量 失效当配乐和剪辑主导共现时,视频越多,学生对真实声源的定位反而越差 自曝资源预算独立核验:SoundNet把ImageNet与Places教师的可见类别当作声音语义上限,无法发现教师没有名字的声学事件;独立撤回检查落在资源预算 空栏画外声源、后期配乐、听觉障碍场景、教师误判、同步漂移及平台视频删除后的可追溯性 异名计算机视觉称“数据、偏斜与真实性”;见第050号第十二条“数据、偏斜与真实性”
【第二幕】规模化对齐与原生全模态 · 约 2019–2026

第二幕把共同空间推成基础设施。对象区域与词token经跨注意力反复交换,4亿级图文对让自然语言成为开放标签,冻结的大视觉与语言模型用小桥接器组合;随后音频、深度、热感、IMU、长视频和实时语音都进入同一系统。能力扩张同时暴露三条债务:桥接模态的偏见可能被传给所有通道,长上下文的召回不等于时序理解,文本安全对齐也可能被图像中的排版指令绕过。

一、ViLBERT与LXMERT:跨注意力让对象与词反复互问ViLBERT and LXMERT: Objects and Words Query Each Other

提出Lu、Batra、Parikh与Lee,2019年NeurIPS论文《ViLBERT》;Tan与Bansal,2019年EMNLP-IJCNLP论文《LXMERT》,第5100–5111页。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键视觉与文字不再各自压成一个向量后拼接,而在多层双向注意中交换对象—词关系。

2019年前的大量视觉语言模型把整图向量与整句向量在末端连接,细粒度关系容易在压缩中消失。ViLBERT和LXMERT借用Transformer注意力,将检测器给出的对象区域与词token分别编码,再以cross-attention让“红色”“左边”“拿着”等词选择区域,区域也反向改变词表示。融合由一次拼接变成多层条件化交互。

本条声称,决定对象—词关系能否跨任务复用的只有两条流是否在预训练中通过跨注意力反复交换信息。LXMERT设置语言、对象关系和跨模态3个编码器,并以masked language、masked object、匹配及VQA等5类任务预训练;ViLBERT采用co-attentional Transformer。共同表征随后微调到VQA、检索与指称任务。〔外部复算〕面向下一轮材料,多模态智能应优先补齐“框外文字、细线、全局布局、检测器版本、视觉token成本及预训练—测试样本近重复”的原始记录,并把“当外部检测器漏掉细节时,跨注意层越深,模型对错误对象集合的确信反而越强”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

LXMERT在约9.18百万图文问答与描述聚合上训练20个epoch、约670K步,最后10个epoch加入image QA目标;论文在VQA、GQA和NLVR2报告当时领先或竞争结果。真正读数应是移除cross-attention、移除区域几何、改变预训练任务后的多基准差值,而不是只比较参数更多的最终模型。

区域输入来自Faster R-CNN等检测器,未被检测的文字、细线、整体布局在进入Transformer前已经消失;对象标签又来自有限视觉词表。模型层数越深,注意权重越精致,反而越会让人忘记输入只是一组预选框。若VQA预训练与下游问答共享答案分布,多任务提升还可能来自标签泄漏。把ViLBERT与LXMERT:跨注意力让对象与词反复互问ViLBERT and LXMERT: Objects and Words Query Each Other与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“遮挡决定性视觉区域后答案正确率下降/未遮挡时答案正确率”在这些类别上都可回查,跨研究比较才有意义。

2024年后的复核应并列区域特征、patch token和原始高分辨率输入,在小物体、OCR、计数与关系反事实上逐项消融。注意图不能自证对齐,应遮挡高权区域并观察答案因果变化;还要记录视觉token数、分辨率和计算成本。若提高分辨率才追回能力,原模型瓶颈在入口而非融合层。

它与第044号第七条“变压器:并行训练解开规模的枷锁”共享架构,却把self-attention扩成跨流互问;与第050号第十条“视觉与语言合流之后”相比,本条具体说明2019年的合流单位是检测框与词。跨注意力成为后续Flamingo、BLIP-2和LLaVA的接口祖先,也留下“桥接前丢掉什么”的持续账本。〔外部复算〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定对象—词关系能否跨任务复用的只有两条流是否通过跨注意力反复交换信息”的操作定义,仍能复算“遮挡决定性视觉区域后答案正确率下降/未遮挡时答案正确率”,否则所谓转向可能只是数据管线或命名变化。

位置D——把双流编码、区域几何与跨注意力组成可复用融合路径 单因决定对象—词关系能否跨任务复用的只有两条流是否通过跨注意力反复交换信息 预设〔01 谁进入分母〕检测器送入的对象框被默认覆盖图像中全部与语言有关的证据 量纲遮挡决定性视觉区域后答案正确率下降/未遮挡时答案正确率 失效当外部检测器漏掉细节时,跨注意层越深,模型对错误对象集合的确信反而越强 自曝外部复算独立核验:LXMERT的约9.18百万训练实例混合多项问答数据,难把跨注意力收益与答案分布复用完全分离;独立撤回检查落在外部复算 空栏框外文字、细线、全局布局、检测器版本、视觉token成本及预训练—测试样本近重复 异名基础模型称“变压器:并行训练解开规模的枷锁”;见第044号第七条“变压器:并行训练解开规模的枷锁”

二、CLIP与ALIGN:自然语言成为4亿级开放视觉标签CLIP and ALIGN: Natural Language Becomes Web-Scale Visual Supervision

提出Radford等,2021年ICML论文《Learning Transferable Visual Models From Natural Language Supervision》,PMLR 139:8748–8763;Jia等,2021年ICML论文《ALIGN》。 争议Jia, C. et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. ICML.。 最新(2024年文献)Wu, C. et al. (2024). Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation. arXiv:2410.13848.。 关键预测哪段文字对应哪幅图的对比任务,可把未经类别清洗的网络图文对变成开放视觉表示。

传统ImageNet监督把视觉概念限制在预先选定的1,000类,换数据集就需再训练输出。CLIP在2021年用网络图文对做对比学习:同一批次中正确图文相似度应高,错误配对应低;测试时把类别名写成自然语言提示即可零样本分类。ALIGN以更少清洗和更大规模验证同一路线,文本成为开放标签接口。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当重复与主流英语配对支配数据时,规模越大,长尾语言和人群的相对准确率反而越低”做至少两轮外部复算,若方向翻转,CLIP与ALIGN:自然语言成为4亿级开放视觉标签CLIP and ALIGN: Natural Language Becomes Web-Scale Visual Supervision的结论必须随之收窄。

〔反号压力〕本条的单因命题是:决定开放视觉迁移能否规模化的只有自然语言监督是否覆盖足够广的图像概念分布。CLIP不直接预测固定类,而学习图像编码器与文本编码器的相似度;任何新任务只要能写成候选文字,便可作为零样本分类器。知识边界由人工类别表改成训练图文配对与提示可表达的集合。

ICML 2021论文用4亿个互联网图文对训练,在30多个数据集做零样本迁移;其zero-shot ImageNet准确率匹配原始ResNet-50,却不使用ImageNet的128万训练图。论文页8748–8763还为ImageNet集成80个提示模板并比较多种尺度。关键读数是同一预训练预算下跨数据集平均迁移及分组最坏值,而非只报ImageNet一项。

图文对不是中性世界抽样:alt-text含SEO、成人内容、刻板印象、名人和英语中心偏差,重复图又可造成测试污染。提示“a photo of a …”改变候选先验,标签表越贴近训练语料,所谓零样本越像检索记忆。规模越大而数据治理不透明,偏见、版权与隐私内容反而越难追溯到来源。

验收应公布数据构成、近重复检测、语言比例和人群子集,并对提示集合预注册;测试还要加入无正确标签与开放集拒绝。2025年后应同时报告zero-shot、linear probe、少样本与跨域最坏组表现,以分开表征质量和提示工程。若更换同义词就翻转预测,开放词汇接口仍不稳定。〔反号压力〕在多模态智能的这一对象上,复核应把“跨数据集最坏群体零样本准确率/总体零样本准确率”拆成同一分母下的主结果与失败谱,“被过滤内容、版权状态、未联网文化、无正确候选、删除请求及近重复进入测试集的路径”要单列编码,不能在汇总时并入其他项。

它与第050号第七条“封闭集合的终结”共享结果,但本条把决定项落到对比图文预训练的规模;与第044号第八条“预训练、涌现与「基础模型」”相连时,4亿图文对是必须写入的分母。2021年的突破证明语言可作高带宽监督,未证明文本就是视觉世界的无偏目录。

位置E——把互联网图文分布、提示语言与候选标签表当成开放视觉能力的环境 单因决定开放视觉迁移能否规模化的只有自然语言监督是否覆盖足够广的图像概念分布 预设〔01 谁进入分母〕4亿网络图文对被默认代表可部署视觉世界与语言人群 量纲跨数据集最坏群体零样本准确率/总体零样本准确率 失效当重复与主流英语配对支配数据时,规模越大,长尾语言和人群的相对准确率反而越低 自曝反号压力独立核验:CLIP匹配ResNet-50的ImageNet表现依赖提示集合,不能把提示敏感性记成纯视觉理解;独立撤回检查落在反号压力 空栏被过滤内容、版权状态、未联网文化、无正确候选、删除请求及近重复进入测试集的路径 异名基础模型称“预训练、涌现与「基础模型」”;见第044号第八条“预训练、涌现与「基础模型」”

三、Flamingo:交错图文进入少样本上下文Flamingo: Interleaved Images and Text Enter Few-Shot Context

提出Alayrac、Donahue、Luc等,2022年NeurIPS论文《Flamingo: a Visual Language Model for Few-Shot Learning》,35:23716–23736。 争议Seamless Communication Team (2023). Seamless: Multilingual Expressive and Streaming Speech Translation. arXiv:2312.05187.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键冻结语言模型只需周期性接收视觉cross-attention,便可在上下文示例中临时学习新视觉任务。

CLIP擅长相似度,却不直接生成长答案;早期VQA模型又为每项任务微调。Flamingo在2022年把冻结语言模型与视觉编码器接合,使任意数量的图像、视频和文字按时间交错进入上下文。用户可先给2个图—问—答示例,再要求模型回答新图,视觉任务像语言few-shot提示一样在推理时被临时指定。

〔责任链〕本条主张,决定多图少样本迁移能否成立的只有交错视觉证据是否能在冻结语言模型中被上下文化调用。Perceiver Resampler把可变视觉特征压成固定数量token,gated cross-attention层周期性注入语言主干;冻结大部分预训练权重减少遗忘。任务定义由参数更新移到示例序列,图像与文字的先后次序成为可编程接口。〔责任链〕落到复现实务,可为Flamingo:交错图文进入少样本上下文Flamingo: Interleaved Images and Text Enter Few-Shot Context建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“打乱提示顺序后仍保持方向的任务数/全部少样本评测任务数”统一结算,避免换口径后仍宣称性能提高。

NeurIPS 2022论文评估16项图像语言与视频语言任务;最大80B版本只用32个任务样例,仍在其中6项超过各自微调领先结果。可核验读数应包括0、2、4、8、16与32-shot曲线,以及随机示例顺序的方差;若只报最佳提示,少样本能力可能只是提示筛选。

2022年的交错网页数据中,相邻图文常是版面关系,不必是因果或指称关系;长序列还会让早先图像被后文稀释。示例越多,模型反而可能复制最近答案格式、忽略当前视觉证据。冻结语言模型保留文本偏见,视觉适配层只能改变有限路径;在计数、细字和时序因果上,流畅回答仍可无图成立。〔责任链〕本条的边界案例应从“提示选择成本、网页版面共现、视觉token截断、长视频漏帧及无图也能答对的样本”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当最近示例格式压过当前图像时,示例越多,视觉证据依赖率反而越低”究竟是偶发噪声,还是足以改变结论方向的系统反例。

复核需打乱示例次序、替换演示答案、删除当前图与删除历史图,分别测模型依赖哪一部分;视频还要按帧率和片段长度报告。2025年的多图系统应公布视觉token预算、截断规则与位置准确率,并用leave-one-image-out证据检验。few-shot平均分必须带提示集合置信区间。

它与第044号第八条“预训练、涌现与「基础模型」”共享上下文学习,却把示例扩为图像和视频;与第253号第九条“自然语言作为界面”相邻,本条多出视觉示例可临时定义任务。Flamingo证明冻结主干能被跨注意力适配,未证明交错上下文中的每张图都被忠实使用。对Flamingo:交错图文进入少样本上下文Flamingo: Interleaved Images and Text Enter Few-Shot Context而言,真正需要登记的不是又一个平均分,而是由“决定多图少样本迁移能否成立的只有交错视觉证据是否能被冻结语言模型上下文化调用”推出的每一步中介、责任人和可撤回条件;〔责任链〕缺少任何一环,都不能把相关性写成机制。

位置S——把交错上下文本身当成无需改权重的视觉任务载体 单因决定多图少样本迁移能否成立的只有交错视觉证据是否能被冻结语言模型上下文化调用 预设〔02 单一读数代表复杂对象〕最佳4-shot分数被默认代表示例顺序、数量与任务差异的整体能力 量纲打乱提示顺序后仍保持方向的任务数/全部少样本评测任务数 失效当最近示例格式压过当前图像时,示例越多,视觉证据依赖率反而越低 自曝责任链独立核验:80B Flamingo的强结果来自冻结大语言主干与筛选上下文,不能单独归因于视觉融合层;独立撤回检查落在责任链 空栏提示选择成本、网页版面共现、视觉token截断、长视频漏帧及无图也能答对的样本 异名基础模型称“预训练、涌现与「基础模型」”;见第044号第八条“预训练、涌现与「基础模型」”

四、BLIP-2:小型Q-Former桥接两座冻结大模型BLIP-2: A Small Q-Former Bridges Two Frozen Giants

提出Li、Li、Savarese与Hoi,2023年ICML论文《BLIP-2》,PMLR 202:19730–19742。 争议Tsai, Y.-H. H. et al. (2019). Multimodal Transformer for Unaligned Multimodal Language Sequences. ACL, 6558–6569.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键Querying Transformer用两阶段预训练把冻结视觉编码器的证据压成冻结LLM可读取的查询token。

端到端训练视觉语言大模型成本迅速上升,而成熟视觉编码器与LLM已分别存在。BLIP-2在2023年选择不重训两座大模型,只训练一个轻量Q-Former:一组可学习query从视觉特征取证,再把结果送入语言模型。多模态建设由“重新训练一个巨型整体”改为“审计并训练中间接口”。〔排除规则〕机构采用BLIP-2:小型Q-Former桥接两座冻结大模型BLIP-2: A Small Q-Former Bridges Two Frozen Giants之前还应公布否决门槛:一旦“当query槽位不足时,压缩越强,细粒度视觉任务正确率反而越低”出现,就暂停扩张并回到“Querying Transformer用两阶段预训练把冻结视觉编码器的证据压成冻结LLM可读取的查询token”的原始记录复核,该门槛必须早于部署决定写入方案。

〔排除规则〕本条的单因命题是:决定冻结单模态模型能否组合的只有桥接器是否提取了LLM完成任务所需的最小视觉证据。第一阶段让query学习图文表示、匹配与生成,第二阶段把视觉query对齐到冻结语言模型的输入。若接口足够,计算与数据可显著下降;若接口丢失细节,两端再强也无法从未传入的信息恢复。

ICML 2023论文页19730–19742报告,BLIP-2在zero-shot VQAv2上比Flamingo-80B高8.7个百分点,同时可训练参数少54倍;模型还展示图像到文本的零样本指令跟随。关键读数是质量增量/可训练参数、训练FLOPs与延迟,而不是总参数被“冻结”后从成本账中消失。〔排除规则〕把BLIP-2:小型Q-Former桥接两座冻结大模型BLIP-2: A Small Q-Former Bridges Two Frozen Giants与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“视觉证据完整且答案正确的任务数/桥接后语言答案正确的任务数”在这些类别上都可回查,跨研究比较才有意义。

Q-Former固定数量的query是一条信息瓶颈:细字、多个小对象或长图表可能竞争同一槽位。冻结视觉编码器若没学医学影像,冻结LLM若缺低资源语言,桥接层无法凭少量配对创造两端没有的能力。query越少,成本越低,反而越可能把失败伪装成LLM幻觉而不是视觉证据丢失。

工程比较要按视觉复杂度改变query数,记录每token延迟、显存与遮挡后的答案变化,并与端到端微调、LoRA和简单投影器对照。2025年的模块化系统还应做责任定位:同一错误分别替换视觉端、桥接端和语言端,看哪一替换修复。冻结不是免责,版本升级可能让接口分布突然漂移。

它与第044号第八条“预训练、涌现与「基础模型」”共同利用冻结预训练资产,但本条把新能力放在桥接器;与第050号第十条“视觉与语言合流之后”相比,争点从能否合流变成合流需要多少可训练容量。2023年的54倍差异只统计可训练参数,不等于推理时总显存、能源与两端维护成本也缩小54倍。

位置E——把冻结端点的能力边界、接口容量与版本分布当成组合条件 单因决定冻结单模态模型能否组合的只有桥接器是否提取LLM所需的最小视觉证据 预设〔02 单一读数代表复杂对象〕可训练参数减少54倍被当成训练、推理和维护总成本的统一代表 量纲视觉证据完整且答案正确的任务数/桥接后语言答案正确的任务数 失效当query槽位不足时,压缩越强,细粒度视觉任务正确率反而越低 自曝排除规则独立核验:BLIP-2冻结两端并未消除它们的总参数、推理显存与预训练数据成本;独立撤回检查落在排除规则 空栏端点许可证、版本漂移、医学与低资源语言缺口、query拥塞及错误应归责哪一模块 异名计算机视觉称“视觉与语言合流之后”;见第050号第十条“视觉与语言合流之后”

五、ImageBind:图像成为六种模态的枢纽桥梁ImageBind: Images Become the Hub for Six Modalities

提出Girdhar、El-Nouby、Liu等,2023年CVPR论文《ImageBind: One Embedding Space To Bind Them All》,第15180–15190页。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键只要每种模态分别与图像配对,文本、音频、深度、热感和IMU之间可在共同空间出现未直接监督的检索与组合。

多数多模态模型实际只处理图像和文本,现实设备却同时产生声音、深度、热成像与惯性信号。ImageBind在2023年选择图像作枢纽:分别学习图—文、图—声、图—深度、图—热感和图—IMU对齐,不要求收集所有六模态同步样本。训练后,音频可检索文本,IMU可关联声音,未直接配对的通道经视觉桥相遇。

本条声称,决定多于两种模态能否共享坐标的只有公共枢纽是否把各自条件分布连接成传递一致的几何。ImageBind 2023的对比损失把每种编码器输出拉向同一图像锚;若A接近图、B也接近同一图,A与B可能彼此接近。这个结构把昂贵的全组合采集,从15种两两配对压成以图像为中心的5条边。〔基线冻结〕面向下一轮材料,多模态智能应优先补齐“同图异温、画外声源、IMU方向、采样率差异、传感时延及视觉无法观测的内部状态”的原始记录,并把“当视觉只提供粗场景标签时,接入模态越多,非视觉细节保真度反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

CVPR 2023论文在15180–15190页明确覆盖image、text、audio、depth、thermal与IMU共6种模态,并展示跨模态检索、零样本分类及音频指导图像生成等emergent能力。核验应看未直接监督模态对的Recall@K,相对于直接配对上界和随机基线;只展示可听可看的样例不能证明传递对齐稳定。

图像不是所有事件的充分中介:温度可在外观不变时升高,IMU包含动作方向,声音可能来自画外。若两种非视觉模态与图像关联的都是粗场景类别,它们会在空间接近,却没有细粒度对应。增加通道越多而都经视觉桥,视觉不可见属性反而越容易被共同空间抹平。〔基线冻结〕在多模态智能的这一对象上,复核应把“未直接配对模态之间Recall@10/有直接配对监督模态之间Recall@10”拆成同一分母下的主结果与失败谱,“同图异温、画外声源、IMU方向、采样率差异、传感时延及视觉无法观测的内部状态”要单列编码,不能在汇总时并入其他项。

复核应对每条模态边做leave-one-hub-out与条件独立检验,加入同图异温、同景异声和相同画面不同运动的hard negatives。2026年的omni-modal检索还要按模态对公布分辨率、采样率、时间窗口与最坏Recall,而不能用六模态平均分。必要时应允许多个局部空间,不强迫所有信号共享一套距离。

它与第534号第一条跨模态检索共享共同空间,但从2种通道扩到6种并引入传递对齐;与第533号第三条“KinectFusion:看见三维改成边走边建”对接时,深度与IMU不只是语义标签,而有几何和时间单位。ImageBind证明枢纽配对节省数据,不证明图像足以代表所有传感因果。〔基线冻结〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当视觉只提供粗场景标签时,接入模态越多,非视觉细节保真度反而越低”做至少两轮外部复算,若方向翻转,ImageBind:图像成为六种模态的枢纽桥梁ImageBind: Images Become the Hub for Six Modalities的结论必须随之收窄。

位置S——把图像枢纽连接出的共同几何当成六模态传递对齐的决定性载体 单因决定多于两种模态能否共享坐标的只有公共枢纽是否连接成传递一致的几何 预设〔03 缺失即不存在〕图像中不可见的温度、运动与画外声音差异被默认不影响共同语义 量纲未直接配对模态之间Recall@10/有直接配对监督模态之间Recall@10 失效当视觉只提供粗场景标签时,接入模态越多,非视觉细节保真度反而越低 自曝基线冻结独立核验:六模态共存于一个空间不等于15种模态对都得到直接监督或同等精度;独立撤回检查落在基线冻结 空栏同图异温、画外声源、IMU方向、采样率差异、传感时延及视觉无法观测的内部状态 异名具身智能称“看见三维改成边走边建”;见第533号第三条“KinectFusion:看见三维改成边走边建”

六、LLaVA:视觉指令数据把图像接进助手对话LLaVA: Visual Instruction Data Turns Images into Assistant Dialogues

提出Liu、Li、Wu与Lee,2023年NeurIPS论文《Visual Instruction Tuning》。 争议Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. ICML, PMLR 139:8748–8763.。 最新(2024年文献)Wu, C. et al. (2024). Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation. arXiv:2410.13848.。 关键把图像描述与结构化标注转换成指令—回答对,可让视觉编码器和开源LLM形成通用对话助手。

视觉语言模型在2023年前常分别服务描述、VQA或检索,用户无法用开放指令改变任务。LLaVA借鉴文本instruction tuning,把COCO图像的描述与框等信息交给GPT-4生成多轮问题、详细说明和复杂推理,再用这些对话训练视觉投影器与LLM。图像从固定基准输入变成助手对话中的共享上下文。

〔异常运行〕本条的单因命题是:决定视觉模型能否遵循开放任务的只有训练数据是否把视觉证据组织成多样指令—回答行为。LLaVA 2023的两阶段训练先对齐视觉特征与语言空间,再进行visual instruction tuning;用户无需选择专用头,只用自然语言提出描述、比较、解释或建议。能力变化主要来自后训练数据结构,而非单纯增加图文对。

NeurIPS 2023论文构造约158,000条语言—图像指令数据,并发布LLaVA-Bench等面向复杂对话的评价;模型连接CLIP视觉编码器与Vicuna,在ScienceQA等任务展示竞争成绩。关键读数应是专家核验的视觉事实正确率、指令覆盖与教师独立性,而不是让GPT-4既生成训练答案又充当唯一评委。〔异常运行〕证据链还要把Liu、Li、Wu与Lee,2023年NeurIPS论文《Visual Instruction 的起点材料与更新文献放在同一比较表里,并逐项报告“把图像描述与结构化标注转换成指令—回答对,可让视觉编码器和开源LLM形成通用对话助手”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

合成指令把COCO已有标注扩写成流畅推理,却不能创造图中未标出的事实;教师还可能补写常识或看错细节。训练数据越像礼貌助手,模型越会在证据不足时给完整答案,而非停下澄清。若评委偏爱同类教师风格,系统在真实OCR、医学和文化图像上的错误会被对话质量掩盖。

复核要保存生成提示、教师版本、拒收规则和人工改写比例,并抽样逐事实对照原图。2025年的领域数据应由独立专家评审,还要用冲突指令、无答案图与遮挡图测试拒绝。评分应拆事实、推理、帮助性和不确定性;同一模型不能既是大部分答案来源又是最终真实性裁判。对LLaVA:视觉指令数据把图像接进助手〔异常运行〕对话LLaVA: Visual Instruction Data Turns Images into Assistant Dialogues而言,真正需要登记的不是又一个平均分,而是由“决定视觉模型能否遵循开放任务的只有训练数据是否把视觉证据组织成多样指令—回答行为”推出的每一步中介、责任人和可撤回条件,〔异常运行〕缺少任何一环,都不能把相关性写成机制。

它与第044号第十条“对齐与 RLHF:从「会说话」到「听话有用」”是视觉侧异名,本条把偏好之前的监督指令作为主要杠杆;与第253号第九条“自然语言作为界面”相比,多出图像证据与教师生成链。LLaVA证明少量合成对话能激活接口,未证明助手口吻等于可靠视觉推理。

位置D——把合成视觉指令、两阶段训练与助手行为串成开放交互路径 单因决定视觉模型能否遵循开放任务的只有训练数据是否把视觉证据组织成多样指令—回答行为 预设〔03 缺失即不存在〕COCO标注与教师描述未提到的视觉事实被默认不影响指令答案 量纲独立专家确认由图像支撑的答案数/模型给出的全部高置信答案数 失效当教师补写常识且评委偏爱同类风格时,指令数据越多,视觉幻觉反而越流畅 自曝异常运行独立核验:约158,000条指令大部分由GPT-4扩写既有标注,数据多样不等于新增视觉观察;独立撤回检查落在异常运行 空栏教师版本、生成拒收、人工改写、图像授权、无答案任务及低资源文化图像的专家核验 异名基础模型称“对齐与 RLHF:从「会说话」到「听话有用」”;见第044号第十条“对齐与 RLHF:从「会说话」到「听话有用」”

七、SeamlessM4T:语音与文字的多语种任务被并进一个模型SeamlessM4T: Multilingual Speech and Text Tasks Merge into One Model

提出Barrault、Chung、Meglioli等,2023年论文《SeamlessM4T—Massively Multilingual & Multimodal Machine Translation》。 争议Yu, J. et al. (2022). CoCa: Contrastive Captioners are Image-Text Foundation Models. TMLR.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键同一UnitY架构可执行ASR、语音到文本、语音到语音、文本到文本和文本到语音翻译。

跨语言语音交流通常串联ASR、机器翻译与TTS,每一段使用不同数据和错误度量;中间转写还会丢掉韵律与说话方式。SeamlessM4T在2023年把语音和文字编码、文本解码、声学unit生成纳入同一多任务架构,用户可从一种语言的声音直接得到另一种语言的声音,任务边界由产品管线移进共同模型。

〔人工接管〕本条主张,决定多语种语音沟通能否跨任务复用的只有语音与文本目标是否在统一语义瓶颈中联合训练。UnitY以语音和文本编码器识别输入,文本解码器生成近100种语言,再由text-to-unit模块与vocoder产生36种语音输出。共享语义层让ASR、S2TT、S2ST、T2TT与T2ST相互提供监督。

Meta 2023资料列出ASR与语音到文本覆盖近100种语言,语音到语音输入近100种、输出35种加英语;在CVSS上,SeamlessM4T-Large比两阶段级联S2ST强58%,24种英语输出方向的人评XSTS均高于4/5。v2相对v1的into-English S2TT再提升10%以上,数字必须按方向与任务拆开。

2023年宣称的“100种语言”是能力集合并非均衡矩阵:许多语言只在输入端,语音输出仅约36种;口音、代码混用、噪声和专业词会改变误差。共享模型越追求平均覆盖,高资源英语梯度越可能支配低资源音系。若文本中间表示删掉性别、礼貌或韵律,翻译内容分高,社会语用反而更错。〔人工接管〕本条的边界案例应从“方言、代码混用、重叠说话、语用性别、原音授权、人工复核与错误翻译造成的现实后果”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当高资源方向支配共享参数时,覆盖语言越多,最低资源语言的相对质量反而越低”究竟是偶发噪声,还是足以改变结论方向的系统反例。

验收应公布每个语言方向的小时数、BLEU或chrF、ASR WER、语音自然度、说话者保真和端到端延迟,并报告最坏方向。约2秒的SeamlessStreaming还需在重叠说话、口音和网络抖动下测稳定性。对医疗、法律场景必须保存原音与译音对齐,允许人工回看中间文本而非把端到端当不可审计。

它与第044号第二条“端到端翻译与信息瓶颈”共享从级联到统一模型的转向,但本条扩到近100种语言和双向语音;与第253号第九条“自然语言作为界面”对接时,语音是带身份与情绪的界面,不只是文字通道。2023年的覆盖表不能替代逐语言、逐口音的公平分母。机构采用SeamlessM4T:语音与文字的多语种任务被并进一个模型SeamlessM4T: Multilingual Speech and Text Tasks Merge into One Model之前还应公布否决门槛:一旦“当高资源方向支配共享参数时,覆盖语言越多,最低资源语言的相对质量反而越低”出现,就暂停扩张并回到“同一UnitY架构可执行ASR、语音到文本、语音到语音、文本到文本和文本到语音翻译”的原始记录复核;该门槛必须早于部署决定写入方案。

位置D——把多任务UnitY、语言数据配比与流式解码串成跨语种沟通路径 单因决定多语种语音沟通能否跨任务复用的只有语音与文本目标是否在统一语义瓶颈联合训练 预设〔04 测量不改变被测对象〕把语音压成文本语义不会改变韵律、身份与礼貌关系的翻译对象 量纲最坏语言方向的端到端语义保持率/全部语言方向的平均语义保持率 失效当高资源方向支配共享参数时,覆盖语言越多,最低资源语言的相对质量反而越低 自曝人工接管独立核验:近100种输入语言与约36种语音输出并非完整双向矩阵,“支持”没有给出每格质量;独立撤回检查落在人工接管 空栏方言、代码混用、重叠说话、语用性别、原音授权、人工复核与错误翻译造成的现实后果 异名基础模型称“端到端翻译与信息瓶颈”;见第044号第二条“端到端翻译与信息瓶颈”

八、Gemini 1.5:长视频与长音频被纳入百万token上下文Gemini 1.5: Long Video and Audio Enter Million-Token Context

提出Gemini Team,2024年技术报告《Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context》,arXiv:2403.05530。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Wu, C. et al. (2024). Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation. arXiv:2410.13848.。 关键文本、视频与音频可共享最高百万乃至实验性千万token窗口,使检索与推理不再限于短剪辑。

此前视频模型常均匀抽取几十帧,语音系统切成短段,跨小时证据必须由外部检索器拼接。Gemini 1.5在2024年把稀疏MoE与长上下文扩展结合,文本、视频和音频被token化后可在同一窗口中定位。系统可以处理1小时视频、11小时音频或70万词文本,研究单位由短片段变成长记录。〔撤回门槛〕面向下一轮材料,多模态智能应优先补齐“抽帧漏失、媒体压缩、每小时token成本、首答延迟、相似诱饵与外部缓存贡献”的原始记录,并把“当相似事件和位置偏差累积时,窗口越长,时间归因正确率反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

〔撤回门槛〕本条的单因命题是:决定长媒体能否整体推理的只有跨模态证据是否在统一长上下文中保持可寻址位置。若某个说话片段、画面文字和早先文档能由同一注意系统访问,模型可回答跨段问题而不依赖人工切片。2024年报告还测试10M token实验窗口,表明输入容量不再只是语言模型参数旁的附属规格。

技术报告显示Gemini 1.5 Pro在文本、视频与音频的1M-token needle-in-a-haystack检索上超过99.7%,多模态到数百万token仍接近99%;MRCR复杂检索在1M上下文约80%。生产说明把1M对应到约1小时视频、11小时音频。核验必须区分单针召回、多针组合、时序因果与回答准确。

2024年的单针测试把一句特殊“针”放进大量干扰内容,模型可凭独特局部模式检索,不需理解整段故事;帧抽样还会让短事件永远不进上下文。窗口越长,成本、延迟和位置偏差越高,模型反而可能在相似事件间选错时间。高召回也不表示能判断“先发生什么导致后来什么”。

复核应加入多针依赖、相似诱饵、跨音画矛盾、不同帧率及真实会议行动项,并按证据位置画准确率曲线。2026年的系统应报告每小时媒体token数、压缩率、首答延迟和漏事件率;若外部检索或缓存参与,也要从“原生窗口”成绩中分账。长输入必须能返回时间戳证据。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定长媒体能否整体推理的只有跨模态证据是否在统一长上下文保持可寻址位置”的操作定义,仍能复算“需要跨越至少3段证据的正确题数/单针可局部检索的正确题数”,否则所谓转向可能只是数据管线或命名变化。

它与第044号第九条“缩放定律:把进步变成可预测的工程”共享规模路线,但这里扩张的是可寻址上下文;与第532号第十五条“记忆与反思:上下文窗口不再假装是一生”相比,本条聚焦媒体时轴。2024年的99.7%针召回是一项检索能力,不应被换名为对长视频的全面理解。

位置E——把token化、帧采样、位置分布与窗口预算当成长媒体能力环境 单因决定长媒体能否整体推理的只有跨模态证据是否在统一长上下文保持可寻址位置 预设〔04 测量不改变被测对象〕把连续视频与音频采样成token不会改变短事件和时序关系 量纲需要跨越至少3段证据的正确题数/单针可局部检索的正确题数 失效当相似事件和位置偏差累积时,窗口越长,时间归因正确率反而越低 自曝撤回门槛独立核验:超过99.7%的1M-token针召回主要证明定位特异信息,未等同验证长时因果推理;独立撤回检查落在撤回门槛 空栏抽帧漏失、媒体压缩、每小时token成本、首答延迟、相似诱饵与外部缓存贡献 异名智能体工程称“记忆与反思”;见第532号第十五条“记忆与反思:上下文窗口不再假装是一生”

九、Chameleon与Janus:理解和生成争夺同一视觉token系统Chameleon and Janus: Understanding and Generation Share—or Split—Visual Tokens

提出Chameleon Team,2024年论文《Chameleon: Mixed-Modal Early-Fusion Foundation Models》;Wu等,2024年《Janus》及Chen等2025年《Janus-Pro》。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键统一Transformer可同时接收与生成图文,但视觉编码究竟合一还是解耦成为决定性分叉。

早期多模态助手多只“看图写字”,图像生成另由扩散模型承担。Chameleon在2024年把文本与图像都离散成token,用一个early-fusion Transformer接受和输出任意交错组合;同年Janus保留统一Transformer,却为视觉理解和图像生成设置不同编码路径。统一不再是有无,而是共享到哪一层。

〔跨域外推〕本条主张,决定理解与生成能否相互增益的只有视觉token接口是否同时保留语义判别和像素重建所需信息。Chameleon选择共同词表与自回归目标,便于统一维护;Janus认为单一视觉编码承受冲突,用语义编码器支持理解、生成tokenizer支持重建,再在同一语言主干汇合。两条路线给出可对照的结构实验。〔跨域外推〕证据链还要把Chameleon Team,2024年论文《Chameleon: Mixed-Modal Ea的起点材料与更新文献放在同一比较表里,并逐项报告“统一Transformer可同时接收与生成图文,但视觉编码究竟合一还是解耦成为决定性分叉”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

Meta 2024资料说明Chameleon可输入文本和图像,并输出任意文本—图像组合;Janus-Pro在2025年以1B、7B版本加入约90M理解样本与72M合成图像。7B版在MMBench得79.2、GenEval得0.80、DPG-Bench得84.19;可核验对象仍应是固定参数和数据下的两任务Pareto前沿。

2025年的图像tokenizer越追求压缩,细字和计数可能丢失;越追求重建纹理,语言推理负担越大。统一目标还会让高量图像生成数据压过稀缺推理样本。模型在生成端越漂亮,理解端反而可能更依赖表面风格;反之,语义编码强也可能产出模式化图像。单一总分无法判定冲突。对Chameleon与Janus:理解和生成争夺同一视觉token系统Chameleon and Janus: Understanding and Generation Share—or Split—Visual Tokens而言,真正需要登记的不是又一个平均分,而是由“决定理解与生成能否相互增益的只有视觉token接口是否同时保留语义与重建信息”推出的每一步中介、责任人和可撤回条件;〔跨域外推〕缺少任何一环,都不能把相关性写成机制。

复核应固定Transformer规模,比较共享、部分共享和双编码器3种方案,报告理解、生成、延迟、显存和相互干扰;再以OCR、空间关系、身份一致与长交错生成作压力测试。2026年的统一模型还要标明图像token来源与版权,生成内容需可追溯,不能因“同一序列”而省略不同模态的治理。

它与第045号第八条“把生成变成可控的采样”对接生成侧,与第050号第十条“视觉与语言合流之后”对接理解侧;本条的新对象是两种目标能否共用表示。2024–2025年的分叉说明“统一架构”并无单一答案:共享主干和共享视觉tokenizer是两种不同承诺。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当重建纹理梯度支配训练时,生成分数越高,细粒度理解准确率反而越低”做至少两轮外部复算,若方向翻转,Chameleon与Janus:理解和生成争夺同一视觉token系统Chameleon and Janus: Understanding and Generation Share—or Split—Visual Tokens的结论必须随之收窄。

位置S——把视觉token接口的共享边界当成理解—生成统一的决定性资源 单因决定理解与生成能否相互增益的只有视觉token接口是否同时保留语义与重建信息 预设〔05 缺失即不存在〕总分未显示的任务冲突被默认不会影响统一模型的部署价值 量纲同时不低于单任务基线的理解—生成任务对数/全部联合评测任务对数 失效当重建纹理梯度支配训练时,生成分数越高,细粒度理解准确率反而越低 自曝跨域外推独立核验:Chameleon的全共享与Janus的双视觉路径同时存在,证明“统一”尚未收敛为一种接口;独立撤回检查落在跨域外推 空栏tokenizer细字损失、两任务采样权重、生成版权、模态治理差异及只公布最佳checkpoint的选择 异名生成模型称“把生成变成可控的采样”;见第045号第八条“把生成变成可控的采样”

十、GPT-4o与Qwen2.5-Omni:实时语音不再经过文字中转GPT-4o and Qwen2.5-Omni: Real-Time Speech Stops Passing Through Text

提出OpenAI,2024年《GPT-4o System Card》;Xu、Guo、He等,2025年《Qwen2.5-Omni Technical Report》,arXiv:2503.20215。 争议Seamless Communication Team (2023). Seamless: Multilingual Expressive and Streaming Speech Translation. arXiv:2312.05187.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键同一网络直接感知文本、图像、音频、视频并流式生成文字与自然语音,交互延迟进入人类对话尺度。

传统语音助手把声音转写成文字,语言模型回答,再由TTS朗读;笑声、犹豫、节奏和多人重叠在中转时丢失。GPT-4o于2024年把文本、视觉和音频端到端训练,Qwen2.5-Omni在2025年进一步公开流式音画编码与Thinker–Talker结构。多模态不再只扩输入类型,而成为实时连续交互。〔盲法复核〕落到复现实务,可为GPT-4o与Qwen2.5-Omni:实时语音不再经过文字中转GPT-4o and Qwen2.5-Omni: Real-Time Speech Stops Passing Through Text建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“听完关键条件后正确响应的轮次/在320毫秒内开始响应的全部轮次”统一结算,避免换口径后仍宣称性能提高。

〔盲法复核〕本条的单因命题是:决定机器能否进行自然实时全模态交互的只有感知与生成是否共享端到端时序表示。GPT-4o可由同一网络处理输入与输出;Qwen以TMRoPE对齐音视频时间戳,Thinker生成文本状态,Talker并行生成语音token。省去文字中转允许模型响应语调与背景声,也减少级联等待。

OpenAI 2024系统卡给出音频响应最快232毫秒、平均320毫秒,并称文本英文与代码匹配GPT-4 Turbo、API成本低50%;Qwen 2025报告可流式输入文本、图像、音频、视频并同步输出文本与自然语音,在Omni-Bench等取得竞争结果。核验需把端到端、首包、完整答复延迟分开。〔盲法复核〕本条的边界案例应从“未授权音色、跨谈归属、听觉障碍、声音水印、审核未覆盖声学事件及错误语音的撤回”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当否定条件出现在句末时,首包越快,过早行动与错误承诺反而越多”究竟是偶发噪声,还是足以改变结论方向的系统反例。

2024年的原生语音也让错误脱离文字过滤器:模型可能模仿未授权声音、推断说话者身份,在交叉谈话中把一句话归错人;声音里的情绪判断更易被当作事实。追求低延迟时,模型越早开口,反而越可能没听完否定或安全条件。文本转写无法完整记录音色、背景声和越界输出。

部署应保存可审计音频事件与时间戳,分别测口音、噪声、cross-talk、打断、未说完条件和说话者切换;声音生成须限制为授权音色并加来源信号。2026年的实时系统还需报告中断后恢复、错误归因率和音频审核覆盖。平均320毫秒不应挤掉等待关键信息的安全策略。机构采用GPT-4o与Qwen2.5-Omni:实时语音不再经过文字中转GPT-4o and Qwen2.5-Omni: Real-Time Speech Stops Passing Through Text之前还应公布否决门槛:一旦“当否定条件出现在句末时,首包越快,过早行动与错误承诺反而越多”出现,就暂停扩张并回到“同一网络直接感知文本、图像、音频、视频并流式生成文字与自然语音,交互延迟进入人类对话尺度”的原始记录复核;该门槛必须早于部署决定写入方案。

它与第253号第十五条“信任的校准”相接:自然语调会抬高可信感,但事实与权限未同步增加;与第044号第十条“对齐与 RLHF:从「会说话」到「听话有用」”相比,多出无法完全由文字策略覆盖的声学行为。实时性是交互量纲,不是正确性或授权的替身。

位置E——把音画时序、网络延迟、说话者条件与声音治理当成实时交互环境 单因决定自然实时全模态交互能否成立的只有感知与生成是否共享端到端时序表示 预设〔05 缺失即不存在〕转写日志未捕获的音色、背景声与声音模仿风险被默认没有发生 量纲听完关键条件后正确响应的轮次/在320毫秒内开始响应的全部轮次 失效当否定条件出现在句末时,首包越快,过早行动与错误承诺反而越多 自曝盲法复核独立核验:232毫秒最快与320毫秒平均只测响应速度,不能证明跨谈、口音和打断下理解正确;独立撤回检查落在盲法复核 空栏未授权音色、跨谈归属、听觉障碍、声音水印、审核未覆盖声学事件及错误语音的撤回 异名人机交互称“信任的校准”;见第253号第十五条“信任的校准”

十一、MMMU、MathVista与Video-MME:多模态推理被拆成学科、数学与时序MMMU, MathVista and Video-MME: Reasoning Splits into Disciplines, Mathematics and Time

提出Yue等,2024年CVPR《MMMU》;Lu等,2024年ICLR《MathVista》;Fu等,2025年CVPR《Video-MME》。 争议Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键评估对象从日常图像问答扩成30门大学学科、视觉数学及最长1小时视频的证据组合。

多模态模型变大后,VQA式短答案很快失去区分力。MMMU在2024年收集大学考试、测验和教材中的图表与专业题;MathVista要求结合图形和数学计算;Video-MME在2025年加入短、中、长视频及字幕、音频。评测开始区分知识、视觉感知、组合推理和时序,而不是用一个“看图会答”总分。

〔结果分母〕本条主张,决定多模态推理进展能否被比较的只有基准是否让视觉或音视频证据成为不可替代的解题条件。MMMU覆盖艺术设计、商业、科学、健康医学、人社科和工程6大类30学科;MathVista混合逻辑、代数和论文图;Video-MME要求跨11秒到1小时的视频定位信息。三套分母揭示不同失败。把MMMU、MathVista与Video-MME:多模态推理被拆成学科、数学与时序MMMU, MathVista and Video-MME: Reasoning Splits into Disciplines, Mathematics and Time与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“遮除决定性模态后由对转错的题数/模型原本答对的全部题数”在这些类别上都可回查,跨研究比较才有意义。

MMMU含11.5K题,原论文人类专家约88.6%、GPT-4V验证约56.8%;MathVista含6,141例,来自28个既有与3个新数据集,首轮最佳约49.9%、比人类低10.4点;Video-MME含900段共254小时视频和2,700问答。第三段的具体读数必须连同版本、split、是否用字幕音频一起报告。

公开题目会进入训练语料,多选项允许排除法;MMMU后续发现约30%题可能不看图回答。视频帧抽样也让“模型不会”与“证据没被送入”混在一起。排行榜越受重视,团队越会调提示、OCR和工具链,单一总分反而越难归因于模型本身。〔结果分母〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定多模态推理进展能否被比较的只有基准是否让视觉或音视频证据成为不可替代条件”的操作定义,仍能复算“遮除决定性模态后由对转错的题数/模型原本答对的全部题数”,否则所谓转向可能只是数据管线或命名变化。

基准应设私有滚动测试、近重复扫描、text-only与image-only基线、工具使用单列,并按学科和时长报告最坏组。MMMU-Pro在2025年移除文字可答题并把选项从4扩到10,是必要清算;Video-MME还需固定帧率与字幕条件。每道题应保存决定性证据位置,允许核查答对是否用对证据。

它与第048号第八条“评估成为基础设施”同样把能力宣称变成公共试验台,本条限定多模态证据不可替代;与第050号第十二条“数据、偏斜与真实性”相接时,题库污染是首要变量。2024–2025年的数字提供时间截面,不能把刷高一个榜单写成统一感知、知识与推理已经完成。〔结果分母〕面向下一轮材料,多模态智能应优先补齐“训练污染、提示筛选、OCR工具、帧率、字幕条件、私有测试差异及答对却证据路径错误”的原始记录,并把“当训练污染与文字捷径增多时,榜单分越高,真实模态依赖率反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

位置S——把不可替代证据与分层公开基准当成多模态推理进展的决定性裁判 单因决定多模态推理进展能否被比较的只有基准是否让视觉或音视频证据成为不可替代条件 预设〔06 通过形式审查=实质合规〕答对公开多选题就等于在现实任务中正确使用多模态证据 量纲遮除决定性模态后由对转错的题数/模型原本答对的全部题数 失效当训练污染与文字捷径增多时,榜单分越高,真实模态依赖率反而越低 自曝结果分母独立核验:MMMU约30%文字捷径促成MMMU-Pro,说明原11.5K题规模没有自动保证图像必要;独立撤回检查落在结果分母 空栏训练污染、提示筛选、OCR工具、帧率、字幕条件、私有测试差异及答对却证据路径错误 异名人工智能对齐称“评估成为基础设施”;见第048号第八条“评估成为基础设施”

十二、MM-SafetyBench与FigStep:安全边界会在模态接缝处破裂MM-SafetyBench and FigStep: Safety Breaks at Modality Seams

提出Liu、Zhu、Gu等,2024年ECCV论文《MM-SafetyBench》;Gong等,2023–2024年《FigStep》。 争议Gong, Y. et al. (2023). FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts. arXiv:2311.05608.。 最新(2024年文献)Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.。 关键文本单独看似无害、图像中却含排版指令时,已经对齐的LLM仍可能在视觉入口被绕过。

文本安全训练通常在语言token上识别有害请求,但多模态系统会先由视觉编码器把图中文字和场景压成表示。FigStep把有害指令排成图片,再用无害文本请求模型按步骤完成;MM-SafetyBench系统化组合查询相关图像。风险由“某模态内容危险”升级为“两个单独可接受的通道合在一起危险”。

〔未覆盖项〕本条的单因命题是:决定多模态安全是否成立的只有策略能否在融合后对联合语义重新执行同一安全约束。若文本过滤发生在视觉融合之前,图像中的OCR指令可能绕过;若只审核最终转写,又可能丢掉空间排版和隐喻。安全单元必须是跨模态组合,不是每个文件分别过审后的逻辑与。

ECCV 2024的MM-SafetyBench覆盖13类风险、5,040个图文对,测试12种当时模型,显示即使底层LLM做过安全对齐,也会被查询相关图像诱发违规;论文提出提示型缓解但未宣称根治。关键读数是attack success rate、良性拒绝率与跨模型迁移,三者需同时报告,不能用更高拒绝掩盖可用性损失。〔未覆盖项〕在多模态智能的这一对象上,复核应把“联合攻击被安全拒绝且良性任务未误拒的样本数/全部图文安全测试样本数”拆成同一分母下的主结果与失败谱,“隐藏测试泄漏、自动评委误判、无障碍OCR误拒、攻击版本、状态清除及越权工具的现实损失”要单列编码,不能在汇总时并入其他项。

公开越狱模板容易被防御规则记住,下降的攻击率未必代表理解联合风险;自动评委还可能把讨论危害的安全解释误判为违规。模态越多,攻击面与组合数增长,单项过滤越严格,良性OCR、教育和无障碍请求反而越可能被拒。安全均值提高可能伴随某种语言或视觉格式恶化。

部署测试应随机化字体、布局、语言、音频时序与视频帧位置,并设置自适应红队、隐藏模板和人工复核;同时记录unsafe response rate与over-refusal。2026年的全模态系统还要测试一条模态撤回后状态是否清除,以及工具调用是否继承融合后的权限。攻击样本与缓解提示必须版本化。〔未覆盖项〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当防御只记住公开模板时,静态攻击率越低,新布局的迁移攻击成功率反而越高”做至少两轮外部复算,若方向翻转,MM-SafetyBench与FigStep:安全边界会在模态接缝处破裂MM-SafetyBench and FigStep: Safety Breaks at Modality Seams的结论必须随之收窄。

它与第048号第九条“被实证记录下来的失败模式”共享对齐清算,但本条把失败定位在视觉—语言接缝;与第253号第十八条“界面中的隐私”相接时,图中文字也可能包含个人数据和隐藏指令。2024年的5,040对证明接缝可系统测量,不代表13类已覆盖实时语音、视频与智能体工具的全部风险。

位置D——把融合后复审、自适应红队与良性拒绝审计串成跨模态安全路径 单因决定多模态安全是否成立的只有策略能否在融合后对联合语义重新执行同一安全约束 预设〔06 通过形式审查=实质合规〕各模态分别通过过滤就等于组合后的含义也安全 量纲联合攻击被安全拒绝且良性任务未误拒的样本数/全部图文安全测试样本数 失效当防御只记住公开模板时,静态攻击率越低,新布局的迁移攻击成功率反而越高 自曝未覆盖项独立核验:MM-SafetyBench的13类5,040对与12个模型是静态截面,未覆盖所有语言、音频、视频和工具权限;独立撤回检查落在未覆盖项 空栏隐藏测试泄漏、自动评委误判、无障碍OCR误拒、攻击版本、状态清除及越权工具的现实损失 异名人工智能对齐称“被实证记录下来的失败模式”;见第048号第九条“被实证记录下来的失败模式”

◎ 二十年连起来看

第一幕的共同动作是把异质信号变成可评分关系:2010年的双向检索测排序,2011年的视听网络测缺失通道,2013年的DeViSE测未见标签,2015年的描述与VQA测句子和答案,2016年的RefCOCO与SoundNet测空间落点和跨模态教师。第二幕不只是参数更大,而把接口升级为跨注意力、4亿级对比数据、交错上下文、Q-Former、六模态枢纽、视觉指令、长媒体、原生语音与联合安全。主线由“两个向量可比较”移到“不同模态在时间、任务和权限上怎样相互修改”。

◎ 三个常见误解

必要性要求移除一条模态后答案显著改变,否则系统可能只借语言先验;互补性要求组合收益超过最佳单模态且在缺失与冲突时校准;可追责性要求输出能返回图像区域、音视频时间戳或具体数据来源。2026年的多模态模型若只报总体准确率,无法区分看见、猜中和记忆。最小证据包应同时含text-only、single-modality、full-modality、conflict与missing五组结果,并把延迟、token和人工复核写进同一预算。

◎ 与相邻领域的接口

误解一:支持的模态越多,理解越统一。ImageBind的6种通道仍主要经图像桥接,视觉不可见属性可被抹平。误解二:长上下文等于长时理解。Gemini 1.5的1M-token针召回超过99.7%,仍不自动证明时序因果。误解三:端到端就没有中间误差。GPT-4o与Qwen2.5-Omni把中间状态变成隐表示,审核反而更难。统一应理解为接口可共同训练,而不是差异、单位与治理责任消失。

◎ 争议现场

与计算机视觉的接口是对象、像素、三维和开放词汇;与语音语言学的接口是音素、韵律、口音及多人轮次;与信息检索的接口是相关集合、候选库与Recall@K;与人机交互的接口是指称、澄清、无障碍和信任校准;与生成模型的接口是视觉token、采样与真实性;与智能体工程的接口则是多模态记忆、工具权限和行动反馈。2026年的共同难题不是再给系统增加一个输入图标,而是让每一条模态保留自己的采样率、误差单位、授权边界与撤回路径。

◎ 往下五年看什么

统一派以CLIP、ImageBind、Chameleon和原生omni模型证明共同空间带来迁移、少样本和低延迟;模块派指出BLIP-2的桥接、Janus的双视觉路径及独立安全过滤更易定位错误。双方共享的隐含前提是“接口位置可以用一个总分裁决”。真正收敛需要在固定数据、参数、FLOPs与延迟下比较全共享、部分共享和模块化3种系统,并在2025–2026年的OCR、跨谈、模态冲突、低资源语言和工具越权任务上同时报告平均与最坏结果。

◎ 可与哪些领域对撞

第一,看多模态系统是否从成对图文走向真实同步流,并公开每种传感器的缺失与校准曲线。第二,看长视频能否从找针推进到跨小时因果、人物持续性和事件遗漏率。第三,看低资源语言、手语、触觉、气味和医学传感是否不再只借视觉当桥。第四,看2026年后的实时语音是否把声音来源、授权与撤回做成默认协议。第五,看滚动私有基准能否持续隔离训练污染。最重要信号不是又支持几种格式,而是模态冲突时系统能否停下、说明证据并请求澄清。

◎ 十条可做的研究命题

1. 打乱图文配对后,CLIP最坏群体准确率应显著下降。2. 删除决定性图像区域后,VQA正确答案应翻转。3. ImageBind非直接配对模态的Recall@10应高于随机且低于直接监督上界。4. Q-Former query加倍应优先改善细字与多对象任务。5. Gemini 1.5的多针跨段题应低于单针召回。6. LLaVA去掉图像后高置信答案率应下降。7. SeamlessM4T最坏语言方向与平均值差距应随数据均衡缩小。8. 原生语音等待句末否定会减少过早承诺。9. Janus双视觉路径应移动理解—生成Pareto前沿。10. 融合后复审应同时降低攻击成功率而不抬高良性误拒;任一结果反向,命题就应收窄。

◎ 资料核验

  1. Rasiwasia, N. et al. (2010). A New Approach to Cross-Modal Multimedia Retrieval. ACM Multimedia. DOI:10.1145/1873951.1873987.
  2. Hardoon, D. R., Szedmak, S. & Shawe-Taylor, J. (2004). Canonical Correlation Analysis: An Overview with Application to Learning Methods. Neural Computation, 16:2639–2664.
  3. Ngiam, J. et al. (2011). Multimodal Deep Learning. ICML, 689–696.
  4. Baltrušaitis, T., Ahuja, C. & Morency, L.-P. (2019). Multimodal Machine Learning: A Survey and Taxonomy. IEEE TPAMI, 41:423–443.
  5. Srivastava, N. & Salakhutdinov, R. (2012). Multimodal Learning with Deep Boltzmann Machines. NeurIPS.
  6. Srivastava, N. & Salakhutdinov, R. (2014). Multimodal Learning with Deep Boltzmann Machines. JMLR, 15:2949–2980.
  7. Frome, A. et al. (2013). DeViSE: A Deep Visual-Semantic Embedding Model. NeurIPS.
  8. Mikolov, T. et al. (2013). Distributed Representations of Words and Phrases and their Compositionality. NeurIPS.
  9. Vinyals, O. et al. (2015). Show and Tell: A Neural Image Caption Generator. CVPR, 3156–3164.
  10. Chen, X. et al. (2015). Microsoft COCO Captions: Data Collection and Evaluation Server. arXiv:1504.00325.
  11. Antol, S. et al. (2015). VQA: Visual Question Answering. ICCV, 2425–2433.
  12. Agrawal, A. et al. (2018). Don't Just Assume; Look and Answer. CVPR.
  13. Yu, L. et al. (2016). Modeling Context in Referring Expressions. ECCV. DOI:10.1007/978-3-319-46475-6_5.
  14. Kazemzadeh, S. et al. (2014). ReferItGame. EMNLP, 787–798.
  15. Aytar, Y., Vondrick, C. & Torralba, A. (2016). SoundNet. NeurIPS.
  16. Arandjelović, R. & Zisserman, A. (2017). Look, Listen and Learn. ICCV.
  17. Lu, J. et al. (2019). ViLBERT. NeurIPS.
  18. Tan, H. & Bansal, M. (2019). LXMERT. EMNLP-IJCNLP, 5100–5111.
  19. Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. ICML, PMLR 139:8748–8763.
  20. Jia, C. et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. ICML.
  21. Schuhmann, C. et al. (2022). LAION-5B. NeurIPS Datasets and Benchmarks.
  22. Alayrac, J.-B. et al. (2022). Flamingo. NeurIPS, 35:23716–23736.
  23. Li, J. et al. (2023). BLIP-2. ICML, PMLR 202:19730–19742.
  24. Girdhar, R. et al. (2023). ImageBind. CVPR, 15180–15190.
  25. Liu, H. et al. (2023). Visual Instruction Tuning. NeurIPS.
  26. Barrault, L. et al. (2023). SeamlessM4T. arXiv:2308.11596.
  27. Seamless Communication Team (2023). Seamless: Multilingual Expressive and Streaming Speech Translation. arXiv:2312.05187.
  28. Gemini Team (2024). Gemini 1.5. arXiv:2403.05530.
  29. Reid, M. et al. (2024). Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context. Technical report.
  30. Chameleon Team (2024). Chameleon: Mixed-Modal Early-Fusion Foundation Models. arXiv:2405.09818.
  31. Wu, C. et al. (2024). Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation. arXiv:2410.13848.
  32. Chen, X. et al. (2025). Janus-Pro. arXiv:2501.17811.
  33. OpenAI (2024). GPT-4o System Card.
  34. Xu, J. et al. (2025). Qwen2.5-Omni Technical Report. arXiv:2503.20215.
  35. Yue, X. et al. (2024). MMMU. CVPR.
  36. Yue, X. et al. (2025). MMMU-Pro. ACL.
  37. Lu, P. et al. (2024). MathVista. ICLR.
  38. Fu, C. et al. (2025). Video-MME. CVPR, 24108–24118.
  39. Liu, X. et al. (2024). MM-SafetyBench. ECCV.
  40. Gong, Y. et al. (2023). FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts. arXiv:2311.05608.
  41. Ying, Z. et al. (2024). SafeBench. arXiv:2410.18927.
  42. Tsai, Y.-H. H. et al. (2019). Multimodal Transformer for Unaligned Multimodal Language Sequences. ACL, 6558–6569.
  43. Liang, P. P. et al. (2022). Foundations and Trends in Multimodal Machine Learning. arXiv:2209.03430.
  44. Sarkar, S. D. et al. (2025). CrossOver: 3D Scene Cross-Modal Alignment. CVPR.
  45. Lei, W. et al. (2024). ViT-Lens: Towards Omni-modal Representations. CVPR.
  46. Su, W. et al. (2020). VL-BERT. ICLR.
  47. Li, J. et al. (2022). BLIP. ICML.
  48. Akbari, H. et al. (2021). VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. NeurIPS.
  49. Yu, J. et al. (2022). CoCa: Contrastive Captioners are Image-Text Foundation Models. TMLR.
  50. OpenAI (2026). GPT-Live: A New Generation of Voice Models. Technical release.

新思想前沿 534 · 多模态智能 · 本页按“必要证据—跨模态增益—冲突失效—责任接口”组织;发布读数以来源版本为准,产品能力更新不追溯改写历史结论。