SDE Universes·新思想前沿计算与人工智能
新思想前沿 · 计算与人工智能

生成模型与扩散

近二十年与经典层 · 两幕 20 个新思想 + 20 个经典思想 · 约 36,967 字 · 王德生 亲撰 · 2026 年 8 月

生成模型的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。

【第一幕】上一个十年 · 约 2006–2016

第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。

甲、变分自编码器:生成被写成可优化的概率下界Variational Autoencoders

提出Kingma 与 Welling,2014 年《ICLR》论文“Auto-Encoding Variational Bayes”。 争议(未见反对;边界:高斯后验与像素似然会产生模糊,ELBO更好不等于感知质量更高。) 最新(2024—2026年未见直接更新。)。 关键重参数化技巧让潜变量生成模型可用反向传播联合学习推断与生成。

起点要放回2014年的ICLR:Kingma 与 Welling不再允许生成模型与扩散在变分自编码器上继续用单一似然或逼真度结算质量。Kingma 与 Welling逐项核对潜变量、噪声轨迹与生成样本里的变分自编码器;训练集近邻、采样成本与条件偏离由生成模型与扩散里的StyleGAN另行登记。在ICLR的证据账上,由在图像数据上学习连续潜空间并近似最大化证据下界起步,生成模型与扩散里的StyleGAN进入解释对照;本条残差不能靠改名消失。

变分自编码器的可反驳立场是:重参数化技巧让潜变量生成模型可用反向传播联合学习推断与生成。Kingma 与 Welling这一路线据此把决定性解释锁在一个对象上,生成模型与扩散里的StyleGAN的“逐层注入风格和噪声可分离姿态、身份与细节尺度”不能替代本条;边界是高斯后验与像素似然会产生模糊。若换样本后再问仍不能保持方向,生成模型与扩散里的StyleGAN便构成变分自编码器的近邻反例;ICLR对变分自编码器仅支持原任务。

可核对的主证据是Kingma 与 Welling,2014 年《ICLR》论文“Auto-Encoding Variational Bayes”:在图像数据上学习连续潜空间并近似最大化证据下界。VAE论文比较2种随机梯度估计器。生成模型与扩散里的StyleGAN要求把2014年的变分自编码器样本与对照结算,再核查生成模型与扩散里的StyleGAN的任务、观察窗和高斯后验与像素似然会产生模糊。对变分自编码器,生成模型与扩散里的StyleGAN仅作近邻;支点仍是Kingma 与 Welling在ICLR的原始比较。

变分自编码器自己留下的反证入口是:高斯后验与像素似然会产生模糊,ELBO更好不等于感知质量更高。用正交量纲重测时,Kingma 与 Welling的解释可能缩小、反号,或让位给生成模型与扩散里的StyleGAN的路径。生成模型与扩散里的StyleGAN给出复核ICLR的近邻条件:把不显著结果一并公开;变分自编码器负责记录中止、排除和不显著对象。

在图像数据上学习连续潜空间并近似最大化证据下界改变登记顺序:潜变量、噪声轨迹与生成样本归变分自编码器,训练集近邻、采样成本与条件偏离交生成模型与扩散里的StyleGAN核查。2019年的生成模型与扩散里的StyleGAN以“逐层注入风格和噪声可分离姿态、身份与细节尺度”作近邻;两者若结论不同,应以高斯后验与像素似然会产生模糊为分账边界;生成模型与扩散里的StyleGAN不得与本条合成一个平均分。

2014年,变分自编码器据在图像数据上学习连续潜空间并近似最大化证据下界对接第047号第一幕丙。跨过去,高斯后验与像素似然会产生模糊迫使变分自编码器重新检验可见读数。变分自编码器以高斯后验与像素似然会产生模糊施加反向压力。该接口若仍支持相反方向,高斯后验与像素似然会产生模糊要求变分自编码器增加第三条件,同时容纳两边的失效样本。

位置S——它把变分自编码器所定义的结构、表示或可判结果当成单独够用的那一样 单因只有变分自编码器是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当高斯后验与像素似然会产生模糊,主指标越高,边界外保持率反而越低 自曝原始纳入标准首先暴露:高斯后验与像素似然会产生模糊 空栏变分自编码器中与“高斯后验与像素似然会产生模糊”有关却未入分母的失败对象 异名另见第047号第一幕丙“高维Lasso:变量多于样本时仍可做稀疏选择”

乙、生成对抗网络:判别器把显式似然换成对抗信号Generative Adversarial Networks

提出Goodfellow 等,2014 年《NeurIPS》27:2672–2680。 争议(未见反对;边界:训练不稳定、模式坍塌与无似然评价使胜负难以结算。) 最新(2024—2026年未见直接更新。)。 关键生成器与判别器的极小极大博弈可直接学习数据分布并生成锐利样本。

真正的断点出现在2014年的NeurIPS:Goodfellow 等不再允许生成模型与扩散在生成对抗网络上继续用单一似然或逼真度结算质量。Goodfellow 等逐项核对潜变量、噪声轨迹与生成样本里的生成对抗网络;训练集近邻、采样成本与条件偏离由生成模型与扩散里的DDPM另行登记。在NeurIPS的证据账上,由早期图像实验显示无需马尔可夫链即可采样起步,生成模型与扩散里的DDPM进入解释对照;本条残差不能靠改名消失。

生成对抗网络的可反驳立场是:生成器与判别器的极小极大博弈可直接学习数据分布并生成锐利样本。Goodfellow 等这一路线据此把决定性解释锁在一个对象上,生成模型与扩散里的DDPM的“预测每一步加入的噪声可训练稳定逆扩散过程”不能替代本条;边界是训练不稳定、模式坍塌与无似然评价使胜负难以结算。若把时间窗拉长再看仍不能保持方向,生成模型与扩散里的DDPM便构成生成对抗网络的近邻反例;NeurIPS对生成对抗网络仅支持原任务。

可核对的主证据是Goodfellow 等,2014 年《NeurIPS》27:2672–2680:早期图像实验显示无需马尔可夫链即可采样,奠定感知生成路线。原始GAN由生成器和判别器2个网络对抗训练。生成模型与扩散里的DDPM要求把2014年的生成对抗网络样本与对照结算,再核查生成模型与扩散里的DDPM的任务、观察窗和训练不稳定、模式坍塌与无似然评价使胜负难以结算。对生成对抗网络,生成模型与扩散里的DDPM仅作近邻;支点仍是Goodfellow 等在NeurIPS的原始比较。

生成对抗网络自己留下的反证入口是:训练不稳定、模式坍塌与无似然评价使胜负难以结算。撤去界面提示再验时,Goodfellow 等的解释可能缩小、反号,或让位给生成模型与扩散里的DDPM的路径。生成模型与扩散里的DDPM给出复核NeurIPS的近邻条件:按个体轨迹而非均值检查;生成对抗网络负责记录中止、排除和不显著对象。

早期图像实验显示无需马尔可夫链即可采样改变登记顺序:潜变量、噪声轨迹与生成样本归生成对抗网络,训练集近邻、采样成本与条件偏离交生成模型与扩散里的DDPM核查。2020年的生成模型与扩散里的DDPM以“预测每一步加入的噪声可训练稳定逆扩散过程”作近邻;两者若结论不同,应以训练不稳定、模式坍塌与无似然评价使胜负难以结算为分账边界;生成模型与扩散里的DDPM不得与本条合成一个平均分。

2014年,生成对抗网络据早期图像实验显示无需马尔可夫链即可采样对接第046号第二幕十。跨过去,训练不稳定、模式坍塌与无似然评价使胜负难以结算迫使生成对抗网络重新检验可见读数。生成对抗网络以训练不稳定、模式坍塌与无似然评价使胜负难以结算施加反向压力。该接口若仍支持相反方向,训练不稳定、模式坍塌与无似然评价使胜负难以结算要求生成对抗网络增加第三条件,同时容纳两边的失效样本。

位置D——它把生成对抗网络的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有生成对抗网络是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当训练不稳定、模式坍塌与无似然评价使胜负难以结算,主指标越高,边界外保持率反而越低 自曝主要终点自己留下:训练不稳定、模式坍塌与无似然评价使胜负难以结算 空栏生成对抗网络中与“训练不稳定、模式坍塌与无似然评价使胜负难以结算”有关却未入分母的失败对象 异名另见第046号第二幕十“规格博弈:代理会优化指标而不是设计者本意”

丙、深卷积GAN:稳定结构把对抗生成推向高分辨率Deep Convolutional GANs

提出Radford、Metz、Chintala,2016 年《ICLR》论文“Unsupervised Representation Learning with Deep Convolutional GANs”。 争议(未见反对;边界:视觉平滑不等于覆盖数据分布,样本挑选会隐藏失败模式。) 最新(2024—2026年未见直接更新。)。 关键全卷积、批归一化和受限架构形成可迁移生成配方。

旧账最先在2016年的ICLR:Radford、Metz、Chintala不再允许生成模型与扩散在深卷积GAN上继续用单一似然或逼真度结算质量。Radford、Metz、Chintala逐项核对潜变量、噪声轨迹与生成样本里的深卷积GAN;训练集近邻、采样成本与条件偏离由得分SDE另行登记。在ICLR的证据账上,由DCGAN在卧室与人脸中学习可操纵潜向量起步,得分SDE进入解释对照;本条残差不能靠改名消失。第281号第十三条“生成模型进入创作工具链”提供不同尺度的反例;它迫使深卷积GAN把“适用”写成可检查的对象范围。

深卷积GAN的可反驳立场是:全卷积、批归一化和受限架构形成可迁移生成配方。Radford、Metz、Chintala这一路线据此把决定性解释锁在一个对象上,得分SDE的“随机微分方程把多类扩散过程、采样器和似然估计放进统一框架”不能替代本条;边界是视觉平滑不等于覆盖数据分布。若保留失败对象后检验仍不能保持方向,得分SDE便构成深卷积GAN的近邻反例;ICLR对深卷积GAN仅支持原任务。

可核对的主证据是Radford、Metz、Chintala,2016 年《ICLR》论文“Unsupervised Representation Learning with Deep Convolutional GANs”:DCGAN在卧室与人脸中学习可操纵潜向量,并让判别特征用于分类。DCGAN在3类图像数据上检查潜空间。得分SDE要求把2016年的深卷积GAN样本与对照结算,再核查得分SDE的任务、观察窗和视觉平滑不等于覆盖数据分布。对深卷积GAN,得分SDE仅作近邻;支点仍是Radford、Metz、Chintala在ICLR的原始比较。拿得分SDE作近邻检验,可辨认Radford、Metz、Chintala观察到的是独有路径,还是另一条路线的表面同义词。

深卷积GAN自己留下的反证入口是:视觉平滑不等于覆盖数据分布,样本挑选会隐藏失败模式。按亚组分别结算时,Radford、Metz、Chintala的解释可能缩小、反号,或让位给得分SDE的路径。得分SDE给出复核ICLR的近邻条件:加入反事实条件;深卷积GAN负责记录中止、排除和不显著对象。回到ICLR的取样方式,深卷积GAN要用得分SDE证明原分母没有删去最容易失败的对象。

DCGAN在卧室与人脸中学习可操纵潜向量改变登记顺序:潜变量、噪声轨迹与生成样本归深卷积GAN,训练集近邻、采样成本与条件偏离交得分SDE核查。2021年的得分SDE以“随机微分方程把多类扩散过程、采样器和似然估计放进统一框架”作近邻;两者若结论不同,应以视觉平滑不等于覆盖数据分布为分账边界;得分SDE不得与本条合成一个平均分。

2016年,深卷积GAN据DCGAN在卧室与人脸中学习可操纵潜向量对接第281号第十三条。跨过去,视觉平滑不等于覆盖数据分布迫使深卷积GAN重新检验可见读数。深卷积GAN以视觉平滑不等于覆盖数据分布施加反向压力。该接口若仍支持相反方向,视觉平滑不等于覆盖数据分布要求深卷积GAN增加第三条件,同时容纳两边的失效样本。

位置E——它把深卷积GAN的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有深卷积GAN是决定因素 预设〔17 局部最优可加总为整体最优〕单项性能会自然形成系统收益 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当视觉平滑不等于覆盖数据分布,主指标越高,边界外保持率反而越低 自曝配平资源后突出:视觉平滑不等于覆盖数据分布 空栏深卷积GAN中与“视觉平滑不等于覆盖数据分布”有关却未入分母的失败对象 异名另见第281号第十三条“生成模型进入创作工具链”

丁、自回归像素:稳定似然以缓慢采样为代价PixelRNN and PixelCNN

提出van den Oord、Kalchbrenner、Kavukcuoglu,2016 年《ICML》48:1747–1756。 争议(未见反对;边界:逐像素依赖导致采样极慢,似然也可能偏好感知更差的分布。) 最新(2024—2026年未见直接更新。)。 关键把联合图像概率按像素顺序分解,可得到精确似然与稳定训练。

转折并非始于2016年的ICML:van den Oord、Kalchbrenner、Kavukcuoglu不再允许生成模型与扩散在自回归像素上继续用单一似然或逼真度结算质量。van den Oord、Kalchbrenner、Kavukcuoglu逐项核对潜变量、噪声轨迹与生成样本里的自回归像素;训练集近邻、采样成本与条件偏离由无分类器引导另行登记。在ICML的证据账上,由PixelRNN在MNIST、CIFAR和ImageNet小图上刷新对数似然起步,无分类器引导进入解释对照;本条残差不能靠改名消失。

自回归像素的可反驳立场是:把联合图像概率按像素顺序分解,可得到精确似然与稳定训练。van den Oord、Kalchbrenner、Kavukcuoglu这一路线据此把决定性解释锁在一个对象上,无分类器引导的“同时训练有条件和无条件模型,可在采样时调节文字一致性与多样性”不能替代本条;边界是逐像素依赖导致采样极慢。若改用地点外资料复核仍不能保持方向,无分类器引导便构成自回归像素的近邻反例;ICML对自回归像素仅支持原任务。

可核对的主证据是van den Oord、Kalchbrenner、Kavukcuoglu,2016 年《ICML》48:1747–1756:PixelRNN在MNIST、CIFAR和ImageNet小图上刷新对数似然。PixelRNN在MNIST、CIFAR与ImageNet小图3类数据上比较似然。无分类器引导要求把2016年的自回归像素样本与对照结算,再核查无分类器引导的任务、观察窗和逐像素依赖导致采样极慢。对自回归像素,无分类器引导仅作近邻;支点仍是van den Oord、Kalchbrenner、Kavukcuoglu在ICML的原始比较。回到ICML的取样方式,自回归像素要用无分类器引导证明原分母没有删去最容易失败的对象。

自回归像素自己留下的反证入口是:逐像素依赖导致采样极慢,似然也可能偏好感知更差的分布。改变任务顺序后追踪时,van den Oord、Kalchbrenner、Kavukcuoglu的解释可能缩小、反号,或让位给无分类器引导的路径。无分类器引导给出复核ICML的近邻条件:用盲法重跑关键判断;自回归像素负责记录中止、排除和不显著对象。

PixelRNN在MNIST、CIFAR和ImageNet小图上刷新对数似然改变登记顺序:潜变量、噪声轨迹与生成样本归自回归像素,训练集近邻、采样成本与条件偏离交无分类器引导核查。2022年的无分类器引导以“同时训练有条件和无条件模型,可在采样时调节文字一致性与多样性”作近邻;两者若结论不同,应以逐像素依赖导致采样极慢为分账边界;无分类器引导不得与本条合成一个平均分。

2016年,自回归像素据PixelRNN在MNIST、CIFAR和ImageNet小图上刷新对数似然对接第044号第二幕十二。跨过去,逐像素依赖导致采样极慢迫使自回归像素重新检验可见读数。自回归像素以逐像素依赖导致采样极慢施加反向压力。该接口若仍支持相反方向,逐像素依赖导致采样极慢要求自回归像素增加第三条件,同时容纳两边的失效样本。

位置S——它把自回归像素所定义的结构、表示或可判结果当成单独够用的那一样 单因只有自回归像素是决定因素 预设〔18 干预不回写到被干预者〕对象不会适应、规避或利用干预 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当逐像素依赖导致采样极慢,主指标越高,边界外保持率反而越低 自曝作者在方法附录承认:逐像素依赖导致采样极慢 空栏自回归像素中与“逐像素依赖导致采样极慢”有关却未入分母的失败对象 异名另见第044号第二幕十二“测试时计算:答案质量开始由推理阶段预算调节”

戊、早期扩散:逐步加噪再学会逆转Diffusion Probabilistic Models

提出Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli,2015 年《ICML》37:2256–2265。 争议(未见反对;边界:数百至上千步采样在当时不具产品速度,质量也未超过GAN。) 最新(2024—2026年未见直接更新。)。 关键复杂分布可由许多小型随机逆过程从噪声逐步还原。

问题的入口是2015年的ICML:Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli不再允许生成模型与扩散在早期扩散上继续用单一似然或逼真度结算质量。Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli逐项核对潜变量、噪声轨迹与生成样本里的早期扩散;训练集近邻、采样成本与条件偏离由潜空间扩散另行登记。在ICML的证据账上,由非平衡热力学框架在图像数据上给出可训练似然与采样链起步,潜空间扩散进入解释对照;本条残差不能靠改名消失。

早期扩散的可反驳立场是:复杂分布可由许多小型随机逆过程从噪声逐步还原。Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli这一路线据此把决定性解释锁在一个对象上,潜空间扩散的“感知自编码器把高维像素压到潜空间,显著降低扩散训练与采样成本”不能替代本条;边界是数百至上千步采样在当时不具产品速度。若让替代路径进入对照仍不能保持方向,潜空间扩散便构成早期扩散的近邻反例;ICML对早期扩散仅支持原任务。

可核对的主证据是Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli,2015 年《ICML》37:2256–2265:非平衡热力学框架在图像数据上给出可训练似然与采样链。早期扩散使用1000步量级的逆过程。潜空间扩散要求把2015年的早期扩散样本与对照结算,再核查潜空间扩散的任务、观察窗和数百至上千步采样在当时不具产品速度。对早期扩散,潜空间扩散仅作近邻;支点仍是Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli在ICML的原始比较。

早期扩散自己留下的反证入口是:数百至上千步采样在当时不具产品速度,质量也未超过GAN。让独立团队预注册时,Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli的解释可能缩小、反号,或让位给潜空间扩散的路径。潜空间扩散给出复核ICML的近邻条件:将短期与长期拆账;早期扩散负责记录中止、排除和不显著对象。

非平衡热力学框架在图像数据上给出可训练似然与采样链改变登记顺序:潜变量、噪声轨迹与生成样本归早期扩散,训练集近邻、采样成本与条件偏离交潜空间扩散核查。2022年的潜空间扩散以“感知自编码器把高维像素压到潜空间,显著降低扩散训练与采样成本”作近邻;两者若结论不同,应以数百至上千步采样在当时不具产品速度为分账边界;潜空间扩散不得与本条合成一个平均分。

2015年,早期扩散据非平衡热力学框架在图像数据上给出可训练似然与采样链对接第257号第十四条。跨过去,数百至上千步采样在当时不具产品速度迫使早期扩散重新检验可见读数。早期扩散以数百至上千步采样在当时不具产品速度施加反向压力。该接口若仍支持相反方向,数百至上千步采样在当时不具产品速度要求早期扩散增加第三条件,同时容纳两边的失效样本。

位置D——它把早期扩散的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有早期扩散是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当数百至上千步采样在当时不具产品速度,主指标越高,边界外保持率反而越低 自曝换到独立样本时暴露:数百至上千步采样在当时不具产品速度 空栏早期扩散中与“数百至上千步采样在当时不具产品速度”有关却未入分母的失败对象 异名另见第257号第十四条“模拟式推断让‘没有似然’不再等于‘不能统计’”

己、正规化流:可逆变换同时给出精确似然与采样Normalizing Flows

提出Dinh、Krueger、Bengio,2015 年 arXiv:1410.8516《NICE》。 争议(未见反对;边界:可逆结构限制网络形状,精确似然不保证样本语义质量。) 最新(2024—2026年未见直接更新。)。 关键可逆映射和雅可比行列式把简单密度变成复杂数据分布。

先看被改写的对象2015年的NICE:Dinh、Krueger、Bengio不再允许生成模型与扩散在正规化流上继续用单一似然或逼真度结算质量。Dinh、Krueger、Bengio逐项核对潜变量、噪声轨迹与生成样本里的正规化流;训练集近邻、采样成本与条件偏离由DDIM与少步采样另行登记。在NICE的证据账上,由NICE展示精确对数似然、潜变量操作和直接采样可同时获得起步,DDIM与少步采样进入解释对照;本条残差不能靠改名消失。

正规化流的可反驳立场是:可逆映射和雅可比行列式把简单密度变成复杂数据分布。Dinh、Krueger、Bengio这一路线据此把决定性解释锁在一个对象上,DDIM与少步采样的“确定性或非马尔可夫逆过程可用更少步骤生成并支持潜空间插值”不能替代本条;边界是可逆结构限制网络形状。若把排除者放回分母仍不能保持方向,DDIM与少步采样便构成正规化流的近邻反例;NICE对正规化流仅支持原任务。

可核对的主证据是Dinh、Krueger、Bengio,2015 年 arXiv:1410.8516《NICE》:NICE展示精确对数似然、潜变量操作和直接采样可同时获得。NICE用4层可逆耦合完成密度估计。DDIM与少步采样要求把2015年的正规化流样本与对照结算,再核查DDIM与少步采样的任务、观察窗和可逆结构限制网络形状。对正规化流,DDIM与少步采样仅作近邻;支点仍是Dinh、Krueger、Bengio在NICE的原始比较。

正规化流自己留下的反证入口是:可逆结构限制网络形状,精确似然不保证样本语义质量。把不显著结果一并公开时,Dinh、Krueger、Bengio的解释可能缩小、反号,或让位给DDIM与少步采样的路径。DDIM与少步采样给出复核NICE的近邻条件:把人工接管计入结果;正规化流负责记录中止、排除和不显著对象。回到NICE的取样方式,正规化流要用DDIM与少步采样证明原分母没有删去最容易失败的对象。

NICE展示精确对数似然、潜变量操作和直接采样可同时获得改变登记顺序:潜变量、噪声轨迹与生成样本归正规化流,训练集近邻、采样成本与条件偏离交DDIM与少步采样核查。2021年的DDIM与少步采样以“确定性或非马尔可夫逆过程可用更少步骤生成并支持潜空间插值”作近邻;两者若结论不同,应以可逆结构限制网络形状为分账边界;DDIM与少步采样不得与本条合成一个平均分。

2015年,正规化流据NICE展示精确对数似然、潜变量操作和直接采样可同时获得对接第047号第一幕乙。跨过去,可逆结构限制网络形状迫使正规化流重新检验可见读数。正规化流以可逆结构限制网络形状施加反向压力。该接口若仍支持相反方向,可逆结构限制网络形状要求正规化流增加第三条件,同时容纳两边的失效样本。

位置E——它把正规化流的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有正规化流是决定因素 预设〔01 谁进入分母〕被成功采集或完成任务者可以代表全部目标对象 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当可逆结构限制网络形状,主指标越高,边界外保持率反而越低 自曝消融或假对照提醒:可逆结构限制网络形状 空栏正规化流中与“可逆结构限制网络形状”有关却未入分母的失败对象 异名另见第047号第一幕乙“PAC-Bayes复兴:先验、后验与经验误差共同给出泛化界”

庚、神经风格迁移:内容与纹理统计可被优化重组Neural Style Transfer

提出Gatys、Ecker、Bethge,2016 年《CVPR》:2414–2423,DOI 10.1109/CVPR.2016.265。 争议(未见反对;边界:表示分离是工程近似,不等于艺术风格的完整定义;计算和版权来源被省略。) 最新(2024—2026年未见直接更新。)。 关键卷积特征的高层激活和Gram矩阵可分别近似内容与风格。

争论应从2016年的CVPR:Gatys、Ecker、Bethge不再允许生成模型与扩散在神经风格迁移上继续用单一似然或逼真度结算质量。Gatys、Ecker、Bethge逐项核对潜变量、噪声轨迹与生成样本里的神经风格迁移;训练集近邻、采样成本与条件偏离由视频扩散另行登记。在CVPR的证据账上,由单幅内容图与风格图经迭代优化即可生成前所未见的重组图像起步,视频扩散进入解释对照;本条残差不能靠改名消失。

神经风格迁移的可反驳立场是:卷积特征的高层激活和Gram矩阵可分别近似内容与风格。Gatys、Ecker、Bethge这一路线据此把决定性解释锁在一个对象上,视频扩散的“时空分解架构可把图像扩散扩展到连续帧生成”不能替代本条;边界是表示分离是工程近似。若固定资源预算后比较仍不能保持方向,视频扩散便构成神经风格迁移的近邻反例;CVPR对神经风格迁移仅支持原任务。

可核对的主证据是Gatys、Ecker、Bethge,2016 年《CVPR》:2414–2423,DOI 10.1109/CVPR.2016.265:单幅内容图与风格图经迭代优化即可生成前所未见的重组图像。风格迁移每次联合1幅内容图和1幅风格图。视频扩散要求把2016年的神经风格迁移样本与对照结算,再核查视频扩散的任务、观察窗和表示分离是工程近似。对神经风格迁移,视频扩散仅作近邻;支点仍是Gatys、Ecker、Bethge在CVPR的原始比较。

神经风格迁移自己留下的反证入口是:表示分离是工程近似,不等于艺术风格的完整定义;计算和版权来源被省略。按个体轨迹而非均值检查时,Gatys、Ecker、Bethge的解释可能缩小、反号,或让位给视频扩散的路径。视频扩散给出复核CVPR的近邻条件:审计数据近邻与泄漏;神经风格迁移负责记录中止、排除和不显著对象。

单幅内容图与风格图经迭代优化即可生成前所未见的重组图像改变登记顺序:潜变量、噪声轨迹与生成样本归神经风格迁移,训练集近邻、采样成本与条件偏离交视频扩散核查。2022年的视频扩散以“时空分解架构可把图像扩散扩展到连续帧生成”作近邻;两者若结论不同,应以表示分离是工程近似为分账边界;视频扩散不得与本条合成一个平均分。

2016年,神经风格迁移据单幅内容图与风格图经迭代优化即可生成前所未见的重组图像对接第281号第十四条。跨过去,表示分离是工程近似迫使神经风格迁移重新检验可见读数。神经风格迁移以表示分离是工程近似施加反向压力。该接口若仍支持相反方向,表示分离是工程近似要求神经风格迁移增加第三条件,同时容纳两边的失效样本。

位置S——它把神经风格迁移所定义的结构、表示或可判结果当成单独够用的那一样 单因只有神经风格迁移是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当表示分离是工程近似,主指标越高,边界外保持率反而越低 自曝长期随访没有保留:表示分离是工程近似 空栏神经风格迁移中与“表示分离是工程近似”有关却未入分母的失败对象 异名另见第281号第十四条“创造力支持工具的评估”

辛、WaveNet:原始波形也能逐点生成Autoregressive Audio Generation

提出van den Oord 等,2016 年 arXiv:1609.03499《WaveNet》。 争议(未见反对;边界:逐采样点生成昂贵,声音相似会带来身份仿冒与授权问题。) 最新(2024—2026年未见直接更新。)。 关键扩张因果卷积可在原始音频尺度建模长程依赖。

历史坐标落在2016年的WaveNet:van den Oord 等不再允许生成模型与扩散在生成模型与扩散里的WaveNet上继续用单一似然或逼真度结算质量。van den Oord 等逐项核对潜变量、噪声轨迹与生成样本里的生成模型与扩散里的WaveNet;训练集近邻、采样成本与条件偏离由生成世界模型另行登记。在WaveNet的证据账上,由模型生成自然语音并提高文本转语音主观质量起步,生成世界模型进入解释对照;本条残差不能靠改名消失。

生成模型与扩散里的WaveNet的可反驳立场是:扩张因果卷积可在原始音频尺度建模长程依赖。van den Oord 等这一路线据此把决定性解释锁在一个对象上,生成世界模型的“大规模视频生成可能学习一部分物体、视角和事件规律,为规划提供想象空间”不能替代本条;边界是逐采样点生成昂贵。若用正交量纲重测仍不能保持方向,生成世界模型便构成生成模型与扩散里的WaveNet的近邻反例;WaveNet对生成模型与扩散里的WaveNet仅支持原任务。

可核对的主证据是van den Oord 等,2016 年 arXiv:1609.03499《WaveNet》:模型生成自然语音并提高文本转语音主观质量。生成世界模型要求把2016年的生成模型与扩散里的WaveNet样本与对照结算,再核查生成世界模型的任务、观察窗和逐采样点生成昂贵。对生成模型与扩散里的WaveNet,生成世界模型仅作近邻;支点仍是van den Oord 等在WaveNet的原始比较。

生成模型与扩散里的WaveNet自己留下的反证入口是:逐采样点生成昂贵,声音相似会带来身份仿冒与授权问题。加入反事实条件时,van den Oord 等的解释可能缩小、反号,或让位给生成世界模型的路径。生成世界模型给出复核WaveNet的近邻条件:先登记停止线再部署;生成模型与扩散里的WaveNet负责记录中止、排除和不显著对象。

模型生成自然语音并提高文本转语音主观质量改变登记顺序:潜变量、噪声轨迹与生成样本归生成模型与扩散里的WaveNet,训练集近邻、采样成本与条件偏离交生成世界模型核查。2024年的生成世界模型以“大规模视频生成可能学习一部分物体、视角和事件规律,为规划提供想象空间”作近邻;两者若结论不同,应以逐采样点生成昂贵为分账边界;生成世界模型不得与本条合成一个平均分。

2016年,生成模型与扩散里的WaveNet据模型生成自然语音并提高文本转语音主观质量对接第281号第十条。跨过去,逐采样点生成昂贵迫使生成模型与扩散里的WaveNet重新检验可见读数。生成模型与扩散里的WaveNet以逐采样点生成昂贵施加反向压力。该接口若仍支持相反方向,逐采样点生成昂贵要求生成模型与扩散里的WaveNet增加第三条件,同时容纳两边的失效样本。

位置D——它把生成模型与扩散里的WaveNet的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有生成模型与扩散里的WaveNet是决定因素 预设〔03 相关方向等同因果方向〕可预测变化就是生成变化的机制 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当逐采样点生成昂贵,主指标越高,边界外保持率反而越低 自曝不同站点之间显出:逐采样点生成昂贵 空栏生成模型与扩散里的WaveNet中与“逐采样点生成昂贵”有关却未入分母的失败对象 异名另见第281号第十条“现场编码与算法音乐”
【第二幕】这个十年 · 约 2016–2026

第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。

一、Wasserstein距离:训练信号在分布不重叠时仍可连续Wasserstein GAN

提出Arjovsky、Chintala、Bottou,2017 年《ICML》70:214–223。 争议(未见反对;边界:权重裁剪破坏容量,后续梯度惩罚才缓解;模式覆盖仍未自动解决。) 最新(2024—2026年未见直接更新。)。 关键Earth-Mover距离为生成器提供更平滑目标,并让损失与质量更相关。

第一处裂缝来自2017年的ICML:Arjovsky、Chintala、Bottou不再允许生成模型与扩散在Wasserstein距离上继续用单一似然或逼真度结算质量。Arjovsky、Chintala、Bottou逐项核对潜变量、噪声轨迹与生成样本里的Wasserstein距离;训练集近邻、采样成本与条件偏离由科学设计另行登记。在ICML的证据账上,由WGAN在玩具与图像任务中减少训练崩溃起步,科学设计进入解释对照;本条残差不能靠改名消失。

Wasserstein距离的可反驳立场是:Earth-Mover距离为生成器提供更平滑目标,并让损失与质量更相关。Arjovsky、Chintala、Bottou这一路线据此把决定性解释锁在一个对象上,科学设计的“蛋白质生成的价值不在样本像真,而在结构、功能和湿实验成功率”不能替代本条;边界是权重裁剪破坏容量。若撤去界面提示再验仍不能保持方向,科学设计便构成Wasserstein距离的近邻反例;ICML对Wasserstein距离仅支持原任务。

可核对的主证据是Arjovsky、Chintala、Bottou,2017 年《ICML》70:214–223:WGAN在玩具与图像任务中减少训练崩溃,对架构超参更稳。科学设计要求把2017年的Wasserstein距离样本与对照结算,再核查科学设计的任务、观察窗和权重裁剪破坏容量。对Wasserstein距离,科学设计仅作近邻;支点仍是Arjovsky、Chintala、Bottou在ICML的原始比较。回到ICML的取样方式,Wasserstein距离要用科学设计证明原分母没有删去最容易失败的对象。若把WGAN在玩具与图像任务中减少训练崩溃,对架构超参更稳从原比较中抽离,Wasserstein距离便失去最关键的经验支点。

Wasserstein距离自己留下的反证入口是:权重裁剪破坏容量,后续梯度惩罚才缓解;模式覆盖仍未自动解决。用盲法重跑关键判断时,Arjovsky、Chintala、Bottou的解释可能缩小、反号,或让位给科学设计的路径。科学设计给出复核ICML的近邻条件:换样本后再问;Wasserstein距离负责记录中止、排除和不显著对象。拿科学设计作近邻检验,可辨认Arjovsky、Chintala、Bottou观察到的是独有路径,还是另一条路线的表面同义词。

WGAN在玩具与图像任务中减少训练崩溃改变登记顺序:潜变量、噪声轨迹与生成样本归Wasserstein距离,训练集近邻、采样成本与条件偏离交科学设计核查。2023年的科学设计以“蛋白质生成的价值不在样本像真,而在结构、功能和湿实验成功率”作近邻;两者若结论不同,应以权重裁剪破坏容量为分账边界;科学设计不得与本条合成一个平均分。

2017年,Wasserstein距离据WGAN在玩具与图像任务中减少训练崩溃对接第244号第九条。跨过去,权重裁剪破坏容量迫使Wasserstein距离重新检验可见读数。Wasserstein距离以权重裁剪破坏容量施加反向压力。该接口若仍支持相反方向,权重裁剪破坏容量要求Wasserstein距离增加第三条件,同时容纳两边的失效样本。第244号第九条“Wasserstein分布鲁棒性”提供不同尺度的反例;它迫使Wasserstein距离把“适用”写成可检查的对象范围。

位置D——它把Wasserstein距离的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有Wasserstein距离是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当权重裁剪破坏容量,主指标越高,边界外保持率反而越低 自曝失败试次放回分母后看到:权重裁剪破坏容量 空栏Wasserstein距离中与“权重裁剪破坏容量”有关却未入分母的失败对象 异名另见第244号第九条“Wasserstein分布鲁棒性”

二、StyleGAN:生成控制进入多尺度风格空间Style-Based Generators

提出Karras、Laine、Aila,2019 年《CVPR》:4401–4410,DOI 10.1109/CVPR.2019.00453。 争议(未见反对;边界:数据集边界定义了“正常人脸”,高质量也会放大人口偏斜。) 最新(2024—2026年未见直接更新。)。 关键逐层注入风格和噪声可分离姿态、身份与细节尺度。

研究单位改在2019年的CVPR:Karras、Laine、Aila不再允许生成模型与扩散在生成模型与扩散里的StyleGAN上继续用单一似然或逼真度结算质量。Karras、Laine、Aila逐项核对潜变量、噪声轨迹与生成样本里的生成模型与扩散里的StyleGAN;训练集近邻、采样成本与条件偏离由记忆与版权另行登记。在CVPR的证据账上,由在人脸数据上显著提高FID并提供可解释的潜空间操纵起步,记忆与版权进入解释对照;本条残差不能靠改名消失。

生成模型与扩散里的StyleGAN的可反驳立场是:逐层注入风格和噪声可分离姿态、身份与细节尺度。Karras、Laine、Aila这一路线据此把决定性解释锁在一个对象上,记忆与版权的“扩散模型会在重复或特殊训练图像上复现近邻,生成与检索边界可被测量”不能替代本条;边界是数据集边界定义了“正常人脸”。若按亚组分别结算仍不能保持方向,记忆与版权便构成生成模型与扩散里的StyleGAN的近邻反例;CVPR对生成模型与扩散里的StyleGAN仅支持原任务。

可核对的主证据是Karras、Laine、Aila,2019 年《CVPR》:4401–4410,DOI 10.1109/CVPR.2019.00453:在人脸数据上显著提高FID并提供可解释的潜空间操纵。记忆与版权要求把2019年的生成模型与扩散里的StyleGAN样本与对照结算,再核查记忆与版权的任务、观察窗和数据集边界定义了“正常人脸”。对生成模型与扩散里的StyleGAN,记忆与版权仅作近邻;支点仍是Karras、Laine、Aila在CVPR的原始比较。

生成模型与扩散里的StyleGAN自己留下的反证入口是:数据集边界定义了“正常人脸”,高质量也会放大人口偏斜。将短期与长期拆账时,Karras、Laine、Aila的解释可能缩小、反号,或让位给记忆与版权的路径。记忆与版权给出复核CVPR的近邻条件:把时间窗拉长再看;生成模型与扩散里的StyleGAN负责记录中止、排除和不显著对象。

在人脸数据上显著提高FID并提供可解释的潜空间操纵改变登记顺序:潜变量、噪声轨迹与生成样本归生成模型与扩散里的StyleGAN,训练集近邻、采样成本与条件偏离交记忆与版权核查。2023年的记忆与版权以“扩散模型会在重复或特殊训练图像上复现近邻,生成与检索边界可被测量”作近邻;两者若结论不同,应以数据集边界定义了“正常人脸”为分账边界;记忆与版权不得与本条合成一个平均分。

2019年,生成模型与扩散里的StyleGAN据在人脸数据上显著提高FID并提供可解释的潜空间操纵对接第049号第二幕五。跨过去,数据集边界定义了“正常人脸”迫使生成模型与扩散里的StyleGAN重新检验可见读数。生成模型与扩散里的StyleGAN以数据集边界定义了“正常人脸”施加反向压力。该接口若仍支持相反方向,数据集边界定义了“正常人脸”要求生成模型与扩散里的StyleGAN增加第三条件,同时容纳两边的失效样本。

位置E——它把生成模型与扩散里的StyleGAN的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有生成模型与扩散里的StyleGAN是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当数据集边界定义了“正常人脸”,主指标越高,边界外保持率反而越低 自曝切换评价口径便会看到:数据集边界定义了“正常人脸” 空栏生成模型与扩散里的StyleGAN中与“数据集边界定义了“正常人脸””有关却未入分母的失败对象 异名另见第049号第二幕五“回路分析:解释单位从节点移向路径与组合算法”

三、DDPM:简单去噪目标让扩散质量越过GANDenoising Diffusion Models

提出Ho、Jain、Abbeel,2020 年《NeurIPS》33:6840–6851。 争议(未见反对;边界:千步采样昂贵,像素损失与感知、事实和版权仍不同量纲。) 最新(2024—2026年未见直接更新。)。 关键预测每一步加入的噪声可训练稳定逆扩散过程。

回到原始设计2020年的NeurIPS:Ho、Jain、Abbeel不再允许生成模型与扩散在生成模型与扩散里的DDPM上继续用单一似然或逼真度结算质量。Ho、Jain、Abbeel逐项核对潜变量、噪声轨迹与生成样本里的生成模型与扩散里的DDPM;训练集近邻、采样成本与条件偏离由评价清算另行登记。在NeurIPS的证据账上,由在CIFAR-10取得高质量无条件生成起步,评价清算进入解释对照;本条残差不能靠改名消失。

生成模型与扩散里的DDPM的可反驳立场是:预测每一步加入的噪声可训练稳定逆扩散过程。Ho、Jain、Abbeel这一路线据此把决定性解释锁在一个对象上,评价清算的“生成评价必须把样本质量、分布覆盖、条件一致性与记忆分别测量”不能替代本条;边界是千步采样昂贵。若改变任务顺序后追踪仍不能保持方向,评价清算便构成生成模型与扩散里的DDPM的近邻反例;NeurIPS对生成模型与扩散里的DDPM仅支持原任务。

可核对的主证据是Ho、Jain、Abbeel,2020 年《NeurIPS》33:6840–6851:在CIFAR-10取得高质量无条件生成,并建立现代扩散配方。DDPM在CIFAR-10报告3.17的FID。评价清算要求把2020年的生成模型与扩散里的DDPM样本与对照结算,再核查评价清算的任务、观察窗和千步采样昂贵。对生成模型与扩散里的DDPM,评价清算仅作近邻;支点仍是Ho、Jain、Abbeel在NeurIPS的原始比较。回到NeurIPS的取样方式,生成模型与扩散里的DDPM要用评价清算证明原分母没有删去最容易失败的对象。

生成模型与扩散里的DDPM自己留下的反证入口是:千步采样昂贵,像素损失与感知、事实和版权仍不同量纲。把人工接管计入结果时,Ho、Jain、Abbeel的解释可能缩小、反号,或让位给评价清算的路径。评价清算给出复核NeurIPS的近邻条件:保留失败对象后检验;生成模型与扩散里的DDPM负责记录中止、排除和不显著对象。

在CIFAR-10取得高质量无条件生成改变登记顺序:潜变量、噪声轨迹与生成样本归生成模型与扩散里的DDPM,训练集近邻、采样成本与条件偏离交评价清算核查。2023年的评价清算以“生成评价必须把样本质量、分布覆盖、条件一致性与记忆分别测量”作近邻;两者若结论不同,应以千步采样昂贵为分账边界;评价清算不得与本条合成一个平均分。

2020年,生成模型与扩散里的DDPM据在CIFAR-10取得高质量无条件生成对接第043号第二幕二。跨过去,千步采样昂贵迫使生成模型与扩散里的DDPM重新检验可见读数。生成模型与扩散里的DDPM以千步采样昂贵施加反向压力。该接口若仍支持相反方向,千步采样昂贵要求生成模型与扩散里的DDPM增加第三条件,同时容纳两边的失效样本。

位置S——它把生成模型与扩散里的DDPM所定义的结构、表示或可判结果当成单独够用的那一样 单因只有生成模型与扩散里的DDPM是决定因素 预设〔17 局部最优可加总为整体最优〕单项性能会自然形成系统收益 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当千步采样昂贵,主指标越高,边界外保持率反而越低 自曝训练分布之外出现:千步采样昂贵 空栏生成模型与扩散里的DDPM中与“千步采样昂贵”有关却未入分母的失败对象 异名另见第043号第二幕二“掩码自编码:预测缺失部分取代逐对样本比较”

四、得分SDE:扩散与得分匹配被统一成连续时间Score-Based SDEs

提出Song、Sohl-Dickstein、Kingma 等,2021 年《ICLR》论文“Score-Based Generative Modeling through Stochastic Differential Equations”。 争议(未见反对;边界:数值求解误差与网络得分误差相互放大,连续数学不等于零成本。) 最新Yang 等,2024 年《ACM Computing Surveys》56(4):1–39“Diffusion Models: A Comprehensive Survey”。 关键随机微分方程把多类扩散过程、采样器和似然估计放进统一框架。

这一路线先拆掉2021年的ICLR:Song、Sohl-Dickstein、Kingma 等不再允许生成模型与扩散在得分SDE上继续用单一似然或逼真度结算质量。Song、Sohl-Dickstein、Kingma 等逐项核对潜变量、噪声轨迹与生成样本里的得分SDE;训练集近邻、采样成本与条件偏离由变分自编码器另行登记。在ICLR的证据账上,由逆时间SDE与概率流ODE在图像生成上达到当时领先结果起步,变分自编码器进入解释对照;本条残差不能靠改名消失。

得分SDE的可反驳立场是:随机微分方程把多类扩散过程、采样器和似然估计放进统一框架。Song、Sohl-Dickstein、Kingma 等这一路线据此把决定性解释锁在一个对象上,变分自编码器的“重参数化技巧让潜变量生成模型可用反向传播联合学习推断与生成”不能替代本条;边界是数值求解误差与网络得分误差相互放大。若让独立团队预注册仍不能保持方向,变分自编码器便构成得分SDE的近邻反例;ICLR对得分SDE仅支持原任务。

可核对的主证据是Song、Sohl-Dickstein、Kingma 等,2021 年《ICLR》论文“Score-Based Generative Modeling through Stochastic Differential Equations”:逆时间SDE与概率流ODE在图像生成上达到当时领先结果。变分自编码器要求把2021年的得分SDE样本与对照结算,再核查变分自编码器的任务、观察窗和数值求解误差与网络得分误差相互放大。对得分SDE,变分自编码器仅作近邻;支点仍是Song、Sohl-Dickstein、Kingma 等在ICLR的原始比较。

得分SDE自己留下的反证入口是:数值求解误差与网络得分误差相互放大,连续数学不等于零成本。审计数据近邻与泄漏时,Song、Sohl-Dickstein、Kingma 等的解释可能缩小、反号,或让位给变分自编码器的路径。变分自编码器给出复核ICLR的近邻条件:改用地点外资料复核;得分SDE负责记录中止、排除和不显著对象。

逆时间SDE与概率流ODE在图像生成上达到当时领先结果改变登记顺序:潜变量、噪声轨迹与生成样本归得分SDE,训练集近邻、采样成本与条件偏离交变分自编码器核查。2014年的变分自编码器以“重参数化技巧让潜变量生成模型可用反向传播联合学习推断与生成”作近邻;两者若结论不同,应以数值求解误差与网络得分误差相互放大为分账边界;变分自编码器不得与本条合成一个平均分。

2021年,得分SDE据逆时间SDE与概率流ODE在图像生成上达到当时领先结果对接第047号第二幕五。跨过去,数值求解误差与网络得分误差相互放大迫使得分SDE重新检验可见读数。得分SDE以数值求解误差与网络得分误差相互放大施加反向压力。该接口若仍支持相反方向,数值求解误差与网络得分误差相互放大要求得分SDE增加第三条件,同时容纳两边的失效样本。

位置D——它把得分SDE的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有得分SDE是决定因素 预设〔18 干预不回写到被干预者〕对象不会适应、规避或利用干预 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当数值求解误差与网络得分误差相互放大,主指标越高,边界外保持率反而越低 自曝参数识别检验告诉我们:数值求解误差与网络得分误差相互放大 空栏得分SDE中与“数值求解误差与网络得分误差相互放大”有关却未入分母的失败对象 异名另见第047号第二幕五“均场极限:宽网络也可看作参数分布的动力系统”

五、无分类器引导:条件强度成为采样旋钮Classifier-Free Guidance

提出Ho 与 Salimans,2022 年 arXiv:2207.12598《Classifier-Free Diffusion Guidance》。 争议(未见反对;边界:权重过高会降低覆盖、饱和色彩并把文本偏见放大。) 最新(2024—2026年未见直接更新。)。 关键同时训练有条件和无条件模型,可在采样时调节文字一致性与多样性。

需要先恢复2022年的Classifier-Free Diffusion Guidance:Ho 与 Salimans不再允许生成模型与扩散在无分类器引导上继续用单一似然或逼真度结算质量。Ho 与 Salimans逐项核对潜变量、噪声轨迹与生成样本里的无分类器引导;训练集近邻、采样成本与条件偏离由生成对抗网络另行登记。在Classifier-Free Diffusion Guidance的证据账上,由引导权重提高条件保真且无需外部分类器起步,生成对抗网络进入解释对照;本条残差不能靠改名消失。

无分类器引导的可反驳立场是:同时训练有条件和无条件模型,可在采样时调节文字一致性与多样性。Ho 与 Salimans这一路线据此把决定性解释锁在一个对象上,生成对抗网络的“生成器与判别器的极小极大博弈可直接学习数据分布并生成锐利样本”不能替代本条;边界是权重过高会降低覆盖、饱和色彩并把文本偏见放大。若把不显著结果一并公开仍不能保持方向,生成对抗网络便构成无分类器引导的近邻反例;Classifier-Free Diffusion Guidance对无分类器引导仅支持原任务。

可核对的主证据是Ho 与 Salimans,2022 年 arXiv:2207.12598《Classifier-Free Diffusion Guidance》:引导权重提高条件保真且无需外部分类器,成为文本图像系统标准部件。生成对抗网络要求把2022年的无分类器引导样本与对照结算,再核查生成对抗网络的任务、观察窗和权重过高会降低覆盖、饱和色彩并把文本偏见放大。对无分类器引导,生成对抗网络仅作近邻;支点仍是Ho 与 Salimans在Classifier-Free Diffusion Guidance的原始比较。

无分类器引导自己留下的反证入口是:权重过高会降低覆盖、饱和色彩并把文本偏见放大。先登记停止线再部署时,Ho 与 Salimans的解释可能缩小、反号,或让位给生成对抗网络的路径。生成对抗网络给出复核Classifier-Free Diffusion Guidance的近邻条件:让替代路径进入对照;无分类器引导负责记录中止、排除和不显著对象。

引导权重提高条件保真且无需外部分类器改变登记顺序:潜变量、噪声轨迹与生成样本归无分类器引导,训练集近邻、采样成本与条件偏离交生成对抗网络核查。2014年的生成对抗网络以“生成器与判别器的极小极大博弈可直接学习数据分布并生成锐利样本”作近邻;两者若结论不同,应以权重过高会降低覆盖、饱和色彩并把文本偏见放大为分账边界;生成对抗网络不得与本条合成一个平均分。

2022年,无分类器引导据引导权重提高条件保真且无需外部分类器对接第044号第二幕六。跨过去,权重过高会降低覆盖、饱和色彩并把文本偏见放大迫使无分类器引导重新检验可见读数。无分类器引导以权重过高会降低覆盖、饱和色彩并把文本偏见放大施加反向压力。该接口若仍支持相反方向,权重过高会降低覆盖、饱和色彩并把文本偏见放大要求无分类器引导增加第三条件,同时容纳两边的失效样本。

位置E——它把无分类器引导的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有无分类器引导是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当权重过高会降低覆盖、饱和色彩并把文本偏见放大,主指标越高,边界外保持率反而越低 自曝任务重测把弱点定位为:权重过高会降低覆盖、饱和色彩并把文本偏见放大 空栏无分类器引导中与“权重过高会降低覆盖、饱和色彩并把文本偏见放大”有关却未入分母的失败对象 异名另见第044号第二幕六“指令调优:任务集合把语言模型改造成可调用接口”

六、潜空间扩散:先压缩图像,再在潜变量中去噪Latent Diffusion Models

提出Rombach、Blattmann、Lorenz、Esser、Ommer,2022 年《CVPR》:10684–10695,DOI 10.1109/CVPR52688.2022.01042。 争议(未见反对;边界:压缩器会删除文字和细节,训练数据许可与复现图像问题并未被压缩掉。) 最新Esser 等,2024 年 arXiv:2403.03206《Scaling Rectified Flow Transformers for High-Resolution Image Synthesis》。 关键感知自编码器把高维像素压到潜空间,显著降低扩散训练与采样成本。

证据链从2022年的CVPR:Rombach、Blattmann、Lorenz、Esser、Ommer不再允许生成模型与扩散在潜空间扩散上继续用单一似然或逼真度结算质量。Rombach、Blattmann、Lorenz、Esser、Ommer逐项核对潜变量、噪声轨迹与生成样本里的潜空间扩散;训练集近邻、采样成本与条件偏离由深卷积GAN另行登记。在CVPR的证据账上,由在图像合成、修复和超分辨率任务以较少计算达到强质量起步,深卷积GAN进入解释对照;本条残差不能靠改名消失。

潜空间扩散的可反驳立场是:感知自编码器把高维像素压到潜空间,显著降低扩散训练与采样成本。Rombach、Blattmann、Lorenz、Esser、Ommer这一路线据此把决定性解释锁在一个对象上,深卷积GAN的“全卷积、批归一化和受限架构形成可迁移生成配方”不能替代本条;边界是压缩器会删除文字和细节。若按个体轨迹而非均值检查仍不能保持方向,深卷积GAN便构成潜空间扩散的近邻反例;CVPR对潜空间扩散仅支持原任务。

可核对的主证据是Rombach、Blattmann、Lorenz、Esser、Ommer,2022 年《CVPR》:10684–10695,DOI 10.1109/CVPR52688.2022.01042:在图像合成、修复和超分辨率任务以较少计算达到强质量。深卷积GAN要求把2022年的潜空间扩散样本与对照结算,再核查深卷积GAN的任务、观察窗和压缩器会删除文字和细节。对潜空间扩散,深卷积GAN仅作近邻;支点仍是Rombach、Blattmann、Lorenz、Esser、Ommer在CVPR的原始比较。回到CVPR的取样方式,潜空间扩散要用深卷积GAN证明原分母没有删去最容易失败的对象。

潜空间扩散自己留下的反证入口是:压缩器会删除文字和细节,训练数据许可与复现图像问题并未被压缩掉。换样本后再问时,Rombach、Blattmann、Lorenz、Esser、Ommer的解释可能缩小、反号,或让位给深卷积GAN的路径。深卷积GAN给出复核CVPR的近邻条件:把排除者放回分母;潜空间扩散负责记录中止、排除和不显著对象。

在图像合成、修复和超分辨率任务以较少计算达到强质量改变登记顺序:潜变量、噪声轨迹与生成样本归潜空间扩散,训练集近邻、采样成本与条件偏离交深卷积GAN核查。2016年的深卷积GAN以“全卷积、批归一化和受限架构形成可迁移生成配方”作近邻;两者若结论不同,应以压缩器会删除文字和细节为分账边界;深卷积GAN不得与本条合成一个平均分。

2022年,潜空间扩散据在图像合成、修复和超分辨率任务以较少计算达到强质量对接第044号第二幕九。跨过去,压缩器会删除文字和细节迫使潜空间扩散重新检验可见读数。潜空间扩散以压缩器会删除文字和细节施加反向压力。该接口若仍支持相反方向,压缩器会删除文字和细节要求潜空间扩散增加第三条件,同时容纳两边的失效样本。

位置S——它把潜空间扩散所定义的结构、表示或可判结果当成单独够用的那一样 单因只有潜空间扩散是决定因素 预设〔01 谁进入分母〕被成功采集或完成任务者可以代表全部目标对象 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当压缩器会删除文字和细节,主指标越高,边界外保持率反而越低 自曝横跨人群后原结论暴露:压缩器会删除文字和细节 空栏潜空间扩散中与“压缩器会删除文字和细节”有关却未入分母的失败对象 异名另见第044号第二幕九“视觉语言对齐:图文对成为开放词汇分类器”

七、DDIM与少步采样:同一训练目标允许非马尔可夫捷径Fast Diffusion Sampling

提出Song、Meng、Ermon,2021 年《ICLR》论文“Denoising Diffusion Implicit Models”。 争议(未见反对;边界:减少步骤会牺牲覆盖与细节,速度比较必须配平分辨率和硬件。) 最新(2024—2026年未见直接更新。)。 关键确定性或非马尔可夫逆过程可用更少步骤生成并支持潜空间插值。

决定性变化始于2021年的ICLR:Song、Meng、Ermon不再允许生成模型与扩散在DDIM与少步采样上继续用单一似然或逼真度结算质量。Song、Meng、Ermon逐项核对潜变量、噪声轨迹与生成样本里的DDIM与少步采样;训练集近邻、采样成本与条件偏离由自回归像素另行登记。在ICLR的证据账上,由DDIM将采样步数从上千降至几十起步,自回归像素进入解释对照;本条残差不能靠改名消失。

DDIM与少步采样的可反驳立场是:确定性或非马尔可夫逆过程可用更少步骤生成并支持潜空间插值。Song、Meng、Ermon这一路线据此把决定性解释锁在一个对象上,自回归像素的“把联合图像概率按像素顺序分解,可得到精确似然与稳定训练”不能替代本条;边界是减少步骤会牺牲覆盖与细节。若加入反事实条件仍不能保持方向,自回归像素便构成DDIM与少步采样的近邻反例;ICLR对DDIM与少步采样仅支持原任务。

可核对的主证据是Song、Meng、Ermon,2021 年《ICLR》论文“Denoising Diffusion Implicit Models”:DDIM将采样步数从上千降至几十,同时保持相近质量。DDIM把约1000步采样缩到几十步。自回归像素要求把2021年的DDIM与少步采样样本与对照结算,再核查自回归像素的任务、观察窗和减少步骤会牺牲覆盖与细节。对DDIM与少步采样,自回归像素仅作近邻;支点仍是Song、Meng、Ermon在ICLR的原始比较。

DDIM与少步采样自己留下的反证入口是:减少步骤会牺牲覆盖与细节,速度比较必须配平分辨率和硬件。把时间窗拉长再看时,Song、Meng、Ermon的解释可能缩小、反号,或让位给自回归像素的路径。自回归像素给出复核ICLR的近邻条件:固定资源预算后比较;DDIM与少步采样负责记录中止、排除和不显著对象。回到ICLR的取样方式,DDIM与少步采样要用自回归像素证明原分母没有删去最容易失败的对象。

DDIM将采样步数从上千降至几十改变登记顺序:潜变量、噪声轨迹与生成样本归DDIM与少步采样,训练集近邻、采样成本与条件偏离交自回归像素核查。2016年的自回归像素以“把联合图像概率按像素顺序分解,可得到精确似然与稳定训练”作近邻;两者若结论不同,应以减少步骤会牺牲覆盖与细节为分账边界;自回归像素不得与本条合成一个平均分。

2021年,DDIM与少步采样据DDIM将采样步数从上千降至几十对接第043号第二幕十。跨过去,减少步骤会牺牲覆盖与细节迫使DDIM与少步采样重新检验可见读数。DDIM与少步采样以减少步骤会牺牲覆盖与细节施加反向压力。该接口若仍支持相反方向,减少步骤会牺牲覆盖与细节要求DDIM与少步采样增加第三条件,同时容纳两边的失效样本。

位置E——它把DDIM与少步采样的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有DDIM与少步采样是决定因素 预设〔09 代理目标等同真实目标〕优化指标不会制造新的捷径 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当减少步骤会牺牲覆盖与细节,结论只留在原任务内 自曝误差分解把漏项指向:减少步骤会牺牲覆盖与细节 空栏DDIM与少步采样中与“减少步骤会牺牲覆盖与细节”有关却未入分母的失败对象 异名另见第043号第二幕十“蒸馏:小模型同时学习软分布与中间表示”

八、视频扩散:时间一致性成为独立约束Video Diffusion Models

提出Ho 等,2022 年 arXiv:2204.03458《Video Diffusion Models》。 争议(未见反对;边界:短时连贯不等于物理一致,镜头剪辑与训练视频记忆会掩盖错误。) 最新(2024—2026年未见直接更新。)。 关键时空分解架构可把图像扩散扩展到连续帧生成。

最早被迫重写的是2022年的Video Diffusion Models:Ho 等不再允许生成模型与扩散在视频扩散上继续用单一似然或逼真度结算质量。Ho 等逐项核对潜变量、噪声轨迹与生成样本里的视频扩散;训练集近邻、采样成本与条件偏离由早期扩散另行登记。在Video Diffusion Models的证据账上,由模型在UCF-101和BAIR等数据上生成可连贯短视频并支持条件预测起步,早期扩散进入解释对照;本条残差不能靠改名消失。

视频扩散的可反驳立场是:时空分解架构可把图像扩散扩展到连续帧生成。Ho 等这一路线据此把决定性解释锁在一个对象上,早期扩散的“复杂分布可由许多小型随机逆过程从噪声逐步还原”不能替代本条;边界是短时连贯不等于物理一致。若用盲法重跑关键判断仍不能保持方向,早期扩散便构成视频扩散的近邻反例;Video Diffusion Models对视频扩散仅支持原任务。

可核对的主证据是Ho 等,2022 年 arXiv:2204.03458《Video Diffusion Models》:模型在UCF-101和BAIR等数据上生成可连贯短视频并支持条件预测。视频扩散同时在UCF-101与BAIR这2类数据上检验。早期扩散要求把2022年的视频扩散样本与对照结算,再核查早期扩散的任务、观察窗和短时连贯不等于物理一致。对视频扩散,早期扩散仅作近邻;支点仍是Ho 等在Video Diffusion Models的原始比较。

视频扩散自己留下的反证入口是:短时连贯不等于物理一致,镜头剪辑与训练视频记忆会掩盖错误。保留失败对象后检验时,Ho 等的解释可能缩小、反号,或让位给早期扩散的路径。早期扩散给出复核Video Diffusion Models的近邻条件:用正交量纲重测;视频扩散负责记录中止、排除和不显著对象。回到Video Diffusion Models的取样方式,视频扩散要用早期扩散证明原分母没有删去最容易失败的对象。

模型在UCF-101和BAIR等数据上生成可连贯短视频并支持条件预测改变登记顺序:潜变量、噪声轨迹与生成样本归视频扩散,训练集近邻、采样成本与条件偏离交早期扩散核查。2015年的早期扩散以“复杂分布可由许多小型随机逆过程从噪声逐步还原”作近邻;两者若结论不同,应以短时连贯不等于物理一致为分账边界;早期扩散不得与本条合成一个平均分。

2022年,视频扩散据模型在UCF-101和BAIR等数据上生成可连贯短视频并支持条件预测对接第254号第十九条。跨过去,短时连贯不等于物理一致迫使视频扩散重新检验可见读数。视频扩散以短时连贯不等于物理一致施加反向压力。该接口若仍支持相反方向,短时连贯不等于物理一致要求视频扩散增加第三条件,同时容纳两边的失效样本。

位置S——它把视频扩散所定义的结构、表示或可判结果当成单独够用的那一样 单因只有视频扩散是决定因素 预设〔13 时间尺度可自由压缩〕短期改善能换算为长期结果 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当短时连贯不等于物理一致,结论只留在原任务内 自曝开放材料使外部团队发现:短时连贯不等于物理一致 空栏视频扩散中与“短时连贯不等于物理一致”有关却未入分母的失败对象 异名另见第254号第十九条“生成式内容对管线的冲击”

九、生成世界模型:视频预测被当作环境模拟器Generative World Models

提出Brooks 等,2024 年 arXiv:2402.17177《Video Generation Models as World Simulators》。 争议(未见反对;边界:演示选择、不可公开数据和缺少交互验证,使“世界模型”仍是推断而非证明。) 最新(2024—2026年未见直接更新。)。 关键大规模视频生成可能学习一部分物体、视角和事件规律,为规划提供想象空间。

这一条先处理2024年的Video Generation Models as World Simulators:Brooks 等不再允许生成模型与扩散在生成世界模型上继续用单一似然或逼真度结算质量。Brooks 等逐项核对潜变量、噪声轨迹与生成样本里的生成世界模型;训练集近邻、采样成本与条件偏离由正规化流另行登记。在Video Generation Models as World Simulators的证据账上,由技术报告展示长镜头、视角移动与文本条件下的复杂场景生成起步,正规化流进入解释对照;本条残差不能靠改名消失。

生成世界模型的可反驳立场是:大规模视频生成可能学习一部分物体、视角和事件规律,为规划提供想象空间。Brooks 等这一路线据此把决定性解释锁在一个对象上,正规化流的“可逆映射和雅可比行列式把简单密度变成复杂数据分布”不能替代本条;边界是演示选择、不可公开数据和缺少交互验证。若将短期与长期拆账仍不能保持方向,正规化流便构成生成世界模型的近邻反例;Video Generation Models as World Simulators对生成世界模型仅支持原任务。

可核对的主证据是Brooks 等,2024 年 arXiv:2402.17177《Video Generation Models as World Simulators》:技术报告展示长镜头、视角移动与文本条件下的复杂场景生成。正规化流要求把2024年的生成世界模型样本与对照结算,再核查正规化流的任务、观察窗和演示选择、不可公开数据和缺少交互验证。对生成世界模型,正规化流仅作近邻;支点仍是Brooks 等在Video Generation Models as World Simulators的原始比较。

生成世界模型自己留下的反证入口是:演示选择、不可公开数据和缺少交互验证,使“世界模型”仍是推断而非证明。改用地点外资料复核时,Brooks 等的解释可能缩小、反号,或让位给正规化流的路径。正规化流给出复核Video Generation Models as World Simulators的近邻条件:撤去界面提示再验;生成世界模型负责记录中止、排除和不显著对象。

技术报告展示长镜头、视角移动与文本条件下的复杂场景生成改变登记顺序:潜变量、噪声轨迹与生成样本归生成世界模型,训练集近邻、采样成本与条件偏离交正规化流核查。2015年的正规化流以“可逆映射和雅可比行列式把简单密度变成复杂数据分布”作近邻;两者若结论不同,应以演示选择、不可公开数据和缺少交互验证为分账边界;正规化流不得与本条合成一个平均分。

2024年,生成世界模型据技术报告展示长镜头、视角移动与文本条件下的复杂场景生成对接第051号第二幕七。跨过去,演示选择、不可公开数据和缺少交互验证迫使生成世界模型重新检验可见读数。生成世界模型以演示选择、不可公开数据和缺少交互验证施加反向压力。该接口若仍支持相反方向,演示选择、不可公开数据和缺少交互验证要求生成世界模型增加第三条件,同时容纳两边的失效样本。

位置D——它把生成世界模型的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有生成世界模型是决定因素 预设〔17 局部最优可加总为整体最优〕单项性能会自然形成系统收益 量纲通过条件一致与覆盖双检的样本数/全部生成样本数 失效当演示选择、不可公开数据和缺少交互验证,结论只留在原任务内 自曝一次真正的边界检验显示:演示选择、不可公开数据和缺少交互验证 空栏生成世界模型中与“演示选择、不可公开数据和缺少交互验证”有关却未入分母的失败对象 异名另见第051号第二幕七“扩散策略承认合理动作不止一条”

十、科学设计:生成候选必须由实验回路结算Generative Models for Science

提出Watson 等,2023 年《Nature》620:1089–1100,DOI 10.1038/s41586-023-06415-8。 争议(未见反对;边界:筛选后的成功样本不能代表全部生成分母,合成和实验成本需纳入效率。) 最新(2024—2026年未见直接更新。)。 关键蛋白质生成的价值不在样本像真,而在结构、功能和湿实验成功率。

原论文正面碰到2023年的Nature:Watson 等不再允许生成模型与扩散在科学设计上继续用单一似然或逼真度结算质量。Watson 等逐项核对潜变量、噪声轨迹与生成样本里的科学设计;训练集近邻、采样成本与条件偏离由神经风格迁移另行登记。在Nature的证据账上,由RFdiffusion按几何与功能条件设计蛋白骨架起步,神经风格迁移进入解释对照;本条残差不能靠改名消失。

科学设计的可反驳立场是:蛋白质生成的价值不在样本像真,而在结构、功能和湿实验成功率。Watson 等这一路线据此把决定性解释锁在一个对象上,神经风格迁移的“卷积特征的高层激活和Gram矩阵可分别近似内容与风格”不能替代本条;边界是筛选后的成功样本不能代表全部生成分母。若把人工接管计入结果仍不能保持方向,神经风格迁移便构成科学设计的近邻反例;Nature对科学设计仅支持原任务。

可核对的主证据是Watson 等,2023 年《Nature》620:1089–1100,DOI 10.1038/s41586-023-06415-8:RFdiffusion按几何与功能条件设计蛋白骨架,多类候选经实验验证。神经风格迁移要求把2023年的科学设计样本与对照结算,再核查神经风格迁移的任务、观察窗和筛选后的成功样本不能代表全部生成分母。对科学设计,神经风格迁移仅作近邻;支点仍是Watson 等在Nature的原始比较。

科学设计自己留下的反证入口是:筛选后的成功样本不能代表全部生成分母,合成和实验成本需纳入效率。让替代路径进入对照时,Watson 等的解释可能缩小、反号,或让位给神经风格迁移的路径。神经风格迁移给出复核Nature的近邻条件:按亚组分别结算;科学设计负责记录中止、排除和不显著对象。

RFdiffusion按几何与功能条件设计蛋白骨架改变登记顺序:潜变量、噪声轨迹与生成样本归科学设计,训练集近邻、采样成本与条件偏离交神经风格迁移核查。2016年的神经风格迁移以“卷积特征的高层激活和Gram矩阵可分别近似内容与风格”作近邻;两者若结论不同,应以筛选后的成功样本不能代表全部生成分母为分账边界;神经风格迁移不得与本条合成一个平均分。

2023年,科学设计据RFdiffusion按几何与功能条件设计蛋白骨架对接第027号第二幕十。跨过去,筛选后的成功样本不能代表全部生成分母迫使科学设计重新检验可见读数。科学设计以筛选后的成功样本不能代表全部生成分母施加反向压力。该接口若仍支持相反方向,筛选后的成功样本不能代表全部生成分母要求科学设计增加第三条件,同时容纳两边的失效样本。

位置E——它把科学设计的数据边界、任务环境或约束条件当成单独够用的那一样 单因只有科学设计是决定因素 预设〔18 干预不回写到被干预者〕对象不会适应、规避或利用干预 量纲经实验达到设计功能的候选数/全部送检生成候选数 失效当筛选后的成功样本不能代表全部生成分母,结论只留在原任务内 自曝部署或临床记录反证:筛选后的成功样本不能代表全部生成分母 空栏科学设计中与“筛选后的成功样本不能代表全部生成分母”有关却未入分母的失败对象 异名另见第027号第二幕十“RFdiffusion把新蛋白骨架变成去噪生成”

十一、记忆与版权:相似样本要相对训练集而非人眼印象检查Training-Data Memorization

提出Somepalli 等,2023 年《NeurIPS》36:6043–6056。 争议(未见反对;边界:相似阈值与特征空间影响计数,没找到复制也不能证明数据授权。) 最新(2024—2026年未见直接更新。)。 关键扩散模型会在重复或特殊训练图像上复现近邻,生成与检索边界可被测量。

方法转向发生在2023年的NeurIPS:Somepalli 等不再允许生成模型与扩散在记忆与版权上继续用单一似然或逼真度结算质量。Somepalli 等逐项核对潜变量、噪声轨迹与生成样本里的记忆与版权;训练集近邻、采样成本与条件偏离由生成模型与扩散里的WaveNet另行登记。在NeurIPS的证据账上,由对文本图像模型进行最近邻检索起步,生成模型与扩散里的WaveNet进入解释对照;本条残差不能靠改名消失。

记忆与版权的可反驳立场是:扩散模型会在重复或特殊训练图像上复现近邻,生成与检索边界可被测量。Somepalli 等这一路线据此把决定性解释锁在一个对象上,生成模型与扩散里的WaveNet的“扩张因果卷积可在原始音频尺度建模长程依赖”不能替代本条;边界是相似阈值与特征空间影响计数。若审计数据近邻与泄漏仍不能保持方向,生成模型与扩散里的WaveNet便构成记忆与版权的近邻反例;NeurIPS对记忆与版权仅支持原任务。

可核对的主证据是Somepalli 等,2023 年《NeurIPS》36:6043–6056:对文本图像模型进行最近邻检索,发现部分输出高度匹配训练样本。生成模型与扩散里的WaveNet要求把2023年的记忆与版权样本与对照结算,再核查生成模型与扩散里的WaveNet的任务、观察窗和相似阈值与特征空间影响计数。对记忆与版权,生成模型与扩散里的WaveNet仅作近邻;支点仍是Somepalli 等在NeurIPS的原始比较。

记忆与版权自己留下的反证入口是:相似阈值与特征空间影响计数,没找到复制也不能证明数据授权。把排除者放回分母时,Somepalli 等的解释可能缩小、反号,或让位给生成模型与扩散里的WaveNet的路径。生成模型与扩散里的WaveNet给出复核NeurIPS的近邻条件:改变任务顺序后追踪;记忆与版权负责记录中止、排除和不显著对象。

对文本图像模型进行最近邻检索改变登记顺序:潜变量、噪声轨迹与生成样本归记忆与版权,训练集近邻、采样成本与条件偏离交生成模型与扩散里的WaveNet核查。2016年的生成模型与扩散里的WaveNet以“扩张因果卷积可在原始音频尺度建模长程依赖”作近邻;两者若结论不同,应以相似阈值与特征空间影响计数为分账边界;生成模型与扩散里的WaveNet不得与本条合成一个平均分。

2023年,记忆与版权据对文本图像模型进行最近邻检索对接第273号第十七条。跨过去,相似阈值与特征空间影响计数迫使记忆与版权重新检验可见读数。记忆与版权以相似阈值与特征空间影响计数施加反向压力。该接口若仍支持相反方向,相似阈值与特征空间影响计数要求记忆与版权增加第三条件,同时容纳两边的失效样本。

位置S——它把记忆与版权所定义的结构、表示或可判结果当成单独够用的那一样 单因只有记忆与版权是决定因素 预设〔23 中位个案代表分布〕典型样本足以代表长尾与亚群 量纲通过训练集近邻审计的样本数/全部生成样本数 失效当相似阈值与特征空间影响计数,结论只留在原任务内 自曝不显著结果没有消失而是说明:相似阈值与特征空间影响计数 空栏记忆与版权中与“相似阈值与特征空间影响计数”有关却未入分母的失败对象 异名另见第273号第十七条“生成式合成媒体:真实性治理必须覆盖来源、标记与传播链”

十二、评价清算:FID不能代表文字忠实、覆盖与人类价值Generative Evaluation Audit

提出Stein 等,2023 年《NeurIPS》36:2319–2333《Exposing Flaws of Generative Model Evaluation Metrics》。 争议(未见反对;边界:单一综合分越方便,越会把少数群体失败和复制训练样本藏在平均值里。) 最新(2024—2026年未见直接更新。)。 关键生成评价必须把样本质量、分布覆盖、条件一致性与记忆分别测量。

这项工作首先校正2023年的NeurIPS:Stein 等不再允许生成模型与扩散在评价清算上继续用单一似然或逼真度结算质量。Stein 等逐项核对潜变量、噪声轨迹与生成样本里的评价清算;训练集近邻、采样成本与条件偏离由Wasserstein距离另行登记。在NeurIPS的证据账上,由研究显示常用特征编码器与数据集选择可逆转模型排名起步,Wasserstein距离进入解释对照;本条残差不能靠改名消失。

评价清算的可反驳立场是:生成评价必须把样本质量、分布覆盖、条件一致性与记忆分别测量。Stein 等这一路线据此把决定性解释锁在一个对象上,Wasserstein距离的“Earth-Mover距离为生成器提供更平滑目标,并让损失与质量更相关”不能替代本条;边界是单一综合分越方便。若先登记停止线再部署仍不能保持方向,Wasserstein距离便构成评价清算的近邻反例;NeurIPS对评价清算仅支持原任务。

可核对的主证据是Stein 等,2023 年《NeurIPS》36:2319–2333《Exposing Flaws of Generative Model Evaluation Metrics》:研究显示常用特征编码器与数据集选择可逆转模型排名。Wasserstein距离要求把2023年的评价清算样本与对照结算,再核查Wasserstein距离的任务、观察窗和单一综合分越方便。对评价清算,Wasserstein距离仅作近邻;支点仍是Stein 等在NeurIPS的原始比较。回到NeurIPS的取样方式,评价清算要用Wasserstein距离证明原分母没有删去最容易失败的对象。

评价清算自己留下的反证入口是:单一综合分越方便,越会把少数群体失败和复制训练样本藏在平均值里。固定资源预算后比较时,Stein 等的解释可能缩小、反号,或让位给Wasserstein距离的路径。Wasserstein距离给出复核NeurIPS的近邻条件:让独立团队预注册;评价清算负责记录中止、排除和不显著对象。拿Wasserstein距离作近邻检验,可辨认Stein 等观察到的是独有路径,还是另一条路线的表面同义词。

研究显示常用特征编码器与数据集选择可逆转模型排名改变登记顺序:潜变量、噪声轨迹与生成样本归评价清算,训练集近邻、采样成本与条件偏离交Wasserstein距离核查。2017年的Wasserstein距离以“Earth-Mover距离为生成器提供更平滑目标,并让损失与质量更相关”作近邻;两者若结论不同,应以单一综合分越方便为分账边界;Wasserstein距离不得与本条合成一个平均分。

2023年,评价清算据研究显示常用特征编码器与数据集选择可逆转模型排名对接第254号第二十条。跨过去,单一综合分越方便迫使评价清算重新检验可见读数。评价清算以单一综合分越方便施加反向压力。该接口若仍支持相反方向,单一综合分越方便要求评价清算增加第三条件,同时容纳两边的失效样本。

位置D——它把评价清算的学习、推断、优化或反馈路径当成单独够用的那一样 单因只有评价清算是决定因素 预设〔01 谁进入分母〕被成功采集或完成任务者可以代表全部目标对象 量纲通过训练集近邻审计的样本数/全部生成样本数 失效当单一综合分越方便,结论只留在原任务内 自曝近期复核仍保留的自我否定是:单一综合分越方便 空栏评价清算中与“单一综合分越方便”有关却未入分母的失败对象 异名另见第254号第二十条“真实感与真实性的分离”

◎ 二十年连起来看

第一幕不是旧成果清单,而是生成模型与扩散第一次为自己建立可失败的比较尺。变分自编码器收紧了旧默认,自回归像素把隐含过程拆成可估参数,生成模型与扩散里的WaveNet又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。

第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。Wasserstein距离扩展了表示或分布,DDIM与少步采样改变了研究单位,评价清算则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。

二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。深卷积GAN说明干预能改变路径,得分SDE说明单一读数会混合层级,科学设计又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。

◎ 三个常见误解

误解一:生成对抗网络已经给出了稳定的通用解释。它容易取信,是因为生成器与判别器的极小极大博弈可直接学习数据分布并生成锐利样本确实改变了旧的研究方式。但训练不稳定、模式坍塌与无似然评价使胜负难以结算,所以正确表述只能限于原设计可识别的那一段责任链。

误解二:生成模型与扩散里的DDPM等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但预测每一步加入的噪声可训练稳定逆扩散过程仍只是一个可检验命题。千步采样昂贵,像素损失与感知、事实和版权仍不同量纲说明,没有干预、替代解释和边界样本,可读不等于因果正确。

误解三:记忆与版权的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把相似阈值与特征空间影响计数,没找到复制也不能证明数据授权藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。

◎ 与相邻领域的接口

变分自编码器与第047号第一幕丙“高维Lasso:变量多于样本时仍可做稀疏选择”的分工在于:本页负责重参数化技巧让潜变量生成模型可用反向传播联合学习推断与生成,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。

神经风格迁移可与第281号第十四条“创造力支持工具的评估”交换制度或工程中的回写证据。前者的核心命题是卷积特征的高层激活和Gram矩阵可分别近似内容与风格,但表示分离是工程近似,不等于艺术风格的完整定义;计算和版权来源被省略;后者则能检验同一接口是否把选择成本转移给了另一个主体。

视频扩散与第254号第十九条“生成式内容对管线的冲击”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用短时连贯不等于物理一致,镜头剪辑与训练视频记忆会掩盖错误给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。

◎ 争议现场

早期扩散的争议是数百至上千步采样在当时不具产品速度,质量也未超过GAN。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。

得分SDE的争议是数值求解误差与网络得分误差相互放大,连续数学不等于零成本。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。

科学设计的争议是筛选后的成功样本不能代表全部生成分母,合成和实验成本需纳入效率。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。

◎ 往下五年看什么

到2031年,看Wasserstein距离的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。

看无分类器引导在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。

看生成世界模型的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。

看评价清算的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。

◎ 可与哪些领域对撞

变分自编码器与第047号第一幕丙“高维Lasso:变量多于样本时仍可做稀疏选择”共享“可见读数能代表真实对象”的预设。本条用高斯后验与像素似然会产生模糊,ELBO更好不等于感知质量更高给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。

生成模型与扩散里的WaveNet与第281号第十条“现场编码与算法音乐”共享“局部表现能够结算整体能力”的预设。生成模型与扩散里的WaveNet主张扩张因果卷积可在原始音频尺度建模长程依赖。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。

视频扩散与第254号第十九条“生成式内容对管线的冲击”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是短时连贯不等于物理一致,镜头剪辑与训练视频记忆会掩盖错误。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。

◎ 十条可做的研究命题

  1. 在时间外数据上重做变分自编码器;方向保持率低于二分之一即证伪其稳定性。
  2. 把生成对抗网络的中止与排除对象放回分母;主效应反号即否定原总结。
  3. 为深卷积GAN配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
  4. 由独立团队预注册自回归像素的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
  5. 对早期扩散的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
  6. 主动改变正规化流的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
  7. 对生成模型与扩散里的DDPM做反事实干预;可视化不随关键参数变化即证伪忠实性。
  8. 把DDIM与少步采样交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
  9. 公开记忆与版权的最强失败实现;下一方法只在原基准改善即判定为换题。
  10. 为评价清算事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。

◎ 资料核验

  1. Kingma 与 Welling,2014 年《ICLR》论文“Auto-Encoding Variational Bayes”。
  2. Goodfellow 等,2014 年《NeurIPS》27:2672–2680。
  3. Radford、Metz、Chintala,2016 年《ICLR》论文“Unsupervised Representation Learning with Deep Convolutional GANs”。
  4. van den Oord、Kalchbrenner、Kavukcuoglu,2016 年《ICML》48:1747–1756。
  5. Sohl-Dickstein、Weiss、Maheswaranathan、Ganguli,2015 年《ICML》37:2256–2265。
  6. Dinh、Krueger、Bengio,2015 年 arXiv:1410.8516《NICE》。
  7. Gatys、Ecker、Bethge,2016 年《CVPR》:2414–2423,DOI 10.1109/CVPR.2016.265。
  8. van den Oord 等,2016 年 arXiv:1609.03499《WaveNet》。
  9. Arjovsky、Chintala、Bottou,2017 年《ICML》70:214–223。
  10. Karras、Laine、Aila,2019 年《CVPR》:4401–4410,DOI 10.1109/CVPR.2019.00453。
  11. Ho、Jain、Abbeel,2020 年《NeurIPS》33:6840–6851。
  12. Song、Sohl-Dickstein、Kingma 等,2021 年《ICLR》论文“Score-Based Generative Modeling through Stochastic Differential Equations”。
  13. Ho 与 Salimans,2022 年 arXiv:2207.12598《Classifier-Free Diffusion Guidance》。
  14. Rombach、Blattmann、Lorenz、Esser、Ommer,2022 年《CVPR》:10684–10695,DOI 10.1109/CVPR52688.2022.01042。
  15. Song、Meng、Ermon,2021 年《ICLR》论文“Denoising Diffusion Implicit Models”。
  16. Ho 等,2022 年 arXiv:2204.03458《Video Diffusion Models》。
  17. Brooks 等,2024 年 arXiv:2402.17177《Video Generation Models as World Simulators》。
  18. Watson 等,2023 年《Nature》620:1089–1100,DOI 10.1038/s41586-023-06415-8。
  19. Somepalli 等,2023 年《NeurIPS》36:6043–6056。
  20. Stein 等,2023 年《NeurIPS》36:2319–2333《Exposing Flaws of Generative Model Evaluation Metrics》。
  21. Brooks 等,2024 年 arXiv:2402.17177《Video Generation Models as World Simulators》。
  22. Esser 等,2024 年 arXiv:2403.03206《Scaling Rectified Flow Transformers for High-Resolution Image Synthesis》。
  23. Somepalli 等,2023 年《NeurIPS》36:6043–6056“Diffusion Art or Digital Forgery?”。
  24. Yang 等,2024 年《ACM Computing Surveys》56(4):1–39“Diffusion Models: A Comprehensive Survey”。
  25. Brock、Donahue、Simonyan,2019 年《ICLR》论文“Large Scale GAN Training for High Fidelity Natural Image Synthesis”。
  26. Karras、Laine、Aittala 等,2020 年《CVPR》:8110–8119,DOI 10.1109/CVPR42600.2020.00813。
  27. Nichol 与 Dhariwal,2021 年《ICML》139:8162–8171。
【学科经典思想汇集部分】1950–2006 · 20 条经典学科思想

以下二十条是生成模型与扩散在 1950 至 2006 年之间立起来的经典思想,与上文近二十年的二十条合成一块面板的两层。它们回答的是另一个问题:上面每一条新做法所替换的,究竟是哪一条老前提,而那条老前提当年又是被谁、用什么材料立起来的。经典层不做名人榜,只收至今仍被现代二十条正面使用或正面反对的命题;每条末尾点名它在上文哪一条里继续活着。其中数条今天已被判为不成立或被大幅收窄,它们照收——供出失效条件正是这一层最值钱的部分。

经一、蒙特卡洛方法:算不出来,就抽样把它数出来Classic 01 · Generative Models and Diffusion

提出Nicholas Metropolis 与 Stanislaw Ulam,1949 年《美国统计学会杂志》44:335–341;Metropolis 等 1953 年给出可用于任意分布的采样算法。 流变马尔可夫链采样此后成为统计与物理的通用工具;其收敛判定始终没有可靠的通用判据,混合缓慢的诊断至今靠经验。 今用本块三「DDPM:简单去噪目标让扩散质量越过GAN」把「取样」这件事从跑链改成了固定步数的逐步去噪。 关键对于难以解析积分的高维分布,可构造一条以该分布为平衡分布的马尔可夫链并从其轨迹中取样。

这一步把「算不出来」与「取不出来」分开了。归一化常数往往无法计算,但采样只需要知道概率的相对大小——接受还是拒绝,只看比值。这个观察让整类高维问题从不可解变成可算,代价是把确定的数值换成了带方差的估计,而方差本身也只能被估计。

遗留的麻烦一直在同一处:链要跑多久才算到了平衡,没有通用答案。分布若有多个远离的峰,链可能长期困在一个峰里,而所有诊断指标看上去都正常。生成模型此后每一次换目标函数——从对抗训练到去噪扩散——多少都是在绕开或替换这一步,而不是把它解决掉。

位置E——它把「以目标分布为平衡态的一条链」当成单独够用的那一样 预设〔01 链已达平衡〕默认在可承受的步数内采样已代表目标分布 量纲实际运行的链长∶达到充分混合所需的链长 失效当分布多峰且峰间势垒高时,样本只覆盖单峰而全部收敛诊断仍显示正常 异名统计物理称「遍历性假设」,民意调查称「抽样框覆盖不足」;另见本块三

经二、信息论与率失真:要多少比特,取决于你允许错多少Classic 02 · Generative Models and Diffusion

提出Claude Shannon,1948 年《贝尔系统技术杂志》27:379–423;率失真理论于 1959 年在《IRE 国家会议记录》第 4 部分 142–163 中给出。 流变成为压缩与通信的基础;其「先定失真度量再谈码率」的次序在感知质量问题上长期被忽略,直到评价指标之争重新把它提出来。 今用本块十二「评价清算:FID不能代表文字忠实、覆盖与人类价值」争的正是「失真该怎么度量」这条前置问题。 关键在允许的失真水平下,描述一个信源所需的最小码率由率失真函数给出,压缩与保真是一对可量化的取舍。

这条理论的关键动作是把「保真度」变成必须先声明的参数。没有失真度量就没有最优码率——同一段信号,按均方误差压和按感知相似度压,最优方案完全不同。生成模型的整个评价困境是这条老结论的直接后果:不先说清「像」是什么意思,就无法比较谁生成得更好。

它同时给出一个常被忽略的推论:在给定码率下,最优的重建不是最可能的那一个,而是使期望失真最小的那一个——两者往往不同。生成模型里「采样出的样本清晰但不典型」与「均值重建模糊但误差小」这对矛盾,在这里就已经被写清楚了,只是当时没有人拿它去看图像。

位置S——它把「失真度量的选择」当成单独够用的那一样 预设〔02 失真度量可先验给定〕默认存在一个与用途无关的保真度指标 量纲按均方误差最优的重建质量∶按人类判断最优的重建质量 失效当度量与实际用途不一致时,率失真意义上的最优方案在感知上系统性变差 异名摄影称「保真与观感之争」,会计学称「计量属性的选择」;另见本块十二

经三、玻尔兹曼机与能量模型:把生成写成给每个状态定一个能量Classic 03 · Generative Models and Diffusion

提出David Ackley、Geoffrey Hinton 与 Terrence Sejnowski,1985 年《认知科学》9:147–169。 流变因配分函数不可解而长期难以规模化;对比散度与得分匹配是绕开它的两条主要路线。 今用本块乙「生成对抗网络:判别器把显式似然换成对抗信号」是绕开配分函数的另一条路——不估概率,只要一个能分辨真假的信号。 关键生成模型可写成一个能量函数,样本的概率与其能量的负指数成正比,学习即调整能量面。

能量视角的好处是极其灵活:任何能给状态打分的函数都能当模型,不必事先保证它是合法的概率分布——归一化交给配分函数去操心。这让模型设计从「必须写成可积形式」中解放出来,也把生成与判别统一在同一个框架下。

配分函数正是代价所在。它是对全部状态求和,高维下既算不出也难以采样估计,于是梯度里那一项永远只有近似。二十年间的技术史几乎都是在处理这一项:限制结构、截断采样、换成对比目标,或者干脆不建模概率本身而只建模它的梯度——最后这条路就是得分匹配。

位置D——它把「一个能量函数」当成单独够用的那一样 预设〔03 归一化可推迟处理〕默认配分函数只是技术细节,不影响模型设计的自由度 量纲模型定义的灵活度∶可精确计算或可靠估计配分函数的模型子类占比 失效当配分函数既不可解也不可靠估计时,模型定义得再自由也无法训练,自由度是名义的 异名统计物理称「自由能计算」,财务称「未入账的隐性成本」;另见本块乙

经四、亥姆霍兹机与唤醒—睡眠:识别与生成是同一件事的两个方向Classic 04 · Generative Models and Diffusion

提出Peter Dayan、Geoffrey Hinton、Radford Neal 与 Richard Zemel,1995 年《神经计算》7:889–904。 流变其两阶段交替训练不保证收敛到同一目标;变分下界的提出把它整理成单一可优化目标。 今用本块甲「变分自编码器:生成被写成可优化的概率下界」正是这条思路被写成一个目标函数之后的样子。 关键网络同时维护自下而上的识别权重与自上而下的生成权重,两者交替训练、互为对方提供目标。

这个设计把无监督学习拆成两半:生成方向说「隐变量长这样会产生什么数据」,识别方向说「看到这个数据隐变量大概是什么」。两者互相提供训练信号,谁也不需要标签,数据自己既当输入又当答案。这是「编码器—解码器」这一整套结构的直接祖先,也是无监督表示学习最早的一个可运行方案。

它的毛病在于两个阶段优化的不是同一个量:唤醒阶段与睡眠阶段各自下降各自的目标,合起来没有一个统一的下界被单调改善,因此没有收敛保证。把这两半合成一个可微的下界,是十几年后才完成的一步——同样的结构,从「两个互相搭台的过程」变成「一个可优化的量」。

位置E——它把「识别与生成的交替」当成单独够用的那一样 预设〔04 交替优化收敛〕默认两阶段各自改进即可让整体逼近数据分布 量纲两个阶段各自下降的目标数∶被同一个量统一衡量的目标数 失效当两阶段目标不一致时,训练可以稳定进行而整体分布距离并不单调下降 异名控制论称「双环调节」,管理学称「部门目标不一致」;另见本块甲

经五、独立成分分析:混在一起的信号,能不能被拆回去Classic 05 · Generative Models and Diffusion

提出Pierre Comon,1994 年《信号处理》36:287–314 给出正式表述;Bell 与 Sejnowski 于 1995 年给出神经网络实现。 流变在脑电与语音分离上广泛应用;其线性混合与统计独立两条假设在真实数据上很少严格成立。 今用本块二「StyleGAN:生成控制进入多尺度风格空间」追求的正是「让各因素可以分别调整」这同一件事。 关键若观测是若干统计独立的非高斯源的线性混合,则仅凭观测即可把各源分离出来,无需任何先验知识。

这条结果反直觉的地方是它证明了「盲」分离可行:不知道混合矩阵,不知道源信号长什么样,只靠独立性与非高斯性就能把它们拆开。它给「表示应当把生成因素分开」这一直觉提供了第一个有定理支撑的形式,也是后来所有解耦表示研究的源头与它们共同的参照点。

它同时给出了这条路的边界。分离只在线性混合下可证,而真实生成过程通常是非线性的;非线性情形下,不加额外约束的解耦被证明不可辨识——同样的观测分布对应无穷多组「独立」的隐变量。这条不可能性结果至今是解耦表示领域最硬的一堵墙,绕过它必须另加监督或结构假设。

位置S——它把「统计独立」当成单独够用的那一样 预设〔05 独立性足以定位因素〕默认统计独立这一条件能唯一确定生成因素 量纲可辨识分离的混合类型数∶真实数据中出现的混合类型数 失效当混合为非线性时,满足独立性的解有无穷多组,独立性不再能定位任何一组真实因素 异名化学计量学称「盲源分离」,经济学称「识别问题」;另见本块二

经六、马尔可夫随机场与图像先验:自然图像不是随便什么像素排列Classic 06 · Generative Models and Diffusion

提出Stuart Geman 与 Donald Geman,1984 年《IEEE 模式分析与机器智能汇刊》6:721–741。 流变其局部平滑先验长期主导图像复原;后被证明在纹理与边缘上系统性过平滑,学习式先验取而代之。 今用本块丙「深卷积GAN:稳定结构把对抗生成推向高分辨率」用结构假设取代了手写势函数,走的是同一条「先验从哪来」的路。 关键图像可建模为像素上的马尔可夫随机场,其局部依赖结构构成一个可用于复原与分割的先验分布。

这项工作把贝叶斯框架正式带进图像处理:观测是被噪声污染的数据,先验描述「自然图像该长什么样」,复原就是求后验最大。吉布斯采样与模拟退火也是在这里被引入视觉的。此后二十年,图像去噪、修复与分割基本都在这个框架内,区别只在先验怎么写、能量怎么调。

手写先验的天花板很快显出来:局部平滑假设让纹理被抹掉、边缘被磨圆,而调参只能在过平滑与残留噪声之间挪动。真正的解法是不再手写——从大量自然图像里把先验学出来。这一步同时改变了先验的形式:从几个参数的解析式,变成上亿参数的网络。

位置D——它把「手写的局部先验」当成单独够用的那一样 预设〔06 先验可由少数参数写出〕默认自然图像的统计规律能被解析形式的局部势函数刻画 量纲手写先验可解释的图像统计量数∶学习式先验捕捉到的统计量数 失效当图像结构以长程纹理与语义为主时,局部平滑先验系统性过平滑,调参无法同时保边与去噪 异名统计学称「先验设定」,建筑学称「按规范配筋而非按受力」;另见本块丙

经七、小波与稀疏表示:换一组基,信号就变得很少几个数就能说清Classic 07 · Generative Models and Diffusion

提出Stéphane Mallat,1989 年《IEEE 模式分析与机器智能汇刊》11:674–693;Ingrid Daubechies 1988 年构造了紧支撑正交小波。 流变压缩与去噪的标准工具,进入图像编码标准;其固定基在自然图像的复杂结构上不如学习字典与深层表示。 今用本块六「潜空间扩散:先压缩图像,再在潜变量中去噪」延续的正是「先换到一个稀疏的表示里再动手」这条路。 关键自然信号在适当的多尺度基下具有稀疏系数,因而去噪与压缩可通过对少数大系数的保留完成。

它给出的操作极简:变换、把小系数置零、逆变换。这一步之所以有效,是因为噪声在任何基下都摊得很开,而信号在合适的基下集中在少数几个系数上。这条「稀疏性即先验」的思路此后统治了信号处理,也是压缩感知的直接前提,其代价是必须先选对基。

它的限制在于基是固定的、事先设计的。自然图像里的结构远比小波的多尺度假设复杂,边缘的方向性、纹理的重复性都不能被一组通用基高效表示。学习字典是第一次松绑,深层表示是第二次——生成模型在潜空间去噪,用的正是一组从数据里学来的、比小波稀疏得多的坐标。

位置E——它把「一组固定的稀疏基」当成单独够用的那一样 预设〔07 通用基对所有信号都稀疏〕默认一组事先设计的基能让各类自然信号同样稀疏 量纲在固定基下保留九成能量所需的系数数∶在学习表示下所需的系数数 失效当信号结构与基的假设不匹配时,稀疏性大幅下降,阈值去噪同时损伤信号与保留噪声 异名音乐称「换个调号就好写了」,会计学称「科目设置决定可读性」;另见本块六

经八、EM 算法:看不见的那一半,可以先猜再改Classic 08 · Generative Models and Diffusion

提出Arthur Dempster、Nan Laird 与 Donald Rubin,1977 年《皇家统计学会杂志 B 辑》39:1–38。 流变成为含隐变量模型的通用训练框架;其局部最优与初值敏感两条性质从未被解决,只被更好的初始化缓解。 今用本块己「正规化流:可逆变换同时给出精确似然与采样」走的是另一条路——不要下界,直接把似然算准。 关键对含隐变量的似然,可交替执行「按当前参数求隐变量的期望」与「按该期望最大化参数」,每步不降低似然。

这条算法的漂亮之处是它给出了单调性保证:每一轮之后似然不会下降。这让一大类此前无从下手的模型——混合模型、隐马尔可夫、缺失数据——变得可训练。它的推导核心是构造一个处处不超过似然、且在当前点相切的下界,然后最大化下界。

变分自编码器把这个下界改造成两点:一是允许下界不紧,用一个参数化的识别网络去近似后验;二是让整个下界对参数可微,从而可以用梯度下降而非交替最大化。同一个数学结构,从「保证单调的交替算法」变成「可反向传播的目标函数」,规模化因此成为可能。

位置S——它把「一个单调改进的下界」当成单独够用的那一样 预设〔08 局部最优足够用〕默认从合理初值出发得到的局部最优接近全局最优 量纲不同初值下收敛到的似然值范围∶该模型的全局最优似然 失效当似然面多峰且峰值差异大时,单调性保证不提供任何关于解质量的信息 异名优化理论称「主辅化最小化」,工程学称「逐次逼近」;另见本块己

经九、自回归分解:把联合概率拆成一串条件概率Classic 09 · Generative Models and Diffusion

提出链式分解本身是概率论基本恒等式;作为生成模型的显式训练方法,由 Brendan Frey 等 1996 年在《神经信息处理系统进展》第 8 卷中的逻辑自回归网络确立。 流变一路发展到像素级与波形级生成;其严格的顺序采样代价始终无法避免,只能靠并行训练与缓存缓解。 今用本块丁「自回归像素:稳定似然以缓慢采样为代价」正是这条路线在图像上的完整兑现与它的代价。 关键任意联合分布可无损分解为一串条件分布之积,因而生成建模可归约为逐个变量的条件预测。

它的优点是干净:似然可以精确计算,训练目标就是极大似然,没有对抗、没有下界、没有配分函数。评价也直接——困惑度是真实的概率,不是代理指标。在很长时间里这是唯一能给出可信似然数值的生成模型族,别的族只能报代理指标。

代价在采样端且无法绕开:第 t 个变量必须等前 t−1 个都生成完。训练可以完全并行,采样必须严格串行,于是高分辨率图像与长音频的生成时间以维度线性增长。扩散模型用固定步数换掉了这个线性依赖——它的采样步数与数据维度无关,这是它取胜的主要工程理由之一。

位置D——它把「精确似然」当成单独够用的那一样 预设〔09 训练可并行即可用〕默认训练效率决定模型的实用性 量纲训练时可并行的变量数∶采样时必须串行的步数 失效当采样步数随数据维度线性增长时,似然再精确也无法用于交互式生成 异名数据库称「事务串行化」,制造业称「流水线不可并行工序」;另见本块丁

经十、非平衡热力学与随机过程反演:加噪容易,去噪也可以学Classic 10 · Generative Models and Diffusion

提出扩散过程的时间反演由 Brian Anderson 于 1982 年在《随机过程及其应用》12:313–326 中给出;其可逆性依赖于对数密度的梯度。 流变长期属于随机分析而与机器学习无交集;直到得分函数被神经网络估计出来,这条结果才成为可用的生成方法。 今用本块戊「早期扩散:逐步加噪再学会逆转」正是这条数学结果第一次被用作生成模型。 关键一个向数据加噪的扩散过程存在时间反演过程,其漂移项由带噪分布的对数密度梯度决定。

这条结果说的是:把数据一点点搅成噪声这个过程,在数学上是可以倒放的,而倒放所需的唯一信息是每个时刻带噪分布的对数密度梯度。生成因此被归约为一个估计问题——估出那个梯度场,就能把噪声变回数据。

它是本层最典型的「工具先到二十年」的条目:结果在一九八二年就有,而把它当生成模型用要等到有办法估计得分。这中间缺的不是数学,是一个能在高维上拟合梯度场的函数逼近器。这条经典因此提示一件事——很多方法学突破不是新定理,是旧定理终于等到了它需要的那个组件,而组件往往来自完全不相干的领域。

位置E——它把「过程可时间反演」当成单独够用的那一样 预设〔10 得分可被估计〕默认高维带噪分布的对数密度梯度能被充分准确地拟合 量纲反演所需的得分估计精度∶现有逼近器在该维度上可达的精度 失效当得分在低密度区域估计不准时,反演轨迹偏离数据流形,样本质量在长链上逐步崩坏 异名随机分析称「时间反演公式」,工程学称「逆问题的适定性」;另见本块戊

经十一、得分匹配:不建概率,只建它的梯度Classic 11 · Generative Models and Diffusion

提出Aapo Hyvärinen,2005 年《机器学习研究杂志》6:695–709。 流变原始形式在高维上方差过大;去噪版本与切片版本使它可用,并成为扩散模型的训练目标。 今用本块四「得分SDE:扩散与得分匹配被统一成连续时间」正是这条目标函数与反演公式合流之后的结果。 关键通过最小化模型对数密度梯度与数据对数密度梯度之差,可在完全不计算配分函数的前提下估计模型。

这一步的巧妙在于取梯度:对数密度的梯度里,归一化常数是个与变量无关的常数,求导后直接消失。困扰能量模型二十年的配分函数,就这样被绕开了——不是解决,是绕开,代价是模型只被确定到相差一个常数。

原始形式需要二阶导数,高维下代价与方差都不可接受。去噪得分匹配换了个等价目标:先给数据加已知噪声,再让网络预测那个噪声——目标函数变成简单的均方误差,而它在期望意义上等价于匹配得分。整个扩散模型的训练目标就是这一句,它简单到可以写进一行代码,而这份简单正是它能被放大到极大规模的原因。

位置S——它把「对数密度的梯度」当成单独够用的那一样 预设〔11 梯度信息足以定模型〕默认知道各处的密度梯度即等价于知道密度本身 量纲由梯度确定的模型自由度∶完整密度所需的自由度 失效当数据分布支撑不连通时,各连通分支上的相对质量无法由梯度确定,模型缺一组权重 异名物理学称「势与力的关系」,地理学称「只有坡度没有海拔」;另见本块四

经十二、Metropolis–Hastings 与退火:温度是一个可以慢慢拧的旋钮Classic 12 · Generative Models and Diffusion

提出W. Keith Hastings,1970 年《生物计量》57:97–109;模拟退火由 Scott Kirkpatrick 等 1983 年在《科学》220:671–680 中提出。 流变退火思想此后进入组合优化、图像复原与采样;其降温速率与效果的关系在实践中始终靠试。 今用本块五「无分类器引导:条件强度成为采样旋钮」处理的正是同一类「用一个标量调节采样锐度」的做法。 关键在采样中引入温度参数并逐步降低,可先在宽阔的分布上自由探索,再逐步收紧到高概率区域。

退火提供的是一个连续的旋钮:温度高时分布近乎均匀,样本到处跑;温度低时分布集中在峰上。慢慢降温,就能在不陷入局部峰的前提下最终落到高概率处。这是「先粗后细」这一策略第一次被写成有理论依据的采样程序,而不只是一句工程经验。

生成模型里的引导强度是同一个旋钮的另一种形式:调大它,样本更符合条件、更清晰、也更同质;调小它,多样性回来而保真度下降。两者共享同一处麻烦——旋钮的最优值没有理论给定,只能按下游用途试出来,而不同的评价指标会给出不同的最优点。

位置D——它把「一个温度参数」当成单独够用的那一样 预设〔12 存在唯一最优温度〕默认调节参数的最优取值不依赖于评价指标的选择 量纲按保真度指标最优的引导强度∶按多样性指标最优的引导强度 失效当保真与多样由不同指标衡量且最优点分离时,单一旋钮无法同时满足,必须先声明取舍 异名冶金学称「退火工艺」,摄影称「对比度旋钮」;另见本块五

经十三、纹理合成的统计约束:让两幅图的统计量对上,看起来就像了Classic 13 · Generative Models and Diffusion

提出Javier Portilla 与 Eero Simoncelli,2000 年《国际计算机视觉杂志》40:49–70;David Heeger 与 James Bergen 于 1995 年给出更早的版本。 流变对均匀纹理效果出色,对含有物体与布局的图像完全失效;其「匹配统计量即匹配外观」的思路在神经特征上重生。 今用本块庚「神经风格迁移:内容与纹理统计可被优化重组」正是同一方法换用深层特征之后的形态。 关键两幅图像若在一组多尺度滤波响应的统计量上一致,则在纹理外观上不可区分。

这项工作把「看起来一样」变成了可执行的程序:选一组滤波器,量一组统计量,然后从噪声出发迭代调整,直到统计量对上。它同时是一个关于人类视觉的假说——纹理感知只依赖某组汇总统计,而不依赖具体像素排列;这个假说后来在周边视觉的心理物理实验中获得了相当支持。

它的边界同样清楚:统计量是全局汇总的,因而完全没有布局信息。合成一片树叶纹理很好,合成一张脸就变成五官零件的杂烩。神经风格迁移把滤波器换成卷积网络的特征、把统计量换成格拉姆矩阵,效果大幅提升,而这条局限没有变——它依旧只管纹理,不管东西在哪。

位置E——它把「一组汇总统计量」当成单独够用的那一样 预设〔13 统计一致即感知一致〕默认匹配汇总统计足以使两幅图在感知上不可区分 量纲被匹配的统计量数∶人类判别所依据的特征维度数 失效当图像含有需要空间布局信息的内容时,统计量匹配可完美达成而感知上完全不同 异名音响学称「频谱匹配」,教育评价称「分数相同能力不同」;另见本块庚

经十四、隐变量的可辨识性:同样的数据,可能对应完全不同的解释Classic 14 · Generative Models and Diffusion

提出因子分析的旋转不确定性由 Louis Thurstone 于 1947 年提出;其对隐变量模型的一般后果在 1950 年代的计量经济学识别理论中被系统化,Tjalling Koopmans 等 1950 年的论文集为标志。 流变识别条件成为计量经济学的核心议题;深度生成模型兴起后,这条老问题以「解耦表示能否无监督学到」的形式重新出现。 今用本块七「DDIM与少步采样:同一训练目标允许非马尔可夫捷径」提醒的是同一件事——同一分布可由多条路径给出,路径不由分布决定。 关键若不同的参数组合能产生完全相同的观测分布,则仅凭数据无法在它们之间做出选择。

这是一条关于「数据能告诉你什么」的上界:拟合得再好也不能区分观测等价的模型。因子分析里表现为旋转不确定——因子载荷可以任意正交旋转而拟合不变,因而「第一个因子代表什么」不是数据决定的,是研究者选的。

生成模型把同一个问题带回来了:潜空间的某个方向对应「微笑」,这是数据决定的还是训练偶然决定的?无监督解耦的不可辨识性结果给出的答案是后者——不加归纳偏置或弱监督,任何一组潜变量都能被重参数化成另一组而分布不变。可控性因此不是模型自然会有的性质,是必须额外付代价换来的。

位置S——它把「拟合观测分布」当成单独够用的那一样 预设〔14 拟合唯一确定解释〕默认能复现数据分布的模型其内部结构也是被数据确定的 量纲拟合同一分布的参数组合数∶被研究者当作唯一解释报告的组合数 失效当存在观测等价的参数族时,任何关于潜变量含义的断言都来自约束或惯例,不来自数据 异名计量经济学称「识别问题」,考古学称「同一遗存的多种复原」;另见本块七

经十五、玩偶实验与图灵测试式评价:判不出来,算不算成功Classic 15 · Generative Models and Diffusion

提出Alan Turing,1950 年《心灵》59:433–460 提出以不可区分性替代「机器能否思考」这一问。 流变其「以人类判别为终极标准」的思路进入生成质量评价;而人类判别的成本、疲劳与训练效应使它难以作为常规指标。 今用本块十一「记忆与版权:相似样本要相对训练集而非人眼印象检查」正是把「靠人眼判别」换成可核对的比对程序。 关键与其定义「是否具备某种能力」,不如问「在受控交互下能否被区分」,把抽象属性换成可执行的判别实验。

这一步的方法论意义超出人工智能:它把一个定义之争换成了一个实验设计。对生成模型而言,这正是最终的评价标准——若人分辨不出真假,还需要什么别的指标。所有以人类判别为金标准的评测,思路都在这里。

它同时暴露了这类评价的全部困难。判别结果依赖判别者是谁、看了多久、受过多少训练;同一批样本给普通人与给专业摄影师,结论完全不同。成本使它无法用于日常迭代,于是自动指标登场,而自动指标与人类判别的关系又需要人类判别来验证。生成模型评价的循环,从这条经典就开始了。

位置D——它把「不可区分性」当成单独够用的那一样 预设〔15 判别者是同质的〕默认不可区分性不随判别者的经验与投入时间而变 量纲普通判别者的辨真率∶受训判别者在同一批样本上的辨真率 失效当判别能力随训练大幅提高时,不可区分性只相对某一群体成立,标准随人群漂移 异名感官科学称「三角测验」,法学称「一般理性人标准」;另见本块十一

经十六、最大似然与 KL 散度:拟合是在缩短哪一段距离Classic 16 · Generative Models and Diffusion

提出Solomon Kullback 与 Richard Leibler,1951 年《数理统计年刊》22:79–86 给出定向散度;其与极大似然的等价关系随后成为标准结果。 流变长期被当作默认的拟合准则;其非对称性造成的「模式覆盖」偏好在生成模型上产生了可见的后果。 今用本块九「生成世界模型:视频预测被当作环境模拟器」对覆盖与遗漏的容忍度完全不同,正是这条方向性偏好的下游后果。 关键极大似然估计等价于最小化数据分布到模型分布的 KL 散度,而该散度不对称。

这条等价关系把「拟合」这件事的目标写清楚了:不是让参数好看,是让两个分布之间的某个距离变小。方向很要紧——最小化数据到模型的方向,会重罚「数据有而模型没有」的区域,因而模型倾向于覆盖所有模式,代价是把概率摊到不该有的地方。

反过来的方向则倾向于抓住一个模式而忽略其余,这正是变分推断里后验塌缩的来源。生成模型里「模糊但全覆盖」与「清晰但少样式」这对老矛盾,根子就在这一处非对称上。换成对称的或几何性质更好的距离,是后来的应对,而每一种距离都带来自己的一组偏好。

位置E——它把「一个方向的散度」当成单独够用的那一样 预设〔16 距离选择是中性的〕默认拟合准则只影响收敛速度而不影响解的形态 量纲正向散度下的模式覆盖率∶反向散度下的样本清晰度 失效当两个分布支撑不重叠时,KL 散度取无穷或不可导,梯度不再提供任何方向信息 异名测度论称「非对称距离」,管理学称「考核口径决定行为」;另见本块九

经十七、最优传输:把一堆土搬成另一个形状,最省力的搬法Classic 17 · Generative Models and Diffusion

提出问题由 Gaspard Monge 于 1781 年提出,其可解形式由 Leonid Kantorovich 于 1942 年给出;对偶形式在 1950 年代进入线性规划标准理论。 流变长期属于数学与运筹学;其计算代价直到熵正则化与对偶近似出现才降到机器学习可用的范围。 今用本块一「Wasserstein距离:训练信号在分布不重叠时仍可连续」用的正是这条距离的对偶形式。 关键两个分布之间的距离可定义为把一个搬成另一个所需的最小运输代价,该距离在分布不重叠时仍有限且连续。

它与散度类度量的根本差别在于用上了空间结构:两个不重叠的分布,散度类度量给出无穷或常数,而运输代价会随它们靠近而连续减小。这意味着即使模型分布与数据分布还没有交叠,也依然有一个指向正确方向的梯度。

代价在计算:精确求解需要解一个大规模线性规划。生成模型用的是它的对偶形式加上一个约束近似,而那个约束是否被真正满足,长期是有争议的——很多训练稳定性的改善可能来自约束本身的正则效果,而不是来自逼近了真正的运输距离。这是「理论动机」与「实际起作用的机制」分离的一个典型。

位置S——它把「运输代价」当成单独够用的那一样 预设〔17 对偶约束被满足〕默认实现中的近似确实逼近了理论距离 量纲理论所要求的约束条件数∶实现中被实际强制的约束条件数 失效当近似只强制了部分约束时,训练的稳定性来自正则化效应,与理论距离无关 异名运筹学称「运输问题」,物流称「最小调拨成本」;另见本块一

经十八、隐马尔可夫与语音合成:把生成拆成状态、时长与波形三段Classic 18 · Generative Models and Diffusion

提出参数化语音合成的隐马尔可夫框架由德田恵一等于 1999 年在欧洲语音通信会议论文集 2347–2350 中确立。 流变其统计平均导致的过平滑使合成语音「闷」;这一缺陷直到直接建模波形的自回归模型出现才被根本解决。 今用本块辛「WaveNet:原始波形也能逐点生成」正是取消这一整套中间表示的那一步。 关键语音可分解为音素状态序列、时长模型与声学参数三层,各层分别统计建模后再合成波形。

这套框架的工程价值极高:模型小、可控、换发音人只需少量数据,每一层都能被单独检查与调整,出了问题也能定位到层。它代表了一整代生成系统的设计哲学——把复杂生成任务拆成若干可解释的中间表示,每段分别建模。

过平滑是分层的必然代价:每层都在做统计平均,而平均掉的恰好是让声音听起来真实的那些细节。直接对波形建模取消了全部中间表示,一步到位,代价是采样极慢、可控性下降。这一对取舍在图像生成上以完全相同的形状出现——分层可控与端到端保真,至今没有免费的兼得。

位置D——它把「可解释的中间表示」当成单独够用的那一样 预设〔18 分层不损失细节〕默认逐层统计建模只丢弃噪声不丢弃有效信息 量纲中间表示保留的参数维度∶原始波形的信息维度 失效当感知质量依赖于被各层平均掉的细节时,分层越清晰、结果越平淡,且无法靠增大模型补回 异名工业设计称「模块化与整体性能的取舍」,翻译称「逐段处理丢失语气」;另见本块辛

经十九、卷积特征的可视化与反演:网络看到的东西能不能被看见Classic 19 · Generative Models and Diffusion

提出Aravindan Mahendran 等的系统方法虽在其后,但特征反演的基本做法由 Bruno Olshausen 与 David Field 在 1996 年《自然》381:607–609 的稀疏编码工作中奠定:先假定表示,再重建输入。 流变稀疏编码学到的基与初级视觉皮层感受野高度相似,为「表示可学习」提供了生物学佐证;其线性生成假设则被深层非线性表示越过。 今用本块八「视频扩散:时间一致性成为独立约束」同样是「固定一项约束、反解出满足它的信号」,只是约束换成了跨帧一致。 关键若要求用尽量少的基元线性重建自然图像,学出的基元自发地呈现为局部、定向、多尺度的边缘检测子。

这项工作的说服力在于它没有设计任何东西:只给了两条约束——重建要准、系数要稀疏——初级视觉皮层的感受野形状就自己长了出来。它因此同时是一个关于视觉系统的解释和一个关于表示学习的方法论主张:结构可以从目标函数与数据里涌现,不必手工设定。

它留下的操作——固定一个表示,反过来求使该表示达到某值的输入——是后来一切「优化输入而非参数」方法的原型:特征可视化、风格迁移、对抗样本,用的都是这一招。同一个操作在不同目标下,一次成为解释工具,一次成为创作工具,一次成为攻击手段。

位置E——它把「稀疏重建约束」当成单独够用的那一样 预设〔19 优化输入可揭示表示含义〕默认反解出的输入能代表该表示单元真正响应的内容 量纲反解得到的输入数∶其中落在自然图像流形上的输入数 失效当优化不受自然图像先验约束时,反解结果落在流形之外,看起来像噪声而目标值极高 异名神经科学称「最优刺激」,逆向工程称「由输出反推输入」;另见本块八

经二十、混合模型与模式崩溃的老账:多样性丢了,指标不一定看得出来Classic 20 · Generative Models and Diffusion

提出有限混合模型的现代统计处理见 Geoffrey McLachlan 与 David Peel,2000 年《有限混合模型》(Wiley);成分数选择问题在此前数十年已被反复讨论。 流变成分数的确定始终没有可靠通用方法;生成模型里它以「模式崩溃」的形式重现,且更难检测。 今用本块十「科学设计:生成候选必须由实验回路结算」最怕的正是这条——没被生成出来的候选不进任何指标。 关键混合模型中成分个数的选择无法由拟合优度单独决定,过少会合并模式,过多会分裂噪声。

这是统计学里最顽固的一类问题:似然随成分数单调上升,所以拟合优度不能用来定成分数;各种信息准则给出的答案互不一致,且对模型设定敏感。「数据里有几类」这个看似基本的问题,从来没有过一个可靠的自动答案。

生成模型把同一问题变得更隐蔽。模式崩溃时样本依然清晰漂亮,只是少了若干种;而以样本质量为主的指标对「少了什么」几乎不敏感——你看不见没被生成出来的东西。这正是覆盖度必须与保真度分开测量的理由,也说明单一分数永远不足以描述一个生成模型——缺失是不显于账面的那一类错误。

位置S——它把「拟合优度」当成单独够用的那一样 预设〔20 单一分数可概括生成质量〕默认一个指标能同时反映样本的真实性与分布的覆盖度 量纲被生成出来的模式数∶数据中实际存在的模式数 失效当缺失的模式不进入任何以样本为输入的指标时,覆盖度下降对分数不可见,质量与多样性同时被误判 异名生态学称「未被采集的物种」,审计学称「漏记不显于账面」;另见本块十

◎ 这一层怎么用

先按「今用」栏回到上文对应的现代条,再把两条的对象、判据与失效条件并排读。两条若只共享名词而不共享失败情形,只登记为异名;量纲若能逐项换算,再判断现代条究竟继承、修正还是反转了这条老命题。本层二十条分别指向上文二十个不同位置,合起来构成一条可倒查的时间轴,而不是某一条的背景介绍。

三条使用纪律。其一,年份边界与两幕严格不重叠,提出年份落在 1950 至 2006 年之间;更早的奠基工作(Monge 的运输问题、Thurstone 的因子旋转、Shannon 一九四八年的信息论原文)只在提出栏与流变栏里被点名其历史位置。其二,经典身份不提供豁免——本层有四条今天已被明确收窄:马尔可夫随机场的手写先验系统性过平滑、纹理统计匹配完全不管布局、参数化语音合成的分层必然过平滑、无监督解耦被证明不可辨识。这些边界正是这一层最值钱的信息。其三,两层不比高下:只读现代层判断不出新在哪里,只读经典层看不出哪一条已经被换掉。

本层四条路的落点:机制路(能量模型、亥姆霍兹机、随机过程反演、得分匹配、自回归分解、EM)问「靠什么把分布造出来」;测量路(率失真、最大似然与 KL、最优传输、图灵式判别、混合模型的成分数)问「凭什么说造得像」;制度路(蒙特卡洛、退火、小波、马尔可夫随机场、参数化语音合成)问「按什么工序做、代价记在哪」;人的路(可辨识性、独立成分分析、稀疏编码、纹理统计)问「一个解释被判为唯一,是谁决定的」。⚠ 这门学科反复出现的母题是一个被绕开的量总会在别处回来:配分函数被得分匹配绕开,代价是分支间权重不可定;采样串行被扩散绕开,代价是步数与质量的新取舍;人类判别被自动指标绕开,代价是指标与判别的关系又要靠人类判别来验。

◎ 经典层资料核验

  1. Metropolis, N. and Ulam, S. The Monte Carlo method. Journal of the American Statistical Association 44 (1949): 335–341。
  2. Metropolis, N. et al. Equation of state calculations by fast computing machines. Journal of Chemical Physics 21 (1953): 1087–1092。
  3. Hastings, W. K. Monte Carlo sampling methods using Markov chains and their applications. Biometrika 57 (1970): 97–109。
  4. Kirkpatrick, S., Gelatt, C. D. and Vecchi, M. P. Optimization by simulated annealing. Science 220 (1983): 671–680。
  5. Shannon, C. E. A mathematical theory of communication. Bell System Technical Journal 27 (1948): 379–423。
  6. Shannon, C. E. Coding theorems for a discrete source with a fidelity criterion. IRE National Convention Record 4 (1959): 142–163。
  7. Cover, T. M. and Thomas, J. A. Elements of Information Theory. New York: Wiley, 1991(专著)。
  8. Ackley, D. H., Hinton, G. E. and Sejnowski, T. J. A learning algorithm for Boltzmann machines. Cognitive Science 9 (1985): 147–169。
  9. Dayan, P., Hinton, G. E., Neal, R. M. and Zemel, R. S. The Helmholtz machine. Neural Computation 7 (1995): 889–904。
  10. Comon, P. Independent component analysis, a new concept? Signal Processing 36 (1994): 287–314。
  11. Bell, A. J. and Sejnowski, T. J. An information-maximization approach to blind separation and blind deconvolution. Neural Computation 7 (1995): 1129–1159。
  12. Hyvärinen, A., Karhunen, J. and Oja, E. Independent Component Analysis. New York: Wiley, 2001(专著)。
  13. Geman, S. and Geman, D. Stochastic relaxation, Gibbs distributions, and the Bayesian restoration of images. IEEE TPAMI 6 (1984): 721–741。
  14. Winkler, G. Image Analysis, Random Fields and Markov Chain Monte Carlo Methods. Berlin: Springer, 1995(专著)。
  15. Mallat, S. A theory for multiresolution signal decomposition: the wavelet representation. IEEE TPAMI 11 (1989): 674–693。
  16. Daubechies, I. Ten Lectures on Wavelets. Philadelphia: SIAM, 1992(专著)。
  17. Donoho, D. L. and Johnstone, I. M. Ideal spatial adaptation by wavelet shrinkage. Biometrika 81 (1994): 425–455。
  18. Dempster, A. P., Laird, N. M. and Rubin, D. B. Maximum likelihood from incomplete data via the EM algorithm. Journal of the Royal Statistical Society B 39 (1977): 1–38。
  19. McLachlan, G. J. and Krishnan, T. The EM Algorithm and Extensions. New York: Wiley, 1997(专著)。
  20. Frey, B. J., Hinton, G. E. and Dayan, P. Does the wake-sleep algorithm produce good density estimators? Advances in Neural Information Processing Systems 8 (1996): 661–667(专著)。
  21. Frey, B. J. Graphical Models for Machine Learning and Digital Communication. Cambridge, MA: MIT Press, 1998(专著)。
  22. Anderson, B. D. O. Reverse-time diffusion equation models. Stochastic Processes and their Applications 12 (1982): 313–326。
  23. Hyvärinen, A. Estimation of non-normalized statistical models by score matching. Journal of Machine Learning Research 6 (2005): 695–709。
  24. Vincent, P. A connection between score matching and denoising autoencoders. Neural Computation 23 (2011): 1661–1674。
  25. Portilla, J. and Simoncelli, E. P. A parametric texture model based on joint statistics of complex wavelet coefficients. International Journal of Computer Vision 40 (2000): 49–70。
  26. Heeger, D. J. and Bergen, J. R. Pyramid-based texture analysis/synthesis. Proceedings of SIGGRAPH (1995): 229–238。
  27. Thurstone, L. L. Multiple-Factor Analysis. Chicago: University of Chicago Press, 1947(专著)。
  28. Koopmans, T. C. (ed.) Statistical Inference in Dynamic Economic Models. New York: Wiley, 1950(专著)。
  29. Turing, A. M. Computing machinery and intelligence. Mind 59 (1950): 433–460。
  30. Kullback, S. and Leibler, R. A. On information and sufficiency. Annals of Mathematical Statistics 22 (1951): 79–86。
  31. Kullback, S. Information Theory and Statistics. New York: Wiley, 1959(专著)。
  32. Kantorovich, L. V. On the translocation of masses. Doklady Akademii Nauk SSSR 37 (1942): 199–201。
  33. Villani, C. Topics in Optimal Transportation. Providence: American Mathematical Society, 2003(专著)。
  34. Tokuda, K. et al. Simultaneous modeling of spectrum, pitch and duration in HMM-based speech synthesis. Proceedings of Eurospeech (1999): 2347–2350。
  35. Olshausen, B. A. and Field, D. J. Emergence of simple-cell receptive field properties by learning a sparse code for natural images. Nature 381 (1996): 607–609。
  36. McLachlan, G. J. and Peel, D. Finite Mixture Models. New York: Wiley, 2000(专著)。
  37. Neal, R. M. Probabilistic Inference Using Markov Chain Monte Carlo Methods. Technical Report CRG-TR-93-1, University of Toronto, 1993。
新思想前沿 · 第 45 号《生成模型》· 20 条现代思想 + 20 条 1950–2006 经典思想 · 双层资料核验 · 王德生 亲撰 · ← 回到 626 个领域总览