计算机视觉
计算机视觉的近二十年转向与 1950—2006 年经典思想在同一页对读:现代层说明新证据怎样改写问题,经典层倒查旧前提由谁、用什么材料建立。四十条均保留来源、边界、量纲、失效与异名接口;经典二十条逐一回指上文,不把年代久远误当成结论仍然有效。
第一幕保留八个奠基节点。它们共同完成对象、测量、训练或比较框架的第一次可复现化,也把后来争议所需的靶子立了起来。
甲、SURF:积分图像把局部不变特征推到实时尺度Speeded-Up Robust Features
起点要放回2006年的ECCV:Bay、Tuytelaars、Van Gool不再允许计算机视觉在计算机视觉里的SURF上继续把封闭集准确率当通用视觉能力。Bay、Tuytelaars、Van Gool逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的SURF;遮挡、未知类、文化覆盖与传感器漂移由可提示分割另行登记。在ECCV的证据账上,由SURF在重复性与匹配任务上接近或超过SIFT起步,可提示分割进入解释对照;本条残差不能靠改名消失。
计算机视觉里的SURF的可反驳立场是:Hessian近似、积分图像与方向描述可在保持尺度旋转鲁棒时显著加速匹配。Bay、Tuytelaars、Van Gool这一路线据此把决定性解释锁在一个对象上,可提示分割的“分割模型可对多种空间提示即时返回候选掩码,而不为每类重训”不能替代本条;边界是重复纹理、弱纹理与大视角变化仍会失败。若换样本后再问仍不能保持方向,可提示分割便构成计算机视觉里的SURF的近邻反例;ECCV对计算机视觉里的SURF仅支持原任务。
可核对的主证据是Bay、Tuytelaars、Van Gool,2006 年《ECCV》3951:404–417,DOI 10.1007/11744023_32:SURF在重复性与匹配任务上接近或超过SIFT,并把计算时间压低数倍。标准SURF描述子为64维。可提示分割要求把2006年的计算机视觉里的SURF样本与对照结算,再核查可提示分割的任务、观察窗和重复纹理、弱纹理与大视角变化仍会失败。对计算机视觉里的SURF,可提示分割仅作近邻;支点仍是Bay、Tuytelaars、Van Gool在ECCV的原始比较。
计算机视觉里的SURF自己留下的反证入口是:重复纹理、弱纹理与大视角变化仍会失败,快速手工不变性也会删除任务线索。用正交量纲重测时,Bay、Tuytelaars、Van Gool的解释可能缩小、反号,或让位给可提示分割的路径。可提示分割给出复核ECCV的近邻条件:把不显著结果一并公开;计算机视觉里的SURF负责记录中止、排除和不显著对象。
SURF在重复性与匹配任务上接近或超过SIFT改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的SURF,遮挡、未知类、文化覆盖与传感器漂移交可提示分割核查。2023年的可提示分割以“分割模型可对多种空间提示即时返回候选掩码,而不为每类重训”作近邻;两者若结论不同,应以重复纹理、弱纹理与大视角变化仍会失败为分账边界;可提示分割不得与本条合成一个平均分。
2006年,计算机视觉里的SURF据SURF在重复性与匹配任务上接近或超过SIFT对接第254号第九条。跨过去,重复纹理、弱纹理与大视角变化仍会失败迫使计算机视觉里的SURF重新检验可见读数。计算机视觉里的SURF以重复纹理、弱纹理与大视角变化仍会失败施加反向压力。该接口若仍支持相反方向,重复纹理、弱纹理与大视角变化仍会失败要求计算机视觉里的SURF增加第三条件,同时容纳两边的失效样本。
乙、PASCAL VOC:检测与分割第一次有共同赛场Visual Recognition Benchmarks
真正的断点出现在2010年的International Journal of Computer Vision:Everingham 等不再允许计算机视觉在计算机视觉里的PASCAL VOC上继续把封闭集准确率当通用视觉能力。Everingham 等逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的PASCAL VOC;遮挡、未知类、文化覆盖与传感器漂移由自监督视觉另行登记。在International Journal of Computer Vision的证据账上,由VOC建立二十类分类、检测与分割任务及平均精度指标起步,自监督视觉进入解释对照;本条残差不能靠改名消失。
计算机视觉里的PASCAL VOC的可反驳立场是:共享图像、类别和评价协议使算法进步能被逐年比较。Everingham 等这一路线据此把决定性解释锁在一个对象上,自监督视觉的“教师—学生自蒸馏可在无标签图像中形成语义对象与部件表示”不能替代本条;边界是封闭类别、网络照片和单一IoU阈值塑造了模型优化方向。若把时间窗拉长再看仍不能保持方向,自监督视觉便构成计算机视觉里的PASCAL VOC的近邻反例;International Journal of Computer Vision对计算机视觉里的PASCAL VOC仅支持原任务。
可核对的主证据是Everingham 等,2010 年《International Journal of Computer Vision》88:303–338,DOI 10.1007/s11263-009-0275-4:VOC建立二十类分类、检测与分割任务及平均精度指标。VOC基准统一20个对象类别。自监督视觉要求把2010年的计算机视觉里的PASCAL VOC样本与对照结算,再核查自监督视觉的任务、观察窗和封闭类别、网络照片和单一IoU阈值塑造了模型优化方向。对计算机视觉里的PASCAL VOC,自监督视觉仅作近邻;支点仍是Everingham 等在International Journal of Computer Vision的原始比较。
计算机视觉里的PASCAL VOC自己留下的反证入口是:封闭类别、网络照片和单一IoU阈值塑造了模型优化方向。撤去界面提示再验时,Everingham 等的解释可能缩小、反号,或让位给自监督视觉的路径。自监督视觉给出复核International Journal of Computer Vision的近邻条件:按个体轨迹而非均值检查;计算机视觉里的PASCAL VOC负责记录中止、排除和不显著对象。
VOC建立二十类分类、检测与分割任务及平均精度指标改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的PASCAL VOC,遮挡、未知类、文化覆盖与传感器漂移交自监督视觉核查。2021年的自监督视觉以“教师—学生自蒸馏可在无标签图像中形成语义对象与部件表示”作近邻;两者若结论不同,应以封闭类别、网络照片和单一IoU阈值塑造了模型优化方向为分账边界;自监督视觉不得与本条合成一个平均分。
2010年,计算机视觉里的PASCAL VOC据VOC建立二十类分类、检测与分割任务及平均精度指标对接第258号第十四条。跨过去,封闭类别、网络照片和单一IoU阈值塑造了模型优化方向迫使计算机视觉里的PASCAL VOC重新检验可见读数。计算机视觉里的PASCAL VOC以封闭类别、网络照片和单一IoU阈值塑造了模型优化方向施加反向压力。该接口若仍支持相反方向,封闭类别、网络照片和单一IoU阈值塑造了模型优化方向要求计算机视觉里的PASCAL VOC增加第三条件,同时容纳两边的失效样本。
丙、ImageNet:千类百万图把表示学习变成规模问题ImageNet
旧账最先在2009年的CVPR:Deng、Dong、Socher、Li、Li、Fei-Fei不再允许计算机视觉在计算机视觉里的ImageNet上继续把封闭集准确率当通用视觉能力。Deng、Dong、Socher、Li、Li、Fei-Fei逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的ImageNet;遮挡、未知类、文化覆盖与传感器漂移由视觉语言合流另行登记。在CVPR的证据账上,由数据集最初含三百余万图、五千余类起步,视觉语言合流进入解释对照;本条残差不能靠改名消失。
计算机视觉里的ImageNet的可反驳立场是:大规模层级标签数据可把视觉算法放到统一统计压力下。Deng、Dong、Socher、Li、Li、Fei-Fei这一路线据此把决定性解释锁在一个对象上,视觉语言合流的“对比图文预训练让文本提示充当开放词汇分类器”不能替代本条;边界是搜索引擎来源、类别本体与标注者偏见进入模型。若保留失败对象后检验仍不能保持方向,视觉语言合流便构成计算机视觉里的ImageNet的近邻反例;CVPR对计算机视觉里的ImageNet仅支持原任务。
可核对的主证据是Deng、Dong、Socher、Li、Li、Fei-Fei,2009 年《CVPR》:248–255,DOI 10.1109/CVPR.2009.5206848:数据集最初含三百余万图、五千余类,后形成千类竞赛子集。ImageNet初版收集约320万图像和5247类。视觉语言合流要求把2009年的计算机视觉里的ImageNet样本与对照结算,再核查视觉语言合流的任务、观察窗和搜索引擎来源、类别本体与标注者偏见进入模型。对计算机视觉里的ImageNet,视觉语言合流仅作近邻;支点仍是Deng、Dong、Socher、Li、Li、Fei-Fei在CVPR的原始比较。
计算机视觉里的ImageNet自己留下的反证入口是:搜索引擎来源、类别本体与标注者偏见进入模型,规模不等于代表世界。按亚组分别结算时,Deng、Dong、Socher、Li、Li、Fei-Fei的解释可能缩小、反号,或让位给视觉语言合流的路径。视觉语言合流给出复核CVPR的近邻条件:加入反事实条件;计算机视觉里的ImageNet负责记录中止、排除和不显著对象。
数据集最初含三百余万图、五千余类改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的ImageNet,遮挡、未知类、文化覆盖与传感器漂移交视觉语言合流核查。2021年的视觉语言合流以“对比图文预训练让文本提示充当开放词汇分类器”作近邻;两者若结论不同,应以搜索引擎来源、类别本体与标注者偏见进入模型为分账边界;视觉语言合流不得与本条合成一个平均分。
2009年,计算机视觉里的ImageNet据数据集最初含三百余万图、五千余类对接第258号第十二条。跨过去,搜索引擎来源、类别本体与标注者偏见进入模型迫使计算机视觉里的ImageNet重新检验可见读数。计算机视觉里的ImageNet以搜索引擎来源、类别本体与标注者偏见进入模型施加反向压力。该接口若仍支持相反方向,搜索引擎来源、类别本体与标注者偏见进入模型要求计算机视觉里的ImageNet增加第三条件,同时容纳两边的失效样本。
丁、AlexNet:卷积网络接管大规模识别Deep Convolutional Vision
转折并非始于2012年的NeurIPS:Krizhevsky、Sutskever、Hinton不再允许计算机视觉在计算机视觉里的AlexNet上继续把封闭集准确率当通用视觉能力。Krizhevsky、Sutskever、Hinton逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的AlexNet;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的DETR另行登记。在NeurIPS的证据账上,由ImageNet top-5错误率15.3%起步,计算机视觉里的DETR进入解释对照;本条残差不能靠改名消失。
计算机视觉里的AlexNet的可反驳立场是:GPU、ReLU、数据增强和深卷积在同一系统中越过手工特征。Krizhevsky、Sutskever、Hinton这一路线据此把决定性解释锁在一个对象上,计算机视觉里的DETR的“二分图匹配和对象查询可端到端预测无序目标集合,去掉锚框与NMS”不能替代本条;边界是系统收益不能只归因网络深度。若改用地点外资料复核仍不能保持方向,计算机视觉里的DETR便构成计算机视觉里的AlexNet的近邻反例;NeurIPS对计算机视觉里的AlexNet仅支持原任务。
可核对的主证据是Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105:ImageNet top-5错误率15.3%,比次名低十个百分点以上。AlexNet含约6000万个参数和65万个神经元。计算机视觉里的DETR要求把2012年的计算机视觉里的AlexNet样本与对照结算,再核查计算机视觉里的DETR的任务、观察窗和系统收益不能只归因网络深度。对计算机视觉里的AlexNet,计算机视觉里的DETR仅作近邻;支点仍是Krizhevsky、Sutskever、Hinton在NeurIPS的原始比较。
计算机视觉里的AlexNet自己留下的反证入口是:系统收益不能只归因网络深度,训练成本和数据偏差也随之放大。改变任务顺序后追踪时,Krizhevsky、Sutskever、Hinton的解释可能缩小、反号,或让位给计算机视觉里的DETR的路径。计算机视觉里的DETR给出复核NeurIPS的近邻条件:用盲法重跑关键判断;计算机视觉里的AlexNet负责记录中止、排除和不显著对象。
ImageNet top-5错误率15.3%改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的AlexNet,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的DETR核查。2020年的计算机视觉里的DETR以“二分图匹配和对象查询可端到端预测无序目标集合,去掉锚框与NMS”作近邻;两者若结论不同,应以系统收益不能只归因网络深度为分账边界;计算机视觉里的DETR不得与本条合成一个平均分。
2012年,计算机视觉里的AlexNet据ImageNet top-5错误率15.3%对接第043号第一幕丙。跨过去,系统收益不能只归因网络深度迫使计算机视觉里的AlexNet重新检验可见读数。计算机视觉里的AlexNet以系统收益不能只归因网络深度施加反向压力。该接口若仍支持相反方向,系统收益不能只归因网络深度要求计算机视觉里的AlexNet增加第三条件,同时容纳两边的失效样本。
戊、R-CNN:候选区域与深特征把检测重新组合Region-Based Detection
问题的入口是2014年的CVPR:Girshick、Donahue、Darrell、Malik不再允许计算机视觉在计算机视觉里的R-CNN上继续把封闭集准确率当通用视觉能力。Girshick、Donahue、Darrell、Malik逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的R-CNN;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的NeRF另行登记。在CVPR的证据账上,由R-CNN在PASCAL VOC 2012将mAP提高到53.3%并刷新结果起步,计算机视觉里的NeRF进入解释对照;本条残差不能靠改名消失。
计算机视觉里的R-CNN的可反驳立场是:先提候选区域,再用卷积特征分类和回归,可显著提高目标检测。Girshick、Donahue、Darrell、Malik这一路线据此把决定性解释锁在一个对象上,计算机视觉里的NeRF的“位置与视角到颜色密度的连续函数可由体渲染监督学习”不能替代本条;边界是多阶段训练和每区域计算昂贵。若让替代路径进入对照仍不能保持方向,计算机视觉里的NeRF便构成计算机视觉里的R-CNN的近邻反例;CVPR对计算机视觉里的R-CNN仅支持原任务。
可核对的主证据是Girshick、Donahue、Darrell、Malik,2014 年《CVPR》:580–587,DOI 10.1109/CVPR.2014.81:R-CNN在PASCAL VOC 2012将mAP提高到53.3%并刷新结果。计算机视觉里的NeRF要求把2014年的计算机视觉里的R-CNN样本与对照结算,再核查计算机视觉里的NeRF的任务、观察窗和多阶段训练和每区域计算昂贵。对计算机视觉里的R-CNN,计算机视觉里的NeRF仅作近邻;支点仍是Girshick、Donahue、Darrell、Malik在CVPR的原始比较。
计算机视觉里的R-CNN自己留下的反证入口是:多阶段训练和每区域计算昂贵,候选器的漏检成为无法挽回上限。让独立团队预注册时,Girshick、Donahue、Darrell、Malik的解释可能缩小、反号,或让位给计算机视觉里的NeRF的路径。计算机视觉里的NeRF给出复核CVPR的近邻条件:将短期与长期拆账;计算机视觉里的R-CNN负责记录中止、排除和不显著对象。
R-CNN在PASCAL VOC 2012将mAP提高到53.3%并刷新结果改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的R-CNN,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的NeRF核查。2020年的计算机视觉里的NeRF以“位置与视角到颜色密度的连续函数可由体渲染监督学习”作近邻;两者若结论不同,应以多阶段训练和每区域计算昂贵为分账边界;计算机视觉里的NeRF不得与本条合成一个平均分。
2014年,计算机视觉里的R-CNN据R-CNN在PASCAL VOC 2012将mAP提高到53.3%并刷新结果对接第043号第一幕庚。跨过去,多阶段训练和每区域计算昂贵迫使计算机视觉里的R-CNN重新检验可见读数。计算机视觉里的R-CNN以多阶段训练和每区域计算昂贵施加反向压力。该接口若仍支持相反方向,多阶段训练和每区域计算昂贵要求计算机视觉里的R-CNN增加第三条件,同时容纳两边的失效样本。
己、全卷积分割:像素级预测不再依赖手工区域Fully Convolutional Segmentation
先看被改写的对象2015年的CVPR:Long、Shelhamer、Darrell不再允许计算机视觉在全卷积分割上继续把封闭集准确率当通用视觉能力。Long、Shelhamer、Darrell逐项核对图像、标签、掩码、视角与相机位姿里的全卷积分割;遮挡、未知类、文化覆盖与传感器漂移由单目深度基础模型另行登记。在CVPR的证据账上,由FCN在PASCAL分割提高mIoU并建立编码器—解码器范式起步,单目深度基础模型进入解释对照;本条残差不能靠改名消失。
全卷积分割的可反驳立场是:把全连接层改成卷积并用跳连融合尺度,可端到端输出密集标签。Long、Shelhamer、Darrell这一路线据此把决定性解释锁在一个对象上,单目深度基础模型的“大规模无标签伪标注与语义预训练可形成跨域单目深度表示”不能替代本条;边界是上采样边界粗糙。若把排除者放回分母仍不能保持方向,单目深度基础模型便构成全卷积分割的近邻反例;CVPR对全卷积分割仅支持原任务。
可核对的主证据是Long、Shelhamer、Darrell,2015 年《CVPR》:3431–3440,DOI 10.1109/CVPR.2015.7298965:FCN在PASCAL分割提高mIoU并建立编码器—解码器范式。FCN在PASCAL分割达到约62.2%平均交并比。单目深度基础模型要求把2015年的全卷积分割样本与对照结算,再核查单目深度基础模型的任务、观察窗和上采样边界粗糙。对全卷积分割,单目深度基础模型仅作近邻;支点仍是Long、Shelhamer、Darrell在CVPR的原始比较。回到CVPR的取样方式,全卷积分割要用单目深度基础模型证明原分母没有删去最容易失败的对象。
全卷积分割自己留下的反证入口是:上采样边界粗糙,像素平均分会掩盖小物体与罕见类别失败。把不显著结果一并公开时,Long、Shelhamer、Darrell的解释可能缩小、反号,或让位给单目深度基础模型的路径。单目深度基础模型给出复核CVPR的近邻条件:把人工接管计入结果;全卷积分割负责记录中止、排除和不显著对象。
FCN在PASCAL分割提高mIoU并建立编码器—解码器范式改变登记顺序:图像、标签、掩码、视角与相机位姿归全卷积分割,遮挡、未知类、文化覆盖与传感器漂移交单目深度基础模型核查。2024年的单目深度基础模型以“大规模无标签伪标注与语义预训练可形成跨域单目深度表示”作近邻;两者若结论不同,应以上采样边界粗糙为分账边界;单目深度基础模型不得与本条合成一个平均分。
2015年,全卷积分割据FCN在PASCAL分割提高mIoU并建立编码器—解码器范式对接第254号第十八条。跨过去,上采样边界粗糙迫使全卷积分割重新检验可见读数。全卷积分割以上采样边界粗糙施加反向压力。该接口若仍支持相反方向,上采样边界粗糙要求全卷积分割增加第三条件,同时容纳两边的失效样本。
庚、KinectFusion:消费级深度相机实现实时三维重建Real-Time RGB-D Reconstruction
争论应从2011年的ISMAR:Newcombe 等不再允许计算机视觉在计算机视觉里的KinectFusion上继续把封闭集准确率当通用视觉能力。Newcombe 等逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的KinectFusion;遮挡、未知类、文化覆盖与传感器漂移由三维高斯泼溅另行登记。在ISMAR的证据账上,由系统以单台Kinect在GPU上完成姿态估计、表面融合与交互起步,三维高斯泼溅进入解释对照;本条残差不能靠改名消失。
计算机视觉里的KinectFusion的可反驳立场是:连续深度帧的相机跟踪与体素融合可实时建立室内稠密模型。Newcombe 等这一路线据此把决定性解释锁在一个对象上,三维高斯泼溅的“可优化三维高斯的颜色、协方差与透明度,可在高质量和实时渲染间折中”不能替代本条;边界是大空间漂移、动态物体和反光表面会破坏重建。若固定资源预算后比较仍不能保持方向,三维高斯泼溅便构成计算机视觉里的KinectFusion的近邻反例;ISMAR对计算机视觉里的KinectFusion仅支持原任务。
可核对的主证据是Newcombe 等,2011 年《ISMAR》:127–136,DOI 10.1109/ISMAR.2011.6092378:系统以单台Kinect在GPU上完成姿态估计、表面融合与交互。KinectFusion以30帧/秒实时融合深度。三维高斯泼溅要求把2011年的计算机视觉里的KinectFusion样本与对照结算,再核查三维高斯泼溅的任务、观察窗和大空间漂移、动态物体和反光表面会破坏重建。对计算机视觉里的KinectFusion,三维高斯泼溅仅作近邻;支点仍是Newcombe 等在ISMAR的原始比较。
计算机视觉里的KinectFusion自己留下的反证入口是:大空间漂移、动态物体和反光表面会破坏重建,设备深度范围有限。按个体轨迹而非均值检查时,Newcombe 等的解释可能缩小、反号,或让位给三维高斯泼溅的路径。三维高斯泼溅给出复核ISMAR的近邻条件:审计数据近邻与泄漏;计算机视觉里的KinectFusion负责记录中止、排除和不显著对象。
系统以单台Kinect在GPU上完成姿态估计、表面融合与交互改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的KinectFusion,遮挡、未知类、文化覆盖与传感器漂移交三维高斯泼溅核查。2023年的三维高斯泼溅以“可优化三维高斯的颜色、协方差与透明度,可在高质量和实时渲染间折中”作近邻;两者若结论不同,应以大空间漂移、动态物体和反光表面会破坏重建为分账边界;三维高斯泼溅不得与本条合成一个平均分。
2011年,计算机视觉里的KinectFusion据系统以单台Kinect在GPU上完成姿态估计、表面融合与交互对接第254号第七条。跨过去,大空间漂移、动态物体和反光表面会破坏重建迫使计算机视觉里的KinectFusion重新检验可见读数。计算机视觉里的KinectFusion以大空间漂移、动态物体和反光表面会破坏重建施加反向压力。该接口若仍支持相反方向,大空间漂移、动态物体和反光表面会破坏重建要求计算机视觉里的KinectFusion增加第三条件,同时容纳两边的失效样本。
辛、图像字幕:视觉表示第一次接上自然语言解码器Image Captioning
历史坐标落在2015年的CVPR:Vinyals、Toshev、Bengio、Erhan不再允许计算机视觉在图像字幕上继续把封闭集准确率当通用视觉能力。Vinyals、Toshev、Bengio、Erhan逐项核对图像、标签、掩码、视角与相机位姿里的图像字幕;遮挡、未知类、文化覆盖与传感器漂移由开放世界检测另行登记。在CVPR的证据账上,由Show and Tell在COCO人工评价中显著提高字幕质量起步,开放世界检测进入解释对照;本条残差不能靠改名消失。
图像字幕的可反驳立场是:卷积编码器与语言解码器可从图像生成开放文本描述。Vinyals、Toshev、Bengio、Erhan这一路线据此把决定性解释锁在一个对象上,开放世界检测的“部署环境含未见对象,检测器应识别未知并在获得标签后增量学习”不能替代本条;边界是模型会依赖高频模板并生成图中不存在物体。若用正交量纲重测仍不能保持方向,开放世界检测便构成图像字幕的近邻反例;CVPR对图像字幕仅支持原任务。
可核对的主证据是Vinyals、Toshev、Bengio、Erhan,2015 年《CVPR》:3156–3164,DOI 10.1109/CVPR.2015.7298935:Show and Tell在COCO人工评价中显著提高字幕质量。字幕模型按5项人工维度比较。开放世界检测要求把2015年的图像字幕样本与对照结算,再核查开放世界检测的任务、观察窗和模型会依赖高频模板并生成图中不存在物体。对图像字幕,开放世界检测仅作近邻;支点仍是Vinyals、Toshev、Bengio、Erhan在CVPR的原始比较。
图像字幕自己留下的反证入口是:模型会依赖高频模板并生成图中不存在物体,流畅度掩盖视觉落地失败。加入反事实条件时,Vinyals、Toshev、Bengio、Erhan的解释可能缩小、反号,或让位给开放世界检测的路径。开放世界检测给出复核CVPR的近邻条件:先登记停止线再部署;图像字幕负责记录中止、排除和不显著对象。
Show and Tell在COCO人工评价中显著提高字幕质量改变登记顺序:图像、标签、掩码、视角与相机位姿归图像字幕,遮挡、未知类、文化覆盖与传感器漂移交开放世界检测核查。2021年的开放世界检测以“部署环境含未见对象,检测器应识别未知并在获得标签后增量学习”作近邻;两者若结论不同,应以模型会依赖高频模板并生成图中不存在物体为分账边界;开放世界检测不得与本条合成一个平均分。
2015年,图像字幕据Show and Tell在COCO人工评价中显著提高字幕质量对接第253号第九条。跨过去,模型会依赖高频模板并生成图中不存在物体迫使图像字幕重新检验可见读数。图像字幕以模型会依赖高频模板并生成图中不存在物体施加反向压力。该接口若仍支持相反方向,模型会依赖高频模板并生成图中不存在物体要求图像字幕增加第三条件,同时容纳两边的失效样本。
第二幕的十二条不按产品热度排列,而按旧默认被哪种证据迫使修改排列:规模、迁移、边界、失效与责任逐项进入正文。
一、视觉Transformer:图像图块可直接进入自注意力Vision Transformers
第一处裂缝来自2021年的ICLR:Dosovitskiy 等不再允许计算机视觉在视觉Transformer上继续把封闭集准确率当通用视觉能力。Dosovitskiy 等逐项核对图像、标签、掩码、视角与相机位姿里的视觉Transformer;遮挡、未知类、文化覆盖与传感器漂移由多模态VLM另行登记。在ICLR的证据账上,由ViT在JFT-300M预训练后超过当时卷积基线起步,多模态VLM进入解释对照;本条残差不能靠改名消失。
视觉Transformer的可反驳立场是:足够数据预训练下,弱化卷积先验的图块序列也能学习强视觉表示。Dosovitskiy 等这一路线据此把决定性解释锁在一个对象上,多模态VLM的“视觉编码器与指令模型连接后,可用对话接口处理图像问题与任务迁移”不能替代本条;边界是数据较少时归纳偏置不足。若撤去界面提示再验仍不能保持方向,多模态VLM便构成视觉Transformer的近邻反例;ICLR对视觉Transformer仅支持原任务。
可核对的主证据是Dosovitskiy 等,2021 年《ICLR》论文“An Image Is Worth 16×16 Words”:ViT在JFT-300M预训练后超过当时卷积基线,并迁移多项任务。ViT在JFT-300M上预训练后迁移。多模态VLM要求把2021年的视觉Transformer样本与对照结算,再核查多模态VLM的任务、观察窗和数据较少时归纳偏置不足。对视觉Transformer,多模态VLM仅作近邻;支点仍是Dosovitskiy 等在ICLR的原始比较。回到ICLR的取样方式,视觉Transformer要用多模态VLM证明原分母没有删去最容易失败的对象。
视觉Transformer自己留下的反证入口是:数据较少时归纳偏置不足,计算和位置编码随分辨率快速增长。用盲法重跑关键判断时,Dosovitskiy 等的解释可能缩小、反号,或让位给多模态VLM的路径。多模态VLM给出复核ICLR的近邻条件:换样本后再问;视觉Transformer负责记录中止、排除和不显著对象。拿多模态VLM作近邻检验,可辨认Dosovitskiy 等观察到的是独有路径,还是另一条路线的表面同义词。
ViT在JFT-300M预训练后超过当时卷积基线改变登记顺序:图像、标签、掩码、视角与相机位姿归视觉Transformer,遮挡、未知类、文化覆盖与传感器漂移交多模态VLM核查。2023年的多模态VLM以“视觉编码器与指令模型连接后,可用对话接口处理图像问题与任务迁移”作近邻;两者若结论不同,应以数据较少时归纳偏置不足为分账边界;多模态VLM不得与本条合成一个平均分。
2021年,视觉Transformer据ViT在JFT-300M预训练后超过当时卷积基线对接第044号第二幕一。跨过去,数据较少时归纳偏置不足迫使视觉Transformer重新检验可见读数。视觉Transformer以数据较少时归纳偏置不足施加反向压力。该接口若仍支持相反方向,数据较少时归纳偏置不足要求视觉Transformer增加第三条件,同时容纳两边的失效样本。第044号第二幕一“Transformer:注意力把序列训练变成高度并行”提供不同尺度的反例;它迫使视觉Transformer把“适用”写成可检查的对象范围。
二、可提示分割:点、框和粗掩码成为通用视觉接口Promptable Segmentation
研究单位改在2023年的ICCV:Kirillov 等不再允许计算机视觉在可提示分割上继续把封闭集准确率当通用视觉能力。Kirillov 等逐项核对图像、标签、掩码、视角与相机位姿里的可提示分割;遮挡、未知类、文化覆盖与传感器漂移由数据偏斜另行登记。在ICCV的证据账上,由SAM以十亿余掩码训练并在多数据集展示零样本迁移起步,数据偏斜进入解释对照;本条残差不能靠改名消失。
可提示分割的可反驳立场是:分割模型可对多种空间提示即时返回候选掩码,而不为每类重训。Kirillov 等这一路线据此把决定性解释锁在一个对象上,数据偏斜的“商业性别分类在肤色与性别交叉群体上误差巨大不同,平均准确率掩盖伤害”不能替代本条;边界是“任何物体”受训练图像和提示定义限制。若按亚组分别结算仍不能保持方向,数据偏斜便构成可提示分割的近邻反例;ICCV对可提示分割仅支持原任务。
可核对的主证据是Kirillov 等,2023 年《ICCV》:4015–4026,DOI 10.1109/ICCV51070.2023.00371:SAM以十亿余掩码训练并在多数据集展示零样本迁移。SAM的训练集含约1100万幅图像和10亿余个掩码。数据偏斜要求把2023年的可提示分割样本与对照结算,再核查数据偏斜的任务、观察窗和“任何物体”受训练图像和提示定义限制。对可提示分割,数据偏斜仅作近邻;支点仍是Kirillov 等在ICCV的原始比较。
可提示分割自己留下的反证入口是:“任何物体”受训练图像和提示定义限制,医学与遥感小结构仍会失真。将短期与长期拆账时,Kirillov 等的解释可能缩小、反号,或让位给数据偏斜的路径。数据偏斜给出复核ICCV的近邻条件:把时间窗拉长再看;可提示分割负责记录中止、排除和不显著对象。
SAM以十亿余掩码训练并在多数据集展示零样本迁移改变登记顺序:图像、标签、掩码、视角与相机位姿归可提示分割,遮挡、未知类、文化覆盖与传感器漂移交数据偏斜核查。2018年的数据偏斜以“商业性别分类在肤色与性别交叉群体上误差巨大不同,平均准确率掩盖伤害”作近邻;两者若结论不同,应以“任何物体”受训练图像和提示定义限制为分账边界;数据偏斜不得与本条合成一个平均分。
2023年,可提示分割据SAM以十亿余掩码训练并在多数据集展示零样本迁移对接第044号第二幕六。跨过去,“任何物体”受训练图像和提示定义限制迫使可提示分割重新检验可见读数。可提示分割以“任何物体”受训练图像和提示定义限制施加反向压力。该接口若仍支持相反方向,“任何物体”受训练图像和提示定义限制要求可提示分割增加第三条件,同时容纳两边的失效样本。
三、自监督视觉:不同视图一致性取代全部人工标签Self-Supervised Vision
回到原始设计2021年的ICCV:Caron 等不再允许计算机视觉在自监督视觉上继续把封闭集准确率当通用视觉能力。Caron 等逐项核对图像、标签、掩码、视角与相机位姿里的自监督视觉;遮挡、未知类、文化覆盖与传感器漂移由合成真实性另行登记。在ICCV的证据账上,由DINO的ViT注意图自发突出物体起步,合成真实性进入解释对照;本条残差不能靠改名消失。
自监督视觉的可反驳立场是:教师—学生自蒸馏可在无标签图像中形成语义对象与部件表示。Caron 等这一路线据此把决定性解释锁在一个对象上,合成真实性的“检测器应跨未见生成器、压缩和编辑评估,而非只识别训练模型指纹”不能替代本条;边界是增强定义了不变性。若改变任务顺序后追踪仍不能保持方向,合成真实性便构成自监督视觉的近邻反例;ICCV对自监督视觉仅支持原任务。
可核对的主证据是Caron 等,2021 年《ICCV》:9650–9660,DOI 10.1109/ICCV48922.2021.00951:DINO的ViT注意图自发突出物体,并在k-NN与迁移任务表现强。合成真实性要求把2021年的自监督视觉样本与对照结算,再核查合成真实性的任务、观察窗和增强定义了不变性。对自监督视觉,合成真实性仅作近邻;支点仍是Caron 等在ICCV的原始比较。回到ICCV的取样方式,自监督视觉要用合成真实性证明原分母没有删去最容易失败的对象。
自监督视觉自己留下的反证入口是:增强定义了不变性,背景和拍摄习惯仍可成为捷径。把人工接管计入结果时,Caron 等的解释可能缩小、反号,或让位给合成真实性的路径。合成真实性给出复核ICCV的近邻条件:保留失败对象后检验;自监督视觉负责记录中止、排除和不显著对象。拿合成真实性作近邻检验,可辨认Caron 等观察到的是独有路径,还是另一条路线的表面同义词。
DINO的ViT注意图自发突出物体改变登记顺序:图像、标签、掩码、视角与相机位姿归自监督视觉,遮挡、未知类、文化覆盖与传感器漂移交合成真实性核查。2023年的合成真实性以“检测器应跨未见生成器、压缩和编辑评估,而非只识别训练模型指纹”作近邻;两者若结论不同,应以增强定义了不变性为分账边界;合成真实性不得与本条合成一个平均分。
2021年,自监督视觉据DINO的ViT注意图自发突出物体对接第043号第二幕一。跨过去,增强定义了不变性迫使自监督视觉重新检验可见读数。自监督视觉以增强定义了不变性施加反向压力。该接口若仍支持相反方向,增强定义了不变性要求自监督视觉增加第三条件,同时容纳两边的失效样本。
四、视觉语言合流:自然语言把封闭类别表打开Open-Vocabulary Vision
这一路线先拆掉2021年的ICML:Radford 等不再允许计算机视觉在视觉语言合流上继续把封闭集准确率当通用视觉能力。Radford 等逐项核对图像、标签、掩码、视角与相机位姿里的视觉语言合流;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的SURF另行登记。在ICML的证据账上,由CLIP在三十余数据集零样本评测接近监督基线起步,计算机视觉里的SURF进入解释对照;本条残差不能靠改名消失。
视觉语言合流的可反驳立场是:对比图文预训练让文本提示充当开放词汇分类器。Radford 等这一路线据此把决定性解释锁在一个对象上,计算机视觉里的SURF的“Hessian近似、积分图像与方向描述可在保持尺度旋转鲁棒时显著加速匹配”不能替代本条;边界是提示措辞、网络语料与文化覆盖决定类别边界。若让独立团队预注册仍不能保持方向,计算机视觉里的SURF便构成视觉语言合流的近邻反例;ICML对视觉语言合流仅支持原任务。
可核对的主证据是Radford 等,2021 年《ICML》139:8748–8763:CLIP在三十余数据集零样本评测接近监督基线,并支持检索。CLIP在30余个数据集做零样本评测。计算机视觉里的SURF要求把2021年的视觉语言合流样本与对照结算,再核查计算机视觉里的SURF的任务、观察窗和提示措辞、网络语料与文化覆盖决定类别边界。对视觉语言合流,计算机视觉里的SURF仅作近邻;支点仍是Radford 等在ICML的原始比较。
视觉语言合流自己留下的反证入口是:提示措辞、网络语料与文化覆盖决定类别边界,零样本并非零数据。审计数据近邻与泄漏时,Radford 等的解释可能缩小、反号,或让位给计算机视觉里的SURF的路径。计算机视觉里的SURF给出复核ICML的近邻条件:改用地点外资料复核;视觉语言合流负责记录中止、排除和不显著对象。
CLIP在三十余数据集零样本评测接近监督基线改变登记顺序:图像、标签、掩码、视角与相机位姿归视觉语言合流,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的SURF核查。2006年的计算机视觉里的SURF以“Hessian近似、积分图像与方向描述可在保持尺度旋转鲁棒时显著加速匹配”作近邻;两者若结论不同,应以提示措辞、网络语料与文化覆盖决定类别边界为分账边界;计算机视觉里的SURF不得与本条合成一个平均分。
2021年,视觉语言合流据CLIP在三十余数据集零样本评测接近监督基线对接第044号第二幕九。跨过去,提示措辞、网络语料与文化覆盖决定类别边界迫使视觉语言合流重新检验可见读数。视觉语言合流以提示措辞、网络语料与文化覆盖决定类别边界施加反向压力。该接口若仍支持相反方向,提示措辞、网络语料与文化覆盖决定类别边界要求视觉语言合流增加第三条件,同时容纳两边的失效样本。
五、DETR:检测被改写成集合匹配而非候选框管线Detection Transformers
需要先恢复2020年的ECCV:Carion 等不再允许计算机视觉在计算机视觉里的DETR上继续把封闭集准确率当通用视觉能力。Carion 等逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的DETR;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的PASCAL VOC另行登记。在ECCV的证据账上,由DETR在COCO达到与Faster R-CNN相当精度起步,计算机视觉里的PASCAL VOC进入解释对照;本条残差不能靠改名消失。
计算机视觉里的DETR的可反驳立场是:二分图匹配和对象查询可端到端预测无序目标集合,去掉锚框与NMS。Carion 等这一路线据此把决定性解释锁在一个对象上,计算机视觉里的PASCAL VOC的“共享图像、类别和评价协议使算法进步能被逐年比较”不能替代本条;边界是训练收敛慢且小物体较弱。若把不显著结果一并公开仍不能保持方向,计算机视觉里的PASCAL VOC便构成计算机视觉里的DETR的近邻反例;ECCV对计算机视觉里的DETR仅支持原任务。
可核对的主证据是Carion 等,2020 年《ECCV》12346:213–229,DOI 10.1007/978-3-030-58452-8_13:DETR在COCO达到与Faster R-CNN相当精度,简化检测组件。计算机视觉里的PASCAL VOC要求把2020年的计算机视觉里的DETR样本与对照结算,再核查计算机视觉里的PASCAL VOC的任务、观察窗和训练收敛慢且小物体较弱。对计算机视觉里的DETR,计算机视觉里的PASCAL VOC仅作近邻;支点仍是Carion 等在ECCV的原始比较。回到ECCV的取样方式,计算机视觉里的DETR要用计算机视觉里的PASCAL VOC证明原分母没有删去最容易失败的对象。
计算机视觉里的DETR自己留下的反证入口是:训练收敛慢且小物体较弱,简洁架构不等于更少数据与算力。先登记停止线再部署时,Carion 等的解释可能缩小、反号,或让位给计算机视觉里的PASCAL VOC的路径。计算机视觉里的PASCAL VOC给出复核ECCV的近邻条件:让替代路径进入对照;计算机视觉里的DETR负责记录中止、排除和不显著对象。
DETR在COCO达到与Faster R-CNN相当精度改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的DETR,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的PASCAL VOC核查。2010年的计算机视觉里的PASCAL VOC以“共享图像、类别和评价协议使算法进步能被逐年比较”作近邻;两者若结论不同,应以训练收敛慢且小物体较弱为分账边界;计算机视觉里的PASCAL VOC不得与本条合成一个平均分。
2020年,计算机视觉里的DETR据DETR在COCO达到与Faster R-CNN相当精度对接第047号第二幕四。跨过去,训练收敛慢且小物体较弱迫使计算机视觉里的DETR重新检验可见读数。计算机视觉里的DETR以训练收敛慢且小物体较弱施加反向压力。该接口若仍支持相反方向,训练收敛慢且小物体较弱要求计算机视觉里的DETR增加第三条件,同时容纳两边的失效样本。
六、NeRF:连续坐标网络把多视图照片变成可渲染场景Neural Radiance Fields
证据链从2020年的ECCV:Mildenhall 等不再允许计算机视觉在计算机视觉里的NeRF上继续把封闭集准确率当通用视觉能力。Mildenhall 等逐项核对图像、标签、掩码、视角与相机位姿里的计算机视觉里的NeRF;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的ImageNet另行登记。在ECCV的证据账上,由NeRF用稀疏已知相机位姿合成高质量新视角起步,计算机视觉里的ImageNet进入解释对照;本条残差不能靠改名消失。
计算机视觉里的NeRF的可反驳立场是:位置与视角到颜色密度的连续函数可由体渲染监督学习。Mildenhall 等这一路线据此把决定性解释锁在一个对象上,计算机视觉里的ImageNet的“大规模层级标签数据可把视觉算法放到统一统计压力下”不能替代本条;边界是每场景优化慢。若按个体轨迹而非均值检查仍不能保持方向,计算机视觉里的ImageNet便构成计算机视觉里的NeRF的近邻反例;ECCV对计算机视觉里的NeRF仅支持原任务。
可核对的主证据是Mildenhall 等,2020 年《ECCV》12346:405–421,DOI 10.1007/978-3-030-58452-8_24:NeRF用稀疏已知相机位姿合成高质量新视角,改写三维表示。计算机视觉里的ImageNet要求把2020年的计算机视觉里的NeRF样本与对照结算,再核查计算机视觉里的ImageNet的任务、观察窗和每场景优化慢。对计算机视觉里的NeRF,计算机视觉里的ImageNet仅作近邻;支点仍是Mildenhall 等在ECCV的原始比较。回到ECCV的取样方式,计算机视觉里的NeRF要用计算机视觉里的ImageNet证明原分母没有删去最容易失败的对象。
计算机视觉里的NeRF自己留下的反证入口是:每场景优化慢,动态、反光和未知相机位姿会破坏静态辐射场假设。换样本后再问时,Mildenhall 等的解释可能缩小、反号,或让位给计算机视觉里的ImageNet的路径。计算机视觉里的ImageNet给出复核ECCV的近邻条件:把排除者放回分母;计算机视觉里的NeRF负责记录中止、排除和不显著对象。
NeRF用稀疏已知相机位姿合成高质量新视角改变登记顺序:图像、标签、掩码、视角与相机位姿归计算机视觉里的NeRF,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的ImageNet核查。2009年的计算机视觉里的ImageNet以“大规模层级标签数据可把视觉算法放到统一统计压力下”作近邻;两者若结论不同,应以每场景优化慢为分账边界;计算机视觉里的ImageNet不得与本条合成一个平均分。
2020年,计算机视觉里的NeRF据NeRF用稀疏已知相机位姿合成高质量新视角对接第254号第四条。跨过去,每场景优化慢迫使计算机视觉里的NeRF重新检验可见读数。计算机视觉里的NeRF以每场景优化慢施加反向压力。该接口若仍支持相反方向,每场景优化慢要求计算机视觉里的NeRF增加第三条件,同时容纳两边的失效样本。
七、单目深度基础模型:相对几何可跨数据集迁移Foundation Models for Depth
决定性变化始于2024年的CVPR:Yang 等不再允许计算机视觉在单目深度基础模型上继续把封闭集准确率当通用视觉能力。Yang 等逐项核对图像、标签、掩码、视角与相机位姿里的单目深度基础模型;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的AlexNet另行登记。在CVPR的证据账上,由Depth Anything利用六千余万无标签图像起步,计算机视觉里的AlexNet进入解释对照;本条残差不能靠改名消失。
单目深度基础模型的可反驳立场是:大规模无标签伪标注与语义预训练可形成跨域单目深度表示。Yang 等这一路线据此把决定性解释锁在一个对象上,计算机视觉里的AlexNet的“GPU、ReLU、数据增强和深卷积在同一系统中越过手工特征”不能替代本条;边界是尺度与相机参数仍不确定。若加入反事实条件仍不能保持方向,计算机视觉里的AlexNet便构成单目深度基础模型的近邻反例;CVPR对单目深度基础模型仅支持原任务。
可核对的主证据是Yang 等,2024 年《CVPR》论文“Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data”:Depth Anything利用六千余万无标签图像,在多数据集零样本相对深度表现强。Depth Anything利用6200万幅无标签图像。计算机视觉里的AlexNet要求把2024年的单目深度基础模型样本与对照结算,再核查计算机视觉里的AlexNet的任务、观察窗和尺度与相机参数仍不确定。对单目深度基础模型,计算机视觉里的AlexNet仅作近邻;支点仍是Yang 等在CVPR的原始比较。
单目深度基础模型自己留下的反证入口是:尺度与相机参数仍不确定,视觉上平滑的深度会在机器人量测中产生系统误差。把时间窗拉长再看时,Yang 等的解释可能缩小、反号,或让位给计算机视觉里的AlexNet的路径。计算机视觉里的AlexNet给出复核CVPR的近邻条件:固定资源预算后比较;单目深度基础模型负责记录中止、排除和不显著对象。
Depth Anything利用六千余万无标签图像改变登记顺序:图像、标签、掩码、视角与相机位姿归单目深度基础模型,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的AlexNet核查。2012年的计算机视觉里的AlexNet以“GPU、ReLU、数据增强和深卷积在同一系统中越过手工特征”作近邻;两者若结论不同,应以尺度与相机参数仍不确定为分账边界;计算机视觉里的AlexNet不得与本条合成一个平均分。
2024年,单目深度基础模型据Depth Anything利用六千余万无标签图像对接第044号第二幕四。跨过去,尺度与相机参数仍不确定迫使单目深度基础模型重新检验可见读数。单目深度基础模型以尺度与相机参数仍不确定施加反向压力。该接口若仍支持相反方向,尺度与相机参数仍不确定要求单目深度基础模型增加第三条件,同时容纳两边的失效样本。
八、三维高斯泼溅:显式点基元换来实时新视角3D Gaussian Splatting
最早被迫重写的是2023年的ACM TOG:Kerbl、Kopanas、Leimkühler、Drettakis不再允许计算机视觉在三维高斯泼溅上继续把封闭集准确率当通用视觉能力。Kerbl、Kopanas、Leimkühler、Drettakis逐项核对图像、标签、掩码、视角与相机位姿里的三维高斯泼溅;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的R-CNN另行登记。在ACM TOG的证据账上,由在真实场景达到1080p实时渲染并接近或超过NeRF质量起步,计算机视觉里的R-CNN进入解释对照;本条残差不能靠改名消失。
三维高斯泼溅的可反驳立场是:可优化三维高斯的颜色、协方差与透明度,可在高质量和实时渲染间折中。Kerbl、Kopanas、Leimkühler、Drettakis这一路线据此把决定性解释锁在一个对象上,计算机视觉里的R-CNN的“先提候选区域,再用卷积特征分类和回归,可显著提高目标检测”不能替代本条;边界是模型内存大、几何表面不显式且动态编辑困难。若用盲法重跑关键判断仍不能保持方向,计算机视觉里的R-CNN便构成三维高斯泼溅的近邻反例;ACM TOG对三维高斯泼溅仅支持原任务。
可核对的主证据是Kerbl、Kopanas、Leimkühler、Drettakis,2023 年《ACM TOG》42(4):139,DOI 10.1145/3592433:在真实场景达到1080p实时渲染并接近或超过NeRF质量。三维高斯泼溅在1080p下实现实时渲染。计算机视觉里的R-CNN要求把2023年的三维高斯泼溅样本与对照结算,再核查计算机视觉里的R-CNN的任务、观察窗和模型内存大、几何表面不显式且动态编辑困难。对三维高斯泼溅,计算机视觉里的R-CNN仅作近邻;支点仍是Kerbl、Kopanas、Leimkühler、Drettakis在ACM TOG的原始比较。
三维高斯泼溅自己留下的反证入口是:模型内存大、几何表面不显式且动态编辑困难,渲染好不等于重建真。保留失败对象后检验时,Kerbl、Kopanas、Leimkühler、Drettakis的解释可能缩小、反号,或让位给计算机视觉里的R-CNN的路径。计算机视觉里的R-CNN给出复核ACM TOG的近邻条件:用正交量纲重测;三维高斯泼溅负责记录中止、排除和不显著对象。
在真实场景达到1080p实时渲染并接近或超过NeRF质量改变登记顺序:图像、标签、掩码、视角与相机位姿归三维高斯泼溅,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的R-CNN核查。2014年的计算机视觉里的R-CNN以“先提候选区域,再用卷积特征分类和回归,可显著提高目标检测”作近邻;两者若结论不同,应以模型内存大、几何表面不显式且动态编辑困难为分账边界;计算机视觉里的R-CNN不得与本条合成一个平均分。
2023年,三维高斯泼溅据在真实场景达到1080p实时渲染并接近或超过NeRF质量对接第254号第五条。跨过去,模型内存大、几何表面不显式且动态编辑困难迫使三维高斯泼溅重新检验可见读数。三维高斯泼溅以模型内存大、几何表面不显式且动态编辑困难施加反向压力。该接口若仍支持相反方向,模型内存大、几何表面不显式且动态编辑困难要求三维高斯泼溅增加第三条件,同时容纳两边的失效样本。
九、开放世界检测:未知类别必须被拒绝或逐步纳入Open-World Recognition
这一条先处理2021年的CVPR:Joseph、Khan、Khan、Balasubramanian不再允许计算机视觉在开放世界检测上继续把封闭集准确率当通用视觉能力。Joseph、Khan、Khan、Balasubramanian逐项核对图像、标签、掩码、视角与相机位姿里的开放世界检测;遮挡、未知类、文化覆盖与传感器漂移由全卷积分割另行登记。在CVPR的证据账上,由ORE在VOC与COCO混合协议上同时评估已知检测、未知召回与持续学习起步,全卷积分割进入解释对照;本条残差不能靠改名消失。
开放世界检测的可反驳立场是:部署环境含未见对象,检测器应识别未知并在获得标签后增量学习。Joseph、Khan、Khan、Balasubramanian这一路线据此把决定性解释锁在一个对象上,全卷积分割的“把全连接层改成卷积并用跳连融合尺度,可端到端输出密集标签”不能替代本条;边界是“未知”依赖测试集人为留类。若将短期与长期拆账仍不能保持方向,全卷积分割便构成开放世界检测的近邻反例;CVPR对开放世界检测仅支持原任务。
可核对的主证据是Joseph、Khan、Khan、Balasubramanian,2021 年《CVPR》:5830–5840,DOI 10.1109/CVPR46437.2021.00577:ORE在VOC与COCO混合协议上同时评估已知检测、未知召回与持续学习。全卷积分割要求把2021年的开放世界检测样本与对照结算,再核查全卷积分割的任务、观察窗和“未知”依赖测试集人为留类。对开放世界检测,全卷积分割仅作近邻;支点仍是Joseph、Khan、Khan、Balasubramanian在CVPR的原始比较。
开放世界检测自己留下的反证入口是:“未知”依赖测试集人为留类,现实新奇可能是天气、视角或传感器变化。改用地点外资料复核时,Joseph、Khan、Khan、Balasubramanian的解释可能缩小、反号,或让位给全卷积分割的路径。全卷积分割给出复核CVPR的近邻条件:撤去界面提示再验;开放世界检测负责记录中止、排除和不显著对象。
ORE在VOC与COCO混合协议上同时评估已知检测、未知召回与持续学习改变登记顺序:图像、标签、掩码、视角与相机位姿归开放世界检测,遮挡、未知类、文化覆盖与传感器漂移交全卷积分割核查。2015年的全卷积分割以“把全连接层改成卷积并用跳连融合尺度,可端到端输出密集标签”作近邻;两者若结论不同,应以“未知”依赖测试集人为留类为分账边界;全卷积分割不得与本条合成一个平均分。
2021年,开放世界检测据ORE在VOC与COCO混合协议上同时评估已知检测、未知召回与持续学习对接第043号第二幕八。跨过去,“未知”依赖测试集人为留类迫使开放世界检测重新检验可见读数。开放世界检测以“未知”依赖测试集人为留类施加反向压力。该接口若仍支持相反方向,“未知”依赖测试集人为留类要求开放世界检测增加第三条件,同时容纳两边的失效样本。
十、多模态VLM:视觉问答必须把看见与推理分账Vision-Language Models
原论文正面碰到2023年的NeurIPS:Liu、Li、Wu、Lee不再允许计算机视觉在多模态VLM上继续把封闭集准确率当通用视觉能力。Liu、Li、Wu、Lee逐项核对图像、标签、掩码、视角与相机位姿里的多模态VLM;遮挡、未知类、文化覆盖与传感器漂移由计算机视觉里的KinectFusion另行登记。在NeurIPS的证据账上,由LLaVA以合成视觉指令数据获得有竞争力多模态对话和科学问答表现起步,计算机视觉里的KinectFusion进入解释对照;本条残差不能靠改名消失。
多模态VLM的可反驳立场是:视觉编码器与指令模型连接后,可用对话接口处理图像问题与任务迁移。Liu、Li、Wu、Lee这一路线据此把决定性解释锁在一个对象上,计算机视觉里的KinectFusion的“连续深度帧的相机跟踪与体素融合可实时建立室内稠密模型”不能替代本条;边界是语言先验会猜测未看见内容。若把人工接管计入结果仍不能保持方向,计算机视觉里的KinectFusion便构成多模态VLM的近邻反例;NeurIPS对多模态VLM仅支持原任务。
可核对的主证据是Liu、Li、Wu、Lee,2023 年《NeurIPS》36:34892–34916《Visual Instruction Tuning》:LLaVA以合成视觉指令数据获得有竞争力多模态对话和科学问答表现。计算机视觉里的KinectFusion要求把2023年的多模态VLM样本与对照结算,再核查计算机视觉里的KinectFusion的任务、观察窗和语言先验会猜测未看见内容。对多模态VLM,计算机视觉里的KinectFusion仅作近邻;支点仍是Liu、Li、Wu、Lee在NeurIPS的原始比较。
多模态VLM自己留下的反证入口是:语言先验会猜测未看见内容,综合分数需拆开OCR、定位、知识与推理。让替代路径进入对照时,Liu、Li、Wu、Lee的解释可能缩小、反号,或让位给计算机视觉里的KinectFusion的路径。计算机视觉里的KinectFusion给出复核NeurIPS的近邻条件:按亚组分别结算;多模态VLM负责记录中止、排除和不显著对象。
LLaVA以合成视觉指令数据获得有竞争力多模态对话和科学问答表现改变登记顺序:图像、标签、掩码、视角与相机位姿归多模态VLM,遮挡、未知类、文化覆盖与传感器漂移交计算机视觉里的KinectFusion核查。2011年的计算机视觉里的KinectFusion以“连续深度帧的相机跟踪与体素融合可实时建立室内稠密模型”作近邻;两者若结论不同,应以语言先验会猜测未看见内容为分账边界;计算机视觉里的KinectFusion不得与本条合成一个平均分。
2023年,多模态VLM据LLaVA以合成视觉指令数据获得有竞争力多模态对话和科学问答表现对接第044号第二幕十。跨过去,语言先验会猜测未看见内容迫使多模态VLM重新检验可见读数。多模态VLM以语言先验会猜测未看见内容施加反向压力。该接口若仍支持相反方向,语言先验会猜测未看见内容要求多模态VLM增加第三条件,同时容纳两边的失效样本。
十一、数据偏斜:视觉标签会把社会类别当作自然属性Dataset Bias and Fairness
方法转向发生在2018年的Proceedings of Machine Learning Research:Buolamwini 与 Gebru不再允许计算机视觉在数据偏斜上继续把封闭集准确率当通用视觉能力。Buolamwini 与 Gebru逐项核对图像、标签、掩码、视角与相机位姿里的数据偏斜;遮挡、未知类、文化覆盖与传感器漂移由图像字幕另行登记。在Proceedings of Machine Learning Research的证据账上,由Gender Shades发现深色女性错误率最高达34.7%起步,图像字幕进入解释对照;本条残差不能靠改名消失。
数据偏斜的可反驳立场是:商业性别分类在肤色与性别交叉群体上误差巨大不同,平均准确率掩盖伤害。Buolamwini 与 Gebru这一路线据此把决定性解释锁在一个对象上,图像字幕的“卷积编码器与语言解码器可从图像生成开放文本描述”不能替代本条;边界是二元性别标签和有限肤色标尺本身有边界。若审计数据近邻与泄漏仍不能保持方向,图像字幕便构成数据偏斜的近邻反例;Proceedings of Machine Learning Research对数据偏斜仅支持原任务。
可核对的主证据是Buolamwini 与 Gebru,2018 年《Proceedings of Machine Learning Research》81:77–91:Gender Shades发现深色女性错误率最高达34.7%,浅色男性低于1%。图像字幕要求把2018年的数据偏斜样本与对照结算,再核查图像字幕的任务、观察窗和二元性别标签和有限肤色标尺本身有边界。对数据偏斜,图像字幕仅作近邻;支点仍是Buolamwini 与 Gebru在Proceedings of Machine Learning Research的原始比较。回到Proceedings of Machine Learning Research的取样方式,数据偏斜要用图像字幕证明原分母没有删去最容易失败的对象。
数据偏斜自己留下的反证入口是:二元性别标签和有限肤色标尺本身有边界,修正数据不等于认可全部使用场景。把排除者放回分母时,Buolamwini 与 Gebru的解释可能缩小、反号,或让位给图像字幕的路径。图像字幕给出复核Proceedings of Machine Learning Research的近邻条件:改变任务顺序后追踪;数据偏斜负责记录中止、排除和不显著对象。
Gender Shades发现深色女性错误率最高达34.7%改变登记顺序:图像、标签、掩码、视角与相机位姿归数据偏斜,遮挡、未知类、文化覆盖与传感器漂移交图像字幕核查。2015年的图像字幕以“卷积编码器与语言解码器可从图像生成开放文本描述”作近邻;两者若结论不同,应以二元性别标签和有限肤色标尺本身有边界为分账边界;图像字幕不得与本条合成一个平均分。
2018年,数据偏斜据Gender Shades发现深色女性错误率最高达34.7%对接第258号第四条。跨过去,二元性别标签和有限肤色标尺本身有边界迫使数据偏斜重新检验可见读数。数据偏斜以二元性别标签和有限肤色标尺本身有边界施加反向压力。该接口若仍支持相反方向,二元性别标签和有限肤色标尺本身有边界要求数据偏斜增加第三条件,同时容纳两边的失效样本。
十二、合成真实性:检测伪造是一场生成器与分发链共同变化的竞赛Synthetic Media Detection
这项工作首先校正2023年的CVPR:Ojha、Li、Lee不再允许计算机视觉在合成真实性上继续把封闭集准确率当通用视觉能力。Ojha、Li、Lee逐项核对图像、标签、掩码、视角与相机位姿里的合成真实性;遮挡、未知类、文化覆盖与传感器漂移由视觉Transformer另行登记。在CVPR的证据账上,由利用视觉语言特征的检测器比专用二分类器更能迁移到未见生成模型起步,视觉Transformer进入解释对照;本条残差不能靠改名消失。
合成真实性的可反驳立场是:检测器应跨未见生成器、压缩和编辑评估,而非只识别训练模型指纹。Ojha、Li、Lee这一路线据此把决定性解释锁在一个对象上,视觉Transformer的“足够数据预训练下,弱化卷积先验的图块序列也能学习强视觉表示”不能替代本条;边界是平台压缩和新生成器会迅速改变分布。若先登记停止线再部署仍不能保持方向,视觉Transformer便构成合成真实性的近邻反例;CVPR对合成真实性仅支持原任务。
可核对的主证据是Ojha、Li、Lee,2023 年《CVPR》:24480–24489《Towards Universal Fake Image Detectors》:利用视觉语言特征的检测器比专用二分类器更能迁移到未见生成模型。视觉Transformer要求把2023年的合成真实性样本与对照结算,再核查视觉Transformer的任务、观察窗和平台压缩和新生成器会迅速改变分布。对合成真实性,视觉Transformer仅作近邻;支点仍是Ojha、Li、Lee在CVPR的原始比较。
合成真实性自己留下的反证入口是:平台压缩和新生成器会迅速改变分布,概率检测不能替代来源签名。固定资源预算后比较时,Ojha、Li、Lee的解释可能缩小、反号,或让位给视觉Transformer的路径。视觉Transformer给出复核CVPR的近邻条件:让独立团队预注册;合成真实性负责记录中止、排除和不显著对象。
利用视觉语言特征的检测器比专用二分类器更能迁移到未见生成模型改变登记顺序:图像、标签、掩码、视角与相机位姿归合成真实性,遮挡、未知类、文化覆盖与传感器漂移交视觉Transformer核查。2021年的视觉Transformer以“足够数据预训练下,弱化卷积先验的图块序列也能学习强视觉表示”作近邻;两者若结论不同,应以平台压缩和新生成器会迅速改变分布为分账边界;视觉Transformer不得与本条合成一个平均分。
2023年,合成真实性据利用视觉语言特征的检测器比专用二分类器更能迁移到未见生成模型对接第254号第二十条。跨过去,平台压缩和新生成器会迅速改变分布迫使合成真实性重新检验可见读数。合成真实性以平台压缩和新生成器会迅速改变分布施加反向压力。该接口若仍支持相反方向,平台压缩和新生成器会迅速改变分布要求合成真实性增加第三条件,同时容纳两边的失效样本。
◎ 二十年连起来看
第一幕不是旧成果清单,而是计算机视觉第一次为自己建立可失败的比较尺。计算机视觉里的SURF收紧了旧默认,计算机视觉里的AlexNet把隐含过程拆成可估参数,图像字幕又迫使一阶表现与二阶判断分账。三者共同做的事,是让一个名词只对一组明确读数和边界负责。
第二幕把问题从“能不能做出”推到“离开原样本是否还成立”。视觉Transformer扩展了表示或分布,单目深度基础模型改变了研究单位,合成真实性则把复现、异质性与失败样本放到一起结算。规模增大因而不再是胜利本身,它只是暴露新偏差的更大压力测试。
二十年的贯穿线是:知识的对象从一个平均结果,变成了“对象—路径—条件”三者绑定的证据体。计算机视觉里的ImageNet说明干预能改变路径,视觉语言合流说明单一读数会混合层级,多模态VLM又把信任、责任或接管写回结果。任何只剩下平均分的总结,都会丢掉这一变化。
◎ 三个常见误解
误解一:计算机视觉里的PASCAL VOC已经给出了稳定的通用解释。它容易取信,是因为共享图像、类别和评价协议使算法进步能被逐年比较确实改变了旧的研究方式。但封闭类别、网络照片和单一IoU阈值塑造了模型优化方向,所以正确表述只能限于原设计可识别的那一段责任链。
误解二:自监督视觉等于对隐藏机制的直读。这种误读来自可视化或可命名结果的强说服力,但教师—学生自蒸馏可在无标签图像中形成语义对象与部件表示仍只是一个可检验命题。增强定义了不变性,背景和拍摄习惯仍可成为捷径说明,没有干预、替代解释和边界样本,可读不等于因果正确。
误解三:数据偏斜的平均改善已足以支持个体决策或真实部署。平均值便于排名,却会把二元性别标签和有限肤色标尺本身有边界,修正数据不等于认可全部使用场景藏进分母。正确做法是分开报告覆盖率、边界组误差与失败后的修复成本。
◎ 与相邻领域的接口
计算机视觉里的SURF与第254号第九条“材质与外观获取”的分工在于:本页负责Hessian近似、积分图像与方向描述可在保持尺度旋转鲁棒时显著加速匹配,对方负责在另一对象上提供反号条件。两者只有在分母能够换算、失败样本都被保留时才构成接口。
计算机视觉里的KinectFusion可与第254号第七条“神经隐式几何表示”交换制度或工程中的回写证据。前者的核心命题是连续深度帧的相机跟踪与体素融合可实时建立室内稠密模型,但大空间漂移、动态物体和反光表面会破坏重建,设备深度范围有限;后者则能检验同一接口是否把选择成本转移给了另一个主体。
三维高斯泼溅与第254号第五条“三维高斯泼溅”共享的不是一个热门词,而是“同一表面结果是否来自同一内部路径”。本页用模型内存大、几何表面不显式且动态编辑困难,渲染好不等于重建真给出边界,对方若在不同尺度上给出相反结果,就必须重新定义两边共用的对象。
◎ 争议现场
计算机视觉里的R-CNN的争议是多阶段训练和每区域计算昂贵,候选器的漏检成为无法挽回上限。它要收敛,支持方和反对方必须在同一份预注册设计中预先指定替代解释,并在时间外样本同时报告主指标与失败分母。
视觉语言合流的争议是提示措辞、网络语料与文化覆盖决定类别边界,零样本并非零数据。要使这场争论离开命名之争,需要固定数据、训练预算和评价口径,再由独立团队对待比模型做参数恢复、消融或外部验证。
多模态VLM的争议是语言先验会猜测未看见内容,综合分数需拆开OCR、定位、知识与推理。收敛条件不是更多主观评分,而是公开误用、拒绝、中止与人工接管的逐例记录,检验平均收益是否靠边界个案承担成本。
◎ 往下五年看什么
到2031年,看视觉Transformer的方向保持数/全部预注册地点数,而不只看原基准分。若新地点保持率连续两轮下降,应降级其通用性声明。
看计算机视觉里的DETR在边界人群或未见任务中的覆盖率/全部目标对象数。若总分上升而边界覆盖不变,进步只发生在原来容易的部分。
看开放世界检测的单位成功所消耗的数据、计算、专业劳动或随访成本。若成本翻倍而独立信息增量趋近于零,就不能把规模扩大写成理论进展。
看合成真实性的失败样本是否真正反向改写下一版基准、指南或部署停止线。若失败仅被记录而不改变任何决策,可复现性仍是报告技术,不是自我修正机制。
◎ 可与哪些领域对撞
计算机视觉里的SURF与第254号第九条“材质与外观获取”共享“可见读数能代表真实对象”的预设。本条用重复纹理、弱纹理与大视角变化仍会失败,快速手工不变性也会删除任务线索给出反向证据。对方却在另一类对象上要求更高的可见量。若两边都成立,就必须新增“读数何时获得对象资格”这个第三变量。
图像字幕与第253号第九条“自然语言作为界面”共享“局部表现能够结算整体能力”的预设。图像字幕主张卷积编码器与语言解码器可从图像生成开放文本描述。对方的实证却可能要求把能力与真实使用分开。两者同时成立将推出:能力只有在路径和环境共同允许时才能显露。
三维高斯泼溅与第254号第五条“三维高斯泼溅”共享“一个命名能稳定指向同一内部结构”的预设。本条的反对点是模型内存大、几何表面不显式且动态编辑困难,渲染好不等于重建真。对方若在相邻领域仍能得到可复现的结构,两边就不是互相否定。真正的新命题是:结构的同一性必须由可交换的失效条件来定义。
◎ 十条可做的研究命题
- 在时间外数据上重做计算机视觉里的SURF;方向保持率低于二分之一即证伪其稳定性。
- 把计算机视觉里的PASCAL VOC的中止与排除对象放回分母;主效应反号即否定原总结。
- 为计算机视觉里的ImageNet配置等数据、等计算或等专业劳动对照;优势消失即说明增益来自资源。
- 由独立团队预注册计算机视觉里的AlexNet的参数恢复;不同参数组合产生同一输出即证伪唯一机制。
- 对计算机视觉里的R-CNN的边界亚组单报覆盖率;优势仅来自排除困难样本即否定普适性。
- 主动改变全卷积分割的测量或反馈界面;行为随界面系统改变即证明测量已回写对象。
- 对自监督视觉做反事实干预;可视化不随关键参数变化即证伪忠实性。
- 把单目深度基础模型交给另一地点用正交量纲复测;两量纲方向相反即停止合并总分。
- 公开数据偏斜的最强失败实现;下一方法只在原基准改善即判定为换题。
- 为合成真实性事先登记放弃条件;失败后仍不改变结论或部署即证伪自我修正能力。
◎ 资料核验
- Bay、Tuytelaars、Van Gool,2006 年《ECCV》3951:404–417,DOI 10.1007/11744023_32。
- Everingham 等,2010 年《International Journal of Computer Vision》88:303–338,DOI 10.1007/s11263-009-0275-4。
- Deng、Dong、Socher、Li、Li、Fei-Fei,2009 年《CVPR》:248–255,DOI 10.1109/CVPR.2009.5206848。
- Krizhevsky、Sutskever、Hinton,2012 年《NeurIPS》25:1097–1105。
- Girshick、Donahue、Darrell、Malik,2014 年《CVPR》:580–587,DOI 10.1109/CVPR.2014.81。
- Long、Shelhamer、Darrell,2015 年《CVPR》:3431–3440,DOI 10.1109/CVPR.2015.7298965。
- Newcombe 等,2011 年《ISMAR》:127–136,DOI 10.1109/ISMAR.2011.6092378。
- Vinyals、Toshev、Bengio、Erhan,2015 年《CVPR》:3156–3164,DOI 10.1109/CVPR.2015.7298935。
- Dosovitskiy 等,2021 年《ICLR》论文“An Image Is Worth 16×16 Words”。
- Kirillov 等,2023 年《ICCV》:4015–4026,DOI 10.1109/ICCV51070.2023.00371。
- Caron 等,2021 年《ICCV》:9650–9660,DOI 10.1109/ICCV48922.2021.00951。
- Radford 等,2021 年《ICML》139:8748–8763。
- Carion 等,2020 年《ECCV》12346:213–229,DOI 10.1007/978-3-030-58452-8_13。
- Mildenhall 等,2020 年《ECCV》12346:405–421,DOI 10.1007/978-3-030-58452-8_24。
- Yang 等,2024 年《CVPR》论文“Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data”。
- Kerbl、Kopanas、Leimkühler、Drettakis,2023 年《ACM TOG》42(4):139,DOI 10.1145/3592433。
- Joseph、Khan、Khan、Balasubramanian,2021 年《CVPR》:5830–5840,DOI 10.1109/CVPR46437.2021.00577。
- Liu、Li、Wu、Lee,2023 年《NeurIPS》36:34892–34916《Visual Instruction Tuning》。
- Buolamwini 与 Gebru,2018 年《Proceedings of Machine Learning Research》81:77–91。
- Ojha、Li、Lee,2023 年《CVPR》:24480–24489《Towards Universal Fake Image Detectors》。
- Kirillov 等,2023 年《ICCV》:4015–4026《Segment Anything》。
- Liu、Li、Li、Lee,2024 年《CVPR》:26296–26306“Improved Baselines with Visual Instruction Tuning”。
- Brooks 等,2024 年 arXiv:2402.17177《Video Generation Models as World Simulators》。
- Liang 等,2024 年 arXiv:2407.03418《Holistic Evaluation of Multimodal Foundation Models》。
以下二十条是计算机视觉在 1950 至 2006 年之间形成的经典思想,与上文二十条合成双层面板。每条用原始材料和后续修订说明旧前提,并点名它在本块哪条现代判断里继续被使用或反对。
经一、图灵测试与机器智能Classic 01 · Computer Vision
在1950年前后的图灵测试与机器智能提出之前,计算机视觉常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第1条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是以可观察对话表现替代对机器是否真正思考的本体争论。第1条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查图灵测试与机器智能,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第1条经典与本块甲“SURF:积分图像把局部不变特征推到实时尺度”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第1条就退回1950年的适用域;经典身份不能代替新证据。
经二、感知机学习规则Classic 02 · Computer Vision
在1958年前后的感知机学习规则提出之前,计算机视觉常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第2条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是线性阈值单元可按分类误差调整权重并学习可分模式。第2条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查感知机学习规则,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第2条经典与本块乙“PASCAL VOC:检测与分割第一次有共同赛场”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第2条就退回1958年的适用域;经典身份不能代替新证据。
经三、Widrow-Hoff最小均方学习Classic 03 · Computer Vision
在1960年前后的Widrow-Hoff最小均方学习提出之前,计算机视觉常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第3条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是沿均方误差梯度更新权重可让线性自适应单元在线收敛。第3条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查Widrow-Hoff最小均方学习,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第3条经典与本块丙“ImageNet:千类百万图把表示学习变成规模问题”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第3条就退回1960年的适用域;经典身份不能代替新证据。
经四、多层数据处理网络Classic 04 · Computer Vision
在1965年前后的多层数据处理网络提出之前,计算机视觉常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第4条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是逐层生成并筛选多项式单元可构造早期深层自组织模型。第4条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查多层数据处理网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第4条经典与本块丁“AlexNet:卷积网络接管大规模识别”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第4条就退回1965年的适用域;经典身份不能代替新证据。
经五、感知机表示局限Classic 05 · Computer Vision
在1969年前后的感知机表示局限提出之前,计算机视觉常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第5条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是单层感知机无法表示异或与某些连通性质,结构能力须与训练成功分开。第5条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查感知机表示局限,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第5条经典与本块戊“R-CNN:候选区域与深特征把检测重新组合”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第5条就退回1969年的适用域;经典身份不能代替新证据。
经六、误差反向传播论文Classic 06 · Computer Vision
在1974年前后的误差反向传播论文提出之前,计算机视觉常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第6条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是链式求导可把输出误差分配给多层网络内部权重。第6条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查误差反向传播论文,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第6条经典与本块己“全卷积分割:像素级预测不再依赖手工区域”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第6条就退回1974年的适用域;经典身份不能代替新证据。
经七、Neocognitron卷积层级Classic 07 · Computer Vision
在1980年前后的Neocognitron卷积层级提出之前,计算机视觉常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第7条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是局部感受野与下采样层级可获得对平移较稳定的视觉识别。第7条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查Neocognitron卷积层级,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第7条经典与本块庚“KinectFusion:消费级深度相机实现实时三维重建”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第7条就退回1980年的适用域;经典身份不能代替新证据。
经八、Hopfield联想记忆Classic 08 · Computer Vision
在1982年前后的Hopfield联想记忆提出之前,计算机视觉常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第8条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是对称连接网络可沿能量下降收敛到存储模式并完成内容寻址。第8条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查Hopfield联想记忆,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第8条经典与本块辛“图像字幕:视觉表示第一次接上自然语言解码器”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第8条就退回1982年的适用域;经典身份不能代替新证据。
经九、玻尔兹曼机Classic 09 · Computer Vision
在1985年前后的玻尔兹曼机提出之前,计算机视觉常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第9条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是随机隐变量网络可用自由相与钳制相统计差学习概率分布。第9条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查玻尔兹曼机,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第9条经典与本块一“视觉Transformer:图像图块可直接进入自注意力”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第9条就退回1985年的适用域;经典身份不能代替新证据。
经十、多层反向传播复兴Classic 10 · Computer Vision
在1986年前后的多层反向传播复兴提出之前,计算机视觉常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第10条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是反向传播误差可让多层网络学习分布式内部表示。第10条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查多层反向传播复兴,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第10条经典与本块二“可提示分割:点、框和粗掩码成为通用视觉接口”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第10条就退回1986年的适用域;经典身份不能代替新证据。
经十一、卷积网络识别手写数字Classic 11 · Computer Vision
在1989年前后的卷积网络识别手写数字提出之前,计算机视觉常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第11条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是共享卷积核与反向传播把图像局部结构转成端到端分类器。第11条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查卷积网络识别手写数字,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第11条经典与本块三“自监督视觉:不同视图一致性取代全部人工标签”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第11条就退回1989年的适用域;经典身份不能代替新证据。
经十二、简单循环网络Classic 12 · Computer Vision
在1990年前后的简单循环网络提出之前,计算机视觉常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第12条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是把上一时刻隐状态回送网络可从序列预测中学习时间结构。第12条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查简单循环网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第12条经典与本块四“视觉语言合流:自然语言把封闭类别表打开”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第12条就退回1990年的适用域;经典身份不能代替新证据。
经十三、支持向量机Classic 13 · Computer Vision
在1995年前后的支持向量机提出之前,计算机视觉常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第13条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是最大间隔与核函数把分类复杂度集中到边界支持向量。第13条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查支持向量机,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第13条经典与本块五“DETR:检测被改写成集合匹配而非候选框管线”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第13条就退回1995年的适用域;经典身份不能代替新证据。
经十四、长短期记忆网络Classic 14 · Computer Vision
在1997年前后的长短期记忆网络提出之前,计算机视觉常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第14条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是门控记忆单元为梯度提供近恒定通道并缓解长序列遗忘。第14条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查长短期记忆网络,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第14条经典与本块六“NeRF:连续坐标网络把多视图照片变成可渲染场景”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第14条就退回1997年的适用域;经典身份不能代替新证据。
经十五、LeNet文档识别系统Classic 15 · Computer Vision
在1998年前后的LeNet文档识别系统提出之前,计算机视觉常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第15条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是卷积、池化和梯度训练可组成部署级手写文档识别流水线。第15条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查LeNet文档识别系统,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第15条经典与本块七“单目深度基础模型:相对几何可跨数据集迁移”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第15条就退回1998年的适用域;经典身份不能代替新证据。
经十六、核方法统一Classic 16 · Computer Vision
在2002年前后的核方法统一提出之前,计算机视觉常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第16条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是正定核把非线性学习转为高维特征空间中的凸优化。第16条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)重新检查核方法统一,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第16条经典与本块八“三维高斯泼溅:显式点基元换来实时新视角”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第16条就退回2002年的适用域;经典身份不能代替新证据。
经十七、Isomap流形学习Classic 17 · Computer Vision
在2000年前后的Isomap流形学习提出之前,计算机视觉常把免疫反应看成均质体液强弱,阴性对象和成功对象没有进入同一份账。第17条把问题压到一条可被重复检查的人物史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是邻域图上的测地距离可恢复高维数据的低维流形坐标。第17条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)重新检查Isomap流形学习,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第17条经典与本块九“开放世界检测:未知类别必须被拒绝或逐步纳入”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第17条就退回2000年的适用域;经典身份不能代替新证据。
经十八、对比散度Classic 18 · Computer Vision
在2002年前后的对比散度提出之前,计算机视觉常把群体平均值当作每个患者,阴性对象和成功对象没有进入同一份账。第18条把问题压到一条可被重复检查的机制史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是短步马尔可夫链可近似能量模型似然梯度并显著降低训练成本。第18条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)重新检查对比散度,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第18条经典与本块十“多模态VLM:视觉问答必须把看见与推理分账”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第18条就退回2002年的适用域;经典身份不能代替新证据。
经十九、GPU通用流式计算Classic 19 · Computer Vision
在2004年前后的GPU通用流式计算提出之前,计算机视觉常把实验室阳性直接当作临床因果,阴性对象和成功对象没有进入同一份账。第19条把问题压到一条可被重复检查的测量史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是把程序表达为数据流内核可将图形处理器用于一般并行数值计算。第19条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444重新检查GPU通用流式计算,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第19条经典与本块十一“数据偏斜:视觉标签会把社会类别当作自然属性”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第19条就退回2004年的适用域;经典身份不能代替新证据。
经二十、深层信念网络逐层预训练Classic 20 · Computer Vision
在2006年前后的深层信念网络逐层预训练提出之前,计算机视觉常把提出者声望当作适用范围,阴性对象和成功对象没有进入同一份账。第20条把问题压到一条可被重复检查的制度史路径:先固定样本和操作,再规定哪一个读数会让解释失败。它的硬命题是逐层无监督训练再微调可让多层生成网络越过随机初始化困难。第20条路线没有终结争论,却把术语背后的对象、装置与时间窗暴露出来,使后来研究能够逐项复算而不是只援引权威。
后续由Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)重新检查深层信念网络逐层预训练,保留可迁移的结构,同时把原始材料没有覆盖的疾病、物种和组织另列。把第20条经典与本块十二“合成真实性:检测伪造是一场生成器与分发链共同变化的竞赛”对读,可见现代层继承了哪一项定义,又在哪个边界上改写旧前提。若纳入原研究排除者、延长观察窗或更换组织后主要排序翻转,第20条就退回2006年的适用域;经典身份不能代替新证据。
◎ 这一层怎么用
先按“今用”或“异名”找到上文对应的现代条,再比较两条的对象、分母与停止规则。若它们只共享名词而不共享失败对象,就只登记为异名;若量纲可以逐项换算,再判断现代条究竟继承、修正还是反转了经典命题。
经典身份不提供豁免。提出年份只决定它属于哪一层;后续综述、反例和新装置负责划出今天仍可使用的边界。量纲字段保留“∶”,使跨年代与跨领域的读数能够先对齐分母再碰撞。
◎ 经典层资料核验
- Turing AM. Computing machinery and intelligence. Mind 59 (1950): 433–460。
- Rosenblatt F. The perceptron: A probabilistic model for information storage and organization in the brain. Psychological Review 65 (1958): 386–408。
- Widrow B, Hoff ME. Adaptive switching circuits. IRE WESCON Convention Record 4 (1960): 96–104。
- Ivakhnenko AG, Lapa VG. Cybernetic Predicting Devices. CCM Information (1965)。
- Minsky M, Papert S. Perceptrons. MIT Press (1969)。
- Werbos PJ. Beyond Regression: New Tools for Prediction and Analysis in the Behavioral Sciences. Harvard PhD thesis (1974)。
- Fukushima K. Neocognitron: A self-organizing neural network model for pattern recognition unaffected by shift in position. Biological Cybernetics 36 (1980): 193–202。
- Hopfield JJ. Neural networks and physical systems with emergent collective computational abilities. Proceedings of the National Academy of Sciences 79 (1982): 2554–2558。
- Ackley DH, Hinton GE, Sejnowski TJ. A learning algorithm for Boltzmann machines. Cognitive Science 9 (1985): 147–169。
- Rumelhart DE, Hinton GE, Williams RJ. Learning representations by back-propagating errors. Nature 323 (1986): 533–536。
- LeCun Y et al. Backpropagation applied to handwritten zip code recognition. Neural Computation 1 (1989): 541–551。
- Elman JL. Finding structure in time. Cognitive Science 14 (1990): 179–211。
- Cortes C, Vapnik V. Support-vector networks. Machine Learning 20 (1995): 273–297。
- Hochreiter S, Schmidhuber J. Long short-term memory. Neural Computation 9 (1997): 1735–1780。
- LeCun Y et al. Gradient-based learning applied to document recognition. Proceedings of the IEEE 86 (1998): 2278–2324。
- Scholkopf B, Smola AJ. Learning with Kernels. MIT Press (2002)。
- Tenenbaum JB, de Silva V, Langford JC. A global geometric framework for nonlinear dimensionality reduction. Science 290 (2000): 2319–2323。
- Hinton GE. Training products of experts by minimizing contrastive divergence. Neural Computation 14 (2002): 1771–1800。
- Buck I et al. Brook for GPUs: Stream computing on graphics hardware. ACM Transactions on Graphics 23 (2004): 777–786。
- Hinton GE, Osindero S, Teh YW. A fast learning algorithm for deep belief nets. Neural Computation 18 (2006): 1527–1554。
- Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press (2016)。
- Russell S, Norvig P. Artificial Intelligence: A Modern Approach, 4th ed. Pearson (2021)。
- Bishop CM, Bishop H. Deep Learning: Foundations and Concepts. Springer (2024)。
- LeCun Y, Bengio Y, Hinton G. Deep learning. Nature 521 (2015): 436–444。
- Sutton RS, Barto AG. Reinforcement Learning, 2nd ed. MIT Press (2018)。
- Nilsson NJ. Learning Machines. McGraw-Hill (1965)。
- Rumelhart DE, McClelland JL. Parallel Distributed Processing. MIT Press (1986)。
- Hertz J, Krogh A, Palmer RG. Introduction to the Theory of Neural Computation. Addison-Wesley (1991)。
- Bishop CM. Neural Networks for Pattern Recognition. Oxford University Press (1995)。
- Vapnik VN. Statistical Learning Theory. Wiley (1998)。
- Haykin S. Neural Networks, 2nd ed. Prentice Hall (1999)。
- Cristianini N, Shawe-Taylor J. An Introduction to Support Vector Machines. Cambridge University Press (2000)。
- Bishop CM. Pattern Recognition and Machine Learning. Springer (2006)。
核验说明:提出栏优先保留原始论文、专著或正式文集;流变栏列具体的后续专著、综述或重建工作。2006 年后的文献只用于说明修订,不改变经典条的入选年份。