数据科学
数据科学的二十年转向,不是从“小数据”简单走向“大数据”,而是从把数据当作现成原料,转向把数据的生产、标注、流动、版本、部署和反馈视为一个持续运行的系统。第一幕建立了分布式计算、最终一致性、协变量漂移、群众标注、在线实验、数据血缘、概念漂移与技术债八个新对象;它们共同证明,数据规模一旦扩张,错误主要不再发生在单个模型公式里,而发生在管线、时间和组织接口上。第二幕则清算“只要模型更强、数据更多就会更好”的直觉:公平性存在不可兼得约束,数据集需要说明书,亚群会被整体指标遮蔽,训练资料会重复、污染和反馈,合成数据也不能自动同时满足隐私、真实性与效用。这二十条把数据科学从一次性建模改写为全生命周期科学:一个结果必须能回答数据从哪来、谁被排除、何时漂移、怎样被系统重新写回世界。
第一幕的共同动作,是把计算、存储、标注与实验平台从后台基础设施提升为知识生成条件;数据不再是静态表格,而是带时序、来源和组织行为的过程。
甲、MapReduce把计算移到数据旁边MapReduce and Data-Local Parallelism
早期并行分析要求程序员显式管理分区、通信、故障与负载均衡,算法在一台机器上正确并不意味着能在数千节点上运行;磁盘搬运成本常超过计算本身。在2008年前后,围绕“MapReduce把计算移到数据旁边”出现的异常把这一旧默认推到前台。就“MapReduce把计算移到数据旁边”而言,这使旧框架在样本扩张、尺度变化或干预发生时失去可比性,研究对象本身必须重新界定。
把任务限制为map生成键值对、reduce聚合同键结果,运行时即可把代码调度到数据所在节点,并以重执行处理普通机器故障。输入被切成分片,map输出按键洗牌,reduce独立聚合;主控记录任务状态,慢节点可投机执行,系统用确定性重算替代昂贵的全局恢复。MapReduce and Data-Local Parallelism由此给出一条可检验的因果或结构主张。在数据科学的“MapReduce把计算移到数据旁边”问题上,其关键不是给现象换名,而是给出可以跨样本比较的控制量,并明确何时不再适用。
Dean与Ghemawat在2008年报告Google集群上的实践,一次作业可跨数千台普通服务器处理TB级数据;论文中的排序任务以约1TB输入展示数据本地性和失败重执行如何维持吞吐。围绕“MapReduce把计算移到数据旁边”,这组2008年前后的观测至少包含两个可复核锚点。以“MapReduce把计算移到数据旁边”为例,结果把概念争论压成了可测差异:若更换数据、仪器或边界后该比例消失,理论就失去支撑。
Stonebraker等指出,MapReduce缺少模式、索引和查询优化,对迭代与连接密集任务效率低;同一抽象不能替代并行数据库,文件系统与批处理边界也会拖慢交互分析。到2010年前后的后续工作,“MapReduce把计算移到数据旁边”的争点已从“是否存在”转到“在哪个边界失效”。围绕“MapReduce把计算移到数据旁边”这条命题,只要这些混杂未被分离,相关性仍可能很强,却不能据此宣称机制已经确定。
这条抽象催生Hadoop生态,并把“算法是否可并行”改成“数据怎样分区、洗牌和恢复”;数据科学团队开始把计算图、存储布局和网络流量一并设计。在2010年前后的数据系统实践中,MapReduce把计算移到数据旁边因此改变了至少一个数据、实验或解释环节。就“MapReduce把计算移到数据旁边”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第351号高性能并行计算面板相比,本条强调容错数据流而非峰值浮点;与第250号数据库面板的区别,是批处理可扩展性与声明式查询的取舍。到2010年的接口比较中,另见第054号面板所用的相邻术语,但本条保留数据科学自己的证据口径。在数据科学的“MapReduce把计算移到数据旁边”问题上,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
乙、最终一致性承认分布式系统不必共享一个即时现在Eventual Consistency and Tunable Coordination
传统数据库把单一串行顺序视为正确性的默认,跨地域复制却会遇到网络分区和节点失联;若每次写入都等待全球共识,购物车、日志和社交数据会因局部故障整体停摆。在2007年前后,围绕“最终一致性承认分布式系统不必共享一个即时现在”出现的异常把这一旧默认推到前台。在数据科学的“最终一致性承认分布式系统不必共享一个即时现在”问题上,当这一遗漏进入真实数据后,误差不再只是数值偏差,而会改变研究者认定的因果方向与边界。
对某些应用,正确性不是所有副本即时相等,而是冲突可检测、版本可合并且最终收敛;一致性、可用性与延迟应按业务不变量分层选择。Dynamo用一致性哈希、向量时钟、quorum读写与应用侧冲突合并维持高可用;后续系统把事务分解为不需全局协调的局部不变量。Eventual Consistency and Tunable Coordination由此给出一条可检验的因果或结构主张。以“最终一致性承认分布式系统不必共享一个即时现在”为例,与旧框架相比,新增的不是更多参数,而是一个能够区分竞争机制的次序判据。
DeCandia等2007年描述Amazon购物车在N个副本中以R、W阈值调节一致性,R+W>N时提高读到最新版本的概率;系统在节点失效时仍接受写入,再以read repair和hinted handoff收敛。围绕“最终一致性承认分布式系统不必共享一个即时现在”,这组2007年前后的观测至少包含两个可复核锚点。围绕“最终一致性承认分布式系统不必共享一个即时现在”这条命题,在这一证据链中,年份、样本规模与不确定区间共同限制了结论能够外推到多远。
“最终”没有固定时限,冲突合并也可能把业务错误永久化;金融余额、唯一名额和权限撤销需要更强约束,开发者若不知道读到旧值的概率,就会把一致性选择当作性能开关。到2014年前后的后续工作,“最终一致性承认分布式系统不必共享一个即时现在”的争点已从“是否存在”转到“在哪个边界失效”。就“最终一致性承认分布式系统不必共享一个即时现在”而言,这也解释了为什么相同标题的研究可能得到相反结果:它们实际上测量了不同分母。
数据建模由表结构扩展到不变量分类,团队需要逐字段决定可否并发、如何合并和多旧算不可接受;这也推动CRDT、因果一致性和可用事务研究。在2014年前后的数据系统实践中,最终一致性承认分布式系统不必共享一个即时现在因此改变了至少一个数据、实验或解释环节。在数据科学的“最终一致性承认分布式系统不必共享一个即时现在”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第054号分布式系统与区块链面板共享CAP问题,但本条强调数据产品的口径后果;与第250号数据库面板相接时,数据科学必须知道特征表读到的是哪个版本。到2014年的接口比较中,另见第054号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
丙、协变量漂移把训练集与部署集区分成两个分布Covariate Shift and Importance-Weighted Learning
机器学习评估默认训练、验证和未来数据同分布,随机切分因此被当作部署性能代理;现实中医院、地区、季节和用户入口会改变协变量构成。在2007年前后,围绕“协变量漂移把训练集与部署集区分成两个分布”出现的异常把这一旧默认推到前台。以“协变量漂移把训练集与部署集区分成两个分布”为例,于是,原本被放在脚注里的条件开始主导结论,继续沿用旧近似会把系统性差异误写成随机波动。
训练分布与目标分布必须分别建模;若条件机制保持,目标风险可用w(x)=p_target(x)/p_train(x)对训练损失加权估计。重要性加权交叉验证让模型选择面向目标分布,密度比可直接估计而不分别拟合两个高维密度;漂移诊断则比较特征与误差随时间的联合变化。Covariate Shift and Importance-Weighted Learning由此给出一条可检验的因果或结构主张。围绕“协变量漂移把训练集与部署集区分成两个分布”这条命题,这一转向的实质,是把默认假设从不可见背景变成可以单独操纵和计量的实验变量。
Sugiyama等2007年证明,在纯协变量漂移下加权验证可无偏估计目标风险;Recht等2019年重新采集约一万张ImageNet测试图,多个分类器准确率相对原测试集下降约11—14个百分点。围绕“协变量漂移把训练集与部署集区分成两个分布”,这组2007年前后的观测至少包含两个可复核锚点。就“协变量漂移把训练集与部署集区分成两个分布”而言,由此得到的并非无条件常数,而是一个带样本、时间与误差范围的经验阈值。
p(y\|x)常与p(x)一起变化,密度比在无重叠区域会发散;高维漂移检测可能发现统计差异却无法判断业务重要性,重新加权也不能创造训练中没有的样本。到2019年前后的后续工作,“协变量漂移把训练集与部署集区分成两个分布”的争点已从“是否存在”转到“在哪个边界失效”。在数据科学的“协变量漂移把训练集与部署集区分成两个分布”问题上,争论能否收敛,取决于是否在同一协议下同时测量竞争变量,而不是各自选择有利数据。
模型上线后需要持续保存特征分布、标签延迟和亚群误差,验证集由一次性文件变成带时间戳的目标样本;再训练触发条件也从固定周期转为漂移与性能联合阈值。在2019年前后的数据系统实践中,协变量漂移把训练集与部署集区分成两个分布因此改变了至少一个数据、实验或解释环节。以“协变量漂移把训练集与部署集区分成两个分布”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第257号统计学的漂移共形相接时,本条先诊断系统分布改变,统计学再修复覆盖;与第309号时间序列规划面板相比,漂移可以是结构断点而非平稳预测问题。到2019年的接口比较中,另见第257号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
丁、群众标注把标签从真值改成带偏差的测量Crowd Labels as Noisy Measurements
数据集常把人工标签视为无误真值,质量控制只靠多数票或少量专家复核;但歧义任务中,分歧可能来自系统性视角、能力差异或标签定义不清。在2008年前后,围绕“群众标注把标签从真值改成带偏差的测量”出现的异常把这一旧默认推到前台。围绕“群众标注把标签从真值改成带偏差的测量”这条命题,这一矛盾说明,问题不在仪器或算法还不够精细,而在旧对象定义把关键自由度排除在外。
标注者是测量仪器,每个人有不同敏感度、特异度和偏好;真值、难度与标注者可靠性应在同一潜变量模型中估计。EM或贝叶斯模型交替估计项目真值和混淆矩阵,多维模型还允许标注者在不同概念轴上擅长不同,而不是压成一个全局准确率。Crowd Labels as Noisy Measurements由此给出一条可检验的因果或结构主张。就“群众标注把标签从真值改成带偏差的测量”而言,这一说法把机制、测量与决策连在一起,使支持证据必须同时满足方向、量级与顺序三项约束。
Snow等2008年在五项NLP任务中比较Mechanical Turk与专家标签,发现每项合并约4—10名非专家后可接近专家一致性;Welinder等2010年进一步用多维能力模型识别不同错误类型。围绕“群众标注把标签从真值改成带偏差的测量”,这组2008年前后的观测至少包含两个可复核锚点。在数据科学的“群众标注把标签从真值改成带偏差的测量”问题上,因此,证据不是一条漂亮曲线,而是一组可以在独立数据中重新计算的数量关系。
若专家本身没有唯一标准,多数模型会把少数但合理的解释当噪声;平台激励、文化与任务说明改变标签分布,估计出的“可靠性”也可能只是与主流一致。到2010年前后的后续工作,“群众标注把标签从真值改成带偏差的测量”的争点已从“是否存在”转到“在哪个边界失效”。以“群众标注把标签从真值改成带偏差的测量”为例,因此,本条的边界不是一句“仍需研究”,而是当上述条件被满足时,原命题应明确退出。
数据集构建开始保存原始多标签、置信度和标注者元数据,训练目标可使用软标签或分歧分布;标签指南从一次性说明升级为不断修订的测量协议。在2010年前后的数据系统实践中,群众标注把标签从真值改成带偏差的测量因此改变了至少一个数据、实验或解释环节。围绕“群众标注把标签从真值改成带偏差的测量”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第146号心理测量学面板相比,本条把标注者当评定者而非受试者;与第253号人机交互面板相接时,界面设计会直接改变标签误差结构。到2010年的接口比较中,另见第146号面板所用的相邻术语,但本条保留数据科学自己的证据口径。就“群众标注把标签从真值改成带偏差的测量”而言,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
戊、在线实验把产品变化变成持续因果基础设施Online Controlled Experiments as Product Infrastructure
互联网产品依赖设计经验、焦点小组和前后对比,用户量增长却让极小效应也有商业意义;同时节日、营销与用户成熟度会让简单时间比较失真。在2009年前后,围绕“在线实验把产品变化变成持续因果基础设施”出现的异常把这一旧默认推到前台。就“在线实验把产品变化变成持续因果基础设施”而言,从那以后,领域内真正需要比较的就不再是单个中心值,而是不同条件下结构是否仍保持。
把用户随机分配到并行版本,以预先指定主指标、护栏与实验单位持续评估;组织应把实验平台视为产品开发的共同基础设施。哈希分流保持用户稳定分组,触发分析区分被随机化者与实际暴露者,方差降低和序贯监测提高效率,AA测试检查平台本身是否偏置。Online Controlled Experiments as Product Infrastructure由此给出一条可检验的因果或结构主张。在数据科学的“在线实验把产品变化变成持续因果基础设施”问题上,如果该命题成立,同一对象在不同尺度上的读数应能通过明确的比率、阈值或结构量相互换算。
Kohavi等2009年汇总网页实验经验,指出大量“显然会赢”的改动实际上不改善指标;2013年大规模平台把单次实验扩展到数百万用户,并用样本比失配检测分流故障。围绕“在线实验把产品变化变成持续因果基础设施”,这组2009年前后的观测至少包含两个可复核锚点。以“在线实验把产品变化变成持续因果基础设施”为例,数字本身不是终点,更要紧的是它规定了后续复现必须保留的分母与对照条件。
短期点击可能牺牲长期留存,网络效应和共享库存会违反个体独立;同时运行的实验发生交互,指标选择也可能把可测行为替代真正价值。到2013年前后的后续工作,“在线实验把产品变化变成持续因果基础设施”的争点已从“是否存在”转到“在哪个边界失效”。围绕“在线实验把产品变化变成持续因果基础设施”这条命题,截至后续复核,最稳妥的结论仍是限定性的,而不是把一个局部机制升级为普遍定律。
产品决策由最高职位的意见转向实验组合,数据科学家承担指标设计、分流审计与停止规则;负结果成为节省开发成本的可积累知识。在2013年前后的数据系统实践中,在线实验把产品变化变成持续因果基础设施因此改变了至少一个数据、实验或解释环节。就“在线实验把产品变化变成持续因果基础设施”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第148号市场营销面板相比,本条强调随机化产品行为而非态度调查;与第257号统计学的e值相接时,可控制持续查看造成的假阳性。到2013年的接口比较中,另见第148号面板所用的相邻术语,但本条保留数据科学自己的证据口径。在数据科学的“在线实验把产品变化变成持续因果基础设施”问题上,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
己、数据血缘把结果与变换历史绑定Data Provenance and Lineage Semantics
分析表经过连接、过滤、聚合和手工修正后,最终数字通常只保留值;当结果异常或需删除某个来源时,团队无法追溯哪些输出受影响。在2007年前后,围绕“数据血缘把结果与变换历史绑定”出现的异常把这一旧默认推到前台。在数据科学的“数据血缘把结果与变换历史绑定”问题上,旧模型能够描述平均情形,却无法解释极端样本、局部亚群与时间变化同时出现时的失败。
数据项应携带可组合的provenance注释,查询运算同时变换值与来源表达式;血缘不是日志附属物,而是查询语义的一部分。provenance semiring用加法表示替代来源、乘法表示联合依赖,使选择、投影、连接和聚合后的来源表达式仍可代数化组合。Data Provenance and Lineage Semantics由此给出一条可检验的因果或结构主张。以“数据血缘把结果与变换历史绑定”为例,它把一个可被反驳的关系放到中心:只要控制变量改变而预言方向不变,命题就应当失败。
Green等2007年证明关系查询可在半环上统一why-provenance、how-provenance与计数;Cheney等2009年整理“为什么出现、来自哪里、怎样产生”三类问题及其复杂度。围绕“数据血缘把结果与变换历史绑定”,这组2007年前后的观测至少包含两个可复核锚点。围绕“数据血缘把结果与变换历史绑定”这条命题,这一设计尤其重要,因为它把先验上相似的两种解释放进同一套观测口径中比较。
字段级血缘会迅速膨胀,外部脚本、人工判断和机器学习训练难以完整捕捉;记录了来源也不保证来源正确,隐私删除与血缘保留还可能冲突。到2009年前后的后续工作,“数据血缘把结果与变换历史绑定”的争点已从“是否存在”转到“在哪个边界失效”。就“数据血缘把结果与变换历史绑定”而言,这场争论留下的价值,恰是把失败条件写得比成功故事更清楚。
现代数据仓库、特征平台和模型注册表开始保存从原始源到指标与模型的有向图;事故响应可按影响范围回溯,而不再全量重跑或人工猜测。在2009年前后的数据系统实践中,数据血缘把结果与变换历史绑定因此改变了至少一个数据、实验或解释环节。在数据科学的“数据血缘把结果与变换历史绑定”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第250号数据库面板相比,本条关注来源语义而非查询效率;与第194号档案与数字保存面板相接时,版本和出处成为长期可解释性的共同对象。到2009年的接口比较中,另见第250号面板所用的相邻术语,但本条保留数据科学自己的证据口径。以“数据血缘把结果与变换历史绑定”为例,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
庚、概念漂移把模型衰退解释为生成过程变化Concept Drift in Streaming Data
离线建模默认一个固定训练分布,性能下降常被归咎于代码、硬件或样本噪声;信用欺诈、传感与用户行为却会因对手、季节和政策改变标签机制。在2014年前后,围绕“概念漂移把模型衰退解释为生成过程变化”出现的异常把这一旧默认推到前台。以“概念漂移把模型衰退解释为生成过程变化”为例,这类反例累积后,研究者不得不承认:背景条件不是噪声,背景条件就是命题的一部分。
漂移不是单一现象,应区分协变量变化、先验变化与概念变化,并用时间窗口、漂移检测器或在线集成在不同速度下更新模型。检测器监控误差均值、分布距离或预测残差,短窗口快速响应突变,长窗口保留稳定知识;自适应集成按近期表现增减成员。Concept Drift in Streaming Data由此给出一条可检验的因果或结构主张。围绕“概念漂移把模型衰退解释为生成过程变化”这条命题,由此,理论不再允许事后挑选解释,在数据到来之前,它已经规定了什么结果会构成反证。
Gama等2014年综述DDM、EDDM、ADWIN等方法,ADWIN以自适应窗口比较两个子窗口均值并在差异超过置信界时切割;后续评测显示无一检测器对所有突变、渐变和循环漂移最优。围绕“概念漂移把模型衰退解释为生成过程变化”,这组2014年前后的观测至少包含两个可复核锚点。就“概念漂移把模型衰退解释为生成过程变化”而言,这些读数的意义在于,它们同时给出了效应方向、可重复尺度和旧模型开始失真的位置。
标签常延迟数周或根本不可得,误差漂移无法及时计算;业务规则改变会同时影响数据与评价指标,频繁重训也可能追逐短期噪声并遗忘稀有事件。到2019年前后的后续工作,“概念漂移把模型衰退解释为生成过程变化”的争点已从“是否存在”转到“在哪个边界失效”。在数据科学的“概念漂移把模型衰退解释为生成过程变化”问题上,边界条件一旦越过,理论预测应当发生符号、阈值或排序上的可见改变,否则它只是叙述。
生产系统开始给模型设“有效期”、漂移告警与回滚策略,数据监控从输入统计扩展到标签、校准和决策后果;模型版本因此成为时间对象。在2019年前后的数据系统实践中,概念漂移把模型衰退解释为生成过程变化因此改变了至少一个数据、实验或解释环节。以“概念漂移把模型衰退解释为生成过程变化”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第309号时间序列面板相比,本条关心预测规则本身何时变质;与第257号统计学的漂移共形相接时,检测与覆盖修复构成前后两层。到2019年的接口比较中,另见第309号面板所用的相邻术语,但本条保留数据科学自己的证据口径。围绕“概念漂移把模型衰退解释为生成过程变化”这条命题,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
辛、机器学习技术债把模型外部依赖视为主要复杂度Hidden Technical Debt in Machine Learning Systems
项目评审常以离线准确率和模型结构判断成熟度,训练脚本只占代码小部分却被当作产品核心;数据源、特征复用、监控和回滚没有统一责任人。在2015年前后,围绕“机器学习技术债把模型外部依赖视为主要复杂度”出现的异常把这一旧默认推到前台。围绕“机器学习技术债把模型外部依赖视为主要复杂度”这条命题,因此,新的问题不是在旧公式上再加一项修正,而是重新决定什么算一次观测、一次状态或一次机制。
ML系统会积累纠缠数据依赖、隐藏反馈、未使用特征、实验代码路径和配置债;局部模型改进可能在系统层制造长期维护成本。特征和标签通过共享管线耦合,模型输出又改变未来输入;任何上游列含义或延迟变化都可能无编译错误地改变预测,因此需要测试、版本和所有权边界。Hidden Technical Debt in Machine Learning Systems由此给出一条可检验的因果或结构主张。就“机器学习技术债把模型外部依赖视为主要复杂度”而言,它因此把“看起来相关”推进到“改变哪个量会先改变哪个结果”的层面。
Sculley等2015年用Google生产经验列出“胶水代码、管线丛林、纠缠和纠正级联”等模式,指出模型代码常只是系统的一小部分;2022年案例综述显示数据与组织接口是部署失败的高频来源。围绕“机器学习技术债把模型外部依赖视为主要复杂度”,这组2015年前后的观测至少包含两个可复核锚点。在数据科学的“机器学习技术债把模型外部依赖视为主要复杂度”问题上,这一步使领域第一次能够区分“模型拟合得好”与“模型抓住了生成机制”。
“技术债”是诊断隐喻而非统一度量,团队可能借此拒绝必要创新;并非所有依赖都应消除,过度模块化会增加延迟和协调成本。到2022年前后的后续工作,“机器学习技术债把模型外部依赖视为主要复杂度”的争点已从“是否存在”转到“在哪个边界失效”。以“机器学习技术债把模型外部依赖视为主要复杂度”为例,后续研究若只增加样本而不改变识别设计,通常只能缩小错误答案的置信区间。
MLOps、特征库、模型注册表和持续验证由此兴起,生产就绪度开始用测试覆盖、回滚时间、数据契约和监控缺口衡量,而非只看排行榜。在2022年前后的数据系统实践中,机器学习技术债把模型外部依赖视为主要复杂度因此改变了至少一个数据、实验或解释环节。围绕“机器学习技术债把模型外部依赖视为主要复杂度”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第255号软件工程面板相比,本条强调数据与模型的静默耦合;与第154号信息系统与数字化转型面板相接时,责任结构与技术结构共同决定债务。到2022年的接口比较中,另见第255号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
第二幕进一步追问系统上线之后怎样伤害或欺骗自己的评估:公平、文档、亚群、污染、反馈与持续测试成为比单次榜单更重要的判据。
一、公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到Fairness Impossibility Trade-offs
算法公平最初常被表述为“去掉敏感属性”或让总体准确率相近,默认所有合理公平指标能够共同实现;风险评分争论却显示不同群体的基准率会把指标拉向相反方向。在2017年前后,围绕“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”出现的异常把这一旧默认推到前台。就“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”而言,这使旧框架在样本扩张、尺度变化或干预发生时失去可比性,研究对象本身必须重新界定。
当群体真实阳性率不同且预测并非完美时,群体内校准与错误率平等通常不能同时成立;公平选择必须明确承担哪一种错误由谁承受。校准要求同一分数在各群体对应相同风险,错误率平等要求阈值后的假阳性或假阴性相等;基准率代数关系使两者在非完美预测下冲突。Fairness Impossibility Trade-offs由此给出一条可检验的因果或结构主张。在数据科学的“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”问题上,其关键不是给现象换名,而是给出可以跨样本比较的控制量,并明确何时不再适用。
Kleinberg等2017年给出一般不可能性证明;Chouldechova同年用再犯风险评分展示,若分数在群体内校准而基准率不同,假阳性率与假阴性率必然出现差异。围绕“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”,这组2017年前后的观测至少包含两个可复核锚点。以“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”为例,结果把概念争论压成了可测差异:若更换数据、仪器或边界后该比例消失,理论就失去支撑。
定理不决定社会应选择哪个指标,也不涵盖资源分配、程序正义和历史标签偏差;把价值冲突简化成数学约束可能遮蔽标签本身的不公。到2017年前后的后续工作,“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”的争点已从“是否存在”转到“在哪个边界失效”。围绕“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”这条命题,只要这些混杂未被分离,相关性仍可能很强,却不能据此宣称机制已经确定。
公平评估由单一“偏差分数”转成多指标权衡与利益相关方决策,模型卡需要说明阈值、基准率和错误成本,而不能只宣布“公平”。在2017年前后的数据系统实践中,公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到因此改变了至少一个数据、实验或解释环节。就“公平性不可能三角证明“一个分数同时满足所有正义指标”通常做不到”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第172号数据与隐私法面板相比,本条给出指标不可兼得的数学结构;与第083号法理法学面板相接时,选择哪类错误仍是规范问题。
二、模型卡把用途、亚群与失败条件写进产品接口Model Cards for Model Reporting
模型通常以一个名称、总体指标和下载链接发布,使用者看不到训练人群、阈值、亚群误差或预期用途;同一权重被移到不同场景时,失败被归咎于“误用”。在2019年前后,围绕“模型卡把用途、亚群与失败条件写进产品接口”出现的异常把这一旧默认推到前台。在数据科学的“模型卡把用途、亚群与失败条件写进产品接口”问题上,当这一遗漏进入真实数据后,误差不再只是数值偏差,而会改变研究者认定的因果方向与边界。
模型应有结构化说明书,至少覆盖模型详情、预期用途、评价因素、指标、训练与评价数据、伦理考虑和限制;文档是接口而非宣传附件。报告按人口群体、环境和阈值切分指标,明确out-of-scope使用,并把版本、许可和维护责任与模型权重绑定。Model Cards for Model Reporting由此给出一条可检验的因果或结构主张。以“模型卡把用途、亚群与失败条件写进产品接口”为例,与旧框架相比,新增的不是更多参数,而是一个能够区分竞争机制的次序判据。
Mitchell等2019年提出model cards并以人脸与图像模型展示分组报告;后续基础模型讨论把文档扩展到训练数据规模、能源、滥用与下游不可预见风险。围绕“模型卡把用途、亚群与失败条件写进产品接口”,这组2019年前后的观测至少包含两个可复核锚点。围绕“模型卡把用途、亚群与失败条件写进产品接口”这条命题,在这一证据链中,年份、样本规模与不确定区间共同限制了结论能够外推到多远。
卡片可被写成合规文案,指标选择仍由发布者控制;大型通用模型的下游用途无法穷举,文档也不会自动触发重新评估或停止使用。到2021年前后的后续工作,“模型卡把用途、亚群与失败条件写进产品接口”的争点已从“是否存在”转到“在哪个边界失效”。就“模型卡把用途、亚群与失败条件写进产品接口”而言,这也解释了为什么相同标题的研究可能得到相反结果:它们实际上测量了不同分母。
采购、监管和内部上线审批开始要求模型卡、变更记录与已知失败案例;版本升级不再只比较平均分,还要比较旧亚群与禁用场景是否恶化。在2021年前后的数据系统实践中,模型卡把用途、亚群与失败条件写进产品接口因此改变了至少一个数据、实验或解释环节。在数据科学的“模型卡把用途、亚群与失败条件写进产品接口”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第492号监管科学与标准化面板相比,本条提供技术产品的证据容器;与第193号知识组织面板相接时,模型文档成为可检索元数据。到2021年的接口比较中,另见第492号面板所用的相邻术语,但本条保留数据科学自己的证据口径。以“模型卡把用途、亚群与失败条件写进产品接口”为例,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
三、数据表说明书把数据集从“下载文件”改成有历史的研究对象Datasheets and Data Cards for Datasets
数据集名称常替代了对采样过程的说明,研究者只知道训练/测试大小和类别数;谁被漏掉、标签怎样定义、许可是否允许再利用往往不可见。在2021年前后,围绕“数据表说明书把数据集从“下载文件”改成有历史的研究对象”出现的异常把这一旧默认推到前台。以“数据表说明书把数据集从“下载文件”改成有历史的研究对象”为例,于是,原本被放在脚注里的条件开始主导结论,继续沿用旧近似会把系统性差异误写成随机波动。
像电子元件一样,数据集需要标准化datasheet,记录生命周期中的决策与责任;评估者应把采集史和缺失模式视为模型性能的一部分。问题清单覆盖动机、组成、收集、预处理、用途、分发与维护,data card再用分层模块服务研究者、产品经理和受影响群体。Datasheets and Data Cards for Datasets由此给出一条可检验的因果或结构主张。围绕“数据表说明书把数据集从“下载文件”改成有历史的研究对象”这条命题,这一转向的实质,是把默认假设从不可见背景变成可以单独操纵和计量的实验变量。
Gebru等2021年给出数据表模板并分析文档如何暴露代表性和许可问题;Pushkarna等2022年在真实团队中使用Data Cards,展示同一数据需要面向不同读者提供粒度不同的证据。围绕“数据表说明书把数据集从“下载文件”改成有历史的研究对象”,这组2021年前后的观测至少包含两个可复核锚点。就“数据表说明书把数据集从“下载文件”改成有历史的研究对象”而言,由此得到的并非无条件常数,而是一个带样本、时间与误差范围的经验阈值。
文档依赖创建者诚实与持续维护,历史数据的关键信息可能已丢失;表格过长会被机械填写,公开采集细节还可能与隐私和安全冲突。到2022年前后的后续工作,“数据表说明书把数据集从“下载文件”改成有历史的研究对象”的争点已从“是否存在”转到“在哪个边界失效”。在数据科学的“数据表说明书把数据集从“下载文件”改成有历史的研究对象”问题上,争论能否收敛,取决于是否在同一协议下同时测量竞争变量,而不是各自选择有利数据。
数据发布流程开始设置文档门槛、版本号与维护者,基准评审也从“是否可下载”转向“是否可追溯、可合法复用、可识别边界”。在2022年前后的数据系统实践中,数据表说明书把数据集从“下载文件”改成有历史的研究对象因此改变了至少一个数据、实验或解释环节。以“数据表说明书把数据集从“下载文件”改成有历史的研究对象”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第194号档案与数字保存面板相比,本条强调模型使用所需的采集语境;与第172号隐私法面板相接时,说明书不能替代同意与合法基础。到2022年的接口比较中,另见第194号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
四、隐藏分层证明总体高分可以遮蔽临床重要亚型Hidden Stratification in Benchmark Data
基准数据把复杂疾病或物体压成一个标签,总体AUC被视为部署性能;只要大类样本多,罕见亚型的系统错误会被平均值稀释。在2020年前后,围绕“隐藏分层证明总体高分可以遮蔽临床重要亚型”出现的异常把这一旧默认推到前台。围绕“隐藏分层证明总体高分可以遮蔽临床重要亚型”这条命题,这一矛盾说明,问题不在仪器或算法还不够精细,而在旧对象定义把关键自由度排除在外。
数据标签的本体粒度决定模型能看见哪些失败;必须在临床、形态或来源亚群上分层评估,而不能把类别内异质性当随机噪声。通过专家复标、聚类和错误审计识别大类内部亚型,再比较各亚型敏感度;模型可能学习大类中最容易的视觉代理而忽略真正严重的子型。Hidden Stratification in Benchmark Data由此给出一条可检验的因果或结构主张。就“隐藏分层证明总体高分可以遮蔽临床重要亚型”而言,这一说法把机制、测量与决策连在一起,使支持证据必须同时满足方向、量级与顺序三项约束。
Oakden-Rayner等2020年在医学影像任务中展示,模型对同一大类的不同病理亚型性能相差显著;Seyyed-Kalantari等2021年发现胸片算法对服务不足人群存在系统性漏诊偏差。围绕“隐藏分层证明总体高分可以遮蔽临床重要亚型”,这组2020年前后的观测至少包含两个可复核锚点。在数据科学的“隐藏分层证明总体高分可以遮蔽临床重要亚型”问题上,因此,证据不是一条漂亮曲线,而是一组可以在独立数据中重新计算的数量关系。
事后切分过多亚群会造成小样本与假发现,亚型定义也可能随专家和医院变化;公平分层并不自动告诉系统应如何重加权或改变阈值。到2021年前后的后续工作,“隐藏分层证明总体高分可以遮蔽临床重要亚型”的争点已从“是否存在”转到“在哪个边界失效”。以“隐藏分层证明总体高分可以遮蔽临床重要亚型”为例,因此,本条的边界不是一句“仍需研究”,而是当上述条件被满足时,原命题应明确退出。
模型验证开始包含错误聚类、最差组准确率和临床严重度加权,数据采集也会针对漏诊亚型补样;整体AUC不再足以通过上线门槛。在2021年前后的数据系统实践中,隐藏分层证明总体高分可以遮蔽临床重要亚型因此改变了至少一个数据、实验或解释环节。围绕“隐藏分层证明总体高分可以遮蔽临床重要亚型”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第109号病理与诊断学面板相接时,本条要求诊断标签保留形态亚型;与第050号计算机视觉面板相比,关注标签层级而非网络架构。到2021年的接口比较中,另见第109号面板所用的相邻术语,但本条保留数据科学自己的证据口径。就“隐藏分层证明总体高分可以遮蔽临床重要亚型”而言,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
五、数据级联揭示上游小失真会在高风险系统中逐层放大Data Cascades in High-Stakes AI
AI项目管理常把“数据准备”视为一次性低技能工作,主要资源投入模型调参与发布;上游缺失、临时标签和跨团队误解直到上线后才暴露。在2021年前后,围绕“数据级联揭示上游小失真会在高风险系统中逐层放大”出现的异常把这一旧默认推到前台。就“数据级联揭示上游小失真会在高风险系统中逐层放大”而言,从那以后,领域内真正需要比较的就不再是单个中心值,而是不同条件下结构是否仍保持。
数据问题具有级联结构:局部、低可见的采集或定义错误会通过特征、模型、评估和决策逐层传播,并在后端形成高成本修复。级联由组织边界维持,数据生产者、模型团队和领域专家使用不同成功指标;缺少反馈渠道使早期假设无法被后续失败反向修正。Data Cascades in High-Stakes AI由此给出一条可检验的因果或结构主张。在数据科学的“数据级联揭示上游小失真会在高风险系统中逐层放大”问题上,如果该命题成立,同一对象在不同尺度上的读数应能通过明确的比率、阈值或结构量相互换算。
Sambasivan等2021年访谈53名来自印度、非洲和拉美的高风险AI从业者,归纳出触发、放大和可见化级联的模式;Scheuerman等分析视觉数据集如何把学科价值写进类别与采样。围绕“数据级联揭示上游小失真会在高风险系统中逐层放大”,这组2021年前后的观测至少包含两个可复核锚点。以“数据级联揭示上游小失真会在高风险系统中逐层放大”为例,数字本身不是终点,更要紧的是它规定了后续复现必须保留的分母与对照条件。
访谈模式不能给每类级联统一效应量,组织也可能把所有失败泛称为“数据问题”而逃避模型和治理责任;某些级联只能在事后观察。到2021年前后的后续工作,“数据级联揭示上游小失真会在高风险系统中逐层放大”的争点已从“是否存在”转到“在哪个边界失效”。围绕“数据级联揭示上游小失真会在高风险系统中逐层放大”这条命题,截至后续复核,最稳妥的结论仍是限定性的,而不是把一个局部机制升级为普遍定律。
数据工作开始设置领域审查、问题追踪与回流机制,项目里程碑不再只验模型分数,还要验标签定义、代表性与修复成本。在2021年前后的数据系统实践中,数据级联揭示上游小失真会在高风险系统中逐层放大因此改变了至少一个数据、实验或解释环节。就“数据级联揭示上游小失真会在高风险系统中逐层放大”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第154号信息系统与数字化转型面板相比,本条聚焦数据生产链;与第152号人力资源管理面板相接时,角色地位与激励决定错误能否被报告。到2021年的接口比较中,另见第245号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
六、再采样基准证明“同名测试集”也会发生分布变化Benchmark Resampling and Dataset Shift
公开基准被当作固定标尺,模型改进以小数点后的准确率累积;测试集长期公开后,研究选择、调参和数据泄漏会逐步适应这一个有限样本。在2019年前后,围绕“再采样基准证明“同名测试集”也会发生分布变化”出现的异常把这一旧默认推到前台。在数据科学的“再采样基准证明“同名测试集”也会发生分布变化”问题上,旧模型能够描述平均情形,却无法解释极端样本、局部亚群与时间变化同时出现时的失败。
基准性能是模型与具体测试样本共同生成的,必须通过重采样、时间外测试和污染审计检验;同任务名称不保证同一难度分布。沿原数据集的类别与采集标准重新招募样本,比较模型在旧、新测试集上的性能与排序;时间戳和训练语料搜索用于识别任务污染。Benchmark Resampling and Dataset Shift由此给出一条可检验的因果或结构主张。以“再采样基准证明“同名测试集”也会发生分布变化”为例,它把一个可被反驳的关系放到中心:只要控制变量改变而预言方向不变,命题就应当失败。
Recht等2019年重建ImageNet与CIFAR测试集,多个模型绝对准确率显著下降但相对排序部分保持;Li与Flanigan 2024年发现训练时间前发布的任务表现异常更高,并用成员推断支持污染解释。围绕“再采样基准证明“同名测试集”也会发生分布变化”,这组2019年前后的观测至少包含两个可复核锚点。围绕“再采样基准证明“同名测试集”也会发生分布变化”这条命题,这一设计尤其重要,因为它把先验上相似的两种解释放进同一套观测口径中比较。
新采集很难完全复刻旧协议,性能下降也可能来自采样者与标注细节改变;污染证据并不等于模型没有迁移能力,真正干净的任务常更难且样本更小。到2024年前后的后续工作,“再采样基准证明“同名测试集”也会发生分布变化”的争点已从“是否存在”转到“在哪个边界失效”。就“再采样基准证明“同名测试集”也会发生分布变化”而言,这场争论留下的价值,恰是把失败条件写得比成功故事更清楚。
排行榜开始要求隐藏测试、滚动更新、数据卡和污染声明;“刷新测试集后保留多少改进”成为比旧榜单峰值更强的进展证据。在2024年前后的数据系统实践中,再采样基准证明“同名测试集”也会发生分布变化因此改变了至少一个数据、实验或解释环节。在数据科学的“再采样基准证明“同名测试集”也会发生分布变化”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第496号开放科学面板相接时,公开测试促进复现却增加适应风险;与第256号自然语言处理面板相比,本条把任务污染视为数据制度而非某一模型缺陷。到2024年的接口比较中,另见第496号面板所用的相邻术语,但本条保留数据科学自己的证据口径。以“再采样基准证明“同名测试集”也会发生分布变化”为例,这种接口防止本块把相邻领域已经完成的工作重讲一遍,同时保留本领域独有的测量与失效条件。
七、生产就绪测试把模型质量扩展到数据、监控和回滚ML Test Scores and Production Readiness
传统软件测试假设代码逻辑决定输出,ML系统却可能在代码不变时因数据漂移而失效;离线精度高的模型常缺少训练可重现、特征检查和回滚路径。在2017年前后,围绕“生产就绪测试把模型质量扩展到数据、监控和回滚”出现的异常把这一旧默认推到前台。以“生产就绪测试把模型质量扩展到数据、监控和回滚”为例,这类反例累积后,研究者不得不承认:背景条件不是噪声,背景条件就是命题的一部分。
生产质量必须按多项测试维度量化,包括特征预期、训练—服务偏差、模型陈旧度、切片性能、数值稳定、可重现与故障恢复。ML test score把每个能力分级,数据模式与统计阈值在训练前后自动验证,模型注册表保存工件与依赖,影子部署和金丝雀发布控制上线风险。ML Test Scores and Production Readiness由此给出一条可检验的因果或结构主张。围绕“生产就绪测试把模型质量扩展到数据、监控和回滚”这条命题,由此,理论不再允许事后挑选解释,在数据到来之前,它已经规定了什么结果会构成反证。
Breck等2017年提出28项左右的测试清单,并用等级区分研究原型与生产系统;TFX等平台随后把数据验证、转换、训练、评估和服务串成可重复管线。围绕“生产就绪测试把模型质量扩展到数据、监控和回滚”,这组2017年前后的观测至少包含两个可复核锚点。就“生产就绪测试把模型质量扩展到数据、监控和回滚”而言,这些读数的意义在于,它们同时给出了效应方向、可重复尺度和旧模型开始失真的位置。
清单容易被游戏化,测试数量不等于风险覆盖;罕见灾难、社会伤害和反馈回路无法由常规单元测试充分模拟,平台成熟也不能补偿错误目标。到2019年前后的后续工作,“生产就绪测试把模型质量扩展到数据、监控和回滚”的争点已从“是否存在”转到“在哪个边界失效”。在数据科学的“生产就绪测试把模型质量扩展到数据、监控和回滚”问题上,边界条件一旦越过,理论预测应当发生符号、阈值或排序上的可见改变,否则它只是叙述。
上线评审由单一模型指标改成证据包,团队可以量化“为什么不能上线”;回滚时间、监控覆盖和训练复现率成为与准确率并列的工程读数。在2019年前后的数据系统实践中,生产就绪测试把模型质量扩展到数据、监控和回滚因此改变了至少一个数据、实验或解释环节。以“生产就绪测试把模型质量扩展到数据、监控和回滚”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第255号软件工程面板的持续交付共享自动测试,但本条增加数据分布与模型切片;与第245号系统工程面板相接时,模型是需要验证确认的子系统。到2019年的接口比较中,另见第255号面板所用的相邻术语,但本条保留数据科学自己的证据口径。围绕“生产就绪测试把模型质量扩展到数据、监控和回滚”这条命题,这一关系也提供了反例:相邻领域若在同样条件下得到相反方向,就说明还存在未建模的第三变量。
八、数据集制图用训练动力学区分容易、模糊与误标样本Dataset Cartography from Training Dynamics
数据清洗通常按静态启发式删异常,默认每个样本对训练贡献相同;仅看最终损失无法区分模型一开始就学会的容易样本、反复摇摆的边界样本和始终不匹配的误标样本。在2020年前后,围绕“数据集制图用训练动力学区分容易、模糊与误标样本”出现的异常把这一旧默认推到前台。围绕“数据集制图用训练动力学区分容易、模糊与误标样本”这条命题,因此,新的问题不是在旧公式上再加一项修正,而是重新决定什么算一次观测、一次状态或一次机制。
记录每个训练样本跨epoch的目标标签置信度,可把数据映射为easy-to-learn、ambiguous和hard-to-learn区域;不同区域对泛化与分布外性能贡献不同。数据图以平均置信度为横轴、标准差为纵轴,训练轨迹替代单次分数;有选择地重采样或人工审计可测试哪些区域携带决策边界信息。Dataset Cartography from Training Dynamics由此给出一条可检验的因果或结构主张。就“数据集制图用训练动力学区分容易、模糊与误标样本”而言,它因此把“看起来相关”推进到“改变哪个量会先改变哪个结果”的层面。
Swayamdipta等2020年在NLI与文本任务中发现,训练只用模糊样本可保留较强分布外泛化,而只用容易样本虽快却降低鲁棒性;Northcutt等2021年在十个常用测试集中发现广泛标签错误。围绕“数据集制图用训练动力学区分容易、模糊与误标样本”,这组2020年前后的观测至少包含两个可复核锚点。在数据科学的“数据集制图用训练动力学区分容易、模糊与误标样本”问题上,这一步使领域第一次能够区分“模型拟合得好”与“模型抓住了生成机制”。
图形依赖具体模型、初始化和训练计划,同一样本可对一个架构容易、对另一个困难;hard-to-learn也可能是重要少数而非误标,自动删除会扩大偏差。到2021年前后的后续工作,“数据集制图用训练动力学区分容易、模糊与误标样本”的争点已从“是否存在”转到“在哪个边界失效”。以“数据集制图用训练动力学区分容易、模糊与误标样本”为例,后续研究若只增加样本而不改变识别设计,通常只能缩小错误答案的置信区间。
数据质量从“是否重复、是否缺失”扩展到“模型怎样经历这个样本”,主动学习和标注复核可按动力学分层,而不是只按低置信度排序。在2021年前后的数据系统实践中,数据集制图用训练动力学区分容易、模糊与误标样本因此改变了至少一个数据、实验或解释环节。围绕“数据集制图用训练动力学区分容易、模糊与误标样本”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第047号机器学习理论面板相比,本条把训练轨迹用于审计数据;与第146号心理测量学相接时,模糊样本类似区分度高但难度适中的题目。到2021年的接口比较中,另见第047号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
九、去重与污染审计证明训练数据规模不能按原始token计数Deduplication and Benchmark Contamination Audits
网页语料常以抓取总量表示规模,默认重复只是存储浪费;模板转载、镜像站和测试题泄漏却会让少数文本被训练数百次,模型表现掺入记忆优势。在2022年前后,围绕“去重与污染审计证明训练数据规模不能按原始token计数”出现的异常把这一旧默认推到前台。就“去重与污染审计证明训练数据规模不能按原始token计数”而言,这使旧框架在样本扩张、尺度变化或干预发生时失去可比性,研究对象本身必须重新界定。
有效数据量应按独立内容和来源多样性计量;近重复去除、时间切分和基准搜索是训练前的统计控制,而非发布后的附加检查。MinHash、局部敏感哈希和n-gram索引识别近重复,文档来源与时间戳用于隔离测试;污染审计比较模型在训练截止日前后任务的异常差异。Deduplication and Benchmark Contamination Audits由此给出一条可检验的因果或结构主张。在数据科学的“去重与污染审计证明训练数据规模不能按原始token计数”问题上,其关键不是给现象换名,而是给出可以跨样本比较的控制量,并明确何时不再适用。
Lee等2022年在语言模型语料上去重后减少逐字记忆并改善评价;Elazar等ICLR 2024检查大型公开语料,报告部分数据集中约一半文档为重复,并发现GLUE等基准污染。围绕“去重与污染审计证明训练数据规模不能按原始token计数”,这组2022年前后的观测至少包含两个可复核锚点。以“去重与污染审计证明训练数据规模不能按原始token计数”为例,结果把概念争论压成了可测差异:若更换数据、仪器或边界后该比例消失,理论就失去支撑。
语义近重复难以设阈值,删得过强会去掉合法引用、少数语言和重要重复模式;训练语料不公开时污染只能间接推断,不能把所有高分都归因于泄漏。到2024年前后的后续工作,“去重与污染审计证明训练数据规模不能按原始token计数”的争点已从“是否存在”转到“在哪个边界失效”。围绕“去重与污染审计证明训练数据规模不能按原始token计数”这条命题,只要这些混杂未被分离,相关性仍可能很强,却不能据此宣称机制已经确定。
数据规模报告开始增加独立文档数、重复率、来源集中度和基准匹配率;模型比较也需要区分记忆、迁移和任务熟悉度。在2024年前后的数据系统实践中,去重与污染审计证明训练数据规模不能按原始token计数因此改变了至少一个数据、实验或解释环节。就“去重与污染审计证明训练数据规模不能按原始token计数”而言,由此形成的新责任链要求把中心读数与适用范围一起发布,避免只传播最醒目的平均值。
与第256号自然语言处理面板相比,本条管理训练语料证据;与第193号图书情报面板相接时,版本、转载与来源聚合成为有效样本量的一部分。到2024年的接口比较中,另见第353号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
十、检索增强生成把知识存储从参数内部拆到可更新语料库Retrieval-Augmented Generation
语言模型把训练语料压进参数,知识更新时间、出处与纠错路径不可见;重新训练成本高,模型还会在不知道答案时生成流畅但无依据的文本。在2020年前后,围绕“检索增强生成把知识存储从参数内部拆到可更新语料库”出现的异常把这一旧默认推到前台。在数据科学的“检索增强生成把知识存储从参数内部拆到可更新语料库”问题上,当这一遗漏进入真实数据后,误差不再只是数值偏差,而会改变研究者认定的因果方向与边界。
将可微或稠密检索器与生成器联合训练,回答由输入问题和检索文档共同条件化;知识库可独立更新,检索结果提供可审计中间层。双编码器把问题与段落映射到向量,top-k文档进入seq2seq生成;边际化多个文档概率或FiD式跨文档注意力整合证据。Retrieval-Augmented Generation由此给出一条可检验的因果或结构主张。以“检索增强生成把知识存储从参数内部拆到可更新语料库”为例,与旧框架相比,新增的不是更多参数,而是一个能够区分竞争机制的次序判据。
Lewis等2020年在开放域问答与事实生成中使用约2100万Wikipedia段落,RAG在多项知识密集任务上超过纯参数模型;后续检索增强模型用数十到上百段文档改善少样本表现。围绕“检索增强生成把知识存储从参数内部拆到可更新语料库”,这组2020年前后的观测至少包含两个可复核锚点。围绕“检索增强生成把知识存储从参数内部拆到可更新语料库”这条命题,在这一证据链中,年份、样本规模与不确定区间共同限制了结论能够外推到多远。
检索到错误或恶意文档会把来源显式错误传给生成,top-k遗漏也无法由生成器修复;引用存在不等于陈述被文档支持,知识库版本与权限仍需治理。到2022年前后的后续工作,“检索增强生成把知识存储从参数内部拆到可更新语料库”的争点已从“是否存在”转到“在哪个边界失效”。就“检索增强生成把知识存储从参数内部拆到可更新语料库”而言,这也解释了为什么相同标题的研究可能得到相反结果:它们实际上测量了不同分母。
数据科学工作由训练一次模型扩展到构建索引、切分文档、评估召回和维护来源;模型更新可以先改知识库,但系统质量必须同时测检索与生成。在2022年前后的数据系统实践中,检索增强生成把知识存储从参数内部拆到可更新语料库因此改变了至少一个数据、实验或解释环节。在数据科学的“检索增强生成把知识存储从参数内部拆到可更新语料库”问题上,这一变化也重排了资源投入:校准、负结果和边界测试开始与追求更高峰值同等重要。
与第353号信息检索与推荐面板共享向量检索,本条强调检索作为生成证据;与第044号基础模型面板相比,知识不再完全封装在参数中。到2022年的接口比较中,另见第353号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
十一、合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明The Synthetic-Data Privacy–Utility–Fidelity Trilemma
合成表格和图像常被宣传为“不是原数据所以天然匿名”,评价只比较边际分布或下游准确率;模型可能记忆罕见记录,视觉相似也不等于统计任务可用。在2022年前后,围绕“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”出现的异常把这一旧默认推到前台。以“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”为例,于是,原本被放在脚注里的条件开始主导结论,继续沿用旧近似会把系统性差异误写成随机波动。
合成数据必须分开评估隐私攻击风险、统计保真与任务效用,三者存在结构性权衡;没有单一距离可以同时证明安全与有用。成员推断和属性推断测试隐私,边际/联合分布比较保真,下游任务与置信区间比较效用;差分隐私训练提供预算但会压平稀有模式。The Synthetic-Data Privacy–Utility–Fidelity Trilemma由此给出一条可检验的因果或结构主张。围绕“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”这条命题,这一转向的实质,是把默认假设从不可见背景变成可以单独操纵和计量的实验变量。
Stadler等2022年系统攻击多类合成数据方法,显示看似匿名的数据仍可泄露成员信息,且强匿名化常显著降低分析效用;PATE-GAN用教师投票与噪声给出形式隐私但需要额外预算选择。围绕“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”,这组2022年前后的观测至少包含两个可复核锚点。就“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”而言,由此得到的并非无条件常数,而是一个带样本、时间与误差范围的经验阈值。
攻击集不可能覆盖所有未来对手,效用又依赖具体任务;对少数群体的保真与隐私尤其冲突,平均分布接近可能掩盖尾部消失。到2022年前后的后续工作,“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”的争点已从“是否存在”转到“在哪个边界失效”。在数据科学的“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”问题上,争论能否收敛,取决于是否在同一协议下同时测量竞争变量,而不是各自选择有利数据。
合成数据发布开始附威胁模型、隐私预算、下游任务和亚群保真表;“可自由共享”不再由生成方法名称自动推出。在2022年前后的数据系统实践中,合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明因此改变了至少一个数据、实验或解释环节。以“合成数据三难说明隐私、效用与逼真度不能用一张相似度图同时证明”为例,它使该领域的工作流从“先算结果、再解释异常”转成“先登记条件、再决定结果是否可比”。
与第172号数据隐私法面板相比,本条给出技术风险测试;与第045号生成模型面板相接时,生成质量只是三个目标之一。到2022年的接口比较中,另见第172号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
十二、反馈回路证明预测会改变自己未来要预测的数据Performative Prediction and Runaway Feedback
监督学习把数据分布视为外生,模型只观察世界而不改变世界;信用、推荐和警务系统的决策却会影响谁被检查、谁获得机会以及未来标签怎样产生。在2020年前后,围绕“反馈回路证明预测会改变自己未来要预测的数据”出现的异常把这一旧默认推到前台。围绕“反馈回路证明预测会改变自己未来要预测的数据”这条命题,这一矛盾说明,问题不在仪器或算法还不够精细,而在旧对象定义把关键自由度排除在外。
在performative prediction中,部署参数θ诱导分布D(θ),优化固定历史风险可能把系统推向新的失衡;应寻找分布响应下的稳定点或直接优化长期社会损失。预测触发行动,行动改变曝光与标签,新增数据再训练模型形成闭环;选择性标签和巡逻集中会让已有高风险区域获得更多观测,从而自我强化。Performative Prediction and Runaway Feedback由此给出一条可检验的因果或结构主张。就“反馈回路证明预测会改变自己未来要预测的数据”而言,这一说法把机制、测量与决策连在一起,使支持证据必须同时满足方向、量级与顺序三项约束。
Ensign等2018年的预测警务模拟显示,即使真实犯罪率相同,按既有逮捕数据分配巡逻也会把资源集中到初始高计数区域;Perdomo等2020年形式化D(θ)并分析performative stable解。围绕“反馈回路证明预测会改变自己未来要预测的数据”,这组2020年前后的观测至少包含两个可复核锚点。在数据科学的“反馈回路证明预测会改变自己未来要预测的数据”问题上,因此,证据不是一条漂亮曲线,而是一组可以在独立数据中重新计算的数量关系。
分布响应函数通常未知且受制度、人的策略与时间延迟影响;稳定点未必公平或社会最优,主动干预还可能引发规避和反策略。到2020年前后的后续工作,“反馈回路证明预测会改变自己未来要预测的数据”的争点已从“是否存在”转到“在哪个边界失效”。以“反馈回路证明预测会改变自己未来要预测的数据”为例,因此,本条的边界不是一句“仍需研究”,而是当上述条件被满足时,原命题应明确退出。
评估由静态测试集转向政策模拟、反事实日志和长期护栏,系统需要记录“因为模型而发生了什么”,而非只记录模型看到了什么。在2020年前后的数据系统实践中,反馈回路证明预测会改变自己未来要预测的数据因此改变了至少一个数据、实验或解释环节。围绕“反馈回路证明预测会改变自己未来要预测的数据”这条命题,这条思路随后进入评审、基准或标准化讨论,因为不报告该变量就无法判断结论能否迁移。
与第079号计算社会科学面板相比,本条把算法作为社会过程参与者;与第171号监管与行政法面板相接时,反馈造成的选择性执法需要程序约束。到2020年的接口比较中,另见第079号面板所用的相邻术语,但本条保留数据科学自己的证据口径。
◎ 二十年连起来看
第一条贯穿线索是:数据不再是文件,而是运行中的生产系统。 MapReduce、Dynamo和血缘把存储、版本、调度与来源写入结果;到了MLOps与数据级联,系统组织方式本身成为误差源。
第二条线索是:平均性能不断让位于条件性能。 协变量漂移、隐藏分层、公平不可能和基准重采样都说明,总体准确率只有在目标人群、时间和亚群明确时才有意义。
第三条线索是:数据会被模型反向制造。 在线实验主动改变行为,RAG改变知识入口,反馈回路改变未来标签。数据科学因此必须追踪“系统做了什么”而不只追踪“系统看到了什么”。
◎ 三个常见误解
误解一是“数据越多,质量问题越会被平均掉”。重复、污染和级联恰好相反:规模会放大少数来源与错误标签的权重,使错误更稳定而不是更随机。
误解二是“数据文档齐全就等于数据可信”。模型卡与数据表只能暴露已知边界;若维护停止、来源历史丢失或指标被选择性填写,文档会成为另一层表面合规。
误解三是“上线后的性能下降只需重新训练”。概念漂移、反馈回路和最终一致性表明,问题可能来自目标、采样与业务不变量变化;在错误目标上更频繁训练只会更快强化偏差。
◎ 与相邻领域的接口
与第250号《数据库与数据系统》的分工:数据库保证查询、事务与存储语义,本块追问这些语义怎样进入训练样本、特征和评估。最终一致性与数据血缘是两块的关键接口。
与第047号《机器学习理论》的分工:第047号研究算法泛化与优化,本块研究训练数据从何而来、部署后怎样漂移以及反馈怎样改写标签。数据集制图是从学习动力学反查数据,而非提出新模型。
与第255号《软件工程》的分工:软件工程关注代码和架构,数据科学增加静默数据依赖、模型陈旧和训练—服务偏差。技术债与ML测试分数说明两者不能再分开。
与第172号《数据与隐私法》的分工:法律定义权利、义务与合法基础,本块测量差分隐私、合成数据攻击与数据说明书能否兑现这些要求。
◎ 争议现场
争议一是数据中心论是否会低估模型创新。数据制图、去重与级联研究强调数据,但同一数据在不同架构下表现可不同。收敛条件是固定模型比较数据改动、固定数据比较模型改动,并报告两者交互而不是争夺唯一主因。
争议二是公平指标能否通过技术选择解决。不可能性定理说明指标冲突,标签历史与资源分配又超出模型。要收敛,必须把错误成本、基准率与受影响群体的决策权写进同一评价,而非只优化一个数学差距。
争议三是合成数据能否替代受限真实数据。当前隐私攻击和效用测试使用不同任务,结论容易互相错位。可执行条件是预先声明威胁模型与未来分析集合,再比较真实受控访问和合成发布的综合风险。
◎ 往下五年看什么
观察点一是大型数据集是否普遍发布重复率、来源集中度与基准污染率。2024年的WIMBD把这些量做成工具,未来应看它们是否成为训练语料的固定元数据。
观察点二是生产ML系统中,数据故障占全部事故的比例是否下降。需要公开的不是案例故事,而是特征漂移、标签延迟、模式变更和回滚的年度计数。
观察点三是模型卡与数据表能否随版本自动更新。可数读数是卡片字段与实际管线元数据的一致率,而不是文档是否存在。
观察点四是反馈系统是否开始做长期随机化。推荐、信贷和公共服务若仍只用静态离线测试,performative prediction就尚未真正进入治理。
◎ 可与哪些领域对撞
“数据血缘”与第194号《档案与数字保存》的来源原则共享预设:内容的可信度依赖可追溯历史。数据库倾向自动记录变换,档案学强调语境与保管链;若二者都成立,模型训练集需要同时保存机器可算的依赖图和人可解释的采集史。
“最终一致性”与第168号《民商法与合同》的履约顺序共享预设:不同副本或当事人可能暂时拥有不一致状态。系统工程允许之后合并,合同法要求某些权利即时确定;若两边都成立,数据系统必须区分可补偿冲突与不可逆权利。
“隐藏分层”与第143号《教育心理学》的平均效应争论共享预设:总体均值可能遮蔽机制不同的亚群。医学影像要求最差组错误率,教育研究常报告异质干预效应;若两边都成立,基准数据集应把亚群定义当作理论承诺而非事后切片。
“反馈回路”与第060号《控制与自动化》的闭环稳定共享预设:输出会反过来改变输入。控制系统通常有明确状态方程,社会算法的响应函数却由人的策略产生;两边若都成立,需要把制度规则视为可变控制器而非环境噪声。
◎ 十条可做的研究命题
1. 训练语料去重后,模型在时间外任务上的增益大于旧基准损失;固定算力训练重复率不同的语料;若时间外表现无改善,则去重的泛化命题被证伪。
2. 数据卡自动从管线生成时,文档与实际数据的一致率高于人工填写;随机比较两种流程;若差异小于5个百分点,则自动化优势不成立。
3. 最差组错误率比总体准确率更能预测部署事故;回溯50个模型版本;若总体指标的预测力相同或更高,则证伪。
4. 概念漂移告警与标签误差联合使用可把无效重训减少30%;在流数据平台做随机策略比较;若重训次数和性能无差异,则证伪。
5. 数据血缘覆盖率低于80%的管线更易出现不可定位事故;比较百条生产管线;若事故率不随覆盖率变化,则证伪。
6. 合成数据在成员推断优势低于0.05时仍可保留90%以上下游效用;跨三类表格数据测试;若多数任务达不到,则三难的约束更强。
7. 在线实验使用e过程后,提前停止导致的假阳性率下降;重放历史日志;若与固定p值无差异,则证伪。
8. 群众标注保存分歧分布比多数票更能提升分布外泛化;训练软标签和硬标签模型;若外部测试无差异,则证伪。
9. 模型卡中的禁用场景能预测真实误用;跟踪公开模型的下游事件;若误用与卡片边界无关联,则文档预测价值不足。
10. 反馈回路的早期强度可由部署后输入分布对决策阈值的弹性估计;做分阶段随机阈值实验;若弹性不预测长期偏移,则证伪。
◎ 资料核验
以下按源行与边界讨论所用资料列出;期刊卷页或DOI已写入,预印本明确标注。
- Dean J, Ghemawat S. MapReduce: simplified data processing on large clusters. Communications of the ACM 51, 107–113 (2008). DOI: 10.1145/1327452.1327492.
- Stonebraker M et al. MapReduce and parallel DBMSs: friends or foes? Communications of the ACM 53, 64–71 (2010). DOI: 10.1145/1629175.1629197.
- DeCandia G et al. Dynamo: Amazon’s highly available key-value store. Proceedings of SOSP, 205–220 (2007). DOI: 10.1145/1294261.1294281.
- Bailis P et al. Highly available transactions: virtues and limitations. Proceedings of the VLDB Endowment 7, 181–192 (2014). DOI: 10.14778/2732279.2732287.
- Sugiyama M, Krauledat M, Müller KR. Covariate shift adaptation by importance weighted cross validation. Journal of Machine Learning Research 8, 985–1005 (2007).
- Recht B, Roelofs R, Schmidt L, Shankar V. Do ImageNet classifiers generalize to ImageNet? Proceedings of ICML 97, 5389–5400 (2019).
- Snow R, O’Connor B, Jurafsky D, Ng AY. Cheap and fast—but is it good? Evaluating non-expert annotations for natural language tasks. Proceedings of EMNLP, 254–263 (2008). DOI: 10.3115/1613715.1613751.
- Welinder P et al. The multidimensional wisdom of crowds. Advances in Neural Information Processing Systems 23, 2424–2432 (2010).
- Kohavi R, Longbotham R, Sommerfield D, Henne RM. Controlled experiments on the web: survey and practical guide. Data Mining and Knowledge Discovery 18, 140–181 (2009). DOI: 10.1007/s10618-008-0114-1.
- Kohavi R, Deng A, Frasca B, Walker T, Xu Y, Pohlmann N. Online controlled experiments at large scale. Proceedings of KDD, 1168–1176 (2013). DOI: 10.1145/2487575.2488217.
- Green TJ, Karvounarakis G, Tannen V. Provenance semirings. Proceedings of PODS, 31–40 (2007). DOI: 10.1145/1265530.1265535.
- Cheney J, Chiticariu L, Tan WC. Provenance in databases: why, how, and where. Foundations and Trends in Databases 1, 379–474 (2009). DOI: 10.1561/1900000006.
- Gama J, Žliobaitė I, Bifet A, Pechenizkiy M, Bouchachia A. A survey on concept drift adaptation. ACM Computing Surveys 46, Article 44 (2014). DOI: 10.1145/2523813.
- Lu J, Liu A, Dong F, Gu F, Gama J, Zhang G. Learning under concept drift: a review. IEEE Transactions on Knowledge and Data Engineering 31, 2346–2363 (2019). DOI: 10.1109/TKDE.2018.2876857.
- Sculley D et al. Hidden technical debt in machine learning systems. Advances in Neural Information Processing Systems 28, 2503–2511 (2015).
- Paleyes A, Urma RG, Lawrence ND. Challenges in deploying machine learning: a survey of case studies. ACM Computing Surveys 55, Article 114 (2022). DOI: 10.1145/3533378.
- Kleinberg J, Mullainathan S, Raghavan M. Inherent trade-offs in the fair determination of risk scores. Proceedings of ITCS, Article 43 (2017). DOI: 10.4230/LIPIcs.ITCS.2017.43.
- Chouldechova A. Fair prediction with disparate impact: a study of bias in recidivism prediction instruments. Big Data 5, 153–163 (2017). DOI: 10.1089/big.2016.0047.
- Mitchell M et al. Model cards for model reporting. Proceedings of FAT* 2019, 220–229. DOI: 10.1145/3287560.3287596.
- Bommasani R et al. On the opportunities and risks of foundation models. arXiv:2108.07258 (2021, preprint).
- Gebru T et al. Datasheets for datasets. Communications of the ACM 64, 86–92 (2021). DOI: 10.1145/3458723.
- Pushkarna M, Zaldivar A, Kjartansson O. Data cards: purposeful and transparent dataset documentation for responsible AI. Proceedings of FAccT, 1776–1826 (2022). DOI: 10.1145/3531146.3533231.
- Oakden-Rayner L et al. Hidden stratification causes clinically meaningful failures in machine learning for medical imaging. Proceedings of CHIL, 151–159 (2020). DOI: 10.1145/3368555.3384468.
- Seyyed-Kalantari L et al. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nature Medicine 27, 2176–2182 (2021). DOI: 10.1038/s41591-021-01595-0.
- Sambasivan N et al. “Everyone wants to do the model work, not the data work”: data cascades in high-stakes AI. Proceedings of CHI, Article 39 (2021). DOI: 10.1145/3411764.3445518.
- Scheuerman MK, Hanna A, Denton E. Do datasets have politics? Disciplinary values in computer vision dataset development. Proceedings of ACM HCI 5, Article 317 (2021). DOI: 10.1145/3476058.
- Li C, Flanigan J. Task contamination: language models may not be few-shot anymore. Proceedings of AAAI 38, 18471–18480 (2024). DOI: 10.1609/aaai.v38i16.29808.
- Breck E et al. The ML test score: a rubric for ML production readiness and technical debt reduction. IEEE Big Data, 1123–1132 (2017). DOI: 10.1109/BigData.2017.8258038.
- Sato H et al. TF-X: a TensorFlow-based production-scale machine learning platform. Proceedings of KDD, 1387–1395 (2019). DOI: 10.1145/3292500.3330671.
- Swayamdipta S et al. Dataset cartography: mapping and diagnosing datasets with training dynamics. Proceedings of EMNLP, 9275–9293 (2020). DOI: 10.18653/v1/2020.emnlp-main.746.
- Northcutt CG, Athalye A, Mueller J. Pervasive label errors in test sets destabilize machine learning benchmarks. Proceedings of NeurIPS Datasets and Benchmarks 1 (2021).
- Lee K et al. Deduplicating training data makes language models better. Proceedings of ACL, 8424–8445 (2022). DOI: 10.18653/v1/2022.acl-long.577.
- Elazar Y et al. What’s in my big data? Proceedings of ICLR (2024). OpenReview: uMG7CZiA6Y.
- Lewis P et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems 33, 9459–9474 (2020).
- Izacard G et al. Few-shot learning with retrieval augmented language models. arXiv:2208.03299 (2022, preprint).
- Stadler T, Oprisanu B, Troncoso C. Synthetic data—anonymisation groundhog day. USENIX Security Symposium, 1451–1468 (2022).
- Jordon J, Yoon J, van der Schaar M. PATE-GAN: generating synthetic data with differential privacy guarantees. Proceedings of ICLR (2019).
- Perdomo J, Zrnic T, Mendler-Dünner C, Hardt M. Performative prediction. Proceedings of ICML 119, 7599–7609 (2020).
- Ensign D, Friedler SA, Neville S, Scheidegger C, Venkatasubramanian S. Runaway feedback loops in predictive policing. Proceedings of FAT* 2018, 160–171. DOI: 10.1145/3287560.3287589.