SDE Universes·新思想前沿AI与知识生产
新思想前沿 · AI与知识生产

AI系统与基础设施

近二十年 · 两幕 · 20 个新思想 · 约 20,070 字 · 王德生 亲撰 · 2026 年 8 月

AI系统与基础设施研究的不是某个模型更聪明,而是数据、参数、梯度、版本与请求怎样穿过机器、网络和组织仍保持可训练、可复算、可服务、可回滚。2004年MapReduce把失败重算藏进批任务,CUDA、Spark、DistBelief、参数服务器和TensorFlow又依次重写设备、迭代、状态与执行图;2015年技术债和2017年TFX则把模型周围的生产系统显影。2018年以后,Ray、MLPerf、集合通信、张量与流水线分片、ZeRO、KServe、PagedAttention以及推理阶段和KV记忆解耦,把基础设施推进到大模型的训练—服务共同设计。

【第一幕】从数据批任务到可测试生产流水线 · 约 2004–2017

第一幕的共同转向,是把一次成功训练背后的隐形工作变成系统抽象:数据按分区重算,GPU算子接受统一编程,迭代工作集可缓存,参数与计算可分离,逻辑图跨设备布置,依赖与测试进入生产门。每一次封装也留下新的债:落盘、数据移动、陈旧梯度、API漂移、影子管线和形式合规。基础设施因此不能只报吞吐,还要同时登记质量、版本、失败恢复与未进入分母的人工。

甲、MapReduce:训练数据第一次按失败可恢复的批任务扩展MapReduce: Training Data Scales as Failure-Recoverable Batch Jobs

提出Dean与Ghemawat,2004年OSDI论文《MapReduce: Simplified Data Processing on Large Clusters》。 争议Pollux Authors. “Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning.” OSDI, 2021.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键程序员只写两个函数,系统负责切片、局部性、调度、容错与结果归并。

2004年前,大规模机器学习预处理常由研究团队手写MPI作业、文件分片和失败恢复;一台机器重启就可能让数小时任务重来。Dean与Ghemawat把Google内部常见数据计算压成Map和Reduce两个接口,运行时自动切输入、把任务靠近数据、重跑失败分片。数据规模由算法脚本之外的运维能力,变成可复用的执行抽象。

〔对象清单〕本条的单因命题是,决定批量AI数据处理能否跨普通集群扩展的只有运行时是否把确定性分区与失败重算封装在编程接口下。Map把记录变成中间键值,shuffle按键聚合,Reduce生成结果;任务级重试比维护全局进程状态更简单。2004年的创新不在某个学习算法,而在让词频、倒排索引和样本统计共享容错骨架。对MapReduce:训练数据第一次按失败可恢复的批任务扩展MapReduce: Training Data Scales as Failure-Recoverable Batch Jobs而言,真正需要登记的不是又一个平均分,而是由“决定批量AI数据处理能否跨普通集群扩展的只有运行时是否封装确定性分区与失败重算”推出的每一步中介、责任人和可撤回条件;〔对象清单〕缺少任何一环,都不能把相关性写成机制。

OSDI 2004论文报告Google在1800台机器上运行MapReduce生产作业,并以约1,000台机器处理1TB数据:分布式grep约150秒,排序约891秒。核验必须同时给出输入字节、有效记录、机器数、失败数和shuffle流量;“1TB在15分钟内排序”若不含资源与副本成本,不能比较下一代AI管线。

MapReduce每轮通常读写分布式文件系统,逻辑回归、聚类和深度学习的迭代会反复搬同一数据。作业越被拆成独立阶段,恢复越容易,迭代端到端时间反而越长;straggler重跑还会复制热点流量。批任务假定函数近似确定,若数据增强含随机性,重算分片可能改变训练样本。〔对象清单〕落到复现实务,可为MapReduce:训练数据第一次按失败可恢复的批任务扩展MapReduce: Training Data Scales as Failure-Recoverable Batch Jobs建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“经血缘核对一致的有效样本数/读取字节、shuffle字节与磁盘写入总量”统一结算,避免换口径后仍宣称性能提高。

2025年的复核应把有效样本每秒、shuffle字节、磁盘写放大、失败恢复时间和随机种子一致性并列;在同一1TB输入上比较批、缓存迭代与流式引擎。数据清洗还需保留记录级血缘,使一次分片重跑能说明哪些样本改变;仅验证作业成功,不足以证明模型看见同一训练集。

它与第054号第一条“云把分布式系统变成基础设施”共享普通机器集群,本条限定AI数据作业的编程与重算接口;与第351号第四条“任务图运行时:并行次序应由依赖关系生成”相比,MapReduce只暴露两级有向结构。2004年的容错吞吐证明批处理可扩展,不证明多轮学习或低延迟推理适合这一抽象。

位置S——把确定性分区与可重算任务当成大规模数据处理的决定性资源 单因决定批量AI数据处理能否跨普通集群扩展的只有运行时是否封装确定性分区与失败重算 预设〔02 谁进入分母〕进入分布式文件系统的记录足以代表训练所需数据与被清洗掉的样本 量纲经血缘核对一致的有效样本数/读取字节、shuffle字节与磁盘写入总量 失效当学习需要多轮迭代时,阶段切得越细,反复落盘造成的端到端时间反而越长 自曝对象清单独立核验:1TB排序读数建立在批任务和约1,000台机器上,未验证迭代训练与随机增强;独立撤回检查落在对象清单 空栏被过滤样本、重算随机性、straggler副本、跨阶段血缘及失败后输入版本变化 异名分布式系统称“云把分布式系统变成基础设施”;见第054号第一条“云把分布式系统变成基础设施”

乙、CUDA与通用GPU:学习代码开始围绕异构设备重写CUDA and GPGPU: Learning Code Is Rewritten Around Heterogeneous Devices

提出NVIDIA,2007年CUDA;Nickolls等,2008年《Scalable Parallel Programming with CUDA》。 争议Abadi, M. et al. “TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems.” 2015.。 最新(2024年文献)Agrawal, A. et al. “Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve.” OSDI, 2024.。 关键研究者可用C风格kernel直接调度数千线程,矩阵与卷积由图形管线外溢为通用学习基础。

2007年前,GPU通用计算需要把数值问题伪装成图形着色器,内存和执行模型难以维护。CUDA把线程、block、grid、共享内存和device kernel公开给C/C++程序,2008年论文系统说明SIMT编程。机器学习由CPU上的少量向量库调用,转向把算子、内存布局和批量大小围绕异构设备设计。〔事件时间轴〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定学习负载能否获得GPU级加速的只有算子是否暴露足够并行性且复用层级内存”的操作定义,仍能复算“固定精度下有效训练样本数/GPU小时、host—device字节与移植人工小时”,否则所谓转向可能只是数据管线或命名变化。

〔事件时间轴〕本条主张,决定学习负载能否获得GPU级加速的只有算子是否暴露足够并行性且复用层级内存。成千线程并非自动变快:连续访存、warp分歧、寄存器和共享内存占用共同决定occupancy。2007年的接口把硬件细节开放给框架作者,随后cuBLAS、cuDNN等库才可把卷积和矩阵乘积做成标准后端。

Nickolls等2008年以CUDA展示并行程序可在多代GPU扩展,AlexNet 2012又用2块GPU训练约6000万参数网络,把工具链推入AI主流。可复算读数应是固定数值精度下的images/s、host—device字节与加速器小时,而非峰值TFLOPS;同一kernel还需报告batch=1与大batch的差距。机构采用CUDA与通用GPU:学习代码开始围绕异构设备重写CUDA and GPGPU: Learning Code Is Rewritten Around Heterogeneous Devices之前还应公布否决门槛:一旦“当内核过度针对单代架构手调时,局部速度越高,跨设备性能保留率反而越低”出现,就暂停扩张并回到“研究者可用C风格kernel直接调度数千线程,矩阵与卷积由图形管线外溢为通用学习基础”的原始记录复核;该门槛必须早于部署决定写入方案。

GPU显存小于主存,数据搬运、内核启动和同步会吃掉短任务收益;算子越为单代架构手调,换设备后反而越难维护。专有编译栈也造成供应商锁定,浮点归约次序会让结果不完全复现。若只报训练最快一次,预处理等待与GPU空闲不会进入分母。

2025年的验收应以Roofline拆算术强度、HBM带宽与互连等待,比较CUDA、跨平台编译和CPU基线;记录内核版本、驱动、设备代际与数值误差。性能可移植性不能只证明“能运行”,而要报告在3类设备上相对各自最佳实现的保留率,并把移植人工计入成本。把CUDA与通用GPU:学习代码开始围绕异构设备重写CUDA and GPGPU: Learning Code Is Rewritten Around Heterogeneous Devices与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“固定精度下有效训练样本数/GPU小时、host—device字节与移植人工小时”在这些类别上都可回查,跨研究比较才有意义。

它与第351号第五条“异构加速编程:GPU不是外设而是协处理器”是直接异名,本条把接口放入AI框架形成史;与第251号第十二条“加速器的虚拟化与调度”相接时,单作业kernel效率还要接受多租户隔离。2007年的可编程性打开规模路线,却没有消除内存、互连和供应链边界。

位置D——把算子并行、内存层级、编译与设备执行组成异构加速路径 单因决定学习负载能否获得GPU级加速的只有算子是否暴露足够并行性且复用层级内存 预设〔02 单一读数代表复杂对象〕峰值TFLOPS足以代表真实训练吞吐、数值稳定与移植成本 量纲固定精度下有效训练样本数/GPU小时、host—device字节与移植人工小时 失效当内核过度针对单代架构手调时,局部速度越高,跨设备性能保留率反而越低 自曝事件时间轴独立核验:CUDA读数依赖专有驱动和特定GPU,未自动推广到异构集群与小批低延迟;独立撤回检查落在事件时间轴 空栏驱动漂移、GPU空闲、数值归约差异、预处理等待、移植人工与供应商锁定 异名高性能计算称“异构加速编程:GPU不是外设而是协处理器”;见第351号第五条“异构加速编程:GPU不是外设而是协处理器”

丙、Spark:迭代学习把工作集留在内存Spark: Iterative Learning Keeps Working Sets in Memory

提出Zaharia等,2010年HotCloud论文《Spark: Cluster Computing with Working Sets》;2012年NSDI论文《Resilient Distributed Datasets》。 争议Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.。 最新(2025年文献)Kubeflow Community. “Kubeflow: The Machine Learning Toolkit for Kubernetes.” 2017–2025.。 关键RDD以不可变分区和血缘恢复,使多轮算法无需每次把状态写回磁盘。

MapReduce擅长一次扫描,却让PageRank、k-means和逻辑回归每轮都重新读写文件。Zaharia等在2010年提出Spark,把会被反复使用的working set留在集群内存;2012年的RDD以不可变分区、粗粒度变换和lineage描述如何重建丢失数据。迭代机器学习由一串独立批作业变成可缓存的数据流。

〔装置边界〕本条的单因命题是,决定迭代算法能否跨轮次提速的只有运行时是否在保持血缘可恢复时复用内存工作集。RDD不为每个元素复制日志,而记录从输入到分区的确定性变换;节点失败时只重算丢失分区。2010年的折中用不可变与粗粒度换取低元数据成本,正好适配反复扫描同一训练样本。〔装置边界〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当分区倾斜与血缘过长时,缓存越满,单点失败后的恢复尾延迟反而越高”做至少两轮外部复算,若方向翻转,Spark:迭代学习把工作集留在内存Spark: Iterative Learning Keeps Working Sets in Memory的结论必须随之收窄。

早期Spark论文在迭代机器学习和交互查询中报告相对Hadoop最高约10倍提速,并展示数十秒级交互;NSDI 2012进一步比较内存、磁盘与容错。核验应固定算法轮数、收敛阈值和输入分区,报告每轮秒数、cache hit、spill字节和恢复耗时;只报首轮或热缓存最快值会夸大实际收益。

RDD分区若按错误键倾斜,一台executor会成为长尾;缓存越积极,垃圾回收和spill反而越严重。血缘链太长时,节点失败触发大段重算,恢复尖峰可能超过定期checkpoint。迭代快也不保证统计收敛更快:不同分区和归约次序会改变浮点轨迹。〔装置边界〕面向下一轮材料,AI系统与基础设施应优先补齐“外部副作用、长血缘截断、热分区、垃圾回收、浮点归约差异与样本版本”的原始记录,并把“当分区倾斜与血缘过长时,缓存越满,单点失败后的恢复尾延迟反而越高”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

2025年的复核应同时施加数据倾斜、10%节点故障、内存不足和动态扩缩,画训练loss对墙钟时间而非只对iteration。血缘需连接到样本版本,checkpoint要注明是否含优化器状态;GPU供料还应测列式解码与PCIe等待。缓存命中率高但GPU饥饿,仍不是合格AI数据层。

它与第351号第四条“任务图运行时:并行次序应由依赖关系生成”共享DAG,本条限定不可变数据血缘与迭代工作集;与第360号第六条“生产轨迹基准:合成负载会遗漏相关性与突发”相接时,缓存效果取决于真实复用。2010年的10倍是相对批落盘路线,不是所有工作负载的固定常数。〔装置边界〕在AI系统与基础设施的这一对象上,复核应把“达到同一loss所需墙钟秒数/spill字节、重算分区数与GPU等待秒数”拆成同一分母下的主结果与失败谱,“外部副作用、长血缘截断、热分区、垃圾回收、浮点归约差异与样本版本”要单列编码,不能在汇总时并入其他项。

位置E——把数据倾斜、内存压力、血缘长度与故障模式当成迭代系统环境 单因决定迭代算法能否跨轮次提速的只有运行时是否在保持血缘可恢复时复用内存工作集 预设〔03 缺失即不存在〕未进入RDD血缘的外部状态和被清洗记录被视为不影响重算一致性 量纲达到同一loss所需墙钟秒数/spill字节、重算分区数与GPU等待秒数 失效当分区倾斜与血缘过长时,缓存越满,单点失败后的恢复尾延迟反而越高 自曝装置边界独立核验:最高约10倍来自相对Hadoop的早期迭代任务,未覆盖现代GPU供料与湖仓版本漂移;独立撤回检查落在装置边界 空栏外部副作用、长血缘截断、热分区、垃圾回收、浮点归约差异与样本版本 异名高性能计算称“任务图运行时:并行次序应由依赖关系生成”;见第351号第四条“任务图运行时:并行次序应由依赖关系生成”

丁、DistBelief:参数服务器与模型副本把深网训练拆开DistBelief: Parameter Servers and Model Replicas Decompose Deep Training

提出Dean等,2012年NeurIPS论文《Large Scale Distributed Deep Networks》。 争议Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.。 最新(2025年文献)Zhang, D. et al. “BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching.” OSDI, 2025.。 关键DistBelief以Downpour SGD和Sandblaster L-BFGS让模型跨机器分片、多个副本并行计算。

深度网络在2012年迅速增大,单机内存和训练周期同时成为瓶颈。Dean等构建DistBelief,把一个模型的参数分布到多台parameter server,再让多个model replica读取参数、计算梯度并异步推送。训练系统不再等于一段GPU程序,而是参数所有权、数据副本、网络更新和故障恢复组成的服务。对DistBelief:参数服务器与模型副本把深网训练拆开DistBelief: Parameter Servers and Model Replicas Decompose Deep Training而言,真正需要登记的不是又一个平均分,而是由“决定超单机模型能否扩展训练的只有参数状态与梯度计算是否被分离且允许并发更新”推出的每一步中介、责任人和可撤回条件;〔样本分层〕缺少任何一环,都不能把相关性写成机制。

〔样本分层〕本条主张,决定超单机模型能否扩展训练的只有参数状态与梯度计算是否被分离且允许并发更新。Downpour SGD容忍不同副本在略旧参数上工作,避免全局barrier;Sandblaster由协调器分配优化子问题。2012年的关键接口是把“模型”拆成逻辑图与物理分片,使算法能在数千机器上运行。

NeurIPS 2012论文说明DistBelief可用数千台机器训练十亿级参数网络,并以数万CPU核心处理语音与视觉任务;报告某些配置相对单副本获得数量级加速。复算必须给出参数数、replica数、server分片、网络字节、梯度staleness和最终质量;机器增加100倍却只快12倍仍要登记利用率。〔样本分层〕落到复现实务,可为DistBelief:参数服务器与模型副本把深网训练拆开DistBelief: Parameter Servers and Model Replicas Decompose Deep Training建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到固定验证质量所需墙钟时间/机器小时、网络字节与梯度陈旧步数”统一结算,避免换口径后仍宣称性能提高。

异步副本读取的参数版本不同,吞吐越高,梯度反而越陈旧,可能在尖锐loss区域震荡;parameter server热点会把少数embedding行变成网络瓶颈。2025年大集群失败频繁,checkpoint若不同步会恢复到混合版本。训练收敛与系统吞吐因此不能各报一个最佳实验再拼成结论。

2025年的验收应画time-to-quality而非steps/s,按0、1、10和100步陈旧分桶报告梯度贡献;随机杀死server与worker,测恢复后loss是否连续。所有副本需记录数据shard、代码和参数版本,checkpoint用一致性校验。若加机器只提高原始梯度数却不缩短目标精度时间,应判为无效扩展。〔样本分层〕证据链还要把Dean等,2012年NeurIPS论文《Large Scale Distributed Dee的起点材料与更新文献放在同一比较表里,并逐项报告“DistBelief以Downpour SGD和Sandblaster L-BFGS让模型跨机器分片、多个副本并行计算”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

它与第351号第十五条“局部性感知调度:就绪任务并非等价任务”对接梯度副本放置,本条把参数状态从计算节点中抽离;与第251号第十一条“数据中心作为一台计算机”共享仓库级资源。2012年的规模突破为TensorFlow铺路,也暴露算法语义会被调度与通信改变。

位置S——把可分片参数状态当成模型超越单机内存的决定性资源 单因决定超单机模型能否扩展训练的只有参数状态与梯度计算是否被分离且允许并发更新 预设〔04 测量不改变被测对象〕增加replica与异步程度不会改变优化轨迹和最终模型质量 量纲达到固定验证质量所需墙钟时间/机器小时、网络字节与梯度陈旧步数 失效当异步副本远离最新参数时,原始梯度吞吐越高,达到目标质量的时间反而越长 自曝样本分层独立核验:数千机器和十亿级参数证明可运行,不等于每增加一台机器都有稳定边际收益;独立撤回检查落在样本分层 空栏热点参数、混合版本恢复、失败梯度、数据shard重叠、网络拥塞与不可复现轨迹 异名操作系统称“数据中心作为一台计算机”;见第251号第十一条“数据中心作为一台计算机”

戊、参数服务器:分布式学习获得一致性、弹性与键空间The Parameter Server: Distributed Learning Gets Consistency, Elasticity and a Key Space

提出Li、Andersen、Park等,2014年OSDI论文《Scaling Distributed Machine Learning with the Parameter Server》。 争议Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.。 最新(2025年文献)Qin, R. et al. “Mooncake: A KVCache-Centric Disaggregated Architecture for LLM Serving.” FAST, 2025.。 关键参数以分布式键值空间管理,worker可异步push/pull,系统支持范围订阅、容错与弹性扩缩。

DistBelief展示内部框架后,Li等在2014年把parameter server抽象为通用分布式机器学习系统。参数按key range分片,worker通过push与pull更新;server group负责复制和恢复,vector clock与一致性选项控制陈旧程度。算法作者可表达稀疏矩阵、图模型和深度网络,而不必为每个任务重写通信层。

〔版本登记〕本条的单因命题是,决定共享模型状态能否被许多worker并发访问的只有键空间是否同时提供分片、局部性与可声明一致性。范围push/pull避免传完整向量,连续key可放在同一server;弹性成员变化不改变逻辑命名。2014年的接口把参数从进程内数组变成网络对象,也把一致性选择交还给算法。机构采用参数服务器:分布式学习获得一致性、弹性与键空间The Parameter Server: Distributed Learning Gets Consistency, Elasticity and a Key Space之前还应公布否决门槛:一旦“当键访问呈幂律时,worker越多,少数热点server的队列反而越长”出现,就暂停扩张并回到“参数以分布式键值空间管理,worker可异步push/pull,系统支持范围订阅、容错与弹性扩缩”的原始记录复核;该门槛必须早于部署决定写入方案。

OSDI 2014论文在大规模稀疏逻辑回归、LDA和DNN任务上使用数百至上千节点,展示接近线性的短区间扩展与每小时数千亿参数访问量级。可复算读数应含每秒有效更新、热点key的P99、staleness、复制流量和最终AUC;平均带宽无法揭示一个热embedding分片拖住全局。

键分布若遵循幂律,少数server会成为热点;一致性越放松,worker越少等待,但错误更新也越晚被看见。2024年弹性加入节点需要重分片,迁移期间缓存和版本可能错位。系统把算法容忍陈旧当配置,却没有替用户证明哪种staleness仍保持收敛与公平。把参数服务器:分布式学习获得一致性、弹性与键空间The Parameter Server: Distributed Learning Gets Consistency, Elasticity and a Key Space与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“通过版本校验的有效参数更新数/网络字节、P99键延迟与重平衡秒数”在这些类别上都可回查,跨研究比较才有意义。

2025年的复核应以合成均匀键和真实长尾embedding各跑一次,报告每分片队列、网络丢包、节点替换与重平衡时间;同时画accuracy对staleness。配置变更必须进入模型血缘,恢复后抽样比对参数checksum。若P99键延迟翻倍,即使平均吞吐提高也不应宣称线性扩展。

它与第251号第十七条“可组合的基础设施”共享资源分离,本条分离的是学习状态而非硬件内存;与第351号第十四条“韧性超越检查点:错误恢复应进入算法内部”相接时,一致性决定恢复语义。2014年的通用键空间后来被all-reduce和专用embedding系统部分替代,说明抽象也有工作负载边界。〔版本登记〕本条的边界案例应从“丢失更新、热点分片、公平误差、成员变更、缓存版本与一致性配置责任”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当键访问呈幂律时,worker越多,少数热点server的队列反而越长”究竟是偶发噪声,还是足以改变结论方向的系统反例。

位置D——把key分片、push/pull、一致性、复制与弹性重平衡串成共享状态路径 单因决定共享模型状态能否被许多worker并发访问的只有键空间是否同时提供分片局部性与可声明一致性 预设〔05 缺失即不存在〕未进入平均带宽的热点key、失败更新与重平衡空窗被视为没有影响收敛 量纲通过版本校验的有效参数更新数/网络字节、P99键延迟与重平衡秒数 失效当键访问呈幂律时,worker越多,少数热点server的队列反而越长 自曝版本登记独立核验:早期近线性区间依赖特定稀疏任务和网络,通用接口未消除负载倾斜;独立撤回检查落在版本登记 空栏丢失更新、热点分片、公平误差、成员变更、缓存版本与一致性配置责任 异名操作系统称“可组合的基础设施”;见第251号第十七条“可组合的基础设施”

己、TensorFlow数据流图:同一模型跨CPU、GPU与TPU布置TensorFlow Dataflow Graphs: One Model Spans CPUs, GPUs and TPUs

提出Abadi等,2015年技术报告及2016年OSDI论文《TensorFlow: A System for Large-Scale Machine Learning》。 争议Rajbhandari, S. et al. “ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.” SC, 2020.。 最新(2024年文献)Zheng, L. et al. “SGLang: Efficient Execution of Structured Language Model Programs.” NeurIPS, 2024.。 关键计算、共享状态与状态变更都写成图节点,运行时把同一逻辑图映射到手机、服务器与分布式加速器。

2015年前的深度学习代码常与单一设备、参数服务器和训练脚本绑定,研究原型难进入产品。TensorFlow把张量上的operation、edge与可变状态表达为数据流图,placement算法再把节点映到CPU、GPU或TPU。2016年OSDI系统把研究、分布式训练和在线推理置于同一接口,开源发布又形成跨机构生态。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定一个AI程序能否跨异构规模复用的只有逻辑计算图是否与物理设备布置分离”的操作定义,仍能复算“跨3类设备达到同一质量的成功图数/全部图及相对各后端最佳实现的性能损失”,否则所谓转向可能只是数据管线或命名变化。

〔失败谱〕本条主张,决定一个AI程序能否跨异构规模复用的只有逻辑计算图是否与物理设备布置分离。图描述依赖和状态,runtime依据设备能力、通信成本和用户约束选择placement;send/receive节点跨进程传张量。2015年的抽象让新优化器和模型无需修改底层集群,却也让图语义成为编译与执行契约。

OSDI 2016论文页码265–283,说明TensorFlow已用于Google十多个领域和多项生产服务,并展示单机、多GPU及分布式任务的吞吐。核验应同时报图构建、编译、执行、通信和checkpoint时间;固定模型在1、8、64设备上的time-to-accuracy与扩展效率,比单个step/s峰值更能检验跨规模复用。〔失败谱〕面向下一轮材料,AI系统与基础设施应优先补齐“图编译时间、API漂移、随机状态、算子缺口、checkpoint兼容与跨设备数值差”的原始记录,并把“当默认placement产生大张量跨设备边时,支持的设备越多,端到端吞吐反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

图上的合法placement不等于高效:一个小操作跨设备就会触发大张量传输,状态变量又可能形成隐式串行点。抽象越统一,硬件特有瓶颈反而越容易被默认策略隐藏;静态图错误常在运行时才以shape或device mismatch出现。开源API变化还会让旧模型无法完全重放。

2025年的验收应导出带shape、dtype、device和通信边的完整图,检查跨设备字节与关键路径;同一模型在3类后端上比较质量、性能和数值差异。编译缓存、算子版本、随机状态与checkpoint格式必须进入artifact清单,若只保存Python源码,无法证明数年后重建的是同一执行图。〔失败谱〕在AI系统与基础设施的这一对象上,复核应把“跨3类设备达到同一质量的成功图数/全部图及相对各后端最佳实现的性能损失”拆成同一分母下的主结果与失败谱,“图编译时间、API漂移、随机状态、算子缺口、checkpoint兼容与跨设备数值差”要单列编码,不能在汇总时并入其他项。

它与第251号第十三条“为推理而生的系统层”相接,但本条覆盖从训练图到部署图的统一表示;与第351号第二条“性能可移植性:可移植不是能运行,而是少掉速”共享跨设备判据。2015–2016年的图抽象扩大生态,却不保证默认placement、数值或API长期稳定。

位置E——把设备异构、API演化、编译缓存与状态语义当成数据流图环境 单因决定一个AI程序能否跨异构规模复用的只有逻辑计算图是否与物理设备布置分离 预设〔06 通过形式审查=实质合规〕同一图能在另一设备执行就等于性能、数值和状态语义保持一致 量纲跨3类设备达到同一质量的成功图数/全部图及相对各后端最佳实现的性能损失 失效当默认placement产生大张量跨设备边时,支持的设备越多,端到端吞吐反而越低 自曝失败谱独立核验:十多个生产领域证明采用规模,不说明所有图的自动布置都接近硬件最优;独立撤回检查落在失败谱 空栏图编译时间、API漂移、随机状态、算子缺口、checkpoint兼容与跨设备数值差 异名高性能计算称“性能可移植性:可移植不是能运行,而是少掉速”;见第351号第十条“性能可移植性:可移植不是能运行,而是少掉速”

庚、机器学习技术债:模型代码只是生产系统的一小块Hidden ML Technical Debt: Model Code Is a Small Part of Production

提出Sculley等,2015年NeurIPS论文《Hidden Technical Debt in Machine Learning Systems》。 争议Baylor, D. et al. “TFX: A TensorFlow-Based Production-Scale Machine Learning Platform.” KDD, 2017.。 最新(2024年文献)Zheng, L. et al. “SGLang: Efficient Execution of Structured Language Model Programs.” NeurIPS, 2024.。 关键纠缠、数据依赖、反馈回路、配置与管线胶水会让一个小模型变更产生远处副作用。

机器学习竞赛把代码框在训练与评测脚本里,生产图景却有数据收集、特征、验证、服务、监控和回滚。Sculley等2015年指出,真正模型代码常只是系统盒图中的很小区域,周围被configuration debt、data dependencies、pipeline jungles和glue code包围。AI系统工程由“模型是否准”转向“变化怎样传播”。

〔机构接口〕本条的单因命题是,决定生产ML系统能否长期修改的只有依赖关系是否显式、可测试并有所有者。CACE原则提醒changing anything changes everything:一个特征的缩放会改变训练、服务与监控;隐藏消费者和反馈回路使局部优化成为全局风险。2015年的贡献是把可维护性变成模型质量之外的一级目标。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当自动化继续接入无主外部依赖时,平台覆盖越广,单次变更的爆炸半径反而越大”做至少两轮外部复算,若方向翻转,机器学习技术债:模型代码只是生产系统的一小块Hidden ML Technical Debt: Model Code Is a Small Part of Production的结论必须随之收窄。

NeurIPS 2015论文以Google生产经验归纳边界侵蚀、纠缠、未声明消费者、数据依赖、反馈回路和配置等模式,页码2503–2511。核验不应只数代码行,而应统计每次模型或特征变更触发的组件、回滚分钟和未预期告警;一项变更若波及17个服务,比模型仓库只改20行更能说明债务。

“债”隐喻可能让团队默认以后还本,却没有记录谁因夜间告警、数据清洗和人工补洞承担成本。自动化越多,隐式供应商API与无人负责的数据源反而越深。若把所有失败都称技术债,歧视性目标或不合法数据会被误当可重构问题,而不是应停止的制度选择。〔机构接口〕证据链还要把Sculley等,2015年NeurIPS论文《Hidden Technical Debt in的起点材料与更新文献放在同一比较表里,并逐项报告“纠缠、数据依赖、反馈回路、配置与管线胶水会让一个小模型变更产生远处副作用”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

2025年的审计应生成数据—特征—模型—服务—指标有向图,为每条边登记schema、版本、SLO、负责人和撤销条件;做一次game day随机移除上游源,量出blast radius。基础模型应用还要把prompt、检索库、工具与评委加入图。没有所有者的边必须进入空栏,不能以“平台负责”收口。

它与第251号第十八条“形式化与实测并重的可靠性”共享失败可见性,本条集中模型与数据依赖;与第532号第二十条“AgentOps、AIOS与AgentDojo:可靠性变成运行时工程”相比,技术债从训练前延伸到工具代理。2015年的清单是诊断框架,不是通过打勾即可消除的认证。对机器学习技术债:模型代码只是生产系统的一小块Hidden ML Technical Debt: Model Code Is a Small Part of Production而言,真正需要登记的不是又一个平均分,而是由“决定生产ML系统能否长期修改的只有依赖关系是否显式可测试并有所有者”推出的每一步中介、责任人和可撤回条件;〔机构接口〕缺少任何一环,都不能把相关性写成机制。

位置S——把显式依赖图与组件所有权当成生产ML系统可修改性的决定性资源 单因决定生产ML系统能否长期修改的只有依赖关系是否显式可测试并有所有者 预设〔01 谁进入分母〕资产目录中登记的组件足以代表所有影子脚本、人工补洞和外部消费者 量纲可在SLO内回滚且未产生未知消费者故障的变更数/全部生产模型与特征变更数 失效当自动化继续接入无主外部依赖时,平台覆盖越广,单次变更的爆炸半径反而越大 自曝机构接口独立核验:2015年论文归纳生产经验但未给出跨组织通用债务总分,模式仍需现场验证;独立撤回检查落在机构接口 空栏影子管线、夜间人工、非法目标、外部API、无主数据源与停止而非重构的条件 异名操作系统称“形式化与实测并重的可靠性”;见第251号第十八条“形式化与实测并重的可靠性”

辛、ML Test Score与TFX:生产准备度成为28项可执行测试ML Test Score and TFX: Production Readiness Becomes 28 Executable Tests

提出Breck等,2017年论文《The ML Test Score》;Baylor等,2017年KDD论文《TFX: A TensorFlow-Based Production-Scale Machine Learning Platform》。 争议Narayanan, D. et al. “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.” SC, 2021.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键数据、特征、模型、基础设施与监控被拆成28项测试,流水线只有通过门槛才可晋级。

传统软件测试假定相同输入产生确定输出,机器学习却会因数据分布、随机训练和服务特征改变。Breck等在2017年提出ML Test Score,以28项测试检查数据完整、特征计算、训练—服务一致、模型质量、基础设施与在线监控;TFX同期把ExampleGen、Transform、Trainer、Evaluator和Pusher接成生产流水线。机构采用ML Test Score与TFX:生产准备度成为28项可执行测试ML Test Score and TFX: Production Readiness Becomes 28 Executable Tests之前还应公布否决门槛:一旦“当团队持续针对固定门调参时,通过率越高,未见故障的漏检率反而越高”出现,就暂停扩张并回到“数据、特征、模型、基础设施与监控被拆成28项测试,流水线只有通过门槛才可晋级”的原始记录复核;该门槛必须早于部署决定写入方案。

〔资源预算〕本条主张,决定模型能否安全从实验晋级生产的只有每个工件是否通过覆盖数据、代码、模型和服务的自动门。测试不是在最终模型跑一次accuracy,而是schema异常阻断数据、候选模型与blessing基线比较、serving signature验证后才push。2017年的流水线把发布决定从个人脚本改成可重放状态机。

ML Test Score列出28项具体测试和监控需求,并按基础、成熟层次给出计分;TFX论文描述Google生产规模的统一组件与持续训练。核验应统计门控命中真实回归的precision、漏失事故、假阳性阻塞小时和从数据到上线的血缘完整率;28/28通过若未做分布外测试,仍不是风险为零。〔资源预算〕落到复现实务,可为ML Test Score与TFX:生产准备度成为28项可执行测试ML Test Score and TFX: Production Readiness Becomes 28 Executable Tests建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“在上线前拦住真实回归的门控次数/全部真实回归加假阳性阻塞次数”统一结算,避免换口径后仍宣称性能提高。

团队会选择容易通过的阈值,长期把失败样本加入golden set后形成测试过拟合;门越多,发布越慢,工程师可能在紧急时绕过。2025年平均schema和accuracy测试也看不见小群体或语义错误。形式准备度越高,反而越容易让采购与管理层把流程分数误当实质安全。

2025年的发布门应区分硬阻断、需人工复核和观测性告警,按事故严重度回测每项门的价值;每季度引入未见故障和shadow traffic。LLM流水线需验证prompt、检索快照、工具权限与评委漂移,保留break-glass日志。得分必须连同未测试空栏和豁免责任人公开。〔资源预算〕本条的边界案例应从“break-glass绕过、最坏群体、评委漂移、人工复核、未知故障与门控维护成本”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当团队持续针对固定门调参时,通过率越高,未见故障的漏检率反而越高”究竟是偶发噪声,还是足以改变结论方向的系统反例。

它与第360号第七条“持续性能验证:回归应像功能错误一样阻止合并”共享持续门控,本条将对象扩到数据和模型语义;与第048号第八条“评估成为基础设施”相接时,评测结果真正控制发布。2017年的28项是路线图,不应冻结为2026年全部AI系统的永久清单。

位置D——把数据验证、训练、评估、blessing、推送与监控串成发布路径 单因决定模型能否安全从实验晋级生产的只有每个工件是否通过覆盖数据代码模型和服务的自动门 预设〔02 单一读数代表复杂对象〕28项通过率足以代表领域安全、群体表现与真实事故风险 量纲在上线前拦住真实回归的门控次数/全部真实回归加假阳性阻塞次数 失效当团队持续针对固定门调参时,通过率越高,未见故障的漏检率反而越高 自曝资源预算独立核验:28项来自当时生产经验,计分没有自动包含基础模型安全与每个行业危害;独立撤回检查落在资源预算 空栏break-glass绕过、最坏群体、评委漂移、人工复核、未知故障与门控维护成本 异名系统性能称“持续性能验证:回归应像功能错误一样阻止合并”;见第360号第十五条“持续性能验证:回归应像功能错误一样阻止合并”
【第二幕】从动态训练运行时到分离式大模型推理 · 约 2018–2026

第二幕把系统对象从静态模型扩成动态AI应用和复合请求:task与actor运行中生成,标准基准固定质量门槛,集合通信、张量、流水线和状态分片共同决定训练,声明式控制面管理版本与流量;随后KV分页、prefill/decode分离、应用图共享、活体扩容和远程会话记忆把一次生成拆成可调度阶段。前沿不再是“更多GPU”,而是每一字节状态在正确时间、正确设备、正确版本和正确权限下出现。

一、Ray:任务与Actor统一动态AI应用Ray: Tasks and Actors Unify Dynamic AI Applications

提出Moritz等,2018年OSDI论文《Ray: A Distributed Framework for Emerging AI Applications》,第561–577页。 争议Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键无状态task与有状态actor共用动态执行引擎,能表达强化学习的模拟、训练和在线服务。

监督学习流水线多是静态DAG,强化学习、超参搜索和智能体却不断生成新任务、维护环境状态并等待异步结果。Moritz等在2018年提出Ray,以remote task表达可并行函数,以actor表达有状态服务,对象存储和全局控制服务共同调度。AI基础设施开始为动态应用而非固定批作业设计。

〔外部复算〕本条的单因命题是,决定新型AI应用能否在同一运行时表达的只有无状态任务与有状态actor是否共享低延迟动态调度。Task易负载均衡和故障重试,actor保存模型、环境或参数状态;future建立依赖而无需预先画完整图。2018年的统一接口让模拟器、训练器和服务不用分别依赖三套系统。〔外部复算〕面向下一轮材料,AI系统与基础设施应优先补齐“重复副作用、控制面故障域、任务重放顺序、对象spill、孤儿actor与级联停机”的原始记录,并把“当对象存储spill和动态扇出叠加时,任务创建越快,端到端goodput反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

OSDI 2018论文页码561–577,报告Ray每秒可调度超过180万任务、延迟约毫秒量级,并用强化学习与模拟应用展示扩展。复算必须给出任务粒度、actor状态大小、对象存储命中、失败重试与端到端time-to-reward;空函数吞吐不能代表包含GPU推理和环境I/O的真实轨迹。

动态任务树会在负载尖峰中爆炸,对象存储满后spill把延迟推高;actor重启若外部副作用不可幂等,就会重复行动。2025年调度越自由,运行次序越难重放,性能bug与随机训练纠缠。统一控制面还扩大故障域,一次元数据服务拥塞可能让训练、调参与服务同时停顿。〔外部复算〕把Ray:任务与Actor统一动态AI应用Ray: Tasks and Actors Unify Dynamic AI Applications与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“满足状态一致与P99 SLO的有效任务数/全部创建任务与重试任务数”在这些类别上都可回查,跨研究比较才有意义。

2025年的验收应在生产轨迹上注入actor崩溃、object store满、网络分区和控制面重启,测goodput与状态一致;每个task须有幂等键和来源trace。对强化学习报告有效新鲜轨迹而非原始任务数,对服务报告P99。若一个统一集群事故同时影响多个阶段,应按级联损失计账。

它与第532号第九条“AutoGen与角色编排:对话成为分布式控制平面”共享动态角色,本条提供底层task/actor执行;与第351号第四条“任务图运行时:并行次序应由依赖关系生成”相比,Ray允许图在运行中生长。2018年的180万调度数是空任务能力,不等于所有AI应用获得同等加速。〔外部复算〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定新型AI应用能否在同一运行时表达的只有无状态任务与有状态actor是否共享低延迟动态调度”的操作定义,仍能复算“满足状态一致与P99 SLO的有效任务数/全部创建任务与重试任务数”,否则所谓转向可能只是数据管线或命名变化。

位置E——把动态负载、对象存储、外部副作用与控制面故障当成AI运行时环境 单因决定新型AI应用能否在同一运行时表达的只有无状态任务与有状态actor是否共享低延迟动态调度 预设〔02 单一读数代表复杂对象〕每秒空任务调度数足以代表强化学习训练和在线服务的端到端能力 量纲满足状态一致与P99 SLO的有效任务数/全部创建任务与重试任务数 失效当对象存储spill和动态扇出叠加时,任务创建越快,端到端goodput反而越低 自曝外部复算独立核验:超过180万任务每秒依赖微任务条件,真实actor状态和GPU工作会改变瓶颈;独立撤回检查落在外部复算 空栏重复副作用、控制面故障域、任务重放顺序、对象spill、孤儿actor与级联停机 异名智能体工程称“AutoGen与角色编排:对话成为分布式控制平面”;见第532号第十七条“AutoGen与角色编排:对话成为分布式控制平面”

二、MLPerf:训练与推理性能获得同分母裁判MLPerf: Training and Inference Performance Get a Common Denominator

提出Mattson等,2020年MLSys论文《MLPerf: An Industry Standard Benchmark Suite for Machine Learning Performance》。 争议Rajbhandari, S. et al. “ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.” SC, 2020.。 最新(2024年文献)Jiang, Y. et al. “MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs.” NSDI, 2024.。 关键以time-to-quality、延迟、吞吐和规则化精度门槛比较软硬件全栈,而非只看峰值算力。

AI芯片和框架快速增加后,厂商各用不同模型、batch、精度与数据集宣称倍数,数字无法横比。MLPerf联盟在2018年启动,2020年论文形成训练与推理套件:固定模型任务、质量阈值、数据处理规则和提交审计。性能对象由单算子或TFLOPS改成软硬件系统达到有效模型质量所需时间。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当厂商长期针对固定套件特调时,榜单时间越短,生产trace性能保留率反而越低”做至少两轮外部复算,若方向翻转,MLPerf:训练与推理性能获得同分母裁判MLPerf: Training and Inference Performance Get a Common Denominator的结论必须随之收窄。

〔反号压力〕本条主张,决定AI系统性能能否跨供应商比较的只有基准是否固定任务质量门槛与允许优化边界。训练成绩以time-to-quality停止,推理按server、offline、single-stream等场景测延迟和吞吐;closed division限制改变,open division允许创新。2020年的规则把“更快但更差”从榜单中剔除。

MLSys 2020论文报告首轮训练套件含视觉、翻译、推荐和强化学习等任务,并吸引多家系统提交;后续轮次可见跨硬件数量级改进。核验每项成绩必须绑定系统配置、软件版本、功耗范围、精度结果和审核日志;最快用2048个加速器与单机成绩不能只按秒数排序而不显示资源。〔反号压力〕证据链还要把Mattson等,2020年MLSys论文《MLPerf: An Industry Standa的起点材料与更新文献放在同一比较表里,并逐项报告“以time-to-quality、延迟、吞吐和规则化精度门槛比较软硬件全栈,而非只看峰值算力”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

排行榜会催生针对固定输入形状、通信拓扑和收敛阈值的优化,真实长尾请求与模型更新不在分母。2024年规则越稳定,厂商越能特调;规则频繁变又破坏跨年比较。公开最佳提交还受巨额硬件预算影响,time-to-quality最低不等于成本、能耗或可获得性最好。

2025年的复核应同时报告closed与open、总加速器小时、能耗、P99、失败率和复现次数;为LLM加入首token、每token、上下文长度与输出质量联合门槛。生产团队须以自家trace复跑参考实现,记录榜单配置到真实部署的性能保留率。单次冠军不得替代多轮稳定分布。〔反号压力〕在AI系统与基础设施的这一对象上,复核应把“达到同一质量门槛的任务数/加速器小时、焦耳、失败重跑与P99延迟”拆成同一分母下的主结果与失败谱,“特调代码、失败提交、硬件采购、维护人工、生产长尾与跨版本不可比区间”要单列编码,不能在汇总时并入其他项。

它与第351号第十一条“真实基准裂缝:峰值排名不等于应用吞吐”形成直接碰撞,本条说明标准化如何改善又制造裂缝;与第251号第二十条“系统研究的评价危机”相接时,基准决定研究注意力。MLPerf提供共同语言,不保证榜单任务覆盖每个生产AI系统。

位置S——把固定质量门槛与可审计规则当成跨AI系统性能比较的决定性资源 单因决定AI系统性能能否跨供应商比较的只有基准是否固定任务质量门槛与允许优化边界 预设〔03 缺失即不存在〕标准套件未覆盖的负载、故障、成本与可维护性被视为不影响系统价值 量纲达到同一质量门槛的任务数/加速器小时、焦耳、失败重跑与P99延迟 失效当厂商长期针对固定套件特调时,榜单时间越短,生产trace性能保留率反而越低 自曝反号压力独立核验:MLPerf固定了可比任务与规则,但提交的资源规模和真实可获得性仍高度不同;独立撤回检查落在反号压力 空栏特调代码、失败提交、硬件采购、维护人工、生产长尾与跨版本不可比区间 异名高性能计算称“真实基准裂缝:峰值排名不等于应用吞吐”;见第351号第十一条“真实基准裂缝:峰值排名不等于应用吞吐”

三、Horovod:Ring AllReduce把数据并行变成一行代码Horovod: Ring AllReduce Makes Data Parallelism a One-Line Change

提出Sergeev与Del Balso,2018年论文《Horovod: Fast and Easy Distributed Deep Learning in TensorFlow》。 争议Narayanan, D. et al. “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.” SC, 2021.。 最新(2025年文献)Qin, R. et al. “Mooncake: A KVCache-Centric Disaggregated Architecture for LLM Serving.” FAST, 2025.。 关键以MPI思想和Ring AllReduce聚合梯度,训练脚本只需少量修改即可从单卡扩到多节点。

分布式TensorFlow早期需要显式配置parameter server、worker、device placement和容错,研究者常把大量时间花在集群样板代码。Uber在2017–2018年开源Horovod,用Ring AllReduce让每个worker持有完整模型、分片发送梯度并最终得到同一归约结果。数据并行由平台专用架构变成接近一行包装的库接口。

〔责任链〕本条的单因命题是,决定同步数据并行能否避免中心热点的只有梯度是否通过带宽最优的集合通信在peer间归约。Ring把张量切为N块,reduce-scatter与allgather使每个节点发送约2(N−1)/N倍梯度大小,不再由一组server承受全部流量。2018年的易用性来自把通信语义固定成全员同步。〔责任链〕落到复现实务,可为Horovod:Ring AllReduce把数据并行变成一行代码Horovod: Ring AllReduce Makes Data Parallelism a One-Line Change建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到固定top-1的有效样本数/GPU小时、all-reduce字节与straggler等待秒数”统一结算,避免换口径后仍宣称性能提高。

Horovod论文报告在128块GPU上训练Inception V3可获得约90%扩展效率,并在多种TensorFlow模型上接近线性;读数需绑定batch、GPU代际、网络与最终top-1。核验应报告all-reduce占step时间、每链路字节、straggler等待和time-to-accuracy;weak scaling高并不说明固定全局batch下统计效率不变。

Ring中任何一个慢worker都会拖住所有节点,节点越多,遇到慢卡或网络抖动的概率反而越高;大batch还会改变优化与泛化。拓扑不是理想环时,跨机架链路成为瓶颈。易用封装也可能让使用者看不见梯度压缩、融合阈值和通信顺序正在改变数值归约。〔责任链〕本条的边界案例应从“慢卡剔除、网络重试、归约次序、大batch泛化、跨机架拓扑与集群占用机会成本”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当worker性能有长尾时,参与同步的节点越多,整步等待最慢节点的比例反而越高”究竟是偶发噪声,还是足以改变结论方向的系统反例。

2025年的复核应分别在单机NVLink、跨机InfiniBand与以太网运行,注入1%慢worker并画扩展效率分布;固定全局batch比较目标质量。集合通信trace要记录chunk、拓扑和重试,训练日志保存world size与归约算法。若128卡只提高samples/s却需更多epoch,不能按90%线性扩展结案。

它与第351号第二条“通信规避:少搬数据比少做运算更重要”共享通信下界,本条给出梯度集合通信的具体接口;与第360号第五条“专用化碎片:单任务加速可能降低集群效率”相接时,多卡独占也会降低集群利用。Horovod简化同步路径,不解决大模型装不进单卡。对Horovod:Ring AllReduce把数据并行变成一行代码Horovod: Ring AllReduce Makes Data Parallelism a One-Line Change而言,真正需要登记的不是又一个平均分,而是由“决定同步数据并行能否避免中心热点的只有梯度是否通过带宽最优集合通信在peer间归约”推出的每一步中介、责任人和可撤回条件;〔责任链〕缺少任何一环,都不能把相关性写成机制。

位置D——把本地梯度、reduce-scatter、allgather、同步与优化更新串成数据并行路径 单因决定同步数据并行能否避免中心热点的只有梯度是否通过带宽最优集合通信在peer间归约 预设〔01 谁进入分母〕所有worker按同速同质执行,等待与被淘汰慢卡不影响扩展效率 量纲达到固定top-1的有效样本数/GPU小时、all-reduce字节与straggler等待秒数 失效当worker性能有长尾时,参与同步的节点越多,整步等待最慢节点的比例反而越高 自曝责任链独立核验:128 GPU约90%效率依赖具体模型、网络和batch,未证明固定统计预算下同样线性;独立撤回检查落在责任链 空栏慢卡剔除、网络重试、归约次序、大batch泛化、跨机架拓扑与集群占用机会成本 异名高性能计算称“通信规避:少搬数据比少做运算更重要”;见第351号第二条“通信规避:少搬数据比少做运算更重要”

四、Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言Mesh-TensorFlow and Megatron: Tensor Dimensions Become a Sharding Language

提出Shazeer等,2018年NeurIPS《Mesh-TensorFlow》;Shoeybi等,2019年《Megatron-LM》。 争议Sergeev, A.; Del Balso, M. “Horovod: Fast and Easy Distributed Deep Learning in TensorFlow.” 2018.。 最新(2024年文献)Jiang, Y. et al. “MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs.” NSDI, 2024.。 关键程序员声明哪一张量维映射到处理器mesh,编译器生成SPMD集合通信。

数据并行要求每张卡放完整模型,当Transformer参数超过单卡显存便失效。Mesh-TensorFlow在2018年允许把batch、hidden或vocabulary等张量维度映射到多维processor mesh,编译为SPMD程序;Megatron-LM 2019用列并行、行并行切Transformer层。模型结构第一次携带明确的物理分片语义。机构采用Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言Mesh-TensorFlow and Megatron: Tensor Dimensions Become a Sharding Language之前还应公布否决门槛:一旦“当分片跨越低带宽边界时,模型维度切得越细,通信占比反而越高”出现,就暂停扩张并回到“程序员声明哪一张量维映射到处理器mesh,编译器生成SPMD集合通信”的原始记录复核;该门槛必须早于部署决定写入方案。

〔排除规则〕本条主张,决定超显存模型能否高效训练的只有逻辑张量维度是否映射到与通信拓扑相容的设备网格。矩阵乘的哪一维切分决定all-reduce或all-gather发生位置;在层内成对安排列、行并行可避免重复同步。2018–2019年的分片语言把“哪张卡放哪层”提升为可组合的维度变换。

Mesh-TensorFlow论文用最多512个TPU核心训练最高约50亿参数Transformer;Megatron-LM在512块V100上训练83亿参数模型,报告可维持约15.1 petaflops、76%扩展效率。复算需固定序列长、精度、激活重算和通信重叠,报告每参数训练FLOPs、链路字节与目标loss。把Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言Mesh-TensorFlow and Megatron: Tensor Dimensions Become a Sharding Language与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“达到固定loss的模型参数步数/加速器小时、链路字节、重算FLOPs与内存峰值”在这些类别上都可回查,跨研究比较才有意义。

错误切分会让all-gather体积超过计算,模型越大,跨低带宽边界的同步反而越支配;手写分片还绑定层形状和设备数。某些维度不能整除mesh,产生padding与空闲。论文中的规则化Transformer适合张量并行,不规则MoE、动态序列和多模态分支会破坏均匀假设。

2025年的验收应枚举至少数据、张量、流水线和序列4维策略,使用真实网络拓扑估算再实测;报告内存峰值、通信、重算、气泡与失败恢复。自动并行器必须给出搜索成本和次优差距,换设备数后重新验证。能编译的mesh不等于有可接受goodput。〔排除规则〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定超显存模型能否高效训练的只有逻辑张量维度是否映射到与通信拓扑相容的设备网格”的操作定义,仍能复算“达到固定loss的模型参数步数/加速器小时、链路字节、重算FLOPs与内存峰值”,否则所谓转向可能只是数据管线或命名变化。

它与第351号第三条“分区全局地址空间:全局可见不等于远程免费”共享逻辑全局、物理分区,本条作用于张量;与第251号第十七条“可组合的基础设施”相接时,SPMD设备网格必须匹配互连。50亿与83亿参数是当时规模读数,不是模型质量或经济价值的替身。

位置E——把模型形状、拓扑、设备数与自动搜索成本当成张量分片环境 单因决定超显存模型能否高效训练的只有逻辑张量维度是否映射到与通信拓扑相容的设备网格 预设〔01 谁进入分母〕规则Transformer上的最优mesh足以代表MoE、动态序列与多模态不规则图 量纲达到固定loss的模型参数步数/加速器小时、链路字节、重算FLOPs与内存峰值 失效当分片跨越低带宽边界时,模型维度切得越细,通信占比反而越高 自曝排除规则独立核验:512 TPU与512 V100结果依赖规则模型和专用互连,换拓扑后策略可能失效;独立撤回检查落在排除规则 空栏mesh不可整除、padding空闲、搜索成本、动态图、故障重分片与通信库版本 异名高性能计算称“分区全局地址空间:全局可见不等于远程免费”;见第351号第三条“分区全局地址空间:全局可见不等于远程免费”

五、ZeRO:优化器、梯度与参数不再在每张卡完整复制ZeRO: Optimizer States, Gradients and Parameters Stop Being Fully Replicated

提出Rajbhandari等,2020年SC论文《ZeRO: Memory Optimizations Toward Training Trillion Parameter Models》;Ren等,2021年USENIX ATC《ZeRO-Offload》。 争议Pollux Authors. “Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning.” OSDI, 2021.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键三个阶段依次分片优化器状态、梯度和参数,把数据并行的冗余变成可回收容量。

经典数据并行让每张GPU保存完整参数、梯度和Adam优化器状态,模型内存随参数线性复制,算力尚未用满显存先耗尽。ZeRO在2020年把冗余分三阶段消除:先分优化器状态,再分梯度,最终在需要计算时临时聚合参数。2021年ZeRO-Offload又把部分数据和计算移到CPU与NVMe层。

〔基线冻结〕本条的单因命题是,决定数据并行能否突破副本内存墙的只有训练状态是否按生命周期分片且只在使用时聚合。参数、梯度和优化器状态并非每步每卡都同时需要;ZeRO利用这一时序减少每卡驻留。系统层由“模型是否装得下”转成“状态何时在哪一级内存出现”的调度问题。〔基线冻结〕面向下一轮材料,AI系统与基础设施应优先补齐“丢失分片、world-size重构、CPU争用、NVMe磨损、manifest一致性与容量未完成训练”的原始记录,并把“当offload超过PCIe带宽时,可容纳模型越大,每秒有效token反而越少”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。〔基线冻结〕证据链还要把Rajbhandari等,2020年SC论文《ZeRO: Memory Optimization的起点材料与更新文献放在同一比较表里,并逐项报告“三个阶段依次分片优化器状态、梯度和参数,把数据并行的冗余变成可回收容量”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

SC 2020论文展示ZeRO可在当时集群训练千亿级模型,并提出万亿参数可行路径;USENIX ATC 2021的ZeRO-Offload在单张V100上训练超过130亿参数模型,相对常见PyTorch约提高10倍容量,10B模型约40 TFLOPS。核验需报告stage、精度、通信量、CPU占用与实际tokens/s。

Stage 3频繁all-gather参数,跨节点链路慢时节省的显存换成通信;offload越多,PCIe与CPU内存带宽反而越成为瓶颈。checkpoint现在分布在多rank,少一个分片就无法恢复;弹性改变world size还需重构状态。容量最大实验可能牺牲吞吐,不等于训练总成本最低。〔基线冻结〕在AI系统与基础设施的这一对象上,复核应把“达到目标loss的参数规模/GPU小时、主机焦耳、通信字节与checkpoint恢复分钟”拆成同一分母下的主结果与失败谱,“丢失分片、world-size重构、CPU争用、NVMe磨损、manifest一致性与容量未完成训练”要单列编码,不能在汇总时并入其他项。

2025年的复核应在ZeRO 1/2/3与offload层级间画模型大小—tokens/s—恢复时间Pareto,注入单rank丢失和world-size变化;checkpoint需有全局manifest和分片checksum。报告可用模型容量时必须同时给出达到目标loss的加速器小时与主机能耗,避免把“装得下”写成“训得起”。

它与第251号第十条“内存墙与近数据计算”共享数据移动约束,本条针对训练状态;与第351号第一条“屋顶线模型:算术强度决定性能上限”相接时,offload会降低算术强度。ZeRO把副本冗余转成通信和管理复杂性,三种成本必须同时入账。〔基线冻结〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当offload超过PCIe带宽时,可容纳模型越大,每秒有效token反而越少”做至少两轮外部复算,若方向翻转,ZeRO:优化器、梯度与参数不再在每张卡完整复制ZeRO: Optimizer States, Gradients and Parameters Stop Being Fully Replicated的结论必须随之收窄。

位置E——把HBM、CPU、NVMe、互连与world-size变化当成分片训练环境 单因决定数据并行能否突破副本内存墙的只有训练状态是否按生命周期分片且只在使用时聚合 预设〔04 测量不改变被测对象〕把状态移出GPU只改变容量,不改变训练吞吐、能耗与恢复风险 量纲达到目标loss的参数规模/GPU小时、主机焦耳、通信字节与checkpoint恢复分钟 失效当offload超过PCIe带宽时,可容纳模型越大,每秒有效token反而越少 自曝基线冻结独立核验:单V100超过130亿参数证明容量扩张,未证明该配置的总训练成本优于多卡方案;独立撤回检查落在基线冻结 空栏丢失分片、world-size重构、CPU争用、NVMe磨损、manifest一致性与容量未完成训练 异名操作系统称“内存墙与近数据计算”;见第251号第十条“内存墙与近数据计算”

六、PipeDream:流水线并行把层、微批与版本调度绑在一起PipeDream: Pipeline Parallelism Couples Layers, Microbatches and Versions

提出Narayanan等,2019年SOSP论文《PipeDream: Generalized Pipeline Parallelism for DNN Training》。 争议Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键系统按计算与通信剖面自动切层,用微批重叠前向和反向,并以权重暂存保持版本一致。

张量并行切单层,数据并行复制全模型;另一条路线是把连续层放到不同设备,让微批像装配线流过。PipeDream在2019年根据每层计算、激活大小和网络成本自动分段,调度多个microbatch的forward/backward重叠,并用weight stashing让反向使用与前向相配的参数版本。〔异常运行〕落到复现实务,可为PipeDream:流水线并行把层、微批与版本调度绑在一起PipeDream: Pipeline Parallelism Couples Layers, Microbatches and Versions建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到固定验证质量的有效microbatch数/GPU小时、bubble秒数与版本差步数”统一结算,避免换口径后仍宣称性能提高。

〔异常运行〕本条主张,决定模型流水线能否获得高利用率的只有分段是否平衡且微批调度保持可接受的权重版本语义。最慢stage决定节拍,microbatch数量决定填充与排空气泡;1F1B次序减少激活峰值。2019年的系统把层切分、调度和优化一致性视为同一问题,而非手工串接GPU。

SOSP 2019论文在图像与语言模型上比较数据并行和模型并行,报告某些配置最高约5.3倍更快、内存更低,并用自动分区适配硬件。复算需报告stage时间方差、bubble比例、激活驻留、权重版本差和time-to-accuracy;只给pipeline吞吐会漏掉陈旧梯度需多跑epoch。〔异常运行〕证据链还要把Narayanan等,2019年SOSP论文《PipeDream: Generalized Pi的起点材料与更新文献放在同一比较表里,并逐项报告“系统按计算与通信剖面自动切层,用微批重叠前向和反向,并以权重暂存保持版本一致”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

层计算不均或序列长度动态变化会使某stage持续空等;切分越多,边界激活通信越多。为填满管线增加microbatch,会抬高延迟和优化batch,权重暂存又耗显存。2025年故障恢复若只重启一段,跨stage的微批和版本可能失配,产生难察觉的错误更新。

2025年的验收应按序列长度分桶测stage P50/P99,比较GPipe、1F1B、interleaved和零气泡调度;报告质量、内存、通信与恢复。随机杀死中间stage后,系统必须证明丢弃或重放的microbatch集合一致。自动分区器要保存剖面输入,硬件或模型变更即重新求解。对PipeDream:流水线并行把层、微批与版本调度绑在一起PipeDream: Pipeline Parallelism Couples Layers, Microbatches and Versions而言,真正需要登记的不是又一个平均分,而是由“决定模型流水线能否获得高利用率的只有分段是否平衡且微批调度保持可接受权重版本语义”推出的每一步中介、责任人和可撤回条件;〔异常运行〕缺少任何一环,都不能把相关性写成机制。

它与第351号第四条“任务图运行时:并行次序应由依赖关系生成”共享依赖调度,本条的边是激活与梯度;与第360号第五条“专用化碎片:单任务加速可能降低集群效率”相接时,SOSP固定stage会造成资源碎片。约5.3倍是特定配置,不是任何模型切层后的保证。

位置D——把自动分段、微批前向、反向、权重版本与恢复组成流水线训练路径 单因决定模型流水线能否获得高利用率的只有分段是否平衡且微批调度保持可接受权重版本语义 预设〔04 测量不改变被测对象〕增加microbatch填满管线不会改变优化batch、延迟和收敛 量纲达到固定验证质量的有效microbatch数/GPU小时、bubble秒数与版本差步数 失效当stage负载随序列长波动时,微批越多,最慢stage累计等待反而越高 自曝异常运行独立核验:最高约5.3倍来自特定网络和硬件,自动分段仍依赖准确剖面与固定拓扑;独立撤回检查落在异常运行 空栏动态序列、版本失配、故障微批、激活重算、跨stage校验与分区过期 异名高性能计算称“任务图运行时:并行次序应由依赖关系生成”;见第351号第四条“任务图运行时:并行次序应由依赖关系生成”

七、Kubernetes、Kubeflow与KServe:模型服务进入声明式控制面Kubernetes, Kubeflow and KServe: Model Serving Gets a Declarative Control Plane

提出Kubeflow社区,2017年启动;KFServing于2019年、后更名KServe,形成基于Kubernetes的推理标准。 争议Narayanan, D. et al. “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.” SC, 2021.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键模型、预处理、解释器和流量策略被声明为资源,由控制器持续把实际状态拉回期望状态。

早期模型服务常是团队自建Web进程,扩容、健康检查、灰度和回滚各写一套脚本。Kubeflow从2017年把训练工作流带进Kubernetes,KFServing/KServe又以InferenceService资源描述predictor、transformer、explainer、canary和autoscaling。部署对象由命令序列变成可版本化的期望状态。

〔人工接管〕本条的单因命题是,决定模型服务能否在多集群一致运维的只有期望状态是否由控制器持续协调并保留版本化声明。CRD记录模型URI、runtime、资源与流量,controller创建pod、网络和伸缩器;健康失败会重建副本。2019年的接口让模型工程继承云原生调度、隔离与声明式回滚。把Kubernetes、Kubeflow与KServe:模型服务进入声明式控制面Kubernetes, Kubeflow and KServe: Model Serving Gets a Declarative Control Plane与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“满足输出质量与P99 SLO的成功请求数/全部请求、冷启动秒与GPU小时”在这些类别上都可回查,跨研究比较才有意义。

KServe项目在2021年成为独立品牌,支持TensorFlow、PyTorch、XGBoost等多种runtime,并以Knative实现按请求伸缩到零;生产读数通常包括冷启动、P95/P99、并发与GPU利用。核验须固定模型大小、镜像层、缓存和流量曲线,报告从0到首个成功响应的秒数及回滚后错误窗口。

控制器层多不等于可靠:CRD、service mesh、serverless和GPU插件任一版本不兼容都会阻塞;伸缩到零节省空闲成本,却让大模型冷启动达到分钟。声明越简洁,镜像、模型仓库与权限的隐含依赖反而越多。重建pod也无法撤销已经发出的错误预测。〔人工接管〕本条的边界案例应从“镜像供应链、模型digest、控制器升级、邻居干扰、语义回滚与已发错误输出”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当模型大且流量突发时,缩容越彻底,恢复容量前的超时请求反而越多”究竟是偶发噪声,还是足以改变结论方向的系统反例。

2025年的验收应模拟镜像拉取失败、模型仓库超时、GPU不足、流量突发和控制器升级,报告可用请求goodput与恢复P99;manifest绑定模型digest、镜像SBOM和数据签名。Canary必须按输出质量与错误率自动停止,不只按HTTP 200。多模型服务还需验证显存隔离和邻居干扰。

它与第251号第六条“轻量虚拟化”共享容器边界,本条把模型版本和流量变成声明资源;与第360号第十条“无服务器冷启动:零运维抽象仍有状态恢复代价”直接对撞KServe按需服务。声明式控制面减少手工步骤,不消除冷启动、供应链和语义回滚。机构采用Kubernetes、Kubeflow与KServe:模型服务进入声明式控制面Kubernetes, Kubeflow and KServe: Model Serving Gets a Declarative Control Plane之前还应公布否决门槛:一旦“当模型大且流量突发时,缩容越彻底,恢复容量前的超时请求反而越多”出现,就暂停扩张并回到“模型、预处理、解释器和流量策略被声明为资源,由控制器持续把实际状态拉回期望状态”的原始记录复核;该门槛必须早于部署决定写入方案。

位置D——把声明、控制器协调、灰度、自动伸缩、监控与回滚串成服务路径 单因决定模型服务能否在多集群一致运维的只有期望状态是否由控制器持续协调并保留版本化声明 预设〔03 缺失即不存在〕HTTP健康与pod就绪足以代表模型语义正确和全部外部副作用可回滚 量纲满足输出质量与P99 SLO的成功请求数/全部请求、冷启动秒与GPU小时 失效当模型大且流量突发时,缩容越彻底,恢复容量前的超时请求反而越多 自曝人工接管独立核验:多runtime与伸缩到零证明控制面通用性,未保证每个模型的语义健康与低冷启动;独立撤回检查落在人工接管 空栏镜像供应链、模型digest、控制器升级、邻居干扰、语义回滚与已发错误输出 异名系统性能称“无服务器冷启动:零运维抽象仍有状态恢复代价”;见第360号第十条“无服务器冷启动:零运维抽象仍有状态恢复代价”

八、vLLM与PagedAttention:KV缓存获得虚拟内存式分页vLLM and PagedAttention: KV Caches Get Virtual-Memory-Style Paging

提出Kwon等,2023年SOSP论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》。 争议Weng, Q. et al. “Beware of Fragmentation: Scheduling GPU-Sharing Workloads with Fragmentation Gradient Descent.” USENIX ATC, 2023.。 最新(2024年文献)Lin, C. et al. “Parrot: Efficient Serving of LLM-Based Applications with Semantic Variable.” OSDI, 2024.。 关键KV cache被切成固定block,以逻辑到物理映射非连续存放,从而支持continuous batching与共享前缀。

自回归LLM每生成一个token都要保留此前注意力的key/value状态,序列长度不一使连续显存预留产生内部与外部碎片。Kwon等在2023年借操作系统分页思想提出PagedAttention,把每个请求的KV cache切成固定块,经block table映射到非连续显存;vLLM据此动态拼批而不必预留最大长度。〔撤回门槛〕面向下一轮材料,AI系统与基础设施应优先补齐“跨租户残留、adapter版本、block清零、前缀命中偏差、长请求饥饿与调度公平”的原始记录,并把“当长请求占满continuous batch时,批中请求越多,短请求P99反而越高”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

〔撤回门槛〕本条主张,决定LLM服务能否提高显存goodput的只有KV状态是否按实际增长分配并可跨请求安全复用。逻辑block与物理block解耦,使新token只申请所需容量,copy-on-write支持并行采样和共享prompt。2023年的接口把显存管理从模型kernel内部提升为服务运行时的一级对象。

SOSP 2023论文报告PagedAttention把KV浪费降到接近最后一个block以内,vLLM在多种模型和负载上相对FasterTransformer、Orca等基线获得约2–4倍吞吐,同时保持相近延迟。复算应绑定模型、上下文、输出长度、block大小与SLO,报告goodput而非无限放宽延迟后的raw tokens/s。〔撤回门槛〕在AI系统与基础设施的这一对象上,复核应把“同时满足TTFT与TBT SLO的输出token数/GPU秒与KV物理block秒”拆成同一分母下的主结果与失败谱,“跨租户残留、adapter版本、block清零、前缀命中偏差、长请求饥饿与调度公平”要单列编码,不能在汇总时并入其他项。

continuous batching会让短请求与长生成共享迭代,调度不当仍有head-of-line阻塞;block太小增加元数据与寻址,太大重现浪费。缓存复用越积极,跨租户数据隔离和淘汰抖动反而越难。KV不是永久记忆,模型或LoRA版本变化后复用旧状态会产生语义错误。

2025年的验收应在真实长度分布、突发到达和多租户前缀下测TTFT、TBT、P99与SLO goodput,随机制造显存压力和版本切换;block table须检查所有权与引用计数。缓存键包含模型、tokenizer、adapter和prompt版本,安全删除后验证物理块清零,不能只测吞吐。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定LLM服务能否提高显存goodput的只有KV状态是否按实际增长分配并可跨请求安全复用”的操作定义,仍能复算“同时满足TTFT与TBT SLO的输出token数/GPU秒与KV物理block秒”,否则所谓转向可能只是数据管线或命名变化。〔撤回门槛〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当长请求占满continuous batch时,批中请求越多,短请求P99反而越高”做至少两轮外部复算,若方向翻转,vLLM与PagedAttention:KV缓存获得虚拟内存式分页vLLM and PagedAttention: KV Caches Get Virtual-Memory-Style Paging的结论必须随之收窄。

它与第251号第九条“存储栈的重写”共享逻辑—物理映射,本条把对象换成KV cache;与第251号第十三条“为推理而生的系统层”是直接细化。约2–4倍来自2023年选定负载,长输出、公平调度与严格SLO会改变可用增益。

位置E——把长度分布、租户隔离、block大小、版本与SLO当成KV分页环境 单因决定LLM服务能否提高显存goodput的只有KV状态是否按实际增长分配并可跨请求安全复用 预设〔05 缺失即不存在〕未进入吞吐读数的缓存隔离、版本错配与淘汰抖动被视为没有代价 量纲同时满足TTFT与TBT SLO的输出token数/GPU秒与KV物理block秒 失效当长请求占满continuous batch时,批中请求越多,短请求P99反而越高 自曝撤回门槛独立核验:约2–4倍吞吐来自选定模型与长度分布,严格延迟目标下goodput可能不同;独立撤回检查落在撤回门槛 空栏跨租户残留、adapter版本、block清零、前缀命中偏差、长请求饥饿与调度公平 异名操作系统称“为推理而生的系统层”;见第251号第十三条“为推理而生的系统层”

九、DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools

提出Zhong等,2024年OSDI论文《DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving》。 争议Pollux Authors. “Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning.” OSDI, 2021.。 最新(2025年文献)KServe Community. “KServe Model Inference Platform.” 2019–2025.。 关键计算密集的prefill与带宽受限的decode独立并行和扩缩,以TTFT、TPOT双SLO优化goodput。

LLM推理包含一次处理整段prompt的prefill和随后逐token的decode;前者适合大矩阵乘,后者反复读取权重与KV。共置批处理会让长prompt堵住正在生成的请求,并把两阶段资源比例锁死。DistServe在2024年把它们分到独立GPU组,完成prefill后传递KV状态,再由decode池继续。

〔跨域外推〕本条的单因命题是,决定双SLO推理能否提高goodput的只有计算形态不同的prefill与decode是否独立配置资源和并行策略。Prefill可用tensor parallel追求首token,decode用另一批次和parallelism维持每token延迟;离线placement按工作负载选择GPU数。2024年的解耦把请求内部阶段变成集群调度单元。〔跨域外推〕证据链还要把Zhong等,2024年OSDI论文《DistServe: Disaggregating Pre的起点材料与更新文献放在同一比较表里,并逐项报告“计算密集的prefill与带宽受限的decode独立并行和扩缩,以TTFT、TPOT双SLO优化goodput”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

OSDI 2024论文以多种LLM与生产式负载比较共置服务,报告在同时满足time-to-first-token与time-per-output-token约束时,DistServe可显著提高per-GPU goodput,部分设置达到数倍。复算必须给出prompt/output分布、KV传输字节、网络拓扑和两个SLO达标率,不能只报平均吞吐。

KV从prefill池跨网传到decode池会占互连,短prompt或低并发时搬运成本可能超过隔离收益;资源比例估错会让一侧排队、另一侧空闲。2024年拆分越彻底,故障恢复和请求所有权反而越复杂。若一个阶段采用不同模型版本,KV形状相同也可能语义不兼容。对DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools而言,真正需要登记的不是又一个平均分,而是由“决定双SLO推理能否提高goodput的只有计算形态不同的prefill与decode是否独立配置资源和并行策略”推出的每一步中介、责任人和可撤回条件;〔跨域外推〕缺少任何一环,都不能把相关性写成机制。

2025年的验收应按prompt与输出长度二维分桶,比较共置、静态分离和动态分离,报告TTFT、TPOT、KV网络P99与GPU空闲;注入decode池故障,确认KV只被重放一次。容量规划器每次模型或流量变化应重新估计,并在版本不一致时拒绝接力。

它与第251号第十七条“可组合的基础设施”共享计算资源解耦,本条解耦一次推理内部两阶段;与第360号第一条“微服务关键路径:服务延迟是调用图分布的组合”相接时,新增KV边成为关键路径。2024年的goodput增益依赖网络与长度分布,不是分离本身的恒定收益。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当KV传输接近互连上限时,阶段分得越开,端到端goodput反而越低”做至少两轮外部复算,若方向翻转,DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools的结论必须随之收窄。〔跨域外推〕落到复现实务,可为DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“同时满足TTFT与TPOT的完成请求数/GPU秒、KV网络字节与重放请求数”统一结算,避免换口径后仍宣称性能提高。

位置S——把可独立配置的prefill与decode资源池当成双SLO推理的决定性资源 单因决定双SLO推理能否提高goodput的只有计算形态不同的prefill与decode是否独立配置资源和并行策略 预设〔05 缺失即不存在〕KV跨池传输与阶段版本错配被视为不会改变解耦收益 量纲同时满足TTFT与TPOT的完成请求数/GPU秒、KV网络字节与重放请求数 失效当KV传输接近互连上限时,阶段分得越开,端到端goodput反而越低 自曝跨域外推独立核验:数倍增益来自特定长度与网络配置,短prompt低并发可能不覆盖额外搬运;独立撤回检查落在跨域外推 空栏KV重复、阶段版本、单侧过载、跨池认证、网络故障与容量估计过期 异名操作系统称“可组合的基础设施”;见第251号第十七条“可组合的基础设施”

十、Parrot:LLM应用图开始跨请求共享语义与中间状态Parrot: LLM Application Graphs Share Semantics and Intermediate State

提出Lin等,2024年OSDI论文《Parrot: Efficient Serving of LLM-based Applications with Semantic Variable》。 争议Rajbhandari, S. et al. “ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.” SC, 2020.。 最新(2025年文献)Qin, R. et al. “Mooncake: A KVCache-Centric Disaggregated Architecture for LLM Serving.” FAST, 2025.。 关键系统不再把每次LLM调用视为孤立请求,而以semantic variable表达依赖、共享前缀和并行机会。

聊天、代理和多阶段推理通常由多个相关LLM调用组成:同一上下文被重复编码,后一步等待前一步,应用开发者却只能向黑箱服务逐条发送请求。Parrot在2024年引入semantic variable和应用图,让系统看见调用间的数据依赖、前缀相同与可并行分支,从跨请求层面调度模型和缓存。〔盲法复核〕落到复现实务,可为Parrot:LLM应用图开始跨请求共享语义与中间状态Parrot: LLM Application Graphs Share Semantics and Intermediate State建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“满足隔离与完整性检查的应用完成数/GPU秒、重复token与关键路径秒数”统一结算,避免换口径后仍宣称性能提高。

〔盲法复核〕本条主张,决定复合AI应用能否跨调用优化的只有服务层是否获得足够的依赖语义而不必猜测程序关系。Semantic variable把prompt片段、输出和消费者显式连接,调度器可合并共享前缀、批处理兼容调用并提前安排后续。2024年的变化是把优化单元从一次请求扩成应用DAG。

OSDI 2024论文在多种LLM应用与集群设置中比较普通服务后端,报告Parrot通过prefix sharing与全局调度降低延迟并提高吞吐;关键读数应是完整应用完成时间、共享token命中、关键路径和SLO goodput。逐调用tokens/s提高而最终代理任务变慢,不能算基础设施进步。〔盲法复核〕本条的边界案例应从“跨租户缓存、错误依赖、安全检查顺序、敏感图结构、随机分支与调度饥饿”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当全局调度偏爱高共享分支时,缓存命中越高,关键短任务P99反而越差”究竟是偶发噪声,还是足以改变结论方向的系统反例。

向服务暴露semantic variable会泄露应用结构和可能含敏感信息的共享关系;错误声明依赖可让缓存串租户或把本应顺序的安全检查并行。2024年图越大,全局调度越复杂,局部高命中反而可能让关键短任务排队。模型随机输出还会使静态依赖不能保证程序语义。

2025年的验收应在多租户compound workload上测端到端P99、共享正确率、隔离失败与调度开销,加入错误依赖和权限边界;缓存只能在模型、租户、策略与数据版本都匹配时复用。trace需返回每个输出的调用图和前缀来源,使一次节省可与隐私、安全检查完整性同时审计。机构采用Parrot:LLM应用图开始跨请求共享语义与中间状态Parrot: LLM Application Graphs Share Semantics and Intermediate State之前还应公布否决门槛:一旦“当全局调度偏爱高共享分支时,缓存命中越高,关键短任务P99反而越差”出现,就暂停扩张并回到“系统不再把每次LLM调用视为孤立请求,而以semantic variable表达依赖、共享前缀和并行机会”的原始记录复核;该门槛必须早于部署决定写入方案。

它与第532号第十三条“ReAct:推理与行动改成观察驱动的交替循环”共享复合调用轨迹,本条优化轨迹的执行与缓存;与第351号第二十条“工作流级复现:一次作业成功不等于科学过程可重放”相接时,semantic variable也是重放血缘。应用语义提高机会,也扩大服务层责任。

位置S——把显式应用依赖与可安全共享的semantic variable当成跨调用优化的决定性资源 单因决定复合AI应用能否跨调用优化的只有服务层是否获得足够依赖语义而不必猜测程序关系 预设〔06 通过形式审查=实质合规〕声明了调用DAG就等于缓存共享、顺序与权限语义全部正确 量纲满足隔离与完整性检查的应用完成数/GPU秒、重复token与关键路径秒数 失效当全局调度偏爱高共享分支时,缓存命中越高,关键短任务P99反而越差 自曝盲法复核独立核验:应用级收益依赖正确semantic variable与共享机会,普通独立请求未必受益;独立撤回检查落在盲法复核 空栏跨租户缓存、错误依赖、安全检查顺序、敏感图结构、随机分支与调度饥饿 异名智能体工程称“ReAct:推理与行动改成观察驱动的交替循环”;见第532号第十三条“ReAct:推理与行动改成观察驱动的交替循环”

十一、BlitzScale:大模型自动伸缩必须移动活模型而非等待冷启动BlitzScale: LLM Autoscaling Moves Live Models Instead of Waiting for Cold Starts

提出Zhang等,2025年OSDI论文《BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching》。 争议Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.。 最新(2026年文献)Jin, C. et al. “HydraServe: Minimizing Cold Start Latency for Serverless LLM Serving.” NSDI, 2026.。 关键通过主机常数级缓存、并行传输和live migration,让数十至数百GB模型在流量突发时更快增加副本。

传统微服务扩容只需拉取小镜像并启动进程,大模型权重却有数十到数百GB,从对象存储加载会造成分钟级冷启动。BlitzScale在2025年把自动伸缩焦点放到模型状态传输,利用O(1)主机缓存避免为每个模型保留完整副本,并让运行中的实例向新GPU并行迁移权重。

〔结果分母〕本条主张,决定LLM服务能否追上突发流量的只有新副本是否在不停止旧副本时获得一致模型状态。Live scaling把传输、加载、注册和流量切换重叠,源实例继续服务;host cache减少远端读。2025年的系统把autoscaling从pod数量控制改成数百GB状态的在线复制协议。把BlitzScale:大模型自动伸缩必须移动活模型而非等待冷启动BlitzScale: LLM Autoscaling Moves Live Models Instead of Waiting for Cold Starts与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“触发后在SLO内完成的正确请求数/扩容秒、复制字节与源实例延迟损失”在这些类别上都可回查,跨研究比较才有意义。

OSDI 2025论文在多种模型、集群与突发trace上比较对象存储冷启动和既有伸缩器,报告更短scale-out时间与更少SLO违约,并强调主机缓存空间随模型数保持O(1)。复算应列权重GB、源/目标链路、在途请求、P99和额外网络字节;副本ready不等于已通过首个正确推理。

从活实例复制会抢占其服务带宽,扩容越激进,旧副本延迟反而越高;源实例若已损坏,会把错误状态快速传播。2025年O(1)缓存把容量压力转成置换和网络,多个模型同时突发会争同一链路。权重到位后还需kernel编译、KV热身与adapter装载,ready信号可能过早。〔结果分母〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定LLM服务能否追上突发流量的只有新副本是否在不停止旧副本时获得一致模型状态”的操作定义,仍能复算“触发后在SLO内完成的正确请求数/扩容秒、复制字节与源实例延迟损失”,否则所谓转向可能只是数据管线或命名变化。

2026年的验收应制造单模型、十模型和跨机架同步突发,测触发到首个SLO合格请求的时间,并报告源实例性能损失;权重块用hash验证,流量切换前做语义canary。缓存置换、编译与adapter必须进入状态机,扩容失败要回滚容量计划,防止控制环振荡;连续5次突发也必须稳定且每次均无超时。

它与第360号第十一条“自动伸缩振荡:延迟反馈会让正确控制规则失稳”共享控制回路,本条补上大模型状态移动;与第251号第九条“存储栈的重写”相接时,OSDI权重分发决定冷启动。O(1)主机缓存减少容量增长,不表示网络、编译和热身也变成常数。〔结果分母〕面向下一轮材料,AI系统与基础设施应优先补齐“源状态损坏、adapter装载、kernel编译、缓存置换、控制振荡与ready误报”的原始记录,并把“当多个模型同时从活实例复制时,扩容并发越高,源服务P99反而越差”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。

位置D——把触发、活体复制、校验、注册、canary与流量切换串成大模型扩容路径 单因决定LLM服务能否追上突发流量的只有新副本是否在不停止旧副本时获得一致模型状态 预设〔06 通过形式审查=实质合规〕副本进入ready就等于权重、kernel、adapter与首个输出全部正确 量纲触发后在SLO内完成的正确请求数/扩容秒、复制字节与源实例延迟损失 失效当多个模型同时从活实例复制时,扩容并发越高,源服务P99反而越差 自曝结果分母独立核验:O(1)描述主机缓存容量随模型数的关系,不代表传输和热身时间为常数;独立撤回检查落在结果分母 空栏源状态损坏、adapter装载、kernel编译、缓存置换、控制振荡与ready误报 异名系统性能称“自动伸缩振荡:延迟反馈会让正确控制规则失稳”;见第360号第十一条“自动伸缩振荡:延迟反馈会让正确控制规则失稳”

十二、SYMPHONY:会话KV从GPU计算中解耦为独立记忆层SYMPHONY: Conversational KV State Becomes a Disaggregated Memory Layer

提出Agarwal、Hu、Mao、Akella与Venkataraman,2026年NSDI论文《SYMPHONY: Enabling Compute-Memory Disaggregation in LLM Serving Systems》。 争议Pollux Authors. “Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning.” OSDI, 2021.。 最新(2024年文献)Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.。 关键计算实例不再永久绑定长会话KV,advisory request提前预取,调度器可按请求迁移。

多轮对话的KV cache会随历史增长,若状态固定留在生成它的GPU,请求被粘到单机,冷热会话造成负载不均;若每次重算或临时offload,又增加延迟。SYMPHONY在2026年把KV存储从计算实例解耦,引入独立记忆层,并依据用户交互或应用结构发出的advisory request提前预取。〔未覆盖项〕证据链还要把Agarwal、Hu、Mao、Akella与Venkataraman,2026年NSDI论文《S的起点材料与更新文献放在同一比较表里,并逐项报告“计算实例不再永久绑定长会话KV,advisory request提前预取,调度器可按请求迁移”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。

〔未覆盖项〕本条的单因命题是,决定有状态LLM请求能否细粒度负载均衡的只有KV是否可在计算与记忆层间按优先级移动并在需要前到达。系统用神经网络层结构和请求优先级管理缓存,GPU与远端协作决定保留、迁出和预取;预测错时仍需有退化路径。2026年的分离把会话状态变成可调度资产。

NSDI 2026论文页码2027–2041,在LLaMA模型、ShareGPT与BurstGPT负载上比较vLLM等基线;结果报告端到端延迟降低约2.4倍,并可在延迟仅小幅增加时服务约4倍请求。复算需固定会话长度、重返时间、网络与存储层,报告预取precision、KV字节和SLO goodput。〔未覆盖项〕在AI系统与基础设施的这一对象上,复核应把“满足SLO且KV版本正确的恢复会话数/预取字节、重算token与远程内存秒数”拆成同一分母下的主结果与失败谱,“KV删除证明、跨区复制、租户隔离、预取公平、记忆节点灾难恢复与模型切换”要单列编码,不能在汇总时并入其他项。

advisory signal并不可靠:用户可能不回来、突然切模型或在另一地区继续,会使预取浪费带宽;2026年远程层故障会同时丢失许多会话状态。解耦越广,KV中敏感对话的复制与保留位置反而越难解释。优先级若偏爱活跃付费会话,长尾用户重算成本会被平均值掩盖。

2026年的验收应把正确、过早、过晚和错误预取分开,模拟记忆节点故障、区域迁移和删除请求;KV必须加密、绑定租户与模型版本,并有可证明清除。报告每类用户的重算、迁移和SLO,比较本地、主机offload与远程解耦。若隐私删除不能跨副本完成,性能增益不应通过。〔未覆盖项〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当advisory request误报增多时,预取越积极,有效请求可用带宽反而越少”做至少两轮外部复算,若方向翻转,SYMPHONY:会话KV从GPU计算中解耦为独立记忆层SYMPHONY: Conversational KV State Becomes a Disaggregated Memory Layer的结论必须随之收窄。

它与第251号第十七条“可组合的基础设施”共享内存解耦,本条对象是含会话语义的KV;与第532号第十五条“记忆与反思:上下文窗口不再假装是一生”相比,NSDI本条只解决状态放置,不解决记忆内容正确。2.4倍与4倍来自指定负载,预取错误和隐私成本必须另列。

位置E——把会话重返、预取误差、网络、租户与删除义务当成解耦KV环境 单因决定有状态LLM请求能否细粒度负载均衡的只有KV是否可在计算与记忆层间按优先级移动并在需要前到达 预设〔08 谁进入分母〕ShareGPT与BurstGPT中的会话重返足以代表所有用户、地区与隐私选择 量纲满足SLO且KV版本正确的恢复会话数/预取字节、重算token与远程内存秒数 失效当advisory request误报增多时,预取越积极,有效请求可用带宽反而越少 自曝未覆盖项独立核验:约2.4倍延迟与4倍容量建立在指定模型和trace上,远程层故障另有风险;独立撤回检查落在未覆盖项 空栏KV删除证明、跨区复制、租户隔离、预取公平、记忆节点灾难恢复与模型切换 异名智能体工程称“记忆与反思:上下文窗口不再假装是一生”;见第532号第十五条“记忆与反思:上下文窗口不再假装是一生”

◎ 二十年连起来看

2004–2017年的抽象上移路线是记录→工作集→参数→数据流图→生产流水线;2018–2026年则是任务/actor→设备mesh→训练状态→应用图→会话KV。每一轮都把程序员不再愿意手管的细节交给运行时,同时暴露新的可变状态。真正的学科主线不是框架更替,而是“哪个状态由谁拥有、何时复制、失败后怎样证明一致”。MapReduce重算输入,ZeRO重组checkpoint,SYMPHONY清除远程KV,三者隔着二十年共享同一责任问题。

◎ 三个常见误解

质量时间要求训练以time-to-quality而非steps/s结案;有效吞吐只计算同时满足TTFT、TBT或任务SLO的goodput;恢复语义要求故障后模型、优化器、微批和外部副作用回到可证明状态;版本血缘把数据、代码、编译器、权重、adapter、prompt和缓存连接。2026年的AI系统若只报峰值token/s,等于把失败重跑、质量下降、缓存错配和人工处置全部排出分母。

◎ 与相邻领域的接口

误解一:加速器越多训练必然越快。通信、陈旧梯度与统计batch会让time-to-quality反号。误解二:模型能部署就已生产就绪。KServe的HTTP健康不验证输出语义,28项测试也不能覆盖未知风险。误解三:缓存命中一定省资源。错误前缀、跨版本KV和无效预取会消耗带宽并扩大隐私面。基础设施的成功读数必须包含有效结果、资源和恢复,不可把“能跑”与“值得持续运行”混为一谈。

◎ 争议现场

它与高性能计算共享通信、Roofline和任务图,但负责模型状态与质量语义;与操作系统共享虚拟内存、调度和资源解耦,但需处理梯度、checkpoint和KV;与数据工程共享血缘与schema,却把模型晋级和训练—服务一致纳入事务;与软件工程共享测试和技术债,却面对随机、数据依赖与漂移。相邻面板若用峰值FLOPS、PUE或HTTP可用率,本块必须补上time-to-quality、SLO goodput和artifact版本,才可形成同分母碰撞。

◎ 往下五年看什么

TensorFlow和Ray追求统一接口,Horovod、ZeRO、vLLM与DistServe则因明确瓶颈获得巨大增益。通用平台降低团队切换成本,却可能遮住硬件和模型形状;特化系统压榨效率,却造成碎片与人才锁定。判断不应靠流行度,而要量出迁移后的性能保留、运维人数、故障域和弃用成本。2026年的合理架构往往是稳定控制面加可替换数据面:版本、权限、观测统一,kernel、并行策略和缓存按负载演化。

◎ 可与哪些领域对撞

AI系统评测应至少包含固定模型的单组件微基准、完整训练或服务闭环、真实长度与到达trace、以及故障注入4层。训练画loss对墙钟、GPU小时与焦耳;推理同时画TTFT、TBT、P99和goodput;恢复随机杀worker、server、stage、控制器与远程记忆层。每项结果至少重跑5次,公布失败提交和置信区间。没有真实trace时,必须说明合成分布及其漏掉的相关性、突发和多租户干扰。

◎ 十条可做的研究命题

2026–2031年的基础设施会围绕三种解耦竞争:计算与高带宽记忆、训练与推理、单模型与复合应用。RL后训练需要生成、奖励和更新不同资源池;多模态与智能体让状态跨媒体、工具和权限流动;异构GPU与专用芯片要求自动并行真正考虑价格和能源。最重要的突破不是再多一层调度器,而是让系统能为一次答案给出可核算账单:用了哪些数据、状态、设备和外部服务,失败如何恢复,删除怎样跨副本完成。

◎ 资料核验

审计清单:① 训练报告time-to-quality;② 推理报告双SLO goodput;③ 记录数据、代码、编译、权重与缓存版本;④ 注入节点、网络与控制面故障;⑤ 报告P99和最坏分片;⑥ 把失败重跑、空闲和人工纳入成本;⑦ 验证checkpoint与KV删除;⑧ 让扩缩、灰度和回滚以语义质量而非HTTP健康收口。

  1. Dean, J.; Ghemawat, S. “MapReduce: Simplified Data Processing on Large Clusters.” OSDI, 2004.
  2. Dean, J.; Ghemawat, S. “MapReduce: Simplified Data Processing on Large Clusters.” CACM, 2008.
  3. Nickolls, J. et al. “Scalable Parallel Programming with CUDA.” ACM Queue, 2008.
  4. LeCun, Y. et al. “Efficient BackProp.” Neural Networks, 1998.
  5. Zaharia, M. et al. “Spark: Cluster Computing with Working Sets.” HotCloud, 2010.
  6. Zaharia, M. et al. “Resilient Distributed Datasets.” NSDI, 2012.
  7. Dean, J. et al. “Large Scale Distributed Deep Networks.” NeurIPS, 2012.
  8. Li, M. et al. “Scaling Distributed Machine Learning with the Parameter Server.” OSDI, 2014.
  9. Abadi, M. et al. “TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems.” 2015.
  10. Abadi, M. et al. “TensorFlow: A System for Large-Scale Machine Learning.” OSDI, 2016.
  11. Sculley, D. et al. “Hidden Technical Debt in Machine Learning Systems.” NeurIPS, 2015.
  12. Breck, E. et al. “The ML Test Score.” IEEE Big Data, 2017.
  13. Baylor, D. et al. “TFX: A TensorFlow-Based Production-Scale Machine Learning Platform.” KDD, 2017.
  14. Polyzotis, N. et al. “Data Management Challenges in Production Machine Learning.” SIGMOD, 2017.
  15. Moritz, P. et al. “Ray: A Distributed Framework for Emerging AI Applications.” OSDI, 2018.
  16. Mattson, P. et al. “MLPerf: An Industry Standard Benchmark Suite for Machine Learning Performance.” MLSys, 2020.
  17. Sergeev, A.; Del Balso, M. “Horovod: Fast and Easy Distributed Deep Learning in TensorFlow.” 2018.
  18. Patrascu, A.; Thorpe, M. “Horovod: Fast and Easy Distributed Deep Learning.” Journal of Open Source Software, 2018.
  19. Shazeer, N. et al. “Mesh-TensorFlow: Deep Learning for Supercomputers.” NeurIPS, 2018.
  20. Shoeybi, M. et al. “Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.” 2019.
  21. Rajbhandari, S. et al. “ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.” SC, 2020.
  22. Ren, J. et al. “ZeRO-Offload: Democratizing Billion-Scale Model Training.” USENIX ATC, 2021.
  23. Rajbhandari, S. et al. “ZeRO-Infinity.” SC, 2021.
  24. Narayanan, D. et al. “PipeDream: Generalized Pipeline Parallelism for DNN Training.” SOSP, 2019.
  25. Huang, Y. et al. “GPipe: Efficient Training of Giant Neural Networks Using Pipeline Parallelism.” NeurIPS, 2019.
  26. Narayanan, D. et al. “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.” SC, 2021.
  27. Burns, B. et al. “Borg, Omega, and Kubernetes.” CACM, 2016.
  28. Verma, A. et al. “Large-Scale Cluster Management at Google with Borg.” EuroSys, 2015.
  29. Kubeflow Community. “Kubeflow: The Machine Learning Toolkit for Kubernetes.” 2017–2025.
  30. KServe Community. “KServe Model Inference Platform.” 2019–2025.
  31. Crankshaw, D. et al. “Clipper: A Low-Latency Online Prediction Serving System.” NSDI, 2017.
  32. Olston, C. et al. “TensorFlow-Serving: Flexible, High-Performance ML Serving.” 2017.
  33. Kwon, W. et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention.” SOSP, 2023.
  34. Yu, G.-I. et al. “Orca: A Distributed Serving System for Transformer-Based Generative Models.” OSDI, 2022.
  35. Agrawal, A. et al. “Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve.” OSDI, 2024.
  36. Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.
  37. Lin, C. et al. “Parrot: Efficient Serving of LLM-Based Applications with Semantic Variable.” OSDI, 2024.
  38. Sheng, Y. et al. “FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.” ICML, 2023.
  39. Sheng, Y. et al. “High-Throughput Generative Inference of Large Language Models with a Single GPU.” 2023.
  40. Zheng, L. et al. “SGLang: Efficient Execution of Structured Language Model Programs.” NeurIPS, 2024.
  41. Zhang, D. et al. “BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching.” OSDI, 2025.
  42. Jin, C. et al. “HydraServe: Minimizing Cold Start Latency for Serverless LLM Serving.” NSDI, 2026.
  43. Agarwal, S. et al. “SYMPHONY: Enabling Compute-Memory Disaggregation in LLM Serving Systems.” NSDI, 2026.
  44. Qin, R. et al. “Mooncake: A KVCache-Centric Disaggregated Architecture for LLM Serving.” FAST, 2025.
  45. Jiang, Y. et al. “MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs.” NSDI, 2024.
  46. Weng, Q. et al. “Beware of Fragmentation: Scheduling GPU-Sharing Workloads with Fragmentation Gradient Descent.” USENIX ATC, 2023.
  47. Gu, J. et al. “Tiresias: A GPU Cluster Manager for Distributed Deep Learning.” NSDI, 2019.
  48. Pollux Authors. “Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning.” OSDI, 2021.
  49. Jeon, M. et al. “Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads.” USENIX ATC, 2019.
  50. Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.
  51. Barroso, L.; Hölzle, U.; Ranganathan, P. The Datacenter as a Computer. Morgan & Claypool, 2018.
  52. Dean, J.; Barroso, L. “The Tail at Scale.” CACM, 2013.