AI系统与基础设施
AI系统与基础设施研究的不是某个模型更聪明,而是数据、参数、梯度、版本与请求怎样穿过机器、网络和组织仍保持可训练、可复算、可服务、可回滚。2004年MapReduce把失败重算藏进批任务,CUDA、Spark、DistBelief、参数服务器和TensorFlow又依次重写设备、迭代、状态与执行图;2015年技术债和2017年TFX则把模型周围的生产系统显影。2018年以后,Ray、MLPerf、集合通信、张量与流水线分片、ZeRO、KServe、PagedAttention以及推理阶段和KV记忆解耦,把基础设施推进到大模型的训练—服务共同设计。
第一幕的共同转向,是把一次成功训练背后的隐形工作变成系统抽象:数据按分区重算,GPU算子接受统一编程,迭代工作集可缓存,参数与计算可分离,逻辑图跨设备布置,依赖与测试进入生产门。每一次封装也留下新的债:落盘、数据移动、陈旧梯度、API漂移、影子管线和形式合规。基础设施因此不能只报吞吐,还要同时登记质量、版本、失败恢复与未进入分母的人工。
甲、MapReduce:训练数据第一次按失败可恢复的批任务扩展MapReduce: Training Data Scales as Failure-Recoverable Batch Jobs
2004年前,大规模机器学习预处理常由研究团队手写MPI作业、文件分片和失败恢复;一台机器重启就可能让数小时任务重来。Dean与Ghemawat把Google内部常见数据计算压成Map和Reduce两个接口,运行时自动切输入、把任务靠近数据、重跑失败分片。数据规模由算法脚本之外的运维能力,变成可复用的执行抽象。
〔对象清单〕本条的单因命题是,决定批量AI数据处理能否跨普通集群扩展的只有运行时是否把确定性分区与失败重算封装在编程接口下。Map把记录变成中间键值,shuffle按键聚合,Reduce生成结果;任务级重试比维护全局进程状态更简单。2004年的创新不在某个学习算法,而在让词频、倒排索引和样本统计共享容错骨架。对MapReduce:训练数据第一次按失败可恢复的批任务扩展MapReduce: Training Data Scales as Failure-Recoverable Batch Jobs而言,真正需要登记的不是又一个平均分,而是由“决定批量AI数据处理能否跨普通集群扩展的只有运行时是否封装确定性分区与失败重算”推出的每一步中介、责任人和可撤回条件;〔对象清单〕缺少任何一环,都不能把相关性写成机制。
OSDI 2004论文报告Google在1800台机器上运行MapReduce生产作业,并以约1,000台机器处理1TB数据:分布式grep约150秒,排序约891秒。核验必须同时给出输入字节、有效记录、机器数、失败数和shuffle流量;“1TB在15分钟内排序”若不含资源与副本成本,不能比较下一代AI管线。
MapReduce每轮通常读写分布式文件系统,逻辑回归、聚类和深度学习的迭代会反复搬同一数据。作业越被拆成独立阶段,恢复越容易,迭代端到端时间反而越长;straggler重跑还会复制热点流量。批任务假定函数近似确定,若数据增强含随机性,重算分片可能改变训练样本。〔对象清单〕落到复现实务,可为MapReduce:训练数据第一次按失败可恢复的批任务扩展MapReduce: Training Data Scales as Failure-Recoverable Batch Jobs建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“经血缘核对一致的有效样本数/读取字节、shuffle字节与磁盘写入总量”统一结算,避免换口径后仍宣称性能提高。
2025年的复核应把有效样本每秒、shuffle字节、磁盘写放大、失败恢复时间和随机种子一致性并列;在同一1TB输入上比较批、缓存迭代与流式引擎。数据清洗还需保留记录级血缘,使一次分片重跑能说明哪些样本改变;仅验证作业成功,不足以证明模型看见同一训练集。
它与第054号第一条“云把分布式系统变成基础设施”共享普通机器集群,本条限定AI数据作业的编程与重算接口;与第351号第四条“任务图运行时:并行次序应由依赖关系生成”相比,MapReduce只暴露两级有向结构。2004年的容错吞吐证明批处理可扩展,不证明多轮学习或低延迟推理适合这一抽象。
乙、CUDA与通用GPU:学习代码开始围绕异构设备重写CUDA and GPGPU: Learning Code Is Rewritten Around Heterogeneous Devices
2007年前,GPU通用计算需要把数值问题伪装成图形着色器,内存和执行模型难以维护。CUDA把线程、block、grid、共享内存和device kernel公开给C/C++程序,2008年论文系统说明SIMT编程。机器学习由CPU上的少量向量库调用,转向把算子、内存布局和批量大小围绕异构设备设计。〔事件时间轴〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定学习负载能否获得GPU级加速的只有算子是否暴露足够并行性且复用层级内存”的操作定义,仍能复算“固定精度下有效训练样本数/GPU小时、host—device字节与移植人工小时”,否则所谓转向可能只是数据管线或命名变化。
〔事件时间轴〕本条主张,决定学习负载能否获得GPU级加速的只有算子是否暴露足够并行性且复用层级内存。成千线程并非自动变快:连续访存、warp分歧、寄存器和共享内存占用共同决定occupancy。2007年的接口把硬件细节开放给框架作者,随后cuBLAS、cuDNN等库才可把卷积和矩阵乘积做成标准后端。
Nickolls等2008年以CUDA展示并行程序可在多代GPU扩展,AlexNet 2012又用2块GPU训练约6000万参数网络,把工具链推入AI主流。可复算读数应是固定数值精度下的images/s、host—device字节与加速器小时,而非峰值TFLOPS;同一kernel还需报告batch=1与大batch的差距。机构采用CUDA与通用GPU:学习代码开始围绕异构设备重写CUDA and GPGPU: Learning Code Is Rewritten Around Heterogeneous Devices之前还应公布否决门槛:一旦“当内核过度针对单代架构手调时,局部速度越高,跨设备性能保留率反而越低”出现,就暂停扩张并回到“研究者可用C风格kernel直接调度数千线程,矩阵与卷积由图形管线外溢为通用学习基础”的原始记录复核;该门槛必须早于部署决定写入方案。
GPU显存小于主存,数据搬运、内核启动和同步会吃掉短任务收益;算子越为单代架构手调,换设备后反而越难维护。专有编译栈也造成供应商锁定,浮点归约次序会让结果不完全复现。若只报训练最快一次,预处理等待与GPU空闲不会进入分母。
2025年的验收应以Roofline拆算术强度、HBM带宽与互连等待,比较CUDA、跨平台编译和CPU基线;记录内核版本、驱动、设备代际与数值误差。性能可移植性不能只证明“能运行”,而要报告在3类设备上相对各自最佳实现的保留率,并把移植人工计入成本。把CUDA与通用GPU:学习代码开始围绕异构设备重写CUDA and GPGPU: Learning Code Is Rewritten Around Heterogeneous Devices与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“固定精度下有效训练样本数/GPU小时、host—device字节与移植人工小时”在这些类别上都可回查,跨研究比较才有意义。
它与第351号第五条“异构加速编程:GPU不是外设而是协处理器”是直接异名,本条把接口放入AI框架形成史;与第251号第十二条“加速器的虚拟化与调度”相接时,单作业kernel效率还要接受多租户隔离。2007年的可编程性打开规模路线,却没有消除内存、互连和供应链边界。
丙、Spark:迭代学习把工作集留在内存Spark: Iterative Learning Keeps Working Sets in Memory
MapReduce擅长一次扫描,却让PageRank、k-means和逻辑回归每轮都重新读写文件。Zaharia等在2010年提出Spark,把会被反复使用的working set留在集群内存;2012年的RDD以不可变分区、粗粒度变换和lineage描述如何重建丢失数据。迭代机器学习由一串独立批作业变成可缓存的数据流。
〔装置边界〕本条的单因命题是,决定迭代算法能否跨轮次提速的只有运行时是否在保持血缘可恢复时复用内存工作集。RDD不为每个元素复制日志,而记录从输入到分区的确定性变换;节点失败时只重算丢失分区。2010年的折中用不可变与粗粒度换取低元数据成本,正好适配反复扫描同一训练样本。〔装置边界〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当分区倾斜与血缘过长时,缓存越满,单点失败后的恢复尾延迟反而越高”做至少两轮外部复算,若方向翻转,Spark:迭代学习把工作集留在内存Spark: Iterative Learning Keeps Working Sets in Memory的结论必须随之收窄。
早期Spark论文在迭代机器学习和交互查询中报告相对Hadoop最高约10倍提速,并展示数十秒级交互;NSDI 2012进一步比较内存、磁盘与容错。核验应固定算法轮数、收敛阈值和输入分区,报告每轮秒数、cache hit、spill字节和恢复耗时;只报首轮或热缓存最快值会夸大实际收益。
RDD分区若按错误键倾斜,一台executor会成为长尾;缓存越积极,垃圾回收和spill反而越严重。血缘链太长时,节点失败触发大段重算,恢复尖峰可能超过定期checkpoint。迭代快也不保证统计收敛更快:不同分区和归约次序会改变浮点轨迹。〔装置边界〕面向下一轮材料,AI系统与基础设施应优先补齐“外部副作用、长血缘截断、热分区、垃圾回收、浮点归约差异与样本版本”的原始记录,并把“当分区倾斜与血缘过长时,缓存越满,单点失败后的恢复尾延迟反而越高”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
2025年的复核应同时施加数据倾斜、10%节点故障、内存不足和动态扩缩,画训练loss对墙钟时间而非只对iteration。血缘需连接到样本版本,checkpoint要注明是否含优化器状态;GPU供料还应测列式解码与PCIe等待。缓存命中率高但GPU饥饿,仍不是合格AI数据层。
它与第351号第四条“任务图运行时:并行次序应由依赖关系生成”共享DAG,本条限定不可变数据血缘与迭代工作集;与第360号第六条“生产轨迹基准:合成负载会遗漏相关性与突发”相接时,缓存效果取决于真实复用。2010年的10倍是相对批落盘路线,不是所有工作负载的固定常数。〔装置边界〕在AI系统与基础设施的这一对象上,复核应把“达到同一loss所需墙钟秒数/spill字节、重算分区数与GPU等待秒数”拆成同一分母下的主结果与失败谱,“外部副作用、长血缘截断、热分区、垃圾回收、浮点归约差异与样本版本”要单列编码,不能在汇总时并入其他项。
丁、DistBelief:参数服务器与模型副本把深网训练拆开DistBelief: Parameter Servers and Model Replicas Decompose Deep Training
深度网络在2012年迅速增大,单机内存和训练周期同时成为瓶颈。Dean等构建DistBelief,把一个模型的参数分布到多台parameter server,再让多个model replica读取参数、计算梯度并异步推送。训练系统不再等于一段GPU程序,而是参数所有权、数据副本、网络更新和故障恢复组成的服务。对DistBelief:参数服务器与模型副本把深网训练拆开DistBelief: Parameter Servers and Model Replicas Decompose Deep Training而言,真正需要登记的不是又一个平均分,而是由“决定超单机模型能否扩展训练的只有参数状态与梯度计算是否被分离且允许并发更新”推出的每一步中介、责任人和可撤回条件;〔样本分层〕缺少任何一环,都不能把相关性写成机制。
〔样本分层〕本条主张,决定超单机模型能否扩展训练的只有参数状态与梯度计算是否被分离且允许并发更新。Downpour SGD容忍不同副本在略旧参数上工作,避免全局barrier;Sandblaster由协调器分配优化子问题。2012年的关键接口是把“模型”拆成逻辑图与物理分片,使算法能在数千机器上运行。
NeurIPS 2012论文说明DistBelief可用数千台机器训练十亿级参数网络,并以数万CPU核心处理语音与视觉任务;报告某些配置相对单副本获得数量级加速。复算必须给出参数数、replica数、server分片、网络字节、梯度staleness和最终质量;机器增加100倍却只快12倍仍要登记利用率。〔样本分层〕落到复现实务,可为DistBelief:参数服务器与模型副本把深网训练拆开DistBelief: Parameter Servers and Model Replicas Decompose Deep Training建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到固定验证质量所需墙钟时间/机器小时、网络字节与梯度陈旧步数”统一结算,避免换口径后仍宣称性能提高。
异步副本读取的参数版本不同,吞吐越高,梯度反而越陈旧,可能在尖锐loss区域震荡;parameter server热点会把少数embedding行变成网络瓶颈。2025年大集群失败频繁,checkpoint若不同步会恢复到混合版本。训练收敛与系统吞吐因此不能各报一个最佳实验再拼成结论。
2025年的验收应画time-to-quality而非steps/s,按0、1、10和100步陈旧分桶报告梯度贡献;随机杀死server与worker,测恢复后loss是否连续。所有副本需记录数据shard、代码和参数版本,checkpoint用一致性校验。若加机器只提高原始梯度数却不缩短目标精度时间,应判为无效扩展。〔样本分层〕证据链还要把Dean等,2012年NeurIPS论文《Large Scale Distributed Dee的起点材料与更新文献放在同一比较表里,并逐项报告“DistBelief以Downpour SGD和Sandblaster L-BFGS让模型跨机器分片、多个副本并行计算”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
它与第351号第十五条“局部性感知调度:就绪任务并非等价任务”对接梯度副本放置,本条把参数状态从计算节点中抽离;与第251号第十一条“数据中心作为一台计算机”共享仓库级资源。2012年的规模突破为TensorFlow铺路,也暴露算法语义会被调度与通信改变。
戊、参数服务器:分布式学习获得一致性、弹性与键空间The Parameter Server: Distributed Learning Gets Consistency, Elasticity and a Key Space
DistBelief展示内部框架后,Li等在2014年把parameter server抽象为通用分布式机器学习系统。参数按key range分片,worker通过push与pull更新;server group负责复制和恢复,vector clock与一致性选项控制陈旧程度。算法作者可表达稀疏矩阵、图模型和深度网络,而不必为每个任务重写通信层。
〔版本登记〕本条的单因命题是,决定共享模型状态能否被许多worker并发访问的只有键空间是否同时提供分片、局部性与可声明一致性。范围push/pull避免传完整向量,连续key可放在同一server;弹性成员变化不改变逻辑命名。2014年的接口把参数从进程内数组变成网络对象,也把一致性选择交还给算法。机构采用参数服务器:分布式学习获得一致性、弹性与键空间The Parameter Server: Distributed Learning Gets Consistency, Elasticity and a Key Space之前还应公布否决门槛:一旦“当键访问呈幂律时,worker越多,少数热点server的队列反而越长”出现,就暂停扩张并回到“参数以分布式键值空间管理,worker可异步push/pull,系统支持范围订阅、容错与弹性扩缩”的原始记录复核;该门槛必须早于部署决定写入方案。
OSDI 2014论文在大规模稀疏逻辑回归、LDA和DNN任务上使用数百至上千节点,展示接近线性的短区间扩展与每小时数千亿参数访问量级。可复算读数应含每秒有效更新、热点key的P99、staleness、复制流量和最终AUC;平均带宽无法揭示一个热embedding分片拖住全局。
键分布若遵循幂律,少数server会成为热点;一致性越放松,worker越少等待,但错误更新也越晚被看见。2024年弹性加入节点需要重分片,迁移期间缓存和版本可能错位。系统把算法容忍陈旧当配置,却没有替用户证明哪种staleness仍保持收敛与公平。把参数服务器:分布式学习获得一致性、弹性与键空间The Parameter Server: Distributed Learning Gets Consistency, Elasticity and a Key Space与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“通过版本校验的有效参数更新数/网络字节、P99键延迟与重平衡秒数”在这些类别上都可回查,跨研究比较才有意义。
2025年的复核应以合成均匀键和真实长尾embedding各跑一次,报告每分片队列、网络丢包、节点替换与重平衡时间;同时画accuracy对staleness。配置变更必须进入模型血缘,恢复后抽样比对参数checksum。若P99键延迟翻倍,即使平均吞吐提高也不应宣称线性扩展。
它与第251号第十七条“可组合的基础设施”共享资源分离,本条分离的是学习状态而非硬件内存;与第351号第十四条“韧性超越检查点:错误恢复应进入算法内部”相接时,一致性决定恢复语义。2014年的通用键空间后来被all-reduce和专用embedding系统部分替代,说明抽象也有工作负载边界。〔版本登记〕本条的边界案例应从“丢失更新、热点分片、公平误差、成员变更、缓存版本与一致性配置责任”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当键访问呈幂律时,worker越多,少数热点server的队列反而越长”究竟是偶发噪声,还是足以改变结论方向的系统反例。
己、TensorFlow数据流图:同一模型跨CPU、GPU与TPU布置TensorFlow Dataflow Graphs: One Model Spans CPUs, GPUs and TPUs
2015年前的深度学习代码常与单一设备、参数服务器和训练脚本绑定,研究原型难进入产品。TensorFlow把张量上的operation、edge与可变状态表达为数据流图,placement算法再把节点映到CPU、GPU或TPU。2016年OSDI系统把研究、分布式训练和在线推理置于同一接口,开源发布又形成跨机构生态。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定一个AI程序能否跨异构规模复用的只有逻辑计算图是否与物理设备布置分离”的操作定义,仍能复算“跨3类设备达到同一质量的成功图数/全部图及相对各后端最佳实现的性能损失”,否则所谓转向可能只是数据管线或命名变化。
〔失败谱〕本条主张,决定一个AI程序能否跨异构规模复用的只有逻辑计算图是否与物理设备布置分离。图描述依赖和状态,runtime依据设备能力、通信成本和用户约束选择placement;send/receive节点跨进程传张量。2015年的抽象让新优化器和模型无需修改底层集群,却也让图语义成为编译与执行契约。
OSDI 2016论文页码265–283,说明TensorFlow已用于Google十多个领域和多项生产服务,并展示单机、多GPU及分布式任务的吞吐。核验应同时报图构建、编译、执行、通信和checkpoint时间;固定模型在1、8、64设备上的time-to-accuracy与扩展效率,比单个step/s峰值更能检验跨规模复用。〔失败谱〕面向下一轮材料,AI系统与基础设施应优先补齐“图编译时间、API漂移、随机状态、算子缺口、checkpoint兼容与跨设备数值差”的原始记录,并把“当默认placement产生大张量跨设备边时,支持的设备越多,端到端吞吐反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
图上的合法placement不等于高效:一个小操作跨设备就会触发大张量传输,状态变量又可能形成隐式串行点。抽象越统一,硬件特有瓶颈反而越容易被默认策略隐藏;静态图错误常在运行时才以shape或device mismatch出现。开源API变化还会让旧模型无法完全重放。
2025年的验收应导出带shape、dtype、device和通信边的完整图,检查跨设备字节与关键路径;同一模型在3类后端上比较质量、性能和数值差异。编译缓存、算子版本、随机状态与checkpoint格式必须进入artifact清单,若只保存Python源码,无法证明数年后重建的是同一执行图。〔失败谱〕在AI系统与基础设施的这一对象上,复核应把“跨3类设备达到同一质量的成功图数/全部图及相对各后端最佳实现的性能损失”拆成同一分母下的主结果与失败谱,“图编译时间、API漂移、随机状态、算子缺口、checkpoint兼容与跨设备数值差”要单列编码,不能在汇总时并入其他项。
它与第251号第十三条“为推理而生的系统层”相接,但本条覆盖从训练图到部署图的统一表示;与第351号第二条“性能可移植性:可移植不是能运行,而是少掉速”共享跨设备判据。2015–2016年的图抽象扩大生态,却不保证默认placement、数值或API长期稳定。
庚、机器学习技术债:模型代码只是生产系统的一小块Hidden ML Technical Debt: Model Code Is a Small Part of Production
机器学习竞赛把代码框在训练与评测脚本里,生产图景却有数据收集、特征、验证、服务、监控和回滚。Sculley等2015年指出,真正模型代码常只是系统盒图中的很小区域,周围被configuration debt、data dependencies、pipeline jungles和glue code包围。AI系统工程由“模型是否准”转向“变化怎样传播”。
〔机构接口〕本条的单因命题是,决定生产ML系统能否长期修改的只有依赖关系是否显式、可测试并有所有者。CACE原则提醒changing anything changes everything:一个特征的缩放会改变训练、服务与监控;隐藏消费者和反馈回路使局部优化成为全局风险。2015年的贡献是把可维护性变成模型质量之外的一级目标。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当自动化继续接入无主外部依赖时,平台覆盖越广,单次变更的爆炸半径反而越大”做至少两轮外部复算,若方向翻转,机器学习技术债:模型代码只是生产系统的一小块Hidden ML Technical Debt: Model Code Is a Small Part of Production的结论必须随之收窄。
NeurIPS 2015论文以Google生产经验归纳边界侵蚀、纠缠、未声明消费者、数据依赖、反馈回路和配置等模式,页码2503–2511。核验不应只数代码行,而应统计每次模型或特征变更触发的组件、回滚分钟和未预期告警;一项变更若波及17个服务,比模型仓库只改20行更能说明债务。
“债”隐喻可能让团队默认以后还本,却没有记录谁因夜间告警、数据清洗和人工补洞承担成本。自动化越多,隐式供应商API与无人负责的数据源反而越深。若把所有失败都称技术债,歧视性目标或不合法数据会被误当可重构问题,而不是应停止的制度选择。〔机构接口〕证据链还要把Sculley等,2015年NeurIPS论文《Hidden Technical Debt in的起点材料与更新文献放在同一比较表里,并逐项报告“纠缠、数据依赖、反馈回路、配置与管线胶水会让一个小模型变更产生远处副作用”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
2025年的审计应生成数据—特征—模型—服务—指标有向图,为每条边登记schema、版本、SLO、负责人和撤销条件;做一次game day随机移除上游源,量出blast radius。基础模型应用还要把prompt、检索库、工具与评委加入图。没有所有者的边必须进入空栏,不能以“平台负责”收口。
它与第251号第十八条“形式化与实测并重的可靠性”共享失败可见性,本条集中模型与数据依赖;与第532号第二十条“AgentOps、AIOS与AgentDojo:可靠性变成运行时工程”相比,技术债从训练前延伸到工具代理。2015年的清单是诊断框架,不是通过打勾即可消除的认证。对机器学习技术债:模型代码只是生产系统的一小块Hidden ML Technical Debt: Model Code Is a Small Part of Production而言,真正需要登记的不是又一个平均分,而是由“决定生产ML系统能否长期修改的只有依赖关系是否显式可测试并有所有者”推出的每一步中介、责任人和可撤回条件;〔机构接口〕缺少任何一环,都不能把相关性写成机制。
辛、ML Test Score与TFX:生产准备度成为28项可执行测试ML Test Score and TFX: Production Readiness Becomes 28 Executable Tests
传统软件测试假定相同输入产生确定输出,机器学习却会因数据分布、随机训练和服务特征改变。Breck等在2017年提出ML Test Score,以28项测试检查数据完整、特征计算、训练—服务一致、模型质量、基础设施与在线监控;TFX同期把ExampleGen、Transform、Trainer、Evaluator和Pusher接成生产流水线。机构采用ML Test Score与TFX:生产准备度成为28项可执行测试ML Test Score and TFX: Production Readiness Becomes 28 Executable Tests之前还应公布否决门槛:一旦“当团队持续针对固定门调参时,通过率越高,未见故障的漏检率反而越高”出现,就暂停扩张并回到“数据、特征、模型、基础设施与监控被拆成28项测试,流水线只有通过门槛才可晋级”的原始记录复核;该门槛必须早于部署决定写入方案。
〔资源预算〕本条主张,决定模型能否安全从实验晋级生产的只有每个工件是否通过覆盖数据、代码、模型和服务的自动门。测试不是在最终模型跑一次accuracy,而是schema异常阻断数据、候选模型与blessing基线比较、serving signature验证后才push。2017年的流水线把发布决定从个人脚本改成可重放状态机。
ML Test Score列出28项具体测试和监控需求,并按基础、成熟层次给出计分;TFX论文描述Google生产规模的统一组件与持续训练。核验应统计门控命中真实回归的precision、漏失事故、假阳性阻塞小时和从数据到上线的血缘完整率;28/28通过若未做分布外测试,仍不是风险为零。〔资源预算〕落到复现实务,可为ML Test Score与TFX:生产准备度成为28项可执行测试ML Test Score and TFX: Production Readiness Becomes 28 Executable Tests建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“在上线前拦住真实回归的门控次数/全部真实回归加假阳性阻塞次数”统一结算,避免换口径后仍宣称性能提高。
团队会选择容易通过的阈值,长期把失败样本加入golden set后形成测试过拟合;门越多,发布越慢,工程师可能在紧急时绕过。2025年平均schema和accuracy测试也看不见小群体或语义错误。形式准备度越高,反而越容易让采购与管理层把流程分数误当实质安全。
2025年的发布门应区分硬阻断、需人工复核和观测性告警,按事故严重度回测每项门的价值;每季度引入未见故障和shadow traffic。LLM流水线需验证prompt、检索快照、工具权限与评委漂移,保留break-glass日志。得分必须连同未测试空栏和豁免责任人公开。〔资源预算〕本条的边界案例应从“break-glass绕过、最坏群体、评委漂移、人工复核、未知故障与门控维护成本”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当团队持续针对固定门调参时,通过率越高,未见故障的漏检率反而越高”究竟是偶发噪声,还是足以改变结论方向的系统反例。
它与第360号第七条“持续性能验证:回归应像功能错误一样阻止合并”共享持续门控,本条将对象扩到数据和模型语义;与第048号第八条“评估成为基础设施”相接时,评测结果真正控制发布。2017年的28项是路线图,不应冻结为2026年全部AI系统的永久清单。
第二幕把系统对象从静态模型扩成动态AI应用和复合请求:task与actor运行中生成,标准基准固定质量门槛,集合通信、张量、流水线和状态分片共同决定训练,声明式控制面管理版本与流量;随后KV分页、prefill/decode分离、应用图共享、活体扩容和远程会话记忆把一次生成拆成可调度阶段。前沿不再是“更多GPU”,而是每一字节状态在正确时间、正确设备、正确版本和正确权限下出现。
一、Ray:任务与Actor统一动态AI应用Ray: Tasks and Actors Unify Dynamic AI Applications
监督学习流水线多是静态DAG,强化学习、超参搜索和智能体却不断生成新任务、维护环境状态并等待异步结果。Moritz等在2018年提出Ray,以remote task表达可并行函数,以actor表达有状态服务,对象存储和全局控制服务共同调度。AI基础设施开始为动态应用而非固定批作业设计。
〔外部复算〕本条的单因命题是,决定新型AI应用能否在同一运行时表达的只有无状态任务与有状态actor是否共享低延迟动态调度。Task易负载均衡和故障重试,actor保存模型、环境或参数状态;future建立依赖而无需预先画完整图。2018年的统一接口让模拟器、训练器和服务不用分别依赖三套系统。〔外部复算〕面向下一轮材料,AI系统与基础设施应优先补齐“重复副作用、控制面故障域、任务重放顺序、对象spill、孤儿actor与级联停机”的原始记录,并把“当对象存储spill和动态扇出叠加时,任务创建越快,端到端goodput反而越低”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
OSDI 2018论文页码561–577,报告Ray每秒可调度超过180万任务、延迟约毫秒量级,并用强化学习与模拟应用展示扩展。复算必须给出任务粒度、actor状态大小、对象存储命中、失败重试与端到端time-to-reward;空函数吞吐不能代表包含GPU推理和环境I/O的真实轨迹。
动态任务树会在负载尖峰中爆炸,对象存储满后spill把延迟推高;actor重启若外部副作用不可幂等,就会重复行动。2025年调度越自由,运行次序越难重放,性能bug与随机训练纠缠。统一控制面还扩大故障域,一次元数据服务拥塞可能让训练、调参与服务同时停顿。〔外部复算〕把Ray:任务与Actor统一动态AI应用Ray: Tasks and Actors Unify Dynamic AI Applications与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“满足状态一致与P99 SLO的有效任务数/全部创建任务与重试任务数”在这些类别上都可回查,跨研究比较才有意义。
2025年的验收应在生产轨迹上注入actor崩溃、object store满、网络分区和控制面重启,测goodput与状态一致;每个task须有幂等键和来源trace。对强化学习报告有效新鲜轨迹而非原始任务数,对服务报告P99。若一个统一集群事故同时影响多个阶段,应按级联损失计账。
它与第532号第九条“AutoGen与角色编排:对话成为分布式控制平面”共享动态角色,本条提供底层task/actor执行;与第351号第四条“任务图运行时:并行次序应由依赖关系生成”相比,Ray允许图在运行中生长。2018年的180万调度数是空任务能力,不等于所有AI应用获得同等加速。〔外部复算〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定新型AI应用能否在同一运行时表达的只有无状态任务与有状态actor是否共享低延迟动态调度”的操作定义,仍能复算“满足状态一致与P99 SLO的有效任务数/全部创建任务与重试任务数”,否则所谓转向可能只是数据管线或命名变化。
二、MLPerf:训练与推理性能获得同分母裁判MLPerf: Training and Inference Performance Get a Common Denominator
AI芯片和框架快速增加后,厂商各用不同模型、batch、精度与数据集宣称倍数,数字无法横比。MLPerf联盟在2018年启动,2020年论文形成训练与推理套件:固定模型任务、质量阈值、数据处理规则和提交审计。性能对象由单算子或TFLOPS改成软硬件系统达到有效模型质量所需时间。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当厂商长期针对固定套件特调时,榜单时间越短,生产trace性能保留率反而越低”做至少两轮外部复算,若方向翻转,MLPerf:训练与推理性能获得同分母裁判MLPerf: Training and Inference Performance Get a Common Denominator的结论必须随之收窄。
〔反号压力〕本条主张,决定AI系统性能能否跨供应商比较的只有基准是否固定任务质量门槛与允许优化边界。训练成绩以time-to-quality停止,推理按server、offline、single-stream等场景测延迟和吞吐;closed division限制改变,open division允许创新。2020年的规则把“更快但更差”从榜单中剔除。
MLSys 2020论文报告首轮训练套件含视觉、翻译、推荐和强化学习等任务,并吸引多家系统提交;后续轮次可见跨硬件数量级改进。核验每项成绩必须绑定系统配置、软件版本、功耗范围、精度结果和审核日志;最快用2048个加速器与单机成绩不能只按秒数排序而不显示资源。〔反号压力〕证据链还要把Mattson等,2020年MLSys论文《MLPerf: An Industry Standa的起点材料与更新文献放在同一比较表里,并逐项报告“以time-to-quality、延迟、吞吐和规则化精度门槛比较软硬件全栈,而非只看峰值算力”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
排行榜会催生针对固定输入形状、通信拓扑和收敛阈值的优化,真实长尾请求与模型更新不在分母。2024年规则越稳定,厂商越能特调;规则频繁变又破坏跨年比较。公开最佳提交还受巨额硬件预算影响,time-to-quality最低不等于成本、能耗或可获得性最好。
2025年的复核应同时报告closed与open、总加速器小时、能耗、P99、失败率和复现次数;为LLM加入首token、每token、上下文长度与输出质量联合门槛。生产团队须以自家trace复跑参考实现,记录榜单配置到真实部署的性能保留率。单次冠军不得替代多轮稳定分布。〔反号压力〕在AI系统与基础设施的这一对象上,复核应把“达到同一质量门槛的任务数/加速器小时、焦耳、失败重跑与P99延迟”拆成同一分母下的主结果与失败谱,“特调代码、失败提交、硬件采购、维护人工、生产长尾与跨版本不可比区间”要单列编码,不能在汇总时并入其他项。
它与第351号第十一条“真实基准裂缝:峰值排名不等于应用吞吐”形成直接碰撞,本条说明标准化如何改善又制造裂缝;与第251号第二十条“系统研究的评价危机”相接时,基准决定研究注意力。MLPerf提供共同语言,不保证榜单任务覆盖每个生产AI系统。
三、Horovod:Ring AllReduce把数据并行变成一行代码Horovod: Ring AllReduce Makes Data Parallelism a One-Line Change
分布式TensorFlow早期需要显式配置parameter server、worker、device placement和容错,研究者常把大量时间花在集群样板代码。Uber在2017–2018年开源Horovod,用Ring AllReduce让每个worker持有完整模型、分片发送梯度并最终得到同一归约结果。数据并行由平台专用架构变成接近一行包装的库接口。
〔责任链〕本条的单因命题是,决定同步数据并行能否避免中心热点的只有梯度是否通过带宽最优的集合通信在peer间归约。Ring把张量切为N块,reduce-scatter与allgather使每个节点发送约2(N−1)/N倍梯度大小,不再由一组server承受全部流量。2018年的易用性来自把通信语义固定成全员同步。〔责任链〕落到复现实务,可为Horovod:Ring AllReduce把数据并行变成一行代码Horovod: Ring AllReduce Makes Data Parallelism a One-Line Change建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到固定top-1的有效样本数/GPU小时、all-reduce字节与straggler等待秒数”统一结算,避免换口径后仍宣称性能提高。
Horovod论文报告在128块GPU上训练Inception V3可获得约90%扩展效率,并在多种TensorFlow模型上接近线性;读数需绑定batch、GPU代际、网络与最终top-1。核验应报告all-reduce占step时间、每链路字节、straggler等待和time-to-accuracy;weak scaling高并不说明固定全局batch下统计效率不变。
Ring中任何一个慢worker都会拖住所有节点,节点越多,遇到慢卡或网络抖动的概率反而越高;大batch还会改变优化与泛化。拓扑不是理想环时,跨机架链路成为瓶颈。易用封装也可能让使用者看不见梯度压缩、融合阈值和通信顺序正在改变数值归约。〔责任链〕本条的边界案例应从“慢卡剔除、网络重试、归约次序、大batch泛化、跨机架拓扑与集群占用机会成本”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当worker性能有长尾时,参与同步的节点越多,整步等待最慢节点的比例反而越高”究竟是偶发噪声,还是足以改变结论方向的系统反例。
2025年的复核应分别在单机NVLink、跨机InfiniBand与以太网运行,注入1%慢worker并画扩展效率分布;固定全局batch比较目标质量。集合通信trace要记录chunk、拓扑和重试,训练日志保存world size与归约算法。若128卡只提高samples/s却需更多epoch,不能按90%线性扩展结案。
它与第351号第二条“通信规避:少搬数据比少做运算更重要”共享通信下界,本条给出梯度集合通信的具体接口;与第360号第五条“专用化碎片:单任务加速可能降低集群效率”相接时,多卡独占也会降低集群利用。Horovod简化同步路径,不解决大模型装不进单卡。对Horovod:Ring AllReduce把数据并行变成一行代码Horovod: Ring AllReduce Makes Data Parallelism a One-Line Change而言,真正需要登记的不是又一个平均分,而是由“决定同步数据并行能否避免中心热点的只有梯度是否通过带宽最优集合通信在peer间归约”推出的每一步中介、责任人和可撤回条件;〔责任链〕缺少任何一环,都不能把相关性写成机制。
四、Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言Mesh-TensorFlow and Megatron: Tensor Dimensions Become a Sharding Language
数据并行要求每张卡放完整模型,当Transformer参数超过单卡显存便失效。Mesh-TensorFlow在2018年允许把batch、hidden或vocabulary等张量维度映射到多维processor mesh,编译为SPMD程序;Megatron-LM 2019用列并行、行并行切Transformer层。模型结构第一次携带明确的物理分片语义。机构采用Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言Mesh-TensorFlow and Megatron: Tensor Dimensions Become a Sharding Language之前还应公布否决门槛:一旦“当分片跨越低带宽边界时,模型维度切得越细,通信占比反而越高”出现,就暂停扩张并回到“程序员声明哪一张量维映射到处理器mesh,编译器生成SPMD集合通信”的原始记录复核;该门槛必须早于部署决定写入方案。
〔排除规则〕本条主张,决定超显存模型能否高效训练的只有逻辑张量维度是否映射到与通信拓扑相容的设备网格。矩阵乘的哪一维切分决定all-reduce或all-gather发生位置;在层内成对安排列、行并行可避免重复同步。2018–2019年的分片语言把“哪张卡放哪层”提升为可组合的维度变换。
Mesh-TensorFlow论文用最多512个TPU核心训练最高约50亿参数Transformer;Megatron-LM在512块V100上训练83亿参数模型,报告可维持约15.1 petaflops、76%扩展效率。复算需固定序列长、精度、激活重算和通信重叠,报告每参数训练FLOPs、链路字节与目标loss。把Mesh-TensorFlow与Megatron:张量维度成为设备网格上的分片语言Mesh-TensorFlow and Megatron: Tensor Dimensions Become a Sharding Language与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“达到固定loss的模型参数步数/加速器小时、链路字节、重算FLOPs与内存峰值”在这些类别上都可回查,跨研究比较才有意义。
错误切分会让all-gather体积超过计算,模型越大,跨低带宽边界的同步反而越支配;手写分片还绑定层形状和设备数。某些维度不能整除mesh,产生padding与空闲。论文中的规则化Transformer适合张量并行,不规则MoE、动态序列和多模态分支会破坏均匀假设。
2025年的验收应枚举至少数据、张量、流水线和序列4维策略,使用真实网络拓扑估算再实测;报告内存峰值、通信、重算、气泡与失败恢复。自动并行器必须给出搜索成本和次优差距,换设备数后重新验证。能编译的mesh不等于有可接受goodput。〔排除规则〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定超显存模型能否高效训练的只有逻辑张量维度是否映射到与通信拓扑相容的设备网格”的操作定义,仍能复算“达到固定loss的模型参数步数/加速器小时、链路字节、重算FLOPs与内存峰值”,否则所谓转向可能只是数据管线或命名变化。
它与第351号第三条“分区全局地址空间:全局可见不等于远程免费”共享逻辑全局、物理分区,本条作用于张量;与第251号第十七条“可组合的基础设施”相接时,SPMD设备网格必须匹配互连。50亿与83亿参数是当时规模读数,不是模型质量或经济价值的替身。
五、ZeRO:优化器、梯度与参数不再在每张卡完整复制ZeRO: Optimizer States, Gradients and Parameters Stop Being Fully Replicated
经典数据并行让每张GPU保存完整参数、梯度和Adam优化器状态,模型内存随参数线性复制,算力尚未用满显存先耗尽。ZeRO在2020年把冗余分三阶段消除:先分优化器状态,再分梯度,最终在需要计算时临时聚合参数。2021年ZeRO-Offload又把部分数据和计算移到CPU与NVMe层。
〔基线冻结〕本条的单因命题是,决定数据并行能否突破副本内存墙的只有训练状态是否按生命周期分片且只在使用时聚合。参数、梯度和优化器状态并非每步每卡都同时需要;ZeRO利用这一时序减少每卡驻留。系统层由“模型是否装得下”转成“状态何时在哪一级内存出现”的调度问题。〔基线冻结〕面向下一轮材料,AI系统与基础设施应优先补齐“丢失分片、world-size重构、CPU争用、NVMe磨损、manifest一致性与容量未完成训练”的原始记录,并把“当offload超过PCIe带宽时,可容纳模型越大,每秒有效token反而越少”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。〔基线冻结〕证据链还要把Rajbhandari等,2020年SC论文《ZeRO: Memory Optimization的起点材料与更新文献放在同一比较表里,并逐项报告“三个阶段依次分片优化器状态、梯度和参数,把数据并行的冗余变成可回收容量”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
SC 2020论文展示ZeRO可在当时集群训练千亿级模型,并提出万亿参数可行路径;USENIX ATC 2021的ZeRO-Offload在单张V100上训练超过130亿参数模型,相对常见PyTorch约提高10倍容量,10B模型约40 TFLOPS。核验需报告stage、精度、通信量、CPU占用与实际tokens/s。
Stage 3频繁all-gather参数,跨节点链路慢时节省的显存换成通信;offload越多,PCIe与CPU内存带宽反而越成为瓶颈。checkpoint现在分布在多rank,少一个分片就无法恢复;弹性改变world size还需重构状态。容量最大实验可能牺牲吞吐,不等于训练总成本最低。〔基线冻结〕在AI系统与基础设施的这一对象上,复核应把“达到目标loss的参数规模/GPU小时、主机焦耳、通信字节与checkpoint恢复分钟”拆成同一分母下的主结果与失败谱,“丢失分片、world-size重构、CPU争用、NVMe磨损、manifest一致性与容量未完成训练”要单列编码,不能在汇总时并入其他项。
2025年的复核应在ZeRO 1/2/3与offload层级间画模型大小—tokens/s—恢复时间Pareto,注入单rank丢失和world-size变化;checkpoint需有全局manifest和分片checksum。报告可用模型容量时必须同时给出达到目标loss的加速器小时与主机能耗,避免把“装得下”写成“训得起”。
它与第251号第十条“内存墙与近数据计算”共享数据移动约束,本条针对训练状态;与第351号第一条“屋顶线模型:算术强度决定性能上限”相接时,offload会降低算术强度。ZeRO把副本冗余转成通信和管理复杂性,三种成本必须同时入账。〔基线冻结〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当offload超过PCIe带宽时,可容纳模型越大,每秒有效token反而越少”做至少两轮外部复算,若方向翻转,ZeRO:优化器、梯度与参数不再在每张卡完整复制ZeRO: Optimizer States, Gradients and Parameters Stop Being Fully Replicated的结论必须随之收窄。
六、PipeDream:流水线并行把层、微批与版本调度绑在一起PipeDream: Pipeline Parallelism Couples Layers, Microbatches and Versions
张量并行切单层,数据并行复制全模型;另一条路线是把连续层放到不同设备,让微批像装配线流过。PipeDream在2019年根据每层计算、激活大小和网络成本自动分段,调度多个microbatch的forward/backward重叠,并用weight stashing让反向使用与前向相配的参数版本。〔异常运行〕落到复现实务,可为PipeDream:流水线并行把层、微批与版本调度绑在一起PipeDream: Pipeline Parallelism Couples Layers, Microbatches and Versions建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“达到固定验证质量的有效microbatch数/GPU小时、bubble秒数与版本差步数”统一结算,避免换口径后仍宣称性能提高。
〔异常运行〕本条主张,决定模型流水线能否获得高利用率的只有分段是否平衡且微批调度保持可接受的权重版本语义。最慢stage决定节拍,microbatch数量决定填充与排空气泡;1F1B次序减少激活峰值。2019年的系统把层切分、调度和优化一致性视为同一问题,而非手工串接GPU。
SOSP 2019论文在图像与语言模型上比较数据并行和模型并行,报告某些配置最高约5.3倍更快、内存更低,并用自动分区适配硬件。复算需报告stage时间方差、bubble比例、激活驻留、权重版本差和time-to-accuracy;只给pipeline吞吐会漏掉陈旧梯度需多跑epoch。〔异常运行〕证据链还要把Narayanan等,2019年SOSP论文《PipeDream: Generalized Pi的起点材料与更新文献放在同一比较表里,并逐项报告“系统按计算与通信剖面自动切层,用微批重叠前向和反向,并以权重暂存保持版本一致”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
层计算不均或序列长度动态变化会使某stage持续空等;切分越多,边界激活通信越多。为填满管线增加microbatch,会抬高延迟和优化batch,权重暂存又耗显存。2025年故障恢复若只重启一段,跨stage的微批和版本可能失配,产生难察觉的错误更新。
2025年的验收应按序列长度分桶测stage P50/P99,比较GPipe、1F1B、interleaved和零气泡调度;报告质量、内存、通信与恢复。随机杀死中间stage后,系统必须证明丢弃或重放的microbatch集合一致。自动分区器要保存剖面输入,硬件或模型变更即重新求解。对PipeDream:流水线并行把层、微批与版本调度绑在一起PipeDream: Pipeline Parallelism Couples Layers, Microbatches and Versions而言,真正需要登记的不是又一个平均分,而是由“决定模型流水线能否获得高利用率的只有分段是否平衡且微批调度保持可接受权重版本语义”推出的每一步中介、责任人和可撤回条件;〔异常运行〕缺少任何一环,都不能把相关性写成机制。
它与第351号第四条“任务图运行时:并行次序应由依赖关系生成”共享依赖调度,本条的边是激活与梯度;与第360号第五条“专用化碎片:单任务加速可能降低集群效率”相接时,SOSP固定stage会造成资源碎片。约5.3倍是特定配置,不是任何模型切层后的保证。
七、Kubernetes、Kubeflow与KServe:模型服务进入声明式控制面Kubernetes, Kubeflow and KServe: Model Serving Gets a Declarative Control Plane
早期模型服务常是团队自建Web进程,扩容、健康检查、灰度和回滚各写一套脚本。Kubeflow从2017年把训练工作流带进Kubernetes,KFServing/KServe又以InferenceService资源描述predictor、transformer、explainer、canary和autoscaling。部署对象由命令序列变成可版本化的期望状态。
〔人工接管〕本条的单因命题是,决定模型服务能否在多集群一致运维的只有期望状态是否由控制器持续协调并保留版本化声明。CRD记录模型URI、runtime、资源与流量,controller创建pod、网络和伸缩器;健康失败会重建副本。2019年的接口让模型工程继承云原生调度、隔离与声明式回滚。把Kubernetes、Kubeflow与KServe:模型服务进入声明式控制面Kubernetes, Kubeflow and KServe: Model Serving Gets a Declarative Control Plane与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“满足输出质量与P99 SLO的成功请求数/全部请求、冷启动秒与GPU小时”在这些类别上都可回查,跨研究比较才有意义。
KServe项目在2021年成为独立品牌,支持TensorFlow、PyTorch、XGBoost等多种runtime,并以Knative实现按请求伸缩到零;生产读数通常包括冷启动、P95/P99、并发与GPU利用。核验须固定模型大小、镜像层、缓存和流量曲线,报告从0到首个成功响应的秒数及回滚后错误窗口。
控制器层多不等于可靠:CRD、service mesh、serverless和GPU插件任一版本不兼容都会阻塞;伸缩到零节省空闲成本,却让大模型冷启动达到分钟。声明越简洁,镜像、模型仓库与权限的隐含依赖反而越多。重建pod也无法撤销已经发出的错误预测。〔人工接管〕本条的边界案例应从“镜像供应链、模型digest、控制器升级、邻居干扰、语义回滚与已发错误输出”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当模型大且流量突发时,缩容越彻底,恢复容量前的超时请求反而越多”究竟是偶发噪声,还是足以改变结论方向的系统反例。
2025年的验收应模拟镜像拉取失败、模型仓库超时、GPU不足、流量突发和控制器升级,报告可用请求goodput与恢复P99;manifest绑定模型digest、镜像SBOM和数据签名。Canary必须按输出质量与错误率自动停止,不只按HTTP 200。多模型服务还需验证显存隔离和邻居干扰。
它与第251号第六条“轻量虚拟化”共享容器边界,本条把模型版本和流量变成声明资源;与第360号第十条“无服务器冷启动:零运维抽象仍有状态恢复代价”直接对撞KServe按需服务。声明式控制面减少手工步骤,不消除冷启动、供应链和语义回滚。机构采用Kubernetes、Kubeflow与KServe:模型服务进入声明式控制面Kubernetes, Kubeflow and KServe: Model Serving Gets a Declarative Control Plane之前还应公布否决门槛:一旦“当模型大且流量突发时,缩容越彻底,恢复容量前的超时请求反而越多”出现,就暂停扩张并回到“模型、预处理、解释器和流量策略被声明为资源,由控制器持续把实际状态拉回期望状态”的原始记录复核;该门槛必须早于部署决定写入方案。
八、vLLM与PagedAttention:KV缓存获得虚拟内存式分页vLLM and PagedAttention: KV Caches Get Virtual-Memory-Style Paging
自回归LLM每生成一个token都要保留此前注意力的key/value状态,序列长度不一使连续显存预留产生内部与外部碎片。Kwon等在2023年借操作系统分页思想提出PagedAttention,把每个请求的KV cache切成固定块,经block table映射到非连续显存;vLLM据此动态拼批而不必预留最大长度。〔撤回门槛〕面向下一轮材料,AI系统与基础设施应优先补齐“跨租户残留、adapter版本、block清零、前缀命中偏差、长请求饥饿与调度公平”的原始记录,并把“当长请求占满continuous batch时,批中请求越多,短请求P99反而越高”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
〔撤回门槛〕本条主张,决定LLM服务能否提高显存goodput的只有KV状态是否按实际增长分配并可跨请求安全复用。逻辑block与物理block解耦,使新token只申请所需容量,copy-on-write支持并行采样和共享prompt。2023年的接口把显存管理从模型kernel内部提升为服务运行时的一级对象。
SOSP 2023论文报告PagedAttention把KV浪费降到接近最后一个block以内,vLLM在多种模型和负载上相对FasterTransformer、Orca等基线获得约2–4倍吞吐,同时保持相近延迟。复算应绑定模型、上下文、输出长度、block大小与SLO,报告goodput而非无限放宽延迟后的raw tokens/s。〔撤回门槛〕在AI系统与基础设施的这一对象上,复核应把“同时满足TTFT与TBT SLO的输出token数/GPU秒与KV物理block秒”拆成同一分母下的主结果与失败谱,“跨租户残留、adapter版本、block清零、前缀命中偏差、长请求饥饿与调度公平”要单列编码,不能在汇总时并入其他项。
continuous batching会让短请求与长生成共享迭代,调度不当仍有head-of-line阻塞;block太小增加元数据与寻址,太大重现浪费。缓存复用越积极,跨租户数据隔离和淘汰抖动反而越难。KV不是永久记忆,模型或LoRA版本变化后复用旧状态会产生语义错误。
2025年的验收应在真实长度分布、突发到达和多租户前缀下测TTFT、TBT、P99与SLO goodput,随机制造显存压力和版本切换;block table须检查所有权与引用计数。缓存键包含模型、tokenizer、adapter和prompt版本,安全删除后验证物理块清零,不能只测吞吐。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定LLM服务能否提高显存goodput的只有KV状态是否按实际增长分配并可跨请求安全复用”的操作定义,仍能复算“同时满足TTFT与TBT SLO的输出token数/GPU秒与KV物理block秒”,否则所谓转向可能只是数据管线或命名变化。〔撤回门槛〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当长请求占满continuous batch时,批中请求越多,短请求P99反而越高”做至少两轮外部复算,若方向翻转,vLLM与PagedAttention:KV缓存获得虚拟内存式分页vLLM and PagedAttention: KV Caches Get Virtual-Memory-Style Paging的结论必须随之收窄。
它与第251号第九条“存储栈的重写”共享逻辑—物理映射,本条把对象换成KV cache;与第251号第十三条“为推理而生的系统层”是直接细化。约2–4倍来自2023年选定负载,长输出、公平调度与严格SLO会改变可用增益。
九、DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools
LLM推理包含一次处理整段prompt的prefill和随后逐token的decode;前者适合大矩阵乘,后者反复读取权重与KV。共置批处理会让长prompt堵住正在生成的请求,并把两阶段资源比例锁死。DistServe在2024年把它们分到独立GPU组,完成prefill后传递KV状态,再由decode池继续。
〔跨域外推〕本条的单因命题是,决定双SLO推理能否提高goodput的只有计算形态不同的prefill与decode是否独立配置资源和并行策略。Prefill可用tensor parallel追求首token,decode用另一批次和parallelism维持每token延迟;离线placement按工作负载选择GPU数。2024年的解耦把请求内部阶段变成集群调度单元。〔跨域外推〕证据链还要把Zhong等,2024年OSDI论文《DistServe: Disaggregating Pre的起点材料与更新文献放在同一比较表里,并逐项报告“计算密集的prefill与带宽受限的decode独立并行和扩缩,以TTFT、TPOT双SLO优化goodput”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
OSDI 2024论文以多种LLM与生产式负载比较共置服务,报告在同时满足time-to-first-token与time-per-output-token约束时,DistServe可显著提高per-GPU goodput,部分设置达到数倍。复算必须给出prompt/output分布、KV传输字节、网络拓扑和两个SLO达标率,不能只报平均吞吐。
KV从prefill池跨网传到decode池会占互连,短prompt或低并发时搬运成本可能超过隔离收益;资源比例估错会让一侧排队、另一侧空闲。2024年拆分越彻底,故障恢复和请求所有权反而越复杂。若一个阶段采用不同模型版本,KV形状相同也可能语义不兼容。对DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools而言,真正需要登记的不是又一个平均分,而是由“决定双SLO推理能否提高goodput的只有计算形态不同的prefill与decode是否独立配置资源和并行策略”推出的每一步中介、责任人和可撤回条件;〔跨域外推〕缺少任何一环,都不能把相关性写成机制。
2025年的验收应按prompt与输出长度二维分桶,比较共置、静态分离和动态分离,报告TTFT、TPOT、KV网络P99与GPU空闲;注入decode池故障,确认KV只被重放一次。容量规划器每次模型或流量变化应重新估计,并在版本不一致时拒绝接力。
它与第251号第十七条“可组合的基础设施”共享计算资源解耦,本条解耦一次推理内部两阶段;与第360号第一条“微服务关键路径:服务延迟是调用图分布的组合”相接时,新增KV边成为关键路径。2024年的goodput增益依赖网络与长度分布,不是分离本身的恒定收益。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当KV传输接近互连上限时,阶段分得越开,端到端goodput反而越低”做至少两轮外部复算,若方向翻转,DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools的结论必须随之收窄。〔跨域外推〕落到复现实务,可为DistServe:预填充与解码被拆到不同GPU池DistServe: Prefill and Decode Move to Different GPU Pools建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“同时满足TTFT与TPOT的完成请求数/GPU秒、KV网络字节与重放请求数”统一结算,避免换口径后仍宣称性能提高。
十、Parrot:LLM应用图开始跨请求共享语义与中间状态Parrot: LLM Application Graphs Share Semantics and Intermediate State
聊天、代理和多阶段推理通常由多个相关LLM调用组成:同一上下文被重复编码,后一步等待前一步,应用开发者却只能向黑箱服务逐条发送请求。Parrot在2024年引入semantic variable和应用图,让系统看见调用间的数据依赖、前缀相同与可并行分支,从跨请求层面调度模型和缓存。〔盲法复核〕落到复现实务,可为Parrot:LLM应用图开始跨请求共享语义与中间状态Parrot: LLM Application Graphs Share Semantics and Intermediate State建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“满足隔离与完整性检查的应用完成数/GPU秒、重复token与关键路径秒数”统一结算,避免换口径后仍宣称性能提高。
〔盲法复核〕本条主张,决定复合AI应用能否跨调用优化的只有服务层是否获得足够的依赖语义而不必猜测程序关系。Semantic variable把prompt片段、输出和消费者显式连接,调度器可合并共享前缀、批处理兼容调用并提前安排后续。2024年的变化是把优化单元从一次请求扩成应用DAG。
OSDI 2024论文在多种LLM应用与集群设置中比较普通服务后端,报告Parrot通过prefix sharing与全局调度降低延迟并提高吞吐;关键读数应是完整应用完成时间、共享token命中、关键路径和SLO goodput。逐调用tokens/s提高而最终代理任务变慢,不能算基础设施进步。〔盲法复核〕本条的边界案例应从“跨租户缓存、错误依赖、安全检查顺序、敏感图结构、随机分支与调度饥饿”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当全局调度偏爱高共享分支时,缓存命中越高,关键短任务P99反而越差”究竟是偶发噪声,还是足以改变结论方向的系统反例。
向服务暴露semantic variable会泄露应用结构和可能含敏感信息的共享关系;错误声明依赖可让缓存串租户或把本应顺序的安全检查并行。2024年图越大,全局调度越复杂,局部高命中反而可能让关键短任务排队。模型随机输出还会使静态依赖不能保证程序语义。
2025年的验收应在多租户compound workload上测端到端P99、共享正确率、隔离失败与调度开销,加入错误依赖和权限边界;缓存只能在模型、租户、策略与数据版本都匹配时复用。trace需返回每个输出的调用图和前缀来源,使一次节省可与隐私、安全检查完整性同时审计。机构采用Parrot:LLM应用图开始跨请求共享语义与中间状态Parrot: LLM Application Graphs Share Semantics and Intermediate State之前还应公布否决门槛:一旦“当全局调度偏爱高共享分支时,缓存命中越高,关键短任务P99反而越差”出现,就暂停扩张并回到“系统不再把每次LLM调用视为孤立请求,而以semantic variable表达依赖、共享前缀和并行机会”的原始记录复核;该门槛必须早于部署决定写入方案。
它与第532号第十三条“ReAct:推理与行动改成观察驱动的交替循环”共享复合调用轨迹,本条优化轨迹的执行与缓存;与第351号第二十条“工作流级复现:一次作业成功不等于科学过程可重放”相接时,semantic variable也是重放血缘。应用语义提高机会,也扩大服务层责任。
十一、BlitzScale:大模型自动伸缩必须移动活模型而非等待冷启动BlitzScale: LLM Autoscaling Moves Live Models Instead of Waiting for Cold Starts
传统微服务扩容只需拉取小镜像并启动进程,大模型权重却有数十到数百GB,从对象存储加载会造成分钟级冷启动。BlitzScale在2025年把自动伸缩焦点放到模型状态传输,利用O(1)主机缓存避免为每个模型保留完整副本,并让运行中的实例向新GPU并行迁移权重。
〔结果分母〕本条主张,决定LLM服务能否追上突发流量的只有新副本是否在不停止旧副本时获得一致模型状态。Live scaling把传输、加载、注册和流量切换重叠,源实例继续服务;host cache减少远端读。2025年的系统把autoscaling从pod数量控制改成数百GB状态的在线复制协议。把BlitzScale:大模型自动伸缩必须移动活模型而非等待冷启动BlitzScale: LLM Autoscaling Moves Live Models Instead of Waiting for Cold Starts与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类;只有“触发后在SLO内完成的正确请求数/扩容秒、复制字节与源实例延迟损失”在这些类别上都可回查,跨研究比较才有意义。
OSDI 2025论文在多种模型、集群与突发trace上比较对象存储冷启动和既有伸缩器,报告更短scale-out时间与更少SLO违约,并强调主机缓存空间随模型数保持O(1)。复算应列权重GB、源/目标链路、在途请求、P99和额外网络字节;副本ready不等于已通过首个正确推理。
从活实例复制会抢占其服务带宽,扩容越激进,旧副本延迟反而越高;源实例若已损坏,会把错误状态快速传播。2025年O(1)缓存把容量压力转成置换和网络,多个模型同时突发会争同一链路。权重到位后还需kernel编译、KV热身与adapter装载,ready信号可能过早。〔结果分母〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定LLM服务能否追上突发流量的只有新副本是否在不停止旧副本时获得一致模型状态”的操作定义,仍能复算“触发后在SLO内完成的正确请求数/扩容秒、复制字节与源实例延迟损失”,否则所谓转向可能只是数据管线或命名变化。
2026年的验收应制造单模型、十模型和跨机架同步突发,测触发到首个SLO合格请求的时间,并报告源实例性能损失;权重块用hash验证,流量切换前做语义canary。缓存置换、编译与adapter必须进入状态机,扩容失败要回滚容量计划,防止控制环振荡;连续5次突发也必须稳定且每次均无超时。
它与第360号第十一条“自动伸缩振荡:延迟反馈会让正确控制规则失稳”共享控制回路,本条补上大模型状态移动;与第251号第九条“存储栈的重写”相接时,OSDI权重分发决定冷启动。O(1)主机缓存减少容量增长,不表示网络、编译和热身也变成常数。〔结果分母〕面向下一轮材料,AI系统与基础设施应优先补齐“源状态损坏、adapter装载、kernel编译、缓存置换、控制振荡与ready误报”的原始记录,并把“当多个模型同时从活实例复制时,扩容并发越高,源服务P99反而越差”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
十二、SYMPHONY:会话KV从GPU计算中解耦为独立记忆层SYMPHONY: Conversational KV State Becomes a Disaggregated Memory Layer
多轮对话的KV cache会随历史增长,若状态固定留在生成它的GPU,请求被粘到单机,冷热会话造成负载不均;若每次重算或临时offload,又增加延迟。SYMPHONY在2026年把KV存储从计算实例解耦,引入独立记忆层,并依据用户交互或应用结构发出的advisory request提前预取。〔未覆盖项〕证据链还要把Agarwal、Hu、Mao、Akella与Venkataraman,2026年NSDI论文《S的起点材料与更新文献放在同一比较表里,并逐项报告“计算实例不再永久绑定长会话KV,advisory request提前预取,调度器可按请求迁移”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
〔未覆盖项〕本条的单因命题是,决定有状态LLM请求能否细粒度负载均衡的只有KV是否可在计算与记忆层间按优先级移动并在需要前到达。系统用神经网络层结构和请求优先级管理缓存,GPU与远端协作决定保留、迁出和预取;预测错时仍需有退化路径。2026年的分离把会话状态变成可调度资产。
NSDI 2026论文页码2027–2041,在LLaMA模型、ShareGPT与BurstGPT负载上比较vLLM等基线;结果报告端到端延迟降低约2.4倍,并可在延迟仅小幅增加时服务约4倍请求。复算需固定会话长度、重返时间、网络与存储层,报告预取precision、KV字节和SLO goodput。〔未覆盖项〕在AI系统与基础设施的这一对象上,复核应把“满足SLO且KV版本正确的恢复会话数/预取字节、重算token与远程内存秒数”拆成同一分母下的主结果与失败谱,“KV删除证明、跨区复制、租户隔离、预取公平、记忆节点灾难恢复与模型切换”要单列编码,不能在汇总时并入其他项。
advisory signal并不可靠:用户可能不回来、突然切模型或在另一地区继续,会使预取浪费带宽;2026年远程层故障会同时丢失许多会话状态。解耦越广,KV中敏感对话的复制与保留位置反而越难解释。优先级若偏爱活跃付费会话,长尾用户重算成本会被平均值掩盖。
2026年的验收应把正确、过早、过晚和错误预取分开,模拟记忆节点故障、区域迁移和删除请求;KV必须加密、绑定租户与模型版本,并有可证明清除。报告每类用户的重算、迁移和SLO,比较本地、主机offload与远程解耦。若隐私删除不能跨副本完成,性能增益不应通过。〔未覆盖项〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当advisory request误报增多时,预取越积极,有效请求可用带宽反而越少”做至少两轮外部复算,若方向翻转,SYMPHONY:会话KV从GPU计算中解耦为独立记忆层SYMPHONY: Conversational KV State Becomes a Disaggregated Memory Layer的结论必须随之收窄。
它与第251号第十七条“可组合的基础设施”共享内存解耦,本条对象是含会话语义的KV;与第532号第十五条“记忆与反思:上下文窗口不再假装是一生”相比,NSDI本条只解决状态放置,不解决记忆内容正确。2.4倍与4倍来自指定负载,预取错误和隐私成本必须另列。
◎ 二十年连起来看
2004–2017年的抽象上移路线是记录→工作集→参数→数据流图→生产流水线;2018–2026年则是任务/actor→设备mesh→训练状态→应用图→会话KV。每一轮都把程序员不再愿意手管的细节交给运行时,同时暴露新的可变状态。真正的学科主线不是框架更替,而是“哪个状态由谁拥有、何时复制、失败后怎样证明一致”。MapReduce重算输入,ZeRO重组checkpoint,SYMPHONY清除远程KV,三者隔着二十年共享同一责任问题。
◎ 三个常见误解
质量时间要求训练以time-to-quality而非steps/s结案;有效吞吐只计算同时满足TTFT、TBT或任务SLO的goodput;恢复语义要求故障后模型、优化器、微批和外部副作用回到可证明状态;版本血缘把数据、代码、编译器、权重、adapter、prompt和缓存连接。2026年的AI系统若只报峰值token/s,等于把失败重跑、质量下降、缓存错配和人工处置全部排出分母。
◎ 与相邻领域的接口
误解一:加速器越多训练必然越快。通信、陈旧梯度与统计batch会让time-to-quality反号。误解二:模型能部署就已生产就绪。KServe的HTTP健康不验证输出语义,28项测试也不能覆盖未知风险。误解三:缓存命中一定省资源。错误前缀、跨版本KV和无效预取会消耗带宽并扩大隐私面。基础设施的成功读数必须包含有效结果、资源和恢复,不可把“能跑”与“值得持续运行”混为一谈。
◎ 争议现场
它与高性能计算共享通信、Roofline和任务图,但负责模型状态与质量语义;与操作系统共享虚拟内存、调度和资源解耦,但需处理梯度、checkpoint和KV;与数据工程共享血缘与schema,却把模型晋级和训练—服务一致纳入事务;与软件工程共享测试和技术债,却面对随机、数据依赖与漂移。相邻面板若用峰值FLOPS、PUE或HTTP可用率,本块必须补上time-to-quality、SLO goodput和artifact版本,才可形成同分母碰撞。
◎ 往下五年看什么
TensorFlow和Ray追求统一接口,Horovod、ZeRO、vLLM与DistServe则因明确瓶颈获得巨大增益。通用平台降低团队切换成本,却可能遮住硬件和模型形状;特化系统压榨效率,却造成碎片与人才锁定。判断不应靠流行度,而要量出迁移后的性能保留、运维人数、故障域和弃用成本。2026年的合理架构往往是稳定控制面加可替换数据面:版本、权限、观测统一,kernel、并行策略和缓存按负载演化。
◎ 可与哪些领域对撞
AI系统评测应至少包含固定模型的单组件微基准、完整训练或服务闭环、真实长度与到达trace、以及故障注入4层。训练画loss对墙钟、GPU小时与焦耳;推理同时画TTFT、TBT、P99和goodput;恢复随机杀worker、server、stage、控制器与远程记忆层。每项结果至少重跑5次,公布失败提交和置信区间。没有真实trace时,必须说明合成分布及其漏掉的相关性、突发和多租户干扰。
◎ 十条可做的研究命题
2026–2031年的基础设施会围绕三种解耦竞争:计算与高带宽记忆、训练与推理、单模型与复合应用。RL后训练需要生成、奖励和更新不同资源池;多模态与智能体让状态跨媒体、工具和权限流动;异构GPU与专用芯片要求自动并行真正考虑价格和能源。最重要的突破不是再多一层调度器,而是让系统能为一次答案给出可核算账单:用了哪些数据、状态、设备和外部服务,失败如何恢复,删除怎样跨副本完成。
◎ 资料核验
审计清单:① 训练报告time-to-quality;② 推理报告双SLO goodput;③ 记录数据、代码、编译、权重与缓存版本;④ 注入节点、网络与控制面故障;⑤ 报告P99和最坏分片;⑥ 把失败重跑、空闲和人工纳入成本;⑦ 验证checkpoint与KV删除;⑧ 让扩缩、灰度和回滚以语义质量而非HTTP健康收口。
- Dean, J.; Ghemawat, S. “MapReduce: Simplified Data Processing on Large Clusters.” OSDI, 2004.
- Dean, J.; Ghemawat, S. “MapReduce: Simplified Data Processing on Large Clusters.” CACM, 2008.
- Nickolls, J. et al. “Scalable Parallel Programming with CUDA.” ACM Queue, 2008.
- LeCun, Y. et al. “Efficient BackProp.” Neural Networks, 1998.
- Zaharia, M. et al. “Spark: Cluster Computing with Working Sets.” HotCloud, 2010.
- Zaharia, M. et al. “Resilient Distributed Datasets.” NSDI, 2012.
- Dean, J. et al. “Large Scale Distributed Deep Networks.” NeurIPS, 2012.
- Li, M. et al. “Scaling Distributed Machine Learning with the Parameter Server.” OSDI, 2014.
- Abadi, M. et al. “TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems.” 2015.
- Abadi, M. et al. “TensorFlow: A System for Large-Scale Machine Learning.” OSDI, 2016.
- Sculley, D. et al. “Hidden Technical Debt in Machine Learning Systems.” NeurIPS, 2015.
- Breck, E. et al. “The ML Test Score.” IEEE Big Data, 2017.
- Baylor, D. et al. “TFX: A TensorFlow-Based Production-Scale Machine Learning Platform.” KDD, 2017.
- Polyzotis, N. et al. “Data Management Challenges in Production Machine Learning.” SIGMOD, 2017.
- Moritz, P. et al. “Ray: A Distributed Framework for Emerging AI Applications.” OSDI, 2018.
- Mattson, P. et al. “MLPerf: An Industry Standard Benchmark Suite for Machine Learning Performance.” MLSys, 2020.
- Sergeev, A.; Del Balso, M. “Horovod: Fast and Easy Distributed Deep Learning in TensorFlow.” 2018.
- Patrascu, A.; Thorpe, M. “Horovod: Fast and Easy Distributed Deep Learning.” Journal of Open Source Software, 2018.
- Shazeer, N. et al. “Mesh-TensorFlow: Deep Learning for Supercomputers.” NeurIPS, 2018.
- Shoeybi, M. et al. “Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.” 2019.
- Rajbhandari, S. et al. “ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.” SC, 2020.
- Ren, J. et al. “ZeRO-Offload: Democratizing Billion-Scale Model Training.” USENIX ATC, 2021.
- Rajbhandari, S. et al. “ZeRO-Infinity.” SC, 2021.
- Narayanan, D. et al. “PipeDream: Generalized Pipeline Parallelism for DNN Training.” SOSP, 2019.
- Huang, Y. et al. “GPipe: Efficient Training of Giant Neural Networks Using Pipeline Parallelism.” NeurIPS, 2019.
- Narayanan, D. et al. “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.” SC, 2021.
- Burns, B. et al. “Borg, Omega, and Kubernetes.” CACM, 2016.
- Verma, A. et al. “Large-Scale Cluster Management at Google with Borg.” EuroSys, 2015.
- Kubeflow Community. “Kubeflow: The Machine Learning Toolkit for Kubernetes.” 2017–2025.
- KServe Community. “KServe Model Inference Platform.” 2019–2025.
- Crankshaw, D. et al. “Clipper: A Low-Latency Online Prediction Serving System.” NSDI, 2017.
- Olston, C. et al. “TensorFlow-Serving: Flexible, High-Performance ML Serving.” 2017.
- Kwon, W. et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention.” SOSP, 2023.
- Yu, G.-I. et al. “Orca: A Distributed Serving System for Transformer-Based Generative Models.” OSDI, 2022.
- Agrawal, A. et al. “Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve.” OSDI, 2024.
- Zhong, Y. et al. “DistServe: Disaggregating Prefill and Decoding for Goodput-Optimized LLM Serving.” OSDI, 2024.
- Lin, C. et al. “Parrot: Efficient Serving of LLM-Based Applications with Semantic Variable.” OSDI, 2024.
- Sheng, Y. et al. “FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.” ICML, 2023.
- Sheng, Y. et al. “High-Throughput Generative Inference of Large Language Models with a Single GPU.” 2023.
- Zheng, L. et al. “SGLang: Efficient Execution of Structured Language Model Programs.” NeurIPS, 2024.
- Zhang, D. et al. “BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching.” OSDI, 2025.
- Jin, C. et al. “HydraServe: Minimizing Cold Start Latency for Serverless LLM Serving.” NSDI, 2026.
- Agarwal, S. et al. “SYMPHONY: Enabling Compute-Memory Disaggregation in LLM Serving Systems.” NSDI, 2026.
- Qin, R. et al. “Mooncake: A KVCache-Centric Disaggregated Architecture for LLM Serving.” FAST, 2025.
- Jiang, Y. et al. “MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs.” NSDI, 2024.
- Weng, Q. et al. “Beware of Fragmentation: Scheduling GPU-Sharing Workloads with Fragmentation Gradient Descent.” USENIX ATC, 2023.
- Gu, J. et al. “Tiresias: A GPU Cluster Manager for Distributed Deep Learning.” NSDI, 2019.
- Pollux Authors. “Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning.” OSDI, 2021.
- Jeon, M. et al. “Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads.” USENIX ATC, 2019.
- Rasley, J. et al. “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters.” KDD, 2020.
- Barroso, L.; Hölzle, U.; Ranganathan, P. The Datacenter as a Computer. Morgan & Claypool, 2018.
- Dean, J.; Barroso, L. “The Tail at Scale.” CACM, 2013.