可持续AI与绿色计算
可持续AI不是给模型贴上“低碳”标签,而是重新规定计算系统的完整分母:空闲服务器是否仍耗掉峰值功率,训练与推理怎样分账,同一焦耳在不同电网时段产生多少排放,芯片制造、水耗、设备提前报废和效率反弹是否被排除在外。二十条转向把绿色计算从机房节能推进到算法—硬件—电网—供应链的共同结算。
第一幕首先拆掉“性能提高自然带来节能”的默认。数据中心被当作一台仓库级计算机,空闲功耗、功率封顶、暗硅、近似计算与间歇供能相继进入设计;到2016年,压缩神经网络又证明模型精度并非只能靠更多乘加维持。
甲、能量比例计算:空闲机器不应维持峰值功耗Energy-Proportional Computing
2007年前的服务器采购以峰值吞吐和每瓦性能为主,机房却长期运行在低利用率;许多设备空闲时仍消耗峰值功率的一半以上,闲置容量因此成为看不见的基荷。〔对象清单〕要确认“能量比例计算:空闲机器不应维持峰值功耗”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。用2026年生产负载作基线时,应把0%、10%、25%、50%与100%利用率的整机瓦数放在同一条power curve,不能只保留峰值点。2026年能量比例计算仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定系统节能能力的只有功耗曲线能否跟随有用工作量下降,而不是满载时每瓦跑分有多漂亮。这个判据把idle draw当成可治理存量;若CPU降频而DRAM、风扇与NIC维持常开,energy proportionality仍未成立。能量比例计算的2026年判据必须允许同预算、同对象的反例直接推翻。〔〔〔对象清单〕对象清单〕对象清单〕对能量比例计算:空闲机器不应维持峰值功耗Energy-Proportional Computing而言,真正需要登记的不是又一个平均分,而是由“决定低负载能效的只有空闲功耗能否随有用工作下降”推出的每一步中介、责任人和可撤回条件,〔对象清单〕缺少任何一环,都不能把相关性写成机制。
Barroso与Hölzle汇总当时服务器曲线,指出10%至50%利用率是常见区间,而低负载能效明显恶化;Fan等以数千台Google服务器轨迹量化了功率与利用率的非线性。复现实验至少覆盖3代服务器、7天请求轨迹与p99 latency,分别报告每请求焦耳和空闲基荷占比。到2026年,能量比例计算读数还要随设备版本、周期与95%置信区间发布。
DVFS只能压低部分动态功耗,内存、风扇、网络和电源损耗仍形成固定底座;若为追求低延迟而保持大量热备,机器越多,单位请求的空闲能耗反而越高。反向情形出现在低延迟服务:为满足20毫秒SLO而频繁休眠,唤醒抖动可能制造更多副本和重试。能量比例计算在2026年的失效监控把最坏切片与反向结果独立列账。
工程上应按负载分箱公布整机功耗,并把休眠唤醒延迟、尾延迟和容量冗余一起核算;只给峰值SPECpower不能代表在线服务。采购门槛可设为10%负载功耗不超过峰值的35%,同时冻结尾延迟、可用性和故障转移预算。2026年能量比例计算上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第360号第一条同题,但本块把能量比例继续接到训练集群、推理弹性和碳强度,要求系统性能与环境成本同一时间窗结算。它把2007年的硬件曲线接到2026年的AI推理弹性;模型路由若不释放机器,算法轻量化仍无法消除机房基荷。能量比例计算接口到2026年只传递同对象、同量纲且可回放的证据。
乙、仓库级计算机:数据中心而非单机成为优化单元Warehouse-Scale Computing
传统体系结构把服务器视作完整计算机,网络与冷却属于设施背景;互联网服务的请求却跨越数百台机器,单机跑分无法解释扇出、复制和调度造成的能耗。〔事件时间轴〕要确认“仓库级计算机:数据中心而非单机成为优化单元”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。到2026年,一次AI请求会穿过负载均衡、加速器、缓存、对象存储与冷却链,单机SPEC无法代表这条服务路径。2026年仓库级计算机仍须用原始样本校准历史断点并记录删失值。
〔事件时间轴〕本条主张,决定大型在线服务效率的只有仓库级资源能否作为一个共同系统被测量和调度,不能把每台服务器的局部最优直接相加。仓库级边界要求调度器看到fan-out、replica与network retry,否则局部每瓦最优会把代价推给别的机架。仓库级计算机的2026年判据必须允许同预算、同对象的反例直接推翻。
Google的仓库级计算机方法把数万台服务器、网络层次与电力基础设施置于同一设计边界;Kanev等后来用生产轨迹说明数据中心应用与传统SPEC CPU基准在指令和存储行为上显著不同。核验可抽取1,000万条trace,按请求汇总CPU、GPU、交换机和制冷电量,并给出95%区间。到2026年,仓库级计算机读数还要随设备版本、周期与95%置信区间发布。〔事件时间轴〕机构采用仓库级计算机:数据中心而非单机成为优化单元Warehouse-Scale Computing之前还应公布否决门槛:一旦“当局部省电引发更多跨机重试时,单机效率越高,仓库总能耗反而可能上升”出现,就暂停扩张并回到“服务能效由计算、网络、存储、冷却和故障域共同决定,单机最优可能制造集群低效”的原始记录复核,该门槛必须早于部署决定写入方案。
整体优化会带来集中风险:降低副本和备用容量可省电,却可能放大故障;网络过度订阅在平均负载下高效,在热点时又让尾延迟和重试能耗同时上升。若缩减副本使故障恢复从2秒升到40秒,节省的待机电可能被重算、缓存失效和SLA违约吞掉。仓库级计算机在2026年的失效监控把最坏切片与反向结果独立列账。
验收应以一项用户请求穿过的全部设备为核算链,报告计算、传输、缓存、重试和冷却电力;采购环节也要比较集群吞吐而非服务器清单。工程台账应让同一个request ID贯穿计算与设施电表,缺失链路必须计入unknown energy而非自动归零。2026年仓库级计算机上线记录须绑定责任人、SLO、到期日与撤回阈值。
它连接第251号体系结构与第252号计算机网络:两边若都只优化自己的每瓦性能,跨层重试与数据搬运就会成为无人负责的第三项。这一尺度与2009年的warehouse-scale computer一致,也提醒AI平台:服务质量、故障域和能耗必须在同一控制面结算。仓库级计算机接口到2026年只传递同对象、同量纲且可回放的证据。
丙、PUE清算:设施效率不等于计算有用性The PUE Reckoning
PUE把数据中心总电力除以IT设备电力,首次让制冷、配电和照明损耗有了公共尺度;但分母里的IT电力无论用于有效请求、空闲等待还是失败训练,都被同样视为产出。〔装置边界〕要确认“PUE清算:设施效率不等于计算有用性”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。ISO/IEC 30134-2把PUE固定为总设施能耗除以IT能耗,但2026年的绿色声明还必须追问IT究竟产出多少有效结果。2026年PUE清算仍须用原始样本校准历史断点并记录删失值。
本条锁定一个否定命题:决定绿色计算质量的不能只有PUE,只有把IT耗电再除以有用工作,设施效率才会转成服务效率。PUE从1.4降到1.1只说明附加损耗变小;若失败训练翻倍,用户得到的每项工作碳强度仍会恶化。PUE清算的2026年判据必须允许同预算、同对象的反例直接推翻。
早期机房PUE常高于2,先进设施逐步接近1.1;这个巨大改善真实存在,却不表示同一任务耗能同步下降,因为服务器利用率、模型规模和重跑次数可能同时增长。复核应同时公布月度PUE、IT utilization、有效任务数与总千瓦时,至少跨越夏季和冬季两个90日窗口。到2026年,PUE清算读数还要随设备版本、周期与95%置信区间发布。
PUE还受气候、边界和计量点影响,年度平均会遮住高温时段;若企业把接近1作为唯一目标,增加IT负载会机械地改善比值,能耗越高,PUE反而可能越好看。当把PUE设成奖金指标时,增加服务器负载会机械改善比值,Green Grid指标因Goodhart效应出现反号。PUE清算在2026年的失效监控把最坏切片与反向结果独立列账。〔装置边界〕面向下一轮材料,可持续AI与绿色计算应优先补齐“失败训练、空闲等待和无用户价值的推理没有从IT电力分母中剔除”的原始记录,并把“当增加IT负载能改善PUE时,总耗电越高,设施指标反而越漂亮”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
成熟披露应同时给PUE、IT设备利用率、每项有用工作能耗、碳强度和水耗,并说明自建机房与云服务的边界是否一致。数据中心验收应以job、token或实验结果为第二分母,并把中止、空转与重试列作非有效IT电力。2026年PUE清算上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第360号第三条共享PUE盲点,又与第218号计量学相撞:指标一旦成为考核对象,测量定义本身就会改变被优化的系统。这项清算连接第218号计量学:2007年指标解决设施损耗可见性,却不能替2026年的计算价值和碳来源作证。PUE清算接口到2026年只传递同对象、同量纲且可回放的证据。〔装置边界〕在可持续AI与绿色计算的这一对象上,复核应把“完成并被采用的计算任务数/数据中心总耗电千瓦时”拆成同一分母下的主结果与失败谱,“失败训练、空闲等待和无用户价值的推理没有从IT电力分母中剔除”要单列编码,不能在汇总时并入其他项。
丁、功率封顶:峰值电力成为可调度资源Power Capping as a Schedulable Resource
机房通常按所有服务器同时达到峰值来配置供电,真实负载却很少同步峰值;静态预留使昂贵电力容量长期闲置,也限制同一设施可安装的计算量。〔样本分层〕要确认“功率封顶:峰值电力成为可调度资源”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。2026年的GPU集群常受变电容量而非机柜数量约束,动态power cap可把闲置千瓦转给临时高价值训练。2026年功率封顶仍须用原始样本校准历史断点并记录删失值。〔样本分层〕对功率封顶:峰值电力成为可调度资源Power Capping as a Schedulable Resource而言,真正需要登记的不是又一个平均分,而是由“决定峰值容量利用率的只有功率预算能否按负载动态重分配”推出的每一步中介、责任人和可撤回条件,〔样本分层〕缺少任何一环,都不能把相关性写成机制。
〔样本分层〕本条主张,决定电力容量利用率的只有功率预算能否随工作负载和服务等级在节点间转移,而不是每台机器各守一个固定上限。控制目标必须同时包含功率、throughput与tail latency;单独压瓦数会让排队和重试成为隐藏执行路径。功率封顶的2026年判据必须允许同预算、同对象的反例直接推翻。
Raghavendra等提出跨硬件与虚拟机的协调控制,在总功率约束内分配预算;后续研究显示短暂进入低功耗状态可换取节能,但唤醒延迟会直接进入在线服务尾部。实验以相同24小时到达轨迹比较静态与动态预算,报告p50/p99、违约数、温度峰值和总kWh。到2026年,功率封顶读数还要随设备版本、周期与95%置信区间发布。
功率封顶若只看平均吞吐,会把代价推给最慢请求;若所有控制器独立响应同一过载信号,还会发生振荡,使频率、排队和功耗反复越界。多个控制器若以相同5秒窗口追逐功率上限,频率与队列会同步振荡,平均功耗下降而服务能耗上升。功率封顶在2026年的失效监控把最坏切片与反向结果独立列账。
工程实施应给出封顶前后p99延迟、违约请求、节点温度和重试次数,并用相同到达轨迹比较静态与动态预算。上线门槛应限制功率超调小于2%、p99恶化小于5%,并保留hardware emergency cap作独立后备。2026年功率封顶上线记录须绑定责任人、SLO、到期日与撤回阈值。〔样本分层〕证据链还要把Raghavendra等,2008年ASPLOS会议集48–59页,DOI 10.1145/13的起点材料与更新文献放在同一比较表里,并逐项报告“供电上限不是固定设施约束,而可在节点间动态分配并与服务等级共同控制”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
它与第060号控制与自动化的反馈稳定问题共用一套结构:电力分配器不是设施附件,而是会回写计算队列的控制器。它把2008年的协调限功推进AI scheduler;资源分配器既是节能器也是反馈控制器,稳定性不能留给设施团队。功率封顶接口到2026年只传递同对象、同量纲且可回放的证据。
戊、暗硅:晶体管增加不再等于可同时点亮Dark Silicon
工艺缩放曾让更多晶体管以相近功率同时运行;电压缩放停滞后,晶体管密度继续增加,功率密度却不允许整片逻辑同时全速点亮。〔版本登记〕要确认“暗硅:晶体管增加不再等于可同时点亮”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。后Dennard时代从2011年起迫使芯片在功率密度下选择性点亮,2026年的AI加速器仍以专用单元换取有限热预算。2026年暗硅仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定后摩尔时代可用性能的只有在功率约束下选择哪些单元点亮,晶体管总数本身不再等于计算能力。暗硅命题约束的是同时活动比例,不是晶体管总数;增加NPU模块若长期闲置,也会带来面积和制造碳。暗硅的2026年判据必须允许同预算、同对象的反例直接推翻。〔版本登记〕机构采用暗硅:晶体管增加不再等于可同时点亮Dark Silicon之前还应公布否决门槛:一旦“当专用单元利用率很低时,每瓦峰值越高,生命周期制造碳摊销反而越差”出现,就暂停扩张并回到“后Dennard时代的芯片面积不能全部同时工作,专用化与关断成为性能条件”的原始记录复核,该门槛必须早于部署决定写入方案。
Esmaeilzadeh等以多种缩放情景估计,到2024年相当比例芯片面积将因功率限制保持黑暗;Horowitz随后给出不同运算与数据搬运的能耗数量级,显示访存常比算术更贵。验证应记录5种代表kernel的active area、结温、频率和性能每瓦,并用同工艺CPU作控制组。到2026年,暗硅读数还要随设备版本、周期与95%置信区间发布。
专用加速器提高局部每瓦性能,却可能闲置于工作负载之外;若为每个模型制造专用单元,利用率越低,制造碳和面积浪费反而越大。专用化越深,未命中工作负载越要回退到通用核,名义TOPS增加而端到端能效可能反向下降。暗硅在2026年的失效监控把最坏切片与反向结果独立列账。
设计应报告加速单元的实际占空比、数据搬运能耗和整个芯片生命周期利用率,而不是只展示内核峰值TOPS/W。架构评审需给出3年workload mix和利用率敏感性,低于20%使用的单元必须解释制造与泄漏成本。2026年暗硅上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第367号芯粒和先进封装相接:暗硅促成专用化,封装又允许按需组合;两者共同把面积浪费转成接口与制造成本。这一边界把2011年的dark silicon连到AI芯片全生命周期;不能只用峰值MAC/W抵消闲置硅和短代际换机。暗硅接口到2026年只传递同对象、同量纲且可回放的证据。〔版本登记〕本条的边界案例应从“从未被目标负载调用的加速器面积及其制造代价不进运行能效”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当专用单元利用率很低时,每瓦峰值越高,生命周期制造碳摊销反而越差”究竟是偶发噪声,还是足以改变结论方向的系统反例。
己、近似计算:误差预算可以兑换能耗Approximate Computing
传统计算机把每一位结果正确视为绝对要求,但视觉、音频和学习任务的最终质量常对局部数值误差不敏感;坚持全精度会为用户看不见的差别付出能耗。〔失败谱〕要确认“近似计算:误差预算可以兑换能耗”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。近似计算允许用可控误差换能耗,但2026年的推荐、医疗和生成任务必须先定义哪一种quality可以下降。2026年近似计算仍须用原始样本校准历史断点并记录删失值。〔失败谱〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定近似是否合法的只有端到端质量约束可被检查”的操作定义,仍能复算“满足逐例质量门槛的输出数/近似执行输出总数”,否则所谓转向可能只是数据管线或命名变化。
〔失败谱〕本条主张,决定近似计算是否正当的只有应用层质量约束能否显式界定并端到端验证,不是硬件自行猜测哪些错误无害。单因不是降低bit width本身,而是误差预算能否被任务损失函数、用户容忍和安全约束共同约束。近似计算的2026年判据必须允许同预算、同对象的反例直接推翻。
Truffle和EnerJ等系统让程序员标注可近似数据与运算,研究报告在若干基准上获得明显能耗或性能收益,同时用输出质量界限约束误差传播。至少比较FP32、BF16、INT8与近似单元,在20个切片上报告焦耳、延迟、校准误差和最坏群体退化。到2026年,近似计算读数还要随设备版本、周期与95%置信区间发布。〔失败谱〕面向下一轮材料,可持续AI与绿色计算应优先补齐“被平均质量指标忽略的少数用户、边缘输入和不可逆错误没有独立栏”的原始记录,并把“当罕见输入决定安全时,平均质量越稳定,关键失败反而越容易被遮蔽”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
误差可能在罕见输入、反馈循环或安全边界累积;若平均图像质量是唯一指标,近似越激进,少数关键对象被误判的概率反而越高。若平均准确率冻结而罕见类别误差从2%升到12%,总体能耗越低,风险分配反而越不公平。近似计算在2026年的失效监控把最坏切片与反向结果独立列账。
成熟流程要公开误差注入位置、最坏输入、质量分布和回退机制;医疗、控制与密码任务不能沿用娱乐媒体的容错尺度。部署应让quality budget随用途版本化,高风险输出禁止静默降精度,监控漂移超过3%立即回退。2026年近似计算上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第049号机制可解释性相撞:两者都用平均指标压缩复杂对象,近似计算必须说明哪些差异被允许消失、由谁授权。它把2012年的disciplined approximation接到模型压缩;节省的是可被明示放弃的精度,未授权伤害不属于误差预算。近似计算接口到2026年只传递同对象、同量纲且可回放的证据。
庚、间歇计算:断电不再是异常而是执行模型Intermittent Computing
能量采集传感器依赖光、振动或射频,供电会在程序尚未完成时消失;传统嵌入式软件假设一次启动拥有持续电源,掉电后只能从头再来。〔机构接口〕要确认“间歇计算:断电不再是异常而是执行模型”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。间歇计算把供能中断当作正常状态;到2026年,微型传感器可在harvested energy下分段完成推理而无需常备电池。2026年间歇计算仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定无电池计算可靠性的只有程序是否以掉电为常态保存一致状态,增加电容或祈求稳定供能不能替代执行语义。关键资源是checkpoint必须与能源状态一致,程序恢复不能重复外部动作或跳过尚未持久化的安全检查。间歇计算的2026年判据必须允许同预算、同对象的反例直接推翻。〔机构接口〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当检查点过密时,供能波动越频繁,保存开销占比反而越高”做至少两轮外部复算,若方向翻转,间歇计算:断电不再是异常而是执行模型Intermittent Computing的结论必须随之收窄。
Mementos在电压下降前自动插入检查点,后续DINO与Chinchilla处理内存一致性和自适应检查点;实验以完成任务比例、重执行次数和检查点开销比较方案。测试用100种断电位置、3档电容和1,000次重启,统计完成率、重复写入、状态损坏与每结果毫焦。到2026年,间歇计算读数还要随设备版本、周期与95%置信区间发布。
检查点本身耗能,写得过密会让设备把采来的能量全用于保存;过稀又会重复大量工作,能量越不稳定,有效进度反而可能趋近于零。保存点越密,写入NVM的时间与能耗越高;保护进度的动作可能消耗掉本可完成当前任务的能量。间歇计算在2026年的失效监控把最坏切片与反向结果独立列账。
部署应公布能量轨迹、掉电次数、重复I/O和最终任务完成率,不能只在恒定实验电源下测一次平均功耗。工程上应区分idempotent与不可重复I/O,后者采用transaction log,并在能量低于阈值时禁止发起。2026年间歇计算上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第355号嵌入式实时系统的故障恢复相连,但间歇计算把故障从例外改成时钟;这为可持续边缘设备提供不同于更大电池的路径。2011年的Mementos证明断电可进入编程模型,但它不保证2026年学习模型的参数、传感时间与现实副作用同步恢复。间歇计算接口到2026年只传递同对象、同量纲且可回放的证据。
辛、深度压缩:模型容量不等于推理成本Deep Compression
早期深度网络以参数量和准确率扩张,部署端却受内存带宽、缓存和电池限制;大量接近零的权重仍被搬运,计算能耗往往不在乘法而在数据访问。〔资源预算〕要确认“深度压缩:模型容量不等于推理成本”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。2016年的Deep Compression把剪枝、量化与编码组合起来;2026年评价压缩仍必须看到真实GPU或ASIC是否少搬数据。2026年深度压缩仍须用原始样本校准历史断点并记录删失值。
〔资源预算〕本条主张,决定推理节能的只有冗余权重是否从存储和访存路径真实消失,文件压缩率或稀疏比例不能单独证明硬件获益。模型文件缩小不是能效本体,只有零值、低位宽和共享权重被runtime映射到更少访问与乘加才产生节能。深度压缩的2026年判据必须允许同预算、同对象的反例直接推翻。
Deep Compression依次使用剪枝、训练量化和霍夫曼编码,在不明显损失准确率的情况下将AlexNet压缩约35倍、VGG-16约49倍;EIE随后把稀疏模型映射到专用硬件。核验在3类硬件上比较dense与compressed版本,固定accuracy,报告板级焦耳、峰值内存、p99和batch size。到2026年,深度压缩读数还要随设备版本、周期与95%置信区间发布。〔资源预算〕落到复现实务,可为深度压缩:模型容量不等于推理成本Deep Compression建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“保持精度的推理次数/板级耗电焦耳”统一结算,避免换口径后仍宣称性能提高。
非结构化稀疏在通用GPU上可能产生索引和不规则访问开销;压缩率越高,若硬件不支持相应数据流,实际延迟与能耗反而不降。非结构稀疏超过90%仍可能被index decode和不规则访存抵消,压缩率越高,通用GPU利用率反而越低。深度压缩在2026年的失效监控把最坏切片与反向结果独立列账。
验收要同时报告磁盘大小、峰值内存、实际板级功耗、端到端延迟和逐类别精度,并与同工艺密集模型比较。发布card应分列logical sparsity与realized speedup,若后者低于1.1×,不得把存储缩减宣传成推理减排。2026年深度压缩上线记录须绑定责任人、SLO、到期日与撤回阈值。〔资源预算〕本条的边界案例应从“解码、索引、稀疏调度和编译转换消耗常不进入模型压缩率”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当硬件不支持不规则稀疏时,压缩率越高,索引与访存开销反而越大”究竟是偶发噪声,还是足以改变结论方向的系统反例。
它与第536号AI基础设施相接,也与第251号体系结构形成硬约束:算法声明的稀疏只有被编译器和存储层兑现,才成为绿色收益。它连接2016年EIE与第537号芯片面板:硬件数据流是算法承诺能否兑换为实际焦耳的最后一道门。深度压缩接口到2026年只传递同对象、同量纲且可回放的证据。
第二幕把能源进一步换算为碳、水和制造责任。研究不再只报一次训练耗时,而开始公布硬件、地点、电网时段、重复实验、推理流量与设备寿命;真正困难的地方从‘少用多少电’转向‘被转移到别处的代价有没有入账’。
一、训练碳账:实验次数比最后一次运行更重要Accounting for Training Emissions
论文通常只呈现获胜模型的最后一次训练,超参数搜索、调试失败和重复种子被留在实验室账外;模型之间也因硬件与电网不同而无法直接比较。〔外部复算〕要确认“训练碳账:实验次数比最后一次运行更重要”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。Strubell等2019年把NLP训练排放带入论文讨论,2026年的完整账本还须覆盖搜索、失败run与复现seed。2026年训练碳账仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定训练环境成本的只有完整实验活动能否被追踪,单次FLOPs或最终运行电量不足以代表研究过程。最终checkpoint只占研发总计算的一部分;决定科学结果碳强度的是所有候选路径,而非获胜模型的一次运行。训练碳账的2026年判据必须允许同预算、同对象的反例直接推翻。
Strubell等估算神经架构搜索可带来显著能源与碳排,推动领域公开训练成本;Henderson等随后提出跟踪器和标准化报告,强调碳强度随地点与时间变化。项目应以job ledger汇总至少12个月GPU-hour、实测功率、PUE和hourly carbon intensity,并给出95%不确定区间。到2026年,训练碳账读数还要随设备版本、周期与95%置信区间发布。
早期估算依赖云价格、平均功率和地区碳因子,可能高估或低估;若只挑最绿色一次公开,实验越多,论文显示的单位排放反而越低。团队若把调试算力归入“研发基础设施”,公开模型越精确,真实实验足迹反而被越多失败记录稀释出分母。训练碳账在2026年的失效监控把最坏切片与反向结果独立列账。〔外部复算〕把训练碳账:实验次数比最后一次运行更重要Accounting for Training Emissions与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“最终被采用模型数/全部训练作业产生的二氧化碳当量”在这些类别上都可回查,跨研究比较才有意义。
研究仓库应自动记录每次作业的设备、时长、功率、地点、碳因子和退出状态,并把搜索预算与最终训练分栏。release report需列成功、失败、抢占和废弃四类作业;缺失功率用上界估算,不得以0 kWh填补。2026年训练碳账上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第538号AI审计虽相邻但不重合:审计关心声明能否复核,本条把被删除的失败运行重新纳入可持续性分母。它把2019年的单模型估算推进组织级责任:比较算法时,研究预算和硬件地点必须与accuracy一起冻结。训练碳账接口到2026年只传递同对象、同量纲且可回放的证据。〔外部复算〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定训练碳账可信度的只有完整实验轨迹是否入账”的操作定义,仍能复算“最终被采用模型数/全部训练作业产生的二氧化碳当量”,否则所谓转向可能只是数据管线或命名变化。
二、Green AI:效率成为与准确率并列的研究结果Green AI
红色AI以更大模型、更大数据和更多搜索换取微小分数,论文榜单却只排列准确率;资源较少的团队难以复制,环境成本也被视为外部条件。〔反号压力〕要确认“Green AI:效率成为与准确率并列的研究结果”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。Green AI在2020年要求把效率视为研究结果;到2026年,论文应同时给quality、训练成本和推理cost curve。2026年Green AI仍须用原始样本校准历史断点并记录删失值。〔反号压力〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当代价被转移到数据和推理时,训练FLOPs越低,全生命周期能耗反而可能更高”做至少两轮外部复算,若方向翻转,Green AI:效率成为与准确率并列的研究结果Green AI的结论必须随之收窄。
〔反号压力〕本条主张,决定算法进步是否可持续的只有性能增益能否与计算、能量和复现成本共同报告,最高分不能独占评价。决定方法能否扩散的不是一次SOTA,而是同等结果需要的计算资源是否降低并能被不同实验室复现。Green AI的2026年判据必须允许同预算、同对象的反例直接推翻。
Green AI提出用计算量和效率曲线补充准确率,后续工作发展FLOPs、训练时长、硬件利用率和碳排披露;同一准确率若少用一个数量级计算,应被视为实质创新。评测可在固定1、10、100 GPU-hour三档预算下画Pareto frontier,至少报告3个seed与方差。到2026年,Green AI读数还要随设备版本、周期与95%置信区间发布。
FLOPs并不等于焦耳,硬件与稀疏执行差异会改变能耗;若指标只奖励计算量,研究者可能把代价转到数据处理、推理或制造阶段。若效率论文只在最新加速器上成立,硬件门槛越高,低资源机构为复现而承担的排放和不平等反而越大。Green AI在2026年的失效监控把最坏切片与反向结果独立列账。
会议评审可要求性能—成本曲线、同预算基线和复现实验,并给效率改进独立陈述位置,而不是把它藏在附录。会议清单应要求hardware、runtime、energy与search budget四列,缺一列的accuracy增益不得标成绿色改进。2026年Green AI上线记录须绑定责任人、SLO、到期日与撤回阈值。〔反号压力〕在可持续AI与绿色计算的这一对象上,复核应把“相对基线的性能百分点增益/训练与搜索总计算量”拆成同一分母下的主结果与失败谱,“数据清洗、模型选择、推理流量和芯片制造没有进入单一训练效率分数”要单列编码,不能在汇总时并入其他项。
它与第047号机器学习理论的样本复杂度相撞:理论问需要多少数据和计算,本条追问这些资源在现实世界由谁支付。这条路线继承2020年Schwartz等的主张,并把Green AI从道德标签变成可比较的资源—质量前沿。Green AI接口到2026年只传递同对象、同量纲且可回放的证据。
三、可复核排放:碳报告从估算走向运行级记录Reproducible Carbon Reporting
同一模型在不同GPU、利用率、数据中心PUE和电网上排放可相差数倍,早期论文却常用设备TDP乘时长,既不测实际功率,也不说明地区。〔责任链〕要确认“可复核排放:碳报告从估算走向运行级记录”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。Henderson等在2020年推动系统化报告;2026年的碳数字必须能从job ID追到功率、地点、时段和排放因子版本。2026年可复核排放仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定碳数字是否可比较的只有底层运行记录和碳因子版本能够复算,统一一个估算公式不够。可复核性的关键不是小数位,而是activity data与emission factor分开保存,使第三方可替换假设重算。可复核排放的2026年判据必须允许同预算、同对象的反例直接推翻。〔责任链〕落到复现实务,可为可复核排放:碳报告从估算走向运行级记录Reproducible Carbon Reporting建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“可由公开记录复算的训练作业数/声称低碳的训练作业总数”统一结算,避免换口径后仍宣称性能提高。
实验影响跟踪器开始从CPU、GPU与DRAM读取能耗,再接入地区碳强度;研究显示迁移到低碳电网和高效加速器可显著改变同一训练的排放。抽查至少100个训练和推理作业,对比仪表读数与估算值,报告MAPE、缺失率和95% uncertainty。到2026年,可复核排放读数还要随设备版本、周期与95%置信区间发布。
碳因子有平均与边际之分,实时数据也可能缺失;若采用最有利的年平均,负载越集中在高碳峰时,报告值与真实新增排放反而偏离越大。云商若只给地区年均系数,作业级数字越精确,时段和边际机组的不确定性反而越容易被精度外观遮蔽。可复核排放在2026年的失效监控把最坏切片与反向结果独立列账。
论文应发布机器型号、功率采样间隔、PUE、地理区域、碳数据源和版本,并分别报能量与碳,避免碳因子遮蔽效率。2026年碳账应保存meter source、PUE、grid factor和software version,任何一项变化都触发delta calculation。2026年可复核排放上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第218号计量溯源相接:一项环境数字必须能追到传感器、换算表和边界版本,才具有跨机构可比性。它把碳披露接到第538号审计:能重算、能定位责任和能解释误差,才比一次性CO2e声明多出保证价值。可复核排放接口到2026年只传递同对象、同量纲且可回放的证据。〔责任链〕对可复核排放:碳报告从估算走向运行级记录Reproducible Carbon Reporting而言,真正需要登记的不是又一个平均分,而是由“决定排放可比性的只有运行记录可被独立复算”推出的每一步中介、责任人和可撤回条件,〔责任链〕缺少任何一环,都不能把相关性写成机制。
四、碳感知调度:同一焦耳在不同时地并不相等Carbon-Aware Scheduling
传统调度以吞吐、截止期和价格选择机房,默认一千瓦时电力具有相同环境代价;可再生能源波动使夜间、午间和不同区域的排放强度显著不同。〔排除规则〕要确认“碳感知调度:同一焦耳在不同时地并不相等”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。碳感知调度利用时间与地区差异移动可延迟作业;2026年同一training run在不同电网小时可能对应不同CO2e。2026年碳感知调度仍须用原始样本校准历史断点并记录删失值。〔排除规则〕机构采用碳感知调度:同一焦耳在不同时地并不相等Carbon-Aware Scheduling之前还应公布否决门槛:一旦“当负载同时追逐绿色窗口时,迁移规模越大,边际高碳机组反而越可能启动”出现,就暂停扩张并回到“可延迟或可迁移负载应跟随电网碳强度,而不仅跟随电价和机器空闲”的原始记录复核,该门槛必须早于部署决定写入方案。
〔排除规则〕本条主张,决定可迁移计算减排的只有执行时空能否与低碳电力窗口匹配,单纯降低总能耗不是唯一道路。真正约束是deadline与data locality,调度器不能把排放降低建立在无限等待或跨境复制无成本的假设上。碳感知调度的2026年判据必须允许同预算、同对象的反例直接推翻。
Google的碳智能计算把部分灵活作业移到低碳时段,并在容量和截止期内保持服务;研究用每小时碳强度模拟时间迁移与地理迁移的减排潜力。用90天真实队列回放比较carbon-aware与FIFO,报告完成率、延迟、迁移流量、kWh和边际排放。到2026年,碳感知调度读数还要随设备版本、周期与95%置信区间发布。
平均碳强度可能与边际机组方向不同,跨区迁移还增加网络和闲置容量;若所有负载同时追逐一个绿色窗口,峰值反而可能启动高碳备用电源。若所有平台追逐同一低碳时段,新增负载会改变边际机组;调度越集中,原有绿色信号反而越快失真。碳感知调度在2026年的失效监控把最坏切片与反向结果独立列账。
调度器应公布预测误差、推迟时长、数据移动和边际排放,并设置不迁移基线;延迟敏感服务与批处理不能使用同一自由度。上线设置最大等待24小时与数据驻留allowlist,并将迁移网络能耗和预热损失计入同一job ledger。2026年碳感知调度上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第566号智能电网相邻但不重复:电网侧调负荷保稳定,本条从计算作业侧决定什么能等、能移以及谁承担等待。它把2021年前后的碳感知计算连接电力系统:平均因子适合盘查,实时决策仍需辨认边际与因果效应。碳感知调度接口到2026年只传递同对象、同量纲且可回放的证据。
五、隐含碳:换新服务器未必比延寿更绿色Embodied Carbon and Hardware Lifetimes
绿色计算长期只算用电,服务器制造、晶圆、内存、机箱和供应链排放在购买时已经发生,却被当作沉没成本;节点越先进,制造占比可能越高。〔基线冻结〕要确认“隐含碳:换新服务器未必比延寿更绿色”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。Gupta等在2021年把制造足迹重新带入计算;2026年更换AI服务器必须比较新机节能与embodied carbon回收期。2026年隐含碳仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定设备更新是否减排的只有新机运行节省能否在剩余寿命内偿还制造碳,能效提高本身不足以支持换新。运行能效并非唯一决定因素,晶圆制造、HBM、封装、运输和提前报废会在开机前形成一笔固定环境债。隐含碳的2026年判据必须允许同预算、同对象的反例直接推翻。〔基线冻结〕面向下一轮材料,可持续AI与绿色计算应优先补齐“晶圆良率损失、备件、运输、维修与提前报废常没有设备级碳字段”的原始记录,并把“当电网已经低碳时,新机能效越高,提前报废造成的制造碳占比反而越大”作为预注册反例,这两项同时公开,才能区分暂时缺证与真正失效。
Chasing Carbon把运行碳与隐含碳放进同一生命周期模型,显示在低碳电网中制造排放会占主导;Carbon Explorer进一步比较利用率、电网和硬件世代的组合。核验以5年functional unit比较延寿与换新,给出制造CO2e、故障率、利用率和年度kWh的Monte Carlo区间。到2026年,隐含碳读数还要随设备版本、周期与95%置信区间发布。
旧设备效率较低且可能阻挡服务密度,新设备也有可靠性与维护收益;若把已发生制造碳无限摊薄,设备越老,账面每年排放反而被人为做小。当电网已经低碳且旧机仍高利用时,新设备每瓦越快,制造排放占生命周期的比例反而可能越高。隐含碳在2026年的失效监控把最坏切片与反向结果独立列账。
资产决策应公布制造碳估计、剩余寿命、利用率、维修和性能需求,并给出碳回收期,而不是按采购年度分割责任。采购审批应要求carbon payback小于剩余服务期,并把翻新、再部署和部件回收列作正式替代方案。2026年隐含碳上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第367号先进封装及第568号循环经济连接:芯片不能只按运行器件看,也是一批含稀缺材料、可维修性与退役路径的物质对象。这与第568号循环经济相接:2021年的全生命周期核算说明性能代际不是自动淘汰许可,设备寿命也是AI设计变量。隐含碳接口到2026年只传递同对象、同量纲且可回放的证据。
六、计算最优缩放:大模型也要在数据与参数间配平Compute-Optimal Scaling
早期规模律常把更多参数视为通向更低损失的直接道路,训练数据量与步数被当作随附选择;许多大模型因此参数过多、数据不足。Hoffmann等在2022年给出compute-optimal scaling;到2026年,固定训练FLOPs下参数与token配平也影响重复训练和服务效率。2026年计算最优缩放仍须用原始样本校准历史断点并记录删失值。
〔异常运行〕本条主张,决定固定预算模型质量的只有参数、token和训练步数是否处在计算最优比例,模型尺寸不能独占规模判断。计算最优只回答训练损失如何分配预算,不能把电网碳、推理流量、数据治理或下游质量一并优化掉。计算最优缩放的2026年判据必须允许同预算、同对象的反例直接推翻。
Chinchilla在约70亿到700亿参数系列实验中指出,给定计算量下参数与训练token应大致同步增长;700亿参数模型以更多数据训练,优于参数更大的Gopher等模型。复验至少使用4档compute budget,拟合loss–parameter–token曲线并公开置信区间、训练硬件与数据去重。到2026年,计算最优缩放读数还要随设备版本、周期与95%置信区间发布。〔异常运行〕证据链还要把Kaplan等,2020年arXiv:2001.08361的起点材料与更新文献放在同一比较表里,并逐项报告“固定计算预算下,参数量与训练数据必须配平,单纯增大模型会浪费算力”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
计算最优依赖数据质量、重复度、目标和推理流量;若训练更小模型需要更多高质量token,数据采集与清洗能耗可能上升。若更长数据训练降低loss却迫使模型在所有请求中保持更大memory footprint,训练最优可能制造服务期负担。计算最优缩放在2026年的失效监控把最坏切片与反向结果独立列账。
评估应报告总训练FLOPs、有效token、数据重复、推理请求和下游质量;训练最优不等于全生命周期最优。模型决策应同时画training FLOPs、inference joules与task quality三维前沿,禁止用Chinchilla曲线单独宣称绿色。2026年计算最优缩放上线记录须绑定责任人、SLO、到期日与撤回阈值。〔异常运行〕对计算最优缩放:大模型也要在数据与参数间配平Compute-Optimal Scaling而言,真正需要登记的不是又一个平均分,而是由“决定固定算力质量的只有参数与有效数据是否计算最优”推出的每一步中介、责任人和可撤回条件,〔异常运行〕缺少任何一环,都不能把相关性写成机制。
它与第044号基础模型的规模律相接,本块增加环境分母:参数缩小若导致服务期内更多推理,也可能把节省从训练转移出去。它连接2022年的缩放定律与第531号AI for Science:预算配平提高实验效率,却不替代问题价值和生命周期结算。计算最优缩放接口到2026年只传递同对象、同量纲且可回放的证据。
七、水足迹:冷却与发电用水进入AI账本The Water Footprint of AI
碳披露普及后,数据中心冷却取水和电厂耗水仍常被隐藏;同样一升水在湿润地区与缺水流域的社会代价并不相等。〔人工接管〕要确认“水足迹:冷却与发电用水进入AI账本”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。Li等在2023年把AI水足迹推向公共议程;2026年冷却用水必须按流域、季节与水压力拆分而非只给全球总量。2026年水足迹仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定AI用水风险的只有直接与间接取水能否按流域、季节和水源共同核算,全球总升数不够。直接蒸发与发电间接用水来自不同系统,单一L/kWh系数会把地区稀缺性和回用水质量全部抹平。水足迹的2026年判据必须允许同预算、同对象的反例直接推翻。
2023年研究估算大型模型训练与推理可产生可观水足迹,并区分现场冷却与发电间接用水;美国数据中心报告进一步跟踪AI需求上升带来的电力与水压力。披露至少包含月度WUE、取水、消耗、回用比例与source basin,并用water-stress weight重算1次。到2026年,水足迹读数还要随设备版本、周期与95%置信区间发布。
估算受冷却系统、气候、云商数据缺口和电源结构影响;若迁移到低碳但缺水地区,碳越低,局部水风险反而可能升高。若把作业迁到低碳但干旱地区,CO2e越低,局部水风险反而可能越高,环境目标不能被单轴调度。水足迹在2026年的失效监控把最坏切片与反向结果独立列账。〔人工接管〕本条的边界案例应从“流域季节性、回用水质量和电厂间接耗水常被全球平均值抹平”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当低碳电力位于缺水地区时,碳强度越低,局部水风险反而可能越高”究竟是偶发噪声,还是足以改变结论方向的系统反例。
云服务应披露水耗效率、流域压力、回用比例和高温时段,并允许作业在碳与水目标间显示权衡。选址与调度采用carbon–water Pareto frontier,高压力流域设置绝对取水上限和社区应急优先权。2026年水足迹上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第066号海洋科学和第296号能源政策产生跨域碰撞:水不是免费冷却介质,而是与城市、农业共享的有边界资源。它把2023年的“thirsty AI”接到第539号治理面板:水数据只有下沉到设施和季节,受影响社区才可能追责。水足迹接口到2026年只传递同对象、同量纲且可回放的证据。〔人工接管〕机构采用水足迹:冷却与发电用水进入AI账本The Water Footprint of AI之前还应公布否决门槛:一旦“当低碳电力位于缺水地区时,碳强度越低,局部水风险反而可能越高”出现,就暂停扩张并回到“AI环境成本既有现场冷却用水,也有电力生产的间接水耗,地点决定稀缺性”的原始记录复核,该门槛必须早于部署决定写入方案。
八、推理成为主账:模型上线后的流量可能超过训练Inference Becomes the Main Environmental Ledger
训练碳进入公众视野后,许多核算仍在模型发布时停止;搜索、对话、推荐和图像生成每天调用数以百万计,单次很小的推理成本会长期累积。〔撤回门槛〕要确认“推理成为主账:模型上线后的流量可能超过训练”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。生成式AI上线后持续服务海量请求;2024年的实测工作表明,输出模态、长度与batch会让单次推理能耗跨越数量级。2026年推理成为主账仍须用原始样本校准历史断点并记录删失值。
〔撤回门槛〕本条主张,决定产品环境成本的只有真实服务期内每次推理资源与调用分布,训练一次的数字不能代表持续运营。生命周期主账由真实流量决定,不是训练或推理天然占主导;模型、cache hit和重生成率共同决定累计需求。推理成为主账的2026年判据必须允许同预算、同对象的反例直接推翻。
生命周期研究比较不同加速器与数据中心后指出硬件、地点和模型效率可大幅改变训练排放;2024年生成式任务测量进一步显示不同模态与模型的单次能耗差异显著。连续记录365天request-level能耗,以有效结果为分母,分列缓存、空请求、重试、输入和输出token。到2026年,推理成为主账读数还要随设备版本、周期与95%置信区间发布。
调用量、批处理、缓存命中和生成长度由产品设计改变;若低成本刺激更多使用,单次能效越高,总请求与总能耗反而可能增长。当单位推理降价刺激更多调用时,每请求焦耳越低,年度总电力反而可能上升,形成典型rebound。推理成为主账在2026年的失效监控把最坏切片与反向结果独立列账。
产品应公布按任务和输出长度分层的焦耳/请求、缓存率、利用率与年度流量,并把用户侧设备和网络传输列为边界说明。产品gate应同时限制joule/result与annual energy budget,流量超过预测20%自动触发模型路由和需求复核。2026年推理成为主账上线记录须绑定责任人、SLO、到期日与撤回阈值。〔撤回门槛〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定产品能耗的只有真实推理流量能否与单次资源合并为服务期总账”的操作定义,仍能复算“产生有效用户结果的请求数/服务期总耗电千瓦时”,否则所谓转向可能只是数据管线或命名变化。
它与第154号信息系统的数字化反弹相撞:效率不是终点,价格下降和便利增长会回写需求,形成新的环境负载。它连接2024年生成任务测量与第154号数字转型:真实服务价值必须进入分母,不能把所有API调用视为同等产出。推理成为主账接口到2026年只传递同对象、同量纲且可回放的证据。
九、MLPerf Power:性能基准开始携带能耗分母MLPerf Power
AI加速器厂商曾各选模型、批量和精度展示TOPS/W,数字无法横向换算;峰值算术吞吐也常忽略内存、主机和网络。〔跨域外推〕要确认“MLPerf Power:性能基准开始携带能耗分母”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。MLPerf Power把性能、质量与功率放进共同提交;2026年AI能效比较必须避免用降质量或缩短任务偷换分母。2026年MLPerf Power仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定能效基准可比性的只有工作负载、质量门槛和系统功率边界统一,芯片峰值指标不能替代端到端测量。基准价值来自规则与审计:相同accuracy target、scenario和系统边界下,performance per watt才具有可比性。MLPerf Power的2026年判据必须允许同预算、同对象的反例直接推翻。〔跨域外推〕证据链还要把Mattson等,2020年《机器学习与系统》2:336–349的起点材料与更新文献放在同一比较表里,并逐项报告“AI系统比较必须在统一任务、质量和功率测量规则下报告性能/瓦”在哪些设备、机构或人群中没有出现,而不是只保留成功演示。
MLPerf建立训练与推理套件,覆盖图像、语言、推荐等任务并要求达到质量阈值;功率规则将瓦特测量接到吞吐和延迟,使提交结果可在相同场景比较。提交应给整机交流侧功率、采样频率、uncertainty与run duration,并由至少1个独立实验室复核。到2026年,MLPerf Power读数还要随设备版本、周期与95%置信区间发布。
厂商仍可优化特定版本、批量和软件栈,基准模型也会落后生产负载;若只追逐榜单任务,提交次数越多,真实长尾工作负载反而越无人优化。厂商若围绕固定模型和batch调优,榜单每瓦越高,对长上下文、动态流量和生产空闲的外推反而越弱。MLPerf Power在2026年的失效监控把最坏切片与反向结果独立列账。
验收应区分服务器、加速卡和整机边界,公开主机功率、空闲功率、精度与延迟,并用生产轨迹补充标准套件。内部采购需用公共MLPerf结果加30天production replay,二者差异超过15%时采用较差读数。2026年MLPerf Power上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第360号性能基准和第536号AI基础设施相接:共同基准提供尺子,但不能替代对模型生命周期与利用率的解释。这与第536号MLPerf条目构成性能—环境接口:2026年的绿色结论还要补制造、碳强度和需求总量。MLPerf Power接口到2026年只传递同对象、同量纲且可回放的证据。〔跨域外推〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当生产负载偏离基准时,榜单分数越高,真实工作效率反而可能无改进”做至少两轮外部复算,若方向翻转,MLPerf Power:性能基准开始携带能耗分母MLPerf Power的结论必须随之收窄。
十、边际碳强度:平均绿色不代表新增负载绿色Marginal Carbon Intensity
企业常用地区年度平均碳强度乘耗电量,默认新增一台服务器按同样电源比例供电;实际负荷变化由边际机组响应,可能是燃气、煤电或被弃掉的可再生能源。〔盲法复核〕要确认“边际碳强度:平均绿色不代表新增负载绿色”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。平均碳强度适合年度盘查,边际碳强度更接近新增AI负载改变哪台发电机;2026年两种信号可能方向相反。2026年边际碳强度仍须用原始样本校准历史断点并记录删失值。〔盲法复核〕落到复现实务,可为边际碳强度:平均绿色不代表新增负载绿色Marginal Carbon Intensity建立版本化对象表:输入、基线、资源预算、异常运行和人工接管分别留痕,并用“避免的边际二氧化碳当量/因调度迁移增加的数据传输量”统一结算,避免换口径后仍宣称性能提高。
〔盲法复核〕本条主张,决定调度减排方向的只有新增负载对应的边际排放,平均碳强度只能描述存量组合。调度效益的单因是可迁移负载对边际排放的因果影响,而不是数据中心所在地区拥有较低年度平均值。边际碳强度的2026年判据必须允许同预算、同对象的反例直接推翻。
相关研究比较平均与边际信号后发现,两者在部分时段会给出不同迁移决策;仅按平均值选择地点,可能把负载移到表面低碳、边际高碳的区域。实验在3个电网、90天窗口同时回放average与marginal signal,比较迁移方向、CO2e和forecast error。到2026年,边际碳强度读数还要随设备版本、周期与95%置信区间发布。〔盲法复核〕本条的边界案例应从“长期电网扩容、备用机组和跨区输电损耗常不进入实时碳API”中抽样,而不是只从最容易成功的中心案例抽样,这样才能判断“当边际信号误判时,迁移频率越高,实际减排反而越小甚至反号”究竟是偶发噪声,还是足以改变结论方向的系统反例。
边际数据依赖市场模型且不总公开,短期与长期边际也不同;若把不确定估计当精确真值,频繁迁移会制造数据传输和备用容量。大规模负载若同步追随预测信号,会改变价格和机组组合;边际估计越受欢迎,其历史模型反而越可能失准。边际碳强度在2026年的失效监控把最坏切片与反向结果独立列账。
运营者应同时报告平均与边际信号、预测误差和迁移成本,并把不确定性放进优化而不是藏在脚注。部署保留grid operator反馈,限制每15分钟迁移斜率,并用事后dispatch重算真实减排而非只报计划值。2026年边际碳强度上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第419号能源经济学的电价形成对撞:价格信号与碳信号可能同向也可能反向,计算调度需要明确优先级。它把2023年的carbon-aware datacenter接到第419号能源经济学:负荷响应会回写被测电网,相关系数不是因果减排。边际碳强度接口到2026年只传递同对象、同量纲且可回放的证据。
十一、绿色算法:把计算预算写进方法选择Green Algorithms
计算生物学和AI研究常把资源视为固定背景,研究者选择更多核心或更长运行只考虑等待时间;并行效率低时,核心增加会提高耗电却几乎不缩短任务。〔结果分母〕要确认“绿色算法:把计算预算写进方法选择”的历史转折,第1段还须公开当时可用的旧基线与未成功样本。Green Algorithms在2021年把运行时长、memory、PUE与碳因子写入估算器;2026年研究计划应先决定资源预算再选方法。2026年绿色算法仍须用原始样本校准历史断点并记录删失值。
本条锁定的命题是,决定分析绿色程度的只有同一科学结果所需的实际计算资源,而不是预算是否充足或作业是否更快结束。绿色算法关注同一科学结果的resource-to-solution,而不是代码运行更快;核心小时也必须经利用率换成实测能量。绿色算法的2026年判据必须允许同预算、同对象的反例直接推翻。〔结果分母〕把绿色算法:〔结果分母〕把计算预算写进方法选择Green Algorithms与相邻路线比较时,统一分母至少应包含成功、失败、弃权和未覆盖对象四类,只有“达到同等科学精度的分析结果数/计算耗电千瓦时”在这些类别上都可回查,跨研究比较才有意义。
Green Algorithms提出按运行时长、核心、内存、PUE和碳强度估算足迹,并以在线工具帮助研究者比较硬件与地点;案例显示并行和地区选择可带来数量级差异。先做1、8、32与128核心的scaling test,记录time、kWh、accuracy和communication share,寻找能量拐点。到2026年,绿色算法读数还要随设备版本、周期与95%置信区间发布。
估算器依赖通用功率系数,无法覆盖GPU利用率和云商细节;若以核心小时代替能量,核心越多,低利用率任务的误差反而越大。并行效率跌破60%后继续加核,wall time仍可能下降,但网络和空闲等待使energy-to-solution反向上升。绿色算法在2026年的失效监控把最坏切片与反向结果独立列账。〔结果分母〕这也给出一项不依赖宣传口径的核验:独立团队只拿到冻结版本与“决定算法足迹的只有获得同一科学结果所需实际资源”的操作定义,仍能复算“达到同等科学精度的分析结果数/计算耗电千瓦时”,否则所谓转向可能只是数据管线或命名变化。
实验计划应先做缩放测试,找到效率拐点,再决定核心数、精度和运行位置;方法论文要给同结果的资源曲线。方法论文应发布资源曲线与停止规则;超过拐点的配置只可因deadline采用,不得归入节能收益。2026年绿色算法上线记录须绑定责任人、SLO、到期日与撤回阈值。
它与第351号高性能计算相撞:HPC追求到解时间,本条要求任何加速都同时说明额外节点与通信是否值得。它连接第351号HPC:2021年的在线估算降低披露门槛,却不能替代GPU板级测量和失败作业全账。绿色算法接口到2026年只传递同对象、同量纲且可回放的证据。
十二、效率反弹:省下的算力会被新增需求重新吃掉The Computing Rebound Effect
数据中心在2010年代显著改善PUE、虚拟化和服务器效率,全球计算需求却以更快速度扩大;单位任务下降与总电力上升可以同时发生。Masanet等2020年显示效率吸收了大量需求增长;IEA于2026年报告数据中心电力需求在2025年增长17%,其中AI重点设施增长50%。2026年效率反弹仍须用原始样本校准历史断点并记录删失值。
〔未覆盖项〕本条主张,决定技术是否真正减排的只有效率收益在需求回写后仍能降低总量,单位能耗下降不能单独作为环境结论。决定真实减排的只有总量在需求回写后是否下降;per-query improvement不能自动外推年度electricity use。效率反弹的2026年判据必须允许同预算、同对象的反例直接推翻。
Masanet等估计2010至2018年数据中心计算实例增长约六倍,而能源使用增长相对有限,证明效率吸收了大量需求;此后生成式AI与加速器集群又改变增长轨迹。企业需连续36个月同时报告有效服务量、总请求、总kWh与价格,估计efficiency elasticity及95%区间。到2026年,效率反弹读数还要随设备版本、周期与95%置信区间发布。〔未覆盖项〕在可持续AI与绿色计算的这一对象上,复核应把“年度产生的有用服务量/数据中心年度总耗电量”拆成同一分母下的主结果与失败谱,“自动生成的低价值请求、广告驱动调用和被替代活动没有统一价值分层”要单列编码,不能在汇总时并入其他项。
反弹大小受价格、产品设计和政策影响,不能由技术效率直接推算;若更便宜推理催生无意义自动生成,效率越高,总请求可能增长越快。若推理成本下降80%而请求增长6倍,单位效率越好,总电力仍反而上升;Jevons effect必须直接进入预算。效率反弹在2026年的失效监控把最坏切片与反向结果独立列账。
企业需要同时公布单位任务能耗、年度任务总量和总电力,并说明新增需求中多少替代旧活动、多少是净新增。年度目标设置绝对energy cap,并把低价值重生成、广告调用与bot traffic单列,避免用需求增长稀释成果。2026年效率反弹上线记录须绑定责任人、SLO、到期日与撤回阈值。〔未覆盖项〕可执行的压力测试是预先固定样本单位、时间窗口和排除规则,再针对“当低价诱发大量新需求时,单位任务越高效,年度总能耗反而越高”做至少两轮外部复算,若方向翻转,效率反弹:省下的算力会被新增需求重新吃掉The Computing Rebound Effect的结论必须随之收窄。
它与第296号能源政策和第154号数字转型相撞:技术团队控制单位成本,组织与社会环境决定节省会不会被扩张吞回。它把2020年的数据中心总量研究接到第296号能源政策:技术效率是必要条件,价格、产品设计和总量治理决定终值。效率反弹接口到2026年只传递同对象、同量纲且可回放的证据。
◎ 二十年连起来看
二十年的主线不是计算越来越省电,而是分母越来越完整。从2007年的低负载功耗到2024年的推理、制造和水足迹,原先分散在机房、芯片厂与电网的代价逐步进入同一服务链。
第二条线是尺度上移:单机让位给仓库级计算机,仓库又让位给跨地区云与电网。任何局部每瓦改进都必须接受端到端请求、生命周期和需求反弹三次复核。
第三条线是责任变化。绿色不再是设备铭牌,而是模型开发者、平台、供应商和使用组织分别能改变什么、披露什么以及谁承担反号后果。
◎ 三个常见误解
误解一是PUE接近1就代表数据中心绿色。PUE只压缩设施附加耗电,不能判断IT电力是否用于有效工作,也不能说明电来自何种边际机组。
误解二是模型越小一定越环保。压缩若不被硬件利用、或小模型在服务期被调用更多次,训练期节省可能被推理与数据移动吞回。
误解三是碳数字越精确越可信。没有硬件、地点、时段、PUE、制造边界和失败运行,精确到小数点后的排放仍不可复算。
◎ 与相邻领域的接口
与第360号系统性能与能效的分工是:该面板解释性能指标如何避免空转,本块继续追踪能量如何换算成碳、水和制造责任。
与第296号能源政策的接口落在边际碳与需求响应。电网告诉计算何时低碳,计算系统必须说明哪些作业可等、可移以及等待成本。
与第568号循环经济的接口是设备寿命。芯片效率属于运行阶段,维修、再利用、制造与退役决定提前换机是否真的减排。
◎ 争议现场
第一场争议是平均还是边际碳强度。要收敛,需对同一地区同一负载同时发布两种信号和真实电力调度结果,比较迁移决策的方向与误差。
第二场争议是训练还是推理主导。要收敛,需对真实产品连续记录一年作业级功率、流量、缓存和模型版本,而不是从单次实验外推。
第三场争议是延寿还是换新。要收敛,需获得设备制造碳、旧机利用率、故障率和新机节能的共同数据,并计算带不确定区间的碳回收期。
◎ 往下五年看什么
看2027年前主要云平台是否把作业级能耗、地区与时段碳强度纳入标准账单;读数是可复算作业占全部AI作业的比例。
看MLPerf等基准能否稳定报告整机功率、质量、延迟和生产轨迹;读数是同时满足端到端边界的公开提交数。
看数据中心水披露能否从全球总量下沉到流域与季节;读数是提供直接、间接及水压力加权数据的设施比例。
看效率反弹是否进入企业目标;读数不只是焦耳/请求,而是年度有效服务量、总电力和无效调用三者能否同时下降。
◎ 可与哪些领域对撞
与第419号能源经济学对撞:两边共享‘价格代表系统代价’,本块显示低价时段未必低碳;若都成立,就必须新增边际排放而非电价作为第三信号。
与第074号因果推断对撞:两边共享‘有数字即可归因’,碳核算却缺同任务反事实;由此推出每个减排百分比都应带基线版本。
与第154号信息系统对撞:数字化称效率降低成本,本块显示低成本会刺激更多请求;若两边都成立,需求回写必须成为绿色服务的独立状态变量。
与第568号循环经济对撞:运行效率鼓励换新,材料循环鼓励延寿;两边共同成立时,碳回收期而非设备年龄应决定更新。
◎ 十条可做的研究命题
命题一:在相同SLO下,按低负载功耗曲线调度比按峰值每瓦性能调度降低至少15%整机能耗;以生产轨迹A/B测试,未达到即证伪。
命题二:用边际而非平均碳强度迁移批处理,在一个完整季节内可多减排10%以上;若方向不稳定即证伪。
命题三:把失败与中止训练纳入后,公开论文的模型碳强度中位数至少上升30%;抽样复算,低于10%即证伪。
命题四:在低碳电网中,服务器制造碳超过五年生命周期总碳的40%;用供应商生命周期数据核算,低于20%即证伪。
命题五:同质量稀疏模型只有在硬件原生支持时才产生端到端节能;跨GPU与专用加速器比较,通用GPU同样获益即证伪。
命题六:流域压力加权后,最低碳机房至少有四分之一时段不是最低环境风险地点;全年调度数据不满足即证伪。
命题七:生成式服务的年度推理电力在上线两年内超过最初训练电力;连续计量未超过即证伪。
命题八:同时公布能量、碳、水和延迟会改变不少于20%的采购排序;多目标排序与单碳排序几乎一致即证伪。
命题九:把无效重生成计入分母后,每份有用工作的能耗至少高于每请求能耗25%;若差异低于5%即证伪。
命题十:效率提升超过两倍的AI服务中,至少一半出现总请求增长抵消大部分节能;三年面板数据无反弹即证伪。
◎ 资料核验
- Barroso, L. A. & Hölzle, U. The Case for Energy-Proportional Computing. Computer 40(12), 33–37 (2007). DOI 10.1109/MC.2007.443.
- Fan, X., Weber, W.-D. & Barroso, L. A. Power Provisioning for a Warehouse-Sized Computer. ISCA, 76–86 (2007). DOI 10.1145/1250662.1250665.
- Barroso, L. A. & Hölzle, U. The Datacenter as a Computer. Morgan & Claypool (2009). DOI 10.2200/S00193ED1V01Y200905CAC006.
- Greenberg, A. et al. The Cost of a Cloud. SIGCOMM CCR 39(4), 68–73 (2009). DOI 10.1145/1592568.1592570.
- The Green Grid. The Green Grid Data Center Power Efficiency Metrics: PUE and DCiE (2007).
- Yuventi, J. & Mehdizadeh, R. A Critical Analysis of Power Usage Effectiveness. Energy and Buildings 64, 450–459 (2013). DOI 10.1016/j.enbuild.2013.05.025.
- Raghavendra, R. et al. No ‘Power’ Struggles. ASPLOS, 48–59 (2008). DOI 10.1145/1346281.1346289.
- Esmaeilzadeh, H. et al. Dark Silicon and the End of Multicore Scaling. ISCA, 365–376 (2011). DOI 10.1145/2000064.2000108.
- Esmaeilzadeh, H. et al. Architecture Support for Disciplined Approximate Programming. ASPLOS, 301–312 (2012). DOI 10.1145/2451116.2451156.
- Ransford, B., Sorber, J. & Fu, K. Mementos. ASPLOS, 1–12 (2011). DOI 10.1145/1950365.1950386.
- Han, S., Mao, H. & Dally, W. J. Deep Compression. ICLR (2016), arXiv:1510.00149.
- Strubell, E., Ganesh, A. & McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. ACL, 3645–3650 (2019). DOI 10.18653/v1/P19-1355.
- Schwartz, R. et al. Green AI. Communications of the ACM 63(12), 54–63 (2020). DOI 10.1145/3381831.
- Henderson, P. et al. Towards the Systematic Reporting of the Energy and Carbon Footprints of Machine Learning. JMLR 21(248), 1–43 (2020).
- Masanet, E. et al. Recalibrating Global Data Center Energy-Use Estimates. Science 367, 984–986 (2020). DOI 10.1126/science.aba3758.
- Lannelongue, L., Grealey, J. & Inouye, M. Green Algorithms. Advanced Science 8, 2100707 (2021). DOI 10.1002/advs.202100707.
- Gupta, U. et al. Chasing Carbon: The Elusive Environmental Footprint of Computing. ISCA, 854–869 (2021). DOI 10.1109/ISCA52012.2021.00076.
- Hoffmann, J. et al. Training Compute-Optimal Large Language Models. NeurIPS 35, 30016–30030 (2022).
- Wu, C.-J. et al. Sustainable AI: Environmental Implications, Challenges and Opportunities. Communications of the ACM 65(11), 52–61 (2022). DOI 10.1145/3485128.
- Radovanović, A. et al. Carbon-Aware Computing for Datacenters. IEEE Transactions on Power Systems 38(2), 1270–1280 (2023). DOI 10.1109/TPWRS.2022.3173250.
- Li, P. et al. Making AI Less ‘Thirsty’. arXiv:2304.03271 (2023, preprint).
- Luccioni, A. S., Jernite, Y. & Strubell, E. Power Hungry Processing. FAccT, 1851–1862 (2024). DOI 10.1145/3630106.3658542.
- International Energy Agency. Key Questions on Energy and AI (2026).
- Lawrence Berkeley National Laboratory. 2024 United States Data Center Energy Usage Report (2024).
SDEUniverses.com · 新思想前沿 | 第 541 号 | 王德生 亲撰