嵌入式与实时系统
嵌入式与实时系统近二十年的变化不应写成工具清单。真正被换掉的是评价标准:系统不再只凭单点分数、平均速度或“能运行”证明自己,而要说明在安全关键控制、共享多核、端侧学习和能量采集设备中,最坏执行时间、共享资源干扰、认证假设和能量收支怎样进入结果。上一个十年主要把旧默认拆成可测约束;这十年则经历真实部署与方法清算,要求同时报告截止期违约、最坏时延、能耗和安全状态。下面二十条均按主证据年份归幕,每条给出源行、六段证据链和可抽取的碰撞行。
第一幕把实时性从平均快改成可组合的最坏上界、关键度与端到端路径。 本幕八条共同把旧默认第一次放到可测上界、误差、资源或行为证据上,并试写出可与别的领域换算的分母。
甲、混合关键度:同一平台必须承认不同证据等级
实时系统的调度理论长期建立在一个统一前提上:每个任务有一个最坏执行时间,这个数是客观的、大家都认的。混合关键度指出这个前提在真实系统里从来不成立——同一段代码,安全认证机构要求的保守估计与工程师日常使用的经验值可以相差数倍。这条转向不再追问哪个数才是真的,而是承认同一任务可以在不同证据等级下携带不同预算,调度必须在多套预算之间保持一致。
这条理论的可反驳命题是:安全关键任务需要保守预算,普通任务可用较乐观预算;超支时系统应有定义地切换保障模式。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“高关键任务按期完成数/高关键任务总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Vestal,2007年《RTSS会议录》,IEEE。具体设计与读数是:模型为同一任务给出LO与HI两组最坏执行时间,并在模式切换后改变服务保证;两级证据不能再压成一个统一截止期。Vestal于2007年提出混合关键度模型,随后形成大量调度分析;模式切换可保高关键任务,却可能粗暴丢弃低关键服务。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“最坏执行时间是否随微体系结构变化”。对照证据见Edwards 与 Lee,2007年《DAC会议录》,ACM/IEEE:PRET以可预测流水、显式存储和时间指令替换复杂缓存猜测;平均IPC可能下降,但同一指令路径的时间方差显著收缩。它显示平均端侧基准不代表最坏响应时间;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:声明可调度时必须写明按哪一级证据的预算算出的结论,以及降级模式下非关键任务将被怎样处理。只报「系统可调度」而不注明证据等级,等于把认证口径与工程口径混成一个数。同时应报告高关键任务在各模式下的按期完成比例,这个读数才是安全论证真正要的东西。
与本块第十二条《优雅降级》是同一机制的两种收尾:混合关键度回答「预算不够时保谁」,优雅降级回答「被牺牲的那部分是整个丢掉还是降质保留」。原始的混合关键度模型选择直接丢弃低关键任务,而这在很多真实系统里不可接受——因此两条必须一起设计,否则理论上可调度的方案在产品上无法交付。
乙、时间可预测处理:平均更快可能让最坏情况更难证明
通用处理器的设计目标长期是平均更快:缓存、乱序执行、分支预测都在优化常见情形。这个前提对吞吐型负载成立,对安全关键系统却制造了新的困难——每一处加速机制都让执行时间的上界更难证明,而认证要的恰恰是这个上界。这条转向主张在安全关键平台上把可分析性放在平均性能之前,宁可放弃一部分速度,也要让最坏情况可被证明。
这条理论的可反驳命题是:安全关键平台应优先让执行时间可分析,即使牺牲部分平均吞吐。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“分析执行时间上界/实测最坏执行时间”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Edwards 与 Lee,2007年《DAC会议录》,ACM/IEEE。具体设计与读数是:PRET以可预测流水、显式存储和时间指令替换复杂缓存猜测;平均IPC可能下降,但同一指令路径的时间方差显著收缩。PRET路线在2008年前后提出精确时序架构与编程模型;研究原型显示消除不可预测共享状态能收紧WCET,但通用性能与生态受限。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“共享GPU与内存是否可给出确定上界”。对照证据见Pellizzoni 等,2010年《RTSS会议录》,IEEE:在四核共享内存平台上,其他核的突发访问可让关键任务延迟成倍增长;单核WCET相加不再给出系统上界。它显示在线更新可快速修错却破坏认证基线;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告执行时间时要同时给出分析上界与实测最坏值,并给出两者之比。上界远大于实测值说明分析过于悲观,硬件资源被白白留出;上界接近实测值则要说明覆盖了哪些路径。只报实测最大值的报告在认证语境下无效——它测的是运气,不是界。
与本块第三条《多核干扰》构成同一趋势的两个阶段:单核上是加速机制让上界难证,多核上是共享资源让独立性假设失效。两者的共同结论是——**可分析性是一种必须被主动设计的属性,它不会作为性能提升的副产品自动出现**。这一点在追求算力的产品决策中经常被反向牺牲。
丙、多核干扰:核数增加会破坏独立任务假设
把多核平台用于实时系统时,最自然的做法是把任务分到各个核上,然后按单核理论分别分析。这个默认前提是任务在各自的核上互不干扰。实际上共享缓存、内存控制器与总线让任何一个核的访问模式都可能延长另一个核上任务的执行时间,独立性假设在硬件层面就不成立。这条转向要求把争用上界纳入最坏执行时间,多核的分析对象从任务改成任务加上它所处的争用环境。
这条理论的可反驳命题是:共享缓存、内存控制器和总线会产生跨核阻塞,WCET必须包含争用上界。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“共享干扰下WCET/独占WCET”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Pellizzoni 等,2010年《RTSS会议录》,IEEE。具体设计与读数是:在四核共享内存平台上,其他核的突发访问可让关键任务延迟成倍增长;单核WCET相加不再给出系统上界。2010年代大量多核实时实验观察到同一任务因共运行负载显著变慢;干扰模式与硬件细节高度相关。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“学习模型更新后原安全论证是否仍成立”。对照证据见Cucu-Grosjean 等,2012年《RTSS会议录》,IEEE:方法用极值统计外推如10^-9超越概率的执行时间分位;输出不是一个绝对最大值,而是“超过此值的概率不高于多少”。它显示过度保守会浪费资源并诱发绕过认证;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:给出共享干扰下与独占条件下的最坏执行时间之比,并说明干扰模型覆盖了哪些共享资源。只给独占测量值的报告在多核平台上没有意义。同时应说明未被建模的共享资源——每一处遗漏都是分析结论与真实行为之间的缺口,而这类缺口在实验室负载下极难暴露。
与本块第十四条《内存带宽预算》是问题与对策:干扰既然无法消除,就把它变成受控资源来分配。两条的组合决定了多核平台在安全关键领域的可用性——只做分析不做管控,干扰上界会悲观到吃掉多核带来的全部收益;只做管控不做分析,则没有可交付给认证的证据。
丁、概率最坏执行时间:极端值可以用统计界表达
最坏执行时间长期被当作一个必须确定给出的单值:分析给出上界,认证据此判定。这个前提在硬件行为高度复杂、路径组合爆炸之后变得越来越昂贵——为了绝对安全,界被推得极其悲观。概率方法换了个提法:在满足独立性与随机化前提时,可以用极值理论给出带超越概率的时间界,把「绝不超过」改成「超过的概率不高于某个量级」。
这条理论的可反驳命题是:在满足独立性与随机化假设时,可用极值理论给出带超越概率的时间界。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“超过估计界的运行数/运行总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Cucu-Grosjean 等,2012年《RTSS会议录》,IEEE。具体设计与读数是:方法用极值统计外推如10^-9超越概率的执行时间分位;输出不是一个绝对最大值,而是“超过此值的概率不高于多少”。MBPTA在2013年前后形成系统方法;随机缓存研究显示可得到可用概率界,但若采样或随机化假设不成立,置信度会失真。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“能量采集输入是否满足长期平稳假设”。对照证据见Wandeler 与 Thiele,2006年《RTSS会议录》,IEEE:组件以到达曲线和服务曲线声明需求与供给,组合时只核对接口;内部实现可以变化,只要仍满足同一时序契约。它显示运行时壳只能约束预先枚举的危险状态;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:写明所依赖的独立性与随机化前提如何被硬件与运行环境满足,并报告实测中超过估计界的运行比例。这类界的有效性完全建立在前提上,前提不成立时给出的数字比悲观的确定界更危险。同时应说明采样规模——极值估计的置信度直接由尾部样本数决定。
与本块第二条《时间可预测处理》在方法论上相反:一个通过设计让上界可证,一个接受不可证而改用统计描述。两条服务于不同的证据体制,且不可互换——把概率界提交给要求确定性证据的认证,或用确定性思维去读概率界,都会得出错误的安全结论。这正是本领域内最需要讲清楚的一处分岔。
戊、可组合资源预留:组件应携带时序接口
把多个组件集成到同一平台时的通行做法是集成后整体重测:各部分单独验证过,合起来再跑一轮。这个前提让每一次集成都要付出完整的验证代价,也让任何一处改动都可能作废全部结论。这条转向要求组件自带时序接口——用预算、周期与供应界描述自己的资源需求与保证,使得局部验证的结果在组合之后仍然有效,集成从重测变成接口相容性检查。
这条理论的可反驳命题是:组件可用预算、周期和供应界描述资源需求,使局部验证结果在组合后仍可复用。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“保留预算内任务数/任务总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Wandeler 与 Thiele,2006年《RTSS会议录》,IEEE。具体设计与读数是:组件以到达曲线和服务曲线声明需求与供给,组合时只核对接口;内部实现可以变化,只要仍满足同一时序契约。2006—2016年的compositional scheduling与resource interface工作给出层级分析;抽象过紧浪费资源,过松则失去保证。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“虚拟化隔离是否包含中断和I/O路径”。对照证据见Davare 等,2007年《DAC会议录》,ACM/IEEE:分析把传感、任务、总线和执行器串成因果链,并计入采样与数据年龄;每个局部任务都按时仍可能让端到端反应跨越多个周期。它显示能量中性在季节和器件老化下可能失效;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:交付组件时一并交出时序接口,并报告在保留预算内完成的任务比例。没有接口的组件无法参与可组合的分析,只能退回整体重测。同时应说明接口的保守程度——接口越保守越容易组合,但平台利用率越低,这个取舍应当由集成方看得见地决定,而不是由组件方悄悄定死。
与本块第十八条《虚拟化时序隔离》是同一目标的两种实现:一个靠分析上的接口契约,一个靠运行时的资源分区。两者可以互补,也可能重复收费——分区已经保证隔离时,再叠加保守的接口预算会让资源被两次预留。集成方若不清楚保证由哪一层提供,最常见的结果是平台利用率低得难以解释。
己、端到端时序链:局部截止期不等于功能及时
实时系统的验证长期以任务为单位:每个任务在自己的截止期内完成,系统就算及时。这个前提忽略了功能是由一串任务、总线传输与采样构成的因果链,链上每一环都按时,端到端的响应仍可能因为相位不对而多等一整个周期。这条转向把分析对象从单个任务改成端到端的因果链,抖动与采样相位第一次成为一等公民。
这条理论的可反驳命题是:系统应分析跨任务、总线与网络的因果链延迟、抖动和采样相位。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“端到端链最坏时延/链路截止期”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Davare 等,2007年《DAC会议录》,ACM/IEEE。具体设计与读数是:分析把传感、任务、总线和执行器串成因果链,并计入采样与数据年龄;每个局部任务都按时仍可能让端到端反应跨越多个周期。AUTOSAR与工业控制案例在2010年代推动端到端时序分析;局部利用率正常时,链路仍可能因排队与相位错配超期。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“最坏执行时间是否随微体系结构变化”。对照证据见IEEE,2015年《IEEE 802.1Qbv Time-Aware Shaper》:时间感知整形器为八个以太网流量队列配置门控表,在预定时间窗放行关键帧;最坏时延由门表和同步误差共同给出。它显示平均端侧基准不代表最坏响应时间;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告时序结论时给出端到端链的最坏时延与链路截止期之比,而不是各任务的截止期满足情况。前者才是功能安全关心的量。同时应说明链上各环节的激活关系是时间触发还是事件触发——这决定了相位是否可控,也决定了最坏情况出现在什么条件下。
与本块第七条《时间敏感网络》是同一条链的计算侧与通信侧:链上的时延既来自任务调度,也来自网络传输。两侧分别达标而端到端仍超时,是分布式实时系统最常见的失败形态,原因通常是两侧各自按局部截止期设计,没人对整条链负责。
庚、时间敏感网络:以太网可以提供有界时延
以太网长期被排除在实时通信之外:它便宜、通用、带宽大,但冲突与排队让时延无界,安全关键系统只好使用专用总线。这个前提把成本与可分析性对立起来。这条转向通过时间同步、流量整形、带宽预留与门控调度,把共享以太网改造成时延有界、可被分析的实时通信层,专用总线与通用网络之间的分界因此被重画。
这条理论的可反驳命题是:时间同步、流量整形、预留与门控调度可把共享以太网变成可分析的实时通信层。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“按时到达关键帧数/关键帧总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自IEEE,2015年《IEEE 802.1Qbv Time-Aware Shaper》。具体设计与读数是:时间感知整形器为八个以太网流量队列配置门控表,在预定时间窗放行关键帧;最坏时延由门表和同步误差共同给出。AVB到IEEE TSN标准在2009—2016年逐步形成;测试显示关键流可获有界延迟,但配置复杂度和跨厂商一致性是边界。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“共享GPU与内存是否可给出确定上界”。对照证据见Burns与Davis,2018年《ACM Computing Surveys》50(6):Article 82:综述清点自2007年至2016年底的单核、多核、资源共享和系统实现证据;它显示只在超支时整批丢弃低关键任务,是理论可证却工程代价过高的简化。它显示在线更新可快速修错却破坏认证基线;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告关键帧的按时到达比例与配置参数——门控时刻表、同步精度与预留带宽,缺一项结论都不可复现。同时应说明与非关键流量共存时的表现,因为这类网络的价值恰恰在于混合流量,而实验室里的纯净负载测不出真实的整形效果。
与本块第六条《端到端时序链》是通信侧与整体的关系,与第十四条《内存带宽预算》则共享同一种思路:把一种共享资源从「先到先得」改成「按契约分配」。这条思路在网络上已成标准,在内存与加速器上仍在推进——三条一起读,可以看出实时性的一般做法就是把每一种共享资源逐个纳入调度。
辛、间歇计算:断电应成为正常控制流
嵌入式程序的默认执行模型是电源持续供应:程序从头跑到尾,断电属于异常,靠电池与看门狗兜底。当设备改用环境能量采集供电时,这个前提失效——掉电频繁发生且不可预测,程序可能在任意位置中断,重启后重复执行已完成的部分,非易失存储上的状态因此可能被写坏。这条转向把断电从异常改写为正常控制流的一部分。
这条理论的可反驳命题是:程序必须显式处理频繁掉电、非易失状态与重复执行,保证跨电源周期的原子性。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“有效前向进展时间/断电恢复总时间”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Ransford、Sorber 与 Fu,2011年《ASPLOS会议录》,ACM。具体设计与读数是:Mementos在16位MSP430类设备上根据电压插入检查点,使掉电后从最近状态继续;断电次数和每次保存成本成为常规执行读数。Mementos于2011年依据电压自动插入检查点;实验验证可在间歇供电下完成任务,但检查点时机和能耗开销不稳定。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“学习模型更新后原安全论证是否仍成立”。对照证据见Maeng 与 Lucia,2017年《Proceedings of the ACM on Programming Languages》1(OOPSLA):Alpaca把程序分成幂等任务并用双缓冲提交共享状态,在七类间歇应用上避免全局检查点;一致性由任务边界而非电源稳定性保证。它显示过度保守会浪费资源并诱发绕过认证;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告有效前向进展时间占总时间的比例,而不是只报吞吐或功耗。频繁掉电下真正稀缺的是「没有被重复执行浪费掉的那部分计算」。同时应说明非易失状态的一致性由什么机制保证,因为这类错误在偶发掉电下极难复现,事后也很难归因。
与本块第九条《任务化间歇编程》是问题与更细的对策,与第二十条《能量中性》则是执行模型与能量预算的两端:断电如何正确恢复,与长期能否持续运行,是两个独立的问题。一个程序可以做到每次断电都正确恢复,却因为收支为负而永远走不完一轮完整任务。
第二幕面对学习组件和间歇能量,把认证单位从静态代码扩到模型、数据、运行时壳与更新过程。 本幕十二条更关注部署、公开清算与方法自审,尤其要求把平均分数换成分布、边界、长期读数和责任链。
一、任务化间歇编程:一致性可以不依赖全局检查点
间歇执行最初的解法是全局检查点:定期把整个状态存进非易失存储,掉电后回到最近的点。这个前提把一致性问题当成快照问题,代价是每次保存都要复制大量状态,而采集到的能量恰恰极其有限。这条转向把程序拆成幂等任务,只在任务边界提交持久状态——一致性由任务的划分与提交语义保证,而不是靠频繁的全量快照。
这条理论的可反驳命题是:把程序拆成幂等任务,并只提交任务边界上的持久状态,可避免重复执行破坏一致性。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“有效计算焦耳/检查点总焦耳”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Maeng 与 Lucia,2017年《Proceedings of the ACM on Programming Languages》1(OOPSLA)。具体设计与读数是:Alpaca把程序分成幂等任务并用双缓冲提交共享状态,在七类间歇应用上避免全局检查点;一致性由任务边界而非电源稳定性保证。Alpaca于2017年提出面向间歇设备的任务模型,在多种应用上减少检查点开销;程序重构与任务粒度选择仍需开发者参与。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“能量采集输入是否满足长期平稳假设”。对照证据见Maeng与Lucia,2018年《OSDI会议录》:129–144,USENIX,页129–144:Chinchilla让未修改的C程序在能量采集设备上运行,并按能量变化动态放置检查点;判据从一次任务能否完成改为长期收支与前向进展能否同时保证。它显示运行时壳只能约束预先枚举的危险状态;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告有效计算焦耳与检查点总焦耳之比,让保存开销显式可见。这个比值是间歇系统真正的效率读数。同时应说明任务划分的粒度依据——粒度决定了重复执行的浪费与提交开销之间的平衡,而这个平衡随能量环境变化,不能一次定死。
与本块第八条《间歇计算》是同一问题上的推进关系,与第二十条《能量中性》构成完整的设计约束:任务粒度既要满足一致性,也要保证在两次掉电之间能真正完成至少一个任务。若能量窗口短于最小任务,系统会陷入永不前进的重复执行——这类活锁在功耗曲线上看起来完全正常。
二、TinyML协同设计:模型精度必须与内存、能量和时延同表比较
把机器学习模型放到微控制器上,早期的做法是先在服务器上训练出高精度模型,再想办法压缩塞进去。这个前提把精度当成模型的属性,把部署当成后续的工程问题。在几百KB内存、毫瓦级功耗的设备上,这条路走不通——真正决定可行性的是内存布局、算子支持、量化方式与传感采样,它们必须与模型一起设计。这条转向把精度、内存、能量与时延放进同一张表里比较。
这条理论的可反驳命题是:模型、算子、量化、传感采样和硬件内存布局要共同设计,单看分类准确率没有意义。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“满足质量阈值的推理数/每焦耳”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Banbury 等,2021年《MLPerf Tiny Benchmark》会议论文。具体设计与读数是:首版包含关键词唤醒、视觉唤醒、图像分类和异常检测四项任务,并同时报告整机延迟、能量与精度。2017年后TinyML生态与TensorFlow Lite Micro等展示KB级内存部署;许多模型在真实板卡上的延迟排序与参数量排序不同。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“虚拟化隔离是否包含中断和I/O路径”。对照证据见Lin 等,2020年《Advances in Neural Information Processing Systems》中的MCUNet工作:MCUNet在约1MB SRAM和2MB闪存的微控制器上运行ImageNet级网络;同样MAC数的模型因内存访问和算子实现不同可有完全不同延迟。它显示能量中性在季节和器件老化下可能失效;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告端侧成果时必须给出四项联合读数——达到质量阈值的推理数、每次推理的能耗、峰值内存与时延,缺任一项都无法判断这个模型能否上板。同时应说明测量所用的具体板卡与工具链版本,因为同一模型在不同板卡上的能耗可以相差数倍。
与本块第十一条《操作数幻觉》是主张与其最常见的反例:把乘加次数当成代价的代理,正是这张联合表要拆掉的东西。与第十九条《基准—现场裂缝》则一头一尾——协同设计给出实验室里的联合读数,现场裂缝提醒这份读数仍可能在整机环境下失真。
三、操作数幻觉:MAC数量不能代表端侧代价
端侧模型的代价长期用乘加次数来估:算子数少就是轻量,模型压缩的成绩也按这个数报。这个前提假设计算量与实际开销成正比。在微控制器上完全不是这样——内存访问、算子是否被运行时支持、并行度以及唤醒与传感的固定成本常常主导延迟与能耗,两个乘加次数相同的模型在同一块板上可以差出几倍。这条转向要求代价必须在目标板上实测,而不是在纸上换算。
这条理论的可反驳命题是:内存访问、算子支持、并行度和唤醒成本常主导实际延迟与能耗,必须在目标板测量。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“完整端侧任务延迟/单算子基准延迟”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Lin 等,2020年《Advances in Neural Information Processing Systems》中的MCUNet工作。具体设计与读数是:MCUNet在约1MB SRAM和2MB闪存的微控制器上运行ImageNet级网络;同样MAC数的模型因内存访问和算子实现不同可有完全不同延迟。2018年后多项移动与微控制器基准发现相同MAC量模型的运行时间可相差显著;未支持算子会触发慢路径。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“最坏执行时间是否随微体系结构变化”。对照证据见Phan 等,2019年《Runtime Assurance for Learning-Enabled Systems》:保障壳包含学习控制器、安全控制器和切换监视器三部分;只要预测状态将越出安全集,就在运行时把控制权交回已验证组件。它显示平均端侧基准不代表最坏响应时间;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告完整端侧任务的延迟,而不是单算子基准延迟,并给出两者之比。这个比值直接暴露了纸面估算与真实开销之间的落差。同时应说明未被计入的固定成本——传感器启动、时钟稳定、数据搬运,这些在论文里通常整个消失,在产品上却决定电池能撑多久。
与本块第十条《TinyML协同设计》是同一主张的具体化,与第十九条《基准—现场裂缝》则是同一失真在两个尺度上的表现:算子层估不准整机,实验室测不准现场。三条合起来给出一条可操作的纪律——**每换一层边界,都要重新测一次,不能靠外推**。
四、优雅降级:混合关键度不应只会丢任务
混合关键度的经典模型给出的处置是二元的:资源不够时,直接丢掉低关键任务以保住高关键任务。这个前提在理论上干净,在产品上很少可接受——被丢掉的往往是人机界面、日志或舒适性功能,用户体验会断崖式下跌。这条转向要求系统具备中间状态:降低频率、降低质量、降低采样率或降低服务等级,在保护关键任务的同时保留一部分非关键价值。
这条理论的可反驳命题是:系统可降低频率、质量、采样率或服务等级,在保护关键任务时保留部分非关键价值。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“降级后保留价值/标称价值”。
主证据来自Burns与Davis,2018年《ACM Computing Surveys》50(6):Article 82。具体设计与读数是:综述清点自2007年至2016年底的单核、多核、资源共享和系统实现证据;它显示只在超支时整批丢弃低关键任务,是理论可证却工程代价过高的简化。2016年后的弹性混合关键度研究引入服务等级和效用曲线;更细降级提高可用性,也使验证状态空间扩大。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“共享GPU与内存是否可给出确定上界”。对照证据见Saha、Xiang与Kim,2019年《RTCSA会议录》:1–6,页1–6:STGM把GPU流多处理器做空间分区、把任务占用做时间调度,在同一设备上允许受控并发;评价同时报告利用率和最坏响应时间,反驳“只要串行化就可预测、只要并发就高吞吐”的二选一。它显示在线更新可快速修错却破坏认证基线;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:给出降级后保留价值与标称价值之比,并说明价值如何量化。没有这个定义,「优雅」只是一个形容词。同时应报告降级的触发条件与恢复条件——只写降级不写恢复的系统,会在一次瞬时过载之后长期停在低服务等级上,这是现场最常见的抱怨来源。
与本块第一条《混合关键度》是模型与其工程修正,与第二十条《能量中性》则共享同一种做法:在硬约束下不是非全即无,而是把服务质量变成可调的连续量。两条一起看可以发现,实时系统近二十年的一个共同走向,就是把二值的「满足或违约」改造成可协商的等级。
五、共享加速器实时性:GPU吞吐不能替代响应上界
把GPU一类加速器引入实时系统时,最自然的期待是吞吐即性能:算得快,响应自然及时。这个前提忽略了实时系统要的不是平均速度而是响应上界,而加速器上恰恰存在大量不可抢占段、驱动队列、批处理与内存争用——一个短任务可能被一个已经在跑的长内核阻塞很久,这段阻塞在吞吐指标里完全看不见。这条转向要求把加速器当作需要分析最坏阻塞的共享资源。
这条理论的可反驳命题是:必须分析内核不可抢占段、内存争用、批处理和驱动队列的最坏阻塞。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“加速器最坏占用时间/任务截止期”。
主证据来自Saha、Xiang与Kim,2019年《RTCSA会议录》:1–6,页1–6。具体设计与读数是:STGM把GPU流多处理器做空间分区、把任务占用做时间调度,在同一设备上允许受控并发;评价同时报告利用率和最坏响应时间,反驳“只要串行化就可预测、只要并发就高吞吐”的二选一。2016年后实时GPU调度研究在自动驾驶与航空工作负载上测得明显尾延迟;硬件和驱动版本改变会使旧上界失效。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“学习模型更新后原安全论证是否仍成立”。对照证据见Yun、Yao、Pellizzoni、Caccamo与Sha,2016年《IEEE Transactions on Computers》65(2):562–576:该工作把每核DRAM请求限制写成周期性带宽预算,并把预算耗尽后的节流时间纳入可调度性分析;读数不再只有平均带宽,而是关键核的最坏停顿与非关键核的剩余吞吐。它显示过度保守会浪费资源并诱发绕过认证;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:给出加速器最坏占用时间与任务截止期之比,并说明驱动栈中哪些环节不可抢占、哪些队列深度不可控。厂商闭源驱动使这类分析常常无法完成,这一点应当如实写出,而不是用平均延迟代替上界。
与本块第三条《多核干扰》和第十四条《内存带宽预算》属于同一族问题:共享资源被引入实时路径。差别在于加速器的内部调度往往不透明,因此连建模所需的信息都拿不到——这使它成为本领域里最难给出可信上界的一类资源,也是学习组件上车时最先撞上的墙。
六、内存带宽预算:共享内存也应被调度
内存带宽长期被当作一种自然可用的公共资源:需要就访问,硬件自己仲裁。这个前提在单核低负载时无害,在多核实时平台上却让任何一个任务的时序都取决于邻居此刻在做什么。这条转向把内存带宽纳入调度对象——为任务分配可执行的带宽或缓存配额,干扰从不可控的背景噪声变成受控且可分析的资源。
这条理论的可反驳命题是:应为任务分配可执行的内存带宽或缓存配额,把干扰变成受控资源。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“实时任务带宽需求/可保证内存带宽”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Yun、Yao、Pellizzoni、Caccamo与Sha,2016年《IEEE Transactions on Computers》65(2):562–576。具体设计与读数是:该工作把每核DRAM请求限制写成周期性带宽预算,并把预算耗尽后的节流时间纳入可调度性分析;读数不再只有平均带宽,而是关键核的最坏停顿与非关键核的剩余吞吐。MemGuard等之后,2017年后多项带宽节流实验显著收紧响应时间分布;保守配额会浪费吞吐,突发需求也难描述。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“能量采集输入是否满足长期平稳假设”。对照证据见Martins 等,2020年《Bao: A Lightweight Static Partitioning Hypervisor》:Bao以约五千行核心代码静态分区CPU、内存和设备;整合多个来宾系统时可分别测启动干扰、中断延迟和缓存污染。它显示运行时壳只能约束预先枚举的危险状态;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告实时任务的带宽需求与平台可保证带宽之比,并说明配额如何强制执行。只做监控不做强制的方案在过载时会失效,而过载正是唯一要紧的场景。同时应说明配额粒度与调节周期,它们决定了这套机制能否跟上突发访问模式。
与本块第七条《时间敏感网络》是同一思路在两种资源上的落地:把先到先得改成按契约分配。与第三条《多核干扰》则是对策与问题。三条合起来构成本领域这二十年最有实操价值的一条经验——**凡是共享的,都要先能被计量,然后才能被保证**。
七、运行时保障壳:学习组件应被可验证边界包围
学习组件进入控制回路后,最初的思路是提高模型自身的可信度:更多数据、更好验证、更高准确率。这个前提要求为一个统计对象给出安全保证,而安全认证要的是在任何输入下都成立的性质,两者语言不通。这条转向绕开了这个僵局——不去证明学习组件本身安全,而是用经过验证的安全控制器、监视器与切换逻辑把它包围起来,让它只能在安全集合内起作用。
这条理论的可反驳命题是:可用经验证的安全控制器、监视器和切换逻辑包围学习组件,让其只在安全集合内运行。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“保障壳介入次数/控制周期总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Phan 等,2019年《Runtime Assurance for Learning-Enabled Systems》。具体设计与读数是:保障壳包含学习控制器、安全控制器和切换监视器三部分;只要预测状态将越出安全集,就在运行时把控制权交回已验证组件。2016年后Simplex式runtime assurance重新用于学习使能系统;实验能阻止部分越界,但监视器模型遗漏仍是单点风险。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“虚拟化隔离是否包含中断和I/O路径”。对照证据见ISO,2024年《ISO/PAS 8800:2024》:标准把训练数据、标签、分布偏移和模型更新纳入安全生命周期;模型文件不再只是普通二进制附件,而是带证据链的配置项。它显示能量中性在季节和器件老化下可能失效;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告保障壳的介入次数与控制周期总数之比,并说明切换判据与切换本身的时序开销。介入率过高说明学习组件在这套约束下没有实际贡献,过低则可能说明监视器根本没在工作。同时应说明退化控制器的性能,因为系统的真实下界由它决定,而不是由学习组件的平均表现决定。
与本块第十六条《数据进入安全论证》是两条并行的路线:一条把学习组件关在可验证的边界内,一条把它的数据假设写进安全案例。前者不要求理解模型,后者要求交代模型从哪来。真实项目往往同时需要——只有壳没有数据论证,无法回答适用域漂移;只有数据论证没有壳,则缺少运行时的最后防线。
八、数据进入安全论证:模型文件不是普通代码附件
安全论证的传统对象是代码与硬件:需求可追溯到设计、设计可追溯到实现与测试。学习组件进来之后,这条链在数据处断掉——模型文件被当作一个普通的配置附件挂上去,而它的行为其实由训练数据、标注规则与采集分布决定。这条转向要求把适用域、数据覆盖、标注质量与漂移检测写进安全案例,数据从工程材料升格为论证要素。
这条理论的可反驳命题是:学习组件的适用域、数据覆盖、标注与漂移检测必须进入安全案例。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“可追溯数据假设数/安全论证假设总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自ISO,2024年《ISO/PAS 8800:2024》。具体设计与读数是:标准把训练数据、标签、分布偏移和模型更新纳入安全生命周期;模型文件不再只是普通二进制附件,而是带证据链的配置项。2020年后自动驾驶与航空标准讨论把数据与模型变更纳入保证流程;如何证明训练分布覆盖运行环境仍未解决。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“最坏执行时间是否随微体系结构变化”。对照证据见EASA,2023年《Artificial Intelligence Roadmap 2.0》:航空软件按DO-178C分A到E五级保证;在线学习若改变行为,就可能使既有测试覆盖、配置基线和合规证据失效。它显示平均端侧基准不代表最坏响应时间;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:给出可追溯的数据假设数与安全论证假设总数之比,并说明每条假设在运行中如何被监测。写下适用域而不监测漂移,等于把一份在交付日成立的论证当成长期有效。同时应说明标注不确定性如何传递到系统级风险,这一段目前在多数项目里是空白。
与本块第十五条《运行时保障壳》互补,与第十七条《在线更新悖论》则连成一条时间线:数据假设写进论证之后,任何一次模型更新都成为对论证的改动,于是「多快能修好」与「多快能重新证明」之间的矛盾第一次变得具体。三条一起读,可以看出学习组件带给安全工程的真正难题不在算法,而在证据的生命周期。
九、在线更新悖论:修补更快会冲击既有认证
安全认证的传统节奏建立在系统相对静止的前提上:认证一次,长期使用,改动走漫长的变更流程。联网设备打破了这个前提——安全漏洞要求尽快修补,而每一次修补都可能改变时序与功能行为,从而触及已获得的认证。这条转向承认两种正当要求正面冲突,并把出路放在增量再认证上:让证据可复用、让变更影响可界定,而不是在快修与合规之间二选一。
这条理论的可反驳命题是:联网设备必须快速修补,同时对更新的时序、功能与安全影响进行增量再认证。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“变更后复用安全证据数/安全证据总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自EASA,2023年《Artificial Intelligence Roadmap 2.0》。具体设计与读数是:航空软件按DO-178C分A到E五级保证;在线学习若改变行为,就可能使既有测试覆盖、配置基线和合规证据失效。2019年后汽车OTA实践显示版本可频繁迭代,但供应链、回滚和证据复用决定是否能安全上线。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“共享GPU与内存是否可给出确定上界”。对照证据见MLCommons,2021—2024年《MLPerf Tiny》,页2021–2024:基准要求在整块开发板上计时与测能,不允许用孤立算子吞吐代替;同一网络在不同编译器和内存布局上的排名会改变。它显示在线更新可快速修错却破坏认证基线;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告一次变更后可复用的安全证据数与证据总数之比,这个比值决定了修补的真实成本。同时应说明影响分析的边界如何确定——判定「本次改动不影响某项证据」的依据必须可复查,否则增量再认证会退化成对流程的形式满足。
与本块第十六条《数据进入安全论证》构成同一困境的两半:数据假设越多,证据越容易被更新作废。与第二十条《补丁延迟》所在的软件安全侧也直接呼应——在安全关键设备上,补丁到达慢的原因往往不是运维懒惰,而是再认证这道正当程序本身要花时间。
十、虚拟化时序隔离:整合节省硬件不等于共享无代价
把多个功能整合到一块更强的芯片上,是嵌入式领域降本的通行做法。默认前提是虚拟化提供了足够的隔离:各虚拟机互不干扰,原有的验证结论可以照搬。这个前提在功能维度大致成立,在时序维度并不成立——虚拟机监控器的调度、I/O 路径与共享缓存都会让一个分区的行为影响另一个分区的最坏响应。这条转向要求隔离必须是可测量的时间隔离与故障封锁,而不只是地址空间的分离。
这条理论的可反驳命题是:虚拟机监控器、I/O与共享缓存必须提供可测的时间隔离和故障封锁。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“被隔离的干扰时间/总执行时间”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Martins 等,2020年《Bao: A Lightweight Static Partitioning Hypervisor》。具体设计与读数是:Bao以约五千行核心代码静态分区CPU、内存和设备;整合多个来宾系统时可分别测启动干扰、中断延迟和缓存污染。2016年后Jailhouse、Xen等安全关键虚拟化研究报告较低平均开销,却仍观察到共享I/O与内存造成的尾部干扰。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“学习模型更新后原安全论证是否仍成立”。对照证据见Vestal,2007年《RTSS会议录》,IEEE:模型为同一任务给出LO与HI两组最坏执行时间,并在模式切换后改变服务保证;两级证据不能再压成一个统一截止期。它显示过度保守会浪费资源并诱发绕过认证;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:给出被隔离的干扰时间占总执行时间的比例,并说明I/O与中断路径是否也在分区之内。多数事故发生在共享的I/O路径上,而这部分在架构图里常被画成一根无害的连线。同时应报告监控器自身的最坏执行开销,它是整个平台时序预算里最容易被漏算的一项。
与本块第五条《可组合资源预留》是运行时与分析上的两种保证方式,与第三条《多核干扰》共享同一个物理根源。三条一起给出一条判断规则——**整合带来的成本节省,必须减去为恢复隔离而付出的资源预留**,否则账面上的节省会在认证阶段被全部退回。
十一、基准—现场裂缝:端侧模型需要整机而非算子排名
端侧模型的比较长期依赖算子级或模型级基准:在标准数据集上跑准确率,在标准算子上测延迟。这个前提假定这些数字可以外推到产品。现场经验反复否定了它——前处理、内存峰值、冷启动、持续运行下的热与降频、以及不同板卡的差异,都会让实验室排名在现场翻转。这条转向要求基准覆盖整机与整段运行,而不是最有利的那一小段。
这条理论的可反驳命题是:基准应包含前处理、内存峰值、启动、持续能耗与板卡差异。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“现场截止期违约率/实验室违约率”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。
主证据来自MLCommons,2021—2024年《MLPerf Tiny》,页2021–2024。具体设计与读数是:基准要求在整块开发板上计时与测能,不允许用孤立算子吞吐代替;同一网络在不同编译器和内存布局上的排名会改变。MLPerf Tiny自2021年给出多板卡端到端测量;结果显示同一模型在不同软件栈上的能效与延迟差异显著。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“能量采集输入是否满足长期平稳假设”。对照证据见MLCommons,2024年《MLPerf Tiny Benchmark Results and Rules》:规则要求在真实微控制器上报告准确率门槛、延迟和能量,而不是只比较MAC或单算子;同一模型的整机结果会随内存层级、预处理和运行时显著变化。它显示运行时壳只能约束预先枚举的危险状态;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告现场截止期违约率与实验室违约率的对照,并说明测试时长与热状态。短时测试测不出降频,冷启动的开销也不会出现在稳态数据里。同时应给出板卡与固件版本,因为同一模型在同代不同批次硬件上的表现差异,常常大于算法改进带来的差异。
与本块第十条《TinyML协同设计》和第十一条《操作数幻觉》构成从算子到整机再到现场的三级递进,与本块第十三条《共享加速器实时性》则共享同一种教训:**任何把一段测量外推到另一层边界的做法,都要先证明这条外推成立**。这在本领域已经反复失败过三次,分别发生在乘加数、整机与现场三处。
十二、能量中性:长期可运行取决于收支不为负
电池供电设备的设计目标是省电:功耗越低,续航越长。改用环境能量采集之后,问题的性质变了——不再是把一块固定的能量用得更久,而是要在采集与消耗之间保持长期收支不为负。这个变化把电源从一个约束条件变成了一个随环境波动的输入,调度必须能够根据可采集能量调整服务质量,而不是按固定负载运行到耗尽为止。
这条理论的可反驳命题是:调度应保证在时间窗口内消耗不超过可收集能量,并允许随环境调整服务质量。比较必须固定任务集合、关键度、硬件仲裁与输入到达模式,只改变调度预算、隔离、运行时保障或模型压缩,并以截止期违约、最坏时延、能耗和安全状态为共同结果;量纲写成“采集能量/任务消耗能量”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Maeng与Lucia,2018年《OSDI会议录》:129–144,USENIX,页129–144。具体设计与读数是:Chinchilla让未修改的C程序在能量采集设备上运行,并按能量变化动态放置检查点;判据从一次任务能否完成改为长期收支与前向进展能否同时保证。2016年后batteryless系统把energy-neutral operation写成运行不变量;真实光照、射频与温差的强非平稳性使预测误差成为核心风险。这笔证据把最坏执行时间、共享资源干扰、认证假设和能量收支从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“虚拟化隔离是否包含中断和I/O路径”。对照证据见Ransford、Sorber 与 Fu,2011年《ASPLOS会议录》,ACM:Mementos在16位MSP430类设备上根据电压插入检查点,使掉电后从最近状态继续;断电次数和每次保存成本成为常规执行读数。它显示能量中性在季节和器件老化下可能失效;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告采集能量与任务消耗能量之比,并给出所用的能量环境剖面。脱离环境剖面谈能量中性没有意义,因为同一套调度在阴天与晴天下的结论完全不同。同时应说明服务质量的可调范围与调节延迟——能量中性依赖及时降档,而降档太慢与不能降档在效果上相同。
与本块第八条《间歇计算》和第九条《任务化间歇编程》构成完整的三层:执行模型解决掉电后如何正确恢复,任务划分解决恢复的代价,能量中性解决长期能否持续。三者缺一都不成立——一个恢复完美、粒度合适的系统,若收支为负,最终仍会停在某个永远走不完的任务上。
◎ 二十年连起来看
第一幕把实时性从平均快改成可组合的最坏上界、关键度与端到端路径。 第二幕面对学习组件和间歇能量,把认证单位从静态代码扩到模型、数据、运行时壳与更新过程。 两幕不是工具换代,而是评价单位不断扩大:第一幕找出局部上界、误差、约束或行为机制,第二幕把它们放进真实系统、组织与生命周期。只有当旧默认被写成可检查条件,新方法才构成转向。
被继承的是预算思想:时间、带宽、能量和风险都必须预先分配、在线监测,并在超支时有定义地降级。 这一判据在二十条里反复出现:条件、操作、读数与边界必须形成可复查链条。工具名可以变化,数据来源、分母、中止、未达阈值或无法归类的对象和复现路径却不能省;这也是碰撞行能够抽取并与别的领域通约的基础。
被推翻的是“吞吐高即可满足实时”和“软件更新只是维护动作”;仍未解决的是动态学习系统的可持续认证。 因而,本领域尚未解决的核心不是再提高一个百分点,而是如何让学习、更新、共享加速与安全认证在同一生命周期证据链中共存。若未来五年的工作仍只给均值和排行榜,不给真实部署、尾部和反例,它不会继续这条二十年主线。
◎ 三个常见误解
误解一:实时就是平均速度快。它容易被相信,是因为单次榜单只显示结果而隐藏任务集合、关键度、硬件仲裁与输入到达模式、中止、未达阈值或无法归类的对象与选择过程。正确表述是把收益限定在同一分母和同一边界内,再看是否跨环境保持。
误解二:TinyML算子排名等于整机可用。它容易被相信,是因为工具把一部分依赖封装起来,看上去像整个系统已经被封装。正确表述是任何抽象都只覆盖一段链条,外部数据、版本、组织和硬件仍需单独核验。
误解三:保障壳可以替代模型验证。它容易被相信,是因为成功案例适合传播,而运行时壳只能约束预先枚举的危险状态通常不进入摘要。正确表述是收益与边界、代价、反例必须同时报告,不能把局部改进外推成普遍保证。
◎ 与相邻领域的接口
与〈形式化方法与程序验证〉的接口在于:最坏上界和运行时保障需要可检查的模型与假设。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
与〈系统性能与能效〉的接口在于:端侧SLO、热约束与能量到任务同样要求带分母的性能读数。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
与〈多智能体系统〉的接口在于:多个自主设备协同后,局部时限会变成网络协议时限。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
与〈传感与物联网〉的接口在于:传感数据质量与网络连通性是本面板实时假设的外部输入。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
◎ 争议现场
未收敛的争论是:WCET应依赖静态分析还是测量概率界。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:用不少于三个独立平台或人群,预注册共同基线、预算和停止规则,并以截止期违约、最坏时延、能耗和安全状态的分层分布比较;若方向一致且边界可预测,争论才收敛。
未收敛的争论是:在线模型更新能否在不中断认证下进行。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:建立版本化公开基准,保存失败配置、调参轨迹和维护成本,以盲评方式复跑;若收益只在事后选择的路径上出现,应判为未收敛。
未收敛的争论是:混合关键度的优雅降级应由谁定义价值顺序。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:把局部结果接入真实工作流或制度现场,连续观测至少一个完整周期,并报告最差分位与反事实对照;只有端到端读数同向,才能排除成本转移。
◎ 往下五年看什么
观察点是共享资源条件下99.999分位与分析上界的间距。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
观察点是端侧完整任务的焦耳、峰值内存和截止期违约率。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
观察点是模型更新后保障壳触发频率与误触发率。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
观察点是能量采集设备跨季节的净能量收支和停机比例。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
◎ 可与哪些领域对撞
本块第1条《混合关键度:同一平台必须承认不同证据等级》与第360号第五条《规模尾延迟》可以对撞。它们共享的预设是:两边都默认少数极端延迟足以决定系统是否可用。相反点在于:混合关键度按任务价值保住硬期限,尾延迟按用户请求分布约束服务。若两边都成立,若两边都成立,第三项就是极端事件必须按损失而不是按出现频率加权。
本块第19条《基准—现场裂缝:端侧模型需要整机而非算子排名》与第065号第一幕己条《保护区面积目标被定下来》可以对撞。它们共享的预设是:两边都默认实验室或纸面覆盖能够替代现场效果。相反点在于:基准—现场裂缝要求真实设备和负载,保护区争论要求实际执法和生态结果。若两边都成立,若两边都成立,覆盖率之后必须增加现场有效率这个分母。
本块第12条《优雅降级:混合关键度不应只会丢任务》与第128号第一幕乙条《专长逆转效应》可以对撞。它们共享的预设是:两边都默认同一种支持或资源分配可用于全部状态。相反点在于:优雅降级按关键度保留不同功能,专长逆转说明新手有效的支持会妨碍熟手。若两边都成立,若两边都成立,第三项就是系统必须先识别状态再决定支持强度。
本块第15条《运行时保障壳:学习组件应被可验证边界包围》与第074号第一幕乙条《局部处理效应的含义被讲清》可以对撞。它们共享的预设是:两边都默认局部条件下成立的保证可以外推到全体。相反点在于:运行时保障壳只对已枚举危险状态有效,局部处理效应只对被工具影响的人有效。若两边都成立,若两边都成立,任何安全保证都要附上它覆盖的状态与对象集合。
◎ 十条可做的研究命题
可组合资源预留的因果识别命题:在控制共同预算后,组件可用预算、周期和供应界描述资源需求,使局部验证结果在组合后仍可复用;怎么做:在真实部署中随机或准随机改变调度预算、隔离、运行时保障或模型压缩,固定任务集合、关键度、硬件仲裁与输入到达模式,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或最坏执行时间是否随微体系结构变化不再预测失败,则命题被证伪。
时间敏感网络的测量命题:在控制共同预算后,时间同步、流量整形、预留与门控调度可把共享以太网变成可分析的实时通信层;怎么做:建立跨三种环境的统一日志,直接测量“按时到达关键帧数/关键帧总数”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或共享GPU与内存是否可给出确定上界不再预测失败,则命题被证伪。
任务化间歇编程的复现重估命题:在控制共同预算后,把程序拆成幂等任务,并只提交任务边界上的持久状态,可避免重复执行破坏一致;怎么做:用新版本、强基线和独立团队重做第5条的关键设计,保存全部失败路径;什么算证伪:若效应低于测量误差、跨环境方向不一致,或学习模型更新后原安全论证是否仍成立不再预测失败,则命题被证伪。
操作数幻觉的跨领域命题:在控制共同预算后,内存访问、算子支持、并行度和唤醒成本常主导实际延迟与能耗,必须在目标板测量;怎么做:把相邻领域的审计、因果或能量账本移入本领域,以共同分母连接截止期违约、最坏时延、能耗和安全状态;什么算证伪:若效应低于测量误差、跨环境方向不一致,或能量采集输入是否满足长期平稳假设不再预测失败,则命题被证伪。
共享加速器实时性的因果识别命题:在控制共同预算后,必须分析内核不可抢占段、内存争用、批处理和驱动队列的最坏阻塞;怎么做:在真实部署中随机或准随机改变调度预算、隔离、运行时保障或模型压缩,固定任务集合、关键度、硬件仲裁与输入到达模式,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或虚拟化隔离是否包含中断和I/O路径不再预测失败,则命题被证伪。
运行时保障壳的测量命题:在控制共同预算后,可用经验证的安全控制器、监视器和切换逻辑包围学习组件,让其只在安全集合内;怎么做:建立跨三种环境的统一日志,直接测量“保障壳介入次数/控制周期总数”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或最坏执行时间是否随微体系结构变化不再预测失败,则命题被证伪。
在线更新悖论的复现重估命题:在控制共同预算后,联网设备必须快速修补,同时对更新的时序、功能与安全影响进行增量再认证;怎么做:用新版本、强基线和独立团队重做第13条的关键设计,保存全部失败路径;什么算证伪:若效应低于测量误差、跨环境方向不一致,或共享GPU与内存是否可给出确定上界不再预测失败,则命题被证伪。
基准—现场裂缝的跨领域命题:在控制共同预算后,基准应包含前处理、内存峰值、启动、持续能耗与板卡差异;怎么做:把相邻领域的审计、因果或能量账本移入本领域,以共同分母连接截止期违约、最坏时延、能耗和安全状态;什么算证伪:若效应低于测量误差、跨环境方向不一致,或学习模型更新后原安全论证是否仍成立不再预测失败,则命题被证伪。
混合关键度的因果识别命题:在控制共同预算后,安全关键任务需要保守预算,普通任务可用较乐观预算;怎么做:在真实部署中随机或准随机改变调度预算、隔离、运行时保障或模型压缩,固定任务集合、关键度、硬件仲裁与输入到达模式,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或能量采集输入是否满足长期平稳假设不再预测失败,则命题被证伪。
多核干扰的测量命题:在控制共同预算后,共享缓存、内存控制器和总线会产生跨核阻塞,WCET必须包含争用上界;怎么做:建立跨三种环境的统一日志,直接测量“共享干扰下WCET/独占WCET”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或虚拟化隔离是否包含中断和I/O路径不再预测失败,则命题被证伪。
◎ 资料核验
- Vestal, S. (2007). Preemptive scheduling of multi-criticality systems with varying degrees of execution time assurance. Proceedings of RTSS 2007. IEEE.
- Edwards, S. A., & Lee, E. A. (2007). The case for the precision timed architecture. Proceedings of DAC 2007. ACM/IEEE.
- Pellizzoni, R., et al. (2010). Worst case delay analysis for memory interference in multicore systems. Proceedings of RTSS 2010. IEEE.
- Cucu-Grosjean, L., et al. (2012). Measurement-based probabilistic timing analysis for multi-path programs. Proceedings of RTSS 2012. IEEE.
- Wandeler, E., & Thiele, L. (2006). Real-time interfaces for interface-based design of real-time systems with fixed priority scheduling. Proceedings of RTSS 2006. IEEE.
- Davare, A., et al. (2007). Period optimization for hard real-time distributed automotive systems. Proceedings of DAC 2007. ACM/IEEE.
- IEEE. (2015). IEEE 802.1Qbv: Enhancements for scheduled traffic.
- Ransford, B., Sorber, J., & Fu, K. (2011). Mementos: System support for long-running computation on RFID-scale devices. Proceedings of ASPLOS 2011. ACM.
- Maeng, K., & Lucia, B. (2017). Alpaca: Intermittent execution without checkpoints. Proceedings of the ACM on Programming Languages, 1(OOPSLA).
- Banbury, C., et al. (2021). MLPerf Tiny benchmark. Proceedings of the NeurIPS Datasets and Benchmarks Track.
- Lin, J., et al. (2020). MCUNet: Tiny deep learning on IoT devices. Advances in Neural Information Processing Systems, 33.
- Burns, A., & Davis, R. I. (2018). A survey of research into mixed criticality systems. ACM Computing Surveys, 50(6), Article 82, 1–37. https://doi.org/10.1145/3131347.
- Saha, S. K., Xiang, Y., & Kim, H. (2019). STGM: Spatio-temporal GPU management for real-time tasks. Proceedings of the 25th IEEE International Conference on Embedded and Real-Time Computing Systems and Applications, 1–6. https://doi.org/10.1109/RTCSA.2019.8864564.
- Yun, H., Yao, G., Pellizzoni, R., Caccamo, M., & Sha, L. (2016). Memory bandwidth management for efficient performance isolation in multi-core platforms. IEEE Transactions on Computers, 65(2), 562–576.
- Phan, D., et al. (2019). Runtime assurance for learning-enabled systems. Proceedings of the International Conference on Computer Safety, Reliability and Security.
- International Organization for Standardization. (2024). ISO/PAS 8800:2024, Road vehicles—Safety and artificial intelligence.
- European Union Aviation Safety Agency. (2023). Artificial Intelligence Roadmap 2.0: A human-centric approach to AI in aviation.
- Martins, J., et al. (2020). Bao: A lightweight static partitioning hypervisor for modern multi-core embedded systems. Proceedings of the Workshop on Next Generation Real-Time Embedded Systems.
- MLCommons. (2021–2024). MLPerf Tiny benchmark rules and results.
- Maeng, K., & Lucia, B. (2018). Adaptive dynamic checkpointing for safe efficient intermittent computing. Proceedings of OSDI 2018, 129–144. USENIX Association.
- MLCommons. (2024). MLPerf Tiny benchmark results and rules. MLCommons.