多智能体系统
多智能体系统近二十年的变化不应写成工具清单。真正被换掉的是评价标准:系统不再只凭单点分数、平均速度或“能运行”证明自己,而要说明在合作决策、分布式约束、多主体学习和语言型代理工作流中,非平稳性、信用分配、通信语义和伙伴适应怎样进入结果。上一个十年主要把旧默认拆成可测约束;这十年则经历真实部署与方法清算,要求同时报告团队回报、适应速度、协议稳定性和失败传播。下面二十条均按主证据年份归幕,每条给出源行、六段证据链和可抽取的碰撞行。
第一幕证明协调可由局部消息、可执行承诺、联盟成本和他者信念组成,而非必须由中央全知控制。 本幕八条共同把旧默认第一次放到可测上界、误差、资源或行为证据上,并试写出可与别的领域换算的分母。
甲、分布式约束优化:协调问题可以分解到因子图
多方协调最自然的解法是把信息集中起来:让一个中心节点掌握全部变量与约束,再解一个大优化问题。这个前提在通信受限、数据不可共享或规模过大时立刻失效。这条转向把协调问题写成因子图——变量、约束与效用分配给各个代理,靠消息传递逼近甚至达到全局解,于是「不把数据交出去」与「得到接近最优的分配」第一次可以同时成立。
这条理论的可反驳命题是:把局部变量、约束和效用分配给代理,可用消息传递在不暴露全部数据时逼近或达到全局解。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“满足约束的分配数/约束总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Farinelli、Rogers、Petcu 与 Jennings,2008年《AAMAS会议录》中的Max-Sum工作。具体设计与读数是:Max-Sum在变量—因子图上传递局部效用消息;图无环时可得到全局最优,有环时则用收敛和解质量报告边界。DPOP、Max-Sum等在2006—2010年形成成熟DCOP方法;网络分配与传感任务显示通信结构决定可扩展性。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Yeoh、Felner 与 Koenig,2010年《Artificial Intelligence》174(12–13):951–997:算法维护上下界并可用误差参数提前停止;代理不仅给出一个方案,还能报告该方案距全局最优最多差多少。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告满足约束的分配数与约束总数之比,并说明所用算法给出的是精确解还是近似解。二者的适用场景完全不同,混着报会让人误以为拿到了最优性保证。同时应报告消息数与收敛轮数,因为这条路线真正的代价在通信,而不在计算。
与本块第八条《共识与消息传递》共享同一种机制,目标却不同:一个要在分歧的效用之间找到分配,一个要让分散的状态收敛到同一个值。两者常被合称为「分布式算法」,但可失败的方式不一样——协调可能停在一个人人都不满意的局部解上,共识则可能收敛到一个错误的公共值。
乙、有界次优协调:代理需要知道离最优还有多远
分布式协调的早期评价是二元的:算出最优解算成功,算不出算失败。这个前提在真实系统里不实用——代理往往没有时间也没有通信预算跑到最优,而一个「不知道离最优多远」的可行解无法用于决策。这条转向要求算法给出随时间改善的质量保证:上下界、截断与局部搜索让最优性成为可以与通信预算交换的连续量。
这条理论的可反驳命题是:可用上下界、截断和局部搜索给出随时间改善的质量保证,使通信与最优性可交换。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“次优解团队回报/集中最优回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Yeoh、Felner 与 Koenig,2010年《Artificial Intelligence》174(12–13):951–997。具体设计与读数是:算法维护上下界并可用误差参数提前停止;代理不仅给出一个方案,还能报告该方案距全局最优最多差多少。ADOPT后续与bounded Max-Sum等在2006—2012年提供可证明界;紧界往往带来高消息或内存成本。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Fornara与Colombetti,2007年《Dagstuhl Seminar Proceedings》07122:1–16:规范被写成由事件触发的角色承诺,并为违反义务配置制裁;这把协议从自然语言约定改成可监控状态,使开放系统即使不能假定代理服从,也能判断何时违约。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告次优解回报与集中式最优回报之比,并给出该比值对应的通信量。只报「求得可行解」不说明距离,等于把最要紧的信息扣下了。同时应说明界是理论保证还是经验观察——两者在工程决策中的分量完全不同。
与本块第一条《分布式约束优化》是同一族方法上的补丁,与第十二条《基准生态》则一起指向一个更普遍的问题:如果不知道最优在哪,跨方法比较就只能比相对分数,而相对分数在换一个任务后经常翻转。有界次优的价值恰恰是给出了一个不随任务变化的参照点。
丙、可执行规范:协议与承诺应成为代理可检查状态
代理之间的协议长期写在文档里:接口约定、交互流程、责任划分,靠实现方自觉遵守。这个前提让违约只能事后追查,运行中无人知道协议是否仍被遵守。这条转向要求把承诺、权限、义务与违约条件写成有形式语义的对象,代理可以在运行时检查自己与他者的承诺状态,协议从文档变成系统里可观测的一等公民。
这条理论的可反驳命题是:承诺、权限、义务和违约条件应有形式语义,并能被代理在运行时监控。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“被监测承诺数/协议承诺总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Fornara与Colombetti,2007年《Dagstuhl Seminar Proceedings》07122:1–16。具体设计与读数是:规范被写成由事件触发的角色承诺,并为违反义务配置制裁;这把协议从自然语言约定改成可监控状态,使开放系统即使不能假定代理服从,也能判断何时违约。2006—2015年的电子制度、承诺协议与规范型多智能体研究展示可执行交互规则;规则冲突与开放环境身份仍难处理。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“通信符号能否跨任务组合与解释”。对照证据见Rahwan 与 Jennings,2007年《Artificial Intelligence》171:672–684:n个代理的联盟结构数按Bell数超指数增长;通信、计算和收益分配成本会让理论最高价值联盟无法稳定形成。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告被实际监测的承诺数与协议承诺总数之比。写下形式语义而不接监测,等于只是换了一种写文档的格式。同时应说明违约的处置路径——检测到违约之后系统做什么,是记录、重协商还是隔离,这一段缺失时监测只会产生无人处理的告警。
与本块第二十条《多代理失效放大》在当下正面相接:语言模型代理编排出的系统里,责任漂移与错误共识恰恰是因为没有可检查的承诺状态,出了问题无法定位是哪一环没有履约。本条提供的正是那套久已存在、却在新一波系统里被整体跳过的机制。
丁、联盟形成成本:最强组合未必能稳定存在
联盟形成的经典分析关注价值分配:哪个组合能产生最大价值,收益该怎么分。这个前提把组建联盟本身当作免费动作。真实的多方合作里,发现合适伙伴、协商条件、维持通信以及应对随时可能的退出,都要付出成本,而这些成本足以让理论上最强的组合根本无法稳定存在。这条转向要求联盟价值扣除这些成本之后再比较。
这条理论的可反驳命题是:联盟价值必须扣除发现、协商、通信与不稳定成本,个体激励会改变可实现结构。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“联盟净收益/协调通信成本”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Rahwan 与 Jennings,2007年《Artificial Intelligence》171:672–684。具体设计与读数是:n个代理的联盟结构数按Bell数超指数增长;通信、计算和收益分配成本会让理论最高价值联盟无法稳定形成。2008年前后联盟结构生成算法开始给出复杂度与近似界;实验显示通信图限制可让理论最优联盟不可达。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“自我博弈是否过拟合固定生态”。对照证据见Farinelli、Rogers、Petcu 与 Jennings,2008年《AAMAS会议录》中的Max-Sum工作:Max-Sum在变量—因子图上传递局部效用消息;图无环时可得到全局最优,有环时则用收敛和解质量报告边界。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:给出联盟净收益与协调通信成本的对照,而不是只报联盟价值。同时应说明稳定性判据——在什么条件下没有子集愿意脱离,因为一个净收益很高但不稳定的联盟在实际运行中会不断重组,重组成本又要重新计入。
与本块第十四条《群体多样性》构成一处张力:多样性提高鲁棒性,也提高协调成本,因为异质伙伴之间的约定发现更贵。两条一起看,可以得出一条对工程有用的判断——**团队规模与异质性的收益必须减去协调开销后才成立**,而这笔减项在多数多代理系统的报告里从不出现。
戊、微观规则—宏观涌现:自组织也需要可验证机制
群体自组织的研究长期停在演示层面:给出一组简单的局部规则,跑出好看的宏观队形,就算证明了机制有效。这个前提把「出现过」当成「可以依赖」。而涌现结果高度依赖拓扑、噪声、密度与反馈延迟,同一套规则换个参数就可能完全不成形。这条转向要求把宏观性质当作需要验证的对象,而不是当作展示材料。
这条理论的可反驳命题是:涌现结果取决于拓扑、噪声、密度和反馈,设计必须检验宏观性质而非只展示动画。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“目标宏观模式出现次数/仿真运行总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Brambilla、Ferrante、Birattari 与 Dorigo,2013年《Swarm Intelligence》7:1–41。具体设计与读数是:工程化综述把设计分成微观规则、宏观行为和验证三层;同一局部规则需在不同群体规模和噪声下测量涌现是否保持。2006—2016年群体机器人与自组织代理研究在聚集、编队和任务分配中反复观察相变与失稳;规模扩大常改变行为。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“增加代理是否增加验证与终止失败”。对照证据见Stone、Kaminka、Kraus 与 Rosenschein,2010年《AAAI会议录》:测试要求代理与训练时从未见过、也没有事先共同协议的队友合作;泛化单位从环境状态扩大到队友类型。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告目标宏观模式在多次运行中出现的比例,而不是展示一次成功的运行。这条要求听起来朴素,却直接把大量演示型结果排除在可用之外。同时应给出参数敏感区间——机制在哪一段参数内成立,比它在某一点上成立重要得多。
与本块第十七条《顺序社会困境》共享同一个洞察的两种表现:宏观结果不是个体规则的简单加总,而是规则与环境共同生成的。一个在稀疏环境中稳定合作的群体,换到资源紧张的环境里可能整体转向掠夺——这不是策略退化,而是同一策略在另一组环境动力下的正常表现。
己、临时组队:合作策略不能只认训练过的伙伴
多代理协作的默认设定是伙伴已知:队友的策略在训练时就在场,协调方式可以一起学出来。这个前提让学到的合作高度依赖具体伙伴——换一个从未共同训练过的队友,配合往往当场崩溃。这条转向把问题重新定义为临时组队:代理必须在没有任何预先协调的情况下推断陌生伙伴的类型与意图,并迅速找到可行的配合方式。
这条理论的可反驳命题是:ad hoc teamwork要求代理在没有预先协调的情况下推断陌生伙伴并迅速合作。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“未见队友合作回报/已见队友回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Stone、Kaminka、Kraus 与 Rosenschein,2010年《AAAI会议录》。具体设计与读数是:测试要求代理与训练时从未见过、也没有事先共同协议的队友合作;泛化单位从环境状态扩大到队友类型。Stone等于2010年前后明确提出该问题;机器人足球与协作任务表明自我对弈策略对新伙伴常显著退化。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Albrecht 与 Ramamoorthy,2013年《A game-theoretic model and best-response learning method for ad hoc coordination》:代理根据每轮动作更新对他者类型和策略的后验分布;对手不再是固定环境参数,而是随互动改变的信念变量。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告与未见过的队友合作时的回报,与和熟悉队友合作时的回报之比。这个比值才是协作能力的读数,而前者在多数论文里根本没有被测。同时应说明陌生队友如何取样——从同一算法族里换个种子,与换一个完全不同的策略族,难度差着数量级。
与本块第十四条《群体多样性》是问题与对策:训练伙伴池越多样,面对陌生伙伴时越不容易崩。与第十八条《合作人工智能》则是特例与一般——人类正是最典型的、无法被纳入训练的陌生伙伴,因此临时组队能力是与人协作的前提条件。
庚、对手模型是动态信念:他者策略不是环境常数
把其他代理当作环境的一部分,是单智能体方法进入多代理场景时最省事的做法:他人的行为被折算成环境的转移概率。这个前提要求他者的策略是固定的。而在所有各方都在学习的系统里,环境本身随时间改变,昨天有效的最优反应今天可能就是最差反应。这条转向要求代理维护对他者类型、目标与学习过程的信念,并根据新观察持续更新。
这条理论的可反驳命题是:代理应维护对他者类型、目标和学习过程的信念,并依据新行为更新。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“对手模型预测正确数/对手动作总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Albrecht 与 Ramamoorthy,2013年《A game-theoretic model and best-response learning method for ad hoc coordination》。具体设计与读数是:代理根据每轮动作更新对他者类型和策略的后验分布;对手不再是固定环境参数,而是随互动改变的信念变量。2010年代Bayesian Policy Reuse、I-POMDP近似与对手建模实验显示显式模型可加速适应;模型错设会造成负迁移。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Olfati-Saber、Fax与Murray,2007年《Proceedings of the IEEE》95(1):215–233:框架把一致性速度与通信图拉普拉斯谱联系起来;连通图上的局部加权平均可收敛,而断连、时延和切换拓扑会给出明确失效条件。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告对手模型的预测正确数与对手动作总数之比,而不是只报自身回报。回报可能来自环境的其他部分,只有预测准确率才直接说明模型是否起作用。同时应说明信念更新的时间尺度——更新太慢跟不上对方的学习,太快则会把噪声当成策略变化。
与本块第十五条《学习中的策略反应》是被动与主动的两步:先承认他者在变,再进一步把他者的学习过程纳入自己的决策。两者的分界很实在——建模他者是为了更好地反应,塑形他者则是把对方的学习轨迹当成可以影响的对象,后者带来的伦理与稳定性问题完全不同。
辛、共识与消息传递:局部交换可以生成全局协调
让分散的个体达成一致,直觉上需要一个中心:由某个节点收集所有信息再广播结论。这个前提在通信受限、节点会失效或规模很大时不成立。这条转向给出的结论相当反直觉——在图连通且权重选择恰当的条件下,每个主体只与邻居交换状态,全体也能收敛到同一个值。协调所需要的不是全局视野,而是足够的连通性与正确的更新规则。
这条理论的可反驳命题是:在连通图与适当权重条件下,主体只交换邻居状态也能收敛到共同值;图结构和延迟决定收敛边界。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“达成共识回合数/通信回合总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Olfati-Saber、Fax与Murray,2007年《Proceedings of the IEEE》95(1):215–233。具体设计与读数是:框架把一致性速度与通信图拉普拉斯谱联系起来;连通图上的局部加权平均可收敛,而断连、时延和切换拓扑会给出明确失效条件。Olfati-Saber、Fax与Murray于2007年把一致性、谱图与网络拓扑放进统一分析框架,局部消息能否形成全局协调由连通性和谱隙给出判据。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“通信符号能否跨任务组合与解释”。对照证据见Lazaridou、Peysakhovich 与 Baroni,2017年《ICLR会议录》及后续组合性检验:训练代理可在已见对象上形成高成功率符号,但换到未见属性组合时消息常失效;通信成功率与组合泛化必须分开。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告达成共识所需的回合数与通信总回合之比,并说明图的连通性假设。收敛速度对拓扑极其敏感,脱离图结构谈收敛没有意义。同时应说明节点失效与消息丢失下的行为——这些条件恰恰是采用分散方案的原因,却常常不在分析里。
与本块第一条《分布式约束优化》共享消息传递机制,与第二十条《多代理失效放大》则形成一处提醒:收敛到共识本身并不保证共识是对的。当输入被少数错误节点污染时,同一套机制会高效地让全体收敛到一个错误的公共值——高效协调与结论正确是两件事。
第二幕把学习非平稳性、信用分配、陌生伙伴和语言代理失败推到中心,基准高分不再足够。 本幕十二条更关注部署、公开清算与方法自审,尤其要求把平均分数换成分布、边界、长期读数和责任链。
一、集中训练、分散执行:训练信息与部署信息可以不同
多代理强化学习最初直接沿用单体设定:每个代理只看自己的局部观察,独立学习。这个前提导致训练极不稳定——从任一代理的视角看,环境因为他人也在学习而不断变化,回报信号无法归因。这条转向把训练与执行分开:训练时允许使用全局状态与他人动作来稳定学习,执行时再退回只依赖局部观察的策略,信息的可用性第一次按阶段区分。
这条理论的可反驳命题是:训练阶段可用全局状态和其他代理动作稳定学习,执行时再限制为局部策略。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“部署时可用信息量/训练时信息量”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Lowe 等,2017年《Advances in Neural Information Processing Systems》30。具体设计与读数是:MADDPG的评论器训练时看到所有代理动作,执行时每个策略只看局部观测;集中信息与部署信息被明确分开。MADDPG于2017年指出独立学习的非平稳性并采用集中critic;在混合合作—竞争任务上优于独立基线,但集中训练规模受联合空间限制。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“自我博弈是否过拟合固定生态”。对照证据见Foerster 等,2018年《AAAI会议录》中的COMA工作:COMA固定其他代理动作,边缘化当前代理的备选动作形成反事实基线;团队奖励由此能回答单个动作贡献。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:明确报告部署时可用信息量与训练时信息量的差距,并说明这一差距如何被处理。差距过大而未处理的方法,在仿真里表现很好,在部署中会因为缺少全局信息而失效。同时应说明训练时的全局信息在真实系统里是否真的可获得,否则这套设定在工程上不可复制。
与本块第十条《反事实归因》和第十一条《单调价值分解》构成同一条技术路线的三步:先解决训练稳定,再解决贡献归因,最后解决分散执行时如何取最优动作。三者互相依赖,缺一环整条路线就退回独立学习。而这条路线的共同前提——训练时能拿到全局状态——正是它与真实部署之间最大的一处落差。
二、反事实归因:团队奖励必须回答‘是谁造成的’
团队学习的常见做法是共享一个团队奖励:大家一起拿分,一起被罚。这个前提让每个代理都无法知道自己的动作是否有用——回报里混着所有人的贡献,梯度因此方差极大,代理容易学成随大流。这条转向要求回答「是谁造成的」:用保持他人动作不变的反事实基线,估计单个代理的相对贡献,把团队回报拆成可归因的部分。
这条理论的可反驳命题是:用保持他者动作不变的反事实基线,可估计单个代理相对贡献并降低梯度方差。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“关键行动边际贡献/团队总回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Foerster 等,2018年《AAAI会议录》中的COMA工作。具体设计与读数是:COMA固定其他代理动作,边缘化当前代理的备选动作形成反事实基线;团队奖励由此能回答单个动作贡献。COMA于2018年在星际争霸微操任务中使用集中critic和反事实优势;归因依赖价值估计准确性。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“增加代理是否增加验证与终止失败”。对照证据见Rashid 等,2018年《ICML会议录》,PMLR:QMIX用单调混合网络保证联合Q值对每个局部Q值非减,在八张StarCraft微操地图上让局部贪心与联合选择一致。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告关键行动的边际贡献与团队总回报的对照,而不是只报团队分数。没有归因的团队分数无法用于诊断,也无法解释训练为何停滞。同时应说明反事实基线的计算成本,因为它随代理数增长,往往是这类方法在大规模团队上的实际瓶颈。
与本块第十一条《单调价值分解》是同一问题的两条路径:一个从回报侧做反事实归因,一个从价值函数侧做结构性分解。前者更通用但更贵,后者更省但要求单调性这一强假设。两条的取舍点很清楚——当协作模式包含互相抵消或互补时,单调性不成立,只能回到归因。
三、单调价值分解:联合最优可由局部贪心实现
分散执行有一个硬要求:每个代理只能看自己的观察,还要选出对团队最好的动作。最省事的做法是让联合价值等于各自价值之和,但这样表达不了任何形式的协作——互补与互相抵消都被排除在外。这条转向找到了中间地带:只要联合价值对各代理的局部价值保持单调,分散地各取局部最优就等于联合最优,非线性协作因此可以在保住分散执行的前提下被表达。
这条理论的可反驳命题是:只要联合价值对各代理局部价值单调,就能保留分散argmax并表达非线性协作。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“可单调分解联合动作数/联合动作总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Rashid 等,2018年《ICML会议录》,PMLR。具体设计与读数是:QMIX用单调混合网络保证联合Q值对每个局部Q值非减,在八张StarCraft微操地图上让局部贪心与联合选择一致。QMIX于2018年在SMAC任务上超过多种值分解基线;单调约束无法表示需要牺牲局部价值的协作。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPS Datasets and Benchmarks》:作者把独立学习、集中式策略梯度和价值分解三类算法放到多种合作任务中统一比较,并开放EPyMARL及两个稀疏奖励环境;同一算法的相对排序会随任务和实现细节改变。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告可被单调分解的联合动作占联合动作总数的比例,并说明任务中是否存在需要牺牲个体价值的协作。单调性在这类任务上不成立,而这恰恰是最需要协作的场景。同时应说明所用网络结构对单调性的强制方式,因为强制方式不同,表达能力的损失也不同。
与本块第十条《反事实归因》是同一目标的两条路径,与第九条《集中训练、分散执行》则是同一条流水线上的下一环。三条一起给出的判断是——**分散执行的每一分便利,都要用表达能力上的某种限制来换**,差别只在于这个限制被明写出来,还是被藏在网络结构里。
四、基准生态:一个地图高分不代表一般协调能力
多代理算法的比较长期依赖少数几个任务:在几张地图或几个经典博弈上分出高下,排名被当作一般协调能力的证据。这个前提假定任务之间可以外推。系统性的重评显示排名在换任务后频繁翻转,而训练细节、超参预算与随机种子造成的波动,常常大于算法之间的差距。这条转向要求基准覆盖观测方式、规模、异质性、通信与泛化,并公开训练细节与统计波动。
这条理论的可反驳命题是:基准应覆盖观测、规模、异质性、通信与泛化,并公开训练细节和统计波动。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“算法跨任务排名一致数/基准任务总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPS Datasets and Benchmarks》。具体设计与读数是:作者把独立学习、集中式策略梯度和价值分解三类算法放到多种合作任务中统一比较,并开放EPyMARL及两个稀疏奖励环境;同一算法的相对排序会随任务和实现细节改变。SMAC于2019年推动标准化微操评估,随后结果显示许多方法对地图、随机种子和实现敏感;SMACv2等提高分布变化。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Bard 等,2020年《Artificial Intelligence》280:103216:Hanabi要求二到五名玩家在看不到自己手牌的条件下合作,提示次数受限;自我博弈强策略若不能读懂陌生伙伴,得分会骤降。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告算法在跨任务上排名一致的任务数,而不是在最有利任务上的分数。排名一致性直接说明结论能否外推。同时应公开随机种子数与置信区间——多代理训练的方差远大于单体,缺了这两项的对比几乎不构成证据。
与本块第二条《有界次优协调》共享同一个缺口:没有可信参照点时,比较只能相对进行。与第十四条《群体多样性》则是评价与被评价——若训练伙伴池与评测伙伴池同源,测出的是记忆而不是泛化,这一点在多代理基准里比单体更容易被忽略。
五、不完全信息合作:强自我博弈不等于会与陌生人合作
自我博弈的成功让一种推断流行起来:能把自己打赢的智能体,自然也擅长与他人合作。这个前提在信息完全、目标对立的博弈里勉强成立,在信息分散且沟通受限的合作任务里失效——自我博弈会收敛到一套只有自己人看得懂的隐秘约定,换成陌生伙伴时完全无法配合。这条转向要求把推断伙伴信念、意图与约定作为独立能力来测。
这条理论的可反驳命题是:当信息分散且沟通受限时,代理必须推断伙伴信念、意图与约定。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“隐信息下团队成功数/任务总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Bard 等,2020年《Artificial Intelligence》280:103216。具体设计与读数是:Hanabi要求二到五名玩家在看不到自己手牌的条件下合作,提示次数受限;自我博弈强策略若不能读懂陌生伙伴,得分会骤降。Hanabi Challenge于2019年把二至五人合作与不完全信息结合;高自我博弈分数的代理在人类或跨策略组队中常退化。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“通信符号能否跨任务组合与解释”。对照证据见Vinyals 等,2019年《Nature》575:350–354中的AlphaStar联赛训练:联赛同时维护主策略、利用者和专门对手,避免单一冠军被一种反制策略击穿;群体策略分布成为鲁棒性资产。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告在隐信息条件下与陌生伙伴的团队成功数,而不是自我博弈的分数。两者的相关性在这类任务里很弱,甚至可能为负。同时应说明约定是否被固定——若评测中双方可以事先沟通策略,测的就不是推断能力而是协议执行能力。
与本块第六条《临时组队》是同一困难的不同入口,与第十六条《涌现语言非组合性》则是同一失败的两种表现:自我博弈产生的隐秘约定,与涌现出的不可迁移符号,都是「只在训练伙伴之间有效的私有语言」。三条合起来指向一个判断——**协作能力的检验必须在训练分布之外进行,否则测到的是共同记忆而不是协作。**
六、群体多样性:一个最优策略会制造脆弱同质化
训练一个多代理系统的默认目标是找到最优策略:收敛到一个策略,全体照它执行。这个前提忽略了同质化的代价——所有代理用同一套策略时,系统在面对循环克制、环境变化或陌生伙伴时会整体脆断,因为没有任何一个成员持有不同的应对方式。这条转向把策略种群、联赛与对手池纳入训练目标,多样性从副产品变成需要主动维持的资源。
这条理论的可反驳命题是:策略种群、联赛与对手池能避免循环克制、提高鲁棒性并覆盖多种协作惯例。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“未见伙伴回报/训练伙伴回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Vinyals 等,2019年《Nature》575:350–354中的AlphaStar联赛训练。具体设计与读数是:联赛同时维护主策略、利用者和专门对手,避免单一冠军被一种反制策略击穿;群体策略分布成为鲁棒性资产。AlphaStar于2019年前后采用league training,后续population-based MARL显示多样性改善泛化;训练成本和评价排序更复杂。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“自我博弈是否过拟合固定生态”。对照证据见Foerster 等,2018年《AAMAS会议录》中的LOLA工作:LOLA在更新自己参数时显式计算该更新会如何改变对手下一步梯度;每个代理的优化问题因他者学习而非平稳。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告与未见过的伙伴合作时的回报和与训练伙伴合作时的回报之比。这个比值是多样性是否真的产生了鲁棒性的直接读数。同时应说明种群的维护成本——维持多样性要消耗大量算力,这笔账应当与鲁棒性收益一起报告。
与本块第四条《联盟形成成本》构成一处清晰的张力:多样性提高鲁棒性,也提高协调成本。与第六条《临时组队》则是对策与目标。三条合起来可以给出一条工程判断——**同质化是效率的产物,也是脆性的来源**,而在什么位置停下来,取决于系统会不会遇到训练分布之外的伙伴。
七、学习中的策略反应:优化自己的回报会改变别人怎么学
多方学习的标准假设是各自独立优化:我改进我的策略,你改进你的,互不干涉。这个前提忽略了一件事——我的策略同时是你的训练数据,我今天怎么选,会改变你明天学成什么样。这条转向把他者的学习过程纳入自己的决策:用元梯度或递归推理预期对方将如何更新,于是策略不只是对当前局面的反应,还具有塑形对方学习轨迹的作用。
这条理论的可反驳命题是:元梯度或递归推理可把对手下一步学习纳入当前决策,策略因此具有塑形作用。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“策略适应后回报/策略适应前回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Foerster 等,2018年《AAMAS会议录》中的LOLA工作。具体设计与读数是:LOLA在更新自己参数时显式计算该更新会如何改变对手下一步梯度;每个代理的优化问题因他者学习而非平稳。LOLA于2018年前后展示学习感知更新可改变社会困境结果;更深递归容易不稳定,也可能被策略性利用。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“增加代理是否增加验证与终止失败”。对照证据见Lowe 等,2017年《Advances in Neural Information Processing Systems》30:MADDPG的评论器训练时看到所有代理动作,执行时每个策略只看局部观测;集中信息与部署信息被明确分开。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告策略适应前后的回报对照,并说明所假设的对方学习算法。塑形效果完全依赖于这个假设,对方换一种更新规则,塑形可能变成自我损害。同时应说明双方都在塑形时的行为——这一情形下的稳定性缺乏保证,而它恰恰是真实多方系统的常态。
与本块第七条《对手模型是动态信念》是被动建模与主动塑形的两步,与第十七条《顺序社会困境》则一起触及一个更硬的问题:当每一方都能塑形他方时,合作可能被制造出来,也可能被系统性地摧毁。技术上可行的塑形能力,在多方系统里同时是一种可以被滥用的能力,这一点应当明写而不是留在脚注里。
八、涌现语言非组合性:能通信不等于形成可迁移语言
让代理在训练中自行发展通信协议之后,出现了一种乐观解读:它们发明了语言。这个前提把「通信提高了回报」等同于「形成了语言」。检验之后的结果要冷静得多——消息常常并未被真正监听、符号不具备组合性、换一个伙伴或换一个任务就完全失效。这条转向要求把可迁移性作为语言的判据,而不是把回报提升当作证据。
这条理论的可反驳命题是:应检验消息是否被监听、是否组合、能否跨伙伴与新任务泛化,而非只看回报。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“跨任务可复用符号数/涌现符号总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Lazaridou、Peysakhovich 与 Baroni,2017年《ICLR会议录》及后续组合性检验。具体设计与读数是:训练代理可在已见对象上形成高成功率符号,但换到未见属性组合时消息常失效;通信成功率与组合泛化必须分开。2019年后正向信号/监听指标、拓扑与群体规模实验发现协议常随随机种子分裂;成功交流可依赖不可解释的私有码。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Leibo 等,2017年《AAMAS会议录》:Cleanup和Harvest两个环境把资源再生、拥挤和长期回报放入连续互动;合作或背叛会改变后续状态,而非只结算一次矩阵收益。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告跨任务可复用的符号数与涌现符号总数之比,并做监听消融——把消息随机化之后回报是否下降。不做消融就无法排除消息其实没被使用这一最常见的情况。同时应说明符号的组合性检验方式,因为组合性正是「语言」这个词所承诺却常常并不存在的东西。
与本块第十三条《不完全信息合作》是同一族失败的两种表现,与第十九条《语言型代理编排》则形成一处有意思的对照:前者是代理自己长出的、不可迁移的私有符号,后者用的是人类语言这一现成的、高度可迁移的媒介。**通信问题的解决方式,从"让它们自己发明"变成了"直接用已有的"**,这一转变本身值得记入本领域的二十年。
九、顺序社会困境:合作与背叛会被环境动力放大
社会困境长期以矩阵博弈为研究对象:囚徒困境、公共品博弈,合作与背叛是两个抽象的动作。这个前提把环境抽空成一张收益表。而在连续环境里,资源再生速度、空间分布与历史积累都会改变激励结构——同一群代理在资源充裕时稳定合作,在资源紧张时转向掠夺,行为的变化不是策略退化,而是同一策略在另一组环境动力下的正常输出。这条转向把社会结果视为策略与环境共同生成的。
这条理论的可反驳命题是:在连续环境中,资源再生、空间和历史会改变激励,社会结果是策略与环境共同生成。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“合作行动数/社会困境总回合”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Leibo 等,2017年《AAMAS会议录》。具体设计与读数是:Cleanup和Harvest两个环境把资源再生、拥挤和长期回报放入连续互动;合作或背叛会改变后续状态,而非只结算一次矩阵收益。Leibo等2017年提出sequential social dilemmas,Melting Pot于2021年扩展多情境基准;算法在一个困境合作不代表跨情境稳健。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Brambilla、Ferrante、Birattari 与 Dorigo,2013年《Swarm Intelligence》7:1–41:工程化综述把设计分成微观规则、宏观行为和验证三层;同一局部规则需在不同群体规模和噪声下测量涌现是否保持。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告合作行动数与困境回合总数之比,并给出环境参数——再生率、密度、可见范围。脱离参数谈合作率没有意义,因为同一套策略在不同参数下的合作率可以从接近一到接近零。同时应说明观察窗口,因为许多环境里合作会在长期后崩溃,短窗口测不出来。
与本块第五条《微观规则—宏观涌现》是同一洞察在社会维度的表现,与第十五条《学习中的策略反应》则合成一处更深的判断:环境塑造激励,而各方的学习又在塑造彼此,因此「合作是否可能」不是一个可以脱离具体环境与学习动力回答的问题。把它当成策略优劣的问题,是这一族研究最常见的越界。
十、合作人工智能:团队质量包括与人和新代理的兼容性
人工智能研究长期以能力为中心:更强的规划、更准的预测、更高的分数。这个前提把协作当成能力足够之后自然出现的东西。合作人工智能提出的是另一件事——与他方(尤其是人)共事需要一组独立的能力:发现约定、表达意图、保持可预测、处理冲突,而这些既不会从单体能力里自动长出来,也不会被以胜负为目标的训练所奖励。
这条理论的可反驳命题是:目标应包含约定发现、意图表达、可预测性、冲突解决和跨伙伴协作。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“人类与代理共同收益/单方最优收益”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。
主证据来自Dafoe 等,2021年《Nature》593:33–36。具体设计与读数是:议程把与陌生代理、人与机构协作列为独立能力,并要求报告伙伴分布、通信限制和失败代价;团队总回报不再是唯一指标。2021年前后Cooperative AI议程与Hanabi人机实验把主观合作感和跨伙伴绩效纳入指标;高客观分数未必带来好团队体验。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“通信符号能否跨任务组合与解释”。对照证据见Wu 等,2023年《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》:框架把代理角色、工具调用和终止条件写成可编排对话;一条任务可产生多轮消息、代码执行和人工介入,控制平面由此显式化。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告人与代理共同取得的收益与单方最优收益的对照,而不是代理自身的分数。这个对照才是协作价值的读数。同时应报告可预测性——人类伙伴无法预期的高能力行为,在协作任务里经常是负资产,而这一项几乎从不被测量。
与本块第六条《临时组队》是一般与特例:人类是最典型的、无法纳入训练的陌生伙伴。与第二十条《多代理失效放大》则一头一尾——本条讲的是与人协作需要什么,那一条讲的是代理之间协作在规模上如何失败。两条共同说明,协作质量不随单体能力自动上升。
十一、语言型代理编排:对话可以成为可编程控制平面
把多个语言模型组织起来干活,最初的做法是写一段长提示,让一个模型扮演多个角色。这个前提让协作发生在模型内部,无法观察也无法约束。这条转向把协作外置成可编程的结构:角色、消息、工具权限与终止条件被显式定义,对话成为控制平面,多个代理之间的交互第一次可以像程序一样被编排、被检查、被复用。
这条理论的可反驳命题是:可用角色、消息、工具权限和终止条件编排多个语言模型代理,形成动态协作程序。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“成功终止工作流数/总代理工作流数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Wu 等,2023年《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》。具体设计与读数是:框架把代理角色、工具调用和终止条件写成可编排对话;一条任务可产生多轮消息、代码执行和人工介入,控制平面由此显式化。AutoGen于2023年公开多代理会话框架并展示代码与工具任务;自然语言控制提高灵活性,也扩大循环、权限和状态失配风险。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“自我博弈是否过拟合固定生态”。对照证据见Wu、Bansal、Zhang等,2024年《COLM 2024》:AutoGen把代理角色、消息、人工接管与工具调用编排为对话程序;这同时暴露了终止、权限和状态一致性必须由外部控制平面定义。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告成功终止的工作流数与总工作流数之比,并说明终止条件如何定义。没有明确终止条件的编排会在失败时持续消耗资源,而这类消耗在成功率指标里完全看不见。同时应报告每个工作流的调用次数与成本,因为这条路线的代价随代理数与轮数迅速上升。
与本块第三条《可执行规范》构成一处值得注意的错位:多代理协调早已有一套关于承诺、权限与违约的形式机制,而这一波语言代理编排基本上重新开始,用自然语言约定角色与职责。与第二十条《多代理失效放大》一起看,可以说这波系统眼下的许多失败,正是那套被跳过的机制原本要处理的问题。
十二、多代理失效放大:代理越多不保证结果越好
多代理系统的默认期待是加法:多一个代理多一份能力,分工越细结果越好。这个前提把协调当作零成本的粘合剂。实测结果相反——通信错误、责任漂移、重复验证与错误共识会随链路数累积,很多失败并非来自单个代理的能力不足,而是来自编排本身。这条转向要求以端到端可靠性评价规模,而不是以代理数或分工细度作为进步的证据。
这条理论的可反驳命题是:通信错误、责任漂移、重复验证与错误共识会随链路增加累积,规模必须用端到端可靠性评价。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“由编排引起失败数/失败总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。
主证据来自Cemri、Pan、Yang等,2025年《Why Do Multi-Agent LLM Systems Fail?》arXiv:2503.13657,DOI:10.48550/arXiv.2503.13657。具体设计与读数是:研究从7个框架收集1600余条标注轨迹,并以150条轨迹构建失效分类;14种失效归入系统设计、主体错位和任务验证三类,标注者一致性κ为0.88。2025年前后的多代理基准与1642条执行轨迹分析记录协调、验证和角色执行等故障;部分系统在代理数增加后性能反降。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。
争议集中在“增加代理是否增加验证与终止失败”。对照证据见Dafoe 等,2021年《Nature》593:33–36:议程把与陌生代理、人与机构协作列为独立能力,并要求报告伙伴分布、通信限制和失败代价;团队总回报不再是唯一指标。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。
它改变的最低交付责任是:报告由编排引起的失败数占失败总数的比例,并给出失败的分类。不做这个拆分,团队表现不佳会被一律归因为模型能力不够,从而引向错误的改进方向。同时应报告与单代理基线的对照——多代理方案必须证明自己优于一个配置良好的单代理,这一条基线在很多报告里缺席。
与本块第三条《可执行规范》和第八条《共识与消息传递》一起构成本块的收口:责任漂移对应的是承诺无法被检查,错误共识对应的是高效协调不保证结论正确。**这两条二十年前就已被研究清楚的机制,正是当下这波多代理系统失败的主要形态**——本条与它们的呼应,是这一整块二十年跨度最值得留意的一处。
◎ 二十年连起来看
第一幕证明协调可由局部消息、可执行承诺、联盟成本和他者信念组成,而非必须由中央全知控制。 第二幕把学习非平稳性、信用分配、陌生伙伴和语言代理失败推到中心,基准高分不再足够。 两幕不是工具换代,而是评价单位不断扩大:第一幕找出局部上界、误差、约束或行为机制,第二幕把它们放进真实系统、组织与生命周期。只有当旧默认被写成可检查条件,新方法才构成转向。
被继承的是协议可执行性:早期承诺与一致性算法,后来演化为价值分解、通信学习和代理编排中的状态接口。 这一判据在二十条里反复出现:条件、操作、读数与边界必须形成可复查链条。工具名可以变化,数据来源、分母、中止、未达阈值或无法归类的对象和复现路径却不能省;这也是碰撞行能够抽取并与别的领域通约的基础。
被推翻的是“单体能力越强,团队自然越强”;仍未解决的是团队失败时如何定位责任并安全终止。 因而,本领域尚未解决的核心不是再提高一个百分点,而是如何在陌生伙伴、开放任务和有限验证预算下形成可迁移且可追责的协作。若未来五年的工作仍只给均值和排行榜,不给真实部署、尾部和反例,它不会继续这条二十年主线。
◎ 三个常见误解
误解一:代理数量越多答案越好。它容易被相信,是因为单次榜单只显示结果而隐藏伙伴策略、信息结构、奖励分解与通信预算、中止、未达阈值或无法归类的对象与选择过程。正确表述是把收益限定在同一分母和同一边界内,再看是否跨环境保持。
误解二:共享奖励会自动产生合作。它容易被相信,是因为工具把一部分依赖封装起来,看上去像整个系统已经被封装。正确表述是任何抽象都只覆盖一段链条,外部数据、版本、组织和硬件仍需单独核验。
误解三:形成通信符号就形成了语言。它容易被相信,是因为成功案例适合传播,而涌现语言可能只是训练伙伴间的私码通常不进入摘要。正确表述是收益与边界、代价、反例必须同时报告,不能把局部改进外推成普遍保证。
◎ 与相邻领域的接口
与〈信息检索与推荐系统〉的接口在于:用户、创作者与排序器形成策略响应和反馈回路。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
与〈形式化方法与程序验证〉的接口在于:协议、角色、终止条件和权限必须能被状态机检查。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
与〈嵌入式与实时系统〉的接口在于:多自主体部署还受网络时限、传感误差和运行时保障约束。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
与〈博弈论〉的接口在于:均衡给出稳定性概念,本面板关注协议如何在有限计算中执行。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。
◎ 争议现场
未收敛的争论是:集中训练信息是否造成不可部署优势。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:用不少于三个独立平台或人群,预注册共同基线、预算和停止规则,并以团队回报、适应速度、协议稳定性和失败传播的分层分布比较;若方向一致且边界可预测,争论才收敛。
未收敛的争论是:人口多样性何时提高泛化而非仅增加噪声。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:建立版本化公开基准,保存失败配置、调参轨迹和维护成本,以盲评方式复跑;若收益只在事后选择的路径上出现,应判为未收敛。
未收敛的争论是:语言代理失败应归因于模型、协议还是验证器。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:把局部结果接入真实工作流或制度现场,连续观测至少一个完整周期,并报告最差分位与反事实对照;只有端到端读数同向,才能排除成本转移。
◎ 往下五年看什么
观察点是更换未见伙伴后的团队回报保留率。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
观察点是通信带宽减半时性能与协议可解释性的变化。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
观察点是失败轨迹中系统设计、代理错位与验证缺口占比。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
观察点是代理数从一到多时边际收益、成本和终止失败率。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。
◎ 可与哪些领域对撞
本块第15条《学习中的策略反应:优化自己的回报会改变别人怎么学》与第353号第十七条《算法混淆》可以对撞。它们共享的预设是:两边都默认主体策略可当作外生环境处理。相反点在于:对手学习意识把他者更新纳入自己的动作,算法混淆把推荐造成的偏好变化纳入评价。若两边都成立,若两边都成立,第三项就是系统需要联合反事实而非固定环境下的单体最优。
本块第4条《联盟形成成本:最强组合未必能稳定存在》与第155号第一幕甲条《价格结构而非价格水平》可以对撞。它们共享的预设是:两边都默认合作结构由多方成本与收益的分配决定。相反点在于:联盟形成计算哪些主体应组合,平台价格结构决定哪一边被补贴。若两边都成立,若两边都成立,第三项就是稳定合作取决于成本如何跨角色分摊。
本块第5条《微观规则—宏观涌现:自组织也需要可验证机制》与第065号第一幕戊条《入侵种与新组合群落》可以对撞。它们共享的预设是:两边都默认局部交互能生成没有中央设计的宏观结构。相反点在于:群体涌现从规则推宏观模式,新组合群落则显示历史迁移会产生无先例生态。若两边都成立,若两边都成立,第三项就是涌现结构必须在开放成员变化下重新定义稳定性。
本块第19条《语言型代理编排:对话可以成为可编程控制平面》与第086号第一幕甲条《参与式文化的乐观》可以对撞。它们共享的预设是:两边都默认增加发言者或代理数会提高集体产出。相反点在于:语言型代理编排会放大终止和验证失败,参与式文化也发现能发声不等于能被看见。若两边都成立,若两边都成立,第三项就是集体智慧需要分配注意、权限和终止责任的制度层。
◎ 十条可做的研究命题
对手模型是动态信念的因果识别命题:在控制共同预算后,代理应维护对他者类型、目标和学习过程的信念,并依据新行为更新;怎么做:在真实部署中随机或准随机改变协商协议、价值分解、人口多样性或编排拓扑,固定伙伴策略、信息结构、奖励分解与通信预算,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或训练伙伴改变后策略是否仍有效不再预测失败,则命题被证伪。
集中训练、分散执行的测量命题:在控制共同预算后,训练阶段可用全局状态和其他代理动作稳定学习,执行时再限制为局部策略;怎么做:建立跨三种环境的统一日志,直接测量“部署时可用信息量/训练时信息量”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或团队奖励是否掩盖个体无效动作不再预测失败,则命题被证伪。
单调价值分解的复现重估命题:在控制共同预算后,只要联合价值对各代理局部价值单调,就能保留分散argmax并表达非线性协作;怎么做:用新版本、强基线和独立团队重做第5条的关键设计,保存全部失败路径;什么算证伪:若效应低于测量误差、跨环境方向不一致,或通信符号能否跨任务组合与解释不再预测失败,则命题被证伪。
不完全信息合作的跨领域命题:在控制共同预算后,当信息分散且沟通受限时,代理必须推断伙伴信念、意图与约定;怎么做:把相邻领域的审计、因果或能量账本移入本领域,以共同分母连接团队回报、适应速度、协议稳定性和失败传播;什么算证伪:若效应低于测量误差、跨环境方向不一致,或自我博弈是否过拟合固定生态不再预测失败,则命题被证伪。
学习中的策略反应的因果识别命题:在控制共同预算后,元梯度或递归推理可把对手下一步学习纳入当前决策,策略因此具有塑形作用;怎么做:在真实部署中随机或准随机改变协商协议、价值分解、人口多样性或编排拓扑,固定伙伴策略、信息结构、奖励分解与通信预算,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或增加代理是否增加验证与终止失败不再预测失败,则命题被证伪。
顺序社会困境的测量命题:在控制共同预算后,在连续环境中,资源再生、空间和历史会改变激励,社会结果是策略与环境共同生成;怎么做:建立跨三种环境的统一日志,直接测量“合作行动数/社会困境总回合”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或训练伙伴改变后策略是否仍有效不再预测失败,则命题被证伪。
语言型代理编排的复现重估命题:在控制共同预算后,可用角色、消息、工具权限和终止条件编排多个语言模型代理,形成动态协作程序;怎么做:用新版本、强基线和独立团队重做第13条的关键设计,保存全部失败路径;什么算证伪:若效应低于测量误差、跨环境方向不一致,或团队奖励是否掩盖个体无效动作不再预测失败,则命题被证伪。
分布式约束优化的跨领域命题:在控制共同预算后,把局部变量、约束和效用分配给代理,可用消息传递在不暴露全部数据时逼近或达;怎么做:把相邻领域的审计、因果或能量账本移入本领域,以共同分母连接团队回报、适应速度、协议稳定性和失败传播;什么算证伪:若效应低于测量误差、跨环境方向不一致,或通信符号能否跨任务组合与解释不再预测失败,则命题被证伪。
可执行规范的因果识别命题:在控制共同预算后,承诺、权限、义务和违约条件应有形式语义,并能被代理在运行时监控;怎么做:在真实部署中随机或准随机改变协商协议、价值分解、人口多样性或编排拓扑,固定伙伴策略、信息结构、奖励分解与通信预算,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或自我博弈是否过拟合固定生态不再预测失败,则命题被证伪。
微观规则—宏观涌现的测量命题:在控制共同预算后,涌现结果取决于拓扑、噪声、密度和反馈,设计必须检验宏观性质而非只展示动画;怎么做:建立跨三种环境的统一日志,直接测量“目标宏观模式出现次数/仿真运行总数”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或增加代理是否增加验证与终止失败不再预测失败,则命题被证伪。
◎ 资料核验
- Farinelli, A., Rogers, A., Petcu, A., & Jennings, N. R. (2008). Decentralised coordination of low-power embedded devices using the Max-Sum algorithm. Proceedings of AAMAS 2008.
- Yeoh, W., Felner, A., & Koenig, S. (2010). BnB-ADOPT: An asynchronous branch-and-bound DCOP algorithm. Artificial Intelligence, 174(12–13), 951–997.
- Fornara, N., & Colombetti, M. (2007). Specifying and enforcing norms in artificial institutions. Dagstuhl Seminar Proceedings, 07122, 1–16. https://doi.org/10.4230/DagSemProc.07122.27.
- Rahwan, T., & Jennings, N. R. (2007). An algorithm for distributing coalitional value calculations among cooperating agents. Artificial Intelligence, 171, 672–684.
- Brambilla, M., Ferrante, E., Birattari, M., & Dorigo, M. (2013). Swarm robotics: A review from the swarm engineering perspective. Swarm Intelligence, 7, 1–41.
- Stone, P., Kaminka, G. A., Kraus, S., & Rosenschein, J. S. (2010). Ad hoc autonomous agent teams: Collaboration without pre-coordination. Proceedings of AAAI 2010.
- Albrecht, S. V., & Ramamoorthy, S. (2013). A game-theoretic model and best-response learning method for ad hoc coordination. Proceedings of AAMAS 2013.
- Olfati-Saber, R., Fax, J. A., & Murray, R. M. (2007). Consensus and cooperation in networked multi-agent systems. Proceedings of the IEEE, 95(1), 215–233.
- Lowe, R., et al. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments. Advances in Neural Information Processing Systems, 30.
- Foerster, J., et al. (2018). Counterfactual multi-agent policy gradients. Proceedings of AAAI 2018.
- Rashid, T., et al. (2018). QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning. Proceedings of ICML 2018. PMLR.
- Papoudakis, G., Christianos, F., Schäfer, L., & Albrecht, S. V. (2021). Benchmarking multi-agent deep reinforcement learning algorithms in cooperative tasks. Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks.
- Bard, N., et al. (2020). The Hanabi challenge: A new frontier for AI research. Artificial Intelligence, 280, 103216.
- Vinyals, O., et al. (2019). Grandmaster level in StarCraft II using multi-agent reinforcement learning. Nature, 575, 350–354.
- Foerster, J., et al. (2018). Learning with opponent-learning awareness. Proceedings of AAMAS 2018.
- Lazaridou, A., Peysakhovich, A., & Baroni, M. (2017). Multi-agent cooperation and the emergence of natural language. Proceedings of ICLR 2017.
- Leibo, J. Z., et al. (2017). Multi-agent reinforcement learning in sequential social dilemmas. Proceedings of AAMAS 2017.
- Dafoe, A., et al. (2021). Open problems in cooperative AI. Nature, 593, 33–36.
- Wu, Q., et al. (2023). AutoGen: Enabling next-gen LLM applications via multi-agent conversation. arXiv:2308.08155.
- Cemri, M., Pan, M. Z., Yang, S., Agrawal, L. A., Chopra, B., Tiwari, R., et al. (2025). Why do multi-agent LLM systems fail? arXiv:2503.13657. https://doi.org/10.48550/arXiv.2503.13657.
- Wu, Q., Bansal, G., Zhang, J., et al. (2024). AutoGen: Enabling next-gen LLM applications via multi-agent conversation. Proceedings of COLM 2024.