SDE Universes·新思想前沿计算机科学的其余主干
新思想前沿 · 计算机科学的其余主干

多智能体系统

近二十年 · 两幕 · 20 个新思想 · 约 31,351 字 · 王德生 亲撰 · 2026 年 8 月

多智能体系统近二十年的变化不应写成工具清单。真正被换掉的是评价标准:系统不再只凭单点分数、平均速度或“能运行”证明自己,而要说明在合作决策、分布式约束、多主体学习和语言型代理工作流中,非平稳性、信用分配、通信语义和伙伴适应怎样进入结果。上一个十年主要把旧默认拆成可测约束;这十年则经历真实部署与方法清算,要求同时报告团队回报、适应速度、协议稳定性和失败传播。下面二十条均按主证据年份归幕,每条给出源行、六段证据链和可抽取的碰撞行。

【第一幕】上一个十年 · 约 2006—2016

第一幕证明协调可由局部消息、可执行承诺、联盟成本和他者信念组成,而非必须由中央全知控制。 本幕八条共同把旧默认第一次放到可测上界、误差、资源或行为证据上,并试写出可与别的领域换算的分母。

甲、分布式约束优化:协调问题可以分解到因子图

提出Farinelli、Rogers、Petcu 与 Jennings,2008年《AAMAS会议录》中的Max-Sum工作 争议或最新Yeoh、Felner 与 Koenig,2010年《Artificial Intelligence》174(12–13):951–997 关键把局部变量、约束和效用分配给代理,可用消息传递在不暴露全部数据时逼近或达到全局解

多方协调最自然的解法是把信息集中起来:让一个中心节点掌握全部变量与约束,再解一个大优化问题。这个前提在通信受限、数据不可共享或规模过大时立刻失效。这条转向把协调问题写成因子图——变量、约束与效用分配给各个代理,靠消息传递逼近甚至达到全局解,于是「不把数据交出去」与「得到接近最优的分配」第一次可以同时成立。

这条理论的可反驳命题是:把局部变量、约束和效用分配给代理,可用消息传递在不暴露全部数据时逼近或达到全局解。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“满足约束的分配数/约束总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Farinelli、Rogers、Petcu 与 Jennings,2008年《AAMAS会议录》中的Max-Sum工作。具体设计与读数是:Max-Sum在变量—因子图上传递局部效用消息;图无环时可得到全局最优,有环时则用收敛和解质量报告边界。DPOP、Max-Sum等在2006—2010年形成成熟DCOP方法;网络分配与传感任务显示通信结构决定可扩展性。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Yeoh、Felner 与 Koenig,2010年《Artificial Intelligence》174(12–13):951–997:算法维护上下界并可用误差参数提前停止;代理不仅给出一个方案,还能报告该方案距全局最优最多差多少。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告满足约束的分配数与约束总数之比,并说明所用算法给出的是精确解还是近似解。二者的适用场景完全不同,混着报会让人误以为拿到了最优性保证。同时应报告消息数与收敛轮数,因为这条路线真正的代价在通信,而不在计算。

与本块第八条《共识与消息传递》共享同一种机制,目标却不同:一个要在分歧的效用之间找到分配,一个要让分散的状态收敛到同一个值。两者常被合称为「分布式算法」,但可失败的方式不一样——协调可能停在一个人人都不满意的局部解上,共识则可能收敛到一个错误的公共值。

位置E——把『分布式约束优化:协调问题可以分解到因子图』成立所需的边界环境作为首要显露 单因决定『分布式约束优化:协调问题可以分解到因子图』当前结论的最小充分项只有:把局部变量、约束和效用分配给代理,可用消息传递在不暴露全部数据时逼近或达到全局解 预设〔01 谁进入分母〕在固定伙伴策略、信息结构、奖励分解与通信预算后,分布式约束优化对应的差异可与其他机制分离 量纲满足约束的分配数/约束总数 失效失效边界是『独立数据或真实负载下效应消失,且训练伙伴改变后策略是否仍有效使方向反转时不成立』;越彻底的问题分解使局部计算越轻,但当约束之间高度耦合时,分解的彻底反而使消息传递在多个局部解之间震荡不收敛。自曝『分布式约束优化:协调问题可以分解到因子图』的原始材料只直接支持“主证据来自Farinelli、Rogers、Petcu与Jennings,2008年《AAMAS会议录》中的Max-Sum工作”,没有自动覆盖边界外对象 空栏『分布式约束优化:协调问题可以分解到因子图』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名组织研究称「分权决策与信息成本」,电力系统称「分区调度」;另见第248号第四条『图算法的连续化』

乙、有界次优协调:代理需要知道离最优还有多远

提出Yeoh、Felner 与 Koenig,2010年《Artificial Intelligence》174(12–13):951–997 争议或最新Fornara与Colombetti,2007年《Dagstuhl Seminar Proceedings》07122:1–16 关键可用上下界、截断和局部搜索给出随时间改善的质量保证,使通信与最优性可交换

分布式协调的早期评价是二元的:算出最优解算成功,算不出算失败。这个前提在真实系统里不实用——代理往往没有时间也没有通信预算跑到最优,而一个「不知道离最优多远」的可行解无法用于决策。这条转向要求算法给出随时间改善的质量保证:上下界、截断与局部搜索让最优性成为可以与通信预算交换的连续量。

这条理论的可反驳命题是:可用上下界、截断和局部搜索给出随时间改善的质量保证,使通信与最优性可交换。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“次优解团队回报/集中最优回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Yeoh、Felner 与 Koenig,2010年《Artificial Intelligence》174(12–13):951–997。具体设计与读数是:算法维护上下界并可用误差参数提前停止;代理不仅给出一个方案,还能报告该方案距全局最优最多差多少。ADOPT后续与bounded Max-Sum等在2006—2012年提供可证明界;紧界往往带来高消息或内存成本。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Fornara与Colombetti,2007年《Dagstuhl Seminar Proceedings》07122:1–16:规范被写成由事件触发的角色承诺,并为违反义务配置制裁;这把协议从自然语言约定改成可监控状态,使开放系统即使不能假定代理服从,也能判断何时违约。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告次优解回报与集中式最优回报之比,并给出该比值对应的通信量。只报「求得可行解」不说明距离,等于把最要紧的信息扣下了。同时应说明界是理论保证还是经验观察——两者在工程决策中的分量完全不同。

与本块第一条《分布式约束优化》是同一族方法上的补丁,与第十二条《基准生态》则一起指向一个更普遍的问题:如果不知道最优在哪,跨方法比较就只能比相对分数,而相对分数在换一个任务后经常翻转。有界次优的价值恰恰是给出了一个不随任务变化的参照点。

位置S——把『有界次优协调:代理需要知道离最优还有多远』形成的对象结构作为首要显露 单因决定『有界次优协调:代理需要知道离最优还有多远』当前结论的最小充分项只有:可用上下界、截断和局部搜索给出随时间改善的质量保证,使通信与最优性可交换 预设〔01 谁进入分母〕可用上下界、截断和局部搜索给出随时间改善的质量保证能够在同一预算与同一输入下被独立检验 量纲次优解团队回报/集中最优回报 失效失效边界是『更换强基线、平台或人群后排序不再保持,并且尾部代价超过收益时失效』;越紧的次优界使解的质量越可信,但当求界本身消耗的通信超过求解时,保证的收紧反而使整体协调效率下降。自曝『有界次优协调:代理需要知道离最优还有多远』的原始材料只直接支持“主证据来自Yeoh、Felner与Koenig,2010年《ArtificialIntelligence》174(12–13):951–997”,没有自动覆盖边界外对象 空栏『有界次优协调:代理需要知道离最优还有多远』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名运筹学称「对偶间隙」,工程估价称「概算精度与投入的权衡」;另见第248号第十六条『近似算法与硬度的对应』

丙、可执行规范:协议与承诺应成为代理可检查状态

提出Fornara与Colombetti,2007年《Dagstuhl Seminar Proceedings》07122:1–16 争议或最新Rahwan 与 Jennings,2007年《Artificial Intelligence》171:672–684 关键承诺、权限、义务和违约条件应有形式语义,并能被代理在运行时监控

代理之间的协议长期写在文档里:接口约定、交互流程、责任划分,靠实现方自觉遵守。这个前提让违约只能事后追查,运行中无人知道协议是否仍被遵守。这条转向要求把承诺、权限、义务与违约条件写成有形式语义的对象,代理可以在运行时检查自己与他者的承诺状态,协议从文档变成系统里可观测的一等公民。

这条理论的可反驳命题是:承诺、权限、义务和违约条件应有形式语义,并能被代理在运行时监控。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“被监测承诺数/协议承诺总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Fornara与Colombetti,2007年《Dagstuhl Seminar Proceedings》07122:1–16。具体设计与读数是:规范被写成由事件触发的角色承诺,并为违反义务配置制裁;这把协议从自然语言约定改成可监控状态,使开放系统即使不能假定代理服从,也能判断何时违约。2006—2015年的电子制度、承诺协议与规范型多智能体研究展示可执行交互规则;规则冲突与开放环境身份仍难处理。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“通信符号能否跨任务组合与解释”。对照证据见Rahwan 与 Jennings,2007年《Artificial Intelligence》171:672–684:n个代理的联盟结构数按Bell数超指数增长;通信、计算和收益分配成本会让理论最高价值联盟无法稳定形成。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告被实际监测的承诺数与协议承诺总数之比。写下形式语义而不接监测,等于只是换了一种写文档的格式。同时应说明违约的处置路径——检测到违约之后系统做什么,是记录、重协商还是隔离,这一段缺失时监测只会产生无人处理的告警。

与本块第二十条《多代理失效放大》在当下正面相接:语言模型代理编排出的系统里,责任漂移与错误共识恰恰是因为没有可检查的承诺状态,出了问题无法定位是哪一环没有履约。本条提供的正是那套久已存在、却在新一波系统里被整体跳过的机制。

位置D——把『可执行规范:协议与承诺应成为代理可检查状态』中的操作次序与变化路径作为首要显露 单因决定『可执行规范:协议与承诺应成为代理可检查状态』当前结论的最小充分项只有:承诺、权限、义务和违约条件应有形式语义,并能被代理在运行时监控 预设〔01 谁进入分母〕比较双方对“什么算一次有效结果”使用相同分母,可执行规范才可排序 量纲被监测承诺数/协议承诺总数 失效失效边界是『分母改为端到端结果后优势低于测量误差,或失败样本集中于关键场景时失效』;越形式化的承诺语义使违约越容易被检出,但当形式化要求高到实现方难以完整表达实际业务时,可检查性的提高反而把协议缩小为易于形式化的那一小部分。自曝『可执行规范:协议与承诺应成为代理可检查状态』的原始材料只直接支持“主证据来自Fornara与Colombetti,2007年《DagstuhlSeminarProceedings》07122:1–16”,没有自动覆盖边界外对象 空栏『可执行规范:协议与承诺应成为代理可检查状态』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名合同法称「可执行条款与君子协定之别」,会计称「或有负债的确认」;另见第253号第十九条『智能体的授权与撤销』

丁、联盟形成成本:最强组合未必能稳定存在

提出Rahwan 与 Jennings,2007年《Artificial Intelligence》171:672–684 争议或最新Farinelli、Rogers、Petcu 与 Jennings,2008年《AAMAS会议录》中的Max-Sum工作 关键联盟价值必须扣除发现、协商、通信与不稳定成本,个体激励会改变可实现结构

联盟形成的经典分析关注价值分配:哪个组合能产生最大价值,收益该怎么分。这个前提把组建联盟本身当作免费动作。真实的多方合作里,发现合适伙伴、协商条件、维持通信以及应对随时可能的退出,都要付出成本,而这些成本足以让理论上最强的组合根本无法稳定存在。这条转向要求联盟价值扣除这些成本之后再比较。

这条理论的可反驳命题是:联盟价值必须扣除发现、协商、通信与不稳定成本,个体激励会改变可实现结构。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“联盟净收益/协调通信成本”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Rahwan 与 Jennings,2007年《Artificial Intelligence》171:672–684。具体设计与读数是:n个代理的联盟结构数按Bell数超指数增长;通信、计算和收益分配成本会让理论最高价值联盟无法稳定形成。2008年前后联盟结构生成算法开始给出复杂度与近似界;实验显示通信图限制可让理论最优联盟不可达。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“自我博弈是否过拟合固定生态”。对照证据见Farinelli、Rogers、Petcu 与 Jennings,2008年《AAMAS会议录》中的Max-Sum工作:Max-Sum在变量—因子图上传递局部效用消息;图无环时可得到全局最优,有环时则用收敛和解质量报告边界。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:给出联盟净收益与协调通信成本的对照,而不是只报联盟价值。同时应说明稳定性判据——在什么条件下没有子集愿意脱离,因为一个净收益很高但不稳定的联盟在实际运行中会不断重组,重组成本又要重新计入。

与本块第十四条《群体多样性》构成一处张力:多样性提高鲁棒性,也提高协调成本,因为异质伙伴之间的约定发现更贵。两条一起看,可以得出一条对工程有用的判断——**团队规模与异质性的收益必须减去协调开销后才成立**,而这笔减项在多数多代理系统的报告里从不出现。

位置S——把『联盟形成成本:最强组合未必能稳定存在』形成的对象结构作为首要显露 单因决定『联盟形成成本:最强组合未必能稳定存在』当前结论的最小充分项只有:联盟价值必须扣除发现、协商、通信与不稳定成本,个体激励会改变可实现结构 预设〔02 单一读数代表复杂对象〕联盟形成成本造成的变化大于版本、样本选择和测量噪声造成的变化 量纲联盟净收益/协调通信成本 失效失效边界是『控制额外信息与调参预算后读数不优于基线,且跨站点复现率低于一半时失效』;越大的联盟规模使可实现的联合价值越高,但当发现与协商成本随成员数超线性增长时,规模的扩大反而使净收益转为下降。自曝『联盟形成成本:最强组合未必能稳定存在』的原始材料只直接支持“主证据来自Rahwan与Jennings,2007年《ArtificialIntelligence》171:672–684”,没有自动覆盖边界外对象 空栏『联盟形成成本:最强组合未必能稳定存在』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名经济学称「交易成本决定企业边界」,政治学称「联合政府的组阁成本」;另见第255号第三条『微服务及其回调』

戊、微观规则—宏观涌现:自组织也需要可验证机制

提出Brambilla、Ferrante、Birattari 与 Dorigo,2013年《Swarm Intelligence》7:1–41 争议或最新Stone、Kaminka、Kraus 与 Rosenschein,2010年《AAAI会议录》 关键涌现结果取决于拓扑、噪声、密度和反馈,设计必须检验宏观性质而非只展示动画

群体自组织的研究长期停在演示层面:给出一组简单的局部规则,跑出好看的宏观队形,就算证明了机制有效。这个前提把「出现过」当成「可以依赖」。而涌现结果高度依赖拓扑、噪声、密度与反馈延迟,同一套规则换个参数就可能完全不成形。这条转向要求把宏观性质当作需要验证的对象,而不是当作展示材料。

这条理论的可反驳命题是:涌现结果取决于拓扑、噪声、密度和反馈,设计必须检验宏观性质而非只展示动画。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“目标宏观模式出现次数/仿真运行总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Brambilla、Ferrante、Birattari 与 Dorigo,2013年《Swarm Intelligence》7:1–41。具体设计与读数是:工程化综述把设计分成微观规则、宏观行为和验证三层;同一局部规则需在不同群体规模和噪声下测量涌现是否保持。2006—2016年群体机器人与自组织代理研究在聚集、编队和任务分配中反复观察相变与失稳;规模扩大常改变行为。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“增加代理是否增加验证与终止失败”。对照证据见Stone、Kaminka、Kraus 与 Rosenschein,2010年《AAAI会议录》:测试要求代理与训练时从未见过、也没有事先共同协议的队友合作;泛化单位从环境状态扩大到队友类型。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告目标宏观模式在多次运行中出现的比例,而不是展示一次成功的运行。这条要求听起来朴素,却直接把大量演示型结果排除在可用之外。同时应给出参数敏感区间——机制在哪一段参数内成立,比它在某一点上成立重要得多。

与本块第十七条《顺序社会困境》共享同一个洞察的两种表现:宏观结果不是个体规则的简单加总,而是规则与环境共同生成的。一个在稀疏环境中稳定合作的群体,换到资源紧张的环境里可能整体转向掠夺——这不是策略退化,而是同一策略在另一组环境动力下的正常表现。

位置D——把『微观规则—宏观涌现:自组织也需要可验证机制』中的操作次序与变化路径作为首要显露 单因决定『微观规则—宏观涌现:自组织也需要可验证机制』当前结论的最小充分项只有:涌现结果取决于拓扑、噪声、密度和反馈,设计必须检验宏观性质而非只展示动画 预设〔02 单一读数代表复杂对象〕在固定伙伴策略、信息结构、奖励分解与通信预算后,微观规则—宏观涌现对应的差异可与其他机制分离 量纲目标宏观模式出现次数/仿真运行总数 失效失效边界是『独立数据或真实负载下效应消失,且增加代理是否增加验证与终止失败使方向反转时不成立』;越简单的局部规则使群体行为越容易解释,但当宏观模式对密度与噪声高度敏感时,规则的简洁反而使系统在部署环境中不可复现。自曝『微观规则—宏观涌现:自组织也需要可验证机制』的原始材料只直接支持“主证据来自Brambilla、Ferrante、Birattari与Dorigo,2013年《SwarmIntelligence》7:1–41”,没有自动覆盖边界外对象 空栏『微观规则—宏观涌现:自组织也需要可验证机制』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生态学称「样地结果不能外推到景观尺度」,社会学称「微观动机与宏观行为」;另见第248号第十八条『动态与并行模型的重整』

己、临时组队:合作策略不能只认训练过的伙伴

提出Stone、Kaminka、Kraus 与 Rosenschein,2010年《AAAI会议录》 争议或最新Albrecht 与 Ramamoorthy,2013年《A game-theoretic model and best-response learning method for ad hoc coordination》 关键ad hoc teamwork要求代理在没有预先协调的情况下推断陌生伙伴并迅速合作

多代理协作的默认设定是伙伴已知:队友的策略在训练时就在场,协调方式可以一起学出来。这个前提让学到的合作高度依赖具体伙伴——换一个从未共同训练过的队友,配合往往当场崩溃。这条转向把问题重新定义为临时组队:代理必须在没有任何预先协调的情况下推断陌生伙伴的类型与意图,并迅速找到可行的配合方式。

这条理论的可反驳命题是:ad hoc teamwork要求代理在没有预先协调的情况下推断陌生伙伴并迅速合作。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“未见队友合作回报/已见队友回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Stone、Kaminka、Kraus 与 Rosenschein,2010年《AAAI会议录》。具体设计与读数是:测试要求代理与训练时从未见过、也没有事先共同协议的队友合作;泛化单位从环境状态扩大到队友类型。Stone等于2010年前后明确提出该问题;机器人足球与协作任务表明自我对弈策略对新伙伴常显著退化。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Albrecht 与 Ramamoorthy,2013年《A game-theoretic model and best-response learning method for ad hoc coordination》:代理根据每轮动作更新对他者类型和策略的后验分布;对手不再是固定环境参数,而是随互动改变的信念变量。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告与未见过的队友合作时的回报,与和熟悉队友合作时的回报之比。这个比值才是协作能力的读数,而前者在多数论文里根本没有被测。同时应说明陌生队友如何取样——从同一算法族里换个种子,与换一个完全不同的策略族,难度差着数量级。

与本块第十四条《群体多样性》是问题与对策:训练伙伴池越多样,面对陌生伙伴时越不容易崩。与第十八条《合作人工智能》则是特例与一般——人类正是最典型的、无法被纳入训练的陌生伙伴,因此临时组队能力是与人协作的前提条件。

位置E——把『临时组队:合作策略不能只认训练过的伙伴』成立所需的边界环境作为首要显露 单因决定『临时组队:合作策略不能只认训练过的伙伴』当前结论的最小充分项只有:adhocteamwork要求代理在没有预先协调的情况下推断陌生伙伴并迅速合作 预设〔02 单一读数代表复杂对象〕adhocteamwork要求代理在没有预先协调的情况下推断陌生伙伴并迅速能够在同一预算与同一输入下被独立检验 量纲未见队友合作回报/已见队友回报 失效失效边界是『更换强基线、平台或人群后排序不再保持,并且尾部代价超过收益时失效』;越充分的联合训练使已见队友之间的配合越精密,但当配合依赖只有双方知道的约定时,默契的精密反而使面对陌生伙伴时的表现更差。自曝『临时组队:合作策略不能只认训练过的伙伴』的原始材料只直接支持“主证据来自Stone、Kaminka、Kraus与Rosenschein,2010年《AAAI会议录》”,没有自动覆盖边界外对象 空栏『临时组队:合作策略不能只认训练过的伙伴』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名运动训练称「固定搭档默契与临时组队」,医学称「跨院会诊的沟通成本」;另见第253号第十条『人机协作的分工』

庚、对手模型是动态信念:他者策略不是环境常数

提出Albrecht 与 Ramamoorthy,2013年《A game-theoretic model and best-response learning method for ad hoc coordination》 争议或最新Olfati-Saber、Fax与Murray,2007年《Proceedings of the IEEE》95(1):215–233 关键代理应维护对他者类型、目标和学习过程的信念,并依据新行为更新

把其他代理当作环境的一部分,是单智能体方法进入多代理场景时最省事的做法:他人的行为被折算成环境的转移概率。这个前提要求他者的策略是固定的。而在所有各方都在学习的系统里,环境本身随时间改变,昨天有效的最优反应今天可能就是最差反应。这条转向要求代理维护对他者类型、目标与学习过程的信念,并根据新观察持续更新。

这条理论的可反驳命题是:代理应维护对他者类型、目标和学习过程的信念,并依据新行为更新。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“对手模型预测正确数/对手动作总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Albrecht 与 Ramamoorthy,2013年《A game-theoretic model and best-response learning method for ad hoc coordination》。具体设计与读数是:代理根据每轮动作更新对他者类型和策略的后验分布;对手不再是固定环境参数,而是随互动改变的信念变量。2010年代Bayesian Policy Reuse、I-POMDP近似与对手建模实验显示显式模型可加速适应;模型错设会造成负迁移。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Olfati-Saber、Fax与Murray,2007年《Proceedings of the IEEE》95(1):215–233:框架把一致性速度与通信图拉普拉斯谱联系起来;连通图上的局部加权平均可收敛,而断连、时延和切换拓扑会给出明确失效条件。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告对手模型的预测正确数与对手动作总数之比,而不是只报自身回报。回报可能来自环境的其他部分,只有预测准确率才直接说明模型是否起作用。同时应说明信念更新的时间尺度——更新太慢跟不上对方的学习,太快则会把噪声当成策略变化。

与本块第十五条《学习中的策略反应》是被动与主动的两步:先承认他者在变,再进一步把他者的学习过程纳入自己的决策。两者的分界很实在——建模他者是为了更好地反应,塑形他者则是把对方的学习轨迹当成可以影响的对象,后者带来的伦理与稳定性问题完全不同。

位置D——把『对手模型是动态信念:他者策略不是环境常数』中的操作次序与变化路径作为首要显露 单因决定『对手模型是动态信念:他者策略不是环境常数』当前结论的最小充分项只有:代理应维护对他者类型、目标和学习过程的信念,并依据新行为更新 预设〔03 相关方向等同因果方向〕比较双方对“什么算一次有效结果”使用相同分母,对手模型是动态信念才可排序 量纲对手模型预测正确数/对手动作总数 失效失效边界是『分母改为端到端结果后优势低于测量误差,或失败样本集中于关键场景时失效』;越精细的对手模型使短期预测越准确,但当对方同样在建模自己时,建模的精细反而可能把双方推入互相追赶的不稳定循环。自曝『对手模型是动态信念:他者策略不是环境常数』的原始材料只直接支持“主证据来自Albrecht与Ramamoorthy,2013年《Agame-theoreticmodelandbest-responselearni”,没有自动覆盖边界外对象 空栏『对手模型是动态信念:他者策略不是环境常数』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名军事学称「敌情判断是动态的」,市场营销称「竞争对手反应函数」;另见第256号第十一条『标注者分歧』

辛、共识与消息传递:局部交换可以生成全局协调

提出Olfati-Saber、Fax与Murray,2007年《Proceedings of the IEEE》95(1):215–233 争议或最新Lazaridou、Peysakhovich 与 Baroni,2017年《ICLR会议录》及后续组合性检验 关键在连通图与适当权重条件下,主体只交换邻居状态也能收敛到共同值

让分散的个体达成一致,直觉上需要一个中心:由某个节点收集所有信息再广播结论。这个前提在通信受限、节点会失效或规模很大时不成立。这条转向给出的结论相当反直觉——在图连通且权重选择恰当的条件下,每个主体只与邻居交换状态,全体也能收敛到同一个值。协调所需要的不是全局视野,而是足够的连通性与正确的更新规则。

这条理论的可反驳命题是:在连通图与适当权重条件下,主体只交换邻居状态也能收敛到共同值;图结构和延迟决定收敛边界。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“达成共识回合数/通信回合总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Olfati-Saber、Fax与Murray,2007年《Proceedings of the IEEE》95(1):215–233。具体设计与读数是:框架把一致性速度与通信图拉普拉斯谱联系起来;连通图上的局部加权平均可收敛,而断连、时延和切换拓扑会给出明确失效条件。Olfati-Saber、Fax与Murray于2007年把一致性、谱图与网络拓扑放进统一分析框架,局部消息能否形成全局协调由连通性和谱隙给出判据。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“通信符号能否跨任务组合与解释”。对照证据见Lazaridou、Peysakhovich 与 Baroni,2017年《ICLR会议录》及后续组合性检验:训练代理可在已见对象上形成高成功率符号,但换到未见属性组合时消息常失效;通信成功率与组合泛化必须分开。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告达成共识所需的回合数与通信总回合之比,并说明图的连通性假设。收敛速度对拓扑极其敏感,脱离图结构谈收敛没有意义。同时应说明节点失效与消息丢失下的行为——这些条件恰恰是采用分散方案的原因,却常常不在分析里。

与本块第一条《分布式约束优化》共享消息传递机制,与第二十条《多代理失效放大》则形成一处提醒:收敛到共识本身并不保证共识是对的。当输入被少数错误节点污染时,同一套机制会高效地让全体收敛到一个错误的公共值——高效协调与结论正确是两件事。

位置E——把『共识与消息传递:局部交换可以生成全局协调』成立所需的边界环境作为首要显露 单因决定『共识与消息传递:局部交换可以生成全局协调』当前结论的最小充分项只有:在连通图与适当权重条件下,主体只交换邻居状态也能收敛到共同值 预设〔03 相关方向等同因果方向〕共识与消息传递造成的变化大于版本、样本选择和测量噪声造成的变化 量纲达成共识回合数/通信回合总数 失效失效边界是『控制额外信息与调参预算后读数不优于基线,且跨站点复现率低于一半时失效』;越强的连通性使共识收敛得越快,但当个别节点持续注入错误状态时,收敛的加快反而使全体更迅速地统一到错误值上。自曝『共识与消息传递:局部交换可以生成全局协调』的原始材料只直接支持“Olfati-Saber、Fax与Murray于2007年把一致性、谱图与网络拓扑放进统一分析框架,局部消息能否形成全局协调由连通性和谱隙给出判据”,没有自动覆盖边界外对象 空栏『共识与消息传递:局部交换可以生成全局协调』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名社会心理学称「群体极化与信息级联」,电力系统称「同步并网」;另见第252号第三条『基于模型的拥塞控制』
【第二幕】这十年 · 约 2016—2026

第二幕把学习非平稳性、信用分配、陌生伙伴和语言代理失败推到中心,基准高分不再足够。 本幕十二条更关注部署、公开清算与方法自审,尤其要求把平均分数换成分布、边界、长期读数和责任链。

一、集中训练、分散执行:训练信息与部署信息可以不同

提出Lowe 等,2017年《Advances in Neural Information Processing Systems》30 争议或最新Foerster 等,2018年《AAAI会议录》中的COMA工作 关键训练阶段可用全局状态和其他代理动作稳定学习,执行时再限制为局部策略

多代理强化学习最初直接沿用单体设定:每个代理只看自己的局部观察,独立学习。这个前提导致训练极不稳定——从任一代理的视角看,环境因为他人也在学习而不断变化,回报信号无法归因。这条转向把训练与执行分开:训练时允许使用全局状态与他人动作来稳定学习,执行时再退回只依赖局部观察的策略,信息的可用性第一次按阶段区分。

这条理论的可反驳命题是:训练阶段可用全局状态和其他代理动作稳定学习,执行时再限制为局部策略。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“部署时可用信息量/训练时信息量”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Lowe 等,2017年《Advances in Neural Information Processing Systems》30。具体设计与读数是:MADDPG的评论器训练时看到所有代理动作,执行时每个策略只看局部观测;集中信息与部署信息被明确分开。MADDPG于2017年指出独立学习的非平稳性并采用集中critic;在混合合作—竞争任务上优于独立基线,但集中训练规模受联合空间限制。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“自我博弈是否过拟合固定生态”。对照证据见Foerster 等,2018年《AAAI会议录》中的COMA工作:COMA固定其他代理动作,边缘化当前代理的备选动作形成反事实基线;团队奖励由此能回答单个动作贡献。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:明确报告部署时可用信息量与训练时信息量的差距,并说明这一差距如何被处理。差距过大而未处理的方法,在仿真里表现很好,在部署中会因为缺少全局信息而失效。同时应说明训练时的全局信息在真实系统里是否真的可获得,否则这套设定在工程上不可复制。

与本块第十条《反事实归因》和第十一条《单调价值分解》构成同一条技术路线的三步:先解决训练稳定,再解决贡献归因,最后解决分散执行时如何取最优动作。三者互相依赖,缺一环整条路线就退回独立学习。而这条路线的共同前提——训练时能拿到全局状态——正是它与真实部署之间最大的一处落差。

位置S——把『集中训练、分散执行:训练信息与部署信息可以不同』形成的对象结构作为首要显露 单因决定『集中训练、分散执行:训练信息与部署信息可以不同』当前结论的最小充分项只有:训练阶段可用全局状态和其他代理动作稳定学习,执行时再限制为局部策略 预设〔03 相关方向等同因果方向〕在固定伙伴策略、信息结构、奖励分解与通信预算后,集中训练、分散执行对应的差异可与其他机制分离 量纲部署时可用信息量/训练时信息量 失效失效边界是『独立数据或真实负载下效应消失,且自我博弈是否过拟合固定生态使方向反转时不成立』;越多的全局信息使训练过程越稳定,但当部署时的局部观察不足以支撑学到的策略时,训练的稳定反而使性能在真实环境中大幅回落。自曝『集中训练、分散执行:训练信息与部署信息可以不同』的原始材料只直接支持“主证据来自Lowe等,2017年《AdvancesinNeuralInformationProcessingSystems》30”,没有自动覆盖边界外对象 空栏『集中训练、分散执行:训练信息与部署信息可以不同』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名教育学称「练习条件与考试条件的差异」,飞行训练称「模拟机与真实气象」;另见第253号第十条『人机协作的分工』

二、反事实归因:团队奖励必须回答‘是谁造成的’

提出Foerster 等,2018年《AAAI会议录》中的COMA工作 争议或最新Rashid 等,2018年《ICML会议录》,PMLR 关键用保持他者动作不变的反事实基线,可估计单个代理相对贡献并降低梯度方差

团队学习的常见做法是共享一个团队奖励:大家一起拿分,一起被罚。这个前提让每个代理都无法知道自己的动作是否有用——回报里混着所有人的贡献,梯度因此方差极大,代理容易学成随大流。这条转向要求回答「是谁造成的」:用保持他人动作不变的反事实基线,估计单个代理的相对贡献,把团队回报拆成可归因的部分。

这条理论的可反驳命题是:用保持他者动作不变的反事实基线,可估计单个代理相对贡献并降低梯度方差。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“关键行动边际贡献/团队总回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Foerster 等,2018年《AAAI会议录》中的COMA工作。具体设计与读数是:COMA固定其他代理动作,边缘化当前代理的备选动作形成反事实基线;团队奖励由此能回答单个动作贡献。COMA于2018年在星际争霸微操任务中使用集中critic和反事实优势;归因依赖价值估计准确性。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“增加代理是否增加验证与终止失败”。对照证据见Rashid 等,2018年《ICML会议录》,PMLR:QMIX用单调混合网络保证联合Q值对每个局部Q值非减,在八张StarCraft微操地图上让局部贪心与联合选择一致。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告关键行动的边际贡献与团队总回报的对照,而不是只报团队分数。没有归因的团队分数无法用于诊断,也无法解释训练为何停滞。同时应说明反事实基线的计算成本,因为它随代理数增长,往往是这类方法在大规模团队上的实际瓶颈。

与本块第十一条《单调价值分解》是同一问题的两条路径:一个从回报侧做反事实归因,一个从价值函数侧做结构性分解。前者更通用但更贵,后者更省但要求单调性这一强假设。两条的取舍点很清楚——当协作模式包含互相抵消或互补时,单调性不成立,只能回到归因。

位置E——把『反事实归因:团队奖励必须回答‘是谁造成的’』成立所需的边界环境作为首要显露 单因决定『反事实归因:团队奖励必须回答‘是谁造成的’』当前结论的最小充分项只有:用保持他者动作不变的反事实基线,可估计单个代理相对贡献并降低梯度方差 预设〔04 尺度迁移不改变结论〕用保持他者动作不变的反事实基线,可估计单个代理相对能够在同一预算与同一输入下被独立检验 量纲关键行动边际贡献/团队总回报 失效当更换强基线、平台或人群后排序不再保持,并且尾部代价超过收益时失效;越精确的反事实归因使个体贡献越清晰,但当基线计算的开销随代理数超线性增长时,归因的精确反而使方法只能用在小团队上。自曝『反事实归因:团队奖励必须回答‘是谁造成的’』的原始材料只直接支持“主证据来自Foerster等,2018年《AAAI会议录》中的COMA工作”,没有自动覆盖边界外对象 空栏『反事实归因:团队奖励必须回答‘是谁造成的’』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名管理会计称「部门贡献毛利」,医学称「归因风险而非总发病率」;另见第255号第九条『技术债的量化』

三、单调价值分解:联合最优可由局部贪心实现

提出Rashid 等,2018年《ICML会议录》,PMLR 争议或最新Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPS Datasets and Benchmarks》 关键只要联合价值对各代理局部价值单调,就能保留分散argmax并表达非线性协作

分散执行有一个硬要求:每个代理只能看自己的观察,还要选出对团队最好的动作。最省事的做法是让联合价值等于各自价值之和,但这样表达不了任何形式的协作——互补与互相抵消都被排除在外。这条转向找到了中间地带:只要联合价值对各代理的局部价值保持单调,分散地各取局部最优就等于联合最优,非线性协作因此可以在保住分散执行的前提下被表达。

这条理论的可反驳命题是:只要联合价值对各代理局部价值单调,就能保留分散argmax并表达非线性协作。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“可单调分解联合动作数/联合动作总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Rashid 等,2018年《ICML会议录》,PMLR。具体设计与读数是:QMIX用单调混合网络保证联合Q值对每个局部Q值非减,在八张StarCraft微操地图上让局部贪心与联合选择一致。QMIX于2018年在SMAC任务上超过多种值分解基线;单调约束无法表示需要牺牲局部价值的协作。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPS Datasets and Benchmarks》:作者把独立学习、集中式策略梯度和价值分解三类算法放到多种合作任务中统一比较,并开放EPyMARL及两个稀疏奖励环境;同一算法的相对排序会随任务和实现细节改变。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告可被单调分解的联合动作占联合动作总数的比例,并说明任务中是否存在需要牺牲个体价值的协作。单调性在这类任务上不成立,而这恰恰是最需要协作的场景。同时应说明所用网络结构对单调性的强制方式,因为强制方式不同,表达能力的损失也不同。

与本块第十条《反事实归因》是同一目标的两条路径,与第九条《集中训练、分散执行》则是同一条流水线上的下一环。三条一起给出的判断是——**分散执行的每一分便利,都要用表达能力上的某种限制来换**,差别只在于这个限制被明写出来,还是被藏在网络结构里。

位置S——把『单调价值分解:联合最优可由局部贪心实现』形成的对象结构作为首要显露 单因决定『单调价值分解:联合最优可由局部贪心实现』当前结论的最小充分项只有:只要联合价值对各代理局部价值单调,就能保留分散argmax并表达非线性协作 预设〔04 尺度迁移不改变结论〕比较双方对“什么算一次有效结果”使用相同分母,单调价值分解才可排序 量纲可单调分解联合动作数/联合动作总数 失效当分母改为端到端结果后优势低于测量误差,或失败样本集中于关键场景时失效;越强的单调性约束使分散取最优越可靠,但当任务要求个体承担局部损失以换取团队收益时,约束的强化反而使这类协作根本无法被表达。自曝『单调价值分解:联合最优可由局部贪心实现』的原始材料只直接支持“主证据来自Rashid等,2018年《ICML会议录》,PMLR”,没有自动覆盖边界外对象 空栏『单调价值分解:联合最优可由局部贪心实现』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名经济学称「可加性效用的便利与失真」,管理学称「部门指标之和不等于公司最优」;另见第248号第十六条『近似算法与硬度的对应』

四、基准生态:一个地图高分不代表一般协调能力

提出Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPS Datasets and Benchmarks》 争议或最新Bard 等,2020年《Artificial Intelligence》280:103216 关键基准应覆盖观测、规模、异质性、通信与泛化,并公开训练细节和统计波动

多代理算法的比较长期依赖少数几个任务:在几张地图或几个经典博弈上分出高下,排名被当作一般协调能力的证据。这个前提假定任务之间可以外推。系统性的重评显示排名在换任务后频繁翻转,而训练细节、超参预算与随机种子造成的波动,常常大于算法之间的差距。这条转向要求基准覆盖观测方式、规模、异质性、通信与泛化,并公开训练细节与统计波动。

这条理论的可反驳命题是:基准应覆盖观测、规模、异质性、通信与泛化,并公开训练细节和统计波动。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“算法跨任务排名一致数/基准任务总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPS Datasets and Benchmarks》。具体设计与读数是:作者把独立学习、集中式策略梯度和价值分解三类算法放到多种合作任务中统一比较,并开放EPyMARL及两个稀疏奖励环境;同一算法的相对排序会随任务和实现细节改变。SMAC于2019年推动标准化微操评估,随后结果显示许多方法对地图、随机种子和实现敏感;SMACv2等提高分布变化。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Bard 等,2020年《Artificial Intelligence》280:103216:Hanabi要求二到五名玩家在看不到自己手牌的条件下合作,提示次数受限;自我博弈强策略若不能读懂陌生伙伴,得分会骤降。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告算法在跨任务上排名一致的任务数,而不是在最有利任务上的分数。排名一致性直接说明结论能否外推。同时应公开随机种子数与置信区间——多代理训练的方差远大于单体,缺了这两项的对比几乎不构成证据。

与本块第二条《有界次优协调》共享同一个缺口:没有可信参照点时,比较只能相对进行。与第十四条《群体多样性》则是评价与被评价——若训练伙伴池与评测伙伴池同源,测出的是记忆而不是泛化,这一点在多代理基准里比单体更容易被忽略。

位置D——把『基准生态:一个地图高分不代表一般协调能力』中的操作次序与变化路径作为首要显露 单因决定『基准生态:一个地图高分不代表一般协调能力』当前结论的最小充分项只有:基准应覆盖观测、规模、异质性、通信与泛化,并公开训练细节和统计波动 预设〔04 尺度迁移不改变结论〕基准生态造成的变化大于版本、样本选择和测量噪声造成的变化 量纲算法跨任务排名一致数/基准任务总数 失效当控制额外信息与调参预算后读数不优于基线,且跨站点复现率低于一半时失效;越标准化的基准使不同算法越可比,但当基准的任务分布窄于真实应用时,可比性的提高反而把研究引向对少数任务的过拟合。自曝『基准生态:一个地图高分不代表一般协调能力』的原始材料只直接支持“主证据来自Papoudakis、Christianos、Schäfer与Albrecht,2021年《NeurIPSDatasetsandBench”,没有自动覆盖边界外对象 空栏『基准生态:一个地图高分不代表一般协调能力』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名教育测量称「题库覆盖度决定分数意义」,药物试验称「入组标准限制外推」;另见第256号第三条『评测的构念效度危机』

五、不完全信息合作:强自我博弈不等于会与陌生人合作

提出Bard 等,2020年《Artificial Intelligence》280:103216 争议或最新Vinyals 等,2019年《Nature》575:350–354中的AlphaStar联赛训练 关键当信息分散且沟通受限时,代理必须推断伙伴信念、意图与约定

自我博弈的成功让一种推断流行起来:能把自己打赢的智能体,自然也擅长与他人合作。这个前提在信息完全、目标对立的博弈里勉强成立,在信息分散且沟通受限的合作任务里失效——自我博弈会收敛到一套只有自己人看得懂的隐秘约定,换成陌生伙伴时完全无法配合。这条转向要求把推断伙伴信念、意图与约定作为独立能力来测。

这条理论的可反驳命题是:当信息分散且沟通受限时,代理必须推断伙伴信念、意图与约定。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“隐信息下团队成功数/任务总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Bard 等,2020年《Artificial Intelligence》280:103216。具体设计与读数是:Hanabi要求二到五名玩家在看不到自己手牌的条件下合作,提示次数受限;自我博弈强策略若不能读懂陌生伙伴,得分会骤降。Hanabi Challenge于2019年把二至五人合作与不完全信息结合;高自我博弈分数的代理在人类或跨策略组队中常退化。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“通信符号能否跨任务组合与解释”。对照证据见Vinyals 等,2019年《Nature》575:350–354中的AlphaStar联赛训练:联赛同时维护主策略、利用者和专门对手,避免单一冠军被一种反制策略击穿;群体策略分布成为鲁棒性资产。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告在隐信息条件下与陌生伙伴的团队成功数,而不是自我博弈的分数。两者的相关性在这类任务里很弱,甚至可能为负。同时应说明约定是否被固定——若评测中双方可以事先沟通策略,测的就不是推断能力而是协议执行能力。

与本块第六条《临时组队》是同一困难的不同入口,与第十六条《涌现语言非组合性》则是同一失败的两种表现:自我博弈产生的隐秘约定,与涌现出的不可迁移符号,都是「只在训练伙伴之间有效的私有语言」。三条合起来指向一个判断——**协作能力的检验必须在训练分布之外进行,否则测到的是共同记忆而不是协作。**

位置S——把『不完全信息合作:强自我博弈不等于会与陌生人合作』形成的对象结构作为首要显露 单因决定『不完全信息合作:强自我博弈不等于会与陌生人合作』当前结论的最小充分项只有:当信息分散且沟通受限时,代理必须推断伙伴信念、意图与约定 预设〔05 观测与干预不回写对象〕在固定伙伴策略、信息结构、奖励分解与通信预算后,不完全信息合作对应的差异可与其他机制分离 量纲隐信息下团队成功数/任务总数 失效当独立数据或真实负载下效应消失,且通信符号能否跨任务组合与解释使方向反转时不成立;越充分的自我博弈使内部约定越高效,但当约定不可被陌生伙伴推断时,效率的提高反而使跨伙伴合作成功率下降。自曝『不完全信息合作:强自我博弈不等于会与陌生人合作』的原始材料只直接支持“主证据来自Bard等,2020年《ArtificialIntelligence》280:103216”,没有自动覆盖边界外对象 空栏『不完全信息合作:强自我博弈不等于会与陌生人合作』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名语言学称「行话提高圈内效率、抬高圈外门槛」,组织学称「隐性规范阻碍新人融入」;另见第256号第十五条『对话与任务型系统的重构』

六、群体多样性:一个最优策略会制造脆弱同质化

提出Vinyals 等,2019年《Nature》575:350–354中的AlphaStar联赛训练 争议或最新Foerster 等,2018年《AAMAS会议录》中的LOLA工作 关键策略种群、联赛与对手池能避免循环克制、提高鲁棒性并覆盖多种协作惯例

训练一个多代理系统的默认目标是找到最优策略:收敛到一个策略,全体照它执行。这个前提忽略了同质化的代价——所有代理用同一套策略时,系统在面对循环克制、环境变化或陌生伙伴时会整体脆断,因为没有任何一个成员持有不同的应对方式。这条转向把策略种群、联赛与对手池纳入训练目标,多样性从副产品变成需要主动维持的资源。

这条理论的可反驳命题是:策略种群、联赛与对手池能避免循环克制、提高鲁棒性并覆盖多种协作惯例。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“未见伙伴回报/训练伙伴回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Vinyals 等,2019年《Nature》575:350–354中的AlphaStar联赛训练。具体设计与读数是:联赛同时维护主策略、利用者和专门对手,避免单一冠军被一种反制策略击穿;群体策略分布成为鲁棒性资产。AlphaStar于2019年前后采用league training,后续population-based MARL显示多样性改善泛化;训练成本和评价排序更复杂。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“自我博弈是否过拟合固定生态”。对照证据见Foerster 等,2018年《AAMAS会议录》中的LOLA工作:LOLA在更新自己参数时显式计算该更新会如何改变对手下一步梯度;每个代理的优化问题因他者学习而非平稳。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告与未见过的伙伴合作时的回报和与训练伙伴合作时的回报之比。这个比值是多样性是否真的产生了鲁棒性的直接读数。同时应说明种群的维护成本——维持多样性要消耗大量算力,这笔账应当与鲁棒性收益一起报告。

与本块第四条《联盟形成成本》构成一处清晰的张力:多样性提高鲁棒性,也提高协调成本。与第六条《临时组队》则是对策与目标。三条合起来可以给出一条工程判断——**同质化是效率的产物,也是脆性的来源**,而在什么位置停下来,取决于系统会不会遇到训练分布之外的伙伴。

位置D——把『群体多样性:一个最优策略会制造脆弱同质化』中的操作次序与变化路径作为首要显露 单因决定『群体多样性:一个最优策略会制造脆弱同质化』当前结论的最小充分项只有:策略种群、联赛与对手池能避免循环克制、提高鲁棒性并覆盖多种协作惯例 预设〔05 观测与干预不回写对象〕策略种群、联赛与对手池能避免循环克制、提高鲁棒性并覆能够在同一预算与同一输入下被独立检验 量纲未见伙伴回报/训练伙伴回报 失效当更换强基线、平台或人群后排序不再保持,并且尾部代价超过收益时失效;越丰富的策略种群使面对陌生伙伴时越鲁棒,但当种群维护消耗的算力超过任务本身时,多样性的收益反而不足以抵偿训练成本。自曝『群体多样性:一个最优策略会制造脆弱同质化』的原始材料只直接支持“AlphaStar于2019年前后采用leaguetraining,后续population-basedMARL显示多样性改善泛化”,没有自动覆盖边界外对象 空栏『群体多样性:一个最优策略会制造脆弱同质化』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生态学称「单一栽培的高产与易崩」,投资学称「集中持仓与分散配置」;另见第248号第十七条『随机性的必要性与去随机化』

七、学习中的策略反应:优化自己的回报会改变别人怎么学

提出Foerster 等,2018年《AAMAS会议录》中的LOLA工作 争议或最新Lowe 等,2017年《Advances in Neural Information Processing Systems》30 关键元梯度或递归推理可把对手下一步学习纳入当前决策,策略因此具有塑形作用

多方学习的标准假设是各自独立优化:我改进我的策略,你改进你的,互不干涉。这个前提忽略了一件事——我的策略同时是你的训练数据,我今天怎么选,会改变你明天学成什么样。这条转向把他者的学习过程纳入自己的决策:用元梯度或递归推理预期对方将如何更新,于是策略不只是对当前局面的反应,还具有塑形对方学习轨迹的作用。

这条理论的可反驳命题是:元梯度或递归推理可把对手下一步学习纳入当前决策,策略因此具有塑形作用。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“策略适应后回报/策略适应前回报”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Foerster 等,2018年《AAMAS会议录》中的LOLA工作。具体设计与读数是:LOLA在更新自己参数时显式计算该更新会如何改变对手下一步梯度;每个代理的优化问题因他者学习而非平稳。LOLA于2018年前后展示学习感知更新可改变社会困境结果;更深递归容易不稳定,也可能被策略性利用。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“增加代理是否增加验证与终止失败”。对照证据见Lowe 等,2017年《Advances in Neural Information Processing Systems》30:MADDPG的评论器训练时看到所有代理动作,执行时每个策略只看局部观测;集中信息与部署信息被明确分开。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告策略适应前后的回报对照,并说明所假设的对方学习算法。塑形效果完全依赖于这个假设,对方换一种更新规则,塑形可能变成自我损害。同时应说明双方都在塑形时的行为——这一情形下的稳定性缺乏保证,而它恰恰是真实多方系统的常态。

与本块第七条《对手模型是动态信念》是被动建模与主动塑形的两步,与第十七条《顺序社会困境》则一起触及一个更硬的问题:当每一方都能塑形他方时,合作可能被制造出来,也可能被系统性地摧毁。技术上可行的塑形能力,在多方系统里同时是一种可以被滥用的能力,这一点应当明写而不是留在脚注里。

位置E——把『学习中的策略反应:优化自己的回报会改变别人怎么学』成立所需的边界环境作为首要显露 单因决定『学习中的策略反应:优化自己的回报会改变别人怎么学』当前结论的最小充分项只有:元梯度或递归推理可把对手下一步学习纳入当前决策,策略因此具有塑形作用 预设〔05 观测与干预不回写对象〕比较双方对“什么算一次有效结果”使用相同分母,学习中的策略反应才可排序 量纲策略适应后回报/策略适应前回报 失效当分母改为端到端结果后优势低于测量误差,或失败样本集中于关键场景时失效;越有效的塑形策略使对方越可能学出合作,但当各方同时施加塑形时,塑形能力的增强反而使系统陷入互相操纵的不稳定均衡。自曝『学习中的策略反应:优化自己的回报会改变别人怎么学』的原始材料只直接支持“主证据来自Foerster等,2018年《AAMAS会议录》中的LOLA工作”,没有自动覆盖边界外对象 空栏『学习中的策略反应:优化自己的回报会改变别人怎么学』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名博弈论称「承诺与威胁的可信度」,教育学称「期望效应改变被期望者」;另见第253号第四条『自动化的过度依赖』

八、涌现语言非组合性:能通信不等于形成可迁移语言

提出Lazaridou、Peysakhovich 与 Baroni,2017年《ICLR会议录》及后续组合性检验 争议或最新Leibo 等,2017年《AAMAS会议录》 关键应检验消息是否被监听、是否组合、能否跨伙伴与新任务泛化,而非只看回报

让代理在训练中自行发展通信协议之后,出现了一种乐观解读:它们发明了语言。这个前提把「通信提高了回报」等同于「形成了语言」。检验之后的结果要冷静得多——消息常常并未被真正监听、符号不具备组合性、换一个伙伴或换一个任务就完全失效。这条转向要求把可迁移性作为语言的判据,而不是把回报提升当作证据。

这条理论的可反驳命题是:应检验消息是否被监听、是否组合、能否跨伙伴与新任务泛化,而非只看回报。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“跨任务可复用符号数/涌现符号总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Lazaridou、Peysakhovich 与 Baroni,2017年《ICLR会议录》及后续组合性检验。具体设计与读数是:训练代理可在已见对象上形成高成功率符号,但换到未见属性组合时消息常失效;通信成功率与组合泛化必须分开。2019年后正向信号/监听指标、拓扑与群体规模实验发现协议常随随机种子分裂;成功交流可依赖不可解释的私有码。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“训练伙伴改变后策略是否仍有效”。对照证据见Leibo 等,2017年《AAMAS会议录》:Cleanup和Harvest两个环境把资源再生、拥挤和长期回报放入连续互动;合作或背叛会改变后续状态,而非只结算一次矩阵收益。它显示价值分解的结构约束可能排除真正最优协作;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告跨任务可复用的符号数与涌现符号总数之比,并做监听消融——把消息随机化之后回报是否下降。不做消融就无法排除消息其实没被使用这一最常见的情况。同时应说明符号的组合性检验方式,因为组合性正是「语言」这个词所承诺却常常并不存在的东西。

与本块第十三条《不完全信息合作》是同一族失败的两种表现,与第十九条《语言型代理编排》则形成一处有意思的对照:前者是代理自己长出的、不可迁移的私有符号,后者用的是人类语言这一现成的、高度可迁移的媒介。**通信问题的解决方式,从"让它们自己发明"变成了"直接用已有的"**,这一转变本身值得记入本领域的二十年。

位置D——把『涌现语言非组合性:能通信不等于形成可迁移语言』中的操作次序与变化路径作为首要显露 单因决定『涌现语言非组合性:能通信不等于形成可迁移语言』当前结论的最小充分项只有:应检验消息是否被监听、是否组合、能否跨伙伴与新任务泛化,而非只看回报 预设〔06 聚合次序不影响结论〕涌现语言非组合性造成的变化大于版本、样本选择和测量噪声造成的变化 量纲跨任务可复用符号数/涌现符号总数 失效当控制额外信息与调参预算后读数不优于基线,且跨站点复现率低于一半时失效;越自由的通信协议使训练伙伴之间的回报越高,但当符号缺乏组合性与可监听性时,通信的自由反而使协议无法迁移到新任务。自曝『涌现语言非组合性:能通信不等于形成可迁移语言』的原始材料只直接支持“主证据来自Lazaridou、Peysakhovich与Baroni,2017年《ICLR会议录》及后续组合性检验”,没有自动覆盖边界外对象 空栏『涌现语言非组合性:能通信不等于形成可迁移语言』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名语言学称「组合性是语言的核心特征」,密码学称「私有编码与公共协议」;另见第256号第八条『分词与文本表示的底层』

九、顺序社会困境:合作与背叛会被环境动力放大

提出Leibo 等,2017年《AAMAS会议录》 争议或最新Brambilla、Ferrante、Birattari 与 Dorigo,2013年《Swarm Intelligence》7:1–41 关键在连续环境中,资源再生、空间和历史会改变激励,社会结果是策略与环境共同生成

社会困境长期以矩阵博弈为研究对象:囚徒困境、公共品博弈,合作与背叛是两个抽象的动作。这个前提把环境抽空成一张收益表。而在连续环境里,资源再生速度、空间分布与历史积累都会改变激励结构——同一群代理在资源充裕时稳定合作,在资源紧张时转向掠夺,行为的变化不是策略退化,而是同一策略在另一组环境动力下的正常输出。这条转向把社会结果视为策略与环境共同生成的。

这条理论的可反驳命题是:在连续环境中,资源再生、空间和历史会改变激励,社会结果是策略与环境共同生成。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“合作行动数/社会困境总回合”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Leibo 等,2017年《AAMAS会议录》。具体设计与读数是:Cleanup和Harvest两个环境把资源再生、拥挤和长期回报放入连续互动;合作或背叛会改变后续状态,而非只结算一次矩阵收益。Leibo等2017年提出sequential social dilemmas,Melting Pot于2021年扩展多情境基准;算法在一个困境合作不代表跨情境稳健。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“团队奖励是否掩盖个体无效动作”。对照证据见Brambilla、Ferrante、Birattari 与 Dorigo,2013年《Swarm Intelligence》7:1–41:工程化综述把设计分成微观规则、宏观行为和验证三层;同一局部规则需在不同群体规模和噪声下测量涌现是否保持。它显示多样性会提高鲁棒性也会增加协调成本;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告合作行动数与困境回合总数之比,并给出环境参数——再生率、密度、可见范围。脱离参数谈合作率没有意义,因为同一套策略在不同参数下的合作率可以从接近一到接近零。同时应说明观察窗口,因为许多环境里合作会在长期后崩溃,短窗口测不出来。

与本块第五条《微观规则—宏观涌现》是同一洞察在社会维度的表现,与第十五条《学习中的策略反应》则合成一处更深的判断:环境塑造激励,而各方的学习又在塑造彼此,因此「合作是否可能」不是一个可以脱离具体环境与学习动力回答的问题。把它当成策略优劣的问题,是这一族研究最常见的越界。

位置E——把『顺序社会困境:合作与背叛会被环境动力放大』成立所需的边界环境作为首要显露 单因决定『顺序社会困境:合作与背叛会被环境动力放大』当前结论的最小充分项只有:在连续环境中,资源再生、空间和历史会改变激励,社会结果是策略与环境共同生成 预设〔06 聚合次序不影响结论〕在固定伙伴策略、信息结构、奖励分解与通信预算后,顺序社会困境对应的差异可与其他机制分离 量纲合作行动数/社会困境总回合 失效当独立数据或真实负载下效应消失,且团队奖励是否掩盖个体无效动作使方向反转时不成立;越充裕的环境资源使合作行为越容易维持,但当资源再生慢于消耗速度时,环境的富足反而使前期形成的合作规范在稀缺来临时迅速瓦解。自曝『顺序社会困境:合作与背叛会被环境动力放大』的原始材料只直接支持“Leibo等2017年提出sequentialsocialdilemmas,MeltingPot于2021年扩展多情境基准”,没有自动覆盖边界外对象 空栏『顺序社会困境:合作与背叛会被环境动力放大』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名生态学称「公地的承载力」,人类学称「丰年与荒年的分配规范」;另见第253号第十一条『众包与被隐藏的劳动』

十、合作人工智能:团队质量包括与人和新代理的兼容性

提出Dafoe 等,2021年《Nature》593:33–36 争议或最新Wu 等,2023年《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》 关键目标应包含约定发现、意图表达、可预测性、冲突解决和跨伙伴协作

人工智能研究长期以能力为中心:更强的规划、更准的预测、更高的分数。这个前提把协作当成能力足够之后自然出现的东西。合作人工智能提出的是另一件事——与他方(尤其是人)共事需要一组独立的能力:发现约定、表达意图、保持可预测、处理冲突,而这些既不会从单体能力里自动长出来,也不会被以胜负为目标的训练所奖励。

这条理论的可反驳命题是:目标应包含约定发现、意图表达、可预测性、冲突解决和跨伙伴协作。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“人类与代理共同收益/单方最优收益”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。它改写的不是工具名称,而是什么比较才算同一个问题。

主证据来自Dafoe 等,2021年《Nature》593:33–36。具体设计与读数是:议程把与陌生代理、人与机构协作列为独立能力,并要求报告伙伴分布、通信限制和失败代价;团队总回报不再是唯一指标。2021年前后Cooperative AI议程与Hanabi人机实验把主观合作感和跨伙伴绩效纳入指标;高客观分数未必带来好团队体验。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“通信符号能否跨任务组合与解释”。对照证据见Wu 等,2023年《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》:框架把代理角色、工具调用和终止条件写成可编排对话;一条任务可产生多轮消息、代码执行和人工介入,控制平面由此显式化。它显示集中训练会偷看部署时不存在的信息;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告人与代理共同取得的收益与单方最优收益的对照,而不是代理自身的分数。这个对照才是协作价值的读数。同时应报告可预测性——人类伙伴无法预期的高能力行为,在协作任务里经常是负资产,而这一项几乎从不被测量。

与本块第六条《临时组队》是一般与特例:人类是最典型的、无法纳入训练的陌生伙伴。与第二十条《多代理失效放大》则一头一尾——本条讲的是与人协作需要什么,那一条讲的是代理之间协作在规模上如何失败。两条共同说明,协作质量不随单体能力自动上升。

位置S——把『合作人工智能:团队质量包括与人和新代理的兼容性』形成的对象结构作为首要显露 单因决定『合作人工智能:团队质量包括与人和新代理的兼容性』当前结论的最小充分项只有:目标应包含约定发现、意图表达、可预测性、冲突解决和跨伙伴协作 预设〔06 聚合次序不影响结论〕目标应包含约定发现、意图表达、可预测性、冲突解决和跨伙能够在同一预算与同一输入下被独立检验 量纲人类与代理共同收益/单方最优收益 失效当更换强基线、平台或人群后排序不再保持,并且尾部代价超过收益时失效;越强的单体能力使代理在任务上的分数越高,但当行为超出人类伙伴的可预期范围时,能力的提高反而降低了人机团队的共同收益。自曝『合作人工智能:团队质量包括与人和新代理的兼容性』的原始材料只直接支持“2021年前后CooperativeAI议程与Hanabi人机实验把主观合作感和跨伙伴绩效纳入指标”,没有自动覆盖边界外对象 空栏『合作人工智能:团队质量包括与人和新代理的兼容性』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名管理学称「明星员工未必提升团队产出」,航空称「机组资源管理重于个人技术」;另见第253号第十条『人机协作的分工』

十一、语言型代理编排:对话可以成为可编程控制平面

提出Wu 等,2023年《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》 争议或最新Wu、Bansal、Zhang等,2024年《COLM 2024》 关键可用角色、消息、工具权限和终止条件编排多个语言模型代理,形成动态协作程序

把多个语言模型组织起来干活,最初的做法是写一段长提示,让一个模型扮演多个角色。这个前提让协作发生在模型内部,无法观察也无法约束。这条转向把协作外置成可编程的结构:角色、消息、工具权限与终止条件被显式定义,对话成为控制平面,多个代理之间的交互第一次可以像程序一样被编排、被检查、被复用。

这条理论的可反驳命题是:可用角色、消息、工具权限和终止条件编排多个语言模型代理,形成动态协作程序。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“成功终止工作流数/总代理工作流数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Wu 等,2023年《AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation》。具体设计与读数是:框架把代理角色、工具调用和终止条件写成可编排对话;一条任务可产生多轮消息、代码执行和人工介入,控制平面由此显式化。AutoGen于2023年公开多代理会话框架并展示代码与工具任务;自然语言控制提高灵活性,也扩大循环、权限和状态失配风险。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“自我博弈是否过拟合固定生态”。对照证据见Wu、Bansal、Zhang等,2024年《COLM 2024》:AutoGen把代理角色、消息、人工接管与工具调用编排为对话程序;这同时暴露了终止、权限和状态一致性必须由外部控制平面定义。它显示涌现语言可能只是训练伙伴间的私码;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告成功终止的工作流数与总工作流数之比,并说明终止条件如何定义。没有明确终止条件的编排会在失败时持续消耗资源,而这类消耗在成功率指标里完全看不见。同时应报告每个工作流的调用次数与成本,因为这条路线的代价随代理数与轮数迅速上升。

与本块第三条《可执行规范》构成一处值得注意的错位:多代理协调早已有一套关于承诺、权限与违约的形式机制,而这一波语言代理编排基本上重新开始,用自然语言约定角色与职责。与第二十条《多代理失效放大》一起看,可以说这波系统眼下的许多失败,正是那套被跳过的机制原本要处理的问题。

位置E——把『语言型代理编排:对话可以成为可编程控制平面』成立所需的边界环境作为首要显露 单因决定『语言型代理编排:对话可以成为可编程控制平面』当前结论的最小充分项只有:可用角色、消息、工具权限和终止条件编排多个语言模型代理,形成动态协作程序 预设〔01 谁进入分母〕比较双方对“什么算一次有效结果”使用相同分母,语言型代理编排才可排序 量纲成功终止工作流数/总代理工作流数 失效当分母改为端到端结果后优势低于测量误差,或失败样本集中于关键场景时失效;越灵活的对话式编排使复杂工作流越容易搭建,但当角色与终止条件仅以自然语言约定时,灵活性的提高反而使失败难以定位与复现。自曝『语言型代理编排:对话可以成为可编程控制平面』的原始材料只直接支持“主证据来自Wu等,2023年《AutoGen:EnablingNext-GenLLMApplicationsviaMulti-AgentConver”,没有自动覆盖边界外对象 空栏『语言型代理编排:对话可以成为可编程控制平面』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名组织设计称「岗位说明书与临时授权」,工程称「流程图与口头交接」;另见第256号第十八条『智能体化与工具使用』

十二、多代理失效放大:代理越多不保证结果越好

提出Cemri、Pan、Yang等,2025年《Why Do Multi-Agent LLM Systems Fail?》arXiv:2503.13657,DOI:10.48550/arXiv.2503.13657 争议或最新Dafoe 等,2021年《Nature》593:33–36 关键通信错误、责任漂移、重复验证与错误共识会随链路增加累积,规模必须用端到端可靠性评价

多代理系统的默认期待是加法:多一个代理多一份能力,分工越细结果越好。这个前提把协调当作零成本的粘合剂。实测结果相反——通信错误、责任漂移、重复验证与错误共识会随链路数累积,很多失败并非来自单个代理的能力不足,而是来自编排本身。这条转向要求以端到端可靠性评价规模,而不是以代理数或分工细度作为进步的证据。

这条理论的可反驳命题是:通信错误、责任漂移、重复验证与错误共识会随链路增加累积,规模必须用端到端可靠性评价。比较必须固定伙伴策略、信息结构、奖励分解与通信预算,只改变协商协议、价值分解、人口多样性或编排拓扑,并以团队回报、适应速度、协议稳定性和失败传播为共同结果;量纲写成“由编排引起失败数/失败总数”。若同等预算下不优于强基线,或换数据、平台与人群便失效,命题只能收窄。

主证据来自Cemri、Pan、Yang等,2025年《Why Do Multi-Agent LLM Systems Fail?》arXiv:2503.13657,DOI:10.48550/arXiv.2503.13657。具体设计与读数是:研究从7个框架收集1600余条标注轨迹,并以150条轨迹构建失效分类;14种失效归入系统设计、主体错位和任务验证三类,标注者一致性κ为0.88。2025年前后的多代理基准与1642条执行轨迹分析记录协调、验证和角色执行等故障;部分系统在代理数增加后性能反降。这笔证据把非平稳性、信用分配、通信语义和伙伴适应从背景变量改成可复算的中间量,并留下样本、版本、阈值或预算检查点。主证据年份决定幕归属;核验应以篇名反查作者、卷页或DOI以及这里采用的读数。

争议集中在“增加代理是否增加验证与终止失败”。对照证据见Dafoe 等,2021年《Nature》593:33–36:议程把与陌生代理、人与机构协作列为独立能力,并要求报告伙伴分布、通信限制和失败代价;团队总回报不再是唯一指标。它显示语言型代理的自然语言流畅度会掩盖状态不一致;换任务、分母或组织流程后,成本可能转移到未记录处。争论要收敛,须预注册口径、公开负结果并由独立站点重做,同时报告均值、尾部、失败类型与维护成本。

它改变的最低交付责任是:报告由编排引起的失败数占失败总数的比例,并给出失败的分类。不做这个拆分,团队表现不佳会被一律归因为模型能力不够,从而引向错误的改进方向。同时应报告与单代理基线的对照——多代理方案必须证明自己优于一个配置良好的单代理,这一条基线在很多报告里缺席。

与本块第三条《可执行规范》和第八条《共识与消息传递》一起构成本块的收口:责任漂移对应的是承诺无法被检查,错误共识对应的是高效协调不保证结论正确。**这两条二十年前就已被研究清楚的机制,正是当下这波多代理系统失败的主要形态**——本条与它们的呼应,是这一整块二十年跨度最值得留意的一处。

位置E——把『多代理失效放大:代理越多不保证结果越好』成立所需的边界环境作为首要显露 单因决定『多代理失效放大:代理越多不保证结果越好』当前结论的最小充分项只有:通信错误、责任漂移、重复验证与错误共识会随链路增加累积,规模必须用端到端可靠性评价 预设〔02 单一读数代表复杂对象〕多代理失效放大造成的变化大于版本、样本选择和测量噪声造成的变化 量纲由编排引起失败数/失败总数 失效当控制额外信息与调参预算后读数不优于基线,且跨站点复现率低于一半时失效;越多的代理与验证环节使单点错误越容易被发现,但当验证本身也由不可靠代理执行时,环节的增加反而使错误在链路中被互相确认并放大。自曝『多代理失效放大:代理越多不保证结果越好』的原始材料只直接支持“主证据来自Cemri、Pan、Yang等,2025年《WhyDoMulti-AgentLLMSystemsFail?》arXiv:2503.1365”,没有自动覆盖边界外对象 空栏『多代理失效放大:代理越多不保证结果越好』账本尚未纳入的中止路径、未达阈值对象、极端尾部与长期环境回写 异名组织学称「层级增加带来的信息衰减」,工程称「串联系统的可靠性随环节数下降」;另见第255号第十九条『智能体软件工程与长程基准』

◎ 二十年连起来看

第一幕证明协调可由局部消息、可执行承诺、联盟成本和他者信念组成,而非必须由中央全知控制。 第二幕把学习非平稳性、信用分配、陌生伙伴和语言代理失败推到中心,基准高分不再足够。 两幕不是工具换代,而是评价单位不断扩大:第一幕找出局部上界、误差、约束或行为机制,第二幕把它们放进真实系统、组织与生命周期。只有当旧默认被写成可检查条件,新方法才构成转向。

被继承的是协议可执行性:早期承诺与一致性算法,后来演化为价值分解、通信学习和代理编排中的状态接口。 这一判据在二十条里反复出现:条件、操作、读数与边界必须形成可复查链条。工具名可以变化,数据来源、分母、中止、未达阈值或无法归类的对象和复现路径却不能省;这也是碰撞行能够抽取并与别的领域通约的基础。

被推翻的是“单体能力越强,团队自然越强”;仍未解决的是团队失败时如何定位责任并安全终止。 因而,本领域尚未解决的核心不是再提高一个百分点,而是如何在陌生伙伴、开放任务和有限验证预算下形成可迁移且可追责的协作。若未来五年的工作仍只给均值和排行榜,不给真实部署、尾部和反例,它不会继续这条二十年主线。

◎ 三个常见误解

误解一:代理数量越多答案越好。它容易被相信,是因为单次榜单只显示结果而隐藏伙伴策略、信息结构、奖励分解与通信预算、中止、未达阈值或无法归类的对象与选择过程。正确表述是把收益限定在同一分母和同一边界内,再看是否跨环境保持。

误解二:共享奖励会自动产生合作。它容易被相信,是因为工具把一部分依赖封装起来,看上去像整个系统已经被封装。正确表述是任何抽象都只覆盖一段链条,外部数据、版本、组织和硬件仍需单独核验。

误解三:形成通信符号就形成了语言。它容易被相信,是因为成功案例适合传播,而涌现语言可能只是训练伙伴间的私码通常不进入摘要。正确表述是收益与边界、代价、反例必须同时报告,不能把局部改进外推成普遍保证。

◎ 与相邻领域的接口

与〈信息检索与推荐系统〉的接口在于:用户、创作者与排序器形成策略响应和反馈回路。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。

与〈形式化方法与程序验证〉的接口在于:协议、角色、终止条件和权限必须能被状态机检查。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。

与〈嵌入式与实时系统〉的接口在于:多自主体部署还受网络时限、传感误差和运行时保障约束。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。

与〈博弈论〉的接口在于:均衡给出稳定性概念,本面板关注协议如何在有限计算中执行。 分工判据是,本块负责把计算对象、系统行为与可核对读数写清;相邻领域负责它自己的机制、制度或物理约束。若同一现象使用不同术语和分母,两边都保留,并在碰撞行登记异名。

◎ 争议现场

未收敛的争论是:集中训练信息是否造成不可部署优势。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:用不少于三个独立平台或人群,预注册共同基线、预算和停止规则,并以团队回报、适应速度、协议稳定性和失败传播的分层分布比较;若方向一致且边界可预测,争论才收敛。

未收敛的争论是:人口多样性何时提高泛化而非仅增加噪声。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:建立版本化公开基准,保存失败配置、调参轨迹和维护成本,以盲评方式复跑;若收益只在事后选择的路径上出现,应判为未收敛。

未收敛的争论是:语言代理失败应归因于模型、协议还是验证器。支持方强调已有正向设计,反对方指出分母、样本或环境不足以外推。要怎样才能收敛:把局部结果接入真实工作流或制度现场,连续观测至少一个完整周期,并报告最差分位与反事实对照;只有端到端读数同向,才能排除成本转移。

◎ 往下五年看什么

观察点是更换未见伙伴后的团队回报保留率。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。

观察点是通信带宽减半时性能与协议可解释性的变化。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。

观察点是失败轨迹中系统设计、代理错位与验证缺口占比。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。

观察点是代理数从一到多时边际收益、成本和终止失败率。应固定统计周期、样本覆盖与质量门槛,按年度公布分布而非只公布最好值;若连续两次独立复测方向相反,就说明该读数尚不足以承担领域判据。

◎ 可与哪些领域对撞

本块第15条《学习中的策略反应:优化自己的回报会改变别人怎么学》与第353号第十七条《算法混淆》可以对撞。它们共享的预设是:两边都默认主体策略可当作外生环境处理。相反点在于:对手学习意识把他者更新纳入自己的动作,算法混淆把推荐造成的偏好变化纳入评价。若两边都成立,若两边都成立,第三项就是系统需要联合反事实而非固定环境下的单体最优。

本块第4条《联盟形成成本:最强组合未必能稳定存在》与第155号第一幕甲条《价格结构而非价格水平》可以对撞。它们共享的预设是:两边都默认合作结构由多方成本与收益的分配决定。相反点在于:联盟形成计算哪些主体应组合,平台价格结构决定哪一边被补贴。若两边都成立,若两边都成立,第三项就是稳定合作取决于成本如何跨角色分摊。

本块第5条《微观规则—宏观涌现:自组织也需要可验证机制》与第065号第一幕戊条《入侵种与新组合群落》可以对撞。它们共享的预设是:两边都默认局部交互能生成没有中央设计的宏观结构。相反点在于:群体涌现从规则推宏观模式,新组合群落则显示历史迁移会产生无先例生态。若两边都成立,若两边都成立,第三项就是涌现结构必须在开放成员变化下重新定义稳定性。

本块第19条《语言型代理编排:对话可以成为可编程控制平面》与第086号第一幕甲条《参与式文化的乐观》可以对撞。它们共享的预设是:两边都默认增加发言者或代理数会提高集体产出。相反点在于:语言型代理编排会放大终止和验证失败,参与式文化也发现能发声不等于能被看见。若两边都成立,若两边都成立,第三项就是集体智慧需要分配注意、权限和终止责任的制度层。

◎ 十条可做的研究命题

对手模型是动态信念的因果识别命题:在控制共同预算后,代理应维护对他者类型、目标和学习过程的信念,并依据新行为更新;怎么做:在真实部署中随机或准随机改变协商协议、价值分解、人口多样性或编排拓扑,固定伙伴策略、信息结构、奖励分解与通信预算,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或训练伙伴改变后策略是否仍有效不再预测失败,则命题被证伪。

集中训练、分散执行的测量命题:在控制共同预算后,训练阶段可用全局状态和其他代理动作稳定学习,执行时再限制为局部策略;怎么做:建立跨三种环境的统一日志,直接测量“部署时可用信息量/训练时信息量”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或团队奖励是否掩盖个体无效动作不再预测失败,则命题被证伪。

单调价值分解的复现重估命题:在控制共同预算后,只要联合价值对各代理局部价值单调,就能保留分散argmax并表达非线性协作;怎么做:用新版本、强基线和独立团队重做第5条的关键设计,保存全部失败路径;什么算证伪:若效应低于测量误差、跨环境方向不一致,或通信符号能否跨任务组合与解释不再预测失败,则命题被证伪。

不完全信息合作的跨领域命题:在控制共同预算后,当信息分散且沟通受限时,代理必须推断伙伴信念、意图与约定;怎么做:把相邻领域的审计、因果或能量账本移入本领域,以共同分母连接团队回报、适应速度、协议稳定性和失败传播;什么算证伪:若效应低于测量误差、跨环境方向不一致,或自我博弈是否过拟合固定生态不再预测失败,则命题被证伪。

学习中的策略反应的因果识别命题:在控制共同预算后,元梯度或递归推理可把对手下一步学习纳入当前决策,策略因此具有塑形作用;怎么做:在真实部署中随机或准随机改变协商协议、价值分解、人口多样性或编排拓扑,固定伙伴策略、信息结构、奖励分解与通信预算,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或增加代理是否增加验证与终止失败不再预测失败,则命题被证伪。

顺序社会困境的测量命题:在控制共同预算后,在连续环境中,资源再生、空间和历史会改变激励,社会结果是策略与环境共同生成;怎么做:建立跨三种环境的统一日志,直接测量“合作行动数/社会困境总回合”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或训练伙伴改变后策略是否仍有效不再预测失败,则命题被证伪。

语言型代理编排的复现重估命题:在控制共同预算后,可用角色、消息、工具权限和终止条件编排多个语言模型代理,形成动态协作程序;怎么做:用新版本、强基线和独立团队重做第13条的关键设计,保存全部失败路径;什么算证伪:若效应低于测量误差、跨环境方向不一致,或团队奖励是否掩盖个体无效动作不再预测失败,则命题被证伪。

分布式约束优化的跨领域命题:在控制共同预算后,把局部变量、约束和效用分配给代理,可用消息传递在不暴露全部数据时逼近或达;怎么做:把相邻领域的审计、因果或能量账本移入本领域,以共同分母连接团队回报、适应速度、协议稳定性和失败传播;什么算证伪:若效应低于测量误差、跨环境方向不一致,或通信符号能否跨任务组合与解释不再预测失败,则命题被证伪。

可执行规范的因果识别命题:在控制共同预算后,承诺、权限、义务和违约条件应有形式语义,并能被代理在运行时监控;怎么做:在真实部署中随机或准随机改变协商协议、价值分解、人口多样性或编排拓扑,固定伙伴策略、信息结构、奖励分解与通信预算,比较前后与未处理组;什么算证伪:若效应低于测量误差、跨环境方向不一致,或自我博弈是否过拟合固定生态不再预测失败,则命题被证伪。

微观规则—宏观涌现的测量命题:在控制共同预算后,涌现结果取决于拓扑、噪声、密度和反馈,设计必须检验宏观性质而非只展示动画;怎么做:建立跨三种环境的统一日志,直接测量“目标宏观模式出现次数/仿真运行总数”并分层报告尾部;什么算证伪:若效应低于测量误差、跨环境方向不一致,或增加代理是否增加验证与终止失败不再预测失败,则命题被证伪。

◎ 资料核验

  1. Farinelli, A., Rogers, A., Petcu, A., & Jennings, N. R. (2008). Decentralised coordination of low-power embedded devices using the Max-Sum algorithm. Proceedings of AAMAS 2008.
  2. Yeoh, W., Felner, A., & Koenig, S. (2010). BnB-ADOPT: An asynchronous branch-and-bound DCOP algorithm. Artificial Intelligence, 174(12–13), 951–997.
  3. Fornara, N., & Colombetti, M. (2007). Specifying and enforcing norms in artificial institutions. Dagstuhl Seminar Proceedings, 07122, 1–16. https://doi.org/10.4230/DagSemProc.07122.27.
  4. Rahwan, T., & Jennings, N. R. (2007). An algorithm for distributing coalitional value calculations among cooperating agents. Artificial Intelligence, 171, 672–684.
  5. Brambilla, M., Ferrante, E., Birattari, M., & Dorigo, M. (2013). Swarm robotics: A review from the swarm engineering perspective. Swarm Intelligence, 7, 1–41.
  6. Stone, P., Kaminka, G. A., Kraus, S., & Rosenschein, J. S. (2010). Ad hoc autonomous agent teams: Collaboration without pre-coordination. Proceedings of AAAI 2010.
  7. Albrecht, S. V., & Ramamoorthy, S. (2013). A game-theoretic model and best-response learning method for ad hoc coordination. Proceedings of AAMAS 2013.
  8. Olfati-Saber, R., Fax, J. A., & Murray, R. M. (2007). Consensus and cooperation in networked multi-agent systems. Proceedings of the IEEE, 95(1), 215–233.
  9. Lowe, R., et al. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments. Advances in Neural Information Processing Systems, 30.
  10. Foerster, J., et al. (2018). Counterfactual multi-agent policy gradients. Proceedings of AAAI 2018.
  11. Rashid, T., et al. (2018). QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning. Proceedings of ICML 2018. PMLR.
  12. Papoudakis, G., Christianos, F., Schäfer, L., & Albrecht, S. V. (2021). Benchmarking multi-agent deep reinforcement learning algorithms in cooperative tasks. Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks.
  13. Bard, N., et al. (2020). The Hanabi challenge: A new frontier for AI research. Artificial Intelligence, 280, 103216.
  14. Vinyals, O., et al. (2019). Grandmaster level in StarCraft II using multi-agent reinforcement learning. Nature, 575, 350–354.
  15. Foerster, J., et al. (2018). Learning with opponent-learning awareness. Proceedings of AAMAS 2018.
  16. Lazaridou, A., Peysakhovich, A., & Baroni, M. (2017). Multi-agent cooperation and the emergence of natural language. Proceedings of ICLR 2017.
  17. Leibo, J. Z., et al. (2017). Multi-agent reinforcement learning in sequential social dilemmas. Proceedings of AAMAS 2017.
  18. Dafoe, A., et al. (2021). Open problems in cooperative AI. Nature, 593, 33–36.
  19. Wu, Q., et al. (2023). AutoGen: Enabling next-gen LLM applications via multi-agent conversation. arXiv:2308.08155.
  20. Cemri, M., Pan, M. Z., Yang, S., Agrawal, L. A., Chopra, B., Tiwari, R., et al. (2025). Why do multi-agent LLM systems fail? arXiv:2503.13657. https://doi.org/10.48550/arXiv.2503.13657.
  21. Wu, Q., Bansal, G., Zhang, J., et al. (2024). AutoGen: Enabling next-gen LLM applications via multi-agent conversation. Proceedings of COLM 2024.
新思想前沿 是一个持续撰写的专栏:近二十年,各主要领域最要紧的思想转向。本块采用两幕体例——上一个十年八条、这十年十二条,每条给出提出者、年份与出处,写清它推翻了什么、靠什么读数立住、以及它自己的边界;每条正文之后另附一行碰撞行(预设/量纲/失效/异名),供跨领域取源比对;文末附资料核验。 · ← 回到学科面板