‹ 少敏 · 全部作品
📖 长文阅读
学员专栏 · 少敏 · 人机系统的效力审计

众声如何成为众智:多智能体系统中独有信息的选择性传递、因果保真与证伪

有效独立性不是智能体集合的静态属性,也不是分歧消息的总存活量,而是让正确且不可替代的差异对最终判断保持可归因效力的路径能力
作者 少敏 · SDE 学员 · 约 2.1 万字 · 发表于2026年8月5日
① 理论母文少敏的理论判断 ② 诠释文日常类比 · 约5000字 ③ 实用文技术流程 · 约5000字
摘 要

多智能体系统常以角色数量、模型异质性、回答分歧或辩论轮数作为“认知独立性”的替代指标。然而,成员彼此不同,并不意味着差异进入了集体判断;让更多分歧进入系统,也不意味着系统更接近真值,因为错误而新奇的命题同样可能被放大。本文在集成学习、多智能体辩论、社会认识论与组织信息加工研究之间建立判决性对照,提出“选择性认知传递”框架:有效独立性不是智能体集合的静态属性,也不是分歧消息的总存活量,而是系统保留正确且不可替代的独有信息、抑制错误独有信息,并使前者对最终判断保持可归因效力的路径能力。本文区分表述多样性、误差去相关、证据增量性、路径传递性与选择性保真五个层次;进一步以阶段级正确/错误传递曲线刻画每一道门的辨别能力,以预算保持的匹配递送干预估计“本可实现的认识价值”,并以实际效力与反事实可实现价值之间的正向保真缺口定位价值损失。在这一机制链上,本文进一步引入四个动态条件:当选择判据进入奖励或路由闭环时,成员生成分布随之改变,静态选择性必须接受对抗再认证;以真值已知、无下游效力的哨兵命题持续审计在役路径;把被阻断命题纳入带复活条件的休眠登记,从而区分可恢复与不可逆损失;追踪本轮裁决如何通过知识吸收、正确异议的自我抑制与表面模仿改变下一轮储备。文章提出五项可预注册研究和十四条理论死亡条件。本文的核心结论不是“差异越多越好”,也不是“保留异议即可”,而是:只有能够区分有认识价值的差异与无价值的新奇性、在成员策略适应下维持这种区分、为误判保留安全且可逆的通道,并把正确差异的潜在价值跨轮次保存为实际效力的系统,才具有有效认知独立性。

关键词:多智能体系统;认知独立性;选择性传递;因果保真;激励相容;哨兵命题;可逆排除;储备再生产

SDE 创新智商:盲评 149.8

盲评为投稿原稿未经任何编辑改动时评出的五维结构化评分(S 结构精确度×.20 + D 差异锐度×.25 + E 纠缠深度×.20 + I 不可还原性×.20 + F 可证伪性×.15),近邻比对按全球公开文献口径从严,并计入作者本人既发论文构成的站内自撞。本文正文未经编辑改动,分数对应投稿原稿;文末「站内划界」一节由编辑增补,不计入本分数;按本站铁律须另由独立评分者复核。(评分:Claude · 2026年8月5日)

1. 问题的转移:从“有几个声音”到“差异走了多远”

多智能体系统的直观吸引力来自一个简单类比:一个人可能遗漏,几个人可以互相纠错;一个模型可能偏执,几个模型可以形成多视角。早期多智能体辩论研究确实展示了多个语言模型实例通过交换答案与理由改善部分数学和事实任务的可能性[1],异质模型组合也在部分推理基准上表现出优势[16]。但后续研究不断发现,辩论并不稳定优于计算量匹配的单智能体方法;同源模型可能共同犯错,智能体会在互动中趋同,裁判还可能被冗长、过度自信或策略性论证误导[2-5]。2026年的新证据进一步缩小了本文可声称的创新范围:信息不对称研究已经证明独立证据分配可能带来预测收益[21];选择瓶颈研究把聚合器质量置于生成器多样性之前[20];分歧消息保留方法已经把“听见什么”变成协议变量[22];信息论研究则指出封闭、非单射聚合会压缩证据相关信息[19]。因此,“有独立证据”“保留分歧”或“聚合器很重要”均不能再作为本文的独占贡献。

集成学习早已提供了第一把手术刀。Krogh 与 Vedelsby 的歧义分解说明,在平方损失及相应条件下,成员差异只有在不同时抬高成员误差时才可能降低集成误差[6]。Kuncheva 与 Whitaker 对多种分类器多样性指标的比较,以及后续对一般损失与集成选择的研究进一步表明,分歧率、Q 统计量、双错率等指标与集成准确率之间没有一种脱离任务、能力和聚合规则而普遍成立的单调关系[7,12,17]。社会认识论与组织研究则提供第二把手术刀:群体拥有分散信息,不等于这些信息会被提出、认真检查并整合;多样性的认识收益需要“信息阐发”这一中介过程[8-10]。

上述证据共同迫使问题再次转移。需要解释的不只是成员是否不同、差异是否到达,而是:

当正确独有命题与错误独有命题同时进入系统时,哪一道门能够辨别二者;一条正确且不可替代的信息所携带的潜在价值,又有多少真正穿过编排结构到达结果?

本文把这一性质称为选择性认知传递。这里的“传递”不是通信层面的消息到达,“选择性”也不是简单删掉少数意见,而是认识价值的差异化保存:正确且非冗余的命题比内容匹配的错误独有命题更可能获得议程位置、同等检验、聚合利用与结果效力。由此,系统既不能靠压平差异获得高分,也不能靠无差别广播所有新奇性冒充独立。

2. 五种经常被混同的“独立”

2.1 表述多样性:声音不同

同一模型在不同温度、提示词或角色标签下,可以产生词汇、语气与论证顺序不同的输出。这类差异对探索可能有用,但它首先是生成多样性,而不是认知独立性。token 级编辑距离或嵌入距离无法判断两个答案是否共享同一事实错误,也无法区分“换一种说法”与“引入一条新证据”。因此,表述多样性只能作为候选路径的发现指标,不能作为独立性认证指标。

2.2 误差去相关:错误不同

当任务具有可判定真值时,可以比较成员错误向量。低错误相关有助于判断是否存在互补纠错空间,但仍非充分条件。两个低能力模型可以“各错各的”;所有成员也可能受到同一数据缺口影响,只是在有限样本上表现为不相关。反过来,多个高能力成员因共同识别真值而高度一致,并不构成虚假独立。相关性必须在控制真值、题目难度、成员能力和共同资源之后估计。

2.3 证据增量性:知道不同

若成员 i 的证据包为 E_i,其他成员证据为 E_(-i),真值为 Y,任务与能力协变量为 C,那么证据增量性可写为:

表示在已知其他证据后,成员 i 的证据仍提供关于真值的新增信息;实际估计可采用分类器型条件互信息方法,但必须报告有限样本偏差与稳健性检验[13]。这个定义比“训练数据分布的 Bhattacharyya 距离”更贴近可测试对象:现实中的闭源模型训练分布通常不可见,两个训练集距离较大也不保证其中差异与当前任务真值有关。本文只测量运行时可审计的检索文档、传感器读数、工具结果或人工证词,并通过遮蔽与置换实验估计其条件增量。

2.4 路径传递性:差异生效

即使 ,系统也可能在议程、相互审查或聚合阶段把它清除。设成员 i 产生的经外部判定为相关且正确的独有命题集合为 Q_i^+,其中进入正式比较并在最终推理记录中存活的集合为 G_i,则成员级差异存活率为:

但进入记录不等于改变结果,因此还需单独估计结果效力。以 Z 表示完整系统输出,Z(-Q_i+) 表示只遮蔽成员 i 的正确独有命题、其余内容与预算保持不变时的反事实输出,L 为预注册损失,则:

τ_i 测量程序存活,η_i 测量结果效力;二者不能相互替代。若同一条命题由多数成员、少数成员、人工专家或检索工具提出时进入最终结论的概率不同,则差异可能被来源标签或拓扑位置折价。只看最终正确率也无法定位这种阻断。

2.5 选择性保真:值得保留的差异被保留

路径传递性仍可能产生假阳性。一个把所有新奇命题无差别送达终点的系统,正确独有命题存活率可能很高,但错误独有命题也同样被放大;一个只奖励与多数“不同”的保留器,还可能系统性选择最醒目而非最有证据的错误[22]。因此,传递量不能直接等同于传递质量。

设在阶段 s 前可判定的正确独有命题为 Q+,内容难度、长度、来源标签和进入时点匹配的错误独有命题为 Q-。定义阶段级正确传递率与错误传递率:

阶段选择性为:

J_s 借用信号检测思想,但测量对象不是单次分类,而是同一命题沿编排路径的累计命运。T_s^+ 高而 T_s^- 也高,表示“高通量、低辨别”;二者都低,表示“压缩一切”;只有 T_s^+ 保持且 T_s^- 下降,才表示系统在传递中形成了认识选择性。为避免把某个阈值包装成普遍常数,研究应报告不同准入或审查阈值下的整条双轨传递曲线及其置信区间。

3. 核心建构:储备、传递与选择性保真

3.1 储备独立性

储备独立性指成员层面存在尚未被其他成员覆盖的、与任务真值相关的证据或推理贡献。它由两类量共同约束:条件化后的错误结构与命题/证据增量性。储备独立性回答“系统内部有没有可用差异”,但不回答该差异是否被集体使用。

3.2 传递独立性

传递独立性指储备差异在编排路径中保留认识效力的程度。它回答“可用差异有没有走到结果”。议程生成器可以拒绝某类问题,通信拓扑可以让少数意见从未抵达裁判,聚合器可以系统性偏好多数或强势模型,最终解释器也可以在总结中删除冲突证据。上述任一环节都可能让成员独立、系统不独立。

3.3 选择性保真

选择性保真指系统把“差异是否值得保留”与“差异是否醒目”分开的能力。它要求编排结构对正确、相关且不可由其他成员替代的命题保持较高传递率,同时对内容匹配的错误独有命题保持较低传递率。该概念切开了三个近邻:信息不对称只保证成员获得不同输入[21];分歧保留只保证某些不同消息继续传播[22];选择瓶颈只说明聚合质量决定多样性是否有益[20]。选择性保真进一步询问:聚合器究竟保留了“最不同的”命题、“最像正确的”命题,还是对最终真值具有不可替代边际价值的命题?

由此得到一条更强的反例:系统可以拥有高储备独立性和高消息传递率,却具有低选择性保真。如果正确与错误独有命题以近似相同概率通过每一道门,差异虽然被保留,系统仍没有把众声转化为众智。

3.4 策略稳健性:当选择门成为激励结构

前述静态测量隐含成员生成分布在评价期间近似不变。一旦 J_s 或其他选择性指标被用于奖励、路由或成员淘汰,这一分布便成为门规则的内生函数,原有静态认证不再自动有效。代理指标被持续优化时可能偏离真实目标;但这种偏离并非逻辑必然,其方向与速度取决于代理误差、可观测反馈和成员的适应能力[24-25]。可检验的风险是:成员学会生产在门的可观测特征上与正确独有命题相似的输出——匹配长度、证据格式、置信措辞与进入时点——却不承担相同的真值约束。此时高 J_s 可能只反映门对一种可学习风格的偏好。

由此,选择门在概念上必须从过滤器升格为契约:它不仅事后筛选命题,还事前塑造命题的生成分布。相应地,选择性保真需要区分两个强度等级:

观察选择性:在成员未针对门优化时,T_s^+ > T_s^- 成立;

策略稳健选择性:在成员被明确激励去最大化自身命题存活率、且可观测门的历史裁决时,T_s^+ > T_s^- 仍然成立,且差距的萎缩速率低于预注册界限。

后者成立的候选机制条件是:门的判据应锚定在成员难以廉价伪造的信号上——可独立复核的证据谱系、可执行的排除性预测、对已知错误假设的可验证排除——而非只锚定在措辞、置信度或新奇度等低成本特征上。一个主要依赖表面特征的门,其 J_s 在对抗压力下的半衰期刻画的是该门当前认证的有效期,而不是系统的永久属性。第 6.5 节给出对抗认证方案;第 8 节规定:若门的选择性在预注册优化压力下衰减至与新奇性指标等效,则选择性主张必须缩限为“未受攻击条件下的描述性性质”。

这一层与近邻的判决差异是:分歧保留研究[22]优化“听见什么”,选择瓶颈研究[20]优化“选择器多好”,二者都把成员生成分布当作外生给定;本文把生成分布内生化为门的函数,并要求选择性在这个反馈闭环中而非闭环外被认证。

3.5 有效认知独立性的合取判据

本文不把多个异质量强行压缩成未经校准的单一分数。一个系统被判为具有有效认知独立性,至少需要通过六道门:

能力门:比较对象在任务能力、计算预算、检索权限与延迟上达到预注册的等效范围;

增量门:至少两个成员持有对 Y 有条件增量的信息或生成经验证的独有正确命题;

传递门:独有命题相对于内容匹配的对照,能够进入检验、聚合并影响结果;

选择门:正确独有命题的阶段传递曲线稳定高于错误独有命题,且差异不由长度、置信措辞、来源声望或进入时点解释;

稳健门:上述效应在提示改写、温度、上下文次序和任务域变化后仍保持方向与最低实质效应;

策略门:当成员可观测门的历史裁决并被激励最大化自身命题存活率时,选择门的 J_s 衰减速率不超过预注册界限,即选择性对成员的策略适应稳健。

这一定义产生两个反转。第一,模型异质性既非必要条件,也非充分条件:异质模型可能依赖相同检索源并被同一聚合器压平;同一基底模型的多个实例也可能因获得因果上独立的证据、采用隔离推理并受差异保留机制约束,而形成有限的有效独立性。第二,传递更多差异也非单调有益:只有传递机制对正确的非冗余信息具有辨别力,增加通量才可能提高集体表现。独立性因此属于“成员—证据—编排—任务—判别门”的关系,而不属于模型名单或消息数量。

4. 从错误相关到认知独立:六项传递条件

“错误相关趋零时,认知独立性与证据来源多样性同向”仍然是过强命题:错误相关趋零既不保证成员有能力,也不保证证据差异与真值有关,更不保证聚合器能识别正确差异。更严格的传递定理候选如下。

设 R_i 为控制任务难度、真值类别、成员能力和共享资源后的错误残差,E_i 为可审计证据,O_i 为成员输出,Z 为集体输出。由成员层面的误差去相关推到系统层面的认知独立,至少需要:

非平凡能力:各成员在目标任务上的校准表现高于预注册的无信息基线,且组间能力达到等效;

条件去相关:R_i 与 R_j 的依赖在控制共同难度与共同冲击后仍显著降低,而非由样本构成制造;

证据相关性:,来源差异必须对真值有增量信息;

聚合可传递性:聚合规则对经验证的少数独有命题具有非零敏感度,不把分歧机械压成多数;

认识选择性:在内容、长度、来源与时序匹配后,正确独有命题的阶段传递概率稳定高于错误独有命题,而不是仅偏好新奇、置信或角色声望;

干预稳定性:遮蔽、置换或恢复某一证据路径时,集体输出按预注册方向改变。

只要其中一项失败,“错误不同”就不能被提升为“认识独立”。这也解释了为什么单纯追求输出分歧或分歧保留可能降低质量:多样性、能力与选择性并非可独立任意增加的三个旋钮[6,11,18,22]。

5. 测量框架

5.1 条件残差错误的有效秩

对有真值任务,先以分层项目反应模型或广义线性混合模型估计题目难度、领域、成员能力、模型家族与共享工具的影响,再获得每个成员的错误残差向量 R_i。由残差相关矩阵 K 的特征值 λ_1,…,λ_m 构造归一化谱 p_k=λ_k/Σ_jλ_j,定义有效秩:

并归一化为:

D_R∈[0,1];越接近 0,误差主要集中在少数共同方向;越接近 1,残差错误维度越分散。有效秩用谱熵表达矩阵的有效维数[14]。它不等同于集成收益,必须同时报告成员校准、双错率、集体损失与置信区间。相比最大/次大特征值比,有效秩不会产生“比值必然不小于1却设置小于0.5阈值”的数学矛盾,也避免把“谱间隙越大”和“同质性越高”混写。

5.2 证据谱系增量

每条可审计命题记录 claim_id—source_id—retrieval_query—tool_result—agent_id—timestamp。证据差异不以域名数量或文档嵌入距离直接认证,而通过三个层次评估:

谱系重复率:不同成员最终依赖的原始来源是否实际重复;

条件预测增益:加入成员 i 的证据后,盲评器对真值的对数损失或 Brier 分数是否改善;

遮蔽效应:移除该证据但保持其他内容与预算不变,正确结论是否按预期减少。

只有后两项成立,来源差异才从“出处不同”升级为“认识上有增量”。

5.3 命题级正确分岔率

token 差异对开放文本几乎必然出现,不能判定认识分岔。本文先把输出转换为可核验命题图,合并语义等价断言,再由盲评者或任务判定器标注正确性、相关性和决策影响。相对能力与预算匹配的基线 B,系统 M 的正确分岔率定义为:

同时报告“错误独有命题率”,防止系统通过制造更多错误提高分岔。开放任务不强行使用唯一真值,而采用多评审的命题可支持性与任务价值评分,并报告分歧。

5.4 差异传递率与阻断恢复效应

差异存活率 τ_i 描述经验证的独有命题有多少进入正式比较并保留到最终记录,结果效力 η_i 则描述遮蔽这些命题造成的损失变化。为识别阻断位置,对相同内容做通道置换:由不同角色、不同模型、人工输入或匿名工具通道提交同一命题,并保持证据、措辞与时序不变。若通道置换改变其准入、检验强度或采纳概率,说明路径本身施加了影响。

进一步定义阻断恢复效应:只改变某一环节——议程准入、通信边、否决权限或聚合规则——观察原先被阻断的正确命题是否恢复效力。哪个最小干预稳定恢复差异,责任和设计修复就优先指向哪个环节。这一指标把“系统没有听见异议”转化为可定位的机制,而非事后叙事。

5.5 反事实可实现价值与正向保真缺口

τ_i 与 η_i 仍未回答一个更严格的问题:系统实际获得的效力,占这条正确独有信息“在指定编排器中本可实现价值”的多少。为构造可比较的反事实,先运行不含 Q_i^+ 的基线 Z(-i);再以预算保持的匹配递送干预把 Q_i+ 连同原证据送达最终比较器,得到 Z^(⋆ i)。干预必须保持总 token、工具调用、裁判和时限不变;若输入窗口已满,则随机移除一条经先导研究判为低边际价值、且与 Q_i^+ 长度匹配的消息。若无法满足这一交换条件,V_i^⋆ 只能解释为“信息加预算”的联合上界,不能与实际路径效力作因果比较。定义:

实际路径效力仍为 η_i。二者之差可能为负:实际路径中的交互有时会优于终端递送。因此,本文把可归因于传递不足的对象限定为正向保真缺口:

当 V_i^⋆ 显著为正而 η_i 接近零时,系统并非“没有有用差异”,而是未实现指定递送干预已证明可实现的价值。若 V_i⋆−η_i≤0,该观察记为“无正向缺口”,并单独报告交互增益,不能反向解释为超额保真。只有在预注册的单调性与正分母条件成立时,才把 φ_i=η_i/V_i⋆ 作为补充的归一化保真率;否则并列报告 V_i^⋆、η_i 与 Γ_i^+,避免比率爆炸或交互效应造成伪精确。

为定位价值在哪一道门损失,依次在命题生成后、议程后、相互检验后和聚合前恢复同一命题,得到阶段恢复输出 Z((s))。每次恢复都采用与终端干预相同的预算保持交换。相邻阶段恢复效应之差构成逐门价值损失剖面。若一次最小恢复在议程后即可消除大部分 Γ_i+,瓶颈位于准入;若直到聚合前恢复才有效,瓶颈位于检验或总结。该剖面不同于信息论上的总压缩界,也不同于“选择器好不好”的单参数模型:它要求对同一条真值相关差异做内容保持的路径干预,并把潜在价值与实际效力放在同一损失尺度上比较。

逐门差异只有在恢复位置随机化、命题内容与总预算一致、终端比较器保持不变、恢复干预不额外改变后续路径的条件下,才可解释为阶段因果损失。若各阶段存在交互,本文不强迫损失相加,而报告:

其中 δ_(is) 是在预注册干预顺序下可识别的阶段恢复差,ε_i 是非加性交互与未识别残差。若 ε_i 持续占据主要部分,逐门剖面只能称为描述性可恢复性分析,不能作为责任归因依据。

5.6 路径可追责性:独立但不并入正确性

路径可追责性是治理轴,不应偷换为认知正确性。本文以四项检查报告:命题能否回溯到来源;每次删改能否回溯到角色和规则;聚合器是否记录排除理由;受影响的人能否复核或申诉。一个系统可能认知表现较好却不可追责,也可能记录完备却判断错误。两轴应并列报告,避免用“可解释”替代“正确”,或用“正确”豁免责任。

5.7 哨兵命题:局部真值下的运行时选择性审计

双轨传递曲线面临一个验证者回退:标注 Q^+ 与 Q^- 需要真值裁判,但部署方通常只在有限子域掌握可靠真值。因此,实验室认证无法单独支持在役系统的持续判断,而 3.4 节表明选择性可能随成员适应而漂移。

本文提出哨兵命题审计作为受限的现场解法:审计方预先构造小规模、真值已知的正确/错误孪生命题库,在随机时点与随机通道进入影子路径,追踪其在议程、检验和聚合门的命运。哨兵不得影响用户可见输出、真实工具调用或不可逆行动;被测系统只返回门决策的副本。由此可在不污染生产决策的条件下持续估计 T_s+、T_s- 与 J_s。该估计只认证哨兵覆盖的局部可判定子域,不能直接外推为全任务域正确率。

哨兵审计有效需要三项纪律:分布可比——哨兵在长度、文体、证据格式与来源标签上与自然命题分布匹配,否则测得的是哨兵识别;零下游效力——错误哨兵只在隔离影子路径运行,并接受泄漏测试;防疫苗化——哨兵库持续轮换,若系统或运营者学会识别其签名,认证立即失效。哨兵曲线能否早于任务损失预警选择性退化,不作为先验事实,而列为第 7 节的竞争性预测。

该工具与近邻的判决差异:LLM 幻觉检测与事实核查基准测量输出的正确率;哨兵审计测量路径的辨别力——同一系统可以输出大体正确却对注入的正确异议一概门杀,这种病理只有路径级探针可见。

5.8 休眠登记与正向保真缺口的可逆分解

前节把传递不足造成的可避免损失记为正向保真缺口 Γ_i^+,但排除并不必然是终局。系统可以要求每一道门对被阻断命题执行休眠登记而非删除——记录命题内容、证据谱系、阻断门位、阻断理由与预注册的复活条件(例如新证据到达、置信区间跨越阈值、下游结论与该命题冲突或申诉触发)。休眠命题不占用后续推理预算,但保持可寻址。

在统一损失尺度与决策期限下,正向缺口分解为:

其中 Γ_i^rec 是在预注册期限内由复活后重跑可恢复的毛价值,Γ_i^irr 是时机敏感决策已经执行或下游承诺已经锁定而无法挽回的价值。令 c_i 表示检索、复核、重跑与延迟成本,三者必须折算到同一损失尺度与时点。只有当 Γ_i^+>0 且分解项可识别时,才定义净排除可逆率 ;否则只报告各项及其区间。两个系统可以有相同的正向缺口,却具有完全不同的不可逆份额:前者的排除是可审计、可申诉、可撤销的暂缓,后者是静默的湮灭。J_s 测量门判断得多准, 测量门错判后有多少价值在扣除恢复成本后仍可挽回。

这一维度改变最优门设计的解空间。若排除不可逆,门必须保守(高准入、依赖后端纠错);若排除可逆且复活条件可信,门可以激进(低准入、依赖休眠—复活回路兜底)。选择性保真的工程目标由此从“把每一次裁决做对”转移为“使错误裁决可发现且可撤销”——这与容错系统设计中“故障不可避免、故障恢复可设计”的转向同构。相应地,5.6 节的路径可追责性获得实质载体:休眠登记就是排除理由记录的可执行形式,申诉权就是人工触发复活条件的权限。

5.9 储备再生产:选择性的动力学

前述指标是单轮快照。但在役系统是重复博弈:第 t 轮各门的裁决通过三条通道改变第 t+1 轮的储备分布。吸收通道:被采纳的正确独有命题进入共享上下文,其携带的证据不再“独有”,U_i 结构性衰减——这是良性的:储备被消费转化为集体知识。寒蝉通道:被错误阻断的正确命题若持续得不到复活,产出该类命题的成员(或其训练信号)将学会自我审查,正确独有命题的生成率下降——储备不是被消费而是被冻结,且冻结在指标上与“没有分歧可提”不可区分。模仿通道:3.4 节的策略适应使错误命题的表面特征向正确命题收敛,Q^+ 与 Q^- 的可分性本身退化。

由此定义两个动力学量:储备再生率 g_t——第 t 轮新产生的、条件于既有共享知识仍有增量的正确独有命题率;选择性半衰期——在成员持续适应下 J_s,t 衰减至初值一半所需轮数。一个健康系统的特征不是任一轮的高 J_s,而是 g_t 不塌缩且 J_s,t 的衰减主要由吸收通道(良性)而非寒蝉与模仿通道(病理)驱动。三条通道可由干预区分:吸收衰减在注入全新证据域后立即恢复;寒蝉衰减在追溯复活历史被阻断命题并公示后缓慢恢复;模仿衰减对证据锚定的门判据更换敏感、对成员更换不敏感。

这一层与近邻的判决差异:多智能体辩论的趋同研究[2,23]记录了“意见收敛”现象,但未区分收敛的三种成因——真值吸引、寒蝉自我审查与表面模仿——而三者的治理含义相反:第一种应欢迎,第二种应以复活与公示矫正,第三种应以更换判据锚点矫正。把趋同分解为可干预区分的通道,是本节相对趋同文献的不可还原剩余。

6. 五项可预注册研究

6.1 研究一:能力归一化与反事实分岔

目的:检验多智能体的分岔是否只是能力、工具或计算量差异。

采用三种能力层级的小/中/大模型与三种工具条件:无检索、统一检索、带对抗核验工具。每个多智能体条件匹配一个单智能体或自一致性基线[15],使总 token、推理轮次、工具调用上限和墙钟时间处于同一预算。正式比较前,在独立校准集上进行等效检验;只有基线准确率与校准误差落入预注册等效界限的组别进入主分析。

主要因变量为命题级正确分岔率、错误独有命题率、条件残差有效秩与最终任务损失。采用分层模型估计系统类型、能力层级、工具条件与任务域的交互;提示词改写、温度和上下文次序作为随机化重复因素,而不是事后控制。样本量由先导数据的方差与最小实质效应通过仿真功效分析确定,不预填无依据的固定阈值。

判决性结果:若能力与预算等效后,多智能体相对基线只增加错误分岔或表述差异,而不增加正确独有命题与最终效用,则“角色数量产生认知独立性”的命题被拒绝。

6.2 研究二:误差结构 × 证据独立 × 聚合传递

目的:校准从错误去相关到有效认知独立的传递条件。

采用 2×2×2 因子设计,三个因素分别是:

条件误差结构:高共同残差与低共同残差;

证据配置:重复或共享证据,与独立且有增量的证据包;

聚合机制:多数压缩,与证据敏感、保留异议的聚合。

通过受控证据任务构造已知真值和已知证据依赖关系,并使各成员边际准确率保持等效。对共享证据条件使用内容相同但表面改写的证据包;对独立条件使用能分别排除不同错误假设的证据包。聚合器在盲态下工作,不见模型品牌或角色声望。

核心检验不是寻找一个漂亮的相关系数,而是交互项:独立证据是否只在聚合传递门打开时改善集体损失;低错误相关在缺乏增量证据或传递机制时是否失去预测力。若结果如此,它将直接支持“储备—传递”区分;若低错误相关单独稳定解释全部收益,本文的传递机制应降级。

6.3 研究三:议程权与否决权的拓扑分离

目的:区分“能决定讨论什么”和“能阻止错误结论”两种权力。

议程生成器先随机分配任务子问题;随后正交操纵某一角色是否拥有提议新议题的权力、是否拥有附证据的暂缓/否决权。所有角色获得相同预算,否决必须给出可核验理由,并由独立裁判判断理由是否满足规则。比较四种拓扑下的正确独有命题准入率、少数正确命题存活率、错误否决率、最终损失与审计完整度。

判决性结果:如果控制议程权后,否决权只增加延迟或策略性阻塞而不提高正确少数命题的存活率,则“否决拓扑产生独立性”的局部命题被删除;若议程权而非否决权解释主要差异,则治理设计应转向准入而不是末端制动。

6.4 研究四:正确—错误孪生命题与逐门保真

目的:检验系统是在保存真值相关差异,还是只在奖励新奇性、置信语气或少数位置。

针对每项受控任务构造两类独有命题:一类由可核验证据支持且能排除一个错误假设,另一类在长度、术语密度、置信措辞、来源标签与进入时点上匹配,但包含一个可定位的错误关系。二者随机分配给相同能力的角色,并以盲态方式依次通过命题生成、议程准入、交叉检验与聚合。主要因变量为各阶段 T_s+、T_s-、J_s、终端可实现价值 V_i^⋆、实际效力 η_i 与正向保真缺口 Γ_i^+。

第二阶段对每条被丢弃的正确独有命题执行逐门恢复:分别在议程后、检验后与聚合前强制注入相同内容。统计分析采用命题与任务交叉随机效应模型,预注册长度、证据强度、角色、顺序和置信表达的交互,并用留出模型家族检验外部迁移。

判决性结果:若正确与错误独有命题的传递曲线在等效界限内无差异,即使系统保留大量分歧,也不能称为具有选择性认知传递;若 V_i^⋆ 显著为正而 Γ_i^+ 无法被任何阶段恢复干预重复定位,则“因果保真剖面”主张被拒绝。

6.5 研究五:对抗认证与多轮动力学

目的:检验选择性保真在成员策略适应与重复交互下的存续,即认证 3.4 节的策略门与 5.9 节的动力学主张。

第一阶段(对抗认证):在研究四的孪生命题设置上加入优化回路。生成错误独有命题的角色可观测各门的历史裁决记录,并以自身命题存活率为目标,经预注册轮数的迭代改写(由独立的攻击模型执行,攻击预算与防守方审查预算按比例匹配)。因变量为 J_s,t 随攻击轮数的轨迹。对比两类门判据:表面型(长度、置信措辞、新奇度、来源声望)与锚定型(可复核证据谱系、可执行排除性预测)。预测:表面型门的 J_s 在有限轮内衰减至无差异,锚定型门的衰减速率显著更低。同时以哨兵命题库(5.7)在攻击进行中持续测量,检验哨兵曲线是否先于任务损失预警选择性崩塌,以及哨兵库轮换能否抵抗疫苗化。

第二阶段(多轮再生产):让同一多智能体系统在共享持久上下文中连续处理同域任务序列(不少于二十轮),正交操纵两个因素:是否启用休眠登记与定期复活公示(5.8);门判据为表面型或锚定型。追踪 g_t(储备再生率)、J_s,t、被阻断正确命题的累计 Γrec、Γirr 与恢复成本,以及三条衰减通道的干预区分测试(新证据域注入、追溯复活公示、判据更换)。

判决性结果:若锚定型门与表面型门在攻击下无衰减差异,则“判据锚点决定策略稳健性”的机制被拒绝,策略门只能保留为不可设计的经验现象;若休眠—复活机制不能减缓 g_t 塌缩,则寒蝉通道主张被拒绝;若三种干预不能分离三条衰减通道,则趋同分解模型降级为不可识别的描述。

7. 竞争性预测网络

以下预测预先规定竞争解释,但不在缺少先导方差时伪造固定百分比或显著性阈值。

在能力、工具与预算等效后,同基底角色辩论若不提高 B^+、D_R 或最终效用,其差异应解释为采样/提示多样性。

异质模型只有在带来条件增量证据且聚合器能够传递时,才优于同质模型;“异质”主效应不应被预设。

独立证据包相较于同内容改写包,应在遮蔽实验中产生可重复的增量损失,否则“来源不同”只是谱系装饰。

高 D_R 若伴随低成员能力和高错误独有命题率,不应被解释为有效独立。

多数压缩聚合相较于证据敏感聚合,将降低少数正确命题的 τ_i,并削弱其 η_i;若两者均无差异,传递门命题受到反证。

通道置换若在内容完全匹配后仍改变采纳率,说明系统存在路径折价;若不改变,则来源标签不是该系统的机制。

议程权对准入率的影响应与否决权对结论阻断的影响可分离;若始终共线,拓扑分离测量失败。

路径审计完整度可以与正确率分离变化;若两者在多域中始终由同一潜变量解释,则独立治理轴需要降级。

增加辩论轮数可能提高理由相似度而降低独有正确命题存活率;若隔离推理与延迟共享能逆转该效应,则趋同来自通信机制而非成员缺乏储备差异。

以“最大分歧”为目标的消息保留器可能同时提高 T_s^+ 与 T_s^-;若最终效用没有提高,说明分歧保留不等于选择性保真。

终端可实现价值 V_i^⋆ 相近的命题若具有不同 η_i,其差异应能由至少一个阶段恢复干预解释;否则保真缺口只是不可识别的事后分解。

当简单指标(投票分歧率、平均嵌入距离、角色数量)或“选择器质量”单参数模型在外部任务上具有与完整框架等同的预测与诊断能力时,本文框架没有增量价值。

表面型判据的门在成员可观测其裁决并被激励优化存活率时,J_s 应在有限轮内向零收敛;锚定型判据的门衰减应显著更慢。若两类门衰减无差异,判据锚点机制被反证。

哨兵命题曲线的下降应在时间上先于终端任务损失的可观测恶化;若二者同步或哨兵滞后,哨兵审计不具有前置警报价值,只是冗余测量。

在启用休眠登记与复活公示的系统中,被错误阻断成员的后续正确独有命题生成率 g_t 应高于无登记对照;若无差异,寒蝉通道假设被反证,趋同应主要归于吸收或模仿。

净排除可逆率 高的系统应能承受更激进(低准入)的门而不损失终端效用;若门激进程度与 的交互不存在,可逆性作为独立设计维度的主张降级。

8. 理论死亡条件与降级规则

高创新主张必须允许自身被删除。本文设置十四条死亡条件,并区分局部删除与整体降级。

数学死亡:条件残差矩阵与有效秩在合理样本量下不可稳定估计,且替代方法不能恢复重测信度,则误差结构指标删除。

增量死亡:证据谱系差异在内容遮蔽后不再预测真值相关增益,则证据增量门删除。

传递死亡:在至少两个任务域中,τ_i 与 η_i 均不能解释集体效用、错误恢复或少数正确命题存活,则传递机制失去核心地位。

能力还原:能力、工具、预算和任务难度对齐后,全部“独立性”效应消失,则原现象还原为能力差异。

采样还原:单模型自一致性在相同预算下复现所有分岔、纠错和稳健性收益,则多智能体机制降级为采样实现。

选择性死亡:正确与错误独有命题的双轨传递曲线在多域中等效,或 J_s 不比通用置信度和新奇性指标更能预测集体效用,则选择性保真概念删除。

保真死亡:V_i^⋆ 与 η_i 的差异无法稳定估计,或保真缺口不比简单的 oracle gap 提供额外阻断诊断,则因果保真层删除。

近邻替代:现有集成多样性、信息阐发、选择瓶颈和信息压缩模型无需新增测量或预测即可完整替代“储备—选择性传递—保真缺口”框架,则本文降级为跨域实现说明。

阻断不可定位:通道置换与最小恢复干预不能重复定位同一阻断环节,则路径归因主张撤回。

外部预测失败:完整框架在留出模型家族、任务域与聚合器上的预测不优于角色数量、投票分歧率、成员平均能力或选择器质量,则整体理论降级。

策略死亡:任何判据类型的门在预注册攻击预算内选择性均衰减至与新奇性指标无差异,且锚定型与表面型无稳定差别,则策略稳健选择性删除,选择门退回为仅在非策略假设下有效的描述。

哨兵死亡:哨兵命题在两个以上任务域中被系统稳定识别(疫苗化不可抑制),或哨兵曲线与直接任务损失监测相比不提供任何前置信息,则运行时审计工具删除,选择性认证退回实验室。

可逆性死亡:Γ^rec 与 Γ^irr 的分解在重复测量下不稳定,或休眠—复活机制的维护成本在真实预算下总是超过其恢复的价值,则可逆排除降级为纯治理记录要求,不再是认知性能维度。

动力学死亡:三条衰减通道(吸收、寒蝉、模仿)不能由预注册干预在任何域中重复分离,则储备再生产模型撤回,趋同重新并入现有收敛文献的单通道描述。

死亡条件不以单次不显著结果触发。正式分析同时使用最小实质效应、等效检验、置信区间与跨域复现;阈值在先导研究后预注册,不能用观察到的数据反向挑选。

9. 理论贡献、适用边界与治理含义

9.1 相对近邻理论的剩余

本文不声称首次发现“多样性不等于准确”“群体需要整合信息”“独立证据有益”“聚合器形成瓶颈”或“保留分歧消息可能改善辩论”。这些判断分别已有集成学习、信息阐发和多智能体系统研究的直接论证[2,6-10,19-22]。本文的不可还原剩余更窄:

在正确与错误独有命题并存时,测量系统能否选择性地保存真值相关差异;再以预算保持的匹配递送干预估计这条差异本可实现的价值,用逐门恢复干预解释潜在价值为何没有成为实际效力;并进一步认证这种选择性在成员策略适应与重复交互下的存续条件,为其误判提供可测量的可逆通道,为其在役漂移提供无需全知裁判的哨兵审计。

近邻之间的判决性差异可压缩为九组对照:

信息阐发[8]已经讨论分散信息是否被提出和讨论;本文追问正确与错误独有命题是否被差异化传递,以及损失发生在哪一道门。

信息不对称[21]检验给成员不同证据能否改善预测;本文测量独有证据的潜在价值有多少被实际路径保存。

分歧保留[22]检验保留高分歧消息能否提高效率;本文区分保留器是在保存真值相关差异,还是同时放大错误新奇性。

选择瓶颈[20]解释选择器质量何时使多样性有益;本文定位同一正确命题的价值在哪一阶段损失,以及能否由最小恢复干预复现。

信息压缩界[19]解释封闭、非单射聚合为何损失信息;本文识别哪些被压缩信息对当前真值不可替代,以及损失是否可恢复。

古德哈特效应与奖励投机[24-25]解释指标被优化后为何可能失真;本文比较证据锚定与表面特征两类门,测量其在成员适应下的选择性半衰期。

幻觉与事实核查基准测量系统输出是否正确;本文用无下游效力的影子探针测量路径是否辨别已知孪生命题,以及这种辨别能否提供前置预警。

容错与撤销设计关注故障恢复;本文把认知排除的错误分为可恢复与不可逆损失,并检验净可逆率如何改变门的最优激进程度。

辩论趋同研究[2,23]描述多轮交互为何收敛;本文尝试以干预区分真值吸收、正确异议的自我抑制与表面模仿。

本文由此把“证据增量—命题生成—议程准入—相互检验—选择性聚合—结果效力”连接为一条可消融的机制链,并为其加入反馈闭环(策略适应)、时间维(储备再生产)、纠错回路(休眠—复活)与在役测量层(哨兵审计)。新增价值不在术语,而在四个同时成立的增量预测:高分歧存活可以与低认识选择性并存;高可实现价值可以与低实际效力并存;高静态选择性可以与短策略半衰期并存;相同正向保真缺口可以与相反的可逆率并存。第一对揭示错误新奇性的放大,第二对定位正确异议的价值损失,第三对暴露认证的时效边界,第四对区分可申诉的暂缓与静默的湮灭。

9.2 适用范围

框架主要适用于具有可审计运行记录、可操纵证据分配和可比较集体输出的多智能体决策系统。对于完全不可观察的闭源系统,本文不能从表面文本反推训练来源独立性;最多评价运行时证据和输出路径。对于价值多元任务,“真值”应替换为公开的规范准则、理由覆盖和受影响方评价,不得把多数偏好伪装成客观正确。对于高风险医疗、法律或公共决策,本文指标只能辅助审计,不能替代领域验证、人类授权与申诉机制。

本文目前仍属于理论建构与实验设计阶段,尚未完成真实系统上的经验验证与独立领域评审。文中提出的阈值、等效界限和样本量只是可预注册的研究参数,须经先导研究校准后方可作为实测判据;在此之前,不应将其引用为已经成立的经验事实。

9.3 设计含义

系统设计不应先问“需要几个代理”,而应依次问:任务中哪些错误具有共同来源;哪些证据可以被因果隔离;独有命题在哪个环节最容易消失;系统能否区分正确独有命题与错误新奇性;聚合器保存了多少本可实现的价值;谁有能力恢复被阻断的路径。由此得到的工程动作包括独立检索、隔离初始判断、证据级而非角色级投票、匿名来源标签、正确/错误孪生命题压力测试、排除理由记录和逐门恢复测试,并追加四项:门判据锚定于难以廉价伪造的证据信号而非表面风格、在役哨兵命题轮换审计、被阻断命题的休眠登记与预注册复活条件、以及跨轮追踪储备再生率以区分良性吸收与病理寒蝉。

责任也不应默认归给“最后给出答案的模型”。若正确差异从未获准进入议程,责任首先位于准入规则;若差异进入但被不对称审查,责任位于检验机制;若证据被确认却在总结中消失,责任位于聚合器及其监督者。路径可追责性由此成为对认知独立性的治理补轴。

10. 结论

多智能体系统最容易制造的幻觉,不一定是一个错误事实,而是“多个声音已经彼此独立”的结构幻觉。角色数量、语言差异、模型品牌、训练来源距离、错误去相关乃至分歧消息的高存活,都只能提供局部证据。真正需要测量的是:系统能否在正确与错误的新奇性之间形成辨别,并把正确独有信息的反事实可实现价值保存为实际结果效力。

本文以“储备独立性—传递独立性—选择性保真—策略稳健性—可逆排除—储备再生产”重新组织这一问题,并通过五个实验把错误结构、证据增量、能力差异、议程权、否决权、正确/错误双轨传递、逐门价值损失、对抗衰减与多轮动力学正交拆分。其最简命题是:

众声并不因彼此不同或被完整转发而成为众智;只有当系统能保留正确且不可替代的差异、抑制错误新奇性、在成员学会讨好门径之后仍维持这种辨别、为自己的误判留下可撤销的通道,并把正确差异的潜在价值跨轮次保存为实际效力时,多个发言者才构成有效的认知独立。

选择性保真由此不是一次可以颁发的证书,而是一种必须持续再认证的均衡:门塑造成员,成员反塑门,而系统的认识品质取决于这个闭环停在何处。

研究透明度说明

本文在写作与修订过程中使用了多个大型语言模型生成候选表述、提出反例并检查结构一致性,人类作者保留问题设定、文献取舍、概念晋升和终稿责任。多个模型的一致意见不被视为独立证据;正文的经验性主张以可公开核验的文献为依据。本文提出的新增机制仍是待实验检验的理论候选,作者侧评价不能替代独立领域评审。

附论 · 与站内既发论文的划界(编辑增补)

本节由编辑增补,不属于作者投稿正文,亦不计入本文分数。作者在本站另有两篇与本文共用关键装置的论文,本文未引;此处点名分工。

一、与《当两种阅读彼此校正》(之三):有终审者与没有终审者

《当两种阅读彼此校正》处理两套分析约束如何互相校正,其可靠性最终由人类终审兜底:编码者独立作业、分歧先保留后讨论,署名研究者对结论强度承担最终责任,而该裁定本身也进入可审计数据。

本文取消的正是这个兜底。多智能体系统里没有一个位置可靠地扮演终审者——裁判本身可能被冗长、过度自信或策略性论证误导,而任务真值通常不可得。因此本文不能像前者那样把「分歧先保留」当作解决方案:保留分歧在本文的框架里只是把正确独有信息与错误独有信息一起留下,问题原封不动。前者可以靠一个外部裁定收束,本文只能靠路径本身在无裁定条件下完成辨别——这也是本文必须引入哨兵命题(真值已知、无下游效力)的原因:它是在没有终审者的系统里人工造出来的一小块局部真值。

二、与《当一个词不再改变判断》(之八):可逆休眠的第二次使用

本文第 5.8 节的「带复活条件的休眠登记」,与《当一个词不再改变判断》治理一节的「带理由、版本、复审期和重新启用条件的可逆休眠」是同一个装置。这属于作者的自我沿用,应当明说。

沿用之外的差别有两点。其一,对象从概念换成被阻断的命题,而后者数量大、生命周期短,因此本文的登记必须能承担运行时开销,前者不必。其二,也是更实质的一点:概念休眠的目的是防止误杀,判断标准在事后;本文的休眠登记有一个前者没有的功能——把正向保真缺口分解为可恢复损失与不可逆损失。同样一个「被挡住的正确命题」,若登记在案且复活条件明确,它计入可恢复;若无从追回,才计入不可逆。前者只在乎能不能翻案,本文还要用翻案率去度量系统本身的选择性质量。

参考文献

[1] DU Y, LI S, TORRALBA A, TENENBAUM J B, MORDATCH I. Improving factuality and reasoning in language models through multiagent debate[EB/OL]. arXiv:2305.14325, 2023. https://doi.org/10.48550/arXiv.2305.14325.

[2] CHEN Y, NIU G, CHENG J, HAN B, SUGIYAMA M. When and why does multi-agent debate fail and does it really underperform?[EB/OL]. arXiv:2510.20963, 2025. https://doi.org/10.48550/arXiv.2510.20963.

[3] ZHANG H, CUI Z, CHEN J, et al. Stop overvaluing multi-agent debate—We must rethink evaluation and embrace model heterogeneity[EB/OL]. arXiv:2502.08788, 2025. https://arxiv.org/abs/2502.08788.

[4] YAO B, SHANG C, DU W, et al. Peacemaker or troublemaker: How sycophancy shapes multi-agent debate[EB/OL]. arXiv:2509.23055, 2025. https://doi.org/10.48550/arXiv.2509.23055.

[5] CHEN Y, et al. Towards scalable oversight with collaborative multi-agent debate in error detection[EB/OL]. OpenReview, 2026. https://openreview.net/forum?id=W6qSjvTQMW.

[6] KROGH A, VEDELSBY J. Neural network ensembles, cross validation, and active learning[C]//Advances in Neural Information Processing Systems 7. 1995: 231-238. https://proceedings.neurips.cc/paper/1994/hash/b8c37e33defde51cf91e1e03e51657da-Abstract.html.

[7] KUNCHEVA L I, WHITAKER C J. Measures of diversity in classifier ensembles and their relationship with the ensemble accuracy[J]. Machine Learning, 2003, 51: 181-207. https://doi.org/10.1023/A:1022859003006.

[8] STEEL D, FAZELPOUR S, CREWE B, GILLETTE K. Information elaboration and epistemic effects of diversity[J]. Synthese, 2021, 198: 1287-1307. https://doi.org/10.1007/s11229-019-02108-w.

[9] FAZELPOUR S, DE-ARTEAGA M. Diversity in sociotechnical machine learning systems[J]. Big Data & Society, 2022, 9(1). https://doi.org/10.1177/20539517221082027.

[10] STEEL D, FAZELPOUR S, GILLETTE K, CREWE B. Multiple diversity concepts and their ethical-epistemic implications[J]. European Journal for Philosophy of Science, 2018, 8: 761-780. https://doi.org/10.1007/s13194-018-0209-5.

[11] NOBRE D A, FONTANARI J F. Prediction diversity and selective attention in the wisdom of crowds[J]. Complex Systems, 2020, 29(4): 861-875. https://doi.org/10.25088/ComplexSystems.29.4.861.

[12] ORTEGA L A, CABAÑAS R, MASEGOSA A R. Diversity and generalization in neural network ensembles[C]//Proceedings of the 25th International Conference on Artificial Intelligence and Statistics. PMLR, 2022, 151: 11720-11743. https://proceedings.mlr.press/v151/ortega22a.html.

[13] MUKHERJEE S, ASNAANI H, LIN E, KANNAN S. CCMI: Classifier based conditional mutual information estimation[C]//Proceedings of the 36th Conference on Uncertainty in Artificial Intelligence. PMLR, 2020, 124: 1083-1093. https://proceedings.mlr.press/v124/mukherjee20a.html.

[14] ROY O, VETTERLI M. The effective rank: A measure of effective dimensionality[C]//15th European Signal Processing Conference. 2007: 606-610. https://www.eurasip.org/Proceedings/Eusipco/Eusipco2007/Papers/a5p-h05.pdf.

[15] WANG X, WEI J, SCHUURMANS D, et al. Self-consistency improves chain of thought reasoning in language models[C]//The Eleventh International Conference on Learning Representations. 2023. https://openreview.net/forum?id=1PL1NIMMrw.

[16] HEGAZY M. Diversity of thought elicits stronger reasoning capabilities in multi-agent debate frameworks[EB/OL]. arXiv:2410.12853, 2024. https://arxiv.org/abs/2410.12853.

[17] PURUCKER L O, SCHNEIDER L, ANASTACIO M, et al. Q(D)O-ES: Population-based quality (diversity) optimisation for post hoc ensemble selection in AutoML[C]//Proceedings of the Second International Conference on Automated Machine Learning. PMLR, 2023, 224: 10/1-10/34. https://proceedings.mlr.press/v224/purucker23b.html.

[18] HONG L, PAGE S E. Groups of diverse problem solvers can outperform groups of high-ability problem solvers[J]. Proceedings of the National Academy of Sciences, 2004, 101(46): 16385-16389. https://doi.org/10.1073/pnas.0403723101.

[19] SHIN K S. The reasoning trap: An information-theoretic bound on closed-system multi-step LLM reasoning[EB/OL]. arXiv:2605.01704, 2026. https://doi.org/10.48550/arXiv.2605.01704.

[20] MARYANSKYY A. When agents disagree: The selection bottleneck in multi-agent LLM pipelines[EB/OL]. arXiv:2603.20324, 2026. https://doi.org/10.48550/arXiv.2603.20324.

[21] LI Y, TAO Y, ZHANG K, et al. Diverse evidence, better forecasts: Multi-agent deliberation under information asymmetry[EB/OL]. arXiv:2607.01661, 2026. https://doi.org/10.48550/arXiv.2607.01661.

[22] NGUYEN M, NGUYEN A, NGUYEN D, VENKATESH S, LE H. Hear both sides: Efficient multi-agent debate via diversity-aware message retention[EB/OL]. arXiv:2603.20640, 2026. https://doi.org/10.48550/arXiv.2603.20640.

[23] BERTALANIČ B, FORTUNA C. The cost of consensus: Isolated self-correction prevails over unguided homogeneous multi-agent debate[EB/OL]. arXiv:2605.00914, 2026. https://doi.org/10.48550/arXiv.2605.00914.

[24] MANHEIM D, GARRABRANT S. Categorizing variants of Goodhart’s Law[EB/OL]. arXiv:1803.04585, 2018. https://doi.org/10.48550/arXiv.1803.04585.

[25] SKALSE J, HOWE N H R, KRASHENINNIKOV D, KRUEGER D. Defining and characterizing reward hacking[EB/OL]. arXiv:2209.13085, 2022. https://doi.org/10.48550/arXiv.2209.13085.