Multi-Agent Debate Self-Correction Reasoning Failure Hallucination Cost-Efficiency
摘要

本文通过受控实证研究,评估了同质多智能体辩论在困难基准测试中的表现。研究发现,缺乏结构化角色的同质团队易陷入阿谀顺从、上下文脆弱及共识崩溃三种失败模式,导致推理性能下降且令牌消耗显著增加。相比之下,孤立的自我修正机制在成本 - 准确性权衡上始终优于无引导的同伴交流,表明在当前参数规模下,简单的同伴互评并不能有效提升推理能力。

AI 推荐理由

核心研究多智能体辩论对推理准确性的影响,分析失败模式与自我修正机制。

研究机构
Jozef Stefan Institute
论文信息
作者 Blaž Bertalanič, Carolina Fortuna
发布日期 2026-04-29
arXiv ID 2605.00914
相关性评分 9/10 (高度相关)