摘要
本文通过受控实证研究,评估了同质多智能体辩论在困难基准测试中的表现。研究发现,缺乏结构化角色的同质团队易陷入阿谀顺从、上下文脆弱及共识崩溃三种失败模式,导致推理性能下降且令牌消耗显著增加。相比之下,孤立的自我修正机制在成本 - 准确性权衡上始终优于无引导的同伴交流,表明在当前参数规模下,简单的同伴互评并不能有效提升推理能力。
AI 推荐理由
核心研究多智能体辩论对推理准确性的影响,分析失败模式与自我修正机制。
研究机构
Jozef Stefan Institute
论文信息