摘要
本文研究了在生成 token 数量受限条件下,语言模型应直接回答、采样投票还是进行多智能体辩论。通过在 MuSiQue 和 GSM8K 数据集上评估贪心解码、三样本投票及双智能体辩论协议,发现针对每个样本选择最佳协议存在显著性能提升空间。然而,利用廉价的事前信号(如投票熵)难以完全恢复这一潜力。关键发现表明,投票熵能预测辩论的“安全性”(避免负面效果),却无法有效识别辩论的“必要性”,因为大量有益案例发生在投票一致但错误的情形中。
AI 推荐理由
核心研究多智能体辩论、投票等推理协议的路由机制与效能边界。
研究机构
Amazon Web Services
论文信息