摘要
评估多智能体大语言模型系统的推理质量极具挑战,尤其在缺乏参考答案的开放式任务中。本文研究了内在置信度信号(即解码过程中的 token 级对数概率)是否能预测由“大模型即裁判”评估的推理质量。基于辩论式作文评分框架,我们在两个 ASAP 数据集上对比了置信度代理指标与基于规则的裁判评分。研究发现,早期 token 置信度(特别是前几个生成 token)是推理质量的最强预测因子,优于全序列统计量。分析表明,生成初始阶段最具异质性且信息量最大。此外,观察到智能体角色间的系统性不对称,支持性推理中置信度与质量的对齐度高于对抗性批评。结果表明,早期解码动态为估计多智能体系统中的推理可靠性提供了轻量且有效的信号。
AI 推荐理由
论文核心研究多智能体辩论中的推理质量评估,利用早期 token 置信度预测推理可靠性。
研究机构
University of California, Irvine
论文信息