Multi-Agent Debate Reasoning Quality LLM-as-Judge Confidence Calibration
摘要

多智能体辩论系统通常仅评估最终答案的正确性,而忽视了旨在产生的中间推理质量。本文研究了多智能体辩论中三种信号的关系:推理令牌级的对数概率分布、LLM 作为裁判分配的评分以及最终任务准确率。我们考察了内部置信度信号是否能预测外部评估的推理质量,以及这些信号是否与任务正确性一致。实验涵盖基于规则的评分、数学推理和事实问答三个领域。框架采用构建者与审计者的双智能体架构,结合 LLM 裁判对指令遵循、论证质量和证据基础进行评分。研究发现构建者的置信度与推理质量高度相关,且能更可靠地检测关键推理失败。

AI 推荐理由

论文核心研究多智能体辩论中的中间推理质量评估,利用置信度信号诊断推理过程。

研究机构
University of California, Irvine
论文信息
作者 Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer
发布日期 2026-06-09
arXiv ID 2606.10296
相关性评分 9/10 (高度相关)