Multi-Agent Systems Reasoning Traces Human-AI Collaboration Hate Speech Moderation
摘要

针对基于大语言模型的多智能体系统,本文提出将智能体间的分歧视为信号而非噪声。在仇恨言论审核场景中,研究通过嵌入五个不同视角智能体的推理轨迹,构建分类体系分析分歧模式。研究发现,推理轨迹的结构差异能有效预测人类标注者的冲突,其相关性显著优于单纯的分歧幅度。该成果倡导从追求共识转向揭示不确定性的多智能体设计,利用分歧结构指导人类介入时机。

AI 推荐理由

论文核心在于分析智能体的推理轨迹结构,利用推理分歧预测人类判断冲突。

研究机构
Faculty of Electronics and Information Technology, Warsaw University of Technology, Warsaw, Poland
论文信息
作者 Michał Wawer, Jarosław A. Chudziak
发布日期 2026-04-04
arXiv ID 2604.03796
相关性评分 9/10 (高度相关)