摘要
针对基于大语言模型的多智能体系统,本文提出将智能体间的分歧视为信号而非噪声。在仇恨言论审核场景中,研究通过嵌入五个不同视角智能体的推理轨迹,构建分类体系分析分歧模式。研究发现,推理轨迹的结构差异能有效预测人类标注者的冲突,其相关性显著优于单纯的分歧幅度。该成果倡导从追求共识转向揭示不确定性的多智能体设计,利用分歧结构指导人类介入时机。
AI 推荐理由
论文核心在于分析智能体的推理轨迹结构,利用推理分歧预测人类判断冲突。
研究机构
Faculty of Electronics and Information Technology, Warsaw University of Technology, Warsaw, Poland
论文信息