Hallucination Detection Multi-Agent Reinforcement Learning Self-Improvement RAG
摘要

幻觉是大语言模型在检索增强生成等应用中的关键瓶颈。现有检测方法常受确认偏差影响。本文提出 MARCH 框架,利用信息不对称机制,协调求解者、提议者和检查者三个专用智能体协作。检查者在隔离状态下验证原子命题,打破自我确认循环。通过多智能体强化学习训练,促使智能体协同进化并优化事实一致性。实验表明,该方法显著降低幻觉率,使小参数模型性能媲美强大闭源模型,为 LLM 的事实性自我改进提供了可扩展路径。

AI 推荐理由

论文核心在于通过多智能体强化学习实现 Agent 的协同进化与自我改进,以解决幻觉问题。

研究机构
阿里巴巴集团夸克应用业务集团 香港大学中国科学院深圳研究院
论文信息
作者 Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou et al.
发布日期 2026-03-25
arXiv ID 2603.24579
相关性评分 9/10 (高度相关)