Multi-Agent Systems Task Decomposition Credit Assignment Role-Specific Training
摘要

现代语言智能体在多步推理中表现优异,但现有方法常将证据获取与答案生成耦合于单一策略,导致角色冲突及训练中的信用分配难题。本文提出 DAC 框架,将智能体搜索分解为由专用智能体处理的两个协作子任务。生成器兼具答案生产与证据充分性验证功能,其弃权信号作为结构化反馈优化搜索代理的奖励机制;搜索器则通过增强困难证据提升生成器鲁棒性。实验表明,该基于共享骨干网 LoRA 模块的方法在多项问答基准上优于全量微调的单体模型基线。

AI 推荐理由

提出角色分解的多智能体框架,将复杂推理任务拆解为搜索与生成子任务,核心在于任务规划与分解机制。

研究机构
首尔国立大学
论文信息
作者 Jaewan Park, Solbee Cho, Jay-Yoon Lee
发布日期 2026-06-09
arXiv ID 2606.10684
相关性评分 9/10 (高度相关)