摘要
现代语言智能体在多步推理中表现优异,但现有方法常将证据获取与答案生成耦合于单一策略,导致角色冲突及训练中的信用分配难题。本文提出 DAC 框架,将智能体搜索分解为由专用智能体处理的两个协作子任务。生成器兼具答案生产与证据充分性验证功能,其弃权信号作为结构化反馈优化搜索代理的奖励机制;搜索器则通过增强困难证据提升生成器鲁棒性。实验表明,该基于共享骨干网 LoRA 模块的方法在多项问答基准上优于全量微调的单体模型基线。
AI 推荐理由
提出角色分解的多智能体框架,将复杂推理任务拆解为搜索与生成子任务,核心在于任务规划与分解机制。
研究机构
首尔国立大学
论文信息