Agent Training Data Synthesis Task Planning Reinforcement Learning
摘要

针对大语言模型向自主代理演进中面临的数据稀缺及现有方法缺乏严谨逻辑的问题,本文提出 LOGIGEN 框架。该框架通过硬编译策略基础、逻辑驱动正向合成及确定性状态验证三大支柱,利用三重代理协作生成包含两万个复杂任务的 verified 数据集。结合基于验证的监督微调与强化学习协议,该方法显著提升了代理在长程目标达成上的表现,在τ²-Bench 基准上成功率达 79.5%,有效构建了因果有效的代理轨迹。

AI 推荐理由

论文核心在于通过逻辑驱动合成复杂任务数据,训练 Agent 在状态环境中进行多步规划以实现目标。

研究机构
百度 清华大学
论文信息
作者 Yucheng Zeng, Weipeng Lu, Linyun Liu, Shupeng Li, Zitian Qu et al.
发布日期 2026-02-28
arXiv ID 2603.00540
相关性评分 9/10 (高度相关)