trajectory synthesis agent training multi-turn dialogue evidence-grounded decision making
摘要

多轮用户交互代理需从不完整请求中推断意图,并通过对话和工具收集缺失信息以执行有效动作。现有方法主要通过组合多个请求生成“写密集型”轨迹来训练顺序执行能力,却忽视了单个决策前需大量“读”取证据的挑战。本文提出 WRIT 框架,沿“写决策数量”和“单决策证据负担”两个维度合成复杂训练轨迹。该方法先生成写密集与读重型任务,多样化用户行为指令,并在可执行环境中模拟交互。实验表明,仅用 2000 条合成轨迹训练的 4B 模型,在$ au^2$-bench 上超越 GPT-5.1 no-think,并显著降低推理 token 消耗。

AI 推荐理由

论文核心在于通过合成复杂轨迹训练 Agent 的多步决策与证据收集规划能力。

研究机构
North Carolina State University Case Western Reserve University
论文信息
作者 Hengrui Gu, Xiaotian Han, Kaixiong Zhou
发布日期 2026-06-01
arXiv ID 2606.02908
相关性评分 9/10 (高度相关)