摘要
多轮用户交互代理需从不完整请求中推断意图,并通过对话和工具收集缺失信息以执行有效动作。现有方法主要通过组合多个请求生成“写密集型”轨迹来训练顺序执行能力,却忽视了单个决策前需大量“读”取证据的挑战。本文提出 WRIT 框架,沿“写决策数量”和“单决策证据负担”两个维度合成复杂训练轨迹。该方法先生成写密集与读重型任务,多样化用户行为指令,并在可执行环境中模拟交互。实验表明,仅用 2000 条合成轨迹训练的 4B 模型,在$ au^2$-bench 上超越 GPT-5.1 no-think,并显著降低推理 token 消耗。
AI 推荐理由
论文核心在于通过合成复杂轨迹训练 Agent 的多步决策与证据收集规划能力。
研究机构
North Carolina State University
Case Western Reserve University
论文信息