Agent Post-training Trajectory Quality Environment-Grounded Supervision Data Efficiency
摘要

本文挑战了“更强代码代理即为更优教师”的假设,通过 Terminal-Lego 管道研究发现,学生代理在较低分但具备环境接地监督(EGS)的轨迹上微调,泛化能力显著更强。这种“教学悖论”表明,暴露检查 - 执行 - 验证行为的交互结构比单纯的结果匹配更能促进鲁棒问题解决 routines 的内化。实验显示极高的数据效率,仅需少量轨迹即可媲美此前大规模数据训练的 SOTA 性能,主张将研究重心转向“Harness Engineering

AI 推荐理由

论文核心研究 Agent 的后训练与自我改进机制,提出基于交互轨迹的教学范式。

研究机构
香港大学 华为技术有限公司
论文信息
作者 Sidi Yang, Chaofan Tao, Jierun Chen, Tiezheng Yu, Ruoyu Wang et al.
发布日期 2026-06-02
arXiv ID 2606.03461
相关性评分 9/10 (高度相关)