Long-Context Reasoning Agent Trajectories Supervised Fine-Tuning Distant Dependencies
摘要

针对大语言模型长上下文推理能力训练数据稀缺的问题,本文提出智能体上下文编译(ACC)方法。该方法将智能体在多轮交互中产生的分散轨迹转化为长上下文问答对,整合原始问题与跨轮次的工具响应及环境观察,从而在不增加额外标注的情况下,实现对远距离依赖关系的直接监督训练。实验表明,ACC 显著提升了模型在复杂长程依赖任务上的表现,同时保持了通用能力,并揭示了模型注意力机制的重构与专家特化现象。

AI 推荐理由

论文核心提出 ACC 方法,旨在通过编译轨迹显式训练 LLM 的长上下文推理与远距离依赖建模能力。

研究机构
Shanghai Innovation Institute Shanghai AI Laboratory MoE Key Lab of BIPC, University of Science and Technology of China
论文信息
作者 Qisheng Su, Zhen Fang, Shiting Huang, Yu Zeng, Yiming Zhao et al.
发布日期 2026-05-21
arXiv ID 2605.21850
相关性评分 9/10 (高度相关)