CLI Agents Reinforcement Learning Credit Assignment Tool Use
摘要

命令行界面(CLI)智能体正成为与动态文件系统交互的新范式。现有强化学习方法未充分利用 CLI 动作的结构属性,且面临从部分观察中提取证据及稀疏奖励分配两大瓶颈。本文针对 shell 驱动的信息提取与文件编辑任务,提出推理时机制σ-Reveal 以选择受限上下文,并设计原生智能体强化学习方法 Action Advantage Assignment (A³),利用抽象语法树残差等构建轮次优势。此外,构建了可验证数据集 ShellOps 以评估该设定。

AI 推荐理由

论文核心研究 CLI Agent 的工具使用技能,提出新 RL 方法优化动作学习与奖励分配。

研究机构
复旦大学 上海创新研究院 上海交通大学
论文信息
作者 Haoyang Su, Ying Wen
发布日期 2026-05-08
arXiv ID 2605.08013
相关性评分 9/10 (高度相关)