Agent Safety Recovery Planning Human Alignment Computer Use Agents
摘要

随着语言模型智能体获得在真实计算机系统上执行操作的能力,不仅需要在大规模上预防有害行为,还需在预防失败时有效补救。本文将执行后防护中的这一被忽视的挑战形式化为“危害恢复”,即根据人类偏好,最优地将智能体从有害状态引导回安全状态。通过用户研究确定了有价值的恢复维度并制定了自然语言评分标准,据此构建奖励模型,在测试时对智能体生成的多个候选恢复计划进行重排序。此外,文章提出了包含 50 个任务的 BackBench 基准以系统评估恢复能力。实验表明,该方法能产生比基线更高质量的恢复轨迹。

AI 推荐理由

论文核心在于生成和重排序恢复计划,以引导智能体从有害状态回到安全状态,属于规划范畴。

研究机构
MIT CSAIL Abridge humans&
论文信息
作者 Christy Li, Sky CH-Wang, Andi Peng, Andreea Bobu
发布日期 2026-04-20
arXiv ID 2604.18847
相关性评分 9/10 (高度相关)