摘要
随着语言模型智能体获得在真实计算机系统上执行操作的能力,不仅需要在大规模上预防有害行为,还需在预防失败时有效补救。本文将执行后防护中的这一被忽视的挑战形式化为“危害恢复”,即根据人类偏好,最优地将智能体从有害状态引导回安全状态。通过用户研究确定了有价值的恢复维度并制定了自然语言评分标准,据此构建奖励模型,在测试时对智能体生成的多个候选恢复计划进行重排序。此外,文章提出了包含 50 个任务的 BackBench 基准以系统评估恢复能力。实验表明,该方法能产生比基线更高质量的恢复轨迹。
AI 推荐理由
论文核心在于生成和重排序恢复计划,以引导智能体从有害状态回到安全状态,属于规划范畴。
研究机构
MIT CSAIL
Abridge
humans&
论文信息