摘要
经验驱动的自我进化已成为提升大语言模型代理自主性的前沿范式,但其依赖自我策划的经验引入了未被充分探索的安全风险。本研究调查了自我进化代理中经验的积累与利用如何在基于网页和具身环境中影响安全性能。研究发现,仅从良性任务收集的经验仍会损害高风险场景下的安全性,这归因于累积经验的执行导向性质,强化了代理的行动而非拒绝倾向。在更现实的混合任务场景中,拒绝相关经验虽能缓解安全下降,却引发过度拒绝,揭示了安全与效用之间的根本权衡。
AI 推荐理由
论文核心研究经验驱动的自我进化代理的安全风险,直接探讨其机制与局限。
研究机构
哈尔滨工业大学
新加坡管理大学
SERES
论文信息