Privilege Escalation Reinforcement Learning Local LLM Security Agents
摘要

针对现有最强系统封闭且资源密集的问题,本文提出一种两阶段后训练流程,旨在开发能在严格资源限制下执行安全任务的本地小模型。研究聚焦于需要多步交互式推理的 Linux 权限提升任务,通过在程序生成的环境轨迹上进行监督微调,随后结合可验证奖励的强化学习进行优化。实验表明,该方法将 4B 模型的成功率提升至 95.8%,接近 Claude Opus 水平,同时将单次成功推理所需的预期成本降低超过 100 倍。

AI 推荐理由

论文核心解决多步交互式推理问题,通过强化学习显著提升模型在复杂安全任务中的推理能力。

研究机构
TU Wien, 奥地利
论文信息
作者 Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp
发布日期 2026-03-18
arXiv ID 2603.17673
相关性评分 9/10 (高度相关)