摘要
针对现有最强系统封闭且资源密集的问题,本文提出一种两阶段后训练流程,旨在开发能在严格资源限制下执行安全任务的本地小模型。研究聚焦于需要多步交互式推理的 Linux 权限提升任务,通过在程序生成的环境轨迹上进行监督微调,随后结合可验证奖励的强化学习进行优化。实验表明,该方法将 4B 模型的成功率提升至 95.8%,接近 Claude Opus 水平,同时将单次成功推理所需的预期成本降低超过 100 倍。
AI 推荐理由
论文核心解决多步交互式推理问题,通过强化学习显著提升模型在复杂安全任务中的推理能力。
研究机构
TU Wien, 奥地利
论文信息