摘要
扩散策略在机器人操作中表现优异,但常难以满足严格物理安全约束。现有方法或在训练早期强加限制,或在测试时依赖外部防护,限制了策略表达能力。本文提出 PACT,一种自进化的后训练框架,无需演示数据或奖励信号,即可将预训练扩散策略投影至可行约束区域。该方法通过逆向 KL 目标将约束梯度蒸馏到模型中,并采用渐进式课程学习,在理论保证下实现单调改进,显著降低违规率并提升任务成功率。
AI 推荐理由
论文提出自进化框架,通过课程学习逐步收紧约束实现策略自我改进与安全对齐。
研究机构
Department of Computer Science and Tech, Institute for AI, Tsinghua-Bosch Joint MI, Center, THBI Lab, BMRiot Center, Tsinghua University, Beijing, 100084, China
论文信息