摘要
针对大型推理模型(LRM)在长程具身导航中如何智能高效利用推理能力的问题,本文提出 HiRO-Nav 代理。该代理首创基于动作熵自适应判断每一步是否进行思考的机制。研究发现仅少量高熵动作对任务成功至关重要。为此,作者设计了包含混合监督微调冷启动及在线强化学习的训练流程,仅在关键高熵步骤激活推理。实验表明,该方法在成功率与令牌效率之间取得了优于密集推理和无推理基线的平衡。
AI 推荐理由
论文核心提出混合推理机制,基于熵自适应决定是否推理,直接优化 LRM 推理效率与质量。
研究机构
Nanyang Technological University
Tencent
论文信息