摘要
具身机器人系统日益依赖大语言模型(LLM)进行高层推理与决策,但频繁调用 LLM 会带来显著延迟与资源开销。过度推理延误行动,不足则导致失败。本文提出 RARRL,一种基于强化学习的资源感知推理框架。该框架不学习底层控制,而是学习高层编排策略,使代理能根据观测、历史及剩余资源,自适应决定是否推理、采用何种推理角色及分配多少计算预算。实验表明,RARRL 在提升任务成功率的同时,有效降低了执行延迟并增强了鲁棒性。
AI 推荐理由
论文核心研究何时触发推理及资源感知推理策略,直接优化 LLM 推理机制。
研究机构
中国科学院自动化研究所
论文信息