Tool Use Multimodal Agents Reinforcement Learning Meta-Cognition
摘要

针对当前代理多模态模型存在的元认知缺陷,即难以权衡内部知识与外部工具查询,导致盲目调用工具并阻碍推理的问题,本文提出了 HDPO 框架。该方法摒弃了传统的标量奖励耦合机制,转而采用正交优化通道:在确保任务准确性的前提下,通过条件优势估计专门优化执行效率。这种解耦架构迫使代理先掌握任务解决再提升自依赖性。实验表明,所得模型 Metis 在大幅减少工具调用次数的同时,显著提升了推理准确率。

AI 推荐理由

论文核心解决多模态 Agent 的工具调用决策问题,提出新框架优化技能使用效率。

研究机构
1 2
论文信息
作者 Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang et al.
发布日期 2026-04-09
arXiv ID 2604.08545
相关性评分 9/10 (高度相关)