摘要
针对当前代理多模态模型存在的元认知缺陷,即难以权衡内部知识与外部工具查询,导致盲目调用工具并阻碍推理的问题,本文提出了 HDPO 框架。该方法摒弃了传统的标量奖励耦合机制,转而采用正交优化通道:在确保任务准确性的前提下,通过条件优势估计专门优化执行效率。这种解耦架构迫使代理先掌握任务解决再提升自依赖性。实验表明,所得模型 Metis 在大幅减少工具调用次数的同时,显著提升了推理准确率。
AI 推荐理由
论文核心解决多模态 Agent 的工具调用决策问题,提出新框架优化技能使用效率。
研究机构
1
2
论文信息