摘要
针对现有原生强化学习方法在长视频理解中顺序调用工具导致的错误传播与高成本问题,本文提出 ParaVT,首个支持并行视频工具调用的多智能体端到端强化学习框架。研究揭示了“工具先验悖论”,即预训练先验虽促进探索却破坏格式稳定性。为此,作者提出 PARA-GRPO 算法,通过结构化令牌奖励与帧预算随机化机制,显著提升训练时的格式合规性与工具调用效率。实验表明,该方法在六个基准测试上平均性能提升 7.9%。
AI 推荐理由
论文核心解决多模态 Agent 并行调用视频处理工具的机制与训练难题,属技能学习范畴。
研究机构
MiroMind
NTU
HKUST(GZ)
THU
LMMs-Lab
论文信息