Reinforcement Learning Multimodal Agents Video Understanding Tool Use Interaction Stability
摘要

针对代理多模态模型在强化学习中常出现的“交互崩溃”问题(即模型倾向于减少工具使用和多轮推理),本文提出了 PyVision-RL 框架。该方法结合过采样 - 过滤 - 排序的展开策略与累积工具奖励机制,有效稳定训练并维持多轮交互。基于统一训练流程,开发了用于图像和视频理解的 PyVision-Image 与 PyVision-Video 模型。特别是在视频推理中,PyVision-Video 采用按需上下文构建策略,选择性采样任务相关帧,显著降低视觉 token 消耗。实验表明,该方法在性能与效率上表现优异,证明了持续交互与按需视觉处理对可扩展多模态代理的关键作用。

AI 推荐理由

论文核心解决多步推理中的交互崩溃问题,通过强化学习优化多轮工具使用与规划策略。

研究机构
中国科学院自动化研究所 清华大学
论文信息
作者 Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng et al.
发布日期 2026-02-24
arXiv ID 2602.20739
相关性评分 9/10 (高度相关)