摘要
针对大型多模态模型在视频推理中的局限,本文提出一种观察级干预方法。利用冻结的工具集成教师模型识别缺失的时空依赖并提供最小证据补丁,学生模型据此重新作答。该方法结合组相对策略优化(GRPO)与鲁棒改进奖励(RIR),在对齐结果有效性与依赖合理性的同时,引导沿因果方向的策略探索。实验表明,该方法在多个基准测试中显著提升了准确率与泛化能力。
AI 推荐理由
论文核心解决视频推理中的上下文缺失问题,通过修复证据提升推理准确性。
研究机构
清华大学
腾讯混元实验室
论文信息