摘要
针对视频大语言模型在复杂推理中面临的稀疏奖励与细粒度信用分配缺失问题,本文提出 VISD 框架。该方法利用视频感知评判模型将推理质量分解为答案正确性、逻辑一致性及时空定位等多维指标,生成结构化反馈以指导教师策略进行令牌级监督。通过引入方向 - 幅度解耦机制,稳定融合密集监督与强化学习,实现语义对齐的细粒度信用分配。实验表明,VISD 在提升答案准确率与时空定位质量的同时,收敛速度加快近两倍。
AI 推荐理由
论文核心解决视频推理中的信用分配难题,提出结构化自蒸馏框架显著提升推理能力。
研究机构
HUST
Wuhan University
Peking University
Tsinghua University
论文信息