摘要
针对长视频理解中因上下文限制导致纯文本推理产生幻觉的问题,本文提出 Video-TwG 框架。该框架引入“基于落地的思考”范式,使模型能在交错的文视频推理中按需主动定位关键片段。通过两阶段强化课程策略及 TwG-GRPO 算法,利用细粒度奖励机制实现端到端训练。实验表明,该方法在多个基准上显著优于现有基线,有效提升了推理质量并减少了冗余定位。
AI 推荐理由
论文提出“基于落地的思考”范式,核心解决长视频理解中的推理幻觉问题,属推理机制研究。
研究机构
清华大学
论文信息