Vision-Language Models Reasoning Traces Video Understanding Gemini
摘要

本文基准测试了内部推理轨迹(称为“思维流”)如何影响视觉语言模型的视频场景理解。通过在 100 小时视频提取的场景上评估 Google Gemini 2.5 Flash 系列模型,研究了思考量与输出质量的关系及收益拐点。文章提出了内容充实度、思维 - 最终覆盖率和主导实体分析三项指标。研究发现,额外思考带来的质量提升迅速趋于平稳,主要改进发生在前几百个 token。严格的推理预算会导致模型产生未经理由的“压缩步幻觉”。尽管模型层级不同,其思维流内容相似但风格各异。

AI 推荐理由

论文核心评估视觉语言模型的内部推理轨迹(思维流)对场景理解的影响,直接研究推理机制。

研究机构
VideoDB*
论文信息
作者 Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi
发布日期 2026-04-13
arXiv ID 2604.11177
相关性评分 9/10 (高度相关)