Vision-Language Models Foveated Attention Reinforcement Learning Efficient Inference
摘要

视觉语言模型虽受益于高分辨率图像,但视觉令牌激增导致计算开销巨大。本文受人类注视机制启发,提出“注视推理器”,将注视与推理统一于单一自回归解码轨迹中。该模型从低分辨率视图起步,仅在必要时触发注视以获取局部高分辨率证据并注入当前上下文。通过两阶段训练(冷启动监督加强化学习),模型学会了有效的注视策略,在严格的视觉令牌预算下,显著提升了多个基准测试的任务准确率,避免了全图浏览的低效方案。

AI 推荐理由

论文提出注视推理框架,核心在于通过动态视觉聚焦优化多模态推理过程与证据获取。

研究机构
AI Center – Mountain View, Samsung Electronics
论文信息
作者 Juhong Min, Lazar Valkov, Vitali Petsiuk, Hossein Souri, Deen Dayal Mohan
发布日期 2026-04-22
arXiv ID 2604.21079
相关性评分 9/10 (高度相关)