Visual Reasoning Reinforcement Learning Chart Question Answering VLM Policy Optimization
摘要

针对现有视觉语言模型在图表问答任务中存在的数值提取不准、隐式关系解读困难及空间注意力不足等局限,本文提出 Chart-RL 框架。该框架结合策略优化技术与自适应奖励函数,通过反馈驱动优化模型的视觉感知与逻辑推断能力。研究引入低秩适应(LoRA)实现参数高效微调,仅需单 GPU 配置。实验表明,经 RL 微调的 4B 模型在准确率上超越 8B 基座模型,同时显著降低推理延迟,展现了卓越的视觉推理增强效果。

AI 推荐理由

论文核心在于通过强化学习优化视觉感知与逻辑推断,显著提升图表问答中的视觉推理能力。

研究机构
Amazon
论文信息
作者 Yunfei Bai, Amit Dhanda, Shekhar Jain
发布日期 2026-04-03
arXiv ID 2604.03157
相关性评分 9/10 (高度相关)