摘要
针对现有视觉语言模型在图表问答任务中存在的数值提取不准、隐式关系解读困难及空间注意力不足等局限,本文提出 Chart-RL 框架。该框架结合策略优化技术与自适应奖励函数,通过反馈驱动优化模型的视觉感知与逻辑推断能力。研究引入低秩适应(LoRA)实现参数高效微调,仅需单 GPU 配置。实验表明,经 RL 微调的 4B 模型在准确率上超越 8B 基座模型,同时显著降低推理延迟,展现了卓越的视觉推理增强效果。
AI 推荐理由
论文核心在于通过强化学习优化视觉感知与逻辑推断,显著提升图表问答中的视觉推理能力。
研究机构
Amazon
论文信息