Chain of Thought Vision-Language Models Supervised Fine-Tuning Multimodal Reasoning
摘要

视觉语言模型的多模态推理通常依赖监督微调与强化学习两阶段流程。标准监督微调中所有令牌对损失贡献均等,忽略了推理数据固有的令牌不平衡性,导致冗长推理与答案不准。本文提出 SCALe 方法,利用动态长度无关权重显式分离推理与答案段的监督。该方法通过余弦调度策略逐渐将训练重心从推理过程转移至答案部分,鼓励简洁且 grounded 的推理。实验表明,SCALe 在多种基准上优于标准微调,仅需约七分之一训练时间即可达到两阶段流程性能,结合 GRPO 更获最佳效果。

AI 推荐理由

论文核心提出改进思维链训练的方法,直接针对多模态推理能力优化。

研究机构
IBM Research
论文信息
作者 Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz
发布日期 2026-03-19
arXiv ID 2603.18656
相关性评分 9/10 (高度相关)