摘要
尽管强化学习提升了多模态大语言模型的推理能力,但其策略在面对模糊、压缩伪影等真实世界视觉退化时仍显脆弱。现有鲁棒性技术难以直接应用于无评论家的自回归模型微调,且 naive 地注入退化视图会导致奖励中毒。本文提出 ROMA 框架,通过双前向传播策略利用教师强制评估退化视图,避免在退化输入上进行新 rollout。同时引入令牌级代理 KL 惩罚、基于干净图像优势的辅助策略梯度损失以及条件正则化,以确保分布一致性并防止策略崩溃。实验表明,该方法在多个基准上显著提升了鲁棒性,同时保持了干净输入的准确率。
AI 推荐理由
论文核心在于通过强化学习提升多模态模型在视觉退化下的推理鲁棒性,直接针对推理能力。
研究机构
Tencent Hunyuan
University of Maryland
论文信息