摘要
针对现有强化学习在视觉 - 语言模型中仅能提供粗粒度结果监督的问题,本文提出 Perceval,一种以感知为中心的过程奖励模型。该模型能提取响应中的图像相关主张并与视觉证据逐一对比,定位感知错误。通过将 Perceval 集成到强化学习中,实现了针对幻觉片段的令牌级惩罚,提供细粒度监督信号。此外,Perceval 还能在推理阶段截断错误并引导模型反思或重生成,实现测试时扩展。实验表明该方法显著提升了多个基准上的推理性能。
AI 推荐理由
论文核心在于通过细粒度感知奖励模型提升多模态模型的复杂推理能力,纠正推理链错误。
研究机构
GaoLing School of Artificial Intelligence, Renmin University of China
University of California, San Diego
论文信息