Omni-LLM Cross-Modal Coreference Multimodal Reasoning SFT+GRPO
摘要

全模态大模型(Omni-LLMs)虽具备强大的整体感知能力,但在需要协同推理的复杂场景中表现不佳。有效推理不仅依赖全局上下文,更取决于细粒度的跨模态对齐,尤其是识别跨模态共享指称对象。本文将该挑战形式化为跨模态共指问题,并引入包含九项任务及人类设计推理依据的 CrossOmni 数据集。实验揭示现有模型在此方面的系统性缺陷归因于缺乏共指感知思维模式。为此,作者提出两种策略:无需训练的上下文学习方法和基于 SFT+GRPO 的训练框架,以诱导此类思维模式。两种方法均显著提升性能并泛化至协作推理任务,证实跨模态共指是推进稳健全模态推理的关键缺失环节。

AI 推荐理由

论文核心解决多模态推理中的细粒度对齐问题,提出跨模态共指推理新范式。

研究机构
Shanghai Jiao Tong University
论文信息
作者 Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu et al.
发布日期 2026-04-07
arXiv ID 2604.05522
相关性评分 9/10 (高度相关)