Multimodal Reasoning Benchmark Visual Clues MLLM Evaluation
摘要

日常场景具有视觉丰富性,要求多模态大语言模型(MLLMs)过滤噪声并识别关键视觉线索以进行准确推理。然而,现有基准主要评估模型的预存知识或感知理解,往往忽视了关键的推理能力。为此,本文提出 DailyClue 基准,专为日常场景中的视觉线索驱动推理设计。该基准基于真实日常活动构建,通过挑战性查询迫使模型主动探索并利用视觉线索进行深层推理,而非简单识别。涵盖四大领域及 16 个子任务的评估显示,准确识别视觉线索是实现稳健推理的关键。

AI 推荐理由

论文核心聚焦于视觉线索驱动的推理能力评估,旨在解决多模态模型在复杂场景下的深层推理问题。

研究机构
大连理工大学
论文信息
作者 Xiaomin Li, Tala Wang, Zichen Zhong, Ying Zhang, Zirui Zheng et al.
发布日期 2026-04-15
arXiv ID 2604.14041
相关性评分 9/10 (高度相关)