Multimodal Learning Context Learning Benchmark Visual Reasoning
摘要

本文提出 MMCL-Bench,一个用于多模态上下文学习的基准测试,旨在评估模型从视觉或混合模态教学上下文中学习任务局部规则、流程及经验模式,并将其应用于新视觉实例的能力。该设置要求模型在推理前先从图像、截图、手册等中恢复并定位相关证据。基准包含 102 个任务,涵盖规则应用、流程执行及经验归纳。评估显示,当前最强模型在严格评分下解决任务数不足三分之一,揭示了多模态上下文学习中从证据锚定到响应构建的全链路推理瓶颈。

AI 推荐理由

论文聚焦多模态上下文学习中的证据提取与逻辑推理,是评估模型推理瓶颈的关键研究。

研究机构
University of Cambridge HKUST Tsinghua University
论文信息
作者 Yifan Chen, Fei Yin, Qingyan Bai, Zicheng Lin, Yujiu Yang
发布日期 2026-05-12
arXiv ID 2605.12703
相关性评分 8/10 (高度相关)