摘要
本文介绍了 TableVista,这是一个用于评估基础模型在视觉和结构复杂性下进行多模态表格推理的综合基准。该基准包含 3000 个高质量推理问题,通过多风格渲染管线扩展为 3 万个多模态样本。对 29 个最先进模型的评估显示,尽管模型在不同渲染风格下表现稳定,但在复杂结构布局和纯视觉设置中性能显著下降。研究揭示了当前模型在结合结构复杂性与视觉呈现时难以维持推理一致性,指出了多模态能力的关键差距。
AI 推荐理由
论文核心评估多模态表格推理能力,直接针对复杂结构下的逻辑推理一致性进行基准测试与分析。
研究机构
同济大学
布里斯托大学
天津大学
耶鲁大学
论文信息