Benchmark Grounded Reasoning Document Understanding Agent Evaluation
摘要

本文提出 OfficeQA Pro,一个用于评估 AI 代理在大型异构文档库上进行落地多文档推理的基准。该语料库包含近百年美国财政部公报,共 8.9 万页及超 2600 万个数值。基准含 133 个问题,需精确解析、检索并结合非结构化文本与表格数据进行分析和推理。实验显示,即便提供文档库,前沿模型平均准确率仅 34.1%;引入结构化文档表示可提升 16.1% 相对性能。研究还探讨了模型选择、表格表示等影响,表明企业级落地推理仍有巨大提升空间。

AI 推荐理由

论文核心是评估 Agent 在复杂文档上的落地推理能力,直接针对推理机制。

研究机构
Databricks
论文信息
作者 Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins, Ivan Zhou, Cindy Wang et al.
发布日期 2026-03-09
arXiv ID 2603.08655
相关性评分 9/10 (高度相关)