摘要
本文提出 OfficeQA Pro,一个用于评估 AI 代理在大型异构文档库上进行落地多文档推理的基准。该语料库包含近百年美国财政部公报,共 8.9 万页及超 2600 万个数值。基准含 133 个问题,需精确解析、检索并结合非结构化文本与表格数据进行分析和推理。实验显示,即便提供文档库,前沿模型平均准确率仅 34.1%;引入结构化文档表示可提升 16.1% 相对性能。研究还探讨了模型选择、表格表示等影响,表明企业级落地推理仍有巨大提升空间。
AI 推荐理由
论文核心是评估 Agent 在复杂文档上的落地推理能力,直接针对推理机制。
研究机构
Databricks
论文信息