摘要
尽管大语言模型能加速文本密集型任务,但在处理复杂金融电子表格的结构化数据提取与推理方面仍存在差距。由于缺乏真实的行业基金组合数据集,本研究提出了 FinSheet-Bench,这是一个基于真实私募股权基金结构合成的基准测试集,旨在评估 LLM 在文本序列化电子表格问答及数值推理任务上的表现。实验结果显示,现有模型在复杂布局下的错误率过高,无法满足专业金融应用的无监督使用需求,且性能随表格复杂度增加显著下降,表明需要分离文档理解与确定性计算的架构方案。
AI 推荐理由
论文核心评估 LLM 在复杂金融表格中的数值推理与逻辑提取能力,揭示推理瓶颈。
研究机构
Qubera AG
苏黎世大学计算机科学系
论文信息