摘要
大型语言模型在财务分析中应用广泛,但其依据明确会计原则审计结构化报表的能力尚待探索。现有基准多关注合成数据的问答或异常检测,难以评估模型对真实报表的规则合规性验证能力。本文提出 FinRule-Bench,这是一个基于真实财务数据和人工 curated 会计原则的基准,涵盖四种 canonical 报表类型。该基准定义了三个递进推理任务:规则验证、规则识别及联合规则诊断。研究引入因果 - 反事实推理协议以增强一致性。实验表明,模型在孤立规则验证上表现良好,但在规则区分和多违规诊断中性能显著下降,为高风险金融分析中的规则驱动推理提供了可复现的测试床。
AI 推荐理由
论文核心评估 LLM 在财务规则下的联合推理、因果反事实推理及诊断能力。
研究机构
亚利桑那州立大学
新加坡国立大学
威廉与玛丽学院
未提供具体单位
论文信息