摘要
针对阿拉伯语金融 NLP 研究不足的现状,本文提出 SAHM,一个基于文档的基准测试及指令微调数据集,专注于阿拉伯语金融自然语言处理与教法合规推理。该数据集包含 14,380 个专家验证实例,涵盖七项任务,包括 AAOIFI 标准问答、基于法特瓦的问答、会计考试、情感分析及事件因果推理等。研究评估了 19 种主流大语言模型,发现阿拉伯语流利度并不能可靠地转化为基于证据的金融推理能力,模型在识别类任务上表现优于生成和因果推理任务,尤其在事件因果推理方面差距显著。
AI 推荐理由
论文核心评估 LLM 在金融和教法合规领域的因果推理与证据 grounded 推理能力。
研究机构
INSAT
University of Manchester
The Fin AI
论文信息