摘要
大型语言模型虽提升了自动法律推理水平,但其表现是否源于真实推理能力尚不明确。本文通过实证研究与数据污染检测协议,严格评估了 LLM 在税法推理中的可靠性,发现数据污染会虚增性能。研究系统对比了单体 LLM 与将法条转化为形式表示并委托符号求解器的混合系统。结果表明,法律推理具有组合性,神经符号框架能提供更可靠、鲁棒的基础及更强的泛化能力。
AI 推荐理由
论文核心评估 LLM 法律推理能力,对比纯神经与神经符号方法,属推理机制研究。
研究机构
Bloomberg
Michigan State University
论文信息