moral reasoning evaluation benchmark LLM capability
摘要

为使高能力 AI 系统在动态环境中安全运行,必须具备识别和响应道德理由的能力。现有研究基于 MoReBench 数据集对前沿模型进行评估,结论普遍悲观。本文提出重构该数据集的评估范式:不再仅依据人类制定的评分标准衡量模型回答,而是让模型像人类一样生成道德分析的评分标准。结果显示,模型生成的标准与人类标准高度校准,差异主要反映道德问题的多维性。据此,LLM 的道德推理能力远超此前认知。

AI 推荐理由

论文核心探讨 LLM 的道德推理能力,通过新评估方法论证其推理潜力,属推理领域核心研究。

研究机构
中国人民大学哲学院 约翰霍普金斯大学政府与政策学院
论文信息
作者 Menghang Zhu, Seth Lazar
发布日期 2026-06-10
arXiv ID 2606.11635
相关性评分 9/10 (高度相关)