reasoning evaluation MarODE quality assessment LLM reasoning traces
摘要

生成式语言模型产生的推理轨迹广泛应用于数学求解等任务,但现有评估方法机械且难以捕捉人类中心的推理质量。本文提出 MarODE,一种基于马尔可夫公式和常微分方程的离线评估框架,用于对推理轨迹进行质量评分。通过人类中心扰动和判断验证,该框架在大规模评估中显著优于现有基线。结果强调了理论驱动评估框架在推理轨迹日益重要的系统中的价值。

AI 推荐理由

论文核心提出评估推理轨迹质量的框架,直接针对 LLM 推理能力的度量与优化。

研究机构
印度理工学院德里分校电气工程系,印度新德里 印度理工学院德里分校人工智能系,印度新德里 阿联酋阿布扎比印度理工学院,阿联酋阿布扎比
论文信息
作者 Arghodeep Nandi, Ojasva Saxena, Tanmoy Chakraborty
发布日期 2026-03-02
arXiv ID 2603.01580
相关性评分 9/10 (高度相关)