摘要
生成式语言模型产生的推理轨迹广泛应用于数学求解等任务,但现有评估方法机械且难以捕捉人类中心的推理质量。本文提出 MarODE,一种基于马尔可夫公式和常微分方程的离线评估框架,用于对推理轨迹进行质量评分。通过人类中心扰动和判断验证,该框架在大规模评估中显著优于现有基线。结果强调了理论驱动评估框架在推理轨迹日益重要的系统中的价值。
AI 推荐理由
论文核心提出评估推理轨迹质量的框架,直接针对 LLM 推理能力的度量与优化。
研究机构
印度理工学院德里分校电气工程系,印度新德里
印度理工学院德里分校人工智能系,印度新德里
阿联酋阿布扎比印度理工学院,阿联酋阿布扎比
论文信息