Reinforcement Learning Reasoning Trace Planner-Executor Reward Modeling
摘要

针对现有强化学习仅依赖最终答案正确性而忽视推理轨迹忠实度的问题,本文提出 TraceLift 框架。该框架将推理视为中间产物,通过冻结的执行器将规划器的推理转化为最终结果以获取反馈。我们引入了基于执行器的奖励机制,结合规则评分与执行提升度,激励高质量且有用的推理轨迹。此外,构建了 TRACELIFT-GROUPS 数据集,包含高质量参考轨迹及多种局部扰动后的缺陷轨迹。实验表明,该方法在代码和数学基准上显著优于仅基于执行的训练,证明推理监督应兼顾轨迹外观及其对下游模型的实际效用。

AI 推荐理由

论文核心提出基于执行器反馈的推理奖励机制,直接优化推理轨迹质量。

研究机构
D* Lab Independent Researcher
论文信息
作者 Tianyang Han, Hengyu Shi, Junjie Hu, Xu Yang, Zhiling Wang et al.
发布日期 2026-05-05
arXiv ID 2605.03862
相关性评分 9/10 (高度相关)