摘要

评分标准常用于评估不可验证的开放式任务,但现有框架仅将其作为独立于推理轨迹的外部评估器,无法主动引导生成过程。本文提出

AI 推荐理由

提出将评分标准内化为推理引导的新范式,直接增强模型生成过程中的内部推理能力。

研究机构
清华大学
论文信息
作者 Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang
发布日期 2026-05-08
arXiv ID 2605.07461
相关性评分 9/10 (高度相关)