摘要
评分标准常用于评估不可验证的开放式任务,但现有框架仅将其作为独立于推理轨迹的外部评估器,无法主动引导生成过程。本文提出
AI 推荐理由
提出将评分标准内化为推理引导的新范式,直接增强模型生成过程中的内部推理能力。
研究机构
清华大学
论文信息