Chain-of-Thought Interpretability Reinforcement Learning Attention Mechanism
摘要

大型语言模型日益依赖思维链(CoT)解决复杂任务,但确保推理轨迹真正影响并忠实反映最终答案的生成过程仍具挑战。本文提出 AtManRL 方法,利用可微注意力操纵结合强化学习来习得更忠实的推理。通过训练加法注意力掩码识别 CoT 中对正确答案至关重要的令牌,衍生出显著性奖励信号,促使模型生成真正影响预测的推理轨迹。该方法在 GRPO 框架中将显著性奖励与基于结果的奖励整合,联合优化正确性与可解释性。实验表明,该方法能有效识别关键推理令牌并训练更透明的推理模型。

AI 推荐理由

论文核心研究通过可微注意力机制提升思维链推理的忠实度与透明度,直接针对推理能力。

研究机构
Aleph Alpha Research Lab1141 TU Darmstadt Hessian.AI
论文信息
作者 Max Henning Höth, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu
发布日期 2026-04-17
arXiv ID 2604.16158
相关性评分 9/10 (高度相关)