Credit Assignment Reinforcement Learning LLM Reasoning Agentic AI Survey
摘要

本文综述了 2024 至 2026 年间发表的 47 种信用分配方法,针对大语言模型在稀疏奖励下的长轨迹归因难题。研究构建了涵盖粒度与方法学的二维分类体系,区分了推理型与代理型强化学习场景。文章指出,从单链推理向多轮代理交互的转变重塑了信用分配格局,推动了反事实分析等新范式的发展,并提供了结构化资源清单、报告检查表及基准协议规范。

AI 推荐理由

论文核心探讨推理与代理场景下的信用分配,直接决定 LLM 推理链优化。

研究机构
Independent Researcher
论文信息
作者 Chenchen Zhang
发布日期 2026-04-10
arXiv ID 2604.09459
相关性评分 9/10 (高度相关)