Credit Assignment Reinforcement Learning Long-Horizon Tasks Self-Distillation Bayesian Inference
摘要

长程代理任务因稀疏的最终奖励而面临严重的信用分配挑战,难以判断哪些中间推理步骤或工具交互促成了最终结果。本文提出 PBSD(特权贝叶斯自蒸馏),一种基于贝叶斯校准的自蒸馏方法。该方法通过计算验证答案的后验与先验概率比,利用贝叶斯规则将其转化为学生模型与特权教师模型间的似然比,并通过自回归分解生成轮次级的信用信号。实验表明,PBSD 能有效将稀疏监督转化为细粒度指导,显著提升域内及域外性能,并促进从短上下文训练到长上下文推理的知识迁移。

AI 推荐理由

核心研究长程任务中的细粒度信用分配,直接优化中间推理步骤的质量评估与策略学习。

研究机构
School of AI, Shanghai Jiao Tong University XYZ AI Lab
论文信息
作者 Yang Tian, Rui Wang, Xumeng Wen, Junjie Li, Shizhao Sun et al.
发布日期 2026-06-08
arXiv ID 2606.09348
相关性评分 9/10 (高度相关)