摘要
针对大语言模型智能体在多步推理任务中面临的稀疏奖励难题,本文提出 T-STAR 框架。该方法通过将独立轨迹整合为统一的“认知树”,识别并合并功能相似的步骤,从而恢复潜在的关联奖励结构。利用内省估值机制在树上传播奖励以获取步级优势,并通过上下文思维嫁接技术对比成功与失败分支合成修正推理。实验表明,该方法在需要扩展推理链的任务上显著优于现有基线。
AI 推荐理由
论文核心解决多步推理中的稀疏奖励问题,提出树状结构优化推理链,显著提升长程推理能力。
研究机构
Department of Electrical and Computer Engineering, George Washington University
论文信息