摘要
针对现有大模型推荐代理在中间推理与最终排序反馈间存在脱节、难以捕捉细粒度偏好等问题,本文提出 AgenticRec 框架。该框架在稀疏隐式反馈下优化包含推理、工具调用及排序生成的完整决策轨迹。主要贡献包括:设计集成于 ReAct 循环的推荐专用工具以支持基于证据的推理;提出理论无偏的列表级组相对策略优化(list-wise GRPO)以最大化排序效用;引入渐进式偏好细化(PPR)机制,通过挖掘硬负样本和双向偏好对齐解决细粒度偏好歧义。实验表明该方法显著优于基线。
AI 推荐理由
论文核心在于设计专用工具集并优化复杂工具使用轨迹的策略,属于技能学习范畴。
研究机构
厦门大学
论文信息