Recommendation System Reinforcement Fine-tuning Reasoning Enhancement LLM Agent
摘要

针对大语言模型在复杂推荐任务中多步推理能力不足的问题,本文提出了 ReRec 框架。该框架采用强化微调技术,包含三大核心组件:双图增强奖励塑造,结合推荐指标与对齐分数提供细粒度信号;推理感知优势估计,分解输出并惩罚错误步骤以优化推理路径;在线课程调度器,动态评估查询难度以稳定训练。实验表明,ReRec 在提升推理性能的同时保留了通用指令遵循能力,优于现有最先进基线。

AI 推荐理由

论文核心提出增强 LLM 推理能力的框架,通过强化微调解决多步推理难题。

研究机构
香港理工大学
论文信息
作者 Jiani Huang, Shijie Wang, Liangbo Ning, Wenqi Fan, Qing Li
发布日期 2026-04-09
arXiv ID 2604.07851
相关性评分 9/10 (高度相关)