摘要
针对文本丰富网络(TRN)的零样本推理难题,本文提出 TRN-R1-Zero 框架。该方法摒弃了监督微调和思维链蒸馏,仅利用强化学习对基础大语言模型进行后训练。通过引入感知邻居的组相对策略优化目标,并基于新颖的边际增益度量动态调整奖励,有效引导模型整合文本语义与关系结构进行推理。实验表明,该框架在多种 TRN 基准测试中表现优异,且仅需节点级训练即可实现边级和图级任务的零样本泛化。
AI 推荐理由
论文核心是通过纯强化学习提升 LLM 在文本丰富网络中的零样本推理能力,直接优化推理机制。
研究机构
School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Queensland, Australia
论文信息