Reinforcement Learning Graph Reasoning Zero-shot Learning Text-rich Networks
摘要

针对文本丰富网络(TRN)的零样本推理难题,本文提出 TRN-R1-Zero 框架。该方法摒弃了监督微调和思维链蒸馏,仅利用强化学习对基础大语言模型进行后训练。通过引入感知邻居的组相对策略优化目标,并基于新颖的边际增益度量动态调整奖励,有效引导模型整合文本语义与关系结构进行推理。实验表明,该框架在多种 TRN 基准测试中表现优异,且仅需节点级训练即可实现边级和图级任务的零样本泛化。

AI 推荐理由

论文核心是通过纯强化学习提升 LLM 在文本丰富网络中的零样本推理能力,直接优化推理机制。

研究机构
School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Queensland, Australia
论文信息
作者 Yilun Liu, Ruihong Qiu, Zi Huang
发布日期 2026-04-21
arXiv ID 2604.19070
相关性评分 9/10 (高度相关)