Reinforcement Learning World Modeling Agent Training Co-training
摘要

强化学习(RL)虽能指导大语言模型代理选择高奖励动作,却缺乏对环境反馈的监督。世界建模可弥补此缺陷,但现有方法常需独立模拟器或额外计算。本文观察到在线 RL 轨迹已包含动作与观测的配对信号,据此提出 PaW 框架,在 RL 过程中为同一策略添加辅助世界建模监督,且不改变推理范式。为确保监督有效稳定,PaW 引入基于动作熵的数据选择、噪声容忍损失及奖励自适应损失平衡机制。实验表明该方法在多个基准上显著优于强 RL 基线。

AI 推荐理由

论文提出策略与世界模型协同训练框架,通过 RL 实现 Agent 自我改进与适应,属核心进化研究。

研究机构
Southern University of Science and Technology Hong Kong University of Science and Technology Hong Kong University of Science and Technology (Guangzhou) Hong Kong Polytechnic University LIGHTSPEED
论文信息
作者 Ning Lu, Baijiong Lin, Shengcai Liu, Jiahao Wu, Haoze Lv et al.
发布日期 2026-06-01
arXiv ID 2606.02388
相关性评分 9/10 (高度相关)