Behavioral Plasticity Reasoning Modes Reinforcement Learning Token-Conditional Generation
摘要

本文揭示了大语言模型具备内在的行为可塑性,能通过 Token 条件生成在推理时无缝切换行为模式(如从逐步推理转为直接回答)。基于此,作者提出 Token 条件强化学习(ToCoRL)框架,利用强化学习将这种瞬态适应转化为稳定的行为模式。实验表明,ToCoRL 能在不降低能力的前提下实现精确的行为控制,使擅长复杂数学推理的大模型也能高效处理事实性问答任务。

AI 推荐理由

论文核心研究通过 token 条件生成动态切换推理模式,解决推理模型在事实问答中的局限。

研究机构
Quwen Team, Alibaba Group Shanghai Jiao Tong University
论文信息
作者 Liyuan Mao, Le Yu, Jing Zhou, Chujie Zheng, Bowen Yu et al.
发布日期 2026-03-09
arXiv ID 2603.08398
相关性评分 9/10 (高度相关)