摘要
本文揭示了大语言模型具备内在的行为可塑性,能通过 Token 条件生成在推理时无缝切换行为模式(如从逐步推理转为直接回答)。基于此,作者提出 Token 条件强化学习(ToCoRL)框架,利用强化学习将这种瞬态适应转化为稳定的行为模式。实验表明,ToCoRL 能在不降低能力的前提下实现精确的行为控制,使擅长复杂数学推理的大模型也能高效处理事实性问答任务。
AI 推荐理由
论文核心研究通过 token 条件生成动态切换推理模式,解决推理模型在事实问答中的局限。
研究机构
Quwen Team, Alibaba Group
Shanghai Jiao Tong University
论文信息