摘要
本文研究了推理语言模型如何通过推理过程访问存储在参数中的世界知识。研究发现,默认情况下模型未能生成最优的知识访问推理,但简单的“逐步思考”提示可显著改善知识召回。受此启发,作者提出利用世界知识问答作为可验证奖励,通过强化学习训练模型更好地对参数化知识进行推理。在 TriviaQA 上的实验显示性能提升 9.9%,并在多个基准测试中取得显著增益,表明推理模型在参数知识访问方面尚未被充分优化,但易于改进。
AI 推荐理由
论文核心研究如何利用推理机制激活参数化知识,提出通过强化学习优化模型推理路径。
研究机构
哥伦比亚大学
论文信息