algorithm reinvention unlearning reasoning capability test-time reinforcement learning
摘要

本文探讨大语言模型是否具备基础创新能力,聚焦于其能否重塑计算机科学中的基础算法。研究提出“遗忘 - 重塑”流程,利用基于 GRPO 的策略内遗忘方法移除模型对特定算法(如 Dijkstra 算法)的先验知识,随后测试其在受控环境下的重塑能力。实验表明,最强模型在无提示下可成功重塑 50% 的算法,且测试时强化学习有助于避免“思维坍塌”。结果揭示了 LLM 创新思维的潜力与局限。

AI 推荐理由

核心研究 LLM 在去除先验知识后重新推导基础算法的推理能力与思维过程。

研究机构
Xiong an AI Institute Shanghai Q Zha University Institute for Interdisciplinary Information Sciences, Tsinghua University Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China Beijing University of Posts and Telecommunications, Beijing, China Independent Researcher
论文信息
作者 Jian Zhao, Haoren Luo, Yu Wang, Yuhan Cao, Pingyue Sheng et al.
发布日期 2026-04-07
arXiv ID 2604.05716
相关性评分 9/10 (高度相关)