Scientific Ideation Reinforcement Learning Reasoning Framework LLM Alignment
摘要

科学构思旨在特定科学背景下提出新颖解决方案。现有基于大语言模型的智能体方法虽模仿人类研究工作流,却未能充分建模科学推理,导致生成的方案缺乏技术深度与科学依据。为此,本文提出 MoRI 框架,使大语言模型显式学习从研究动机到方法论的推理过程。该框架首先通过监督微调初始化模型以生成研究动机,随后利用复合强化学习奖励进行训练:一是熵感知信息增益,鼓励模型挖掘基于真实方法的高复杂度技术细节;二是对比语义增益,约束推理轨迹以保持与科学有效方案的概念一致性。实验表明,MoRI 在新颖性、技术严谨性和可行性等多个维度上显著优于强大的商业大语言模型及复杂智能体基线。

AI 推荐理由

论文核心提出动机引导的推理框架,通过强化学习优化科学推理过程,深度契合推理主题。

研究机构
华东师范大学经济与管理学院
论文信息
作者 Chenyang Gu, Jiahao Cheng, Meicong Zhang, Pujun Zheng, Jinquan Zheng et al.
发布日期 2026-03-19
arXiv ID 2603.19044
相关性评分 9/10 (高度相关)