cognitive uncertainty scientific discovery reinforcement learning adapter ensemble exploration bonus
摘要

基于大语言模型的自动科学发现依赖于识别真正新颖的解。标准强化学习惩罚高方差变异,导致策略偏向熟悉模式,限制最大奖励提升。为此,本文提出 UG-TTT 方法,通过在冻结基模型上维护低秩适配器集合,量化预测分歧以隔离认知不确定性,并将其作为探索_bonus_融入策略梯度。该方法引导策略朝向训练覆盖不足但具发现潜力的区域,并通过核范数正则化保持适配器多样性。实验表明,该方法在多个科学发现基准上显著提升了最大奖励与解的多样性。

AI 推荐理由

论文提出利用认知不确定性驱动策略探索,实现科学发现中的自我改进与新颖解生成,属核心进化机制。

研究机构
Stanford University National University of Sciences and Technology University of Oklahoma
论文信息
作者 Kainat Riaz, Muhammad Ahmed Mohsin, Ahsan Bilal, Muhammad Umer, Ayesha Mohsin et al.
发布日期 2026-05-11
arXiv ID 2605.11328
相关性评分 9/10 (高度相关)