摘要
基于大语言模型的自动科学发现依赖于识别真正新颖的解。标准强化学习惩罚高方差变异,导致策略偏向熟悉模式,限制最大奖励提升。为此,本文提出 UG-TTT 方法,通过在冻结基模型上维护低秩适配器集合,量化预测分歧以隔离认知不确定性,并将其作为探索_bonus_融入策略梯度。该方法引导策略朝向训练覆盖不足但具发现潜力的区域,并通过核范数正则化保持适配器多样性。实验表明,该方法在多个科学发现基准上显著提升了最大奖励与解的多样性。
AI 推荐理由
论文提出利用认知不确定性驱动策略探索,实现科学发现中的自我改进与新颖解生成,属核心进化机制。
研究机构
Stanford University
National University of Sciences and Technology
University of Oklahoma
论文信息