摘要
本文针对当前 AI 科学家研究多关注执行能力而忽视“科学品味”(即判断和提出高影响力研究想法的能力)的问题,提出了基于社区反馈的强化学习(RLCF)范式。该方法将科学品味学习建模为偏好建模与对齐问题:首先利用 70 万对高低引用论文训练
AI 推荐理由
论文提出基于社区反馈的强化学习范式,实现 AI 科学家自我改进与偏好对齐,属核心进化研究。
研究机构
复旦大学
中央民族大学
论文信息