摘要

本文针对当前 AI 科学家研究多关注执行能力而忽视“科学品味”(即判断和提出高影响力研究想法的能力)的问题,提出了基于社区反馈的强化学习(RLCF)范式。该方法将科学品味学习建模为偏好建模与对齐问题:首先利用 70 万对高低引用论文训练

AI 推荐理由

论文提出基于社区反馈的强化学习范式,实现 AI 科学家自我改进与偏好对齐,属核心进化研究。

研究机构
复旦大学 中央民族大学
论文信息
作者 Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou et al.
发布日期 2026-03-15
arXiv ID 2603.14473
相关性评分 9/10 (高度相关)