self-improvement self-supervised learning collaborative training mathematical reasoning
摘要

针对语言模型在无外部监督下持续自我改进的挑战,本文提出同伴预测自训练(PST)框架。该方法利用多模型协作生成的聚合响应作为内部训练信号,通过点互信息衡量中间响应的信息量以动态调整更新幅度。在数学推理基准测试中,PST 显著提升了多种小模型的准确率并缩小了生成器 - 验证器差距,证明了跨模型交互与同伴反馈是实现有效自监督训练及模型自我进化的可行路径。

AI 推荐理由

论文提出无监督自训练框架,核心在于模型通过协作反馈实现自我改进与持续进化。

研究机构
哈佛大学 斯坦福大学
论文信息
作者 Shi Feng, Hanlin Zhang, Fan Nie, Sham Kakade, Yiling Chen
发布日期 2026-04-14
arXiv ID 2604.13356
相关性评分 9/10 (高度相关)