Chain-of-Thought Active Learning Theoretical Analysis Math Reasoning
摘要

本文研究了在多位思考者提供思维链(CoT)监督下的学习问题,这些思考者虽均提供正确解法,但步骤可能存在系统性差异。研究指出,在某些计算类问题上,单思考者 CoT 易学而仅靠结果监督难学;但在被动数据收集设定下,若存在两位或多位不同思考者,学习难度将显著增加。对此,作者提出一种通用的高效主动学习算法,仅需少量独立于目标精度的 CoT 数据及适度数量的思考者,结合充足的被动结果数据即可实现高效学习。

AI 推荐理由

论文核心研究多思维者下的思维链(CoT)监督学习机制,直接提升推理能力。

研究机构
丰田技术研究所芝加哥 韦茨曼科学研究所 纽约大学
论文信息
作者 Nirmit Joshi, Roey Magen, Nathan Srebro, Nikolaos Tsilivis, Gal Vardi
发布日期 2026-04-27
arXiv ID 2604.24737
相关性评分 9/10 (高度相关)