摘要
本文研究了在多位思考者提供思维链(CoT)监督下的学习问题,这些思考者虽均提供正确解法,但步骤可能存在系统性差异。研究指出,在某些计算类问题上,单思考者 CoT 易学而仅靠结果监督难学;但在被动数据收集设定下,若存在两位或多位不同思考者,学习难度将显著增加。对此,作者提出一种通用的高效主动学习算法,仅需少量独立于目标精度的 CoT 数据及适度数量的思考者,结合充足的被动结果数据即可实现高效学习。
AI 推荐理由
论文核心研究多思维者下的思维链(CoT)监督学习机制,直接提升推理能力。
研究机构
丰田技术研究所芝加哥
韦茨曼科学研究所
纽约大学
论文信息