摘要
针对现有思维链模型在单次推理中易出错的问题,本文提出高效的递归思考 - 回答过程(R-TAP)。该方法引入置信度生成器评估响应确定性,并通过两种互补奖励机制引导模型进行迭代推理循环。实验表明,R-TAP 在提升大语言模型和视觉语言模型准确率的同时,显著减少了自我反思模式的出现频率,实现了更稳定、快速的推理过程,为未来 AI 推理优化提供了新路径。
AI 推荐理由
提出递归思考 - 回答过程,通过迭代推理循环和置信度机制显著提升模型推理准确性。
研究机构
KAIST
论文信息