摘要
测试时缩放已成为提升大语言模型推理能力的有效范式。针对现有方法在协调并行推理轨迹或利用历史信息方面的局限,本文提出 TMAS 框架。该框架将推理组织为专用智能体间的协作过程,引入分层记忆机制:经验库复用可靠的中间结论,指南库记录高层策略以避免冗余。此外,设计了混合奖励强化学习方案,兼顾基础推理能力保持、经验利用及探索激励。实验表明,TMAS 在挑战性推理基准上实现了优于基线的迭代缩放效果。
AI 推荐理由
论文核心旨在通过多智能体协同扩展测试时计算,显著提升 LLM 的推理能力。
研究机构
iQuest Research
Beihang University
论文信息