摘要
大语言模型虽具备强大推理能力,但在分布偏移下性能常下降。现有测试时适应方法依赖梯度更新或外部指导。本文提出免训练测试时对比学习(TF-TTCL)框架,使冻结模型能通过蒸馏自身推理经验实现在线改进。该方法包含“探索 - 反思 - 引导”循环:利用多智能体角色扮演生成多样推理轨迹,对比优劣轨迹提取显式规则,并在推理时检索规则以引导模型规避错误。实验表明,该方法在封闭及开放任务中均显著优于零样本基线及现有适应方法。
AI 推荐理由
论文核心在于通过对比学习动态优化 LLM 的推理轨迹,提升分布偏移下的推理鲁棒性。
研究机构
South China University of Technology
Pazhou Laboratory
论文信息