摘要
测试时适应无需额外监督即可提升大语言模型推理性能,但现有方法常对所有输入应用统一优化目标,导致在异构推理问题上效率低下或不稳定。本文提出 DiSCTT,一种难度感知、共识引导的自课程框架。该框架根据采样推理轨迹的一致性估算实例级认知不确定性,动态分配优化策略:高一致性输入通过监督微调巩固,低一致性输入则利用共识正则化强化学习优化。实验表明,DiSCTT 在多项数学及通用推理基准上显著优于基线,兼具高精度、低方差及更低计算成本。
AI 推荐理由
论文核心针对推理任务,提出基于共识的自适应课程以提升推理性能。
研究机构
加拿大不列颠哥伦比亚大学计算机科学系
论文信息