摘要
大语言模型通常以固定参数部署,虽可通过增加推理计算量提升性能,但难以纠正模型误解或适应特定查询结构。测试时优化虽能更新参数,但现有方法依赖外部数据或缺乏查询特异性。本文提出查询条件测试时自训练(QueST)框架,利用输入查询隐含信号构建问题 - 解对,作为监督信号在测试时进行参数高效微调。该方法无需外部数据即可实现查询特异性适配。在七个数学推理基准及 GPQA-Diamond 科学推理基准上,QueST 均优于现有测试时优化基线,证明了其有效性。
AI 推荐理由
论文提出测试时自训练框架,显著提升数学与科学推理基准性能,核心聚焦推理能力增强。
研究机构
KAIST
论文信息