test-time training mathematical reasoning self-supervised learning parameter-efficient fine-tuning
摘要

大语言模型通常以固定参数部署,虽可通过增加推理计算量提升性能,但难以纠正模型误解或适应特定查询结构。测试时优化虽能更新参数,但现有方法依赖外部数据或缺乏查询特异性。本文提出查询条件测试时自训练(QueST)框架,利用输入查询隐含信号构建问题 - 解对,作为监督信号在测试时进行参数高效微调。该方法无需外部数据即可实现查询特异性适配。在七个数学推理基准及 GPQA-Diamond 科学推理基准上,QueST 均优于现有测试时优化基线,证明了其有效性。

AI 推荐理由

论文提出测试时自训练框架,显著提升数学与科学推理基准性能,核心聚焦推理能力增强。

研究机构
KAIST
论文信息
作者 Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim
发布日期 2026-05-13
arXiv ID 2605.13369
相关性评分 9/10 (高度相关)