Test-Time Adaptation Co-Adaptation LLM Alignment
摘要

针对大语言模型在多轮交互中难以动态适应用户需求的问题,本文指出现有方法仅单一优化提示或权重,忽略了歧义与能力不足的耦合效应。作者提出 ROSA2 框架,将交互重构为“词语”与“权重”的联合优化问题。该方法利用文本梯度消除意图歧义,并通过参数更新弥补能力缺口。理论证明协同自适应能严格减少收敛所需的参数偏移。实验显示,ROSA2 在 MATH 基准上超越最先进基线 30%,并将交互轮次减少 40%。

AI 推荐理由

论文提出测试时协同自适应框架,核心在于模型通过自我调整权重与指令实现能力进化。

研究机构
香港科技大学(广州)人工智能与数字技术学院 香港科技大学(广州)计算与数据科学学院
论文信息
作者 Chenxing Wei, Hong Wang, Ying He, Zhongxiang Dai, Bo Jiang et al.
发布日期 2026-03-02
arXiv ID 2603.01375
相关性评分 9/10 (高度相关)