摘要
针对大语言模型在多轮交互中难以动态适应用户需求的问题,本文指出现有方法仅单一优化提示或权重,忽略了歧义与能力不足的耦合效应。作者提出 ROSA2 框架,将交互重构为“词语”与“权重”的联合优化问题。该方法利用文本梯度消除意图歧义,并通过参数更新弥补能力缺口。理论证明协同自适应能严格减少收敛所需的参数偏移。实验显示,ROSA2 在 MATH 基准上超越最先进基线 30%,并将交互轮次减少 40%。
AI 推荐理由
论文提出测试时协同自适应框架,核心在于模型通过自我调整权重与指令实现能力进化。
研究机构
香港科技大学(广州)人工智能与数字技术学院
香港科技大学(广州)计算与数据科学学院
论文信息