摘要
测试时学习(TTL)使语言智能体能在推理阶段通过与环境交互迭代优化性能。现有方法依赖固定的人工设计自适应策略,而非针对下游任务进行优化。本文主张最优策略应从任务环境中习得,并提出 Meta-TTL 框架,将有效策略的发现建模为双层优化问题。内环执行标准 TTL 过程,外环利用进化搜索在多样化任务分布上迭代 refine 自适应策略。实验表明,该方法在多个基准上均优于人工基线,且具备泛化能力。
AI 推荐理由
论文提出通过进化搜索优化自适应策略,核心在于 Agent 的自我改进与适应机制。
研究机构
National University of Singapore
论文信息