摘要
针对部署环境中 LLM 代理因动作选择错误累积导致效率降低的问题,现有推理时适应方法多依赖提示或检索,缺乏显式决策层。本文提出 OLIVIA 框架,将 ReAct 代理的动作选择层建模为上下文线性 bandit,利用冻结隐藏状态作为上下文。该方法直接在动作接口进行自适应,保留原有推理过程,并提供不确定性估计和轻量级在线更新。实验表明,OLIVIA 在多个基准上显著优于静态 ReAct 及基于提示的基线,证明了显式在线决策层的有效性。
AI 推荐理由
论文提出推理时自适应框架,实现 Agent 基于反馈的在线自我改进与策略更新。
研究机构
University of Illinois at Urbana-Champaign
论文信息