Online Learning ReAct Agents Inference-time Adaptation Linear Bandit
摘要

针对部署环境中 LLM 代理因动作选择错误累积导致效率降低的问题,现有推理时适应方法多依赖提示或检索,缺乏显式决策层。本文提出 OLIVIA 框架,将 ReAct 代理的动作选择层建模为上下文线性 bandit,利用冻结隐藏状态作为上下文。该方法直接在动作接口进行自适应,保留原有推理过程,并提供不确定性估计和轻量级在线更新。实验表明,OLIVIA 在多个基准上显著优于静态 ReAct 及基于提示的基线,证明了显式在线决策层的有效性。

AI 推荐理由

论文提出推理时自适应框架,实现 Agent 基于反馈的在线自我改进与策略更新。

研究机构
University of Illinois at Urbana-Champaign
论文信息
作者 Sheldon Yu, Junda Wu, Xintong Li, Nikki Lijing Kuang, Sizhe Zhou et al.
发布日期 2026-05-11
arXiv ID 2605.11169
相关性评分 9/10 (高度相关)