Agent Evaluation Self-Improvement Reinforcement Learning Stock Prediction LLM Judges
摘要

本文提出一种行为评估框架,解决聚合指标掩盖智能体决策质量的问题。该框架利用大语言模型裁判对决策轨迹进行多维评分,并将低分转化为惩罚项融入强化学习奖励函数,形成闭环反馈。实验表明,通过三次微调循环,系统在测试集上的预测误差显著降低,夏普比率提升 18%,尤其在市场高波动期间表现优异,实现了基于行为反馈的系统自我进化。

AI 推荐理由

论文核心在于利用评估反馈闭环驱动 Agent 自我改进与微调,显著提升性能,符合自我进化定义。

研究机构
School of Electrical Engineering and Computer Science, University of Ottawa, Ottawa, Canada
论文信息
作者 Mohammad Al Ridhawi, Mahtab Haj Ali, Hussein Al Osman
发布日期 2026-05-07
arXiv ID 2605.05739
相关性评分 9/10 (高度相关)