摘要
本文指出命令行智能体的环境反馈流是丰富的监督信号,但现有强化学习方法往往将其忽略。作者提出 ECHO(环境交叉熵混合目标),通过结合策略梯度损失与预测环境观测的辅助损失,将终端反馈转化为密集监督。该方法无需额外 rollout 即可显著提升性能,使模型在无专家演示下实现自我改进,并更好地预测终端动态,证明了环境观测可作为强大的在策略监督信号。
AI 推荐理由
论文提出利用环境反馈进行无监督自我改进,实现策略的持续进化与自适应学习。
研究机构
Microsoft Research
论文信息