Reinforcement Learning Human Simulation Verbal Feedback Self-Improvement
摘要

人类通过言语反馈学习社会规范,而现有 LLM 研究多集中于代码和数学等可量化领域。为使 LLM 更逼真地模拟人类行为,本文提出 DITTO 模型,将主观、多维的言语反馈作为强化学习的一级信号。该模型利用 GRPO 算法,在每次 rollout 后接收反馈并生成改进版本,将指导信息蒸馏至基础策略中,无需测试时反馈。此外,文章引入了涵盖六大类任务的 SOUL 基准。实验表明,DITTO 平均提升 36%,在多项指标上超越 GPT-5.4,证明了言语反馈 RL 的有效性。

AI 推荐理由

论文核心是通过言语反馈进行强化学习,实现 Agent 行为的自我改进与进化。

研究机构
Microsoft
论文信息
作者 Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun et al.
发布日期 2026-05-19
arXiv ID 2605.20506
相关性评分 9/10 (高度相关)