Deep Reasoning Reflection and Revision Open-Ended Writing Process Reward
摘要

尽管长思维链深度推理显著提升了大模型在数学等可验证领域的表现,但其在开放域写作任务中的有效性尚未被充分探索。本文系统研究发现,现有主流推理模型在此类任务中增益有限,主要归因于缺乏深度的反思与修订模式。为此,我们提出 R2-Write 框架,通过作者 - 评判者迭代交互合成富含显式反思与修订模式的高质量思维轨迹。此外,设计过程奖励机制监督强化学习中的反思质量,以提升性能并减少冗余。多基准实验表明,该方法显著提升了创意写作与深度研究任务的表现。

AI 推荐理由

论文核心研究开放域写作中的深度推理,提出显式反思与修订机制以解锁推理能力。

研究机构
Tongyi Lab, Alibaba Group
论文信息
作者 Wanlong Liu, Bo Zhang, Chenliang Li, Shaopeng Lai, Yuning Wu et al.
发布日期 2026-04-03
arXiv ID 2604.03004
相关性评分 9/10 (高度相关)