Machine Translation Self-Reflection Reinforcement Learning Model Internalization Efficiency
摘要

近年来,大型推理模型在机器翻译领域应用广泛,但现有的“先思考后翻译”范式导致推理成本高昂。为此,本文提出 ReflectMT,一种采用“先翻译后思考”范式的两阶段反思内化算法。该方法利用强化学习培养模型的“翻译 - 反思 - 优化”能力:第一阶段提升高质量反思与修正能力;第二阶段将反思中获得的知识内化。推理时,模型无需显式推理步骤即可直接生成高质量翻译。实验表明,其在多项指标上优于多步推理模型,同时大幅降低令牌消耗。

AI 推荐理由

论文核心在于通过强化学习实现自我反思能力的内化与模型自我改进,属于典型的自我进化研究。

研究机构
School of Informatics, Xiamen University WeChat AI, Tencent Inc.
论文信息
作者 Kunquan Li, Yingxue Zhang, Fandong Meng, Jinsong Su
发布日期 2026-04-21
arXiv ID 2604.19144
相关性评分 9/10 (高度相关)