Retrosynthesis Reinforcement Learning Chain-of-Thought Long-horizon Planning
摘要

逆合成规划是有机化学的基础任务,但因组合复杂性而极具挑战。传统方法依赖混合框架,割裂了局部分子转化与全局规划目标的逻辑连贯性。为此,本文提出 ReTriP,一种端到端生成框架,将逆合成重构为直接的思维链推理任务。该框架建立了路径一致的分子表示,并采用从推理蒸馏到基于可验证奖励的强化学习的渐进式课程训练,有效对齐逐步生成与实际路线效用。在 RetroBench 上的评估表明,ReTriP 取得了最先进性能,在长程规划中展现出优于混合基线的鲁棒性。

AI 推荐理由

论文核心解决逆合成规划任务,提出端到端框架优化长程规划能力。

研究机构
中科院人工智能研究院(AIR) 清华大学 PharMolix Inc.
论文信息
作者 Chenyang Zuo, Siqi Fan, Yizhen Luo, Zaiqing Nie
发布日期 2026-03-31
arXiv ID 2603.29723
相关性评分 9/10 (高度相关)