Protein Design Reasoning-Augmented Decoding Agent Framework Direct Preference Optimization
摘要

蛋白语言模型通常是被动的预言机,缺乏咨询外部生物物理反馈或在违反约束时重定向生成的机制。本文提出 AgentPLM,通过两项创新解决此问题:一是推理增强解码(RAD),在自回归生成中交织工具调用以获取实时反馈;二是对比代理策略优化(CAPO),一种轨迹级直接偏好优化扩展,端到端训练策略以学习何时利用反馈。实验表明,该方法在抗体优化等任务中达到最先进水平,提供了无需显式回溯即可实现在线错误修正的机制证据。

AI 推荐理由

论文核心提出推理增强解码机制,将工具调用与生成过程交织,实现在线错误修正。

研究机构
Bedford College, London, United Kingdom
论文信息
作者 Sahil Rahman, Maxx Richard Rahman
发布日期 2026-06-01
arXiv ID 2606.02386
相关性评分 9/10 (高度相关)