摘要
蛋白语言模型通常是被动的预言机,缺乏咨询外部生物物理反馈或在违反约束时重定向生成的机制。本文提出 AgentPLM,通过两项创新解决此问题:一是推理增强解码(RAD),在自回归生成中交织工具调用以获取实时反馈;二是对比代理策略优化(CAPO),一种轨迹级直接偏好优化扩展,端到端训练策略以学习何时利用反馈。实验表明,该方法在抗体优化等任务中达到最先进水平,提供了无需显式回溯即可实现在线错误修正的机制证据。
AI 推荐理由
论文核心提出推理增强解码机制,将工具调用与生成过程交织,实现在线错误修正。
研究机构
Bedford College, London, United Kingdom
论文信息