Prompt Evolution Online Learning Human-in-the-loop Production System
摘要

本文提出 HOPM,一种分层在线提示变异框架,旨在提升高风险生产环境中语言模型的适应性、证据依据性及可审计性。该系统将提示视为在线策略,利用版本路由器选择提示,并通过确定性护栏归因失败。结合人工审查与自动评判的双重反馈机制,动态更新路由策略与变异优先级。在真实市场纠纷证据工作流中的消融实验表明,完整 HOPM 显著提升了胜率与生成质量,同时降低了问题标记率,证明了其在生产环境中的有效性。

AI 推荐理由

论文提出在线提示变异框架,通过双环反馈实现 Agent 策略的自我适应与持续改进,属自我进化核心研究。

研究机构
eBay Inc. San Jose, CA, USA
论文信息
作者 Nataraj Agaram Sundar Tejas Morabia
发布日期 2026-05-31
arXiv ID 2606.01472
相关性评分 9/10 (高度相关)