摘要
本文提出 Trace2Policy 框架,其核心为错误驱动迭代技能精炼(EISR)机制。该方法通过分析验证集上的错误根源,对人工可读的规则文档进行针对性修补与回归测试,从而实现决策规则的自动优化。实验表明,在合规敏感任务中,规则质量而非模型能力是性能关键。经 EISR 优化的规则编译为 Python 后,准确率显著提升且无需推理时调用 LLM。该系统已在物流企业部署,并证明了基于 LLM 的自动变体 Auto-EISR 能以低成本复现专家级的规则演进过程。
AI 推荐理由
论文核心提出 EISR 机制,通过错误驱动迭代优化规则,实现 Agent 决策能力的自我进化与改进。
研究机构
SF Express
论文信息