Self-Evolving Agents Generative Optimization Engineering Benchmark Iterative Refinement
摘要

现有大模型智能体基准多关注二元通过/失败任务,忽视了真实世界中通过迭代优化可行设计所体现的工程价值。为此,本文提出 Frontier-Eng,这是一个经人工验证的生成式优化基准,涵盖五大类共 47 项工程任务。该基准采用“提议 - 执行 - 评估”的迭代循环,智能体在固定交互预算下生成候选产物,接收可执行验证器反馈并修正方案。任务基于工业级模拟器,提供连续奖励信号并强制执行可行性约束。评估显示,尽管 Claude 4.6 Opus 表现最稳健,但所有模型仍面临挑战。分析表明改进频率与幅度呈双重幂律衰减,且在固定预算下,深度对艰难改进至关重要。

AI 推荐理由

论文核心研究智能体在工程任务中的自我进化与迭代优化机制。

研究机构
Einsia.AI
论文信息
作者 Yizhe Chi, Deyao Hong, Dapeng Jiang, Tianwei Luo, Kaisen Yang et al.
发布日期 2026-04-14
arXiv ID 2604.12290
相关性评分 9/10 (高度相关)