摘要
现有大模型智能体基准多关注二元通过/失败任务,忽视了真实世界中通过迭代优化可行设计所体现的工程价值。为此,本文提出 Frontier-Eng,这是一个经人工验证的生成式优化基准,涵盖五大类共 47 项工程任务。该基准采用“提议 - 执行 - 评估”的迭代循环,智能体在固定交互预算下生成候选产物,接收可执行验证器反馈并修正方案。任务基于工业级模拟器,提供连续奖励信号并强制执行可行性约束。评估显示,尽管 Claude 4.6 Opus 表现最稳健,但所有模型仍面临挑战。分析表明改进频率与幅度呈双重幂律衰减,且在固定预算下,深度对艰难改进至关重要。
AI 推荐理由
论文核心研究智能体在工程任务中的自我进化与迭代优化机制。
研究机构
Einsia.AI
论文信息