摘要
大语言模型虽具备推理与工具使用能力,但其适应动态环境并持续优化解决方案的核心认知机能尚待探索。本文提出 OPT-BENCH 基准,结合机器学习任务与 NP 难问题,评估智能体基于内在自我反思而非机械工具应用的自我改进能力。同时推出 OPT-Agent 框架,模拟人类认知适应机制,通过感知、记忆与推理循环迭代优化方案。实验表明,更强模型能更有效利用反馈进行自我提升,但仍受限于基础能力,未达人类专家水平。
AI 推荐理由
论文核心研究 Agent 在大规模搜索空间中的迭代自我优化与自适应能力,提出评估基准及框架。
研究机构
Tongji University
Shanghai AI Lab
Fudan University
Zhejiang University
University of California San Diego
论文信息