Agent Tool Use Reinforcement Learning Combinatorial Optimization Heuristic Design
摘要

自动启发式设计(AHD)是解决 NP 难组合优化问题的新兴范式。现有框架通常将大语言模型视为被动生成器,受限于固定工作流和手动设计的上下文,难以捕捉状态依赖信息。为此,本文提出 AHD Agent,这是一种集成工具的多轮框架,使 LLM 能主动决定生成启发式或调用工具从求解环境中检索针对性证据。我们引入代理强化学习系统,利用新颖的环境合成管道优化小型模型的通用 AHD 能力。实验表明,该 4B 参数代理在八个领域表现媲美或超越更大模型基线,且评估次数显著减少。

AI 推荐理由

论文核心在于赋予 Agent 主动调用工具获取证据的技能,以优化启发式设计过程。

研究机构
1Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of Computer Science and Engineering, Southern University of Science and Technology 2Zhongguancun Academy 3The Hong Kong University of Science and Technology
论文信息
作者 Haoze Lv, Ning Lu, Ziang Zhou, Shengcai Liu
发布日期 2026-05-09
arXiv ID 2605.08756
相关性评分 9/10 (高度相关)