摘要
针对现有基于大语言模型的启发式设计主要依赖延迟终点性能的问题,本文提出一种教师感知进化框架。该方法利用独立训练的学习优化策略作为行为教师,通过查询候选程序访问状态下的教师动作偏好,提供局部反馈以指导进化。实验表明,该方法在调度、路由及图优化基准上优于仅依赖性能的基线,且部署时无需神经推理,证明了学习策略可作为自动启发式发现的有效行为反馈源。
AI 推荐理由
论文提出教师感知进化框架,核心在于利用行为信号指导启发式程序的自动进化与发现。
研究机构
深圳技术大学
上海 Polytechnic University
上海交通大学
论文信息