optimization-like reasoning search space reinforcement learning step-by-step decision making
摘要

可验证奖励训练提升了数学与代码推理能力,但难以覆盖现实世界中需在众多可行方案中寻找高价值计划的复杂决策。本文提出 OPT*,这是一类可扩展的优化风格任务族,旨在沿复杂度轴训练和评估 LLM 的逐步优化式推理。该任务提供可行性检查器与评估器,并通过复杂度参数扩展搜索空间而无需新的人工标注。研究探讨了两种机制:求解器引导的在线策略优化与基于搜索的离线强化学习。理论与实证表明,OPT* 能有效提升 LLM 在大搜索空间中的逐步推理效率。

AI 推荐理由

论文核心研究 LLM 在扩展搜索空间中的逐步优化式推理机制与训练方法。

研究机构
University of Cambridge
论文信息
作者 Nicolás Astorga, Nabeel Seedat, Mihaela van der Schaar
发布日期 2026-06-03
arXiv ID 2606.05464
相关性评分 9/10 (高度相关)