摘要
大型语言模型难以通过直接推理解决复杂组合问题,常需合成可执行求解器。本文提出 CP-SynC-XL 基准,评估三种构建范式。研究发现,Python+OR-Tools 正确性最高,而提示优化搜索仅带来微小加速,却因“启发式陷阱”导致长尾问题正确率骤降。LLM 倾向于用局部近似替代完整搜索或注入未验证边界。结论建议:LLM 应专注于形式化约束,分离检查其生成的搜索优化策略。
AI 推荐理由
研究 LLM 解决组合优化问题的推理局限,分析启发式陷阱对正确性的影响。
研究机构
University of Pennsylvania
University of Toronto
Google DeepMind
论文信息