摘要
本文提出 ConstraintBench,旨在评估大语言模型在无求解器辅助下,直接解决完全指定的约束优化问题的能力。该基准涵盖十个运筹学领域,所有真值解均经 Gurobi 验证。实验发现,可行性而非最优性是主要瓶颈:最佳模型的约束满足率仅为 65.0%,且无模型在联合可行性与最优性上超过 30.5%。研究还揭示了持续时间约束误解、实体幻觉等系统性失败模式,并公开了相关评估基础设施。
AI 推荐理由
论文核心评估 LLM 在约束优化中的直接推理能力,聚焦逻辑与数学推理瓶颈。
研究机构
HalaDir研究团队
论文信息