constraint reasoning optimization evaluation benchmark power grid
摘要

大型语言模型(LLM)在多种自然语言任务中展现出卓越能力,但其在约束条件下解决抽象与优化问题的能力尚待探索。本文研究了 LLM 是否能在最优潮流(OPF)问题的物理与运行约束下进行推理和优化。我们引入了一套极具挑战性的评估框架,要求具备推理、结构化输入处理、算术运算及约束优化等基础技能。评估结果显示,当前最先进的 LLM 在大多数任务中表现失败,即便是专用推理模型在最复杂场景下亦然。本研究揭示了 LLM 在处理约束下结构化推理方面的关键缺陷,并为开发能解决现实电网优化问题的高能力 LLM 助手提供了严格的测试环境。

AI 推荐理由

论文核心评估 LLM 在约束条件下的抽象推理与优化能力,直接针对推理机制。

研究机构
SnT – University of Luxembourg, Luxembourg Luxembourg Institute of Health (LIH), Luxembourg
论文信息
作者 Fabien Bernier, Salah Ghamizi, Pantelis Dogoulis, Maxime Cordy
发布日期 2026-03-24
arXiv ID 2603.23004
相关性评分 9/10 (高度相关)