摘要
针对供应链优化模型常因建模错误导致不可行的问题,本文提出 OptiRepair 框架。该方法将任务分解为领域无关的可行性修复阶段和基于库存理论的领域特定验证阶段。通过在 976 个问题上的测试及利用求解器验证奖励进行自我教导推理训练,定制的 8B 模型在理性恢复率上达到 81.7%,显著优于现有 API 模型。研究表明,针对求解器交互的定向训练与形式化的理性检查是提升 AI 在运营规划中可靠性的关键。
AI 推荐理由
核心研究利用 LLM 进行诊断与修复的逻辑推理,通过自我教导提升求解器交互中的推理能力。
研究机构
麻省理工学院
阿里巴巴集团
论文信息