摘要
大语言模型常被用于将自然语言优化问题转化为数学公式和求解器代码,但仅匹配目标值无法验证正确性,因为数值一致可能掩盖语义错误。本文提出“优化建模幻觉检测”任务,旨在审计问题描述、符号模型与代码实现间的结构一致性。作者构建了首个细粒度幻觉分类体系,并据此设计了 OptArgus 多智能体检测系统,包含指挥路由、专家审计员及证据整合模块。实验表明,该系统在减少误报、定位错误及检测自然生成幻觉方面均优于单智能体基线。
AI 推荐理由
论文聚焦多智能体检测 LLM 建模幻觉,核心在于逻辑一致性与符号推理审计。
研究机构
Zhejiang University
Great Bay University
Peking University
Shenzhen Loop Area Institute
Jilin University
论文信息