摘要
本文提出 GeoBuildBench,旨在评估大语言模型及多模态智能体能否将非正式的自然语言平面几何问题转化为可执行的几何构造。与现有关注答案正确性或静态图解的基准不同,该基准将几何图视为交互式构造任务:智能体需生成领域特定语言(DSL)程序,以产出满足明确指定几何对象及可验证约束的图表。该基准包含 489 道经筛选验证的中文教科书风格问题。评估显示,尽管现有模型有一定成功率,但常出现结构性幻觉、对象缺失及无法满足几何约束等问题,且利用反馈进行自我修正的能力有限。
AI 推荐理由
论文核心评估 LLM 将自然语言转化为可执行几何构造的落地推理能力,强调约束满足与自我修正。
研究机构
北京大学
王宽诚教育基金会
论文信息