Geo-Spatial QA Agent Planning Dynamic Environment Benchmark
摘要

尽管大语言模型展现出卓越的推理能力,但其在动态地理空间环境中进行目的驱动探索的潜力尚未得到充分研究。现有地理空间问答基准主要关注静态检索,无法捕捉涉及动态用户位置和复合约束的真实世界规划复杂性。为此,本文引入 EVGeoQA,这是一个基于电动汽车充电场景的新型基准,具有独特的位置锚定和双目标设计。每个查询均绑定用户实时坐标,整合充电需求与协同活动偏好双重目标。此外,我们提出了 GeoRover,一个基于工具增强代理架构的通用评估框架,用于评估模型在动态多目标探索中的能力。实验表明,虽然模型能利用工具解决子任务,但在长距离空间探索方面仍显不足,但涌现出通过总结历史轨迹提升效率的能力。

AI 推荐理由

论文核心评估 LLM 在动态环境下的多目标探索与任务规划能力,提出专门框架。

研究机构
北京师范大学人工智能学院 北京师范大学人工智能关键实验室 教育部教育智能技术与教育应用工程研究中心 国防科技大学计算机科学与技术学院
论文信息
作者 Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He
发布日期 2026-04-08
arXiv ID 2604.07070
相关性评分 9/10 (高度相关)