摘要
本研究提出 MobilityBench,一个用于评估基于大语言模型的路线规划代理在真实移动场景中表现的可扩展基准。该基准基于高德地图大规模匿名用户查询构建,涵盖全球多城市的多样化规划意图。为实现可复现的端到端评估,设计了确定性 API 回放沙箱以消除环境方差,并提出了以结果有效性为核心的多维评估协议。实验表明,当前模型在基础检索与规划任务上表现尚可,但在偏好约束规划方面仍存在显著不足。
AI 推荐理由
论文核心是评估 LLM 代理在真实场景中的路线规划能力,直接对应规划主题。
研究机构
计算机网络信息中心, 中国科学院, 阿里巴巴集团, 北京, 中国
AMAP, 阿里巴巴集团, 北京, 中国
计算机网络信息中心, 中国科学院, 北京, 中国
中国科学技术大学, 合肥, 中国
论文信息