Temporal Reasoning Tokenization Multilingual Benchmark LLM Evaluation
摘要

本文提出 MultiTempBench,一个涵盖日期算术、时区转换和时间关系提取的多语言时间推理基准,涉及五种语言及多种历法。通过评估 20 个大语言模型并引入多语言日期碎片化比率(mDFR),研究发现:在低资源语言和罕见历法中,时间实体的分词质量是主要瓶颈,导致精度崩溃;而在高资源场景中,时间线性表示是更强的预测因子。该研究揭示了分词与内部表示对时间推理能力的不同影响机制。

AI 推荐理由

论文核心研究时间推理机制,分析分词与表示对推理能力的影响。

研究机构
阿伯丁大学 格勒诺布尔阿尔卑斯大学 & CNRS
论文信息
作者 Gagan Bhatia, Ahmad Muhammad Isa, Maxime Peyrard, Wei Zhao
发布日期 2026-03-19
arXiv ID 2603.19017
相关性评分 9/10 (高度相关)