摘要
本文研究了语言模型(LM)在受控环境下如何比较包含测量单位的数量(如 110 厘米与 1.2 米)。研究发现,当数值接近比较边界时,模型准确率显著下降,且错误呈现系统性特征。线性代理模型显示,LM 的偏好可由数值差异和单位尺度差异的线索预测;因果干预实验进一步证实,针对这些变量对齐的子空间进行操作会改变模型输出。结果表明,LM 并非先将表达式转换为统一的精确标度表示,而是通过一组针对数字和单位的启发式规则来进行数量比较。
AI 推荐理由
论文核心研究 LLM 在数值与单位比较中的推理机制,揭示其启发式策略而非精确转换。
研究机构
Tohoku University
SOKENDAI
RIKEN
论文信息