内部机制 表示学习 可解释性
摘要

本文探讨大语言模型是否在不同符号系统(如散文、代码、数学)中共享统一的内部推理基础。通过引入 TriForm 基准并利用 RSA、交叉形式探测及激活修补技术,研究发现中层存在“格式无关推理子空间”(FARS)。提取的 10 维子空间能显著放大概念结构并抑制形式信息,跨形式修补时保留高达 96% 的输出性能。该子空间具有泛化性且跨架构收敛,支持柏拉图表示假说,并揭示了声明性与程序性表示间的不对称性。

AI 推荐理由

论文核心研究 LLM 内部推理表示的格式无关子空间,深入揭示推理机制。

研究机构
University of Southern California Duke University
论文信息
作者 Aojie Yuan, Zhiyuan Su
发布日期 2026-05-10
arXiv ID 2605.09496
相关性评分 9/10 (高度相关)