Representational Convergence Reasoning Mechanisms Model Interpretability Causal Analysis
摘要

本文探讨了“柏拉图表征假说”是否延伸至推理过程。通过评估 8 个家族共 16 个大语言模型在数学、科学等 800 个推理问题上的表现,研究发现三种分离现象:难度倒置(失败问题上表征更收敛)、代际差距(决策前表征对齐,决策后发散)以及附带正确性(共享信息可解码但对预测因果影响微弱)。结果表明,表征收敛反映的是共享输入处理约束,而非共享推理策略,这对集成设计和可解释性评估具有重要意义。

AI 推荐理由

论文核心研究 LLM 在推理过程中的表征收敛与策略分歧,直接探讨推理机制本质。

研究机构
Control Laboratory, School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST), Daejeon 34141, Republic of Korea
论文信息
作者 Muhammad Usama, Dong Eui Chang
发布日期 2026-05-22
arXiv ID 2605.23315
相关性评分 9/10 (高度相关)