摘要
本文探讨了“柏拉图表征假说”是否延伸至推理过程。通过评估 8 个家族共 16 个大语言模型在数学、科学等 800 个推理问题上的表现,研究发现三种分离现象:难度倒置(失败问题上表征更收敛)、代际差距(决策前表征对齐,决策后发散)以及附带正确性(共享信息可解码但对预测因果影响微弱)。结果表明,表征收敛反映的是共享输入处理约束,而非共享推理策略,这对集成设计和可解释性评估具有重要意义。
AI 推荐理由
论文核心研究 LLM 在推理过程中的表征收敛与策略分歧,直接探讨推理机制本质。
研究机构
Control Laboratory, School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST), Daejeon 34141, Republic of Korea
论文信息