摘要
后训练评估常将多跳推理视为单一能力,本文指出该假设具有误导性:原子知识稳定但组合行为差异巨大的“组合崩溃”现象被聚合指标掩盖。作者引入双门控协议,将后训练增益分解为原子稳定性、残差组合和关键深度三个独立通道。实验表明,现有目标可能误导推理能力提升的判断,建议采用受控指标。诊断探针显示部分失败源于生成时计算约束而非永久 inability。
AI 推荐理由
论文核心研究多跳推理中的组合崩溃现象,提出新评估协议分解推理能力。
研究机构
浙江大学
香港浸会大学
北京智源研究院
哈尔滨工业大学
杭州电子科技大学
论文信息