multi-hop reasoning evaluation protocol compositionality post-training factual knowledge
摘要

后训练评估常将多跳推理视为单一能力,本文指出该假设具有误导性:原子知识稳定但组合行为差异巨大的“组合崩溃”现象被聚合指标掩盖。作者引入双门控协议,将后训练增益分解为原子稳定性、残差组合和关键深度三个独立通道。实验表明,现有目标可能误导推理能力提升的判断,建议采用受控指标。诊断探针显示部分失败源于生成时计算约束而非永久 inability。

AI 推荐理由

论文核心研究多跳推理中的组合崩溃现象,提出新评估协议分解推理能力。

研究机构
浙江大学 香港浸会大学 北京智源研究院 哈尔滨工业大学 杭州电子科技大学
论文信息
作者 Zhe Yu, Wenpeng Xing, Yunzhao Wei, Jie Chen, Hongzhi Wang et al.
发布日期 2026-05-26
arXiv ID 2605.26789
相关性评分 9/10 (高度相关)