Reasoning-Action Coupling Diagnostic Benchmark Tool Use Efficiency
摘要

本文提出 ZebraArena,一个程序化生成的诊断环境,旨在研究工具增强型大语言模型中的推理与行动耦合问题。该环境具有可控难度和最小化知识依赖的设计,以排除记忆或数据污染的干扰。任务要求模型通过精准的工具调用获取关键信息进行演绎推理,提供确定性评估及理论最优查询次数基准。实验表明,即使是 GPT-5 等前沿模型在困难实例上准确率仅 60%,且实际工具调用量远超理论最优值,揭示了内部推理与外部行动交互中的显著差距。

AI 推荐理由

论文核心研究推理与行动的耦合机制,通过诊断环境评估多步推理能力。

研究机构
斯坦福大学微软研究院
论文信息
作者 Wanjia Zhao, Ludwig Schmidt, James Zou, Vidhisha Balachandran, Lingjiao Chen
发布日期 2026-03-19
arXiv ID 2603.18614
相关性评分 9/10 (高度相关)