Chain-of-Thought Tensor Program Optimization Step-level Supervision LLM Reasoning
摘要

尽管大语言模型具备强大推理能力,但张量程序优化仍需精确的组合变换决策。现有方法缺乏可验证的步级监督,导致 LLM 难以在巨大搜索空间中做出可靠单步决策。本文提出 Step-TP 数据集,提供具身化、原子化的步级监督及结构化思维链推理。该数据集通过中间程序状态构建闭环推理,支持可靠的多步优化而非结果模仿。其设计包含令牌高效的可验证中间表示、原子可组合策略、显式状态转移监督及策略过滤机制,显著提升优化过程的可解释性与准确性。

AI 推荐理由

论文核心提出基于思维链(CoT)的逐步推理数据集,旨在提升 LLM 在复杂优化中的单步决策可靠性。

研究机构
The University of Hong Kong Hong Kong, China Ant Group Hangzhou, China University of Science and Technology of China Hefei, China
论文信息
作者 Mengfan Liu, Da Zheng, Junwei Su, Chuan Wu
发布日期 2026-05-25
arXiv ID 2605.25954
相关性评分 9/10 (高度相关)