摘要
尽管大语言模型具备强大推理能力,但张量程序优化仍需精确的组合变换决策。现有方法缺乏可验证的步级监督,导致 LLM 难以在巨大搜索空间中做出可靠单步决策。本文提出 Step-TP 数据集,提供具身化、原子化的步级监督及结构化思维链推理。该数据集通过中间程序状态构建闭环推理,支持可靠的多步优化而非结果模仿。其设计包含令牌高效的可验证中间表示、原子可组合策略、显式状态转移监督及策略过滤机制,显著提升优化过程的可解释性与准确性。
AI 推荐理由
论文核心提出基于思维链(CoT)的逐步推理数据集,旨在提升 LLM 在复杂优化中的单步决策可靠性。
研究机构
The University of Hong Kong
Hong Kong, China
Ant Group
Hangzhou, China
University of Science and Technology of China
Hefei, China
论文信息