Small Language Models Reasoning Correction Teacher-Student Framework Deterministic Execution
摘要

针对小语言模型(SLM)无法自我纠正推理错误的局限,本文提出语义梯度下降(SGDe)框架。该方法利用前沿大模型作为教师,在离散语义空间中生成自然语言批评作为方向性梯度,迭代优化 SLM 的工作流产物。通过将代理工作流编译为包含 DAG 拓扑和确定性代码的执行计划,SGDe 实现了能力卸载与结构共识。实验表明,在少量样本下,该方法在对抗合成测试集上的准确率显著优于现有提示优化器,有效解决了企业部署中的认知不对称问题。

AI 推荐理由

论文核心提出 SGDe 框架,通过编译确定性结构显著提升小模型推理纠错能力与准确率。

研究机构
School of Science and Technology, Kwansei Gakuin University, Japan School of Engineering & Computer Science, Victoria University of Wellington, New Zealand
论文信息
作者 Zan Kai Chong, Hiroyuki Ohsaki, Bryan Ng
发布日期 2026-04-19
arXiv ID 2604.17450
相关性评分 9/10 (高度相关)