reasoning supervision data metrics model scaling training data selection
摘要

验证推理模型的训练数据通常需昂贵的试错微调。本研究探讨能否利用内在数据指标在训练前可靠预测推理数据集的效用。我们提出一套定量度量,并通过在波兰语推理数据集的语义变体上微调 8B 和 11B 模型评估其预测力。分析显示,这些内在指标与下游性能显著相关。关键发现是效用预测具有尺度依赖性:小模型依赖对齐指标以确保精度,而大模型受益于高冗余和详细轨迹以解决复杂任务。

AI 推荐理由

论文核心研究推理监督数据属性与模型推理能力的关系,提出预测指标框架。

研究机构
Wrocław Tech, 50-370 Wrocław, Poland
论文信息
作者 Mikołaj Langner, Dzmitry Pihulski, Jan Eliasz, Michał Rajkowski, Przemysław Kazienko et al.
发布日期 2026-05-13
arXiv ID 2605.13290
相关性评分 9/10 (高度相关)