摘要
小型视觉语言模型(SVLM)虽高效但常受限于视觉脆弱性与工具编排能力不足,且通常依赖昂贵的监督微调。本文提出 SPECTRA 框架,利用冷启动强化学习在无监督条件下引导 SVLM 自举智能体能力。该方法通过软结构多轮展开约束,强制智能体在综合推理前明确排序工具衍生的证据,从而将推理扎根于视觉观察。研究引入多目标奖励信号及工具效用指标,使智能体无需人类偏好标签即可自我发现鲁棒行为。实验表明,该方法显著提升了任务准确率与工具效率。
AI 推荐理由
论文核心在于通过无监督强化学习优化智能体的工具编排与使用效率,属于技能学习范畴。
研究机构
印度理工学院德里分校,印度
印度理工学院阿布扎比分校,阿联酋
微软研究,印度
论文信息