摘要
针对现有多模态大模型在人脸防伪任务中仅能捕捉直觉语义线索而难以感知细粒度视觉模式的问题,本文提出工具增强推理框架(TAR-FAS)。该框架将任务重构为结合视觉工具的思维链范式,使模型能从直觉观察出发,自适应调用外部视觉工具深入探究细微伪造线索。通过构建包含多轮工具使用轨迹的 ToolFAS-16K 数据集,并引入多样性工具组相对策略优化(DT-GRPO)训练流程,实现了模型对高效工具使用的自主习得,显著提升了跨域泛化性能。
AI 推荐理由
论文核心在于 MLLM 自适应调用外部视觉工具进行细粒度调查,属于典型的技能学习与工具使用研究。
研究机构
SAIL, UCAS
MAIS, CASIA
论文信息