摘要
针对现有多模态大模型在面部表情识别中依赖被动输入且缺乏主动感知能力的问题,本文提出 ActFER 框架。该框架将识别任务重构为主动视觉证据获取与多模态推理过程,能动态调用工具检测人脸、缩放关键区域,并通过视觉思维链推理面部动作单元与情绪。为实现此行为,开发了效用校准的 GRPO 强化学习算法,利用多层可验证奖励和对比效用估计,使模型学会何时进行局部检查及如何推理证据。实验表明,该方法显著优于被动基线并提升了动作单元预测精度。
AI 推荐理由
论文核心在于通过主动工具调用获取视觉证据,并基于此进行多模态思维链推理,显著提升情感识别能力。
研究机构
University of Science and Technology of China
Nanjing University
论文信息