Video Reward Model Chain-of-Thought Anomaly Detection Vision-Language Models
摘要

本文提出 CaC,一种基于视觉语言模型的由粗到细异常奖励模型。推理时,先全局扫描定位异常时间窗,再进行细粒度空间定位,最后通过结构化时空思维链得出稳健判断。为此构建了首个带帧级标注的大规模生成视频异常数据集,并设计三阶段渐进训练范式。除常规准确率奖励外,引入时空 IoU 奖励监督中间定位过程。实验表明,CaC 能稳定聚焦细微异常,在细粒度基准上准确率提升 25.7%,作为奖励信号可减少 11.7% 的生成视频异常并提升整体质量。

AI 推荐理由

论文核心提出结构化时空思维链推理机制,是关键创新点。

研究机构
BJTU BUPt Kuaishou Technology
论文信息
作者 Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan et al.
发布日期 2026-05-12
arXiv ID 2605.11723
相关性评分 8/10 (高度相关)