Benchmark Vision-Language Models Human-Centric AI Reasoning
摘要

针对现有基准缺乏细粒度以人为本评估的问题,本文提出 MHPR,一个涵盖个体、多人及人机交互场景的综合感知 - 推理基准。该基准包含多层级数据设计及自动化标注流程,用于评估模型在细粒度属性与高层语义上的表现。研究发现,格式对齐的微调数据显著提升指令遵循能力,而基于坏例分析的强化学习数据进一步增强了困难样本的感知与推理性能。

AI 推荐理由

论文核心构建多维人类感知与推理基准,重点评估并提升模型的细粒度推理能力。

研究机构
AI Compute Group, Baidu
论文信息
作者 Kangkang Wang, Qinting Jiang, Wanping Zhang, Bowen Ren, Shengzhao Wen
发布日期 2026-05-05
arXiv ID 2605.03485
相关性评分 9/10 (高度相关)