摘要
随着大语言模型及智能体系统在社会环境中的部署,规范性能力对行为安全至关重要。现有方法仅评估文本判断或固定选项选择,存在局限。本文提出 NoRA,一个视觉第一人称视频基准,要求模型从零生成候选动作,并通过显式的“事实 - 理由 - 动作”支持图进行论证。该基准包含 1420 个标注视频片段,通过动作对齐、事实基础和支持绑定评估 grounded 合理性分数。实验表明,当前多模态模型虽能识别合理动作和相关事实,但在构建完整合理动作空间及正确绑定局部支持方面表现欠佳。
AI 推荐理由
论文核心评估多模态智能体基于视觉事实的规范性推理与理由构建能力。
研究机构
The University of Sydney
Australian National University
RMIT University
Johns Hopkins University
论文信息