摘要
在多智能体系统中,智能体需具备理解与推理社会规范的能力。现有规范性多智能体系统研究多依赖符号方法,局限于简化环境。相比之下,多模态大语言模型(MLLMs)为机器人在复杂图文场景中识别和推理规范提供了新可能。本文通过三十个文本故事和三十个图像故事,评估了五种 MLLMs 回答规范相关问题的能力,并与人类表现对比。结果显示,MLLMs 在文本规范推理上优于图像,GPT-4o 表现最佳,但所有模型在处理复杂规范时仍面临挑战。
AI 推荐理由
论文核心评估多模态大模型在社会规范场景下的推理能力,直接对应 reasoning 主题。
研究机构
奥塔哥大学计算机学院,新西兰
论文信息