摘要
道德推理是安全人工智能的基础,但随着 AI 从文本助手演变为具身智能体,确保跨模态一致性至关重要。现有安全技术虽在文本语境中有效,但在视觉输入泛化上存在隐患。本文指出,视觉输入从根本上改变了最先进视觉 - 语言模型(VLM)的道德决策,绕过了基于文本的安全机制。通过引入基于道德基础理论的多模态基准 MDS,研究发现视觉模态激活了类似直觉的路径,覆盖了文本语境中更审慎、安全的推理模式。这揭示了语言调优的安全过滤器无法约束视觉处理的脆弱性,凸显了多模态安全对齐的紧迫性。
AI 推荐理由
论文核心研究视觉输入如何破坏多模态模型的道德推理机制,属于推理能力范畴。
研究机构
清华大学
中国科学院自动化研究所
北京智谱华章科技有限公司
论文信息