value alignment pseudo-deliberation LLM evaluation multi-agent system
摘要

大型语言模型常基于其陈述的价值观进行评估,但这些价值观往往无法可靠地转化为实际行动,这种现象被称为“价值 - 行动差距”。本文指出,即使在显式推理下,该差距依然存在,揭示了一种更深层的失效模式——“伪深思”,即表现出原则性推理却缺乏相应的行为对齐。为此,我们提出了 VALDI 框架,用于量化陈述价值观与生成对话之间的一致性。该框架涵盖五个领域的 4941 个以人为本的场景,包含激发价值观阐述、推理和行动的三项任务,以及五项衡量价值观遵循程度的指标。实验显示,各类模型均存在显著的价值错位。此外,我们提出了 VIVALDI,一种多智能体价值观审计器,旨在通过在生成不同阶段进行干预来解决这一问题。

AI 推荐理由

论文核心探讨显式推理与行为对齐的失败,深入分析推理过程在价值观执行中的局限性。

研究机构
New York University New York City, NY 10012 New York University Shanghai
论文信息
作者 Sushrita Rakshit, Hanwen Zhang, Hua Shen
发布日期 2026-05-11
arXiv ID 2605.09893
相关性评分 8/10 (高度相关)