User Modeling Reasoning Synthesis Post-hoc Rationalization Action Reconstruction
摘要

用户建模旨在利用语言模型模仿个体行为。现有方法常通过合成推理轨迹来增强数据,但这往往是事后合理化而非真实推理。本文提出 Recon 方法,利用动作重构来评估推理轨迹的预测能力:给定上下文和候选推理,重构模型预测动作,其重构 fidelity 决定推理质量。实验表明,Recon 在四个领域优于标准基线,且基于其奖励训练的模型显著提升了下游用户建模性能,证明了事后合理化的局限性及有效推理应自然导出动作。

AI 推荐理由

论文核心提出重构引导的推理合成方法,旨在解决事后合理化问题,提升推理质量。

研究机构
University of California, Berkeley
论文信息
作者 Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap et al.
发布日期 2026-05-26
arXiv ID 2605.26969
相关性评分 9/10 (高度相关)