Human-Aligned Decision Making Latent Preferences LLM Reasoning Transferable Rules
摘要

大型语言模型常作为推理模块,但在生成符合人类偏好的解决方案方面存在困难。人类对齐的决策需兼顾显性目标与塑造歧义解决的潜在偏好。现有方法或依赖大量交互,或缺乏跨任务泛化能力。本文提出 CLIPR 框架,旨在从有限的对话输入中学习代表潜在偏好的可操作、可迁移自然语言规则。该框架通过自适应反馈迭代优化规则,并应用于多种环境下的分布内及分布外歧义任务。评估表明,CLIPR 在提升对齐度和降低推理成本方面优于现有方法。

AI 推荐理由

论文核心在于利用 LLM 进行高层推理,通过推断潜在偏好来解决歧义决策问题。

研究机构
Oregon State University
论文信息
作者 Alina Hyk, Sandhya Saisubramanian
发布日期 2026-05-12
arXiv ID 2605.12682
相关性评分 8/10 (高度相关)