摘要
大型语言模型常作为推理模块,但在生成符合人类偏好的解决方案方面存在困难。人类对齐的决策需兼顾显性目标与塑造歧义解决的潜在偏好。现有方法或依赖大量交互,或缺乏跨任务泛化能力。本文提出 CLIPR 框架,旨在从有限的对话输入中学习代表潜在偏好的可操作、可迁移自然语言规则。该框架通过自适应反馈迭代优化规则,并应用于多种环境下的分布内及分布外歧义任务。评估表明,CLIPR 在提升对齐度和降低推理成本方面优于现有方法。
AI 推荐理由
论文核心在于利用 LLM 进行高层推理,通过推断潜在偏好来解决歧义决策问题。
研究机构
Oregon State University
论文信息