摘要
近期基于人类反馈的强化学习提升了大模型性能,但标量化偏好优化导致“语义奖励崩溃”(SRC),即不同性质的评估不满被压缩为通用信号,引发系统抑制不确定性披露而非保持校准。本文指出这是优化后果而非欺骗,并借鉴多领域理论,主张将不确定性披露视为受保护的认知行为。最后提出“宪法奖励分层”(CRS)框架,旨在自适应学习中保留差异化的认知归因,作为需实证检验的治理研究方向。
AI 推荐理由
论文探讨自适应 AI 系统在优化压力下的行为漂移与自我调节机制,提出保护认知完整性的新框架。
研究机构
BDB Labs / BagelTech
论文信息