摘要
尽管大型语言模型具备卓越的推理能力,但固有的社会偏见常在思维链过程中级联,导致持续的“偏见传播”。现有方法多关注静态约束,难以中断此过程。本文提出 Self-Debias 框架,将去偏重构为战略资源重分配问题,动态调整输出概率以修正偏见路径。该方法采用细粒度的轨迹级目标,选择性修订偏见后缀并保留有效上下文前缀。此外,集成基于一致性过滤的在线自改进机制,自主合成监督信号。仅需少量标注样本,即可激活高效的自我纠正,在保持通用推理能力的同时实现优越的去偏效果。
AI 推荐理由
论文提出自我纠正框架与在线自改进机制,核心在于模型的自我进化与去偏能力。
研究机构
暨南大学
南京理工大学
新加坡国立大学
论文信息