摘要
在高风险领域,能够表达可解释且校准的不确定性的语言模型至关重要。针对现有后处理方法计算成本高或缺乏校准的问题,本文提出三阶段微调流程:首先基于训练数据计算细粒度熵基不确定性分数;其次通过 Platt 缩放进行校准;最后利用强化学习使模型策略与校准信号对齐。实验表明,该方法在测试时能提供高效、可解释的不确定性估计,且在未见任务上表现出良好的泛化性和鲁棒的推理行为。
AI 推荐理由
论文核心在于训练模型进行不确定性推理,属于高阶推理能力研究。
研究机构
德国癌症研究中心(DKFZ)
德国癌症联盟(DKTK)
法兰克福大学
论文信息