摘要
LLM 驱动的工作流常通过“生成 - 评估 - 修订”迭代循环产出结果,但面临何时停止发布的统计挑战。由于缺乏校准所需的似然模型,本文提出一种“始终有效”的发布封装器。该方法构建高分失败案例的硬负参考池,将黑盒评分转化为保守证据,并利用 e-过程积累证据以支持可选停止。理论证明其在不可行任务上能控制错误发布概率,同时在可行任务上保持非平凡发布率。MBPP+ 案例显示,该方法显著减少了过早错误发布。
AI 推荐理由
论文聚焦生成 - 验证循环中的停止决策,核心在于评估推理结果的可信度与有效性。
研究机构
未提供
论文信息