Long-form Generation Consistency Benchmark LLM Evaluation
摘要

针对大语言模型在生成长篇叙事时难以维持事实、角色及世界观一致性的问题,本文提出了 ConStory-Bench 基准测试。该基准涵盖 2000 个提示词,定义了五类一致性错误及其细分子类型,并开发了自动检测管道 ConStory-Checker。实验评估表明,一致性错误多发于事实与时序维度,常出现在叙事中段及高熵文本区域。本研究填补了长文本一致性评估的空白,为提升模型长期记忆与上下文一致性能力提供了重要依据。

AI 推荐理由

论文核心研究长文本生成中的事实与逻辑一致性,直接关联 Agent 的长期记忆保持与上下文管理机制。

研究机构
Microsoft, Beijing, China Singapore University of Technology and Design
论文信息
作者 Junjie Li, Xinrui Guo, Yuhao Wu, Roy Ka-Wei Lee, Hongzhi Li et al.
发布日期 2026-03-06
arXiv ID 2603.05890
相关性评分 9/10 (高度相关)