LLM Evaluation Agentic Framework Text Synthesis Reasoning Capability
摘要

针对现有评估框架无法衡量大纲、起草等具体合成操作的缺陷,本文提出 RAVEL 智能体框架,使测试者能自主规划并执行文本合成任务。配套推出的 C3EBench 基准包含 1258 个专业样本,通过逆向工程流程隔离四项关键能力。对 14 个大模型的分析表明,多数模型在指令受限时的上下文理解上表现不佳。研究证实,代理式文本合成主要取决于推理能力而非生成能力,强推理者可显著提升弱生成器的输出质量。

AI 推荐理由

论文核心发现文本合成由推理能力主导,并验证强推理者引导弱生成器的机制。

研究机构
清华大学 北京大学
论文信息
作者 Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Bosi Wen, Yidong Wang et al.
发布日期 2026-02-28
arXiv ID 2603.00686
相关性评分 9/10 (高度相关)