摘要
针对现有评估框架无法衡量大纲、起草等具体合成操作的缺陷,本文提出 RAVEL 智能体框架,使测试者能自主规划并执行文本合成任务。配套推出的 C3EBench 基准包含 1258 个专业样本,通过逆向工程流程隔离四项关键能力。对 14 个大模型的分析表明,多数模型在指令受限时的上下文理解上表现不佳。研究证实,代理式文本合成主要取决于推理能力而非生成能力,强推理者可显著提升弱生成器的输出质量。
AI 推荐理由
论文核心发现文本合成由推理能力主导,并验证强推理者引导弱生成器的机制。
研究机构
清华大学
北京大学
论文信息