摘要
现有大模型评估多局限于单轮生成,难以捕捉交互中的迭代推理过程。本文提出 MUTATE 基准,从路径级(多方案探索)和动作级(非常规对象使用)两个层面评估 Agent 的发散性思维。针对现有框架在收敛压力下易陷入行动固化的缺陷,作者提出 ReDNA 方法,将无约束的候选生成与收敛选择分离。实验表明,ReDNA 显著提升了各层面的发散性表现,并证实了其源于对韧性发散推理的质性增强,而非简单的环境探索。
AI 推荐理由
论文核心研究交互式 Agent 的发散性推理机制,提出新基准与架构以解决思维固化问题。
研究机构
崇实大学
论文信息