Benchmark Dynamic Environment Belief Revision Agent Evaluation
摘要

部署为持久助手的 AI 智能体必须在信息环境演化时维持正确信念。针对现有基准多假设静态环境的局限,本文提出 ClawArena,用于评估智能体在多源冲突、动态信念修正及隐式个性化挑战下的表现。该基准通过噪声、部分且矛盾的多渠道信息流,模拟真实世界的复杂性。实验表明,模型能力与框架设计显著影响性能,而具备自我进化技能的框架能部分缩小模型差距,且信念修正难度取决于更新策略而非更新本身的存在。

AI 推荐理由

论文核心评估智能体在动态环境中的信念修正与自我适应能力,直接对应自我进化主题。

研究机构
UNC-Chapel Hill University of California, Santa Cruz University of California, Berkeley
论文信息
作者 Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu et al.
发布日期 2026-04-05
arXiv ID 2604.04202
相关性评分 9/10 (高度相关)