摘要
部署为持久助手的 AI 智能体必须在信息环境演化时维持正确信念。针对现有基准多假设静态环境的局限,本文提出 ClawArena,用于评估智能体在多源冲突、动态信念修正及隐式个性化挑战下的表现。该基准通过噪声、部分且矛盾的多渠道信息流,模拟真实世界的复杂性。实验表明,模型能力与框架设计显著影响性能,而具备自我进化技能的框架能部分缩小模型差距,且信念修正难度取决于更新策略而非更新本身的存在。
AI 推荐理由
论文核心评估智能体在动态环境中的信念修正与自我适应能力,直接对应自我进化主题。
研究机构
UNC-Chapel Hill
University of California, Santa Cruz
University of California, Berkeley
论文信息