摘要
嵌入代理框架的大型推理模型已将信息检索从静态问答转变为开放式探索。然而,实际应用要求模型从分散来源中发现并综合“长尾”事实,该能力尚缺乏评估。本文提出 PolitNuggets,一个多语言基准,通过为 400 位全球精英构建政治传记来评估代理信息综合能力,涵盖超一万条政治事实。我们利用优化的多代理系统标准化评估,并提出 FactNet 协议以评分发现率、细粒度准确性及效率。研究发现当前系统在细节处理上存在困难且效率差异显著,同时揭示了短上下文提取、多语言鲁棒性及可靠工具使用的重要性。
AI 推荐理由
论文核心评估 Agent 的工具使用、多源信息发现与合成能力,属技能范畴。
研究机构
The University of Hong Kong
论文信息