Multi-Agent System Harmful Content Detection Interpretability Zero-Shot Learning Reasoning Chain
摘要

针对模因有害内容检测依赖大量标注数据且泛化能力有限的问题,本文提出 PrismAgent,一种零样本、可解释的多智能体框架。该框架将任务概念化为刑事案件调查,包含分析、调查、起诉和判决四个阶段,由四个专用智能体协同工作。分析师重构模因意图,调查员检索证据构建语境,起诉员进行初步判断,法官综合裁决。其显式的多阶段推理链赋予了模型内在的可解释性。实验表明,该方法在三个数据集上显著优于现有零样本检测方法。

AI 推荐理由

论文核心在于多智能体协作下的显式多阶段推理链,通过模拟刑侦流程实现可解释的有害内容检测。

研究机构
四川大学 南洋理工大学
论文信息
作者 Zihan Ding, Ziyuan Yang, Yi Zhang
发布日期 2026-05-01
arXiv ID 2605.02940
相关性评分 9/10 (高度相关)