摘要
平台内容审核需依据明确政策规则及上下文条件判定内容合规性。现有基准多简化为标签匹配,忽视底层规则结构。为此,本文提出 RuleSafe-VL 基准,源自公开审核政策,形式化 93 条原子规则与 92 种规则关系,构建 2166 个情境敏感案例。通过四项诊断任务分解审核流程:识别激活规则、恢复规则交互、判断证据充分性及补全缺失上下文后的结果裁决。实验显示,规则关系恢复是主要瓶颈,最佳模型 Macro-F1 仅 64.8,部分安全导向模型低于 7。该研究推动审核评估从终态标签打分转向规则条件决策推理的诊断性评估。
AI 推荐理由
论文核心评估多模态模型在规则约束下的决策推理能力,聚焦逻辑推导过程。
研究机构
北京邮电大学
论文信息