Differential Privacy LLM Benchmark Reasoning Capability Automated Verification
摘要

差分隐私应用广泛,但其算法设计与验证需专家级推理,门槛较高。现有方法或依赖专用语言,或需人工介入。本文探讨大语言模型自动化差分隐私推理的潜力,提出 DPrivBench 基准,涵盖多主题与难度层级,旨在避免简单模式匹配。实验表明,最强模型虽能处理基础机制,但在高级算法上表现不佳,暴露出当前推理能力的显著差距。通过失败模式分析,本文指出了改进方向,为开发评估此类方法奠定基础。

AI 推荐理由

论文核心评估 LLM 在差分隐私领域的专业推理能力,构建基准并分析推理缺口。

研究机构
Halcoglu Data Science Institute, UC San Diego Department of Computer Science and Engineering, UC San Diego Department of Electrical Engineering, National Taiwan University
论文信息
作者 Erchi Wang, Pengrun Huang, Eli Chien, Om Thakkar, Kamalika Chaudhuri et al.
发布日期 2026-04-17
arXiv ID 2604.15851
相关性评分 9/10 (高度相关)