Reasoning Models Presupposition Handling Factuality LLM Evaluation
摘要

数百万用户依赖 AI 模型获取信息,但许多查询包含事实错误的假设。既往研究表明大语言模型常无法挑战此类错误假设,反而强化用户误解。鉴于近期模型推理能力的进步,本文重新审视大型推理模型(LRMs)能否识别底层假设并恰当回应。研究构建了涵盖健康、科学及常识领域、具有不同预设强度的查询数据集,以评估主流模型。结果显示,相较于非推理模型,推理模型的准确率仅小幅提升(2-11%),但仍未能有效挑战大量(26-42%)虚假预设,且其表现易受预设表达强度的影响。

AI 推荐理由

论文核心评估大型推理模型(LRMs)处理预设假设的推理能力,直接针对推理机制。

研究机构
Indian Institute of Science
论文信息
作者 Rose Sathyanathan, Kinshuk Vasisht, Danish Pruthi
发布日期 2026-05-04
arXiv ID 2605.03050
相关性评分 9/10 (高度相关)