Pragmatic Reasoning Evaluation Methods Scalar Diversity LLM Assessment
摘要

评估大语言模型(LLM)的语用推理仍具挑战,因模型行为随评估方法而异。先前研究表明提示判断可能与内部概率分布不一致。本研究利用标量多样性作为分级诊断工具,对比直接概率测量与元语言提示在多种模型及设置下的表现。结果显示无单一方法始终占优,语用行为在不同模型家族、策略及任务结构中差异显著。标量多样性梯度仅在特定组合中出现,表明语用推理是内部概率表征与任务诱导行为的交互结果,而非单一范式可捕捉的稳定能力。

AI 推荐理由

论文核心研究 LLM 的语用推理能力,评估不同方法下的推理表现差异。

研究机构
Sungkyunkwan University
论文信息
作者 Ye-eun Cho
发布日期 2026-05-09
arXiv ID 2605.09042
相关性评分 9/10 (高度相关)