摘要
大型语言模型日益成为自主推理代理,但在关键应用中需确保其推理在语义等价输入变化下保持稳定。现有基准测试无法捕捉这一可靠性维度。本文提出一种蜕变测试框架,通过八种语义保持变换,系统评估了跨越四种架构家族的七个基础模型在八个科学领域十九个多步推理问题上的鲁棒性。结果显示模型规模不能预测鲁棒性,较小模型反而表现出更高的稳定性,而较大模型则更显脆弱。
AI 推荐理由
论文核心研究 LLM 代理在语义等价输入下的推理稳定性与鲁棒性。
研究机构
LUXEMBOURG Institute of Science and Technology, L-4362 Esch-sur-Alzette, Luxembourg
Department of Computer Applications in Science & Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain
Escola Tècnica Superior de Enginyeria (ETSE), Universitat Pontificia Comillas, 28015 Madrid, Spain
Département d'Informatique de Sistemas y Computadores, Universitat Politècnica de València, Valencia, Spain
Université du Luxembourg, L-4365 Esch-sur-Alzette, Luxembourg
论文信息