摘要
基于大语言模型的智能体日益部署于现实世界任务中,其行为受 inherently 模糊的领域策略管辖。现有基准多假设策略明确,存在评估缺口。本文提出 DRIP-R 基准,利用零售领域的策略模糊性构建无单一正确解的场景。该基准包含精心策划的策略模糊退货场景、真实客户画像、支持工具调用的全双工对话模拟及涵盖策略遵循等多维度的多裁判评估框架。实验表明,前沿模型在相同模糊场景下存在根本性分歧,证实模糊性是 LLM 决策面临的系统性挑战。
AI 推荐理由
论文核心研究模糊策略下的决策与推理挑战,评估模型推理一致性。
研究机构
Interdisciplinary Transformation University Austria
论文信息