temporal reasoning medical QA safety evaluation constraint following
摘要

大型语言模型常被用于回答日常健康问题,如非处方药(OTC)的再次服用安全性。然而,现有医学问答评估鲜少涉及此场景,该场景需追踪给药时间、计算滚动 24 小时摄入量并遵循标签约束。本文提出 DOSEBENCH,包含 81 个精心策划的对乙酰氨基酚和布洛芬使用场景及人工标注金标准。通过评估四个模型在多次运行中的表现,发现模型在处理滚动窗口推理和模糊案例时经常失败,且看似自信的回答仍可能违反剂量约束。研究表明,OTC 剂量问答是评估医疗领域时间推理、约束遵循及安全不确定性处理的有效测试平台。

AI 推荐理由

论文核心评估 LLM 在时间不确定性下的滚动窗口推理与约束遵循能力,属推理研究。

研究机构
Illinois Institute of Technology Chicago, IL, USA
论文信息
作者 Maroof Kousar, Yibo Hu
发布日期 2026-06-02
arXiv ID 2606.04262
相关性评分 9/10 (高度相关)