Multi-Agent Systems Explainability Internal Reasoning Game Theory
摘要

针对大型语言模型(LLM)智能体在交互式及部分可观测环境中的可解释性挑战,本文提出了 TriEx 框架。该框架通过三种对齐的视角增强序列决策的可解释性:绑定行动的第一人称自我推理、随时间更新的关于对手的第二人称信念状态,以及基于环境参考信号的第三人称预言机审计。在不完美信息战略游戏中,TriEx 将解释转化为可验证的证据锚定对象,揭示了智能体所言、所信与所做之间的系统性不匹配,强调了可解释性的交互依赖特性。

AI 推荐理由

论文核心在于解释多智能体内部推理过程,通过三视图框架分析信念与行为的一致性。

研究机构
Adelaide University
论文信息
作者 Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang
发布日期 2026-04-21
arXiv ID 2604.20043
相关性评分 9/10 (高度相关)