摘要
针对资源受限环境挑战,本文提出一种轻量级混合框架,用于亚马逊棋博弈。该框架融合基于图的结构性推理与大语言模型的生成能力,利用图注意力自编码器指导多步蒙特卡洛树搜索,并采用随机图遗传算法优化评估信号。不同于依赖专家演示的传统方法,本框架能从噪声监督中学习。实验表明,图注意力机制有效过滤了 LLM 输出噪声,在决策准确率上显著优于基线及教师模型,验证了在严格计算约束下从通用基础模型演化出专用高性能游戏 AI 的可行性。
AI 推荐理由
论文核心在于结合图注意力与 LLM 进行结构化推理,解决资源受限下的决策问题。
研究机构
东南大学数学学院,南京,210096,中国
波兰科学院系统研究所,华沙,01-447,波兰
东南大学计算机科学与工程学院,南京,210096,中国
波兰萨格勒布大学,卢布林,90-113,波兰
论文信息