Self-Programming Game Agents Reinforcement Learning Self-Critique LLM Applications
摘要

本文提出了一种利用大语言模型(LLM)扩展香农博弈机器分类法的新范式。核心是 Nemobot,一个交互式代理工程环境,支持用户创建和部署 LLM 驱动的游戏代理。该系统在四类游戏中展现能力:字典类游戏通过压缩状态映射实现快速适应;可解类游戏运用数学推理生成最优策略及解释;启发式类游戏结合极小化极大算法与众包数据合成策略;学习类游戏则利用人类反馈强化学习与自我批评,通过试错和模仿学习迭代优化策略。Nemobot 展示了代理整合众包学习与人类创造力以实现逻辑自修正的自编程潜力。

AI 推荐理由

论文核心在于通过自我批评和反馈迭代优化策略,实现 AI 自编程与自我进化。

研究机构
Nanyang Technological University, Singapore
论文信息
作者 Chee Wei Tan, Yuchen Wang, Shangxin Guo
发布日期 2026-04-23
arXiv ID 2604.21896
相关性评分 9/10 (高度相关)