Tool Use 6G Network Reinforcement Learning Data Synthesis Closed-loop Interaction
摘要

自主 6G 网络管理需智能体具备执行工具、观测状态变化并自适应决策的能力。针对现有基准缺乏闭环交互的局限,本文提出 6GAgentGym 框架。该框架提供含 42 类工具的交互环境,区分只读观测与状态变更配置,并基于 NS-3 数据校准实验模型。通过 6G-Forge 利用自指令生成与执行验证构建训练轨迹,结合监督微调与在线闭环强化学习,使 8B 开源模型在长程任务上表现优异,为实现自主闭环网络管理提供了可行路径。

AI 推荐理由

论文核心构建包含 42 种工具的环境,聚焦智能体执行工具、状态观测及闭环学习能力。

研究机构
深圳智慧城市科技发展集团有限公司 上海大学智能工程学院
论文信息
作者 Jiao Chen, Jianhua Tang, Xiaotong Yang, Zuohong Lv
发布日期 2026-03-31
arXiv ID 2603.29656
相关性评分 9/10 (高度相关)