RTL Generation Multi-Agent System Reinforcement Learning Self-Training
摘要

现有基于 API 的 RTL 生成系统与工业实践脱节,依赖黄金测试bench 且无法利用私有数据。本文提出 ChipMATE,首个用于 RTL 生成的自训练多智能体框架。受工业中交叉验证启发,该框架配对 Verilog 与 Python 参考模型智能体,在无黄金标准下相互验证输出。设计了基于回溯的推理工作流防止错误传播,并采用两阶段训练策略:先单独训练饱和单点能力,再联合训练提升协作效率。实验表明其在 VerilogEval V2 上显著优于现有自训练模型及超大参数模型。

AI 推荐理由

论文核心在于通过多智能体协作与强化学习实现模型的自我训练与能力进化,显著提升代码生成质量。

研究机构
UCSD Columbia University
论文信息
作者 Zhongkai Yu, Yichen Lin, Chenyang Zhou, Yuwei Zhang, Kun Zhou et al.
发布日期 2026-05-13
arXiv ID 2605.12857
相关性评分 9/10 (高度相关)