摘要
针对数字硬件设计中自动生成功能正确 RTL 代码面临的长程推理、多步依赖及严格约束挑战,本文提出 StepPRM-RTL 框架。该方法结合逐步轨迹建模、过程奖励模型(PRM)与检索增强微调(RAFT),利用蒙特卡洛树搜索探索替代推理路径,生成包含原理与增量代码修改的高质量轨迹。PRM 对中间步骤提供密集反馈,指导强化式更新,使模型不仅学习如何构建代码,更理解其逻辑成因。实验表明,该方法在功能正确性与推理保真度上显著优于现有基准。
AI 推荐理由
论文核心解决长程推理与多步依赖问题,通过逐步过程奖励模型提升推理保真度。
研究机构
IBM Research, San Jose, CA, USA
论文信息