RTL Generation Process Reward Model Long-horizon Reasoning Hardware Design Automation
摘要

针对数字硬件设计中自动生成功能正确 RTL 代码面临的长程推理、多步依赖及严格约束挑战,本文提出 StepPRM-RTL 框架。该方法结合逐步轨迹建模、过程奖励模型(PRM)与检索增强微调(RAFT),利用蒙特卡洛树搜索探索替代推理路径,生成包含原理与增量代码修改的高质量轨迹。PRM 对中间步骤提供密集反馈,指导强化式更新,使模型不仅学习如何构建代码,更理解其逻辑成因。实验表明,该方法在功能正确性与推理保真度上显著优于现有基准。

AI 推荐理由

论文核心解决长程推理与多步依赖问题,通过逐步过程奖励模型提升推理保真度。

研究机构
IBM Research, San Jose, CA, USA
论文信息
作者 Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi, Ehsan Degan, Vandana Mukherjee
发布日期 2026-06-02
arXiv ID 2606.04246
相关性评分 9/10 (高度相关)