摘要
针对现有 RTL 基准规模小、任务单一且性能饱和的问题,本文提出 RTL-BenchLS 大规模基准。该基准包含超一万个形式化验证的 Verilog 设计,涵盖更复杂的设计场景。除规范到 RTL 生成外,提出了往返推理、掩码内容推理及仓库问题修复三项新任务,利用自监督机制解决数据扩展瓶颈,并通过形式化等价检查进行验证。实验表明当前最优模型在该基准上表现不佳,证明了其高挑战性与指导价值。
AI 推荐理由
论文核心是构建评估 LLM 在硬件设计领域推理与生成能力的基准,重点考察逻辑推理。
研究机构
香港科技大学
论文信息