论文
HLS-Seek:通过代理比较奖励强化学习生成 QoR 感知代码以进行高级综合
HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning
摘要
高级综合 (HLS) 将算法 C/C++ 描述编译到硬件中,结果质量 (QoR)(延迟和资源利用率)严格受编译指示配置和代码结构控制。现有的自然语言到 HLS(NL-to-HLS)训练方法优先考虑功能正确性,而很大程度上忽略了 QoR。我们观察到 HLS 的强化学习 (RL) 不需要绝对的综合结果——只需要候选者之间的相对比较。基于这一见解,我们提出了 \textbf{HLS-Seek},这是一个 QoR 感知的 NL 到 HLS 框架,它通过比较代理奖励模型避免了循环中的全面综合 RL,实现了 99.53% 的帕累托支配精度。为了防止 奖励作弊,我们引入了 \textit{不确定性感知蒙特卡罗 (MC) 退出切换},它有选择地为低置信度候选者调用真正的 Vitis HLS 合成并在线更新代理,从而创建一个自我改进的奖励系统。 HLS-Seek 在 HLS-Eval~\cite{abikaram2025hlseval} 上仅用 7B 个参数即可实现 84.7\% 语法正确性 pass@1 和 81.4\% 功能正确性 pass@5,在功能 pass@5 上超越 GPT-5.1,同时实现比真实奖励 RL 快 8.5$\times$ 的训练速度。在 QoR 评估中,HLS-Seek 在 19/30 内核上实现了最低延迟,并在 9 内核上 Pareto 主导 HLS 特定基线。