论文

LLM4Cov:面向高覆盖测试平台生成的执行感知 Agentic 学习

LLM4Cov: Execution-Aware Agentic Learning for High-coverage Testbench Generation

模型训练强化学习合成数据Agentic RL

摘要

执行感知的 LLM 代理为从工具反馈中学习提供了一种有前途的范例,但此类反馈通常成本高昂且获取缓慢,使得在线强化学习 (RL) 不切实际。高覆盖率硬件验证因其对工业模拟器和不可微分执行信号的依赖而体现了这一挑战。我们提出了 LLM4Cov,一种离线代理学习框架,它将验证建模为由确定性评估器引导的无记忆状态转换。在此基础上,我们引入了执行验证的数据管理、策略感知的代理数据合成和最坏状态优先采样,以在执行约束下实现可扩展的学习。我们通过修订的评估协议进一步策划了一个根据现有验证套件改编的符合现实的基准。使用所提出的管道,紧凑的 4B 参数模型在代理评估下实现了 69.2% 的覆盖通过率,比其老师高出 5.3%,并展示了与大一个数量级的模型相比的竞争性能。

LLM4Cov:面向高覆盖测试平台生成的执行感知 Agentic 学习
图3:LLM4Cov的主要组成部分。(a)该框架通过与不断演进的学生分布对齐的分阶段、执行感知训练,将模拟器覆盖反馈转换为稳定的离线监督。(b)覆盖引导的智能体拒绝微调(Coverage-Guided Agentic Rejection Fine-tuning)保留低覆盖草稿及其最能提升覆盖的修订,将监督集中于恢复行为。(c)验证条件化的渐进学习(Verification-Conditioned Progressive Learning)以当前学生为条件生成分阶段合成轨迹并据此训练,带来逐步增强的智能体性能和更稳定的最终覆盖。