CHORUS框架突破:小模型在硬件验证测试生成任务中超越巨型模型
在硬件芯片设计领域,高覆盖率测试激励生成是验证环节的关键任务,传统上需要大量人工投入。随着大语言模型在代码生成方面取得进展,可执行反馈为模型学习提供了比单纯文本模仿更可靠的信号。
近日研究人员在arXiv发表论文《CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation》,提出了一种创新的后训练框架。该框架基于两个关键发现:首先,分阶段监督微调会产生行为多样化的检查点,而密集奖励强化学习可将它们转化为具有可比总体性能但任务层面优势各异的强专家模型;其次,这些互补优势可以通过免训练模型融合或进一步后训练来利用,从而超越最佳个体专家。
通过将生成的专家整合到单个4B参数模型中,CHORUS在CVDP-ECov基准测试中实现了88.0%的Pass@1,比DeepSeek-R1(671B参数)高出13.5个百分点。这一突破表明,通过精心设计的专家整合策略,较小规模的模型也能在特定专业任务上超越巨型模型,为硬件验证自动化提供了更高效、更经济的解决方案。