论文

当LLM过度作答:度量与缓解HDL问答中的质量问题

When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering

摘要

大语言模型(LLM)的快速进步使从业者日益依赖其回答硬件描述语言(HDL)问题。由于HDL终将被综合为物理硬件,不精确或冗余的答案可能传导为时序违例或不可综合逻辑、在设计流程晚期才暴露,使HDL答案的质量格外重要。然而LLM生成回答的质量——尤其与人类专家答案相比——仍不清楚。为调查这一问题,我们从Stack Overflow收集6,246条有采纳答案的HDL问答帖并整理为数据集,按四大类(概念、调试、生成、优化)十个子类组织分类。基于该数据集,我们设计了由19名有一至三年经验的HDL工程师参加的用户研究。发现揭示了普遍的过度作答倾向:LLM提供正确内容却埋在冗余备选(65.7%)与冗长填充(69.1%)之下,近半答案(49.0%)未能与专家答案完全对齐,但参与者仍因可读性偏好LLM回答(58.3%)。基于这些发现,我们提出改进LLM的HDL问答的多智能体框架。用LLM即裁判与两个结构指标评估答案质量:核心答案数(反映冗余,LLM常给多个备选解)与非核心内容长度(反映冗长)。在四个主流LLM上评估,该框架把平均核心答案质量分从3.71提高到4.67(+0.96),非核心内容质量从3.72提高到4.23(+0.51)(五分制)。

当LLM过度作答:度量与缓解HDL问答中的质量问题:论文配图
图 4:多智能体框架的流程。 M1M_{1} 描述问题(任务类型、意图、验证需求)并起草答案; M2M_{2}将其分解为核心和非核心内容(M2.1M_{2.1}),通过多角色辩论修剪冗余核心候选内容(M2.2M_{2.2}),并按任务类型压缩非核心内容(M2.3M_{2.3}); M3M_{3} 使用大语言模型作为评委 (M3.1M_{3.1}) 对精炼答案进行评分,并根据已接受的答案 (M3.2M_{3.2}) 对其进行验证。每个阶段都是由相应的用户研究结果驱动的。