摘要
大型语言模型(LLMs)的快速发展使得从业者越来越依赖它们来回答关于硬件描述语言(HDLs)的问题。由于HDL最终会被合成到物理硬件中,因此不准确或冗余的答案可能会导致时序违规或不可合成的逻辑,这些问题往往在设计流程的后期才显现出来,使得HDL答案的质量显得尤为重要。然而,LLM生成的回答质量,特别是与人类专家提供的答案相比,仍然不清楚。
为了解决这个问题,我们收集了6,246个来自Stack Overflow的HDL问答帖子及其接受的答案,并将其整理成一个数据集,按照四个主要类别(概念、调试、生成和优化)和十个子类别进行分类。基于这个数据集,我们设计了一项用户研究,参与者为19名拥有1到3年经验的HDL工程师。
研究结果揭示了一种普遍的过度回答倾向:LLMs提供正确的内容,但往往被冗余的替代方案(65.7%)和冗长的填充内容(69.1%)所掩盖,而近一半的答案(49.0%)未能与专家答案完全对齐,但参与者仍偏好LLM的回答,因为其可读性更高(58.3%)。基于这些发现,我们提出了一种多代理框架来改进基于LLM的HDL问答。
我们使用LLM作为评判者,并采用两个结构化指标来评估答案质量:核心答案的数量,反映冗余性,因为LLMs经常提供多个替代解决方案,以及非核心内容的长度,反映冗长性。在对四种主流LLMs进行评估时,我们的框架将平均核心答案质量分数从3.71提高到4.67(+0.96),非核心内容质量从3.72提高到4.23(+0.51),均采用五分制。
博主点评: 本文深入探讨了LLMs在HDL问答中的实用性与不足,尤其是过度回答的问题。提出的多代理框架为提升回答质量提供了新思路,值得在实际应用中进行更广泛的验证与推广。通过优化LLMs的输出结构,可以更有效地满足工程师的需求。