NeFut Logo NeFut
EN 管理员登录

[AI学术] WaveformQA:大规模语言模型在数字波形上的时间推理基准测试

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#algorithm #Machine Learning #Open Source

摘要

大型语言模型(LLMs)在代码生成和推理方面展现出强大的能力,但它们对数字波形数据的时间推理能力尚未得到充分探索。尽管对数字波形的推理是设计验证中的关键瓶颈,现有基准主要评估硬件描述语言(HDL)代码生成,并将波形作为辅助上下文使用。本文提出了WaveformQA,一个开源的问答基准,用于评估LLM在数字波形上的时间推理能力。

该基准包含360个问题,涵盖八个不同难度类别,问题的真值由程序生成,涉及多信号相关性和事件排序等内容。波形是从开源设计实现中生成的,确保了可重复性,并将基准与真实硬件行为相结合。对前沿LLM的评估显示,虽然模型在简单查询上取得了合理的准确性,但在复杂时间和多步骤问题上,性能因上下文窗口限制和推理困难而下降。

此外,我们展示了波形的事件时间JSON表示相较于标准的值变化转储(VCD)格式,提高了LLM的推理准确性。该开源框架支持扩展到新的问题类别和导入新的波形源,使研究人员能够快速原型化时间推理实验。

博主点评: WaveformQA的推出为大型语言模型的时间推理能力提供了新的评估平台,特别是在数字电路设计领域。通过结合真实的硬件行为和可扩展的基准,未来可能推动更高效的设计验证流程。研究者们应关注模型在复杂推理任务上的表现,以期进一步提升其能力。

原文链接: https://arxiv.org/abs/2607.20638

[h] 返回首页