摘要
LLM驱动的代理系统在电子设计自动化(EDA)中展现出强大的潜力,能够自动化复杂的设计工作流程。然而,现有评估主要集中在单一语言模型的孤立EDA任务上,缺乏对不同代理系统在完整EDA流程中的表现的深入洞察。本文介绍了FluxBench,这是对AI代理在统一提示、工具环境和技术库设置下的端到端EDA工作流程进行系统评估的工具。
我们的评估涵盖了代表性场景,包括使用开源工具链的RTL生成和使用闭源商业EDA工具的RTL到GDS流程,适用于工业应用。通过这些工作流程,我们评估了代理在RTL代码生成、迭代修复、工具反馈利用、逻辑综合、放置和布线(P&R)以及工程变更订单(ECO)自动化方面的能力。
为了进一步表征代理系统的效率,我们引入了Token ROI,这是一个衡量EDA工件相对于token使用和运行成本的有效改进的成本效益指标。实验结果显示,即使基于相同的基础模型,不同的代理系统架构在性能上也可能存在高达86.27%的差距。此外,在任务性能相近的系统中,Token ROI的差异可达到$105.92\times$。
以PicoRV32为案例研究的RTL到GDS流程中,FluxEDA实现了高达97.94的端到端得分,超越了具备领域特定EDA技能的Claude Code,提升幅度达$8.39\times$。这些结果表明,仅有领域特定的技能不足以提升代理在大规模EDA场景中的表现。相反,代理系统设计和基础模型能力在实现有效的自动化EDA工作流程中扮演着关键角色。
博主点评: 本文通过FluxBench工具展现了AI代理在EDA流程中的潜力和挑战,强调了系统设计与基础模型的重要性,为未来的研究提供了宝贵的参考。过往对单一模型的评估已不再适应复杂的设计需求,综合考量不同系统架构的表现显得尤为重要。