我们探讨了在本地部署的大语言模型(LLM)驱动的 AI 代理,能否在符合工业实际的工具调用环境中可靠地自动化专家定义的硬件设计工作流。工程师在此类环境中会通过专用工具执行重复且有依赖顺序的操作,例如创建组件、添加端口以及连线。由于组件规格的保密性和命名约定,往往无法使用托管的专有 API,这促使我们采用本地模型。
为此我们实现了 Model Context Protocol(MCP)服务器,它复现了某嵌入式系统开发专用硬件设计工具的状态与依赖逻辑。基于该服务器,我们构建了一个覆盖单操作编辑、多步依赖链、无效请求、拼写错误提示以及多服务器工具上下文等场景的基准套件。
我们选取了七个开源模型进行评估,比较了系统提示、工具描述细节、上下文范围以及单代理 vs 多代理架构等管线配置。实验结果表明:强模型在基准工作流上可以实现几乎完整的预期调用覆盖,但可靠性高度依赖任务结构和代理配置。具体发现包括:
- 详尽的工具描述始终能显著降低失败率;
- 少样本提示在部分模型上会导致严重的无动作行为;
- 累积上下文对受限模型产生负面影响;
- 多代理分解能够帮助弱模型或长会话,但会增加额外的调用次数。
这些结论为在有状态硬件设计环境中部署本地 LLM 代理提供了实用的指导。
博主点评:本文通过构建真实感强的 MCP 基准,系统评估了本地 LLM 在硬件设计自动化中的可行性。实验设计严谨,结论对工业落地具有直接参考价值,尤其是对工具描述和多代理策略的洞察值得进一步探索。