模拟成功并不等同于结构正确。我们在 150 条三语电路基准上定义并测量四个评估层级——模式有效性、拓扑有效性、后端可执行性和组件集合一致性,使用基于类型化电路交换表示的流水线。
这四层不是嵌套关系。以 gpt-4o-mini 为例,16 条电路(10.7%,95% CI 6.7‑16.6)被拓扑验证拒绝,却在 ngspice 中无错误或警告地执行;其中 12 条恰好包含请求的组件,只是有一个端口未连接。相反,7 条电路(4.7%)通过验证但被 ngspice 拒绝。10 条两者均失败,117 条两者均通过,说明每个检查捕获对方遗漏的错误。
一个最小的三元分压器示例展示差异:悬空电阻导致电压显示为 5.00 V 而非 2.50 V,ngspice 却保持沉默。
配对消融实验将每条支路都使用同一模型抽样而非重新抽样,以分离修复阶段的噪声。在 45 条分层子样本上,模型修复将拓扑有效性从 40.0% 提升至 84.4%(+20 条,无回退),可执行性净增 6(+7,‑1),组件一致性提升 2。单一步骤中有电路在两个层面出现相反变化。
与直接 netlist 基线比较,流水线在 88.7% 电路上成功执行,而基线为 47.3%;若按无法归因于 netlist 的失败计入基线,则成功率为 62.7%。
结论:结构验证与仿真应作为独立评估阶段报告。能够运行的电路不一定结构有效,结构有效的电路也不一定可执行。
点评