NeFut Logo NeFut
EN 管理员登录

[AI学术] PLCWorld:闭环工厂仿真中的LLM生成PLC程序基准测试

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#Machine Learning #optimization #GPT

Programmable Logic Controllers(PLC)通过读取传感器输入并下发控制指令来协调工业设备。要评估大语言模型(LLM)生成的PLC程序是否满足任务需求和安全约束,需要观察其指令对设备和工件状态的实际影响。为此我们构建了PLCWorld,一个将结构化文本(ST)执行与模拟工厂响应、传感器反馈耦合的闭环执行环境与基准套件。

PLCWorld基于工业PLC程序和工程文档中提取的控制关系,包含100个人工合成任务和473个任务‑条件对,覆盖运动控制和物料搬运两大场景。任务难度由控制依赖范围决定。统一的评估协议将任务成功(Task Success)和安全违规(Safety Violation)分开报告。

验证流程包括实践者审查、参考程序与替代程序对比、针对性反例检测、规范‑评估器对齐检查以及与独立ST运行时的比较。参考程序和替代程序在其适用案例中均满足要求;所有542个针对性反例在至少一个注册条件下都会触发对应的评估规则。

我们提出的Execution Gap指标衡量提交的程序在接受后出现任务失败或安全违规的概率。实验结果显示,在易度任务上,直接使用GPT‑5.5可达82.70%的任务成功率,但在难度任务上跌至25.10%。对六种LLM和四种生成‑验证工作流的评估进一步揭示了完成度、安全性和生成成本之间的差异。

代码、仿真环境、基准任务及基线实现已在 https://yunji0516.github.io/PLCWorld/ 开源。

点评

原文链接: https://arxiv.org/abs/2610.02982

[h] 返回首页