SemaPLC:把 PLC 仿真搬进浏览器,小参数模型也能过工程验收

AI 写代码早就不新鲜了,但 PLC 是个例外。PLC 控制的是产线、设备、阀门、电梯和安全联锁——"代码看着对"根本不算交付,程序必须能编译、能在实时运行环境里行为正确、异常场景下不能出错、还得让现场工程师看得懂。

上海交通大学联合 Sema 研究团队发布的 SemaPLC,就是冲着这道坎去的:把编译、部署运行、变量读写、行为验证、过程仿真这一整套工程闭环搬进浏览器,并用「验证门控」约束 Agent——任务完成与否不由模型自己说了算,而是由外部检查(规范、编译、真实运行环境中的行为)来裁决。一句话概括:AI 写 PLC 代码从「能生成」升级到了「可交付」。

为什么 PLC 是 AI 编程最难啃的领域

大模型用自然语言生成 PLC 程序已经相当靠谱:描述一个电机启停逻辑、一套水箱液位控制、一个四层电梯控制器,模型就能给出符合 IEC 61131-3 标准的结构化文本(ST)代码。难的是生成之后的一切。

PLC 程序不是跑在服务器上的网页服务,它物理控制着产线。它必须嵌进一个既有项目,处理共享变量、时序约束和具体硬件接口。孤立编译通过不代表能集成,集成了不代表运行时正确,正常工况正确不代表故障时安全。在工业自动化里,"看起来对"不是质量线,而是问题的开始。

SemaPLC 怎么做:Agent 即工程闭环

SemaPLC 的架构思路很直白:把 AI Agent 与 PLC 工程工具链解耦,工具链以套件形式提供——编译、部署运行、变量读写(含强制)、轨迹记录、行为验证、仿真生成。工程师在浏览器 WebIDE 里完成需求输入、代码查看、梯形图阅读、变量监控,全部集中在一个窗口。

最关键的机制是验证门控:Agent 不觉得自己"写完了"就算完,只有外部检查确认通过才宣布完成。模型负责提议,工具链负责裁决。

数据也撑得起这个设计:在 117 个独立 POU 任务上(与现有基准对齐),SemaPLC 在全部 7 个测试模型上都拿到最高严格验证通过率,平均 72.6%,领先 Agents4PLC、AutoPLC 等主流基线近 9 个百分点;在更难的 65 个真实项目上下文任务里,集成编译、静态行为、动态行为三项均列第一。

最值得看的发现是静态与动态的落差:基线方法静态分析能拿 70% 左右,一旦把同一份代码放进实时运行环境,直接掉到 20–30%;SemaPLC 的动态可靠性平均仍有 52.2%——因为它的门槛就是运行时行为本身。论文的结论很干脆:动态运行时验证,才是衡量生成代码真实可靠性的最有效标尺。

可复用的模式:验证门控式编程

把 SemaPLC 放远一点看,它是同一类模式的具体样本。主流 AI 编程目前本质是"规模化的自动补全":模型生成、人来看、最好的情况有 CI 跑测试。普通软件用测试当正确性的代理就够了;控制逻辑不行,门槛必须是真实运行时——把生成逻辑与参考逻辑部署上去对比执行轨迹。

这就像自信的副驾驶和飞行检查单的区别:让飞机安全落地的是检查单,不是副驾驶的自信。验证门控式 Agent 把检查单当真相源,模型只是可以随时换掉的提议引擎。这也解释了"小参数模型也能高通过率"为什么不是悖论:当外部回路负责验收,模型大小就不再是决定性变量——带验证回路的小模型,能拿到没有回路的大模型拿不到的通过率,成本还低一个量级。

产业含义

工业自动化一直是 AI 编程最难落地的领域,原因很直白:失效成本是物理性的。网页应用里一个幻觉函数是 bug,安全回路里一个幻觉联锁就是事故。验证门控改变了这个风险等式——这比 PLC 这个具体领域更重要。

同样的逻辑会外溢到嵌入式、航空、医疗器械、金融对账:任何"必须被证明、而不只是看起来合理"的代码场景。AI 辅助工程的瓶颈正在从生成质量转向验证基础设施——谁能低成本、持续地构建测试 AI 输出的回路,谁就拿到了护城河——芯片设计领域已出现首个通过工程级验收的 Level 5 AI 工程师(Cadence ChipStack),同一逻辑正在更多硬核工程领域复制。这也是工具公司的机会,不只是模型实验室的。

还有一层普惠意义:如果验证回路能让小模型通过工程级验收,那么没有前沿模型预算的中型集成商和工厂团队,也能用上 AI 辅助工程——这与机器人量产卡在万台关口的症结同源:缺的不是模型,而是把 AI 输出变成可靠交付物的验证基建。评测标准也会跟着进步——报告动态通过率、而不是静态分数的基准,才真正预测现场表现。

可以立刻做的事

  • 自动化工程师:自然语言起草 ST 代码可以试了,但任何 AI 输出都必须过编译、运行轨迹验证和异常场景仿真再合入——生成的是草稿,验证过的才是交付物。
  • 平台团队:把编译、运行时轨迹、仿真这些验证门做成一级公民,而不是事后插件。模型可以换,回路才是壁垒。
  • 选型采购:评估工业 AI 编码工具时,直接要真实项目上的动态验证通过率。演示视频不是证据。
  • 研究者/爱好者:SemaPLC 论文(arXiv 2608.18565)和基准值得读;浏览器里的 PLC 仿真本身也是培训新工程师的安全训练场,与 Veeda 的机器人虚拟训练场 同属仿真验证基建。

结论一句话:AI 编码的下一站不是更聪明的生成,而是把模型提议与现实验收之间的回路闭合。SemaPLC 用一组扎实的测量证明——杠杆在回路,不在模型。

发表评论

滚动至顶部