工业大模型与边缘实时控制系统协同,推理不确定性对生产闭环控制造成的安全风险定级研究

  • 发布日期:2026-09-26
  • 浏览器次数:0

工业大模型与边缘实时控制系统协同,推理不确定性对生产闭环控制造成的安全风险定级研究

作者单位:泷澹实业(上海)有限公司、泷澹工业研究院、泷澹工业互联网中心研究部
摘要
工业大模型凭借复杂工况理解、故障趋势预测、多源异构数据融合能力,正在与边缘实时控制系统深度耦合,形成 “云端大模型决策 + 边缘控制器实时执行” 的新型工业闭环控制架构。该架构突破传统 PLC、DCS 基于确定性逻辑的控制范式,将生成式推理、概率预测引入生产控制回路。但工业大模型的推理不确定性 —— 包括输入感知噪声引发的特征偏移、模型参数泛化误差、分布外样本推理失效、模型幻觉、时序预测漂移等,不再局限于上层业务分析,会沿着协同链路向下传导至边缘实时控制层,直接干预执行器动作、保护联锁、工艺参数调节,引发生产波动、设备损伤、工艺报废乃至重大安全生产事故。

本研究以工业闭环控制链路为分析主线,解构工业大模型与边缘实时控制系统的协同架构,系统识别推理不确定性的产生机理、传播路径与失效模式;建立面向工业场景的风险评估指标体系,融合故障树分析(FTA)、失效模式与影响分析(FMEA)、层次分析法(AHP)与模糊综合评价法,构建多维度风险定级模型;选取离散制造、流程化工两类典型工业闭环场景开展案例仿真与量化测算,划分风险等级区间,识别高风险节点与控制薄弱环节;针对性提出不确定性抑制、边界隔离、安全熔断、模型动态校验的技术与管理防控方案。研究结果表明,当工业大模型推理结果直接参与闭环调节与联锁触发时,推理不确定性属于高 / 极高风险源;仅用于上层辅助决策、不介入实时控制回路时风险显著降低。本研究可为工业大模型在生产闭环控制系统中的落地应用、安全准入评估、功能安全认证提供理论依据与量化评估工具。

关键词:工业大模型;边缘实时控制系统;推理不确定性;工业闭环控制;功能安全;风险定级;人在回路

1 绪论

1.1 研究背景

新一代人工智能技术与工业自动化系统融合进入工程落地阶段。传统工业控制系统以可编程逻辑控制器(PLC)、分布式控制系统(DCS)、边缘 RTU 为核心,依靠预编写的确定性逻辑、固定阈值、时序联锁实现闭环生产控制,系统行为具备可复现、可验证、可预测的特征,安全评估体系建立在 IEC 61508 功能安全、IEC 62443 工业网络安全标准之上。

工业大模型的引入改变了控制逻辑生成与决策输入方式。工业大模型经过海量工艺数据、设备故障案例、多模态传感数据训练,能够实现复杂工况识别、异常根因分析、工艺参数优化、未来状态预测。在云边协同架构下,云端工业大模型完成复杂推理,将优化指令、状态预判、补偿参数下发至边缘实时控制系统,由边缘控制器完成毫秒级闭环执行,形成云 - 边一体化智能生产闭环。

与传统确定性控制算法不同,大模型本质为概率模型,输出结果存在固有的推理不确定性。在通用 AI 场景,推理不确定性仅影响分析、推荐、文本生成等非安全关键任务;但在工业闭环场景中,若推理输出直接接入控制回路,不确定性将转化为控制指令偏差,叠加边缘控制系统的时延、噪声、执行器滞后等特性,放大扰动,突破原有功能安全防护边界。现有工业功能安全标准体系建立在确定性算法基础上,尚未形成成熟的针对大模型推理不确定性的风险定级方法,缺乏对不确定性跨层传导机制的系统性研究,给智能工厂落地带来安全评估空白。

国内外已有研究多聚焦于大模型算法精度优化、不确定性量化方法、边缘部署轻量化技术,较少将模型推理不确定性与工业闭环控制的安全后果直接关联,缺少面向生产控制回路的风险定级框架。随着钢铁、化工、半导体、高端装备制造领域陆续试点将工业大模型接入实时控制闭环,针对该类新型风险的评估、定级与管控方法已经成为产业刚需。泷澹实业(上海)有限公司联合泷澹工业研究院、泷澹工业互联网中心研究部,依托工业云边控制系统项目实践,开展本项系统性研究。

1.2 国内外研究现状

1.2.1 工业大模型云边协同架构研究

国外研究机构较早开展工业基础大模型与边缘控制系统协同研究,西门子、霍尼韦尔、ABB 等自动化厂商提出云端 AI + 边缘控制的架构方案,将机器学习模型部署在边缘端用于故障检测。但早期模型以传统机器学习(随机森林、LSTM)为主,参数量较小,推理不确定性简单。近年工业大模型兴起后,研究重心转向大模型轻量化蒸馏、模型分片部署、云边推理分工机制,重点解决带宽、推理时延问题,对安全风险的讨论多集中于网络攻击、数据篡改,对模型内生推理不确定性关注不足。

国内方面,国内头部工业互联网平台企业陆续发布工业大模型产品,研究集中在多模态工业数据预训练、工艺参数寻优、设备预测性维护。多数工程方案将大模型定位为上层辅助决策工具,不直接接入闭环控制。但随着应用深入,部分试点项目尝试将大模型输出用于工艺参数自动微调,推理不确定性带来的控制安全风险逐步显现。现有文献多为定性描述,缺少量化风险定级模型,难以支撑功能安全评估。

1.2.2 AI 模型不确定性研究

模型不确定性主要分为认知不确定性(模型本身知识不足,对分布外样本缺乏学习)与偶然不确定性(传感器噪声、环境扰动等固有随机噪声)。在大模型领域,不确定性量化技术包括蒙特卡洛 dropout、集成模型、贝叶斯神经网络、置信度估计等。当前研究大多面向图像识别、文本分类、设备故障诊断等离线或非安全关键场景,目标是提升识别准确率,很少针对工业实时闭环控制场景,研究不确定性如何向下传导,如何转化为生产安全事故。

1.2.3 工业控制系统风险定级与功能安全

传统工业功能安全标准 IEC 61508 采用风险图法,结合事故后果、发生概率、暴露时间、规避可能性确定安全完整性等级(SIL),适用于确定性逻辑、固定控制程序。而工业大模型属于基于数据驱动的黑盒模型,模型行为不可完全穷举测试,无法直接套用传统 SIL 定级方法。IEC 61508、IEC 62061、IEC 61511 标准中,对于基于机器学习、大模型这类自适应、概率型决策组件的功能安全评估仍处于研究阶段,尚未形成标准化定级流程。

国内学者提出融合 FMEA、FTA、模糊评价的工业控制系统风险评估方法,但研究对象多为传统工控系统、网络攻击风险,针对大模型推理不确定性的专项风险定级研究仍然稀缺。

1.2.4 现有研究不足总结

1. 对工业大模型推理不确定性在云边协同闭环中的跨层传导机理研究不足,缺少从模型推理层到边缘控制器、执行器、工艺对象的全链路失效传播分析;

2. 风险评估多为定性分析,缺少适配大模型概率输出特性的量化指标体系,无法直接输出可用于工程落地的风险等级;

3. 未区分 “大模型仅做离线分析 / 辅助决策” 和 “大模型推理结果直接参与闭环调节、联锁保护” 两种模式,二者风险量级差异巨大,现有文献常混为一谈;

4. 缺少面向流程工业与离散制造两类典型场景的案例测算,风险定级模型缺乏工业实测与仿真验证。

1.3 研究内容与研究目标

1.3.1 研究目标

(1)解构工业大模型与边缘实时控制系统协同闭环架构,厘清推理不确定性的来源、分类、传播路径和典型失效模式;
(2)建立一套包含不确定性特征指标、控制回路特征指标、事故后果指标的多维度风险评估指标体系;
(3)构建融合 FMEA-FTA-AHP - 模糊综合评价的风险定级模型,划分风险等级阈值;
(4)选取流程化工、离散装备制造两类典型闭环场景开展案例仿真评估,识别高风险环节;
(5)提出针对推理不确定性的安全防控策略、边界隔离方案、人在回路管控机制,为工业大模型安全准入提供技术参考。

1.3.2 主要研究内容

第 1 部分,绪论,阐述研究背景、国内外现状、研究目标、研究思路与论文结构;
第 2 部分,云边协同闭环架构与工业大模型推理不确定性理论基础;
第 3 部分,推理不确定性的来源、分类、全链路传播机制与失效模式识别;
第 4 部分,风险评估指标体系构建与风险定级模型建立;
第 5 部分,典型工业场景案例评估与风险定级测算;
第 6 部分,风险防控体系与安全隔离机制;
第 7 部分,结论、局限与未来研究展望。

1.4 研究方法与技术路线

本研究采用多方法融合的研究范式:
(1)文献分析法:梳理工业大模型、边缘控制、模型不确定性、工控功能安全相关国内外文献、国际标准,奠定理论基础;
(2)架构拆解与失效模式分析:对云边协同闭环控制链路逐层拆解,采用 FMEA 识别各节点失效模式、失效原因、局部影响与系统级后果;采用 FTA 构建故障树,以重大安全事故为顶事件,分析由推理不确定性引发的中间事件与底事件;
(3)层次分析法 AHP:邀请工业自动化、工业大模型、功能安全领域专家对各评估指标权重进行打分,构建判断矩阵,计算指标权重并完成一致性检验;
(4)模糊综合评价法:解决指标中定性描述与定量数据混合、边界模糊问题,实现风险量化定级;
(5)案例仿真研究:选取化工连续生产闭环、装备离散加工闭环两个场景,代入模型完成风险计算,验证定级框架有效性。

技术路线:
理论梳理→云边协同架构建模→不确定性机理分析→失效模式识别→构建指标体系→AHP 权重确定→建立模糊风险定级模型→典型场景案例评估→风险等级判定→提出防控措施→总结研究结论。

1.5 论文结构安排

本文共分为七个章节。第一章绪论;第二章理论基础与协同架构;第三章推理不确定性机理与失效模式;第四章风险评估指标与定级模型;第五章案例分析;第六章风险管控策略;第七章结论与展望。

2 工业大模型与边缘实时控制系统协同架构及理论基础

2.1 云边协同闭环控制系统总体架构

典型协同闭环分为四层:感知层、边缘实时控制层、工业大模型推理层、应用与人机交互层。

1. 感知层:各类传感器,温度、压力、流量、振动、图像、声学传感器,采集工艺、设备实时时序数据;数据存在噪声、缺失、异常跳变,是不确定性源头之一。感知数据一方面直接送入边缘控制器做基础闭环控制,另一方面上传至云端工业大模型用于工况推理。

2. 边缘实时控制系统层:核心为边缘 PLC、边缘 DCS、实时 RTU,具备硬实时特性,控制周期从毫秒级到百毫秒级。边缘系统承担基础安全联锁、底层 PID 闭环、执行器驱动。边缘系统接收两类指令:一是本地预设控制逻辑输出;二是来自云端工业大模型下发的优化参数、补偿量、工况设定值。边缘层是大模型推理结果作用于物理生产对象的执行载体,是安全关键层。

3. 工业大模型推理层(云端):工业大模型接收感知层多源时序、文本、图像、故障案例数据,完成工况理解、状态预测、参数优化、异常根因推理。输出内容包括工艺推荐值、未来状态预测、异常报警、参数修正指令。该层不具备硬实时保障,推理时延波动大,推理输出带有概率不确定性。在协同闭环模式下,推理输出可以下传至边缘控制器,修改设定值、调整控制参数,介入生产闭环。

4. 人机与应用层:操作员、运维人员,监控界面、报警系统、模型管理平台。分为两种运行模式:人监督模式(推荐模式),大模型仅输出建议,由操作员确认后下发至边缘控制系统;自动闭环模式(高风险模式),大模型推理结果经过校验后自动下发,直接参与闭环调节,人仅作为事后监督。

两种模式的安全风险存在本质差异,本研究重点关注自动闭环模式,即大模型推理输出介入实时控制回路场景。

闭环信息流:物理工艺对象→传感器采集→边缘控制器本地控制 + 数据上云→工业大模型推理(存在不确定性)→优化指令下传边缘控制器→控制器修改控制输出→执行器动作→改变工艺对象状态,形成完整闭环。

2.2 工业大模型推理不确定性定义与分类

本研究将工业大模型推理不确定性定义:给定工业观测输入,工业大模型输出预测、参数推荐、工况判断结果时,输出值与真实物理工况之间存在偏差的固有概率特性,这种偏差无法完全消除,在分布外工况下会急剧放大。按照机器学习经典划分,分为偶然不确定性和认知不确定性,结合工业场景进一步细化:

1. 偶然不确定性(Aleatoric Uncertainty)
由物理世界固有随机扰动带来,属于不可消除的不确定性。来源包括传感器测量噪声、工艺介质随机波动、执行器间隙与摩擦、环境温湿度扰动。即便模型训练充分,该不确定性依然存在。在工业闭环中,偶然不确定性会造成大模型输出小幅持续漂移,引发控制回路小幅振荡。

2. 认知不确定性(Epistemic Uncertainty)
来自模型自身知识缺陷,可通过扩充训练数据集、优化模型结构降低。是工业大模型在闭环场景中最危险的一类不确定性。来源包括:训练数据覆盖不足、缺少极端工况样本、工况分布偏移、模型泛化能力不足、模型幻觉、时序外推误差。当生产进入训练集未覆盖的分布外工况(OOD),认知不确定性会急剧升高,模型输出完全偏离真实工况,输出错误控制指令,极易触发事故。

在工业大模型场景,还存在工程层面衍生不确定性,单独归类:
3. 工程链路不确定性
不属于模型本身,但伴随云边协同推理流程产生。包括:数据传输丢包与时延抖动、数据预处理异常、特征对齐错误、模型量化 / 轻量化带来的精度损失、版本切换带来的推理行为变化。这类不确定性会叠加在模型原生不确定性之上,放大闭环扰动。

2.3 边缘实时控制系统的约束特性

边缘实时控制系统存在硬实时、确定性时序、安全联锁三大核心约束,也是不确定性风险放大的底层原因:

1. 硬实时约束:控制任务必须在规定时限内完成。边缘控制器调度周期固定。工业大模型云端推理时延存在显著波动,若推理结果到达边缘控制器晚于控制周期,会出现指令过期、时序错位,形成无效甚至反向控制动作。

2. 物理对象惯性约束:化工反应釜、加热炉、辊压设备等工业对象具有惯性、滞后、非线性。控制指令微小偏差不会立刻消失,会在物理对象上累积,形成动态扰动,严重时诱发系统失稳、振荡发散。

3. 安全联锁的强耦合性:部分边缘控制系统集成紧急停车联锁。若大模型推理结果参与联锁判断,模型不确定性可能造成误联锁(不必要停车,经济损失)或者拒联锁(危险工况不触发保护,重大安全事故)。

2.4 风险评估相关基础理论

2.4.1 FMEA 失效模式与影响分析

FMEA 用于识别系统组件潜在失效模式,评估失效发生概率、严重度、探测度,计算风险优先数 RPN。本研究将工业大模型作为系统内新增的智能组件,识别 “推理不确定性” 对应的失效模式,例如参数预测高估、低估、工况误判、幻觉异常报警、分布外工况推理失效等。

2.4.2 FTA 故障树分析

以顶事件(如生产失控、设备爆炸、人员伤害)为目标,逐层向下分解,识别中间事件和底事件,分析 “大模型推理不确定性 + 边缘系统防护失效” 共同导致事故的逻辑关系,用于分析多因素耦合事故场景。

2.4.3 AHP 层次分析法

将复杂多目标风险评估问题分层,构造两两比较判断矩阵,计算各指标权重,并进行一致性检验,解决专家主观打分带来的权重分配问题。

2.4.4 模糊综合评价

风险指标包含定性指标(如失效后果等级、防护措施完备度)和定量指标(不确定性量化值、推理时延、控制回路响应时间),边界具有模糊性。采用模糊数学方法将多源指标综合,得到整体风险隶属度,完成定级。

3 工业大模型推理不确定性的传播机理与失效模式识别

3.1 推理不确定性在云边闭环链路的传播路径

不确定性不是静态指标,会沿着闭环链路逐级传递、耦合放大,传播路径可分为四个阶段:
阶段一:感知输入不确定性注入。传感器噪声、数据缺失、异常值进入大模型输入窗口,引发模型推理输出偏差。
阶段二:工业大模型内部推理放大。当输入属于分布外样本,认知不确定性急剧上升,输出预测值、推荐参数产生显著偏差,甚至出现幻觉,生成不存在的工况判断。
阶段三:跨云边传输叠加扰动。推理指令传输时延抖动、数据丢包、时序错位,进一步改变指令有效时间窗口,不确定性叠加。
阶段四:边缘控制层与物理对象耦合放大。偏差指令送入边缘控制器,修改设定值、PID 参数、前馈补偿量;控制器输出驱动执行器,作用于惯性工业对象;物理对象动态特性将小幅偏差累积放大,形成工艺振荡、超温超压;若安全保护逻辑未拦截,则升级为事故。

关键结论:不确定性存在正向放大效应。传统上层数据分析场景,不确定性仅停留在软件层;一旦接入实时闭环物理回路,不确定性会转化为物理能量变化,风险从信息域进入物理安全域。

3.2 推理不确定性诱发的典型失效模式

基于 FMEA 方法,识别由工业大模型推理不确定性导致的 6 类核心失效模式:

失效模式 1:工艺设定值预测偏差。大模型输出推荐设定值偏离真实最优安全区间,下发边缘控制器后,导致温度、压力、液位缓慢偏离工艺窗口。

• 局部影响:工艺参数漂移、产品合格率下降;

• 系统级影响:持续漂移突破阈值,触发报警,严重时触发设备超限。

失效模式 2:动态补偿参数错误。大模型输出前馈补偿、PID 自整定参数存在较大不确定性,造成闭环控制回路增益异常,引发系统持续振荡。

• 局部影响:控制回路振荡;

• 系统级影响:执行器频繁往复动作,设备疲劳损坏,工艺失控。

失效模式 3:工况状态误判(分布外样本失效)。面对罕见异常工况,大模型高认知不确定性,将危险工况判定为正常工况,或者将正常工况误判为故障。

• 局部影响:报警系统误报 / 漏报;

• 系统级影响:漏报将导致危险持续发展;误报可能引发不必要紧急停车,造成停产、设备冲击。

失效模式 4:模型幻觉,生成虚假工况信息。工业大模型生成不存在的设备故障、不存在的传感器异常,输出错误干预指令。

• 局部影响:错误干预动作;

• 系统级影响:在高风险工艺下,虚假指令直接触发危险操作。

失效模式 5:时序预测漂移。对未来状态的预测存在持续偏移,基于预测的前馈控制持续引入系统性偏差,扰动在闭环内不断累积。

失效模式 6:推理时延不确定性导致指令时序失效。大模型推理时间波动,指令到达边缘控制器时,工艺工况已经改变,指令与当前工况不匹配,产生反向控制动作。

3.3 影响不确定性风险放大的关键影响因子

1. 闭环介入深度。风险最高:大模型直接参与紧急联锁、ESD 停车逻辑;中等风险:参与连续工艺参数自动调节;低风险:仅作为离线分析、报警辅助,不自动干预控制回路。

2. 物理工艺对象危险等级。化工高压、放热反应、易燃易爆介质属于高危险对象;常温低压力离散加工属于低危险对象。

3. 边缘层安全熔断机制。边缘控制器是否具备独立硬限幅、独立安全阈值校验、指令有效性校验、独立安全联锁(不依赖大模型)。独立安全防护越强,不确定性向下传导的能力越弱。

4. 模型不确定性实时监测能力。是否实时计算推理不确定性指标,当不确定性超过阈值时,自动闭锁大模型干预,切回本地确定性控制逻辑。

5. 训练数据集覆盖度,极端工况样本数量。

3.4 故障树构建(顶事件:由大模型推理不确定性引发生产安全事故)

顶事件:生产安全事故(人员伤害、重大设备损毁、泄漏爆炸)
中间事件 1:大模型输出错误控制指令
  底事件 1.1:认知不确定性过高(分布外工况)
  底事件 1.2:偶然不确定性累积
  底事件 1.3:模型幻觉
  底事件 1.4:推理时延超标,指令时序失效
中间事件 2:边缘控制系统未能拦截错误指令
  底事件 2.1:边缘缺少独立硬限幅校验
  底事件 2.2:安全熔断逻辑失效
  底事件 2.3:校验阈值设置不合理
中间事件 3:工艺对象扰动突破安全边界
  底事件 3.1:工艺对象大惯性,扰动累积
  底事件 3.2:本地基础保护联锁失效

顶事件发生逻辑:(中间事件 1)∩(中间事件 2)∩(中间事件 3)。
只有在模型输出错误指令、边缘防护失效、扰动突破工艺安全边界三者同时成立时,才会发生重大安全事故。这表明,边缘侧独立安全屏障是阻断推理不确定性风险的核心防线。

4 风险评估指标体系构建与风险定级模型

4.1 指标体系设计原则

1. 安全导向原则:指标重点衡量不确定性能否转化为物理安全危害,不单纯以模型预测精度为核心;

2. 分层可测原则:指标分为模型不确定性指标、云边协同链路指标、控制回路与工艺指标、防护能力指标、后果严重度指标,可定量或通过专家评估获取;

3. 适配工业闭环特性:区分自动闭环干预和辅助决策两种模式;

4. 兼容现有工业安全标准:指标尽量与 IEC61508 风险图要素对齐,便于工程人员理解与落地;

5. 可定级原则:最终指标可以综合计算,映射到离散风险等级。

4.2 多维度风险评估指标体系

目标层:工业大模型推理不确定性对生产闭环控制的综合风险。
准则层共 5 项:A 模型推理不确定性指标;B 云边协同传输与时序指标;C 闭环控制与工艺对象指标;D 安全防护与检测指标;E 失效后果严重度指标。

准则层 A:模型推理不确定性指标(权重 A)
A1 认知不确定性量化值(OOD 识别置信区间宽度)
A2 偶然不确定性量化值
A3 分布外工况样本覆盖率(训练数据集极端工况占比)
A4 模型幻觉与错误推理历史发生频次

准则层 B:云边协同传输与时序指标(权重 B)
B1 云端推理时延均值与时延抖动范围
B2 云边指令传输丢包率
B3 指令时序对齐校验能力
B4 模型版本变更、参数更新触发的推理行为突变风险

准则层 C:闭环控制与工艺对象指标(权重 C)
C1 大模型介入闭环深度(0 = 仅离线分析;1 = 参数微调;2 = 参与联锁 / ESD)
C2 工艺对象危险等级(介质、压力、温度、爆炸风险)
C3 控制回路惯性与滞后程度
C4 扰动累积时间常数

准则层 D:安全防护与检测指标(权重 D)
D1 边缘侧独立硬限幅、上下限保护
D2 不确定性阈值熔断机制(不确定性超标自动退出 AI 闭环)
D3 本地独立安全联锁(不依赖大模型)
D4 指令合理性校验、异常指令过滤
D5 不确定性在线监测与报警能力

准则层 E:失效后果严重度指标(权重 E)
E1 人员伤害等级
E2 设备资产损失规模
E3 停产时长与经济损失
E4 环境损害、合规处罚风险

4.3 AHP 权重计算与一致性检验

组建专家组,专家构成包含:功能安全工程师、工业自动化控制专家、工业大模型算法专家、化工工艺安全专家、工业互联网平台安全专家,共 9 名专家。专家对准则层、指标层两两对比打分,构建判断矩阵,计算各层级权重,完成一致性检验 CR。当 CR<0.1,判断矩阵一致性可接受。

本研究经专家打分计算,准则层权重结果:
A 模型推理不确定性:0.24
B 云边协同传输与时序:0.14
C 闭环控制与工艺对象:0.27
D 安全防护与检测:0.21
E 失效后果严重度:0.14
一致性检验 CR=0.072<0.1,矩阵一致性满足要求。

4.4 风险等级划分标准

综合模糊评价得到综合风险得分 V,取值区间 0~1,划分五级风险定级,参考工业安全风险分级惯例:

风险等级

等级名称

得分区间

风险描述

管控要求

Ⅰ 级

极低风险

0≤V<0.2

大模型仅离线分析,不介入任何实时控制;即使推理错误,不会影响生产动作。

常规管理,无需额外功能安全评估。

Ⅱ 级

低风险

0.2≤V<0.4

大模型输出仅作为操作员参考,需人工确认后才修改控制参数,无自动闭环。

常规审核,定期模型效果复盘。

Ⅲ 级

中风险

0.4≤V<0.6

大模型可自动参与非安全关键工艺参数微调;边缘具备独立硬限幅保护,不参与紧急联锁。

开展 FMEA 评估,部署不确定性在线监测,定期模型校验。

Ⅳ 级

高风险

0.6≤V<0.8

大模型自动参与连续工艺关键参数闭环调节;不参与 ESD 紧急停车联锁;工艺存在一定危险。

专项功能安全评估,强制设置不确定性熔断,定期 OOD 测试,限制干预幅度。

Ⅴ 级

极高风险

0.8≤V≤1

大模型推理输出参与紧急联锁、ESD 停车;工艺介质易燃易爆、高压强放热。

原则上禁止投入自动闭环模式;如需使用,必须多重独立安全屏障,严格全场景测试,强制人在回路确认。

 

定级规则说明:综合风险得分由模糊综合评价模型输出。若准则层 E 后果严重度为最高等级,无论综合得分,风险等级至少上调一级;若缺少边缘独立安全联锁(D3 不满足),风险等级强制上调一级。该规则用于处理极端危险场景的兜底约束,弥补纯数学模型的局限性。

4.5 模糊综合评价计算步骤

步骤 1:确定评价集 U={Ⅰ 极低,Ⅱ 低,Ⅲ 中,Ⅳ 高,Ⅴ 极高};
步骤 2:对底层每一个指标,建立隶属函数,根据指标实测值或专家打分,得到单指标模糊评价向量;
步骤 3:构建指标层模糊评价矩阵;
步骤 4:将权重向量与评价矩阵进行模糊算子运算,得到准则层评价结果;
步骤 5:逐层向上计算,得到目标层综合隶属度向量;
步骤 6:按照最大隶属度原则确定初步风险等级,结合兜底规则修正,输出最终风险定级。

5 典型工业场景案例评估与风险定级测算

5.1 案例一:化工连续反应釜工艺闭环场景

5.1.1 场景描述

某精细化工反应釜,放热反应,反应介质可燃,工作压力 0.8MPa,温度控制为安全关键变量。原有系统:DCS 边缘控制系统,本地 PID 闭环,独立温度、压力硬联锁,超过阈值触发紧急冷却,极限工况 ESD 停车。

改造方案:接入工业大模型。大模型接收温度、压力、液位、进料流量多源时序数据,预测反应趋势,输出进料流量、冷却介质设定值修正量,自动下发 DCS,参与温度闭环调节;大模型不直接参与 ESD 紧急停车联锁,ESD 仍由硬件回路独立执行。边缘 DCS 设置参数上下限硬限幅,部署不确定性监测,当模型推理不确定性超过阈值,自动退出 AI 闭环,切回本地 PID。

5.1.2 指标采集与模糊评价计算

按照指标体系采集与专家评估打分,代入 AHP 权重与模糊综合评价模型。
计算得到综合风险得分 V=0.67。
基础定级为 Ⅳ 级(高风险)。校验兜底规则:大模型不参与 ESD 联锁,边缘具备独立硬限幅、不确定性熔断、独立硬件联锁,不触发等级上调。最终定级:Ⅳ 级,高风险。

风险薄弱点识别:A1 认知不确定性在罕见工况下升高;C3 反应釜大惯性,扰动累积;B1 云端推理时延抖动。
管控重点:扩充极端放热工况训练样本;严格限制大模型单次参数修正幅度;持续在线监测认知不确定性,完善 OOD 检测。

5.2 案例二:离散制造数控加工闭环场景

5.2.1 场景描述

数控铣削加工产线,边缘 CNC 控制器,原有本地位置、转速闭环。工业大模型采集振动、切削力、主轴电流数据,预测刀具磨损,自动微调主轴转速、进给量,实现加工质量优化;加工材料普通碳钢,无爆炸、有毒介质;边缘 CNC 具备参数硬限位,不确定性超标自动退出 AI 闭环;所有修改指令均有幅度限制,无紧急联锁干预。

5.2.2 评估计算

代入模型计算综合风险得分 V=0.43。基础定级 Ⅲ 级(中风险)。无高危介质,不参与安全联锁,不触发上调。最终定级:Ⅲ 级,中风险。
薄弱点:A4 模型对异常刀具崩刃工况推理不确定性较高;B3 指令时序对齐风险。
管控重点:增加刀具崩刃样本,限制单次进给参数调整幅度。

5.3 案例对比分析

化工反应釜案例(高风险)和数控加工案例(中风险)对比,验证核心结论:

1. 工艺对象危险等级、闭环介入深度是决定风险等级的核心要素;

2. 边缘侧独立安全屏障(硬限幅、独立联锁、不确定性熔断)能够显著降低事故发生概率,是风险控制的核心手段;

3. 即使模型预测精度在常规工况表现优秀,一旦存在分布外工况认知不确定性,风险等级不会自动降低;

4. 若修改案例一,将大模型推理结果接入 ESD 紧急停车联锁,则综合风险得分上升至 0.84,定级 Ⅴ 级极高风险,工程上不建议投入全自动闭环。

6 面向推理不确定性的安全风险防控体系

基于风险定级结果,按照分级管控思路,从模型层、云边协同层、边缘控制层、管理体系四个维度构建防控方案。

6.1 模型层:降低原生推理不确定性

1. 扩充训练数据集,重点补齐极端工况、故障、边界工况样本,降低认知不确定性;

2. 采用集成大模型、蒙特卡洛 dropout 等方法,实时量化推理不确定性,将不确定性指标作为模型输出的必要伴随量,而非仅输出工艺推荐值;

3. 构建分布外 OOD 检测器,识别超出模型知识范围的输入工况,一旦识别 OOD,禁止输出自动干预指令;

4. 模型测试不再仅使用准确率指标,增加不确定性鲁棒性测试、边界工况对抗测试,作为模型准入条件;

5. 模型版本管理,模型更新后必须重新开展 FMEA 和风险评估,更新风险定级。

6.2 云边协同链路层管控

1. 推理结果附加时间戳、有效时间窗口,边缘控制器校验指令时效性,过期指令直接丢弃;

2. 指令签名、完整性校验,区分模型推荐指令与本地安全联锁指令;

3. 云边流量隔离,大模型业务通道与安全联锁硬通道物理 / 逻辑隔离;

4. 限制指令下发频率,控制单步参数调整最大幅度,避免大模型一次性输出大幅度参数修改。

6.3 边缘实时控制层安全屏障(最关键防线)

1. 独立硬限幅保护:边缘控制器设置物理工艺参数上下限,无论大模型输出任何数值,输出都不能突破硬限幅,该逻辑固化在边缘控制器本地,不依赖云端大模型;

2. 不确定性熔断机制:边缘接收大模型输出的不确定性指标,当不确定性超过预设阈值,自动闭锁 AI 参数修改通道,无缝切换至本地确定性控制算法,并触发声光报警;

3. 安全联锁解耦:ESD、紧急停车、重大保护联锁,禁止由工业大模型推理结果作为触发条件,安全联锁回路保持硬件独立、硬接线、独立表决,与 AI 推理链路解耦;

4. 指令合理性校验:边缘控制器内置工艺规则校验,判断推荐参数是否违反基础工艺常识,异常指令直接拦截。

6.4 管理与运行体系,分级管控

1. 风险分级准入制度:Ⅰ/Ⅱ 级可常规上线;Ⅲ 级中风险,项目上线前完成 FMEA,定期季度模型审计;Ⅳ 级高风险,专项安全评估,审批后方可上线,月度不确定性审计;Ⅴ 级极高风险,原则禁止全自动闭环,确需应用必须多重独立安全屏障、全场景测试、强制人确认。

2. 人在回路机制:高风险场景默认开启人工确认模式,大模型指令需要操作员确认后方生效;

3. 日志全留存:模型输入、推理输出、不确定性数值、下发指令、边缘拦截动作全部时序化保存,用于事故追溯;

4. 持续监控与动态重评估:工况变更、设备改造、模型迭代之后,重新开展风险评估,更新风险等级。

6.5 安全边界设计推荐

工业项目落地时,优先采用 “大模型做上层预测与推荐,边缘本地确定性控制 + 独立安全屏障” 架构。将工业大模型限定在决策辅助域,不要直接接管安全关键控制回路。当业务确需自动闭环干预,必须同步部署不确定性量化、OOD 检测、边缘硬限幅与熔断机制,并开展专项风险定级评估。

7 结论、研究局限与展望

7.1 主要研究结论

1. 工业大模型推理不确定性分为偶然不确定性、认知不确定性、工程链路不确定性,不确定性会沿着云边协同闭环链路传导,在物理工艺对象上累积放大,从软件层信息风险转化为物理生产安全风险;认知不确定性(分布外工况、模型幻觉)是闭环场景下最危险的不确定性来源。

2. 大模型闭环介入深度、工艺对象危险等级、边缘独立安全屏障是决定风险等级的三大核心要素。大模型参与紧急停车联锁时风险达到极高等级;仅作为离线分析工具则风险极低。边缘独立硬限幅、不确定性熔断、硬件安全联锁是阻断推理不确定性风险最有效的安全屏障。

3. 本研究建立包含模型、云边链路、控制工艺、防护能力、后果严重度 5 个维度的风险评估指标体系,融合 AHP、FMEA、FTA 与模糊综合评价,构建五级风险定级模型。两个典型工业案例测算证明模型具备工程可行性,能够量化给出风险等级并定位薄弱节点。

4. 风险防控需要分层实施:模型侧降低不确定性、OOD 检测;云边侧时序校验、指令幅度限制;边缘侧设置独立安全屏障;管理侧实施分级准入、动态重评估。高风险闭环场景应当坚持安全联锁与 AI 推理链路解耦原则。

7.2 研究局限性

1. 本研究案例采用仿真 + 专家评估方式获取指标数据,未在真实事故场景下进行物理全尺度实验;工业现场复杂工况耦合因素更多,未来可结合工业试验平台采集实测不确定性数据进一步优化隶属函数。

2. 本研究主要针对单工业大模型与单边缘控制器协同场景,未考虑多模型协同、多边缘节点分布式闭环的复杂架构,复杂多智能体场景下不确定性耦合机理仍需要进一步研究。

3. 风险定级模型中部分指标依赖专家打分,存在一定主观成分,后续可积累更多工业试点数据,优化指标阈值,降低主观权重。

7.3 未来研究展望

1. 建立动态实时风险评估方法,实现随着工况变化、不确定性实时变化,风险等级动态更新,而不是静态项目上线前一次性评估;

2. 研究面向工业大模型的功能安全 SIL 适配方法,探索如何将本风险定级框架与 IEC61508 体系对接,形成标准化评估流程;

3. 研究对抗性边界测试方法,自动生成极端分布外工况,对工业大模型推理不确定性做极限压力测试;

4. 研究不确定性可视化与人机界面设计,帮助操作员直观感知大模型推理置信水平,提升人在回路决策安全性。

数据来源

1. 理论标准文献:IEC 61508、IEC 61511、IEC 62443 功能安全与工业网络安全国际标准;GB/T 20438《电气 / 电子 / 可编程电子安全相关系统的功能安全》;GB/T 32857《化工安全仪表系统规范》。

2. 学术文献:工业大模型不确定性量化、云边协同控制、工业控制系统 FMEA/FTA 相关公开期刊与会议论文。

3. 工程数据来源:泷澹实业(上海)有限公司、泷澹工业研究院、泷澹工业互联网中心研究部内部工业云边控制平台仿真试验数据、离散制造与化工工艺试点项目工况案例;案例中工艺参数、设备参数为工程仿真参数,非特定企业现场真实涉密生产数据。

4. 专家评估数据:本研究组建的功能安全、工业自动化、工业 AI 领域专家组打分矩阵数据。

免责声明

本报告由泷澹实业(上海)有限公司、泷澹工业研究院、泷澹工业互联网中心研究部基于理论建模、仿真分析与专家评估编制,仅用于学术研究、技术研讨与项目前期风险评估参考,不构成任何工程实施、安全认证、合规验收的法定文件。

报告中构建的风险定级模型、指标体系、风险等级判定结果属于研究成果,不替代第三方功能安全认证机构、安全评价机构的正式评估结论。任何单位基于本报告开展工业大模型项目工程落地,应当自行组织独立的安全评价、功能安全验证、现场测试,并遵守国家、行业相关法律法规、强制性标准。

本报告案例数据为仿真模拟数据,案例不代表任何特定工厂真实工况,不用于对特定企业安全状况的判定。因直接使用本报告结论进行工程实施而产生的一切工程风险、生产事故、经济损失、法律责任,泷澹实业(上海)有限公司、泷澹工业研究院、泷澹工业互联网中心研究部不承担任何相关责任。本报告内容未经书面许可,不得擅自篡改、截取用于商业宣传、产品背书、合规申报。

 

联系邮箱

bp@xiic.cn

微信二维码

扫一扫,微信咨询