My coding work file package
Project description
- 在电力设备状态监测场景中,如何利用时序数据分析方法(如趋势分析、异常检测)实现变压器、断路器等关键设备的故障预警?请描述分析流程、关键技术选型及结果应用路径。 在电力设备状态监测中,利用时序数据分析实现故障预警的流程如下:首先进行数据采集,通过传感器获取变压器油温、绕组电流、振动,断路器分合闸线圈电流、机械行程等时序数据,经清洗、对齐、降噪后构建统一时序数据库。关键技术选型方面,趋势分析采用移动平均、指数平滑或STL分解提取长期变化规律,结合线性回归或 ARIMA 模型判断特征量是否偏离正常演化路径;异常检测则利用孤立森林、LSTM 自编码器或动态时间规整捕捉突发性离群点,并设置自适应阈值减少误报。分析流程将上述方法串联:先对多源时序数据进行特征工程提取健康指标,再通过滑动窗口实时计算趋势偏离度与异常得分,当两者超过预设阈限且持续一定时间后触发预警。结果应用路径上,预警信息经置信度分级后推送至运维平台,低级预警用于生成例行检修建议,高级预警结合设备台账与历史案例自动定位可能故障模式,并指导差异化巡检或临时停运决策,最终将反馈结果闭环至算法模型进行持续优化。
四管哨兵——660MW超临界燃煤机组锅炉“四管”泄漏AI预警设计方案
参赛定位:重大非计划停运风险的“提前发现—辅助定位—规范处置—检修闭环”系统
适用对象:660MW超临界直流燃煤机组(具体设备编码、测点和阈值以目标电厂为准)
安全边界:只读接入DCS/SIS等生产数据;不替代保护、联锁、运行规程和人员判断;不向DCS下发控制指令
版本日期:2026-07-05
1. 一页执行摘要
1.1 为什么要做
锅炉水冷壁、过热器、再热器、省煤器统称锅炉“四管”。四管长期处于高温、高压、腐蚀、磨损和频繁变负荷的复合作用下,缺陷往往经历“材料/水质/燃烧或冲刷诱因—局部减薄或超温—微裂纹/微泄漏—相邻管冲刷—爆管停炉”的演化。国家能源局《防止电力生产事故的二十五项重点要求(2023版)》已明确要求建立四管防磨防爆台账、有条件采用泄漏监测装置,并要求发生爆漏后尽快停炉、完整记录与分析原因;这说明四管治理不是单纯算法题,而是贯穿运行、检修、金属监督和管理闭环的现场业务题。国家能源局《二十五项反措(2023版)》
现有DCS高低限报警擅长识别已经越限的显性异常,却难以在负荷、煤质、吹灰、启停等工况变化中识别“尚未越限但多参数关系已经失常”的微弱前兆;运行人员还要在短时间内跨画面比对给水、主汽、壁温、炉膛负压、烟温、减温水和声音等证据,判断泄漏真假与区域。国家能源局要求深度调峰期间重点关注管道超温、泄漏、疲劳劣化及升降负荷速率影响,这进一步放大了分工况监测的必要性。国家能源局国能发安全〔2024〕58号
1.2 建设什么
“四管哨兵”在不改变DCS保护逻辑的前提下,构建三条相互校验的预警链:
- 机理链:汽水质量平衡、简化热量平衡、烟汽侧一致性与吹灰事件校正;
- 数据链:分工况正常行为模型预测“理论应有值”,检测多测点时序残差及变化点;
- 证据链:把泄漏声学信号(若现有)、炉膛负压、给水—主汽不平衡、局部烟温/壁温、减温水和历史案例融合,输出概率、区域、趋势、置信度和证据。
系统回答五个现场问题:是否异常、像不像泄漏、疑似在哪里、风险是否在发展、现在应查什么。知识库提供有出处的规程条款和历史案例,但不让大模型决定报警级别;风险由经验证的机理、规则和时序模型共同决定。
1.3 如何落地
项目按“数据治理与案例复盘—离线回放—只读影子运行—小范围试点—验收推广”推进。先用本厂历史数据重现事故前后曲线并冻结测试集,再在真实运行中只显示、不触发工单,评估误报与工况漂移;通过运行、锅炉、热控、金属监督共同评审后,才进入人工确认的告警闭环。
1.4 预期效果(均为待验证的项目目标)
- 将“越限后响应”前移为“多源关系失常时预警”;
- 提供水冷壁/过热器/再热器/省煤器一级区域判断,并在测点条件允许时细化到炉墙、烟道侧或管屏组;
- 以每机组日误报次数、事件召回率、预警提前量、区域定位准确率等指标验收;
- 减少人工翻图时间、缩短故障确认时间,为计划降负荷/停机和备件组织争取窗口;
- 将处置与检修结果回写,形成“一次事件沉淀一个可复用案例”的知识闭环。
证据边界声明:本文引用的研究结果仅证明技术路线具有可行性,不代表本项目已经取得相同结果;文中数值指标是建议验收目标,须在目标电厂历史回放和影子运行中校准;最终实测结果只在试点完成后填报。
2. 场景和设备系统描述
2.1 目标机组和边界
以一台660MW超临界直流燃煤机组为统一设计基线。锅炉水冷壁吸收炉膛辐射热并完成工质蒸发;过热器将蒸汽加热至主汽设计状态;再热器对高压缸排汽再热;省煤器利用尾部烟气加热给水。四类受热面在温度、介质、布置和主要失效模式上不同,不能用一个固定阈值或单一模型粗暴覆盖。
现行DL/T 438—2023《火力发电厂金属技术监督规程》将过热器、再热器、水冷壁、省煤器等承压部件纳入金属监督范围,为检验、判据和寿命管理提供标准依据。系统只提供运行期风险线索,不取代该标准要求的检验检测。
| 受热面 | 典型工作环境 | 主要诱因 | 运行期可观察前兆 |
|---|---|---|---|
| 水冷壁 | 炉膛高热负荷、辐射、汽水/超临界工质 | 高温腐蚀、结垢垢下腐蚀、局部过热、吹灰/落焦磨损、焊口或鳍片受力 | 炉膛负压扰动、给水—蒸汽偏差、局部壁温/烟温异常、声学能量变化 |
| 过热器 | 高温烟气与高温蒸汽 | 热偏差、超温蠕变、氧化皮脱落堵管、减温水异常、吹灰磨损、异种钢焊口劣化 | 管壁温偏差扩大、主汽温/减温水关系异常、烟温和蒸汽侧不一致 |
| 再热器 | 大流量高温再热蒸汽、宽负荷变化 | 流量分配不均、热偏差、超温蠕变、氧化皮、磨损、启停热疲劳 | 再热汽温、压差、壁温分布及负荷速率关系失常 |
| 省煤器 | 尾部烟道、较低温给水、飞灰冲刷 | 飞灰磨损、低温腐蚀、局部积灰、焊缝/管排缺陷 | 给水侧平衡异常、烟温偏差、尾部烟道声音/负压变化 |
同行评审失效分析表明,水冷壁爆管可由结垢与垢下腐蚀、局部过热等共同造成,说明监测不能只盯一个温度测点,而要同时考虑水汽品质、运行历史和热负荷。《锅炉水冷壁腐蚀爆管原因》
2.2 参赛演示边界
- 首期覆盖:现有DCS/SIS可获得的运行参数;已有声学泄漏监测如可接入则作为独立证据,不以新增硬件为项目成立前提。
- 区域粒度:无足够空间测点时只承诺四大受热面/炉墙或烟道区域;不宣称定位到某一根管。
- 输出性质:黄色/橙色/红色“辅助预警”,最终处置必须按运行规程、值长指令和保护动作执行。
- 不包含:承压部件剩余寿命的法定结论、在线替代无损检测、自动降负荷、自动停炉或自动隔离。
3. 当前业务流程与岗位分工
3.1 现行流程及断点
flowchart LR
A["DCS固定阈值、巡检或泄漏声学装置发现异常"] --> B["主/副值人工翻阅多幅趋势"]
B --> C["联系锅炉专工、热控与检修复核"]
C --> D{"判断是否四管泄漏"}
D -- "证据不足" --> E["持续观察;可能错过发展窗口"]
D -- "疑似/确认" --> F["值长按规程汇报并组织降负荷或停机"]
F --> G["隔离、冷却、检查、割管与失效分析"]
G --> H["检修记录、金属监督报告、运行记录分散归档"]
H -. "知识难复用" .-> B
主要断点:
- 发现晚:单测点高限常在异常放大后才触发;
- 工况混淆:吹灰、磨组切换、升降负荷会产生与泄漏相似的瞬时变化;
- 证据割裂:运行曲线、声学、缺陷台账、化学监督、检修报告位于不同系统;
- 定位粗:报警只能说“可能漏”,不能稳定解释为何怀疑某一受热面;
- 经验依赖:夜班与人员经验差异影响确认速度;
- 闭环弱:爆口分析和检修结果没有结构化回写预警规则。
3.2 优化后流程
flowchart LR
A["只读采集DCS/SIS、声学、日志、规程和案例"] --> B["数据质量检查 + 工况/事件识别"]
B --> C["机理残差 + 正常行为模型 + 变化点检测"]
C --> D["多证据融合:泄漏概率、趋势、区域、置信度"]
D --> E{"持续性与多源一致性门控"}
E -- "不足" --> F["抑制/观察清单;保留审计记录"]
E -- "达到阈值" --> G["预警驾驶舱:证据链和规程出处"]
G --> H["主值/值长人工确认"]
H --> I["按现行规程处置和工单流转"]
I --> J["检修/失效分析结果结构化回写"]
J --> K["模型复盘、阈值评审、知识库更新"]
K --> B
3.3 RACI岗位分工
| 活动 | 主/副值 | 值长 | 锅炉专工/检修 | 热控 | 金属/化学监督 | AI运维 |
|---|---|---|---|---|---|---|
| 预警监视与初核 | R | A | C | C | I | I |
| 处置决策 | C | A/R | C | C | I | 不参与 |
| 测点/数据质量复核 | C | I | C | A/R | I | C |
| 区域检查、割管检修 | I | A | R | C | C | 不参与 |
| 失效原因认定 | I | I | R | C | A/R | 不参与 |
| 标签与案例回写 | C | A | R | R | R | C |
| 模型发布/回退 | I | I | C | C | C | R;专业负责人A |
R=执行,A=最终负责,C=协商,I=知会。AI系统没有运行处置决策权。
4. 故障演化链和深层业务痛点
4.1 四类受热面的故障演化
flowchart TD
A["诱因层<br/>偏烧/煤质变化/结焦/吹灰冲刷/水质恶化/氧化皮/焊接或材料缺陷/频繁调峰"] --> B["损伤层<br/>热偏差、局部超温、腐蚀、磨损、堵管、热疲劳、蠕变"]
B --> C["隐患层<br/>壁厚减薄、组织劣化、裂纹萌生、流量分配恶化"]
C --> D["前兆层<br/>壁温关系失常、汽水平衡偏移、烟汽侧不一致、声学能量异常"]
D --> E["微泄漏<br/>高压工质喷出但单点可能尚未越限"]
E --> F["扩大泄漏<br/>炉膛负压和给水补偿更明显、邻管被冲刷"]
F --> G["爆管/停炉<br/>非计划停运、连带损伤与抢修"]
D -. "机会窗口" .-> H["AI多源早期预警"]
受热面差异决定证据侧重:
- 水冷壁:高温腐蚀/结垢导致壁厚和传热恶化,局部热负荷与水动力偏差促使裂纹;微漏先影响炉膛负压和汽水平衡,壁温未必先越限。
- 过热器/再热器:长期超温、短时超温、流量偏差和氧化皮堵塞会形成蠕变或局部过热链;减温水变化可能暂时掩盖主/再热汽温异常。
- 省煤器:飞灰磨损和尾部积灰环境突出;局部泄漏信号可能被烟道噪声和运行扰动淹没。
针对660MW超临界锅炉的同行评审研究指出,过热器集箱流量分配与热偏差可导致局部超温爆管;燃烧—水动力耦合研究也显示高温受热面壁温具有明显空间偏差,支持采用“受热面分区+工况基线”而非全炉单阈值。660MW过热器流量分配研究;燃烧与水动力耦合壁温研究
4.2 五个需要AI解决的深层问题
- 正常波动的边界随工况移动:300MW低负荷与660MW高负荷、稳态与快速爬坡的合理给水—主汽偏差不同。
- 前兆是关系异常,不一定是数值越限:例如给水量、主汽流量都在允许范围内,但二者校正后的差值开始持续偏离。
- 故障样本少且标签不整齐:爆管事件稀有,事件起点常由事后经验回溯,不能依赖纯监督分类。
- 真假泄漏混淆:吹灰、疏水、启停、给煤扰动、测点跳变可造成相似残差。
- 报警必须可解释:值长不能依据一个0.87的黑盒分数决定处置,必须看到哪些证据、持续多久、哪些反证存在。
4.3 业务后果
- 微漏未及时识别可能扩大冲刷邻管,增加检修范围;
- 误报可能导致不必要的降负荷、巡检风险和对系统的不信任;
- 漏报则错失计划处置窗口;
- 处置证据不足会增加跨专业沟通时间;
- 未结构化沉淀的失效分析无法反哺运行监测。
5. 项目目标、边界与适用条件
5.1 业务目标
- 建立覆盖“四管”从早期异常到处置复盘的闭环;
- 对历史可识别事件提供早于现有明确报警的辅助预警;
- 将人工跨画面分析浓缩为一条可审计证据链;
- 将爆口、材质、位置、检修和原因结构化进入知识库;
- 为防磨防爆检查区域和检修资源排序提供数据线索。
5.2 技术目标
- 构建启停、稳态、升负荷、降负荷、深调峰、吹灰等状态识别;
- 建立质量/热量平衡、正常行为预测、变化点检测和证据融合;
- 输出四元组:
风险等级 + 疑似区域 + 发展趋势 + 置信度; - 每条预警保存模型版本、输入窗口、关键证据、规则命中、人工反馈。
5.3 适用条件
- 关键DCS/SIS测点时间戳可对齐,采样周期和单位可追溯;
- 至少能取得正常运行数据及若干历史异常/爆漏事件窗口;
- 运行日志和检修记录可建立设备编码映射;
- 电厂愿意由运行、锅炉、热控、金属/化学监督联合确认标签;
- 无历史事件时,可完成正常行为异常检测,但不得承诺事件召回率。
5.4 明确边界
- 只读部署,系统与生产控制网络按电厂网络安全制度隔离;
- 不修改DCS原报警,不屏蔽保护信号;
- AI建议不得覆盖运行规程;
- 不用AI虚拟值替代保护测点;
- 声学装置未配置时,系统降级为DCS多参数预警并降低置信度;
- 不把“异常”直接等同于“泄漏”,以候选、疑似、较高风险分级表述。
6. 数据清单、标签来源和预警知识库设计
6.1 数据清单
| 数据域 | 典型字段 | 用途 | 质量要求 |
|---|---|---|---|
| 机组工况 | 负荷、主汽压力/温度、给水流量、燃料量、升降负荷速率 | 工况分层、平衡校正 | 单位统一、时钟对齐 |
| 汽水侧 | 主汽/再热汽流量、给水流量、减温水、疏水、分离器/储水罐相关量 | 质量和热量平衡 | 明确计算值/测量值来源 |
| 炉膛烟气侧 | 炉膛负压、烟温、氧量、风量、引送风机参数 | 泄漏扰动与区域证据 | 处理测点漂移与卡涩 |
| 受热面 | 各屏/墙壁温、进出口汽温/压力、烟温分区 | 超温、空间偏差、定位 | 建立测点—区域拓扑 |
| 事件状态 | 吹灰器状态、磨组切换、燃烧器切换、启停、旁路/疏水 | 误报抑制、工况识别 | 事件起止时间可靠 |
| 声学(可选) | 分区声强、频带能量、装置告警 | 独立泄漏证据 | 记录环境噪声和设备状态 |
| 设备与检修 | 爆口位置、材质、壁厚、失效机理、割管/更换、工单 | 标签、区域先验、知识闭环 | 设备编码一致 |
| 化学与监督 | 水汽品质、结垢、腐蚀产物、金相、硬度、寿命评估 | 原因解释、风险先验 | 采样时间与机组时段关联 |
6.2 标签分级
- 金标签:检修割管、失效分析或现场确认支持的真实爆漏,含时间、区域、机理;
- 银标签:运行日志明确记录疑似泄漏并采取处置,但缺少完整失效分析;
- 弱标签:已有报警或人工备注,仅用于候选检索,不直接作为真值;
- 正常标签:经事件、检修、运行共同排除异常的稳定窗口;
- 干扰标签:吹灰、启停、疏水、磨切换、测点故障等非泄漏事件。
训练与验收优先使用金/银标签;弱标签需专业复核。按事件时间切分训练、验证、测试,禁止同一事故的相邻窗口同时出现在训练和测试中。
6.3 知识库
知识库采用“文档库+结构化故障图谱”双层:
- 文档:运行规程、事故预案、二十五项反措、金属监督标准、设备说明书、检修工艺;
- 案例:事件时间线、关键曲线、爆口图、材质与位置、根因、处置和效果;
- 图谱实体:机组—受热面—管屏/炉墙—测点—故障模式—机理—证据—处置—工单;
- 版本控制:规程生效/失效日期、审批人、来源页码;
- 检索输出:只展示经授权资料,并返回文档名、版本、条款/页码;
- 安全约束:大模型只做检索摘要和自然语言解释,不生成越过规程的操作指令,不参与风险分数计算。
7. 总体系统架构与数据流
flowchart TB
subgraph L1["第1层:数据源层"]
A1["DCS/SIS时序"] A2["声学泄漏监测(可选)"] A3["运行日志/工单/检修"] A4["规程/标准/案例"]
end
subgraph L2["第2层:数据治理层"]
B1["只读采集与时钟对齐"] B2["单位/量程/缺失/坏点检查"] B3["设备测点拓扑"] B4["工况与干扰事件标注"]
end
subgraph L3["第3层:分析模型层"]
C1["汽水质量平衡"] C2["简化热量平衡"] C3["分工况正常行为模型"] C4["残差/变化点检测"] C5["多证据融合与区域定位"]
end
subgraph L4["第4层:业务应用层"]
D1["风险驾驶舱"] D2["证据链与趋势"] D3["历史回放"] D4["规程/案例检索"] D5["人工确认与工单闭环"]
end
subgraph L5["第5层:治理保障层"]
E1["模型版本与审计"] E2["权限/网络安全"] E3["漂移监测与回退"] E4["指标看板与专业评审"]
end
L1 --> L2 --> L3 --> L4
L5 -. "全过程约束" .-> L2
L5 -. "全过程约束" .-> L3
L5 -. "全过程约束" .-> L4
数据流保持单向只读:生产侧经批准的接口/隔离措施向分析区提供数据;分析结果在授权终端展示,不反写DCS控制逻辑。原始数据、特征、推理结果和人工反馈分别保存,确保事故复盘可追溯。
8. AI模型、输入输出、选择理由及基线方法
8.1 模型组合
A. 工况识别与事件门控
- 规则+轻量分类模型识别启停、稳态、升/降负荷、低负荷深调、吹灰、磨切换等;
- 输入负荷、负荷变化率、燃料量、主汽压力、吹灰和设备状态;
- 作用是选择相应基线并对已知干扰设置短时观察窗,而不是简单屏蔽所有异常。
B. 汽水质量平衡
用校正后的给水、主汽、再热/减温水、疏水等构造平衡残差。实际公式必须由目标机组流程图和测点定义确认,避免重复计量或漏项。采用滚动统计和工况回归消除仪表偏差;持续偏移才形成证据。
C. 简化热量平衡与烟汽侧一致性
比较燃料/烟气侧热输入代理量、受热面壁温/汽温响应与减温水调节之间关系。目标不是在线复现全炉热力计算,而是得到可解释的“正常关系残差”。
D. 正常行为模型(NBM)
- 首选LightGBM/梯度提升树:适合非线性表格时序特征,训练和解释成本低,可输出SHAP贡献;
- 对有明显长时滞的参数补充TCN或LSTM,但只有在按事件外推验证显著优于轻量模型时启用;
- 每个受热面/区域建模,输入相关工况与上游变量,预测壁温、烟温、压力/流量关系等“应有值”;
- 模型主要学习健康数据,适合故障样本稀缺场景。
E. 残差与变化点
- 计算标准化残差、残差斜率、持续时间、多测点相关性变化;
- EWMA/CUSUM识别均值缓慢漂移,滑动方差识别波动增强;
- 动态阈值按工况和季节/煤种分位数设置。
F. 多证据融合和区域定位
将机理残差、数据残差、声学分区(如有)、空间邻近测点和历史先验输入贝叶斯/加权证据融合层。权重由历史回放和专业审核确定;任一单证据不直接触发红色预警。区域评分依据测点拓扑和证据覆盖率计算,并输出“定位能力不足”的诚实提示。
同行评审研究已在真实电站水冷壁泄漏数据上探索机器学习和传感器选择,另一项真实电站研究采用CNN与SVM混合方案进行泄漏检测;这些属于外部文献结果,仅证明从运行时序中提取泄漏特征的路线可行,不可直接搬用其性能作为本项目成绩。Sensors 2020研究;Mathematics 2024研究
8.2 模型输入输出
| 模块 | 输入 | 输出 | 可解释信息 |
|---|---|---|---|
| 工况识别 | 负荷、变化率、设备状态 | 工况标签、置信度 | 触发规则/关键变量 |
| 平衡模型 | 流量、温压、疏水/减温水 | 质量/热量残差 | 参与项和校正项 |
| NBM | 工况及相关多测点序列 | 预测值、区间、标准化残差 | SHAP、实际/预测曲线 |
| 变化点 | 残差序列 | 起点、持续时间、趋势 | CUSUM/EWMA轨迹 |
| 融合定位 | 多源证据+拓扑 | 泄漏风险、区域、置信度 | 正证据、反证、缺失证据 |
8.3 与基线比较
必须至少比较:
- 现有DCS固定上下限;
- 单一质量平衡阈值;
- 不分工况的统计阈值;
- 分工况机理+NBM融合方案。
比较维度为事件召回率、误报/机组日、事件级精确率、首次预警提前量、区域定位准确率和检测延迟;不以逐采样点准确率掩盖类别极不平衡。
9. 实时预警、根因分析、处置和检修闭环
9.1 三级预警
| 等级 | 建议触发逻辑(待本厂标定) | 系统呈现 | 人员动作边界 |
|---|---|---|---|
| 黄色:关注 | 单/双类证据轻度持续,或变化点出现但反证存在 | 候选区域、证据缺口、观察计时 | 主值复核趋势和工况,不建议设备操作 |
| 橙色:疑似 | 至少两类独立证据持续增强,且干扰门控不能解释 | 泄漏概率、区域、发展速度、相关规程 | 值长组织锅炉/热控复核,按规程加强监视/检查 |
| 红色:高风险 | 多源强一致、趋势持续恶化或现有明确报警出现 | 高风险证据链、时间线、应急资料入口 | 完全按现行规程与值长指令处置;AI不下发命令 |
9.2 证据卡
每条预警展示:
- 当前工况与过去30/60分钟工况变化;
- 实测值、模型预测值、置信区间和残差起点;
- 汽水平衡、炉膛负压、壁温/烟温、声学证据;
- 吹灰/磨切换/测点坏点等反证;
- 疑似受热面与区域热力拓扑;
- 与最相似历史案例的相似点/差异点;
- 引用规程名称、版本和条款;
- 模型版本、数据完整度与置信度。
9.3 根因与处置闭环
系统根因输出分为“泄漏位置假设”和“形成机理候选”,后者只能作检修检查方向:
- 高温/热偏差、腐蚀减薄、飞灰/吹灰磨损、氧化皮堵管、焊口/材料、机械拉裂等;
- 结合水汽品质、超温历史、吹灰位置、以往壁厚与爆口记录排序;
- 运行期不宣称完成材料失效认定,最终结论由割管、金相、力学和化学分析给出。
工单关闭时回填:是否真实泄漏、准确时间、位置、材质、爆口形貌、根因、处理、连带损伤、系统是否提前、是否误定位。未经专业审核的反馈不进入正式训练集。
10. 数据缺失、坏点、变工况、模型失效等降级策略
| 风险 | 检测方式 | 降级措施 | 展示要求 |
|---|---|---|---|
| 数据中断/时钟错位 | 心跳、采样间隔、跨源时差 | 暂停相关模型,保留独立可用证据 | 标“数据不完整”,禁止高置信度 |
| 测点跳变/卡死/漂移 | 变化率、平线、冗余/虚拟测点残差 | 降低该测点权重,转用冗余/关联量 | 显示被降权原因 |
| 吹灰/启停/磨切换 | 事件状态和工况模型 | 切换专用基线、延迟升级,不一刀切屏蔽 | 说明干扰事件 |
| 新煤种/新运行方式 | 分布漂移、残差群体偏移 | 进入影子观察,回退规则/机理层 | 标记模型超适用域 |
| 模型服务故障 | 健康检查、延迟和异常码 | 回退现有DCS与机理规则,通知运维 | 不影响原系统 |
| 无声学信号 | 接口状态 | 使用DCS融合,置信度上限下调 | 明确缺失证据 |
| 多模型冲突 | 证据一致性检查 | 不自动升级,进入人工复核 | 同时列正证据和反证 |
| 版本异常 | 指标漂移、发布审计 | 一键回退最近已批准版本 | 保留全量审计 |
误报控制采用六道门:工况分层、干扰识别、持续性、多源一致性、测点可信度、人工确认。漏报风险通过保留原DCS报警、定期复盘未命中事故和红队注入测试控制。
11. 离线回放、影子运行和现场试点实施计划
11.1 实施里程碑
| 阶段 | 建议周期 | 关键工作 | 阶段出口 |
|---|---|---|---|
| M0 立项与边界 | 2周 | 机组流程、网络、安全、岗位和验收口径确认 | 范围/安全边界签字 |
| M1 数据与知识治理 | 4–6周 | 点表、时间对齐、工况/事件、历史案例和文档整理 | 数据质量报告、金/银标签清单 |
| M2 模型与离线回放 | 6–8周 | 平衡模型、NBM、变化点、融合、基线比较 | 冻结测试集回放报告 |
| M3 只读影子运行 | 8–12周,覆盖典型工况 | 实时推理但不推送正式告警,记录候选 | 误报、漂移和性能评审通过 |
| M4 受控试点 | 8–12周 | 指定机组/班组展示,人工确认和工单闭环 | 业务与技术双验收 |
| M5 推广与运营 | 持续 | 扩区域、季度复盘、版本治理 | 稳态指标与年度价值复核 |
周期为建议值,需根据事件数量、数据权限和停机窗口调整。
11.2 历史回放演示脚本(待填真实案例模板)
以下仅是演示模板,不代表存在该事件或已获得任何提前量。
演示主题:一次已由检修确认的[受热面/区域]泄漏事件回放
资料前提:事件必须有运行日志、停机/检修记录或失效分析支持;敏感信息脱敏。
- 0:00–0:10 交代真值:展示事件编号、确认时间、实际区域和标签等级,隐藏模型结果;
- 0:10–0:25 传统视角:播放故障前
[建议2–4小时]DCS关键参数,标出现有明确报警时刻T0; - 0:25–0:45 AI视角:叠加实测/预测、平衡残差、变化点和多证据风险,显示AI首次达到黄色T1、橙色T2;
- 0:45–0:60 证据链:点击风险卡,展示三项正证据、干扰反证、数据完整度和疑似区域;
- 0:60–0:75 定位与知识:在锅炉示意图高亮AI区域,与最终检修区域对照;打开有出处的规程/相似案例;
- 0:75–0:90 结果页:自动计算
提前量=T0−T2、是否命中区域、是否存在误报;明确“处置仍由值长按规程决定”。
若回放未提前或定位错误,应如实展示并解释误差、提出改进,不挑选测试集之外的“最好案例”代替整体指标。
12. 技术指标及验收方法
12.1 建议量化指标
| 指标 | 建议项目目标 | 计算/验收方法 | 结果性质 |
|---|---|---|---|
| 金/银标签事件召回率 | ≥90% | 独立冻结事件测试集,按事件而非采样点 | 待实测 |
| 事件级精确率 | ≥85% | 经专业闭环确认的预警事件 | 待实测 |
| 误报频度 | ≤1次/机组日 | 影子运行覆盖主要工况,按橙级及以上 | 待实测 |
| 中位预警提前量 | ≥15分钟 | 相对现有首个明确报警/人工确认时刻,口径预先冻结 | 待实测 |
| 一级区域定位准确率 | ≥80% | 四大受热面或约定区域,与检修真值比较 | 待实测 |
| 实时推理延迟 | ≤1个采样周期 | 端到端时间戳审计 | 待实测 |
| 关键数据可用率 | ≥99% | 项目定义的关键点表 | 待实测 |
| 预警解释完整率 | 100% | 每条含正/反证、工况、版本、资料出处 | 待实测 |
| 8分钟汇报完成率 | 100% | 三次计时彩排,7:30–8:00完成 | 赛前验证 |
这些数值是竞赛方案中的建议验收目标,不是承诺值。若本厂历史样本过少,应报告置信区间和每类事件数量,不用合成注入数据代替真实事件召回结论。
12.2 验收设计
- 训练/验证/测试严格按时间和事故事件隔离;
- 先冻结阈值和模型,再运行测试集,避免事后调参;
- 以DCS阈值、单平衡、无工况统计模型为基线;
- 合成注入仅用于鲁棒性测试,如缺失、漂移、跳变、小幅偏置,不计入真实事件效果;
- 分别报告稳态、升降负荷、深调峰、吹灰等工况;
- 对每个漏报、误报做专业复盘;
- 现场试点由运行、锅炉、热控、金属监督联合签字验收。
13. 安全、经济和管理价值量化公式
13.1 安全价值
- 微泄漏被扩大前识别的事件数;
- 预警争取的确认/处置窗口;
- 邻管冲刷或扩大损伤的减少情况;
- 高风险巡检的减少或更精准组织;
- 防磨防爆检查的重点区域命中率。
13.2 经济价值公式
年度可核验价值:
V = V_避免非停 + V_缩短抢修 + V_减少连带损伤 + V_减少人工分析 − C_建设 − C_运维
其中:
V_避免非停 = 可归因减少事件数 × 平均少停小时 × 受限出力(MW) × 边际贡献(元/MWh);V_缩短抢修 = 缩短小时 × 停运小时价值 + 节省外委/加班费用;V_减少连带损伤 = 基准期邻管/管排更换和材料费用 − 试点期可比费用;V_减少人工分析 = 单事件节约工时 × 人工综合成本 × 事件数。
需要电厂补充:近3–5年四管事件、停运小时、平均受限出力、边际贡献、抢修和材料费用、现有监测维护费。只有经财务/生产共同确认且能归因的部分计入收益;不把所有停机改善都归功于AI。
13.3 管理价值
- 形成统一四管事件编码和防磨防爆知识台账;
- 将“老员工脑中经验”变为带出处的证据链;
- 量化运行、检修和技术监督协同效率;
- 为检修检查区域排序提供辅助证据,但不减少标准规定的必检项。
14. 方案创新点及与普通阈值报警的差异
| 维度 | 普通阈值/单一装置 | 四管哨兵 | 为什么需要 | 如何验证 |
|---|---|---|---|---|
| 报警基线 | 固定上下限 | 分工况动态正常区间 | 深调峰和变负荷边界移动 | 分工况误报对比 |
| 判据 | 单点越限 | 机理、数据、声学(可选)多证据 | 单点易误判 | 消融实验和冲突案例 |
| 时机 | 显性异常后 | 关系失常与变化点阶段 | 争取处置窗口 | 历史事件提前量 |
| 定位 | 全炉/装置分区 | 受热面+热力拓扑+空间证据 | 缩短人工排查 | 与检修真值比较 |
| 解释 | 报警值 | 正证据、反证、缺失证据、相似案例 | 支持值长判断 | 解释完整率/专家评分 |
| 知识闭环 | 报表分散 | 工单和失效分析回写 | 防止重复故障 | 案例复用和标签完整率 |
| 安全治理 | 可能被误解为自动控制 | 明确只读、可回退、不进保护 | 电力生产安全底线 | 网络/权限/回退测试 |
核心创新不是堆叠深度学习名词,而是:
- 把“汽水平衡和热量关系”转化为可解释的AI残差;
- 用工况识别和干扰反证解决调峰、吹灰造成的误报;
- 让每条预警同时给出支持与反对泄漏的证据;
- 把爆口失效分析反哺运行模型,形成跨专业闭环。
15. 10–12页、8分钟PPT大纲及逐页时间
建议11页,总计480秒。
| 页 | 标题 | 核心内容/画面 | 时间 |
|---|---|---|---|
| 1 | 四管哨兵:把爆管处置窗口向前移 | 一句话价值、660MW场景、安全边界 | 25秒 |
| 2 | 为什么四管是现场真痛点 | 四类受热面、监管要求、损失链;只引用可靠资料 | 40秒 |
| 3 | 一次泄漏为何难以及时确认 | “诱因—损伤—前兆—微漏—爆管”演化图 | 45秒 |
| 4 | 现有流程的六个断点 | 传统流程图,突出晚、散、混、粗、靠经验、难闭环 | 45秒 |
| 5 | 优化后的业务闭环 | AI预警—人工确认—按规程处置—检修回写 | 35秒 |
| 6 | 五层架构:只读接入,不碰保护 | 数据、治理、模型、应用、保障架构图 | 45秒 |
| 7 | AI如何既早又稳 | 工况基线+质量/热量平衡+NBM残差+变化点+融合 | 60秒 |
| 8 | 预警不是一个分数,而是一条证据链 | 风险卡原型:概率、区域、趋势、正反证、出处 | 45秒 |
| 9 | 90秒历史回放演示 | 真实案例模板:传统报警T0、AI候选T1/T2、检修真值 | 90秒 |
| 10 | 如何证明不是“实验室AI” | 离线回放—影子运行—试点;指标与失效降级 | 30秒 |
| 11 | 价值、创新与总结 | ROI公式、四项创新、结论“先可信预警,再规范处置” | 20秒 |
演示页可与讲解并行,严格使用本厂已确认历史案例;若尚未获得数据,PPT标注“演示原型/待接入真实案例”,不得伪造事故曲线。
16. 专家可能提问及标准答复
Q1:DCS已有高低限和泄漏声学装置,为什么还要AI?
答:DCS阈值和声学装置继续保留,它们是重要基线和独立证据。AI的增量是按工况预测“应有值”,识别尚未越限的多参数关系异常,并把汽水平衡、炉膛负压、壁温、烟温、声学和干扰事件合成可审计证据链。项目必须在冻结测试集上证明相对现有基线的提前量和误报改善,否则不进入试点。
Q2:故障样本很少,深度学习会不会过拟合?
答:不会把纯深度监督分类作为首选。先以健康数据训练正常行为模型,用机理残差和变化点识别偏离;LightGBM等可解释轻量模型优先。TCN/LSTM只有在事件外推验证显著更好时才使用。训练、验证、测试按事件隔离,并报告样本数和置信区间。
Q3:如何区分泄漏和吹灰?
答:吹灰状态进入事件门控和专用基线;同时检查声学空间位置、汽水平衡持续性、炉膛负压、烟温/壁温响应。吹灰通常有明确起止状态和可重复响应,泄漏证据则在吹灰结束后仍可能持续或增强。系统不会因单一尖峰升级红警。
Q4:给水流量和主汽流量本身有误差,质量平衡可靠吗?
答:平衡不是单点硬阈值。项目先核对流程边界和计量口径,按工况估计正常偏差,监测持续变化而非绝对零残差;若相关测点可信度下降,就降低该证据权重。它只作为多证据之一。
Q5:能定位到具体哪根管吗?
答:不做超出测点空间分辨率的承诺。首期目标是四类受热面和约定分区;现有壁温、烟温或声学分区充分时再细化至炉墙/管屏组。具体管号最终由停机检查确认。
Q6:模型给出红色预警后会自动停炉吗?
答:不会。系统只读,不进保护和闭环控制。所有操作由值长依据运行规程、保护状态和现场复核决定;模型故障也不影响原DCS。
Q7:如果把真实过热误判成测点故障怎么办?
答:测点可信度只是一个输入,不会直接屏蔽原报警。系统比较冗余/邻近测点、设备工况、物理平衡和多源同步变化;证据冲突时降低置信度并转人工复核。原始值始终显示,AI虚拟值绝不替代保护测量。
Q8:如何量化经济收益而不夸大?
答:按可归因事件逐项核算:减少非停小时、缩短抢修、减少连带损伤和人工分析,扣除建设运维成本;所需参数由生产和财务确认。未发生事故不直接等于“AI避免了一次事故”,必须有事件证据和对照口径。
Q9:文献中准确率很高,你们为什么目标没有照搬?
答:文献的数据、机组、采样和标签定义不同,只能证明路线可行。本项目指标必须由本厂冻结测试集和影子运行实测,且优先报告事件召回、误报/机组日和提前量,而不是类别不平衡下容易虚高的逐点准确率。
Q10:新煤种或深度调峰方式改变后,模型还可靠吗?
答:系统监测特征分布和残差群体漂移。超出适用域时降低置信度、回退机理/规则层并进入影子观察,积累经审核的新工况数据后再发布新版本。每次发布可回退、可审计。
Q11:知识库中的大模型会不会“幻觉”出错误操作?
答:大模型只检索和摘要经批准的规程、案例,并强制返回文档版本和条款出处;风险等级由机理、规则和时序模型计算。没有出处时明确回答“未检索到”,禁止生成新的操作指令。
Q12:合成故障注入能不能证明系统有效?
答:合成注入只能验证对缺失、漂移、跳变和小偏差的鲁棒性,不能替代真实泄漏事件的召回率、提前量和定位结论。真实成效只用金/银标签历史事件和现场影子运行评价。
Q13:与“慧测”测点可信度方案和“煤盾”方案如何协同?
答:“慧测”向本方案输出测点可信度,低可信测点降权但不删除原值;“煤盾”的磨组切换、断煤和燃烧扰动事件可作为四管模型的工况/反证输入。四管哨兵又将受热面风险供机组级驾驶舱展示。三者共用数据治理、知识库和工单闭环,但模型与验收指标独立。
Q14:项目最大的落地风险是什么?
答:不是算法,而是历史标签、测点口径和跨专业闭环。故此M1先做数据与案例治理;无可靠标签不宣称准确率;运行、锅炉、热控、金属/化学监督共同签字,先影子运行再受控试点。
参考资料与证据边界
以下共10项,其中1–5为官方文件/标准,6–10为同行评审论文或专业期刊资料。引用只用于支撑行业背景、故障机理和技术可行性。
- 国家能源局:《2023年全国电力可靠性年度报告》。用于可靠性管理与非计划停运背景;不据此虚构本厂事件数。
- 国家能源局:《防止电力生产事故的二十五项重点要求(2023版)》。用于四管防磨防爆、监测、停运和失效分析的安全要求。
- 国家能源局:《关于加强煤电机组灵活性改造和深度调峰期间安全管理的通知》。用于变负荷、管道超温、泄漏、疲劳劣化和状态监测要求。
- 全国标准信息公共服务平台:DL/T 438—2023《火力发电厂金属技术监督规程》。用于承压部件金属监督范围与检验边界。
- 国家市场监督管理总局:TSG 11—2020《锅炉安全技术规程》及第1号修改单公告。用于锅炉法定安全技术规范边界。
- Khalid et al., “Intelligent Steam Power Plant Boiler Waterwall Tube Leakage Detection via Machine Learning-Based Optimal Sensor Selection,” Sensors, 2020. 用于真实水冷壁泄漏数据和机器学习传感器选择可行性。
- “Real-World Steam Powerplant Boiler Tube Leakage Detection Using Hybrid Deep Learning,” Mathematics, 2024. 用于真实电站时序泄漏识别路线参考。
- 张志达等:《锅炉水冷壁腐蚀爆管原因》,《理化检验—物理分册》,2023。用于腐蚀、结垢、局部过热与爆管机理。
- 《过热器分配集箱三通区域静压分布试验研究》。用于660MW超临界锅炉过热器流量分配、热偏差与超温风险。
- 《基于燃烧与水动力耦合模型的锅炉蒸汽管超温特性研究》。用于660MW超临界锅炉高温受热面空间壁温偏差与分区监测依据。
三类结果必须严格区分
- 文献结果:上述论文在各自数据和边界内的结论,只证明路线可研究;
- 项目目标:第12节指标表,是待目标电厂确认和实测的验收建议;
- 未来实测结果:离线冻结测试集、影子运行和受控试点完成后方可填写,未完成前统一标注“待验证”。
煤盾——660MW超临界燃煤机组制粉系统故障链AI预警设计方案
文档定位:竞赛方案设计稿,不代表已建成系统或既有运行业绩。
统一基线:660MW超临界燃煤机组、直吹式中速磨煤机制粉系统;已有DCS/SIS时序数据,可补充煤质、日志、检修记录、运行规程和历史案例。
安全边界:系统只读接入,AI仅提供风险提示和决策证据,不修改DCS定值,不替代联锁、保护、运行规程和人员判断,不直接控制任何设备。
证据口径:本文将“文献或规范要求”“项目拟定验收目标”“投运后实测结果”严格区分。文中所有准确率、提前量和收益均为拟定目标或计算方法,不宣称已经取得。
1. 一页执行摘要
1.1 要解决的核心问题
制粉系统承担原煤磨制、干燥、分离和输送任务,是锅炉燃料供应链的关键环节。磨煤机具有强耦合、非线性、明显时滞和工况依赖特征,堵磨、断煤、磨损、积粉、自燃等故障早期征兆相互交叠;煤种、全水分、负荷、磨组组合和启停切换又会造成大量“像故障的正常波动”。传统DCS固定阈值擅长末端越限和保护,但不擅长提前识别缓慢偏离、解释多参数故障链和区分相似根因。
国家能源局《防止电力生产事故的二十五项重点要求(2023版)》明确要求制粉系统配置足够的温度、压力、流量测点和完备联锁保护,并要求磨煤机出口温度测点定期校验;同时强调制粉系统与煤种特性匹配、减少积粉死角、配置消防或充惰系统等防爆措施。国家能源局《防止电力生产事故的二十五项重点要求(2023版)》
1.2 方案答案
建设“煤盾”制粉系统故障链AI预警系统,在不改变任何保护与控制逻辑的前提下,形成:
工况识别 → 测点可信度筛查 → 动态正常基线 → 多参数残差 → 堵磨/断煤/自燃风险指数 → 故障因果链与根因排名 → 分级提示 → 规程检索 → 人工确认 → 工单与检修闭环
系统的三项核心能力是:
- 看得早:对尚未越过DCS固定阈值、但已持续偏离同工况正常基线的异常进行预警。
- 分得清:联合给煤量、一次风量、差压、出口温度、电流、阀位、CO(如有)和煤质信息,区分堵磨、断煤、自燃风险、磨损退化、切磨瞬态和测点异常。
- 说得明:输出风险指数、根因排名、证据曲线、故障传播链和经电厂审核的规程条款,不用一个不可解释的“故障概率”替代专业判断。
1.3 可落地性与预期效果
- 数据可得:首期主要使用DCS/SIS已有秒级或分钟级数据,新增硬件不是上线前提;CO、煤粉细度、煤质在线信息不足时,系统降级运行并降低结论置信度。
- 模型可验:已有同行评审研究证明,可基于磨煤机实际运行参数建立正常状态估计和变工况预警;但论文结果不直接等于本项目效果。例如,针对某660MW机组的研究使用工况聚类、多元状态估计与滑动阈值,文献报告正常状态预测MAPE低于2%,这只证明技术路线可行,不能作为本项目已实现指标。《基于FCM与多元状态估计融合的磨煤机故障预警研究》
- 项目拟定目标:经现场历史样本确认后,以“事件召回率≥90%、事件精确率≥80%、中位有效提前量≥10分钟、误报≤1次/磨·日”为首轮试点目标;最终阈值须以历史回放和至少3个月影子运行结果共同冻结。
- 价值可计算:以减少堵磨/断煤造成的降负荷时间、减少故障性检修、降低误报警处置工时和优化磨组轮换为价值来源,不虚构金额。
1.4 与另外两套方案的协同
- 接收“慧测”系统输出的测点可信度,低可信测点降权而非自动替换原值。
- 向“四管哨兵”提供煤量、风量、磨组切换和燃烧侧异常背景,帮助其区分受热面真实异常与燃烧扰动。
- 三套方案共享数据接入、工况标签、知识库、用户权限、审计和历史回放底座,但“煤盾”可独立部署、独立验收、独立参赛。
2. 场景和设备系统描述
2.1 目标对象
本方案以660MW超临界燃煤机组常见的直吹式中速磨煤机为设计对象。原煤经原煤仓、给煤机进入磨煤机,在磨辊/磨盘作用下粉磨;热、冷一次风承担干燥和输送,经分离器分选后的合格煤粉送往燃烧器。具体磨型、磨煤机台数、磨组运行方式和测点命名在项目启动时按目标电厂P&ID、控制逻辑图及设备台账映射,不在竞赛阶段凭空假定。
同行评审综述指出,磨煤机同时完成粉磨、干燥和输送,其性能直接影响机组可靠性、燃烧质量和负荷响应;磨内煤粉流量与库存等关键状态又难以直接测量,造成控制和诊断困难。Agrawal等:Review of control and fault diagnosis methods applied to coal mills
2.2 业务范围
纳入首期:
- 原煤仓出口至磨煤机出口煤粉管道前的运行监测。
- 堵磨、断煤、磨辊/磨盘磨损、积粉与自燃风险的识别。
- 磨煤机、给煤机、一次风相关测点的可信度提示。
- 运行风险提示、证据展示、规程检索和检修闭环。
暂不纳入首期:
- 煤粉浓度、粒径的高成本新增在线仪表闭环控制。
- 任何保护定值修改、联锁旁路或自动启停磨。
- 对“爆炸发生概率”的直接数值预测。爆燃是低频高后果事件,标签极少且受安全系统影响,本方案只识别其上游危险状态并提示按规程处置。
2.3 为什么聚焦制粉系统
国家能源局曾专门要求燃煤电厂加强输煤及制粉系统监测报警、安全防护、灭火设施和应急预案建设,并鼓励探索新技术、新设备治理机械伤害、粉尘爆燃等隐患。国家能源局综合司关于加强燃煤电厂输煤及制粉系统安全生产工作的通知
同时,深度调峰增加了低负荷、频繁变负荷和磨组切换场景。国家能源局要求企业关注升降负荷速率对安全运行的影响,完善配煤掺烧、控制策略和应急预案。国能发安全〔2024〕58号
3. 当前业务流程与岗位分工
3.1 典型现状流程
以下是行业常见流程假设,必须通过值长、锅炉主值、巡检、热控、检修和燃料岗位访谈确认后固化:
- 运行人员依靠DCS固定高/低限报警、趋势曲线和画面颜色发现异常。
- 主值查看给煤量、一次风量、磨差压、出口温度、电流及阀位,结合当前负荷和煤质经验判断。
- 巡检人员现场听音、测温、检查排渣、漏粉、异味或异常振动。
- 值长依据运行规程组织风险控制;涉及停运、切换或降负荷时执行现有操作票和审批流程。
- 热控排查测点和采集通道;锅炉检修检查磨辊、衬板、分离器、风门及密封。
- 处置记录分散在运行日志、缺陷单和检修工单中,复盘结果较少回写到报警规则。
3.2 岗位断点
| 断点 | 现场表现 | 业务后果 | AI切入点 |
|---|---|---|---|
| 告警偏末端 | 多在参数越限后出现 | 处置窗口短 | 正常行为模型识别阈值内偏离 |
| 多参数割裂 | 单点报警无法描述传播链 | 根因判断慢 | 时序残差和因果规则联合 |
| 工况影响大 | 切磨、升降负荷常触发报警 | 误报与报警疲劳 | 分煤种、分负荷、分状态动态基线 |
| 经验依赖强 | 同一现象不同班组判断不一 | 处置一致性不足 | 证据链、根因排名、规程定位 |
| 数据与检修脱节 | 工单结果未回流模型 | 重复故障难复用 | 事件—工单—部件闭环 |
| 安全建议易越界 | 单纯算法可能给出激进动作 | 可能扩大事故 | 规则白名单、强制规程引用、人工确认 |
3.3 现状与优化后业务流程图
flowchart LR
subgraph A["现状:报警后人工拼图"]
A1["DCS固定阈值报警"] --> A2["主值翻查多条曲线"]
A2 --> A3["电话联系巡检"]
A3 --> A4["依经验判断根因"]
A4 --> A5["按规程处置"]
A5 --> A6["日志/缺陷单分散留存"]
end
subgraph B["优化:风险前移但保留人工决策"]
B1["只读接入DCS/SIS与煤质"] --> B2["工况识别+测点可信度"]
B2 --> B3["动态基线+故障链推理"]
B3 --> B4["风险分级、根因排名、证据曲线"]
B4 --> B5["值长/主值确认"]
B5 --> B6["调用已审核规程并执行原有流程"]
B6 --> B7["工单结果回写、模型复盘"]
end
变化本质:AI不替代岗位职责,而是把“找曲线、比工况、查案例”的认知劳动提前并标准化,最终操作权仍在运行人员和既有生产制度。
4. 故障演化链和深层业务痛点
4.1 六类风险不是六个孤立标签
(1)断煤
可能起点包括原煤仓棚煤/堵塞、给煤机异常、落煤管堵塞或信号异常。断煤后实际入磨煤量下降,干燥负荷改变,出口温度、风门和压力参数会出现联动。机理建模研究展示了断煤、堵磨、自燃三类故障可通过边界条件和模型参数变化进行模拟,并指出故障样本稀缺会限制纯数据驱动诊断。Hu等:Modeling of Coal Mill System Used for Fault Simulation
痛点:给煤机指令/反馈、实际煤流与磨内库存并不总是等价;仅看给煤量低可能把切磨过程、负荷指令变化或给煤测量异常当成断煤。
(2)堵磨
可能由煤湿、给煤量与研磨/通风能力不匹配、一次风量不足、磨损导致研磨能力下降或排渣异常等诱发。典型传播为磨内库存和流动阻力增加,继而引起差压、进出口压力、一次风量、出口温度、电流等多参数偏离,但不同磨型、控制策略和堵塞位置的征兆方向可能不同。
痛点:固定差压高限只能识别较晚阶段;若模型把“差压必升、电流必升”写成绝对规则,遇到测点位置、控制回路补偿或局部堵塞就会误判。因此本方案采用“同工况预测残差+方向性软规则”,不把单一征兆硬编码成结论。
(3)磨损
磨辊、磨盘、衬板和分离器磨损会使单位给煤量对应的电流、差压、出口温度、风量和煤粉细度关系缓慢改变。磨损通常是周/月级退化,不应与分钟级堵磨共用同一报警逻辑。
痛点:日常运行参数受煤质和负荷影响大,检修常按周期或出现性能问题后安排;若缺少同煤种、同负荷对比,很难从正常波动中提取慢性退化。
(4)积粉
结构死角、水平段、密封不严或输送能力不足会形成积粉。积粉本身可能不立即触发DCS报警,但会增加自热、自燃及后续异常工况下扬尘的风险。国家能源局重点要求减少制粉和送粉系统死角、保持严密光滑并避免局部积粉,说明“积粉风险”应作为防爆链条的前置状态,而非等到温度越限后才处理。《防止电力生产事故的二十五项重点要求(2023版)》
(5)自燃风险
煤粉高温、滞留时间、煤种挥发分/着火特性、氧量及积粉共同影响自燃风险。可用出口温度异常、温升速率、CO(有可靠测点时)、停磨后温度衰减异常等作为证据,但任何单一信号都不足以独立确认自燃。
痛点:将“出口温度高”直接等同自燃,会把断煤后的干燥负荷变化或测点跳变误判为火情;反之,过度相信模型也可能漏掉真实危险。因此需要硬保护优先、测点可信度筛查和多证据一致性。
(6)爆燃/爆炸危险状态
爆燃需要可燃煤粉云、氧化剂、点火源和一定空间条件共同存在。AI不预测“何时爆炸”,只对积粉、自热、温升、CO异常(如有)、通风/隔离状态异常等上游危险组合发出高等级提示,并直接调取经审批的反事故措施。国家现行标准GB 26164.1-2010明确覆盖锅炉和煤粉制造设备运行维护,作为现场作业的安全制度底线。国家标准信息公共服务平台:GB 26164.1-2010
4.2 工况因素如何制造“假故障”或放大真风险
| 工况因素 | 对模型的影响 | 设计响应 |
|---|---|---|
| 煤种变化 | 可磨性、挥发分、灰分、低位发热量改变正常参数关系 | 以煤质批次/配煤比例为上下文;未知煤种降置信度 |
| 全水分升高 | 干燥负荷增大、出口温度和风量关系变化,易蓬煤堵煤 | 湿煤工况独立建模;纳入雨季/煤场来源标签 |
| 深度调峰 | 单磨低出力、风煤比和控制裕量改变 | 按负荷区间、升降负荷速率和稳/变工况分层 |
| 磨组切换 | 短时阀位、风量、压力和温度剧烈变化 | 设启停/切磨抑制窗,仅保留硬规则与安全提示 |
| 设备检修后 | 部件间隙和控制特性发生阶跃变化 | 建立“模型再基线”流程,不沿用旧阈值 |
| 测点异常 | 单点跳变、卡死会制造假故障链 | 接入测点可信度并显示证据完整性 |
4.3 故障演化与AI判断流程图
flowchart TD
X["外部诱因:煤湿/煤质变化/低负荷/切磨/部件磨损"] --> C{"工况是否已知且稳定?"}
C -- "否" --> T["瞬态模式:抑制普通预警,仅保留硬安全规则"]
C -- "是" --> Q{"关键测点可信?"}
Q -- "否" --> M["提示测点异常/结论降级,要求人工核验"]
Q -- "是" --> R["计算同工况正常值与多参数残差"]
R --> D{"证据组合"}
D --> D1["给煤下降 + 干燥/风压联动\n→ 断煤风险"]
D --> D2["库存/阻力代理量上升 + 风量/温度/压力联动\n→ 堵磨风险"]
D --> D3["长期效率残差恶化\n→ 磨损风险"]
D --> D4["积粉条件 + 温升/CO等多证据\n→ 自燃危险状态"]
D1 --> P["因果图校验、根因排名、风险分级"]
D2 --> P
D3 --> P
D4 --> P
P --> H["值长/主值确认并按经审核规程处置"]
4.4 最深层的业务矛盾
制粉诊断不是“用一个更复杂的算法替换阈值”,而是同时解决三种时间尺度:
- 秒—分钟:跳变、断煤、快速堵塞与危险温升,需要低延迟和保护优先。
- 十分钟—小时:缓慢堵磨、积粉、自热,需要持续性判断和多证据合并。
- 周—月:磨损和性能退化,需要同工况趋势、检修反馈和健康排名。
单一分类模型若把三种尺度混在一个标签中,既难解释,也难设置统一验收标准。本方案因此采用“快风险指数+慢健康指数”双通道。
5. 项目目标、边界与适用条件
5.1 项目目标
- 提前发现堵磨、断煤和自燃上游危险状态。
- 区分设备异常、工况瞬态和测点异常,降低报警疲劳。
- 将多参数异常转换为可审计的故障链和根因排名。
- 将经电厂审批的运行规程、反措和历史案例送到告警现场。
- 建立磨煤机健康排名,为轮换运行与检修计划提供依据。
- 通过历史回放和影子运行形成可复核的技术、经济评价。
5.2 安全与业务边界
- AI提示不得覆盖、屏蔽或延迟DCS/SIS报警、MFT、联锁及保护动作。
- 不给出脱离本厂规程的具体操作指令;界面显示“规程条款+适用前提+审批版本”。
- 当AI与硬报警冲突时,以硬报警和运行规程为准,AI自动标记为待复盘事件。
- 低置信度、关键测点缺失、未知煤种和切磨瞬态时,只提示观察/核验,不输出确定性根因。
- 系统不自动生成操作票,不直接执行开关风门、停磨、惰化、切磨或降负荷。
5.3 适用前提
- DCS/SIS时间戳可对齐,关键变量具有至少1年的可用历史,最好覆盖不同季节、煤种和负荷。
- 能取得经过脱敏的运行日志、缺陷单、检修工单及关键事件时间。
- 电厂指定运行、锅炉、热控、检修和安全专业共同审核标签与处置知识。
- 对缺少CO、煤质在线值或煤粉细度数据的电厂,可上线基础版,但自燃和磨损诊断置信度须显式降低。
6. 数据清单、标签来源和预警知识库设计
6.1 数据清单
| 数据域 | 典型字段 | 推荐粒度 | 用途 | 缺失时处理 |
|---|---|---|---|---|
| 机组工况 | 机组负荷、负荷指令、升降负荷速率、主汽参数 | 1–5秒原始,10秒/1分钟特征 | 工况分层 | 无负荷速率则由负荷差分计算 |
| 给煤系统 | 给煤指令、给煤反馈、给煤机转速/电流、原煤仓料位 | 1–5秒 | 断煤与供煤异常 | 料位缺失不阻塞基础版 |
| 一次风系统 | 热/冷风门、入口一次风量/温度/压力、出口压力 | 1–5秒 | 输送与干燥能力 | 单测点缺失由冗余/模型降级 |
| 磨煤机 | 差压、出口温度(多点)、电流/功率、振动、液压加载、排渣 | 1–5秒 | 堵磨、磨损、自燃证据 | 关键测点缺失则降置信度 |
| 环保/安全 | CO、O₂、消防/充惰系统可用状态(仅状态读取) | 1–10秒 | 自燃危险组合 | CO缺失时不得输出高确定性自燃结论 |
| 煤质 | 煤源、配煤比例、全水分、灰分、挥发分、发热量、可磨性指数 | 批次/班/日 | 工况上下文与风险先验 | 用最近批次并标记时效 |
| 运维事件 | 报警、操作、巡检、缺陷、工单、换件、检修报告 | 事件级 | 标签和闭环 | 人工对齐事件窗口 |
| 规程案例 | 运行规程、反事故措施、事故预案、历史案例 | 文档级 | 检索与解释 | 未审核材料不得上线 |
6.2 数据质量规则
- 统一时区、采样周期、设备编码和测点工程单位。
- 对卡死、越界、跳变、丢包、校验期间数据分别打标,不简单插值后冒充真实值。
- 切磨、启停、检修后试运和传感器校验期间建立事件遮罩。
- 同一故障事件的前后窗口不得拆入训练集和测试集,防止时间泄漏。
- 煤质批次必须标注生效时间和时效;无法精确对应到磨时,降为“班/日级上下文”,不得声称分钟级精准。
6.3 标签来源与可信等级
| 等级 | 标签证据 | 用法 |
|---|---|---|
| A级 | 检修解体、明确部件更换、消防/事故调查结论 | 监督学习与最终验收 |
| B级 | 值长日志+多参数曲线+专业人员复核一致 | 训练/验证,单独报告不确定性 |
| C级 | 单一报警或未经复核的操作记录 | 弱标签、案例检索,不作为金标准 |
| D级 | 机理仿真或人工注入故障 | 稳健性测试,不与真实事件混算 |
文献已指出制粉系统故障样本稀缺且类别不平衡,因此采用机理仿真补足边界测试具有合理性,但仿真样本不能替代真实故障验收。Hu等,2020
6.4 预警知识库
知识库采用“结构化事件图谱+受控文档检索”两部分:
- 实体:机组、磨煤机、给煤机、测点、部件、煤种、故障模式、征兆、操作、工单、规程条款。
- 关系:属于、前置于、支持、反驳、适用于、处置后、检修确认、版本替代。
- 文档:本厂运行规程、反事故措施、设备说明书、审批后的应急预案、历史案例复盘。
- 版本控制:每条建议显示来源、版本、生效日期、适用磨型和审核人。
- 大模型边界:只负责检索摘要和自然语言解释;风险等级由时序模型和确定性规则生成。无来源时必须回答“知识库暂无依据”,不得自由编造操作步骤。
7. 总体系统架构与数据流
7.1 五层系统架构图
flowchart TB
L1["第1层 数据源层\nDCS/SIS、煤质、报警日志、巡检、工单、规程案例"]
L2["第2层 数据治理层\n只读网闸/接口、时钟对齐、单位统一、质量码、事件遮罩、测点可信度"]
L3["第3层 AI与规则层\n工况识别、正常行为模型、变化点检测、风险指数、因果图、健康评分"]
L4["第4层 业务服务层\n告警编排、根因排名、证据链、知识检索、历史回放、模型监控"]
L5["第5层 应用与闭环层\n运行驾驶舱、值长确认、巡检核验、缺陷工单、检修反馈、审计报表"]
L1 --> L2 --> L3 --> L4 --> L5
L5 -. "人工审核后的标签反馈" .-> L3
L5 -. "工单与换件结果" .-> L2
7.2 数据流与部署
- 生产侧通过既有安全隔离方式向分析区提供只读数据副本。
- 流处理服务对齐时间、生成质量标记和工况特征。
- 在线推理以10秒或1分钟窗口运行;具体周期由数据质量与现场响应需求确定。
- 事件引擎将短时尖峰合并为可处置事件,避免每个采样点单独报警。
- 告警页面显示原始值、预测值、残差、关键证据和规程出处。
- 人员确认、处置结果与检修结论写入分析区闭环库,不反写DCS控制系统。
7.3 网络与权限
- 最小权限、分角色访问;运行、检修、热控和管理员权限分离。
- 模型版本、阈值、知识条款、用户确认和导出均留审计记录。
- 模型更新采用离线训练、审批、灰度发布和可回滚机制。
- 上线失败时退化为原DCS/SIS监视,不影响机组控制。
8. AI模型、输入输出、选择理由及基线方法
8.1 总体策略:机理约束的多模型组合
单一端到端深度网络难以同时处理少样本、变工况和安全解释。本方案采用四级组合:
- 工况识别模型。
- 正常行为模型(预测“此工况下应该是多少”)。
- 风险指数与变化点检测。
- 故障因果图和根因排名。
8.2 工况识别
输入:机组负荷、负荷变化率、磨组组合、给煤量、一次风量、煤质批次、磨启停状态。
方法:明确状态由规则标注(启停、切磨);稳态运行再用FCM或高斯混合聚类形成软工况。软聚类允许一个点同时部分属于相邻负荷区,减少硬分箱边界跳变。
输出:工况ID、隶属度、是否瞬态、当前煤质时效。
选择理由:660MW机组相关同行评审研究已使用FCM、正常状态记忆矩阵和滑动阈值处理深调峰、配煤掺烧下的复杂工况,说明该路线具有工程可行性;文献报告值仅作可行性旁证。王天钰、李学峰,2025
8.3 正常行为模型
按变量特性选择两类模型:
- MSET/相似状态估计:适合从历史正常样本库寻找相似工况,输出易解释,首期作为主模型。
- LightGBM:用于非线性关系明显且需要特征贡献解释的目标变量,输出SHAP贡献。
- TCN/Autoformer候选:仅在MSET/LightGBM无法覆盖长时滞且有足够数据时试验,不作为首期必须项。
对每个目标参数 (y_j) 计算预测值 (\hat y_j) 和标准化残差:
[ r_j(t)=\frac{y_j(t)-\hat y_j(t)}{\sigma_{j,c}+\epsilon} ]
其中 (\sigma_{j,c}) 为工况 (c) 下正常残差尺度。模型输出的不是“真值替代”,而是同工况参照值。
8.4 三类快速风险指数
堵磨风险指数 (R_{block})
证据包括:
- 磨差压、进出口压力、一次风量相对预测值的联合偏离。
- 电流/功率与给煤量关系异常。
- 出口温度与热/冷风门响应异常。
- 变化持续时间、变化方向和磨内库存代理量。
- 湿煤、磨损和低负荷等先验条件。
断煤风险指数 (R_{break})
证据包括:
- 给煤指令—反馈不一致或实际反馈快速下降。
- 出口温度、风门、压力、电流的联动残差。
- 原煤仓料位/疏松装置状态(如有)。
- 当前是否处于正常停磨、切磨或降负荷指令。
自燃危险指数 (R_{fire})
证据包括:
- 出口温度相对预测值持续偏高及温升速率。
- 多点温度一致性与测点可信度。
- CO异常(有可靠测点时)、氧量、停磨后衰减特征。
- 煤种挥发分/着火特性、积粉风险及消防/充惰系统可用状态。
风险指数统一映射至0–100,但明确标注为排序与分级分数,不是经统计校准的事故概率:
[ R_k=100\times \sigma\left(\sum_j w_{kj}g(r_j,\Delta r_j,d_j)+b_k\right) ]
其中 (d_j) 表示异常持续性,权重由历史事件拟合、机理方向约束和专家复核共同确定。只有完成可靠性校准后,才可另行显示概率。
8.5 慢性磨损健康指数
以周为窗口,在同煤种、同负荷、同出力条件下计算:
- 单位给煤量电耗趋势。
- 风量—差压—给煤量关系漂移。
- 出口温度控制裕量。
- 振动、排渣和液压加载长期变化。
- 检修后性能恢复程度。
健康分数 (H_m) 用于同型号磨煤机横向排名和单机纵向趋势,不直接判定必须检修。模型遇到新煤种或重大检修后重置参照期。
8.6 因果图与根因排名
将“原煤仓棚煤→入磨煤量下降→磨内干燥负荷变化→出口温度/风门联动”等机制编码为有向图。根因分数综合:
[ Score(cause)=Prior(cause|context)\times EvidenceConsistency\times SensorConfidence\times TemporalOrder ]
- Prior:煤质、季节、负荷和历史缺陷构成先验。
- EvidenceConsistency:支持证据与反证据的匹配程度。
- SensorConfidence:关键测点可信度。
- TemporalOrder:征兆先后是否符合因果链。
界面最多显示前三个根因及支持/反驳证据,避免给出虚假确定性。
8.7 基线方法与模型淘汰规则
必须与以下基线同场比较:
- 原DCS固定阈值。
- 单变量EWMA/CUSUM。
- 分负荷线性回归或随机森林。
- 本方案多工况正常行为模型+因果规则。
若复杂模型在跨时间测试、跨煤种测试或误报率上不优于简单基线,则不因“AI名称更高级”而上线。行业综述已将制粉故障诊断分为定量、信号、定性和过程历史等路径,本方案采用组合而非押注单一路径。樊帅、肖军:《锅炉制粉系统故障诊断方法》
9. 实时预警、根因分析、处置和检修闭环
9.1 告警事件卡
每张事件卡必须包含:
- 设备、开始时间、持续时间、当前工况和煤质时效。
- 堵磨/断煤/自燃三项风险指数及置信等级。
- 根因Top 3、支持证据、反证据和关键测点可信度。
- 实际值—AI正常值—原DCS阈值三线对比。
- 是否处于启停/切磨抑制窗。
- 对应本厂规程条款、版本和适用前提。
- “确认异常、误报、工况变化、测点问题、待观察”人工反馈入口。
9.2 风险分级
| 等级 | 触发逻辑(概念) | 系统行为 | 人员动作边界 |
|---|---|---|---|
| 蓝色关注 | 单一弱证据或模型漂移 | 记录趋势,不弹窗打扰 | 无操作建议 |
| 黄色预警 | 多证据持续偏离,置信度中等 | 提醒主值核验,显示证据 | 按本厂巡检/核验规程 |
| 橙色风险 | 故障链一致、趋势恶化或关键危险组合 | 值长确认,调用对应事故预案 | 仅展示已审批规程,不自动控制 |
| 红色紧急 | 已有DCS硬报警/保护条件或经批准规则触发 | AI界面突出显示并停止自由生成建议 | 完全服从DCS保护、运行规程和值长指挥 |
具体阈值不在竞赛稿中杜撰,须由历史回放、影子运行和安全专业审批确定。
9.3 错误处置安全约束
这是“煤盾”的关键防线:
- 硬保护优先:任何AI结果不能否定温度、压力、流量联锁和保护。
- 动作白名单:系统只能展示经本厂审核的规程内容;无法匹配适用条件时只提示联系值长。
- 危险组合禁建议:存在自燃/爆燃危险证据时,系统不生成可能造成煤粉扬起、引入空气或改变隔离状态的自由文本动作。
- 双人确认:橙色及以上建议的阅读与确认纳入值长/主值双角色审计,但不改变原生产审批制度。
- 上下文校验:建议必须校验磨运行/停运状态、消防/充惰可用状态、煤种和保护状态;上下文缺失则隐藏操作性文本。
- 冲突升级:AI判断“测点异常”但DCS硬报警存在时,不允许降级风险,必须按真实故障优先处理。
9.4 检修闭环与健康排名
- 日榜:按当前风险、测点可信度和未关闭缺陷排序。
- 周榜:同磨型比较健康分、单位给煤电耗和异常次数。
- 月榜:结合磨损趋势、检修窗口和备件状态给出“检查优先级”,不自动生成检修结论。
- 工单关闭时回写:确认根因、部件、照片/报告、换件、检修前后性能。
- 模型复盘:预警是否有效、提前多久、是否误报、是否存在标签偏差。
10. 数据缺失、坏点、变工况、模型失效等降级策略
| 失效场景 | 检测方式 | 降级策略 | 明示给用户 |
|---|---|---|---|
| 关键测点缺失 | 数据延迟/空值监控 | 关闭依赖该点的证据,使用剩余模型 | “关键证据缺失,结论低置信” |
| 测点跳变或卡死 | 变化率、平直线、冗余比较 | 降低该点权重,不用AI值替代保护值 | “疑似测点异常” |
| 未知煤种/煤质过期 | 批次时效检查、分布外检测 | 使用宽阈值通用模型 | “煤质上下文未知” |
| 启停/切磨瞬态 | 状态机识别 | 暂停普通风险指数,保留硬安全规则 | “瞬态抑制中” |
| 数据分布漂移 | PSI/残差分布/校准误差 | 停止自动分级,转人工观察 | “模型待复核” |
| 模型服务故障 | 心跳、自检、延迟监控 | 界面退回原始DCS/SIS趋势只读展示 | “AI服务不可用,不影响DCS” |
| 知识库无匹配 | 检索置信阈值 | 不生成处置文本 | “请查阅本厂规程/联系值长” |
| 模型与硬报警冲突 | 规则一致性检查 | 硬报警优先并创建复盘事件 | “以保护和规程为准” |
回声状态网络等时序模型已被用于磨煤机故障预警研究,说明利用时间依赖关系具有技术基础;本项目仍要求先通过简单基线和跨工况测试,不能由单篇论文替代现场验证。《基于回声状态网络的磨煤机故障预警》
11. 离线回放、影子运行和现场试点实施计划
11.1 实施阶段与里程碑
| 阶段 | 周期建议 | 主要工作 | 里程碑/退出条件 |
|---|---|---|---|
| 0. 场景确认 | 2周 | P&ID、控制逻辑、岗位访谈、数据盘点、安全边界 | 场景说明书与测点字典审批 |
| 1. 数据治理 | 4周 | 时间对齐、质量规则、煤质映射、事件清洗 | 关键测点可用率报告;标签分级表 |
| 2. 模型开发 | 6周 | 工况识别、正常模型、风险指数、因果图、基线比较 | 历史留出集达到试运行门槛 |
| 3. 历史回放 | 3周 | 按事件盲测、专家复核、阈值调整 | 回放报告;误报来源清单 |
| 4. 影子运行 | ≥12周 | 实时只读运行,不推送操作性建议 | 覆盖主要煤种、负荷与切磨场景 |
| 5. 单磨试点 | 4–8周 | 告警送达、知识检索、反馈闭环 | 运行/检修/安全三方验收 |
| 6. 扩围运行 | 持续 | 多磨复制、月度漂移监控、季度复盘 | 形成全厂健康排名与年度价值核算 |
11.2 历史回放演示脚本模板
说明:这是PPT动态演示模板。必须用电厂提供并脱敏的真实事件替换方括号;若暂无真实案例,可明确标注“仿真演示”,不得伪装成生产结果。
演示标题:一次[堵磨/断煤/自燃危险状态]事件,AI能否比固定阈值更早且更清楚地提示?
- 0–10秒:建立背景
展示[日期]、[磨号]、[机组负荷]、[煤种/全水分]和[磨组组合];右上角明确“历史回放,不连接控制”。 - 10–25秒:正常阶段
实际曲线与AI正常值基本重合,三项风险指数处于低位。 - 25–45秒:早期偏离
在时间点 (T_{AI}),[差压/风量/出口温度/电流]的联合残差持续增加;固定阈值尚未动作。 - 45–60秒:证据链
动画点亮“[诱因]→[中间状态]→[可观测征兆]”,显示Top 3根因和一条反证据。 - 60–75秒:传统报警与结果
时间点 (T_{DCS}) 出现原报警;时间点 (T_{confirm}) 由[工单/检修/日志]确认。展示真实提前量 (T_{DCS}-T_{AI}),若AI晚于DCS也如实报告。 - 75–90秒:安全闭环
展示系统只调用[规程名称、版本、条款],由人员确认;工单结论回写模型。
演示必须同时展示:
- 事件真值来源和标签等级。
- 预测区间和原DCS阈值。
- 被抑制的切磨瞬态,证明系统不是“见波动就报”。
- 若关键证据缺失,明确显示低置信而非补造数据。
12. 技术指标及验收方法
12.1 拟定指标表
以下均为项目验收目标建议值,不是已实现结果;须在阶段0根据样本量、故障频率和电厂容忍度冻结。
| 维度 | 指标 | 拟定目标 | 验收口径 |
|---|---|---|---|
| 事件识别 | 堵磨/断煤事件召回率 | ≥90% | A/B级真实事件,按事件而非采样点 |
| 事件识别 | 事件精确率 | ≥80% | 人工复核确认事件/AI事件 |
| 误报控制 | 误报频率 | ≤1次/磨·日 | 排除经定义的测试和检修时段 |
| 提前量 | 中位有效提前量 | ≥10分钟 | 相对原DCS首次相关报警或人工首次记录,二者口径预先冻结 |
| 诊断 | 根因Top-3命中率 | ≥85% | 仅用A/B级且根因可确认事件 |
| 瞬态控制 | 切磨/启停误报抑制率 | ≥90% | 预定义瞬态事件集 |
| 正常模型 | 关键变量误差 | 优于固定均值和分负荷回归 | MAE/RMSE按工况报告,不机械照搬论文MAPE |
| 自燃风险 | 高等级风险漏报 | 试点期0起 | 只统计有可靠真值的危险事件;样本过少则报告事实,不虚构比例 |
| 磨损健康 | 排名与检修结论一致性 | Spearman ≥0.6(建议) | 同型号磨、同一检修周期 |
| 系统工程 | 在线数据可用率 | ≥99% | 不含计划停机;同时报告关键测点缺失率 |
| 系统工程 | 推理延迟 | ≤采样周期 | 从数据到达至事件引擎完成 |
| 安全 | 对DCS控制写入次数 | 必须为0 | 网络、接口和审计联合验证 |
12.2 验证设计
- 时间留出:按时间先后划分训练、验证和测试,测试集必须晚于训练集。
- 事件隔离:同一故障前后窗口只能进入一个集合。
- 煤种外推:单独报告已见煤种与新煤种表现。
- 工况分层:稳态、升负荷、降负荷、低负荷、切磨分别报告。
- 基线对比:与原阈值、EWMA/CUSUM、简单回归同表比较。
- 盲评:隐藏模型结论,由运行/检修专家先独立标注,再揭盲比较。
- 影子运行:至少12周,只读、不影响操作;周度审查误报和漏报。
- 安全测试:断网、数据延迟、模型宕机、知识库无匹配、冲突报警和权限越界演练。
12.3 防止指标“好看但无用”
- 不用逐采样点准确率作为主指标,因为正常点占绝大多数,会造成虚高。
- 不把仿真注入样本与真实故障合并报告。
- 不只报告平均提前量,同时给出中位数、四分位数和最差案例。
- 不在测试集上反复调阈值。
- 所有未检出的事件与高风险误报必须进入失败案例复盘。
13. 安全、经济和管理价值量化公式
13.1 安全价值
安全价值不折算为“人身事故金额”,采用过程指标:
- 高风险事件提前识别数。
- 从异常出现到人员确认的时间缩短。
- 错误处置建议拦截数。
- 规程引用完整率、处置闭环率。
- 关键安全测点缺陷提前发现数。
13.2 经济价值
[ 年度净收益 = V_{避免降负荷} +V_{减少故障检修} +V_{节电与效率} +V_{减少人工分析} -C_{建设运维} ]
其中:
[ V_{避免降负荷}=\sum_i 减少事件次数_i\times 平均少损失电量_i\times 单位电量边际收益 ]
[ V_{减少故障检修}= 减少的故障性检修工时\times综合工时成本 +减少的备件与外委费用 ]
[ V_{节电与效率}= 磨煤机节电量\times厂用电价值 +因煤粉质量改善带来的经验证燃料收益 ]
13.3 需要电厂补充的参数
- 近3年堵磨、断煤、磨损检修和自燃危险事件数量。
- 每次事件的降负荷幅度、持续时间和替代磨组影响。
- 上网边际收益或内部统一价值口径。
- 磨煤机、一次风机能耗和检修备件成本。
- 运行、巡检、热控、检修投入工时。
- AI平台建设、接口、服务器、模型运维和培训成本。
13.4 管理价值
- 将个人经验沉淀为可版本化、可追溯的故障知识。
- 统一班组的证据查看顺序和风险语言。
- 让运行、检修、热控围绕同一事件ID协同。
- 用健康排名支持状态检修,但不替代检修专业决策。
14. 方案创新点及与普通阈值报警的差异
| 维度 | 普通固定阈值 | “煤盾”方案 | 为什么需要 | 如何验证 |
|---|---|---|---|---|
| 工况适应 | 同一上下限 | 分煤种、分负荷、分磨组组合的动态基线 | 调峰和配煤使正常范围变化 | 分工况误报率与阈值基线对比 |
| 故障对象 | 单点越限 | 堵磨—断煤—磨损—积粉—自燃危险链 | 相似征兆需要联合研判 | A/B级事件Top-3根因命中率 |
| 时间尺度 | 多为末端瞬时报警 | 快风险指数+慢健康指数 | 堵磨与磨损时间尺度不同 | 分别按分钟事件和月度检修验收 |
| 可解释性 | 显示参数越限 | 实际值/正常值/残差、因果路径、支持与反证 | 值长需要证据,不只要分数 | 专家盲评可用性 |
| 数据可信度 | 默认测点可信 | 接入测点健康度,低可信证据降权 | 坏点会制造假故障 | 注入跳变/卡死测试 |
| 安全约束 | 报警与规程分离 | 规程白名单、危险组合禁建议、冲突硬报警优先 | 防止AI建议扩大事故 | 安全场景演练与审计 |
| 维护闭环 | 报警结束即终止 | 工单根因、换件和检修前后性能回写 | 模型需从真实检修学习 | 闭环率、标签升级率 |
14.1 三个竞赛级亮点
- “误操作防火墙”:算法不仅识别故障,还主动限制自己在危险状态下能说什么。创新落在生产安全,而非模型名称。
- “三指数+一排名”:堵磨、断煤、自燃三项快速风险指数,加磨煤机慢性健康排名,一张图覆盖分钟到月级决策。
- “可反驳证据链”:不仅列支持证据,也列反证据和缺失证据,让评委看到系统会表达不确定性。
14.2 创新并不等于夸大
- 不承诺预测爆炸。
- 不承诺所有故障都能提前。
- 不将论文准确率移植为本项目成果。
- 不将AI虚拟值送入保护或控制。
- 不以大模型生成文本代替故障模型和运行规程。
15. 10–12页、8分钟PPT大纲及逐页时间
共11页、480秒。主线只讲一个故事:“固定阈值看见结果,煤盾沿故障链看见演化,并且知道何时不该给操作建议。”
| 页码 | 时间 | 页面标题 | 核心内容与画面 |
|---|---|---|---|
| 1 | 20秒 | 煤盾:让制粉故障从报警处置走向故障链预控 | 一句话价值、660MW场景、安全边界 |
| 2 | 30秒 | 为什么是制粉系统:低负荷与配煤让老阈值失灵 | 国家能源局要求+现场工况变化,不堆统计 |
| 3 | 45秒 | 一个堵磨为什么要跨岗位“拼图” | 现状流程图、六个岗位断点 |
| 4 | 40秒 | 六种故障其实是一条风险演化链 | 堵磨、断煤、磨损、积粉、自燃、爆燃危险状态图 |
| 5 | 50秒 | 系统架构:只读接入,五层解耦 | 五层架构图;强调不写DCS |
| 6 | 50秒 | AI方法:先识别工况,再看同工况残差 | 工况识别、正常行为模型、变化点检测 |
| 7 | 55秒 | 三指数+一排名,把风险说清楚 | 三个风险指数、根因Top 3、健康排名 |
| 8 | 90秒 | 90秒历史回放:比原报警早在哪里 | 使用第11节脚本,展示真实/仿真标签 |
| 9 | 45秒 | 误操作防火墙:AI越聪明越要有边界 | 硬保护优先、规程白名单、危险组合禁建议 |
| 10 | 35秒 | 如何落地与验收:从回放到12周影子运行 | 里程碑、指标表、基线对比 |
| 11 | 20秒 | 价值总结:少非停、少误报、可复盘 | 三句收束:看得早、分得清、说得明 |
展示设计
- 不在8分钟内讲模型公式;公式放备份页。
- 第8页做唯一动画高潮,所有数字都来自真实回放或明确标“仿真”。
- 第9页主动回答“AI会不会误导运行人员”,把可行性与安全性变成加分项。
- 备份页准备数据字典、混淆矩阵、ROI参数表和12个问答。
16. 专家可能提问及标准答复
Q1:为什么固定阈值不够,还要上AI?
答:固定阈值必须保留,它适合安全保护和明确越限。AI补的是阈值前的多参数缓慢偏离、变工况基线和相似根因区分。验收时两者同场比较;若AI不能在误报可控条件下增加有效提前量,就不进入现场推送。
Q2:故障样本很少,模型怎么训练?
答:主模型只用大量正常数据学习“同工况应有值”,异常以残差识别;少量A/B级真实事件用于阈值和根因校验。机理仿真或故障注入只用于稳健性测试,绝不与真实事件合并冒充效果。相关论文也明确指出故障样本不平衡是磨煤机诊断难点。Hu等,2020
Q3:煤种变化会不会让模型大量误报?
答:煤种、全水分、负荷和磨组组合进入工况上下文;未知煤种触发分布外检测并切到宽阈值通用模型,同时显示低置信。验收报告单独给出已见煤种与新煤种表现,不用平均值掩盖外推失败。
Q4:怎样区分堵磨和断煤?
答:不靠单一差压或给煤量。系统比较给煤指令/反馈、一次风、压力、出口温度、电流及阀位的变化顺序,并用因果图列出支持与反证。输出Top 3根因而非强行给唯一答案,最终由现场核验和工单确认。
Q5:出口温度升高就一定是自燃吗?
答:不是。断煤、风门调节、负荷变化和测点跳变都可能造成温升。只有温度相对同工况预测值持续偏高,并与多点一致性、CO(如有)、煤种、积粉条件等共同支持时,才提高自燃危险指数;关键证据不足时系统明确降置信。
Q6:为什么不让AI自动停磨或调整风门?
答:题目要求的是预警与决策支持,而生产安全要求保护、联锁和运行规程具有最高优先级。首期只读部署能显著降低实施风险,先证明识别价值;任何未来控制优化都应作为独立项目重新进行设计审查、仿真、试验和审批。
Q7:AI给错处置建议怎么办?
答:风险模型不直接生成动作。系统只检索经本厂审核、带版本和适用条件的规程;危险组合下关闭自由文本建议,硬报警与AI冲突时硬报警优先。所有建议阅读和人员确认均留审计。
Q8:如何证明预警真的“提前”?
答:对每个A/B级事件预先定义三时刻:AI首次满足持续性条件 (T_{AI})、原DCS首次相关报警或人工首次记录 (T_{baseline})、检修/工单确认 (T_{confirm})。提前量为 (T_{baseline}-T_{AI}),同时报告中位数、分布和AI晚报案例,不只挑最好案例。
Q9:历史回放很好看,现场会不会失效?
答:因此历史回放后必须做至少12周影子运行,覆盖主要煤种、负荷、季节和切磨场景。模型漂移、误报频率和缺失数据都进入上线门槛;影子运行不达标则不推送给运行人员。
Q10:磨损健康排名能直接决定检修吗?
答:不能。它用于同型号磨煤机横向比较和趋势提示,需要与振动、排渣、煤粉细度、检修历史和专业检查结合。系统输出检查优先级,不输出“必须更换部件”的自动结论。
Q11:没有CO在线测点还能做吗?
答:堵磨和断煤基础功能可以;自燃模块只能基于温度、煤种、停磨衰减和其他间接证据输出较低置信的危险状态,不可包装成完整火情诊断。是否新增CO测点应由现场风险和投入产出评估决定。
Q12:方案最大的创新究竟是什么?
答:不是某个深度模型,而是三件可验证的工程创新:分煤种/分负荷动态基线解决误报;故障因果链解决“异常但不知原因”;误操作防火墙解决AI建议的安全边界。每一点都有历史回放、影子运行或安全演练对应验收。
Q13:如何防止大模型“幻觉”?
答:大模型不参与风险分值和控制,只在受控知识库中检索。回答必须带规程名称、版本、条款和适用磨型;检索不到就明确说无依据。处置文本由运行和安全专业审批后上线。
Q14:与“四管哨兵”和“慧测”是否重复?
答:不重复。“慧测”判断输入数据是否可信;“煤盾”判断制粉设备及故障链;“四管哨兵”判断锅炉受热面风险。“煤盾”把燃料和磨组扰动输出给四管模型,又接收慧测的测点置信度,三者形成数据质量—辅机故障—主设备风险的递进体系。
参考资料与证据等级
以下9项资料均在方案中实际使用;前4项为官方文件或国家标准,第5—9项为同行评审论文/期刊资料。厂商宣传材料未作为关键论据。
- 官方文件:国家能源局《防止电力生产事故的二十五项重点要求(2023版)》。用于制粉系统防爆、测点、积粉、煤种适配和消防/充惰要求。
- 官方文件:国家能源局综合司关于加强燃煤电厂输煤及制粉系统安全生产工作的通知。用于隐患治理、报警设施、粉尘爆燃和应急管理要求。
- 官方文件:国家能源局关于加强煤电机组灵活性改造和深度调峰期间安全管理的通知(国能发安全〔2024〕58号)。用于低负荷、变负荷、配煤掺烧和状态检修背景。
- 国家标准:GB 26164.1-2010《电业安全工作规程 第1部分:热力和机械》标准信息页。用于作业安全底线。
- 同行评审论文:Hu, Y. et al. Modeling of Coal Mill System Used for Fault Simulation. Energies, 2020, 13(7), 1784。用于故障样本稀缺、断煤/堵磨/自燃机理仿真可行性。
- 同行评审综述:Agrawal, V. et al. Review of control and fault diagnosis methods applied to coal mills. Journal of Process Control, 2015, 32:138–153。用于磨煤机强耦合、关键状态难测和诊断方法分类。
- 同行评审论文:王天钰、李学峰:《基于FCM与多元状态估计融合的磨煤机故障预警研究》,《电力科学与工程》。用于660MW机组、复杂工况聚类和正常状态估计的技术可行性。
- 同行评审论文:《基于回声状态网络的磨煤机故障预警》,《发电设备》2021年第35卷第1期。用于时序预警的技术路线旁证。
- 同行评审综述:樊帅、肖军:《锅炉制粉系统故障诊断方法》,《热力发电》2015年第44卷第2期。用于常见征兆参数和多类诊断方法比较。
方案自检清单
- 包含场景描述、业务痛点、AI落地思路、预期效果四大模块。
- 覆盖时序数据、异常日志、历史案例、检修记录和运行规程知识库。
- 包含现状/优化流程图、五层架构图、故障演化/AI判断图。
- 包含量化指标表和实施里程碑表。
- 11页PPT大纲严格合计8分钟。
- 包含14个专家问答。
- 包含可替换真实数据的历史回放演示脚本模板。
- 至少引用6项可靠资料,且官方/标准/同行评审资料超过3项。
- 区分文献结果、项目拟定目标和未来现场实测结果。
- 明确只读接入、零控制写入、保护和规程优先。
- ROI仅提供公式和待补参数,不虚构金额。
- 每个创新点均说明为什么需要、如何实现、如何验证。
慧测——660MW超临界燃煤机组测点可信度与预测性检修AI设计方案
版本:竞赛设计稿 v1.0
建设原则:只读接入、辅助决策、人工确认、可解释、可降级、可验收
适用对象:660MW超临界燃煤机组;首期聚焦温度测点,后续扩展压力、流量和振动测点
结果口径:本文中的模型精度、预警提前量和经济收益均为拟定验收目标或计算方法,不是已经取得的现场成果;最终数值须通过目标电厂历史回放和影子运行确认。
1. 一页执行摘要
1.1 一句话定义
“慧测”不是又一套固定阈值报警,而是一套安装在DCS/SIS历史数据之上的测点可信度评估与预测性检修辅助系统:先判断“数据是否可信”,再支撑设备故障研判。
1.2 现场问题
660MW机组存在数量众多的温度、压力、流量、振动等测点。DCS质量码擅长发现断线、通信中断、越量程等“硬故障”,但测点在刚开始跳变、缓慢漂移、偏置、噪声增大、卡死或响应迟缓时,数值仍可能位于量程内,质量码也可能保持正常。运行人员只能临时对比邻近测点、负荷、油温、振动和设备状态,容易出现两类代价高昂的混淆:
- 把测点故障当成设备过热、泄漏或振动异常,触发无效检查甚至错误处置;
- 把真实设备异常当成“测点不准”,延误事故处置。
同行评审综述指出,传感器常见故障包括漂移、冻结、精度下降和校准误差;工业传感器恶劣环境下的早期故障识别对避免误报警和错误诊断具有现实意义。Li等,传感器故障诊断综述;针对电厂的研究也验证了利用相关过程变量构建“解析冗余/软测量值”,以实测值和估计值的残差开展在线监测的可行性。电厂传感器混合数据驱动诊断研究
1.3 解决方案
系统采用“规则与机理守底线、轻量AI建基线、变化检测抢时效、多源证据辨真假”的技术路线:
- 工况识别:识别启停、稳态、升降负荷、低负荷、设备切换等工况,防止把正常工况变化当故障。
- AI虚拟测点:利用同设备、同过程的可信关联变量,预测目标测点的合理值和置信区间。
- 残差与变化点检测:对实际值与虚拟值的偏差、噪声、变化率、卡死时长和响应滞后进行EWMA/CUSUM检测。
- 真假异常辨识:目标测点孤立异常、物理过程未联动时偏向“测点故障”;多个因果相关测点同步变化、物理平衡同时破坏时偏向“设备真实异常”;证据冲突时明确输出“无法判定”,不强行归类。
- 可信度与健康指数:实时输出测点可信度、故障类型、证据链和推荐权重;对存在渐进征兆的测点输出检修优先级和风险窗口。
- 闭环学习:把现场校验、更换、接线紧固和误报确认结果回写为标签,持续修正模型。
1.4 最重要的安全边界
- 系统只读接入DCS/SIS,不写入DCS,不修改原始质量码、保护定值或联锁逻辑。
- AI重构值不得替代原测量值参与保护、联锁、自动控制或运行规程规定的法定判断。
- 系统输出给其他AI预警模型的仅是“推荐可信权重和原因码”;下游模型必须保留自己的缺测、降级和人工确认机制。
- IEC 61511要求安全仪表系统从传感器到最终元件按功能安全生命周期进行设计、运行和维护,因此本项目定位为非SIS的辅助诊断层,不构成安全仪表功能。IEC 61511-1:2016
1.5 竞赛亮点
- 亮点一:真假故障双假设竞争。 不只告诉运行人员“曲线异常”,而是比较“测点坏”和“设备坏”两套解释及其证据。
- 亮点二:突发识别与渐进预测分轨。 跳变、断线等突发故障追求秒级/采样周期级识别;漂移、噪声恶化等渐进故障才做风险趋势和预测性检修。系统不承诺预测毫无前兆的瞬时故障。
- 亮点三:可信度成为AI数据底座。 将测点可信度供“四管哨兵”“煤盾”等设备预警模型降权使用,减少坏点污染和连锁误报。
- 亮点四:从报警到检修闭环。 每条预警同时给出证据、疑似故障环节、检查顺序、风险等级和回写入口。
1.6 项目验收目标摘要
首期选取100~300个代表性温度测点进行试点。拟定目标包括:已知测点故障召回率不低于90%,六类故障宏平均F1不低于0.85,跳变检测延迟不超过3个采样周期,测点故障/设备真实异常二分类宏平均F1不低于0.85,虚拟测点相对朴素基线MAE改善不低于20%,影子运行误报不超过1次/100测点·日。所有目标均需在按时间隔离的测试集和不少于8周的影子运行中验证。
2. 场景和设备系统描述
2.1 机组与测点范围
本方案以一台660MW超临界燃煤机组为基线,覆盖锅炉、汽轮机、制粉、给水回热和主要辅机。首期温度测点建议包括:
| 系统 | 首期代表测点 | 关联变量示例 | 业务价值 |
|---|---|---|---|
| 锅炉受热面 | 水冷壁、过热器、再热器壁温及汽温 | 负荷、煤量、给水量、减温水、烟温、氧量、邻管壁温 | 防止坏点污染超温和四管泄漏研判 |
| 汽轮机 | 轴承金属温度、回油温度、推力瓦温度 | 转速、负荷、润滑油温压、振动、胀差、邻瓦温度 | 区分传感器跳变与真实轴承过热 |
| 制粉系统 | 磨煤机出口温度、轴承温度 | 给煤量、一次风量、冷热风门、磨电流、差压、邻出口温度 | 支撑堵磨、自燃和轴承异常判断 |
| 回热系统 | 高低压加热器进出口水温、疏水温度 | 负荷、抽汽压力、流量、水位、邻级温度 | 发现偏置、迟缓和热力过程异常 |
| 主要辅机 | 风机、泵、电机轴承及绕组温度 | 电流、负荷、振动、冷却介质温度和压力 | 支撑状态检修和误报警治理 |
中国现行GB/T 26863-2022《火电站监控系统术语》界定了火电站监控系统相关术语;DL/T 774-2015《火力发电厂热工自动化系统检修运行维护规程》适用于已投产机组热控系统的检修和日常运行维护,且内容覆盖温度、压力、流量及机械量仪表的检修校验。本项目不取代这些法定/规程工作,而是给校验和消缺提供优先级。
2.2 故障对象定义
本项目所称“测点”包括完整测量链:敏感元件(热电偶/热电阻等)、补偿导线或信号线、接线端子、变送器、隔离器、I/O通道、采集与历史存储环节。一个异常读数并不天然等于传感元件损坏,必须结合共模故障和通道拓扑定位。
2.3 六类首期故障模式
| 故障模式 | 数据信号特征 | 常见候选原因 | 能否事前预测 |
|---|---|---|---|
| 跳变/尖峰 | 单点瞬时大幅变化,一阶变化率突增,随后恢复或保持新值 | 接线松动、干扰、通道瞬断、接触不良 | 通常只能快速识别;若跳变频率逐步增加,可预测退化风险 |
| 漂移 | 与虚拟值偏差缓慢单向积累 | 元件老化、热电不均匀、变送器漂移 | 有渐进征兆时可以预测风险窗口 |
| 固定偏置 | 长期稳定偏高/偏低,动态趋势仍相似 | 校准偏差、补偿参数错误、安装位置影响 | 可通过长期残差发现;不等同于可准确预测发生时刻 |
| 卡死 | 值长时间不变,但关联过程已变化 | 通道冻结、采集程序异常、传感器失效 | 多为在线识别,不承诺提前预测 |
| 噪声增大 | 局部方差、高频能量或尖峰频次持续上升 | 屏蔽接地、接线、元件老化、电磁干扰 | 若逐步恶化,可进行趋势预测 |
| 响应迟缓 | 对负荷或过程变化的响应明显晚于同类/模型 | 套管热阻、积灰、采样滤波异常、变送器迟滞 | 可通过动态响应辨识发现并安排校验 |
NIST指出,温度计错误读数可能由机械冲击、热冲击、传感器或读出装置随时间漂移及校准系数错误导致,并建议通过已校准参考温度计进行验证。NIST温度计验证指南 因此AI只能生成“疑似故障和检查顺序”,最终定责仍需标准器校验、回路检查或元件更换结果。
2.4 扩展边界
- 压力/差压/流量:复用工况基线和残差框架,增加质量守恒、能量守恒、阀位—流量及压差—流量关系;重点识别引压管堵塞、零点漂移、卡涩和迟缓。
- 振动:若仅有DCS低频总振值,只做跳变、卡死、漂移、通道不一致等测点可信诊断;若取得状态监测系统高频波形,再扩展频谱、包络和转速同步特征。不得用低频总振值冒充高频故障诊断。
- 不纳入首期:保护专用三取二逻辑改造、SIS定值优化、AI闭环控制、无现场标签支撑的精确剩余寿命预测。
3. 当前业务流程与岗位分工
3.1 现状流程
典型流程是“DCS越限或运行人员目视发现 → 手工拉曲线 → 电话联系热控/检修 → 现场检查或等待停机校验 → 纸面/工单记录”。主要岗位如下:
- 集控运行:监视参数和报警,交叉比较相关曲线,采取规程允许的运行处置。
- 热控检修:检查传感元件、接线、变送器、I/O通道并执行校验或更换。
- 设备点检/专业主管:判断设备本体是否异常,确定检修窗口和优先级。
- 生产技术/信息化:管理SIS历史数据、规程、缺陷和工单;组织复盘。
3.2 现状断点
- 发现晚:量程内软故障可能不触发DCS坏质量或上下限报警。
- 真假难辨:目标点异常与设备真实异常共享“温度升高”等表象。
- 证据分散:时序曲线、校验报告、缺陷工单和规程无法在同一告警中联动。
- 检修排序依经验:大量可疑测点中,谁先校验、谁等待停机缺少量化依据。
- 经验不沉淀:处理结果没有自动形成模型标签和可检索案例。
3.3 现状与优化后业务流程图
flowchart LR
subgraph B["现状:报警驱动、人工串联"]
B1["DCS越限/人工发现"] --> B2["手工拉取多条曲线"]
B2 --> B3["运行电话通知热控与点检"]
B3 --> B4{"凭经验判断"}
B4 -->|疑似测点| B5["现场查线/校验/更换"]
B4 -->|疑似设备| B6["设备检查或运行处置"]
B5 --> B7["分散记录"]
B6 --> B7
end
subgraph A["优化后:证据融合、闭环检修"]
A1["DCS/SIS只读数据"] --> A2["工况识别+质量预检"]
A2 --> A3["虚拟测点+残差/变化检测"]
A3 --> A4{"真假故障双假设评分"}
A4 --> A5["可信度/故障类型/证据链"]
A5 --> A6["运行确认+热控/点检协同"]
A6 --> A7["校验、查线、设备检查"]
A7 --> A8["工单结果回写和模型复盘"]
end
4. 故障演化链和深层业务痛点
4.1 测量链故障演化
渐进型链条:
高温/振动/腐蚀/老化 → 元件特性或绝缘逐步变化 → 残差偏移、噪声增加、响应变慢 → 间歇异常增多 → 超差或完全失效 → DCS坏点/人工发现
突发型链条:
接线瞬断、强电磁干扰、I/O通道故障 → 单点跳变/卡死/丢失 → DCS可能稍后才判坏,或始终保持“正常质量码”
NIST将漂移定义为仪表响应的缓慢变化,并指出可使用控制图和周期性检查标准来识别漂移;漂移不一定长期以固定速率和方向持续。NIST工程统计手册:Drift 这支持本方案使用趋势和变化点检测,但也提醒我们不能简单直线外推“精确剩余寿命”。
4.2 最难的业务矛盾:测点异常还是设备异常
以汽轮机某轴承金属温度上升为例:
- 假设H1:测点故障。 目标温度突然上升20℃;同瓦另一测点、回油温度、振动、润滑油参数和负荷均未联动;AI虚拟温度稳定;该通道近期已有尖峰。
- 假设H2:设备真实异常。 两支相关温度同步上升,回油温度和振动也升高,且变化与负荷/油压异常时间一致;此时即使某一个测点残差大,也不能轻率判为坏点。
- 安全结论: 只有H1证据明显占优时才提示“疑似测点故障”;H2占优时提示“疑似设备真实异常”;两者接近则输出“冲突/无法判定,按设备异常优先核查”。
4.3 深层痛点及其后果
| 深层痛点 | 直接后果 | 对比赛评分的回答 |
|---|---|---|
| 质量码只有硬故障判据 | 软故障带病运行或反复误报 | 精准贴合热控运行实际 |
| 固定阈值不识别负荷和启停工况 | 变负荷时报警洪泛 | AI动态基线有明确必要性 |
| 单点异常没有过程证据 | 真假故障混淆 | 多变量解析冗余解决真实问题 |
| 维护记录与时序数据脱节 | 无法积累标签、模型无法闭环 | 知识库和工单回写具备落地价值 |
| 罕见故障样本少 | 纯监督深度学习容易过拟合 | 正常模型+合成注入+少量确认标签更可行 |
| 预警模型依赖坏点 | 一个坏点引发多个AI误报警 | 可信权重成为跨系统数据质量底座 |
同行评审论文已在真实火电蒸汽分离器上研究传感器故障检测与隔离,并指出虚警概率与检测延迟之间需要权衡。蒸汽分离器传感器故障检测研究 这正是本项目把“误报/延迟”并列为验收指标的依据,而不是单看准确率。
5. 项目目标、边界与适用条件
5.1 建设目标
- 建立首批100~300个关键温度测点的动态正常基线。
- 在线识别跳变、漂移、偏置、卡死、噪声增大、响应迟缓六类故障。
- 对“测点故障/设备真实异常/证据不足”给出概率、证据和人工检查建议。
- 形成每个测点0~100可信度、0~100健康度和四级检修优先级。
- 把可信权重提供给四管、制粉等非保护类AI模型,验证误报下降效果。
- 建立校验、查线、更换、设备检查结果回写闭环。
5.2 两条明确分开的功能线
| 功能线 | 对象 | 时间目标 | 输出 | 能力边界 |
|---|---|---|---|---|
| 突发故障在线识别 | 跳变、尖峰、卡死、断线、突发通道故障 | 1~3个采样周期内发现 | 实时可信度下降、原因码、核查建议 | 无前兆突发故障不能承诺提前预测 |
| 渐进退化预测性检修 | 漂移、噪声恶化、迟缓加剧、间歇跳变频率上升 | 提前数小时至数周识别趋势,依数据而定 | 健康趋势、风险窗口、检修优先级 | 仅在趋势稳定且证据充分时给风险窗口,不输出伪精确RUL |
5.3 适用条件
- SIS历史库至少具备目标测点及关联变量的同步数据;首期建议1~5秒原始采样或可追溯的最细历史粒度。
- 至少覆盖一个完整季节、典型负荷区间和主要运行方式;优选12个月以上。
- 可取得缺陷单、校验报告、更换记录、DCS质量码和运行日志。
- 测点、设备、I/O通道和物理位置存在可维护映射。
- 电厂指定运行、热控、点检三方专家参与标签确认。
5.4 不可越过的边界
- 不写DCS/SIS生产控制网;数据通过既有安全区接口单向/受控同步。
- 不修改原始数据;所有清洗、插补、虚拟值均保留来源、时间戳、模型版本。
- 不自动下达停机、切换、旁路或保护退出指令。
- 不把模型自学习直接上线;模型更新必须离线回放、审核、灰度和可回滚。
- 不用“AI判坏”替代计量校准和规程要求的检修。
6. 数据清单、标签来源和预警知识库设计
6.1 数据清单
| 数据域 | 必要字段 | 建议粒度/跨度 | 用途 |
|---|---|---|---|
| DCS/SIS时序 | 值、原始质量码、时间戳、工程单位、量程 | 1~5秒;≥12个月优先 | 虚拟测点、突发检测、工况识别 |
| 机组工况 | 负荷、负荷变化率、启停状态、AGC、主汽参数 | 同步时序 | 工况分层和动态阈值 |
| 设备关联量 | 流量、压力、阀位、电流、振动、油温油压、邻点 | 同步时序 | 解析冗余和真假辨识 |
| 测点主数据 | tag、KKS、设备、位置、元件类型、量程、I/O卡件 | 配置变更时更新 | 拓扑、分组、解释 |
| 报警/事件 | SOE、DCS报警、通道故障、强制/退出扫描 | 毫秒~秒级 | 突发故障时间对齐 |
| 检修/校验 | 缺陷单、校前校后误差、处理动作、更换件、结论 | 全历史 | 金标准标签和价值计算 |
| 运行日志 | 异常描述、操作动作、交接班记录 | 全历史 | 案例还原 |
| 规程资料 | 运行规程、热控检修规程、事故处置卡、图纸 | 版本化文档 | 检查建议和引用依据 |
6.2 数据治理规则
- 时间统一到电厂时钟;记录各源延迟和重采样方式。
- 原始值、清洗值、模型输入值分层保存,禁止覆盖。
- 质量码、强制状态、检修旁路、设备停运和通信中断作为显式特征,不默默删除。
- 对启停、跳闸和传感器更换后稳定期建立数据隔离标签。
- 训练/验证/测试按时间切分,禁止随机打散导致未来信息泄漏。
- 同一故障事件的窗口不得跨训练集和测试集。
6.3 标签体系与可信等级
| 标签级别 | 来源 | 用法 |
|---|---|---|
| A级金标准 | 标准器校验超差、元件/变送器/卡件更换后恢复、明确接线故障 | 监督训练与最终验收 |
| B级强标签 | 多专业事故分析结论、同源冗余确认、完整工单闭环 | 训练及复核 |
| C级弱标签 | 运行日志“疑似”、DCS质量码、规则命中 | 半监督学习,不单独作为验收真值 |
| U级未知 | 无检修确认 | 仅用于正常模型或待审核,不自动当正常 |
6.4 故障注入数据
罕见故障不足时,在确认正常的离线副本上合成:
- 阶跃跳变:
y'(t)=y(t)+A·I(t≥t0) - 线性/非线性漂移:
y'(t)=y(t)+k(t-t0)或分段缓慢漂移 - 偏置:固定加/减量程比例
- 卡死:
y'(t)=y(t0) - 噪声恶化:逐步增加方差或脉冲噪声
- 迟缓:一阶惯性滤波或时移
注入幅度、持续时间和变化速率必须覆盖“易检出—临界—难检出”三档,并由热控人员确认工程合理性。合成样本只用于算法压力测试和演示,不能冒充真实故障案例或经济成果。
6.5 预警知识库
知识库分为结构化图谱和文档库:
- 实体:测点、设备、介质、参数、传感器类型、变送器、I/O卡件、故障模式、症状、检查动作、工单、规程条款。
- 关系:测量、安装于、同源冗余、上下游、共享卡件、因果关联、故障导致、应检查、由工单验证。
- 文档:运行规程、检修规程、校验报告、图纸、历史案例和事故分析。
- 检索输出:告警解释必须标注规程名称、版本、页码/条款和检索时间。
- 大模型边界:大模型只负责检索归纳和自然语言解释,不负责生成风险分数、覆盖规则或自动下令。
ISO 13374-1给出了机器状态监测与诊断信息处理、通信和呈现的一般指南;ISO 13374-2进一步给出参考信息模型和处理模型。本项目五层架构与“数据—检测—诊断—健康—呈现”分层参考其开放状态监测思想。
7. 总体系统架构与数据流
7.1 五层系统架构
flowchart TB
L1["① 数据源层<br/>DCS/SIS时序、SOE、质量码、缺陷工单、校验报告、规程、设备主数据"]
L2["② 数据治理层<br/>只读采集、时间对齐、工况切片、质量预检、Tag-KKS-设备-I/O拓扑、特征库"]
L3["③ AI分析层<br/>工况识别、虚拟测点、预测区间、EWMA/CUSUM、故障分类、真假异常证据融合"]
L4["④ 业务服务层<br/>可信度、健康指数、检修优先级、知识检索、告警合并、工单回写、模型治理"]
L5["⑤ 展示与接口层<br/>可信度地图、单点诊断卡、历史回放、班组看板、API推荐权重、审计报表"]
L1 -->|"受控只读/单向同步"| L2
L2 --> L3
L3 --> L4
L4 --> L5
L5 -. "人工确认与检修结果" .-> L4
L4 -. "审核后的标签/模型迭代" .-> L3
7.2 数据流
- 接入原始时序、质量码和主数据,不改变生产源。
- 以统一事件时间对齐,生成工况、测点组和共享通道拓扑。
- 虚拟测点输出预测中位数及上下置信界;异常引擎生成残差和变化点。
- 证据融合引擎同时计算“测点故障”“设备真实异常”“数据不足”三类置信度。
- 服务层抑制重复报警,形成单一诊断事件和检查建议。
- 人员确认后创建/关联工单;校验结果回写标签库。
- 非保护类下游AI通过API读取可信权重;若接口异常,保持原模型既有降级逻辑。
7.3 对外接口(新增公共接口)
下游AI只读取以下建议数据,不读取模型内部中间值:
{
"tag_id": "示例KKS",
"event_time": "2026-07-05T10:00:00+08:00",
"raw_quality_code": "GOOD",
"trust_score": 47,
"health_score": 62,
"state": "SUSPECT_SENSOR",
"fault_type": "INTERMITTENT_JUMP",
"confidence": 0.88,
"recommended_weight": 0.3,
"reason_codes": ["RESIDUAL_CHANGE", "NO_PROCESS_COHERENCE", "JUMP_REPEAT"],
"model_version": "temp-v1.2.0",
"expires_at": "2026-07-05T10:05:00+08:00"
}
默认权重策略:
| 可信度Q | 推荐权重 | 下游建议 |
|---|---|---|
| 80~100 | 1.0 | 正常使用 |
| 60~79 | 0.7 | 降权并关注 |
| 40~59 | 0.3 | 显著降权,要求其他证据 |
| 0~39 | 0 | 非保护AI中排除该点,启用替代特征/模型 |
| 未知/接口失效 | null |
不擅自设0或1,下游按自身缺测策略降级 |
上述阈值为项目初始配置,须经历史回放和影子运行标定。任何权重都不影响DCS、保护、联锁和自动控制。
8. AI模型、输入输出、选择理由及基线方法
8.1 技术路线总览
flowchart TD
A["原始值+质量码+工况+关联测点"] --> B{"硬质量异常/越量程?"}
B -->|是| C["规则直判:硬故障<br/>可信度快速下降"]
B -->|否| D["工况识别与同工况基线"]
D --> E["AI虚拟测点<br/>预测值+置信区间"]
E --> F["残差、变化率、噪声、卡死、滞后特征"]
F --> G["EWMA/CUSUM/规则+轻量分类器"]
G --> H{"多点过程是否同步联动?"}
H -->|"否,目标点孤立异常"| I["H1:疑似测点故障"]
H -->|"是,符合机理/平衡"| J["H2:疑似设备真实异常"]
H -->|"证据冲突或不足"| K["H3:无法判定<br/>按设备风险优先核查"]
I --> L["可信度+故障类型+检修优先级"]
J --> M["保留原值并升级设备异常"]
K --> N["人工复核,不自动降权关键判断"]
8.2 工况识别
采用“规则优先+分类补充”:
- 规则输入:机组启停标志、负荷区间、负荷变化率、设备启停、磨组组合、AGC状态、主要阀门状态。
- 工况:停机/启动/并网低负荷/稳态中高负荷/升负荷/降负荷/快速扰动/设备切换。
- LightGBM补充识别边界工况,但规则和运行状态标签具有更高优先级。
- 工况切换后的热惯性缓冲窗口单独建模,不把瞬态硬塞进稳态阈值。
8.3 AI虚拟测点
首选模型:LightGBM分位数回归。
- 优点:适合表格型DCS数据、可处理非线性、训练和推理成本低,可通过SHAP展示相关变量贡献。
- 输出:P50预测值及P05/P95区间,而不是单一“真值”。
- 输入选择:机理筛选先确定候选变量,再用时滞互信息、稳定性和共线性审查;严禁直接使用可能与目标共坏的共享通道变量而不标注。
时序补充模型:TCN。
- 仅用于热惯性明显、LightGBM在升降负荷时持续欠拟合的测点。
- 使用固定历史窗口捕捉滞后,不默认采用参数更重的复杂网络。
- 当样本或算力不足时退回LightGBM/线性物理基线。
参照可行性: 火电高压加热器研究使用真实燃煤电厂DCS数据预测壳侧疏水温度和管侧出口温度,并在快速变负荷和长期低负荷情形下开展状态监测。Engineering Applications of Artificial Intelligence,2025 其论文结果证明“用DCS相关变量预测热工温度”具有研究可行性,但论文中的MSE和准确率不作为本项目已实现结果,本项目必须独立验证。
8.4 残差与变化点检测
核心特征:
- 标准化残差:
r=(实测值-P50)/(P95-P05+ε) - 一阶/二阶差分及短时变化率
- 局部均值、方差、MAD、尖峰频次
- 卡死时长和有效分辨率
- 实测与虚拟值、邻点的互相关及时滞
- 共享卡件/同源回路的共模异常
- 质量码变化、强制状态和通信事件
检测器:
- 规则:越量程、卡死、不可达变化率、质量码异常。
- EWMA:平滑发现小幅持续偏移。
- 双侧CUSUM:发现均值结构性改变。
- 预测区间越界持续性:控制单次尖峰误报。
- LightGBM故障分类器:融合特征识别六类故障;类不平衡采用类别权重,不以合成样本替代真实验证。
8.5 真假故障证据融合
每个事件计算两组证据,不让单一模型“一票定性”:
| 证据 | 支持测点故障H1 | 支持设备异常H2 |
|---|---|---|
| 目标点与虚拟值残差 | 大且孤立 | 可大可小 |
| 邻近/冗余测点 | 不同步 | 同步变化 |
| 物理平衡 | 基本保持 | 同时破坏 |
| 设备状态量 | 无对应变化 | 振动、油温、压力等联动 |
| 共享卡件其他点 | 共同异常时指向通道故障 | 通常不支持 |
| 变化时序 | 突兀、不符合热惯性 | 符合因果传播和热惯性 |
| 历史缺陷 | 同点反复跳变/校验超差 | 同设备存在已知缺陷 |
采用可解释的加权贝叶斯/证据评分,不直接上黑盒端到端分类。模型输出:
P(sensor_fault)P(process_fault)P(insufficient_evidence)- 前5项证据及反证
当两种主要假设差值小于设定灰区(初值0.15)或关键关联数据缺失时,输出“无法判定”。涉及真实设备安全风险时,默认按设备异常优先核查。
8.6 可信度、健康指数和检修优先级
**可信度Q(实时,0~100)**由四部分构成:
- 原始有效性25%:质量码、越量程、卡死、通信。
- 模型一致性30%:残差和预测区间。
- 群组/物理一致性25%:邻点、冗余和过程关系。
- 稳定性20%:噪声、跳变和迟缓。
权重为初始设计,需用历史故障校准;每次评分保留分项得分。
**健康度H(慢变量,0~100)**由近7/30/90天漂移斜率、噪声趋势、异常频次、校验记录、使用年限和工作环境组成。健康度不会因一次孤立尖峰永久下降。
四级检修优先级:
| 等级 | 条件示例 | 建议 |
|---|---|---|
| P1 紧急 | Q<40且影响重要监视/设备判断;或共享卡件多点异常 | 运行立即确认,热控尽快查线/通道;设备异常证据存在时按规程处置 |
| P2 高 | H持续下降、重复跳变或漂移超警戒,存在近期失效风险 | 24~72小时内安排检查或最近可用窗口校验 |
| P3 中 | Q=60~79或单次弱异常 | 纳入周计划,继续观察并准备比对 |
| P4 观察 | Q≥80且趋势稳定 | 正常运行,按原周期维护 |
预测性检修只对至少满足“趋势持续、数据覆盖充分、模型稳定、历史同类可验证”四项条件的测点给出风险窗口;否则只给健康趋势。
8.7 基线方法
所有AI模型必须与以下基线比较:
- DCS原质量码与固定上下限;
- 同类测点中位数/三西格玛规则;
- 上一时刻持久性预测;
- 线性回归或简单热力关系;
- 单变量EWMA/CUSUM。
只有在误报、召回、延迟和解释性上形成综合增益,复杂模型才允许进入影子运行。
9. 实时预警、根因分析、处置和检修闭环
9.1 单点诊断卡
每条事件展示:
- 当前实测值、虚拟预测值、P05~P95区间;
- 可信度、健康度、故障类型、严重度和持续时间;
- “测点故障/设备异常/无法判定”三类置信度;
- 支持证据和反证,不只显示SHAP条形图;
- 疑似故障环节:元件、线路/端子、变送器、I/O通道、历史采集;
- 按规程引用的检查步骤;
- 影响范围:哪些设备预警模型正在使用该点;
- 确认、误报、创建工单和关联已有工单按钮。
9.2 根因定位规则
| 现象组合 | 优先检查 |
|---|---|
| 同一I/O卡多点同时跳变 | 卡件、电源、通信和接地 |
| 单点间歇尖峰,敲击/振动相关 | 端子、补偿导线、接触不良 |
| 全工况固定偏置,校验历史异常 | 元件/变送器校准和补偿设置 |
| 同类点均正常但目标迟缓 | 保护套管、安装、热阻、滤波配置 |
| 实测与虚拟值偏差大且多过程量同步异常 | 优先按设备真实异常排查 |
9.3 告警治理
- 同一测点短时重复命中合并为一个事件,状态变化才更新。
- 同一卡件共模异常合并为“通道组事件”,避免报警洪泛。
- 告警恢复需满足滞回和持续时间,防止反复开关。
- P1/P2需人工确认;P3进入班组看板;P4仅记录。
- 未经确认的AI告警不直接生成强制检修任务。
9.4 闭环
发现 → 证据融合 → 人工确认 → 运行/热控/点检分派 → 查线/校验/设备检查 → 处理结果 → 标签审核 → 效果复盘 → 模型再训练审批
工单必须记录“校前误差、处理动作、校后误差、是否恢复、真实根因、停机需求、工时”。这既是验收真值,也是ROI输入。
9.5 与其他方案协同
- 向“四管哨兵”提供受热面壁温、汽温、流量和压力点可信权重,避免单个壁温跳变触发泄漏误判。
- 向“煤盾”提供磨出口温度、差压、一次风量等可信权重,辅助区分堵磨/自燃与测点故障。
- 若下游设备模型判定真实异常而“慧测”判测点故障,生成模型冲突事件,必须人工复核,不允许静默覆盖。
- “慧测”也可独立参赛:核心价值是全厂测量链的预测性检修和AI数据质量治理。
10. 数据缺失、坏点、变工况、模型失效等降级策略
| 风险/失效模式 | 识别方式 | 降级策略 | 禁止行为 |
|---|---|---|---|
| 关联变量缺失 | 完整率、质量码、延迟监控 | 使用最小特征备用模型;不足则输出“无法判定” | 用虚构/过期值强行判别 |
| 目标点已硬坏 | DCS质量码/越量程/通信故障 | 规则直判,停止精细分类;建议现场检查 | 用AI重构值回写DCS |
| 启停/切换新工况 | 工况未知、分布外检测 | 暂停趋势判定,仅保留硬规则;积累数据后审批建模 | 用稳态阈值套用瞬态 |
| 煤种/季节/设备检修后漂移 | 特征分布、残差基线漂移 | 提醒模型再验证;启用上一稳定版本或简单基线 | 无审核在线自学习 |
| 模型服务中断 | 心跳、延迟、版本校验 | 页面显示“AI不可用”;下游权重返回null |
默认把所有点判正常 |
| 时间不同步 | 源时间差、互相关异常 | 隔离受影响源,暂停真假故障判定 | 把错时联动当故障传播 |
| 共模卡件故障 | 同卡多点同时异常 | 升级为通道组事件,降低单点定位置信度 | 多点分别轰炸报警 |
| 模型冲突 | 规则、虚拟点、设备模型结论不一致 | 输出冲突证据,人工会签 | 让任一黑盒自动覆盖 |
| 网络安全隔离 | 接口不可达 | 本地缓存、断点续传、只读重连 | 绕过电力监控系统安全边界 |
GB/T 36293-2018《火力发电厂分散控制系统技术条件》是现行火电DCS国家标准。本项目通过旁路只读部署和明确失效降级,避免改变DCS本体职责。
11. 离线回放、影子运行和现场试点实施计划
11.1 26周实施路线
| 阶段 | 周期 | 关键任务 | 阶段产物 | 闸门 |
|---|---|---|---|---|
| 1. 场景与安全设计 | 第1~4周 | 选点、数据/网络审查、测点拓扑、指标冻结 | 试点清单、接口方案、风险清单 | 三专业会签 |
| 2. 数据与知识库 | 第5~8周 | 时钟/质量审计、标签整理、规程入库、主数据映射 | 数据质量报告、A级/B级标签集 | 标签抽检通过 |
| 3. 模型开发 | 第9~14周 | 工况、虚拟点、变化检测、真假辨识、可解释输出 | 基线与候选模型、模型卡 | 按时间测试集达标 |
| 4. 离线回放 | 第15~18周 | 历史事件回放、合成注入、阈值标定、专家复核 | 回放报告、误报清单、演示案例 | 无安全红线、指标初达标 |
| 5. 影子运行 | 第19~26周 | 只读实时运行、P1/P2人工确认、A/B比较、稳定性监控 | 8周影子报告、工单闭环样本 | 联合验收 |
| 6. 扩点推广 | 验收后 | 温度扩点,压力/流量/振动分批验证 | 扩点模型和运维制度 | 每批独立验收 |
11.2 历史回放原则
- 以故障发生/人工发现时刻为T0,隐藏T0之后信息,从T0前若干小时/天滚动播放。
- 模型必须使用当时可获得数据,禁止偷看后续工单结论。
- 同时显示DCS原报警、慧测预警、人员日志和最终校验结果。
- 对每例记录首次检测时间、稳定报警时间、误报次数、诊断结论和证据。
- 没有真实渐进案例时,不宣称“提前X天”,改用合成注入验证灵敏度。
11.3 90秒演示脚本:历史回放/合成故障注入
演示案例A:真实历史跳变(优先;须由电厂提供并脱敏)
- 0~15秒:展示某轴承温度与DCS质量码,质量码仍为GOOD,温度突然上升。
- 15~35秒:叠加AI虚拟温度和置信区间;虚拟值稳定,邻瓦温度、振动、回油温度未联动。
- 35~50秒:可信度由92降至38,系统在第3个采样周期形成“疑似测点跳变”,列出三条证据和一条反证。
- 50~65秒:点击I/O拓扑,显示同卡其他点正常,优先检查该点端子/线路;展示对应规程条款。
- 65~80秒:回放最终工单/校验结果,说明是否与系统判断一致。
- 80~90秒:展示结果口径:这是一例回放,不代表全厂总体准确率;总体指标见测试集和影子运行报告。
演示案例B:合成渐进漂移(无真实案例时)
- 在已确认正常的历史副本上,从T0注入0→8℃的14天缓慢漂移。
- 第1天:固定上下限不动作;残差尚在正常波动内。
- 第6天:CUSUM发生持续变化,健康度从91降至76,进入观察。
- 第10天:偏差趋势与邻点分离,健康度降至58,生成P2“近期校验”建议。
- 第14天:展示注入真值和检测结果,明确标注“离线合成压力测试,不是现场事故”。
11.4 上线前检查
- 接口只读和网络边界验证;
- 版本、阈值、特征和训练数据可追溯;
- 模型中断时前端、API和下游模型按设计降级;
- 所有告警均可人工否决并记录原因;
- 运行规程与AI建议冲突时,规程优先;
- 重要测点误判专项演练通过。
12. 技术指标及验收方法
12.1 量化指标表
| 类别 | 指标 | 拟定验收目标 | 验证数据与方法 |
|---|---|---|---|
| 数据 | 关键点时序可用率 | ≥99.5% | 影子运行按点统计;计划检修单列 |
| 虚拟测点 | 相对持久性/线性基线MAE改善 | ≥20% | 按时间隔离测试集,分工况报告 |
| 虚拟测点 | 90%预测区间覆盖率 | 85%~95% | 防止区间过窄或过宽 |
| 故障发现 | 已确认测点故障召回率 | ≥90% | A/B级真实标签;合成结果分开报告 |
| 故障分类 | 六类故障宏平均F1 | ≥0.85 | 真实标签为主,合成压力测试单列 |
| 突发检测 | 跳变/卡死检测延迟 | ≤3个采样周期 | 离线注入+真实事件 |
| 真假辨识 | 测点故障/设备异常宏平均F1 | ≥0.85 | 专家会签事件集;“未知”单独统计 |
| 告警治理 | 误报率 | ≤1次/100测点·日 | 不少于8周影子运行 |
| 预测维护 | 渐进事件提前量 | 报告中位数/P25/P75,不预设虚假天数 | 仅真实渐进A/B级案例 |
| 检修价值 | P1/P2工单确认率 | ≥70% | 校验/查线/设备检查闭环 |
| 稳定性 | 在线服务可用率 | ≥99.5% | 影子运行监控 |
| 协同 | 下游AI测点类误报下降 | ≥20% | 同期A/B回放;设备故障召回不得下降 |
12.2 验收设计
- 数据切分:训练/验证/测试按时间顺序;同一事件仅属于一个集合。
- 分层报告:按稳态、升降负荷、启停、设备切换和测点类型分别报告。
- 对照组:DCS固定阈值、质量码、简单统计基线和AI方案同台比较。
- 未知类:模型拒判不算“准确”,单独报告拒判率和拒判后的人工结果。
- 真实/合成分离:真实故障决定现场有效性;合成注入只检验边界和灵敏度。
- 置信区间:事件数量少时给出95%置信区间,避免用少数案例报虚高百分比。
- 安全性门槛:任何把真实设备异常高置信判为测点故障的案例,均进入重大误判复盘;未完成复盘不得扩点。
12.3 文献结果、项目目标、未来实测三者分离
| 类型 | 本文示例 | 使用方式 |
|---|---|---|
| 文献结果 | 高压加热器论文报告了其数据集上的预测与异常检测结果 | 仅证明研究路线可行,不平移为本项目成绩 |
| 项目目标 | 宏平均F1≥0.85、误报≤1次/100测点·日 | 作为合同/试点拟定指标,可在数据审计后冻结 |
| 未来实测 | 目标电厂历史回放和8周影子运行结果 | 项目实施后填入验收报告,当前不得虚构 |
13. 安全、经济和管理价值量化公式
13.1 安全价值
- 降低坏点造成的设备故障误判和错误操作风险;
- 降低把真实设备异常误当坏点的漏报风险;
- 提前暴露共享卡件、线路和测量链共模问题;
- 为关键设备AI预警提供数据可信门控。
安全价值以事件数和风险降低表达,不虚构事故避免金额:
年度高风险事件降低数 = 基线期测点误判高风险事件数 - 投运期同口径事件数
13.2 经济价值
年度净收益建议按下式代入电厂真实参数:
年度净收益 = V误报减少 + V计划检修 + V避免扩大故障 + V校验优化 + V下游AI增益 - C年运维
其中:
V误报减少 = 减少的无效告警/检查次数 × 单次平均人工时 × 综合人工成本V计划检修 = 由紧急抢修转为计划检修的次数 × 单次抢修与计划检修成本差V避免扩大故障 = 经厂方审核的可归因事件数 × 单次停机时长 × 平均损失负荷 × 单位电量边际收益V校验优化 = 安全前提下减少的无效重复校验次数 × 单次校验成本V下游AI增益 = 四管/制粉等模型减少误报和缩短分析时间的可审核价值C年运维 = 软件运维 + 算力存储 + 模型复核 + 接口和知识库维护成本
ROI与回收期:
ROI = (年度净收益 - 首期建设投资年化额) / 首期建设投资年化额静态回收期 = 首期建设投资 / 年度净现金收益
13.3 需电厂补充的参数
- 每年测点缺陷、校验超差、临时消缺和紧急抢修次数;
- 每次故障平均工时、备件、脚手架和停机窗口成本;
- 因测点问题引发的设备误报警、降负荷或非停记录;
- 平均损失负荷、电价/边际收益和启停成本;
- 现行定期校验规模、周期和单次成本;
- 下游AI历史误报中可归因于坏点的比例。
13.4 管理价值
- 从“坏了再修”转向“按健康度排程”;
- 从个人经验比曲线转向可审计证据链;
- 从分散日志转向测点全寿命档案;
- 从AI各自清洗数据转向统一可信度服务;
- 形成运行、热控、点检共同确认的闭环语言。
国家标准GB/T 37942-2019《生产过程质量控制 设备状态监测》为设备状态监测提供现行标准依据;国家能源局2025年发布的“人工智能+”能源政策明确提出推动电力设备故障预测性维护和设备精益化管理。国家发展改革委、国家能源局相关实施意见
14. 方案创新点及与普通阈值报警的差异
14.1 四项创新
-
双假设竞争而非单点判坏
“测点故障H1”和“设备异常H2”同时计算证据,包含反证和拒判区,直接解决现场最危险的混淆问题。 -
解析冗余替代大规模硬件冗余
用关联过程变量生成虚拟测点和预测区间,不要求为每个普通测点新增一套物理传感器;关键安全测点仍按原设计保留硬件冗余。 -
快慢双通道
快通道用规则、变化点检测应对突发;慢通道用健康趋势支持预测性检修。能力边界比“所有故障提前预测”的口号更可信。 -
可信度跨模型传播
标准化输出可信权重、原因码、过期时间和模型版本,让设备预警系统显式处理坏点,而不是各自重复清洗。
14.2 与普通报警对比
| 维度 | 固定阈值/质量码 | 慧测方案 |
|---|---|---|
| 判断依据 | 单点上下限、断线、越量程 | 工况、虚拟值、邻点、物理关系、拓扑、历史 |
| 软故障 | 容易漏掉量程内漂移/偏置 | 残差和趋势识别 |
| 变工况 | 阈值难自适应 | 分工况模型和瞬态缓冲 |
| 输出 | “高/低/坏质量” | 可信度、故障类型、真假概率、证据和建议 |
| 误报控制 | 持续时间/死区 | 预测区间、告警合并、共模识别、拒判 |
| 检修 | 发现后人工排序 | 健康度和P1~P4优先级 |
| 知识沉淀 | 日志/工单分散 | 事件、规程、校验结果闭环 |
| 安全边界 | 属于生产监控本体 | 只读辅助层,不替代保护和控制 |
14.3 为什么可落地
- 主要输入来自现有DCS/SIS、工单和规程,无需首期大规模加装硬件。
- LightGBM、EWMA、CUSUM等算法成熟、算力要求低、解释路径清楚。
- 先从100~300个温度点试点,逐批扩展,避免“一次做全厂”。
- 电厂传感器研究已有真实机组在线监测和解析冗余案例,可作为路线依据,但本项目仍通过自己的数据验收。电厂混合数据驱动诊断
15. 10~12页、8分钟PPT大纲及逐页时间
共11页,合计480秒。主线只讲一个矛盾:“温度升高,到底是设备坏了还是测点坏了?”
| 页码 | 页面标题 | 核心内容/画面 | 时间 |
|---|---|---|---|
| 1 | 慧测:先判断数据可信,再判断设备故障 | 一句话方案、660MW机组、只读辅助定位 | 25秒 |
| 2 | 一个温度跳变,为什么现场难判断 | 轴承温度案例;设备过热vs测点跳变双假设 | 40秒 |
| 3 | 痛点不是“没有报警”,而是软故障和真假混淆 | 六类故障、现状流程四个断点 | 45秒 |
| 4 | 目标与边界:两条功能线 | 突发在线识别vs渐进预测检修;不承诺预测无前兆突发 | 45秒 |
| 5 | 五层架构:现有数据即可起步 | DCS/SIS、数据治理、AI、业务、展示;只读边界 | 55秒 |
| 6 | 核心算法:虚拟测点+残差+变化点 | 实测/虚拟/区间三条曲线;LightGBM、EWMA/CUSUM | 45秒 |
| 7 | 最大创新:测点坏还是设备坏 | 双假设证据表和拒判机制 | 55秒 |
| 8 | 90秒历史回放演示 | 第3采样周期发现跳变;邻点/振动不联动;工单回证 | 90秒 |
| 9 | 从报警到预测性检修闭环 | 可信度、健康度、P1~P4、工单回写 | 35秒 |
| 10 | 如何证明有效,而不是“AI看起来很准” | 时间隔离、真实/合成分开、8周影子运行、指标表 | 25秒 |
| 11 | 价值与落地:100~300点先行,26周验收 | ROI公式、三方案协同、安全边界、总结 | 20秒 |
15.1 汇报金句
- “DCS质量码回答的是‘有没有硬坏’,慧测回答的是‘这个数现在值不值得相信’。”
- “不把每一次温度升高都说成测点坏,也不把每一次跳变都说成设备坏;系统同时摆出两套证据。”
- “对无前兆故障,我们承诺快速识别;对有渐进征兆的故障,我们才谈预测性检修。”
- “虚拟值可以辅助分析,但永远不能替代原值进入保护和控制。”
15.2 演示备份方案
- 无法联网时使用录屏和逐帧回放,不依赖现场实时系统。
- 无真实案例授权时使用明确标注的合成注入,不讲“提前避免某事故”。
- 演示失败时用三张静态截图:异常前、系统判定、工单回证。
16. 专家可能提问及标准答复
Q1:DCS已经有坏质量码和上下限报警,为什么还需要这套系统?
答: DCS对断线、通信中断、越量程等硬故障有效,但量程内漂移、偏置、间歇跳变、噪声恶化和迟缓可能仍显示GOOD。慧测不替代DCS,而是在其上增加工况基线、解析冗余和软故障诊断,并把结果用于检修排序。
Q2:AI凭什么知道“正确温度”?
答: 系统不声称知道绝对真值,而是根据已确认健康期数据、相关过程变量和热力/设备关系生成预测分布。输出的是P50和置信区间;最终真值仍由标准器校验或检修结果确认。模型不确定时会拒判。
Q3:如何区分测点故障和真实设备异常?
答: 采用双假设证据融合。单点与虚拟值严重偏离,但邻点、振动、油温和物理平衡不动,支持测点故障;多个因果相关量同步变化且符合过程机理,支持设备异常;证据冲突时输出“无法判定”,并按设备风险优先核查。
Q4:如果多个相关测点一起坏,虚拟测点会不会也被骗?
答: 会有这种风险,因此模型显式使用I/O卡件和测量链拓扑识别共模故障,并限制共享卡件变量进入同一虚拟模型。发现同卡多点异常时升级为通道组事件;关键证据不足则停止真假判定,不强行给结论。
Q5:为什么用LightGBM,不直接用大模型或最先进的深度学习?
答: 首期数据是典型表格时序,故障标签少,工程上更重视解释、速度和维护成本。LightGBM分位数回归能输出区间并用SHAP解释。只有热惯性和时滞明显且轻量模型确实欠拟合时才引入TCN。大语言模型只做规程检索解释,不参与风险打分。
Q6:所有测点故障都能提前预测吗?
答: 不能。接线瞬断、强干扰等突发故障可能没有前兆,只能追求1~3个采样周期内快速识别;漂移、噪声逐步增大、间歇跳变频率上升等渐进故障才适合健康趋势和风险窗口预测。方案明确分开两条能力线。
Q7:测点没有足够故障样本,模型怎么训练?
答: 首先用健康期数据训练正常行为模型,不依赖大量故障标签;其次使用A/B级校验和工单标签训练轻量分类器;最后在正常数据副本上注入工程合理的六类故障做压力测试。合成结果与真实结果分开报告,不能替代现场验证。
Q8:模型会不会在机组升降负荷时大量误报?
答: 工况识别先于异常判断,升降负荷、启停和切换使用独立基线和热惯性缓冲。验收也按工况分层,不能用稳态总体准确率掩盖瞬态误报。未知工况触发降级,只保留硬规则。
Q9:AI虚拟值能不能在原测点坏后送入控制系统顶替?
答: 不能。本项目只读部署,虚拟值仅用于分析、展示和非保护类AI的缺失特征参考,不得写回DCS,不得进入保护、联锁、自动控制或替代规程规定的测量。恢复生产测量必须按热控检修和功能安全要求处理。
Q10:可信度给其他AI系统后,会不会把真实故障信号错误降权?
答: 下游接收的是“推荐权重”,不是强制屏蔽。若设备模型存在多点联动,慧测会提高设备异常假设;两模型冲突时生成冲突事件并人工复核。安全相关逻辑完全不使用该权重。验收要求下游误报下降的同时,设备故障召回不得下降。
Q11:怎样证明系统不是做了一套漂亮界面?
答: 有三道闸门:按时间隔离的历史测试、遮蔽未来信息的事件回放、不少于8周只读影子运行。对照DCS质量码、固定阈值和简单统计基线,同时统计召回、误报、延迟、拒判和工单确认率;真实和合成数据分开披露。
Q12:如何避免模型漂移和在线自学习带来风险?
答: 在线只监测数据分布和残差,不自动替换生产模型。新模型必须经过数据审查、离线回放、专家审核、灰度部署和可回滚验证。模型版本、训练窗口、阈值和特征均留审计记录。
Q13:这套方案最大的经济价值是什么?
答: 价值不只来自少换几个传感器,而是减少无效检查、把紧急消缺转为计划检修、避免坏点污染关键设备预警,并降低真假误判造成的降负荷或事故扩大风险。现场不具备归因证据前不承诺金额,使用可代入公式由电厂真实数据计算。
Q14:首期为什么只做温度,压力、流量、振动怎么办?
答: 温度测点数量多、热惯性明显、邻点和过程关联丰富,最适合形成可验收样板。压力和流量在二期加入质量守恒和压差—流量关系;振动若只有DCS总振值,仅做测点可信度,取得高频波形后才开展频谱诊断。分期能避免范围过大导致方案漂浮。
参考资料
以下资料均用于方案边界、技术路线或验证设计;其中1~8为官方标准/机构资料,9~12为同行评审论文。文献结果不等于本项目现场成果。
- 国家市场监督管理总局、国家标准化管理委员会:GB/T 26863-2022《火电站监控系统术语》。
- 全国标准信息公共服务平台:DL/T 774-2015《火力发电厂热工自动化系统检修运行维护规程》。
- 国家市场监督管理总局、国家标准化管理委员会:GB/T 36293-2018《火力发电厂分散控制系统技术条件》。
- 国家市场监督管理总局、国家标准化管理委员会:GB/T 37942-2019《生产过程质量控制 设备状态监测》。
- ISO:ISO 13374-1:2003,Condition monitoring and diagnostics of machines—General guidelines;ISO 13374-2:2007,Data processing。
- IEC:IEC 61511-1:2016,Functional safety—Safety instrumented systems for the process industry sector。
- NIST:Temperature Scales, Uncertainty, and Traceability; Thermocouples and Thermocouple Wires;NIST Engineering Statistics Handbook—Drift。
- 国家发展改革委、国家能源局:关于推进“人工智能+”能源高质量发展的实施意见。
- Li, D. et al.:Recent advances in sensor fault diagnosis: A review,Sensors and Actuators A: Physical, 2020。
- Guo, P. et al.:A hybrid data-driven modeling method on sensor condition monitoring and fault diagnosis for power plants,International Journal of Electrical Power & Energy Systems, 2015。
- Zhirabok, A. et al.:Sensor fault detection and isolation in a thermal power plant steam separator,Control Engineering Practice, 2013。
- Applying deep learning and automated machine learning for enhanced state monitoring and health assessment of high-pressure heater in thermal power units,Engineering Applications of Artificial Intelligence, 2025。
结论
“慧测”的竞争力不在于堆叠复杂算法,而在于把电厂长期存在却常被忽略的核心矛盾做成闭环:一个异常值到底代表设备风险,还是测量链风险? 方案以现有DCS/SIS数据起步,用工况识别、虚拟测点、变化检测和多源证据给出可解释结论,再把校验和检修结果变成持续积累的知识。首期范围明确、部署边界安全、指标可回放可验收;既能独立形成测点预测性检修方案,也能成为锅炉四管和制粉故障预警的可信数据底座。
Project details
Release history Release notifications | RSS feed
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file hdwfpre-0.1.0.tar.gz.
File metadata
- Download URL: hdwfpre-0.1.0.tar.gz
- Upload date:
- Size: 6.4 MB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.2.0 CPython/3.12.0
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
d80022b08ce4d346618b93b953f349c8a86325b16bf51b68e625bf4073ecf68b
|
|
| MD5 |
386eda496ef1833d177d171496ec580b
|
|
| BLAKE2b-256 |
ecec3a51625fafa9e3bbd3bbc440a52413381ef918b0837946d07b632e0b6843
|
File details
Details for the file hdwfpre-0.1.0-py3-none-any.whl.
File metadata
- Download URL: hdwfpre-0.1.0-py3-none-any.whl
- Upload date:
- Size: 6.3 MB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.2.0 CPython/3.12.0
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
08653d7f251f4612b30eb9ef09c206be1f21b64b9ff2dd6fb5ebf25c044ca395
|
|
| MD5 |
bb7dd0e8973e9911b0d14bae2fe6582c
|
|
| BLAKE2b-256 |
fb73ef0c40eb9d1d5876f9b47111bd23052464d3c4fe4ebdac745b6819cab88e
|