可修复系统可靠性评估:状态空间法、频率平衡法与框图法详解

可修复系统可靠性评估:状态空间法、频率平衡法与框图法详解 简介这份电力系统规划与可靠性主题课件面向电力专业学生、电网规划与可靠性工程师重点讲解可修复系统可靠性的核心概念与计算方法。内容涵盖预防性维修与矫正性维修的区别以及可靠度、可用度、不可用度等关键指标并系统介绍了状态空间/时间法、频率平衡法和框图法三类分析手段配有单元件、多元件串并联系统的推导与算例有助于读者快速建立从故障率、修复率到系统可靠性评估的完整分析框架。资源为单个PPT文件压缩包大小约801KB属于文档资料类型适合课堂辅助或自学入门。已有168人学习使用页内以幻灯片形式呈现公式推导、状态空间图与串并联框图重点突出便于对照理解与复习备考。1. 可修复系统可靠性为什么电力规划不能只算可靠度电力系统的元件几乎都是「可修复」的发电机跳机后要抢修变压器故障后要更换线路跳闸后要复电。于是出现一个反直觉现象按不可修复模型计算一条寿命期 10 年的线路可靠度会随时间持续衰减、逼近于 0而实际电网里同样的线路靠维修反复投运长期可用率稳定在 99% 以上。这个差异正是可修复系统可靠性要单独建模的原因——把故障率 λ 和修复率 μ 同时放进状态转移过程用可用度 A、不可用度 U 和循环频率 f 描述系统的长期行为而不是只盯住可靠度 R。本篇围绕状态空间/时间法、频率平衡法、框图法三条计算路径把单元件、串联、并联和完整母线算例的等值公式、量纲陷阱和校验方法一次讲透适合做电力系统规划、可靠性评估和设备运维的工程师参考。2. 状态空间/时间法与频率平衡法A、U 的指数分布推导2.1 两状态模型里 λ 和 μ 是速率不是概率建立最基本的可修复元件两状态模型。0 状态为工作状态1 状态为失效状态从 0 到 1 的转移率是 λ故障率次/年从 1 到 0 的转移率是 μ修复率次/年。这里的「率」是单位时间内的期望转移次数不是概率取值可以大于 1这是初学者最容易绕进去的一个点——看到 μ1095 次/年就以为不合理其实它对应平均修复时间 8 小时。在指数分布假设下平均无故障工作时间与故障率互为倒数平均修复时间与修复率互为倒数m MTTF 1/λr MTTR 1/μT MTBF m r 1/fMTBF 是平均失效间隔时间包含一次运行时间和一次修复时间MTTF 只包含运行时间。两者在数值上可能很接近因为 r 通常远小于 m但概念上不能混用。PPT 中专门强调这一点是因为在串联框图法中 r 会进入等值修复时间公式混淆 MTTF 与 MTBF 会直接导致参数代错。2.2 停留概率的三个等价表达式状态空间/时间法的核心关系是停留在状态 S 的概率 P(S) m(S) / T(S)即状态平均持续时间除以平均遭遇周期。对 0 状态m(0)mT(0)mr于是得到可用度 A m/(mr)。代入 m1/λ、r1/μ分子分母同乘 λμ得到 A μ/(λμ)。同理可得不可用度 U r/(mr) λ/(λμ)。频率角度的关系式 f 1/T λA Uμ 在后续框图法校验中非常关键任何一个状态的遭遇频率等于该状态概率乘以离开该状态的转移率。也就是说元件进入失效状态的频率既可以用 λ 乘以可用概率算也可以用 μ 乘以不可用概率算两条路径结果相同。指标符号用 λ、μ 表示用 m、r 表示可用度Aμ/(λμ)m/(mr)不可用度Uλ/(λμ)r/(mr)循环频率fλA Uμ1/(mr)平均无故障工作时间MTTF1/λm平均修复时间MTTR1/μr平均失效间隔时间MTBF1/λ 1/μmr2.3 频率平衡法不积分也能解稳态概率频率平衡法基于遍历系统的一个性质稳态下离开某状态的期望频率必然等于进入该状态的期望频率。对单元件模型离开 0 状态的频率是 λP0进入 0 状态的频率是 μP1平衡方程 λP0 μP1 加上归一化条件 P0P11解出来依然是 P0 μ/(λμ)、P1 λ/(λμ)与状态空间/时间法结果完全一致。这个方法在多元件系统中的价值更明显。以两个元件为例四个状态按二进制编号0(0,0)、1(1,0)、2(0,1)、3(1,1)其中括号内第一位表示元件 1 的状态第二位表示元件 2 的状态。对状态 3两元件同时失效其稳态概率为 P3 λ1λ2 / [(λ1μ1)(λ2μ2)]。在 λr 远小于 1 的工程条件下该式可近似为 λ1λ2/(μ1μ2) U1U2这个结果直接对应后面并联系统的不可用度乘积公式。由此可见频率平衡法不是一套独立的替代算法而是为多元件状态空间模型提供了一种更简洁的线性方程构造方式。2.4 用 Python 验证单元件指标# 单元件可用度计算λ0.5 次/年平均修复时间 8 小时/次 lam 0.5 # 故障率次/年 r 8 / 8760 # 平均修复时间换算成年 mu 1 / r # 修复率次/年 A mu / (lam mu) # 可用度 U lam / (lam mu) # 不可用度 f lam * A # 循环频率次/年 print(fA{A:.6f}, U{U:.6f}, f{f:.4f} 次/年) print(fMTTF{1/lam:.2f} 年, MTTR{r*8760:.2f} 小时)这里必须先做单位换算r 从小时换成年再取倒数得到 μ否则 μ 与 λ 不在同一时间基准上A 的数值会完全失真。上述参数算得 A≈0.99954、U≈0.0004566、f≈0.49977 次/年对应平均约两年一次失效、每次停运 8 小时符合直觉。3. 串联框图等值λs、rs 的累加与适用边界3.1 串联系统的马尔可夫等值逻辑电力系统里电源点到负荷点的供电回路通常是串联关系任一设备退出运行整个回路就失去供电。对串联系统由正常状态向停运状态转移的速率是各元件故障率之和这是「或门」逻辑。设串联等值故障率为 λs等值平均修复时间为 rs稳态下系统不可用率 Us λs·rs。同时各个元件独立时Us 也可通过 1 - ΠAi 计算两条路径在 λr 远小于 1 时一致这就是工程上默认的近似条件。等值修复率 μs 不能简单相加。正确做法是先由马尔可夫状态方程推导系统从停运状态返回到正常状态的转移速率等于各元件修复率按故障率加权的平均值即 μs Σλi·μi / Σλi。由此得到等值修复时间 rs 1/μs Σ(λi·ri) / Σλi。PPT 中 rs 公式的分子是 Σλi·ri拆开看就是把每个元件的修复时间按它对系统总故障率的贡献加权。3.2 串联等值公式与参数速查表参数含义单个元件串联等值λ故障率次/年λiλs Σλir平均修复时间小时/次rirs Σ(λi·ri) / λsU不可用率Ui ≈ λi·ri/8760Us ≈ λs·rs/8760A可用度Ai ≈ 1 - λi·ri/8760As ≈ ΠAi注意 Us 的量纲。λ 的单位是次/年r 的单位是小时/次两者相乘得到小时/年表示一年内累计停运小时数。要转成无量纲概率还要除以 8760。很多计算错误发生在这一步把 88 小时/年直接当成 88% 的不可用率。3.3 三元件串联算例lam [1.0, 0.05, 0.02] # 三个元件的故障率次/年 r [50, 300, 150] # 平均修复时间小时/次 lam_s sum(lam) # 串联等值故障率 # 等值修复时间按故障率加权平均 r_s sum(l*ri for l, ri in zip(lam, r)) / lam_s U_hours lam_s * r_s # 小时/年 A_s 1 - U_hours / 8760 # 无量纲可用度 print(fλs{lam_s:.3f} 次/年, rs{r_s:.3f} 小时/次) print(fUs{U_hours:.2f} 小时/年, A{A_s:.6f})输出为 λs1.07 次/年、rs≈62.6 小时/次、Us≈67.0 小时/年、A≈0.99235。这里的 rs 是加权结果修复时间最长的 T2150 小时故障率只有 0.02对等值修复时间的贡献很小。如果直接用三个 r 的算术平均 166.7 小时会高估系统停运恢复时间进而高估不可用度。3.4 常见误用对 r 直接取算术平均串联系统的等值修复时间必须按故障率加权不能做算术平均。原因在于一个修复时间长的元件如果极少故障它对系统整体停运时间的贡献就小反之一个修复时间短但高频故障的元件才是应该优先关注的。只有当所有元件故障率相等时加权平均才退化为算术平均。做可靠性分析时遇到「把 r 加起来除以 n」的算法基本可以判定结果不可信。另一个概念坑是 MTTF 与 MTBF 混用。MTTF 从修复完成时刻算到下一次失效MTBF 相邻两次失效之间的完整周期。在串联等值公式中只能用 r对应 MTTR用 MTBF 代入会把修复时间算成运行时间导致不可用度虚高。4. 并联冗余不可用度乘积与 rp 的并联公式4.1 为什么并联系统的 U 可以直接相乘两个元件并联系统只有在两个元件同时停运时才失效。在独立性假设下系统不可用度等于两个元件不可用度的乘积Up U1 · U2这是「与门」逻辑。注意 PPT 推导并联等值故障率的顺序先由 U 乘积得到系统不可用度再由系统停运状态的平均持续时间 rp 反推 λp Up / rp而不是直接把两个元件的 λ 相乘。λ 乘积在量纲上不成立也缺乏物理含义。4.2 rp 的推导任一元件修复即恢复两元件同时停运时任何一个元件修复完成系统就恢复运行。因此系统离开停运状态的转移率是两个元件修复率之和μp μ1 μ2rp 1/μp r1·r2 / (r1r2)例如 r150 小时、r2300 小时时rp 15000/350 ≈ 42.86 小时。这个值明显低于任何一个单独修复时间意味着冗余结构不仅降低了失效概率还缩短了系统平均恢复时间。在规划阶段评估备用方案时这两个收益要分开看前者来自概率乘积后者来自修复率叠加。4.3 串并联公式对照系统类型λ 等值r 等值U 等值串联ΣλiΣ(λi·ri)/λs≈ λs·rs并联Up / rpr1·r2/(r1r2)U1·U2串联系统 Σλi 会让总故障率变大并联系统 Up 会让不可用率变得极小两种结构对可靠性的影响方向完全相反。实际电网往往同时包含这两种结构比如双回线路并联供电、两端各自经过串联设备先局部化简再整体组合是框图法的常规流程。4.4 算例并联比单机可靠多少lam [1.0, 0.05] # 两台设备故障率次/年 r [50, 300] # 平均修复时间小时/次 U [l*x/8760 for l, x in zip(lam, r)] # 各自不可用率 Up U[0] * U[1] # 并联系统不可用率 rp r[0]*r[1] / (r[0]r[1]) # 等值修复时间 lam_p Up / (rp/8760) # 反推等效故障率 print(fU1{U[0]:.6f}, U2{U[1]:.6f}, Up{Up:.8f}) print(frp{rp:.2f} 小时, λp{lam_p:.4f} 次/年)两台设备单独看λ11 次/年的设备约每年失效一次并联后等效故障率约 0.002 次/年下降约三个数量级而不可用率从 5.7e-3 降到 9.7e-6 量级。这个数量级差异在规划决策里很直观冗余投资换来的不是「故障少一点」而是「故障率降几个数量级」。但这里隐含一个强假设——两个元件的失效彼此独立。同塔双回线路、同沟电缆这类共因失效场景会直接破坏乘积公式后面第 6 章再展开。5. 母线 D 五元件算例2.57 与 34.241245 的前后校验5.1 原始数据与回路结构PPT 给出一个 100MW 发电机经两台变压器、两条线路向母线 D 供电的算例负荷 80MW。五个元件在供电回路中全部串联任一元件失效母线 D 就失电。注意这里评估的是「母线 D 电源点是否可用」这个二态问题发电机 100MW 容量相对 80MW 负荷有裕度所以暂不涉及容量充裕度评估。元件λ次/年r小时/次λ·r小时/年G11.05050T10.0530015T20.021503L11.01616L20.584合计2.57—88Σλi 2.57 次/年Σλi·ri 88 小时/年。这两个合计值就是后面所有指标的基础。5.2 串联等值指标计算与精度校验rs 88 / 2.57 34.241245 小时/次与 PPT 结果一致。Us 88 小时/年换算成概率 Us 88/8760 ≈ 0.010045可用度 A ≈ 0.989955。这里得到的结论是该回路每年平均停运 88 小时可靠性水平约为 99%读作「三个九未满」。lam {G1:1.0, T1:0.05, T2:0.02, L1:1.0, L2:0.5} r {G1:50, T1:300, T2:150, L1:16, L2:8} lam_s sum(lam.values()) # 2.57 次/年 r_s sum(lam[k]*r[k] for k in lam) / lam_s # 加权等值修复时间 U_hours sum(lam[k]*r[k] for k in lam) # 88 小时/年 A_prod 1 for k in lam: A_prod * 1 - lam[k]*r[k]/8760 # 各元件可用度连乘 print(fλs{lam_s:.3f} 次/年, rs{r_s:.6f} 小时/次) print(fUs{U_hours:.2f} 小时/年, A(等值){1-U_hours/8760:.6f}) print(fA(连乘){A_prod:.6f})输出中 A(等值)0.989955A(连乘)≈0.989945两者差异在小数点后第五位来自 λr 高阶项的舍去。当单个元件可用度都在 0.98 以上时这种近似误差完全可接受但如果某个元件 λr 超过 0.1连乘结果会更接近真实值建议此时用 1-ΠAi 反推 Us。5.3 发电机完全可靠时的对比将 G1 故障率置为 0相当于从串联链中剔除该元件。此时 λs1.57 次/年rs 38/1.57 ≈ 24.20382 小时/次Us38 小时/年A≈0.99566。两个场景对比不可用度从 88 小时/年降到 38 小时/年下降 56.8%。这个降幅刚好等于 G1 的 λ·r 占比50/8856.8%。这不是巧合在串联系统中每个元件对系统不可用度的边际贡献就是它自己的 λ·r 值。各元件贡献排序为 G150 小时/年→ L116→ T115→ L24→ T23。规划层面如何排序如果目标是提升母线 D 的供电可用率投入资源改善 G1 的故障率或缩短其修复时间收益最明显而 T2 即使修复时间减半对系统整体可用度的提升也微乎其微。5.4 用频率公式交叉验证还可以用 f λA 验证循环频率系统每年进入停运状态的期望次数约为 2.57×0.98995 ≈ 2.54 次平均每次停运 34.24 小时两者相乘约 87 小时与 Us 一致。如果算出的频率与 λs 差距过大通常意味着单位换算或状态概率归一化出错。这套交叉验证方法在复杂网络可靠性计算里能快速定位错误。6. 工程校验三招量纲、近似边界与共因失效6.1 量纲自检先看单位再谈数值λ 用次/年、r 用小时/次乘积单位是小时/年要得到无量纲不可用率必须除以 8760。反过来如果拿到一个无量纲不可用率要转成小时/年必须乘以 8760。实践中常见的错误是直接把 0.01 当 0.01 小时/年或者把 88 小时/年当 88% 不可用率。每次计算结束先看结果的量级电力设备不可用率一般在 1e-4 到 1e-2 之间算出来 U 超过 0.1优先检查 r 是否漏了小时到年的换算。6.2 近似边界λr 小于 0.1 时才放心用框图公式串联等值 rs Σλi·ri / Σλi 和并联 Up ≈ U1·U2 都建立在 λr 远小于 1 的近似上。单个元件 λr 超过 0.1 时可用度应改用精确式 A1/(1λr)由 Aμ/(λμ) 推导Us 改用 1-ΠAi 计算。对于修复时间特别长的设备比如 r300 小时、λ0.05λr0.017仍处于安全区但如果出现 λ0.5、r500 小时的元件λr0.029系列展开误差仍可接受超过 0.1 建议用马尔可夫状态枚举或蒙特卡洛仿真复核。6.3 共因失效并联公式的假设边界两个元件并联的 Up U1U2 成立的前提是失效事件相互独立。同塔双回线路、同沟电缆、同一变电站内的两台主变都存在共因失效风险。常见做法是在独立失效基础上增加一个共因失效分支Up U1·U2 Ucc其中 Ucc 由共因失效事件的 λcc 和 rcc 计算。规划阶段若忽略这一项冗余设计带来的可靠性收益会被高估。一个实用的检查方法是把两条线路的走廊距离、保护配置列出来若存在共享通道或共享二次设备就必须显式建模共因失效。最后建议把这三条规则固化成一个自检函数每次算完框图法结果先跑一遍量纲与边界检查再进入规划决策环节。本文还有配套的精品资源点击获取