跳转到内容
← 返回信息与机器
信息与机器L316 分钟阅读

可靠性工程:把“不出事”变成可计算的指标

Reliability Engineering: Making 'Nothing Goes Wrong' a Computable Metric

第一个误解,是把可靠性当成"质量好"的同义词。质量回答"产品出厂时是否符合规格",可靠性回答的是另一个问题:它在规定条件下、规定时间内,继续完成功能的概率有多大。可靠性工程的起点,是把"不出事"从一句愿望改写成一个带时间、带条件的概率命题。 第二个误解,是以为 MTBF(平均故障间隔时间)是厂家对寿命的承诺。"MTBF…

可靠性工程Weibull分布MTBFFMEA共因失效概率风险评估

破除误解

第一个误解,是把可靠性当成"质量好"的同义词。质量回答"产品出厂时是否符合规格",可靠性回答的是另一个问题:它在规定条件下、规定时间内,继续完成功能的概率有多大。可靠性工程的起点,是把"不出事"从一句愿望改写成一个带时间、带条件的概率命题。

第二个误解,是以为 MTBF(平均故障间隔时间)是厂家对寿命的承诺。"MTBF 十万小时"绝不意味着设备能安稳运行十万小时——它只是寿命分布的均值,而均值背后藏着对故障形态的强假设。

第三个误解,是相信多加一套备份就能"消除"故障。冗余对付的是独立的随机故障;面对设计缺陷、共同环境、共同维护错误这类共因失效(common cause failure),四套一模一样的备份会在同一时刻一起倒下。福岛第一核电站的十三台应急柴油发电机,就是代价惨烈的演示。

可靠性的概率化定义

可靠性工程的正式定义由四个要素构成:规定的功能、规定的时间、规定的条件,以及一个概率。写成数学语言:可靠度 R(t) 是产品寿命 T 超过 t 的概率。前三者把命题锚定在具体工况上;第四个要素是这门学科真正的立场:它承认无法保证单个产品不失效,只对总体的失效规律下注

浴盆曲线与 Weibull:故障率的时间形状

把一大批同类产品的故障率(hazard rate,产品活到时刻 t 后紧接着失效的条件概率)画成时间函数,经典教科书会给出一条浴盆形曲线:早期故障率高且递减(制造缺陷集中暴露),随后进入近似平坦区,最后随磨损与老化重新爬升。

浴盆曲线是对三类失效机制的概括,不是自然定律。真正让它可计算的是威布尔分布。1951 年,瑞典工程师威布尔(Waloddi Weibull)在《应用力学学报》上发表《一种适用面很广的统计分布函数》,提出用形状参数 β 一个旋钮覆盖三种情形:β < 1 时故障率递减(早期失效),β = 1 时退化为指数分布、故障率恒定,β > 1 时故障率递增(磨损失效)。β 小于 1,对策是加强出厂老炼筛选,让早期失效死在工厂里;β 大于 1,对策是按特征寿命安排预防性更换。

浴盆曲线的典型误用,是把"中间那段是平的"当成对一切产品的豁免——电子产品故障率可能全程递减,机械产品可能几乎没有平坦段。把三段论套在不肯配合的数据上,是可靠性报表里最昂贵的一类自欺。

MTBF 的统计陷阱

MTBF 是按可修复系统定义的:总运行时间除以故障次数。对不可修复的产品(卫星部件、保险丝、LED),正确的量是 MTTF(平均失效前时间)。混用是行业顽疾:把一次性产品的 MTTF 写成 MTBF,会让维护部门以为"坏了修一下就行"。

更深的陷阱藏在均值背后。MTBF 只有在故障率恒定——即寿命服从指数分布——时才是一个完整的描述。指数分布有个反直觉的性质:无记忆性,老设备下一千小时失效的概率与新设备完全相同。这也意味着在 MTBF 五倍的运行时间内,产品失效的概率约 99.3%。一旦真实分布是磨损型(β > 1),指数假设会同时低估老设备的危险、高估预防性更换的无用。MTBF 没有错,错的是把一个一维数字当作整条分布的替身。

FMEA 与 RPN:给失效模式排队,以及排队规则的裂缝

工程上最广泛使用的可靠性分析工具是故障模式与影响分析(FMEA):逐个部件穷举"它可能怎么坏、坏了会怎样、怎么防"。其制度化源头是 1949 年美国军方的 MIL-P-1629《故障模式、影响与危害性分析程序》;NASA 在阿波罗计划中大规模应用,国际版本是 IEC 60812,加上危害性分级后称 FMECA。

汽车工业给它装上一个流行的排序装置:风险优先数(RPN)= 严重度(S)× 发生度(O)× 探测度(D),各打 1 到 10 分,乘积越大越优先处理。对 RPN 的批评集中在三点。其一,三者是序数标度——"8 分"不比"4 分"严重两倍,相乘在数学上没有依据。其二,乘积严重撞车:(S,O,D)=(9,2,4) 与 (3,4,6) 都得 72,但前者是不可容忍的高严重度模式,后者只是平庸的中等模式。其三,评分对小组主观判断极其敏感,排序不稳。2019 年发布的 AIAG & VDA《FMEA 手册》正式放弃了 RPN 阈值排序,改用"措施优先级"(AP)查表法,优先保严重度——等于行业承认了乘积排序的缺陷。FMEA 框架本身仍不可替代,它最大的价值不在打分,而在那张被穷举出来的失效模式清单

冗余与共因失效:备份为什么会在同一时刻倒下

对付随机硬件故障,冗余是教科书答案:两个独立部件并联,各自失效概率 10⁻³,同时失效就是 10⁻⁶。这个乘法成立的前提是"独立",而独立性是冗余设计里最容易被偷走的假设。同一个批次、同一个软件、同一个房间、同一班维护人员——任何一项共享都可能让两套备份共享同一个死因。

福岛第一核电站,2011 年 3 月 11 日。 全厂共 13 台应急柴油发电机,其中 10 台海水冷却、3 台空冷。地震切断全部厂外电源,柴油机全部自动启动。约四十分钟后,14 米左右的海啸淹没厂房:1–3 号机组的水冷柴油机被淹停机(4 号机组一台水冷机事发时正在检修),两台空冷机本体未淹却因金属封闭开关柜进水而失去供电能力,5、6 号机组的水冷机则因应急海水泵失效而无法运行。最终只剩 6 号机组一台装在高处的空冷柴油机幸存,并向 5 号机组供电。1–3 号机组陷入全厂断电,堆芯相继熔毁。十几套备份败给的不是十几次独立故障,而是同一个死因的重复命中——这正是共因失效的定义。

软件是另一种共因失效。航天飞机有五台通用计算机,其中四台同步运行同一份主航空电子软件(PASS)互相表决,专治硬件随机故障;但四份一模一样的代码也意味着一个软件缺陷会同时撂倒四台机器。NASA 的对策是让第五台计算机运行由独立团队另行开发的备份飞行软件(BFS),只覆盖上升与再入等关键阶段。冗余防随机失效,多样性防系统失效——前者靠数量,后者靠刻意的不同。

可靠性增长与 HALT/HASS:让失效提前发生

可靠性不是算出来的,是被失效喂大的。1964 年,通用电气的杜安(J. T. Duane)在 IEEE 汇刊上发表《可靠性监控的学习曲线方法》,发现一个经验规律:在"试验—分析—改进"循环中,累计故障率随累计试验时间按幂律下降。克劳(L. H. Crow)后来将其形式化为 AMSAA/Crow 模型。

把这一思想推到极端的是加速应力试验。1988 年,工程师格雷格·霍布斯(Gregg Hobbs)提出 HALT(高加速寿命试验):对样品施加远超规格的步进温度、振动与电压,直到把它整坏——目的不是验证合格,而是用最快速度逼出设计薄弱环节,改完再压,如此往复。量产后的 HASS(高加速应力筛选)以低一档应力逐件筛选,把早期失效拦在厂内。HALT/HASS 的逻辑与统计建模恰好相反:它不拟合分布、不预测寿命,只负责让失效提前发生、让原因提前暴露

案例:当概率估算走上审判席

WASH-1400:第一份反应堆概率风险评估。 1975 年 10 月,美国核管会发布了由 MIT 教授诺曼·拉斯穆森(Norman Rasmussen)主持的《反应堆安全研究》(WASH-1400)。报告首次用事件树—故障树方法,估算压水堆堆芯熔毁概率约为每堆年 5×10⁻⁵(约两万堆年一次),并宣称百座反应堆的风险远小于其他人为与自然风险。方法开创了一个时代,结论却引爆了争议:1978 年,以物理学家哈罗德·刘易斯(Harold Lewis)为首的评审组发表报告,肯定 PRA 方法论的价值,同时批评其不确定性分析不足、执行摘要措辞误导;1979 年 1 月,NRC 发表政策声明,撤回了对执行摘要的背书。两个月后,三里岛事故发生——其事故序列(小破口失水)恰在 WASH-1400 的场景清单之内。PRA 的对错分成了两层:作为方法论它赢了,作为数字它教会了行业敬畏不确定性。此后 PRA 成为各国核安全监管的标准工具(详见 核能)。

航天飞机:两组数字相差一千倍。 1986 年挑战者号事故后,费曼在罗杰斯委员会报告附录 F 中记录了一组刺眼的对比:对"一次飞行损失航天飞机与乘组"的概率,管理层估约十万分之一,一线工程师估约百分之一。十万分之一意味着每天飞一次、三百年才丢一架。费曼追查发现,管理层把"以往没出过大事"直接外推成"几乎不可能出事"——用历史侥幸冒充可靠性论证。航天飞机最终 135 次飞行损失两架,实测记录落在了工程师一侧。这是可靠性工程的元教训:可靠度数字本身也是一个需要论证的工程产物,它的出处(数据、模型还是愿望)比它的位数更重要。

争议与边界:不能推出什么

不能从"算出了概率"推出"风险被接受"。 5×10⁻⁵ 这样的数字只描述频率的估计,不回答"社会是否容忍"。WASH-1400 执行摘要当年正是栽在把"概率小"直接写成"风险可接受"上——后者是价值判断,不归可靠性工程师投票。

不能把历史无事故当作可靠度证据。 挑战者号发射前 O 形环异常已有多次记录,"以前都没炸"被反复引用为放行理由。可靠性意义上的证据是载荷—强度裕度与失效物理数据,不是幸存者列表。这与 人因工程 揭示的"偏差正常化"是同一种病的两个侧面。

不能指望冗余与筛选替代设计正确性。 对设计错误、需求错误、组织错误这类共因失效,增加副本毫无作用。可靠性工具链(FMEA、增长试验、PRA)能在正确的设计上榨出余量,救不回一个被想错的需求。

最后划清专业边界:本文为原理性通识介绍。具体产品的可靠性指标论证、安全完整性等级(SIL)定级、核设施 PRA 建模与适航符合性验证,须由持照专业人员结合现场规范、适用标准与实际工况判断;本文不构成任何工程决策依据。

跨域连接

  • 失效分析:可靠性工程预测失效,失效分析解剖失效,两者共用同一套失效物理。FMEA 清单里的每一种失效模式,几乎都对应着事故史上真实发生过的案例;每一次根因调查的结论又会回流为下一代产品的失效率数据与设计准则。预测与解剖之间的闭环,是可靠性数字能逐年变准的根本原因。
  • 系统工程:可靠性指标是典型的系统级需求——它跨越所有子系统,必须在需求阶段被分配、在验证阶段被检验。费曼记录的"十万分之一"正是系统工程意义上的确认失败:指标来自管理层的愿望而非工程的论证。可靠性分配回答的是"每个子系统各自要多可靠,整体才够可靠"。
  • 人因工程:浴盆曲线之外还有一条没画上去的失效通道——人。三里岛的仪表误导、挑战者号的决策压力都表明:硬件可靠度再高,操作与组织环节的失误率仍可能主导系统风险。现代 PRA 已把人因失误概率纳入事件树,但人的失效远不如部件那样服从平稳分布,这是可靠性量化最难啃的一段。
  • 核能:核电是 PRA 方法的发源地,也是其最严苛的应用场。从 WASH-1400 到福岛事故后各国的压力测试,核能安全分析的演进几乎就是一部可靠性工程方法史:事件树、共因失效分析、外部灾害裕度,每一项工具都对应着一次真实事故的学费。
  • 统计学:可靠性工程是统计学最硬核的应用分支之一——删失数据、小样本、极值外推样样齐全。Weibull 拟合本质上是带删失的生存分析;用几十次试验去论证十万分之一的失效率,置信区间的宽度往往比点估计本身更诚实。MTBF 之争归根结底是"一个均值能代表多少分布信息"的统计学问题。

参考文献

  • Weibull, Waloddi. "A Statistical Distribution Function of Wide Applicability." Journal of Applied Mechanics, 18(3): 293–297, 1951. DOI: 10.1115/1.4010337.
  • U.S. Nuclear Regulatory Commission. Reactor Safety Study: An Assessment of Accident Risks in U.S. Commercial Nuclear Power Plants(WASH-1400 / NUREG-75/014). 1975.
  • Lewis, Harold W., et al. Risk Assessment Review Group Report to the U.S. Nuclear Regulatory Commission(NUREG/CR-0400). 1978.
  • Feynman, Richard P. "Personal Observations on Reliability of Shuttle." 载 Report of the Presidential Commission on the Space Shuttle Challenger Accident, Appendix F, 1986.
  • Duane, J. T. "Learning Curve Approach to Reliability Monitoring." IEEE Transactions on Aerospace, 2(2): 563–566, 1964.
  • U.S. Department of Defense. MIL-P-1629: Procedures for Performing a Failure Mode, Effects and Criticality Analysis. 1949(1980 年修订为 MIL-STD-1629A).
  • IEC 60812:2018. Failure Modes and Effects Analysis (FMEA and FMECA). International Electrotechnical Commission, 2018.
  • AIAG & VDA. AIAG & VDA FMEA Handbook. 1st ed., 2019.

延伸阅读

  • O'Connor, Patrick, and Andre Kleyner. Practical Reliability Engineering. 5th ed., Wiley, 2012.
  • Rausand, Marvin, Anne Barros, and Arnljot Høyland. System Reliability Theory: Models, Statistical Methods, and Applications. 3rd ed., Wiley, 2021.
  • Hobbs, Gregg K. Accelerated Reliability Engineering: HALT and HASS. Wiley, 2000.
  • Modarres, Mohammad, Mark Kaminskiy, and Vasiliy Krivtsov. Reliability Engineering and Risk Analysis. 3rd ed., CRC Press, 2016.