Устойчивость к общей причине отказа
Устойчивость к общей причине отказа — это свойство системы, её компонента или элемента сохранять работоспособность при воздействии одного или нескольких событий, имеющих единый источник (общую причину), которые могут привести к одновременному отказу нескольких функционально независимых частей системы. Данное понятие является ключевым в теории надёжности, технике безопасности и анализе рисков, особенно в системах, критически важных для безопасности (атомная энергетика, авиация, космонавтика, системы управления химическими процессами).
Определение и сущность
Традиционные методы анализа надёжности часто предполагают, что отказы отдельных элементов системы являются независимыми событиями. Однако на практике существует класс отказов, называемых отказами по общей причине (ООП) или отказами общего вида (ООВ), которые нарушают это предположение. Отказ по общей причине — это событие, при котором два или более отдельных, функционально независимых элемента системы отказывают одновременно или в течение короткого промежутка времени из-за одного и того же исходного события (причины).
Устойчивость к общей причине отказа — это способность системы противостоять таким событиям. Она достигается за счёт применения специальных проектных решений, организационных мер и процедур эксплуатации, которые снижают вероятность того, что одно событие вызовет множественные отказы.
Причины возникновения отказов по общей причине
Причины, приводящие к отказам по общей причине, можно разделить на несколько категорий:
- Внешние воздействия: Единичные природные или техногенные события, которые одновременно воздействуют на несколько элементов системы. Примеры: удар молнии в линию электропередачи, вызывающий короткое замыкание и отключение нескольких подстанций; землетрясение, повреждающее фундаменты нескольких зданий; пожар, распространяющийся на несколько помещений с оборудованием; наводнение, затопляющее насосные станции; падение самолёта на объект критической инфраструктуры.
- Конструктивные и производственные дефекты: Ошибки, допущенные на этапе проектирования, изготовления или монтажа, которые приводят к одинаковому дефекту во всех элементах одного типа. Например, неправильный выбор материала для уплотнительных колец может привести к их одновременному разрушению на всех насосах одной серии; заводской брак в партии предохранителей может вызвать их одновременное срабатывание при номинальном токе; ошибка в монтаже системы пожаротушения может привести к её неработоспособности на всех этажах здания.
- Эксплуатационные факторы: Ошибки персонала, неправильные процедуры технического обслуживания или ремонта. Например, отключение не той задвижки при проведении регламентных работ может привести к остановке нескольких технологических линий; использование несоответствующей смазки для всех подшипников вентиляторов может вызвать их одновременный выход из строя; неправильная калибровка датчиков давления на всех параллельных контурах.
- Внутренние причины: Взаимовлияние элементов системы друг на друга. Например, разрыв одного трубопровода может привести к затоплению и выходу из строя соседнего электрооборудования; вибрация от одного насоса может вызвать усталостное разрушение креплений соседних агрегатов.
- Человеческий фактор: Одно и то же неправильное действие оператора, выполняемое в отношении нескольких элементов. Например, оператор, следуя ошибочной инструкции, может одновременно отключить все резервные насосы; неверная оценка ситуации может привести к принятию решения, которое выведет из строя несколько независимых систем безопасности.
Методы обеспечения устойчивости
Для обеспечения устойчивости к общей причине отказа применяется комплекс мер, направленных на предотвращение, обнаружение и смягчение последствий ООП. Основные методы включают:
Разнообразие (диверсификация)
Использование в системе элементов, основанных на разных физических принципах, конструкциях, технологиях или программном обеспечении. Это снижает вероятность того, что одна и та же причина (например, дефект конструкции) вызовет отказ всех элементов. Примеры:
- Использование в системе безопасности двух разных типов детекторов пожара (дымового и теплового).
- Применение в резервных каналах управления насосами разных производителей или разных моделей.
- Использование в системе управления двух разных операционных систем (например, Windows и Linux) для разных резервных контроллеров.
Физическое разделение (изоляция)
Размещение функционально независимых элементов системы на достаточном расстоянии друг от друга, в разных помещениях, зданиях, или с использованием физических барьеров (стены, экраны, кабельные каналы). Это предотвращает распространение локального воздействия (пожара, затопления, взрыва) на все элементы.
- Прокладка резервных кабелей электропитания по разным трассам.
- Установка резервных насосов в отдельных, изолированных помещениях.
- Размещение аварийных дизель-генераторов в разных зданиях на территории электростанции.
Функциональное разделение
Организация работы системы таким образом, чтобы отказ одной функции не приводил к отказу другой. Например, система охлаждения реактора может быть разделена на несколько независимых контуров, каждый из которых способен обеспечить отвод тепла.
Избыточность (резервирование)
Включение в систему дополнительных (резервных) элементов, которые могут взять на себя функции отказавших. Однако при проектировании избыточности необходимо учитывать ООП: если все резервные элементы имеют общую причину отказа, то избыточность не даёт эффекта. Поэтому избыточность часто сочетается с разнообразием и разделением.
Тестирование и диагностика
Регулярное проведение испытаний и проверок для выявления скрытых дефектов, которые могут стать причиной ООП. Это включает в себя:
- Периодические испытания резервного оборудования.
- Мониторинг состояния изоляции кабелей.
- Анализ данных о отказах и дефектах, поступающих от производителей и эксплуатантов аналогичных систем.
Анализ и управление
Систематический анализ возможных отказов по общей причине на этапе проектирования и эксплуатации. Для этого используются специальные методы, такие как Анализ отказов по общей причине (АООП) или Анализ событий с общей причиной (АСОП). Результаты анализа используются для корректировки проектных решений, процедур эксплуатации и планов технического обслуживания.
Примеры и последствия
Недостаточная устойчивость к общей причине отказа может привести к катастрофическим последствиям.
- Авария на АЭС «Фукусима-1» (2011): Землетрясение и последовавшее за ним цунами стали общей причиной отказа для всех резервных дизель-генераторов и систем охлаждения, расположенных в подвальных помещениях. Это привело к расплавлению активной зоны трёх реакторов и выбросу радиоактивных веществ. Несмотря на наличие избыточности, отсутствие физического разделения и защиты от внешнего воздействия (цунами) сделало систему уязвимой.
- Авиакатастрофа Boeing 737 MAX (2018, 2019): Система MCAS (Maneuvering Characteristics Augmentation System) была спроектирована таким образом, что её срабатывание основывалось на показаниях одного датчика угла атаки. Отказ этого датчика (общая причина) приводил к неверным командам MCAS, что в сочетании с недостаточной подготовкой пилотов привело к двум катастрофам.
- Отключение электроэнергии в Северной Америке (2003): Ошибка оператора и сбой в системе управления одной из линий электропередачи в Огайо (США) привели к каскадному отключению более 250 электростанций. Общей причиной стало отсутствие эффективной системы мониторинга и координации между различными энергосистемами, что привело к одновременному отказу множества линий и генераторов.
Критика и ограничения
Абсолютная устойчивость к общей причине отказа недостижима. Всегда существует вероятность того, что возникнет событие, которое не было предусмотрено проектом (например, падение крупного метеорита или целенаправленная диверсия). Кроме того, меры по обеспечению устойчивости (разнообразие, разделение) могут значительно увеличивать стоимость, сложность и массу системы.
Основная критика заключается в том, что анализ ООП часто является недостаточно глубоким, особенно на ранних этапах проектирования. Сложность выявления всех возможных связей и взаимозависимостей между элементами системы приводит к тому, что некоторые сценарии остаются неучтёнными. Также существует проблема «слепого доверия» к избыточности: инженеры могут полагать, что наличие нескольких резервных каналов гарантирует надёжность, не учитывая возможность их одновременного отказа по общей причине.
Источники
- ГОСТ Р 27.301-2021 «Надёжность в технике. Анализ видов и последствий отказов».
- ГОСТ Р 27.002-2015 «Надёжность в технике. Термины и определения».
- NUREG/CR-5485 «Guidelines on the Treatment of Common-Cause Failures in Probabilistic Risk Assessment». U.S. Nuclear Regulatory Commission.
- «Reliability Engineering: Theory and Practice» by Alessandro Birolini.
- «System Reliability Theory: Models, Statistical Methods, and Applications» by Marvin Rausand and Arnljot Høyland.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →