Назад към блога

Пет техники за надеждност при анализ на устойчивостта на промишлените системи към откази

Разгледайте пет практични техники за надеждност при оценяване на отказоустойчиви системи. Научете как FTA, FMEA, симулациите по метода Монте Карло, RCA и моделите на Марков подпомагат по-безопаснот...

Защо отказоустойчивостта изисква повече от резервирано хардуерно оборудване

Всяка промишлена система в крайна сметка ще претърпи повреди. Сензорите се разкалибрират, захранващите устройства се влошават, комуникационните връзки стават нестабилни, а механичните компоненти се износват при многократно натоварване. Следователно целта на отказоустойчивото инженерство не е да създаде оборудване, което никога не може да откаже. Целта му е да гарантира, че предвидимите повреди няма незабавно да се превърнат в неконтролирани откази на системата.

Отказоустойчива система може да продължи да предоставя приемлива функция, след като един или повече компоненти станат недостъпни. В някои приложения системата трябва да поддържа пълно производство. В други е приемлив намален капацитет, докато техническото обслужване възстанови отказалия канал. Вместо това системите, критични за безопасността, могат да преминат в контролирано безопасно състояние, когато продължаването на работата би създало неприемлив риск.

Излишните компоненти често са част от тази стратегия, но самото дублиране не доказва отказоустойчивост. Два контролера все пак могат да зависят от едно захранване, един мрежов комутатор или една софтуерна конфигурация. Два предавателя могат да използват общ импулсен тръбопровод и да откажат поради едно и също запушване. Затова анализът на надеждността трябва да изследва цялостната архитектура, включително зависимостите, които не се виждат непосредствено в списъка на оборудването.

Пет метода са особено полезни за тази работа. Анализът на дървото на отказите изследва как комбинации от откази могат да доведат до определено основно събитие. Анализът на видовете и последствията от отказите проучва как могат да откажат отделни компоненти и как тези откази влияят на системата като цяло. Симулацията по метода Монте Карло изследва неопределеността при множество възможни сценарии на работа и откази, докато анализът на първопричината изследва защо е възникнало реално събитие. Марковските модели описват как ремонтируемите системи преминават с течение на времето между нормално, деградирало, отказало и възстановено състояние.

Промишлена инженерна дейност по надеждността за системи, които не могат да избегнат всяка повреда

Фигура 1. Промишлените системи не могат да избегнат всяка повреда, но дисциплинираната инженерна дейност по надеждността може да предотврати превръщането на много повреди в пълни откази.

Надеждност, готовност, безопасност и поддържаемост не са едно и също

Терминологията на надеждността често се използва неточно, което може да предизвика объркване по време на прегледите на проекта. Надеждността описва вероятността оборудването да изпълнява изискваната му функция за определен период. Готовността описва дали оборудването е готово, когато процесът има нужда от него. Дадена система може понякога да отказва, но да поддържа висока готовност, когато ремонтите се извършват бързо и резервните части са незабавно достъпни.

Поддържаемостта описва доколко ефективно може да бъде диагностицирана и възстановена отказала система. Безопасността описва дали отказите остават в приемливите граници на риска за персонала, околната среда и оборудването. Тези свойства си влияят взаимно, но подобряването на едно свойство не подобрява автоматично всички останали. Защитното изключване може да намали производствената готовност, като същевременно значително подобри безопасността на инсталацията.

Отказоустойчивостта обхваща всички тези дисциплини. Тя зависи от резервираността, диагностиката, изолирането, възможността за ремонт и контролираното влошаване на работата. Тя зависи и от ясното определяне на необходимата функция. Инженерите не могат да определят дали една система е отказоустойчива, преди да знаят каква производителност трябва да се запази след всеки достоверен отказ.

Например система за защита на компресор може да трябва да запази възможността за аварийно изключване след отказ на един сензор. Система за управление на процес може да трябва само да поддържа стабилна работа, докато един контролер бъде заменен. Схема за защита на електрозахранването може да изисква независими канали, така че един общ отказ да не може да изключи едновременно основната и резервната защита. Техниките за надеждност помагат на инженерите да превърнат тези изисквания в изпитвани конструкции.

Избор на метод според инженерния въпрос

Петте техники за надеждност разглеждат различни аспекти на един и същ проблем. FTA започва с нежелано събитие в системата и работи назад към отказите, които могат да го причинят. FMEA започва с компонентите или функциите и проследява напред последствията от всеки режим на отказ. Симулацията по метода Монте Карло изследва ефекта от несигурността, като повтаря системния модел при множество случайно генерирани условия.

RCA обикновено започва след реален инцидент, като използва доказателства, за да разграничи видимите симптоми от основните технически и организационни причини. Моделирането по Марков се съсредоточава върху състоянията на системата и скоростите, с които системата преминава между тях. То е особено полезно, когато ремонтът, работата в режим на готовност, влошената производителност и диагностичното покритие оказват силно влияние върху готовността.

Правилният избор зависи от въпроса, който се разглежда. Екип, изследващ как може да възникне пълна загуба на охлаждането, обикновено ще започне с FTA. Проектантски екип, който преглежда всеки възможен отказ на предавател, контролер и клапан, ще извлече по-голяма полза от FMEA. Мениджър на активи, сравняващ несигурни интервали за техническо обслужване, може да използва симулация по метода Монте Карло, докато инженер по надеждността, изчисляващ дългосрочната готовност на двойка резервирани контролери, може да предпочете модел на Марков.

Тези методи са допълващи се, а не взаимозаменяеми. FMEA може да идентифицира режими на отказ, които по-късно се превръщат в базови събития в дърво на отказите. Констатациите от RCA могат да коригират нереалистични допускания за откази в модел на Марков. Симулацията по метода Монте Карло може да провери как несигурните вероятности влияят върху заключенията от FTA или върху планирането на техническото обслужване.

Анализът на дървото на отказите започва с последицата

Анализът на дървото на отказите е дедуктивен метод, който започва с едно ясно дефинирано нежелано събитие. Това събитие се нарича върхово събитие. Подходящи примери са загуба на цялата захранваща вода към котела, отказ на функцията за изключване на турбината, пълна загуба на комуникацията с контролера или неконтролирано повишаване на налягането в реактора. Определението трябва да е достатъчно конкретно, за да позволи съдържателен анализ.

Върхово събитие, описано само като „повреда на системата“, обикновено е твърде неясно. То не определя коя функция е отказала, колко дълго е продължил отказът или кое работно състояние е било приложимо. По-добро определение би било „загуба на целия поток охлаждаща вода за повече от шестдесет секунди по време на нормално производство“. Тази формулировка осигурява ясна граница за анализа.

След като върховото събитие бъде определено, екипът идентифицира непосредствените условия, които могат да го предизвикат. Тези условия се разлагат до събития на по-ниско ниво, докато анализът достигне базови откази на компоненти, външни смущения или човешки действия. Логическите елементи свързват събитията и описват как те се комбинират. Елементите ИЛИ показват, че всяко изброено събитие може да предизвика събитие от по-високо ниво, докато елементите И изискват няколко събития да настъпят едновременно.

Завършеното дърво предоставя визуално представяне на логиката на отказите. То позволява на специалисти по електрически, механични системи, измервателна апаратура, технологични процеси, поддръжка и безопасност да преглеждат една и съща система от обща гледна точка. Този споделен модел е една от най-големите практически предимства на FTA. Той улеснява оспорването на скритите допускания, преди те да бъдат заложени в проекта.

Анализ на дървото на отказите, свързващ отказите на компонентите с промишлено върхово събитие

Фигура 2. Дървото на отказите работи в обратна посока от определено върхово събитие и идентифицира комбинациите от откази на по-ниско ниво, които могат да го предизвикат.

Разработване на дърво на отказите стъпка по стъпка

Първата практическа задача е да се определи границата на системата. Инженерите трябва да решат кое оборудване, комунални услуги, софтуер, оператори и външни услуги се включват в анализа. Изследването на охладителна система може да включва помпи, клапани, електроразпределение, измервателни уреди и логика за управление. Може също да е необходимо да се включат източникът на вода, условията на околната среда и реакцията на оператора, когато тези фактори могат да повлияят на върховото събитие.

След това екипът идентифицира непосредствените причини. Пълна загуба на охлаждане може да възникне, ако всички помпи станат недостъпни, ако общият захранващ колектор се запуши или ако спирателните клапани се затворят неправилно. Всяка непосредствена причина се разлага допълнително. Недостъпността на помпата може да е резултат от повреда на двигателя, блокиране на лагер, загуба на засмукване, повреда на контролера или загуба на електрозахранване.

Процесът продължава, докато по-нататъшното разлагане не подобри решението. Събитията на най-ниско ниво се разглеждат като базови събития и за тях могат да се зададат вероятности или честоти на отказ. След това логическата структура може да бъде оценена качествено или количествено. Дори когато няма точни числови данни, дървото може да разкрие единични точки на отказ и неочаквани споделени зависимости.

Количественият FTA комбинира вероятностите на събитията според структурата на логическите врати. Изчислението може да изглежда просто, но допусканията за независимост изискват внимателен преглед. Две събития, които споделят един и същ източник на захранване, околна среда, дейност по поддръжката или софтуерен дефект, не са напълно независими. Пренебрегването на тези зависимости може да направи резервирания проект да изглежда значително по-безопасен, отколкото е в действителност.

Минималните сечения показват най-опасните комбинации

Минимално сечение е комбинация от базови събития, която предизвиква върховото събитие. Минималното сечение не съдържа ненужно събитие, тоест премахването на което и да е събитие би предотвратило настъпването на върховото събитие. Тези комбинации помагат на инженерите да идентифицират най-кратките и най-важните пътища на отказ. Те са особено ценни, когато голямото дърво на отказите съдържа стотици събития.

Едноелементно минимално сечение показва, че един отказ може пряко да предизвика върховото събитие. Такива резултати обикновено изискват незабавно внимание при проектирането. Екипът може да добави резервираност, да подобри изолирането, да осигури отделно захранване или да въведе допълнителен защитен слой. Минималните сечения от две и три събития често представляват откази в резервирани архитектури.

Не всяко кратко минимално сечение носи еднакъв риск. Комбинация от две събития, свързани с чести откази, може да е по-значима от едно изключително рядко външно събитие. Времето за откриване и ремонт също влияе върху значимостта. Скрит отказ, който остава неоткрит в продължение на месеци, създава много по-дълъг период на излагане на риск от повреда, открита и отстранена незабавно.

Софтуерът за FTA може да подрежда минималните сечения според изчисления им принос. Инженерите обаче трябва да изследват и физическия смисъл зад числата. Математически малка вероятност може да се основава на слаби допускания или общи данни, които не отразяват действителната инсталация. Инженерната преценка остава необходима през целия анализ.

Пример: Резервираност на помпите за питателна вода на котела, която не е действително независима

Да разгледаме електроцентрала, която работи с две помпи за питателна вода на котела. Всяка помпа може да поддържа минимално необходимия дебит, така че системата изглежда способна да понесе отказ на една помпа. Простото преброяване на оборудването предполага пълна резервираност. Дървото на отказите може да разкрие различна реалност, когато се включат споделените зависимости.

Двата помпени двигателя могат да получават захранване от една и съща електрическа шина. Двете помпи могат да засмукват от един смукателен колектор, да зависят от една и съща система за управление или да получават команди от едно измерване на нивото. Следователно единична повреда на шината, блокиран смукателен колектор или неправилен общ сигнал може да изведе от строя и двете помпи едновременно. Привидната резервираност от две помпи няма да осигури защита срещу тези общи откази.

Анализът може да доведе до няколко практически подобрения. Отделните електрозахранвания могат да намалят риска от обща загуба на захранване. Разнообразните измервания на нивото могат да намалят зависимостта от една технология на трансмитер. Независимите пътища за управление, подобреното ръчно управление и по-добрият мониторинг на засмукването могат да укрепят архитектурата, без непременно да се добавя още една цялостна помпа.

Този пример показва защо FTA е по-полезен от простото преброяване на резервираните устройства. Той оценява дали устройствата остават независими при реални работни условия. Също така показва къде допълнителната сложност осигурява действителна защита и къде само създава впечатление за защита.

Къде анализът на дървото на отказите работи добре — и къде не

FTA е особено ефективен за функции за безопасност, защитни системи, електрически разпределителни системи, комуникационни мрежи и други приложения с ясно дефинирано нежелано събитие. Визуалната му структура подпомага прегледите на проекта и регулаторните обсъждания. Той може да се използва качествено за разкриване на слабости или количествено за оценка на вероятността за основното събитие.

Методът става по-малко ефективен, когато основното събитие е дефинирано неточно. Поддръжката му също може да се усложни, когато дървото се разрасне до хиляди събития. Динамичните последователности, действията по поддръжката и променящите се работни състояния могат да изискват специализирани логически елементи или допълнителни техники за моделиране. Статичното дърво на отказите не описва естествено всяка зависимост, изменяща се във времето.

Човешките действия също изискват внимателно разглеждане. Вероятността за реакция на оператора зависи от качеството на алармата, дизайна на процедурата, обучението, натоварването, наличното време и условията на интерфейса. Определянето на една обща вероятност за човешка грешка може да прикрие тези различия. При сериозни анализи следва да се привличат специалисти по човешки фактори, когато действието на оператора е от ключово значение за резултата.

Затова FTA е най-ефективен, когато се използва като част от по-широка програма за надеждност. FMEA може да предостави подробна информация за видовете откази на компонентите, докато методите на Марков или Монте Карло могат да обхванат ремонта, последователността и неопределеността. Нито едно дърво не бива да се разглежда като пълно представяне на всяко поведение на системата.

Анализът на видовете откази и последствията започва с компонента

Анализът на видовете откази и последствията (FMEA) използва индуктивен подход. Вместо да започва с основно събитие, екипът започва с компонент, функция или стъпка от процеса. След това разглежда как този компонент може да откаже и какво въздействие би имал всеки отказ локално и в рамките на системата. Тази посока прави FMEA особено полезен при проектиране и преглед на оборудването.

Трансмитерът за налягане може да откаже по няколко различни начина. Изходът му може да се отклони към висока или ниска стойност, да замръзне на една стойност, да стане нестабилен или да изчезне напълно. Всеки режим води до различно експлоатационно последствие. Високо показание може да причини ненужно изключване, докато ниско показание може да скрие опасно налягане.

FMEA принуждава екипа да опише тези различия, вместо да записва само „повреда на трансмитера“. Той разглежда и съществуващите мерки за предотвратяване и откриване. Анализът може да идентифицира диагностика, логика за сравнение, функционални изпитвания, аларми, байпаси или проверки от оператора, които намаляват последствията. Недостатъчната откриваемост често се оказва също толкова важна, колкото и първоначалният режим на повреда.

Работен лист за анализ на видовете и последствията от отказите за преглед на индустриалната надеждност

Фигура 3. FMEA оценява отделните режими на повреда, техните ефекти, тежестта им и наличните мерки за предотвратяването или откриването им.

Какво трябва да съдържа един ефективен работен лист за FMEA

Полезният работен лист за FMEA започва с елемента и необходимата му функция. Режимът на повреда описва как функцията може да бъде загубена, влошена или изпълнена неправилно. Локалният ефект описва какво се случва на ниво компонент, докато системният ефект описва по-широкото експлоатационно или безопасностно последствие. Причините и механизмите се записват отделно от ефектите.

Работният лист документира и съществуващите мерки за контрол. Превантивните мерки намаляват вероятността от възникване на повредата. Мерките за откриване разкриват повредата, преди тя да доведе до неприемливо последствие. Примерите включват самодиагностика, сравнение между резервирани сигнали, алармени граници, функционални изпитвания, инспекции и прогнозна поддръжка.

Много организации определят оценки за тежест, честота на възникване и откриваемост. Понякога тези стойности се умножават, за да се получи число за приоритет на риска. То може да подпомогне приоритизирането, но никога не трябва да заменя техническата преценка. Различни комбинации могат да дадат една и съща оценка, дори когато последствията им са фундаментално различни.

Рядка катастрофална повреда може да заслужава повече внимание от често срещано незначително неудобство, дори когато изчислените им оценки изглеждат сходни. Затова тежестта трябва да се преглежда независимо. Екипите също трябва да приоритизират действия, които отстраняват механизма на повредата или намаляват последствията, вместо да разчитат единствено на допълнителни инспекции.

Пример: Резервирани PLC входове със споделена слабост

Разгледайте два цифрови входни канала, наблюдаващи един авариен полеви превключвател. Архитектурата изглежда резервирана, тъй като два PLC входа получават сигнала. FMEA анализира дали целият път на сигнала действително е независим. Той обхваща полевия контакт, окабеляването, захранването на входа, клемните сглобки, модулите, логиката и диагностичното поведение.

Възможните видове откази включват прекъсната верига, късо съединение, заварен контакт, канал, блокиран във високо състояние, канал, блокиран в ниско състояние, или загуба на общото захранване на входовете. Анализът също така проверява дали се открива несъответствие между каналите. Ако и двата канала споделят един полеви контакт и един кабел, много реалистични откази засягат едновременно и двата канала.

Прегледът може да покаже, че дублираните входни модули осигуряват ограничена допълнителна защита. Може да са необходими отделни контакти, наблюдавани полеви вериги, независими захранващи пътища или разнообразни принципи на измерване. Процедурата за изпитване с доказване също трябва да проверява цялата сигнална верига, а не само модула на PLC.

При защитни архитектури инженерите могат също да прегледат подходящи индустриални модули за безопасност, проектирани за диагностично покритие, резервираност и контролирано поведение при отказ. Изборът на хардуер все пак трябва да следва пълния жизнен цикъл на безопасността и не може да замени анализа, специфичен за конкретното приложение.

FMEA на конструкцията и FMEA на процеса разглеждат различни рискове

FMEA на конструкцията изследва проектирания продукт или система. Тя проверява дали избраните архитектура, компоненти, материали и функции за управление могат да работят по предназначение. Методът обикновено се прилага по време на разработването на концепцията, детайлното проектиране и промените в конструкцията. Той е най-ценен, преди промяната на конструкцията да стане скъпа.

FMEA на процеса изследва дейностите по производство, сглобяване, монтаж, въвеждане в експлоатация или поддръжка. Един шкаф може да има правилна електрическа конструкция, но процесът на монтаж все пак може да доведе до разхлабени клеми, обърнат поляритет, неправилни номинали на предпазителите или неправилно идентифицирани проводници. Дейностите по поддръжката могат да доведат до неправилен фърмуер, неподходящи резервни части, деактивирани аларми или оставени активни байпаси.

Тези два вида FMEA трябва да се допълват. Проектните средства за управление могат да намалят чувствителността към монтажа, докато средствата за управление на процеса могат да предотвратят грешки при изпълнението, които проектът не може да отстрани. Прегледът само на конструкцията на оборудването оставя много рискове през жизнения цикъл без внимание. Прегледът само на работния процес може да скрие слабости, заложени в първоначалната архитектура.

При критични системи за автоматизация и двата анализа трябва да се актуализират след значителни промени. Подмяната на контролер, миграцията на мрежата, надстройката на софтуера или промяната в процедурата за изпитване с доказване могат да въведат нови видове откази. Историческите работни листове не бива да остават замразени, докато предприятието се развива около тях.

FMECA добавя по-формална оценка на критичността

Анализът на видовете откази, последствията и критичността разширява структурата на FMEA, като добавя формални изчисления на критичността. Методът може да използва честотите на откази на компонентите, експозицията при работа, фазите на мисията, категориите за тежест и условните вероятности. Той е полезен, когато една голяма система съдържа много видове откази и инженерните ресурси трябва да бъдат насочени към най-съществените фактори.

Изчисленията на критичността зависят в голяма степен от качеството на данните. Общите бази данни за честотата на отказите осигуряват отправна точка, но може да не отразяват реалната инсталация. Температурата, вибрациите, замърсяването, електрическото натоварване, качеството на техническото обслужване и работният цикъл влияят върху действителната производителност. Данните, специфични за предприятието, трябва да заменят общите допускания, когато е налична достатъчна експлоатационна история.

Анализът трябва също да разграничава отказите, откривани незабавно, от отказите, които остават скрити. Скрит отказ в резервна система може да не засегне производството, докато друг компонент не откаже или не възникне заявка за сработване. Продължителното скрито излагане на риск може да направи сравнително рядък отказ изключително важен. Затова трябва да бъдат включени интервалите за откриване и ефективността на функционалните изпитвания.

FMECA е най-полезна, когато резултатите ѝ водят до действия по конструкцията или техническото обслужване. Сложна таблица за класиране има малка стойност, ако не влияе върху архитектурата, резервните части, диагностиката, изпитванията или експлоатационните процедури. Целта остава практическото намаляване на риска, а не изчислението само по себе си.

Къде FMEA работи добре — и къде може да заблуди

FMEA осигурява дисциплиниран преглед на компонентите един по един. Тя е сравнително лесна за обяснение и подпомага участието на специалисти по инженеринг, експлоатация, техническо обслужване, качество и безопасност. Полученият регистър на действията може да бъде пряко свързан с промени в конструкцията, инспекции, диагностика и подобрения в техническото обслужване.

Методът може да стане повтарящ се, когато се прилага към много големи системи. Екипите могат да отделят прекомерно време за документиране на маловажни режими на отказ, като същевременно пропускат взаимодействията в системата. Традиционната FMEA също обикновено разглежда по един отказ наведнъж. Няколко едновременни отказа и събитията, зависещи от последователността, може да не се откроят ясно.

Системите за оценяване създават друг риск. Екипите могат да коригират оценките, за да постигнат предпочитан приоритет, или да приемат крайното число за по-обективно от залегналата в него преценка. Ниска оценка не доказва, че даден отказ е приемлив. Събитията с висока тежест, отказите по обща причина и регулаторните изисквания трябва да бъдат разглеждани отделно.

Качеството на FMEA зависи от хората, които я извършват. Работен лист, подготвен от един проектант, може да пропусне реални експлоатационни обстоятелства, познати на операторите и техниците. Задълбочените анализи съчетават проектантските знания с реалната история на техническото обслужване и експлоатационния опит.

Симулацията по метода Монте Карло превръща неопределеността в разпределение

Изчисленията за надеждност в промишлеността често включват неопределени входни данни. Срокът на експлоатация на компонентите варира, продължителността на ремонта се променя, доставката на резервни части е непредвидима, а натоварването от околната среда влияе върху поведението при отказ. Една усреднена стойност невинаги може да представи тези вариации. Симулацията по метода Монте Карло решава този проблем чрез многократно случайно семплиране.

Инженерът първо изгражда модел на системата и задава вероятностни разпределения на несигурните променливи. След това симулацията генерира множество възможни комбинации. При един прогон може да се приеме, че помпа отказва след 8 000 часа и се ремонтира в рамките на четири часа. При друг прогон може да възникне по-късен отказ, но ремонтът да продължи много по-дълго, тъй като необходимата резервна част не е налична.

След хиляди или милиони прогонове резултатите образуват разпределение. Моделът може да оцени очакваното време на престой, загубата на производство, готовността на системата, вероятността за успешно изпълнение на задачата, търсенето на резервни части или разходите за техническо обслужване. Той може също да покаже вероятността за екстремни резултати, които биха изчезнали в една-единствена средна стойност.

Разпределение от симулация Монте Карло за анализ на промишлената надеждност и престоите

Фигура 4. Симулацията Монте Карло оценява множество случайно генерирани сценарии на откази и ремонти, за да определи диапазон от възможни резултати.

Изграждане на надежден модел за анализ на надеждността чрез метода Монте Карло

Качеството на симулацията зависи от модела на системата. Моделът трябва да представя компонентите, правилата за експлоатация, разпределенията на отказите, поведението при ремонт, зависимостите, логиката на резервирането и ресурсите за техническо обслужване. Той може също да включва метеорологични условия, производствено търсене, логистични забавяния и човешка реакция, когато тези фактори влияят върху ефективността на системата.

Всеки симулиран прогон проследява системата във времето. Компонентите отказват според извадки от разпределенията, ремонтите започват, когато ресурсите станат налични, а моделът записва дали системата остава работоспособна, деградирала или недостъпна. Повтарянето на процеса дава оценки за различни показатели на ефективността.

Валидирането е от съществено значение. Екипът трябва да сравни модела с опростени изчисления, известни експлоатационни случаи и исторически резултати от централата. Неочакваните резултати трябва да бъдат проучени, а не приемани само защото са получени от софтуер. Впечатляваща визуално симулация все пак може да е грешна, когато заложената логика е непълна.

Анализът на чувствителността помага да се установи кои допускания определят резултата. Ако времето за ремонт оказва много по-голямо влияние от честотата на отказите, ръководството може да постигне по-голяма полза чрез подобряване на наличността на резервни части и бързината на диагностиката. Ако вероятността за отказ по обща причина доминира, добавянето на повече идентични компоненти може да донесе малка полза.

Избор на вероятностни разпределения, съответстващи на механизма на отказ

Експоненциалното разпределение приема постоянна честота на отказите. То може да е подходящо за някои електронни компоненти през полезния им експлоатационен живот. Разпределението на Weibull е по-гъвкаво и може да представя откази в началото на експлоатацията, случайни откази или поведение, свързано с износване. Логнормалните разпределения често са полезни за продължителността на ремонтите и за процеси, повлияни от няколко множителни фактора.

Изборът трябва да отразява физическия механизъм, а не удобството на софтуера. Повреда на лагер вследствие на износване не следва естествено същото поведение като случайна комуникационна грешка. Използването на постоянна честота на повредите и за двете може да изкриви дългосрочните прогнози. Инженерите по надеждност трябва да проучат експлоатационната история и механизмите на повредите, преди да изберат разпределението.

Историческите данни често изискват почистване. Системите за поддръжка може да объркват планираната подмяна с функционална повреда. Датите на повредите може да бъдат въведени при откриване на работната поръчка, а не при възникване на неизправността. Имената на активите, работните часове и кодовете на повредите също може да са непоследователни в различните обекти.

Ограничените данни не възпрепятстват анализа, но несигурността трябва да остане видима. Експертната преценка, информацията от доставчици и отрасловите бази данни могат да подпомогнат ранните оценки. Моделът трябва да тества реалистичен диапазон, вместо да представя едно несигурно предположение като точен факт.

Пример: Наличност на станция с три компресора

Да разгледаме станция с три газови компресора. Два агрегата са необходими за пълно производство, а третият осигурява резервен капацитет. Всяка машина има различни работни часове, история на поддръжката и ефективност на охлаждането. Само един основен ремонт може да се извършва едновременно, тъй като станцията разполага с един специализиран екип по поддръжката.

Резервните лагери изискват няколко дни за доставка, а повредите в охладителната система стават по-чести при високи температури на околната среда. Тези взаимодействия е трудно да бъдат представени с едно просто уравнение за наличност. Моделът Монте Карло може да симулира повреди на компресорите, продължителност на ремонтите, метеорологични периоди, наличност на техници и логистични забавяния.

Резултатите може да покажат наличност при пълен капацитет, работа при намален капацитет и пълно спиране на станцията. Ръководството може да сравни алтернативни инвестиции. Поддържането на допълнителен запас от лагери може да намали екстремните престои по-ефективно от назначаването на още един общопрофилен техник по поддръжката. Подобряването на надеждността на охлаждането може да донесе по-голяма стойност от подмяната на иначе изправен компресор.

Моделът може да тества и интервалите за поддръжка. По-кратките интервали за превантивна поддръжка може да намалят повредите, но да увеличат времето на планираните спирания и грешките, предизвикани от поддръжката. Симулацията позволява и двата ефекта да бъдат оценени в рамките на един и същ оперативен модел.

Къде симулацията Монте Карло работи добре — и къде се проваля

Методите Монте Карло са мощни, когато много несигурни променливи си взаимодействат. Те могат да представят сложна логистика, опашки за ремонт, метеорологични ефекти, производствено търсене и решения за поддръжка. Полученото разпределение предоставя повече информация от една-единствена средна стойност. То също така подпомага решенията, основани на риска, като показва вероятността от тежки, но редки резултати.

Основната слабост е достоверността на модела. Сложната симулация може да създаде фалшива увереност, тъй като резултатът ѝ изглежда числено прецизен. Програмата изчислява само последствията от допусканията, въведени от анализатора. Липсващи зависимости или нереалистични разпределения могат да доведат до подвеждащи резултати.

Симулацията също изисква достатъчно на брой изпълнения за постигане на стабилни оценки. Вероятностите за редки събития може да изискват специализирани техники за извадково моделиране, тъй като обикновената случайна симулация би изисквала непрактично голям брой изпълнения. Трябва да се посочват доверителни интервали, за да разбират потребителите статистическата неопределеност.

Следователно методът е най-ценен, когато логиката на модела, източниците на данни и ограниченията остават прозрачни. Решенията за надеждност не трябва да се основават на графика, чиито допускания не могат да бъдат обяснени на оперативния и инженерния персонал.

Анализът на първопричината започва след събитието

Анализът на първопричината изследва защо е възникнала действителна повреда, проблем с качеството или събитие, свързано с безопасността. Той надхвърля идентифицирането на повредения компонент. Двигателят може да спре, защото лагерът е блокирал, но замяната на лагера само възстановява работата. Разследването трябва да определи защо лагерът е достигнал това състояние.

По-дълбоките причини може да включват замърсяване, неправилно смазване, неподходящо съхранение, повреди при монтажа, прекомерно процесно натоварване или пропусната инспекция. Организационните условия също може да допринасят. Задачи по техническото обслужване може да са били премахнати, резервните части да са били неподходящи или производственият натиск да е забавил коригиращите дейности.

Затова RCA разграничава симптомите, преките физически причини, допринасящите условия и основните слабости на системата. Това разграничение не позволява на организацията да приема всеки ремонт за постоянно решение. То също така създава доказателства, които могат да подобрят бъдещите FMEA, FTA, планирането на техническото обслужване и оперативните процедури.

Проследяване на промишлена повреда чрез анализ на първопричината — от симптомите до основните причини

Фигура 5. RCA проследява повредата отвъд видимия симптом и идентифицира техническите и организационните условия, които са позволили възникването ѝ.

Доказателствата трябва да бъдат съхранени, преди предприятието да се върне към нормална работа

Промишлените доказателства могат бързо да изчезнат. Операторите може да нулират алармите, техниците може да заменят модули, а условията на процеса може да се променят. Регистрите на контролера могат да презапишат по-ранни събития, а повредените компоненти може да бъдат изхвърлени преди изследването им. Затова дисциплинираният процес на RCA започва със съхраняване на доказателствата.

Екипът трябва да събере трендове от исторически данни, списъци с аларми, регистри на събитията в контролера, записи от релета, работни поръчки, снимки, повредени части, версии на софтуера, конфигурационни файлове и наблюдения на операторите. Всеки елемент трябва да бъде идентифициран по източник и време. Физическите доказателства трябва да останат под контролиран достъп, докато разследването не определи дали е необходимо допълнително изследване.

На синхронизирането на времето трябва да се обърне особено внимание. Контролер, архиватор, защитно реле, сървър и система за поддръжка може да записват различни времеви отпечатъци. Разследващите трябва да коригират тези разлики, преди да изградят последователността на събитията. В противен случай по-късна аларма може неправилно да изглежда като първоначалното събитие.

Интервютата с операторите трябва да бъдат проведени своевременно, но внимателно. Хората може да помнят последователност и контекст, които автоматизираните системи не са записали. Техните изявления трябва да се разглеждат като доказателства, а не като повод за обвинения. Целта е да се разбере работната среда, в която са били вземани решенията.

Изграждане на хронология на събитията, преди да се зададе въпросът „Защо?“

Добре изградената хронология разграничава проверените факти от интерпретацията. Тя записва какво се е случило преди, по време на и след повредата. Всяко събитие трябва да бъде свързано с източник, например стойност от архиватор, запис на аларма, действие по поддръжката, снимка или свидетелско показание. Пропуските и несъответствията трябва да останат видими.

Първата аларма, показана на оператора, невинаги е първото физическо събитие. Потокът от аларми може да скрие първоначалното условие сред стотици вторични съобщения. Данните с висока разделителна способност за последователността на събитията могат да покажат, че нестабилността на налягането, смущението в електрозахранването или загубата на комуникация са започнали по-рано. Хронологията помага да се разграничи причината от следствието.

След като последователността бъде изяснена, екипът може да използва инструменти като метода „Петте защо“, диаграми „рибена кост“, анализ на бариерите, анализ на промените или диаграми на причинните фактори. Простите събития могат да бъдат обяснени чрез кратка причинно-следствена верига. Сложните инциденти обикновено включват няколко взаимодействащи технически и организационни условия.

Разследването не трябва да приключва след откриването на едно правдоподобно обяснение. Алтернативните хипотези трябва да бъдат проверени спрямо доказателствата. Неподкрепените предположения трябва да останат обозначени като предположения, а не да бъдат представяни като потвърдени причини.

Пример: Повтарящи се повреди на честотно регулируеми задвижвания

В дадено предприятие се наблюдават повтарящи се повреди на честотно регулируемо задвижване, което управлява един конвейер. След всеки случай поддръжката заменя задвижването и производството се нормализира. Няколко месеца по-късно друго задвижване се поврежда. Повтарящата се подмяна подсказва, че самото задвижване може да не е целият проблем.

Екипът по анализа на първопричината сравнява датите на повредите със записите за околната среда и поддръжката. Повечето повреди са възникнали през горещите летни периоди. Тенденциите на температурата в шкафа показват продължителна работа над предпочитания диапазон. При проверката се установяват запушени филтри, ограничен въздушен поток и значително натрупване на прах около охлаждащия въздушен път.

Историята на поддръжката показва, че редовното почистване на филтрите е било премахнато от графика за превантивна поддръжка след промяна в числеността на персонала. Задвижването е повреденият компонент, но прекомерната температура в шкафа е пряката физическа причина. Ограничената вентилация и липсващата задача по поддръжката са допринасящи и организационни причини.

Затова коригиращото действие трябва да надхвърля поредната смяна на задвижващ модул. Предприятието може да възстанови техническото обслужване на филтрите, да инсталира температурни аларми, да подобри охлаждането на шкафовете и да преразгледа конструкцията на корпусите. Ефективността трябва да бъде проверена през следващия период на високи температури.

Коригиращите действия трябва да са свързани с потвърдени причини

Много доклади от анализи на първопричината отслабват при планирането на коригиращите действия. Екипите могат да препоръчат допълнително обучение, без да докажат, че знанията са били недостатъчни. Могат да преразгледат процедурите, когато истинският проблем е лошият дизайн на оборудването. Могат да добавят проверки, които не могат да открият действителния механизъм на повредата.

Всяко действие трябва да е насочено към потвърдена причина или допринасящо условие. То трябва да има отговорник, срок за изпълнение и определен метод за проверка. Организацията трябва да разграничава временното ограничаване на последствията, коригиращото действие и дългосрочното превантивно действие. Възстановяването на производството не е същото като предотвратяването на повторна поява.

Ефективността трябва да бъде прегледана след внедряването. Изпълненото действие не е автоматично успешно. Предприятието трябва да потвърди дали вероятността от повреда е намаляла, дали новият контрол се използва и дали не е въвел друг риск. Тази обратна връзка затваря цикъла на подобряване на надеждността.

При сериозни разследвания може да е необходим независим преглед. Екипите, тясно ангажирани със събитието, могат да бъдат повлияни от предишни предположения или организационен натиск. Външен или междуфункционален преглед може да постави анализа под въпрос, преди да бъдат приети окончателните заключения.

Човешката грешка рядко е пълна първопричина

„Грешка на оператора“ и „грешка при техническото обслужване“ често се срещат в слаби разследвания. Тези етикети описват кой е извършил последното действие, но не обясняват защо действието е станало вероятно. Хората работят в рамките на интерфейси, процедури, нива на персонала, производствени изисквания, системи за обучение и конструкции на оборудването. Разследването трябва да изследва всички тези условия.

Операторът може да избере неправилния контролен елемент, защото два обекта на екрана изглеждат почти еднакви. Техникът може да монтира неправилната част, защото идентификацията е непоследователна. Ръководителят може да отложи техническото обслужване, защото организацията възнаграждава непрекъснатото производство, без да осигурява реалистичен времеви прозорец за спиране.

Разбирането на тези условия не отменя индивидуалната отговорност. То предотвратява възможността същата система да насочи друг човек към същата грешка. Разследването, съсредоточено върху вината, може да удовлетвори непосредственото изискване за поемане на отговорност, но да остави основната слабост непоправена.

Ефективният анализ на първопричината изследва как системата е повлияла на решението. Той проверява дали алармите са били разбираеми, процедурите — практични, натоварването — приемливо и необходимите инструменти — налични. Тези въпроси водят до по-ефективни коригиращи действия, отколкото простото инструктиране на хората да бъдат по-внимателни.

Където анализът на първопричината работи добре — и където не работи

RCA превръща реалния експлоатационен опит в превантивно знание. Той може да разкрие слабости в конструкцията, пропуски в техническото обслужване, процедурни проблеми и организационен натиск, които прогнозните изследвания са пропуснали. Констатациите му могат да подобрят моделите на надеждност и стандартите за бъдещи проекти.

Методът е реактивен, защото започва след настъпването на събитие. Индустриите с тежки последици не могат да разчитат само на извличането на поуки от откази. Проактивните методи като FMEA и FTA все още са необходими. RCA трябва да ги допълва, като актуализира предположенията с доказателства от реалната експлоатация.

Разследванията също могат да станат субективни. Пристрастието към потвърждение може да накара екипите да предпочетат първото обяснение, което изглежда подходящо. Липсващите доказателства могат да наложат изводите да останат несигурни. Силните доклади ясно разграничават потвърдените причини, допринасящите фактори, хипотезите и нерешените въпроси.

Стойността на RCA зависи от последващото изпълнение. Технически силното разследване носи малка полза, когато действията се забавят, отслабват или никога не се проверяват. Затова ангажираността на ръководството е също толкова важна, колкото и аналитичните умения.

Моделите на Марков проследяват системата през променящите се състояния

Моделирането на Марков представя системата чрез определени работни състояния. Една проста система може да съдържа само работоспособно и отказало състояние. Отказоустойчива система обикновено изисква допълнителни състояния, като напълно резервирано, деградирало, отказало, в ремонт или в очакване на резервна част. Преходите свързват тези състояния.

Интензитетът на отказите може да премести системата от напълно работоспособно в деградирало състояние. Друга повреда може да я премести от деградирало в недостъпно състояние. Интензитетът на ремонта може да върне системата към пълна работоспособност. Моделът изчислява вероятността системата да се намира във всяко състояние във времето.

Тази структура е особено полезна за ремонтопригодни системи. Тя може да представя резервиране, резервно оборудване в режим на готовност, диагностично покритие, реакция при техническо обслужване и частичен производствен капацитет. За разлика от простата формула за надеждност, тя показва колко дълго системата може да остане уязвима след първата повреда.

Марков модел на надеждността, показващ преходите между работоспособно и отказало състояние

Фигура 6. Моделите на Марков описват как системите преминават между нормално, деградирало, отказало и ремонтирано състояние.

Двусъстояният модел представя основния принцип

Най-простият модел на Марков съдържа едно работоспособно състояние и едно отказало състояние. Интензитетът на отказите управлява преминаването от работоспособно към отказало състояние. Интензитетът на ремонта управлява обратното преминаване към работоспособно състояние. Въз основа на тези преходи моделът може да оцени готовността за работа за определен период или при установени условия.

Този модел е полезен за просто ремонтопригодно оборудване, но не описва напълно повечето резервирани автоматизирани системи. Двуканален контролер може да продължи да работи, след като единият канал откаже. Системата остава функционална, но губи резервирането си. Тя вече се намира в деградирало състояние с по-голяма уязвимост към втора повреда.

Добавянето на деградирано състояние позволява на модела да изчисли колко често и колко дълго системата работи без пълна защита. Скоростта на ремонта става изключително важна. Система с надеждни компоненти все пак може да прекарва прекомерно много време в деградирано състояние, когато диагностицирането на отказа, доставката на резервна част или одобрението за техническо обслужване се бавят.

Моделът може също да разграничава открити и неоткрити откази. Открит отказ на канал може да задейства незабавен ремонт. Неоткрит отказ може да остане скрит, докато не възникне потребност или друг отказ. Диагностичното покритие променя структурата на преходите и следователно променя изчислената наличност и риска.

Пример: Двойка двойно резервирани контролери

Да разгледаме два контролера, разположени в резервирана двойка. Състояние едно представлява изправни и двата контролера. Състояние две представлява отказ на единия контролер, докато вторият поддържа управлението. Състояние три представлява загуба на двата контролера и пълна недостъпност на управлението.

Моделът включва честотата на отказите на всеки контролер и честотата на ремонта след откриване. Той може също да включва отказ при превключване, обща загуба на захранването и общ софтуерен дефект. Тези допълнителни преходи не позволяват анализът да приема идеална независимост.

Резултатите могат да разграничат наличността при пълно резервиране от функционалната наличност. Системата може да запази способността да управлява процеса през по-голямата част от годината, като същевременно прекара значителен брой часове само с един изправен контролер. Това излагане на деградирано състояние може да бъде неприемливо за критично приложение.

Моделът може да сравнява стратегии за подобрение. По-бързата подмяна на резервни части може да намали излагането на деградирано състояние по-ефективно от добавянето на трети контролер. По-добрата диагностика може да донесе по-голяма полза от малкото намаляване на честотата на откази на хардуера. Марковският анализ прави тези компромиси измерими.

Резервното оборудване се нуждае от повече от състояние „активен отказ“

Резервирането в режим на готовност въвежда допълнително поведение. Резервната помпа може да остане спряна, докато работещата помпа не откаже. Резервният агрегат може да съдържа скрит отказ, да не стартира или да възникне проблем с логиката за превключване. Изолиращите клапани също могат да не се преместят в необходимото положение.

Марковският модел може да включва състояния за работещо и изправно оборудване, недостъпно резервно оборудване, отказ при превключване, намален капацитет и пълна загуба на системата. Функционалната проверка премества системата от неизвестно скрито състояние към известно състояние. Интервалът между изпитванията влияе върху това колко дълго скритите откази могат да останат неоткрити.

Политиките за техническо обслужване могат да се оценяват в същата структура. По-кратките интервали между изпитванията подобряват откриването на скрити откази, но увеличават натоварването по поддръжката и могат да доведат до допълнителни грешки. Моделът може да сравнява тези конкуриращи се ефекти, вместо да приема, че по-честото изпитване винаги е по-добро.

Анализът на резервирането трябва да включва и логистиката на ремонта. Повреден резервен компонент може да не прекъсне производството незабавно, затова ремонтът може да бъде отложен. Това забавяне оставя системата без защита, когато работещият блок по-късно откаже. Следователно оперативните приоритети влияят върху надеждността не по-малко от характеристиките на хардуера.

Марковското допускане създава както простота, така и ограничения

Базовият Марковски модел приема, че бъдещото поведение при преход зависи от текущото състояние, а не от пълната история. Това допускане опростява математиката и често изисква постоянни преходни интензитети. Някои промишлени съоръжения отговарят на това приближение сравнително добре за ограничен период.

Стареенето и натрупаните повреди могат да нарушат това допускане. Силно износен лагер няма същото бъдещо поведение при отказ като нов лагер, дори когато и двата в момента работят. Допълнителни състояния на деградация могат да приближат стареенето, а за по-точно представяне може да са необходими полумарковски или други модели.

Експлозията на броя състояния е друго предизвикателство. Всяко състояние на компонент може да умножи броя на възможните състояния на системата. Сложна резервирана инсталация може бързо да доведе до хиляди или милиони комбинации. За да се запази анализът управляем, може да са необходими редуциране на модела, групиране или симулация.

Моделът трябва да съдържа достатъчно детайли, за да подпомогне вземането на решение, без да представя всяка физическа вариация. Прекомерната сложност създава проблеми при поддръжката и валидирането. Твърде опростеният модел скрива важно поведение, докато прекалено подробният става невъзможен за обяснение.

Къде марковското моделиране работи добре — и къде не

Марковското моделиране е подходящо за ремонтируеми резервирани системи, резервно оборудване, деградирали режими на работа и диагностично покритие. То подпомага анализа на готовността и показва как реакцията при поддръжка променя експозицията на системата. Особено полезно е, когато последователността на състоянията на отказ и ремонт има значение.

Методът зависи от правилно дефинирани състояния и преходни интензитети. Допусканията за постоянни интензитети може да не отразяват стареенето, изменението на околната среда или качеството на поддръжката. Отказите по обща причина трябва да бъдат представени изрично, а не скрити в независимите интензитети на отказите на компонентите.

Резултатите трябва да бъдат подкрепени с анализ на чувствителността. Екипът трябва да провери как се променят изводите при промяна на честотите на отказите, времената за ремонт, диагностичното покритие и допусканията за откази по обща причина. Проект, който изглежда приемлив само при едно оптимистично допускане, не е устойчив.

Марковските модели са аналитични инструменти, а не физическо доказателство. Изпитванията, експлоатационните данни, FMEA и FTA остават необходими. Моделът помага за сравняване на стратегии, но не може да замени проверката на действителната архитектура.

Използване на петте метода като единна система за надеждност

Петте техники носят най-голяма стойност, когато са свързани. FMEA може да идентифицира подробните режими на отказ на компонентите по време на проектирането. След това FTA може да определи кои комбинации допринасят за критично събитие в системата. Моделирането на Марков може да опише поведението на системата след първия отказ и по време на ремонта.

Симулацията Монте Карло може да проверява несигурни входни данни, като продължителността на ремонтите, доставката на резервни части, метеорологичните условия и натоварването на поддръжката. RCA предоставя доказателства след реални откази и може да разкрие допускания, които първоначалните модели са пропуснали. След това моделите трябва да бъдат актуализирани, а не съхранявани като исторически документи.

Да предположим, че FTA разглежда отказите на два контролера като независими. По-късно RCA показва, че и двата контролера са отказали, след като един техник по поддръжката е заредил една и съща неправилна конфигурация. Дървото на отказите трябва да добави общо събитие, свързано с поддръжката. Моделите на Марков и Монте Карло също трябва да включат новата зависимост.

Този процес на обратна връзка създава действаща програма за надеждност. Прогнозният анализ насочва проектирането, експлоатационните данни проверяват допусканията, а резултатите от разследванията подобряват следващото поколение модели. Работата по надеждността става част от жизнения цикъл на системата, вместо да бъде еднократно изискване на проекта.

Отказите по обща причина могат да обезсилят цяла резервирана архитектура

Отказите по обща причина засягат множество канали чрез едно основно условие. Често срещани примери са общото електрозахранване, охлаждането, мрежовата инфраструктура, софтуерът, въздействието на околната среда и практиките за поддръжка. Тези откази са особено опасни, защото могат да обезсилят резервираността, която изглежда надеждна на хартия.

Физическото разделяне намалява някои откази по обща причина. Различното оборудване или софтуерът могат да намалят други. Независимата проверка може да намали грешките при поддръжката и конфигурирането. Разнообразието обаче също така увеличава сложността на обучението, резервните части, изпитването и интеграцията.

Правилното решение зависи от риска. Инсталирането на контролери от различни технологии може да намали риска от общ софтуерен отказ, но да създаде нови предизвикателства, свързани с комуникацията и поддръжката. Отделните захранвания може да донесат малка полза, ако и двете остават в един и същ шкаф, подложен на риск от наводнение. Методите за анализ на надеждността помагат да се установи кои мерки за разнообразие са насочени към достоверни механизми на отказ.

Допусканията за откази по обща причина трябва да са видими във всеки количествен модел. Третирането на резервираните канали като напълно независими почти винаги води до оптимистичен резултат. Експлоатационният опит и резултатите от анализа на първопричините предоставят ценни доказателства за оценяване на тези зависимости.

Диагностичното покритие определя колко дълго системата остава уязвима

Излишната резервираност на системата не може да се управлява ефективно, когато отказите остават скрити. Диагностичното покритие описва дела на съответните неизправности, открити от автоматични или ръчни средства за контрол. Високото покритие намалява времето, през което системата остава влошена, без това да е известно. То също така позволява на поддръжката да възстанови резервираността, преди да възникне друг отказ.

Диагностичните твърдения трябва да бъдат внимателно проверявани. Контролерът може да открива вътрешни откази на процесора, но не и всеки отказ на полевото окабеляване. Комуникационният модул може да открива пълна загуба на връзката, но да не разпознава неправилно съпоставяне на данните. Захранването може да подаде аларма след пълна загуба на изхода, но да не предупреди за постепенно влошаване.

Функционалното изпитване обхваща откази, които непрекъснатата диагностика не открива. Интервалът между изпитванията влияе върху времето на експозиция. По-дългите интервали позволяват на скритите откази да останат по-дълго, докато много кратките интервали увеличават натоварването по поддръжката и риска, предизвикан от изпитването. FMEA, Марковският анализ и експлоатационните данни могат да подпомогнат определянето на балансиран интервал.

Изпитването трябва да обхваща цялата функция. Активирането на вход на PLC не доказва, че полевият превключвател, окабеляването, логиката, изходът и крайният елемент работят правилно. Анализът на надеждността трябва да определи точно кои откази може да открие всяка диагностична процедура или функционален тест.

Времето за ремонт често е също толкова важно, колкото честотата на отказите

Програмите за надеждност често се съсредоточават върху намаляването на честотата на отказите на компонентите. Времето за ремонт може да бъде също толкова важно при отказоустойчивите системи. След отказа на първия канал системата може да продължи да работи, но да остане уязвима. Дългите забавяния при ремонта увеличават вероятността втори отказ да причини пълна загуба.

Диагностиката, одобренията, наличността на техници, резервните части, разрешителните за достъп и производствените условия влияят върху времето за възстановяване. Един компонент може да бъде сменен за петнадесет минути, след като правилната резервна част достигне шкафа. Реалният престой обаче все пак може да продължи дни, когато резервната част трябва да бъде осигурена от чужбина.

Подобрената диагностика може да намали времето за локализиране на повредата. Стандартизираните модули и предварително конфигурираните резервни части могат да намалят времето за подмяна. Местните складови наличности, ясните процедури за ескалация и дистанционната инженерна поддръжка могат да намалят логистичните забавяния. Марковските и Монте Карло моделите могат да определят количествено стойността на тези подобрения.

Най-добрата инвестиция в надеждност не винаги е по-здравият хардуер. В някои системи намаляването на времето за ремонт осигурява по-голямо намаляване на риска от малкото подобрение в честотата на отказите на компонентите. Анализът трябва да сравни и двата варианта.

Прилагане на анализа на надеждността към архитектурите на DCS и PLC

Надеждността на системата за управление зависи от повече от централния процесор. Инженерите трябва да прегледат контролерите, модулите за входове/изходи, комуникационните мрежи, захранванията, сървърите, операторските станции, синхронизацията на времето, полевите интерфейси и спомагателните комунални системи. Всеки споделен елемент може да се превърне в обща зависимост.

Резервирани контролери могат да споделят един шкаф за входове/изходи. Резервирани сървъри могат да зависят от един мрежов комутатор или една система за съхранение. Мрежите за отдалечени входове/изходи могат да използват отделни комуникационни канали, които преминават по един и същ физически маршрут. Пълният анализ трябва да проследи функцията от полевото устройство до крайното управляващо действие.

Необходимото поведение след отказ трябва да бъде ясно дефинирано. Процесът може да продължи с останалия контролер, да премине към ръчно управление или да влезе в контролирано спиране. Персоналът по поддръжката трябва да знае как да идентифицира отказалия канал и да възстанови системата, без да нарушава работата на изправния канал.

Организациите, които планират модернизация на системите за управление, могат също да прегледат типичните компоненти на DCS системи за управление, използвани в архитектури за автоматизация на процеси. Изборът на компоненти винаги трябва да следва изискванията за надеждност на цялото приложение, а не изолирани характеристики на продуктите.

Надеждните модели зависят от надеждни данни за поддръжката

Количественият анализ на надеждността е толкова силен, колкото са надеждни основополагащите го данни. Записите за поддръжка трябва да разграничават функционален отказ, планирана подмяна, инспекция и модификация. Датата на отказа трябва да показва кога е била загубена функцията, а датата на възстановяване трябва да показва кога работата действително е била отново възможна.

Идентичността на активите трябва да остане последователна в архиватора на данни, системата за поддръжка, чертежите и базата данни за резервни части. Кодовете за откази трябва да описват механизмите, а не неясни симптоми. „Спрял“ предоставя малка аналитична стойност, докато „блокирал лагер вследствие на замърсяване на смазката“ подпомага бъдещото моделиране и предотвратяване.

Експлоатационното натоварване също трябва да бъде включено. Помпа, която работи непрекъснато, не може да се сравнява директно с резервна помпа, която работи само по време на изпитвания. Температурата, влажността, замърсяването, вибрациите, електрическото натоварване и технологичното натоварване могат да обяснят разликите между иначе идентични компоненти.

Почистването на данните трябва да се разглежда като инженерна работа, а не като административна подготовка. Неправилните класификации могат да изкривят честотите на отказите, разпределенията на времето за ремонт и заключенията от моделите. Анализаторите трябва да преглеждат необичайните резултати с персонала по поддръжката и експлоатацията, преди да ги приемат.

Практически работен процес за подобряване на надеждността

Проектът за надеждност трябва да започне с дефиниране на необходимата функция и границите на системата. Екипът трябва да посочи каква производителност се изисква при нормална работа и след всеки достоверен отказ. Трябва да събере чертежи, ръководства, история на поддръжката, работни процедури, записи на аларми и предишни доклади за инциденти.

След това FMEA може да идентифицира режими на отказ на ниво компонент и слаби средства за откриване. FTA може да анализира критични върхови събития и споделени зависимости. Марковското моделиране може да оцени деградиралите състояния и реакцията при ремонт, а симулацията по метода Монте Карло може да представи неопределеността при откази, поддръжка и логистика.

Историческите инциденти трябва да се преглеждат чрез RCA. Констатациите трябва да се използват за актуализиране на проектните анализи и количествените допускания. Действията трябва да се приоритизират според последствията, вероятността, откриваемостта, експозицията, времето за ремонт и разходите.

Всяко действие трябва да има отговорно лице, краен срок и проверка на ефективността. Анализите трябва да се актуализират след значителни промени в оборудването, софтуерни обновявания, изменения на процесите или промени в стратегията за техническо обслужване. Надеждността е постоянна инженерна дисциплина, а не доклад, който се изготвя веднъж и се съхранява.

Въпросите, които разкриват слабите твърдения за отказоустойчивост

Един задълбочен преглед поставя въпроса коя функция трябва да остане достъпна и какви откази може да понесе системата. Той проверява дали резервираните канали са физически, електрически и логически независими. Проверява също как се откриват скритите откази и колко дълго системата може да остане в деградирано състояние преди ремонта.

Екипът трябва да идентифицира компонентите с дълги срокове за доставка и да определи дали една грешка при техническото обслужване може да засегне няколко канала. На зависимостите от софтуера и конфигурацията трябва да се обръща същото внимание като на хардуера. Операторите трябва да разбират как се държи системата след отказ и какви ръчни действия остават възможни.

Допусканията относно отказите и ремонтите трябва, когато е възможно, да бъдат подкрепени с данни от предприятието. Коригиращите действия трябва да се проверяват след приключването им. Функционалните изпитвания трябва да демонстрират цялостната защитна функция, а не само реакцията на отделно оборудване.

Тези въпроси са по-ценни от общото твърдение, че системата е резервирана. Те свързват отказоустойчивостта с реалната архитектура, експлоатационната среда и възможностите за техническо обслужване.

Заключителна перспектива

Отказоустойчивостта е от съществено значение, когато престой, опасно поведение или загуба на управление не могат да бъдат допуснати. Само резервирането обаче не създава надеждна система. Инженерите трябва да разбират режимите на отказ, общите зависимости, диагностичното покритие, работата в деградирано състояние, поведението при ремонт и експлоатационните последици.

Анализът на дървото на отказите показва как съчетания от откази могат да доведат до критично събитие. FMEA осигурява систематичен преглед на отделните режими на отказ и последиците от тях. Симулацията по метода Монте Карло оценява неопределени сценарии, докато RCA превръща реалните откази в превантивни знания. Марковското моделиране обяснява как ремонтируемите системи преминават между изправно, влошено, отказало и възстановено състояние.

Всеки метод има ограничения, но взети заедно, те осигуряват стабилна рамка за надеждност. Проектните проучвания трябва да се актуализират с експлоатационни данни, а резултатите от инциденти трябва да подобряват бъдещите модели. Резултатите трябва да влияят върху архитектурата, техническото обслужване, резервните части, изпитванията, обучението и процедурите.

Целта не е да се създаде система, която никога не претърпява отказ. Целта е отказите да се откриват рано, последиците от тях да се ограничават, необходимата функция да се запазва и пълната работоспособност да се възстановява по предвидим начин. Това е практическото значение на отказоустойчивостта в индустрията.

Оставяне на коментар

Имайте предвид, че коментарите трябва да бъдат одобрени, преди да се публикуват.