Lima Teknik Kebolehpercayaan untuk Menganalisis Toleransi Kerosakan Industri
Terokai lima teknik kebolehpercayaan praktikal untuk menilai sistem toleran kerosakan. Ketahui cara FTA, FMEA, simulasi Monte Carlo, RCA dan model Markov menyokong reka bentuk serta penyelenggaraan...
Mengapa Toleransi terhadap Kerosakan Memerlukan Lebih Daripada Perkakasan Berlebihan
Setiap sistem industri akhirnya akan mengalami kerosakan. Sensor hanyut, bekalan kuasa merosot, pautan komunikasi menjadi tidak stabil dan komponen mekanikal haus akibat beban berulang. Oleh itu, tujuan kejuruteraan toleransi terhadap kerosakan bukanlah untuk menghasilkan peralatan yang tidak mungkin gagal. Tujuannya adalah untuk memastikan kerosakan yang boleh dijangka tidak serta-merta menjadi kegagalan sistem yang tidak terkawal.
Sistem yang mempunyai toleransi terhadap kerosakan boleh terus memberikan fungsi yang boleh diterima selepas satu atau lebih komponen tidak tersedia. Dalam sesetengah aplikasi, sistem mesti mengekalkan pengeluaran penuh. Dalam aplikasi lain, kapasiti yang berkurangan boleh diterima sehingga penyelenggaraan memulihkan saluran yang gagal. Sebaliknya, sistem kritikal keselamatan mungkin beralih kepada keadaan selamat terkawal apabila operasi berterusan akan mewujudkan risiko yang tidak boleh diterima.
Komponen berlebihan sering menjadi sebahagian daripada strategi ini, tetapi penduaan semata-mata tidak membuktikan toleransi terhadap kerosakan. Dua pengawal mungkin masih bergantung pada satu bekalan kuasa, satu suis rangkaian atau satu konfigurasi perisian. Dua pemancar mungkin berkongsi talian impuls yang sama dan gagal akibat sumbatan yang sama. Oleh itu, analisis kebolehpercayaan mesti meneliti seni bina lengkap, termasuk kebergantungan yang tidak kelihatan dengan serta-merta dalam senarai peralatan.
Lima kaedah amat berguna untuk kerja ini. Analisis Pokok Kerosakan meneliti cara gabungan kegagalan boleh menghasilkan peristiwa puncak yang ditetapkan. Analisis Mod Kegagalan dan Kesan mengkaji cara komponen individu boleh gagal dan kesan kegagalan tersebut terhadap sistem yang lebih luas. Simulasi Monte Carlo meneroka ketidakpastian merentas pelbagai kemungkinan senario operasi dan kegagalan, manakala Analisis Punca Akar menyiasat sebab sesuatu kejadian sebenar berlaku. Model Markov menerangkan cara sistem yang boleh dibaiki bergerak antara keadaan sihat, terjejas, gagal dan dipulihkan dari semasa ke semasa.

Rajah 1. Sistem industri tidak dapat mengelakkan setiap kerosakan, tetapi kejuruteraan kebolehpercayaan yang berdisiplin dapat menghalang banyak kerosakan daripada menjadi kegagalan lengkap.
Kebolehpercayaan, Ketersediaan, Keselamatan dan Kebolehselenggaraan Tidak Sama
Istilah kebolehpercayaan sering digunakan secara longgar, yang boleh menyebabkan kekeliruan semasa semakan reka bentuk. Kebolehpercayaan menerangkan kebarangkalian peralatan melaksanakan fungsi yang diperlukan dalam tempoh yang ditetapkan. Ketersediaan menerangkan sama ada peralatan bersedia apabila proses memerlukannya. Sesuatu sistem mungkin kadangkala gagal namun mengekalkan ketersediaan yang tinggi apabila pembaikan dilakukan dengan pantas dan alat ganti tersedia serta-merta.
Kebolehselenggaraan menerangkan sejauh mana sistem yang gagal dapat didiagnosis dan dipulihkan dengan berkesan. Keselamatan menerangkan sama ada kegagalan kekal dalam had risiko yang boleh diterima bagi kakitangan, alam sekitar dan peralatan. Sifat-sifat ini saling mempengaruhi, tetapi penambahbaikan pada satu sifat tidak semestinya menambah baik kesemuanya. Penutupan perlindungan mungkin mengurangkan ketersediaan pengeluaran sambil meningkatkan keselamatan loji dengan ketara.
Toleransi terhadap kegagalan merangkumi semua disiplin ini. Ia bergantung pada lebihan, diagnostik, pengasingan, keupayaan pembaikan dan kemerosotan terkawal. Ia juga bergantung pada takrifan yang jelas tentang fungsi yang diperlukan. Jurutera tidak dapat menentukan sama ada sesuatu sistem itu toleran terhadap kegagalan sehingga mereka mengetahui prestasi yang mesti dikekalkan selepas setiap kerosakan yang munasabah.
Sebagai contoh, sistem perlindungan pemampat mungkin perlu mengekalkan keupayaan trip kecemasan selepas satu kegagalan sensor. Sistem kawalan proses mungkin hanya perlu mengekalkan operasi yang stabil sementara satu pengawal diganti. Skim perlindungan kuasa mungkin memerlukan saluran bebas supaya satu kerosakan sepunya tidak dapat melumpuhkan kedua-dua perlindungan utama dan sandaran. Teknik kebolehpercayaan membantu jurutera menterjemahkan keperluan ini kepada reka bentuk yang boleh diuji.
Memilih Kaedah Berdasarkan Soalan Kejuruteraan
Lima teknik kebolehpercayaan menangani bahagian yang berbeza dalam masalah yang sama. FTA bermula dengan peristiwa sistem yang tidak diingini dan bergerak ke belakang menuju kegagalan yang boleh menyebabkannya. FMEA bermula dengan komponen atau fungsi dan bergerak ke hadapan melalui akibat setiap mod kegagalan. Simulasi Monte Carlo mengkaji kesan ketidakpastian dengan mengulangi model sistem dalam pelbagai keadaan yang dijana secara rawak.
RCA biasanya bermula selepas insiden sebenar, dengan menggunakan bukti untuk membezakan gejala yang dapat dilihat daripada punca teknikal dan organisasi yang mendasarinya. Pemodelan Markov memberi tumpuan kepada keadaan sistem dan kadar sistem beralih antara keadaan tersebut. Kaedah ini amat berguna apabila pembaikan, operasi siap sedia, prestasi terjejas dan liputan diagnostik sangat mempengaruhi ketersediaan.
Pilihan yang tepat bergantung pada soalan yang ingin dijawab. Pasukan yang menyiasat bagaimana kehilangan penyejukan sepenuhnya boleh berlaku biasanya akan bermula dengan FTA. Pasukan reka bentuk yang menyemak setiap kemungkinan kegagalan pemancar, pengawal dan injap akan mendapat lebih banyak manfaat daripada FMEA. Pengurus aset yang membandingkan selang penyelenggaraan yang tidak pasti mungkin menggunakan simulasi Monte Carlo, manakala jurutera kebolehpercayaan yang mengira ketersediaan jangka panjang bagi sepasang pengawal berlebihan mungkin lebih memilih model Markov.
Kaedah-kaedah ini saling melengkapi dan bukannya boleh saling menggantikan. FMEA boleh mengenal pasti mod kegagalan yang kemudiannya menjadi peristiwa asas dalam pokok kegagalan. Penemuan RCA boleh membetulkan andaian kegagalan yang tidak realistik dalam model Markov. Simulasi Monte Carlo boleh menguji bagaimana kebarangkalian yang tidak pasti mempengaruhi kesimpulan yang dibuat daripada FTA atau perancangan penyelenggaraan.
Analisis Pokok Kegagalan Bermula dengan Akibat
Analisis Pokok Kegagalan ialah kaedah deduktif yang bermula dengan satu peristiwa tidak diingini yang ditakrifkan dengan jelas. Peristiwa ini dipanggil peristiwa puncak. Contoh yang sesuai termasuk kehilangan semua air suapan dandang, kegagalan fungsi trip turbin, kehilangan sepenuhnya komunikasi pengawal, atau peningkatan tekanan yang tidak terkawal dalam reaktor. Takrif tersebut mestilah cukup khusus untuk menyokong analisis yang bermakna.
Peristiwa puncak yang hanya diterangkan sebagai “kegagalan sistem” biasanya terlalu kabur. Ia tidak mentakrifkan fungsi yang gagal, tempoh kegagalan atau keadaan operasi yang terpakai. Takrifan yang lebih baik mungkin ialah “kehilangan semua aliran air penyejuk selama lebih daripada enam puluh saat semasa pengeluaran biasa.” Pernyataan itu memberikan sempadan yang jelas untuk analisis.
Setelah peristiwa puncak ditakrifkan, pasukan itu mengenal pasti keadaan serta-merta yang boleh menghasilkannya. Keadaan tersebut diuraikan menjadi peristiwa peringkat rendah sehingga analisis mencapai kegagalan komponen asas, gangguan luaran atau tindakan manusia. Gerbang logik menghubungkan peristiwa-peristiwa itu dan menerangkan cara peristiwa tersebut bergabung. Gerbang ATAU menunjukkan bahawa mana-mana peristiwa yang disenaraikan boleh menghasilkan peristiwa yang lebih tinggi, manakala gerbang DAN memerlukan beberapa peristiwa berlaku serentak.
Pepohon yang lengkap memberikan gambaran visual tentang logik kegagalan. Pepohon ini membolehkan pakar elektrik, mekanikal, instrumentasi, proses, penyelenggaraan dan keselamatan menyemak sistem yang sama dari sudut pandang yang dikongsi bersama. Model bersama ini merupakan salah satu kekuatan praktikal terbesar FTA. Model ini memudahkan anda mencabar andaian tersembunyi sebelum andaian tersebut terbina dalam reka bentuk.

Rajah 2. Pepohon kerosakan bergerak secara menjejak balik daripada peristiwa puncak yang ditakrifkan dan mengenal pasti gabungan kegagalan peringkat rendah yang boleh menghasilkannya.
Membangunkan Pepohon Kerosakan Langkah demi Langkah
Tugas praktikal pertama ialah menetapkan sempadan sistem. Jurutera mesti menentukan peralatan, utiliti, perisian, pengendali dan perkhidmatan luaran yang termasuk dalam analisis. Kajian sistem penyejukan mungkin merangkumi pam, injap, pengagihan kuasa, instrumentasi dan logik kawalan. Kajian itu juga mungkin perlu merangkumi sumber air, keadaan persekitaran dan tindak balas pengendali apabila faktor-faktor ini boleh mempengaruhi peristiwa puncak.
Pasukan itu kemudiannya mengenal pasti punca serta-merta. Kehilangan penyejukan sepenuhnya mungkin berlaku kerana semua pam tidak dapat digunakan, pengepala bekalan sepunya tersumbat, atau injap pengasingan tertutup secara tidak betul. Setiap punca serta-merta dihuraikan lagi. Ketidaktersediaan pam mungkin berpunca daripada kegagalan motor, galas tersekat, kehilangan sedutan, kegagalan pengawal, atau kehilangan bekalan elektrik.
Proses ini berterusan sehingga penguraian selanjutnya tidak lagi meningkatkan keputusan. Peristiwa pada tahap terendah dianggap sebagai peristiwa asas dan boleh diberikan kebarangkalian atau kadar kegagalan. Struktur logik itu kemudiannya boleh dinilai secara kualitatif atau kuantitatif. Walaupun data berangka yang tepat tidak tersedia, pepohon itu masih boleh mendedahkan titik kegagalan tunggal dan kebergantungan bersama yang tidak dijangka.
FTA kuantitatif menggabungkan kebarangkalian peristiwa mengikut struktur get. Pengiraan mungkin kelihatan mudah, tetapi andaian kebebasan memerlukan semakan yang teliti. Dua peristiwa yang berkongsi sumber kuasa, persekitaran, aktiviti penyelenggaraan, atau kecacatan perisian yang sama tidak sepenuhnya bebas. Mengabaikan hubungan ini boleh menyebabkan reka bentuk berlebihan kelihatan jauh lebih selamat daripada keadaan sebenar.
Set Potongan Minimum Menunjukkan Gabungan yang Paling Berbahaya
Set potongan ialah gabungan peristiwa asas yang menghasilkan peristiwa puncak. Set potongan minimum tidak mengandungi peristiwa yang tidak diperlukan, bermakna penyingkiran mana-mana satu peristiwa akan menghalang berlakunya peristiwa puncak. Gabungan ini membantu jurutera mengenal pasti laluan kegagalan yang paling pendek dan paling penting. Gabungan ini amat bernilai apabila pokok kerosakan yang besar mengandungi ratusan peristiwa.
Set potongan minimum yang terdiri daripada satu peristiwa menunjukkan bahawa satu kegagalan boleh menyebabkan peristiwa puncak secara langsung. Penemuan sedemikian biasanya memerlukan perhatian reka bentuk serta-merta. Pasukan mungkin menambah redundansi, menambah baik pengasingan, menyediakan bekalan kuasa berasingan, atau memperkenalkan lapisan perlindungan yang lain. Set potongan dua peristiwa dan tiga peristiwa sering mewakili kegagalan dalam seni bina berlebihan.
Tidak semua set potongan pendek mempunyai risiko yang sama. Gabungan dua peristiwa yang melibatkan kegagalan yang kerap berlaku mungkin lebih signifikan daripada satu peristiwa luaran yang amat jarang berlaku. Masa pengesanan dan pembaikan juga mempengaruhi kepentingan. Kegagalan tersembunyi yang tidak dikesan selama berbulan-bulan mewujudkan tempoh pendedahan yang jauh lebih lama berbanding kerosakan yang dikesan dan dibaiki dengan segera.
Perisian FTA boleh menyusun set potongan mengikut sumbangan yang dikira. Walau bagaimanapun, jurutera masih perlu meneliti makna fizikal di sebalik angka tersebut. Kebarangkalian yang kecil secara matematik mungkin berdasarkan andaian yang lemah atau data generik yang tidak mencerminkan pemasangan sebenar. Pertimbangan kejuruteraan kekal diperlukan sepanjang analisis.
Contoh: Redundansi Air Suapan Dandang yang Tidak Benar-Benar Bebas
Pertimbangkan sebuah loji kuasa yang mengendalikan dua pam air suapan dandang. Mana-mana satu pam boleh mengekalkan aliran minimum yang diperlukan, jadi sistem itu kelihatan mampu menanggung kegagalan satu pam. Pengiraan peralatan yang mudah menunjukkan redundansi penuh. Namun, analisis pokok kerosakan mungkin mendedahkan keadaan yang berbeza apabila kebergantungan sepunya diambil kira.
Kedua-dua motor pam mungkin menerima kuasa daripada bas elektrik yang sama. Kedua-dua pam mungkin menarik aliran dari pengepala sedutan yang sama, bergantung pada sistem kawalan yang sama, atau menerima arahan daripada satu ukuran aras. Oleh itu, satu kerosakan bas, pengepala sedutan yang tersumbat, atau isyarat sepunya yang tidak betul boleh menyebabkan kedua-dua pam tidak berfungsi pada masa yang sama. Lebihan dua pam yang kelihatan itu tidak akan melindungi daripada kegagalan sepunya ini.
Analisis ini mungkin membawa kepada beberapa penambahbaikan praktikal. Bekalan elektrik yang berasingan boleh mengurangkan kehilangan kuasa sepunya. Pengukuran aras yang pelbagai boleh mengurangkan kebergantungan pada satu teknologi pemancar. Laluan kawalan bebas, operasi manual yang dipertingkatkan dan pemantauan sedutan yang lebih baik boleh mengukuhkan seni bina tanpa semestinya menambah satu lagi pam lengkap.
Contoh ini menunjukkan sebab FTA lebih berguna daripada sekadar mengira peranti berlebihan. Ia menilai sama ada peranti tersebut kekal bebas antara satu sama lain dalam keadaan operasi sebenar. Ia juga mengenal pasti tempat kerumitan tambahan memberikan perlindungan sebenar dan tempat ia hanya mewujudkan gambaran perlindungan.
Di Mana Analisis Pepohon Kerosakan Berkesan—dan Di Mana Ia Tidak
FTA amat berkesan untuk fungsi keselamatan, sistem perlindungan, pengagihan elektrik, rangkaian komunikasi dan aplikasi lain yang mempunyai peristiwa tidak diingini yang ditakrifkan dengan jelas. Struktur visualnya menyokong semakan reka bentuk dan perbincangan kawal selia. Ia boleh digunakan secara kualitatif untuk mendedahkan kelemahan atau secara kuantitatif untuk menganggar kebarangkalian peristiwa puncak.
Kaedah ini menjadi kurang berkesan apabila peristiwa puncak ditakrifkan dengan kurang baik. Ia juga mungkin sukar diselenggara apabila pepohon berkembang merangkumi ribuan peristiwa. Urutan dinamik, tingkah laku penyelenggaraan dan keadaan operasi yang berubah-ubah mungkin memerlukan get khusus atau teknik pemodelan tambahan. Pepohon kerosakan statik tidak dapat menerangkan setiap hubungan yang bergantung pada masa secara semula jadi.
Tindakan manusia juga memerlukan penelitian yang teliti. Kebarangkalian tindak balas operator bergantung pada kualiti penggera, reka bentuk prosedur, latihan, beban kerja, masa yang tersedia dan keadaan antara muka. Menetapkan satu kebarangkalian ralat manusia yang umum mungkin menyembunyikan perbezaan ini. Analisis yang serius harus melibatkan pakar faktor manusia apabila tindakan operator menjadi faktor utama dalam hasil.
Oleh itu, FTA paling berkesan apabila digunakan sebagai sebahagian daripada program kebolehpercayaan yang lebih menyeluruh. FMEA boleh menyediakan mod kegagalan komponen yang terperinci, manakala kaedah Markov atau Monte Carlo boleh menangani pembaikan, urutan dan ketidakpastian. Tiada satu pun pepohon harus dianggap sebagai gambaran lengkap bagi setiap tingkah laku sistem.
Analisis Mod Kegagalan dan Kesan Bermula Dengan Komponen
Analisis Mod Kegagalan dan Kesan menggunakan pendekatan induktif. Daripada bermula dengan peristiwa puncak, pasukan bermula dengan item, fungsi atau langkah proses. Kemudian, pasukan bertanya bagaimana item itu boleh gagal dan apakah kesan setiap kegagalan secara setempat serta terhadap keseluruhan sistem. Arah analisis ini menjadikan FMEA amat berguna semasa reka bentuk dan semakan peralatan.
Pemancar tekanan boleh gagal dalam beberapa cara yang berbeza. Outputnya mungkin menyimpang ke nilai tinggi, menyimpang ke nilai rendah, kekal pada satu nilai, menjadi tidak stabil atau hilang sepenuhnya. Setiap mod menghasilkan kesan operasi yang berbeza. Bacaan tinggi mungkin menyebabkan penutupan yang tidak diperlukan, manakala bacaan rendah mungkin menyembunyikan keadaan tekanan yang berbahaya.
FMEA memaksa pasukan menghuraikan perbezaan ini dan bukannya hanya merekodkan “kegagalan pemancar”. Ia turut meneliti kawalan pencegahan dan pengesanan yang sedia ada. Analisis ini mungkin mengenal pasti diagnostik, logik perbandingan, ujian kalis, penggera, pintasan atau pemeriksaan oleh pengendali yang mengurangkan akibatnya. Pengesanan yang lemah sering menjadi sama pentingnya dengan mod kegagalan asal.

Rajah 3. FMEA menilai mod kegagalan individu, kesannya, tahap keterukannya serta kawalan yang tersedia untuk mencegah atau mengesannya.
Perkara yang Patut Terkandung dalam Lembaran Kerja FMEA yang Berkesan
Lembaran kerja FMEA yang berguna bermula dengan item dan fungsi yang diperlukan. Mod kegagalan menerangkan cara fungsi boleh hilang, merosot atau dilaksanakan dengan tidak betul. Kesan setempat menerangkan perkara yang berlaku pada peringkat komponen, manakala kesan sistem menerangkan akibat operasi atau keselamatan yang lebih luas. Punca dan mekanisme direkodkan secara berasingan daripada kesan.
Lembaran kerja ini turut mendokumentasikan kawalan sedia ada. Kawalan pencegahan mengurangkan kebarangkalian kegagalan berlaku. Kawalan pengesanan mendedahkan kegagalan sebelum ia menghasilkan akibat yang tidak boleh diterima. Contohnya termasuk diagnostik kendiri, perbandingan antara isyarat berlebihan, had penggera, ujian kalis, pemeriksaan dan penyelenggaraan ramalan.
Banyak organisasi menetapkan penarafan keterukan, kebarangkalian berlaku dan kebolehkesanan. Nilai ini kadangkala didarabkan untuk menghasilkan Nombor Keutamaan Risiko. Nombor tersebut boleh membantu menetapkan keutamaan, tetapi tidak sepatutnya menggantikan pertimbangan teknikal. Gabungan yang berbeza boleh menghasilkan skor yang sama walaupun akibatnya pada asasnya berbeza.
Kegagalan bencana yang jarang berlaku mungkin memerlukan lebih perhatian berbanding gangguan kecil yang kerap berlaku, walaupun skor pengiraannya kelihatan serupa. Oleh itu, tahap keterukan hendaklah dikaji secara berasingan. Pasukan juga hendaklah mengutamakan tindakan yang menghapuskan mekanisme kegagalan atau mengurangkan akibatnya, bukannya hanya bergantung pada pemeriksaan tambahan.
Contoh: Input PLC Berlebihan dengan Kelemahan yang Dikongsi
Pertimbangkan dua saluran input digital yang memantau satu suis medan kecemasan. Seni binanya kelihatan berlebihan kerana dua input PLC menerima isyarat tersebut. FMEA meneliti sama ada keseluruhan laluan isyarat benar-benar bebas. Ia mempertimbangkan sentuhan medan, pendawaian, kuasa input, pemasangan terminal, modul, logik dan tingkah laku diagnostik.
Mod kegagalan yang mungkin termasuk litar terbuka, litar pintas, sentuhan terimpal, saluran tersekat pada aras tinggi, saluran tersekat pada aras rendah, atau kehilangan bekalan input sepunya. Analisis ini juga menilai sama ada ketidakselarasan antara saluran dikesan. Jika kedua-dua saluran berkongsi satu sentuhan medan dan satu kabel, banyak kegagalan yang munasabah boleh menjejaskan kedua-dua saluran secara serentak.
Semakan mungkin menunjukkan bahawa modul input berganda memberikan perlindungan tambahan yang terhad. Sesentuh berasingan, litar medan yang dipantau, laluan kuasa bebas atau prinsip penderiaan yang pelbagai mungkin diperlukan. Prosedur ujian bukti juga mesti mengesahkan keseluruhan rantaian isyarat, bukannya menguji modul PLC sahaja.
Bagi seni bina perlindungan, jurutera juga boleh menyemak modul keselamatan industri yang sesuai dan direka bentuk untuk liputan diagnostik, redundansi serta tingkah laku kegagalan terkawal. Pemilihan perkakasan masih mesti mengikut kitar hayat keselamatan yang lengkap dan tidak boleh menggantikan analisis khusus aplikasi.
FMEA Reka Bentuk dan FMEA Proses Menangani Risiko yang Berbeza
FMEA Reka Bentuk mengkaji produk atau sistem yang direka bentuk. Ia meneliti sama ada seni bina, komponen, bahan dan fungsi kawalan yang dipilih dapat berfungsi seperti yang dimaksudkan. Kaedah ini lazimnya digunakan semasa pembangunan konsep, reka bentuk terperinci dan perubahan reka bentuk. Ia paling bernilai sebelum reka bentuk menjadi mahal untuk diubah suai.
FMEA Proses mengkaji aktiviti pembuatan, pemasangan, instalasi, pentauliahan atau penyelenggaraan. Sesebuah kabinet mungkin mempunyai reka bentuk elektrik yang betul, tetapi proses pemasangan masih boleh menyebabkan terminal longgar, kekutuban terbalik, kadar fius yang salah atau pengenalpastian wayar yang tidak betul. Aktiviti penyelenggaraan boleh menyebabkan perisian tegar yang salah, alat ganti yang tidak sesuai, penggera yang dinyahdayakan atau pintasan yang dibiarkan aktif.
Kedua-dua bentuk FMEA ini hendaklah saling menyokong. Kawalan reka bentuk boleh mengurangkan kepekaan pemasangan, manakala kawalan proses boleh mencegah kesilapan pelaksanaan yang tidak dapat dihapuskan oleh reka bentuk. Menyemak reka bentuk peralatan sahaja meninggalkan banyak risiko sepanjang kitar hayat tanpa ditangani. Menyemak proses kerja sahaja pula mungkin menyembunyikan kelemahan yang terbina dalam seni bina asal.
Bagi sistem automasi kritikal, kedua-dua analisis hendaklah dikemas kini selepas pengubahsuaian besar. Penggantian pengawal, migrasi rangkaian, naik taraf perisian atau perubahan dalam prosedur ujian bukti boleh memperkenalkan mod kegagalan baharu. Lembaran kerja sejarah tidak sepatutnya kekal tidak berubah apabila loji terus berkembang.
FMECA Menambah Penilaian Kekritisan yang Lebih Formal
Analisis Mod Kegagalan, Kesan dan Kekritisan memperluas struktur FMEA dengan menambahkan pengiraan kekritisan formal. Kaedah ini mungkin menggunakan kadar kegagalan komponen, pendedahan operasi, fasa misi, kategori keterukan dan kebarangkalian bersyarat. Ia berguna apabila sistem besar mengandungi banyak mod kegagalan dan sumber kejuruteraan perlu diarahkan kepada penyumbang yang paling ketara.
Pengiraan kekritisan sangat bergantung pada kualiti data. Pangkalan data kadar kegagalan generik menyediakan titik permulaan, tetapi mungkin tidak mencerminkan pemasangan sebenar. Suhu, getaran, pencemaran, tekanan elektrik, kualiti penyelenggaraan dan kitaran tugas semuanya mempengaruhi prestasi sebenar. Bukti khusus loji hendaklah menggantikan andaian generik apabila sejarah operasi yang mencukupi tersedia.
Analisis ini juga harus membezakan antara kerosakan yang dikesan serta-merta dengan kerosakan yang kekal tersembunyi. Kerosakan terpendam dalam sistem siap siaga mungkin tidak menjejaskan pengeluaran sehingga komponen lain rosak atau berlaku permintaan. Tempoh pendedahan tersembunyi yang panjang boleh menjadikan kerosakan yang agak jarang berlaku sangat penting. Oleh itu, selang pengesanan dan keberkesanan ujian bukti mesti disertakan.
FMECA paling berguna apabila hasilnya membawa kepada tindakan reka bentuk atau penyelenggaraan. Jadual pemeringkatan yang kompleks tidak banyak nilainya jika tidak mempengaruhi seni bina, alat ganti, diagnostik, pengujian, atau prosedur operasi. Tujuannya kekal sebagai pengurangan risiko secara praktikal, bukannya pengiraan semata-mata.
Di Mana FMEA Berfungsi Dengan Baik—dan Di Mana Ia Boleh Mengelirukan
FMEA menyediakan semakan komponen demi komponen yang berdisiplin. Kaedah ini agak mudah diterangkan dan menyokong penyertaan kakitangan kejuruteraan, operasi, penyelenggaraan, kualiti, dan keselamatan. Daftar tindakan yang terhasil boleh dihubungkan secara langsung dengan perubahan reka bentuk, pemeriksaan, diagnostik, dan penambahbaikan penyelenggaraan.
Kaedah ini boleh menjadi berulang apabila digunakan pada sistem yang sangat besar. Pasukan mungkin menghabiskan terlalu banyak masa untuk mendokumenkan mod kerosakan bernilai rendah sambil terlepas pandang interaksi sistem. FMEA tradisional juga cenderung meneliti satu kerosakan pada satu-satu masa. Kerosakan serentak berganda dan peristiwa yang bergantung pada urutan mungkin tidak dapat dikenal pasti dengan jelas.
Sistem pemarkahan mewujudkan satu lagi risiko. Pasukan mungkin melaraskan penarafan untuk mencapai keutamaan yang dikehendaki atau menganggap nombor akhir lebih objektif daripada pertimbangan yang mendasarinya. Skor rendah tidak membuktikan bahawa sesuatu kerosakan boleh diterima. Peristiwa berkeparahan tinggi, kerosakan berpunca sama, dan keperluan kawal selia harus menerima semakan berasingan.
Kualiti FMEA bergantung pada orang yang melaksanakannya. Lembaran kerja yang disediakan oleh seorang pereka bentuk mungkin terlepas daripada realiti lapangan yang diketahui oleh pengendali dan juruteknik. Kajian yang kukuh menggabungkan pengetahuan reka bentuk dengan sejarah penyelenggaraan sebenar dan pengalaman operasi.
Simulasi Monte Carlo Menukar Ketidakpastian Menjadi Taburan
Pengiraan kebolehpercayaan industri sering melibatkan input yang tidak pasti. Jangka hayat komponen berubah-ubah, tempoh pembaikan berbeza, penghantaran alat ganti tidak dapat diramalkan, dan tekanan persekitaran mempengaruhi tingkah laku kerosakan. Satu nilai purata tidak semestinya dapat mewakili variasi ini. Simulasi Monte Carlo menangani masalah ini melalui persampelan rawak berulang.
Jurutera terlebih dahulu membina model sistem dan menetapkan taburan kebarangkalian bagi pemboleh ubah yang tidak pasti. Simulasi kemudiannya menjana banyak gabungan yang mungkin. Satu larian mungkin mengandaikan pam rosak selepas 8,000 jam dan dibaiki dalam masa empat jam. Larian lain mungkin menghasilkan kerosakan yang berlaku kemudian tetapi memerlukan tempoh pembaikan yang jauh lebih lama kerana alat ganti yang diperlukan tidak tersedia.
Selepas ribuan atau jutaan larian, hasilnya membentuk suatu taburan. Model ini boleh menganggarkan masa henti yang dijangka, kerugian pengeluaran, ketersediaan sistem, kebarangkalian kejayaan misi, permintaan alat ganti atau kos penyelenggaraan. Model ini juga boleh menunjukkan kebarangkalian hasil ekstrem yang akan hilang jika diringkaskan dalam satu nilai purata.

Rajah 4. Simulasi Monte Carlo menilai banyak senario kegagalan dan pembaikan yang dijana secara rawak untuk menganggarkan julat hasil yang mungkin.
Membina Model Kebolehpercayaan Monte Carlo yang Berwibawa
Kualiti simulasi bergantung pada model sistem. Model tersebut mesti mewakili komponen, peraturan operasi, taburan kegagalan, tingkah laku pembaikan, kebergantungan, logik siap sedia dan sumber penyelenggaraan. Model itu juga boleh merangkumi cuaca, permintaan pengeluaran, kelewatan logistik dan tindak balas manusia apabila faktor-faktor tersebut mempengaruhi prestasi sistem.
Setiap larian simulasi menjejaki sistem mengikut masa. Komponen gagal berdasarkan taburan yang disampel, pembaikan bermula apabila sumber tersedia, dan model merekodkan sama ada sistem kekal beroperasi, merosot atau tidak tersedia. Pengulangan proses ini menghasilkan anggaran untuk ukuran prestasi yang berbeza.
Pengesahan amat penting. Pasukan hendaklah membandingkan model dengan pengiraan dipermudah, kes operasi yang diketahui dan hasil sejarah loji. Output yang tidak dijangka hendaklah disiasat dan bukannya diterima hanya kerana ia datang daripada perisian. Simulasi yang kelihatan mengagumkan masih boleh salah apabila logik asasnya tidak lengkap.
Analisis kepekaan membantu mengenal pasti andaian yang paling mempengaruhi hasil. Jika masa pembaikan memberi kesan yang jauh lebih besar daripada kadar kegagalan, pihak pengurusan mungkin memperoleh manfaat yang lebih besar dengan meningkatkan ketersediaan alat ganti dan kelajuan diagnostik. Jika kebarangkalian punca sepunya mendominasi, menambah lebih banyak komponen serupa mungkin memberikan sedikit manfaat.
Memilih Taburan Kebarangkalian yang Sejajar dengan Mekanisme Kegagalan
Taburan eksponen mengandaikan kadar kegagalan yang malar. Ia sesuai untuk sesetengah komponen elektronik sepanjang hayat operasi bergunanya. Taburan Weibull lebih fleksibel dan boleh mewakili kegagalan peringkat awal, kegagalan rawak atau tingkah laku akibat kehausan. Taburan lognormal sering berguna untuk tempoh pembaikan dan proses yang dipengaruhi oleh beberapa faktor pendaraban.
Pilihan hendaklah mencerminkan mekanisme fizikal dan bukannya kemudahan perisian. Kegagalan galas akibat kehausan tidak secara semula jadi mengikut tingkah laku yang sama seperti ralat komunikasi rawak. Penggunaan kadar kegagalan malar untuk kedua-duanya boleh memesongkan ramalan jangka panjang. Jurutera kebolehpercayaan hendaklah meneliti sejarah operasi dan mekanisme kegagalan sebelum memilih taburan.
Data sejarah selalunya perlu dibersihkan. Sistem penyelenggaraan mungkin tersalah anggap penggantian terancang sebagai kegagalan fungsi. Tarikh kegagalan mungkin direkodkan ketika perintah kerja dibuka dan bukannya ketika kerosakan berlaku. Nama aset, jam operasi dan kod kegagalan juga mungkin tidak konsisten antara tapak.
Data yang terhad tidak menghalang analisis, tetapi ketidakpastian harus kekal jelas. Pertimbangan pakar, maklumat pembekal dan pangkalan data industri boleh menyokong anggaran awal. Model harus menguji julat yang realistik dan bukannya membentangkan satu andaian yang tidak pasti sebagai fakta yang tepat.
Contoh: Ketersediaan Stesen Tiga Pemampat
Pertimbangkan sebuah stesen dengan tiga pemampat gas. Dua unit diperlukan untuk pengeluaran penuh, manakala unit ketiga menyediakan kapasiti siap sedia. Setiap mesin mempunyai jam operasi, sejarah penyelenggaraan dan prestasi penyejukan yang berbeza. Hanya satu pembaikan besar boleh dilakukan pada satu-satu masa kerana stesen ini mempunyai satu pasukan penyelenggaraan pakar.
Galas ganti memerlukan beberapa hari untuk dihantar, dan kegagalan sistem penyejukan menjadi lebih kerap semasa suhu persekitaran tinggi. Interaksi ini sukar diwakili dengan satu persamaan ketersediaan yang ringkas. Model Monte Carlo boleh mengambil sampel kegagalan pemampat, tempoh pembaikan, tempoh cuaca, ketersediaan juruteknik dan kelewatan logistik.
Keputusan mungkin menunjukkan ketersediaan pada kapasiti penuh, operasi pada kapasiti yang dikurangkan dan pemberhentian penuh stesen. Pengurusan boleh membandingkan pelaburan alternatif. Menyimpan galas tambahan mungkin mengurangkan masa henti ekstrem dengan lebih berkesan berbanding menambah seorang lagi juruteknik penyelenggaraan am. Meningkatkan kebolehpercayaan sistem penyejukan mungkin memberikan nilai yang lebih besar berbanding menggantikan pemampat yang selainnya masih baik.
Model ini juga boleh menguji selang penyelenggaraan. Selang pencegahan yang lebih pendek mungkin mengurangkan kerosakan, tetapi meningkatkan masa henti terancang dan ralat yang berpunca daripada penyelenggaraan. Simulasi membolehkan kedua-dua kesan dinilai dalam model operasi yang sama.
Di Mana Simulasi Monte Carlo Berfungsi Dengan Baik—dan Di Mana Ia Gagal
Kaedah Monte Carlo berkuasa apabila banyak pemboleh ubah tidak pasti saling berinteraksi. Kaedah ini boleh mewakili logistik yang kompleks, baris gilir pembaikan, kesan cuaca, permintaan pengeluaran dan keputusan penyelenggaraan. Taburan yang terhasil memberikan lebih banyak maklumat berbanding satu purata tunggal. Kaedah ini juga menyokong keputusan berasaskan risiko dengan menunjukkan kebarangkalian berlakunya kesan teruk tetapi jarang berlaku.
Kelemahan utama ialah kredibiliti model. Simulasi yang rumit boleh mewujudkan keyakinan palsu kerana hasilnya kelihatan tepat dari segi angka. Program ini hanya mengira akibat daripada andaian yang dimasukkan oleh penganalisis. Kebergantungan yang tidak dikenal pasti atau taburan yang tidak realistik boleh menghasilkan keputusan yang mengelirukan.
Simulasi juga memerlukan bilangan larian yang mencukupi untuk mencapai anggaran yang stabil. Kebarangkalian peristiwa jarang berlaku mungkin memerlukan teknik pensampelan khusus kerana simulasi rawak biasa memerlukan bilangan larian yang terlalu besar dan tidak praktikal. Selang keyakinan hendaklah dilaporkan supaya pengguna memahami ketidakpastian statistik.
Oleh itu, kaedah ini paling bernilai apabila logik model, sumber data dan batasan kekal telus. Keputusan kebolehpercayaan tidak seharusnya berdasarkan graf yang andaian-andaianya tidak dapat diterangkan kepada kakitangan operasi dan kejuruteraan.
Analisis Punca Asas Bermula Selepas Peristiwa Berlaku
Analisis Punca Asas menyiasat sebab berlakunya kegagalan sebenar, masalah kualiti atau peristiwa keselamatan. Analisis ini melangkaui pengenalpastian komponen yang rosak. Motor mungkin berhenti kerana galas tersekat, tetapi menggantikan galas hanya memulihkan operasi. Siasatan mesti menentukan sebab galas tersebut mencapai keadaan itu.
Punca yang lebih mendalam mungkin termasuk pencemaran, pelinciran yang tidak betul, penyimpanan yang kurang baik, kerosakan semasa pemasangan, beban proses yang berlebihan atau pemeriksaan yang terlepas. Keadaan organisasi juga mungkin menyumbang. Tugas penyelenggaraan mungkin telah digugurkan, alat ganti mungkin tidak sesuai atau tekanan pengeluaran mungkin telah melambatkan kerja pembetulan.
Oleh itu, RCA membezakan gejala, punca fizikal langsung, keadaan penyumbang dan kelemahan asas sistem. Pembezaan ini menghalang organisasi daripada menganggap setiap pembaikan sebagai penyelesaian kekal. Ia juga menghasilkan bukti yang boleh menambah baik FMEA, FTA, perancangan penyelenggaraan dan prosedur operasi pada masa hadapan.

Rajah 5. RCA menjejaki kegagalan melampaui gejala yang kelihatan dan mengenal pasti keadaan teknikal serta organisasi yang membolehkannya berlaku.
Bukti Mesti Dipelihara Sebelum Loji Kembali kepada Keadaan Normal
Bukti industri boleh hilang dengan cepat. Pengendali mungkin menetapkan semula penggera, juruteknik mungkin menggantikan modul dan keadaan proses mungkin berubah. Log pengawal boleh menulis ganti peristiwa terdahulu, manakala komponen yang rosak mungkin dibuang sebelum diperiksa. Oleh itu, proses RCA yang berdisiplin bermula dengan pemeliharaan bukti.
Pasukan tersebut harus mengumpulkan trend pensintesis sejarah, senarai penggera, log peristiwa pengawal, rekod geganti, arahan kerja, gambar, bahagian yang rosak, versi perisian, fail konfigurasi dan pemerhatian pengendali. Setiap item hendaklah dikenal pasti berdasarkan sumber dan masa. Bukti fizikal hendaklah kekal terkawal sehingga siasatan menentukan sama ada pemeriksaan lanjut diperlukan.
Penyegerakan masa memerlukan perhatian khusus. Pengawal, pensintesis sejarah, geganti perlindungan, pelayan dan sistem penyelenggaraan mungkin merekodkan cap masa yang berbeza. Penyiasat mesti membetulkan perbezaan ini sebelum membina urutan peristiwa. Jika tidak, penggera yang berlaku kemudian mungkin tersilap dianggap sebagai peristiwa pencetus.
Temu bual dengan operator hendaklah diselesaikan dengan segera tetapi secara teliti. Mereka mungkin mengingati urutan dan konteks yang tidak dirakam oleh sistem automatik. Kenyataan mereka hendaklah dianggap sebagai bukti, bukannya dipersalahkan. Objektifnya adalah untuk memahami persekitaran operasi tempat keputusan dibuat.
Membina Garis Masa Peristiwa Sebelum Bertanya Mengapa
Garis masa yang kukuh memisahkan fakta yang disahkan daripada tafsiran. Garis masa itu merekodkan perkara yang berlaku sebelum, semasa, dan selepas kegagalan. Setiap peristiwa hendaklah dipautkan kepada sumber seperti nilai sejarah, rekod penggera, tindakan penyelenggaraan, foto, atau kenyataan saksi. Jurang dan ketidakselarasan hendaklah kekal kelihatan.
Penggera pertama yang dipaparkan kepada operator tidak semestinya peristiwa fizikal yang pertama. Banjiran penggera boleh menenggelamkan keadaan pencetus di bawah ratusan mesej sekunder. Data urutan kejadian beresolusi tinggi mungkin menunjukkan bahawa ketidakstabilan tekanan, gangguan kuasa, atau kehilangan komunikasi bermula lebih awal. Garis masa membantu membezakan punca daripada akibat.
Setelah urutan kejadian difahami, pasukan boleh menggunakan alat seperti Lima Mengapa, gambar rajah tulang ikan, analisis halangan, analisis perubahan, atau carta faktor penyebab. Peristiwa mudah mungkin dapat dijelaskan melalui rantaian sebab yang ringkas. Insiden kompleks biasanya melibatkan beberapa keadaan teknikal dan organisasi yang saling berinteraksi.
Siasatan tidak seharusnya berhenti selepas menemui satu penjelasan yang munasabah. Hipotesis alternatif hendaklah diuji berdasarkan bukti. Andaian yang tidak disokong hendaklah kekal dikenal pasti sebagai andaian dan bukannya dikemukakan sebagai punca yang disahkan.
Contoh: Kegagalan Pemacu Kelajuan Boleh Ubah Berulang
Sebuah loji mengalami kegagalan berulang pemacu kelajuan boleh ubah yang mengawal satu penghantar. Penyelenggaraan menggantikan pemacu selepas setiap kejadian, dan pengeluaran kembali normal. Beberapa bulan kemudian, pemacu lain gagal. Penggantian berulang itu menunjukkan bahawa pemacu itu sendiri mungkin bukan keseluruhan masalah.
Pasukan RCA membandingkan tarikh kegagalan dengan rekod persekitaran dan penyelenggaraan. Kebanyakan kegagalan berlaku dalam tempoh musim panas yang panas. Trend suhu kabinet menunjukkan operasi berpanjangan melebihi julat yang disyorkan. Pemeriksaan mendedahkan penapis tersumbat, aliran udara terhad, dan pengumpulan habuk yang banyak di sekeliling laluan penyejukan.
Rekod penyelenggaraan menunjukkan bahawa pembersihan penapis secara berkala telah dikeluarkan daripada jadual pencegahan selepas tahap kepegawaian berubah. Pemacu ialah komponen yang gagal, tetapi suhu kabinet yang berlebihan ialah punca fizikal langsung. Pengudaraan yang terhad dan tugas penyelenggaraan yang ditiadakan ialah faktor penyumbang serta punca organisasi.
Oleh itu, tindakan pembetulan harus melangkaui penggantian pemacu sekali lagi. Loji mungkin perlu memulihkan penyelenggaraan penapis, memasang penggera suhu, menambah baik penyejukan kabinet, dan menyemak reka bentuk penutup. Keberkesanan hendaklah disahkan dalam tempoh suhu tinggi yang seterusnya.
Tindakan pembetulan mesti dikaitkan dengan punca yang disahkan
Banyak laporan RCA menjadi lemah semasa perancangan tindakan pembetulan. Pasukan mungkin mengesyorkan latihan tambahan tanpa membuktikan bahawa pengetahuan tidak mencukupi. Mereka mungkin menyemak semula prosedur sedangkan masalah sebenar ialah reka bentuk peralatan yang lemah. Mereka mungkin menambah pemeriksaan yang tidak dapat mengesan mekanisme kegagalan sebenar.
Setiap tindakan harus menangani punca atau keadaan penyumbang yang telah disahkan. Tindakan itu hendaklah mempunyai pemilik, tarikh siap dan kaedah pengesahan yang ditetapkan. Organisasi harus membezakan antara pembendungan sementara, tindakan pembetulan dan tindakan pencegahan jangka panjang. Memulihkan pengeluaran tidak sama dengan mencegah kejadian berulang.
Keberkesanan mesti disemak selepas pelaksanaan. Tindakan yang telah diselesaikan tidak semestinya berjaya. Loji harus mengesahkan sama ada kebarangkalian kegagalan menurun, sama ada kawalan baharu digunakan dan sama ada ia menimbulkan risiko lain. Maklum balas ini melengkapkan kitaran penambahbaikan kebolehpercayaan.
Siasatan serius mungkin memerlukan semakan bebas. Pasukan yang terlibat rapat dengan kejadian boleh dipengaruhi oleh andaian terdahulu atau tekanan organisasi. Semakan luaran atau merentas fungsi boleh mencabar analisis sebelum kesimpulan akhir diterima.
Kesilapan Manusia Jarang Menjadi Punca Akar yang Lengkap
“Kesilapan operator” dan “kesilapan penyelenggaraan” sering muncul dalam siasatan yang lemah. Label ini menerangkan siapa yang melakukan tindakan akhir, tetapi tidak menjelaskan mengapa tindakan itu menjadi lebih berkemungkinan berlaku. Orang bekerja dalam persekitaran antara muka, prosedur, tahap perjawatan, tuntutan pengeluaran, sistem latihan dan reka bentuk peralatan. Siasatan harus meneliti semua keadaan ini.
Seorang operator mungkin memilih kawalan yang salah kerana dua objek pada skrin kelihatan hampir serupa. Seorang juruteknik mungkin memasang bahagian yang salah kerana pengenalpastian tidak konsisten. Seorang penyelia mungkin menangguhkan penyelenggaraan kerana organisasi memberi ganjaran kepada pengeluaran tanpa gangguan, sedangkan tiada tempoh pemberhentian operasi yang realistik disediakan.
Memahami keadaan ini tidak menghapuskan akauntabiliti individu. Sebaliknya, ia menghalang sistem yang sama daripada mendorong orang lain melakukan kesilapan yang sama. Siasatan yang berfokuskan kesalahan mungkin memenuhi tuntutan segera untuk mencari pihak yang bertanggungjawab, tetapi kelemahan asas tetap tidak ditangani.
RCA yang berkesan meneliti bagaimana sistem mempengaruhi keputusan. Ia bertanya sama ada penggera mudah difahami, prosedur praktikal, beban kerja munasabah dan peralatan yang diperlukan tersedia. Soalan-soalan ini menghasilkan tindakan pembetulan yang lebih kukuh berbanding sekadar mengarahkan orang supaya lebih berhati-hati.
Di Mana Analisis Punca Akar Berkesan—dan Di Mana Ia Tidak
RCA menukarkan pengalaman operasi sebenar kepada pengetahuan pencegahan. Ia dapat mendedahkan kelemahan reka bentuk, kekurangan penyelenggaraan, masalah prosedur dan tekanan organisasi yang terlepas dalam kajian ramalan. Dapatannya boleh menambah baik model kebolehpercayaan dan piawaian projek akan datang.
Kaedah ini bersifat reaktif kerana bermula selepas sesuatu kejadian. Industri berimpak tinggi tidak boleh bergantung hanya pada pembelajaran daripada kegagalan. Kaedah proaktif seperti FMEA dan FTA masih diperlukan. RCA harus melengkapinya dengan mengemas kini andaian berdasarkan bukti daripada operasi sebenar.
Siasatan juga boleh menjadi subjektif. Bias pengesahan boleh menyebabkan pasukan cenderung memilih penjelasan pertama yang sepadan. Kekurangan bukti mungkin memaksa kesimpulan kekal tidak pasti. Laporan yang kukuh membezakan dengan jelas antara punca yang disahkan, faktor penyumbang, hipotesis dan persoalan yang belum diselesaikan.
Nilai RCA bergantung pada tindakan susulan. Siasatan yang kukuh dari segi teknikal hanya menghasilkan sedikit manfaat apabila tindakan ditangguhkan, dilemahkan atau tidak pernah disahkan. Oleh itu, komitmen pengurusan sama pentingnya dengan kemahiran analisis.
Model Markov Menjejaki Sistem Melalui Perubahan Keadaan
Pemodelan Markov mewakili sistem melalui keadaan operasi yang ditetapkan. Sistem mudah mungkin hanya mengandungi keadaan beroperasi dan keadaan gagal. Sistem toleran kerosakan biasanya memerlukan keadaan tambahan seperti lebihan penuh, terjejas, gagal, sedang dibaiki atau menunggu alat ganti. Peralihan menghubungkan keadaan-keadaan ini.
Kadar kegagalan boleh mengalihkan sistem daripada beroperasi sepenuhnya kepada keadaan terjejas. Kegagalan lain boleh mengalihkannya daripada keadaan terjejas kepada tidak tersedia. Kadar pembaikan boleh mengembalikannya kepada operasi penuh. Model mengira kebarangkalian sistem berada dalam setiap keadaan mengikut masa.
Struktur ini amat berguna untuk sistem yang boleh dibaiki. Ia boleh mewakili lebihan, peralatan siap sedia, liputan diagnostik, tindak balas penyelenggaraan dan kapasiti pengeluaran separa. Tidak seperti formula kebolehpercayaan mudah, model ini menunjukkan tempoh sistem mungkin kekal terdedah selepas kegagalan pertama.

Rajah 6. Model Markov menerangkan cara sistem bergerak antara keadaan sihat, terjejas, gagal dan dibaiki.
Model Dua Keadaan Menyediakan Prinsip Asas
Model Markov paling mudah mengandungi satu keadaan beroperasi dan satu keadaan gagal. Kadar kegagalan mengawal peralihan daripada beroperasi kepada gagal. Kadar pembaikan mengawal peralihan kembali kepada keadaan beroperasi. Daripada peralihan ini, model boleh menganggarkan ketersediaan dalam tempoh yang ditetapkan atau dalam keadaan mantap.
Model ini berguna untuk peralatan mudah yang boleh dibaiki, tetapi tidak menerangkan sepenuhnya kebanyakan sistem automasi berlebihan. Pengawal dwi-saluran mungkin terus beroperasi selepas satu saluran gagal. Sistem kekal berfungsi tetapi kehilangan lebihan. Kini sistem berada dalam keadaan terjejas dengan pendedahan yang lebih tinggi terhadap kegagalan kedua.
Menambahkan keadaan terjejas membolehkan model mengira kekerapan dan tempoh sistem beroperasi tanpa perlindungan penuh. Kelajuan pembaikan menjadi amat penting. Sistem dengan komponen yang boleh dipercayai masih mungkin menghabiskan terlalu banyak masa dalam keadaan terjejas apabila diagnosis kerosakan, penghantaran alat ganti atau kelulusan penyelenggaraan berjalan lambat.
Model ini juga boleh membezakan kegagalan yang dikesan dan tidak dikesan. Kerosakan saluran yang dikesan mungkin mencetuskan pembaikan serta-merta. Kerosakan yang tidak dikesan mungkin kekal tersembunyi sehingga permintaan atau kegagalan lain berlaku. Liputan diagnostik mengubah struktur peralihan dan oleh itu mengubah ketersediaan serta risiko yang dikira.
Contoh: Pasangan Pengawal Lebihan Dwi
Pertimbangkan dua pengawal yang disusun sebagai pasangan berlebihan. Keadaan satu mewakili kedua-dua pengawal yang sihat. Keadaan dua mewakili satu pengawal yang gagal manakala pengawal kedua mengekalkan kawalan. Keadaan tiga mewakili kehilangan kedua-dua pengawal dan ketidaktersediaan kawalan sepenuhnya.
Model ini merangkumi kadar kegagalan setiap pengawal dan kadar pembaikan selepas pengesanan. Ia juga mungkin merangkumi kegagalan pertukaran, kehilangan kuasa sepunya dan kecacatan perisian sepunya. Peralihan tambahan ini menghalang analisis daripada menganggap kebebasan sempurna.
Keputusan boleh membezakan ketersediaan lebihan penuh daripada ketersediaan berfungsi. Sistem mungkin kekal mampu mengawal proses sepanjang kebanyakan masa dalam setahun, sambil menghabiskan sejumlah jam yang ketara dengan hanya satu pengawal yang sihat. Pendedahan kepada keadaan terjejas itu mungkin tidak boleh diterima untuk aplikasi kritikal.
Model ini boleh membandingkan strategi penambahbaikan. Penggantian alat ganti yang lebih pantas mungkin mengurangkan pendedahan kepada keadaan terjejas dengan lebih berkesan berbanding menambah pengawal ketiga. Diagnosis yang lebih baik mungkin memberikan manfaat yang lebih besar daripada pengurangan kecil dalam kadar kegagalan perkakasan. Analisis Markov menjadikan pertukaran ini boleh diukur.
Peralatan Siap Sedia Memerlukan Lebih Daripada Keadaan Kegagalan Aktif
Lebihan siap sedia memperkenalkan tingkah laku tambahan. Pam siap sedia mungkin kekal berhenti sehingga pam yang sedang beroperasi gagal. Unit siap sedia mungkin mempunyai kerosakan dorman, gagal dihidupkan atau mengalami masalah logik pemindahan. Injap pengasingan juga mungkin gagal bergerak ke kedudukan yang diperlukan.
Model Markov boleh merangkumi keadaan peralatan aktif yang sihat, peralatan siap sedia yang tidak tersedia, kegagalan pemindahan, kapasiti berkurangan dan kehilangan keseluruhan sistem. Ujian bukti mengalihkan sistem daripada keadaan dorman yang tidak diketahui kepada keadaan yang diketahui. Selang antara ujian mempengaruhi tempoh kegagalan tersembunyi kekal berkemungkinan berlaku.
Dasar penyelenggaraan boleh dinilai dalam struktur yang sama. Selang ujian yang lebih pendek meningkatkan pengesanan kerosakan tersembunyi tetapi menambah beban kerja penyelenggaraan dan mungkin menyebabkan ralat tambahan. Model ini boleh membandingkan kesan yang bersaing tersebut, bukannya menganggap bahawa ujian yang lebih kerap sentiasa lebih baik.
Analisis siap sedia juga harus merangkumi logistik pembaikan. Komponen siap sedia yang gagal mungkin tidak mengganggu pengeluaran dengan serta-merta, jadi pembaikan boleh ditangguhkan. Kelewatan itu menyebabkan sistem tidak lagi dilindungi apabila unit aktif kemudiannya gagal. Oleh itu, keutamaan operasi mempengaruhi kebolehpercayaan sama seperti ciri perkakasan.
Andaian Markov Mewujudkan Kesederhanaan dan Had
Model Markov asas mengandaikan bahawa tingkah laku peralihan masa depan bergantung pada keadaan semasa, bukannya keseluruhan sejarah. Andaian ini memudahkan matematik dan selalunya memerlukan kadar peralihan malar. Sesetengah peralatan industri mematuhi penghampiran ini dengan agak baik dalam tempoh yang terhad.
Penuaan dan kerosakan terkumpul boleh melanggar andaian tersebut. Galas yang sangat haus tidak mempunyai tingkah laku kegagalan masa depan yang sama seperti galas baharu, walaupun kedua-duanya sedang beroperasi. Keadaan degradasi tambahan boleh menganggarkan penuaan, manakala model separa Markov atau model lain mungkin diperlukan untuk perwakilan yang lebih tepat.
Ledakan keadaan merupakan satu lagi cabaran. Setiap keadaan komponen boleh menggandakan bilangan keadaan sistem yang mungkin. Loji berlebihan yang kompleks boleh menghasilkan ribuan atau jutaan gabungan dengan cepat. Pengurangan model, pengelompokan atau simulasi mungkin diperlukan untuk memastikan analisis dapat diurus.
Model hendaklah mengandungi perincian yang mencukupi untuk menyokong keputusan tanpa mewakili setiap variasi fizikal. Kerumitan berlebihan menimbulkan masalah penyelenggaraan dan pengesahan. Model yang terlalu ringkas menyembunyikan tingkah laku penting, manakala model yang terlalu terperinci menjadi mustahil untuk diterangkan.
Di Mana Pemodelan Markov Berfungsi dengan Baik—dan Di Mana Ia Tidak
Pemodelan Markov amat sesuai untuk sistem berlebihan yang boleh dibaiki, peralatan siap sedia, mod operasi terdegradasi dan liputan diagnostik. Ia menyokong analisis ketersediaan serta menunjukkan bagaimana tindak balas penyelenggaraan mengubah pendedahan sistem. Kaedah ini amat berguna apabila urutan keadaan kegagalan dan pembaikan penting.
Kaedah ini bergantung pada takrifan keadaan dan kadar peralihan yang betul. Andaian kadar malar mungkin tidak mencerminkan penuaan, variasi persekitaran atau kualiti penyelenggaraan. Kegagalan berpunca sepunya mesti diwakili secara jelas dan bukannya disembunyikan dalam kadar komponen yang dianggap bebas.
Hasil analisis hendaklah disokong oleh analisis kepekaan. Pasukan perlu menguji perubahan kesimpulan apabila kadar kegagalan, masa pembaikan, liputan diagnostik dan andaian punca sepunya berubah. Reka bentuk yang kelihatan boleh diterima hanya di bawah satu andaian optimistik tidak kukuh.
Model Markov ialah alat analisis, bukannya bukti fizikal. Pengujian, bukti operasi, FMEA dan FTA masih diperlukan. Model ini membantu membandingkan strategi, tetapi tidak boleh menggantikan pengesahan seni bina sebenar.
Menggunakan Lima Kaedah sebagai Satu Sistem Kebolehpercayaan
Kelima-lima teknik ini memberikan nilai terbesar apabila digunakan secara bersepadu. FMEA boleh mengenal pasti mod kegagalan komponen secara terperinci semasa reka bentuk. FTA kemudiannya boleh menentukan gabungan yang menyumbang kepada peristiwa kritikal sistem. Pemodelan Markov boleh menerangkan tingkah laku sistem selepas kegagalan pertama dan semasa pembaikan.
Simulasi Monte Carlo boleh menguji input yang tidak pasti seperti tempoh pembaikan, penghantaran alat ganti, cuaca dan beban kerja penyelenggaraan. RCA memberikan bukti selepas kegagalan sebenar dan mungkin mendedahkan andaian yang terlepas daripada model asal. Model tersebut kemudiannya harus dikemas kini dan bukannya disimpan sebagai dokumen sejarah.
Andaikan FTA menganggap dua kegagalan pengawal sebagai bebas. RCA kemudiannya menunjukkan bahawa kedua-dua pengawal gagal selepas seorang juruteknik penyelenggaraan memuatkan konfigurasi salah yang sama. Pepohon kerosakan mesti menambah satu kejadian penyelenggaraan sepunya. Model Markov dan Monte Carlo juga harus memasukkan kebergantungan baharu ini.
Proses maklum balas ini mewujudkan program kebolehpercayaan yang sentiasa berkembang. Analisis ramalan membimbing reka bentuk, bukti operasi menguji andaian, dan hasil penyiasatan menambah baik generasi model yang seterusnya. Usaha kebolehpercayaan menjadi sebahagian daripada kitar hayat sistem dan bukannya keperluan projek sekali sahaja.
Kegagalan Sebab Sepunya Boleh Menewaskan Keseluruhan Seni Bina Berredundansi
Kegagalan sebab sepunya menjejaskan berbilang saluran melalui satu keadaan asas. Kuasa, penyejukan, infrastruktur rangkaian, perisian, pendedahan alam sekitar dan amalan penyelenggaraan yang dikongsi merupakan contoh yang lazim. Kegagalan ini amat berbahaya kerana boleh menewaskan redundansi yang kelihatan kukuh di atas kertas.
Pengasingan fizikal mengurangkan sesetengah punca sepunya. Peralatan atau perisian yang berbeza boleh mengurangkan punca yang lain. Pengesahan bebas boleh mengurangkan kesilapan penyelenggaraan dan konfigurasi. Walau bagaimanapun, kepelbagaian juga meningkatkan kerumitan latihan, alat ganti, pengujian dan integrasi.
Penyelesaian yang betul bergantung pada risiko. Memasang teknologi pengawal yang berbeza mungkin mengurangkan kegagalan perisian sepunya, tetapi mewujudkan cabaran komunikasi dan penyelenggaraan yang baharu. Bekalan kuasa berasingan mungkin memberikan sedikit manfaat apabila kedua-duanya masih berada dalam kabinet yang sama dan mudah dinaiki air. Kaedah kebolehpercayaan membantu mengenal pasti langkah kepelbagaian yang menangani mekanisme kegagalan yang munasabah.
Andaian sebab sepunya mesti dinyatakan dengan jelas dalam setiap model kuantitatif. Menganggap saluran berredundansi sebagai bebas sepenuhnya hampir selalu menghasilkan keputusan yang terlalu optimistik. Pengalaman loji dan penemuan RCA memberikan bukti berharga untuk menganggarkan kebergantungan ini.
Liputan Diagnostik Menentukan Tempoh Sistem Kekal Terdedah
Sistem berredundansi tidak dapat diurus dengan berkesan apabila kegagalan kekal tersembunyi. Liputan diagnostik menerangkan perkadaran kerosakan berkaitan yang dikesan oleh kawalan automatik atau manual. Liputan yang tinggi mengurangkan tempoh sistem beroperasi dalam keadaan terjejas tanpa disedari. Ia juga membolehkan penyelenggaraan memulihkan redundansi sebelum kegagalan lain berlaku.
Tuntutan diagnostik mesti diperiksa dengan teliti. Pengawal mungkin dapat mengesan kerosakan dalaman pemproses, tetapi bukan setiap kegagalan pendawaian medan. Modul komunikasi mungkin dapat mengesan kehilangan pautan sepenuhnya, tetapi gagal mengenal pasti pemetaan data yang salah. Bekalan kuasa mungkin memberikan penggera selepas kehilangan output sepenuhnya, tetapi tidak memberi amaran tentang kemerosotan beransur-ansur.
Ujian pembuktian meliputi kerosakan yang tidak dikesan oleh diagnostik berterusan. Selang ujian mempengaruhi tempoh pendedahan. Selang yang lebih panjang membolehkan kegagalan tersembunyi berterusan lebih lama, manakala selang yang sangat singkat meningkatkan beban penyelenggaraan dan risiko yang berpunca daripada ujian. FMEA, analisis Markov dan bukti operasi boleh menyokong penetapan selang yang seimbang.
Pengujian mesti meliputi fungsi lengkap. Mengaktifkan input PLC tidak membuktikan bahawa suis medan, pendawaian, logik, output dan elemen akhir semuanya beroperasi dengan betul. Analisis kebolehpercayaan hendaklah mentakrifkan dengan tepat kerosakan yang boleh dikesan oleh setiap diagnostik atau ujian pembuktian.
Masa Pembaikan Selalunya Sama Penting dengan Kadar Kegagalan
Program kebolehpercayaan sering menumpukan pada pengurangan kekerapan kegagalan komponen. Masa pembaikan boleh sama pentingnya dalam sistem toleran kerosakan. Selepas saluran pertama gagal, sistem mungkin terus beroperasi tetapi kekal terdedah. Kelewatan pembaikan yang panjang meningkatkan kebarangkalian bahawa kegagalan kedua akan menyebabkan kehilangan sepenuhnya.
Diagnosis, kelulusan, ketersediaan juruteknik, alat ganti, permit akses dan keadaan pengeluaran semuanya mempengaruhi masa pemulihan. Komponen mungkin mengambil masa lima belas minit untuk diganti selepas alat ganti yang betul sampai ke kabinet. Masa henti sebenar masih boleh berlanjutan selama berhari-hari apabila alat ganti perlu diperoleh dari luar negara.
Diagnostik yang dipertingkatkan boleh mengurangkan masa mengesan lokasi kerosakan. Modul yang diseragamkan dan alat ganti yang telah dikonfigurasi boleh mengurangkan masa penggantian. Inventori tempatan, prosedur peningkatan yang jelas dan sokongan kejuruteraan jarak jauh boleh mengurangkan kelewatan logistik. Model Markov dan Monte Carlo boleh mengukur nilai penambahbaikan ini.
Pelaburan kebolehpercayaan yang terbaik tidak semestinya perkakasan yang lebih kukuh. Dalam sesetengah sistem, pengurangan masa pembaikan memberikan pengurangan risiko yang lebih besar berbanding peningkatan kecil pada kadar kegagalan komponen. Analisis hendaklah membandingkan kedua-dua pilihan.
Menggunakan Analisis Kebolehpercayaan pada Seni Bina DCS dan PLC
Kebolehpercayaan sistem kawalan bergantung pada lebih daripada pemproses pusat. Jurutera hendaklah menyemak pengawal, modul I/O, rangkaian komunikasi, bekalan kuasa, pelayan, stesen pengendali, penyegerakan masa, antara muka medan dan utiliti sokongan. Setiap elemen yang dikongsi boleh menjadi kebergantungan bersama.
Pengawal berlebihan mungkin berkongsi satu rak I/O. Pelayan berlebihan mungkin bergantung pada satu suis rangkaian atau satu sistem storan. Rangkaian I/O jauh mungkin menggunakan saluran komunikasi berasingan yang melalui laluan fizikal yang sama. Analisis lengkap mesti menjejaki fungsi daripada peranti medan hingga tindakan kawalan akhir.
Tingkah laku yang diperlukan selepas kegagalan hendaklah ditakrifkan dengan jelas. Proses mungkin diteruskan di bawah pengawal yang masih berfungsi, dipindahkan kepada operasi manual, atau memasuki penutupan terkawal. Kakitangan penyelenggaraan mesti tahu cara mengenal pasti saluran yang gagal dan memulihkan sistem tanpa mengganggu saluran yang sihat.
Organisasi yang merancang naik taraf kawalan juga boleh menyemak komponen sistem kawalan DCS lazim yang digunakan dalam seni bina automasi proses. Pemilihan komponen hendaklah sentiasa mengikut keperluan kebolehpercayaan keseluruhan aplikasi, bukannya ciri produk secara berasingan.
Model yang Boleh Dipercayai Bergantung pada Data Penyelenggaraan yang Boleh Dipercayai
Analisis kebolehpercayaan kuantitatif hanya seteguh data asasnya. Rekod penyelenggaraan hendaklah membezakan kegagalan fungsi, penggantian terancang, pemeriksaan dan pengubahsuaian. Tarikh kegagalan hendaklah merujuk kepada masa fungsi hilang, manakala tarikh pemulihan hendaklah merujuk kepada masa operasi benar-benar tersedia semula.
Identiti aset mesti kekal konsisten merentas sistem sejarah, sistem penyelenggaraan, lukisan dan pangkalan data alat ganti. Kod kegagalan hendaklah menerangkan mekanisme dan bukannya gejala yang samar. “Berhenti” memberikan sedikit nilai analisis, manakala “galas tersekat akibat pencemaran pelinciran” menyokong pemodelan dan pencegahan pada masa hadapan.
Pendedahan operasi juga mesti diambil kira. Pam yang beroperasi secara berterusan tidak boleh dibandingkan secara langsung dengan pam siap sedia yang hanya dijalankan semasa ujian. Suhu, kelembapan, pencemaran, getaran, tekanan elektrik dan beban proses mungkin menjelaskan perbezaan antara komponen yang sebaliknya serupa.
Pembersihan data hendaklah dianggap sebagai kerja kejuruteraan dan bukannya persediaan pentadbiran. Pengelasan yang tidak betul boleh memesongkan kadar kegagalan, taburan pembaikan dan kesimpulan model. Penganalisis hendaklah menyemak keputusan luar biasa bersama kakitangan penyelenggaraan dan operasi sebelum menerimanya.
Aliran Kerja Praktikal untuk Meningkatkan Kebolehpercayaan
Projek kebolehpercayaan hendaklah bermula dengan mentakrifkan fungsi yang diperlukan dan sempadan sistem. Pasukan mesti menyatakan prestasi yang diperlukan semasa operasi normal dan selepas setiap kerosakan yang munasabah. Pasukan itu hendaklah mengumpulkan lukisan, manual, sejarah penyelenggaraan, prosedur operasi, rekod penggera dan laporan insiden terdahulu.
FMEA kemudiannya boleh mengenal pasti mod kegagalan peringkat komponen dan kawalan pengesanan yang lemah. FTA boleh meneliti peristiwa puncak kritikal dan kebergantungan bersama. Pemodelan Markov boleh menilai keadaan terdegradasi dan tindak balas pembaikan, manakala simulasi Monte Carlo boleh mewakili ketidakpastian dalam kegagalan, penyelenggaraan dan logistik.
Insiden sejarah hendaklah dikaji melalui RCA. Dapatan hendaklah digunakan untuk mengemas kini analisis reka bentuk dan andaian kuantitatif. Tindakan hendaklah diutamakan mengikut akibat, kebarangkalian, kebolehkesanan, pendedahan, masa pembaikan dan kos.
Setiap tindakan memerlukan pemilik, tarikh siap dan pemeriksaan keberkesanan. Analisis hendaklah dikemas kini selepas perubahan besar pada peralatan, naik taraf perisian, pengubahsuaian proses atau perubahan strategi penyelenggaraan. Kebolehpercayaan ialah disiplin kejuruteraan yang berterusan, bukannya laporan yang disiapkan sekali lalu disimpan.
Soalan-soalan yang Mendedahkan Dakwaan Lemah tentang Toleransi Kegagalan
Semakan yang kukuh menanyakan fungsi apa yang mesti kekal tersedia dan kerosakan mana yang boleh ditoleransi oleh sistem. Semakan ini menanyakan sama ada saluran berlebihan adalah bebas dari segi fizikal, elektrik dan logik. Ia juga menanyakan cara kegagalan tersembunyi dikesan dan berapa lama sistem boleh kekal dalam keadaan terjejas sebelum dibaiki.
Pasukan hendaklah mengenal pasti komponen dengan tempoh penghantaran penggantian yang panjang dan menentukan sama ada satu kesilapan penyelenggaraan boleh menjejaskan beberapa saluran. Kebergantungan perisian dan konfigurasi hendaklah diberi perhatian yang sama seperti perkakasan. Pengendali mesti memahami cara sistem bertindak selepas kerosakan dan tindakan manual yang masih tersedia.
Andaian tentang kegagalan dan pembaikan hendaklah disokong oleh bukti loji apabila boleh. Tindakan pembetulan hendaklah disahkan selepas selesai dilaksanakan. Ujian bukti hendaklah menunjukkan fungsi perlindungan yang lengkap, bukannya hanya tindak balas peralatan secara berasingan.
Soalan-soalan ini lebih bernilai daripada pernyataan umum bahawa sistem tersebut mempunyai lebihan. Soalan ini menghubungkan toleransi kegagalan dengan seni bina sebenar, persekitaran operasi dan keupayaan penyelenggaraan.
Perspektif Akhir
Toleransi kegagalan amat penting apabila masa henti, tingkah laku tidak selamat atau kehilangan kawalan tidak boleh diterima. Walau bagaimanapun, lebihan sahaja tidak mewujudkan sistem yang boleh dipercayai. Jurutera mesti memahami mod kegagalan, kebergantungan bersama, liputan diagnostik, operasi terjejas, tingkah laku pembaikan dan akibat operasi.
Analisis Pokok Kegagalan menunjukkan bagaimana gabungan kegagalan boleh menghasilkan peristiwa kritikal. FMEA menyediakan semakan sistematik terhadap mod kegagalan individu dan kesannya. Simulasi Monte Carlo menilai senario yang tidak menentu, manakala RCA menukarkan kegagalan sebenar kepada pengetahuan pencegahan. Pemodelan Markov menerangkan bagaimana sistem boleh dibaiki bergerak antara keadaan sihat, terjejas, gagal dan dipulihkan.
Setiap kaedah mempunyai batasan, tetapi secara bersama-sama kaedah ini menyediakan rangka kerja kebolehpercayaan yang kukuh. Kajian reka bentuk hendaklah dikemas kini berdasarkan bukti operasi, dan dapatan insiden hendaklah menambah baik model masa hadapan. Hasilnya mesti mempengaruhi seni bina, penyelenggaraan, alat ganti, pengujian, latihan dan prosedur.
Matlamatnya bukanlah untuk mencipta sistem yang tidak pernah mengalami kerosakan. Matlamatnya adalah untuk mengesan kerosakan lebih awal, mengehadkan akibatnya, mengekalkan fungsi yang diperlukan dan memulihkan keupayaan penuh secara boleh dijangka. Itulah makna praktikal toleransi kegagalan industri.
Tentang Penulis
Marcus Ellwood | Wartawan Kebolehpercayaan Industri dan Sistem
Marcus Ellwood ialah profil penyumbang editorial yang mewakili pasukan kandungan teknikal PLCProTech. Artikel ini mencerminkan pengalaman terkumpul selama 12 tahun dalam analisis kebolehpercayaan, integrasi automasi dan kejuruteraan lapangan yang melibatkan persekitaran kawalan ABB, Rockwell Automation, Honeywell, HIMA dan Siemens.