Năm kỹ thuật về độ tin cậy để phân tích khả năng chịu lỗi trong công nghiệp
Khám phá năm kỹ thuật đánh giá độ tin cậy thiết thực dành cho các hệ thống chịu lỗi. Tìm hiểu cách FTA, FMEA, mô phỏng Monte Carlo, RCA và các mô hình Markov hỗ trợ thiết kế và bảo trì công nghiệp ...
Vì sao khả năng chịu lỗi đòi hỏi nhiều hơn phần cứng dự phòng
Mọi hệ thống công nghiệp cuối cùng đều sẽ gặp sự cố. Cảm biến bị trôi, bộ nguồn xuống cấp, đường truyền thông trở nên không ổn định và các linh kiện cơ khí bị mài mòn do chịu tải lặp lại. Vì vậy, mục đích của kỹ thuật chịu lỗi không phải là tạo ra thiết bị không bao giờ hỏng. Mục đích là bảo đảm các sự cố có thể dự đoán không lập tức trở thành những hỏng hóc hệ thống mất kiểm soát.
Một hệ thống chịu lỗi có thể tiếp tục cung cấp chức năng chấp nhận được sau khi một hoặc nhiều linh kiện không còn khả dụng. Trong một số ứng dụng, hệ thống phải duy trì sản lượng đầy đủ. Trong các ứng dụng khác, việc giảm công suất có thể chấp nhận được cho đến khi bảo trì khôi phục kênh bị hỏng. Thay vào đó, các hệ thống trọng yếu về an toàn có thể chuyển sang trạng thái an toàn có kiểm soát khi việc tiếp tục vận hành tạo ra rủi ro không thể chấp nhận.
Các linh kiện dự phòng thường là một phần của chiến lược này, nhưng chỉ nhân đôi linh kiện không chứng minh được khả năng chịu lỗi. Hai bộ điều khiển vẫn có thể phụ thuộc vào một nguồn điện, một bộ chuyển mạch mạng hoặc một cấu hình phần mềm. Hai bộ truyền tín hiệu có thể dùng chung một đường ống lấy áp và cùng hỏng do một chỗ tắc. Vì vậy, phân tích độ tin cậy phải xem xét toàn bộ kiến trúc, bao gồm cả những mối phụ thuộc không hiển nhiên trong danh sách thiết bị.
Năm phương pháp đặc biệt hữu ích cho công việc này. Phân tích cây sự cố xem xét cách các tổ hợp hỏng hóc có thể tạo ra một sự kiện đỉnh được xác định. Phân tích dạng thức và tác động của hỏng hóc nghiên cứu cách từng linh kiện có thể hỏng và những hỏng hóc đó ảnh hưởng đến toàn hệ thống như thế nào. Mô phỏng Monte Carlo khảo sát sự không chắc chắn qua nhiều kịch bản vận hành và hỏng hóc có thể xảy ra, trong khi Phân tích nguyên nhân gốc điều tra lý do một sự kiện thực tế đã xảy ra. Mô hình Markov mô tả cách các hệ thống có thể sửa chữa chuyển đổi theo thời gian giữa các trạng thái khỏe mạnh, suy giảm, hỏng và được khôi phục.

Hình 1. Các hệ thống công nghiệp không thể tránh mọi sự cố, nhưng kỹ thuật độ tin cậy có kỷ luật có thể ngăn nhiều sự cố trở thành hỏng hóc hoàn toàn.
Độ tin cậy, Tính sẵn sàng, Tính an toàn và Khả năng bảo trì không giống nhau
Thuật ngữ độ tin cậy thường được sử dụng không chặt chẽ, điều này có thể gây nhầm lẫn trong các cuộc đánh giá thiết kế. Độ tin cậy mô tả xác suất thiết bị thực hiện chức năng yêu cầu trong một khoảng thời gian xác định. Tính sẵn sàng mô tả việc thiết bị có sẵn sàng khi quy trình cần đến hay không. Một hệ thống đôi khi có thể hỏng nhưng vẫn duy trì tính sẵn sàng cao khi việc sửa chữa nhanh chóng và phụ tùng thay thế có thể được tiếp cận ngay lập tức.
Khả năng bảo trì mô tả mức độ hiệu quả của việc chẩn đoán và khôi phục một hệ thống bị hỏng. Tính an toàn mô tả việc các sự cố có nằm trong giới hạn rủi ro chấp nhận được đối với nhân sự, môi trường và thiết bị hay không. Các đặc tính này tác động lẫn nhau, nhưng cải thiện một đặc tính không tự động cải thiện tất cả các đặc tính còn lại. Việc dừng bảo vệ có thể làm giảm khả năng sẵn sàng sản xuất, đồng thời cải thiện đáng kể mức độ an toàn của nhà máy.
Khả năng chịu lỗi bao quát các lĩnh vực này. Nó phụ thuộc vào tính dự phòng, khả năng chẩn đoán, cô lập, khả năng sửa chữa và sự suy giảm có kiểm soát. Khả năng này cũng phụ thuộc vào việc xác định rõ chức năng bắt buộc. Kỹ sư không thể xác định một hệ thống có chịu lỗi hay không cho đến khi biết hiệu năng nào phải được duy trì sau mỗi lỗi có thể xảy ra.
Ví dụ, một hệ thống bảo vệ máy nén có thể cần duy trì khả năng ngắt khẩn cấp sau khi một cảm biến bị hỏng. Một hệ thống điều khiển quy trình có thể chỉ cần duy trì hoạt động ổn định trong khi một bộ điều khiển được thay thế. Một phương án bảo vệ nguồn điện có thể yêu cầu các kênh độc lập để một lỗi chung không thể vô hiệu hóa cả hệ thống bảo vệ chính và dự phòng. Các kỹ thuật độ tin cậy giúp kỹ sư chuyển những yêu cầu này thành các thiết kế có thể kiểm thử.
Lựa chọn phương pháp theo câu hỏi kỹ thuật
Năm kỹ thuật độ tin cậy đề cập đến những khía cạnh khác nhau của cùng một vấn đề. FTA bắt đầu với một sự kiện không mong muốn của hệ thống và truy ngược về các hỏng hóc có thể gây ra sự kiện đó. FMEA bắt đầu với các linh kiện hoặc chức năng và tiến tới các hậu quả của từng dạng hỏng. Mô phỏng Monte Carlo nghiên cứu ảnh hưởng của sự không chắc chắn bằng cách lặp lại mô hình hệ thống trong nhiều điều kiện được tạo ngẫu nhiên.
RCA thường bắt đầu sau một sự cố thực tế, sử dụng bằng chứng để phân biệt các triệu chứng biểu hiện với những nguyên nhân kỹ thuật và tổ chức tiềm ẩn. Mô hình Markov tập trung vào các trạng thái của hệ thống và tốc độ chuyển đổi giữa các trạng thái đó. Phương pháp này đặc biệt hữu ích khi việc sửa chữa, vận hành ở chế độ chờ, hiệu suất suy giảm và độ bao phủ chẩn đoán ảnh hưởng đáng kể đến khả năng sẵn sàng.
Lựa chọn đúng phụ thuộc vào câu hỏi cần giải đáp. Một nhóm đang điều tra cách thức có thể xảy ra mất hoàn toàn khả năng làm mát thường sẽ bắt đầu bằng FTA. Nhóm thiết kế xem xét mọi khả năng hỏng của máy phát, bộ điều khiển và van sẽ thu được nhiều lợi ích hơn từ FMEA. Người quản lý tài sản so sánh các khoảng thời gian bảo trì chưa chắc chắn có thể sử dụng mô phỏng Monte Carlo, trong khi kỹ sư độ tin cậy tính toán khả năng sẵn sàng dài hạn cho một cặp bộ điều khiển dự phòng có thể thích mô hình Markov hơn.
Các phương pháp này bổ trợ cho nhau thay vì có thể thay thế lẫn nhau. FMEA có thể xác định các dạng hỏng, sau đó trở thành các sự kiện cơ bản trong cây lỗi. Các phát hiện từ RCA có thể điều chỉnh những giả định hỏng hóc phi thực tế trong mô hình Markov. Mô phỏng Monte Carlo có thể kiểm tra mức độ ảnh hưởng của các xác suất không chắc chắn đến những kết luận rút ra từ FTA hoặc việc lập kế hoạch bảo trì.
Phân tích cây lỗi bắt đầu từ hậu quả
Phân tích cây lỗi là một phương pháp suy diễn, bắt đầu với một sự kiện không mong muốn được xác định rõ ràng. Sự kiện này được gọi là sự kiện đỉnh. Các ví dụ phù hợp gồm mất toàn bộ nước cấp cho nồi hơi, hỏng chức năng ngắt tuabin, mất hoàn toàn liên lạc với bộ điều khiển hoặc áp suất trong lò phản ứng tăng không kiểm soát. Định nghĩa phải đủ cụ thể để hỗ trợ việc phân tích có ý nghĩa.
Một sự kiện đỉnh chỉ được mô tả là “hỏng hệ thống” thường quá mơ hồ. Mô tả đó không xác định chức năng nào đã hỏng, tình trạng hỏng kéo dài bao lâu hoặc trạng thái vận hành nào đang áp dụng. Một định nghĩa tốt hơn có thể là “mất toàn bộ lưu lượng nước làm mát trong hơn sáu mươi giây trong quá trình sản xuất bình thường”. Cách diễn đạt này tạo ra ranh giới rõ ràng cho việc phân tích.
Sau khi xác định sự kiện đỉnh, nhóm nhận diện các điều kiện trực tiếp có thể gây ra sự kiện đó. Các điều kiện này được phân rã thành những sự kiện ở cấp thấp hơn cho đến khi phân tích đạt đến các hỏng hóc của bộ phận cơ bản, nhiễu loạn bên ngoài hoặc hành động của con người. Các cổng logic kết nối các sự kiện và mô tả cách chúng kết hợp với nhau. Cổng OR cho biết bất kỳ sự kiện nào được liệt kê cũng có thể gây ra sự kiện cấp cao hơn, trong khi cổng AND yêu cầu nhiều sự kiện xảy ra đồng thời.
Cây hoàn chỉnh cung cấp một biểu diễn trực quan về logic hỏng hóc. Cây cho phép các chuyên gia về điện, cơ khí, thiết bị đo lường, quy trình, bảo trì và an toàn cùng xem xét một hệ thống từ góc nhìn chung. Mô hình chung này là một trong những thế mạnh thực tiễn lớn nhất của FTA. Mô hình giúp dễ dàng thách thức các giả định tiềm ẩn trước khi chúng được tích hợp vào thiết kế.

Hình 2. Cây sự cố phân tích ngược từ một sự kiện đỉnh đã xác định và nhận diện các tổ hợp hỏng hóc ở cấp thấp hơn có thể gây ra sự kiện đó.
Phát triển cây sự cố từng bước
Nhiệm vụ thực tiễn đầu tiên là xác lập ranh giới hệ thống. Các kỹ sư phải quyết định thiết bị, tiện ích, phần mềm, nhân sự vận hành và dịch vụ bên ngoài nào thuộc phạm vi phân tích. Một nghiên cứu hệ thống làm mát có thể bao gồm máy bơm, van, phân phối điện, thiết bị đo lường và logic điều khiển. Nghiên cứu cũng có thể cần bao gồm nguồn nước, điều kiện môi trường và phản ứng của người vận hành khi các yếu tố này có thể ảnh hưởng đến sự kiện đỉnh.
Sau đó, nhóm xác định các nguyên nhân trực tiếp. Mất hoàn toàn khả năng làm mát có thể xảy ra vì tất cả máy bơm đều không khả dụng, vì ống góp cấp chung bị tắc, hoặc vì các van cô lập đóng sai. Mỗi nguyên nhân trực tiếp được phân rã thêm. Tình trạng máy bơm không khả dụng có thể do hỏng động cơ, kẹt ổ bi, mất nguồn hút, hỏng bộ điều khiển hoặc mất nguồn điện.
Quy trình tiếp diễn cho đến khi việc phân rã thêm không còn cải thiện quyết định. Các sự kiện ở cấp thấp nhất được xem là sự kiện cơ bản và có thể được gán xác suất hoặc tỷ lệ hỏng hóc. Sau đó, cấu trúc logic có thể được đánh giá định tính hoặc định lượng. Ngay cả khi không có dữ liệu số chính xác, cây vẫn có thể chỉ ra các điểm hỏng đơn lẻ và những phụ thuộc chung ngoài dự kiến.
FTA định lượng kết hợp các xác suất sự kiện theo cấu trúc cổng logic. Phép tính có thể có vẻ đơn giản, nhưng các giả định về tính độc lập cần được xem xét cẩn thận. Hai sự kiện cùng phụ thuộc vào một nguồn điện, môi trường, hoạt động bảo trì hoặc lỗi phần mềm không hoàn toàn độc lập. Bỏ qua các mối quan hệ này có thể khiến một thiết kế dự phòng có vẻ an toàn hơn đáng kể so với thực tế.
Các tập cắt tối thiểu cho thấy những tổ hợp nguy hiểm nhất
Tập cắt là một tổ hợp các sự kiện cơ bản tạo ra sự kiện đỉnh. Tập cắt tối thiểu không chứa sự kiện không cần thiết nào, nghĩa là việc loại bỏ bất kỳ sự kiện nào cũng sẽ ngăn sự kiện đỉnh xảy ra. Những tổ hợp này giúp kỹ sư xác định các đường dẫn hỏng hóc ngắn nhất và quan trọng nhất. Chúng đặc biệt hữu ích khi một cây lỗi lớn chứa hàng trăm sự kiện.
Một tập cắt tối thiểu gồm một sự kiện cho thấy chỉ một hỏng hóc cũng có thể trực tiếp gây ra sự kiện đỉnh. Những phát hiện như vậy thường cần được xem xét ngay trong thiết kế. Nhóm có thể bổ sung dự phòng, cải thiện khả năng cô lập, cung cấp nguồn điện riêng hoặc đưa vào một lớp bảo vệ khác. Các tập cắt gồm hai hoặc ba sự kiện thường đại diện cho những hỏng hóc trong các kiến trúc dự phòng.
Không phải mọi tập cắt ngắn đều có cùng mức rủi ro. Một tổ hợp gồm hai sự kiện hỏng hóc thường xuyên có thể đáng kể hơn một sự kiện bên ngoài cực kỳ hiếm. Thời gian phát hiện và sửa chữa cũng ảnh hưởng đến mức độ quan trọng. Một hỏng hóc tiềm ẩn không được phát hiện trong nhiều tháng tạo ra khoảng thời gian phơi nhiễm lớn hơn nhiều so với một hỏng hóc được phát hiện và sửa chữa ngay lập tức.
Phần mềm FTA có thể xếp hạng các tập cắt theo mức đóng góp được tính toán. Tuy nhiên, các kỹ sư vẫn nên xem xét ý nghĩa vật lý đằng sau những con số. Một xác suất nhỏ về mặt toán học có thể dựa trên các giả định yếu hoặc dữ liệu chung chung không phản ánh đúng hệ thống lắp đặt thực tế. Phán đoán kỹ thuật vẫn cần thiết trong suốt quá trình phân tích.
Ví dụ: Tính dự phòng của bơm nước cấp lò hơi nhưng không thực sự độc lập
Hãy xem xét một nhà máy điện vận hành hai bơm nước cấp lò hơi. Một trong hai bơm đều có thể duy trì lưu lượng tối thiểu yêu cầu, nên hệ thống có vẻ có khả năng chịu được việc một bơm bị hỏng. Việc chỉ đếm số lượng thiết bị cho thấy sự dự phòng đầy đủ. Tuy nhiên, cây lỗi có thể cho thấy một thực tế khác khi tính đến các phụ thuộc dùng chung.
Cả hai động cơ bơm có thể nhận điện từ cùng một thanh cái điện. Cả hai bơm có thể hút từ một ống góp hút, phụ thuộc vào cùng một hệ thống điều khiển hoặc nhận lệnh từ một phép đo mức duy nhất. Do đó, một sự cố thanh cái, ống góp hút bị tắc hoặc tín hiệu chung không chính xác có thể khiến cả hai bơm ngừng hoạt động cùng lúc. Sự dư thừa biểu kiến của hai bơm sẽ không bảo vệ hệ thống trước các hỏng hóc chung này.
Phân tích có thể dẫn đến một số cải tiến thực tế. Các nguồn cấp điện riêng biệt có thể giảm nguy cơ mất điện chung. Các phép đo mức đa dạng có thể giảm sự phụ thuộc vào một công nghệ bộ truyền tín hiệu duy nhất. Các đường điều khiển độc lập, thao tác thủ công được cải thiện và việc giám sát lực hút tốt hơn có thể củng cố kiến trúc mà không nhất thiết phải bổ sung thêm một máy bơm hoàn chỉnh.
Ví dụ này cho thấy vì sao FTA hữu ích hơn việc chỉ đếm các thiết bị dự phòng. Phương pháp này đánh giá liệu các thiết bị có duy trì được tính độc lập trong điều kiện vận hành thực tế hay không. Đồng thời, nó cũng xác định nơi sự phức tạp bổ sung mang lại khả năng bảo vệ thực sự và nơi nó chỉ tạo ra vẻ ngoài được bảo vệ.
Phân tích cây sự cố hoạt động hiệu quả ở đâu—và không hiệu quả ở đâu
FTA đặc biệt hiệu quả đối với các chức năng an toàn, hệ thống bảo vệ, phân phối điện, mạng truyền thông và các ứng dụng khác có một sự kiện không mong muốn được xác định rõ ràng. Cấu trúc trực quan của phương pháp này hỗ trợ việc đánh giá thiết kế và thảo luận với cơ quan quản lý. Có thể sử dụng FTA theo định tính để phát hiện điểm yếu hoặc theo định lượng để ước tính xác suất xảy ra sự kiện đỉnh.
Phương pháp này trở nên kém hiệu quả khi sự kiện đỉnh được xác định không rõ ràng. Việc duy trì cũng có thể trở nên khó khăn khi cây mở rộng đến hàng nghìn sự kiện. Các chuỗi động, hoạt động bảo trì và trạng thái vận hành thay đổi có thể đòi hỏi các cổng chuyên dụng hoặc kỹ thuật mô hình hóa bổ sung. Cây sự cố tĩnh không tự nhiên mô tả được mọi mối quan hệ phụ thuộc thời gian.
Các hành động của con người cũng cần được xử lý cẩn trọng. Xác suất phản ứng của người vận hành phụ thuộc vào chất lượng cảnh báo, thiết kế quy trình, đào tạo, khối lượng công việc, thời gian sẵn có và điều kiện giao diện. Việc gán một xác suất lỗi con người chung có thể che giấu những khác biệt này. Các phân tích nghiêm túc nên có sự tham gia của chuyên gia yếu tố con người khi hành động của người vận hành đóng vai trò then chốt đối với kết quả.
Do đó, FTA phát huy hiệu quả nhất khi được sử dụng như một phần của chương trình độ tin cậy rộng hơn. FMEA có thể cung cấp các dạng hỏng chi tiết của bộ phận, trong khi các phương pháp Markov hoặc Monte Carlo có thể xử lý việc sửa chữa, trình tự và tính không chắc chắn. Không nên xem bất kỳ cây sự kiện đơn lẻ nào là sự mô tả hoàn chỉnh mọi hành vi của hệ thống.
Phân tích dạng hỏng và ảnh hưởng bắt đầu từ bộ phận
Phân tích dạng hỏng và ảnh hưởng sử dụng phương pháp quy nạp. Thay vì bắt đầu từ một sự kiện đỉnh, nhóm bắt đầu với một hạng mục, chức năng hoặc bước trong quy trình. Sau đó, nhóm xem xét hạng mục đó có thể hỏng như thế nào và mỗi dạng hỏng sẽ gây ra ảnh hưởng gì tại chỗ cũng như trên toàn hệ thống. Hướng tiếp cận này khiến FMEA đặc biệt hữu ích trong quá trình thiết kế và đánh giá thiết bị.
Một bộ truyền tín hiệu áp suất có thể hỏng theo nhiều cách khác nhau. Tín hiệu đầu ra có thể bị trôi lên cao, trôi xuống thấp, đóng băng ở một giá trị, trở nên không ổn định hoặc biến mất hoàn toàn. Mỗi dạng hỏng gây ra một hậu quả vận hành khác nhau. Giá trị đọc cao có thể gây ra việc dừng máy không cần thiết, trong khi giá trị đọc thấp có thể che giấu tình trạng áp suất nguy hiểm.
FMEA buộc nhóm phải mô tả những khác biệt này thay vì chỉ ghi “hỏng bộ truyền tín hiệu”. Phân tích cũng xem xét các biện pháp kiểm soát phòng ngừa và phát hiện hiện có. Phân tích có thể xác định các chức năng chẩn đoán, logic so sánh, kiểm tra xác nhận, cảnh báo, mạch nối tắt hoặc hoạt động kiểm tra của người vận hành giúp giảm hậu quả. Khả năng phát hiện yếu thường trở nên quan trọng không kém dạng hỏng ban đầu.

Hình 3. FMEA đánh giá từng dạng hỏng, ảnh hưởng của chúng, mức độ nghiêm trọng và các biện pháp kiểm soát sẵn có để phòng ngừa hoặc phát hiện chúng.
Bảng phân tích FMEA hiệu quả cần bao gồm những gì
Một bảng phân tích FMEA hữu ích bắt đầu bằng đối tượng và chức năng bắt buộc của đối tượng đó. Dạng hỏng mô tả cách chức năng có thể bị mất, suy giảm hoặc thực hiện không chính xác. Ảnh hưởng cục bộ mô tả điều xảy ra ở cấp độ linh kiện, trong khi ảnh hưởng cấp hệ thống mô tả hậu quả vận hành hoặc an toàn trên phạm vi rộng hơn. Nguyên nhân và cơ chế được ghi riêng với các ảnh hưởng.
Bảng phân tích cũng ghi lại các biện pháp kiểm soát hiện có. Biện pháp kiểm soát phòng ngừa làm giảm xác suất xảy ra hỏng hóc. Biện pháp kiểm soát phát hiện выяв lỗi trước khi lỗi gây ra hậu quả không thể chấp nhận. Ví dụ gồm có chức năng tự chẩn đoán, so sánh giữa các tín hiệu dự phòng, giới hạn cảnh báo, kiểm tra xác nhận, kiểm tra và bảo trì dự đoán.
Nhiều tổ chức chấm điểm mức độ nghiêm trọng, tần suất xảy ra và khả năng phát hiện. Các giá trị này đôi khi được nhân với nhau để tạo ra Chỉ số Ưu tiên Rủi ro. Chỉ số này có thể hỗ trợ việc sắp xếp ưu tiên, nhưng không bao giờ được thay thế đánh giá kỹ thuật. Những tổ hợp khác nhau có thể tạo ra cùng một điểm số, dù hậu quả của chúng về cơ bản rất khác nhau.
Một sự cố thảm khốc hiếm gặp có thể cần được chú ý hơn một bất tiện nhỏ xảy ra thường xuyên, ngay cả khi điểm số tính toán của chúng có vẻ tương đương. Do đó, mức độ nghiêm trọng cần được xem xét độc lập. Các nhóm cũng nên ưu tiên những hành động loại bỏ cơ chế hỏng hóc hoặc giảm hậu quả, thay vì chỉ dựa vào các hoạt động kiểm tra bổ sung.
Ví dụ: Các đầu vào PLC dự phòng có một điểm yếu chung
Hãy xem xét hai kênh đầu vào số giám sát một công tắc hiện trường khẩn cấp. Kiến trúc này có vẻ dự phòng vì hai đầu vào PLC nhận cùng một tín hiệu. FMEA kiểm tra xem toàn bộ đường dẫn tín hiệu có thực sự độc lập hay không. Phân tích xem xét tiếp điểm hiện trường, hệ thống dây dẫn, nguồn cấp cho đầu vào, các cụm đầu nối, mô-đun, logic và hoạt động chẩn đoán.
Các dạng hỏng có thể xảy ra gồm hở mạch, ngắn mạch, tiếp điểm bị hàn dính, kênh bị kẹt ở mức cao, kênh bị kẹt ở mức thấp hoặc mất nguồn cấp đầu vào dùng chung. Phân tích cũng đặt câu hỏi liệu sự không nhất quán giữa các kênh có được phát hiện hay không. Nếu cả hai kênh dùng chung một tiếp điểm hiện trường và một dây cáp, nhiều hỏng hóc có cơ sở có thể đồng thời ảnh hưởng đến cả hai kênh.
Việc xem xét có thể cho thấy các mô-đun đầu vào được nhân đôi chỉ mang lại mức bảo vệ bổ sung hạn chế. Có thể cần các tiếp điểm riêng biệt, mạch hiện trường được giám sát, đường cấp nguồn độc lập hoặc các nguyên lý cảm biến đa dạng. Quy trình kiểm tra xác nhận cũng phải kiểm tra toàn bộ chuỗi tín hiệu thay vì chỉ kiểm tra mô-đun PLC.
Đối với các kiến trúc bảo vệ, kỹ sư cũng có thể xem xét các mô-đun an toàn công nghiệp phù hợp, được thiết kế để cung cấp độ bao phủ chẩn đoán, tính dự phòng và đặc tính hỏng có kiểm soát. Tuy nhiên, việc lựa chọn phần cứng vẫn phải tuân theo toàn bộ vòng đời an toàn và không thể thay thế cho phân tích dành riêng cho ứng dụng.
FMEA Thiết kế và FMEA Quy trình Giải quyết các Rủi ro Khác nhau
FMEA thiết kế nghiên cứu sản phẩm hoặc hệ thống được thiết kế. Phương pháp này xem xét liệu kiến trúc, linh kiện, vật liệu và các chức năng điều khiển được lựa chọn có thể hoạt động như dự kiến hay không. Phương pháp thường được áp dụng trong giai đoạn phát triển ý tưởng, thiết kế chi tiết và thay đổi thiết kế. Phương pháp có giá trị nhất trước khi thiết kế trở nên tốn kém để sửa đổi.
FMEA quy trình nghiên cứu các hoạt động sản xuất, lắp ráp, lắp đặt, chạy thử hoặc bảo trì. Một tủ điện có thể có thiết kế điện đúng, nhưng quy trình lắp đặt vẫn có thể gây ra các đầu nối bị lỏng, đấu ngược cực, định mức cầu chì không chính xác hoặc nhận dạng dây sai. Hoạt động bảo trì có thể đưa vào phần sụn không đúng, linh kiện thay thế không phù hợp, vô hiệu hóa cảnh báo hoặc để các mạch nối tắt ở trạng thái hoạt động.
Hai hình thức FMEA này nên hỗ trợ lẫn nhau. Các biện pháp kiểm soát thiết kế có thể giảm độ nhạy với việc lắp đặt, trong khi các biện pháp kiểm soát quy trình có thể ngăn ngừa lỗi thực hiện mà thiết kế không thể loại bỏ. Chỉ xem xét thiết kế thiết bị sẽ bỏ sót nhiều rủi ro trong suốt vòng đời. Chỉ xem xét quy trình công việc có thể che giấu những điểm yếu vốn có trong kiến trúc ban đầu.
Đối với các hệ thống tự động hóa quan trọng, cả hai phân tích nên được cập nhật sau những sửa đổi đáng kể. Việc thay thế bộ điều khiển, chuyển đổi mạng, nâng cấp phần mềm hoặc thay đổi quy trình kiểm tra xác nhận có thể tạo ra các dạng hỏng mới. Các bảng tính lịch sử không nên bị giữ nguyên trong khi nhà máy liên tục thay đổi.
FMECA Bổ sung Đánh giá Mức độ Nghiêm trọng Chính thức hơn
Phân tích các dạng hỏng, ảnh hưởng và mức độ nghiêm trọng mở rộng cấu trúc FMEA bằng cách bổ sung các phép tính mức độ nghiêm trọng chính thức. Phương pháp này có thể sử dụng tỷ lệ hỏng hóc của linh kiện, mức độ phơi nhiễm trong vận hành, các giai đoạn nhiệm vụ, các nhóm mức độ nghiêm trọng và xác suất có điều kiện. Phương pháp hữu ích khi một hệ thống lớn có nhiều dạng hỏng và cần tập trung nguồn lực kỹ thuật vào những yếu tố đóng góp quan trọng nhất.
Các phép tính mức độ nghiêm trọng phụ thuộc nhiều vào chất lượng dữ liệu. Cơ sở dữ liệu tỷ lệ hỏng hóc chung cung cấp điểm khởi đầu, nhưng có thể không phản ánh đúng hệ thống lắp đặt thực tế. Nhiệt độ, rung động, nhiễm bẩn, ứng suất điện, chất lượng bảo trì và chu kỳ làm việc đều ảnh hưởng đến hiệu suất thực tế. Khi có đủ lịch sử vận hành, bằng chứng cụ thể của nhà máy nên thay thế các giả định chung.
Phân tích cũng nên phân biệt giữa các hỏng hóc được phát hiện ngay lập tức và các hỏng hóc vẫn còn tiềm ẩn. Một hỏng hóc tiềm ẩn ở hệ thống dự phòng có thể không ảnh hưởng đến sản xuất cho đến khi một linh kiện khác hỏng hoặc khi phát sinh yêu cầu hoạt động. Thời gian tiềm ẩn kéo dài có thể khiến một hỏng hóc tương đối ít xảy ra trở nên đặc biệt quan trọng. Vì vậy, phải đưa các khoảng thời gian phát hiện và hiệu quả của kiểm thử xác nhận vào phân tích.
FMECA hữu ích nhất khi kết quả dẫn đến hành động về thiết kế hoặc bảo trì. Một bảng xếp hạng phức tạp sẽ có ít giá trị nếu không ảnh hưởng đến kiến trúc, phụ tùng dự phòng, chẩn đoán, kiểm thử hoặc quy trình vận hành. Mục đích vẫn là giảm rủi ro một cách thiết thực, thay vì tính toán chỉ vì bản thân việc tính toán.
FMEA Hoạt Động Hiệu Quả Ở Đâu—Và Có Thể Gây Hiểu Lầm Ở Đâu
FMEA cung cấp một quy trình xem xét có hệ thống theo từng linh kiện. Phương pháp này tương đối dễ giải thích và hỗ trợ sự tham gia của nhân sự kỹ thuật, vận hành, bảo trì, chất lượng và an toàn. Danh mục hành động tạo ra có thể được liên kết trực tiếp với các thay đổi thiết kế, hoạt động kiểm tra, chẩn đoán và cải tiến bảo trì.
Phương pháp này có thể trở nên lặp lại khi áp dụng cho các hệ thống rất lớn. Các nhóm có thể dành quá nhiều thời gian để lập tài liệu cho những dạng hỏng hóc ít giá trị trong khi bỏ qua các tương tác trong hệ thống. FMEA truyền thống cũng có xu hướng xem xét từng hỏng hóc một. Nhiều hỏng hóc đồng thời và các sự kiện phụ thuộc vào trình tự có thể không được thể hiện rõ ràng.
Hệ thống chấm điểm tạo ra một rủi ro khác. Các nhóm có thể điều chỉnh mức đánh giá để đạt được mức ưu tiên mong muốn hoặc coi con số cuối cùng là khách quan hơn phán đoán làm nền tảng cho nó. Điểm thấp không chứng minh rằng một dạng hỏng hóc là có thể chấp nhận. Các sự kiện có mức độ nghiêm trọng cao, hỏng hóc do nguyên nhân chung và yêu cầu pháp quy nên được xem xét riêng.
Chất lượng của FMEA phụ thuộc vào những người thực hiện. Một bảng tính do một kỹ sư thiết kế chuẩn bị có thể bỏ sót thực tế tại hiện trường mà nhân viên vận hành và kỹ thuật viên biết rõ. Các nghiên cứu hiệu quả kết hợp kiến thức thiết kế với lịch sử bảo trì thực tế và kinh nghiệm vận hành.
Mô phỏng Monte Carlo Biến Sự Không Chắc Chắn Thành Một Phân Phối
Các phép tính độ tin cậy công nghiệp thường liên quan đến các đầu vào không chắc chắn. Tuổi thọ linh kiện thay đổi, thời gian sửa chữa không cố định, việc giao phụ tùng thay thế khó dự đoán và ứng suất môi trường ảnh hưởng đến đặc tính hỏng hóc. Một giá trị trung bình duy nhất không phải lúc nào cũng thể hiện được những biến động này. Mô phỏng Monte Carlo giải quyết vấn đề này thông qua việc lấy mẫu ngẫu nhiên lặp lại.
Trước tiên, kỹ sư xây dựng mô hình hệ thống và gán các phân phối xác suất cho những biến không chắc chắn. Sau đó, mô phỏng tạo ra nhiều tổ hợp khả dĩ. Một lần chạy có thể giả định rằng một máy bơm hỏng sau 8.000 giờ và được sửa chữa trong vòng bốn giờ. Một lần chạy khác có thể cho ra hỏng hóc muộn hơn nhưng thời gian sửa chữa lâu hơn nhiều vì không có sẵn phụ tùng dự phòng cần thiết.
Sau hàng nghìn hoặc hàng triệu lần chạy, các kết quả tạo thành một phân phối. Mô hình có thể ước tính thời gian ngừng hoạt động dự kiến, tổn thất sản lượng, độ sẵn sàng của hệ thống, xác suất hoàn thành nhiệm vụ, nhu cầu phụ tùng dự phòng hoặc chi phí bảo trì. Mô hình cũng có thể cho thấy xác suất xảy ra các kết quả cực đoan mà sẽ biến mất nếu chỉ gói gọn trong một giá trị trung bình.

Hình 4. Mô phỏng Monte Carlo đánh giá nhiều kịch bản hỏng hóc và sửa chữa được tạo ngẫu nhiên để ước tính phạm vi các kết quả có thể xảy ra.
Xây dựng mô hình độ tin cậy Monte Carlo đáng tin cậy
Chất lượng của mô phỏng phụ thuộc vào mô hình hệ thống. Mô hình phải thể hiện các linh kiện, quy tắc vận hành, phân phối hỏng hóc, hành vi sửa chữa, sự phụ thuộc, logic dự phòng và nguồn lực bảo trì. Mô hình cũng có thể bao gồm thời tiết, nhu cầu sản xuất, chậm trễ hậu cần và phản ứng của con người khi những yếu tố đó ảnh hưởng đến hiệu suất hệ thống.
Mỗi lần chạy mô phỏng theo dõi hệ thống theo thời gian. Các linh kiện hỏng theo các phân phối được lấy mẫu, việc sửa chữa bắt đầu khi nguồn lực sẵn sàng, và mô hình ghi nhận liệu hệ thống vẫn đang hoạt động, bị suy giảm hay không khả dụng. Việc lặp lại quy trình này tạo ra các ước tính cho những thước đo hiệu suất khác nhau.
Thẩm định là điều thiết yếu. Nhóm nên so sánh mô hình với các phép tính đơn giản hóa, những trường hợp vận hành đã biết và kết quả lịch sử của nhà máy. Kết quả bất ngờ cần được điều tra thay vì chấp nhận chỉ vì chúng được phần mềm tạo ra. Một mô phỏng ấn tượng về mặt trực quan vẫn có thể sai nếu logic nền tảng chưa đầy đủ.
Phân tích độ nhạy giúp xác định những giả định nào chi phối kết quả. Nếu thời gian sửa chữa có ảnh hưởng lớn hơn nhiều so với tỷ lệ hỏng hóc, ban quản lý có thể thu được nhiều giá trị hơn bằng cách cải thiện khả năng cung ứng phụ tùng dự phòng và tốc độ chẩn đoán. Nếu xác suất nguyên nhân chung chi phối, việc bổ sung thêm các linh kiện giống hệt nhau có thể mang lại rất ít lợi ích.
Lựa chọn các phân phối xác suất phù hợp với cơ chế hỏng hóc
Phân phối mũ giả định tỷ lệ hỏng hóc không đổi. Phân phối này có thể phù hợp với một số linh kiện điện tử trong thời gian vận hành hữu ích. Phân phối Weibull linh hoạt hơn và có thể biểu diễn các hỏng hóc giai đoạn đầu, hỏng hóc ngẫu nhiên hoặc hiện tượng hao mòn. Phân phối lognormal thường hữu ích để mô hình hóa thời gian sửa chữa và các quy trình chịu ảnh hưởng của nhiều yếu tố nhân.
Việc lựa chọn nên phản ánh cơ chế vật lý thay vì sự tiện lợi của phần mềm. Hỏng vòng bi do hao mòn không tự nhiên tuân theo cùng một quy luật như lỗi giao tiếp ngẫu nhiên. Việc sử dụng cùng một tỷ lệ hỏng hóc không đổi cho cả hai có thể làm sai lệch các dự báo dài hạn. Các kỹ sư độ tin cậy nên xem xét lịch sử vận hành và cơ chế hỏng hóc trước khi chọn phân phối.
Dữ liệu lịch sử thường cần được làm sạch. Hệ thống bảo trì có thể nhầm lẫn giữa việc thay thế theo kế hoạch và sự cố chức năng. Ngày xảy ra sự cố có thể được nhập là ngày mở lệnh công việc thay vì ngày lỗi thực sự xảy ra. Tên tài sản, số giờ vận hành và mã lỗi cũng có thể không nhất quán giữa các cơ sở.
Dữ liệu hạn chế không ngăn cản việc phân tích, nhưng sự không chắc chắn cần được thể hiện rõ. Nhận định của chuyên gia, thông tin từ nhà cung cấp và cơ sở dữ liệu ngành có thể hỗ trợ các ước tính ban đầu. Mô hình nên kiểm tra một phạm vi thực tế thay vì trình bày một giả định không chắc chắn như một sự thật chính xác.
Ví dụ: Độ sẵn sàng của một trạm có ba máy nén
Hãy xem xét một trạm có ba máy nén khí. Cần hai máy để đạt sản lượng tối đa, trong khi máy thứ ba cung cấp công suất dự phòng. Mỗi máy có số giờ vận hành, lịch sử bảo trì và hiệu suất làm mát khác nhau. Chỉ có thể thực hiện một lần sửa chữa lớn tại một thời điểm vì trạm chỉ có một đội bảo trì chuyên môn.
Vòng bi dự phòng cần vài ngày để giao đến, và các sự cố của hệ thống làm mát trở nên thường xuyên hơn khi nhiệt độ môi trường cao. Những tương tác này khó được mô tả bằng một phương trình độ sẵn sàng đơn giản. Mô hình Monte Carlo có thể lấy mẫu các sự cố máy nén, thời gian sửa chữa, các giai đoạn thời tiết, khả năng sẵn sàng của kỹ thuật viên và độ trễ logistics.
Kết quả có thể cho thấy trạng thái sẵn sàng ở toàn bộ công suất, vận hành ở công suất giảm và trạm ngừng hoàn toàn. Ban quản lý có thể so sánh các phương án đầu tư. Dự trữ thêm vòng bi có thể giảm thời gian ngừng máy cực đoan hiệu quả hơn so với việc bổ sung một kỹ thuật viên bảo trì đa năng khác. Cải thiện độ tin cậy của hệ thống làm mát có thể mang lại giá trị lớn hơn việc thay thế một máy nén vốn vẫn hoạt động tốt.
Mô hình cũng có thể kiểm tra các khoảng thời gian bảo trì. Khoảng thời gian bảo trì phòng ngừa ngắn hơn có thể giảm số lần hỏng hóc, nhưng làm tăng thời gian dừng máy theo kế hoạch và các lỗi do bảo trì gây ra. Mô phỏng cho phép đánh giá cả hai tác động trong cùng một mô hình vận hành.
Mô phỏng Monte Carlo hoạt động hiệu quả ở đâu—và thất bại ở đâu
Các phương pháp Monte Carlo rất hữu ích khi nhiều biến không chắc chắn tương tác với nhau. Chúng có thể mô phỏng logistics phức tạp, hàng đợi sửa chữa, ảnh hưởng của thời tiết, nhu cầu sản xuất và các quyết định bảo trì. Phân phối kết quả cung cấp nhiều thông tin hơn một giá trị trung bình duy nhất. Phương pháp này cũng hỗ trợ ra quyết định dựa trên rủi ro bằng cách cho thấy xác suất xảy ra các kết quả nghiêm trọng nhưng hiếm gặp.
Điểm yếu chính là độ đáng tin cậy của mô hình. Một mô phỏng phức tạp có thể tạo ra sự tự tin giả tạo vì kết quả của nó có vẻ chính xác về mặt số học. Chương trình chỉ tính toán các hệ quả của những giả định do nhà phân tích đưa vào. Các mối phụ thuộc bị bỏ sót hoặc các phân phối phi thực tế có thể tạo ra kết quả sai lệch.
Mô phỏng cũng cần đủ số lần chạy để đạt được các ước lượng ổn định. Xác suất của các sự kiện hiếm có thể cần các kỹ thuật lấy mẫu chuyên biệt, vì mô phỏng ngẫu nhiên thông thường sẽ cần số lần chạy lớn đến mức không thực tế. Cần báo cáo các khoảng tin cậy để người dùng hiểu được độ bất định về mặt thống kê.
Vì vậy, phương pháp này có giá trị nhất khi logic mô hình, nguồn dữ liệu và các giới hạn vẫn minh bạch. Các quyết định về độ tin cậy không nên dựa trên một biểu đồ mà các giả định của nó không thể được giải thích cho nhân viên vận hành và kỹ thuật.
Phân tích nguyên nhân gốc bắt đầu sau sự kiện
Phân tích nguyên nhân gốc điều tra lý do xảy ra một sự cố thực tế, vấn đề chất lượng hoặc sự kiện an toàn. Phân tích này không chỉ dừng ở việc xác định linh kiện bị hư hỏng. Động cơ có thể dừng vì ổ bi bị kẹt, nhưng việc thay ổ bi chỉ khôi phục hoạt động. Cuộc điều tra phải xác định lý do ổ bi rơi vào tình trạng đó.
Các nguyên nhân sâu xa hơn có thể bao gồm nhiễm bẩn, bôi trơn không đúng cách, bảo quản kém, hư hỏng do lắp đặt, tải quá lớn trong quá trình hoặc bỏ sót việc kiểm tra. Các điều kiện tổ chức cũng có thể góp phần. Một số nhiệm vụ bảo trì có thể đã bị loại bỏ, phụ tùng thay thế có thể không phù hợp hoặc áp lực sản xuất có thể đã làm chậm công việc khắc phục.
Do đó, RCA phân biệt giữa triệu chứng, nguyên nhân vật lý trực tiếp, điều kiện góp phần và những điểm yếu tiềm ẩn của hệ thống. Sự phân biệt này ngăn tổ chức xem mọi lần sửa chữa là giải pháp lâu dài. Nó cũng tạo ra bằng chứng có thể cải thiện FMEA, FTA, việc lập kế hoạch bảo trì và các quy trình vận hành trong tương lai.

Hình 5. RCA lần theo sự cố vượt ra ngoài triệu chứng biểu hiện và xác định các điều kiện kỹ thuật cũng như tổ chức đã tạo điều kiện để sự cố xảy ra.
Phải bảo toàn bằng chứng trước khi nhà máy trở lại hoạt động bình thường
Bằng chứng công nghiệp có thể biến mất nhanh chóng. Người vận hành có thể đặt lại cảnh báo, kỹ thuật viên có thể thay thế mô-đun và các điều kiện của quá trình có thể thay đổi. Nhật ký bộ điều khiển có thể ghi đè các sự kiện trước đó, trong khi các linh kiện hư hỏng có thể bị loại bỏ trước khi được kiểm tra. Vì vậy, một quy trình phân tích nguyên nhân gốc (RCA) có kỷ luật phải bắt đầu bằng việc bảo toàn bằng chứng.
Nhóm cần thu thập xu hướng từ hệ thống lưu trữ dữ liệu, danh sách cảnh báo, nhật ký sự kiện của bộ điều khiển, hồ sơ rơ-le, lệnh công việc, ảnh chụp, các bộ phận hư hỏng, phiên bản phần mềm, tệp cấu hình và quan sát của người vận hành. Mỗi mục cần được xác định theo nguồn và thời gian. Bằng chứng vật lý phải được kiểm soát cho đến khi cuộc điều tra xác định có cần kiểm tra thêm hay không.
Cần đặc biệt chú ý đến việc đồng bộ hóa thời gian. Bộ điều khiển, hệ thống lưu trữ dữ liệu, rơ-le bảo vệ, máy chủ và hệ thống bảo trì có thể ghi nhận các dấu thời gian khác nhau. Điều tra viên phải hiệu chỉnh những khác biệt này trước khi xây dựng trình tự sự kiện. Nếu không, một cảnh báo xuất hiện sau có thể bị nhận định sai là sự kiện khởi phát.
Cần hoàn tất phỏng vấn người vận hành kịp thời nhưng thận trọng. Họ có thể nhớ được trình tự và bối cảnh mà các hệ thống tự động không ghi lại. Lời khai của họ nên được xem là bằng chứng thay vì cơ sở để quy trách nhiệm. Mục tiêu là hiểu môi trường vận hành trong đó các quyết định được đưa ra.
Xây dựng dòng thời gian sự kiện trước khi đặt câu hỏi tại sao
Một dòng thời gian chặt chẽ phân tách các sự kiện đã được xác minh khỏi phần diễn giải. Dòng thời gian ghi lại những gì xảy ra trước, trong và sau sự cố. Mỗi sự kiện cần được liên kết với một nguồn như giá trị trong hệ thống lưu trữ dữ liệu, bản ghi cảnh báo, thao tác bảo trì, ảnh chụp hoặc lời khai của nhân chứng. Các khoảng trống và điểm không nhất quán cần được giữ nguyên để có thể nhìn thấy.
Cảnh báo đầu tiên hiển thị cho người vận hành không phải lúc nào cũng là sự kiện vật lý đầu tiên. Hàng loạt cảnh báo có thể che lấp điều kiện khởi phát bên dưới hàng trăm thông báo thứ cấp. Dữ liệu trình tự sự kiện có độ phân giải cao có thể cho thấy tình trạng bất ổn áp suất, nhiễu nguồn điện hoặc mất liên lạc đã bắt đầu sớm hơn. Dòng thời gian giúp phân biệt nguyên nhân với hệ quả.
Sau khi hiểu rõ trình tự sự việc, nhóm có thể sử dụng các công cụ như phương pháp Năm câu hỏi Tại sao, sơ đồ xương cá, phân tích rào chắn, phân tích thay đổi hoặc biểu đồ yếu tố nguyên nhân. Các sự kiện đơn giản có thể được giải thích bằng một chuỗi nguyên nhân ngắn. Các sự cố phức tạp thường liên quan đến nhiều điều kiện kỹ thuật và tổ chức tương tác với nhau.
Không nên dừng cuộc điều tra sau khi tìm thấy một lời giải thích có vẻ hợp lý. Cần kiểm chứng các giả thuyết thay thế dựa trên bằng chứng. Những giả định chưa được chứng minh phải tiếp tục được xác định là giả định, thay vì được trình bày như các nguyên nhân đã được xác nhận.
Ví dụ: Các sự cố lặp lại của bộ biến tần
Một nhà máy liên tục gặp sự cố với một bộ biến tần điều khiển một băng tải. Sau mỗi sự cố, bộ phận bảo trì thay bộ biến tần và hoạt động sản xuất trở lại bình thường. Vài tháng sau, một bộ biến tần khác lại hỏng. Việc thay thế lặp đi lặp lại cho thấy bản thân bộ biến tần có thể không phải là toàn bộ vấn đề.
Nhóm RCA đối chiếu ngày xảy ra sự cố với hồ sơ môi trường và bảo trì. Phần lớn sự cố xảy ra trong những giai đoạn mùa hè nóng bức. Xu hướng nhiệt độ tủ cho thấy thiết bị đã vận hành trong thời gian dài trên mức ưu tiên. Kiểm tra cho thấy các bộ lọc bị tắc, luồng khí bị hạn chế và bụi tích tụ dày đặc quanh đường làm mát.
Lịch sử bảo trì cho thấy việc vệ sinh bộ lọc định kỳ đã bị loại khỏi lịch bảo trì phòng ngừa sau khi mức nhân sự thay đổi. Bộ biến tần là bộ phận bị hỏng, nhưng nhiệt độ tủ quá cao mới là nguyên nhân vật lý trực tiếp. Hệ thống thông gió bị hạn chế và nhiệm vụ bảo trì bị thiếu là các nguyên nhân góp phần và nguyên nhân mang tính tổ chức.
Do đó, hành động khắc phục nên vượt ra ngoài việc thay thế một bộ biến tần khác. Nhà máy có thể khôi phục hoạt động bảo trì bộ lọc, lắp đặt cảnh báo nhiệt độ, cải thiện việc làm mát tủ điện và xem xét lại thiết kế vỏ bảo vệ. Hiệu quả nên được xác minh trong giai đoạn nhiệt độ cao tiếp theo.
Hành động khắc phục phải gắn với các nguyên nhân đã được xác minh
Nhiều báo cáo RCA trở nên yếu trong giai đoạn lập kế hoạch hành động khắc phục. Các nhóm có thể đề xuất đào tạo bổ sung mà không chứng minh rằng kiến thức còn thiếu. Họ có thể sửa đổi quy trình trong khi vấn đề thực sự là thiết kế thiết bị kém. Họ có thể bổ sung các cuộc kiểm tra nhưng những cuộc kiểm tra này không thể phát hiện cơ chế hỏng hóc thực tế.
Mỗi hành động nên giải quyết một nguyên nhân hoặc điều kiện góp phần đã được xác minh. Hành động đó cần có người phụ trách, ngày hoàn thành và phương pháp xác minh được xác định rõ. Tổ chức nên phân biệt giữa biện pháp ngăn chặn tạm thời, hành động khắc phục và hành động phòng ngừa dài hạn. Khôi phục sản xuất không đồng nghĩa với ngăn ngừa tái diễn.
Hiệu quả phải được xem xét sau khi triển khai. Một hành động đã hoàn tất không tự động có nghĩa là thành công. Nhà máy cần xác nhận liệu xác suất xảy ra hỏng hóc có giảm không, biện pháp kiểm soát mới có đang được sử dụng không và liệu nó có tạo ra rủi ro khác không. Phản hồi này khép lại vòng lặp cải tiến độ tin cậy.
Các cuộc điều tra nghiêm trọng có thể cần được đánh giá độc lập. Những nhóm tham gia sâu vào sự việc có thể bị ảnh hưởng bởi các giả định trước đó hoặc áp lực từ tổ chức. Việc đánh giá bên ngoài hoặc liên chức năng có thể phản biện phân tích trước khi các kết luận cuối cùng được chấp nhận.
Lỗi con người hiếm khi là nguyên nhân gốc hoàn chỉnh
“Lỗi của người vận hành” và “lỗi bảo trì” thường xuất hiện trong các cuộc điều tra sơ sài. Những nhãn này mô tả ai đã thực hiện hành động cuối cùng nhưng không giải thích vì sao hành động đó dễ xảy ra. Con người làm việc trong phạm vi của giao diện, quy trình, mức nhân sự, yêu cầu sản xuất, hệ thống đào tạo và thiết kế thiết bị. Cuộc điều tra nên xem xét tất cả các điều kiện này.
Một người vận hành có thể chọn nhầm nút điều khiển vì hai đối tượng trên màn hình trông gần như giống hệt nhau. Một kỹ thuật viên có thể lắp sai phụ tùng vì việc nhận diện không nhất quán. Một giám sát viên có thể trì hoãn bảo trì vì tổ chức khen thưởng việc sản xuất không gián đoạn nhưng không bố trí khoảng thời gian dừng máy thực tế.
Hiểu rõ các điều kiện này không loại bỏ trách nhiệm cá nhân. Điều đó giúp ngăn cùng một hệ thống dẫn dắt người khác mắc cùng một sai lầm. Một cuộc điều tra tập trung vào việc quy lỗi có thể đáp ứng yêu cầu tức thời về trách nhiệm, nhưng lại bỏ ngỏ điểm yếu nền tảng.
RCA hiệu quả xem xét cách hệ thống đã định hình quyết định. Phân tích này đặt câu hỏi liệu các cảnh báo có dễ hiểu không, quy trình có khả thi không, khối lượng công việc có hợp lý không và các công cụ cần thiết có sẵn không. Những câu hỏi này tạo ra các hành động khắc phục hiệu quả hơn so với việc chỉ yêu cầu mọi người cẩn thận hơn.
Phân tích nguyên nhân gốc hiệu quả trong trường hợp nào—và không hiệu quả trong trường hợp nào
RCA chuyển hóa kinh nghiệm vận hành thực tế thành kiến thức phòng ngừa. Phương pháp này có thể phát hiện các điểm yếu trong thiết kế, thiếu sót trong bảo trì, vấn đề về quy trình và áp lực từ tổ chức mà các nghiên cứu dự đoán đã bỏ sót. Những phát hiện này có thể cải thiện các mô hình độ tin cậy và tiêu chuẩn cho các dự án tương lai.
Phương pháp này mang tính phản ứng vì bắt đầu sau khi sự kiện xảy ra. Các ngành có hậu quả nghiêm trọng không thể chỉ dựa vào việc rút kinh nghiệm từ các sự cố. Những phương pháp chủ động như FMEA và FTA vẫn cần thiết. RCA nên bổ trợ cho chúng bằng cách cập nhật các giả định dựa trên bằng chứng từ hoạt động thực tế.
Các cuộc điều tra cũng có thể trở nên chủ quan. Thiên kiến xác nhận có thể khiến các nhóm ưu tiên lời giải thích đầu tiên phù hợp với dữ kiện. Thiếu bằng chứng có thể buộc kết luận vẫn phải để ngỏ. Các báo cáo tốt cần phân biệt rõ nguyên nhân đã được xác nhận, yếu tố góp phần, giả thuyết và những câu hỏi chưa được giải đáp.
Giá trị của RCA phụ thuộc vào việc theo sát đến cùng. Một cuộc điều tra vững chắc về mặt kỹ thuật sẽ mang lại rất ít lợi ích nếu các hành động bị trì hoãn, thực hiện không đầy đủ hoặc không bao giờ được xác minh. Vì vậy, cam kết của ban quản lý cũng quan trọng như năng lực phân tích.
Các mô hình Markov theo dõi hệ thống qua những trạng thái thay đổi
Mô hình hóa Markov biểu diễn một hệ thống thông qua các trạng thái vận hành được xác định. Một hệ thống đơn giản có thể chỉ gồm trạng thái đang vận hành và trạng thái hỏng. Một hệ thống chịu lỗi thường cần thêm các trạng thái như đầy đủ dự phòng, suy giảm, hỏng, đang được sửa chữa hoặc đang chờ phụ tùng thay thế. Các chuyển đổi kết nối những trạng thái này.
Tỷ lệ hỏng hóc có thể chuyển hệ thống từ trạng thái vận hành đầy đủ sang trạng thái suy giảm. Một hỏng hóc khác có thể chuyển hệ thống từ trạng thái suy giảm sang trạng thái không khả dụng. Tỷ lệ sửa chữa có thể đưa hệ thống trở lại trạng thái vận hành đầy đủ. Mô hình tính xác suất hệ thống ở mỗi trạng thái theo thời gian.
Cấu trúc này đặc biệt hữu ích cho các hệ thống có thể sửa chữa. Nó có thể biểu diễn tính dự phòng, thiết bị chờ, độ bao phủ chẩn đoán, hoạt động bảo trì và năng lực sản xuất một phần. Không giống công thức độ tin cậy đơn giản, mô hình này cho thấy hệ thống có thể ở trạng thái dễ bị tổn thương bao lâu sau lần hỏng hóc đầu tiên.

Hình 6. Các mô hình Markov mô tả cách hệ thống chuyển đổi giữa các trạng thái khỏe mạnh, suy giảm, hỏng và đã sửa chữa.
Mô hình hai trạng thái cung cấp nguyên lý cơ bản
Mô hình Markov đơn giản nhất gồm một trạng thái đang vận hành và một trạng thái hỏng. Tỷ lệ hỏng hóc chi phối quá trình chuyển từ trạng thái đang vận hành sang trạng thái hỏng. Tỷ lệ sửa chữa chi phối quá trình chuyển trở lại trạng thái đang vận hành. Từ các chuyển đổi này, mô hình có thể ước tính độ sẵn sàng trong một khoảng thời gian xác định hoặc ở điều kiện ổn định.
Mô hình này hữu ích cho các thiết bị đơn giản có thể sửa chữa, nhưng không mô tả đầy đủ hầu hết các hệ thống tự động hóa dự phòng. Bộ điều khiển hai kênh có thể tiếp tục hoạt động sau khi một kênh bị hỏng. Hệ thống vẫn hoạt động nhưng mất tính dự phòng. Khi đó, hệ thống ở trạng thái suy giảm với nguy cơ xảy ra hỏng hóc thứ hai cao hơn.
Việc bổ sung trạng thái suy giảm cho phép mô hình tính toán tần suất và thời gian hệ thống vận hành mà không có đầy đủ khả năng bảo vệ. Tốc độ sửa chữa trở nên đặc biệt quan trọng. Một hệ thống có các linh kiện đáng tin cậy vẫn có thể ở trạng thái suy giảm quá lâu khi việc chẩn đoán lỗi, giao phụ tùng hoặc phê duyệt bảo trì diễn ra chậm.
Mô hình cũng có thể phân biệt các lỗi đã phát hiện và chưa phát hiện. Lỗi kênh đã phát hiện có thể kích hoạt việc sửa chữa ngay lập tức. Lỗi chưa phát hiện có thể vẫn tiềm ẩn cho đến khi xảy ra một yêu cầu hoặc một lỗi khác. Độ bao phủ chẩn đoán làm thay đổi cấu trúc chuyển tiếp, từ đó thay đổi độ khả dụng và rủi ro được tính toán.
Ví dụ: Một cặp bộ điều khiển dự phòng kép
Hãy xét hai bộ điều khiển được bố trí thành một cặp dự phòng. Trạng thái một biểu thị cả hai bộ điều khiển đều khỏe mạnh. Trạng thái hai biểu thị một bộ điều khiển đã hỏng trong khi bộ còn lại vẫn duy trì việc điều khiển. Trạng thái ba biểu thị mất cả hai bộ điều khiển và mất hoàn toàn khả năng điều khiển.
Mô hình bao gồm tỷ lệ hỏng của từng bộ điều khiển và tỷ lệ sửa chữa sau khi phát hiện. Mô hình cũng có thể bao gồm lỗi chuyển mạch, mất nguồn chung và lỗi phần mềm chung. Các chuyển tiếp bổ sung này ngăn phân tích giả định tính độc lập tuyệt đối.
Kết quả có thể phân biệt độ khả dụng khi dự phòng đầy đủ với độ khả dụng chức năng. Hệ thống có thể vẫn đủ khả năng điều khiển quy trình trong phần lớn thời gian của năm, nhưng trải qua một số giờ đáng kể với chỉ một bộ điều khiển khỏe mạnh. Mức độ phơi nhiễm suy giảm đó có thể không thể chấp nhận đối với một ứng dụng quan trọng.
Mô hình có thể so sánh các chiến lược cải tiến. Thay thế phụ tùng dự phòng nhanh hơn có thể giảm mức độ phơi nhiễm suy giảm hiệu quả hơn so với việc bổ sung bộ điều khiển thứ ba. Chẩn đoán tốt hơn có thể mang lại lợi ích lớn hơn việc giảm nhẹ tỷ lệ hỏng phần cứng. Phân tích Markov giúp định lượng các đánh đổi này.
Thiết bị dự phòng cần nhiều hơn một trạng thái lỗi khi đang hoạt động
Dự phòng ở chế độ chờ tạo ra các hành vi bổ sung. Một máy bơm dự phòng có thể vẫn dừng cho đến khi máy bơm đang vận hành bị hỏng. Thiết bị dự phòng có thể chứa lỗi tiềm ẩn, không khởi động được hoặc gặp sự cố trong logic chuyển đổi. Các van cách ly cũng có thể không di chuyển đến vị trí yêu cầu.
Mô hình Markov có thể bao gồm các trạng thái như thiết bị đang hoạt động khỏe mạnh, thiết bị dự phòng không khả dụng, lỗi chuyển đổi, công suất suy giảm và mất toàn bộ hệ thống. Kiểm thử chứng minh đưa hệ thống từ trạng thái tiềm ẩn chưa xác định về trạng thái đã biết. Khoảng thời gian giữa các lần kiểm thử ảnh hưởng đến thời gian mà các lỗi tiềm ẩn có thể tồn tại.
Các chính sách bảo trì có thể được đánh giá trong cùng một cấu trúc. Khoảng thời gian kiểm thử ngắn hơn giúp phát hiện lỗi tiềm ẩn tốt hơn nhưng làm tăng khối lượng công việc bảo trì và có thể phát sinh thêm lỗi. Mô hình có thể so sánh các tác động đối nghịch này thay vì mặc định rằng kiểm thử thường xuyên hơn luôn tốt hơn.
Phân tích thiết bị dự phòng cũng nên bao gồm công tác hậu cần sửa chữa. Một linh kiện dự phòng bị hỏng có thể chưa làm gián đoạn sản xuất ngay lập tức, vì vậy việc sửa chữa có thể bị trì hoãn. Sự trì hoãn đó khiến hệ thống không còn được bảo vệ khi thiết bị đang hoạt động hỏng sau đó. Do đó, các ưu tiên vận hành ảnh hưởng đến độ tin cậy không kém gì các đặc tính phần cứng.
Giả định Markov Tạo ra cả Sự Đơn giản lẫn Giới hạn
Mô hình Markov cơ bản giả định rằng hành vi chuyển trạng thái trong tương lai phụ thuộc vào trạng thái hiện tại chứ không phụ thuộc vào toàn bộ lịch sử. Giả định này đơn giản hóa toán học và thường đòi hỏi các tốc độ chuyển trạng thái không đổi. Một số thiết bị công nghiệp phù hợp khá tốt với xấp xỉ này trong một khoảng thời gian giới hạn.
Sự lão hóa và hư hỏng tích lũy có thể vi phạm giả định này. Một ổ bi bị mài mòn nặng không có hành vi hỏng hóc trong tương lai giống như một ổ bi mới, ngay cả khi cả hai hiện vẫn đang hoạt động. Có thể dùng các trạng thái suy giảm bổ sung để xấp xỉ sự lão hóa, trong khi các mô hình bán Markov hoặc mô hình khác có thể cần thiết để biểu diễn chính xác hơn.
Bùng nổ số lượng trạng thái cũng là một thách thức. Mỗi điều kiện của linh kiện có thể làm tăng gấp nhiều lần số trạng thái hệ thống khả dĩ. Một nhà máy phức tạp có dự phòng có thể nhanh chóng tạo ra hàng nghìn hoặc hàng triệu tổ hợp. Có thể cần giảm mô hình, nhóm các trạng thái hoặc mô phỏng để duy trì phân tích ở mức có thể quản lý.
Mô hình nên có đủ chi tiết để hỗ trợ quyết định mà không cần biểu diễn mọi biến thiên vật lý. Độ phức tạp quá mức gây ra các vấn đề về bảo trì và xác nhận. Mô hình quá đơn giản sẽ che giấu hành vi quan trọng, trong khi mô hình quá chi tiết trở nên không thể giải thích.
Mô hình Markov Hoạt động Tốt ở Đâu—và Không Hoạt động Tốt ở Đâu
Mô hình Markov phù hợp với các hệ thống dự phòng có thể sửa chữa, thiết bị dự phòng, các chế độ vận hành suy giảm và độ bao phủ chẩn đoán. Mô hình hỗ trợ phân tích tính sẵn sàng và cho thấy cách phản ứng bảo trì làm thay đổi mức độ phơi nhiễm của hệ thống. Mô hình đặc biệt hữu ích khi trình tự của các trạng thái hỏng hóc và sửa chữa có ý nghĩa.
Phương pháp này phụ thuộc vào việc xác định đúng các trạng thái và tốc độ chuyển trạng thái. Các giả định về tốc độ không đổi có thể không phản ánh sự lão hóa, biến động môi trường hoặc chất lượng bảo trì. Hỏng hóc do nguyên nhân chung phải được biểu diễn một cách rõ ràng thay vì bị che giấu trong các tỷ lệ hỏng hóc độc lập của từng linh kiện.
Kết quả cần được hỗ trợ bằng phân tích độ nhạy. Nhóm nên kiểm tra cách các kết luận thay đổi khi tỷ lệ hỏng hóc, thời gian sửa chữa, độ bao phủ chẩn đoán và các giả định về nguyên nhân chung thay đổi. Một thiết kế chỉ có vẻ chấp nhận được dưới một giả định lạc quan duy nhất thì không vững chắc.
Các mô hình Markov là công cụ phân tích chứ không phải bằng chứng vật lý. Việc thử nghiệm, bằng chứng vận hành, FMEA và FTA vẫn cần thiết. Mô hình giúp so sánh các chiến lược, nhưng không thể thay thế việc xác minh kiến trúc thực tế.
Sử dụng Năm Phương pháp như một Hệ thống Độ tin cậy Thống nhất
Năm kỹ thuật này mang lại giá trị lớn nhất khi được kết nối với nhau. FMEA có thể xác định các dạng hỏng hóc chi tiết của linh kiện trong giai đoạn thiết kế. Sau đó, FTA có thể xác định tổ hợp nào góp phần gây ra một sự kiện nghiêm trọng của hệ thống. Mô hình Markov có thể mô tả cách hệ thống hoạt động sau hỏng hóc đầu tiên và trong quá trình sửa chữa.
Mô phỏng Monte Carlo có thể kiểm tra các đầu vào không chắc chắn như thời gian sửa chữa, thời gian giao phụ tùng, thời tiết và khối lượng công việc bảo trì. RCA cung cấp bằng chứng sau các hỏng hóc thực tế và có thể làm lộ ra những giả định mà các mô hình ban đầu đã bỏ sót. Khi đó cần cập nhật mô hình thay vì giữ nguyên chúng như những tài liệu lịch sử.
Giả sử một FTA coi hai hỏng hóc bộ điều khiển là độc lập. Sau đó, một cuộc RCA cho thấy cả hai bộ điều khiển đều hỏng sau khi một kỹ thuật viên bảo trì tải cùng một cấu hình sai. Cây lỗi phải bổ sung một sự kiện bảo trì chung. Các mô hình Markov và Monte Carlo cũng nên đưa mối phụ thuộc mới này vào.
Quy trình phản hồi này tạo ra một chương trình độ tin cậy liên tục được cập nhật. Phân tích dự báo định hướng cho thiết kế, bằng chứng vận hành kiểm tra các giả định, còn kết quả điều tra cải thiện thế hệ mô hình tiếp theo. Công tác độ tin cậy trở thành một phần của vòng đời hệ thống thay vì yêu cầu của một dự án chỉ thực hiện một lần.
Hỏng hóc do nguyên nhân chung có thể vô hiệu hóa toàn bộ kiến trúc dự phòng
Hỏng hóc do nguyên nhân chung ảnh hưởng đến nhiều kênh thông qua một điều kiện nền tảng duy nhất. Nguồn điện, hệ thống làm mát, hạ tầng mạng, phần mềm, tác động môi trường và quy trình bảo trì dùng chung là những ví dụ thường gặp. Những hỏng hóc này đặc biệt nguy hiểm vì có thể vô hiệu hóa khả năng dự phòng vốn có vẻ vững chắc trên giấy tờ.
Tách biệt vật lý làm giảm một số nguyên nhân chung. Thiết bị hoặc phần mềm đa dạng có thể giảm các nguyên nhân khác. Xác minh độc lập có thể giảm lỗi bảo trì và cấu hình. Tuy nhiên, tính đa dạng cũng làm tăng độ phức tạp về đào tạo, phụ tùng thay thế, kiểm thử và tích hợp.
Giải pháp phù hợp phụ thuộc vào rủi ro. Việc lắp đặt các công nghệ bộ điều khiển khác nhau có thể giảm hỏng hóc phần mềm do nguyên nhân chung, nhưng lại tạo ra những thách thức mới về liên lạc và bảo trì. Các nguồn điện riêng biệt có thể mang lại ít lợi ích khi cả hai vẫn nằm trong cùng một tủ dễ bị ngập. Các phương pháp phân tích độ tin cậy giúp xác định biện pháp đa dạng hóa nào giải quyết những cơ chế hỏng hóc có cơ sở thực tế.
Các giả định về nguyên nhân chung cần được thể hiện rõ trong mọi mô hình định lượng. Việc coi các kênh dự phòng là hoàn toàn độc lập hầu như luôn tạo ra kết quả lạc quan. Kinh nghiệm vận hành tại nhà máy và các phát hiện từ RCA cung cấp bằng chứng giá trị để ước tính những mối phụ thuộc này.
Độ bao phủ chẩn đoán quyết định thời gian hệ thống duy trì trạng thái dễ bị tổn thương
Một hệ thống dự phòng không thể được quản lý hiệu quả khi các hỏng hóc vẫn bị che giấu. Độ bao phủ chẩn đoán mô tả tỷ lệ các lỗi liên quan được phát hiện bởi các biện pháp kiểm soát tự động hoặc thủ công. Độ bao phủ cao giúp giảm thời gian hệ thống ở trạng thái suy giảm mà không được nhận biết. Độ bao phủ này cũng cho phép bảo trì khôi phục khả năng dự phòng trước khi xảy ra hỏng hóc khác.
Các tuyên bố về khả năng chẩn đoán phải được xem xét cẩn thận. Một bộ điều khiển có thể phát hiện lỗi bộ xử lý bên trong nhưng không phát hiện được mọi lỗi dây dẫn hiện trường. Một mô-đun truyền thông có thể phát hiện mất hoàn toàn liên kết nhưng không nhận ra việc ánh xạ dữ liệu không chính xác. Một bộ nguồn có thể phát cảnh báo sau khi mất hoàn toàn đầu ra nhưng không đưa ra cảnh báo về sự suy giảm dần dần.
Phép thử xác nhận bao phủ những lỗi mà chức năng chẩn đoán liên tục không phát hiện được. Khoảng thời gian giữa các lần thử ảnh hưởng đến mức độ phơi nhiễm. Khoảng thời gian dài hơn cho phép các lỗi ẩn tồn tại lâu hơn, trong khi khoảng thời gian rất ngắn làm tăng gánh nặng bảo trì và rủi ro do thử nghiệm gây ra. FMEA, phân tích Markov và bằng chứng vận hành có thể hỗ trợ xác định khoảng thời gian cân bằng.
Việc kiểm thử phải bao phủ toàn bộ chức năng. Kích hoạt một đầu vào PLC không chứng minh rằng công tắc hiện trường, hệ thống dây dẫn, logic, đầu ra và phần tử chấp hành cuối đều hoạt động đúng. Phân tích độ tin cậy nên xác định chính xác những lỗi nào mà mỗi chức năng chẩn đoán hoặc phép thử xác nhận có thể phát hiện.
Thời gian sửa chữa thường quan trọng không kém tỷ lệ hỏng hóc
Các chương trình độ tin cậy thường tập trung vào việc giảm tần suất hỏng hóc của linh kiện. Thời gian sửa chữa cũng quan trọng không kém trong các hệ thống chịu lỗi. Sau khi kênh đầu tiên hỏng, hệ thống có thể tiếp tục vận hành nhưng vẫn ở trạng thái dễ bị tổn thương. Việc sửa chữa kéo dài làm tăng xác suất hỏng hóc thứ hai gây mất hoàn toàn chức năng.
Việc chẩn đoán, phê duyệt, khả năng sẵn có của kỹ thuật viên, phụ tùng, giấy phép tiếp cận và điều kiện sản xuất đều ảnh hưởng đến thời gian khôi phục. Một linh kiện có thể được thay trong mười lăm phút sau khi phụ tùng đúng loại được đưa đến tủ. Tuy nhiên, thời gian ngừng hoạt động thực tế vẫn có thể kéo dài nhiều ngày khi phải tìm nguồn phụ tùng từ quốc tế.
Chẩn đoán được cải thiện có thể rút ngắn thời gian xác định vị trí sự cố. Các mô-đun được tiêu chuẩn hóa và phụ tùng được cấu hình sẵn có thể giảm thời gian thay thế. Tồn kho tại chỗ, quy trình báo cáo leo thang rõ ràng và hỗ trợ kỹ thuật từ xa có thể giảm chậm trễ hậu cần. Các mô hình Markov và Monte Carlo có thể định lượng giá trị của những cải thiện này.
Khoản đầu tư tốt nhất cho độ tin cậy không phải lúc nào cũng là phần cứng mạnh hơn. Ở một số hệ thống, việc giảm thời gian sửa chữa mang lại mức giảm rủi ro lớn hơn so với một cải thiện nhỏ về tỷ lệ hỏng hóc của linh kiện. Phân tích nên so sánh cả hai phương án.
Áp dụng phân tích độ tin cậy cho các kiến trúc DCS và PLC
Độ tin cậy của hệ thống điều khiển không chỉ phụ thuộc vào bộ xử lý trung tâm. Kỹ sư nên xem xét các bộ điều khiển, mô-đun I/O, mạng truyền thông, bộ nguồn, máy chủ, trạm vận hành, đồng bộ hóa thời gian, giao diện hiện trường và các tiện ích hỗ trợ. Mọi phần tử dùng chung đều có thể trở thành một điểm phụ thuộc chung.
Các bộ điều khiển dự phòng có thể dùng chung một tủ I/O. Các máy chủ dự phòng có thể phụ thuộc vào một bộ chuyển mạch mạng hoặc một hệ thống lưu trữ. Các mạng I/O từ xa có thể sử dụng các kênh liên lạc riêng biệt nhưng đi qua cùng một tuyến vật lý. Phân tích đầy đủ phải theo dõi chức năng từ thiết bị hiện trường đến tác động điều khiển cuối cùng.
Hành vi cần có sau khi xảy ra sự cố phải được xác định rõ ràng. Quy trình có thể tiếp tục nhờ bộ điều khiển còn lại, chuyển sang vận hành thủ công hoặc chuyển vào trạng thái dừng có kiểm soát. Nhân viên bảo trì phải biết cách xác định kênh bị lỗi và khôi phục hệ thống mà không làm ảnh hưởng đến kênh đang hoạt động bình thường.
Các tổ chức đang lên kế hoạch nâng cấp hệ thống điều khiển cũng có thể xem xét các linh kiện hệ thống điều khiển DCS tiêu biểu được sử dụng trong các kiến trúc tự động hóa quy trình. Việc lựa chọn linh kiện luôn phải dựa trên các yêu cầu về độ tin cậy của toàn bộ ứng dụng, thay vì các tính năng riêng lẻ của sản phẩm.
Mô hình đáng tin cậy phụ thuộc vào dữ liệu bảo trì đáng tin cậy
Phân tích độ tin cậy định lượng chỉ mạnh khi dữ liệu nền tảng đáng tin cậy. Hồ sơ bảo trì nên phân biệt hỏng chức năng, thay thế theo kế hoạch, kiểm tra và sửa đổi. Ngày xảy ra hỏng hóc phải thể hiện thời điểm chức năng bị mất, còn ngày khôi phục phải thể hiện thời điểm thiết bị thực sự sẵn sàng vận hành trở lại.
Nhận dạng tài sản phải nhất quán giữa hệ thống lưu trữ dữ liệu lịch sử, hệ thống bảo trì, bản vẽ và cơ sở dữ liệu phụ tùng. Mã lỗi nên mô tả cơ chế thay vì các triệu chứng mơ hồ. “Đã dừng” mang lại rất ít giá trị phân tích, trong khi “kẹt ổ trục do nhiễm bẩn chất bôi trơn” hỗ trợ việc lập mô hình và phòng ngừa trong tương lai.
Mức độ vận hành cũng phải được tính đến. Không thể so sánh trực tiếp một máy bơm vận hành liên tục với một máy bơm dự phòng chỉ chạy trong các lần kiểm tra. Nhiệt độ, độ ẩm, nhiễm bẩn, rung động, ứng suất điện và tải quy trình có thể giải thích sự khác biệt giữa các linh kiện vốn giống hệt nhau.
Làm sạch dữ liệu nên được xem là công việc kỹ thuật thay vì khâu chuẩn bị hành chính. Việc phân loại không chính xác có thể làm sai lệch tỷ lệ hỏng, phân bố thời gian sửa chữa và kết luận của mô hình. Các nhà phân tích nên trao đổi với nhân viên bảo trì và vận hành về những kết quả bất thường trước khi chấp nhận chúng.
Quy trình thực tiễn để cải thiện độ tin cậy
Một dự án độ tin cậy nên bắt đầu bằng việc xác định chức năng cần thiết và ranh giới hệ thống. Nhóm phải nêu rõ hiệu suất cần đạt trong quá trình vận hành bình thường và sau mỗi sự cố có thể xảy ra. Nhóm cũng nên thu thập bản vẽ, tài liệu hướng dẫn, lịch sử bảo trì, quy trình vận hành, hồ sơ cảnh báo và các báo cáo sự cố trước đây.
Sau đó, FMEA có thể xác định các dạng hỏng ở cấp linh kiện và những điểm yếu trong các biện pháp kiểm soát phát hiện. FTA có thể xem xét các sự kiện đỉnh quan trọng và các yếu tố phụ thuộc dùng chung. Mô hình Markov có thể đánh giá các trạng thái suy giảm và khả năng đáp ứng sửa chữa, trong khi mô phỏng Monte Carlo có thể biểu diễn sự không chắc chắn trong hỏng hóc, bảo trì và hậu cần.
Các sự cố trong quá khứ nên được xem xét thông qua RCA. Kết quả phát hiện cần được dùng để cập nhật các phân tích thiết kế và các giả định định lượng. Các hành động nên được ưu tiên theo mức độ hậu quả, xác suất, khả năng phát hiện, mức độ phơi nhiễm, thời gian sửa chữa và chi phí.
Mỗi hành động cần có người chịu trách nhiệm, ngày hoàn tất và bước kiểm tra hiệu quả. Các phân tích nên được cập nhật sau những thay đổi lớn về thiết bị, nâng cấp phần mềm, sửa đổi quy trình hoặc thay đổi chiến lược bảo trì. Độ tin cậy là một lĩnh vực kỹ thuật liên tục, không phải là báo cáo hoàn thành một lần rồi lưu trữ.
Những câu hỏi làm lộ rõ các tuyên bố yếu về khả năng chịu lỗi
Một cuộc đánh giá chặt chẽ sẽ đặt câu hỏi chức năng nào phải luôn khả dụng và hệ thống có thể chịu được những sự cố nào. Đánh giá đó xem xét liệu các kênh dự phòng có độc lập về mặt vật lý, điện và logic hay không. Đồng thời, nó cũng xem xét cách phát hiện các hỏng hóc tiềm ẩn và hệ thống có thể duy trì trạng thái suy giảm trong bao lâu trước khi được sửa chữa.
Nhóm nên xác định các linh kiện có thời gian cung ứng thay thế dài và xác định liệu một lỗi bảo trì có thể ảnh hưởng đến nhiều kênh hay không. Các yếu tố phụ thuộc về phần mềm và cấu hình cũng cần được chú ý như phần cứng. Người vận hành phải hiểu hệ thống hoạt động như thế nào sau một sự cố và còn những thao tác thủ công nào có thể thực hiện.
Các giả định về hỏng hóc và sửa chữa nên được hỗ trợ bằng bằng chứng từ nhà máy whenever có thể. Các hành động khắc phục nên được xác minh sau khi hoàn tất. Thử nghiệm kiểm chứng nên chứng minh toàn bộ chức năng bảo vệ thay vì chỉ phản hồi của từng thiết bị riêng lẻ.
Những câu hỏi này có giá trị hơn một tuyên bố chung rằng hệ thống có dự phòng. Chúng liên kết khả năng chịu lỗi với kiến trúc thực tế, môi trường vận hành và năng lực bảo trì.
Góc nhìn cuối cùng
Khả năng chịu lỗi là thiết yếu khi không thể chấp nhận thời gian ngừng hoạt động, hành vi không an toàn hoặc mất quyền kiểm soát. Tuy nhiên, chỉ riêng dự phòng không tạo nên một hệ thống đáng tin cậy. Kỹ sư phải hiểu các dạng hỏng hóc, các yếu tố phụ thuộc chung, mức độ bao phủ chẩn đoán, chế độ vận hành suy giảm, đặc tính sửa chữa và hậu quả trong vận hành.
Phân tích cây sự cố cho thấy các tổ hợp hỏng hóc có thể gây ra một sự kiện nghiêm trọng như thế nào. FMEA cung cấp đánh giá có hệ thống về các dạng hỏng hóc riêng lẻ và ảnh hưởng của chúng. Mô phỏng Monte Carlo đánh giá các kịch bản không chắc chắn, trong khi RCA biến những hỏng hóc thực tế thành kiến thức phòng ngừa. Mô hình Markov giải thích cách các hệ thống có thể sửa chữa chuyển đổi giữa các trạng thái bình thường, suy giảm, hỏng hóc và được khôi phục.
Mỗi phương pháp đều có những hạn chế, nhưng khi kết hợp, chúng tạo nên một khuôn khổ độ tin cậy vững chắc. Các nghiên cứu thiết kế nên được cập nhật bằng bằng chứng vận hành, và các phát hiện từ sự cố nên góp phần cải thiện các mô hình trong tương lai. Kết quả phải tác động đến kiến trúc, bảo trì, phụ tùng thay thế, thử nghiệm, đào tạo và quy trình.
Mục tiêu không phải là tạo ra một hệ thống không bao giờ gặp sự cố. Mục tiêu là phát hiện sự cố sớm, hạn chế hậu quả, duy trì chức năng cần thiết và khôi phục đầy đủ năng lực theo cách có thể dự đoán. Đó là ý nghĩa thực tiễn của khả năng chịu lỗi trong công nghiệp.