Dlaczego zespół przestaje ufać AI w BHP już w trzecim tygodniu (i jak temu zapobiec)

Systemy wizji komputerowej w BHP rzadko zawodzą na etapie wykrywania. Zawodzą na etapie zaufania. Gdy nieskalibrowany system zalewa zespoły BHP fałszywymi alarmami, operatorzy po cichu przestają reagować, zwykle w ciągu trzech tygodni od uruchomienia. Ten poradnik opiera się na badaniach nad zmęczeniem alarmami w szpitalach, centrach SOC i ochronie fizycznej, pokazuje matematykę fałszywych alarmów w skali zakładu i opisuje pięć elementów dyscypliny kalibracji: cichy pomiar bazowy, zapisany cel dla fałszywych alarmów, strojenie każdej kamery, cotygodniowy pomiar dokładności i uzgodnioną ekonomię alertów. Zawiera też praktyczny przewodnik po pięciu typowych problemach z detekcją w przemyśle, listę 10 pytań do dostawcy, 90-dniowy plan pilotażu oraz FAQ dla liderów BHP i operacji.
Wojciech Tubek
CEO @ Surveily
•
21 minut
 read
Fabrication hall CCTV view with AI detection boxes: a real near miss between a worker and a moving forklift, and false positives on skylight glare (smoke), wall signs (person) and a red barrel (fire). People are blurred.

Dla dyrektorów EHS, kierowników BHP w zakładach i liderów doskonałości operacyjnej, a także dla każdego, kto widział, jak obiecujące narzędzie do monitorowania bezpieczeństwa umiera w pierwszym miesiącu.

W skrócie

Większość wdrożeń wizji komputerowej w BHP nie zawodzi dlatego, że model przeocza zagrożenia. Zawodzi, bo zgłasza zbyt wiele zdarzeń, które zagrożeniami nie są, a ludzie po drugiej stronie przestają zwracać na nie uwagę. To przewidywalna porażka behawioralna, która zwykle zaczyna się w ciągu trzech tygodni od uruchomienia systemu. Pierwszy tydzień to entuzjazm. Drugi to selekcja. W trzecim pojawia się filtr w głowie, który każdy kolejny alert odkłada do szuflady „pewnie znowu nic”.

To nie spekulacja. To jedno z najlepiej potwierdzonych zjawisk w każdej branży, która na dużą skalę wykorzystuje systemy alarmowe:

  • Szpitale: opublikowane badania pokazują, że 74–99% alarmów z monitorów funkcji życiowych nie wymaga żadnego działania, a monitory na OIOM-ie generują setki alarmów na pacjenta dziennie. To właśnie na podstawie tych badań ukuto pojęcie „zmęczenia alarmami”.
  • Centra operacji bezpieczeństwa (SOC): badanie branżowe z 2023 roku wykazało, że około 83% codziennych alertów to fałszywe alarmy, a 67% ostatecznie zostaje zignorowanych, ponieważ analitycy nie nadążają z ich obsługą. Jedno ze znanych badań jakościowych analityków SOC nosi, bez cienia ironii, tytuł „99% False Positives”.
  • Ochrona fizyczna: analizy branżowe szacują udział fałszywych alarmów wywołanych przez kamery na nawet ~98%, głównie z powodu pogody, zwierząt, oświetlenia i roślinności.

AI w BHP dziedziczy dokładnie tę samą dynamikę, z jednym czynnikiem, który dodatkowo pogarsza sytuację. Osoby odbierające alerty — kierownicy BHP, mistrzowie zmian, brygadziści — mają już pełne etaty, a selekcja alertów nie należy do ich obowiązków. Margines na szum na hali produkcyjnej jest węższy niż w SOC, a nie szerszy.

Rozwiązaniem nie jest lepszy wynik dokładności w dniu uruchomienia. Jest nim dyscyplina kalibracji: pomiar bazowy dla każdej kamery, ograniczony w czasie okres strojenia z liczbowym celem dla fałszywych alarmów, cotygodniowy raport mierzonej dokładności oraz model operacyjny, w którym precyzją zarządza się co tydzień, zamiast obiecywać ją w broszurze. Poniżej znajdziesz dowody, rachunek i listę kontrolną, którą możesz przyłożyć do każdego pilotażu — także naszego.

Wykres ilustracyjny: bez kalibracji liczba alertów utrzymuje się na poziomie około 100 na zmianę, a odsetek otwieranych alertów spada z 95% do 12% do 30. dnia; z kalibracją liczba alertów spada do około 16, a odsetek otwarć utrzymuje się na poziomie 90–95%.
Rysunek 1. Krzywa trzeciego tygodnia: liczba alertów a reakcja operatorów (dane ilustracyjne)

1. Zmęczenie alertami to prawo operacji, nie błąd w oprogramowaniu

Każda dziedzina monitorowania, która zwiększyła skalę alarmowania, odkrywała to samo prawo: ludzka uwaga jest zasobem skończonym, a fałszywe alarmy wyczerpują ją coraz szybciej. Psychologia jest stara — efekt „chłopca, który wołał wilka” bada się od lat 80. — a dane operacyjne są jednoznaczne.

Ochrona zdrowia przeprowadziła ten eksperyment jako pierwsza i na największą skalę. Przeglądy badań nad alarmami klinicznymi konsekwentnie pokazują, że 74–99% alarmów z monitorów funkcji życiowych nie wymaga działania, a monitory na oddziałach intensywnej terapii potrafią generować ponad 350 alarmów na pacjenta dziennie. Udokumentowane skutki to opóźnione reakcje, wyłączanie alarmów i zgony pacjentów. Dlatego zarządzanie alarmami stało się osobnym celem bezpieczeństwa pacjentów w amerykańskim systemie akredytacji szpitali. Główny wniosek można wprost przenieść na przemysł: po kilku fałszywych alarmach z rzędu operatorzy przestają ufać całemu kanałowi, a nie tylko pojedynczemu alertowi.

Cyberbezpieczeństwo powtórzyło ten schemat. Badania branżowe podają, że około 83% codziennych alertów w SOC to fałszywe alarmy, 73% zespołów bezpieczeństwa wskazuje je jako największe wyzwanie w wykrywaniu zagrożeń, a 25–30% alertów nigdy nie zostaje zbadanych z powodu przeciążenia. Wielopoziomowa selekcja, reguły wyciszania i silniki korelacji tworzą dziś całą podbranżę, a samo jej istnienie pokazuje skalę problemu.

Ochrona fizyczna domknęła ten wzór. Analizy systemów alarmowych opartych na kamerach wskazują udział fałszywych alarmów sięgający 98%. Policja w kilku krajach nakłada dziś kary za powtarzające się fałszywe alarmy albo przestaje na nie reagować. To brak zaufania zapisany w polityce publicznej.

Lekcja dla kupujących AI w BHP nie brzmi: „alarmowanie jest bez szans”. Brzmi tak: liczba alertów i ich precyzja to kluczowe parametry produktu, równie ważne jak to, co system potrafi wykryć. Jeśli dostawca mówi ci, co jego system wykrywa, ale nie mówi, jak mierzy, zarządza i raportuje precyzję, odbyłeś dopiero połowę rozmowy.

2. Rachunek: dlaczego „95% dokładności” wciąż może zasypać zespół BHP

Oto obliczenie, które każdy kupujący powinien wykonać przed pilotażem. Wyjaśnia problem trzeciego tygodnia lepiej niż jakakolwiek anegdota.

Weźmy średni zakład z 40 kamerami pracującymi bez przerwy. W praktyce system podejmuje tysiące decyzji klasyfikacyjnych na kamerę dziennie. Prawdziwe zdarzenia niebezpieczne są natomiast rzadkie — i właśnie dlatego warto je wykrywać. Rzadkie cele stanowią najtrudniejszy przypadek dla precyzji. To problem częstości bazowej: nawet niski odsetek błędów na pojedynczą decyzję, pomnożony przez 40 kamer i 24 godziny, może wygenerować fałszywe alerty, których jest wielokrotnie więcej niż prawdziwych zdarzeń.

Na liczbach ilustracyjnych: zakład ma 20 prawdziwych zdarzeń niebezpiecznych dziennie, a system zgłasza 100 alertów. Precyzja wynosi 20%. Cztery na pięć alertów marnują czas operatora i w ciągu kilku tygodni uczą użytkowników, żeby je ignorować. Ogranicz strumień do 25 alertów dziennie przy tych samych detekcjach, a precyzja wzrośnie do 80%. To różnica między kanałem, któremu ludzie ufają, a kanałem, który wyciszają. Deklarowana dokładność modelu jest w obu scenariuszach identyczna. Zmieniła się kalibracja do zakładu.

Trzy praktyczne konsekwencje:

  1. Deklarowana dokładność to średnia, a średnie ukrywają kamery. Wdrożenie może działać przy ważonej średniej ~95%, podczas gdy kamera 17, skierowana każdego popołudnia na nisko stojące słońce, generuje połowę fałszywych alertów w zakładzie. Pomiar dla każdej kamery jest warunkiem koniecznym. Każdą wartość dokładności, także naszą, traktuj jako liczbę mierzoną i raportowaną na bieżąco, nigdy jako gwarancję.
  2. Precyzja i czułość (recall) pozostają w konflikcie, więc zarządzaj tym kompromisem świadomie. Zaostrzysz progi, a ryzykujesz przeoczenie prawdziwych zdarzeń. Poluzujesz je, a zalejesz kanał alertami. Dojrzałe zespoły ustawiają ten kompromis dla każdego przypadku użycia osobno: detekcja upadku pracownika (man-down) może tolerować więcej fałszywych alarmów niż kontrola ŚOI, bo jej przeoczenie kosztuje znacznie więcej.
  3. Kierowanie alertów jest częścią dokładności. Poprawna detekcja, która trafia do niewłaściwej osoby w niewłaściwym czasie, jest w praktyce fałszywym alarmem. Poziomy ważności, kierowanie według stref i doręczanie z uwzględnieniem zmian to narzędzia kalibracji, a nie dodatki do interfejsu.
Ilustracja: 100 alertów, w tym 20 prawdziwych zdarzeń, daje precyzję 20%; 25 alertów przy tych samych 20 zdarzeniach daje precyzję 80%.
Rysunek 2. Efekt częstości bazowej: ten sam detektor, dwie rzeczywistości precyzji (dane ilustracyjne)

3. Anatomia porażki w trzecim tygodniu

Ta porażka ma powtarzalną anatomię. Warto nazwać każdy etap, bo każdy można zaobserwować i każdy można przerwać.

Dni 1–5: nadwyżka nowości. Każdy alert zostaje otwarty. Fałszywe alarmy są wybaczane, a nawet bawią. Zrzuty ekranu krążą po zakładzie, bo system jest nowy, a prawdziwe wykrycia naprawdę robią wrażenie. Kierownictwo widzi pierwszy dashboard i jest zachwycone. To najniebezpieczniejsza faza: wdrożenie wygląda na sukces, choć ekonomia alertów już teraz jest nie do utrzymania.

Dni 6–12: cicha selekcja. Operatorzy tworzą prywatne reguły: ignoruj tę kamerę, ignoruj tę regułę po zmroku, sprawdzaj alerty dwa razy na zmianę zamiast na bieżąco. Czas reakcji się wydłuża. Nikt tego nie zgłasza, bo wygląda to na efektywność, a nie na porażkę.

Dni 13–21: załamanie zaufania. Prywatne reguły twardnieją i stają się normą, a norma się rozprzestrzenia („nie przejmuj się tymi z alejki, to zawsze cień”). Jedyne prawdziwe zdarzenie potencjalnie wypadkowe, które pojawia się 19. dnia, zostaje potraktowane jak szum. W szpitalach jest to udokumentowany mechanizm, przez który zmęczenie alarmami prowadzi do śmierci pacjentów. W zakładzie przemysłowym w ten sposób system bezpieczeństwa zamienia się w półkownika z abonamentem.

Od 22. dnia: cicha renegocjacja. Alerty trafiają do skrzynki, której nikt nie prowadzi. Kwartalny przegląd u dostawcy pokazuje rosnącą liczbę detekcji. Zaangażowanie w zakładzie spada. Pół roku później rozmowa o przedłużeniu umowy dotyczy ceny, bo nikt nie potrafi powiedzieć, jaka była wartość systemu.

Kluczowa obserwacja: każdy etap zostawia mierzalne ślady: liczbę alertów, odsetek otwarć, czas do potwierdzenia, udział fałszywych alarmów na kamerę. Wdrożenie, które śledzi je od pierwszego dnia, widzi nadchodzące załamanie dziesięć dni wcześniej. Wdrożenie, które liczy tylko detekcje, tego nie widzi. To wskaźniki wyprzedzające dla samego systemu bezpieczeństwa i zasługują na taką samą uwagę jak wskaźniki wyprzedzające, które system raportuje z hali.

4. Dyscyplina kalibracji, która temu zapobiega

Wdrożenia, które przetrwały trzeci miesiąc, rzadko różnią się od tych, które nie przetrwały, architekturą modelu. Różnią się tym, czy kalibracja była prowadzona jako proces ograniczony w czasie, mierzony i jawnie raportowany. Ta dyscyplina ma pięć elementów.

4.1 Najpierw pomiar bazowy, potem ocena

Przez pierwsze dni po podłączeniu system obserwuje, a zespół mierzy. Co widzi każda kamera? Jak wygląda surowy strumień alertów? Które reguły się uruchamiają, w których strefach i o jakich godzinach? Podczas pomiaru bazowego nikt nie powinien reagować na alerty i nikomu nie powinno się prezentować dashboardu jako źródła prawdy. Pomiar bazowy jest punktem odniesienia dla wszystkiego, co nastąpi później, włącznie z dowodem „przed i po”, który wdrożenie będzie kiedyś winne sponsorowi budżetu.

4.2 Cel liczbowy z terminem

Kalibracja bez liczby i terminu to tylko wrażenia. Dobra praktyka to jawny cel: w ustalonym oknie kalibracji (liczonym w dniach, nie kwartałach) udział fałszywych alarmów ma spaść poniżej określonego progu, mierzonego dla każdego przypadku użycia i każdej kamery.

Na przykład dwutygodniowe okno z jednocyfrowym celem dla udziału fałszywych alarmów. Konkretne liczby są mniej ważne niż trzy rzeczy. Cel jest zapisany przed startem pilotażu. Jest mierzony poprzez liczenie, a nie na oko. I jest jawnie weryfikowany z klientem, alert po alercie, podczas wspólnego przeglądu.

Gotowość dostawcy do takiego pomiaru to jeden z najmocniejszych sygnałów przy wyborze. Mimo to traktuj tę wartość jako cel do wykazania, a nie zakładaną gwarancję umowną.

4.3 Strojenie każdej kamery i każdej reguły przez ludzi, którzy naprawdę oglądają nagrania

Zakłady przemysłowe pokonują ogólne modele wizyjne w przyziemny sposób. Odblaskowe kamizelki, które pod pewnymi kątami wyglądają na nieobecne. Kłęby pary, które wyglądają jak dym. Lustro sferyczne, które podwaja każdy wózek widłowy.

Naprawa tego nie oznacza trenowania modelu od zera. To systematyczna praca nad każdą kamerą: maski stref, korekty progów, harmonogramy reguł — reguła dla bramy rampy nie musi działać, gdy rampa jest zamknięta — oraz przekazywanie modelowi informacji zwrotnej o specyficznych cechach wizualnych zakładu.

Pytanie do każdego dostawcy: kto wykonuje tę pracę, ile godzin jest na nią przewidzianych i jak co tydzień zobaczymy jej efekt?

Dostawca z dedykowanymi specjalistami ds. danych, którzy stroją system w ramach usługi, opisuje proces. Dostawca, który daje ci tylko suwak czułości, opisuje twoje przyszłe weekendy.

Liczy się tu także prywatność. Strojenie oznacza przeglądanie klipów ze zdarzeniami, dlatego przegląd powinien domyślnie odbywać się na zdeidentyfikowanym obrazie — twarze i sylwetki powinny być rozmyte lub przedstawione jako kontury. Chodzi o to, by znaleźć brakujący kask, a nie o to, by ustalić, kto go nie założył.

4.4 Cotygodniowa mierzona dokładność: średnia ważona i widok per kamera

Po uruchomieniu precyzja staje się metryką zarządzaną na stałe. Potrzebny jest cotygodniowy raport dokładności, który podaje średnią ważoną dla aktywnych przypadków użycia oraz pokazuje rozkład wyników dla poszczególnych kamer.

Dzięki temu pogarszającą się kamerę — z powodu nowego oświetlenia, przestawionych regałów czy sezonowej zmiany kąta padania słońca — wyłapuje raport, a nie operatorzy, którzy po cichu uczą się ją ignorować.

Dokładność dryfuje w produkcji. Zakłady się zmieniają, pory roku się zmieniają, obudowy kamer się brudzą. Średnia ważona ~95%, która jest mierzona i raportowana na bieżąco, jest warta więcej niż jakakolwiek deklaracja z dnia startu właśnie dlatego, że co tydzień można ją zweryfikować.

4.5 Ekonomia alertów uzgodniona z zespołem, który je odbiera

Kalibrację kończy jawne porozumienie z ludźmi po drugiej stronie. Które alerty przychodzą w czasie rzeczywistym i do kogo? Które trafiają do dziennego zestawienia? Które pojawiają się tylko jako trendy na dashboardzie?

W każdej dziedzinie alarmowania obowiązuje ta sama zasada: jeśli dany typ alertu nie ma wskazanego właściciela ani określonej reakcji, nie powinien być alertem w czasie rzeczywistym.

Poziomy ważności, kierowanie według stref i okna zestawień sprawiają, że zespół BHP pozostaje w pętli, nie tonąc w strumieniu. A pętla zawsze kończy się na człowieku: system sygnalizuje, ludzie decydują, co dalej.

Jak wygląda skalibrowane wdrożenie: zmierzone wyniki

Wdrożenia prowadzone w ten sposób dają obraz dokładnie odwrotny do krzywej trzeciego tygodnia: liczba alertów spada, wykrywanie prawdziwych zdarzeń się utrzymuje, a zaangażowanie pozostaje wysokie.

Opublikowane i raportowane przez klientów dane z branży AI w BHP pokazują skalę tego efektu. Każda wartość dotyczy jednego zakładu, określonego zakresu i okresu, dlatego należy traktować je jako dowód, że taki efekt jest możliwy, a nie jako obietnicę: europejska rafineria odnotowała spadek liczby alertów o 85% w ciągu sześciu miesięcy przy rosnącej zgodności w stosowaniu ŚOI; huta stali odnotowała o 90% mniej alertów ogółem i o 92% mniej alertów dotyczących zbliżenia pojazdu do pieszego w ciągu sześciu miesięcy; operator elektrociepłowni odnotował spadek liczby alertów ogółem o 89%.

Mniej alertów przy utrzymanym poziomie wykrywania to obraz systemu, który zdobywa zaufanie, zapisany w danych.

5. Praktyczny przewodnik: pięć typowych problemów z detekcją w przemyśle

Każdy zakład ma własny „dialekt”, który może zmylić ogólne modele wizyjne, ale rodziny błędów się powtarzają. Ich znajomość pozwala konkretyzować rozmowy z dostawcami. Zamiast pytać „jak dokładny jest system?”, zapytaj: „jak radzicie sobie z tymi pięcioma problemami i czy mogę zobaczyć dowody dla każdej kamery?”.

Pięć typowych problemów z detekcją (optyka i pogoda, para i pył, odbicia, błędna detekcja ŚOI, uzasadnione wyjątki) wraz z rozwiązaniami. Trzy pierwsze wymagają strojenia, dwa ostatnie ludzkiego osądu.
Rysunek 3. Pięć typowych problemów z detekcją w przemyśle i jak je naprawić

1. Optyka i pogoda. Nisko stojące słońce w bramach ramp, odblaski na obiektywie, deszcz i śnieg na kopułach kamer, mgła, cykle kondensacji w chłodniach. Objaw: fałszywe alarmy skupione w określonych godzinach i porach roku na określonych kamerach. Rozwiązania: harmonogramy i progi dla każdej kamery, strojenie uwzględniające ekspozycję, a czasem uczciwa odpowiedź, że kamerę trzeba przestawić albo wyposażyć w osłonę. Dostawca, który potrafi powiedzieć „przestawcie kamerę”, ma zdrową kulturę kalibracji.

2. Para, pył i drgające od żaru powietrze. Klasyka przemysłu ciężkiego: para brana za dym, chmury pyłu brane za ogień, drgające powietrze zniekształcające wykrywanie osób przy piecach. Objaw: fałszywe alarmy przy regułach krytycznych, takich jak dym i ogień. To najdroższe fałszywe alarmy w całym systemie, bo uruchamiają najbardziej uciążliwe reakcje. Rozwiązania: strojenie dla konkretnych stref, potwierdzanie na wielu klatkach i kierowanie według poziomu ważności, tak aby niepotwierdzone detekcje trafiały do przeglądu, a nie uruchamiały syren.

3. Odbicia i duplikaty. Polerowane posadzki, szklane ścianki, lustra, mokre powierzchnie po sprzątaniu — każda z nich może podwoić wózek widłowy albo umieścić widmo człowieka w strefie zakazanej. Objaw: fizycznie niemożliwe detekcje, na przykład osoba „w ścianie” albo ten sam pojazd w dwóch miejscach. Rozwiązania: maskowanie powierzchni odbijających, kontrola geometrii i wielokąty wykluczeń dla każdej kamery, definiowane w czasie kalibracji.

4. Błędna detekcja ŚOI i nietypowe pozycje. Odblaskowe pokrowce przeciwdeszczowe na kaskach, kaptury na kaskach, rękawice w kolorze rękawów, pracownik pochylony nad maszyną z kaskiem poza kadrem. Objaw: wyniki fałszywie ujemne równie często jak fałszywe alarmy, czyli niebezpieczne połączenie. Rozwiązania: pokrycie stref krytycznych z kilku kątów, okna detekcji uwzględniające pozycję ciała — sprawdzaj ŚOI na początku zadania, a nie w przysiadzie — oraz uczciwe raportowanie czułości dla każdego przypadku użycia, a nie tylko precyzji.

5. Uzasadnione wyjątki. Ekipa utrzymania ruchu z pozwoleniem na wejście za ogrodzenie. Wózek widłowy, który musi przejechać przez przejście dla pieszych podczas przezbrojenia. Strefa, której reguły zmieniają się w zależności od zmiany. Objaw: technicznie poprawne detekcje, które operatorzy odbierają jako fałszywe, bo kontekst mówi „dozwolone”. Te przypadki najbardziej niszczą zaufanie, bo system nie wygląda na mylący się, tylko na głupi. Rozwiązania: harmonogramy reguł, procedury wyjątków z datą wygaśnięcia oraz cotygodniowy przegląd, podczas którego operatorzy zgłaszają reguły wymagające korekty.

Proces kalibracji bez pętli informacji zwrotnej od operatorów wygra w statystykach precyzji i przegra z ludźmi na hali.

Przewodnik pokazuje też, dlaczego kalibracji nie da się w pełni zautomatyzować. Rodziny 1–3 poddają się strojeniu technicznemu. Rodziny 4–5 wymagają ludzkiego osądu dotyczącego tego, jak w danym zakładzie naprawdę wykonuje się pracę. Ten osąd to właśnie „dyscyplina” w dyscyplinie kalibracji.

6. Metryki, które powinny znaleźć się w umowie pilotażowej

Język precyzji w rozmowach handlowych łatwo się rozmywa, dlatego definicje należy zapisać przed rozpoczęciem pilotażu:

  • Precyzja (dla przypadku użycia i kamery): odsetek zgłoszonych alertów potwierdzonych jako prawdziwe podczas przeglądu przez człowieka. Podstawowa metryka higieny.
  • Czułość, czyli recall (dla przypadku użycia, gdzie da się ją zmierzyć): odsetek prawdziwych zdarzeń z próbki nagrań, które system wychwycił. Trudniej ją zmierzyć, ponieważ wymaga ręcznej weryfikacji próbek nagrań, ale dostawca powinien mieć metodę jej szacowania podczas walidacji. Samą precyzję da się „ograć”, po prostu niczego nie wykrywając.
  • Średnia ważona dokładność: łączna miara dla aktywnych przypadków użycia, ważona liczbą alertów lub ich krytycznością. Przydatna jako linia trendu, ale niebezpieczna jako pojedyncza liczba podana bez rozkładu dla kamer.
  • Liczba alertów na kamerę na zmianę: obciążenie operacyjne. Jej przebieg w pierwszych 90 dniach to najlepszy pojedynczy prognostyk długoterminowego zaangażowania.
  • Czas do potwierdzenia i odsetek otwarć: ludzka połowa systemu. Jeśli te wartości spadają, a precyzja się utrzymuje, problemem jest kierowanie i liczba alertów, a nie detekcja.
  • Udział fałszywych alarmów na koniec kalibracji: liczba, do której zobowiązuje okno kalibracji. Zapisana, mierzona poprzez liczenie, wspólnie weryfikowana i rozumiana przez obie strony jako cel wykazywany podczas walidacji, a nie stała gwarancja umowna. Zakłady się zmieniają i właśnie po to potrzebny jest cotygodniowy raport.
Precyzja, czułość, średnia ważona dokładność, alerty na kamerę na zmianę, odsetek otwarć i czas do potwierdzenia oraz udział fałszywych alarmów na koniec kalibracji, każda z opisem i sygnałem ostrzegawczym.
Rysunek 4. Sześć metryk do zapisania w umowie pilotażowej

Dwie uwagi dotyczące nadzoru. Po pierwsze, dopilnuj, aby próbkę alertów w czasie walidacji oceniał twój własny zespół. Zadanie domowe sprawdzane przez dostawcę zawsze prowadzi do pochlebnych wyników.

Po drugie, uzgodnij, że rytm pomiarów przetrwa uruchomienie: cotygodniowy raport dokładności, comiesięczny przegląd kamer i kwartalna kontrola rekalibracji. Wdrożenia utrzymują dyscyplinę z pierwszego tygodnia dokładnie tak długo, jak wymusza ją rytm raportowania.

7. Lista kontrolna weryfikacji dla kupującego

Pięć par odpowiedzi dostawców: po lewej odpowiedzi świadczące o mierzonej dyscyplinie kalibracji, po prawej zapowiadające załamanie zaufania w trzecim tygodniu.
Rysunek 5. Jak czytać odpowiedzi dostawców na listę kontrolną

8. 90-dniowy plan pilotażu zbudowany wokół precyzji

Oto dyscyplina w formie harmonogramu, który możesz przyjąć bez zmian:

Dni 1–10: podłączenie i cichy pomiar bazowy. Kamery są podłączone, detekcje działają, ale nikt nie dostaje alertów. Rezultaty: mapa pokrycia, statystyki surowego strumienia alertów dla każdej kamery i reguły oraz lista widocznych mylników (patrz przewodnik w sekcji 5). Ustal z dostawcą zasady oceny: co liczy się jako prawdziwe zdarzenie, kto o tym decyduje i jak rozstrzygane są spory.

Dni 11–25: okno kalibracji. Strojenie każdej kamery względem zapisanego celu dla fałszywych alarmów. Wspólny cotygodniowy przegląd: twój zespół ocenia losową próbkę alertów, a dostawca pokazuje, jak zmieniała się precyzja kamer z tygodnia na tydzień. Kryterium wyjścia: uzgodniony udział fałszywych alarmów wykazany na policzonych danych albo udokumentowany plan dla kamer, które go nie osiągnęły (przestawienie, maska, zmiana reguły).

Dni 26–40: nadzorowana praca produkcyjna. Alerty trafiają do wskazanych właścicieli zgodnie z uzgodnionym sposobem kierowania (czas rzeczywisty, zestawienie lub dashboard). Mierz ludzką połowę systemu od pierwszego dnia: odsetek otwarć i czas do potwierdzenia. W połowie tego etapu zorganizuj forum operatorów. To tutaj wychodzą na jaw uzasadnione wyjątki (rodzina 5), a każdy naprawiony wyjątek to zaufanie odłożone na konto.

Dni 41–80: stan ustalony pod pomiarem. Cotygodniowe raporty dokładności działają. Liczba alertów jest stała lub spada, a detekcja się utrzymuje. Jeśli możesz, wprowadź jedną celową zmianę — na przykład zmianę układu lub nowy system zmianowy — aby przetestować rekalibrację, póki dostawca wciąż o ciebie zabiega.

Dni 81–90: pakiet decyzyjny. Końcowe metryki względem zapisanych kryteriów sukcesu: precyzja dla przypadków użycia, czułość oszacowana na podstawie zweryfikowanych próbek, przebieg liczby alertów, zaangażowanie i werdykt forum operatorów.

O przedłużeniu nie decyduje pytanie „czy system coś wykrył?”. Na pewno wykrył. Decyduje pytanie: „czy zespół ufa temu kanałowi bardziej w 12. tygodniu niż w 2.?”. Jeśli tak, skaluj. Jeśli nie, pilotaż powiedział ci tanio to, co wdrożenie powiedziałoby drogo.

Dwie uwagi do umowy pilotażowej. Kryterium zakończenia kalibracji i metodę pomiaru zapisz w zamówieniu, a nie w prezentacji. Zachowaj też dane z pomiaru bazowego niezależnie od wyniku. To dane o ryzyku w twoim zakładzie, dzięki którym kolejna ocena albo uzasadnienie biznesowe wdrożenia zacznie się od dowodów.

9. Najczęstsze pytania o fałszywe alarmy w AI dla BHP

Krótkie odpowiedzi na pytania, które liderzy EHS i operacji zadają najczęściej o fałszywe alarmy, zmęczenie alertami i kalibrację w monitorowaniu bezpieczeństwa z użyciem AI.

Czym jest fałszywy alarm w monitorowaniu bezpieczeństwa z użyciem AI?

Fałszywy alarm (false positive) to alert, który system AI do monitorowania bezpieczeństwa zgłasza dla czegoś, co nie jest prawdziwym zagrożeniem, na przykład pary wodnej rozpoznanej jako dym albo odbicia rozpoznanego jako osoba w strefie zakazanej. W monitorowaniu BHP opartym na wizji komputerowej fałszywe alarmy są równie ważne jak przeoczone zagrożenia. Wysoki odsetek fałszywych alarmów uczy zespoły EHS i brygadzistów ignorowania alertów, także tych prawdziwych.

Dlaczego wdrożenia AI do monitorowania bezpieczeństwa się nie udają?

Większość wdrożeń AI w BHP zawodzi z powodu zmęczenia alertami, a nie dlatego, że model przeocza zagrożenia. Gdy nieskalibrowany system zalewa zespoły BHP fałszywymi alarmami, operatorzy przestają reagować, zwykle w ciągu około trzech tygodni od uruchomienia. Ten sam wzór opisano w innych dziedzinach: badania kliniczne pokazują, że 74–99% alarmów z monitorów szpitalnych nie wymaga działania, a centra operacji bezpieczeństwa (SOC) raportują podobne przeciążenie.

Czym jest zmęczenie alertami w BHP?

Zmęczenie alertami to utrata zaufania i reakcji, która pojawia się, gdy ludzie otrzymują zbyt wiele alertów okazujących się fałszywymi albo nieistotnymi. W AI do BHP objawia się dłuższym czasem potwierdzania, spadającym odsetkiem otwarć i nieformalnymi regułami w rodzaju „ignoruj tę kamerę”. W końcu prawdziwe zdarzenie potencjalnie wypadkowe zostaje potraktowane jak szum.

Czy system AI do BHP może mieć zero fałszywych alarmów?

Nie. Dostawca, który deklaruje zero fałszywych alarmów, po prostu ich nie mierzy. Realistycznym celem jest precyzja na tyle wysoka, by każdy alert zasługiwał na uwagę. Tę precyzję trzeba mierzyć dla każdej kamery i przypadku użycia oraz raportować co tydzień, aby utrzymywała się mimo zmian oświetlenia, układu hali i pór roku.

Jak dokładne powinno być monitorowanie bezpieczeństwa z użyciem AI?

Zanim zapytasz o liczbę, zapytaj o pomiar. Wiarygodny dostawca raportuje średnią ważoną dokładność dla przypadków użycia, pokazuje rozkład dla poszczególnych kamer i aktualizuje oba te parametry co tydzień. Mierzona na bieżąco dokładność na poziomie około 95% jest sprawdzalna. Niezmierzona deklaracja 99% to marketing. Każdą wartość dokładności traktuj jako mierzoną, nie gwarantowaną.

Ile powinna trwać kalibracja kamer AI do BHP?

Kalibracja powinna trwać tygodnie, nie kwartały. Typowy układ to krótki cichy pomiar bazowy, a po nim okno kalibracji trwające około dwóch tygodni. To okno ma zapisany cel dla fałszywych alarmów, mierzony dla każdej kamery i weryfikowany wspólnie z klientem. Uważaj na dostawcę bez okresu kalibracji, ale także na takiego, u którego kalibracja nigdy się nie kończy.

Jak ograniczyć fałszywe alarmy w monitorowaniu BHP z wykorzystaniem wizji komputerowej?

Fałszywe alarmy ogranicza się poprzez kalibrację do konkretnego zakładu, a nie przez zastosowanie nowego modelu. Główne narzędzia to maski stref dla każdej kamery, strojenie progów, harmonogramy reguł, potwierdzanie dymu i ognia na wielu klatkach oraz kierowanie alertów według poziomu ważności. Najczęstsze przyczyny fałszywych alarmów w zakładach przemysłowych to nisko stojące słońce i pogoda, para i pył, odbicia, błędna detekcja ŚOI oraz uzasadnione wyjątki, takie jak autoryzowane prace utrzymania ruchu.

Czy pilotaż AI w BHP zaczynać od wielu przypadków użycia, czy od kilku?

Zacznij od jednego lub dwóch przypadków użycia i skalibruj je do wiarygodnej precyzji, zanim dodasz kolejne. Wczesna precyzja buduje zaufanie operatorów, które przejmą kolejne przypadki użycia. Szerokie pokrycie od pierwszego dnia zwykle odtwarza krzywą zmęczenia alertami z trzeciego tygodnia w skali całego przedsiębiorstwa.

Jeśli nasz zespół ignoruje alerty ruchu z systemu VMS, czy zignoruje też alerty AI?

Niekoniecznie, ale samo lepsze wykrywanie tego nie naprawi. Ignorowanie hałaśliwych alertów ruchu to racjonalne zachowanie, co pokazują badania nad zmęczeniem alarmami. Alerty AI w BHP utrzymują uwagę, gdy strumień alertów projektuje się wspólnie z zespołem. Każdy alert w czasie rzeczywistym ma wskazanego właściciela i określoną reakcję, a cała reszta trafia do dziennego zestawienia albo na dashboard.

Jakie metryki powinna zawierać umowa na pilotaż AI w BHP?

Umowa na pilotaż AI w BHP powinna definiować sześć metryk: precyzję dla przypadku użycia i kamery, czułość szacowaną na próbkach nagrań, średnią ważoną dokładność, liczbę alertów na kamerę na zmianę, odsetek otwarć i czas do potwierdzenia oraz udział fałszywych alarmów na koniec kalibracji. Zapisz te definicje i metodę pomiaru w zamówieniu, a próbkę alertów niech ocenia twój własny zespół.

Czy AI do monitorowania BHP identyfikuje poszczególnych pracowników?

Nie musi i systemy projektowane z myślą o prywatności tego nie robią. Surveily na przykład wykrywa obiekty, sprzęt, pojazdy i zachowania, takie jak brak kasku, bez rozpoznawania twarzy i bez jakiejkolwiek innej identyfikacji biometrycznej. Obraz jest domyślnie deidentyfikowany: twarze i sylwetki są rozmywane, zanim cokolwiek zostanie zapisane lub wyświetlone. O tym, co dzieje się po alercie, decydują ludzie, a nie system.

Jak Surveily radzi sobie z fałszywymi alarmami?

Surveily prowadzi ograniczony w czasie okres kalibracji w każdym wdrożeniu, weryfikowany jawnie z klientem względem zapisanego celu dla fałszywych alarmów. Dedykowani specjaliści ds. danych stroją każdą kamerę. Klienci co tydzień otrzymują raport dokładności z widokiem dla każdej kamery i średnią ważoną dla przypadków użycia. Ta średnia wynosi około 95% w naszych wdrożeniach, jest mierzona i raportowana na bieżąco, nigdy gwarantowana.

Źródła

  1. Literatura o alarmach klinicznych (PubMed Central): przeglądy wskazujące, że 74–99% alarmów z monitorów funkcji życiowych nie wymaga działania, a obciążenie alarmami na OIOM-ie przekracza 350 na pacjenta dziennie. Przykład: https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3752621/
  2. StrangeBee — Cybersecurity alert fatigue (badanie z 2023 r.: ~83% alertów fałszywych; 67% ignorowanych). https://strangebee.com/blog/what-is-cybersecurity-alert-fatigue-and-how-to-fight-back/
  3. SANS Detection and Response Survey 2025 — 73% zespołów bezpieczeństwa wskazuje fałszywe alarmy jako największe wyzwanie w wykrywaniu (za podsumowaniem Vectra AI). https://www.vectra.ai/topics/alert-fatigue
  4. AlAhmadi, B. i in. — „99% False Positives: A Qualitative Study of SOC Analysts’ Perspectives on Security Alarms” (USENIX Security).
  5. IntelliSee — 98% of Security Camera Alarms Are False (analiza branżowa). https://intellisee.com/98-of-security-camera-alarms-are-false-heres-what-thats-actually-costing-you/
  6. Splunk — Preventing Alert Fatigue in Cybersecurity (25–30% alertów niezbadanych). https://www.splunk.com/en_us/blog/learn/alert-fatigue.html
  7. Wyniki wdrożeń AI w BHP w przemyśle (rafineria, huta stali, elektrociepłownia): dane o spadku liczby alertów dla konkretnego zakresu, raportowane przez klientów, 2024–2026.

Wojtek Tubek jest założycielem i CEO Surveily, wrocławskiej firmy, która zamienia monitoring CCTV, który zakład już ma, w proaktywny system bezpieczeństwa projektowany z myślą o prywatności.

Jak prowadzimy kalibrację w Surveily. Każde wdrożenie zaczyna się od ograniczonego w czasie okresu kalibracji, weryfikowanego jawnie z klientem względem zapisanego celu dla fałszywych alarmów. Dedykowani specjaliści ds. danych stroją każdą kamerę, a klienci otrzymują cotygodniowy raport dokładności: średnią ważoną dla przypadków użycia (około 95% w naszych wdrożeniach, mierzoną i raportowaną na bieżąco, nigdy gwarantowaną) oraz widok dla każdej kamery. Obraz jest analizowany na miejscu i domyślnie deidentyfikowany, zanim cokolwiek zostanie zapisane lub wyświetlone, a surowe nagrania nie są przechowywane. System sygnalizuje, decyzję podejmuje twój zespół.

Planujesz pilotaż? Zabierz listę kontrolną z sekcji 7 na każde spotkanie z dostawcą, także z nami. Ten artykuł ma charakter edukacyjny. Przytoczone wyniki wdrożeń dotyczą konkretnego zakładu, zakresu i okresu.

‍

Dlaczego czekać?

Zyskaj pełną widoczność  
ryzyk w całym zakładzie.

Dołącz do firm na całym świecie, które zaufały Surveily AI, by podnieść poziom bezpieczeństwa pracy i wzmocnić zespoły. Nasze rozwiązania oparte na sztucznej inteligencji proaktywnie chronią pracowników i usprawniają operacje.
Zobacz wideo