Monitoring sieci w firmie. Co monitorować
na routerach, switchach i łączach?
To jedne z najczęstszych zgłoszeń w firmowym IT. Problem polega na tym, że wszystkie mogą mieć zupełnie inne przyczyny. Winny może być:
Albo urządzenie, które od kilku tygodni działa na granicy swoich możliwości.
Bez monitoringu administrator zaczyna od zgadywania. Z monitoringiem ma dane historyczne pokazujące dokładnie, co działo się z siecią przed wystąpieniem problemu.
Dlatego dobry monitoring sieci nie polega na sprawdzaniu, czy urządzenie odpowiada na ping. Powinien odpowiadać na znacznie ważniejsze pytanie:
Czy sieć działa poprawnie i czy za chwilę coś się w niej nie skończy, przeciąży albo zepsuje?
Po co monitorować sieć firmową?
Najbardziej podstawową korzyścią jest możliwość wykrycia awarii zanim pierwszy użytkownik zadzwoni z informacją "nie działa". Ale dobry monitoring daje znacznie więcej. Pozwala:
Dane historyczne są szczególnie ważne przy problemach, które występują nieregularnie. Jeżeli użytkownicy zgłaszają "codziennie około 14:00 Internet działa wolno", to bez monitoringu pozostaje czekanie na kolejne wystąpienie problemu.
Z monitoringiem można sprawdzić obciążenie łącza, CPU routera, packet loss, ruch na portach i liczbę sesji dokładnie w tym okresie.
Ping to dopiero początek
Najprostszy monitoring wygląda tak: router odpowiada na ping - działa, router nie odpowiada - awaria. To oczywiście lepsze niż brak monitoringu, ale zdecydowanie niewystarczające.
Urządzenie może odpowiadać na ping i jednocześnie:
Z punktu widzenia monitoringu urządzenie jest "zielone". Z punktu widzenia użytkowników sieć praktycznie nie działa.
Co monitorować na routerze?
Router jest zwykle jednym z najważniejszych urządzeń w firmie. Obsługuje dostęp do Internetu, routing pomiędzy sieciami, VPN, NAT, firewall, a często również połączenia pomiędzy oddziałami. Jego awaria może zatrzymać praktycznie całą firmę.
Dostępność
Podstawą jest sprawdzanie, czy router odpowiada, jak długo działa bez restartu, czy zmienił się uptime oraz czy pojawiają się okresowe przerwy.
Nagły reset urządzenia powinien generować alert nawet wtedy, gdy router po minucie ponownie działa poprawnie. Powtarzające się restarty mogą oznaczać problem z zasilaniem, przegrzewanie, błąd firmware albo awarię sprzętu.
CPU
Obciążenie procesora routera powinno być analizowane w czasie. Pojedynczy skok nie musi być problemem. Znacznie bardziej niepokojące jest CPU stale powyżej 80-90 procent, regularne skoki w godzinach szczytu, nagły wzrost po zmianie konfiguracji lub przeciążenie podczas działania VPN.
W urządzeniach MikroTik wysokie CPU może być związane między innymi z:
Pamięć RAM
Rosnące zużycie pamięci może wskazywać na błąd oprogramowania, wyciek pamięci, zbyt dużą liczbę sesji lub przeciążenie urządzenia. Jeżeli ilość wolnej pamięci systematycznie maleje przez kilka dni, warto to przeanalizować zanim router przestanie odpowiadać.
Interfejsy sieciowe
Dla każdego kluczowego portu warto obserwować:
To właśnie błędy interfejsów bardzo często prowadzą do problemów typu "sieć działa, ale co jakiś czas coś przerywa".
Nie wystarczy wiedzieć, że port działa
Załóżmy, że port Ethernet jest aktywny. Monitoring pokazuje status UP. Jednocześnie licznik błędów CRC rośnie o kilkaset błędów na minutę.
Przyczyną może być uszkodzony przewód, problem z modułem SFP, problem z portem switcha, zakłócenia lub nieprawidłowe parametry transmisji.
Bez monitoringu użytkownik zgłosi "wolny Internet". Administrator może przez godzinę analizować router, podczas gdy problemem jest jeden patchcord.
Monitoring ruchu i wykorzystania pasma
Jedną z najważniejszych informacji jest wykorzystanie każdego istotnego interfejsu. Warto monitorować:
Jeżeli firma posiada łącze 1 Gbps i codziennie przez kilka godzin wykorzystuje 950 Mbps, problem nie jest awarią. Problemem jest zbyt małe łącze. Monitoring pozwala wykazać to na podstawie danych zamiast opinii użytkowników.
Liczba połączeń i NAT
W routerach obsługujących NAT warto kontrolować również liczbę aktywnych połączeń, tempo tworzenia nowych sesji, wykorzystanie connection tracking oraz nietypowe wzrosty liczby połączeń. Nagły skok może wskazywać między innymi na infekcję stacji roboczej, skanowanie sieci, atak, wadliwą aplikację lub nagły wzrost ruchu.
VPN
Jeżeli firma korzysta z VPN, monitoring powinien obejmować nie tylko router jako urządzenie, ale również same tunele. Warto kontrolować:
Dotyczy to między innymi WireGuard, IPsec, OpenVPN, tuneli site-to-site oraz połączeń pomiędzy oddziałami. Więcej o wyborze technologii VPN piszemy w artykule WireGuard czy OpenVPN.
Tunel VPN może formalnie działać, ale jednocześnie gubić pakiety albo mieć bardzo wysokie opóźnienie.
Routing
W bardziej rozbudowanych środowiskach warto również monitorować routing - szczególnie BGP, OSPF, konfiguracje z wieloma operatorami i wieloma lokalizacjami. Alert powinien pojawić się między innymi po utracie sąsiedztwa, zmianie liczby tras, zmianie aktywnej ścieżki lub przełączeniu operatora.
Co monitorować na switchach?
Switch jest często mniej widoczny niż router. Dopóki działa, nikt o nim nie myśli. Jednocześnie pojedynczy problem na switchu może spowodować niedostępność całego piętra, działu albo serwerowni.
Dostępność switcha
Podobnie jak router powinien być monitorowany pod kątem dostępności, uptime, restartów, stanu CPU i pamięci.
Porty
To najważniejszy element monitoringu switcha. Warto kontrolować:
Flapping portów
Port, który co kilka minut przechodzi ze stanu UP do DOWN i z powrotem, powinien generować alert. Może to oznaczać uszkodzony kabel, problem z kartą sieciową, problem z urządzeniem końcowym, problem z PoE lub uszkodzony port.
Użytkownik może zgłaszać jedynie "co jakiś czas zrywa mi sieć". Monitoring pokaże dokładnie, kiedy i na którym porcie problem występuje.
Błędy CRC
Rosnąca liczba CRC errors jest jednym z najbardziej użytecznych sygnałów podczas diagnostyki sieci. Może wskazywać na uszkodzoną skrętkę, wadliwy moduł SFP, uszkodzone włókno, problem z portem lub zakłócenia transmisji. Alert warto generować nie po pojedynczym błędzie, ale po przekroczeniu określonego tempa wzrostu.
Wykorzystanie portów
Monitoring powinien pokazywać również obciążenie uplinków. Jeżeli uplink między dwoma switchami regularnie osiąga 100 procent, można rozważyć agregację LACP, przejście z 1 Gbps na 10 Gbps, zmianę topologii lub rozdzielenie ruchu. Bez danych historycznych takie decyzje często podejmowane są na podstawie przypuszczeń.
STP i pętle sieciowe
Pętla w warstwie drugiej potrafi zatrzymać całą sieć w bardzo krótkim czasie. Dlatego w środowiskach wykorzystujących STP lub RSTP warto monitorować zmianę root bridge, zmianę topologii, blokowanie portów i częste przeliczenia drzewa. Jeżeli root bridge nagle zmieni się z głównego switcha Core na mały switch dostępowy, warto wiedzieć o tym natychmiast.
LACP i agregacja łączy
Jeżeli wykorzystywane są port-channel lub bonding, monitoring powinien kontrolować status agregacji, stan każdego członka, rozkład ruchu i utratę jednego z linków.
Agregacja może nadal działać po utracie jednego kabla, ale dostępne pasmo może spaść o połowę. Bez monitoringu firma może przez wiele tygodni pracować na zdegradowanym połączeniu.
PoE
W sieciach z telefonami VoIP, kamerami, punktami WiFi i urządzeniami IoT bardzo istotny jest monitoring PoE. Warto obserwować:
Jeżeli switch posiada budżet 370 W i urządzenia pobierają 360 W, podłączenie kolejnego access pointa może spowodować problemy.
Temperatura i zasilacze
Urządzenia sieciowe pracujące w źle wentylowanej szafie mogą się przegrzewać. Dlatego warto monitorować temperaturę, pracę wentylatorów, stan zasilaczy, redundantne PSU oraz alarmy hardware. Jeżeli temperatura rośnie przez kilka tygodni wraz z nadejściem lata, można zareagować przed pierwszym restartem urządzenia.
Co monitorować na łączach internetowych?
To jeden z najważniejszych obszarów. Firma może posiadać doskonale działającą infrastrukturę lokalną, ale jeśli łącze operatora działa niestabilnie, użytkownicy będą postrzegać cały system IT jako awaryjny.
Dostępność
Nie wystarczy pingować tylko routera operatora. Dobrze jest sprawdzać kilka punktów: gateway operatora, niezależny adres w Internecie, DNS oraz ważną usługę chmurową. Dzięki temu można rozróżnić awarię lokalnego routera, problem z operatorem, problem routingu i problem konkretnej usługi.
Latency
Opóźnienie powinno być monitorowane jako trend. Jeżeli przez wiele miesięcy średni ping wynosi około 10 ms, a nagle rośnie do 70 ms, warto to zbadać nawet wtedy, gdy Internet formalnie nadal działa. Wysokie latency wpływa szczególnie na VoIP, Teams, RDP, VPN, aplikacje chmurowe i systemy ERP dostępne zdalnie.
Packet loss
Utrata pakietów jest jednym z najbardziej dokuczliwych problemów sieciowych. Nawet niewielka może powodować przerywanie rozmów, problemy z VPN, wolne aplikacje, zerwane sesje i retransmisje TCP. Co ważne, użytkownik często opisuje to po prostu jako "Internet jest wolny".
Jitter
Jitter oznacza zmienność opóźnienia i jest szczególnie istotny dla VoIP, wideokonferencji i komunikacji czasu rzeczywistego. Łącze może mieć średnie latency 20 ms, ale jeśli kolejne pakiety docierają po 10, 80, 15 i 100 ms, jakość rozmowy może być bardzo słaba.
Wykorzystanie pasma
Warto monitorować średnie wykorzystanie, maksymalne wartości, godziny szczytu i kierunek ruchu. Szczególnie istotny bywa upload.
Firma może posiadać 1 Gbps download i tylko 100 Mbps upload. Jeżeli w tym samym czasie działa backup do chmury, VPN, Teams i synchronizacja danych, to właśnie upload może być źródłem problemów.
Monitoring SLA operatora
Dane historyczne pozwalają również ocenić jakość operatora. Można raportować dostępność miesięczną, liczbę awarii, czas niedostępności, latency i packet loss. Jeżeli operator deklaruje określone SLA, mamy dane pozwalające zweryfikować jego realizację.
Łącze zapasowe, którego nikt nie sprawdza
To bardzo częsty problem. Firma posiada światłowód główny oraz zapasowe LTE lub drugiego operatora. Wszyscy zakładają, że w razie awarii nastąpi automatyczne przełączenie. Tylko że ostatni test był trzy lata temu.
W międzyczasie karta SIM wygasła, zmieniła się konfiguracja, router LTE przestał działać albo antena uległa uszkodzeniu.
Łącze zapasowe powinno być monitorowane tak samo jak główne. Dodatkowo warto okresowo wykonywać kontrolowany test failover.
WiFi również jest częścią sieci
Choć głównym tematem są routery, switche i WAN, w większości współczesnych firm nie można ignorować WiFi. Warto monitorować:
Problem "Internet działa wolno" bardzo często okazuje się problemem WiFi, a nie samego Internetu.
SNMP, API i flow
Do monitorowania urządzeń sieciowych wykorzystuje się kilka źródeł danych.
SNMP
Pozwala pobierać między innymi ruch interfejsów, błędy, CPU, RAM, temperaturę i stan zasilaczy. Warto korzystać z SNMPv3, jeżeli urządzenia je obsługują.
API
Nowoczesne urządzenia coraz częściej udostępniają API pozwalające pobierać bardziej szczegółowe informacje niż klasyczne SNMP.
NetFlow, sFlow i IPFIX
Pozwalają odpowiedzieć na pytanie: kto właściwie wykorzystuje nasze łącze? Dzięki analizie flow można zobaczyć:
To bardzo przydatne podczas analizy przeciążenia łącza lub podejrzanej aktywności.
Monitoring konfiguracji
Dostępność urządzenia to tylko część obrazu. Ważne jest również wykrywanie zmian konfiguracji. Jeżeli ktoś otworzy port na firewallu, zmieni regułę NAT, zmieni VLAN, doda użytkownika VPN lub zmodyfikuje routing, warto posiadać historię tej zmiany.
To pomaga zarówno przy bezpieczeństwie, jak i diagnostyce awarii.
Bardzo wiele problemów zaczyna się od zdania "nic nie zmienialiśmy". Historia konfiguracji często pokazuje coś innego.
Jak ustawić alerty, żeby monitoring był użyteczny?
Największym zagrożeniem dla systemu monitoringu jest nie brak alertów. Jest nim ich nadmiar. Jeżeli administrator otrzymuje 300 komunikatów dziennie, po kilku tygodniach przestaje je czytać. Dlatego alerty powinny mieć priorytety.
Natychmiastowa reakcja
brak głównego routera, awaria obu łączy, niedostępność core switcha, utrata tunelu do krytycznej lokalizacji.
Wymaga szybkiej analizy
awaria jednego operatora przy działającym backupie, wysokie packet loss, awaria jednego członka LACP, wysoka temperatura urządzenia.
Wymaga zaplanowania
port regularnie osiąga 80% przepustowości, maleje ilość wolnej pamięci, rośnie liczba błędów interfejsu, zbliża się limit PoE.
Dobry monitoring nie powinien generować większej liczby wiadomości. Powinien generować lepsze informacje.
Dashboard dla administratora
Po otwarciu dashboardu administrator powinien od razu zobaczyć:
Dopiero dalej powinny znajdować się szczegółowe wykresy i dane historyczne. Dashboard ma pomagać podejmować decyzje, a nie wyglądać efektownie na telewizorze w dziale IT.
Najczęstsze błędy w monitoringu sieci
Podczas audytów najczęściej spotykamy kilka problemów.
Monitorowany jest tylko ping
Urządzenie odpowiada, więc wszystko jest zielone. Nikt nie obserwuje wydajności ani błędów.
Brak historii
Administrator widzi stan bieżący, ale nie może sprawdzić, co działo się wczoraj o 14:37.
Za dużo alertów
Każdy interfejs i każde drobne zdarzenie generuje e-mail. W efekcie ważne alarmy giną w szumie.
Brak monitoringu zapasowych łączy
O ich awarii firma dowiaduje się dopiero podczas awarii łącza głównego.
Brak monitoringu PoE i temperatury
Problemy pojawiają się dopiero po wyłączeniu urządzeń.
Brak kontroli konfiguracji
Nie wiadomo, kiedy i dlaczego pojawiła się zmiana.
Monitoring w tej samej lokalizacji
Po awarii całej serwerowni przestaje działać również monitoring.
W przypadku krytycznych systemów warto posiadać przynajmniej część monitoringu niezależną od monitorowanego środowiska.
Jak wygląda monitoring sieci w PRO-Admin?
Nie wdrażamy monitoringu po to, żeby mieć więcej wykresów. Najpierw ustalamy:
Dopiero później dobieramy metryki i progi alarmowe. Monitorujemy między innymi routery MikroTik, switche, firewalle, VPN, WAN, zapasowe łącza, interfejsy, PoE, temperaturę, wykorzystanie pasma, packet loss, latency oraz usługi zależne od sieci.
Monitoring może być następnie powiązany z systemem zgłoszeń i eskalacją. Dzięki temu awaria routera o 4:00 rano nie jest tylko czerwoną kropką na dashboardzie - jest zdarzeniem, które trafia do konkretnej osoby zgodnie z ustaloną procedurą.
Jeżeli Twoja sieć opiera się na MikroTik, warto też sprawdzić artykuł o najczęstszych błędach konfiguracji MikroTik, które regularnie znajdujemy podczas audytów.
FAQ - monitoring sieci
Czy ping wystarczy do monitorowania sieci?
Nie. Ping pozwala sprawdzić podstawową dostępność urządzenia, ale nie pokazuje przeciążenia CPU, błędów portów, packet loss, temperatury, wykorzystania pasma ani problemów z PoE.
Jak monitorować router MikroTik?
Najczęściej wykorzystujemy SNMP, API, syslog oraz dane o interfejsach, CPU, pamięci, temperaturze, routingu, VPN i liczbie połączeń. Zakres zależy od roli urządzenia.
Czy warto monitorować każde gniazdo switcha?
Nie zawsze. W przypadku dużych środowisk warto szczegółowo monitorować porty krytyczne, uplinki, serwery, access pointy i urządzenia infrastrukturalne. Pozostałe można obserwować z mniej restrykcyjnymi alertami.
Czy można monitorować jakość Internetu?
Tak. Można mierzyć dostępność, latency, jitter, packet loss oraz wykorzystanie pasma. Warto wykonywać testy do kilku niezależnych punktów, żeby łatwiej określić źródło problemu.
Czy monitoring może wykryć awarię kabla?
Nie zawsze bezpośrednio, ale może wykryć objawy takie jak CRC errors, flapping portu, zmiana prędkości linku lub utrata pakietów.
Czy monitoring powinien działać 24/7?
Tak. Problemy z siecią nie występują wyłącznie w godzinach pracy. Sam monitoring może działać przez całą dobę, natomiast sposób reakcji na alerty powinien wynikać z ustalonego SLA.
Podsumowanie
Dobra sieć to nie taka, która po prostu działa dzisiaj. To sieć, o której stanie wiemy wystarczająco dużo, żeby przewidzieć problemy i szybko znaleźć ich przyczynę.
Dlatego monitoring powinien obejmować nie tylko dostępność urządzeń, ale również:
Największą wartością nie jest jednak sam wykres. Jest nią odpowiedź na pytanie:
Dlaczego sieć działa źle i co trzeba zrobić, żeby problem się nie powtórzył?
Użytkownicy regularnie zgłaszają, że "Internet działa wolno"?
Nie musisz czekać na kolejną awarię, żeby rozpocząć diagnostykę. W PRO-Admin możemy przeanalizować obecną sieć, uruchomić monitoring routerów, switchy i łączy oraz przygotować dashboard i alerty dopasowane do rzeczywistych potrzeb firmy. Jeżeli problem już występuje, możemy również przeprowadzić analizę sieci i wskazać, czy źródłem jest operator, router, switch, WiFi, konfiguracja czy przeciążenie infrastruktury.
Wdrożenie monitoringu ITPrzeczytaj też
Jak jedna błędna reguła firewalla odcięła firmę od świata?
Jedna źle dodana reguła firewalla wystarczyła, aby sparaliżować pracę całej firmy. Poznaj prawdziwy scenariusz awarii, dowiedz się jak bezpiecznie wprowadzać zmiany w firewallu i dlaczego rollback powinien być obowiązkowym elementem każdej modyfikacji.
BezpieczeństwoJak rozpoznać atak ransomware, zanim będzie za późno?
Ransomware rzadko pojawia się nagle - atakujący przebywają w sieci tygodniami. Sygnały ostrzegawcze: nietypowe logowania, błędy backupu, nowe konta administracyjne. Jak reagować.
MonitoringMonitoring infrastruktury IT - co warto monitorować?
CPU i RAM to dopiero początek. Co jeszcze monitorować: usługi, SSL, backup, sieć i sprzęt. Zabbix, Prometheus i Grafana w praktyce. Jak unikać alert fatigue?
Monitoring ITCo monitorujemy u klientów? Monitoring IT 24/7 w praktyce
Skuteczny monitoring IT nie polega na sprawdzaniu, czy serwer odpowiada na ping. Dowiedz się, co monitorujemy u klientów: serwery, sieci, backupy, aplikacje biznesowe i jak wykrywamy problemy zanim zadzwoni klient.
Porozmawiajmy o Twoim IT
Odpiszemy najszybciej jak to możliwe. Bezpłatna konsultacja i wycena.
Obsługujemy firmy w Szczecinie, Stargardzie i okolicach oraz realizujemy usługi zdalnie na terenie całej Polski.