Monitoring Sieci Infrastruktura IT

Monitoring sieci w firmie. Co monitorować
na routerach, switchach i łączach?

· 15 min czytania · PRO-Admin
"Internet działa wolno."
"VPN znowu rozłącza."
"Teams tnie."
"ERP się zawiesza."
"Drukarki zniknęły z sieci."

To jedne z najczęstszych zgłoszeń w firmowym IT. Problem polega na tym, że wszystkie mogą mieć zupełnie inne przyczyny. Winny może być:

Operator Internetu
Router
Switch
Przeciążony port
Uszkodzony kabel
Błąd VLAN
Tunel VPN
Pętla w sieci

Albo urządzenie, które od kilku tygodni działa na granicy swoich możliwości.

Bez monitoringu administrator zaczyna od zgadywania. Z monitoringiem ma dane historyczne pokazujące dokładnie, co działo się z siecią przed wystąpieniem problemu.

Dlatego dobry monitoring sieci nie polega na sprawdzaniu, czy urządzenie odpowiada na ping. Powinien odpowiadać na znacznie ważniejsze pytanie:

Czy sieć działa poprawnie i czy za chwilę coś się w niej nie skończy, przeciąży albo zepsuje?

Po co monitorować sieć firmową?

Najbardziej podstawową korzyścią jest możliwość wykrycia awarii zanim pierwszy użytkownik zadzwoni z informacją "nie działa". Ale dobry monitoring daje znacznie więcej. Pozwala:

Wykrywać awarie routerów i switchy
Sprawdzać stan łączy internetowych
Obserwować wykorzystanie pasma
Wykrywać packet loss i rosnące opóźnienia
Identyfikować problemy z portami switchy
Kontrolować VPN
Monitorować temperaturę urządzeń
Wykrywać problemy z PoE
Analizować historię awarii
Planować rozbudowę infrastruktury

Dane historyczne są szczególnie ważne przy problemach, które występują nieregularnie. Jeżeli użytkownicy zgłaszają "codziennie około 14:00 Internet działa wolno", to bez monitoringu pozostaje czekanie na kolejne wystąpienie problemu.

Z monitoringiem można sprawdzić obciążenie łącza, CPU routera, packet loss, ruch na portach i liczbę sesji dokładnie w tym okresie.

Ping to dopiero początek

Najprostszy monitoring wygląda tak: router odpowiada na ping - działa, router nie odpowiada - awaria. To oczywiście lepsze niż brak monitoringu, ale zdecydowanie niewystarczające.

Urządzenie może odpowiadać na ping i jednocześnie:

Mieć CPU wykorzystane w 100 procentach
Gubić pakiety
Mieć uszkodzony port
Posiadać przepełnioną tablicę połączeń
Generować błędy na interfejsie
Mieć prawie pełną pamięć
Działać przy zbyt wysokiej temperaturze

Z punktu widzenia monitoringu urządzenie jest "zielone". Z punktu widzenia użytkowników sieć praktycznie nie działa.

Co monitorować na routerze?

Router jest zwykle jednym z najważniejszych urządzeń w firmie. Obsługuje dostęp do Internetu, routing pomiędzy sieciami, VPN, NAT, firewall, a często również połączenia pomiędzy oddziałami. Jego awaria może zatrzymać praktycznie całą firmę.

Dostępność

Podstawą jest sprawdzanie, czy router odpowiada, jak długo działa bez restartu, czy zmienił się uptime oraz czy pojawiają się okresowe przerwy.

Nagły reset urządzenia powinien generować alert nawet wtedy, gdy router po minucie ponownie działa poprawnie. Powtarzające się restarty mogą oznaczać problem z zasilaniem, przegrzewanie, błąd firmware albo awarię sprzętu.

CPU

Obciążenie procesora routera powinno być analizowane w czasie. Pojedynczy skok nie musi być problemem. Znacznie bardziej niepokojące jest CPU stale powyżej 80-90 procent, regularne skoki w godzinach szczytu, nagły wzrost po zmianie konfiguracji lub przeciążenie podczas działania VPN.

W urządzeniach MikroTik wysokie CPU może być związane między innymi z:

Dużą liczbą reguł firewall
Intensywnym ruchem VPN
Routingiem dynamicznym
Brakiem hardware offload
Błędną konfiguracją bridge
Dużą liczbą połączeń

Pamięć RAM

Rosnące zużycie pamięci może wskazywać na błąd oprogramowania, wyciek pamięci, zbyt dużą liczbę sesji lub przeciążenie urządzenia. Jeżeli ilość wolnej pamięci systematycznie maleje przez kilka dni, warto to przeanalizować zanim router przestanie odpowiadać.

Interfejsy sieciowe

Dla każdego kluczowego portu warto obserwować:

Status up/down
Prędkość negocjacji
Wykorzystanie pasma
Ilość przesłanych danych
Błędy RX i TX
Dropped packets
CRC errors

To właśnie błędy interfejsów bardzo często prowadzą do problemów typu "sieć działa, ale co jakiś czas coś przerywa".

Nie wystarczy wiedzieć, że port działa

Załóżmy, że port Ethernet jest aktywny. Monitoring pokazuje status UP. Jednocześnie licznik błędów CRC rośnie o kilkaset błędów na minutę.

Przyczyną może być uszkodzony przewód, problem z modułem SFP, problem z portem switcha, zakłócenia lub nieprawidłowe parametry transmisji.

Bez monitoringu użytkownik zgłosi "wolny Internet". Administrator może przez godzinę analizować router, podczas gdy problemem jest jeden patchcord.

Monitoring ruchu i wykorzystania pasma

Jedną z najważniejszych informacji jest wykorzystanie każdego istotnego interfejsu. Warto monitorować:

Ruch przychodzący
Ruch wychodzący
Procent wykorzystania łącza
Wartości szczytowe
Trend w dłuższym okresie

Jeżeli firma posiada łącze 1 Gbps i codziennie przez kilka godzin wykorzystuje 950 Mbps, problem nie jest awarią. Problemem jest zbyt małe łącze. Monitoring pozwala wykazać to na podstawie danych zamiast opinii użytkowników.

Liczba połączeń i NAT

W routerach obsługujących NAT warto kontrolować również liczbę aktywnych połączeń, tempo tworzenia nowych sesji, wykorzystanie connection tracking oraz nietypowe wzrosty liczby połączeń. Nagły skok może wskazywać między innymi na infekcję stacji roboczej, skanowanie sieci, atak, wadliwą aplikację lub nagły wzrost ruchu.

VPN

Jeżeli firma korzysta z VPN, monitoring powinien obejmować nie tylko router jako urządzenie, ale również same tunele. Warto kontrolować:

Status tunelu
Czas od ostatniego handshake
Ilość przesłanych danych
Liczbę aktywnych użytkowników
Opóźnienia
Packet loss
Częste rozłączanie

Dotyczy to między innymi WireGuard, IPsec, OpenVPN, tuneli site-to-site oraz połączeń pomiędzy oddziałami. Więcej o wyborze technologii VPN piszemy w artykule WireGuard czy OpenVPN.

Tunel VPN może formalnie działać, ale jednocześnie gubić pakiety albo mieć bardzo wysokie opóźnienie.

Routing

W bardziej rozbudowanych środowiskach warto również monitorować routing - szczególnie BGP, OSPF, konfiguracje z wieloma operatorami i wieloma lokalizacjami. Alert powinien pojawić się między innymi po utracie sąsiedztwa, zmianie liczby tras, zmianie aktywnej ścieżki lub przełączeniu operatora.

Co monitorować na switchach?

Switch jest często mniej widoczny niż router. Dopóki działa, nikt o nim nie myśli. Jednocześnie pojedynczy problem na switchu może spowodować niedostępność całego piętra, działu albo serwerowni.

Dostępność switcha

Podobnie jak router powinien być monitorowany pod kątem dostępności, uptime, restartów, stanu CPU i pamięci.

Porty

To najważniejszy element monitoringu switcha. Warto kontrolować:

Status portu
Częstotliwość zmian stanu
Prędkość linku
Błędy
Ilość ruchu
Wykorzystanie pasma

Flapping portów

Port, który co kilka minut przechodzi ze stanu UP do DOWN i z powrotem, powinien generować alert. Może to oznaczać uszkodzony kabel, problem z kartą sieciową, problem z urządzeniem końcowym, problem z PoE lub uszkodzony port.

Użytkownik może zgłaszać jedynie "co jakiś czas zrywa mi sieć". Monitoring pokaże dokładnie, kiedy i na którym porcie problem występuje.

Błędy CRC

Rosnąca liczba CRC errors jest jednym z najbardziej użytecznych sygnałów podczas diagnostyki sieci. Może wskazywać na uszkodzoną skrętkę, wadliwy moduł SFP, uszkodzone włókno, problem z portem lub zakłócenia transmisji. Alert warto generować nie po pojedynczym błędzie, ale po przekroczeniu określonego tempa wzrostu.

Wykorzystanie portów

Monitoring powinien pokazywać również obciążenie uplinków. Jeżeli uplink między dwoma switchami regularnie osiąga 100 procent, można rozważyć agregację LACP, przejście z 1 Gbps na 10 Gbps, zmianę topologii lub rozdzielenie ruchu. Bez danych historycznych takie decyzje często podejmowane są na podstawie przypuszczeń.

STP i pętle sieciowe

Pętla w warstwie drugiej potrafi zatrzymać całą sieć w bardzo krótkim czasie. Dlatego w środowiskach wykorzystujących STP lub RSTP warto monitorować zmianę root bridge, zmianę topologii, blokowanie portów i częste przeliczenia drzewa. Jeżeli root bridge nagle zmieni się z głównego switcha Core na mały switch dostępowy, warto wiedzieć o tym natychmiast.

LACP i agregacja łączy

Jeżeli wykorzystywane są port-channel lub bonding, monitoring powinien kontrolować status agregacji, stan każdego członka, rozkład ruchu i utratę jednego z linków.

Agregacja może nadal działać po utracie jednego kabla, ale dostępne pasmo może spaść o połowę. Bez monitoringu firma może przez wiele tygodni pracować na zdegradowanym połączeniu.

PoE

W sieciach z telefonami VoIP, kamerami, punktami WiFi i urządzeniami IoT bardzo istotny jest monitoring PoE. Warto obserwować:

Pobór mocy na portach
Całkowity budżet PoE
Przeciążenia
Automatyczne odcinanie urządzeń

Jeżeli switch posiada budżet 370 W i urządzenia pobierają 360 W, podłączenie kolejnego access pointa może spowodować problemy.

Temperatura i zasilacze

Urządzenia sieciowe pracujące w źle wentylowanej szafie mogą się przegrzewać. Dlatego warto monitorować temperaturę, pracę wentylatorów, stan zasilaczy, redundantne PSU oraz alarmy hardware. Jeżeli temperatura rośnie przez kilka tygodni wraz z nadejściem lata, można zareagować przed pierwszym restartem urządzenia.

Co monitorować na łączach internetowych?

To jeden z najważniejszych obszarów. Firma może posiadać doskonale działającą infrastrukturę lokalną, ale jeśli łącze operatora działa niestabilnie, użytkownicy będą postrzegać cały system IT jako awaryjny.

Dostępność

Nie wystarczy pingować tylko routera operatora. Dobrze jest sprawdzać kilka punktów: gateway operatora, niezależny adres w Internecie, DNS oraz ważną usługę chmurową. Dzięki temu można rozróżnić awarię lokalnego routera, problem z operatorem, problem routingu i problem konkretnej usługi.

Latency

Opóźnienie powinno być monitorowane jako trend. Jeżeli przez wiele miesięcy średni ping wynosi około 10 ms, a nagle rośnie do 70 ms, warto to zbadać nawet wtedy, gdy Internet formalnie nadal działa. Wysokie latency wpływa szczególnie na VoIP, Teams, RDP, VPN, aplikacje chmurowe i systemy ERP dostępne zdalnie.

Packet loss

Utrata pakietów jest jednym z najbardziej dokuczliwych problemów sieciowych. Nawet niewielka może powodować przerywanie rozmów, problemy z VPN, wolne aplikacje, zerwane sesje i retransmisje TCP. Co ważne, użytkownik często opisuje to po prostu jako "Internet jest wolny".

Jitter

Jitter oznacza zmienność opóźnienia i jest szczególnie istotny dla VoIP, wideokonferencji i komunikacji czasu rzeczywistego. Łącze może mieć średnie latency 20 ms, ale jeśli kolejne pakiety docierają po 10, 80, 15 i 100 ms, jakość rozmowy może być bardzo słaba.

Wykorzystanie pasma

Warto monitorować średnie wykorzystanie, maksymalne wartości, godziny szczytu i kierunek ruchu. Szczególnie istotny bywa upload.

Firma może posiadać 1 Gbps download i tylko 100 Mbps upload. Jeżeli w tym samym czasie działa backup do chmury, VPN, Teams i synchronizacja danych, to właśnie upload może być źródłem problemów.

Monitoring SLA operatora

Dane historyczne pozwalają również ocenić jakość operatora. Można raportować dostępność miesięczną, liczbę awarii, czas niedostępności, latency i packet loss. Jeżeli operator deklaruje określone SLA, mamy dane pozwalające zweryfikować jego realizację.

Łącze zapasowe, którego nikt nie sprawdza

To bardzo częsty problem. Firma posiada światłowód główny oraz zapasowe LTE lub drugiego operatora. Wszyscy zakładają, że w razie awarii nastąpi automatyczne przełączenie. Tylko że ostatni test był trzy lata temu.

W międzyczasie karta SIM wygasła, zmieniła się konfiguracja, router LTE przestał działać albo antena uległa uszkodzeniu.

Łącze zapasowe powinno być monitorowane tak samo jak główne. Dodatkowo warto okresowo wykonywać kontrolowany test failover.

WiFi również jest częścią sieci

Choć głównym tematem są routery, switche i WAN, w większości współczesnych firm nie można ignorować WiFi. Warto monitorować:

Dostępność access pointów
Liczbę klientów
Wykorzystanie kanałów
Poziom sygnału
Retransmisje
Interferencje
Wykorzystanie pasma radiowego
Przeciążone access pointy

Problem "Internet działa wolno" bardzo często okazuje się problemem WiFi, a nie samego Internetu.

SNMP, API i flow

Do monitorowania urządzeń sieciowych wykorzystuje się kilka źródeł danych.

SNMP

Pozwala pobierać między innymi ruch interfejsów, błędy, CPU, RAM, temperaturę i stan zasilaczy. Warto korzystać z SNMPv3, jeżeli urządzenia je obsługują.

API

Nowoczesne urządzenia coraz częściej udostępniają API pozwalające pobierać bardziej szczegółowe informacje niż klasyczne SNMP.

NetFlow, sFlow i IPFIX

Pozwalają odpowiedzieć na pytanie: kto właściwie wykorzystuje nasze łącze? Dzięki analizie flow można zobaczyć:

Źródła ruchu
Cele
Protokoły
Aplikacje
Największych użytkowników pasma

To bardzo przydatne podczas analizy przeciążenia łącza lub podejrzanej aktywności.

Monitoring konfiguracji

Dostępność urządzenia to tylko część obrazu. Ważne jest również wykrywanie zmian konfiguracji. Jeżeli ktoś otworzy port na firewallu, zmieni regułę NAT, zmieni VLAN, doda użytkownika VPN lub zmodyfikuje routing, warto posiadać historię tej zmiany.

To pomaga zarówno przy bezpieczeństwie, jak i diagnostyce awarii.

Bardzo wiele problemów zaczyna się od zdania "nic nie zmienialiśmy". Historia konfiguracji często pokazuje coś innego.

Jak ustawić alerty, żeby monitoring był użyteczny?

Największym zagrożeniem dla systemu monitoringu jest nie brak alertów. Jest nim ich nadmiar. Jeżeli administrator otrzymuje 300 komunikatów dziennie, po kilku tygodniach przestaje je czytać. Dlatego alerty powinny mieć priorytety.

P1

Natychmiastowa reakcja

brak głównego routera, awaria obu łączy, niedostępność core switcha, utrata tunelu do krytycznej lokalizacji.

P2

Wymaga szybkiej analizy

awaria jednego operatora przy działającym backupie, wysokie packet loss, awaria jednego członka LACP, wysoka temperatura urządzenia.

P3

Wymaga zaplanowania

port regularnie osiąga 80% przepustowości, maleje ilość wolnej pamięci, rośnie liczba błędów interfejsu, zbliża się limit PoE.

Dobry monitoring nie powinien generować większej liczby wiadomości. Powinien generować lepsze informacje.

Dashboard dla administratora

Po otwarciu dashboardu administrator powinien od razu zobaczyć:

Które urządzenia są niedostępne
Które łącza mają problemy
Gdzie występuje packet loss
Które porty są przeciążone
Czy występują błędy interfejsów
Czy tunel VPN działa
Czy aktywne jest łącze zapasowe
Czy urządzenia nie przegrzewają się

Dopiero dalej powinny znajdować się szczegółowe wykresy i dane historyczne. Dashboard ma pomagać podejmować decyzje, a nie wyglądać efektownie na telewizorze w dziale IT.

Najczęstsze błędy w monitoringu sieci

Podczas audytów najczęściej spotykamy kilka problemów.

Monitorowany jest tylko ping

Urządzenie odpowiada, więc wszystko jest zielone. Nikt nie obserwuje wydajności ani błędów.

Brak historii

Administrator widzi stan bieżący, ale nie może sprawdzić, co działo się wczoraj o 14:37.

Za dużo alertów

Każdy interfejs i każde drobne zdarzenie generuje e-mail. W efekcie ważne alarmy giną w szumie.

Brak monitoringu zapasowych łączy

O ich awarii firma dowiaduje się dopiero podczas awarii łącza głównego.

Brak monitoringu PoE i temperatury

Problemy pojawiają się dopiero po wyłączeniu urządzeń.

Brak kontroli konfiguracji

Nie wiadomo, kiedy i dlaczego pojawiła się zmiana.

Monitoring w tej samej lokalizacji

Po awarii całej serwerowni przestaje działać również monitoring.

W przypadku krytycznych systemów warto posiadać przynajmniej część monitoringu niezależną od monitorowanego środowiska.

Jak wygląda monitoring sieci w PRO-Admin?

Nie wdrażamy monitoringu po to, żeby mieć więcej wykresów. Najpierw ustalamy:

Które urządzenia są krytyczne
Które łącza mają znaczenie biznesowe
Jakie usługi zależą od sieci
Jakie są połączenia pomiędzy lokalizacjami
Gdzie istnieje redundancja
Jakie problemy występowały wcześniej

Dopiero później dobieramy metryki i progi alarmowe. Monitorujemy między innymi routery MikroTik, switche, firewalle, VPN, WAN, zapasowe łącza, interfejsy, PoE, temperaturę, wykorzystanie pasma, packet loss, latency oraz usługi zależne od sieci.

Monitoring może być następnie powiązany z systemem zgłoszeń i eskalacją. Dzięki temu awaria routera o 4:00 rano nie jest tylko czerwoną kropką na dashboardzie - jest zdarzeniem, które trafia do konkretnej osoby zgodnie z ustaloną procedurą.

Jeżeli Twoja sieć opiera się na MikroTik, warto też sprawdzić artykuł o najczęstszych błędach konfiguracji MikroTik, które regularnie znajdujemy podczas audytów.

FAQ - monitoring sieci

Czy ping wystarczy do monitorowania sieci?

Nie. Ping pozwala sprawdzić podstawową dostępność urządzenia, ale nie pokazuje przeciążenia CPU, błędów portów, packet loss, temperatury, wykorzystania pasma ani problemów z PoE.

Jak monitorować router MikroTik?

Najczęściej wykorzystujemy SNMP, API, syslog oraz dane o interfejsach, CPU, pamięci, temperaturze, routingu, VPN i liczbie połączeń. Zakres zależy od roli urządzenia.

Czy warto monitorować każde gniazdo switcha?

Nie zawsze. W przypadku dużych środowisk warto szczegółowo monitorować porty krytyczne, uplinki, serwery, access pointy i urządzenia infrastrukturalne. Pozostałe można obserwować z mniej restrykcyjnymi alertami.

Czy można monitorować jakość Internetu?

Tak. Można mierzyć dostępność, latency, jitter, packet loss oraz wykorzystanie pasma. Warto wykonywać testy do kilku niezależnych punktów, żeby łatwiej określić źródło problemu.

Czy monitoring może wykryć awarię kabla?

Nie zawsze bezpośrednio, ale może wykryć objawy takie jak CRC errors, flapping portu, zmiana prędkości linku lub utrata pakietów.

Czy monitoring powinien działać 24/7?

Tak. Problemy z siecią nie występują wyłącznie w godzinach pracy. Sam monitoring może działać przez całą dobę, natomiast sposób reakcji na alerty powinien wynikać z ustalonego SLA.

Podsumowanie

Dobra sieć to nie taka, która po prostu działa dzisiaj. To sieć, o której stanie wiemy wystarczająco dużo, żeby przewidzieć problemy i szybko znaleźć ich przyczynę.

Dlatego monitoring powinien obejmować nie tylko dostępność urządzeń, ale również:

CPU i pamięć
Porty
Błędy transmisji
Wykorzystanie pasma
VPN
Routing
PoE
Temperaturę
Latency
Jitter
Packet loss
Łącza zapasowe
Zmiany konfiguracji

Największą wartością nie jest jednak sam wykres. Jest nią odpowiedź na pytanie:

Dlaczego sieć działa źle i co trzeba zrobić, żeby problem się nie powtórzył?

Użytkownicy regularnie zgłaszają, że "Internet działa wolno"?

Nie musisz czekać na kolejną awarię, żeby rozpocząć diagnostykę. W PRO-Admin możemy przeanalizować obecną sieć, uruchomić monitoring routerów, switchy i łączy oraz przygotować dashboard i alerty dopasowane do rzeczywistych potrzeb firmy. Jeżeli problem już występuje, możemy również przeprowadzić analizę sieci i wskazać, czy źródłem jest operator, router, switch, WiFi, konfiguracja czy przeciążenie infrastruktury.

Wdrożenie monitoringu IT
Kontakt

Porozmawiajmy o Twoim IT

Odpiszemy najszybciej jak to możliwe. Bezpłatna konsultacja i wycena.

Obsługujemy firmy w Szczecinie, Stargardzie i okolicach oraz realizujemy usługi zdalnie na terenie całej Polski.

Dane kontaktowe

+48 91 885 43 40
biuro@pro-admin.pl
ul. Lutniana 39/3, 71-425 Szczecin

Godziny kontaktu

Pn–Pt 8:00–17:00
Sob–Ndz Zamknięte
Monitoring & alerty 24/7

Dziękujemy za kontakt!

Wiadomość została wysłana. Odpiszemy najszybciej jak to możliwe.

Ta strona używa narzędzi Microsoft Clarity (mapy cieplne, nagrania sesji) oraz Google Analytics (statystyki ruchu) do anonimowej analizy odwiedzin. Nie korzystamy z reklam ani profilowania.