Od monitoringu do observability w realnym środowisku
W klasycznym monitoringu często kończy się na pytaniu ,,czy działa?", a w observability chodzi o to, żeby dało się jeszcze odpowiedzieć ,,dlaczego przestało działać" i ,,co dokładnie się zmieniło". To subtelna różnica, ale w praktyce ratuje wdrożenia, dyżury i nerwy zespołu. W tej kategorii przewijają się tematy pracy na metrykach, budowania sensownych alertów oraz patrzenia na usługę jako całość: od aplikacji po infrastrukturę.
Prometheus, Zabbix i codzienna higiena alertów
Gdy potrzebujesz poukładać zbieranie metryk, reguły i zapytania, przydaje się perspektywa narzędziowa: w książce Prometheus w pełnej gotowości. Jak monitorować pracę infrastruktury i wydajność działania aplikacji. Wydanie II Julien Pivotto i Briana Brazil pokazują m.in. konfigurację serwera, Node Exportera, Alertmanagera, PromQL oraz współpracę z Grafaną i Kubernetesem. A kiedy w firmie trzeba ogarnąć monitoring ,,od sieci po aplikacje" w jednym miejscu, do głosu dochodzi podejście platformowe: Zabbix 7.0. Efektywny monitoring infrastruktury IT dla każdego Mateusza Dampca prowadzi przez komponenty Zabbiksa, przygotowanie środowiska i uruchomienie monitoringu tak, by szybciej wyłapywać problemy w serwerach, urządzeniach i aplikacjach. W praktyce te książki pomagają w typowych sytuacjach: ,,czemu baza nagle dostaje zadyszki", ,,dlaczego alerty spamują nocą" albo ,,czy to problem sieci, czy jednak kodu".
Jeśli bliższe Ci jest szukanie przyczyn, a nie tylko symptomów, to Observability. Widoczność w systemach IT Mateusza Gruzewskiego dobrze ustawia myślenie o widoczności systemów i o tym, jak składać sygnały w spójną diagnozę.
Ścieżki zawodowe: SRE, DevOps, admin i inżynier produktu
Monitoring i observability to kompetencje, które ,,przyklejają się" do wielu ról. Administrator wykorzysta je do kontroli zasobów i pojemności, DevOps do stabilnych wdrożeń i sensownych progów alarmowych, a SRE do budowania niezawodności i przewidywalności usług pod obciążeniem. Jest też perspektywa bliższa produktowi: lepsza widoczność działania systemu pomaga szybciej ocenić ryzyko zmian, a nawet zrozumieć koszty utrzymania infrastruktury (czasem zaskakująco duże, gdy metryki mówią prawdę).
A jeśli chcesz domknąć temat automatyzacją środowisk, zajrzyj też do podkategorii Ansible w dziale DevOps -- dobrze się to łączy z porządnym podejściem do telemetrii i utrzymania.

