Site Reliability Engineering (SRE): zasady i praktyki
Trzydniowe szkolenie z Site Reliability Engineering — filozofia SRE, SLI/SLO/SLA i budżety błędów, monitoring i observability, zarządzanie incydentami, automatyzacja operacji i redukcja toil, architektura odporna na awarie, testowanie chaos, postmortem i analiza przyczyn, budowanie kultury SRE.
SRE to nie „ops z lepszą nazwą” — to inżynieria, która mierzy niezawodność (SLI/SLO), zarządza budżetami błędów i systematycznie eliminuje pracę manualną
DevOps zmienił kulturę — SRE daje inżynierom konkretne narzędzia do zarządzania niezawodnością. Budżet błędów definiuje, ile niedostępności może mieć usługa. SLI/SLO mierzą, czy dotrzymujesz obietnic. Postmortem uczy zespół bez obwiniania. Toil reduction automatyzuje powtarzalną pracę. To nie filozofia — to inżynieria z metrykami.
Site Reliability Engineering (SRE): zasady i praktyki to trzydniowe szkolenie EITT, realizowane w formie stacjonarnej lub zdalnej. Program bazuje na praktykach Google SRE i łączy teorię z warsztatami: symulacje incydentów, pisanie postmortems, projektowanie monitoringu, eksperymenty chaos engineering.
Dla kogo jest to szkolenie?
Dla inżynierów oprogramowania, DevOps i administratorów systemów. Szczególnie gdy:
- Przechodzisz do roli SRE lub platform engineer i potrzebujesz systematycznej wiedzy o zasadach i praktykach niezawodności
- Zarządzasz systemami produkcyjnymi i chcesz wdrożyć SLI/SLO, budżety błędów i blameless postmortems w swoim zespole
- Budujesz kulturę niezawodności w organizacji i szukasz frameworku, który działa nie tylko w big tech
Trzy dni: od SLI/SLO po chaos engineering
Dzień 1: Fundamenty — filozofia SRE, SLI/SLO/SLA, budżety błędów, monitoring i observability (metryki, logi, traces), alerting, ćwiczenia.
Dzień 2: Operacje — zarządzanie incydentami, postmortem (blameless), automatyzacja i redukcja toil, zarządzanie zmianą (canary, blue-green), capacity planning, symulacja incydentu.
Dzień 3: Architektura i kultura — wzorce odporności (circuit breaker, bulkhead), chaos engineering, skalowanie, zarządzanie ryzykiem, budowanie kultury SRE, roadmapa wdrożenia.
Z ponad 2500 szkoleń w ofercie i oceną 4.8/5, EITT jest zaufanym partnerem w rozwoju kompetencji. Skontaktuj się z nami — organizujemy szkolenia SRE zamknięte dla zespołów inżynierskich.
Korzyści
- Definiować SLI, SLO i SLA dla usług oraz zarządzać budżetami błędów
- Projektować systemy monitoringu i alertingu oparte na trzech filarach observability (metryki, logi, traces)
- Prowadzić proces zarządzania incydentami i pisać blameless postmortems z action items
- Identyfikować toil i planować automatyzację operacji w celu redukcji pracy manualnej
- Stosować wzorce architektury odpornej na awarie (circuit breaker, bulkhead, graceful degradation)
- Projektować eksperymenty chaos engineering i budować kulturę SRE w organizacji
Dla kogo jest to szkolenie?
Wymagania wstępne
- Doświadczenie w rozwoju oprogramowania lub administracji systemami
- Znajomość systemów Linux/Unix i narzędzi linii komend
- Podstawowe doświadczenie z platformami chmurowymi i konteneryzacją
- Orientacja w narzędziach monitorowania i systemach logowania
Program szkolenia
Dzień 1: Fundamenty SRE — zasady, SLI/SLO i monitoring
- Filozofia i zasady SRE — geneza SRE w Google, różnica między SRE a DevOps, rola inżyniera SRE, organizacja zespołu SRE w firmie
- Mierzenie niezawodności — SLI (Service Level Indicators), SLO (Service Level Objectives), SLA (Service Level Agreements), dobór wskaźników do typu usługi
- Budżety błędów (Error Budgets) — definiowanie, monitorowanie, konsekwencje wyczerpania budżetu, balansowanie niezawodności z szybkością rozwoju
- Monitoring i observability — trzy filary observability (metryki, logi, traces), narzędzia (Prometheus, Grafana, ELK, Jaeger), projektowanie dashboardów
- Alerting — zasady skutecznego alertingu, redukcja szumu, eskalacja, on-call rotations, zarządzanie zmęczeniem alertami
- Ćwiczenia: definiowanie SLI/SLO dla usługi, projektowanie dashboardu monitoringu, konfiguracja alertów
Dzień 2: Zarządzanie incydentami i automatyzacja
- Zarządzanie incydentami — proces reakcji na incydent, role (Incident Commander, Communications Lead), komunikacja w trakcie incydentu
- Postmortem i analiza przyczyn — pisanie postmortem bez obwiniania (blameless), identyfikacja przyczyn źródłowych, action items, kultura uczenia się
- Automatyzacja operacji — identyfikacja toil (praca powtarzalna, manualna), strategie redukcji toil, automatyzacja deploymentów i operacji
- Zarządzanie zmianą — continuous delivery w kontekście SRE, canary releases, blue-green deployments, feature flags, rollback
- Capacity planning — prognozowanie pojemności, testy obciążeniowe, planowanie wzrostu, zarządzanie kosztami infrastruktury
- Ćwiczenia: symulacja incydentu (tabletop exercise), pisanie postmortem, identyfikacja i priorytetyzacja toil
Dzień 3: Architektura odporna na awarie i kultura SRE
- Architektura odporna na awarie — wzorce (circuit breaker, bulkhead, retry with backoff), redundancja, graceful degradation, failover
- Testowanie chaos — zasady chaos engineering, narzędzia (Chaos Monkey, Litmus), projektowanie eksperymentów, game days
- Strategie skalowania — skalowanie horyzontalne i wertykalne, sharding, caching, CDN, optymalizacja latencji
- Zarządzanie ryzykiem — identyfikacja ryzyk technicznych, matryca ryzyka, risk acceptance, priorytety inżynierskie
- Budowanie kultury SRE — wdrażanie praktyk SRE w organizacji, współpraca z zespołami deweloperskimi, dokumentacja i baza wiedzy
- Continuous Improvement — retrospektywy, metryki dojrzałości SRE, roadmapa wdrożenia SRE, indywidualny plan działania
Formy realizacji
Online
- Wygoda uczestnictwa z dowolnego miejsca
- Interaktywne sesje na żywo z trenerem
- Materiały dostępne przez 30 dni
- Brak kosztów dojazdu
Stacjonarnie
- Bezpośredni kontakt z trenerem i grupą
- Intensywne warsztaty praktyczne
- Networking z innymi uczestnikami
- Pełne skupienie na nauce
Najczęściej zadawane pytania
Czy szkolenie jest oparte na praktykach Google SRE?
Tak — program bazuje na zasadach opisanych w Google SRE Book i SRE Workbook, ale uwzględnia również praktyki z innych organizacji (Netflix, Meta, Spotify). Treści są dostosowane do różnych skal organizacji — nie tylko big tech.
Czy to szkolenie dla DevOps czy SRE?
Oba podejścia się uzupełniają. Szkolenie wyjaśnia różnicę (DevOps = kultura i praktyki, SRE = konkretna implementacja niezawodności) i uczy technik specyficznych dla SRE: budżety błędów, SLI/SLO, postmortem, toil reduction.
Czy potrzebuję doświadczenia z Kubernetes?
Podstawowe doświadczenie z platformami chmurowymi i konteneryzacją jest zalecane. Szkolenie nie jest kursem Kubernetes — omawia praktyki SRE, które są niezależne od platformy, ale przykłady często dotyczą środowisk chmurowych.
W jakim formacie i jak długo trwa szkolenie?
Szkolenie trwa 3 dni (9:00-16:00), dostępne online i stacjonarnie. Warsztaty techniczne, symulacje incydentów (tabletop exercises) i studia przypadków.
Czy po szkoleniu otrzymam certyfikat?
Tak, każdy uczestnik otrzymuje imienny certyfikat ukończenia szkolenia wydany przez EITT.
Poproś o ofertę
Możliwości dofinansowania
Sprawdź możliwości dofinansowania dla Twojej firmy
Baza Usług Rozwojowych
Dofinansowanie do 80% dla MŚP ze środków EFS
Sprawdź dostępnośćKrajowy Fundusz Szkoleniowy
Dofinansowanie do 100% dla pracodawców
Dowiedz się więcejZaufali nam
Szkolimy zespoły największych polskich firm
Zainteresowany tym szkoleniem?
Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.