Przejdź do treści
Technologie / Programowanie

Site Reliability Engineering (SRE): zasady i praktyki

Trzydniowe szkolenie z Site Reliability Engineering — filozofia SRE, SLI/SLO/SLA i budżety błędów, monitoring i observability, zarządzanie incydentami, automatyzacja operacji i redukcja toil, architektura odporna na awarie, testowanie chaos, postmortem i analiza przyczyn, budowanie kultury SRE.

SRE to nie „ops z lepszą nazwą” — to inżynieria, która mierzy niezawodność (SLI/SLO), zarządza budżetami błędów i systematycznie eliminuje pracę manualną

DevOps zmienił kulturę — SRE daje inżynierom konkretne narzędzia do zarządzania niezawodnością. Budżet błędów definiuje, ile niedostępności może mieć usługa. SLI/SLO mierzą, czy dotrzymujesz obietnic. Postmortem uczy zespół bez obwiniania. Toil reduction automatyzuje powtarzalną pracę. To nie filozofia — to inżynieria z metrykami.

Site Reliability Engineering (SRE): zasady i praktyki to trzydniowe szkolenie EITT, realizowane w formie stacjonarnej lub zdalnej. Program bazuje na praktykach Google SRE i łączy teorię z warsztatami: symulacje incydentów, pisanie postmortems, projektowanie monitoringu, eksperymenty chaos engineering.

Dla kogo jest to szkolenie?

Dla inżynierów oprogramowania, DevOps i administratorów systemów. Szczególnie gdy:

  • Przechodzisz do roli SRE lub platform engineer i potrzebujesz systematycznej wiedzy o zasadach i praktykach niezawodności
  • Zarządzasz systemami produkcyjnymi i chcesz wdrożyć SLI/SLO, budżety błędów i blameless postmortems w swoim zespole
  • Budujesz kulturę niezawodności w organizacji i szukasz frameworku, który działa nie tylko w big tech

Trzy dni: od SLI/SLO po chaos engineering

Dzień 1: Fundamenty — filozofia SRE, SLI/SLO/SLA, budżety błędów, monitoring i observability (metryki, logi, traces), alerting, ćwiczenia.

Dzień 2: Operacje — zarządzanie incydentami, postmortem (blameless), automatyzacja i redukcja toil, zarządzanie zmianą (canary, blue-green), capacity planning, symulacja incydentu.

Dzień 3: Architektura i kultura — wzorce odporności (circuit breaker, bulkhead), chaos engineering, skalowanie, zarządzanie ryzykiem, budowanie kultury SRE, roadmapa wdrożenia.

Z ponad 2500 szkoleń w ofercie i oceną 4.8/5, EITT jest zaufanym partnerem w rozwoju kompetencji. Skontaktuj się z nami — organizujemy szkolenia SRE zamknięte dla zespołów inżynierskich.

Korzyści

  • Definiować SLI, SLO i SLA dla usług oraz zarządzać budżetami błędów
  • Projektować systemy monitoringu i alertingu oparte na trzech filarach observability (metryki, logi, traces)
  • Prowadzić proces zarządzania incydentami i pisać blameless postmortems z action items
  • Identyfikować toil i planować automatyzację operacji w celu redukcji pracy manualnej
  • Stosować wzorce architektury odpornej na awarie (circuit breaker, bulkhead, graceful degradation)
  • Projektować eksperymenty chaos engineering i budować kulturę SRE w organizacji

Dla kogo jest to szkolenie?

Inżynierowie oprogramowania przechodzący do ról SRE i platform engineering
Inżynierowie DevOps chcący poszerzyć kompetencje o praktyki niezawodności
Administratorzy systemów odpowiedzialni za dostępność systemów produkcyjnych
Inżynierowie platform budujący wewnętrzne platformy deweloperskie
Liderzy techniczni implementujący kulturę SRE w organizacji
Architekci projektujący odporne i skalowalne architektury systemów

Wymagania wstępne

  • Doświadczenie w rozwoju oprogramowania lub administracji systemami
  • Znajomość systemów Linux/Unix i narzędzi linii komend
  • Podstawowe doświadczenie z platformami chmurowymi i konteneryzacją
  • Orientacja w narzędziach monitorowania i systemach logowania

Program szkolenia

01

Dzień 1: Fundamenty SRE — zasady, SLI/SLO i monitoring

  • Filozofia i zasady SRE — geneza SRE w Google, różnica między SRE a DevOps, rola inżyniera SRE, organizacja zespołu SRE w firmie
  • Mierzenie niezawodności — SLI (Service Level Indicators), SLO (Service Level Objectives), SLA (Service Level Agreements), dobór wskaźników do typu usługi
  • Budżety błędów (Error Budgets) — definiowanie, monitorowanie, konsekwencje wyczerpania budżetu, balansowanie niezawodności z szybkością rozwoju
  • Monitoring i observability — trzy filary observability (metryki, logi, traces), narzędzia (Prometheus, Grafana, ELK, Jaeger), projektowanie dashboardów
  • Alerting — zasady skutecznego alertingu, redukcja szumu, eskalacja, on-call rotations, zarządzanie zmęczeniem alertami
  • Ćwiczenia: definiowanie SLI/SLO dla usługi, projektowanie dashboardu monitoringu, konfiguracja alertów
02

Dzień 2: Zarządzanie incydentami i automatyzacja

  • Zarządzanie incydentami — proces reakcji na incydent, role (Incident Commander, Communications Lead), komunikacja w trakcie incydentu
  • Postmortem i analiza przyczyn — pisanie postmortem bez obwiniania (blameless), identyfikacja przyczyn źródłowych, action items, kultura uczenia się
  • Automatyzacja operacji — identyfikacja toil (praca powtarzalna, manualna), strategie redukcji toil, automatyzacja deploymentów i operacji
  • Zarządzanie zmianą — continuous delivery w kontekście SRE, canary releases, blue-green deployments, feature flags, rollback
  • Capacity planning — prognozowanie pojemności, testy obciążeniowe, planowanie wzrostu, zarządzanie kosztami infrastruktury
  • Ćwiczenia: symulacja incydentu (tabletop exercise), pisanie postmortem, identyfikacja i priorytetyzacja toil
03

Dzień 3: Architektura odporna na awarie i kultura SRE

  • Architektura odporna na awarie — wzorce (circuit breaker, bulkhead, retry with backoff), redundancja, graceful degradation, failover
  • Testowanie chaos — zasady chaos engineering, narzędzia (Chaos Monkey, Litmus), projektowanie eksperymentów, game days
  • Strategie skalowania — skalowanie horyzontalne i wertykalne, sharding, caching, CDN, optymalizacja latencji
  • Zarządzanie ryzykiem — identyfikacja ryzyk technicznych, matryca ryzyka, risk acceptance, priorytety inżynierskie
  • Budowanie kultury SRE — wdrażanie praktyk SRE w organizacji, współpraca z zespołami deweloperskimi, dokumentacja i baza wiedzy
  • Continuous Improvement — retrospektywy, metryki dojrzałości SRE, roadmapa wdrożenia SRE, indywidualny plan działania

Formy realizacji

Online

  • Wygoda uczestnictwa z dowolnego miejsca
  • Interaktywne sesje na żywo z trenerem
  • Materiały dostępne przez 30 dni
  • Brak kosztów dojazdu

Stacjonarnie

  • Bezpośredni kontakt z trenerem i grupą
  • Intensywne warsztaty praktyczne
  • Networking z innymi uczestnikami
  • Pełne skupienie na nauce

Najczęściej zadawane pytania

Czy szkolenie jest oparte na praktykach Google SRE?

Tak — program bazuje na zasadach opisanych w Google SRE Book i SRE Workbook, ale uwzględnia również praktyki z innych organizacji (Netflix, Meta, Spotify). Treści są dostosowane do różnych skal organizacji — nie tylko big tech.

Czy to szkolenie dla DevOps czy SRE?

Oba podejścia się uzupełniają. Szkolenie wyjaśnia różnicę (DevOps = kultura i praktyki, SRE = konkretna implementacja niezawodności) i uczy technik specyficznych dla SRE: budżety błędów, SLI/SLO, postmortem, toil reduction.

Czy potrzebuję doświadczenia z Kubernetes?

Podstawowe doświadczenie z platformami chmurowymi i konteneryzacją jest zalecane. Szkolenie nie jest kursem Kubernetes — omawia praktyki SRE, które są niezależne od platformy, ale przykłady często dotyczą środowisk chmurowych.

W jakim formacie i jak długo trwa szkolenie?

Szkolenie trwa 3 dni (9:00-16:00), dostępne online i stacjonarnie. Warsztaty techniczne, symulacje incydentów (tabletop exercises) i studia przypadków.

Czy po szkoleniu otrzymam certyfikat?

Tak, każdy uczestnik otrzymuje imienny certyfikat ukończenia szkolenia wydany przez EITT.

Monika Fengler
Monika Fengler Opiekun szkolenia

Poproś o ofertę

Możliwości dofinansowania

Sprawdź możliwości dofinansowania dla Twojej firmy

Zaufali nam

Szkolimy zespoły największych polskich firm

ING Bank - klient EITT
mBank - klient EITT
PKO Bank Polski - klient EITT
PZU - klient EITT
Allianz - klient EITT
T-Mobile - klient EITT
KGHM - klient EITT
PGE - klient EITT
IKEA - klient EITT
InPost - klient EITT
Leroy Merlin - klient EITT
ZUS - klient EITT

Zainteresowany tym szkoleniem?

Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.

500+ ekspertów
2500+ szkoleń w ofercie
ISO 9001 certyfikat jakości
Zapytaj o szkolenie
Zadzwoń do nas +48 22 487 84 90