Przejdź do treści
Technologie

Przygotowanie i kontrola jakości danych w Python

Praktyczne szkolenie z przygotowania i kontroli jakości danych w Python z wykorzystaniem pandas, Great Expectations, scikit-learn imputers, ydata-profiling i Pydantic. Uczestnicy poznają techniki data wrangling, walidacji schematów danych, obsługi braków, profilowania zbiorów danych oraz budowania pipeline ETL z wersjonowaniem danych (DVC).

Dlaczego warto wybrać to szkolenie?

Jakość danych wejściowych determinuje jakość każdej analizy i każdego modelu ML — a w praktyce analitycy i data scientists spędzają większość czasu na czyszczeniu i walidacji danych. Python z ekosystemem pandas, Great Expectations i scikit-learn oferuje potężne narzędzia do systematycznego zarządzania jakością danych na każdym etapie pipeline.

Podczas szkolenia uczestnicy poznają kompletny workflow — od data wrangling z pandas, przez walidację z Great Expectations i Pydantic, obsługę braków danych z scikit-learn imputers, profilowanie z ydata-profiling, po budowanie reprodukowalnych pipeline ETL z wersjonowaniem danych (DVC).

Po ukończeniu szkolenia uczestnicy będą potrafili: efektywnie przetwarzać i transformować dane z wykorzystaniem pandas, definiować i automatyzować reguły walidacji z Great Expectations, stosować Pydantic do walidacji schematów danych w pipeline, analizować wzorce braków danych i stosować scikit-learn imputers. Te kompetencje bezpośrednio przekładają się na wyższą efektywność w realizacji projektów IT.

Szkolenie jest szczególnie wartościowe dla: analityków danych odpowiedzialnych za jakość danych w organizacji, data scientists pracujących z nieoczyszczonymi zbiorami danych, data engineers budujących pipeline ETL w Python.

Co wyróżnia nasze podejście?

W EITT wierzymy, że najlepsza nauka odbywa się przez praktykę. W ciągu 2 dni intensywnego szkolenia uczestnicy pracują na realnych przykładach i scenariuszach, co gwarantuje nie tylko zrozumienie teorii, ale przede wszystkim umiejętność jej praktycznego zastosowania.

Z ponad 2500 szkoleń w ofercie i oceną 4.8/5 od uczestników, EITT jest zaufanym partnerem w rozwoju kompetencji dla organizacji każdej wielkości. Nasi trenerzy to praktycy z wieloletnim doświadczeniem, którzy dzielą się aktualną wiedzą i sprawdzonymi rozwiązaniami.

Szukasz szkolenia dopasowanego do potrzeb Twojego zespołu? Skontaktuj się z nami — przygotujemy program dostosowany do Twoich wymagań.

Korzyści

  • Efektywnie przetwarzać i transformować dane z wykorzystaniem pandas
  • Definiować i automatyzować reguły walidacji z Great Expectations
  • Stosować Pydantic do walidacji schematów danych w pipeline
  • Analizować wzorce braków danych i stosować scikit-learn imputers
  • Tworzyć automatyczne raporty profilowania z ydata-profiling
  • Wykrywać outlierów i anomalie metodami statystycznymi i ML
  • Projektować reprodukowalne pipeline ETL z wersjonowaniem danych (DVC)
  • Integrować kontrolę jakości danych z istniejącymi workflow analitycznymi

Dla kogo jest to szkolenie?

Analitycy danych odpowiedzialni za jakość danych w organizacji
Data Scientists pracujący z nieoczyszczonymi zbiorami danych
Data Engineers budujący pipeline ETL w Python
Programiści Python rozszerzający kompetencje o data engineering
Business Intelligence specjaliści
ML Engineers dbający o jakość danych wejściowych do modeli
Menedżerowie danych i osoby odpowiedzialne za data governance

Wymagania wstępne

  • Podstawowa znajomość Python (zmienne, funkcje, klasy, moduły)
  • Doświadczenie w pracy z pandas (DataFrame, Series)
  • Podstawowa znajomość numpy i matplotlib (zalecana)
  • Własny laptop z zainstalowanym Python 3.10+ i środowiskiem wirtualnym

Program szkolenia

01

Data wrangling z pandas

  • Wczytywanie danych z różnych źródeł (CSV, Excel, SQL, API)
  • Filtrowanie, grupowanie i agregacja z pandas
  • Praca z danymi tekstowymi (str accessor, regex)
  • Obsługa dat i stref czasowych
  • Łączenie i scalanie zbiorów danych (merge, join, concat)
02

Walidacja danych z Great Expectations i Pydantic

  • Great Expectations — definiowanie expectations i suites
  • Automatyczne generowanie profili walidacji
  • Data Docs — interaktywne raporty walidacji
  • Pydantic — walidacja schematów danych w pipeline
  • Integracja walidacji z workflow przetwarzania
03

Obsługa braków danych i imputacja

  • Analiza wzorców braków danych (missingno, seaborn)
  • Mechanizmy powstawania braków (MCAR, MAR, MNAR)
  • scikit-learn imputers (SimpleImputer, KNNImputer, IterativeImputer)
  • Strategie imputacji dla różnych typów danych
  • Ocena jakości imputacji i walidacja wyników
04

Profilowanie danych i wykrywanie anomalii

  • ydata-profiling — automatyczne raporty profilowania
  • Wykrywanie outlierów (IQR, Z-score, Isolation Forest)
  • Analiza rozkładów i korelacji
  • Wykrywanie duplikatów i niespójności
  • Wizualizacja jakości danych z matplotlib i seaborn
05

Pipeline ETL i wersjonowanie danych

  • Projektowanie pipeline ETL w Python (Prefect, Luigi)
  • DVC — wersjonowanie danych i reprodukowalność
  • Logowanie transformacji i audyt zmian
  • Testowanie pipeline z pytest
  • Najlepsze praktyki organizacji projektów data quality

Formy realizacji

Online

  • Wygoda uczestnictwa z dowolnego miejsca
  • Interaktywne sesje na żywo z trenerem
  • Materiały dostępne przez 30 dni
  • Brak kosztów dojazdu

Stacjonarnie

  • Bezpośredni kontakt z trenerem i grupą
  • Intensywne warsztaty praktyczne
  • Networking z innymi uczestnikami
  • Pełne skupienie na nauce

Najczęściej zadawane pytania

Jakie wymagania wstępne muszę spełnić przed szkoleniem?

Wymagana jest podstawowa znajomość Python (zmienne, funkcje, klasy) oraz doświadczenie w pracy z pandas (DataFrame, Series). Znajomość numpy i matplotlib jest zalecana, ale nie obowiązkowa — kluczowe elementy zostaną przypomniane podczas szkolenia.

W jakim formacie odbywa się szkolenie i ile trwa?

Szkolenie trwa 2 dni i jest dostępne w formacie online (na żywo) oraz stacjonarnym. Program opiera się na praktycznych ćwiczeniach — uczestnicy pracują na rzeczywistych, nieuporządkowanych zbiorach danych. Każdy uczestnik otrzymuje materiały szkoleniowe i certyfikat ukończenia.

Dla kogo przeznaczone jest to szkolenie?

Szkolenie skierowane jest do analityków danych odpowiedzialnych za jakość danych, data scientists pracujących z nieoczyszczonymi zbiorami, data engineers budujących pipeline ETL w Python oraz ML engineers dbających o jakość danych wejściowych do modeli.

Anna Polak
Anna Polak Opiekun szkolenia

Poproś o ofertę

Możliwości dofinansowania

Sprawdź możliwości dofinansowania dla Twojej firmy

Zaufali nam

Szkolimy zespoły największych polskich firm

ING Bank - klient EITT
mBank - klient EITT
PKO Bank Polski - klient EITT
PZU - klient EITT
Allianz - klient EITT
T-Mobile - klient EITT
KGHM - klient EITT
PGE - klient EITT
IKEA - klient EITT
InPost - klient EITT
Leroy Merlin - klient EITT
ZUS - klient EITT

Zainteresowany tym szkoleniem?

Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.

500+ ekspertów
2500+ szkoleń w ofercie
ISO 9001 certyfikat jakości
Zapytaj o szkolenie
Zadzwoń do nas +48 22 487 84 90