Przygotowanie i kontrola jakości danych w Python
Praktyczne szkolenie z przygotowania i kontroli jakości danych w Python z wykorzystaniem pandas, Great Expectations, scikit-learn imputers, ydata-profiling i Pydantic. Uczestnicy poznają techniki data wrangling, walidacji schematów danych, obsługi braków, profilowania zbiorów danych oraz budowania pipeline ETL z wersjonowaniem danych (DVC).
Dlaczego warto wybrać to szkolenie?
Jakość danych wejściowych determinuje jakość każdej analizy i każdego modelu ML — a w praktyce analitycy i data scientists spędzają większość czasu na czyszczeniu i walidacji danych. Python z ekosystemem pandas, Great Expectations i scikit-learn oferuje potężne narzędzia do systematycznego zarządzania jakością danych na każdym etapie pipeline.
Podczas szkolenia uczestnicy poznają kompletny workflow — od data wrangling z pandas, przez walidację z Great Expectations i Pydantic, obsługę braków danych z scikit-learn imputers, profilowanie z ydata-profiling, po budowanie reprodukowalnych pipeline ETL z wersjonowaniem danych (DVC).
Po ukończeniu szkolenia uczestnicy będą potrafili: efektywnie przetwarzać i transformować dane z wykorzystaniem pandas, definiować i automatyzować reguły walidacji z Great Expectations, stosować Pydantic do walidacji schematów danych w pipeline, analizować wzorce braków danych i stosować scikit-learn imputers. Te kompetencje bezpośrednio przekładają się na wyższą efektywność w realizacji projektów IT.
Szkolenie jest szczególnie wartościowe dla: analityków danych odpowiedzialnych za jakość danych w organizacji, data scientists pracujących z nieoczyszczonymi zbiorami danych, data engineers budujących pipeline ETL w Python.
Co wyróżnia nasze podejście?
W EITT wierzymy, że najlepsza nauka odbywa się przez praktykę. W ciągu 2 dni intensywnego szkolenia uczestnicy pracują na realnych przykładach i scenariuszach, co gwarantuje nie tylko zrozumienie teorii, ale przede wszystkim umiejętność jej praktycznego zastosowania.
Z ponad 2500 szkoleń w ofercie i oceną 4.8/5 od uczestników, EITT jest zaufanym partnerem w rozwoju kompetencji dla organizacji każdej wielkości. Nasi trenerzy to praktycy z wieloletnim doświadczeniem, którzy dzielą się aktualną wiedzą i sprawdzonymi rozwiązaniami.
Szukasz szkolenia dopasowanego do potrzeb Twojego zespołu? Skontaktuj się z nami — przygotujemy program dostosowany do Twoich wymagań.
Korzyści
- Efektywnie przetwarzać i transformować dane z wykorzystaniem pandas
- Definiować i automatyzować reguły walidacji z Great Expectations
- Stosować Pydantic do walidacji schematów danych w pipeline
- Analizować wzorce braków danych i stosować scikit-learn imputers
- Tworzyć automatyczne raporty profilowania z ydata-profiling
- Wykrywać outlierów i anomalie metodami statystycznymi i ML
- Projektować reprodukowalne pipeline ETL z wersjonowaniem danych (DVC)
- Integrować kontrolę jakości danych z istniejącymi workflow analitycznymi
Dla kogo jest to szkolenie?
Wymagania wstępne
- Podstawowa znajomość Python (zmienne, funkcje, klasy, moduły)
- Doświadczenie w pracy z pandas (DataFrame, Series)
- Podstawowa znajomość numpy i matplotlib (zalecana)
- Własny laptop z zainstalowanym Python 3.10+ i środowiskiem wirtualnym
Program szkolenia
Data wrangling z pandas
- Wczytywanie danych z różnych źródeł (CSV, Excel, SQL, API)
- Filtrowanie, grupowanie i agregacja z pandas
- Praca z danymi tekstowymi (str accessor, regex)
- Obsługa dat i stref czasowych
- Łączenie i scalanie zbiorów danych (merge, join, concat)
Walidacja danych z Great Expectations i Pydantic
- Great Expectations — definiowanie expectations i suites
- Automatyczne generowanie profili walidacji
- Data Docs — interaktywne raporty walidacji
- Pydantic — walidacja schematów danych w pipeline
- Integracja walidacji z workflow przetwarzania
Obsługa braków danych i imputacja
- Analiza wzorców braków danych (missingno, seaborn)
- Mechanizmy powstawania braków (MCAR, MAR, MNAR)
- scikit-learn imputers (SimpleImputer, KNNImputer, IterativeImputer)
- Strategie imputacji dla różnych typów danych
- Ocena jakości imputacji i walidacja wyników
Profilowanie danych i wykrywanie anomalii
- ydata-profiling — automatyczne raporty profilowania
- Wykrywanie outlierów (IQR, Z-score, Isolation Forest)
- Analiza rozkładów i korelacji
- Wykrywanie duplikatów i niespójności
- Wizualizacja jakości danych z matplotlib i seaborn
Pipeline ETL i wersjonowanie danych
- Projektowanie pipeline ETL w Python (Prefect, Luigi)
- DVC — wersjonowanie danych i reprodukowalność
- Logowanie transformacji i audyt zmian
- Testowanie pipeline z pytest
- Najlepsze praktyki organizacji projektów data quality
Formy realizacji
Online
- Wygoda uczestnictwa z dowolnego miejsca
- Interaktywne sesje na żywo z trenerem
- Materiały dostępne przez 30 dni
- Brak kosztów dojazdu
Stacjonarnie
- Bezpośredni kontakt z trenerem i grupą
- Intensywne warsztaty praktyczne
- Networking z innymi uczestnikami
- Pełne skupienie na nauce
Najczęściej zadawane pytania
Jakie wymagania wstępne muszę spełnić przed szkoleniem?
Wymagana jest podstawowa znajomość Python (zmienne, funkcje, klasy) oraz doświadczenie w pracy z pandas (DataFrame, Series). Znajomość numpy i matplotlib jest zalecana, ale nie obowiązkowa — kluczowe elementy zostaną przypomniane podczas szkolenia.
W jakim formacie odbywa się szkolenie i ile trwa?
Szkolenie trwa 2 dni i jest dostępne w formacie online (na żywo) oraz stacjonarnym. Program opiera się na praktycznych ćwiczeniach — uczestnicy pracują na rzeczywistych, nieuporządkowanych zbiorach danych. Każdy uczestnik otrzymuje materiały szkoleniowe i certyfikat ukończenia.
Dla kogo przeznaczone jest to szkolenie?
Szkolenie skierowane jest do analityków danych odpowiedzialnych za jakość danych, data scientists pracujących z nieoczyszczonymi zbiorami, data engineers budujących pipeline ETL w Python oraz ML engineers dbających o jakość danych wejściowych do modeli.
Poproś o ofertę
Możliwości dofinansowania
Sprawdź możliwości dofinansowania dla Twojej firmy
Baza Usług Rozwojowych
Dofinansowanie do 80% dla MŚP ze środków EFS
Sprawdź dostępnośćKrajowy Fundusz Szkoleniowy
Dofinansowanie do 100% dla pracodawców
Dowiedz się więcejZaufali nam
Szkolimy zespoły największych polskich firm
Zainteresowany tym szkoleniem?
Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.