Analiza dużych zbiorów danych w Python
Szkolenie z analizy dużych zbiorów danych w Pythonie, obejmujące optymalizację pandas, przetwarzanie rozproszone z Dask i PySpark oraz nowoczesne biblioteki Polars i Vaex. Program koncentruje się na praktycznych technikach profilowania pamięci, chunked processing, pracy z formatami Parquet i Arrow oraz integracji z bazami danych. Uczestnicy poznają strategie doboru narzędzi w zależności od skali i charakteru danych.
Dlaczego warto wybrać to szkolenie?
Standardowe narzędzia analizy danych w Pythonie szybko napotykają ograniczenia przy pracy z dużymi zbiorami — pandas zwalnia, pamięć RAM się wyczerpuje, a przetwarzanie trwa godzinami zamiast minut. Dwudniowe szkolenie przygotowuje analityków i inżynierów danych do efektywnej pracy z dużymi wolumenami danych, od optymalizacji pandas przez nowoczesne biblioteki Polars i Vaex, po przetwarzanie rozproszone z Dask i PySpark. Program obejmuje również formaty kolumnowe Parquet i Arrow, profilowanie pamięci oraz strategie doboru narzędzi w zależności od skali danych.
Po ukończeniu szkolenia uczestnicy będą potrafili: optymalizować pandas pod kątem wydajności i zużycia pamięci, przetwarzać rozproszone zbiory danych z wykorzystaniem Dask, korzystać z biblioteki Polars jako wydajnej alternatywy dla pandas, pracować z formatami kolumnowymi Parquet i Arrow. Te kompetencje bezpośrednio przekładają się na wyższą efektywność w realizacji projektów IT.
Szkolenie jest szczególnie wartościowe dla: analityków danych pracujących z dużymi zbiorami w Pythonie, Data Scientists poszukujących wydajniejszych narzędzi do przetwarzania danych, inżynierów danych budujących pipeline’y analityczne.
Co wyróżnia nasze podejście?
W EITT wierzymy, że najlepsza nauka odbywa się przez praktykę. W ciągu 2 dni intensywnego szkolenia uczestnicy pracują na realnych przykładach i scenariuszach, co gwarantuje nie tylko zrozumienie teorii, ale przede wszystkim umiejętność jej praktycznego zastosowania.
Z ponad 2500 szkoleń w ofercie i oceną 4.8/5 od uczestników, EITT jest zaufanym partnerem w rozwoju kompetencji dla organizacji każdej wielkości. Nasi trenerzy to praktycy z wieloletnim doświadczeniem, którzy dzielą się aktualną wiedzą i sprawdzonymi rozwiązaniami.
Szukasz szkolenia dopasowanego do potrzeb Twojego zespołu? Skontaktuj się z nami — przygotujemy program dostosowany do Twoich wymagań.
Korzyści
- Uczestnik będzie potrafił optymalizować pandas pod kątem wydajności i zużycia pamięci
- Zdobędzie umiejętność przetwarzania rozproszonych zbiorów danych z wykorzystaniem Dask
- Nauczy się korzystać z biblioteki Polars jako wydajnej alternatywy dla pandas
- Pozna techniki przetwarzania danych na dużą skalę z PySpark
- Będzie umiał pracować z formatami kolumnowymi Parquet i Arrow
- Rozwinie umiejętności profilowania pamięci i identyfikacji wąskich gardeł wydajnościowych
- Opanuje techniki chunked processing i przetwarzania out-of-core
- Nauczy się dobierać odpowiednie narzędzie w zależności od skali i charakteru danych
Dla kogo jest to szkolenie?
Wymagania wstępne
- Znajomość Pythona na poziomie średniozaawansowanym
- Podstawowa znajomość biblioteki pandas
- Doświadczenie w analizie danych tabelarycznych
- Podstawowa znajomość SQL
Program szkolenia
Optymalizacja pandas
- Profilowanie pamięci i identyfikacja wąskich gardeł
- Optymalizacja typów danych (category, int8/16/32, nullable dtypes)
- Wektoryzacja operacji i unikanie pętli
- Chunked reading z read_csv i read_parquet
Dask i przetwarzanie rozproszone
- Architektura Dask — DataFrame, Array, Bag
- Lazy evaluation i graf obliczeń
- Konfiguracja schedulera lokalnego i rozproszonego
- Diagnostyka i dashboard Dask
Polars i Vaex
- Polars — architektura Rust, lazy i eager mode
- Wyrażenia Polars vs składnia pandas
- Vaex — przetwarzanie out-of-core na dużych zbiorach
- Porównanie wydajności Polars vs pandas vs Dask
PySpark i formaty danych
- PySpark DataFrame API — operacje na dużych tabelach
- Formaty kolumnowe Parquet i Arrow (PyArrow)
- Konwersja między pandas, Polars i Spark DataFrame
- Optymalizacja partycjonowania i kompresji danych
Integracja z bazami danych i pipeline'y
- SQLAlchemy i connectorpy do baz relacyjnych
- Chunked processing z bazami danych
- Budowanie pipeline'ów ETL z wykorzystaniem poznanych narzędzi
- Strategie doboru narzędzia w zależności od skali danych
Formy realizacji
Online
- Wygoda uczestnictwa z dowolnego miejsca
- Interaktywne sesje na żywo z trenerem
- Materiały dostępne przez 30 dni
- Brak kosztów dojazdu
Stacjonarnie
- Bezpośredni kontakt z trenerem i grupą
- Intensywne warsztaty praktyczne
- Networking z innymi uczestnikami
- Pełne skupienie na nauce
Najczęściej zadawane pytania
Jakie są wymagania wstępne do udziału w szkoleniu Analiza dużych zbiorów danych w Python?
Do udziału w szkoleniu wymagana jest znajomość Pythona na poziomie średniozaawansowanym, podstawowa znajomość biblioteki pandas, doświadczenie w analizie danych tabelarycznych oraz podstawowa znajomość SQL.
W jakim formacie i jak długo trwa szkolenie?
Szkolenie trwa 2 dni i dostępne jest w formie online oraz onsite (stacjonarnej).
Dla kogo przeznaczone jest to szkolenie?
Szkolenie dedykowane jest dla analityków danych, Data Scientists, inżynierów danych i programistów Python, którzy pracują z dużymi zbiorami danych i chcą poznać wydajniejsze narzędzia przetwarzania.
Poproś o ofertę
Możliwości dofinansowania
Sprawdź możliwości dofinansowania dla Twojej firmy
Baza Usług Rozwojowych
Dofinansowanie do 80% dla MŚP ze środków EFS
Sprawdź dostępnośćKrajowy Fundusz Szkoleniowy
Dofinansowanie do 100% dla pracodawców
Dowiedz się więcejZaufali nam
Szkolimy zespoły największych polskich firm
Zainteresowany tym szkoleniem?
Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.