Przejdź do treści
Technologie

Analiza dużych zbiorów danych w Python

Szkolenie z analizy dużych zbiorów danych w Pythonie, obejmujące optymalizację pandas, przetwarzanie rozproszone z Dask i PySpark oraz nowoczesne biblioteki Polars i Vaex. Program koncentruje się na praktycznych technikach profilowania pamięci, chunked processing, pracy z formatami Parquet i Arrow oraz integracji z bazami danych. Uczestnicy poznają strategie doboru narzędzi w zależności od skali i charakteru danych.

Dlaczego warto wybrać to szkolenie?

Standardowe narzędzia analizy danych w Pythonie szybko napotykają ograniczenia przy pracy z dużymi zbiorami — pandas zwalnia, pamięć RAM się wyczerpuje, a przetwarzanie trwa godzinami zamiast minut. Dwudniowe szkolenie przygotowuje analityków i inżynierów danych do efektywnej pracy z dużymi wolumenami danych, od optymalizacji pandas przez nowoczesne biblioteki Polars i Vaex, po przetwarzanie rozproszone z Dask i PySpark. Program obejmuje również formaty kolumnowe Parquet i Arrow, profilowanie pamięci oraz strategie doboru narzędzi w zależności od skali danych.

Po ukończeniu szkolenia uczestnicy będą potrafili: optymalizować pandas pod kątem wydajności i zużycia pamięci, przetwarzać rozproszone zbiory danych z wykorzystaniem Dask, korzystać z biblioteki Polars jako wydajnej alternatywy dla pandas, pracować z formatami kolumnowymi Parquet i Arrow. Te kompetencje bezpośrednio przekładają się na wyższą efektywność w realizacji projektów IT.

Szkolenie jest szczególnie wartościowe dla: analityków danych pracujących z dużymi zbiorami w Pythonie, Data Scientists poszukujących wydajniejszych narzędzi do przetwarzania danych, inżynierów danych budujących pipeline’y analityczne.

Co wyróżnia nasze podejście?

W EITT wierzymy, że najlepsza nauka odbywa się przez praktykę. W ciągu 2 dni intensywnego szkolenia uczestnicy pracują na realnych przykładach i scenariuszach, co gwarantuje nie tylko zrozumienie teorii, ale przede wszystkim umiejętność jej praktycznego zastosowania.

Z ponad 2500 szkoleń w ofercie i oceną 4.8/5 od uczestników, EITT jest zaufanym partnerem w rozwoju kompetencji dla organizacji każdej wielkości. Nasi trenerzy to praktycy z wieloletnim doświadczeniem, którzy dzielą się aktualną wiedzą i sprawdzonymi rozwiązaniami.

Szukasz szkolenia dopasowanego do potrzeb Twojego zespołu? Skontaktuj się z nami — przygotujemy program dostosowany do Twoich wymagań.

Korzyści

  • Uczestnik będzie potrafił optymalizować pandas pod kątem wydajności i zużycia pamięci
  • Zdobędzie umiejętność przetwarzania rozproszonych zbiorów danych z wykorzystaniem Dask
  • Nauczy się korzystać z biblioteki Polars jako wydajnej alternatywy dla pandas
  • Pozna techniki przetwarzania danych na dużą skalę z PySpark
  • Będzie umiał pracować z formatami kolumnowymi Parquet i Arrow
  • Rozwinie umiejętności profilowania pamięci i identyfikacji wąskich gardeł wydajnościowych
  • Opanuje techniki chunked processing i przetwarzania out-of-core
  • Nauczy się dobierać odpowiednie narzędzie w zależności od skali i charakteru danych

Dla kogo jest to szkolenie?

Analitycy danych pracujący z dużymi zbiorami w Pythonie
Data Scientists poszukujący wydajniejszych narzędzi do przetwarzania danych
Inżynierowie danych budujący pipeline'y analityczne
Programiści Python chcący optymalizować przetwarzanie danych
Specjaliści ds. Business Intelligence
Analitycy finansowi przetwarzający duże wolumeny danych rynkowych
Badacze i naukowcy pracujący z dużymi zbiorami eksperymentalnymi

Wymagania wstępne

  • Znajomość Pythona na poziomie średniozaawansowanym
  • Podstawowa znajomość biblioteki pandas
  • Doświadczenie w analizie danych tabelarycznych
  • Podstawowa znajomość SQL

Program szkolenia

01

Optymalizacja pandas

  • Profilowanie pamięci i identyfikacja wąskich gardeł
  • Optymalizacja typów danych (category, int8/16/32, nullable dtypes)
  • Wektoryzacja operacji i unikanie pętli
  • Chunked reading z read_csv i read_parquet
02

Dask i przetwarzanie rozproszone

  • Architektura Dask — DataFrame, Array, Bag
  • Lazy evaluation i graf obliczeń
  • Konfiguracja schedulera lokalnego i rozproszonego
  • Diagnostyka i dashboard Dask
03

Polars i Vaex

  • Polars — architektura Rust, lazy i eager mode
  • Wyrażenia Polars vs składnia pandas
  • Vaex — przetwarzanie out-of-core na dużych zbiorach
  • Porównanie wydajności Polars vs pandas vs Dask
04

PySpark i formaty danych

  • PySpark DataFrame API — operacje na dużych tabelach
  • Formaty kolumnowe Parquet i Arrow (PyArrow)
  • Konwersja między pandas, Polars i Spark DataFrame
  • Optymalizacja partycjonowania i kompresji danych
05

Integracja z bazami danych i pipeline'y

  • SQLAlchemy i connectorpy do baz relacyjnych
  • Chunked processing z bazami danych
  • Budowanie pipeline'ów ETL z wykorzystaniem poznanych narzędzi
  • Strategie doboru narzędzia w zależności od skali danych

Formy realizacji

Online

  • Wygoda uczestnictwa z dowolnego miejsca
  • Interaktywne sesje na żywo z trenerem
  • Materiały dostępne przez 30 dni
  • Brak kosztów dojazdu

Stacjonarnie

  • Bezpośredni kontakt z trenerem i grupą
  • Intensywne warsztaty praktyczne
  • Networking z innymi uczestnikami
  • Pełne skupienie na nauce

Najczęściej zadawane pytania

Jakie są wymagania wstępne do udziału w szkoleniu Analiza dużych zbiorów danych w Python?

Do udziału w szkoleniu wymagana jest znajomość Pythona na poziomie średniozaawansowanym, podstawowa znajomość biblioteki pandas, doświadczenie w analizie danych tabelarycznych oraz podstawowa znajomość SQL.

W jakim formacie i jak długo trwa szkolenie?

Szkolenie trwa 2 dni i dostępne jest w formie online oraz onsite (stacjonarnej).

Dla kogo przeznaczone jest to szkolenie?

Szkolenie dedykowane jest dla analityków danych, Data Scientists, inżynierów danych i programistów Python, którzy pracują z dużymi zbiorami danych i chcą poznać wydajniejsze narzędzia przetwarzania.

Anna Polak
Anna Polak Opiekun szkolenia

Poproś o ofertę

Możliwości dofinansowania

Sprawdź możliwości dofinansowania dla Twojej firmy

Zaufali nam

Szkolimy zespoły największych polskich firm

ING Bank - klient EITT
mBank - klient EITT
PKO Bank Polski - klient EITT
PZU - klient EITT
Allianz - klient EITT
T-Mobile - klient EITT
KGHM - klient EITT
PGE - klient EITT
IKEA - klient EITT
InPost - klient EITT
Leroy Merlin - klient EITT
ZUS - klient EITT

Zainteresowany tym szkoleniem?

Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.

500+ ekspertów
2500+ szkoleń w ofercie
ISO 9001 certyfikat jakości
Zapytaj o szkolenie
Zadzwoń do nas +48 22 487 84 90