Przejdź do treści
Technologie

Analiza dużych zbiorów danych w R

Szkolenie z analizy dużych zbiorów danych w języku R, obejmujące optymalizację pamięci, przetwarzanie równoległe oraz integrację z bazami danych i Apache Spark. Program koncentruje się na praktycznym wykorzystaniu pakietów data.table, dplyr, future, foreach i sparklyr do efektywnej pracy z danymi przekraczającymi możliwości standardowych narzędzi. Uczestnicy poznają techniki chunked processing, profilowania pamięci i optymalizacji zapytań.

Dlaczego warto wybrać to szkolenie?

Współczesna analiza danych coraz częściej wymaga pracy ze zbiorami, które przekraczają możliwości standardowych narzędzi R. Dwudniowe szkolenie przygotowuje analityków i Data Scientists do efektywnego przetwarzania dużych wolumenów danych — od optymalizacji struktur danych przez data.table i dplyr, przez przetwarzanie równoległe z pakietami future i foreach, aż po integrację z bazami danych (DBI, dbplyr) i przetwarzanie rozproszone w Apache Spark via sparklyr. Program kładzie nacisk na praktyczne techniki zarządzania pamięcią, chunked processing i wybór odpowiednich formatów danych.

Po ukończeniu szkolenia uczestnicy będą potrafili: efektywnie przetwarzać duże zbiory danych z wykorzystaniem data.table i dplyr, implementować przetwarzanie równoległe z pakietami future i foreach, optymalizować zużycie pamięci RAM i stosować techniki chunked processing, integrować R z bazami danych przez DBI i dbplyr. Te kompetencje bezpośrednio przekładają się na wyższą efektywność w realizacji projektów IT.

Szkolenie jest szczególnie wartościowe dla: analityków danych pracujących z dużymi zbiorami danych, Data Scientists wykorzystujących R w codziennej pracy, statystyków i badaczy przetwarzających duże wolumeny danych.

Co wyróżnia nasze podejście?

W EITT wierzymy, że najlepsza nauka odbywa się przez praktykę. W ciągu 2 dni intensywnego szkolenia uczestnicy pracują na realnych przykładach i scenariuszach, co gwarantuje nie tylko zrozumienie teorii, ale przede wszystkim umiejętność jej praktycznego zastosowania.

Z ponad 2500 szkoleń w ofercie i oceną 4.8/5 od uczestników, EITT jest zaufanym partnerem w rozwoju kompetencji dla organizacji każdej wielkości. Nasi trenerzy to praktycy z wieloletnim doświadczeniem, którzy dzielą się aktualną wiedzą i sprawdzonymi rozwiązaniami.

Szukasz szkolenia dopasowanego do potrzeb Twojego zespołu? Skontaktuj się z nami — przygotujemy program dostosowany do Twoich wymagań.

Korzyści

  • Uczestnik będzie potrafił efektywnie przetwarzać duże zbiory danych w R z wykorzystaniem data.table i dplyr
  • Zdobędzie umiejętność implementacji przetwarzania równoległego z pakietami future i foreach
  • Nauczy się optymalizować zużycie pamięci RAM i stosować techniki chunked processing
  • Pozna metody integracji R z bazami danych przez DBI i dbplyr
  • Będzie umiał konfigurować i wykorzystywać Apache Spark przez sparklyr do przetwarzania rozproszonego
  • Rozwinie umiejętności profilowania wydajności kodu R i identyfikacji wąskich gardeł
  • Opanuje techniki pracy z formatami danych optymalnymi dla dużych zbiorów (Arrow, fst, Parquet)

Dla kogo jest to szkolenie?

Analitycy danych pracujący z dużymi zbiorami danych
Data Scientists wykorzystujący R w codziennej pracy
Statystycy i badacze przetwarzający duże wolumeny danych
Programiści R chcący optymalizować wydajność analiz
Specjaliści ds. Business Intelligence
Analitycy finansowi pracujący z danymi rynkowymi
Inżynierowie danych odpowiedzialni za pipeline'y analityczne

Wymagania wstępne

  • Znajomość języka R na poziomie średniozaawansowanym
  • Podstawowa znajomość tidyverse (dplyr, tidyr)
  • Doświadczenie w analizie danych tabelarycznych
  • Podstawowa znajomość SQL

Program szkolenia

01

Wydajne struktury danych w R

  • Pakiet data.table — składnia, indeksowanie i operacje grupowe
  • Porównanie data.table vs dplyr pod kątem wydajności
  • Zaawansowane operacje dplyr na dużych zbiorach
  • Profilowanie pamięci i zarządzanie obiektami w R
02

Przetwarzanie równoległe

  • Framework future — planowanie i wykonywanie zadań równoległych
  • Pakiet foreach z backendami doParallel i doFuture
  • Strategie dzielenia danych na chunki
  • Monitorowanie postępu i obsługa błędów w przetwarzaniu równoległym
03

Optymalizacja pamięci i chunked processing

  • Techniki redukcji zużycia pamięci RAM
  • Przetwarzanie danych w porcjach (chunked processing)
  • Lazy evaluation i opóźnione obliczenia
  • Formaty danych oszczędzające pamięć (fst, qs, Arrow)
04

Integracja z bazami danych

  • Pakiet DBI — połączenia z PostgreSQL, MySQL, SQLite
  • dbplyr — translacja kodu dplyr na SQL
  • Optymalizacja zapytań i pobierania danych
  • Praca z danymi bezpośrednio w bazie bez ładowania do pamięci
05

Apache Spark via sparklyr

  • Konfiguracja i połączenie z klastrem Spark
  • Przetwarzanie rozproszone z interfejsem dplyr
  • Spark SQL i operacje na dużych tabelach
  • Integracja sparklyr z pipeline'ami analitycznymi

Formy realizacji

Online

  • Wygoda uczestnictwa z dowolnego miejsca
  • Interaktywne sesje na żywo z trenerem
  • Materiały dostępne przez 30 dni
  • Brak kosztów dojazdu

Stacjonarnie

  • Bezpośredni kontakt z trenerem i grupą
  • Intensywne warsztaty praktyczne
  • Networking z innymi uczestnikami
  • Pełne skupienie na nauce

Najczęściej zadawane pytania

Jakie są wymagania wstępne do udziału w szkoleniu Analiza dużych zbiorów danych w R?

Do udziału w szkoleniu wymagana jest znajomość języka R na poziomie średniozaawansowanym, podstawowa znajomość tidyverse (dplyr, tidyr), doświadczenie w analizie danych tabelarycznych oraz podstawowa znajomość SQL.

W jakim formacie i jak długo trwa szkolenie?

Szkolenie trwa 2 dni i dostępne jest w formie online oraz onsite (stacjonarnej).

Dla kogo przeznaczone jest to szkolenie?

Szkolenie dedykowane jest dla analityków danych, Data Scientists, statystyków i programistów R, którzy pracują z dużymi zbiorami danych i chcą poznać techniki optymalizacji wydajności analiz.

Anna Polak
Anna Polak Opiekun szkolenia

Poproś o ofertę

Możliwości dofinansowania

Sprawdź możliwości dofinansowania dla Twojej firmy

Zaufali nam

Szkolimy zespoły największych polskich firm

ING Bank - klient EITT
mBank - klient EITT
PKO Bank Polski - klient EITT
PZU - klient EITT
Allianz - klient EITT
T-Mobile - klient EITT
KGHM - klient EITT
PGE - klient EITT
IKEA - klient EITT
InPost - klient EITT
Leroy Merlin - klient EITT
ZUS - klient EITT

Zainteresowany tym szkoleniem?

Skontaktuj się z nami - przygotujemy ofertę dopasowaną do potrzeb Twojego zespołu.

500+ ekspertów
2500+ szkoleń w ofercie
ISO 9001 certyfikat jakości
Zapytaj o szkolenie
Zadzwoń do nas +48 22 487 84 90