Python Data Engineer
XTB
Rola dla doświadczonego inżyniera danych, który będzie projektował, budował i utrzymywał skalowalne potoki danych (ETL/ELT) z wykorzystaniem Spark (PySpark) na dużych zbiorach danych. Kandydat będzie modelował warstwy hurtowni danych, pisał czysty kod w Pythonie, optymalizował zadania Spark i współpracował z analitykami i naukowcami danych. Jest to rola dla silnego programisty Pythona z solidnym zapleczem programistycznym, który lubi budować niezawodne systemy danych.
Brakuje: szczegóły dotyczące konkretnych narzędzi do orkiestracji potoków danych., informacje o konkretnych projektach, nad którymi kandydat będzie pracował..
Rola dla doświadczonego inżyniera danych, który będzie projektował, budował i utrzymywał skalowalne potoki danych (ETL/ELT) z wykorzystaniem Spark (PySpark) na dużych zbiorach danych. Kandydat będzie modelował warstwy hurtowni danych, pisał czysty kod w Pythonie, optymalizował zadania Spark i współpracował z analitykami i naukowcami danych. Jest to rola dla silnego programisty Pythona z solidnym zapleczem programistycznym, który lubi budować niezawodne systemy danych.
- ✓Praca zdalna, możliwość pracy z biura w Warszawie lub z przestrzeni coworkingowej.
- ✓Budżet szkoleniowy na kursy i konferencje.
- ✓Dodatkowy dzień wolny na urodziny i dla rodziców.
- ✓Firma jest certyfikowana jako Great Place to Work.
- ✓Regularne wydarzenia integracyjne zespołu.
- !Nie sprecyzowano, jak wygląda współpraca z innymi zespołami (np. Data Science, Analityka) w praktyce.
- !Brak szczegółów dotyczących konkretnych narzędzi do orkiestracji potoków danych.
- •Projektowanie, budowanie i utrzymywanie wsadowych i przyrostowych potoków danych przy użyciu Spark (PySpark) na dużych zbiorach danych.
- •Modelowanie i rozwijanie warstw hurtowni danych (staging, dimensional, serving) przy użyciu zasad DWH (schematy gwiazdy/płatka śniegu, tabele faktów i wymiarów, powoli zmieniające się wymiary - SCD).
- •Rozwój i optymalizacja przepływów pracy ETL/ELT, zapewniając jakość, dokładność i terminowość danych.
- •Pisanie czystego, dobrze przetestowanego i łatwego w utrzymaniu kodu Python, stosując solidne praktyki inżynierii oprogramowania (kontrola wersji, przegląd kodu, projekt modułowy).
- •Dostrajanie zadań Spark pod kątem wydajności i kosztów (partycjonowanie, buforowanie, strategie łączenia, konfiguracja zasobów).
- •Budowanie i utrzymywanie przepływów pracy orkiestracji oraz monitorowanie stanu potoków.
- •Współpraca z interesariuszami w celu przekształcania wymagań biznesowych i analitycznych w niezawodne modele danych.
- •Współtworzenie decyzji dotyczących architektury danych, dokumentacji i standardów inżynierskich w zespole.
Oferta skierowana do developerów z doświadczeniem komercyjnym (Mid).
Kandydat z co najmniej 3 latami doświadczenia w inżynierii danych lub pokrewnej roli, posiadający solidne podstawy w SQL, Pythonie i podstawową wiedzę o hurtowniach danych. Powinien mieć doświadczenie z Apache Spark (PySpark) i rozumieć zasady ETL/ELT. Praca zdalna jest dla niego preferowana.
Nie dla osób z mniejszym doświadczeniem w inżynierii danych lub bez praktycznego doświadczenia z Apache Spark (PySpark). Rola wymaga zaawansowanej wiedzy z zakresu hurtowni danych i programowania w Pythonie.
- ?Jakie są główne wyzwania związane z jakością danych, z którymi zespół się mierzy?
- ?Jak wygląda proces przeglądu kodu i jakie są standardy kodowania?
- ?Czy zespół korzysta z jakichś narzędzi do monitorowania potoków danych?
- ?Jakie są plany rozwoju architektury danych w najbliższym czasie?
- ?Jak wygląda proces wdrażania nowych technologii lub narzędzi w zespole?
- −Szczegóły dotyczące konkretnych narzędzi do orkiestracji potoków danych.
- −Informacje o konkretnych projektach, nad którymi kandydat będzie pracował.
- −Więcej szczegółów na temat procesów CI/CD dla potoków danych.
Zespół aktywnie dzieli się wiedzą, oferuje wsparcie w rozwoju i regularnie organizuje wydarzenia integracyjne.
Na poziomie rynkowym
≈ 95,2–131,5 zł/h
Dane z aktywnych ofert zawierających technologię Python. Pełne statystyki zarobków →