Data Engineer ze znajomością przetwarzania danych niestrukturalnych
PKO BP Finat
Rola w wewnętrznym zespole banku PKO BP, zajmującym się budową i utrzymaniem Data Lake. Głównym wyzwaniem jest przetwarzanie danych niestrukturalnych (audio, obrazy, dokumenty tekstowe) z wykorzystaniem technologii strumieniowych (Kafka/Pub/Sub) i chmury GCP (BigQuery, Data Proc, Data Flow). To typowa rola Data Engineera zorientowana na integrację danych, przetwarzanie strumieniowe i optymalizację baz danych. Bankowość zapewnia stabilność, ale może wiązać się z legacy systemami.
Brak jawnych widełek — wynagrodzenie do ustalenia podczas rekrutacji.
Brakuje: nie podano wielkości zespołu, brak opisu procesu rekrutacyjnego.
Rola w wewnętrznym zespole banku PKO BP, zajmującym się budową i utrzymaniem Data Lake. Głównym wyzwaniem jest przetwarzanie danych niestrukturalnych (audio, obrazy, dokumenty tekstowe) z wykorzystaniem technologii strumieniowych (Kafka/Pub/Sub) i chmury GCP (BigQuery, Data Proc, Data Flow). To typowa rola Data Engineera zorientowana na integrację danych, przetwarzanie strumieniowe i optymalizację baz danych. Bankowość zapewnia stabilność, ale może wiązać się z legacy systemami.
- ✓Praca w stabilnym, dużym banku PKO BP
- ✓Ciekawy obszar przetwarzania danych niestrukturalnych z wykorzystaniem GenAI
- ✓Elastyczność w ustaleniu trybu hybrydowego/zdalnego
- !Model hybrydowy z 'do ustalenia' – niejasna częstotliwość wizyt w biurze
- !Wąski zakres wymagań – dużo technologii, ale brak informacji o skali systemu i wielkości zespołu
- !Nieokreślony proces rekrutacyjny
- ?Brak jawnych widełek — wynagrodzenie do ustalenia podczas rekrutacji
- •Projektowanie i budowa rozwiązań Data Lake na GCP
- •Tworzenie pipeline'ów do przetwarzania danych niestrukturalnych (audio, obrazy, dokumenty)
- •Implementacja architektury sterowanej zdarzeniami z użyciem Kafki lub Pub/Sub
- •Optymalizacja i tuning zapytań w GCP BigQuery, Oracle, PostgreSQL
- •Programowanie w Pythonie i/lub Ruście do automatyzacji i przetwarzania danych
- •Integracja zewnętrznych narzędzi ETL (Informatica, Automate Now) i orkiestracja w Airflow
- •Współpraca przy wykorzystaniu GenAI do przetwarzania danych niestrukturalnych (np. transkrypcje, OCR)
- •Praca w systemie Linux na poziomie zaawansowanego użytkownika
Oferta skierowana do developerów z doświadczeniem komercyjnym (Mid).
Tester/QA lub administrator baz danych z 2-3 latami doświadczenia, który zna SQL i Linux, i jest w stanie szybko nauczyć się Pythona i data engineeringu na GCP.
Osoby szukające w pełni zdalnej pracy lub oczekujące wyłącznie pracy z nowoczesnym stackiem bez elementów legacy (Oracle, Informatica). Juniorzy bez doświadczenia w Data Lake i przetwarzaniu strumieniowym nie spełnią wymagań.
- ?Ile osób liczy zespół Data Engineering i ile osób pracuje nad danymi niestrukturalnymi?
- ?Jakie konkretnie przypadki użycia GenAI są planowane (np. OCR, transkrypcje, analiza obrazów)?
- ?Czy istnieje już infrastruktura GCP, czy będzie budowana od podstaw?
- ?Jaki jest zakres odpowiedzialności za legacy systemy (Oracle, Informatica)?
- ?Czy przewidziane są dyżury on-call lub praca w godzinach nadliczbowych?
- ?Jak wygląda proces rekrutacyjny – ile etapów, czy jest zadanie techniczne?
- ?Czy firma oferuje budżet szkoleniowy na certyfikacje GCP?
- −Nie podano wielkości zespołu
- −Brak opisu procesu rekrutacyjnego
- −Nie wiadomo, czy praca dotyczy konkretnego projektu czy wsparcia wielu zespołów
- −Brak informacji o on-call lub dyżurach
Prawdopodobnie dojrzały zespół IT w banku, z naciskiem na stabilność i jakość, ale z otwartością na nowe technologie (GenAI).