Data Engineer (Spark/Data Lakehouse)
Indexed description
O kliencie
Nasz Klient to jeden z wiodących banków uniwersalnych w Polsce, należący do międzynarodowej grupy finansowej. Organizacja oferuje kompleksowe usługi bankowe dla klientów indywidualnych oraz biznesowych, rozwijając nowoczesne rozwiązania w obszarze bankowości codziennej, finansowania i systemów płatniczych.
O roli projektowej
Rola obejmuje projektowanie i rozwój procesów rekoncyliacji oraz synchronizacji danych w środowisku Spark/PySpark i MongoDB. Osoba na tym stanowisku będzie również budować i utrzymywać warstwy danych w architekturze Data Lakehouse (Delta Lake / Apache Iceberg / Hudi) – od danych surowych po warstwy prezentacyjne.
Model współpracy
Zdalny, z wizytami 1 dzień w miesiącu w biurze Klienta we Wrocławiu.
Realizację projektu ułatwi Ci
- Minimum 4 lata doświadczenia w pracy z rozwiązaniami data engineeringowymi w środowiskach produkcyjnych.
- Bardzo dobra znajomość Python, Apache Spark, PySpark, Spark SQL i DataFrames.
- Doświadczenie ze Structured Streaming.
- Praktyczna znajomość MongoDB oraz integracji ze Spark poprzez MongoDB Spark Connector.
- Doświadczenie w modelowaniu danych dokumentowych oraz optymalizacji odczytu i indeksowania w MongoDB.
- Praktyczne doświadczenie z Apache Iceberg, w tym wersjonowaniem tabel i operacjami merge/upsert.
- Doświadczenie z Jenkins i procesami CI/CD (spark-unit, integration)
- Znajomość Prometheus i Grafana.
- Doświadczenie w pracy w Agile/Scrum lub Kanban oraz z Jira/Confluence.
Twój wkład do projektu
- Projektowanie i implementacja procesów przetwarzania danych w PySpark i Spark SQL.
- Rekoncyliacja danych pomiędzy ODS (MongoDB) a systemami źródłowymi.
- Tworzenie reguł jakości danych oraz wykrywanie duplikatów, braków i anomalii.
- Integracja Apache Spark z MongoDB przy użyciu MongoDB Spark Connector.
- Projektowanie i rozwój warstw Raw/Bronze → Silver → Gold w architekturze Data Lakehouse.
- Praca z Apache Iceberg, w tym wersjonowanie tabel oraz operacje upsert/merge.
- Optymalizacja wydajności i kosztów przetwarzania danych w Spark.
- Rozwój procesów batchowych i streamingowych oraz ich monitorowanie.
- Automatyzacja deploymentu aplikacji Spark z wykorzystaniem Jenkins, Docker i Kubernetes.
- Konfiguracja monitoringu i alertów z wykorzystaniem Prometheus i Grafana.
- Diagnozowanie problemów związanych z jakością, spójnością i opóźnieniami danych.
- Code review, prowadzenie warsztatów oraz tworzenie dokumentacji technicznej.
- Współpraca z Data Engineerami, analitykami, testerami i zespołem DevOps w metodykach Scrum/Kanban.
Tak o Ciebie zadbamy
Dołączając do Edge One Solutions, otrzymujesz pełne wsparcie w rozwoju zawodowym i osobistym, co daje Ci realną szansę na budowanie kariery zgodnie z własnymi celami.
- Zyskujesz indywidualne wsparcie Service Delivery Managera, który pomoże Ci zaplanować ścieżkę kariery i zadba o Twój komfort i satysfakcję z pracy w projekcie
- Szkolenia, certyfikaty i konferencje - dofinansowujemy lub w pełni pokrywamy koszty rozwoju kompetencji technicznych
- #SmartChange – umożliwiamy zmianę projektu i dobieramy kolejny zgodnie z Twoimi preferencjami
- Dbamy o Twój work-life balance, dlatego poza pracą oferujemy wyjścia integracyjne, aktywności sportowe i inspirujące webinary #edge1talks, które rozwijają i łączą ludzi.
- Aktywność fizyczna – wspieramy sportowe inicjatywy i wynajem sal treningowych
- Pakiet zdrowotny – prywatna opieka, karta sportowa, ubezpieczenie i wsparcie psychologiczne
Nie spełniasz wszystkich wymagań, a projekt Cię zainteresował? Nie wahaj się i aplikuj. Porozmawiajmy!
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search