Unlock Full Resume Report

New offer - be the first one to apply!

September 1, 2026

Spark Data Lakehouse Developer

Senior • On-site

291,200 - 332,800 PLN/yr

Wroclaw, DS, Poland

Informacje organizacyjne

  • Budżet: do 160 PLN/h netto + VAT.
  • Tryb pracy: zdalnie, z wymaganą obecnością w biurze we Wrocławiu 1 dzień w miesiącu.
  • Projekt ma charakter długofalowy. Mile widziany start ASAP; akceptowane są standardowe okresy wypowiedzenia.
  • Sektor: bankowość / sektor finansowy.

Projekt i Twoja rola

Dołączysz do zespołu Data Platform w stabilnej instytucji z sektora finansowego. Będziesz odpowiadać za projektowanie i implementację rozwiązań rekoncyliacji danych w warstwie ODS (MongoDB) oraz budowę i skalowanie nowoczesnego środowiska Data Lakehouse. Rola łączy zaawansowany development w ekosystemie Spark, pracę z dużymi wolumenami danych oraz dbałość o ich najwyższą jakość.

Proces rekrutacji

Krótki screening, a następnie merytoryczna rozmowa techniczna z managerami po stronie klienta.

Główne obowiązki

  • Projektowanie i implementacja procesów Spark SQL / PySpark do porównywania danych w warstwie ODS (MongoDB) z systemami źródłowymi.
  • Kompleksowa budowa, wersjonowanie i utrzymanie warstw danych w architekturze Data Lakehouse: raw → bronze → silver → gold, z wykorzystaniem Apache Iceberg, Delta Lake lub Hudi.
  • Integracja środowiska Spark z MongoDB z użyciem dedykowanego konektora, w tym optymalizacja odczytów i zapisów, schema inference oraz partitioning.
  • Wdrażanie reguł Data Quality, wykrywanie duplikatów, braków i anomalii oraz generowanie alertów jakościowych.
  • Tuning wydajności procesów Spark, w tym caching, broadcast joins i Adaptive Query Execution, oraz optymalizacja kosztów zapytań analitycznych.
  • Automatyzacja deploymentów z użyciem Docker, Kubernetes, Spark Operator i Jenkins oraz rozwój i konfiguracja monitoringu aplikacji w Prometheus i Grafana.
  • Praca w metodyce Agile (Scrum/Kanban) oraz mentoring Data Engineerów i analityków.

Oczekiwania

  • Minimum 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z Apache Spark, w tym PySpark, Spark SQL, DataFrames i Structured Streaming.
  • Doświadczenie w pracy z MongoDB: odczyt i zapis danych, modelowanie dokumentowe oraz indeksowanie.
  • Praktyczna znajomość architektury Data Lakehouse, w tym zarządzania tabelami wersjonowanymi w Apache Iceberg, lub gotowość do szybkiego przeniesienia kompetencji z Delta Lake / Hudi.
  • Biegłość w Pythonie i SQL.
  • Sprawne poruszanie się w środowisku CI/CD, w tym automatyzacja z Jenkins, oraz biegła obsługa Jira i Confluence.
  • Znajomość narzędzi do monitoringu, metryk i logów: Prometheus i Grafana.

Oferujemy

  • Długofalowy projekt technologiczny w branży finansowej.
  • Pakiet benefitów: karta Multisport i prywatna opieka medyczna.
  • Możliwość pracy z nowoczesnym stosem technologicznym wokół ekosystemu Data Lakehouse.

Similar jobs you might like