Unlock Full Resume Report

New offer - be the first one to apply!

September 1, 2026

Mid Data Engineer (AWS)

Mid • Remote

Warsaw, MZ, Poland

Opis projektu

  • Rozwój platformy Data Lake/Lakehouse w AWS opartej o skalowalne przetwarzanie danych.
  • Budowa frameworku przetwarzania danych oraz wysokowydajnych pipeline’ów ETL/ELT.
  • Wykorzystanie architektury medalionowej oraz formatów Apache Iceberg i Parquet.
  • Rozwój produktu z naciskiem na wydajność, niezawodność i jakość danych.
  • Standaryzacja Data Governance i automatyzacja działań generujących koszty operacyjne.

Twoje zadania

  • Projektowanie i rozwój pipeline’ów w Pythonie, PySpark i MWAA (Airflow).
  • Implementacja rozwiązań opartych o S3, Glue, EMR, Athena, Lambda, MSK (Kafka) i Kinesis Data Streams.
  • Optymalizacja przetwarzania, storage’u i kosztów platformy AWS Data Lake.
  • Rozwój infrastruktury z wykorzystaniem Terraform, GitHub i Jenkins.
  • Implementacja mechanizmów Data Quality / Data Governance oraz współpraca przy budowie produktu.
  • Debugowanie pipeline’ów przed wzrostem kosztów AWS.

Wymagania

  • Kilka lat doświadczenia w inżynierii danych.
  • Bardzo dobra znajomość Python, PySpark oraz procesów ETL/ELT.
  • Praktyczne doświadczenie z Data Lake/Lakehouse, Apache Iceberg, Parquet i architekturą medalionową lub równoważną, wraz ze zrozumieniem procesu przetwarzania danych od źródła do konsumenta.
  • Dobra znajomość usług AWS: S3, Glue, EMR, Athena, MWAA (Airflow), Lambda, MSK (Kafka), Kinesis Data Streams.
  • Doświadczenie z Terraform, GitHub oraz Jenkins.
  • Świadomość wpływu projektowania pipeline’ów na wydajność i budżet.

Mile widziane

  • Doświadczenie z Data Governance, Data Quality, Great Expectations (GX) i DataHub.
  • Umiejętność współpracy z zespołami analitycznymi przy rozwoju produktów data.
  • Dobra znajomość języka angielskiego.
  • Podejście do optymalizacji kosztów poprzez eliminowanie konieczności wielokrotnego uruchamiania pipeline’ów.

Similar jobs you might like