Brak wyników spełniających kryteria wyszukiwania.

Opis projektu:
Rozwijamy platformę Data Lake/Lakehouse w AWS opartą o skalowalne przetwarzanie danych.
Budujemy framework przetwarzania danych oraz wysokowydajne pipeline'y ETL/ELT.
Stosujemy architekturę medalionową, wykorzystując formaty Apache Iceberg i Parquet.
Rozwijamy produkt z naciskiem na wydajność, niezawodność i jakoś danych.
Standaryzujemy Data Governance i automatyzujemy wszystko, co generuje koszty operacyjne.
Twoje zadania:
Projektowanie i rozwój pipeline'ów w Python, PySpark i MWAA (Airflow).
Implementacja rozwiązań w oparciu o S3, Glue, EMR, Athena, Lambda, MSK (Kafka) i Kinesis Data Streams.
Optymalizacja przetwarzania, storage'u i kosztów platformy AWS Data Lake.
Rozwój infrastruktury z wykorzystaniem Terraform, GitHub i Jenkins.
Implementacja mechanizmów Data Quality / Data Governance oraz współpraca przy budowie produktu.
Debugowanie pipeline'ów, zanim zrobi to rachunek z AWS.
Wymagania:
Kilka lat doświadczenia w inżynierii danych.
Bardzo dobra znajomość: Python, PySpark oraz procesów ETL/ELT.
Praktyczne doświadczenie z Data Lake/Lakehouse, Apache Iceberg, Parquet i architekturą medalionową (lub inną nomenklaturą, ważne jest rozumienie całego procesu przetwarzania danych od źródła do konsumenta)
Dobra znajomość usług AWS: S3, Glue, EMR, Athena, MWAA (Airflow), Lambda, MSK (Kafka), Kinesis Data Streams.
Doświadczenie z Terraform, GitHub oraz Jenkins.
Świadomość, że źle zaprojektowany pipeline najpierw niszczy wydajność, a potem budżet.
Mile widziane:
Doświadczenie z Data Governance, Data Quality, Great Expectations (GX) i DataHub.
Umiejętność współpracy z zespołami analitycznymi przy rozwoju produktów data.
Dobra znajomość języka angielskiego.
Przekonanie, że najlepszą optymalizacją kosztów jest pipeline, którego nie trzeba uruchamiać kilka razy ;-)
Zainteresowany ofertą?
Aplikuj już teraz!