Dołącz do Edge One Solutions jako Lead Site Reliability Engineer i wspieraj międzynarodową organizację w rozwoju zaawansowanej platformy chmurowej. W tej roli będziesz kluczową osobą odpowiedzialną za kształtowanie standardów niezawodności systemów oraz wdrażanie nowoczesnych praktyk SRE w środowisku Azure i Kubernetes.
Zakres obowiązków
- Rozwijanie praktyk SRE oraz definiowanie strategii niezawodności w organizacji.
- Wdrażanie SLI, SLO oraz error budgetów dla złożonych systemów.
- Projektowanie centralnych dashboardów monitorujących wydajność i dostępność platformy.
- Wspieranie procesów zarządzania incydentami, tworzenie procedur SOP oraz prowadzenie analiz RCA.
- Współpraca z zespołami Cloud Engineering i Development w celu eliminacji przyczyn źródłowych awarii.
Wymagania
- Minimum 3 lata doświadczenia w obszarze Site Reliability Engineering.
- Bardzo dobra znajomość Microsoft Azure (PaaS/IaaS) oraz środowisk Kubernetes.
- Praktyczna wiedza z zakresu systemów rozproszonych, mikroserwisów i architektury cloud native.
- Znajomość narzędzi takich jak Prometheus, Grafana, Elasticsearch oraz Elastic APM.
- Bardzo dobra znajomość języka angielskiego umożliwiająca współpracę z międzynarodowymi zespołami.
- Umiejętność prezentowania zagadnień technicznych kadrze zarządzającej i tworzenia uzasadnień biznesowych.
Co oferujemy
- Indywidualne wsparcie Service Delivery Managera w planowaniu ścieżki kariery.
- Dofinansowanie szkoleń, certyfikatów oraz udziału w konferencjach technicznych.
- Elastyczne benefity, pakiet zdrowotny, ubezpieczenie oraz wsparcie psychologiczne.
- Możliwość zmiany projektu zgodnie z własnymi preferencjami w ramach inicjatywy #SmartChange.