Firma Margo poszukuje doświadczonego inżyniera Linux/SRE do zespołu odpowiedzialnego za utrzymanie i rozwój zaawansowanej infrastruktury HPC oraz klastrów GPU wspierających projekty z obszaru sztucznej inteligencji. Jest to rola skoncentrowana na pracy z fizycznymi serwerami, sieciami Data Center oraz optymalizacji stabilności środowisk produkcyjnych.
Zakres obowiązków
- Utrzymanie i rozwój infrastruktury Linux oraz klastrów obliczeniowych HPC/GPU.
- Diagnozowanie i rozwiązywanie złożonych problemów systemowych, sprzętowych oraz sieciowych.
- Automatyzacja procesów konfiguracji i zarządzania infrastrukturą.
- Rozwijanie systemów monitoringu oraz dbanie o wysoką stabilność środowiska.
- Dokumentowanie rozwiązań technicznych i aktywne usprawnianie codziennej pracy zespołu.
Wymagania
- Bardzo dobra znajomość systemów Linux (Debian-like) oraz doświadczenie w pracy z systemami produkcyjnymi.
- Praktyczna wiedza z zakresu bare-metal oraz infrastruktury Data Center.
- Dobra znajomość sieci (TCP/IP, DNS, VLAN, routing) oraz umiejętność diagnozowania wydajności.
- Biegłość w Ansible, Git oraz umiejętność pisania skryptów w Bashu i Pythonie.
- Znajomość języka angielskiego umożliwiająca swobodną komunikację techniczną.
Co oferujemy
- Pracę z nowoczesnymi klastrami GPU oraz infrastrukturą klasy AI/HPC.
- Dużą samodzielność w działaniu oraz realny wpływ na architekturę i funkcjonowanie infrastruktury.
- Bezpośrednią współpracę z doświadczonymi inżynierami w zespole.
- Możliwość rozwoju w niszowych technologiach HPC i AI.
- Krótką ścieżkę decyzyjną i brak zbędnych formalności w codziennej pracy.