Struct4 to dynamiczna firma technologiczna specjalizująca się w zaawansowanych rozwiązaniach IT w obszarze Data i Event-Driven Systems. Poszukujemy doświadczonego LLM Engineera, który dołączy do naszego zespołu i wesprze nas w budowie nowoczesnej platformy do serwowania modeli językowych.
Zakres obowiązków
- Wdrażanie i konfiguracja modeli LLM, takich jak Llama, Mistral czy Qwen, z wykorzystaniem technologii vLLM.
- Optymalizacja wydajności inferencji, w tym zarządzanie pamięcią GPU, kwantyzacja oraz obsługa KV cache.
- Przygotowywanie i utrzymywanie endpointów API w pełni zgodnych ze standardem OpenAI.
- Projektowanie i wdrażanie rozwiązań RAG, obejmujących przetwarzanie dokumentów, tworzenie embeddingów oraz pracę z bazami wektorowymi.
- Ścisła współpraca z zespołami MLOps i DevOps w celu zapewnienia stabilnych wdrożeń produkcyjnych.
Wymagania
- Bardzo dobra znajomość języka Python oraz doświadczenie w pracy z modelami LLM.
- Praktyczna wiedza z zakresu optymalizacji inferencji modeli na GPU.
- Doświadczenie w pracy z technologiami takimi jak vLLM, bazy wektorowe oraz systemy RAG.
- Umiejętność ewaluacji wydajności modeli pod kątem latencji, przepustowości oraz kosztów operacyjnych.
- Zrozumienie procesów MLOps i DevOps w kontekście wdrażania rozwiązań AI.
Co oferujemy
- W pełni zdalny model pracy, który pozwala na elastyczne zarządzanie czasem.
- Pracę przy innowacyjnych projektach z obszaru Generative AI w doświadczonym zespole.
- Minimalną liczbę spotkań synchronicznych, ograniczoną do jednego w tygodniu.
- Możliwość rozwoju w środowisku skupionym na nowoczesnych technologiach GPU inference.