DevOps Engineer - AI Infrastructure & Orchestration
Poland
Rola polega na budowaniu i utrzymaniu infrastruktury do uruchamiania dużych modeli językowych (LLM) na lokalnym klastrze GPU z wykorzystaniem vLLM na OpenShift Kubernetes. Będziesz odpowiedzialny za deployment, orkiestrację GPU, automatyzację cyklu życia modeli, monitorowanie wydajności (metryki inferencji, zużycie GPU) oraz zapewnienie wysokiej dostępności (SLA 99.9%). To stanowisko łączy DevOps z MLOps – praca jest bardzo techniczna, oparta na automatyzacji i optymalizacji.
Brakuje: brak informacji o dyżurach on-call i ewentualnej kompensacji, nie podano, czy projekt jest greenfield czy brownfield.
Rola polega na budowaniu i utrzymaniu infrastruktury do uruchamiania dużych modeli językowych (LLM) na lokalnym klastrze GPU z wykorzystaniem vLLM na OpenShift Kubernetes. Będziesz odpowiedzialny za deployment, orkiestrację GPU, automatyzację cyklu życia modeli, monitorowanie wydajności (metryki inferencji, zużycie GPU) oraz zapewnienie wysokiej dostępności (SLA 99.9%). To stanowisko łączy DevOps z MLOps – praca jest bardzo techniczna, oparta na automatyzacji i optymalizacji.
- ✓Długoterminowy, stabilny projekt w sektorze Telco/AI
- ✓Nowoczesny stack: vLLM, GPU, OpenShift, Observability
- −Rola przez agencję – faktyczne warunki zatrudnienia i stabilność zależą od klienta
- !Brak informacji o wielkości i strukturze zespołu (6-8 osób, ale role? DevOps, ML? )
- !Proces rekrutacji 1-etapowy – może być zbyt szybki jak na seniora
- •Deployowanie i konfigurowanie vLLM na klastrze OpenShift z GPU (H100/H200/B300)
- •Tworzenie i utrzymywanie dashboardów Grafana do monitorowania GPU, tokenów, opóźnień i kosztów
- •Automatyzacja procesów lifecycle modeli (pobieranie z Hugging Face/S3, wersjonowanie, hot-swap) przy użyciu Python/Bash/Go
- •Konfigurowanie HPA (autoskalowanie) w oparciu o głębokość kolejki i zużycie pamięci GPU
- •Implementacja alertów dla awarii GPU, anomalii opóźnień i przekroczeń limitów
- •Zarządzanie API Gateway (NGINX) – autoryzacja, rate limiting, routing
- •Praca z CI/CD (GitLab CI, Jenkins, ArgoCD) do automatyzacji wdrożeń
- •Obsługa incydentów produkcyjnych i optymalizacja wykorzystania GPU (>70%)
Oferta dla doświadczonych specjalistów (Senior).
Mid-level DevOps z około 4-letnim stażem, który miał styczność z MLOps, zna Kubernetes i podstawy GPU. Osoba chętna do szybkiego rozwoju w kierunku AI Infrastructure, posiadająca solidne podstawy Python i automatyzacji.
Osoby bez doświadczenia z GPU i MLOps; juniorzy bez 5 lat w DevOps; osoby szukające pracy stacjonarnej; kandydaci niechętni do pracy z bare-metal / on-prem.
- ?Jak wygląda dyżurowanie on-call? Czy jest dodatkowo płatne?
- ?Ile osób w zespole to DevOps, a ile to ML Engineerowie?
- ?Czy klient ma już działające środowisko GPU, czy budujemy od zera?
- ?Jaka jest rotacja modeli – jak często wdrażane są nowe wersje?
- ?Czy istnieje możliwość wpływu na wybór narzędzi (np. ArgoCD vs GitOps)?
- ?Jak wygląda współpraca z zespołem ML – czy są dedykowani Data Scientist?
- ?Czy są jakieś konkretne wymagania dotyczące security / compliance (audit logi)?
- −Brak informacji o dyżurach on-call i ewentualnej kompensacji
- −Nie podano, czy projekt jest greenfield czy brownfield
- −Brak opisu ścieżki kariery/dostępu do szkoleń
- −Nie wiadomo, czy są regularne spotkania zespołu (stand-up, retrospektywy)
Praca w zespole 6-8 osobowym, prawdopodobnie złożonym z DevOps i ML Engineerów. Kultura nastawiona na współpracę i automatyzację, choć szczegóły nie są opisane w ogłoszeniu.
1-etapowy proces rekrutacyjny: spotkanie zdalne via MS Teams. Sporadycznie możliwe dodatkowe krótkie spotkanie połączone z decyzją.