Production Engineer/SRE
O projekcie
Poszukujemy doświadczonego Production Engineering Specialist, który będzie odpowiedzialny za utrzymanie i rozwój krytycznych systemów transakcyjnych działających w środowisku o wysokiej dostępności.
Rola łączy obszary Production Support, SRE oraz automatyzacji. Poszukujemy osoby, która potrafi diagnozować problemy produkcyjne end-to-end, rozumie zależności pomiędzy aplikacją, bazą danych i infrastrukturą oraz potrafi skutecznie przywracać stabilność systemów biznesowo krytycznych.
To stanowisko dla osób, które dobrze odnajdują się w dynamicznym środowisku produkcyjnym, mają doświadczenie w obsłudze incydentów oraz chcą realnie wpływać na niezawodność platform przetwarzających duże wolumeny transakcji.
Zadania
Obsługa i rozwiązywanie incydentów produkcyjnych.
Analiza problemów oraz prowadzenie Root Cause Analysis (RCA).
Monitorowanie stabilności, wydajności i dostępności systemów.
Diagnostyka problemów obejmujących aplikacje, bazy danych, system operacyjny oraz środowisko kontenerowe.
Udział w wdrożeniach nowych wersji oprogramowania oraz działaniach związanych z release management.
Tworzenie i rozwijanie automatyzacji wspierających procesy operacyjne.
Analiza logów, metryk i danych produkcyjnych.
Współpraca z zespołami developerskimi przy identyfikacji i eliminacji problemów.
Proponowanie oraz wdrażanie usprawnień zwiększających niezawodność i efektywność środowiska.
-
Udział w działaniach post-mortem i inicjatywach poprawiających jakość usług.
Wymagania
Minimum 4 lata doświadczenia w obszarach Production Support, Application Support, SRE, Platform Engineering lub pokrewnych.
Doświadczenie w utrzymaniu systemów transakcyjnych, płatniczych lub innych środowisk mission critical.
Bardzo dobra znajomość Oracle SQL i PL/SQL.
Doświadczenie w pracy z relacyjnymi bazami danych produkcyjnymi oraz umiejętność analizy problemów na poziomie danych i zapytań bazodanowych.
Dobra znajomość Linux oraz swobodna praca w środowisku terminalowym.
Doświadczenie z Kubernetes w zakresie monitorowania, diagnostyki i wsparcia aplikacji.
Umiejętność tworzenia i utrzymywania skryptów automatyzujących w Bash, Python lub podobnych technologiach.
Doświadczenie w analizie incydentów produkcyjnych, troubleshootingu oraz prowadzeniu Root Cause Analysis (RCA).
Znajomość narzędzi monitoringu oraz analizy logów.
Umiejętność identyfikowania problemów wydajnościowych i proponowania optymalizacji dla aplikacji, baz danych lub środowiska produkcyjnego.
Znajomość procesów CI/CD oraz udział w procesach wdrożeniowych.
Praktyczne podejście do rozwiązywania problemów oraz umiejętność działania pod presją czasu.
Bardzo dobra znajomość języka polskiego i angielskiego.
Otwartość na pracę z biura w Krakowie 2 razy w tygodniu.
Mile widziane
Doświadczenie w środowiskach wysokiej dostępności (HA).
Udział w inicjatywach automatyzacyjnych, optymalizacyjnych lub związanych z poprawą niezawodności platform.
Doświadczenie w pracy zgodnie z praktykami Site Reliability Engineering.