Senior Site Reliability Engineer Kubernetes Platform (m/w/d)
Sicherstellung des stabilen Betriebs unserer Kubernetes SaaS-Plattform mit hunderten aktiven Clustern inklusive Vorfallminderung
Übersetzung komplexer Systemarchitekturen in Code (30-40%) mit einem Software-Entwicklungsanteil in Go, Terraform, Ansible und Bash
Entwicklung und Automatisierung von Infrastrukturkomponenten von der Server-Provisionierung bis hin zu K8s-Operatoren
Optimierung und operative Betreuung der Observability-Plattform für die Managed-Service-Infrastruktur (Prometheus, Loki, Mimir)
Durchführung von Release-Management, kontinuierliche Verbesserung der CI/CD-Pipelines (GitLab) sowie Troubleshooting im 2nd und 3rd Level Support
Teilnahme an der Rufbereitschaft (nach erfolgreicher Probezeit)
Fundierte Praxiserfahrung im Betrieb, der Fehlerbehebung und der Skalierung hochverfügbarer Kubernetes-Cluster in Produktionsumgebungen
Tiefgehende Kenntnisse in der Linux-Systemadministration sowie ein solides Verständnis von Netzwerk-Layer 3/4 (Routing, NAT) und Layer 7-Protokollen
Praktische Entwicklungserfahrung in System-Sprachen (Go) sowie sichere Anwendung gängiger Automatisierungswerkzeuge (Terraform, Ansible, Helm)
Erfahrung im Aufbau und Betrieb von Observability-Stacks (Prometheus, Loki, Mimir) sowie im Umgang mit gängigen CI/CD-Praktiken
Verständnis der internen Kubernetes-Mechanismen (etcd, apiserver, kubelet)
Fließende Deutsch- und gute Englischkenntnisse (B2)