Senior Kubernetes Platform Engineer / DevOps Engineer
Summary
Senior engineer maintaining and scaling a Kubernetes-based platform, automating operations with Terraform/Ansible/Helm, and ensuring high availability with Prometheus, Grafana, and ELK/OpenSearch.
Für den Betrieb und die Weiterentwicklung einer modernen Kubernetes-basierten Plattform suchen wir einen erfahrenen Senior Kubernetes Platform Engineer.
Zu deinen Hauptaufgaben gehören:
Betrieb, Überwachung und kontinuierliche Optimierung einer Kubernetes-basierten Plattform sowie der darauf betriebenen Managed Services wie MongoDB, PostgreSQL und Kafka
Sicherstellung von Hochverfügbarkeit, Skalierbarkeit und Ausfallsicherheit der Plattform
Proaktives Monitoring, Alerting sowie Incident- und Problem-Management
Durchführung und Automatisierung von Day-2-Operations wie Upgrades, Patches, Backup & Restore sowie Capacity Management
Analyse komplexer Störungen und Durchführung von Root-Cause-Analysen in produktionsnahen Umgebungen
Aufbau, Pflege und Weiterentwicklung der Observability-Landschaft mit Prometheus, Grafana sowie ELK/OpenSearch
Automatisierung wiederkehrender Betriebsaufgaben
Zusammenarbeit mit Engineering-Teams zur kontinuierlichen Verbesserung von Betriebsprozessen, Runbooks und Automatisierungen
Unterstützung bei der Stabilisierung und Optimierung bestehender Plattformen und Services
Teilnahme am Pikett-Dienst zur Sicherstellung eines zuverlässigen 24/7-Betriebs
Abgeschlossene Ausbildung oder Studium in Informatik, beispielsweise Universität, FH, HF oder EFZ, beziehungsweise eine vergleichbare Weiterbildung
Mehrjährige Berufserfahrung im Betrieb produktionskritischer IT-Infrastrukturen
Sehr gute praktische Kenntnisse mit Kubernetes
Fundierte Erfahrung im Betrieb containerbasierter Plattformen und Services
Sehr gute Linux- und System-Engineering-Kenntnisse
Erfahrung mit Observability und Monitoring, insbesondere:
- Prometheus
- Grafana
- ELK oder OpenSearch
Erfahrung mit Infrastructure as Code und Automatisierung, beispielsweise:
- Terraform
- Ansible
- Helm
Gute Kenntnisse moderner CI/CD- und DevOps-Werkzeuge wie:
- GitLab
- Git
- Docker
Betriebserfahrung mit mindestens einer der folgenden Technologien:
- MongoDB
- PostgreSQL
- Kafka
Erfahrung mit Incident Management, Troubleshooting und strukturierter Root-Cause-Analyse
Fähigkeit, sich schnell in bestehende und komplexe Infrastrukturumgebungen einzuarbeiten
Selbstständige, strukturierte und lösungsorientierte Arbeitsweise
Belastbarkeit und souveränes Verhalten auch bei kritischen Produktionsstörungen
Teamfähigkeit sowie Erfahrung mit agilen und Lean-orientierten Arbeitsweisen