Senior Site Reliability Engineer (all genders)
Summary
Senior Site Reliability Engineer at a Berlin-based company building eCommerce product-discovery tech, maintaining and scaling Kubernetes-based systems during a shift to cloud.
- Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.
- Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.
- Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z. B. Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.
- Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
- Du entwickelst unsere Observability weiter – Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.
- Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – inklusive Burst-Szenarien in die Public Cloud.
- Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu
- Erfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld – oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.
- Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.
- Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrades und Operator-Pattern.
- Erfahrung oder starkes Interesse an Harvester bzw. vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
- Vertrautheit mit GitOps (Argo CD / Flux), Container Storage (Longhorn, Ceph) und Kubernetes Networking (Load Balancing, Ingress).
- Kenntnisse zu Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und Kapazitätsplanung on-prem und in der Cloud.
- Verständnis für Netzwerke in produktionsnahen Rechenzentren (u. a. VLAN).
- Ausgeprägter Automatisierungsinstinkt und eine Haltung, Toil strukturell zu eliminieren.
- Praktische Erfahrung im Einsatz von AI-Tools im operativen Betrieb.
- Sehr gute Englischkenntnisse; Deutsch von Vorteil.
- Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.
- Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud – mit Raum, Dinge neu und richtig zu bauen.
- AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.
- Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.
- Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.
- Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.