Ich bin ein Site Reliability/DevOps Engineer mit über 4 Jahren praktischer Erfahrung im Aufbau von Infrastruktur, die um 3 Uhr morgens ohne Probleme skaliert.
Was ich in der Produktion tatsächlich gebaut habe:
- Zero-Downtime AWS-Migrationen (Cross-Account Elastic IP Umschaltung, Route53 DNS-Delegation, NLB-Neukonfiguration) mit Rollback-Automatisierung
- CI/CD-Pipelines mit CDK/CodePipeline und GitHub Actions, inklusive automatischer Sicherheitsüberprüfung
- EKS-Cluster mit FSx-gestütztem Speicher und Disaster Recovery, Reduzierung der Ausfallzeiten um 90 %
- CloudWatch/Prometheus-Überwachung für mehr als 15 Fehlerarten mit strukturiertem Logging und Multi-Period-Alarmierung
- Terraform-gestützte Infrastruktur für sichere, wiederholbare Umgebungsbereitstellung
- Maßgeschneiderte Automatisierung in Go und Python für Infrastruktur-Orchestrierung (z.B. ein benutzerdefinierter SFTP-Proxy-Routing-Layer)
Was ich aus meinen eigenen Systemen mitbringe (unabhängig gebaut und betrieben):
- Selbstheilende Kubernetes-Plattformen mit GitOps (ArgoCD), Policy-as-Code (Kyverno) und Chaos Engineering (AWS FIS), getestet gegen eine Recovery-SLA von 10 Minuten
- Laufzeitsicherheits-Erkennung mit Falco, inklusive automatisierter, schweregradbewerteter Incident-Reaktion
- Ein von Grund auf neu entwickelter Kubernetes-Operator (Go, benutzerdefinierte CRDs, controller-runtime) für Flottenmanagement
- Multi-Cloud-Unterstützung