Ich richte Prometheus Grafana Monitoring und Alerts für deine Server ein
AWS DevOps und SRE, 7 Jahre, Kubernetes CKA, Terraform, CICD
Über diesen Service
Dass du erst von einem Kunden erfährst, dass dein Server down ist, ist der falsche Weg. Lass mich eine Überwachung einrichten, die dir das zuerst sagt.
Senior DevOps / SRE, über 7 Jahre bei Zoom, Airtel, Infosys und Mindtree. Ich betreue täglich über 150 Linux-Hosts und Multi-Cluster EKS mit einer Verfügbarkeit von über 99 %, nutze Prometheus, Grafana, Datadog und PagerDuty. Zertifiziert: CKA, AWS Solutions Architect, AWS SysOps, Terraform.
WAS ICH EINRICHTE
Prometheus mit node exporter, cAdvisor und Service-Exportern
Grafana-Dashboards, die zeigen, was wirklich zählt, nicht 40 nutzlose Panels
Alertmanager-Regeln, die an Slack, E-Mail oder PagerDuty weitergeleitet werden
Loki für zentrale Logs, durchsuchbar neben deinen Metriken
Kubernetes-Überwachung: Pods, Nodes, Deployments, Ressourcenbelastung
AWS CloudWatch Alarme, wo sie besser passen als Prometheus
Alarme, die ständig ausgelöst werden, werden ignoriert. Ich passe Schwellenwerte an, sodass jeder Alarm wirklich bedeutet, dass etwas ernsthaft falsch ist und ein Mensch eingreifen muss.
WIE ICH ARBEITE
Schritt eins: Sag mir, was du betreibst und was dich vorher gestört hat.
Schritt zwei: Ich bestätige den Umfang und worauf wir alarmieren. Beratung ist kostenlos.
Schritt drei: funktionierender Stack, abgestimmte Alarme und ein Runbook pro Alarm.
Schreib mir mit deiner Konfiguration für eine kostenlose Beratung.
Tools:
Docker
•
Kubernetes
•
Amazon EKS
•
Andere
Frameworks:
Terraform
•
Ansible
Cloud-Provider:
Amazon Web Services
Programmiersprache:
Bash
•
Python
Expertise:
Installation
•
Debuggen
•
Konfiguration

