Ich werde AWS ETL-Pipelines mit airflow, spark und python aufbauen
Leitender Dateningenieur
Über diesen Service
Senior Data Engineer mit über 10 Jahren Erfahrung im Aufbau von Produktions-ETL für Fortune 500 Kunden (Expedia, Ford, HP).
Ich erstelle zuverlässige, produktionsbereite AWS-Datenpipelines mit Python, PySpark, Airflow und Spark, keine Wegwerf-Skripte. Echter Ingenieurstil: Partitionierung, Broadcast-Joins, Orchestrierung und Tests.
Erfolgsgeschichte:
Reduzierte einen 64-stündigen HiveQL-Job auf unter 3 Stunden (95,6 % schneller)
500 TB von Hadoop auf AWS migriert, vollständig validiert
Eigene Multi-Tenant SaaS-Plattform von Anfang bis Ende aufgebaut und betrieben
Was du bekommst: sauberen, dokumentierten, deploybaren Code, den dein Team pflegen kann, kein Black Box.
Mit Sitz in Mexiko (US-Zeitzonen-Überlappung), Echtzeit-Zusammenarbeit während deiner Geschäftszeiten. Fließendes Englisch.
Nicht sicher, welches Paket passt? Schreib mir zuerst und ich kläre es mit dir ab.
Tools und Plattformen:
AWS Glue DataBrew
•
Andere
Mein Portfolio
FAQ
Automatische Übersetzung
Q: Arbeitest du mit Datenquellen außerhalb von AWS?
A: Ja — Ich nehme Daten aus Datenbanken (PostgreSQL, MySQL), APIs, Dateien und Streaming-Quellen wie Kafka auf, und lade sie in S3, Redshift oder dein Wunsch-Data Warehouse.
Q: Erhalte ich den Quellcode und die Dokumentation?
A: Immer. Du erhältst sauberen, versionierten Code plus Dokumentation, damit dein Team alles selbstständig laufen und pflegen kann.
Q: Ich bin mir nicht sicher, welches Paket ich brauche. Kannst du helfen?
A: Absolut. Schreib mir mit deinen Quellen, Ziel und Volumen, und ich empfehle das passende Paket oder erstelle ein individuelles Angebot.
Q: Kannst du eine bestehende Pipeline reparieren oder optimieren, anstatt eine neue zu bauen?
A: Ja. Ich prüfe defekte oder langsame Pipelines und optimiere sie — mein HiveQL-Job hat eine Aufgabe von 64 Stunden auf unter 3 reduziert.

