Ich baue deine ETL-Datenpipeline mit Python, SQL, Airflow und AWS auf
Dateningenieur
Über diesen Service
Hast du Schwierigkeiten mit unordentlichen, verstreuten Daten, denen du kaum traust? Ich erstelle zuverlässige ETL-Pipelines, die Rohdaten in saubere, abfragebereite Informationen verwandeln – genau wie es Produktionsteams machen.
Ich arbeite mit Python, SQL, Apache Airflow, PySpark und AWS, um deine Daten vom Quellort in ein strukturiertes Warehouse zu bewegen, mit Validierung auf dem Weg, damit schlechte Daten frühzeitig erkannt werden.
Wobei ich dir helfen kann:
ETL/ELT-Pipeline-Design und -Entwicklung
Orchestrierung mit Apache Airflow (geplante DAGs)
Datenaufnahme aus APIs, CSVs und Datenbanken
Datenumwandlung mit Python/PySpark
Modellierung des Data Warehouse (Faktentabellen, Dimensionstabellen, PostgreSQL)
Validierung der Datenqualität und automatische Checks
Ich habe End-to-End-Pipelines gebaut, die über 100.000 Datensätze aus mehreren Quellen verarbeiten und in saubere, analytische Warehouses einspeisen.
Mir ist sauberer Code und klare Kommunikation wichtig, du wirst bei jedem Schritt wissen, was passiert – nicht nur am Ende eine Black Box.
Hast du eine andere Datenquelle oder brauchst du etwas anderes? Schreib mir zuerst, ich prüfe gern, ob es passt, bevor du bestellst.
Zielplattform:
Amazon Redshift
•
PostgreSQL
•
mySQL
•
Amazon S3
Tools und Plattformen:
AWS Glue DataBrew
•
Andere
