Ich erstelle ETL-Pipelines für Data Engineering mit Apache Airflow
Junior Data Scientist, ML Engineer, Python, ETL-Pipelines
Über diesen Service
Steht deine Daten in APIs oder Dateien, ohne eine automatisierte Möglichkeit, sie zu sammeln und zu speichern? Ich erstelle produktionsreife ETL-Pipelines und Data-Engineering-Workflows mit Apache Airflow 3, Python und SQL, die deine Daten nach einem Zeitplan extrahieren, transformieren und laden – vollautomatisch, ohne manuellen Aufwand.
Was ich liefere:
- Automatisierte Pipeline mit unabhängigen Extract-, Transform- und Load-Aufgaben
- Apache Airflow 3 mit TaskFlow API und täglicher Planung
- Multi-Container Docker-Stack für saubere, reproduzierbare Deployments
- PostgreSQL- oder MySQL-Datenbank mit strukturierten, abfragbaren Datensätzen
- Vollständiger Quellcode via GitHub bereitgestellt
Warum ich? Ich habe eine peer-reviewed IEEE-Konferenzpublikation, doppelte DataCamp-Zertifizierungen (Certified Data Scientist und Certified Associate Data Scientist) und ein Forschungspraktikum bei einem britischen KI-Labor. Mein ETL-Datenpipeline läuft live in der Produktion und sammelt jährlich über 365 strukturierte Datensätze ohne manuellen Eingriff.
Ich arbeite mit: REST-APIs und dateibasierten Datenquellen, lade Daten in SQL-Datenbanken wie PostgreSQL oder MySQL.
Hinweis: Bitte schreibe mir vor der Bestellung, um deine Datenquelle und Anforderungen zu besprechen.
Zielplattform:
PostgreSQL
•
mySQL
Tools und Plattformen:
Andere
Mein Portfolio
FAQ
Automatische Übersetzung
Mit welchen Datenquellen können Sie eine Verbindung herstellen?
Derzeit REST-APIs. Wenn du eine andere Quelle hast, wie CSV-Dateien oder eine Datenbank, schreibe mir zuerst und wir besprechen die Machbarkeit.
Übernimmst du die komplette Datenentwicklung oder nur einfache ETL-Skripte?
Komplette Datenentwicklung: Pipeline-Architektur, Apache Airflow-Orchestrierung, Docker-Containerisierung und produktionsreifer Code, kein einmaliges Skript.
Muss Apache Airflow bereits installiert sein?
Nein. Ich richte die Pipeline-Umgebung für dich ein, inklusive Docker-Konfiguration, falls nötig.
Läuft die Pipeline automatisch, ohne dass ich etwas tun muss?
Ja. Die Standard- und Premium-Pakete beinhalten vollautomatisierte Planung mit Apache Airflow, die nach deinem Zeitplan läuft, ohne manuelles Triggern.
Erhalte ich den Quellcode?
Ja, alle Pakete beinhalten den vollständigen Python-Quellcode und DAG-Dateien.
Kannst du mit meiner bestehenden Datenbank arbeiten?
Ja, solange du die Zugangsdaten sicher bereitstellen kannst. Ich empfehle, dies vor der Bestellung zu besprechen.
Prüft die Pipeline auf schlechte oder ungültige Daten?
Ja. Eingehende Daten werden geprüft, bevor sie geladen werden, dabei werden Typen, erforderliche Felder und eindeutig ungültige Werte überprüft, damit eine fehlerhafte Datensatz erkannt wird, anstatt stillschweigend in deiner Datenbank zu landen.
Was passiert, wenn ein Schritt in der Pipeline fehlschlägt?
Jede Aufgabe versucht automatisch ein paar Mal, bevor sie fehlschlägt, und du kannst per E-Mail benachrichtigt werden, wenn ein Lauf letztendlich scheitert. So werden Probleme sofort erkannt, anstatt erst Tage später entdeckt zu werden.

