Ich baue ETL, ELT Datenpipelines mit Python, Spark, Airflow und dbt auf
Daten- und KI-Ingenieur, Python, PySpark, Airflow und Cloud ETL
Über diesen Service
Über dieses Gig:
Wenn du deine Daten bereinigen, transformieren und zuverlässig vom Quell- zum Zielort fließen lassen willst, bin ich dein Ansprechpartner. Ich baue ETL/ELT-Pipelines mit modernen Data-Engineering-Tools wie Python, PySpark, SQL, Apache Airflow, dbt und Databricks nach der Medallion-Architektur (Bronze/Silber/Gold) für saubere, produktionsreife Datenschichten.
Zu meinen aktuellen Projekten gehört eine Pipeline, die Live-Daten via API einspeist, sie mit Airflow orchestriert und bei Fehlern automatische Benachrichtigungen sendet, sie durch mehr als 10 dbt-Modelle mit über 60 Datenqualitäts-Tests transformiert und in einem Power BI-Dashboard sowie einer separaten Databricks-Pipeline verarbeitet, die E-Commerce-Daten End-to-End mit PySpark verarbeitet.
Was ich anbiete:
- Design und Entwicklung von ETL/ELT-Pipelines (Batch)
- Datenbereinigung, Validierung und Qualitätstests
- Implementierung der Medallion-Architektur (Bronze/Silber/Gold)
- Orchestrierung mit Apache Airflow
- Daten-Transformation mit dbt, SQL, PySpark
- Entwicklung von Databricks-Pipelines
- API-basierte Datenaufnahme
- Dashboard-Integration (Power BI)
Warum mit mir arbeiten:
- Reale, überprüfbare Projektarbeit, jedes Ergebnis wird durch ein öffentliches GitHub-Repository belegt
- Klare Kommunikation, realistische Zeitpläne
- Sauberer, dokumentierter Code im Produktionsstil, keine Wegwerf-Skripte
Zielplattform:
PostgreSQL
•
Amazon S3
•
Andere
Tools und Plattformen:
Azure Data Factory
•
Andere
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Art von Datenpipelines kannst du bauen?
Ich baue ETL/ELT Pipelines, die Daten aus APIs, Datenbanken, Flachdateien (CSV/Excel) oder Websites extrahieren. Ich bereinige, transformiere und teste diese Daten mit Python, PySpark und dbt und liefere sie in einem strukturierten Format an deine Datenbank oder dein Data Warehouse (wie PostgreSQL oder Databricks).
Ich bin kein Technikfreak, kannst du mir trotzdem helfen?
Absolut. Die meisten meiner Kunden sind keine Ingenieure. Erzähl mir dein Endziel in einfachem Englisch (z.B. „Ich brauche meine täglichen Verkaufsdaten und Bestände an einem Ort“), und ich kümmere mich um die technische Architektur und erkläre sie einfach.
Kannst du eine Pipeline automatisieren, die täglich oder wöchentlich läuft?
Ja. Ich spezialisiere mich auf die Nutzung von Apache Airflow zur Orchestrierung und Automatisierung von Workflows. Je nach Paket kann ich geplante Läufe, Aufgabenabhängigkeiten und automatische E-Mail-Benachrichtigungen bei Fehlern im Pipeline einrichten.
Kannst du beim Web Scraping helfen?
Ja. Ich kann Web-Scraper mit Python bauen, um Daten von öffentlichen Websites zu extrahieren, wobei ich sicherstelle, dass das Projekt den rechtlichen Anforderungen und den Regeln der Seite entspricht. Ich kann auch direkt mit APIs integrieren, was ich immer zuerst empfehle, um bessere Stabilität zu gewährleisten.
Was ist die "Medallion-Architektur"?
Sie ist ein Best-Practice-Daten-Designmuster, das Daten in drei Schichten organisiert: Bronze (Rohdaten), Silber (gereinigte und gefilterte Daten) und Gold (geschäftsbereite Daten). Damit stelle ich sicher, dass deine finalen Berichte auf hochzuverlässigen, getesteten Daten basieren.
Lässt sich das mit BI-Tools integrieren?
Ja. Ich gestalte die finale Schicht deiner Datenpipeline so, dass Tools wie Power BI, Tableau oder andere Analyseplattformen sich direkt verbinden und die Daten effizient abfragen können.
Was ist AI-Datenanreicherung?
AI-Datenanreicherung bedeutet, KI- oder LLM-Tools zu verwenden, um rohen, unordentlichen Daten mehr Bedeutung und Struktur zu verleihen. Zum Beispiel können unstrukturierte Kundenfeedbacks automatisch nach Stimmung kategorisiert oder spezifische Entitäten (wie Namen oder Orte) aus großen Textblöcken extrahiert werden.
Kannst du AI- oder LLM-Anreicherung zu meinen Daten hinzufügen?
Ja. Ich kann KI/LLM-Workflows in deine Pipeline integrieren, um Aufgaben wie Zusammenfassung, Klassifikation, Tagging und die Umwandlung unstrukturierter Texte in saubere, abfragbare Datenbankfelder vor deinem Dashboard zu übernehmen.
Verwendest du Datenqualitäts-Tests?
Ja. Ich bin fest davon überzeugt, dass Datenqualität integriert sein sollte, nicht nachträglich angebaut. Ich nutze dbt, um automatisierte Tests zu implementieren (z.B. auf Nullwerte, Duplikate oder akzeptierte Werte), damit deine Pipeline dich vor schlechten Daten warnt, bevor sie deine Berichte zerstören.

