Ich baue Produktions-PySpark-, Python- und SQL-Datenpipelines auf
Daten- und Backend-Engineer
Über diesen Service
Ich habe über 13 Jahre Erfahrung im Aufbau von Datenpipelines bei Goldman Sachs, Walmart Global Tech, Ola und zwei venture-finanzierten Startups. Die Pipelines, die ich betreut habe, bewegen täglich Terabytes. Jetzt erstelle ich deine.
WAS DU BEKOMMST
- Eine funktionierende PySpark / Python / SQL Pipeline, kein reiner Notebook-Export
- Idempotent und wiederholbar, damit sie nach einem Fehler sicher erneut ausgeführt werden kann
- Umgang mit Nullwerten, Duplikaten, späten Daten und Schema-Änderungen, ohne abzustürzen
- Lesbarer kommentierter Code, plus ein kurzes Video, das dich durch die Pipeline führt
ICH ARBEITE MIT
PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)
BEISPIELARBEITEN
- Unordentliche CSV/JSON/Parquet-Daten in eine saubere, modellierte Tabelle umwandeln
- Einen Spark-Job oder eine Abfrage, die wirklich fertig werden muss
- Geplante Extrakte aus einer API oder Datenbank
- Window-Funktionen, Dedup-Logik, inkrementelle Loads, CDC
BEVOR DU BESTELLST
Schick mir eine Datenprobe und eine Vorstellung, wie das Ergebnis aussehen soll. Ich sage dir, welches Paket passt oder ob ich nicht die richtige Person dafür bin. Die Scope-Definition ist kostenlos.
Ich bin in IST-Zeit und arbeite überlappend mit US- und EU-Zeiten.
FAQ
Automatische Übersetzung
Kannst du mit meinen Daten arbeiten, wenn sie vertraulich sind?
Ja. Ich arbeite mit einem Schema-only Beispiel oder synthetischen Daten, die deiner Struktur entsprechen, und speichere nach der Lieferung nichts. Gerne unterschreibe ich eine NDA, bevor du mir etwas schickst.
Wie groß können die Daten sein?
Komfortabel im Terabyte-Bereich — ich habe Pipelines mit etwa 3TB/Tag verarbeitet. Große Jobs laufen bei mir auf Spark oder DuckDB, nicht auf Pandas, damit sie auch wirklich fertig werden.
Brauche ich Spark oder reicht SQL?
Schick mir eine Nachricht. Meistens ist die Antwort "du brauchst kein Spark", und ich sage dir das, auch wenn die Spark-Version eine größere Bestellung wäre.
Kann ich das nach der Lieferung selbst warten?
Genau darum geht's. Kommentierter Code, eine README und ein Video-Guide. Wenn dein Team Python lesen kann, kann es das auch selbst übernehmen.

