Ich baue Produktions-PySpark-, Python- und SQL-Datenpipelines auf

Einige Informationen wurden automatisch übersetzt.

Indien

Ich spreche Englisch, Hindi

Daten- und Backend-Engineer

Über 13 Jahre Erfahrung im Aufbau von Datenplattformen und Backend-Systemen — Goldman Sachs, Walmart Global Tech, Ola und zwei finanzierte Startups, bei denen ich Teams von 6-12 Ingenieuren leitete. ...
Über diesen Service

Ich habe über 13 Jahre Erfahrung im Aufbau von Datenpipelines bei Goldman Sachs, Walmart Global Tech, Ola und zwei venture-finanzierten Startups. Die Pipelines, die ich betreut habe, bewegen täglich Terabytes. Jetzt erstelle ich deine.


WAS DU BEKOMMST

- Eine funktionierende PySpark / Python / SQL Pipeline, kein reiner Notebook-Export

- Idempotent und wiederholbar, damit sie nach einem Fehler sicher erneut ausgeführt werden kann

- Umgang mit Nullwerten, Duplikaten, späten Daten und Schema-Änderungen, ohne abzustürzen

- Lesbarer kommentierter Code, plus ein kurzes Video, das dich durch die Pipeline führt


ICH ARBEITE MIT

PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)


BEISPIELARBEITEN

- Unordentliche CSV/JSON/Parquet-Daten in eine saubere, modellierte Tabelle umwandeln

- Einen Spark-Job oder eine Abfrage, die wirklich fertig werden muss

- Geplante Extrakte aus einer API oder Datenbank

- Window-Funktionen, Dedup-Logik, inkrementelle Loads, CDC


BEVOR DU BESTELLST

Schick mir eine Datenprobe und eine Vorstellung, wie das Ergebnis aussehen soll. Ich sage dir, welches Paket passt oder ob ich nicht die richtige Person dafür bin. Die Scope-Definition ist kostenlos.


Ich bin in IST-Zeit und arbeite überlappend mit US- und EU-Zeiten.

Zielplattform:

Google BigQuery

Amazon Redshift

ClickHouse

Tools und Plattformen:

Hevo Data

Kafka Connect

Debezium