Ich baue PySpark- und Databricks-Datenpipelines sowie ETL auf

Einige Informationen wurden automatisch übersetzt.

Indien

Ich spreche Englisch

Dateningenieur für PySpark, Databricks, SQL und Python

Hallo, ich bin Abhishek, ein Vollzeit-Dateningenieur bei GHD, der täglich mit PySpark, Databricks, SQL, Python und Azure arbeitet. Ich unterstütze Unternehmen und Ingenieure bei: - Aufbau und Reparat...
Über diesen Service

Benötigst du eine zuverlässige Datenpipeline oder einen Spark-Job, der zu langsam ist oder ständig fehlschlägt? Ich bin ein Vollzeit-Dateningenieur, der täglich mit PySpark, Databricks, SQL und Azure arbeitet.


WAS ICH FÜR DICH TUN KANN:

  1. ETL/ELT-Pipelines in PySpark und Databricks erstellen (CSV, JSON, Parquet, APIs, Datenbanken)
  2. Daten in Delta Lake, Databricks, Azure Synapse, PostgreSQL oder SQL Server laden
  3. Inkrementelle Loads, Delta MERGE / Upserts, SCD Typ 2 Historientabellen
  4. Langsame oder fehlerhafte Spark-Jobs beheben: Daten-Skew, Shuffles, Joins, kleine Dateien, Out-of-Memory-Fehler
  5. Datenqualitätsprüfungen, Duplikatentfernung und saubere Reporting-Tabellen
  6. Planung mit Azure Data Factory oder Databricks Workflows

WAS DU BEKOMMST:

  1. Sauberer, kommentierter Code im Produktionsstil
  2. Kurzes Dokument, das erklärt, wie man ihn ausführt und wartet
  3. Vorher/Nachher-Laufzeiten für Optimierungsarbeiten

Bitte schreibe mir vor der Bestellung mit deinen Datenquellen, Volumen und Ziel, damit ich das passende Paket und den Zeitplan bestätigen kann. Keine Produktionszugänge nötig; Beispiel-Daten oder eine Sandbox reichen zum Start.

Zielplattform:

Azure Synapse Analytics

•

Databricks Lakehouse

Tools und Plattformen:

Azure Data Factory

•

Andere