Ich werde große Apache Spark Datenpipelines bauen und optimieren

Einige Informationen wurden automatisch übersetzt.

Indien

Ich spreche Telugu, Englisch, Hindi

Leitender Dateningenieur

Senior Data Engineer mit über 8 Jahren Erfahrung im Aufbau und der Optimierung groß angelegter verteilten Datenpipelines. Erfahren in Apache Spark, Scala, PySpark, Hive, Hadoop, SQL und AWS, mit prak...
Über diesen Service

Experten für Apache Spark Optimierung & Datenpipeline-Architektur

Stürzen deine Spark-Jobs mit Out-of-Memory (OOM)-Fehlern ab, timeout bei Broadcasts oder kosten zu viel in der Cloud?

Ich bin ein Senior Data Engineer mit über 8 Jahren Erfahrung im Aufbau, der Fehlersuche und der Optimierung von groß angelegten verteilten Datenpipelines. Ich spezialisiere mich auf die Verarbeitung von Multi-Terabyte-Workloads und die Lösung komplexer Big Data Engpässe mit Apache Spark, Scala, PySpark, Hadoop und Hive.

Was ich für dich tun kann:

  • Spark Performance Tuning: Daten-Skew beheben, teure Joins optimieren und den Speicherverbrauch feinjustieren, um Job-Fehler zu stoppen und die Ausführungszeit drastisch zu reduzieren.
  • ETL Pipeline Entwicklung: Robuste, skalierbare und fehlertolerante Datenaufnahme-Pipelines von Grund auf entwerfen und bauen, unter Verwendung bewährter Praktiken für Partitionierung und Speicherung.
  • Produktions-Debugging: Tiefer Einblick in Lineage, Shuffles und Cluster-Ressourcennutzung, um stille Performance-Killer im bestehenden Code zu beheben.
  • Core Tech Stack: Apache Spark, Scala, Python/PySpark, Hadoop, Hive, SQL und Cloud-Plattformen (AWS).

Ob du eine schnelle Diagnose für eine fehlerhafte Abfrage brauchst oder eine komplette Enterprise-Datenarchitektur – ich bin hier, um zu helfen.