Ich erstelle automatisierte ETL-Datenpipelines mit PySpark und Python

Einige Informationen wurden automatisch übersetzt.

Indien

Ich spreche Englisch
Dateningenieur, der eine Gesundheitsdatenplattform von Grund auf neu konzipiert und aufgebaut hat, die jetzt über 5 Mio. Patientenakten und mehr als 10 TB klinischer Daten verarbeitet, die aus EHR-Sys...
Über diesen Service

Benötigst du skalierbare, leistungsstarke Datenverarbeitung für dein Business?

Ich bin ein professioneller Data Engineer, spezialisiert auf PySpark, Python, SQL und Cloud Data Architectures. Ich helfe Unternehmen dabei, rohe, unstrukturierte Datensätze in saubere, zuverlässige und handlungsfähige Datenpipelines umzuwandeln.

Was ich für dich tun kann:

  • Robuste Batch- und Echtzeit-ETL/ELT-Pipelines mit PySpark aufbauen.
  • Massive CSV-, Parquet-, JSON- oder SQL-Datensätze mit hoher Performance verarbeiten.
  • PySpark mit Databricks, AWS (S3, Glue, Redshift), GCP und Azure integrieren.
  • Langsame PySpark-Codes optimieren (Repartitioning, Caching, Broadcast-Joins, Out-of-Memory-Fehler beheben).
  • Schmutzige Datensätze für Analytics oder Machine Learning bereinigen, validieren und strukturieren.

Warum du mich wählen solltest?

  • Produktionstauglicher, vollständig kommentierter Code.
  • Umfassende Setup-Anleitungen.
  • 100% Datensicherheit und Vertraulichkeit.

Zielplattform:

PostgreSQL

•

mySQL

•

Microsoft SQL Server

•

Amazon S3

Tools und Plattformen:

AWS Glue DataBrew

•

Azure Data Factory