Benötigst du skalierbare, leistungsstarke Datenverarbeitung für dein Business?
Ich bin ein professioneller Data Engineer, spezialisiert auf PySpark, Python, SQL und Cloud Data Architectures. Ich helfe Unternehmen dabei, rohe, unstrukturierte Datensätze in saubere, zuverlässige und handlungsfähige Datenpipelines umzuwandeln.
Was ich für dich tun kann:
- Robuste Batch- und Echtzeit-ETL/ELT-Pipelines mit PySpark aufbauen.
- Massive CSV-, Parquet-, JSON- oder SQL-Datensätze mit hoher Performance verarbeiten.
- PySpark mit Databricks, AWS (S3, Glue, Redshift), GCP und Azure integrieren.
- Langsame PySpark-Codes optimieren (Repartitioning, Caching, Broadcast-Joins, Out-of-Memory-Fehler beheben).
- Schmutzige Datensätze für Analytics oder Machine Learning bereinigen, validieren und strukturieren.
Warum du mich wählen solltest?
- Produktionstauglicher, vollständig kommentierter Code.
- Umfassende Setup-Anleitungen.
- 100% Datensicherheit und Vertraulichkeit.