Ich werde robuste und skalierbare Data-Pipelines mit pyspark, databricks und airflow aufbauen
Zertifizierter Dateningenieur
Über diesen Service
Benötigst du skalierbare, produktionsbereite Data-Pipelines? Ich erstelle leistungsstarke Datenarchitekturen mit Databricks, PySpark, SQL, Apache Airflow und Apache Kafka. Von einfachem Dateieinlesen bis hin zu komplexem Echtzeit-Streaming liefere ich optimierte, kosteneffiziente Cloud-Lösungen.
Was ich anbiete:
- End-to-End ETL/ELT: Sichere Data-Pipelines mit PySpark und SQL.
- Databricks-Optimierung: Delta Lake, Delta Live Tables (DLT) und Unity Catalog Einrichtung.
- Orchestrierung: Automatisierte Apache Airflow DAGs mit Fehlerbehandlung.
- Echtzeit-Streaming: Niedrig-latenz Event-Streaming via Apache Kafka.
- Performance-Optimierung: Senkung deiner Cloud-Compute-Kosten durch optimierte Abfragen.
Warum du mich wählen solltest?
- Produktionsreifer, sauberer und wiederverwendbarer Code.
- Erfahrung mit Enterprise-Cloud (AWS / Azure).
- Kostenlose Architektur-Dokumentation inklusive.
Zielplattform:
Snowflake
•
Databricks Lakehouse
•
Teradata
•
Amazon S3
FAQ
Automatische Übersetzung
1. Welche Informationen oder Zugänge benötigst du, um loszulegen?
Ich benötige eine klare Beschreibung deiner Datenquellen, des erwarteten Endformats und sicheren, temporären Zugriffs auf deine Umgebung (wie Databricks-Token, Cloud-Speicher-Buckets oder Airflow-Umgebungen).
2. Handhabst du sowohl Batch-Verarbeitung als auch Echtzeit-Streaming?
Ja. Ich erstelle Standard-Batch-ETL-Pipelines mit PySpark und Databricks SQL sowie Echtzeit-Streaming-Pipelines mit Apache Kafka und Databricks Delta Live Tables (DLT).
3. Werden die Data-Pipelines vollständig automatisiert sein?
Ja. Ich schreibe individuelle Apache Airflow DAGs, um deine gesamte Data-Pipeline zu orchestrieren, zu planen, zu überwachen und zu automatisieren, inklusive robuster Fehlerbehandlung und Fehlerbenachrichtigungen.
4. Erhalte ich den Quellcode und die Dokumentation?
Ja. Du erhältst 100% Eigentum an allen Quellcodes (wie PySpark-Notebooks, SQL-Skripten und Airflow-DAG-Dateien) sowie eine saubere, leicht verständliche technische Dokumentation, wie man sie ausführt.

