Ich baue eine vollständige Open-Source-Produktionsdatenpipeline mit cicd-Automatisierung

Einige Informationen wurden automatisch übersetzt.

Pakistan

Ich spreche Urdu, Englisch

Dateningenieur

Data Engineer, spezialisiert auf den Aufbau von End-to-End, selbst gehosteten Data Lakehouses auf Kubernetes mit Open-Source-Technologien. Ich habe eine vollständige produktionsreife Datenplattform en...
Über diesen Service
<p suchst du nach flexibler Unterstützung im Bereich Data Engineering, egal ob es sich um eine schnelle Lösung oder den Aufbau einer kompletten Pipeline handelt? Ich biete drei Engagement-Stufen an:


Stundenweise Unterstützung: Schnelles Debugging, kleine Spark/ETL-Aufgaben oder Beratung

Teilzeit-Engagement: Fokus auf 20-Stunden-Pipeline- oder dbt-Modellentwicklung

Kompletter Projektaufbau: Vollständige End-to-End-Lakehouse-Setup (50+ Stunden)


Ich bin Data Engineer mit praktischer Erfahrung im Aufbau eines voll selbst gehosteten

Data Lakehouse auf Kubernetes, das etwa 5 Millionen Zeilen verarbeitet, unter Verwendung von Apache Spark,

Apache Iceberg, Trino, dbt-Trino und Google BigQuery.


Was ich liefere:

Apache Spark ETL-Pipelines für Ingestion, Reinigung und Transformation

Datenqualitätsprüfungen mit PyDeequ

dbt-Trino Gold Layer Modelle: Star Schema, Data Vault, OBT, Marts

Dagster-Orchestrierung und CI/CD-Automatisierung

Komplette Dokumentation (Standard- & Premium-Tiers)


Schreib mir vor der Bestellung, damit wir deine spezifischen Anforderungen besprechen können.

Warehouse-Plattform:

Snowflake

BigQuery

Databricks

Projektart:

New Build

Mein Portfolio