Ich baue eine vollständige Open-Source-Produktionsdatenpipeline mit cicd-Automatisierung
Dateningenieur
Über diesen Service
Stundenweise Unterstützung: Schnelles Debugging, kleine Spark/ETL-Aufgaben oder Beratung
Teilzeit-Engagement: Fokus auf 20-Stunden-Pipeline- oder dbt-Modellentwicklung
Kompletter Projektaufbau: Vollständige End-to-End-Lakehouse-Setup (50+ Stunden)
Ich bin Data Engineer mit praktischer Erfahrung im Aufbau eines voll selbst gehosteten
Data Lakehouse auf Kubernetes, das etwa 5 Millionen Zeilen verarbeitet, unter Verwendung von Apache Spark,
Apache Iceberg, Trino, dbt-Trino und Google BigQuery.
Was ich liefere:
Apache Spark ETL-Pipelines für Ingestion, Reinigung und Transformation
Datenqualitätsprüfungen mit PyDeequ
dbt-Trino Gold Layer Modelle: Star Schema, Data Vault, OBT, Marts
Dagster-Orchestrierung und CI/CD-Automatisierung
Komplette Dokumentation (Standard- & Premium-Tiers)
Schreib mir vor der Bestellung, damit wir deine spezifischen Anforderungen besprechen können.
Warehouse-Plattform:
Snowflake
•
BigQuery
•
Databricks
Projektart:
New Build
Mein Portfolio
FAQ
Automatische Übersetzung
F: Arbeitest du mit Cloud-Plattformen wie AWS oder GCP?
A: Ja — ich unterstütze Google BigQuery, AWS S3 und jeden S3-kompatiblen Speicher wie MinIO.
Q: Kannst du mit meiner bestehenden Dateninfrastruktur arbeiten?
A: Ja — ich kann in deine bestehenden Datenbanken, Cloud-Speicher oder Data Warehouses integrieren.
F: Bietest du Dokumentation zum Code an?
A: Ja — alle Pakete beinhalten vollständige Code-Dokumentation und einen Lieferzusammenfassungsbericht.
F: Kannst du Echtzeit-Streaming-Pipelines bearbeiten?
A: Ja — ich arbeite mit Apache Flink für Streaming und Spark Structured Streaming für Micro-Batch-Verarbeitung.
F: Was passiert, wenn ich nach der Lieferung Änderungen benötige?
A: Revisionen sind in allen Paketen enthalten. Zusätzliche Revisionen sind gegen Aufpreis erhältlich.

