Ich werde Datenpipelines erstellen, die
KI- und ML-Entwickler für LLM Feinabstimmung, RAG und Data Science
Über diesen Service
Ich baue produktionsreife ETL-Pipelines mit PySpark für Transformationen, Airflow für Orchestrierung und Delta Lake für Speicherung – das gleiche Stack, das ich in meiner täglichen Datenengineering-Arbeit verwende.
Folgendes wird abgedeckt:
- Bronze-zu-Silver (Roh-zu-geputzt) Transformationslogik in PySpark
- Airflow DAG-Design mit richtiger Planung und Abhängigkeitsverwaltung
- Delta Lake Tabellen-Setup mit Versionierung
- Optional: Trino/Metabase Dashboard auf der bereinigten Datenbasis
- Vollständig intern, selbst gehostete Pipeline-Architektur ohne Abhängigkeit von Drittanbieter-ETL-Plattformen (Fivetran, Airbyte Cloud usw.), falls du die volle Kontrolle über den Stack haben möchtest
Bevor ich mit der Gestaltung der Pipeline beginne, frage ich nach deinem Datenvolumen und Format der Quelle, da sich viel zwischen einer CSV mit 10.000 Zeilen und einer Streaming-Quelle unterscheidet. Ich werde ehrlich den Umfang einschätzen, anstatt eine generische Vorlage zu verwenden.
FAQ
Automatische Übersetzung
Arbeitest du mit Cloud-Datenquellen (S3, GCS, Azure Blob)?
Ja — gib deine Quelle in den Anforderungen an.
Kannst du eine bestehende defekte Pipeline reparieren, anstatt eine neue zu bauen?
Ja, schreib mir zuerst mit Details — die Preise unterscheiden sich von neuen Gigs.
Brauche ich eine eigene Airflow-Instanz?
Nein, ich kann eine (lokal/Docker) im Rahmen der Lieferung einrichten oder innerhalb deiner arbeiten, wenn du Zugriff hast.
Kannst du das ohne die Nutzung von verwalteten Drittanbieter-ETL-Tools bauen?
Ja — ich baue vollständig intern/self-hosted Pipelines (PySpark + Airflow + Delta Lake) anstelle von Tools wie Fivetran oder Airbyte Cloud zu verbinden. Verfügbar im Premium-Tarif.
