Ich werde Datenpipelines erstellen, die

Einige Informationen wurden automatisch übersetzt.

Indien

Ich spreche Englisch

KI- und ML-Entwickler für LLM Feinabstimmung, RAG und Data Science

KI/ML-Entwickler mit praktischer Erfahrung in der Produktion von LLM-Feinabstimmung (QLoRA/PEFT), RAG-Systemen (ChromaDB, MongoDB Atlas Vektorsuche, agentische Speicher) und Data Engineering (PySpark,...
Über diesen Service

Ich baue produktionsreife ETL-Pipelines mit PySpark für Transformationen, Airflow für Orchestrierung und Delta Lake für Speicherung – das gleiche Stack, das ich in meiner täglichen Datenengineering-Arbeit verwende.

Folgendes wird abgedeckt:

  • Bronze-zu-Silver (Roh-zu-geputzt) Transformationslogik in PySpark
  • Airflow DAG-Design mit richtiger Planung und Abhängigkeitsverwaltung
  • Delta Lake Tabellen-Setup mit Versionierung
  • Optional: Trino/Metabase Dashboard auf der bereinigten Datenbasis
  • Vollständig intern, selbst gehostete Pipeline-Architektur ohne Abhängigkeit von Drittanbieter-ETL-Plattformen (Fivetran, Airbyte Cloud usw.), falls du die volle Kontrolle über den Stack haben möchtest

Bevor ich mit der Gestaltung der Pipeline beginne, frage ich nach deinem Datenvolumen und Format der Quelle, da sich viel zwischen einer CSV mit 10.000 Zeilen und einer Streaming-Quelle unterscheidet. Ich werde ehrlich den Umfang einschätzen, anstatt eine generische Vorlage zu verwenden.

Zielplattform:

Amazon Redshift

Databricks Lakehouse

PostgreSQL

Tools und Plattformen:

AWS Glue DataBrew

Google Cloud Dataflow