Ich werde pyspark databricks datenpipelines bauen oder optimieren
FullStack Agentic AI Agenten-Design und Automatisierung, MLOps
Über diesen Service
Benötigst du eine zuverlässige, skalierbare und verständliche PySpark- oder Databricks-Pipeline?
Ich werde eine begrenzte Datenpipeline mit PySpark, Spark SQL, Delta Lake und Azure Databricks überprüfen, bauen, reparieren oder optimieren, wo es passend ist.
Ich kann langsame Jobs, zu viele Shuffle-Operationen, Join-Skew, Partitionierung, Pruning, Window-Funktionen, temporäre Features, inkrementelle Verarbeitung, Delta Lake, Datenqualitätsprüfungen und Python UDF-Refactoring angehen.
Deine Lieferung kann korrigierten Code, Performance-Ergebnisse, Pipeline-Implementierung, Validierungschecks, Benchmark-Richtlinien, Dokumentation und eine technische Übergabe umfassen.
Mein aktueller Arbeitsbereich umfasst verteilte Verarbeitung von Milliarden von Paket-Netzwerk-Datensätzen in Azure Databricks ohne Python UDFs. Ich konzentriere mich auf erklärbare, wartbare Verbesserungen.
Pakete decken definierte Jobs, Quellen und Transformationen ab. Cloud-Gebühren, Produktionszugänge, Plattformverwaltung und nicht verwandte Dashboards sind ausgeschlossen, es sei denn, sie sind in einem individuellen Angebot enthalten.
Bitte sende mir vor der Bestellung eine Nachricht mit Code, Schemas, Datenmenge, aktuellem Runtime und gewünschtem Ergebnis.
Mein Portfolio
FAQ
Automatische Übersetzung
Kannst du einen bestehenden PySpark-Job optimieren?
Ja. Ich kann die Ausführungslogik, Joins, Shuffle-Operationen, Skew, Partitionierung, Caching, Window-Funktionen, UDF-Nutzung, Lesen/Schreiben und Job-Struktur überprüfen. Die tatsächlichen Verbesserungen hängen von den Daten, der Cluster-Konfiguration und der bestehenden Implementierung ab.
Kannst du eine bestimmte Leistungssteigerung garantieren?
Nein. Ich werde Engpässe identifizieren und Verbesserungen validieren, wenn ein repräsentativer Zugriff auf die Ausführung vorhanden ist. Die Laufzeit hängt jedoch von Datenverteilung, Cluster-Ressourcen, Parallelität, Speicher und Plattformkonfiguration ab.
Arbeitest du nur mit Azure Databricks?
Meine bisher stärkste Erfahrung liegt bei Azure Databricks und PySpark, aber Spark-Konzepte gelten auch für andere verwaltete Spark-Umgebungen. Bestätige deine Plattform vor der Bestellung.
Benötigst du Zugriff auf Produktionsdaten?
Nicht unbedingt. Gesäuberte Muster, Schemas, Ausführungspläne, Spark UI-Screenshots, Logs und reproduzierbare Testdaten sind oft ausreichend. Übermittle niemals unbeschränkte Produktionszugänge über Fiverr-Anforderungen.
Sind Cloud- und Cluster-Gebühren inklusive?
Nein. Der Käufer trägt die Kosten für Databricks, Cloud, Speicher, Datenbank und andere Infrastruktur. Nutze nach Möglichkeit eine kostenkontrollierte Nicht-Produktionsumgebung.
Stellen Sie Quellcode und Dokumentation zur Verfügung?
Ja. Die Deliverables folgen dem gewählten Paket und können Notebooks, Python-Module, SQL, Konfigurationsbeispiele, Tests, Erkenntnisse, README-Anweisungen und ein Operations-Handbuch umfassen.
Kannst du eine End-to-End-Plattform bauen?
Dieses Gig umfasst begrenzte Pipelines und verbundene Jobs. Eine vollständige Datenplattform, organisationsweite Migration, Governance-Programm oder kontinuierlicher Produktionsbetrieb erfordern Discovery und ein individuelles Meilenstein-Angebot.
Was zählt als Überarbeitung?
Eine Revision korrigiert die gelieferte Arbeit anhand der vereinbarten Anforderungen. Neue Quellen, Transformationen, Notebooks, Plattformen, Schemas oder geänderte Geschäftslogik sind zusätzlicher Umfang.

