Ich erstelle eine ETL-Datenpipeline, die unterwegs reinigt und anreichert
Python Data Engineer: Web Scraping, ETL Pipelines und Data Enrichment
Level 2
Hat hohe Leistungskriterien erfüllt und verfügt über eine nachgewiesene Erfolgsbilanz bei der Erfüllung von Kundenerwartungen.
Über diesen Service
Die Daten kommen aus sechs verschiedenen Quellen, und keine stimmt überein. Eine REST API, zwei Tabellenkalkulationen, die jemand manuell pflegt, eine Scraper-Ausgabe und ein CRM-Export mit unterschiedlichen Spaltennamen. Jemand verbringt eine Woche morgens damit, alles zusammenzufügen.
Was die Pipeline macht
- Extrahiert aus Websites, REST APIs, Datenbanken und Dateien
- Reinigt, dedupliziert und formatiert sie in ein von dir definiertes Schema
- Bereichert die Datensätze mit anderen Quellen: Firmendaten, Kontakte, Geodaten
- Lädt sie in BigQuery, PostgreSQL, MySQL, Sheets oder dein CRM
- Führt sie nach einem Zeitplan aus, gesteuert in Airflow oder n8n
Damit es nicht stillschweigend scheitert
- Wiederholungsversuche und Ratenbegrenzung bei jeder Quelle
- Validierung im Pipeline-Prozess, damit schlechte Zeilen erkannt werden, bevor sie landen
- Benachrichtigungen, wenn ein Lauf fehlschlägt oder ein Feld leer ankommt
Ich habe die Pipeline hinter über 1 Mio. US-Anwalt-Profilen aufgebaut, die unbeaufsichtigt laufen.
Du bekommst die funktionierende Pipeline, den Quellcode und die Setup-Dokumentation, die für den Nachfolger geschrieben ist. Sag mir deine Quellen und dein Ziel, und ich werde den Umfang festlegen und ein Angebot machen, bevor du bestellst.
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Quellen kannst du verbinden?
Websites und Scraper, REST- und GraphQL-APIs, PostgreSQL, MySQL, MongoDB, BigQuery, CSV- und Excel-Dateien, Google Sheets und die meisten CRMs über ihre API. Wenn eine Quelle eine API oder eine Seite hat, kann sie in der Regel eine Quelle sein. Schick mir die Liste und ich bestätige sie, bevor ich ein Angebot mache.
Wo kann es die Daten laden?
BigQuery, PostgreSQL, MySQL, MongoDB, Google Sheets, S3 oder Flachdateien. Wenn das Ziel ein CRM oder eine App ist statt eines Warehouses, ist das eine Integration und funktioniert genauso. Sag mir, was die Daten danach liest, und ich schreibe in das, was es erwartet.
Wie wird es geplant und wo läuft es?
Airflow, wenn der Workflow echte Abhängigkeiten zwischen den Schritten hat, n8n, wenn es einfacher ist und du es sehen möchtest, und ein einfacher Cron-Job, wenn keines von beidem den Aufwand wert ist. Es läuft auf deinem Server oder in deinem Cloud-Account, also besteht nach der Übergabe keine Abhängigkeit mehr von mir.
Kannst du zwei Tools integrieren, die nicht miteinander sprechen?
Ja, das ist eine gängige Version dieses Jobs. Daten von einer API ziehen, in das transformieren, was die andere erwartet, pushen, Fehler und Rate-Limits handhaben und dann planen. HubSpot, Airtable, Salesforce, Sheets und die meisten REST-APIs. Zapier oder n8n, wo sie passen, und bei Bedarf eigenes Python.
Womit kannst du Datensätze anreichern?
Unternehmensgröße, Branche, Standort, Webseite, verwendete Technologien, geschäftliche E-Mails und Telefonnummern, Namen der Entscheidungsträger und Geocoding. Was verfügbar ist, hängt von der Quelle ab, daher sage ich dir vor der Bestellung, welche Felder realistisch ausgefüllt werden, anstatt nachher.
Bekomme ich den Code?
Ja, alles, dokumentiert und von dir änderbar. Die Übergabe umfasst das Repository, eine Readme mit Installations- und Konfigurationsanweisungen, die Zeitplan-Definition und die Verbindungseinstellungen mit deinen eigenen Zugangsdaten statt meinen.
Was passiert, wenn sich eine Quelle ändert und die Pipeline bricht?
Es benachrichtigt dich, was der Punkt ist. Die Validierung läuft innerhalb der Pipeline, nicht danach, sodass eine Quelle, die anfängt, leere Felder zurückzugeben, den Lauf scheitern lässt, anstatt still und heimlich Null-Werte in dein Warehouse zu laden. Premium beinhaltet die Überwachung und Alarmierung.
Kannst du es nach der Lieferung überwachen und warten?
Premium umfasst Überwachung und Alarmierung bei Übergabe. Laufende Wartung, bei der ich die Alarme beobachte und Fehler behebe, ist eine separate monatliche Vereinbarung. Die meisten Kunden nehmen den Code und laufen ihn, weshalb die Dokumentation eher für einen Fremden geschrieben ist als für dich.
Wie viel Daten kann es verarbeiten?
Der größte einzelne Job verarbeitete über 100M JSON-Dateien zu analysebereiten CSVs. Das Volumen ist meist eine Designfrage und kein Limit: Batch-Verarbeitung, inkrementelle Loads und wo die Transformation stattfindet. Sag mir die Zeilenzahlen und die Frequenz, und ich sage dir die Form.
Das sieht teuer aus. Gibt es eine kleinere Version?
Ja. Wenn du eine Quelle hast, die in einen Zielort auf einem Zeitplan gezogen wird, reicht Basic aus und es ist nichts Weiteres nötig. Wenn du die Daten einmalig statt wiederholt brauchst, ist mein Scraping-Service ein Zehntel des Preises und die richtige Lösung. Ich sage es dir, anstatt dich aufzukläufen.
