Ich erstelle einen geplanten Web-Scraper und Datenpipeline mit sauberer, deduplizierter Ausgabe

Einige Informationen wurden automatisch übersetzt.

Tunesien

Ich spreche Arabisch, Englisch, Französisch

Python-Automatisierungs- und Datenentwickler

Ich bin ein Python-Entwickler, der sich darauf spezialisiert hat, chaotische Daten in zuverlässige, strukturierte Ausgaben umzuwandeln. Ich erstelle Web-Scraper, geplante Datenpipelines und Text-zu-JS...
Über diesen Service

Benötigst du täglich oder wöchentlich frische Web-Daten, ohne ein Skript manuell neu auszuführen? Ich baue einen Scraper, der automatisch nach einem Zeitplan läuft, die gesammelten Daten bereinigt, doppelte Einträge entfernt und dir eine Datei oder Datenbank liefert, die sofort einsatzbereit ist.


Was du bekommst: einen Python-Scraper (Playwright oder Scrapy, wo die Seite es braucht), automatische Ausführungen auf deinem Rechner oder Server, Validierung jedes Datensatzes, einen eindeutigen Schlüssel pro Eintrag, damit nichts doppelt erscheint, Wiederholungen bei langsamen Seiten, und ein Log, das in einfachen Worten erklärt, wenn eine Ausführung fehlgeschlagen ist und warum. Ausgabe: CSV, XLSX, JSON oder SQLite.


Warum ich: Für einen Kunden habe ich eine ähnliche Pipeline gebaut: tägliche Ingestion öffentlicher Datensätze, Duplikatentfernung, regelbasierte Bewertung, automatische Ausführungen und Absturz-Wiederherstellung. Eine echte Monatslaufzeit hat 318.962 Datensätze in etwa 34 Minuten mit 0 Fehlern verarbeitet. Der Kunde ist vertraulich.


Nicht enthalten: Seiten hinter einem Login, den du nicht besitzt, CAPTCHA-Umgehung, Daten, deren Sammlung durch die Nutzungsbedingungen der Seite verboten ist, Hosting- oder Proxy-Kosten. Ich sage dir vorher, wenn eine Seite nicht geeignet ist.

Technologie:

Python

•

Excel

•

scrapy

•

Dramatiker

•

Pandas

Informationstyp:

Wettbewerbsanalyse

•

Notierungen

Technik:

Automatisiert

Mein Portfolio