Ich erstelle einen geplanten Web-Scraper und Datenpipeline mit sauberer, deduplizierter Ausgabe
Python-Automatisierungs- und Datenentwickler
Über diesen Service
Benötigst du täglich oder wöchentlich frische Web-Daten, ohne ein Skript manuell neu auszuführen? Ich baue einen Scraper, der automatisch nach einem Zeitplan läuft, die gesammelten Daten bereinigt, doppelte Einträge entfernt und dir eine Datei oder Datenbank liefert, die sofort einsatzbereit ist.
Was du bekommst: einen Python-Scraper (Playwright oder Scrapy, wo die Seite es braucht), automatische Ausführungen auf deinem Rechner oder Server, Validierung jedes Datensatzes, einen eindeutigen Schlüssel pro Eintrag, damit nichts doppelt erscheint, Wiederholungen bei langsamen Seiten, und ein Log, das in einfachen Worten erklärt, wenn eine Ausführung fehlgeschlagen ist und warum. Ausgabe: CSV, XLSX, JSON oder SQLite.
Warum ich: Für einen Kunden habe ich eine ähnliche Pipeline gebaut: tägliche Ingestion öffentlicher Datensätze, Duplikatentfernung, regelbasierte Bewertung, automatische Ausführungen und Absturz-Wiederherstellung. Eine echte Monatslaufzeit hat 318.962 Datensätze in etwa 34 Minuten mit 0 Fehlern verarbeitet. Der Kunde ist vertraulich.
Nicht enthalten: Seiten hinter einem Login, den du nicht besitzt, CAPTCHA-Umgehung, Daten, deren Sammlung durch die Nutzungsbedingungen der Seite verboten ist, Hosting- oder Proxy-Kosten. Ich sage dir vorher, wenn eine Seite nicht geeignet ist.
Technologie:
Python
•
Excel
•
scrapy
•
Dramatiker
•
Pandas
Technik:
Automatisiert
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Websites kannst du scrapen?
Öffentliche Seiten, inklusive solcher mit viel JavaScript. Ich prüfe die Seite und ihre Nutzungsbedingungen zuerst. Seiten hinter einem Login, den du nicht besitzt, oder die Scraping verbieten, sind nicht geeignet.
Wie werden die geplanten Ausführungen eingerichtet?
Mit cron (Linux/Mac) oder Task Scheduler (Windows) auf deinem Rechner oder Server, oder einem Docker-Container im Premium-Plan. Hosting-Kosten gehen zu deinen Lasten.
Was, wenn sich die Website später ändert?
Layout-Änderungen können einen Scraper kaputt machen. Innerhalb des Revision-Fensters behebe ich, was ich geliefert habe; spätere Korrekturen sind eine neue kleine Bestellung. Das Fehlerprotokoll zeigt dir, wenn eine Ausführung nichts zurückgibt.
Was bedeutet 'Seiten gescraped'?
Fiverr legt eine Seitenzahl pro Paket fest. Hier ist die Anzahl der Seiten, die bei jeder geplanten Ausführung abgerufen werden darf: 100 im Basic, 500 im Standard, 1500 im Premium. Größere Aufträge: schreib mir zuerst.
