Ich erstelle Python-Web-Scraping-Bots und KI-Datenextraktions-Pipelines
LLM-Ingenieur und Data Scientist: NLP, GenAI, ML, die Ergebnisse liefern
Über diesen Service
Ich entwickle Scraper und Datenpipelines, die auch nach dem ersten Lauf weiterarbeiten.
8 Jahre in Data Engineering und KI. Frühere Arbeiten:
- Verteilte Crawler für Facebook, Instagram, TikTok, Twitter, Suchmaschinen und E-Commerce-Seiten gebaut, die Geschäftsberichte für das Management liefern
- Ein ETL-Pipeline entwickelt, die über 10 Millionen Buchdatensätze von Amazon, Ingram und Goodreads normalisiert und automatisch 50 % der Duplikate und Konflikte auflöst
- Crawler gebaut, die Rohdaten in ein internes KI-Produkt einspeisen
Was ich machen kann:
- Produkt-, Preis- und Bewertungsdaten von E-Commerce-Shops
- Geschäftslisten und Verzeichnisse für Lead-Recherche
- Immobilien-, Job-, Nachrichten- und Event-Listings
- JavaScript-intensive Seiten, unendliches Scrollen und Login-Seiten, auf die du Zugriff hast
- KI-Extraktion: unordentliche Seiten und PDFs in saubere, strukturierte Felder mit LLMs umwandeln
- Geplante Läufe, die frische Daten an Google Sheets, eine Datenbank oder deine API senden
Tools: Python, Scrapy, Playwright, Selenium, BeautifulSoup, Pandas, PostgreSQL, MongoDB, AWS
Jede Lieferung wird vor Übergabe gereinigt, dedupliziert und geprüft.
Ich scrape nur öffentlich verfügbare Daten. Schick mir den Link der Website vor der Bestellung, damit ich bestätigen kann, ob es möglich ist.
Technologie:
Python
•
scrapy
•
Selen
•
Apollo
•
E-Mail-Extraktor
Technik:
Automatisiert
FAQ
Automatische Übersetzung
Können Sie jede Website schaben?
Die meisten öffentlichen Websites, ja. Einige Seiten blockieren Scraping stark oder verbieten es in ihren Nutzungsbedingungen. Schick mir den Link vor der Bestellung, dann bestätige ich, was möglich ist und wie lange es dauert.
Lieferst du den Code oder nur die Daten?
Data Pull liefert nur Daten. Scraper + Code und Automatisierte Pipeline beinhalten den vollständigen Python-Quellcode, den du selbst wieder ausführen kannst.
Kannst du Daten nach einem Zeitplan scrapen?
Ja. Die Automatisierte Pipeline läuft täglich, wöchentlich oder in jedem gewünschten Intervall, mit Benachrichtigungen, falls sich eine Seite ändert und der Scraper aktualisiert werden muss.
In welchen Formaten kann ich die Daten erhalten?
CSV, Excel, JSON, Google Sheets oder direkt in deine PostgreSQL-, MySQL- oder MongoDB-Datenbank. Ich kann die Daten auch über eine einfache API bereitstellen.
Wie nutzt du KI beim Scraping?
Bei Seiten ohne klare Struktur, wie PDFs, Listings oder Freitextbeschreibungen, nutze ich LLMs, um Felder wie Namen, Preise und Spezifikationen in eine einheitliche Tabelle zu extrahieren.
Scrapst du persönliche Daten oder hinter Logins?
Ich scrape nur öffentlich zugängliche Daten und Seiten hinter einem Login nur, wenn du den Account besitzt und Zugriff auf die Daten hast. Ich sammle keine privaten persönlichen Informationen.

