Ich werde Python Web Scraping oder PDF-Datenextraktion in Excel, CSV oder json durchführen
Web-App, Automatisierung und Chatbot-Entwickler
Über diesen Service
Benötigst du Daten von einer Webseite, einem Verzeichnis, einem Online-Katalog oder aus Hunderten von PDFs und Rechnungen? Ich extrahiere sie und liefere einen sauberen, einsatzbereiten Datensatz in Excel, CSV, JSON oder Google Sheets.
Typische Aufträge:
- Produktkataloge und Preislisten
- Branchenverzeichnisse, Einträge und öffentliche Register
- Tabellen und Positionen aus PDF-Rechnungen, Berichten oder gescannten Dokumenten
- Öffentliche Statistiken, offene Daten und Artikel für Analysen
- Preisüberwachung, die automatisch neu läuft (Premium)
Was du bekommst:
- Duplikatfreie, gereinigte und einheitlich formatierte Daten
- Genau die Spalten, die du angefragt hast, mit einer Probe innerhalb von 12 Stunden
- Eine Validierungszusammenfassung (gesammelte Zeilen, Lücken, Notizen)
- Ein wiederverwendbares Python-Skript mit Anweisungen (Standard und Premium)
Ich arbeite nur mit öffentlich zugänglichen Daten, unter Einhaltung der Website-Bedingungen und Datenschutzgesetze: keine persönliche Daten-Erfassung, kein Umgehen von Login oder CAPTCHA.
Lieferungen in Englisch, Französisch, Niederländisch, Deutsch, Spanisch, Türkisch, Arabisch und mehr.
Sende mir den Link oder eine Beispiel-Datei, und ich bestätige die Machbarkeit und das passende Paket, bevor du bestellst.
Technologie:
Python
•
scrapy
•
Beautiful Soup
•
Dramatiker
•
Pandas
Technik:
Automatisiert
FAQ
Automatische Übersetzung
Können Sie jede Website schaben?
Bei den meisten öffentlichen Webseiten ja. Plattformen, deren Nutzungsbedingungen Scraping verbieten (Marktplätze, soziale Netzwerke, Bewertungsseiten) und sites mit Login-Schutz werden abgelehnt. Sende den Link vor der Bestellung: Ich bestätige schriftlich, was möglich ist, welche Spalten und ungefähr wie viele Zeilen du bekommst. Diese Nachricht ist der Auftragsumfang.
Was zählt als eine Quelle?
Eine Webseite (alle Seiten desselben Typs, z.B. jede Produktseite eines Shops) oder eine Charge von PDFs mit gleichem Layout.
In welchem Format erhalte ich?
Excel (.xlsx), CSV, JSON oder Google Sheets, mit den von dir angegebenen Spalten.
Lieferst du das Script?
Ja, in Standard und Premium, mit Anweisungen, damit du es selbst erneut laufen lassen kannst. Geplante Scraper (Premium) laufen auf deinem eigenen Konto, z.B. GitHub Actions oder einem kleinen Server; ich richte es mit dir ein.
Was ist mit persönlichen Daten?
Von Webseiten sammle ich keine persönlichen Daten von Einzelpersonen (private E-Mails, Telefonnummern) oder alles, was gegen GDPR verstößt. Das Extrahieren von Daten aus deinen eigenen Dokumenten, wie Rechnungen, ist in Ordnung.
Kannst du Daten aus gescannten PDFs extrahieren?
Ja, inklusive OCR für Scans. Die Genauigkeit wird zuerst an einer Probe überprüft.
Gibt es Projekte, die ausgeschlossen sind?
Alles im Zusammenhang mit Glücksspiel, Erwachsenen-Inhalten, Alkohol, Musik/Unterhaltung, Dating, interessenbasierte Kredit- oder Investitionsprodukte oder Schul-/Uni-Aufgaben, die als deine eigene Arbeit eingereicht werden sollen, sowie alles, was gegen die Nutzungsbedingungen einer Webseite verstößt.

