Ich werde Daten von jeder Website mit Selenium und BeautifulSoup scrapen
Student an der NIT Surat
Über diesen Service
Benötigst du saubere, strukturierte Daten, die von dynamischen Websites, Verzeichnissen oder öffentlichen Listen extrahiert werden?
Ich erstelle individuelle Web Scraper, um Daten von jeder Website zu extrahieren, auch von solchen mit dynamischem JavaScript, unendlichem Scrollen, Paginierung oder interaktiven Elementen. Mit Python (Selenium/BeautifulSoup) für das Scraping und Pandas für gründliche Datenbereinigung liefere ich Datensätze, die zu 100 % für Analysen bereit sind.
Was ich Scrape:
- Öffentliche Branchenverzeichnisse & Lead-Listen (Telefonnummern, E-Mails, Adressen, Karten)
- Immobilienangebote & Jobbörsen (Titel, Beschreibungen, Standorte, Gehälter)
- E-Commerce & Produktkataloge (Preise, Spezifikationen, SKUs, Bewertungen, Bild-URLs)
- Veranstaltungsliste, Marktdaten & Social Profiles
Komplette Datenbereinigung (Pandas Cleaning):
- Kein roher Textchaos: Entfernen von Währungszeichen ($), Kommas und Sonderzeichen mit Regex.
- Korrekte Datentypen: Umwandlung von Textzahlen in richtige numerische Fließkommazahlen/ Ganzzahlen, damit du sofort Formeln verwenden kannst.
- Feldaufteilung: Aufteilung von kombinierten Texten (z.B. vollständige Adressen in Straße, Stadt, Bundesland, PLZ).
- Sauberer Output: Duplikate entfernen und fehlende Werte (NaN) richtig handhaben.
Sauberer .xlsx (Excel), .csv, .json oder ein vollständig dokumentiertes Python-Automatisierungsskript
Technologie:
Python
•
Excel
•
Selen
•
Beautiful Soup
•
Pandas
Informationstyp:
BILDER
•
Immobilien
•
E-Mails
•
Websites
•
Links
Technik:
Automatisiert

