Ich werde Daten bereinigen, duplikate entfernen und normalisieren mit Python
Türkei
103 Aufträge abgeschlossen
Full Stack Entwickler und Automatisierungsspezialist mit 88 hervorragenden Bewertungen
Level 2
Hat hohe Leistungskriterien erfüllt und verfügt über eine nachgewiesene Erfolgsbilanz bei der Erfüllung von Kundenerwartungen.
Über diesen Service
Unordentliches Dataset bremst dich aus? Ich mache professionelle Datenbereinigung bei CSV-, Excel-, JSON- und SQL-Dumps. Duplikate entfernt, Felder normalisiert, Daten geparst, fehlende Werte behandelt.
Was ich bereinige:
+ CSV-, Excel-, JSON-, SQL-Dumps, TSV, Parquet
+ Gescrapte Produktkataloge und Preislisten
+ Kunden- und Mailinglisten
+ Umfrage-Exporte und Formularübermittlungen
+ Unordentliche Transaktions- oder Inventardateien
Was ich mache:
+ Duplikatentfernung mit benutzerdefinierten Schlüsselregeln
+ String-Normalisierung (Groß-/Kleinschreibung, Leerzeichen, Kodierung)
+ Datum, Telefon- und Adressparsing
+ Umgang mit fehlenden Werten (imputieren, entfernen, markieren)
+ Ausreißererkennung und Feldzuordnung
Werkzeuge, die ich verwende:
+ Pandas, numpy, SQL, regex, Python
Was du bekommst:
+ Sauberes, strukturiertes Dataset im gewählten Format
+ Python-Skript zur Datenbereinigung, das du erneut ausführen kannst
+ Dokumentation aller angewendeten Regeln
89 Fünf-Sterne-Bewertungen auf meinem Profil und über 30 Scraping-Projekte, bei denen ich unordentliche Daten end-to-end bereinigt habe. Ich weiß genau, wie kaputt echte Dateien werden.
Wichtig: Schreibe mir VOR der Bestellung eine Nachricht mit einer Beispiel-Datei und deinen Reinigungsregeln. Ich bestätige Umfang und Zeitplan.
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Dateiformate unterstützen Sie?
CSV, Excel (xlsx und xls), JSON, TSV, SQL-Dumps, Parquet und Klartext. Falls dein Format ungewöhnlich ist, schick mir eine Probe und ich bestätige es, bevor du bestellst.
Wie viele Zeilen kannst du reinigen?
Basic deckt bis zu 5000 Zeilen ab, Standard bis zu 50.000, Premium ist unbegrenzt. Für sehr große Datensätze baue ich eine Pipeline und verarbeite sie in Teilen.
Wie entscheidest du, was als Duplikat gilt?
Du sagst mir die Schlüsselspalten. Falls du unsicher bist, schlage ich eine Regelnliste vor, basierend auf den Daten, und du genehmigst sie, bevor ich loslege.
Wie gehst du mit fehlenden Werten um?
Drei Optionen: aus anderen Zeilen oder externen Quellen imputieren, Zeile entfernen oder für Überprüfung markieren. Ich bestätige pro Spalte, bevor ich starte.
Bekomme ich das Python-Skript oder nur die sauberen Daten?
Beides ab Standard. Das Skript ist wiederverwendbar für zukünftige Dateien und kommt mit einer dokumentierten Regelnliste.
Sind meine Daten vertraulich?
Ja. Ich arbeite in einem privaten Workspace, lösche deine Dateien nach der Lieferung auf Wunsch und unterschreibe bei Bedarf eine NDA.
Kannst du mit Daten und Adressen in gemischten Formaten umgehen?
Ja. Daten werden in ISO 8601 umgewandelt, Telefonnummern in E.164, Adressen standardisiert. Randfälle werden für deine Überprüfung markiert.

