Ich werde dein unordentliches Dataset mit Python und Pandas bereinigen und vorverarbeiten

Einige Informationen wurden automatisch übersetzt.

Pakistan

Ich spreche Englisch, Urdu
Abschlussjahr im Bereich Software Engineering in Pakistan, arbeite mit Python, Pandas und scikit-learn an echten ML-Projekten. Kürzlich habe ich ein ML-Praktikum absolviert, bei dem ich Produktionsda...
Über diesen Service

Unordentliche Daten bremsen alles aus, falsche Datentypen, fehlende Werte, doppelte Zeilen, inkonsistente Formatierung. Ich werde dein Dataset mit Python und Pandas säubern, damit es bereit für Analyse oder Modellierung ist.

Vor Kurzem habe ich genau dieses Problem im großen Stil während eines ML-Praktikums gelöst, indem ich Daten aus 18 monatlichen Dateien (~79 Millionen Zeilen insgesamt) für ein produktionsähnliches Scoring-Modell gereinigt und vorbereitet habe, inklusive der Behebung eines kniffligen Bugs, bei dem eine numerische Spalte stillschweigend als ungültiger Typ gespeichert wurde und richtig konvertiert werden musste, bevor sie verwendet werden konnte.

Was ich liefern werde:

  • Doppelte und irrelevante Zeilen entfernt
  • Fehlende Werte richtig behandelt (nicht nur blind gelöscht)
  • Datentypen korrigiert und validiert
  • Saubere, einsatzbereite CSV/Excel-Ausgabe
  • Kurznotiz darüber, was ich gefixt habe und warum

Sende mir deine Datei und sag mir, was du damit vorhast, ich kümmere mich um den Rest.