Ich werde deine unordentlichen Datensätze abgleichen, zusammenführen und Duplikate entfernen

Einige Informationen wurden automatisch übersetzt.

Mexiko

Ich spreche Spanisch, Englisch, Französisch

PhD-Kandidat in Astrophysik, Statistische Beratung

PhD-Kandidat in Astrophysik. Ich verbringe meine Tage mit Statistik an unordentlichen, unvollständigen, korrelierten Daten – Galaxienkataloge, bei denen nichts sauber ist und jedes Fehlerbalken vertei...
Über diesen Service

Zwei Listen mit denselben Personen, Produkten oder Orten, kein gemeinsamer ID: unterschiedlich geschriebene Namen, Tippfehler, fehlende Felder. Excel's VLOOKUP gibt sofort auf.


Ich mache probabilistische Datensatzverknüpfung: Statt "Übereinstimmung / keine Übereinstimmung" erhält jedes Kandidatenpaar eine Punktzahl, wie wahrscheinlich es ist, dass es dieselbe Entität ist, basierend auf der tatsächlichen Bedeutung der Übereinstimmung in jedem Feld. Bei seltenen Nachnamen ist eine Übereinstimmung ein starkes Indiz; bei häufigen ist es schwächer. Die Methode kennt den Unterschied.


Warum das für dich wichtig ist: Du kannst den Schwellenwert selbst festlegen. Hohe Sicherheit für automatisches Zusammenführen und eine separate Liste mit zweifelhaften Paaren für eine menschliche Überprüfung, anstatt versehentlich zwei verschiedene Kunden zu verschmelzen oder denselben doppelt zu behalten.


Ich verwende das bei astronomischen Katalogen, wo das falsche Zusammenfügen zweier Objekte die Wissenschaft ungültig macht. Deine Daten verdienen die gleiche Sorgfalt.


Was ich liefere: dein zusammengeführter Datensatz mit einer Vertrauenswürdigkeit für jede Übereinstimmung; eine separate "Überprüfung erforderlich"-Liste für zweifelhafte Fälle; einen Qualitätsbericht darüber, wie viele Übereinstimmungen es gab, wie viele nicht, und warum; sowie Duplikate innerhalb jeder Datei, nicht nur zwischen ihnen.


Sende zuerst eine kleine Probe, wenn du sehen möchtest, wie es funktioniert, bevor du bestellst.

Technologie:

Python

Expertise:

Datenmanipulation

Datenvalidierung

etl

Normalisierung