Duplikate zu entfernen klingt einfach, bis zwei Zeilen fast, aber nicht vollständig gleich sind. Sicherer ist es, zuerst festzulegen, was Eindeutigkeit im jeweiligen Datensatz bedeutet.
Exakte und fachliche Duplikate
Ein exaktes Duplikat wiederholt alle Werte. Ein fachliches Duplikat beschreibt dieselbe Entität, obwohl einzelne Felder abweichen.
Zwei Zeilen können dieselbe Kunden-ID besitzen, aber unterschiedliche Telefonnummern. Eine davon blind zu löschen könnte eine gültige Aktualisierung entfernen.
Den richtigen Schlüssel wählen
Kunden-ID, SKU oder Vorgangsnummer sind meist zuverlässiger als ein Name. Manchmal wird ein zusammengesetzter Schlüssel wie filiale_id + produkt_id benötigt.
Mit CSV-Duplikate entfernen lässt sich eine spaltenbasierte Regel anwenden.
Vorher bereinigen
Leerzeichen und unterschiedliche Groß-/Kleinschreibung können Duplikate verstecken. Normalisieren Sie nur Felder, die nach Ihrer fachlichen Regel tatsächlich als gleich gelten sollen.