🗑️ Duplikate entfernen
Entfernen Sie doppelte Zeilen aus jeder Liste sofort. Kostenlos, ohne Registrierung.
Es wurden noch keine Duplikate entfernt.
Klicken Sie auf „Duplikate entfernen", um zu beginnen.
Was jede Schaltfläche tatsächlich entfernt, umordnet oder anzeigt
Die Kurzfassung: Zwei Schaltflächen entfernen Duplikate und behalten Ihre ursprüngliche Reihenfolge bei, eine Schaltfläche entfernt Duplikate und alphabetisiert dann, was übrig bleibt, und eine Schaltfläche entfernt überhaupt nichts, sie zeigt Ihnen nur, was wiederholt wird.
john@email.com
jane@email.com
John@Email.com
bob@email.com
jane@email.comjohn@email.com
jane@email.com
John@Email.com
bob@email.com| Schaltfläche | Groß-/Kleinschreibung | Behält ursprüngliche Reihenfolge | Wechselt ab 5.000 Zeilen zu einem Hintergrund-Thread |
|---|---|---|---|
| Duplikate entfernen | Exakter Abgleich mit Beachtung der Groß-/Kleinschreibung | Ja | Ja |
| Groß-/Kleinschr. ignorieren | Abgleich ohne Beachtung der Groß-/Kleinschreibung | Ja | Ja |
| Sortieren + Dedup | Exakter Abgleich mit Beachtung der Groß-/Kleinschreibung | Nein, alphabetisiert | Nein |
| Duplikate anzeigen | Exakter Abgleich mit Beachtung der Groß-/Kleinschreibung | Entfernt nichts | Nein |
Jede dieser vier Schaltflächen führt den gleichen ersten Schritt aus, bevor sie eine einzige Zeile vergleicht: Der eingefügte Text wird an den Zeilenumbrüchen aufgeteilt, bei jeder Zeile werden die führenden und abschließenden Leerzeichen abgeschnitten, und jede Zeile, die nun leer ist, wird vollständig aus der Liste entfernt. Was diesen Durchlauf überlebt, ist das, womit der Rest der Logik der Schaltfläche arbeitet. Dieser erste Schritt ist für "Duplikate entfernen" und "Groß-/Kleinschr. ignorieren" identisch, sodass der einzige wirkliche Unterschied zwischen ihnen die einzige Vergleichsregel darunter ist, nicht das Abschneiden oder die Behandlung leerer Zeilen darum herum.
Nur "Duplikate entfernen" und "Groß-/Kleinschr. ignorieren" senden ihre gelöschten Zeilen an das Feld "Entfernte Duplikate" auf der rechten Seite. "Sortieren + Dedup" füllt dieses Feld ebenfalls, da es vor dem Sortieren dedupliziert. "Duplikate anzeigen" berührt es nie, da es nichts entfernt, sondern nur das neu anordnet, was im Haupteditor verbleibt.
Große Listen verhalten sich je nach Schaltfläche unterschiedlich. Ab 5.000 Zeilen übergeben "Duplikate entfernen" und "Groß-/Kleinschr. ignorieren" an einen Web Worker im Hintergrund, damit der Tab reaktionsfähig bleibt. "Sortieren + Dedup" und "Duplikate anzeigen" haben keine solche Übergabe und laufen immer direkt auf der Seite, sodass ein ungewöhnlich großes Einfügen den Tab kurz anhalten lassen kann, wenn Sie auf eine dieser beiden klicken.
Standardmäßig Groß-/Kleinschreibung beachten: Wenn Apple und apple als zwei zählen
Duplikate entfernen behandelt die Groß-/Kleinschreibung als Teil des Textes. Klicken Sie stattdessen auf Groß-/Kleinschr. ignorieren und apple, Apple und APPLE werden zu der Schreibweise zusammengefasst, die als erstes eingefügt wurde.
john@email.com
jane@email.com
John@Email.com
bob@email.comjohn@email.com
jane@email.com
bob@email.comBeide Spalten beginnen mit derselben eingefügten Liste: john@email.com, jane@email.com, John@Email.com, bob@email.com, jane@email.com. Einfaches "Duplikate entfernen" erfasst nur die exakte Wiederholung von jane@email.com in der letzten Zeile, da Zeilen genau so verglichen werden, wie sie geschrieben wurden. John@Email.com überlebt direkt neben john@email.com, da für einen Vergleich, der die Groß-/Kleinschreibung beachtet, Groß- und Kleinbuchstaben einfach unterschiedliche Zeichen sind.
Diese Standardeinstellung ist korrekt für Daten, bei denen die Groß-/Kleinschreibung wirklich eine Bedeutung hat: Produkt-SKUs, Benutzernamen, die Groß-/Kleinschreibung beachten, und Codes, bei denen sich ABC123 und abc123 möglicherweise auf völlig unterschiedliche Datensätze beziehen. Es ist die falsche Standardeinstellung für eine E-Mail-Liste, da john@email.com und John@Email.com auf denselben Posteingang verweisen und das zweimalige Senden an dieselbe Adresse genau das ist, was das Deduplizieren verhindern sollte.
Groß-/Kleinschr. ignorieren ist eine Schaltfläche, kein Kontrollkästchen. Ein Klick darauf wandelt jede Zeile nur zu Vergleichszwecken in Kleinbuchstaben um, behält die erste Schreibweise bei, die für jeden eindeutigen Wert gefunden wurde, und führt die gesamte Entfernung mit diesem einen Klick aus. Es schaltet keine dauerhafte Einstellung um, die ändert, was die einfache Schaltfläche Duplikate entfernen beim nächsten Drücken tut. Es gibt auch keine teilweise Option, keine Möglichkeit, die Groß-/Kleinschreibung für einen Teil einer Zeile oder nur außerhalb eines Domainnamens zu ignorieren. Die Wahl ist binär: Vergleichen Sie jede Zeile genau wie eingegeben, oder wandeln Sie jede Zeile vor dem Vergleichen in Kleinbuchstaben um.
Sortieren + Dedup hat keine Version von sich selbst, die die Groß-/Kleinschreibung ignoriert. Es vergleicht Zeilen immer genau, genau wie die einfache Schaltfläche Duplikate entfernen. Wenn Sie sowohl ein Ergebnis ohne Beachtung der Groß-/Kleinschreibung als auch ein alphabetisiertes benötigen, klicken Sie zuerst auf Groß-/Kleinschr. ignorieren, um die Varianten zusammenzufassen, und klicken Sie dann auf Sortieren + Dedup, um das, was übrig bleibt, zu alphabetisieren. Wenn Sie Sortieren + Dedup allein auf Daten mit gemischter Groß-/Kleinschreibung ausführen, wird jede Variante beibehalten, die es nicht als identisch erkennt.
Warum abgeschnittene Leerzeichen einige Duplikate beheben und andere nicht
Jeder Vergleich schneidet zuerst den Anfang und das Ende jeder Zeile ab. Ein verirrtes führendes oder abschließendes Leerzeichen verursacht niemals eine falsche Nichtübereinstimmung. Ein doppeltes Leerzeichen in der Mitte einer Zeile zählt immer noch als anderer Text.
john@email.com
john@email.comjohn@email.comDie beiden obigen Zeilen sehen identisch aus, und für Ihre Augen sind sie es auch. Die zweite wurde mit einem unsichtbaren abschließenden Leerzeichen eingefügt, die Art, die kostenlos mitkommt, wenn Sie einen Wert aus einer Tabellenzelle oder einer PDF-Tabelle kopieren. Bevor dieses Tool etwas vergleicht, entfernt es führende und abschließende Leerzeichen aus jeder Zeile, sodass das abschließende Leerzeichen nie die Chance bekommt, zwei ansonsten identische Zeilen unterschiedlich aussehen zu lassen. Das Ergebnis ist eine einzige überlebende Zeile, genau wie es sein sollte.
Was das Abschneiden nicht bewirkt, ist das Berühren von Leerzeichen innerhalb einer Zeile. New York und New York, die zweite mit zwei Leerzeichen zwischen den Wörtern anstelle von einem, werden an ihren Rändern auf die gleiche Weise abgeschnitten, unterscheiden sich aber immer noch in der Mitte, sodass keine der vier Schaltflächen sie als Duplikate behandelt. Das automatische Reduzieren von internen Leerzeichen würde das Risiko bergen, zwei wirklich unterschiedliche Wörter zusammenzuführen, daher belässt dieses Tool es absichtlich dabei. Tabulatoren werden auf die gleiche Weise wie Leerzeichen abgeschnitten: Eine Zeile, die mit einem Tabulatorzeichen anstelle eines Leerzeichens beginnt, wird genauso sauber entfernt, da der Abschneideschritt jede Art von Leerzeichen von beiden Enden einer Zeile entfernt, nicht nur das Leerzeichen speziell.
Inkonsistente interne Abstände überleben jede Schaltfläche auf dieser Seite. Wenn Ihre Daten Einträge wie New York und New York nebeneinander haben, wird das Deduplizieren sie nicht erfassen, da das Abschneiden immer nur die beiden Enden einer Zeile berührt. Normalisieren Sie die internen Abstände zuerst von Hand oder mit einem Suchen-und-Ersetzen-Durchlauf und führen Sie die Entfernung dann erneut aus.
Welche Kopie überlebt und ob die Liste in der richtigen Reihenfolge bleibt
Sowohl Duplikate entfernen als auch Groß-/Kleinschr. ignorieren behalten jede überlebende Zeile genau dort, wo sie war. Sortieren + Dedup behält das gleiche erste Vorkommen, alphabetisiert dann das Ergebnis, sodass die ursprüngliche Reihenfolge weg ist.
Banana
Apple
CherryApple
Banana
CherryFügen Sie Banana, Apple, Banana, Cherry ein und beide Schaltflächen sind sich einig, welche Kopie von Banana beibehalten werden soll: die erste, auf die sie stoßen, während sie die Liste von oben nach unten scannen. Wo sie sich nicht einig sind, ist, was mit den Überlebenden danach passiert. Duplikate entfernen belässt Banana, Apple, Cherry genau in dieser Reihenfolge, da nichts an dem Entfernungsschritt etwas umordnet, er nimmt nur Zeilen heraus. Sortieren + Dedup nimmt die gleichen drei Überlebenden und alphabetisiert sie, wobei sie stattdessen auf Apple, Banana, Cherry landen.
Die Beibehaltung der ursprünglichen Reihenfolge ist wichtig, wenn die Abfolge Ihrer Daten eigene Informationen trägt: ein chronologisches Protokoll, eine Liste, bei der der erste Eintrag der kanonische Datensatz ist und spätere versehentliche erneute Einfügungen sind, oder jeder Datensatz, bei dem eine Neusortierung etwas über Priorität oder Zeitpunkt löschen würde. Greifen Sie speziell zu Sortieren + Dedup, wenn Sie eine saubere alphabetisierte Referenzliste wünschen und die Reihenfolge, in der die Daten ankamen, von Anfang an nie aussagekräftig war. Diese Regel für das erste Vorkommen ist auch auf jeder Schaltfläche hier festgelegt: Nichts auf dieser Seite behält das letzte Vorkommen einer wiederholten Zeile anstelle des ersten, daher gibt es keine Einstellung zum Umschalten, wenn das, was Sie eigentlich wollten, die aktuellste Kopie war.
Das Feld "Entfernte Duplikate" folgt ebenfalls der Scan-Reihenfolge. Unabhängig davon, ob Sie auf Duplikate entfernen, Groß-/Kleinschr. ignorieren oder Sortieren + Dedup geklickt haben, die Zeilen, die im rechten Feld angezeigt werden, werden in der Reihenfolge aufgelistet, in der sie beim Scannen angetroffen wurden, nicht gruppiert danach, welche überlebende Zeile sie dupliziert haben, und nicht alphabetisiert.
Warum ein falsch geschriebenes Duplikat unberührt durchrutscht
Jeder Vergleich hier ist exakt. John Smith und Jon Smith oder Acme Inc. und Acme Inc sind zwei verschiedene Zeilen für dieses Tool, nicht ein Duplikat und ein Tippfehler des anderen.
John Smith
Jon Smith
Acme Inc.
Acme IncJohn Smith
Jon Smith
Acme Inc.
Acme IncKlicken Sie in dieser Liste auf Duplikate entfernen und es ändert sich nichts. Alle vier Zeilen werden beibehalten, und das Tool teilt Ihnen dies mit der Meldung "Keine Duplikate gefunden!" mit, da jeder Vergleich, den es anstellt, eine zeichenweise Übereinstimmung der abgeschnittenen und optional in Kleinbuchstaben umgewandelten Zeile ist. Es hat kein Konzept von "nah genug". Ein Ein-Buchstaben-Tippfehler, ein fehlender abschließender Punkt oder ein Bindestrich, der gegen ein Leerzeichen ausgetauscht wurde, erzeugen alle zwei Zeilen, die einfach nichts miteinander zu tun haben, soweit es eine Schaltfläche hier betrifft.
Das ist eine bewusste Einschränkung, kein Versehen. Die Entscheidung, wie ähnlich zwei Zeilen sein müssen, bevor sie als dasselbe zählen, was normalerweise mit etwas wie der Bearbeitungsdistanz gemessen wird, ist eine grundlegend andere Art von Algorithmus als ein exakter Vergleich, und sie trifft Ermessensentscheidungen, die je nach Datensatz variieren. Es in die andere Richtung falsch zu machen, indem zwei Datensätze zusammengeführt werden, die nur ähnlich aussehen, kann echte Daten im Stillen zerstören, was ein schlechteres Ergebnis ist, als ein offensichtliches Beinahe-Duplikat in der Liste zu belassen, damit ein Mensch es abfangen kann.
Eine praktische Methode zum Umgang mit unordentlichen Daten: Führen Sie zuerst Duplikate anzeigen aus, um zu sehen, wie viele exakte Wiederholungen bereits vorhanden sind, standardisieren Sie die offensichtlichen Formatierungsunterschiede von Hand oder mit einem Suchen-und-Ersetzen-Durchlauf, konsistenter Groß- und Kleinschreibung, konsistenter Zeichensetzung, konsistenten Abkürzungen, und führen Sie dann Duplikate entfernen erneut aus. Die Bereinigung, die Beinahe-Duplikate in exakte Übereinstimmungen verwandelt, ermöglicht es diesem Tool, sie zu erfassen.
Was Duplikate anzeigen tatsächlich anzeigt und in welcher Reihenfolge
Duplikate anzeigen listet jeden Wert auf, der mehr als einmal erscheint, jeweils einmal, ohne etwas zu löschen. Wenn Ihre Liste einfache Zahlen mit Wörtern mischt, kommen die Zahlen zuerst in aufsteigender Reihenfolge, nicht in der Reihenfolge, in der Sie sie eingefügt haben.
100
5
zebra
100
5
zebra5
100
zebra"Duplikate anzeigen" zählt, wie oft jede abgeschnittene Zeile erscheint, behält nur die Werte, die mehr als einmal erscheinen, und ersetzt den Inhalt des Editors durch diese Liste, ein Eintrag pro dupliziertem Wert anstelle eines Eintrags pro Wiederholung. Eine fünfmal eingefügte Zeile erscheint einmal im Ergebnis, da der Punkt darin besteht, zu zeigen, welche Werte sich wiederholen, nicht wie viele Kopien vorhanden sind. Nichts in Ihrem ursprünglichen Text wird durch diese Schaltfläche geändert oder entfernt.
Die Nummernfolge im obigen Beispiel ist keine Sortierfunktion. Sie ergibt sich daraus, wie das JavaScript-Objekt, das Ihre Zeilen zählt, seine eigenen Schlüssel ordnet: Einträge, die wie einfache nicht negative ganze Zahlen aussehen, wie 5 und 100, werden immer zuerst in aufsteigender numerischer Reihenfolge aufgelistet, vor jedem anderen duplizierten Wert, der dann in der Reihenfolge erscheint, in der er zuerst angetroffen wurde. Das zeigt sich nur, wenn Ihre duplizierten Daten bloße numerische Zeilen mit Textzeilen mischen. Eine Liste duplizierter Namen oder Wörter, in der keine einfachen Zahlen enthalten sind, wird in der Reihenfolge ihres ersten Erscheinens zurückgegeben, ohne dass eine Besonderheit zu bemerken ist. Das gleiche numerisch-zuerst-Verhalten zeigt sich unabhängig davon, wie oft sich ein Wert wiederholt oder wie lang die Liste ist, da es davon herrührt, wie das Zählobjekt seine Schlüssel ordnet, und nicht von der Größe Ihrer Daten.
Duplikate anzeigen berührt nie das Feld "Entfernte Duplikate" auf der rechten Seite. In diesem Feld wird weiterhin das angezeigt, was zuletzt angezeigt wurde, oder "Warten...", wenn Sie noch nicht "Duplikate entfernen", "Groß-/Kleinschr. ignorieren" oder "Sortieren + Dedup" ausgeführt haben, da "Duplikate anzeigen" nichts entfernt und niemals darauf schreibt.
Sechs Möglichkeiten, wie Leute dieses Tool tatsächlich nutzen
Eine E-Mail-Liste vor einer Kampagne bereinigen
Fügen Sie eine kombinierte Liste aus mehreren Anmeldequellen ein und klicken Sie auf Groß-/Kleinschr. ignorieren anstelle der einfachen Schaltfläche. Dieselbe Adresse, die mit unterschiedlicher Groß-/Kleinschreibung eingegeben wurde, ist immer noch derselbe Posteingang, und das zweimalige Senden an dieselbe Person ist genau das Ergebnis, das Sie vermeiden möchten.
Überprüfen, bevor Sie sich festlegen, etwas zu löschen
Klicken Sie zuerst auf Duplikate anzeigen in jeder Liste, bei der Sie sich nicht ganz sicher sind. Wenn Sie genau sehen, welche Werte sich wiederholen, ohne Ihre ursprünglichen Daten zu verlieren, haben Sie die Möglichkeit, einen Fall zu erkennen, in dem ein scheinbares Duplikat tatsächlich aussagekräftig ist, bevor Sie die Entfernung selbst ausführen.
Erstellen einer sauberen, alphabetisierten Masterliste
Wenn Sie mehrere Quelllisten zu einem Referenzdokument zusammenfassen und die ursprüngliche Reihenfolge keine Rolle spielt, erledigt Sortieren + Dedup beide Aufgaben mit einem Klick: nur eindeutige Werte, alphabetisch geordnet, bereit zur Verwendung als Suchliste.
Bereinigen einer aus einer Tabelle exportierten Spalte
Tabellenexporte enthalten häufig nachgestellte Leerzeichen durch Zellenauffüllung sowie inkonsistente Groß-/Kleinschreibung durch manuelle Dateneingabe. Da jeder Vergleich hier Leerzeichen automatisch abschneidet und Groß-/Kleinschr. ignorieren die Groß-/Kleinschreibung übernimmt, erfasst das direkte Einfügen einer exportierten Spalte normalerweise beide Probleme in einem Durchgang.
Ein chronologisches Protokoll oder einen Datensatz mit dem ersten Eintrag sauber halten
Wenn die Reihenfolge Ihrer Daten wichtig ist, ein Protokoll oder eine Liste, bei der der erste Eintrag der ursprüngliche Datensatz ist, klicken Sie auf Duplikate entfernen oder Groß-/Kleinschr. ignorieren statt auf Sortieren + Dedup. Beide behalten jede überlebende Zeile genau dort, wo sie war, sodass die Sequenz, mit der Sie begonnen haben, danach immer noch lesbar ist, und keine der beiden wird eine Liste leise neu anordnen, auf die Sie sich verlassen haben, dass sie an Ort und Stelle bleibt.
Arbeiten mit sehr großen Exporten
Duplikate entfernen und Groß-/Kleinschr. ignorieren werden beide an einen Hintergrund-Thread übergeben, sobald eine Liste 5.000 Zeilen überschreitet, sodass der Tab weiterhin reagiert, während eine große Datei verarbeitet wird. Sortieren + Dedup und Duplikate anzeigen werden unabhängig von der Größe direkt auf der Seite ausgeführt. In jedem Fall verlässt nichts, was Sie einfügen, Ihr Gerät: Es gibt keinen Upload-Schritt, keine Verarbeitungswarteschlange und kein Konto, das erstellt werden muss.
Häufig gestellte Fragen
Verwandte Textwerkzeuge
Möchten Sie mehr mit Ihren Daten machen? Probieren Sie diese ergänzenden Werkzeuge:
🔒 100% Privat und Sicher
Der Schutz Ihrer Daten hat für uns höchste Priorität. Die gesamte Deduplizierung erfolgt lokal in Ihrem Browser: Ihr Text wird niemals auf einen Server hochgeladen. Wir können Ihre Daten weder einsehen noch speichern oder darauf zugreifen. Verwenden Sie dieses Werkzeug bedenkenlos für sensible Informationen wie E-Mail-Listen, Kundendaten oder vertrauliche Dokumente.