TextSorter
Eingabe (Eindeutige Elemente)
0 Zeilen
0 Zeilen
Entfernte Duplikate
0 entfernt

Es wurden noch keine Duplikate entfernt.
Klicken Sie auf „Duplikate entfernen", um zu beginnen.

Warte auf Eingabe...

Was jede Schaltfläche tatsächlich entfernt, umordnet oder anzeigt

Die Kurzfassung: Zwei Schaltflächen entfernen Duplikate und behalten Ihre ursprüngliche Reihenfolge bei, eine Schaltfläche entfernt Duplikate und alphabetisiert dann, was übrig bleibt, und eine Schaltfläche entfernt überhaupt nichts, sie zeigt Ihnen nur, was wiederholt wird.

Sie fügen ein
john@email.com
jane@email.com
John@Email.com
bob@email.com
jane@email.com
Duplikate entfernen behält
john@email.com
jane@email.com
John@Email.com
bob@email.com
SchaltflächeGroß-/KleinschreibungBehält ursprüngliche ReihenfolgeWechselt ab 5.000 Zeilen zu einem Hintergrund-Thread
Duplikate entfernenExakter Abgleich mit Beachtung der Groß-/KleinschreibungJaJa
Groß-/Kleinschr. ignorierenAbgleich ohne Beachtung der Groß-/KleinschreibungJaJa
Sortieren + DedupExakter Abgleich mit Beachtung der Groß-/KleinschreibungNein, alphabetisiertNein
Duplikate anzeigenExakter Abgleich mit Beachtung der Groß-/KleinschreibungEntfernt nichtsNein

Jede dieser vier Schaltflächen führt den gleichen ersten Schritt aus, bevor sie eine einzige Zeile vergleicht: Der eingefügte Text wird an den Zeilenumbrüchen aufgeteilt, bei jeder Zeile werden die führenden und abschließenden Leerzeichen abgeschnitten, und jede Zeile, die nun leer ist, wird vollständig aus der Liste entfernt. Was diesen Durchlauf überlebt, ist das, womit der Rest der Logik der Schaltfläche arbeitet. Dieser erste Schritt ist für "Duplikate entfernen" und "Groß-/Kleinschr. ignorieren" identisch, sodass der einzige wirkliche Unterschied zwischen ihnen die einzige Vergleichsregel darunter ist, nicht das Abschneiden oder die Behandlung leerer Zeilen darum herum.

Nur "Duplikate entfernen" und "Groß-/Kleinschr. ignorieren" senden ihre gelöschten Zeilen an das Feld "Entfernte Duplikate" auf der rechten Seite. "Sortieren + Dedup" füllt dieses Feld ebenfalls, da es vor dem Sortieren dedupliziert. "Duplikate anzeigen" berührt es nie, da es nichts entfernt, sondern nur das neu anordnet, was im Haupteditor verbleibt.

Große Listen verhalten sich je nach Schaltfläche unterschiedlich. Ab 5.000 Zeilen übergeben "Duplikate entfernen" und "Groß-/Kleinschr. ignorieren" an einen Web Worker im Hintergrund, damit der Tab reaktionsfähig bleibt. "Sortieren + Dedup" und "Duplikate anzeigen" haben keine solche Übergabe und laufen immer direkt auf der Seite, sodass ein ungewöhnlich großes Einfügen den Tab kurz anhalten lassen kann, wenn Sie auf eine dieser beiden klicken.

Standardmäßig Groß-/Kleinschreibung beachten: Wenn Apple und apple als zwei zählen

Duplikate entfernen behandelt die Groß-/Kleinschreibung als Teil des Textes. Klicken Sie stattdessen auf Groß-/Kleinschr. ignorieren und apple, Apple und APPLE werden zu der Schreibweise zusammengefasst, die als erstes eingefügt wurde.

Duplikate entfernen behält
john@email.com
jane@email.com
John@Email.com
bob@email.com
Groß-/Kleinschr. ignorieren behält
john@email.com
jane@email.com
bob@email.com

Beide Spalten beginnen mit derselben eingefügten Liste: john@email.com, jane@email.com, John@Email.com, bob@email.com, jane@email.com. Einfaches "Duplikate entfernen" erfasst nur die exakte Wiederholung von jane@email.com in der letzten Zeile, da Zeilen genau so verglichen werden, wie sie geschrieben wurden. John@Email.com überlebt direkt neben john@email.com, da für einen Vergleich, der die Groß-/Kleinschreibung beachtet, Groß- und Kleinbuchstaben einfach unterschiedliche Zeichen sind.

Diese Standardeinstellung ist korrekt für Daten, bei denen die Groß-/Kleinschreibung wirklich eine Bedeutung hat: Produkt-SKUs, Benutzernamen, die Groß-/Kleinschreibung beachten, und Codes, bei denen sich ABC123 und abc123 möglicherweise auf völlig unterschiedliche Datensätze beziehen. Es ist die falsche Standardeinstellung für eine E-Mail-Liste, da john@email.com und John@Email.com auf denselben Posteingang verweisen und das zweimalige Senden an dieselbe Adresse genau das ist, was das Deduplizieren verhindern sollte.

Groß-/Kleinschr. ignorieren ist eine Schaltfläche, kein Kontrollkästchen. Ein Klick darauf wandelt jede Zeile nur zu Vergleichszwecken in Kleinbuchstaben um, behält die erste Schreibweise bei, die für jeden eindeutigen Wert gefunden wurde, und führt die gesamte Entfernung mit diesem einen Klick aus. Es schaltet keine dauerhafte Einstellung um, die ändert, was die einfache Schaltfläche Duplikate entfernen beim nächsten Drücken tut. Es gibt auch keine teilweise Option, keine Möglichkeit, die Groß-/Kleinschreibung für einen Teil einer Zeile oder nur außerhalb eines Domainnamens zu ignorieren. Die Wahl ist binär: Vergleichen Sie jede Zeile genau wie eingegeben, oder wandeln Sie jede Zeile vor dem Vergleichen in Kleinbuchstaben um.

Sortieren + Dedup hat keine Version von sich selbst, die die Groß-/Kleinschreibung ignoriert. Es vergleicht Zeilen immer genau, genau wie die einfache Schaltfläche Duplikate entfernen. Wenn Sie sowohl ein Ergebnis ohne Beachtung der Groß-/Kleinschreibung als auch ein alphabetisiertes benötigen, klicken Sie zuerst auf Groß-/Kleinschr. ignorieren, um die Varianten zusammenzufassen, und klicken Sie dann auf Sortieren + Dedup, um das, was übrig bleibt, zu alphabetisieren. Wenn Sie Sortieren + Dedup allein auf Daten mit gemischter Groß-/Kleinschreibung ausführen, wird jede Variante beibehalten, die es nicht als identisch erkennt.

Warum abgeschnittene Leerzeichen einige Duplikate beheben und andere nicht

Jeder Vergleich schneidet zuerst den Anfang und das Ende jeder Zeile ab. Ein verirrtes führendes oder abschließendes Leerzeichen verursacht niemals eine falsche Nichtübereinstimmung. Ein doppeltes Leerzeichen in der Mitte einer Zeile zählt immer noch als anderer Text.

Sie fügen ein, Zeile 2 verbirgt ein Leerzeichen
john@email.com
john@email.com
Duplikate entfernen behält
john@email.com

Die beiden obigen Zeilen sehen identisch aus, und für Ihre Augen sind sie es auch. Die zweite wurde mit einem unsichtbaren abschließenden Leerzeichen eingefügt, die Art, die kostenlos mitkommt, wenn Sie einen Wert aus einer Tabellenzelle oder einer PDF-Tabelle kopieren. Bevor dieses Tool etwas vergleicht, entfernt es führende und abschließende Leerzeichen aus jeder Zeile, sodass das abschließende Leerzeichen nie die Chance bekommt, zwei ansonsten identische Zeilen unterschiedlich aussehen zu lassen. Das Ergebnis ist eine einzige überlebende Zeile, genau wie es sein sollte.

Was das Abschneiden nicht bewirkt, ist das Berühren von Leerzeichen innerhalb einer Zeile. New York und New  York, die zweite mit zwei Leerzeichen zwischen den Wörtern anstelle von einem, werden an ihren Rändern auf die gleiche Weise abgeschnitten, unterscheiden sich aber immer noch in der Mitte, sodass keine der vier Schaltflächen sie als Duplikate behandelt. Das automatische Reduzieren von internen Leerzeichen würde das Risiko bergen, zwei wirklich unterschiedliche Wörter zusammenzuführen, daher belässt dieses Tool es absichtlich dabei. Tabulatoren werden auf die gleiche Weise wie Leerzeichen abgeschnitten: Eine Zeile, die mit einem Tabulatorzeichen anstelle eines Leerzeichens beginnt, wird genauso sauber entfernt, da der Abschneideschritt jede Art von Leerzeichen von beiden Enden einer Zeile entfernt, nicht nur das Leerzeichen speziell.

Inkonsistente interne Abstände überleben jede Schaltfläche auf dieser Seite. Wenn Ihre Daten Einträge wie New York und New  York nebeneinander haben, wird das Deduplizieren sie nicht erfassen, da das Abschneiden immer nur die beiden Enden einer Zeile berührt. Normalisieren Sie die internen Abstände zuerst von Hand oder mit einem Suchen-und-Ersetzen-Durchlauf und führen Sie die Entfernung dann erneut aus.

Welche Kopie überlebt und ob die Liste in der richtigen Reihenfolge bleibt

Sowohl Duplikate entfernen als auch Groß-/Kleinschr. ignorieren behalten jede überlebende Zeile genau dort, wo sie war. Sortieren + Dedup behält das gleiche erste Vorkommen, alphabetisiert dann das Ergebnis, sodass die ursprüngliche Reihenfolge weg ist.

Duplikate entfernen behält
Banana
Apple
Cherry
Sortieren + Dedup behält
Apple
Banana
Cherry

Fügen Sie Banana, Apple, Banana, Cherry ein und beide Schaltflächen sind sich einig, welche Kopie von Banana beibehalten werden soll: die erste, auf die sie stoßen, während sie die Liste von oben nach unten scannen. Wo sie sich nicht einig sind, ist, was mit den Überlebenden danach passiert. Duplikate entfernen belässt Banana, Apple, Cherry genau in dieser Reihenfolge, da nichts an dem Entfernungsschritt etwas umordnet, er nimmt nur Zeilen heraus. Sortieren + Dedup nimmt die gleichen drei Überlebenden und alphabetisiert sie, wobei sie stattdessen auf Apple, Banana, Cherry landen.

Die Beibehaltung der ursprünglichen Reihenfolge ist wichtig, wenn die Abfolge Ihrer Daten eigene Informationen trägt: ein chronologisches Protokoll, eine Liste, bei der der erste Eintrag der kanonische Datensatz ist und spätere versehentliche erneute Einfügungen sind, oder jeder Datensatz, bei dem eine Neusortierung etwas über Priorität oder Zeitpunkt löschen würde. Greifen Sie speziell zu Sortieren + Dedup, wenn Sie eine saubere alphabetisierte Referenzliste wünschen und die Reihenfolge, in der die Daten ankamen, von Anfang an nie aussagekräftig war. Diese Regel für das erste Vorkommen ist auch auf jeder Schaltfläche hier festgelegt: Nichts auf dieser Seite behält das letzte Vorkommen einer wiederholten Zeile anstelle des ersten, daher gibt es keine Einstellung zum Umschalten, wenn das, was Sie eigentlich wollten, die aktuellste Kopie war.

Das Feld "Entfernte Duplikate" folgt ebenfalls der Scan-Reihenfolge. Unabhängig davon, ob Sie auf Duplikate entfernen, Groß-/Kleinschr. ignorieren oder Sortieren + Dedup geklickt haben, die Zeilen, die im rechten Feld angezeigt werden, werden in der Reihenfolge aufgelistet, in der sie beim Scannen angetroffen wurden, nicht gruppiert danach, welche überlebende Zeile sie dupliziert haben, und nicht alphabetisiert.

Warum ein falsch geschriebenes Duplikat unberührt durchrutscht

Jeder Vergleich hier ist exakt. John Smith und Jon Smith oder Acme Inc. und Acme Inc sind zwei verschiedene Zeilen für dieses Tool, nicht ein Duplikat und ein Tippfehler des anderen.

Sie fügen vier Beinahe-Duplikate ein
John Smith
Jon Smith
Acme Inc.
Acme Inc
Duplikate entfernen hinterlässt
John Smith
Jon Smith
Acme Inc.
Acme Inc

Klicken Sie in dieser Liste auf Duplikate entfernen und es ändert sich nichts. Alle vier Zeilen werden beibehalten, und das Tool teilt Ihnen dies mit der Meldung "Keine Duplikate gefunden!" mit, da jeder Vergleich, den es anstellt, eine zeichenweise Übereinstimmung der abgeschnittenen und optional in Kleinbuchstaben umgewandelten Zeile ist. Es hat kein Konzept von "nah genug". Ein Ein-Buchstaben-Tippfehler, ein fehlender abschließender Punkt oder ein Bindestrich, der gegen ein Leerzeichen ausgetauscht wurde, erzeugen alle zwei Zeilen, die einfach nichts miteinander zu tun haben, soweit es eine Schaltfläche hier betrifft.

Das ist eine bewusste Einschränkung, kein Versehen. Die Entscheidung, wie ähnlich zwei Zeilen sein müssen, bevor sie als dasselbe zählen, was normalerweise mit etwas wie der Bearbeitungsdistanz gemessen wird, ist eine grundlegend andere Art von Algorithmus als ein exakter Vergleich, und sie trifft Ermessensentscheidungen, die je nach Datensatz variieren. Es in die andere Richtung falsch zu machen, indem zwei Datensätze zusammengeführt werden, die nur ähnlich aussehen, kann echte Daten im Stillen zerstören, was ein schlechteres Ergebnis ist, als ein offensichtliches Beinahe-Duplikat in der Liste zu belassen, damit ein Mensch es abfangen kann.

Eine praktische Methode zum Umgang mit unordentlichen Daten: Führen Sie zuerst Duplikate anzeigen aus, um zu sehen, wie viele exakte Wiederholungen bereits vorhanden sind, standardisieren Sie die offensichtlichen Formatierungsunterschiede von Hand oder mit einem Suchen-und-Ersetzen-Durchlauf, konsistenter Groß- und Kleinschreibung, konsistenter Zeichensetzung, konsistenten Abkürzungen, und führen Sie dann Duplikate entfernen erneut aus. Die Bereinigung, die Beinahe-Duplikate in exakte Übereinstimmungen verwandelt, ermöglicht es diesem Tool, sie zu erfassen.

Was Duplikate anzeigen tatsächlich anzeigt und in welcher Reihenfolge

Duplikate anzeigen listet jeden Wert auf, der mehr als einmal erscheint, jeweils einmal, ohne etwas zu löschen. Wenn Ihre Liste einfache Zahlen mit Wörtern mischt, kommen die Zahlen zuerst in aufsteigender Reihenfolge, nicht in der Reihenfolge, in der Sie sie eingefügt haben.

Sie fügen ein
100
5
zebra
100
5
zebra
Duplikate anzeigen zeigt
5
100
zebra

"Duplikate anzeigen" zählt, wie oft jede abgeschnittene Zeile erscheint, behält nur die Werte, die mehr als einmal erscheinen, und ersetzt den Inhalt des Editors durch diese Liste, ein Eintrag pro dupliziertem Wert anstelle eines Eintrags pro Wiederholung. Eine fünfmal eingefügte Zeile erscheint einmal im Ergebnis, da der Punkt darin besteht, zu zeigen, welche Werte sich wiederholen, nicht wie viele Kopien vorhanden sind. Nichts in Ihrem ursprünglichen Text wird durch diese Schaltfläche geändert oder entfernt.

Die Nummernfolge im obigen Beispiel ist keine Sortierfunktion. Sie ergibt sich daraus, wie das JavaScript-Objekt, das Ihre Zeilen zählt, seine eigenen Schlüssel ordnet: Einträge, die wie einfache nicht negative ganze Zahlen aussehen, wie 5 und 100, werden immer zuerst in aufsteigender numerischer Reihenfolge aufgelistet, vor jedem anderen duplizierten Wert, der dann in der Reihenfolge erscheint, in der er zuerst angetroffen wurde. Das zeigt sich nur, wenn Ihre duplizierten Daten bloße numerische Zeilen mit Textzeilen mischen. Eine Liste duplizierter Namen oder Wörter, in der keine einfachen Zahlen enthalten sind, wird in der Reihenfolge ihres ersten Erscheinens zurückgegeben, ohne dass eine Besonderheit zu bemerken ist. Das gleiche numerisch-zuerst-Verhalten zeigt sich unabhängig davon, wie oft sich ein Wert wiederholt oder wie lang die Liste ist, da es davon herrührt, wie das Zählobjekt seine Schlüssel ordnet, und nicht von der Größe Ihrer Daten.

Duplikate anzeigen berührt nie das Feld "Entfernte Duplikate" auf der rechten Seite. In diesem Feld wird weiterhin das angezeigt, was zuletzt angezeigt wurde, oder "Warten...", wenn Sie noch nicht "Duplikate entfernen", "Groß-/Kleinschr. ignorieren" oder "Sortieren + Dedup" ausgeführt haben, da "Duplikate anzeigen" nichts entfernt und niemals darauf schreibt.

Sechs Möglichkeiten, wie Leute dieses Tool tatsächlich nutzen

Eine E-Mail-Liste vor einer Kampagne bereinigen

Fügen Sie eine kombinierte Liste aus mehreren Anmeldequellen ein und klicken Sie auf Groß-/Kleinschr. ignorieren anstelle der einfachen Schaltfläche. Dieselbe Adresse, die mit unterschiedlicher Groß-/Kleinschreibung eingegeben wurde, ist immer noch derselbe Posteingang, und das zweimalige Senden an dieselbe Person ist genau das Ergebnis, das Sie vermeiden möchten.

Überprüfen, bevor Sie sich festlegen, etwas zu löschen

Klicken Sie zuerst auf Duplikate anzeigen in jeder Liste, bei der Sie sich nicht ganz sicher sind. Wenn Sie genau sehen, welche Werte sich wiederholen, ohne Ihre ursprünglichen Daten zu verlieren, haben Sie die Möglichkeit, einen Fall zu erkennen, in dem ein scheinbares Duplikat tatsächlich aussagekräftig ist, bevor Sie die Entfernung selbst ausführen.

Erstellen einer sauberen, alphabetisierten Masterliste

Wenn Sie mehrere Quelllisten zu einem Referenzdokument zusammenfassen und die ursprüngliche Reihenfolge keine Rolle spielt, erledigt Sortieren + Dedup beide Aufgaben mit einem Klick: nur eindeutige Werte, alphabetisch geordnet, bereit zur Verwendung als Suchliste.

Bereinigen einer aus einer Tabelle exportierten Spalte

Tabellenexporte enthalten häufig nachgestellte Leerzeichen durch Zellenauffüllung sowie inkonsistente Groß-/Kleinschreibung durch manuelle Dateneingabe. Da jeder Vergleich hier Leerzeichen automatisch abschneidet und Groß-/Kleinschr. ignorieren die Groß-/Kleinschreibung übernimmt, erfasst das direkte Einfügen einer exportierten Spalte normalerweise beide Probleme in einem Durchgang.

Ein chronologisches Protokoll oder einen Datensatz mit dem ersten Eintrag sauber halten

Wenn die Reihenfolge Ihrer Daten wichtig ist, ein Protokoll oder eine Liste, bei der der erste Eintrag der ursprüngliche Datensatz ist, klicken Sie auf Duplikate entfernen oder Groß-/Kleinschr. ignorieren statt auf Sortieren + Dedup. Beide behalten jede überlebende Zeile genau dort, wo sie war, sodass die Sequenz, mit der Sie begonnen haben, danach immer noch lesbar ist, und keine der beiden wird eine Liste leise neu anordnen, auf die Sie sich verlassen haben, dass sie an Ort und Stelle bleibt.

Arbeiten mit sehr großen Exporten

Duplikate entfernen und Groß-/Kleinschr. ignorieren werden beide an einen Hintergrund-Thread übergeben, sobald eine Liste 5.000 Zeilen überschreitet, sodass der Tab weiterhin reagiert, während eine große Datei verarbeitet wird. Sortieren + Dedup und Duplikate anzeigen werden unabhängig von der Größe direkt auf der Seite ausgeführt. In jedem Fall verlässt nichts, was Sie einfügen, Ihr Gerät: Es gibt keinen Upload-Schritt, keine Verarbeitungswarteschlange und kein Konto, das erstellt werden muss.

Häufig gestellte Fragen

Wie entferne ich doppelte Zeilen aus einem Text?
Fügen Sie Ihren Text in den Editor ein und klicken Sie auf 'Duplikate entfernen'. Das Werkzeug behält das erste Vorkommen jeder Zeile und entfernt alle Wiederholungen. Im rechten Bereich sehen Sie genau, was gelöscht wurde.
Kann ich die Groß-/Kleinschreibung beim Entfernen von Duplikaten ignorieren?
Ja! Klicken Sie auf 'Groß-/Kleinschreibung ignorieren', um 'Apfel' und 'apfel' als dasselbe Element zu behandeln. Dies ist nützlich, wenn Ihre Daten eine inkonsistente Schreibweise aufweisen. Die ursprüngliche Schreibweise des ersten Vorkommens wird beibehalten.
Wie finde ich heraus, welche Elemente doppelt vorhanden sind, ohne sie zu entfernen?
Klicken Sie auf 'Duplikate anzeigen', um nur die Elemente zu sehen, die mehr als einmal in Ihrer Liste vorkommen. So können Sie problematische Einträge identifizieren, ohne sie sofort zu löschen - sehr nützlich zur Datenprüfung.
Sind meine Daten bei der Verwendung dieses Werkzeugs sicher?
Absolut. Die gesamte Verarbeitung erfolgt lokal in Ihrem Browser mittels JavaScript. Ihre Daten verlassen Ihr Gerät niemals und werden auf keinen Server gesendet. Es ist 100% privat.
Kann ich die Aktion nach dem Entfernen von Duplikaten rückgängig machen?
Ja! Klicken Sie auf die Schaltfläche 'Rückgängig', um Ihren Originaltext wiederherzustellen. Das Werkzeug speichert einen Änderungsverlauf, sodass Sie bei Bedarf jederzeit zurückgehen können.
Wie viele Daten kann ich maximal verarbeiten?
Da die Verarbeitung in Ihrem Browser erfolgt, hängt die Grenze vom Arbeitsspeicher Ihres Geräts ab. Die meisten modernen Geräte können Hunderttausende von Zeilen problemlos verarbeiten. Für sehr große Datensätze (mehr als 1 Million Zeilen) empfehlen wir eine Desktop-Anwendung.

Verwandte Textwerkzeuge

Möchten Sie mehr mit Ihren Daten machen? Probieren Sie diese ergänzenden Werkzeuge:

🔒 100% Privat und Sicher

Der Schutz Ihrer Daten hat für uns höchste Priorität. Die gesamte Deduplizierung erfolgt lokal in Ihrem Browser: Ihr Text wird niemals auf einen Server hochgeladen. Wir können Ihre Daten weder einsehen noch speichern oder darauf zugreifen. Verwenden Sie dieses Werkzeug bedenkenlos für sensible Informationen wie E-Mail-Listen, Kundendaten oder vertrauliche Dokumente.