E-Mail-Duplikate schleichen sich schnell ein, wenn Du einen CRM-Export mit Formularübermittlungen oder einer Event-Liste zusammenführst. Dieselbe Person taucht doppelt auf, doch die Zeilen sind selten identisch. In einer steht vielleicht die Telefonnummer, in der anderen die Quelle oder eine hilfreiche Notiz.
Deshalb lösche ich wiederholte E-Mail-Adressen nicht einfach. Um E-Mail-Adressen sicher zu deduplizieren, nutze ich den Datablist Duplicates Finder mit Smart Matching und dem Email processor. So werden Varianten derselben E-Mail-Adresse gruppiert. Anschließend kann ich die vollständigen Kontaktdatensätze prüfen und alle Angaben zusammenführen, die ich behalten möchte.
Für diese Anleitung habe ich eine Testliste mit 1.000 Kontakten und typischen E-Mail-Varianten erstellt: von Plus-Aliasen und Gmail-Abweichungen bis hin zu eingebetteten Adressen. Datablist fand 200 Duplikatpaare. Nach der Bereinigung enthielt die Collection noch 800 Kontakte. Ich zeige Dir, welche Einstellungen ich verwendet und was ich vor dem Zusammenführen geprüft habe.
Gleiche zuerst die E-Mail-Adresse ab, entscheide aber anhand des gesamten Kontaktdatensatzes, welche Informationen erhalten bleiben. Wenn Du stattdessen Namen, Telefonnummern, Unternehmensdomains oder andere Identifikatoren vergleichen möchtest, erfährst Du hier, wie Du eine Liste online deduplizierst.
Welche E-Mail-Adressen Datablist als identisch erkennt
Smart Matching mit dem Email processor vergleicht E-Mail-Identitäten statt der unbearbeiteten Zellinhalte. Dabei werden Leerzeichen am Anfang und Ende entfernt, Werte in Kleinschreibung verglichen und +suffix vor dem Abgleich aus dem lokalen Teil der Adresse entfernt.
Zusätzlich gelten Gmail-spezifische Regeln. Punkte werden aus dem lokalen Teil von Gmail-Adressen entfernt und googlemail.com wird gmail.com zugeordnet. Datablist kann außerdem eine gültige Adresse aus einer Kombination aus Anzeigename und E-Mail-Adresse oder aus einem mailto:-Wert mit Query-String extrahieren.
Hier sind einige Beispiele aus dem Testdatensatz:
| Gespeicherte Werte | Ergebnis mit Smart Email |
|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Dieselbe Identität nach dem Entfernen des Plus-Suffixes |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Dieselbe Gmail-Identität nach dem Entfernen der Punkte |
yasmincarter105@gmail.comyasmincarter105@googlemail.com | Dieselbe Gmail-Identität nach der Normalisierung der Domain |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Dieselbe Identität nach dem Extrahieren der eingebetteten Adresse |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Dieselbe Identität nach dem Entfernen der umgebenden Bestandteile und dem Vergleich in Kleinschreibung |
Die Behandlung von Punkten gilt ausschließlich für Gmail. Datablist geht nicht davon aus, dass first.last@company.com und firstlast@company.com dieselbe Adresse sind. Bei anderen Domains können Punkte relevant sein.
Fehlerhafte Werte bleiben ebenfalls unverändert. Der Processor ist für einzelne, gültig formatierte E-Mail-Adressen ausgelegt – nicht dafür, die Bedeutung beliebiger Zeichenfolgen zu erraten. Wenn nur exakt gleich gespeicherte Werte übereinstimmen sollen, wähle Exact statt Smart.
🔑 Die Normalisierung schlägt eine Duplikatgruppe vor
Sie beweist nicht, dass alle Felder zu derselben Person gehören. Prüfe vor dem Zusammenführen Namen, Unternehmen und funktionsbezogene Sammeladressen.
Für die meisten Bereinigungen von Kontaktlisten empfehle ich Smart Matching mit dem Email processor. Zu Exact wechsle ich nur, wenn Aliase getrennt bleiben müssen oder der gespeicherte String selbst als Identifikator dient.
In der Dokumentation zum Email processor findest Du die vollständigen Normalisierungsregeln und Informationen zur Verfügbarkeit in den einzelnen Tarifen.
Beispiel-E-Mail-Liste für diese Anleitung
Die Testdatei enthält 1.000 synthetische Kontaktzeilen, die 800 gezielt angelegte Identitäten abbilden. Bei keinem Duplikatpaar ist der unbearbeitete E-Mail-String identisch. Das ist wichtig, denn eine Bereinigung anhand exakter Werte würde den aliasbasierten Abgleich nicht demonstrieren.
Die Datei umfasst acht Spalten: record_id, first_name, last_name, email, company, phone, source und notes. Der Workflow gleicht email ab. Die übrigen Felder bleiben sichtbar, damit ich einen Master-Datensatz auswählen und hilfreiche Werte erhalten kann.
Hier sind vier unveränderte Eingabezeilen aus zwei Duplikatpaaren:
| record_id | first_name | last_name | phone | source | notes | |
|---|---|---|---|---|---|---|
CONTACT-0040-A | Nora | Anderson | noraanderson40@demo.co | CRM-Export | Primärer Kontaktdatensatz | |
CONTACT-0040-B | N. | A. | noraanderson40+newsletter@demo.co | +1-202-555-1039 | Website-Formular | Follow-up-Angaben aus einer zweiten Quelle |
CONTACT-0062-A | Victor | Bennett | victorbennett62@gmail.com | +1-202-555-1061 | Website-Formular | Primärer Kontaktdatensatz |
CONTACT-0062-B | victor | BENNETT | victorb.ennett62@gmail.com | Event | Follow-up-Angaben aus einer zweiten Quelle |
Das Nora-Paar zeigt, warum ich Duplikate nicht sofort lösche. Der Basisdatensatz enthält den bevorzugten vollständigen Namen, während die Zeile mit dem Plus-Alias die einzige Telefonnummer und eine zweite Akquisequelle enthält. Durch das Zusammenführen lassen sich beide Angaben erhalten.
Der Datensatz enthält 200 Duplikatidentitäten mit jeweils zwei Zeilen. Sie verteilen sich gleichmäßig auf fünf Varianten: Plus-Aliase, Gmail-Adressen mit Punkten, gmail.com gegenüber googlemail.com, eingebettete Adressen mit Anzeigenamen und mailto:-Werte. Die übrigen 600 Identitäten kommen jeweils nur einmal vor.
Du kannst die Beispiel-CSV mit 1.000 Zeilen herunterladen, um die Anleitung nachzuvollziehen. Wenn Du Deine eigene Datei verwendest, sollte jede Zeile nur eine E-Mail-Adresse enthalten. Behalte außerdem alle angrenzenden Felder, die Du konsolidieren möchtest.
E-Mail-Spalte importieren und vorbereiten
Importiere die CSV- oder Excel-Datei in eine neue Datablist Collection. Prüfe die Importvorschau und ordne die E-Mail-Spalte einer E-Mail-Property zu.
Speichere Namen, Unternehmen, Telefonnummer, Quelle, Notizen und stabile IDs in separaten Properties. Diese Spalten sind kein überflüssiger Ballast. Sie liefern Dir die nötigen Anhaltspunkte, wenn zwei Zeilen bei der E-Mail-Adresse übereinstimmen, sich in anderen Feldern aber unterscheiden.
Für diesen Workflow verwende ich außerdem bevorzugt nur eine Adresse pro Zelle. Enthält eine Zelle etwa alice@example.com; bob@example.com, solltest Du sie zuerst aufteilen oder normalisieren. Wie das funktioniert, erklärt die Anleitung zum Deduplizieren eines Feldes mit mehreren E-Mail-Adressen.
💡 Bewahre die Informationen für Deine Merge-Entscheidung auf
Entferne vor der Deduplizierung keine Spalten mit Quellen, Notizen, Telefonnummern oder stabilen IDs. Sie helfen Dir, die Master-Zeile auszuwählen und den Verlust einzigartiger Daten zu vermeiden.
Öffne Clean > Merge duplicates. Wähle Selected Properties und anschließend email für diesen E-Mail-basierten Durchlauf.
Mit nur einer ausgewählten Property bleibt die Regel leicht nachvollziehbar. Würdest Du an dieser Stelle zusätzlich einen Namen oder eine Unternehmens-Property hinzufügen, könnte das eine berechtigte E-Mail-Übereinstimmung verhindern, wenn diese Felder fehlen oder anders formatiert sind.
Duplicates Finder konfigurieren
Wähle für die Property email den Vergleichsalgorithmus Smart und anschließend den Email processor.
Jede Einstellung erfüllt einen bestimmten Zweck:
- Selected Properties beschränkt die Prüfung auf den Identifikator, den Du vergleichen möchtest.
- Smart aktiviert die processorbasierte Normalisierung, statt gespeicherte Strings wortwörtlich zu vergleichen.
- Email wendet die oben beschriebenen und geprüften Regeln für Aliase, Gmail, Anzeigenamen und
mailto:an.
Nutze Smart zusammen mit dem Email processor für Varianten derselben Identität. Exact erkennt nur identisch gespeicherte Werte.
Die Duplikatprüfung selbst ist schreibgeschützt. Beim Ausführen werden lediglich potenzielle Gruppen zur Prüfung erstellt. Es werden keine Zeilen der Collection gelöscht oder zusammengeführt. Änderungen erfolgen erst, wenn Du eine Merge- oder Löschaktion auswählst und anwendest.
Diese Trennung ist hilfreich. Ich möchte zuerst sehen, welche Werte die Matching-Regel als gleichwertig einstuft, bevor ich einen Bulk Merge auf die Liste anwende.
Prüfung starten und Duplikatgruppen kontrollieren
Klicke auf Run duplicates check. In diesem Test ordnete Datablist 400 der 1.000 Zeilen insgesamt 200 Gruppen mit jeweils zwei Zeilen zu.
Betrachte die Anzahl der Gruppen noch nicht als Anzahl der zu löschenden Zeilen. Jede Gruppe ist zunächst ein Prüfkandidat. Kontrolliere jeweils:
- ob die Variante der E-Mail-Adresse plausibel ist;
- ob Vor- und Nachname übereinstimmen oder sich die Abweichung erklären lässt;
- ob sich Unternehmens- oder Telefonnummernwerte widersprechen;
- ob Quellen und Notizen ergänzende Informationen liefern;
- ob es sich um eine gemeinsam genutzte Sammeladresse handelt.
Normalerweise prüfe ich die ersten Gruppen und jede überraschende Übereinstimmung zwischen unterschiedlichen Unternehmen, bevor ich eine Bulk-Regel anwende. Das geht schneller, als später einen zu aggressiven Merge zu reparieren.
⚠️ Eine wiederholte Adresse gehört nicht immer zur selben Person
Eine Sammeladresse wie
sales@company.comkann mehreren berechtigten Kontakten zugeordnet sein. Prüfe funktionsbezogene Adressen manuell, statt automatisch alle Zeilen zu einem Datensatz zusammenzuführen.
Die Testdatei wurde so erstellt, dass jedes normalisierte Paar genau eine Identität abbildet. Ein echter CRM-Export ist meist unübersichtlicher. Wenn Namen oder Unternehmen auf unterschiedliche Personen hindeuten, überspringe die Gruppe oder prüfe sie separat.
Zusammenführen oder löschen
Meine Entscheidungsregel ist einfach:
- Führe Zeilen zusammen, wenn sie sich ergänzende Daten enthalten.
- Lösche eine zusätzliche Zeile nur, wenn sie keinen hilfreichen Wert beiträgt.
- Lass unklare Gruppen manuell prüfen.
Bei diesem Durchlauf wurde mit der Merge-Konfiguration die vollständigste Zeile als Master ausgewählt. Sie behielt die record_id des Masters bei, verwendete die längsten Werte für Vor- und Nachnamen und kombinierte source sowie notes mit Semikolons.
Diese Einstellungen passen zum Beispiel. Ich würde jedoch nicht standardmäßig jede Property mit abweichenden Werten kombinieren. Eine Quellenhistorie kann sinnvoll zu Website-Formular;CRM-Export werden. Für einen CRM-Status, eine Owner-ID oder die primäre E-Mail-Adresse brauchst Du dagegen meist einen eindeutigen, maßgeblichen Wert.
In der Vorschau prüfst Du, ob diese Entscheidungen passen. Kontrolliere die Zielzeile nach jeder Änderung einer Regel erneut.
💡 Prüfe die Vorschau nach jeder Regeländerung
Kontrolliere, welche Zeile zum Master wird, welche Werte kombiniert werden und welche verschwinden, bevor Du die Regel auf alle bereiten Gruppen anwendest.
Wenn eine Duplikatzeile eine einzigartige Telefonnummer, Quelle oder Notiz enthält, solltest Du sie zusammenführen, statt sie zu löschen. Im Nora-Beispiel behielt die finale Zeile den vollständigen Namen aus einem Datensatz und die Telefonnummer aus dem anderen.
Für komplexere CRM-Konflikte kannst Du den ausführlichen Workflow nutzen, um doppelte Leads ohne Datenverlust zusammenzuführen. Bei diesem E-Mail-basierten Durchlauf geht es darum, hilfreiche angrenzende Felder zu erhalten, ohne jede Property in einen Multi-Value-String zu verwandeln.
Ergebnisse der getesteten Liste mit 1.000 Zeilen
Der Merge führte zu folgenden gemessenen Werten:
| Kennzahl | Ergebnis |
|---|---|
| Zeilen zu Beginn | 1.000 |
| Duplikatgruppen zugeordnete Zeilen | 400 |
| Duplikatgruppen mit zwei Zeilen | 200 |
| Gelöschte Duplikatzeilen | 200 |
| Aktualisierte Master-Zeilen | 200 |
| Verbleibende Zeilen | 800 |
| Verbleibende Duplikatgruppen | 0 |
Die Rechnung ist eindeutig: 1.000 Zeilen zu Beginn - 200 gelöschte Zeilen = 800 beibehaltene Zeilen.
Im manuell durchgeführten Test dauerte der Merge wenige Sekunden, es wurde jedoch keine genaue Zeit erfasst. Betrachte das als Beobachtung dieses Durchlaufs und nicht als Performance-Benchmark.
Das heruntergeladene Änderungsprotokoll enthält 400 Einträge: 200 gelöschte Zeilen und 200 aktualisierte Master-Zeilen. Für jede zusammengeführte Gruppe zeigt es die Werte vor dem Merge und die Werte, die in der Zielzeile beibehalten wurden.
Die folgende Tabelle enthält die exakten Werte aus dem Testlauf:
| Ursprüngliche Varianten | Grund für die Übereinstimmung | Beibehaltene E-Mail-Adresse | Aktion | Erhaltene Felder |
|---|---|---|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Plus-Suffix entfernt | noraanderson40+newsletter@demo.co | Zusammengeführt in CONTACT-0040-B | Vollständiger Name, Telefonnummer, Website-Formular;CRM-Export und beide Notizen |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Gmail-Punkte normalisiert | victorbennett62@gmail.com | Zusammengeführt in CONTACT-0062-A | Telefonnummer, Website-Formular;Event und beide Notizen |
gabrielcarter113@gmail.comgabrielcarter113@googlemail.com | Gmail-Domains normalisiert | gabrielcarter113@gmail.com | Zusammengeführt in CONTACT-0113-A | Telefonnummer, Partnerliste;CRM-Export und die Notiz zur Demo-Anfrage |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Umschließenden Anzeigenamen entfernt | camiladiaz123@testmail.net | Zusammengeführt in CONTACT-0123-A | Vollständiger Name, Telefonnummer, Partnerliste;CRM-Export und beide Notizen |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | mailto:-Bestandteile entfernt und Groß-/Kleinschreibung normalisiert | mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Zusammengeführt in CONTACT-0199-B | Vollständiger Name, Telefonnummer, Webinar;Event und beide Notizen |
Der beibehaltene Wert ist nicht immer die optisch einfachste E-Mail-Adresse. Der ausgewählte Master-Datensatz bestimmt, welche gespeicherte Adresse erhalten bleibt. Die Normalisierung dient dem Matching. Sie schreibt nicht automatisch jeden beibehaltenen Wert in ein einheitliches Format um.
Der getestete Merge reduzierte die Liste von 1.000 auf 800 Zeilen, weil 200 geprüfte Duplikatzeilen mit ihren jeweiligen Master-Datensätzen zusammengeführt wurden. Dieses Ergebnis gilt für die eigens erstellte Testliste und ist keine allgemeingültige Match-Rate für alle E-Mail-Formate.
Fehlerfälle und Checkliste zur Validierung
Smart Email Matching verarbeitet die fünf getesteten Varianten, ersetzt aber keine manuelle Prüfung.
Punkte bei Nicht-Gmail-Adressen
Bei anderen Domains als Gmail bleiben Punkte relevant. Gehe nicht davon aus, dass first.last@company.com und firstlast@company.com zum selben Postfach gehören. Wenn externe Informationen die Verbindung bestätigen, bearbeite dieses Paar manuell.
Fehlerhafte Werte
Fehlerhafte Strings und Werte, die keiner einzelnen gültigen E-Mail-Adresse entsprechen, bleiben unverändert. Bereinige diese Zellen oder verschiebe sie in eine separate Prüfwarteschlange. Erwarte nicht, dass der Processor aus beliebigem Text eine Adresse ableitet.
Exaktes Matching
Ein Exact-Vergleich übersieht Plus-Aliase, Gmail-Varianten mit Punkten, Domain-Aliase und umschließende Bestandteile, wenn sich die gespeicherten Strings unterscheiden. Das kann richtig sein, wenn Aliase getrennt bleiben sollen. Für diesen Workflow ist es jedoch nicht die passende Einstellung.
Mehrere Adressen in einer Zelle
Diese Methode setzt eine Adresse pro Zelle voraus. Eine Zelle mit mehreren durch Trennzeichen separierten Adressen muss vor dem zeilenbasierten Matching mit dem separaten Multi-Value-Workflow bearbeitet werden.
Gemeinsam genutzte Sammeladressen
Zwei Zeilen mit sales@company.com können unterschiedliche Personen beschreiben. Namen, Jobtitel, Unternehmen und Notizen sollten die Prüfentscheidung bestimmen. Ich würde funktionsbezogene Sammeladressen nicht ungeprüft per Bulk Merge zusammenführen.
Ergänzende Felder versehentlich löschen
Beim Löschen einer zusätzlichen Zeile kann die einzige Telefonnummer, Akquisequelle oder Notiz verloren gehen. Nutze die Merge-Vorschau, um zu sehen, welche Werte erhalten bleiben.
Der speziell erstellte Test erkannte alle 200 vorgesehenen Identitäten und erzeugte keine unerwarteten Gruppen mit unterschiedlichen Identitäten. Er deckte jedoch nicht jedes reale E-Mail-Format, jeden fehlerhaften Wert oder jedes Muster gemeinsam genutzter Postfächer ab.
Prüfe vor dem Export Deiner eigenen Liste Folgendes:
- Jede bestätigte Gruppe repräsentiert genau eine Identität.
- Gemeinsam genutzte und funktionsbezogene Postfächer wurden manuell geprüft.
- Die Master-Zeile enthält den bevorzugten Namen, die bevorzugte ID und die gewünschte E-Mail-Adresse.
- Einzigartige Telefonnummern, Unternehmen, Quellen und Notizen bleiben nach dem Merge erhalten.
- Die Anzahl der Ausgangszeilen abzüglich der gelöschten Zeilen entspricht der finalen Zeilenanzahl.
- Eine Stichprobe deckt jede in Deiner Liste vorkommende Normalisierungsvariante ab.
- Die Anzahl der verbleibenden Duplikatgruppen entspricht Deiner Erwartung.
📌 Gleiche die Zahlen ab
Ausgangszeilen - gelöschte Zeilen = finale Zeilenist die schnellste Vollständigkeitsprüfung nach einem Merge.
E-Mail-Liste weiter bereinigen
Die Deduplizierung löst das Problem wiederholter Identitäten. Sie prüft jedoch nicht, ob ein Postfach existiert, ob ein Anbieter Wegwerf-Adressen bereitstellt, ob ein Kontakt sich abgemeldet hat oder ob eine E-Mail zustellbar ist.
Ich löse zuerst die doppelten Identitäten auf. Spätere Prüfungen laufen dadurch nur für die beibehaltenen Kontakte, statt mehrere Varianten derselben Person zu verarbeiten. Sobald der Merge Deine Validierungscheckliste bestanden hat, kannst Du den Rest Deiner E-Mail-Liste bereinigen. Öffne danach Export und wähle CSV oder Excel.
Deine Liste mit Datablist deduplizieren
Importiere Deine Kontaktdatei in Datablist, starte die E-Mail-basierte Duplikatprüfung, kontrolliere die vorgeschlagenen Gruppen, führe hilfreiche Werte zusammen und exportiere die bereinigte Liste.
FAQ
Spielt Groß- und Kleinschreibung beim E-Mail-Abgleich eine Rolle?
Smart Email verwendet für den Abgleich Kleinschreibung. Deshalb können NAME@example.com und name@example.com gruppiert werden, wenn der Rest der normalisierten Adresse übereinstimmt.
Gelten Gmail-Punkte und Plus-Aliase als dieselbe Adresse?
Smart Email Matching entfernt ein Plus-Suffix aus dem lokalen Teil und ignoriert Punkte im lokalen Teil von Gmail-Adressen. Die Punktregel gilt ausschließlich für Gmail. Bei anderen Domains bleiben Punkte relevant.
Sollte ich doppelte Kontakte zusammenführen oder löschen?
Führe die Datensätze zusammen, wenn eine weitere Zeile eine Telefonnummer, Quelle, Notiz, Unternehmensangabe oder ein anderes hilfreiches Feld ergänzt. Lösche die zusätzliche Zeile nur, wenn sie nichts enthält, was Du brauchst.
Was ist, wenn eine Zelle mehrere E-Mail-Adressen enthält?
Teile die Multi-Value-Zelle auf oder normalisiere sie, bevor Du diesen zeilenbasierten Workflow ausführst. Folge dazu der Anleitung zum Deduplizieren eines Feldes mit mehreren E-Mail-Adressen.
Sollten Sammeladressen wie sales@company.com zusammengeführt werden?
Nicht automatisch. Eine gemeinsam genutzte Adresse kann mehrere Kontakte repräsentieren. Vergleiche die Namen und anderen Felder und prüfe diese Gruppen anschließend manuell.










