I duplicati delle email tendono a comparire quando si unisce un export del CRM con le submission di un form o una lista di partecipanti a un evento. La stessa persona compare due volte, ma le righe raramente sono identiche: una può contenere il numero di telefono, l’altra la fonte o una nota utile.
Per questo non inizio eliminando le email ripetute. Per deduplicare gli indirizzi email in modo sicuro, uso Datablist Duplicates Finder con Smart matching e il processor Email. Datablist raggruppa le varianti dello stesso indirizzo, poi mi permette di esaminare le righe complete dei contatti e unire i dati che voglio conservare.
Per questa guida ho preparato una lista di test con 1.000 contatti e le varianti che incontro più spesso: alias con il segno più, differenze negli indirizzi Gmail e indirizzi racchiusi in altri formati. Datablist ha individuato 200 coppie di duplicati e la collection pulita è rimasta con 800 contatti. Vediamo quali impostazioni ho usato e quali controlli ho effettuato prima di unire i dati.
Inizia dal matching sull’email, ma decidi cosa conservare valutando l’intera riga del contatto. Se invece devi confrontare nomi, numeri di telefono, domini aziendali o altri identificatori, scopri come deduplicare una lista online.
Quali indirizzi email considera uguali Datablist
Lo Smart matching con il processor Email confronta l’identità degli indirizzi, non il semplice testo contenuto nelle celle. Rimuove gli spazi iniziali e finali, confronta i valori in minuscolo ed elimina il +suffisso dalla parte locale prima del matching.
Applica inoltre regole specifiche per Gmail. Rimuove i punti dalla parte locale degli indirizzi Gmail e riconduce googlemail.com a gmail.com. Datablist può anche estrarre un indirizzo valido racchiuso in un display name o in un valore mailto: con una query string.
Ecco alcuni esempi tratti dal dataset di test:
| Valori memorizzati | Risultato Smart Email |
|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Stessa identità dopo la rimozione del suffisso con il segno più |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Stessa identità Gmail dopo la rimozione dei punti |
yasmincarter105@gmail.comyasmincarter105@googlemail.com | Stessa identità Gmail dopo la normalizzazione del dominio |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Stessa identità dopo l’estrazione dell’indirizzo racchiuso nel display name |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Stessa identità dopo la rimozione del wrapper e il confronto in minuscolo |
La gestione dei punti è specifica per Gmail. Datablist non presume che first.last@company.com e firstlast@company.com siano lo stesso indirizzo. Nei domini diversi da Gmail, i punti possono avere un significato preciso.
Anche i valori non validi rimangono invariati. Il processor è progettato per singoli indirizzi email validi, non per interpretare stringhe arbitrarie. Se vuoi trovare solo valori memorizzati identici, seleziona Exact invece di Smart.
🔑 La normalizzazione propone un gruppo di duplicati
Non dimostra che tutti i campi appartengano alla stessa persona. Prima del merge, controlla nomi, aziende e caselle email associate a un ruolo.
Per la maggior parte delle operazioni di pulizia delle liste di contatti consiglio Smart matching con il processor Email. Passo a Exact solo quando gli alias devono restare separati o quando l’identificatore è la stringa memorizzata in sé.
Consulta la documentazione del processor Email per conoscere tutte le regole di normalizzazione e la disponibilità nei diversi piani.
Lista email di esempio usata nella guida
Il file di test contiene 1.000 righe di contatti sintetici, corrispondenti a 800 identità create appositamente. Nessuna coppia di duplicati presenta la stessa stringa email grezza. È un aspetto importante, perché una pulizia basata sui valori esatti non mostrerebbe il matching degli alias.
Il file contiene otto colonne: record_id, first_name, last_name, email, company, phone, source e notes. Il workflow esegue il matching su email, mentre gli altri campi restano visibili per consentirmi di scegliere un record master e conservare i valori utili.
Ecco quattro righe esatte dell’input, appartenenti a due coppie di duplicati:
| record_id | first_name | last_name | phone | source | notes | |
|---|---|---|---|---|---|---|
CONTACT-0040-A | Nora | Anderson | noraanderson40@demo.co | Export CRM | Record principale del contatto | |
CONTACT-0040-B | N. | A. | noraanderson40+newsletter@demo.co | +1-202-555-1039 | Form del sito | Dettagli di follow-up da una seconda fonte |
CONTACT-0062-A | Victor | Bennett | victorbennett62@gmail.com | +1-202-555-1061 | Form del sito | Record principale del contatto |
CONTACT-0062-B | victor | BENNETT | victorb.ennett62@gmail.com | Evento | Dettagli di follow-up da una seconda fonte |
La coppia di Nora mostra perché non elimino i duplicati a prima vista. Il record di base contiene il nome completo preferito, mentre la riga con l’alias è l’unica ad avere il numero di telefono e una seconda fonte di acquisizione. Con un merge si possono conservare entrambi.
Il dataset contiene 200 identità duplicate composte da due righe, distribuite in modo uniforme tra cinque tipi di variante: alias con il segno più, indirizzi Gmail con punti, gmail.com rispetto a googlemail.com, display name e valori mailto:. Le altre 600 identità compaiono una sola volta.
Puoi scaricare il CSV di esempio con 1.000 righe per riprodurre la procedura. Se usi un file tuo, mantieni un solo indirizzo email per riga e conserva i campi adiacenti che vuoi consolidare.
Importare e preparare la colonna email
Importa il file CSV o Excel in una nuova collection Datablist. Controlla l’anteprima di importazione e associa la colonna email a una proprietà email.
Mantieni nomi, azienda, telefono, fonte, note e ID stabili in proprietà separate. Queste colonne non sono superflue: sono gli elementi che userai per decidere quando due righe hanno la stessa email ma dati discordanti negli altri campi.
Per questo workflow preferisco inoltre avere un solo indirizzo per cella. Se una cella contiene alice@example.com; bob@example.com, prima dividila o normalizzala. La guida per deduplicare un campo contenente più indirizzi email descrive questo caso specifico.
💡 Conserva i dati utili per il merge
Non rimuovere le colonne relative a fonte, note, telefono o ID stabile prima della deduplicazione. Ti aiutano a scegliere la riga master ed evitano la perdita di dati unici.
Apri Clean > Merge duplicates. Scegli Selected Properties, quindi seleziona email per questa prima verifica basata sull’indirizzo.
Selezionare una sola proprietà rende la regola facile da interpretare. Aggiungere subito il nome o l’azienda potrebbe impedire un match email valido quando questi campi sono vuoti o formattati diversamente.
Configurare Duplicates Finder
Per la proprietà email, seleziona Smart come algoritmo di confronto e scegli il processor Email.
Ogni impostazione svolge una funzione precisa:
- Selected Properties limita la verifica all’identificatore che vuoi confrontare.
- Smart abilita la normalizzazione basata sul processor, invece di confrontare letteralmente le stringhe memorizzate.
- Email applica le regole verificate per alias, Gmail, display name e
mailto:descritte sopra.
Usa Smart con il processor Email per trovare le varianti della stessa identità. Exact rileva solo valori memorizzati identici.
La verifica dei duplicati è in sola lettura. Quando la esegui, vengono creati gruppi candidati da esaminare, senza eliminare o unire le righe della collection. Le modifiche avvengono solo dopo che hai scelto e applicato un’azione di merge o eliminazione.
Questa separazione è utile: voglio vedere quali valori la regola di matching considera equivalenti prima di consentire a un merge massivo di modificare la lista.
Eseguire il controllo e verificare i duplicati
Fai clic su Run duplicates check. Nel test, Datablist ha inserito 400 delle 1.000 righe in 200 gruppi da due righe.
Non considerare ancora il numero di gruppi come il numero di righe da eliminare. Ogni gruppo è un candidato da verificare. Per ciascuno controlla:
- che la variante dell’email sia plausibile;
- che nome e cognome coincidano o presentino una differenza spiegabile;
- che azienda e numero di telefono non siano in conflitto;
- che fonte e note forniscano informazioni complementari;
- che l’indirizzo non appartenga a una casella condivisa.
Di solito controllo i primi gruppi e ogni match insolito tra aziende diverse prima di applicare una regola massiva. È più rapido che correggere in seguito un merge troppo aggressivo.
⚠️ Un indirizzo ripetuto non indica sempre la stessa persona
Una casella condivisa come
sales@company.compuò appartenere a più contatti legittimi. Controlla manualmente gli indirizzi associati a un ruolo, senza presumere che tutte le righe debbano essere accorpate.
Il file di test è stato progettato affinché ogni coppia normalizzata corrispondesse a una sola identità. Un vero export del CRM sarà meno ordinato. Se nomi o aziende fanno pensare a persone diverse, ignora il gruppo o esaminalo separatamente.
Scegliere se unire o eliminare
La mia regola è semplice:
- Unisci le righe quando contengono dati complementari.
- Elimina una riga aggiuntiva solo quando non contiene alcun valore utile.
- Lascia i gruppi ambigui alla revisione manuale.
In questo test, la configurazione del merge ha selezionato come master la riga più completa. Ha mantenuto il record_id del master, usato i valori più lunghi per nome e cognome e combinato source e notes usando il punto e virgola.
Queste impostazioni sono adatte all’esempio, ma non combinerei automaticamente tutte le proprietà in conflitto. È sensato trasformare lo storico delle fonti in Form del sito;Export CRM. Uno stato del CRM, l’ID del proprietario o l’email principale richiedono invece, di norma, un unico valore autorevole.
L’anteprima serve a verificare queste scelte. Dopo aver modificato una regola, controlla di nuovo la riga di destinazione.
💡 Controlla l’anteprima dopo ogni modifica
Prima di applicare la regola a tutti i gruppi pronti, verifica quale riga diventa il master, quali valori vengono combinati e quali scompaiono.
Se una riga duplicata contiene un numero di telefono, una fonte o una nota unici, uniscila invece di eliminarla. Nell’esempio di Nora, la riga finale ha conservato il nome completo di un record e il telefono dell’altro.
Chi deve gestire conflitti più complessi nel CRM può seguire il workflow completo per unire Lead duplicati senza perdere dati. In questo controllo basato sull’email, l’obiettivo è conservare i campi adiacenti utili senza trasformare ogni proprietà in una stringa multivalore.
Risultati del test su 1.000 righe
Il merge ha prodotto questi risultati misurati:
| Misurazione | Risultato |
|---|---|
| Righe iniziali | 1.000 |
| Righe inserite nei gruppi di duplicati | 400 |
| Gruppi di duplicati da due righe | 200 |
| Righe duplicate eliminate | 200 |
| Righe master aggiornate | 200 |
| Righe finali | 800 |
| Gruppi di duplicati rimasti | 0 |
Il calcolo è immediato: 1.000 righe iniziali - 200 righe eliminate = 800 righe conservate.
Nel test eseguito manualmente, il merge ha richiesto pochi secondi, ma non è stato registrato un tempo preciso. Consideralo un dato relativo a questa prova, non un benchmark delle prestazioni.
Il change log scaricato contiene 400 voci: 200 righe eliminate e 200 righe master aggiornate. Per ogni gruppo unito mostra i valori precedenti al merge e quelli conservati nella riga di destinazione.
La tabella seguente riporta i valori esatti del test:
| Varianti originali | Motivo del match | Email conservata | Azione | Campi conservati |
|---|---|---|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Suffisso con il segno più rimosso | noraanderson40+newsletter@demo.co | Merge in CONTACT-0040-B | Nome completo, telefono, Form del sito;Export CRM ed entrambe le note |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Punti Gmail normalizzati | victorbennett62@gmail.com | Merge in CONTACT-0062-A | Telefono, Form del sito;Evento ed entrambe le note |
gabrielcarter113@gmail.comgabrielcarter113@googlemail.com | Domini Gmail normalizzati | gabrielcarter113@gmail.com | Merge in CONTACT-0113-A | Telefono, Lista partner;Export CRM e la nota sulla richiesta di demo |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Display name rimosso | camiladiaz123@testmail.net | Merge in CONTACT-0123-A | Nome completo, telefono, Lista partner;Export CRM ed entrambe le note |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Wrapper mailto: rimosso e maiuscole normalizzate | mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Merge in CONTACT-0199-B | Nome completo, telefono, Webinar;Evento ed entrambe le note |
Nota che il valore conservato non è sempre l’email visivamente più semplice. Il record master selezionato determina quale indirizzo memorizzato rimane. La normalizzazione viene usata per il matching, ma non riscrive automaticamente ogni valore conservato in un formato canonico.
Il merge di test ha ridotto le righe da 1.000 a 800 perché 200 duplicati verificati sono stati consolidati nei rispettivi record master. Il risultato riguarda la lista creata per il test e non rappresenta un tasso di matching universale per ogni formato email.
Errori comuni e checklist di verifica
Lo Smart Email matching gestisce le cinque famiglie di varianti testate, ma non sostituisce la revisione.
Punti nei domini diversi da Gmail
Nei domini diversi da Gmail, i punti restano significativi. Non presumere che first.last@company.com e firstlast@company.com appartengano alla stessa casella. Se disponi di prove esterne che li collegano, gestisci la coppia manualmente.
Valori non validi
Le stringhe malformate e i valori che non corrispondono a un singolo indirizzo email valido rimangono invariati. Pulisci queste celle o spostale in una coda di revisione separata. Non aspettarti che il processor ricavi un indirizzo da testo arbitrario.
Matching Exact
Il confronto Exact non rileva alias con il segno più, variazioni dei punti Gmail, alias di dominio e wrapper quando le stringhe memorizzate differiscono. Può essere il comportamento corretto se gli alias devono rimanere separati, ma non è l’impostazione usata in questo workflow.
Più indirizzi in una cella
Questo metodo presuppone un solo indirizzo per cella. Una cella con più indirizzi separati da delimitatori richiede prima il workflow specifico per i valori multipli.
Caselle email condivise
Due righe con sales@company.com possono descrivere persone diverse. La decisione deve basarsi su nomi, ruoli, aziende e note. Non eseguirei un merge massivo delle caselle associate a un ruolo senza prima controllarle.
Eliminazione di campi complementari
Eliminare una riga aggiuntiva può rimuovere l’unico numero di telefono, la fonte di acquisizione o una nota. Usa l’anteprima del merge per vedere quali dati verranno conservati.
Il test ha individuato tutte le 200 identità previste e nessun gruppo inatteso tra identità diverse. Non ha però coperto ogni formato email reale, valore non valido o configurazione di casella condivisa.
Prima di esportare la lista, verifica che:
- Ogni gruppo approvato rappresenti una sola identità.
- Le caselle condivise e associate a un ruolo siano state controllate manualmente.
- La riga master contenga il nome, l’ID e l’indirizzo email preferiti.
- I valori unici di telefono, azienda, fonte e note sopravvivano al merge.
- Il numero di righe iniziali meno quelle eliminate corrisponda al totale finale.
- Un controllo a campione copra ogni famiglia di normalizzazione presente nella lista.
- Il numero di gruppi duplicati rimasti corrisponda alle aspettative.
📌 Verifica i totali
Righe iniziali - righe eliminate = righe finaliè il controllo di completezza più rapido dopo un merge.
Continuare a pulire la lista email
La deduplicazione risolve le identità ripetute. Non verifica l’esistenza delle caselle, i provider di email temporanee, lo stato di disiscrizione o la deliverability.
Preferisco risolvere prima le identità duplicate. In questo modo, i controlli successivi vengono eseguiti sui contatti conservati e non su più versioni della stessa persona. Quando il merge supera la checklist di verifica, completa la pulizia della lista email, quindi apri Export e scegli CSV o Excel.
Deduplica la tua lista con Datablist
Importa il file dei contatti in Datablist, esegui il controllo dei duplicati basato sull’email, verifica i gruppi proposti, unisci i valori utili ed esporta la lista pulita.
FAQ
Le maiuscole contano nel confronto delle email?
Il confronto Smart Email usa valori in minuscolo per il matching, quindi NAME@example.com e name@example.com possono essere raggruppati quando il resto dell’indirizzo normalizzato coincide.
Punti Gmail e alias con il segno più indicano lo stesso indirizzo?
Lo Smart Email matching rimuove il suffisso con il segno più dalla parte locale e ignora i punti nella parte locale degli indirizzi Gmail. La regola dei punti vale solo per Gmail: negli altri domini, i punti restano significativi.
È meglio unire o eliminare i contatti duplicati?
Esegui il merge quando un’altra riga aggiunge un numero di telefono, una fonte, una nota, un’azienda o un altro campo utile. Elimina la riga aggiuntiva solo se non contiene nulla che ti serva.
Cosa fare se una cella contiene più indirizzi email?
Dividi o normalizza la cella multivalore prima di eseguire questo workflow a livello di riga. Segui la guida per deduplicare un campo contenente più indirizzi email.
Le caselle condivise come sales@company.com vanno unite?
Non automaticamente. Un unico indirizzo condiviso può rappresentare più contatti. Confronta i nomi e gli altri campi, quindi verifica manualmente questi gruppi.










