I duplicati delle email tendono a comparire quando si unisce un export del CRM con le submission di un form o una lista di partecipanti a un evento. La stessa persona compare due volte, ma le righe raramente sono identiche: una può contenere il numero di telefono, l’altra la fonte o una nota utile.

Per questo non inizio eliminando le email ripetute. Per deduplicare gli indirizzi email in modo sicuro, uso Datablist Duplicates Finder con Smart matching e il processor Email. Datablist raggruppa le varianti dello stesso indirizzo, poi mi permette di esaminare le righe complete dei contatti e unire i dati che voglio conservare.

Per questa guida ho preparato una lista di test con 1.000 contatti e le varianti che incontro più spesso: alias con il segno più, differenze negli indirizzi Gmail e indirizzi racchiusi in altri formati. Datablist ha individuato 200 coppie di duplicati e la collection pulita è rimasta con 800 contatti. Vediamo quali impostazioni ho usato e quali controlli ho effettuato prima di unire i dati.

Inizia dal matching sull’email, ma decidi cosa conservare valutando l’intera riga del contatto. Se invece devi confrontare nomi, numeri di telefono, domini aziendali o altri identificatori, scopri come deduplicare una lista online.

Quali indirizzi email considera uguali Datablist

Lo Smart matching con il processor Email confronta l’identità degli indirizzi, non il semplice testo contenuto nelle celle. Rimuove gli spazi iniziali e finali, confronta i valori in minuscolo ed elimina il +suffisso dalla parte locale prima del matching.

Applica inoltre regole specifiche per Gmail. Rimuove i punti dalla parte locale degli indirizzi Gmail e riconduce googlemail.com a gmail.com. Datablist può anche estrarre un indirizzo valido racchiuso in un display name o in un valore mailto: con una query string.

Ecco alcuni esempi tratti dal dataset di test:

Valori memorizzatiRisultato Smart Email
noraanderson40@demo.co
noraanderson40+newsletter@demo.co
Stessa identità dopo la rimozione del suffisso con il segno più
victorbennett62@gmail.com
victorb.ennett62@gmail.com
Stessa identità Gmail dopo la rimozione dei punti
yasmincarter105@gmail.com
yasmincarter105@googlemail.com
Stessa identità Gmail dopo la normalizzazione del dominio
camiladiaz123@testmail.net
Camila Diaz <camiladiaz123@testmail.net>
Stessa identità dopo l’estrazione dell’indirizzo racchiuso nel display name
marcusevans199@testmail.net
mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello
Stessa identità dopo la rimozione del wrapper e il confronto in minuscolo

La gestione dei punti è specifica per Gmail. Datablist non presume che first.last@company.com e firstlast@company.com siano lo stesso indirizzo. Nei domini diversi da Gmail, i punti possono avere un significato preciso.

Anche i valori non validi rimangono invariati. Il processor è progettato per singoli indirizzi email validi, non per interpretare stringhe arbitrarie. Se vuoi trovare solo valori memorizzati identici, seleziona Exact invece di Smart.

🔑 La normalizzazione propone un gruppo di duplicati

Non dimostra che tutti i campi appartengano alla stessa persona. Prima del merge, controlla nomi, aziende e caselle email associate a un ruolo.

Per la maggior parte delle operazioni di pulizia delle liste di contatti consiglio Smart matching con il processor Email. Passo a Exact solo quando gli alias devono restare separati o quando l’identificatore è la stringa memorizzata in sé.

Consulta la documentazione del processor Email per conoscere tutte le regole di normalizzazione e la disponibilità nei diversi piani.

Lista email di esempio usata nella guida

Il file di test contiene 1.000 righe di contatti sintetici, corrispondenti a 800 identità create appositamente. Nessuna coppia di duplicati presenta la stessa stringa email grezza. È un aspetto importante, perché una pulizia basata sui valori esatti non mostrerebbe il matching degli alias.

Il file contiene otto colonne: record_id, first_name, last_name, email, company, phone, source e notes. Il workflow esegue il matching su email, mentre gli altri campi restano visibili per consentirmi di scegliere un record master e conservare i valori utili.

Ecco quattro righe esatte dell’input, appartenenti a due coppie di duplicati:

record_idfirst_namelast_nameemailphonesourcenotes
CONTACT-0040-ANoraAndersonnoraanderson40@demo.coExport CRMRecord principale del contatto
CONTACT-0040-BN.A.noraanderson40+newsletter@demo.co+1-202-555-1039Form del sitoDettagli di follow-up da una seconda fonte
CONTACT-0062-AVictorBennettvictorbennett62@gmail.com+1-202-555-1061Form del sitoRecord principale del contatto
CONTACT-0062-BvictorBENNETTvictorb.ennett62@gmail.comEventoDettagli di follow-up da una seconda fonte

La coppia di Nora mostra perché non elimino i duplicati a prima vista. Il record di base contiene il nome completo preferito, mentre la riga con l’alias è l’unica ad avere il numero di telefono e una seconda fonte di acquisizione. Con un merge si possono conservare entrambi.

Il dataset contiene 200 identità duplicate composte da due righe, distribuite in modo uniforme tra cinque tipi di variante: alias con il segno più, indirizzi Gmail con punti, gmail.com rispetto a googlemail.com, display name e valori mailto:. Le altre 600 identità compaiono una sola volta.

Puoi scaricare il CSV di esempio con 1.000 righe per riprodurre la procedura. Se usi un file tuo, mantieni un solo indirizzo email per riga e conserva i campi adiacenti che vuoi consolidare.

Importare e preparare la colonna email

Importa il file CSV o Excel in una nuova collection Datablist. Controlla l’anteprima di importazione e associa la colonna email a una proprietà email.

Mantieni nomi, azienda, telefono, fonte, note e ID stabili in proprietà separate. Queste colonne non sono superflue: sono gli elementi che userai per decidere quando due righe hanno la stessa email ma dati discordanti negli altri campi.

Una collection di 1.000 contatti con il menu Clean aperto su Merge duplicates
Una collection di 1.000 contatti con il menu Clean aperto su Merge duplicates

Per questo workflow preferisco inoltre avere un solo indirizzo per cella. Se una cella contiene alice@example.com; bob@example.com, prima dividila o normalizzala. La guida per deduplicare un campo contenente più indirizzi email descrive questo caso specifico.

💡 Conserva i dati utili per il merge

Non rimuovere le colonne relative a fonte, note, telefono o ID stabile prima della deduplicazione. Ti aiutano a scegliere la riga master ed evitano la perdita di dati unici.

Apri Clean > Merge duplicates. Scegli Selected Properties, quindi seleziona email per questa prima verifica basata sull’indirizzo.

La proprietà email selezionata come campo per trovare i contatti duplicati
La proprietà email selezionata come campo per trovare i contatti duplicati

Selezionare una sola proprietà rende la regola facile da interpretare. Aggiungere subito il nome o l’azienda potrebbe impedire un match email valido quando questi campi sono vuoti o formattati diversamente.

Configurare Duplicates Finder

Per la proprietà email, seleziona Smart come algoritmo di confronto e scegli il processor Email.

Confronto Smart configurato con il processor Email
Confronto Smart configurato con il processor Email

Ogni impostazione svolge una funzione precisa:

  • Selected Properties limita la verifica all’identificatore che vuoi confrontare.
  • Smart abilita la normalizzazione basata sul processor, invece di confrontare letteralmente le stringhe memorizzate.
  • Email applica le regole verificate per alias, Gmail, display name e mailto: descritte sopra.

Usa Smart con il processor Email per trovare le varianti della stessa identità. Exact rileva solo valori memorizzati identici.

La verifica dei duplicati è in sola lettura. Quando la esegui, vengono creati gruppi candidati da esaminare, senza eliminare o unire le righe della collection. Le modifiche avvengono solo dopo che hai scelto e applicato un’azione di merge o eliminazione.

Questa separazione è utile: voglio vedere quali valori la regola di matching considera equivalenti prima di consentire a un merge massivo di modificare la lista.

Eseguire il controllo e verificare i duplicati

Fai clic su Run duplicates check. Nel test, Datablist ha inserito 400 delle 1.000 righe in 200 gruppi da due righe.

Revisione dei duplicati con 200 gruppi, varianti email e campi discordanti
Revisione dei duplicati con 200 gruppi, varianti email e campi discordanti

Non considerare ancora il numero di gruppi come il numero di righe da eliminare. Ogni gruppo è un candidato da verificare. Per ciascuno controlla:

  • che la variante dell’email sia plausibile;
  • che nome e cognome coincidano o presentino una differenza spiegabile;
  • che azienda e numero di telefono non siano in conflitto;
  • che fonte e note forniscano informazioni complementari;
  • che l’indirizzo non appartenga a una casella condivisa.

Di solito controllo i primi gruppi e ogni match insolito tra aziende diverse prima di applicare una regola massiva. È più rapido che correggere in seguito un merge troppo aggressivo.

⚠️ Un indirizzo ripetuto non indica sempre la stessa persona

Una casella condivisa come sales@company.com può appartenere a più contatti legittimi. Controlla manualmente gli indirizzi associati a un ruolo, senza presumere che tutte le righe debbano essere accorpate.

Il file di test è stato progettato affinché ogni coppia normalizzata corrispondesse a una sola identità. Un vero export del CRM sarà meno ordinato. Se nomi o aziende fanno pensare a persone diverse, ignora il gruppo o esaminalo separatamente.

Scegliere se unire o eliminare

La mia regola è semplice:

  • Unisci le righe quando contengono dati complementari.
  • Elimina una riga aggiuntiva solo quando non contiene alcun valore utile.
  • Lascia i gruppi ambigui alla revisione manuale.

In questo test, la configurazione del merge ha selezionato come master la riga più completa. Ha mantenuto il record_id del master, usato i valori più lunghi per nome e cognome e combinato source e notes usando il punto e virgola.

Regole di merge configurate per conservare un record master e combinare fonte e note
Regole di merge configurate per conservare un record master e combinare fonte e note

Queste impostazioni sono adatte all’esempio, ma non combinerei automaticamente tutte le proprietà in conflitto. È sensato trasformare lo storico delle fonti in Form del sito;Export CRM. Uno stato del CRM, l’ID del proprietario o l’email principale richiedono invece, di norma, un unico valore autorevole.

L’anteprima serve a verificare queste scelte. Dopo aver modificato una regola, controlla di nuovo la riga di destinazione.

Anteprima con tutti i 200 gruppi di duplicati verificati e pronti per il merge
Anteprima con tutti i 200 gruppi di duplicati verificati e pronti per il merge

💡 Controlla l’anteprima dopo ogni modifica

Prima di applicare la regola a tutti i gruppi pronti, verifica quale riga diventa il master, quali valori vengono combinati e quali scompaiono.

Se una riga duplicata contiene un numero di telefono, una fonte o una nota unici, uniscila invece di eliminarla. Nell’esempio di Nora, la riga finale ha conservato il nome completo di un record e il telefono dell’altro.

Chi deve gestire conflitti più complessi nel CRM può seguire il workflow completo per unire Lead duplicati senza perdere dati. In questo controllo basato sull’email, l’obiettivo è conservare i campi adiacenti utili senza trasformare ogni proprietà in una stringa multivalore.

Risultati del test su 1.000 righe

Il merge ha prodotto questi risultati misurati:

MisurazioneRisultato
Righe iniziali1.000
Righe inserite nei gruppi di duplicati400
Gruppi di duplicati da due righe200
Righe duplicate eliminate200
Righe master aggiornate200
Righe finali800
Gruppi di duplicati rimasti0

Il calcolo è immediato: 1.000 righe iniziali - 200 righe eliminate = 800 righe conservate.

Completamento del merge di 200 gruppi, senza gruppi di duplicati residui
Completamento del merge di 200 gruppi, senza gruppi di duplicati residui

Nel test eseguito manualmente, il merge ha richiesto pochi secondi, ma non è stato registrato un tempo preciso. Consideralo un dato relativo a questa prova, non un benchmark delle prestazioni.

Il change log scaricato contiene 400 voci: 200 righe eliminate e 200 righe master aggiornate. Per ogni gruppo unito mostra i valori precedenti al merge e quelli conservati nella riga di destinazione.

Change log scaricato con i record email eliminati e aggiornati
Change log scaricato con i record email eliminati e aggiornati

La tabella seguente riporta i valori esatti del test:

Varianti originaliMotivo del matchEmail conservataAzioneCampi conservati
noraanderson40@demo.co
noraanderson40+newsletter@demo.co
Suffisso con il segno più rimossonoraanderson40+newsletter@demo.coMerge in CONTACT-0040-BNome completo, telefono, Form del sito;Export CRM ed entrambe le note
victorbennett62@gmail.com
victorb.ennett62@gmail.com
Punti Gmail normalizzativictorbennett62@gmail.comMerge in CONTACT-0062-ATelefono, Form del sito;Evento ed entrambe le note
gabrielcarter113@gmail.com
gabrielcarter113@googlemail.com
Domini Gmail normalizzatigabrielcarter113@gmail.comMerge in CONTACT-0113-ATelefono, Lista partner;Export CRM e la nota sulla richiesta di demo
camiladiaz123@testmail.net
Camila Diaz <camiladiaz123@testmail.net>
Display name rimossocamiladiaz123@testmail.netMerge in CONTACT-0123-ANome completo, telefono, Lista partner;Export CRM ed entrambe le note
marcusevans199@testmail.net
mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello
Wrapper mailto: rimosso e maiuscole normalizzatemailto:MARCUSEVANS199@TESTMAIL.NET?subject=HelloMerge in CONTACT-0199-BNome completo, telefono, Webinar;Evento ed entrambe le note

Nota che il valore conservato non è sempre l’email visivamente più semplice. Il record master selezionato determina quale indirizzo memorizzato rimane. La normalizzazione viene usata per il matching, ma non riscrive automaticamente ogni valore conservato in un formato canonico.

La collection Accounts pulita con le 800 righe rimanenti
La collection Accounts pulita con le 800 righe rimanenti

Il merge di test ha ridotto le righe da 1.000 a 800 perché 200 duplicati verificati sono stati consolidati nei rispettivi record master. Il risultato riguarda la lista creata per il test e non rappresenta un tasso di matching universale per ogni formato email.

Errori comuni e checklist di verifica

Lo Smart Email matching gestisce le cinque famiglie di varianti testate, ma non sostituisce la revisione.

Punti nei domini diversi da Gmail

Nei domini diversi da Gmail, i punti restano significativi. Non presumere che first.last@company.com e firstlast@company.com appartengano alla stessa casella. Se disponi di prove esterne che li collegano, gestisci la coppia manualmente.

Valori non validi

Le stringhe malformate e i valori che non corrispondono a un singolo indirizzo email valido rimangono invariati. Pulisci queste celle o spostale in una coda di revisione separata. Non aspettarti che il processor ricavi un indirizzo da testo arbitrario.

Matching Exact

Il confronto Exact non rileva alias con il segno più, variazioni dei punti Gmail, alias di dominio e wrapper quando le stringhe memorizzate differiscono. Può essere il comportamento corretto se gli alias devono rimanere separati, ma non è l’impostazione usata in questo workflow.

Più indirizzi in una cella

Questo metodo presuppone un solo indirizzo per cella. Una cella con più indirizzi separati da delimitatori richiede prima il workflow specifico per i valori multipli.

Caselle email condivise

Due righe con sales@company.com possono descrivere persone diverse. La decisione deve basarsi su nomi, ruoli, aziende e note. Non eseguirei un merge massivo delle caselle associate a un ruolo senza prima controllarle.

Eliminazione di campi complementari

Eliminare una riga aggiuntiva può rimuovere l’unico numero di telefono, la fonte di acquisizione o una nota. Usa l’anteprima del merge per vedere quali dati verranno conservati.

Il test ha individuato tutte le 200 identità previste e nessun gruppo inatteso tra identità diverse. Non ha però coperto ogni formato email reale, valore non valido o configurazione di casella condivisa.

Prima di esportare la lista, verifica che:

  • Ogni gruppo approvato rappresenti una sola identità.
  • Le caselle condivise e associate a un ruolo siano state controllate manualmente.
  • La riga master contenga il nome, l’ID e l’indirizzo email preferiti.
  • I valori unici di telefono, azienda, fonte e note sopravvivano al merge.
  • Il numero di righe iniziali meno quelle eliminate corrisponda al totale finale.
  • Un controllo a campione copra ogni famiglia di normalizzazione presente nella lista.
  • Il numero di gruppi duplicati rimasti corrisponda alle aspettative.

📌 Verifica i totali

Righe iniziali - righe eliminate = righe finali è il controllo di completezza più rapido dopo un merge.

Continuare a pulire la lista email

La deduplicazione risolve le identità ripetute. Non verifica l’esistenza delle caselle, i provider di email temporanee, lo stato di disiscrizione o la deliverability.

Preferisco risolvere prima le identità duplicate. In questo modo, i controlli successivi vengono eseguiti sui contatti conservati e non su più versioni della stessa persona. Quando il merge supera la checklist di verifica, completa la pulizia della lista email, quindi apri Export e scegli CSV o Excel.

Deduplica la tua lista con Datablist

Importa il file dei contatti in Datablist, esegui il controllo dei duplicati basato sull’email, verifica i gruppi proposti, unisci i valori utili ed esporta la lista pulita.

FAQ

Le maiuscole contano nel confronto delle email?

Il confronto Smart Email usa valori in minuscolo per il matching, quindi NAME@example.com e name@example.com possono essere raggruppati quando il resto dell’indirizzo normalizzato coincide.

Punti Gmail e alias con il segno più indicano lo stesso indirizzo?

Lo Smart Email matching rimuove il suffisso con il segno più dalla parte locale e ignora i punti nella parte locale degli indirizzi Gmail. La regola dei punti vale solo per Gmail: negli altri domini, i punti restano significativi.

È meglio unire o eliminare i contatti duplicati?

Esegui il merge quando un’altra riga aggiunge un numero di telefono, una fonte, una nota, un’azienda o un altro campo utile. Elimina la riga aggiuntiva solo se non contiene nulla che ti serva.

Cosa fare se una cella contiene più indirizzi email?

Dividi o normalizza la cella multivalore prima di eseguire questo workflow a livello di riga. Segui la guida per deduplicare un campo contenente più indirizzi email.

Le caselle condivise come sales@company.com vanno unite?

Non automaticamente. Un unico indirizzo condiviso può rappresentare più contatti. Confronta i nomi e gli altri campi, quindi verifica manualmente questi gruppi.