Les doublons d’emails ont tendance à se glisser dans vos listes lorsque vous combinez un export CRM avec des soumissions de formulaires ou une liste d’événement. La même personne apparaît deux fois, mais les lignes sont rarement identiques. L’une peut contenir le numéro de téléphone, tandis que l’autre indique la source ou une note utile.
C’est pourquoi je ne commence pas par supprimer les emails répétés. Pour dédupliquer des adresses email sans risque, j’utilise le Datablist Duplicates Finder avec le Smart matching et le processeur Email. Il regroupe les variantes d’une même adresse, puis me permet d’examiner les fiches contact complètes et de fusionner les informations à conserver.
Pour ce guide, j’ai créé une liste test de 1 000 contacts avec les types de variantes que je rencontre souvent : alias avec signe plus, différences propres à Gmail ou encore adresses intégrées dans un libellé. Datablist a détecté 200 paires de doublons, et la collection nettoyée comptait finalement 800 contacts. Voici les réglages que j’ai utilisés et les vérifications effectuées avant toute fusion.
Commencez par comparer les emails, mais décidez des données à conserver à partir de la fiche contact complète. Si vous devez plutôt comparer les noms, numéros de téléphone, domaines d’entreprise ou d’autres identifiants, découvrez comment dédupliquer une liste en ligne.
Ce que Datablist considère comme la même adresse email
Le Smart matching associé au processeur Email compare l’identité des adresses plutôt que le texte brut des cellules. Il supprime les espaces autour de l’adresse, compare les valeurs en minuscules et retire le +suffixe de la partie locale avant la comparaison.
Il applique également des règles propres à Gmail. Les points sont supprimés de la partie locale des adresses Gmail, et le domaine googlemail.com est converti en gmail.com. Datablist peut aussi extraire une adresse valide depuis un libellé contenant un nom d’affichage ou une valeur mailto: accompagnée de paramètres de requête.
Voici quelques exemples issus du jeu de données testé :
| Valeurs enregistrées | Résultat du Smart Email |
|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Même identité après suppression du suffixe avec signe plus |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Même identité Gmail après suppression des points |
yasmincarter105@gmail.comyasmincarter105@googlemail.com | Même identité Gmail après normalisation du domaine |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Même identité après extraction de l’adresse intégrée au libellé |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Même identité après suppression du libellé et comparaison en minuscules |
La gestion des points est propre à Gmail. Datablist ne considère pas que prenom.nom@entreprise.com et prenomnom@entreprise.com correspondent à la même adresse. Sur les domaines autres que Gmail, les points peuvent avoir une incidence.
Les valeurs mal formées restent également inchangées. Le processeur est conçu pour reconnaître une seule adresse email valide, pas pour deviner le sens d’une chaîne de caractères arbitraire. Si vous souhaitez uniquement rapprocher des valeurs enregistrées strictement identiques, sélectionnez Exact plutôt que Smart.
🔑 La normalisation suggère un groupe de doublons
Elle ne prouve pas que tous les champs appartiennent à la même personne. Vérifiez les noms, les entreprises et les boîtes mail génériques avant de fusionner.
Pour la plupart des opérations de nettoyage de listes de contacts, je recommande le Smart matching avec le processeur Email. Je passe à Exact uniquement lorsque les alias doivent rester séparés ou lorsque la chaîne enregistrée constitue elle-même l’identifiant.
Consultez la documentation du processeur Email pour connaître l’ensemble des règles de normalisation et leur disponibilité selon les offres.
Exemple de liste d’emails utilisé dans ce guide
Le fichier test contient 1 000 lignes de contacts fictifs représentant 800 identités définies à l’avance. Aucune paire de doublons ne possède exactement la même chaîne d’email. C’est important, car un nettoyage fondé sur des valeurs strictement identiques ne permettrait pas d’illustrer la détection des alias.
Le fichier comporte huit colonnes : record_id, first_name, last_name, email, company, phone, source et notes. Le workflow effectue la comparaison sur email, mais les autres champs restent visibles afin que je puisse sélectionner une fiche principale et préserver les valeurs utiles.
Voici quatre lignes exactes du fichier source, issues de deux paires de doublons :
| record_id | first_name | last_name | phone | source | notes | |
|---|---|---|---|---|---|---|
CONTACT-0040-A | Nora | Anderson | noraanderson40@demo.co | Export CRM | Fiche contact principale | |
CONTACT-0040-B | N. | A. | noraanderson40+newsletter@demo.co | +1-202-555-1039 | Formulaire du site | Informations de suivi provenant d’une seconde source |
CONTACT-0062-A | Victor | Bennett | victorbennett62@gmail.com | +1-202-555-1061 | Formulaire du site | Fiche contact principale |
CONTACT-0062-B | victor | BENNETT | victorb.ennett62@gmail.com | Événement | Informations de suivi provenant d’une seconde source |
La paire de Nora montre pourquoi je ne supprime pas les doublons à première vue. La fiche de base contient le nom complet à privilégier, tandis que la ligne avec l’alias est la seule à comporter un numéro de téléphone et une seconde source d’acquisition. Une fusion permet de conserver les deux.
Le jeu de données comprend 200 identités en double, composées chacune de deux lignes et réparties équitablement entre cinq familles de variantes : alias avec signe plus, adresses Gmail avec des points, gmail.com contre googlemail.com, libellés avec nom d’affichage et valeurs mailto:. Les 600 autres identités n’apparaissent qu’une fois.
Vous pouvez télécharger l’exemple CSV de 1 000 lignes pour reproduire ce guide. Si vous utilisez votre propre fichier, conservez un email par ligne ainsi que les champs adjacents que vous souhaitez consolider.
Importer et préparer la colonne email
Importez le fichier CSV ou Excel dans une nouvelle collection Datablist. Vérifiez l’aperçu de l’import et associez la colonne d’emails à une propriété de type email.
Conservez les noms, l’entreprise, le téléphone, la source, les notes et les identifiants stables dans des propriétés distinctes. Ces colonnes ne sont pas superflues : elles vous aideront à prendre une décision lorsque deux lignes correspondent sur l’email, mais présentent des informations différentes ailleurs.
Pour ce workflow, je préfère également ne conserver qu’une seule adresse par cellule. Si une cellule contient alice@example.com; bob@example.com, commencez par la fractionner ou la normaliser. Le guide pour dédupliquer un champ contenant plusieurs adresses email traite spécifiquement ce cas.
💡 Conservez les données utiles à la fusion
Ne supprimez pas les colonnes source, notes, téléphone ou identifiant stable avant la déduplication. Elles vous aident à choisir la ligne principale et à ne pas perdre de données uniques.
Ouvrez Clean > Merge duplicates. Choisissez Selected Properties, puis sélectionnez email pour cette première passe centrée sur l’adresse email.
En ne sélectionnant qu’une seule propriété, la règle reste facile à comprendre. Ajouter le nom ou l’entreprise à ce stade pourrait empêcher la détection d’un véritable doublon si ces champs sont absents ou formatés différemment.
Configurer le Duplicates Finder
Pour la propriété email, sélectionnez Smart comme algorithme de comparaison, puis choisissez le processeur Email.
Chaque réglage remplit une fonction précise :
- Selected Properties limite la vérification à l’identifiant que vous souhaitez comparer.
- Smart active la normalisation fondée sur le processeur au lieu de comparer littéralement les chaînes enregistrées.
- Email applique les règles vérifiées concernant les alias, Gmail, les noms d’affichage et les valeurs
mailto:décrites précédemment.
Utilisez Smart avec le processeur Email pour détecter les variantes d’une même identité. Exact repère uniquement les valeurs enregistrées à l’identique.
La recherche de doublons est une opération en lecture seule. Son exécution crée des groupes de correspondances potentielles à vérifier. Elle ne supprime ni ne fusionne aucune ligne de la collection. Les modifications interviennent uniquement après la sélection et l’application d’une action de fusion ou de suppression.
Cette séparation est utile : je veux voir ce que la règle de rapprochement considère comme équivalent avant d’autoriser une fusion en masse sur la liste.
Lancer la détection et vérifier les doublons
Cliquez sur Run duplicates check. Dans ce test, Datablist a réparti 400 des 1 000 lignes dans 200 groupes de deux lignes.
Ne considérez pas encore le nombre de groupes comme le nombre de suppressions. Chaque groupe est une correspondance potentielle à examiner. Pour chacun, vérifiez :
- si la variante de l’email est cohérente ;
- si les noms et prénoms concordent ou présentent une variation explicable ;
- si les valeurs d’entreprise et de téléphone se contredisent ;
- si les sources et les notes apportent des informations complémentaires ;
- si l’adresse correspond à une boîte mail partagée.
En général, j’examine les premiers groupes ainsi que toute correspondance surprenante entre des entreprises différentes avant d’appliquer une règle en masse. C’est plus rapide que de réparer ensuite une fusion trop agressive.
⚠️ Une adresse répétée ne désigne pas toujours la même personne
Une boîte partagée comme
sales@company.compeut être associée à plusieurs contacts légitimes. Vérifiez manuellement les adresses génériques au lieu de supposer que toutes les lignes doivent être regroupées.
Le fichier testé a été conçu pour que chaque paire normalisée représente une seule identité. Un véritable export CRM sera plus complexe. Si les noms ou les entreprises semblent désigner des personnes différentes, ignorez le groupe ou examinez-le séparément.
Choisir entre fusionner et supprimer
Ma règle de décision est simple :
- Fusionnez les lignes lorsqu’elles contiennent des données complémentaires.
- Ne supprimez une ligne supplémentaire que si elle n’apporte aucune information utile.
- Réservez les groupes ambigus à une vérification manuelle.
Pour ce test, la configuration de fusion sélectionnait la ligne la plus complète comme fiche principale. Elle conservait son record_id, utilisait les valeurs de prénom et de nom les plus longues, puis combinait source et notes avec des points-virgules.
Ces réglages conviennent à cet exemple, mais je ne combinerais pas par défaut toutes les propriétés contradictoires. Un historique de sources peut tout à fait devenir Formulaire du site;Export CRM. En revanche, un statut CRM, l’identifiant d’un responsable ou l’email principal nécessite généralement une valeur de référence unique.
L’aperçu vous permet de valider ces choix. Après chaque modification d’une règle, examinez de nouveau la ligne de destination.
💡 Vérifiez l’aperçu après chaque modification de règle
Avant d’appliquer la règle à tous les groupes prêts, vérifiez quelle ligne devient la fiche principale, quelles valeurs sont combinées et lesquelles disparaissent.
Si une ligne en double contient un numéro de téléphone, une source ou une note unique, fusionnez-la au lieu de la supprimer. Dans l’exemple de Nora, la ligne finale a conservé le nom complet d’une fiche et le téléphone de l’autre.
Si vous gérez des conflits CRM plus complexes, suivez le workflow détaillé pour fusionner des leads en double sans perdre de données. Pour cette passe centrée sur les emails, l’objectif est de préserver les champs adjacents utiles sans transformer chaque propriété en chaîne multivaleur.
Résultats du test sur une liste de 1 000 lignes
La fusion a produit les résultats mesurés suivants :
| Mesure | Résultat |
|---|---|
| Lignes au départ | 1 000 |
| Lignes placées dans des groupes de doublons | 400 |
| Groupes de doublons composés de deux lignes | 200 |
| Lignes en double supprimées | 200 |
| Lignes principales mises à jour | 200 |
| Lignes finales | 800 |
| Groupes de doublons restants | 0 |
Le rapprochement est simple : 1 000 lignes au départ - 200 lignes supprimées = 800 lignes conservées.
La fusion a pris quelques secondes lors du test manuel, mais aucun chronométrage précis n’a été effectué. Il s’agit donc d’une observation propre à ce test, et non d’un benchmark de performance.
Le journal des modifications téléchargé contient 400 entrées : 200 lignes supprimées et 200 lignes principales mises à jour. Pour chaque groupe fusionné, il indique les valeurs présentes avant la fusion et celles conservées dans la ligne de destination.
Le tableau ci-dessous reprend les valeurs exactes du test :
| Variantes d’origine | Raison du rapprochement | Email conservé | Action | Champs préservés |
|---|---|---|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Suffixe avec signe plus supprimé | noraanderson40+newsletter@demo.co | Fusion dans CONTACT-0040-B | Nom complet, téléphone, Formulaire du site;Export CRM et les deux notes |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Points Gmail normalisés | victorbennett62@gmail.com | Fusion dans CONTACT-0062-A | Téléphone, Formulaire du site;Événement et les deux notes |
gabrielcarter113@gmail.comgabrielcarter113@googlemail.com | Domaines Gmail normalisés | gabrielcarter113@gmail.com | Fusion dans CONTACT-0113-A | Téléphone, Liste partenaire;Export CRM et la note de demande de démo |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Libellé avec nom d’affichage supprimé | camiladiaz123@testmail.net | Fusion dans CONTACT-0123-A | Nom complet, téléphone, Liste partenaire;Export CRM et les deux notes |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Libellé mailto: supprimé et casse normalisée | mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Fusion dans CONTACT-0199-B | Nom complet, téléphone, Webinar;Événement et les deux notes |
Notez que la valeur conservée n’est pas toujours l’adresse email la plus simple visuellement. La fiche principale sélectionnée détermine l’email enregistré qui subsiste. La normalisation sert au rapprochement ; elle ne réécrit pas automatiquement chaque valeur conservée dans un format canonique.
La fusion testée a réduit la liste de 1 000 à 800 lignes, car 200 lignes en double vérifiées ont été consolidées dans leurs fiches principales. Ce résultat décrit la liste test conçue pour ce guide, et non un taux de correspondance universel pour tous les formats d’emails.
Cas d’échec et checklist de validation
Le Smart Email matching gère les cinq familles de variantes testées, mais ne doit pas remplacer une vérification.
Points sur les domaines autres que Gmail
Les points restent significatifs sur les domaines autres que Gmail. Ne supposez pas que prenom.nom@entreprise.com et prenomnom@entreprise.com correspondent à la même boîte mail. Si vous disposez de preuves externes établissant un lien entre les deux, traitez cette paire manuellement.
Valeurs mal formées
Les chaînes mal formées et les valeurs qui ne correspondent pas à une adresse email unique valide restent inchangées. Nettoyez ces cellules ou placez-les dans une file de vérification distincte. Ne comptez pas sur le processeur pour déduire une adresse à partir d’un texte arbitraire.
Comparaison Exact
La comparaison Exact ne détecte pas les alias avec signe plus, les variations de points Gmail, les alias de domaine ni les libellés lorsque les chaînes enregistrées diffèrent. Ce comportement peut être approprié si vous devez conserver les alias séparément, mais ce n’est pas le réglage utilisé dans ce workflow.
Plusieurs adresses dans une cellule
Cette méthode suppose que chaque cellule ne contient qu’une seule adresse. Une cellule contenant plusieurs adresses séparées par des délimiteurs nécessite d’abord le workflow multivaleur dédié, avant la comparaison des lignes.
Boîtes mail partagées
Deux lignes comportant sales@company.com peuvent décrire des personnes différentes. Les noms, intitulés de poste, entreprises et notes doivent guider votre décision. Je déconseille de fusionner en masse des boîtes mail génériques sans les vérifier.
Suppression de champs complémentaires
La suppression d’une ligne supplémentaire peut faire disparaître l’unique numéro de téléphone, source d’acquisition ou note disponible. Utilisez l’aperçu de la fusion pour vérifier les données qui seront conservées.
Le test conçu pour ce guide a détecté les 200 identités prévues sans créer de groupe inattendu entre des identités différentes. Il ne couvre cependant pas tous les formats d’adresses réels, toutes les valeurs mal formées ni tous les cas de boîtes partagées.
Avant d’exporter votre propre liste, vérifiez les points suivants :
- Chaque groupe approuvé représente une seule identité.
- Les boîtes partagées et les adresses génériques ont été vérifiées manuellement.
- La fiche principale contient le nom, l’identifiant et la valeur d’email à privilégier.
- Les valeurs uniques de téléphone, d’entreprise, de source et de notes sont préservées lors de la fusion.
- Le nombre de lignes initial moins les lignes supprimées correspond au nombre final de lignes.
- Un contrôle ponctuel couvre chaque famille de normalisation présente dans votre liste.
- Le nombre de groupes de doublons restants correspond à vos attentes.
📌 Rapprochez les totaux
Lignes initiales - lignes supprimées = lignes finalesest le contrôle d’exhaustivité le plus rapide après une fusion.
Poursuivre le nettoyage de la liste d’emails
La déduplication résout le problème des identités répétées. Elle ne vérifie ni l’existence des boîtes mail, ni les fournisseurs d’adresses jetables, ni le statut de désinscription, ni la délivrabilité.
Je préfère commencer par résoudre les doublons d’identité. Les contrôles suivants portent ainsi sur les contacts conservés, au lieu de traiter plusieurs versions d’une même personne. Une fois la fusion validée à l’aide de votre checklist, nettoyez le reste de votre liste d’emails, puis ouvrez Export et choisissez CSV ou Excel.
Dédupliquer votre liste dans Datablist
Importez votre fichier de contacts dans Datablist, lancez la détection de doublons adaptée aux emails, vérifiez les groupes proposés, fusionnez les valeurs utiles, puis exportez la liste nettoyée.
FAQ
Les majuscules comptent-elles lors de la comparaison des emails ?
La comparaison Smart Email utilise les valeurs en minuscules. NAME@example.com et name@example.com peuvent donc être regroupés si le reste de l’adresse normalisée correspond.
Les points Gmail et les alias avec signe plus désignent-ils la même adresse ?
Le Smart Email matching retire le suffixe avec signe plus de la partie locale et ignore les points dans la partie locale des adresses Gmail. La règle sur les points est propre à Gmail : ceux-ci restent significatifs sur les autres domaines.
Faut-il fusionner ou supprimer les contacts en double ?
Fusionnez les fiches lorsqu’une autre ligne apporte un numéro de téléphone, une source, une note, une valeur d’entreprise ou tout autre champ utile. Ne supprimez la ligne supplémentaire que si elle ne contient aucune donnée dont vous avez besoin.
Que faire si une cellule contient plusieurs adresses email ?
Fractionnez ou normalisez la cellule multivaleur avant de lancer ce workflow au niveau des lignes. Suivez le guide pour dédupliquer un champ contenant plusieurs adresses email.
Faut-il fusionner les boîtes partagées comme sales@company.com ?
Pas automatiquement. Une même adresse partagée peut représenter plusieurs contacts. Comparez les noms et les autres champs, puis vérifiez manuellement ces groupes.










