Los emails duplicados suelen colarse cuando combina una exportación del CRM con formularios recibidos o una lista de asistentes a un evento. La misma persona aparece dos veces, pero las filas rara vez son idénticas. Una puede incluir el teléfono, mientras que la otra contiene la fuente o una nota útil.
Por eso no empiezo eliminando los emails repetidos. Para deduplicar direcciones de email de forma segura, utilizo Datablist Duplicates Finder con Smart matching y el Email processor. Esta combinación agrupa las variantes de una misma dirección y me permite revisar las filas completas de cada contacto y fusionar los datos que quiero conservar.
Para este tutorial, preparé una lista de prueba con 1.000 contactos y las variantes de email que encuentro habitualmente: alias con el signo más, diferencias en direcciones de Gmail y direcciones envueltas en otros formatos, entre otras. Datablist encontró 200 pares duplicados y la colección limpia quedó en 800 contactos. A continuación, le muestro la configuración que utilicé y qué comprobé antes de fusionar los registros.
Busque coincidencias por email, pero decida qué conservar revisando toda la fila del contacto. Si necesita comparar nombres, teléfonos, dominios de empresa u otros identificadores, consulte cómo deduplicar una lista online.
Qué direcciones considera idénticas Datablist
Smart matching con el Email processor compara identidades de email, no el texto exacto de las celdas. Elimina los espacios al principio y al final, compara los valores en minúsculas y suprime el +sufijo de la parte local antes de buscar coincidencias.
También aplica reglas específicas de Gmail. Elimina los puntos de la parte local de las direcciones de Gmail y convierte googlemail.com en gmail.com. Datablist también puede extraer una dirección válida incluida en un formato con nombre visible o en un valor mailto: con una cadena de consulta.
Estos son algunos ejemplos del dataset probado:
| Valores almacenados | Resultado de Smart Email |
|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | La misma identidad tras eliminar el sufijo con el signo más |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | La misma identidad de Gmail tras eliminar los puntos |
yasmincarter105@gmail.comyasmincarter105@googlemail.com | La misma identidad de Gmail tras normalizar el dominio |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | La misma identidad tras extraer la dirección incluida en el formato |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | La misma identidad tras eliminar el formato externo y comparar los valores en minúsculas |
El tratamiento de los puntos es específico de Gmail. Datablist no presupone que first.last@company.com y firstlast@company.com sean la misma dirección. En dominios que no son de Gmail, los puntos pueden ser relevantes.
Los valores mal formados tampoco se modifican. El processor está diseñado para direcciones de email únicas y válidas, no para adivinar qué significa una cadena de texto cualquiera. Si solo quiere encontrar coincidencias entre valores almacenados idénticos, seleccione Exact en lugar de Smart.
🔑 La normalización propone un grupo de duplicados
No demuestra que todos los campos pertenezcan a la misma persona. Revise los nombres, las empresas y los buzones asociados a funciones antes de fusionar los registros.
Para la mayoría de las limpiezas de listas de contactos, recomiendo Smart matching con el Email processor. Solo cambio a Exact cuando los alias deben permanecer separados o cuando la propia cadena almacenada funciona como identificador.
Consulte la documentación del Email processor para conocer todas las reglas de normalización y la disponibilidad según el plan.
Lista de emails utilizada en este tutorial
El archivo de prueba contiene 1.000 filas de contactos ficticios que representan 800 identidades creadas para el ensayo. Ningún par duplicado comparte exactamente la misma cadena de email. Es un detalle importante, porque una limpieza basada en valores exactos no demostraría la detección de alias.
El archivo tiene ocho columnas: record_id, first_name, last_name, email, company, phone, source y notes. El workflow busca coincidencias en email, pero mantiene visibles los demás campos para que pueda seleccionar un registro maestro y conservar los valores útiles.
Estas son cuatro filas exactas de entrada pertenecientes a dos pares duplicados:
| record_id | first_name | last_name | phone | source | notes | |
|---|---|---|---|---|---|---|
CONTACT-0040-A | Nora | Anderson | noraanderson40@demo.co | Exportación del CRM | Registro principal del contacto | |
CONTACT-0040-B | N. | A. | noraanderson40+newsletter@demo.co | +1-202-555-1039 | Formulario web | Datos de seguimiento de una segunda fuente |
CONTACT-0062-A | Victor | Bennett | victorbennett62@gmail.com | +1-202-555-1061 | Formulario web | Registro principal del contacto |
CONTACT-0062-B | victor | BENNETT | victorb.ennett62@gmail.com | Evento | Datos de seguimiento de una segunda fuente |
El par de Nora muestra por qué no elimino los duplicados a primera vista. El registro base contiene el nombre completo preferido, mientras que la fila con el alias incluye el único número de teléfono y una segunda fuente de captación. Al fusionarlos, es posible conservar ambas cosas.
El dataset contiene 200 identidades duplicadas de dos filas, repartidas por igual entre cinco tipos de variantes: alias con el signo más, direcciones de Gmail con puntos, gmail.com frente a googlemail.com, formatos con nombre visible y valores mailto:. Las otras 600 identidades solo aparecen una vez.
Puede descargar el CSV de ejemplo con 1.000 filas para reproducir el tutorial. Si utiliza su propio archivo, mantenga un email por fila y conserve los campos contiguos que necesite consolidar.
Importe y prepare la columna de email
Importe el archivo CSV o Excel en una nueva colección de Datablist. Compruebe la vista previa de importación y asigne la columna de email a una propiedad de tipo email.
Mantenga los nombres, la empresa, el teléfono, la fuente, las notas y los ID estables en propiedades separadas. Esas columnas no sobran: son las pruebas que utilizará cuando dos filas coincidan por email, pero difieran en otros campos.
Para este workflow, también prefiero tener una sola dirección por celda. Si una celda contiene alice@example.com; bob@example.com, divídala o normalícela primero. La guía para deduplicar un campo con varias direcciones de email explica ese caso por separado.
💡 Conserve los datos necesarios para decidir la fusión
No elimine las columnas de fuente, notas, teléfono o ID estable antes de deduplicar. Le ayudarán a elegir la fila maestra y a evitar la pérdida de datos únicos.
Abra Clean > Merge duplicates. Elija Selected Properties y seleccione email para esta primera pasada centrada en el email.
Seleccionar una sola propiedad hace que la regla sea fácil de entender. Si añadiera ahora una propiedad de nombre o empresa, podría impedir una coincidencia de email válida cuando esos campos estuvieran vacíos o tuvieran formatos distintos.
Configure Duplicates Finder
Para la propiedad email, seleccione Smart como algoritmo de comparación y elija el processor Email.
Cada ajuste cumple una función concreta:
- Selected Properties limita la comprobación al identificador que quiere comparar.
- Smart activa la normalización mediante un processor, en lugar de comparar literalmente las cadenas almacenadas.
- Email aplica las reglas verificadas para alias, Gmail, nombres visibles y
mailto:descritas anteriormente.
Utilice Smart junto con el Email processor para detectar variantes de una identidad. Exact solo encuentra valores almacenados idénticos.
La comprobación de duplicados es de solo lectura. Al ejecutarla, se crean grupos candidatos para que usted los revise, pero no se elimina ni fusiona ninguna fila de la colección. Los cambios solo se aplican después de que elija y ejecute una acción de fusión o eliminación.
Esta separación resulta útil. Prefiero ver qué valores considera equivalentes la regla de coincidencia antes de permitir que una fusión masiva modifique la lista.
Ejecute la búsqueda y revise los duplicados
Haga clic en Run duplicates check. En esta prueba, Datablist distribuyó 400 de las 1.000 filas en 200 grupos de dos filas.
No interprete todavía el número de grupos como el número de eliminaciones. Cada grupo es un candidato que debe revisar. En cada uno, compruebe:
- si la variante del email tiene sentido;
- si el nombre y los apellidos coinciden o presentan una variación explicable;
- si hay conflictos entre los valores de empresa y teléfono;
- si las fuentes y las notas aportan información complementaria;
- si la dirección corresponde a un buzón compartido.
Normalmente reviso los primeros grupos y cualquier coincidencia inesperada entre empresas antes de aplicar una regla masiva. Es más rápido que reparar después una fusión demasiado agresiva.
⚠️ Una dirección repetida no siempre significa una persona repetida
Un buzón compartido como
sales@company.compuede aparecer en varios contactos legítimos. Revise manualmente las direcciones asociadas a funciones, en vez de asumir que todas las filas deben convertirse en una sola.
El archivo de prueba se diseñó para que cada par normalizado representara una única identidad. Una exportación real de un CRM será más compleja. Si los nombres o las empresas apuntan a personas distintas, omita ese grupo o revíselo por separado.
Elija entre fusionar o eliminar
Mi criterio es sencillo:
- Fusione las filas cuando contengan datos complementarios.
- Elimine una fila adicional solo cuando no aporte ningún valor útil.
- Deje los grupos ambiguos para una revisión manual.
En esta prueba, la configuración de fusión seleccionó como registro maestro la fila más completa. Conservó el record_id maestro, utilizó los valores más largos para el nombre y los apellidos y combinó source y notes con puntos y coma.
Estos ajustes encajan con el ejemplo, pero no combinaría por defecto todas las propiedades que presenten conflictos. Tiene sentido convertir el historial de fuentes en Formulario web;Exportación del CRM. En cambio, el estado del CRM, el ID del propietario o el email principal suelen necesitar un único valor de referencia.
Utilice la vista previa para comprobar estas decisiones. Después de cambiar una regla, vuelva a revisar la fila de destino.
💡 Revise la vista previa tras cada cambio de regla
Antes de aplicar una regla a todos los grupos preparados, compruebe qué fila se convertirá en la maestra, qué valores se combinarán y cuáles desaparecerán.
Si una fila duplicada contiene un teléfono, una fuente o una nota que no aparecen en ningún otro registro, fusiónela en lugar de eliminarla. En el ejemplo de Nora, la fila final conservó el nombre completo de un registro y el teléfono del otro.
Si gestiona conflictos más complejos en su CRM, puede seguir el workflow avanzado para fusionar leads duplicados sin perder datos. En esta pasada centrada en el email, el objetivo es conservar los campos contiguos útiles sin convertir cada propiedad en una cadena con múltiples valores.
Resultados de la lista de prueba con 1.000 filas
La fusión produjo estos resultados medidos:
| Métrica | Resultado |
|---|---|
| Filas iniciales | 1.000 |
| Filas incluidas en grupos de duplicados | 400 |
| Grupos duplicados de dos filas | 200 |
| Filas duplicadas eliminadas | 200 |
| Filas maestras actualizadas | 200 |
| Filas finales | 800 |
| Grupos de duplicados restantes | 0 |
La conciliación es directa: 1.000 filas iniciales - 200 filas eliminadas = 800 filas conservadas.
La fusión tardó unos segundos en la prueba manual, aunque no se registró un tiempo exacto. Considérelo una observación de esta ejecución, no una referencia de rendimiento.
El registro de cambios descargado contiene 400 entradas: 200 filas eliminadas y 200 filas maestras actualizadas. Para cada grupo fusionado, muestra los valores anteriores a la fusión y los valores conservados en la fila de destino.
La siguiente tabla utiliza valores exactos de la prueba:
| Variantes originales | Motivo de la coincidencia | Email conservado | Acción | Campos conservados |
|---|---|---|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Sufijo con el signo más eliminado | noraanderson40+newsletter@demo.co | Fusionado en CONTACT-0040-B | Nombre completo, teléfono, Formulario web;Exportación del CRM y ambas notas |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Puntos de Gmail normalizados | victorbennett62@gmail.com | Fusionado en CONTACT-0062-A | Teléfono, Formulario web;Evento y ambas notas |
gabrielcarter113@gmail.comgabrielcarter113@googlemail.com | Dominios de Gmail normalizados | gabrielcarter113@gmail.com | Fusionado en CONTACT-0113-A | Teléfono, Lista de partners;Exportación del CRM y la nota de solicitud de demo |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Formato con nombre visible eliminado | camiladiaz123@testmail.net | Fusionado en CONTACT-0123-A | Nombre completo, teléfono, Lista de partners;Exportación del CRM y ambas notas |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Formato mailto: eliminado y mayúsculas normalizadas | mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Fusionado en CONTACT-0199-B | Nombre completo, teléfono, Webinar;Evento y ambas notas |
Observe que el valor conservado no siempre es el email visualmente más sencillo. El registro maestro seleccionado determina qué dirección almacenada permanece. La normalización se utiliza para encontrar coincidencias; no transforma silenciosamente todos los valores conservados a un formato canónico.
La fusión de prueba redujo las 1.000 filas a 800 porque 200 filas duplicadas revisadas se consolidaron en sus registros maestros. Este resultado corresponde a la lista de prueba diseñada y no representa una tasa de coincidencia universal para todos los formatos de email.
Casos problemáticos y checklist de validación
Smart Email matching gestiona los cinco tipos de variantes probados, pero no debe sustituir la revisión.
Puntos en dominios que no son Gmail
Los puntos siguen siendo relevantes en los dominios que no son de Gmail. No dé por hecho que first.last@company.com y firstlast@company.com pertenecen al mismo buzón. Si dispone de pruebas externas que los relacionen, gestione ese par manualmente.
Valores mal formados
Las cadenas mal formadas y los valores que no tienen la estructura de un único email válido permanecen sin cambios. Limpie esas celdas o trasládelas a una cola de revisión independiente. No espere que el processor deduzca una dirección a partir de texto arbitrario.
Coincidencia Exact
La comparación Exact no detectará alias con el signo más, variaciones con puntos de Gmail, alias de dominio ni formatos externos cuando las cadenas almacenadas sean diferentes. Puede ser el comportamiento correcto si necesita mantener los alias separados, pero no es el ajuste empleado en este workflow.
Varias direcciones en una celda
Este método presupone que hay una dirección por celda. Una celda con varias direcciones separadas por delimitadores requiere el workflow específico para valores múltiples antes de buscar coincidencias entre filas.
Buzones compartidos
Dos filas con sales@company.com pueden corresponder a personas distintas. Los nombres, cargos, empresas y notas deben orientar la revisión. No fusionaría de forma masiva los buzones asociados a funciones sin comprobarlos.
Eliminación de campos complementarios
Eliminar una fila adicional puede hacerle perder el único teléfono, fuente de captación o comentario disponible. Utilice la vista previa de fusión para comprobar qué datos se conservarán.
La prueba diseñada encontró las 200 identidades previstas y no generó grupos inesperados entre identidades distintas. No evaluó todos los formatos de email, valores mal formados o patrones de buzones compartidos que pueden aparecer en un caso real.
Antes de exportar su lista, compruebe que:
- Cada grupo aprobado representa una sola identidad.
- Los buzones compartidos y asociados a funciones se han revisado manualmente.
- La fila maestra contiene el nombre, el ID y el email preferidos.
- Los valores únicos de teléfono, empresa, fuente y notas se conservan tras la fusión.
- Las filas iniciales menos las eliminadas coinciden con el número final de filas.
- La revisión por muestreo cubre cada tipo de normalización presente en su lista.
- El número de grupos duplicados restantes coincide con lo esperado.
📌 Concilie los recuentos
Filas iniciales - filas eliminadas = filas finaleses la comprobación de integridad más rápida después de una fusión.
Continúe limpiando la lista de emails
La deduplicación resuelve las identidades repetidas. No comprueba si el buzón existe, si pertenece a un proveedor de emails desechables, si el contacto se ha dado de baja ni si la dirección puede recibir mensajes.
Prefiero resolver primero las identidades duplicadas. De ese modo, las comprobaciones posteriores se ejecutan sobre los contactos conservados, en lugar de procesar varias versiones de una misma persona. Cuando la fusión supere su checklist de validación, limpie el resto de su lista de emails; después, abra Export y elija CSV o Excel.
Deduplicate su lista con Datablist
Importe su archivo de contactos en Datablist, ejecute la búsqueda de duplicados específica para emails, revise los grupos propuestos, fusione los valores útiles y exporte la lista limpia.
FAQ
¿Importan las mayúsculas al comparar emails?
La comparación Smart Email utiliza valores en minúsculas, por lo que NAME@example.com y name@example.com pueden agruparse si el resto de la dirección normalizada coincide.
¿Los puntos de Gmail y los alias con + son iguales?
Smart Email matching elimina los sufijos con el signo más de la parte local e ignora los puntos en la parte local de Gmail. La regla de los puntos es específica de Gmail: en los demás dominios, los puntos siguen siendo relevantes.
¿Debo fusionar o eliminar los contactos duplicados?
Fusione los registros cuando otra fila aporte un teléfono, una fuente, una nota, una empresa u otro campo útil. Elimine la fila adicional solo cuando no añada ningún dato que necesite.
¿Qué hago si una celda contiene varios emails?
Divida o normalice la celda con múltiples valores antes de ejecutar este workflow por filas. Siga la guía para deduplicar un campo con varias direcciones de email.
¿Debo fusionar buzones como sales@company.com?
No de forma automática. Una dirección compartida puede representar a varios contactos. Compare los nombres y el resto de los campos y revise esos grupos manualmente.










