Duplicados de email costumam surgir quando se combinam dados exportados de um CRM com envios de formulários ou listas de eventos. A mesma pessoa aparece duas vezes, mas as linhas raramente são idênticas. Uma pode conter o número de telefone, enquanto a outra inclui a origem do Lead ou uma observação útil.
É por isso que não começo por eliminar emails repetidos. Para remover emails duplicados com segurança, uso o Datablist Duplicates Finder com Smart matching e o Email processor. A ferramenta agrupa variações do mesmo email e permite rever todas as linhas dos contactos e combinar os dados que pretendo manter.
Para este guia, preparei uma lista de teste com 1.000 contactos e os tipos de variações de email que encontro com frequência, desde aliases com sinal de mais e diferenças no Gmail até endereços inseridos em wrappers. O Datablist encontrou 200 pares duplicados, e a coleção limpa ficou com 800 contactos. Vou mostrar as configurações que usei e o que verifiquei antes de combinar os registos.
Comece por encontrar correspondências no email, mas decida o que manter com base em toda a linha do contacto. Se precisar de comparar nomes, números de telefone, domínios de empresas ou outros identificadores, veja como remover duplicados de uma lista online.
O que o Datablist considera o mesmo endereço de email
O Smart matching com o Email processor compara identidades de email, não o texto bruto das células. Remove espaços no início e no fim, compara os valores em minúsculas e retira o +sufixo da parte local antes de procurar correspondências.
Também aplica regras específicas do Gmail. Os pontos são removidos da parte local dos endereços Gmail, e googlemail.com é convertido em gmail.com. O Datablist também consegue extrair um endereço válido de um wrapper com nome de exibição ou de um valor mailto: com uma query string.
Estes são alguns exemplos do conjunto de dados testado:
| Valores guardados | Resultado do Smart Email |
|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | A mesma identidade após remover o sufixo com sinal de mais |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | A mesma identidade Gmail após remover os pontos |
yasmincarter105@gmail.comyasmincarter105@googlemail.com | A mesma identidade Gmail após normalizar o domínio |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | A mesma identidade após extrair o endereço do wrapper |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | A mesma identidade após remover o wrapper e comparar os valores em minúsculas |
O tratamento dos pontos é específico do Gmail. O Datablist não pressupõe que nome.apelido@empresa.com e nomeapelido@empresa.com sejam o mesmo endereço. Os pontos podem ser relevantes em domínios que não sejam do Gmail.
Os valores malformados também permanecem inalterados. O processor foi criado para endereços de email individuais válidos, não para tentar adivinhar o significado de uma string arbitrária. Se quiser encontrar apenas valores guardados que sejam idênticos, selecione Exact em vez de Smart.
🔑 A normalização propõe um grupo de duplicados
Não prova que todos os campos pertencem à mesma pessoa. Reveja os nomes, as empresas e as caixas de email associadas a funções antes de combinar os registos.
Para a maioria das operações de limpeza de listas de contactos, recomendo o Smart matching com o Email processor. Só mudo para Exact quando os aliases precisam de permanecer separados ou quando a própria string guardada funciona como identificador.
Consulte a documentação do Email processor para conhecer todas as regras de normalização e a disponibilidade por plano.
Lista de emails usada neste exemplo
O ficheiro de teste contém 1.000 linhas de contactos fictícios que representam 800 identidades planeadas. Nenhum dos pares duplicados tem exatamente a mesma string de email. Isto é importante porque uma limpeza baseada em valores exatos não demonstraria a deteção inteligente de aliases.
O ficheiro tem oito colunas: record_id, first_name, last_name, email, company, phone, source e notes. O workflow procura correspondências em email, mas os outros campos permanecem visíveis para que eu possa selecionar um registo principal e preservar os valores úteis.
Seguem-se quatro linhas exatas do ficheiro, pertencentes a dois pares duplicados:
| record_id | first_name | last_name | phone | source | notes | |
|---|---|---|---|---|---|---|
CONTACT-0040-A | Nora | Anderson | noraanderson40@demo.co | Exportação do CRM | Registo principal do contacto | |
CONTACT-0040-B | N. | A. | noraanderson40+newsletter@demo.co | +1-202-555-1039 | Formulário do site | Dados de acompanhamento de uma segunda origem |
CONTACT-0062-A | Victor | Bennett | victorbennett62@gmail.com | +1-202-555-1061 | Formulário do site | Registo principal do contacto |
CONTACT-0062-B | victor | BENNETT | victorb.ennett62@gmail.com | Evento | Dados de acompanhamento de uma segunda origem |
O par da Nora mostra por que não elimino duplicados assim que os encontro. O registo base contém o nome completo preferido, enquanto a linha com o alias é a única que inclui o número de telefone e uma segunda origem de aquisição. Ao combinar as linhas, é possível manter ambos.
O conjunto de dados contém 200 identidades duplicadas com duas linhas cada, distribuídas uniformemente por cinco tipos de variações: aliases com sinal de mais, endereços Gmail com pontos, gmail.com versus googlemail.com, wrappers com nome de exibição e valores mailto:. As outras 600 identidades aparecem apenas uma vez.
Pode descarregar o CSV de exemplo com 1.000 linhas para reproduzir este guia. Se usar o seu próprio ficheiro, mantenha um email por linha e conserve os campos adjacentes que precisa de consolidar.
Importe e prepare a coluna de email
Importe o ficheiro CSV ou Excel para uma nova coleção do Datablist. Verifique a pré-visualização da importação e associe a coluna de email a uma propriedade de email.
Mantenha os nomes, a empresa, o telefone, a origem, as notas e os IDs estáveis em propriedades separadas. Essas colunas não são ruído. São as provas que usará quando duas linhas tiverem o mesmo email, mas divergirem noutros campos.
Também prefiro ter apenas um endereço por célula neste workflow. Se uma célula contiver alice@example.com; bob@example.com, separe ou normalize primeiro os endereços. O guia para remover duplicados de um campo com vários endereços de email explica esse caso específico.
💡 Mantenha os dados necessários para a combinação
Não remova as colunas de origem, notas, telefone ou ID estável antes da deduplicação. Elas ajudam a escolher a linha principal e evitam a perda de dados únicos.
Abra Clean > Merge duplicates. Escolha Selected Properties e selecione email nesta primeira análise centrada no email.
Selecionar uma única propriedade torna a regra fácil de compreender. Adicionar agora uma propriedade de nome ou empresa poderia impedir uma correspondência de email válida caso esses campos estivessem vazios ou tivessem uma formatação diferente.
Configure o Duplicates Finder
Para a propriedade email, selecione Smart como algoritmo de comparação e escolha o processor Email.
Cada configuração tem uma função específica:
- Selected Properties limita a verificação ao identificador que pretende comparar.
- Smart ativa a normalização baseada num processor, em vez de comparar literalmente as strings guardadas.
- Email aplica as regras verificadas para aliases, Gmail, nomes de exibição e
mailto:descritas acima.
Use Smart com o Email processor para encontrar variações da mesma identidade. Exact deteta apenas valores guardados idênticos.
A verificação de duplicados é uma operação apenas de leitura. Ao executá-la, são criados grupos candidatos para revisão. Nenhuma linha da coleção é eliminada ou combinada. As alterações só ocorrem depois de escolher e aplicar uma ação de combinação ou eliminação.
Esta separação é útil. Quero ver o que a regra de correspondência considera equivalente antes de permitir que uma combinação em massa altere a lista.
Execute a verificação e reveja os duplicados
Clique em Run duplicates check. Neste teste, o Datablist colocou 400 das 1.000 linhas em 200 grupos de duas linhas.
Não considere ainda o número de grupos como o número de eliminações. Cada grupo é um candidato a revisão. Em cada um, verifique:
- se a variação do email faz sentido;
- se os nomes e apelidos coincidem ou apresentam uma variação justificável;
- se existem conflitos nos valores da empresa e do telefone;
- se a origem e as notas acrescentam informações complementares;
- se o endereço corresponde a uma caixa de email partilhada.
Normalmente, inspeciono os primeiros grupos e qualquer correspondência inesperada entre empresas diferentes antes de aplicar uma regra em massa. É mais rápido do que corrigir posteriormente uma combinação demasiado agressiva.
⚠️ Um endereço repetido nem sempre representa a mesma pessoa
Uma caixa de email partilhada, como
sales@company.com, pode estar associada a vários contactos legítimos. Reveja manualmente os endereços associados a funções, em vez de pressupor que todas as linhas devem ser combinadas numa só.
O ficheiro de teste foi preparado para que cada par normalizado representasse uma única identidade. Uma exportação real de um CRM será mais complexa. Se os nomes ou as empresas indicarem pessoas diferentes, ignore o grupo ou analise-o separadamente.
Escolha entre combinar ou eliminar
A minha regra de decisão é simples:
- Combine as linhas quando contiverem dados complementares.
- Elimine uma linha adicional apenas quando esta não acrescentar qualquer valor útil.
- Deixe os grupos ambíguos para revisão manual.
Neste teste, a configuração de combinação selecionou como principal a linha mais completa. Manteve o record_id do registo principal, usou os valores mais longos de nome e apelido e combinou source e notes com pontos e vírgulas.
Estas configurações são adequadas para o exemplo, mas eu não combinaria por predefinição todas as propriedades em conflito. Um histórico de origens pode perfeitamente tornar-se Formulário do site;Exportação do CRM. Já o estado no CRM, o ID do proprietário ou o email principal costumam exigir um único valor fidedigno.
A pré-visualização é o momento de validar essas escolhas. Depois de alterar uma regra, volte a inspecionar a linha de destino.
💡 Pré-visualize após cada alteração às regras
Antes de aplicar a regra a todos os grupos prontos, verifique qual linha se torna a principal, quais valores são combinados e quais desaparecem.
Se uma linha duplicada contiver um telefone, uma origem ou uma nota única, combine-a em vez de a eliminar. No exemplo da Nora, a linha final manteve o nome completo de um registo e o telefone do outro.
Quem precisa de resolver conflitos mais complexos no CRM pode seguir o workflow completo para combinar Leads duplicados sem perder dados. Nesta análise centrada no email, o objetivo é preservar os campos adjacentes úteis sem transformar todas as propriedades numa string com vários valores.
Resultados da lista testada com 1.000 linhas
A combinação produziu os seguintes resultados:
| Métrica | Resultado |
|---|---|
| Linhas iniciais | 1.000 |
| Linhas incluídas em grupos de duplicados | 400 |
| Grupos duplicados com duas linhas | 200 |
| Linhas duplicadas eliminadas | 200 |
| Linhas principais atualizadas | 200 |
| Linhas finais | 800 |
| Grupos de duplicados restantes | 0 |
A reconciliação é direta: 1.000 linhas iniciais - 200 linhas eliminadas = 800 linhas mantidas.
A combinação demorou alguns segundos no teste manual, mas não foi registado um tempo exato. Considere este dado apenas uma observação desta execução, não um benchmark de desempenho.
O registo de alterações descarregado contém 400 entradas: 200 linhas eliminadas e 200 linhas principais atualizadas. Para cada grupo combinado, mostra os valores anteriores à combinação e os valores mantidos na linha de destino.
A tabela abaixo apresenta valores exatos da execução:
| Variações originais | Motivo da correspondência | Email mantido | Ação | Campos preservados |
|---|---|---|---|---|
noraanderson40@demo.conoraanderson40+newsletter@demo.co | Sufixo com sinal de mais removido | noraanderson40+newsletter@demo.co | Combinado em CONTACT-0040-B | Nome completo, telefone, Formulário do site;Exportação do CRM e ambas as notas |
victorbennett62@gmail.comvictorb.ennett62@gmail.com | Pontos do Gmail normalizados | victorbennett62@gmail.com | Combinado em CONTACT-0062-A | Telefone, Formulário do site;Evento e ambas as notas |
gabrielcarter113@gmail.comgabrielcarter113@googlemail.com | Domínios do Gmail normalizados | gabrielcarter113@gmail.com | Combinado em CONTACT-0113-A | Telefone, Lista de parceiros;Exportação do CRM e a nota do pedido de demonstração |
camiladiaz123@testmail.netCamila Diaz <camiladiaz123@testmail.net> | Wrapper com nome de exibição removido | camiladiaz123@testmail.net | Combinado em CONTACT-0123-A | Nome completo, telefone, Lista de parceiros;Exportação do CRM e ambas as notas |
marcusevans199@testmail.netmailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Wrapper mailto: removido e capitalização normalizada | mailto:MARCUSEVANS199@TESTMAIL.NET?subject=Hello | Combinado em CONTACT-0199-B | Nome completo, telefone, Webinar;Evento e ambas as notas |
Repare que o valor mantido nem sempre é o email visualmente mais simples. O registo principal selecionado determina qual dos emails guardados permanece. A normalização é usada para encontrar correspondências; não converte silenciosamente todos os valores mantidos para um formato canónico.
A combinação testada reduziu 1.000 linhas para 800 porque 200 linhas duplicadas revistas foram consolidadas nos respetivos registos principais. Este resultado refere-se à lista de teste preparada e não representa uma taxa de correspondência universal para todos os formatos de email.
Casos problemáticos e checklist de validação
O Smart Email matching trata os cinco tipos de variações testados, mas não dispensa a revisão.
Pontos fora do Gmail
Os pontos continuam a ser relevantes em domínios que não sejam do Gmail. Não pressuponha que nome.apelido@empresa.com e nomeapelido@empresa.com pertencem à mesma caixa de email. Se tiver provas externas que os relacionem, trate esse par manualmente.
Valores malformados
As strings malformadas e os valores que não correspondam a um único endereço de email válido permanecem inalterados. Limpe essas células ou transfira-as para uma fila de revisão separada. Não espere que o processor deduza um endereço a partir de texto arbitrário.
Correspondência exata
A comparação Exact não encontra aliases com sinal de mais, variações com pontos no Gmail, aliases de domínio nem wrappers quando as strings guardadas são diferentes. Esse pode ser o comportamento correto se precisar de manter os aliases separados, mas não é a configuração usada neste workflow.
Vários endereços numa célula
Este método pressupõe que existe um único endereço por célula. Uma célula com vários endereços separados por delimitadores requer primeiro o workflow específico para múltiplos valores e só depois a correspondência ao nível das linhas.
Caixas de email partilhadas
Duas linhas com sales@company.com podem representar pessoas diferentes. Os nomes, cargos, empresas e notas devem orientar a decisão durante a revisão. Eu não combinaria em massa caixas associadas a funções sem as verificar.
Eliminação de campos complementares
Eliminar uma linha adicional pode remover o único número de telefone, a origem de aquisição ou uma nota. Use a pré-visualização da combinação para confirmar o que será preservado.
O teste preparado encontrou as 200 identidades pretendidas e não criou grupos inesperados entre identidades diferentes. Contudo, não testou todos os formatos de endereço existentes, valores malformados ou padrões de caixas partilhadas.
Antes de exportar a sua lista, confirme que:
- Cada grupo aprovado representa uma única identidade.
- As caixas partilhadas e associadas a funções foram revistas manualmente.
- A linha principal contém o nome, o ID e o valor de email preferidos.
- Os valores únicos de telefone, empresa, origem e notas são preservados durante a combinação.
- O número de linhas iniciais menos as linhas eliminadas corresponde ao número de linhas finais.
- A verificação por amostragem abrange cada tipo de normalização presente na sua lista.
- O número de grupos duplicados restantes corresponde ao esperado.
📌 Reconcilie os números
Linhas iniciais - linhas eliminadas = linhas finaisé a forma mais rápida de verificar se a combinação ficou completa.
Continue a limpar a lista de emails
A deduplicação resolve identidades repetidas. Não verifica se as caixas de email existem, se pertencem a fornecedores descartáveis, se os contactos cancelaram a subscrição ou se os emails podem ser entregues.
Prefiro resolver primeiro as identidades duplicadas. Assim, as verificações seguintes são executadas apenas nos contactos mantidos, em vez de processarem várias versões da mesma pessoa. Quando a combinação passar na sua checklist de validação, limpe o resto da lista de emails, abra Export e escolha CSV ou Excel.
Remova duplicados da sua lista no Datablist
Importe o ficheiro de contactos para o Datablist, execute a verificação de duplicados que reconhece variações de email, reveja os grupos propostos, combine os valores úteis e exporte a lista limpa.
FAQ
As maiúsculas afetam a comparação de emails?
A comparação Smart Email usa valores em minúsculas para encontrar correspondências. Assim, NAME@example.com e name@example.com podem ser agrupados quando o resto do endereço normalizado coincide.
Pontos e aliases do Gmail contam como o mesmo email?
O Smart Email matching remove da parte local o sufixo com sinal de mais e ignora os pontos na parte local dos endereços Gmail. A regra dos pontos é específica do Gmail. Em domínios que não sejam do Gmail, os pontos continuam a ser relevantes.
Devo combinar ou eliminar contactos duplicados?
Combine os registos quando outra linha acrescentar um número de telefone, uma origem, uma nota, uma empresa ou outro campo útil. Elimine a linha adicional apenas quando não incluir nada de que precise.
E se uma célula contiver vários endereços de email?
Separe ou normalize a célula com vários valores antes de executar este workflow ao nível das linhas. Siga o guia para remover duplicados de um campo com vários endereços de email.
Devo combinar caixas partilhadas como sales@company.com?
Não automaticamente. Um único endereço partilhado pode representar vários contactos. Compare os nomes e os restantes campos e depois reveja esses grupos manualmente.










