Para unificar valores de campos sem mesclar linhas, encontre os registros da mesma entidade, escolha um valor para o campo desejado e copie-o para todo o grupo. No Datablist, use Custom with AI no Duplicates Finder e instrua explicitamente a ferramenta a manter todos os registros.
Recomendo agrupar os registros de empresas por um identificador confiável, como o site, antes de padronizar os nomes. Um nome parecido, por si só, não comprova que duas empresas sejam a mesma organização. Manter as linhas separadas preserva seus IDs e dados de origem, mas um agrupamento incorreto ainda pode copiar o nome errado para elas.
Neste guia, você aprenderá a normalizar valores de campos específicos em grupos de duplicados sem alterar os registros individuais:
- O que é normalização de dados?
- AI Processing no Duplicates Finder
- Como normalizar dados duplicados passo a passo
O que é normalização de dados?
Neste contexto, normalizar dados significa adotar um formato consistente. Ao trabalhar com duplicados, é comum encontrar divergências em determinados campos. Por exemplo:
- Nomes de empresas: "Tech Solutions Inc.", "Tech Solutions, LLC", "Tech Solutions"
- Cargos: "Engenheiro de Software", "Desenvolvedor de Software", "Eng. de Software"
- Endereços: "Rua Principal, 123", "R. Principal, 123", "rua principal 123"
- Países: "Brasil", "BR", "BRA"
O objetivo da normalização é escolher um único valor padrão (como "Tech Solutions" ou "Brasil") e aplicá-lo ao campo correspondente em todos os registros identificados como duplicados.
Isso deixa os dados mais limpos, fáceis de analisar e confiáveis para filtros ou relatórios, mesmo que os registros duplicados continuem separados. É uma etapa essencial da limpeza de dados.
AI Processing no Duplicates Finder
O Duplicates Finder do Datablist já é uma ferramenta poderosa para identificar registros semelhantes. Além de oferecer opções robustas para mesclar duplicados de forma automática ou manual, o modo AI Processing proporciona ainda mais flexibilidade.
Em vez de usar regras de mesclagem predefinidas, o AI Processing permite que você descreva a lógica em um prompt em linguagem natural. Assim, é possível informar à AI exatamente como tratar os duplicados. Entre outras tarefas, você pode:
- Selecionar um registro principal com base em critérios específicos (por exemplo, o que foi atualizado mais recentemente).
- Mesclar determinados campos e manter outros separados.
- Fazer cálculos durante a mesclagem, como somar valores.
- 👉 E, o mais importante para este guia: atualizar um campo específico em todos os duplicados com um único valor normalizado, sem mesclar os registros.
Isso transforma uma tarefa complexa, que normalmente exigiria scripts para manipular dados, em uma simples conversa com nossa AI.
Como normalizar dados duplicados passo a passo
Veja como usar o AI Processing para normalizar um campo, como o nome da empresa, em registros duplicados.
Etapa 1: prepare seus dados
Primeiro, carregue seus dados no Datablist.
- Crie uma coleção: clique no botão “+” na barra lateral para criar uma coleção.
- Importe os dados: importe seus dados de um arquivo CSV ou Excel. Se eles estiverem distribuídos em vários arquivos, importe todos para a mesma coleção. O Datablist ajudará você a associar as colunas às propriedades. Verifique se o campo que deseja normalizar (por exemplo, Company Name) e os campos usados para identificar duplicados (como Email ou Website) foram importados corretamente.
Nestes dados de exemplo, já é possível identificar alguns nomes de empresas duplicados que precisam ser normalizados.
Etapa 2: encontre os duplicados
Agora, identifique os registros duplicados.
2.a. Abra o Duplicates Finder
Abra Clean > Merge duplicates.
2.b. Escolha os identificadores de duplicados
Selecione a propriedade — ou as propriedades — que identifica um duplicado de forma inequívoca.
Sempre que possível, use um site ou ID de empresa compartilhado. Se você tiver apenas os nomes, consulte o guia de correspondência de nomes de empresas e revise cada grupo antes de normalizá-lo. Nomes parecidos e sufixos jurídicos diferentes podem pertencer a entidades distintas.
Para empresas, você também pode usar
Website URLouLinkedIn Company Page URL.Para contatos,
Phone Numbersão opções comuns.
2.c. Configure o algoritmo
Na etapa seguinte, escolha o algoritmo de correspondência.
O algoritmo “Smart” costuma funcionar bem com URLs ou e-mails, pois considera pequenas variações. O “Exact” é mais rigoroso. Para nomes, também é possível usar correspondência fonética ou aproximada.
Selecione também o Processor mais adequado aos seus dados.
Neste exemplo, seleciono o Processor Company Name para tratar variações específicas de nomes de empresas, como sufixos empresariais e termos geográficos.
2.c. Execute a verificação
Clique em Run duplicates check.
O Datablist analisará os dados e apresentará grupos de possíveis duplicados.
Etapa 3: selecione o modo AI Processing
Selecione Custom with AI na página de resultados dos duplicados. As capturas de tela mais antigas abaixo ainda mostram o nome anterior, AI Editing. Esse modo gera um script com base nas suas instruções e em uma pequena amostra de itens e, em seguida, apresenta uma prévia das alterações.
Etapa 4: escreva o prompt de normalização
É aqui que você explica à AI o que ela deve fazer. Oriente-a a:
- Identificar o valor mais comum da propriedade desejada em cada grupo de duplicados.
- Atualizar todos os registros do grupo para usar esse valor comum na propriedade especificada.
- Declarar explicitamente que nenhum registro deve ser excluído.
Veja um exemplo de prompt para normalizar a propriedade /Company Name:
Para cada grupo de duplicados, conte os valores não vazios de /CompanyName usando correspondências exatas de texto. Se um valor aparecer mais vezes do que todos os outros, copie-o para /CompanyName em todos os registros desse grupo, inclusive naqueles em que CompanyName estiver vazio.
Se todos os valores estiverem vazios ou se dois ou mais valores empatarem na maior contagem, ignore o grupo sem fazer alterações. Ignore também os grupos cujos valores já sejam idênticos. Preserve todas as outras propriedades e não mescle nem exclua nenhum registro.
Entenda cada parte do prompt:
Normalize a propriedade /CompanyName...: especifica o campo desejado. Use/PropertyNameou{{PropertyName}}para fazer referência às suas colunas....conte os valores não vazios usando correspondências exatas de texto.: define como o valor padrão será escolhido. Campos vazios não podem vencer, e grupos empatados ficam pendentes para revisão. Você também pode adotar outros critérios, como “valor mais longo”, “valor mais curto” ou até usar outro campo como referência — por exemplo, “use o valor do registro que tiver a data /UpdatedAt mais recente”.Ignore o grupo se todos os valores de /CompanyName já forem iguais.: evita processamento desnecessário.Não exclua nenhum registro.: esta instrução é essencial para garantir que apenas os campos sejam atualizados, sem mesclar nem remover registros.
Etapa 5: gere e visualize o script
Clique em Generate and preview changes. A AI do Datablist interpretará o prompt e criará um script para executar a ação.
Não se preocupe: você não precisa escrever nem editar nenhum script.
- Explicação do script: um resumo em linguagem simples do que o script fará. Confirme se a explicação corresponde ao resultado desejado.
- Prévia do resultado: uma tabela que mostra exatamente como o script modificará uma amostra dos grupos de duplicados antes de aplicar qualquer alteração. Confira o campo desejado (por exemplo,
/Company Name) na prévia para garantir que ele apresente o valor normalizado correto em todos os duplicados da amostra.
Por exemplo, um grupo com Acme Ltd, Acme Ltd e Acme Limited deve manter três linhas, todas com Acme Ltd. Já um grupo com um registro Acme Ltd e outro Acme Limited deve permanecer inalterado, pois nenhum dos valores é mais frequente. Esses são apenas testes ilustrativos para conferir a prévia, não resultados medidos.
Confira tanto os valores quanto o número de linhas. Verifique se os campos vazios são preenchidos apenas quando há um vencedor claro, se os grupos empatados permanecem inalterados e se os IDs de origem e as demais propriedades são preservados.
Etapa 6: execute o script
Se a explicação e a prévia estiverem corretas, clique em Run AI rules. O Datablist executará o script gerado em todos os grupos de duplicados identificados.
Etapa 7: revise as alterações
Ao concluir a execução, o Datablist exibirá um resumo e uma Changes List para download.
Isso é útil quando você precisa reproduzir as alterações em um sistema externo — por exemplo, para editar leads no CRM.
Volte à visualização principal da coleção. O campo desejado (por exemplo, /CompanyName) agora estará consistente entre os registros de cada grupo de duplicados, enquanto os registros continuarão separados.
Pronto: você normalizou um campo em registros duplicados sem mesclá-los! 🚀
Quando normalizar sem mesclar
Em quais situações vale a pena normalizar um campo em vez de fazer uma mesclagem completa?
- Padronização de nomes de empresas ou contatos: corrija variações como “Exemplo Ltda.”, “Exemplo Limitada”, “João Silva” e “João P. Silva” entre duplicados antes de definir a estratégia final de mesclagem.
- Limpeza de cargos: unifique cargos como “VP de Marketing”, “Vice-presidente de Marketing” e “Marketing VP” para gerar análises e relatórios consistentes.
- Normalização de localidades: mantenha nomes de países (“Brasil”, “BR”) ou siglas de estados (“SP”, “São Paulo”) consistentes entre endereços duplicados.
- Preparação para importar ou atualizar o CRM: padronize campos importantes antes de importar os dados para um CRM com regras de validação rigorosas, mesmo que os duplicados sejam mantidos temporariamente.
- Auditoria de dados: preserve os registros duplicados originais para auditorias ou acompanhamento do histórico, mas padronize identificadores importantes para facilitar as análises.
- Limpeza incremental: normalize um campo por vez como parte de um processo mais amplo de limpeza de dados, antes de optar pela mesclagem ou exclusão completa.
Por que normalizar em vez de mesclar?
- Preserva a granularidade dos registros: mantém cada registro duplicado intacto, o que pode ser necessário para rastrear sua origem, interações específicas ou dados históricos associados a ele.
- Lida melhor com incertezas: é útil quando os duplicados não correspondem perfeitamente. Normalizar um campo importante garante consistência sem forçar uma mesclagem possivelmente incorreta entre registros que apresentam outros dados divergentes.
- Permite uma abordagem por etapas: oferece mais controle sobre a limpeza dos dados. Primeiro, normalize; depois, revise e decida se deseja mesclar ou excluir os registros.
- É simples e direcionado: você padroniza apenas um campo, sem afetar os demais dados dos registros duplicados.
Conclusão
Comece com um grupo verificado, defina a regra de seleção do valor e confira a prévia. Depois de executar o script, confirme se o número de linhas permanece igual e revise os grupos ignorados por causa de empates. Em seguida, você poderá exportar nomes consistentes sem deixar de preservar cada registro de origem.
FAQ
-
O AI Processing está incluído no meu plano do Datablist? O AI Processing, incluindo a geração e a execução de scripts para normalização, está disponível nos planos pagos do Datablist. Consulte nossa página de preços para mais detalhes.
-
Posso normalizar vários campos com um único prompt? Sim. Você pode escrever um prompt para normalizar vários campos ao mesmo tempo. Por exemplo: “Normalize a propriedade /Company Name usando o valor mais comum de cada grupo. Normalize a propriedade /Country usando o valor mais comum de cada grupo. Não exclua nenhum registro.”
-
E se a AI interpretar meu prompt de forma errada? Sempre revise com atenção a explicação do script e a prévia dos resultados antes de executá-lo. Se a prévia estiver incorreta, ajuste o prompt para deixá-lo mais claro e específico e, depois, gere o script novamente.
-
Posso desfazer as alterações feitas pelo script de AI? Após a execução do script, as alterações são aplicadas diretamente. Embora o Datablist ofereça um recurso para desfazer ações recentes dentro da sessão, a prática recomendada é clonar sua coleção antes de executar transformações importantes como esta. Assim, você poderá restaurá-la se necessário.
-
Qual é a diferença em relação à opção padrão de mesclagem “Combine conflicting properties”? A opção padrão “Combine” mescla os registros duplicados em um único registro principal e concatena valores de texto conflitantes em um só campo. Com o prompt adequado, o AI Processing atualiza o campo de todos os registros duplicados com um único valor escolhido e mantém cada registro separado. Ele não mescla registros nem concatena valores, a menos que você solicite isso explicitamente.















