Para unificar valores de campos sem mesclar linhas, encontre os registros da mesma entidade, escolha um valor para o campo desejado e copie-o para todo o grupo. No Datablist, use Custom with AI no Duplicates Finder e instrua explicitamente a ferramenta a manter todos os registros.

Recomendo agrupar os registros de empresas por um identificador confiável, como o site, antes de padronizar os nomes. Um nome parecido, por si só, não comprova que duas empresas sejam a mesma organização. Manter as linhas separadas preserva seus IDs e dados de origem, mas um agrupamento incorreto ainda pode copiar o nome errado para elas.

Neste guia, você aprenderá a normalizar valores de campos específicos em grupos de duplicados sem alterar os registros individuais:

O que é normalização de dados?

Neste contexto, normalizar dados significa adotar um formato consistente. Ao trabalhar com duplicados, é comum encontrar divergências em determinados campos. Por exemplo:

  • Nomes de empresas: "Tech Solutions Inc.", "Tech Solutions, LLC", "Tech Solutions"
  • Cargos: "Engenheiro de Software", "Desenvolvedor de Software", "Eng. de Software"
  • Endereços: "Rua Principal, 123", "R. Principal, 123", "rua principal 123"
  • Países: "Brasil", "BR", "BRA"

O objetivo da normalização é escolher um único valor padrão (como "Tech Solutions" ou "Brasil") e aplicá-lo ao campo correspondente em todos os registros identificados como duplicados.

Isso deixa os dados mais limpos, fáceis de analisar e confiáveis para filtros ou relatórios, mesmo que os registros duplicados continuem separados. É uma etapa essencial da limpeza de dados.

AI Processing no Duplicates Finder

O Duplicates Finder do Datablist já é uma ferramenta poderosa para identificar registros semelhantes. Além de oferecer opções robustas para mesclar duplicados de forma automática ou manual, o modo AI Processing proporciona ainda mais flexibilidade.

Em vez de usar regras de mesclagem predefinidas, o AI Processing permite que você descreva a lógica em um prompt em linguagem natural. Assim, é possível informar à AI exatamente como tratar os duplicados. Entre outras tarefas, você pode:

  • Selecionar um registro principal com base em critérios específicos (por exemplo, o que foi atualizado mais recentemente).
  • Mesclar determinados campos e manter outros separados.
  • Fazer cálculos durante a mesclagem, como somar valores.
  • 👉 E, o mais importante para este guia: atualizar um campo específico em todos os duplicados com um único valor normalizado, sem mesclar os registros.

Isso transforma uma tarefa complexa, que normalmente exigiria scripts para manipular dados, em uma simples conversa com nossa AI.

Como normalizar dados duplicados passo a passo

Veja como usar o AI Processing para normalizar um campo, como o nome da empresa, em registros duplicados.

Etapa 1: prepare seus dados

Primeiro, carregue seus dados no Datablist.

  1. Crie uma coleção: clique no botão “+” na barra lateral para criar uma coleção.
Criar uma coleção no Datablist
Criar uma coleção no Datablist
  1. Importe os dados: importe seus dados de um arquivo CSV ou Excel. Se eles estiverem distribuídos em vários arquivos, importe todos para a mesma coleção. O Datablist ajudará você a associar as colunas às propriedades. Verifique se o campo que deseja normalizar (por exemplo, Company Name) e os campos usados para identificar duplicados (como Email ou Website) foram importados corretamente.
Importar o conjunto de dados em CSV ou Excel
Importar o conjunto de dados em CSV ou Excel

Nestes dados de exemplo, já é possível identificar alguns nomes de empresas duplicados que precisam ser normalizados.

Revisar os dados e as propriedades importadas
Revisar os dados e as propriedades importadas

Etapa 2: encontre os duplicados

Agora, identifique os registros duplicados.

2.a. Abra o Duplicates Finder

Abra Clean > Merge duplicates.

Abrir o Duplicates Finder
Abrir o Duplicates Finder

2.b. Escolha os identificadores de duplicados

Selecione a propriedade — ou as propriedades — que identifica um duplicado de forma inequívoca.

Sempre que possível, use um site ou ID de empresa compartilhado. Se você tiver apenas os nomes, consulte o guia de correspondência de nomes de empresas e revise cada grupo antes de normalizá-lo. Nomes parecidos e sufixos jurídicos diferentes podem pertencer a entidades distintas.

Selecionar propriedades para identificar duplicados
Selecionar propriedades para identificar duplicados

Para empresas, você também pode usar Website URL ou LinkedIn Company Page URL.

Para contatos, Email ou Phone Number são opções comuns.

2.c. Configure o algoritmo

Na etapa seguinte, escolha o algoritmo de correspondência.

O algoritmo “Smart” costuma funcionar bem com URLs ou e-mails, pois considera pequenas variações. O “Exact” é mais rigoroso. Para nomes, também é possível usar correspondência fonética ou aproximada.

Selecione também o Processor mais adequado aos seus dados.

Neste exemplo, seleciono o Processor Company Name para tratar variações específicas de nomes de empresas, como sufixos empresariais e termos geográficos.

Configurar o algoritmo e o Processor de correspondência
Configurar o algoritmo e o Processor de correspondência

2.c. Execute a verificação

Clique em Run duplicates check.

O Datablist analisará os dados e apresentará grupos de possíveis duplicados.

Revisar os grupos de duplicados encontrados
Revisar os grupos de duplicados encontrados

Etapa 3: selecione o modo AI Processing

Selecione Custom with AI na página de resultados dos duplicados. As capturas de tela mais antigas abaixo ainda mostram o nome anterior, AI Editing. Esse modo gera um script com base nas suas instruções e em uma pequena amostra de itens e, em seguida, apresenta uma prévia das alterações.

Etapa 4: escreva o prompt de normalização

É aqui que você explica à AI o que ela deve fazer. Oriente-a a:

  1. Identificar o valor mais comum da propriedade desejada em cada grupo de duplicados.
  2. Atualizar todos os registros do grupo para usar esse valor comum na propriedade especificada.
  3. Declarar explicitamente que nenhum registro deve ser excluído.

Veja um exemplo de prompt para normalizar a propriedade /Company Name:

Prompt de deduplicação

Para cada grupo de duplicados, conte os valores não vazios de /CompanyName usando correspondências exatas de texto. Se um valor aparecer mais vezes do que todos os outros, copie-o para /CompanyName em todos os registros desse grupo, inclusive naqueles em que CompanyName estiver vazio.

Se todos os valores estiverem vazios ou se dois ou mais valores empatarem na maior contagem, ignore o grupo sem fazer alterações. Ignore também os grupos cujos valores já sejam idênticos. Preserve todas as outras propriedades e não mescle nem exclua nenhum registro.

Escrever o prompt de AI com a lógica de normalização
Escrever o prompt de AI com a lógica de normalização

Entenda cada parte do prompt:

  • Normalize a propriedade /CompanyName...: especifica o campo desejado. Use /PropertyName ou {{PropertyName}} para fazer referência às suas colunas.
  • ...conte os valores não vazios usando correspondências exatas de texto.: define como o valor padrão será escolhido. Campos vazios não podem vencer, e grupos empatados ficam pendentes para revisão. Você também pode adotar outros critérios, como “valor mais longo”, “valor mais curto” ou até usar outro campo como referência — por exemplo, “use o valor do registro que tiver a data /UpdatedAt mais recente”.
  • Ignore o grupo se todos os valores de /CompanyName já forem iguais.: evita processamento desnecessário.
  • Não exclua nenhum registro.: esta instrução é essencial para garantir que apenas os campos sejam atualizados, sem mesclar nem remover registros.
Usar a sintaxe /PropertyName para selecionar a propriedade no prompt
Usar a sintaxe /PropertyName para selecionar a propriedade no prompt

Etapa 5: gere e visualize o script

Clique em Generate and preview changes. A AI do Datablist interpretará o prompt e criará um script para executar a ação.

Enviar o prompt e aguardar a geração do script pela AI
Enviar o prompt e aguardar a geração do script pela AI

Não se preocupe: você não precisa escrever nem editar nenhum script.

  • Explicação do script: um resumo em linguagem simples do que o script fará. Confirme se a explicação corresponde ao resultado desejado.
  • Prévia do resultado: uma tabela que mostra exatamente como o script modificará uma amostra dos grupos de duplicados antes de aplicar qualquer alteração. Confira o campo desejado (por exemplo, /Company Name) na prévia para garantir que ele apresente o valor normalizado correto em todos os duplicados da amostra.

Por exemplo, um grupo com Acme Ltd, Acme Ltd e Acme Limited deve manter três linhas, todas com Acme Ltd. Já um grupo com um registro Acme Ltd e outro Acme Limited deve permanecer inalterado, pois nenhum dos valores é mais frequente. Esses são apenas testes ilustrativos para conferir a prévia, não resultados medidos.

Confira tanto os valores quanto o número de linhas. Verifique se os campos vazios são preenchidos apenas quando há um vencedor claro, se os grupos empatados permanecem inalterados e se os IDs de origem e as demais propriedades são preservados.

Revisar a explicação do script e visualizar as alterações
Revisar a explicação do script e visualizar as alterações

Etapa 6: execute o script

Se a explicação e a prévia estiverem corretas, clique em Run AI rules. O Datablist executará o script gerado em todos os grupos de duplicados identificados.

Executar o script gerado
Executar o script gerado

Etapa 7: revise as alterações

Ao concluir a execução, o Datablist exibirá um resumo e uma Changes List para download.

Isso é útil quando você precisa reproduzir as alterações em um sistema externo — por exemplo, para editar leads no CRM.

Baixar a lista de alterações realizadas
Baixar a lista de alterações realizadas

Volte à visualização principal da coleção. O campo desejado (por exemplo, /CompanyName) agora estará consistente entre os registros de cada grupo de duplicados, enquanto os registros continuarão separados.

Revisar os dados finais com valores normalizados na coleção
Revisar os dados finais com valores normalizados na coleção

Pronto: você normalizou um campo em registros duplicados sem mesclá-los! 🚀

Quando normalizar sem mesclar

Em quais situações vale a pena normalizar um campo em vez de fazer uma mesclagem completa?

  • Padronização de nomes de empresas ou contatos: corrija variações como “Exemplo Ltda.”, “Exemplo Limitada”, “João Silva” e “João P. Silva” entre duplicados antes de definir a estratégia final de mesclagem.
  • Limpeza de cargos: unifique cargos como “VP de Marketing”, “Vice-presidente de Marketing” e “Marketing VP” para gerar análises e relatórios consistentes.
  • Normalização de localidades: mantenha nomes de países (“Brasil”, “BR”) ou siglas de estados (“SP”, “São Paulo”) consistentes entre endereços duplicados.
  • Preparação para importar ou atualizar o CRM: padronize campos importantes antes de importar os dados para um CRM com regras de validação rigorosas, mesmo que os duplicados sejam mantidos temporariamente.
  • Auditoria de dados: preserve os registros duplicados originais para auditorias ou acompanhamento do histórico, mas padronize identificadores importantes para facilitar as análises.
  • Limpeza incremental: normalize um campo por vez como parte de um processo mais amplo de limpeza de dados, antes de optar pela mesclagem ou exclusão completa.

Por que normalizar em vez de mesclar?

  • Preserva a granularidade dos registros: mantém cada registro duplicado intacto, o que pode ser necessário para rastrear sua origem, interações específicas ou dados históricos associados a ele.
  • Lida melhor com incertezas: é útil quando os duplicados não correspondem perfeitamente. Normalizar um campo importante garante consistência sem forçar uma mesclagem possivelmente incorreta entre registros que apresentam outros dados divergentes.
  • Permite uma abordagem por etapas: oferece mais controle sobre a limpeza dos dados. Primeiro, normalize; depois, revise e decida se deseja mesclar ou excluir os registros.
  • É simples e direcionado: você padroniza apenas um campo, sem afetar os demais dados dos registros duplicados.

Conclusão

Comece com um grupo verificado, defina a regra de seleção do valor e confira a prévia. Depois de executar o script, confirme se o número de linhas permanece igual e revise os grupos ignorados por causa de empates. Em seguida, você poderá exportar nomes consistentes sem deixar de preservar cada registro de origem.

FAQ

  1. O AI Processing está incluído no meu plano do Datablist? O AI Processing, incluindo a geração e a execução de scripts para normalização, está disponível nos planos pagos do Datablist. Consulte nossa página de preços para mais detalhes.

  2. Posso normalizar vários campos com um único prompt? Sim. Você pode escrever um prompt para normalizar vários campos ao mesmo tempo. Por exemplo: “Normalize a propriedade /Company Name usando o valor mais comum de cada grupo. Normalize a propriedade /Country usando o valor mais comum de cada grupo. Não exclua nenhum registro.”

  3. E se a AI interpretar meu prompt de forma errada? Sempre revise com atenção a explicação do script e a prévia dos resultados antes de executá-lo. Se a prévia estiver incorreta, ajuste o prompt para deixá-lo mais claro e específico e, depois, gere o script novamente.

  4. Posso desfazer as alterações feitas pelo script de AI? Após a execução do script, as alterações são aplicadas diretamente. Embora o Datablist ofereça um recurso para desfazer ações recentes dentro da sessão, a prática recomendada é clonar sua coleção antes de executar transformações importantes como esta. Assim, você poderá restaurá-la se necessário.

  5. Qual é a diferença em relação à opção padrão de mesclagem “Combine conflicting properties”? A opção padrão “Combine” mescla os registros duplicados em um único registro principal e concatena valores de texto conflitantes em um só campo. Com o prompt adequado, o AI Processing atualiza o campo de todos os registros duplicados com um único valor escolhido e mantém cada registro separado. Ele não mescla registros nem concatena valores, a menos que você solicite isso explicitamente.