Para remover linhas duplicadas de um CSV com segurança, compare a coluna que identifica cada registro, revise os grupos sugeridos e, depois, exclua as linhas redundantes ou mescle os valores que deseja preservar. Esse processo funciona tanto para um único arquivo CSV quanto para vários arquivos importados na mesma collection do Datablist.
Na primeira verificação, use email, telefone, site da empresa, SKU ou outro identificador estável. Quando houver diferenças de grafia ou formatação nos valores, use correspondência Smart, fuzzy ou phonetic e mantenha os grupos incertos para revisão.
Como mesclar duplicatas de arquivos CSV
O Datablist é excelente para realizar operações com dados que não são possíveis em planilhas. Use-o quando precisar de um bom editor de CSV online.
Neste guia, trabalharemos com dois arquivos CSV que contêm milhares de registros. Vamos carregá-los em uma única collection e eliminar duplicatas com base em uma das quatro colunas. A deduplicação também funciona com um único arquivo CSV.
Para baixar os arquivos CSV deste tutorial: Arquivo CSV 1 e Arquivo CSV 2
O arquivo CSV contém quatro colunas: First Name, Last Name, Email e Job Title. Queremos mesclar os registros que compartilham o mesmo endereço de email.
Se o campo de email contiver vários endereços na mesma célula, divida as células CSV com múltiplos valores em linhas antes de procurar duplicatas. Caso o arquivo exportado seja grande demais para importar ou revisar com segurança, divida o arquivo CSV grande antes da deduplicação.
O processo para mesclar duplicatas pode ser resumido assim:
- Carregue seus arquivos CSV em uma collection do Datablist
- Selecione as propriedades usadas para localizar duplicatas
- Mescle automaticamente as duplicatas sem conflitos
- Mescle manualmente as duplicatas restantes
Etapa 1: carregue os arquivos CSV em uma collection do Datablist
Crie uma nova collection
A primeira etapa é carregar o arquivo CSV no Datablist. Para começar, abra o Datablist (não é necessário criar uma conta).
Para criar uma collection, clique no botão "New collection" com o símbolo +. Depois de criá-la, escolha um nome e um ícone.
Em seguida, clique no botão Import CSV.
Crie propriedades para o arquivo CSV
Com o arquivo CSV carregado, você pode criar propriedades para a collection usando os nomes das colunas do CSV. O Datablist lista todas as colunas encontradas para que você crie uma propriedade para cada uma delas.
Arquivos CSV não informam o tipo de cada coluna. O Datablist sugere os tipos com base nos valores importados, facilitando a ordenação e a aplicação de filtros. Revise essas sugestões antes de importar.
Mantenha identificadores como SKU, ID da conta ou CEP no formato Text. Por exemplo, converter 00127 em Number remove os zeros à esquerda e altera a chave usada na comparação. Consulte o guia de tipos de propriedade se tiver dúvidas sobre qual tipo escolher.
Revise e importe
Na etapa de revisão, as linhas serão exibidas diretamente do arquivo CSV. Verifique se os dados estão bem formatados e consistentes. Depois, clique no botão "Import items". Pronto! 💪
Repita o processo com os outros arquivos CSV
Agora que sua collection está com as propriedades configuradas, use novamente o processo "Import CSV/Excel" para importar os outros arquivos CSV ou Excel para a mesma collection.
Etapa 2: encontre as duplicatas
Depois de carregar os arquivos CSV, abra Clean > Merge duplicates. Se as linhas extras não contiverem nenhum dado que precise ser preservado, selecione Remove duplicates.
Há dois modos disponíveis:
- All Properties compara as linhas completas.
- Selected Properties compara apenas as colunas que identificam o registro.
Neste exemplo, a propriedade email é suficiente para identificar um contato. Portanto, você pode selecionar o modo Selected Properties e a propriedade email.
Se aliases ou endereços intermediários fizerem os valores parecerem diferentes, use o fluxo específico para emails a fim de eliminar essas variações duplicadas.
A verificação não altera os dados. A área de resultados lista os grupos, explica por que houve correspondência e separa os grupos Ready daqueles que precisam de revisão.
Remova linhas duplicadas do CSV sem mesclar
Para apenas excluir duplicatas, escolha Remove duplicates na área de resultados:
- Verifique Record to keep. A opção padrão é Most Complete; as demais regras de seleção de registros exigem um plano pago. A linha escolhida permanece inalterada.
- Abra alguns grupos e compare as linhas marcadas como Keep e Remove. Confira se as linhas que serão excluídas contêm um telefone, uma observação ou um valor mais recente que ainda seja necessário.
- Se esses valores forem importantes, selecione Merge and preserve data e siga a Etapa 3 abaixo. A exclusão não copia valores adicionais para a linha mantida.
- Quando os grupos Ready corresponderem ao resultado desejado, clique em Remove ready duplicates. Revise qualquer aviso sobre perda de dados antes de confirmar.
Por exemplo, duas linhas idênticas com o mesmo email podem ser reduzidas a uma. Já duas linhas com o mesmo email, mas telefones diferentes, exigem uma decisão: manter um registro sem alterações ou mesclar os telefones no registro de destino.
Escolha as colunas de correspondência antes de decidir qual linha será mantida. All Properties encontra linhas completas idênticas. Selected Properties consegue agrupar o mesmo contato mesmo quando cargo ou telefone são diferentes. Usar apenas o site da empresa é abrangente demais quando vários contatos trabalham nela.
Guarde os arquivos CSV originais. Após o processamento, compare a quantidade de linhas removidas com os grupos revisados, confira os identificadores mantidos e exporte a collection limpa como CSV. As linhas que ainda aguardam revisão podem permanecer na collection; portanto, concluir um lote não significa que todas as possíveis duplicatas foram resolvidas.
Etapa 3: mescle e consolide duplicatas automaticamente
Selecione Merge and preserve data quando as linhas secundárias do CSV contiverem valores úteis. O Datablist escolhe um registro de destino, preenche as propriedades vazias e aplica suas regras de conflito antes de excluir as linhas secundárias.
A prévia separa os grupos Ready daqueles que ainda têm conflitos não resolvidos. Consulte a documentação do Duplicate Finder para conhecer todas as configurações de revisão, survivorship e seleção de registros.
Expanda Resolve conflicting values para identificar quais propriedades ainda precisam de uma regra.
Mescle linhas sem conflitos
O algoritmo "Merge non-conflicting duplicates" executa uma mesclagem inteligente. Ele combina registros com valores semelhantes ou complementares.
Por exemplo, estas duplicatas:
email | First Name | Last Name
james@gmail.com | James
james@gmail.com | | Bond
Serão mescladas assim:
email | First Name | Last Name
james@gmail.com | James | Bond
Combine valores duplicados
Combinar ou consolidar valores duplicados é ideal quando há valores conflitantes, mas você ainda quer mesclar os registros sem perder dados.
Por exemplo, ao combinar a propriedade Phone usando ponto e vírgula:
email | Phone | First Name | Last Name
james@gmail.com | +33 1 34 65 23 | James |
james@gmail.com | 06 13 42 78 23 | | Bond
O resultado será:
email | Phone | First Name | Last Name
james@gmail.com | +33 1 34 65 23;06 13 42 78 23 | James | Bond
Qualquer propriedade que contenha texto pode ser combinada. Os delimitadores disponíveis são line break, semi-colon, comma e space. É possível combinar uma ou mais propriedades durante a mesclagem.
Mesclar registros duplicados e combinar valores é ideal para a limpeza de leads e CRM. Mescle todos os leads duplicados e combine as propriedades Phone, Email e Notes para obter uma lista limpa. Depois de exportar o CSV de leads já tratado, basta importá-lo novamente no seu CRM.
Mantenha o valor do registro selecionado
Essa regra mantém o valor do registro de destino selecionado e descarta os demais valores conflitantes.
Most Complete é a regra padrão de Record to keep. Nos planos pagos, é possível escolher outras regras ou selecionar valores de campos individualmente com regras de survivorship.
Use a opção drop conflicting values para:
- Propriedades técnicas, como
Account Id, que exigem um único valor. - Propriedades do tipo "Relation", que não aceitam vários valores. Por exemplo:
Lead ownereAccount. - Propriedades que não são de texto e não podem ser combinadas. Por exemplo, data e hora, como
Last ActivityeContacted on, além de checkboxes.
Etapa 4: Assistente de Mesclagem manual
Abra Review group quando um grupo de duplicatas exigir uma decisão manual. O Merging Assistant permite escolher o registro de destino e o valor que será mantido em cada propriedade.
O registro de destino selecionado manualmente mantém seu ID do Datablist. As demais linhas tornam-se registros secundários.
Revise cada propriedade, selecione os valores que deseja manter e confirme a mesclagem. Você também pode excluir uma linha do grupo de duplicatas ou ignorar todo o grupo.
Exporte para CSV, se necessário
Parabéns, seus arquivos CSV foram deduplicados com sucesso! Se precisar usar o resultado em outra ferramenta, clique no botão "Export" para exportar a collection como um novo arquivo CSV.
FAQ
Quais outras operações de dados estão disponíveis no Datablist?
Arquivos CSV são amplamente usados para representar dados estruturados em aplicações de software ou conjuntos de dados. Apesar de estarem por toda parte, manipulá-los é difícil e muitas vezes exige conhecimento técnico.
Para operações simples, as planilhas são suficientes. No entanto, elas têm limitações quando é preciso:
Se você tiver vários arquivos CSV e quiser uni-los usando uma coluna única, consulte o guia sobre como unir arquivos CSV.
O Datablist processa arquivos CSV grandes?
O plano Free permite até 1 milhão de itens por collection no armazenamento do navegador. Os planos pagos permitem importar até 2 milhões de itens por collection. Operações locais de grande porte ainda dependem do navegador e do dispositivo. Veja como editar arquivos CSV grandes.
O algoritmo de deduplicação é melhor que o recurso de remover duplicatas do Microsoft Excel e Google Sheets?
Ferramentas de planilha, como Microsoft Excel e Google Sheets, oferecem recursos de deduplicação. Eles funcionam removendo linhas semelhantes. Para usos corporativos, porém, simplesmente excluir linhas não é o ideal.
O Datablist exibe os grupos de duplicatas antes de alterar o arquivo. Você pode remover linhas redundantes, mesclar valores complementares, resolver conflitos ou deixar grupos incertos intactos.
Se tiver alguma dúvida, entre em contato conosco.








