Para limpar dados de web scraping, primeiro preserve os valores brutos, normalize os campos que serão usados, revise os registros duplicados e valide os dados de contato antes da exportação.
Eu começo criando uma cópia separada do arquivo de origem, pois um valor aparentemente mais limpo pode perder informações. Uma query de URL pode identificar uma variante de produto, e um zero à esquerda pode fazer parte de um ID de conta. Mantenha a URL de origem e o texto original junto aos campos tratados.
Para uma lista de contatos extraída por scraping, siga esta ordem:
- Importe os dados e verifique os tipos de coluna sugeridos. Mantenha os identificadores como Text.
- Remova o HTML e os espaços extras dos textos descritivos. Depois, padronize apenas os campos necessários para filtros ou correspondências.
- Converta datas e quantidades após revisar seus formatos.
- Identifique duplicados usando um dado confiável, como o email, e decida quais valores manter.
- Verifique a sintaxe dos emails e as informações do domínio, analise as exceções e exporte a lista limpa.
As ferramentas abaixo permitem executar cada etapa no Datablist sem fórmulas. Os exemplos mostram quais valores devem ser verificados antes de aplicar uma transformação a toda a coleção.
Confira um resumo rápido das operações de limpeza abordadas neste artigo:
- Converter texto em Datetime, Number e Boolean
- Converter HTML em texto e remover tags
- Remover espaços extras dos textos
- Normalizar os dados
- Remover símbolos dos textos
- Separar o nome completo em First Name e Last Name
- Remover registros duplicados
- Validar endereços de email
- Extrair nomes de pessoas ou empresas de textos
Importar dados de CSV ou copiar e colar
O Datablist é uma excelente ferramenta para limpar dados. Trata-se de um editor de CSV online com recursos de limpeza, edição em massa e enriquecimento. Além disso, cada coleção comporta milhões de itens.
Abra o Datablist, crie uma coleção e carregue o arquivo CSV com os dados obtidos por scraping.
Para criar uma coleção, clique no botão + na barra lateral. Em seguida, clique em "Import CSV/Excel" para carregar o arquivo. Você também pode usar o atalho da página inicial para ir diretamente à etapa de importação.
Detectar o formato automaticamente
O assistente de importação do Datablist detecta automaticamente endereços de email, valores Datetime em ISO 8601, Booleans, Numbers, URLs e outros tipos, desde que estejam formatados corretamente.
Caso seus dados exijam uma análise mais complexa — devido a outro formato de data ou a erros em URLs ou emails, por exemplo —, importe-os como uma propriedade Text. Na próxima seção, mostrarei como converter propriedades Text em Datetime, Boolean ou Number.
Converter texto em Datetime, Boolean e Number
Marie Kondo diz que "a vida só começa de verdade depois que você coloca a casa em ordem". O mesmo vale para dados obtidos por scraping: "as vendas só começam de verdade depois que você coloca os dados em ordem"! 😅
Filtrar uma data (data de criação, data de captação etc.), um número (preço, quantidade de funcionários) ou um booleano é muito mais fácil quando esses valores são objetos nativos, e não apenas textos.
Abra a ferramenta "Text to Datetime, Number, Checkbox" no menu "Clean".
Converter qualquer texto para o formato Datetime
Datetime possui um formato internacional chamado ISO 8601, com uma estrutura definida. Se os seus dados usam esse formato, uma propriedade Datetime será criada automaticamente durante a importação para armazená-los.
Para valores Date e Datetime em outros formatos, é necessário indicar o padrão utilizado para que o Datablist possa convertê-los em valores Datetime estruturados.
Selecione a propriedade que deseja converter e escolha "Convert to Datetime".
Os formatos mais comuns estão disponíveis na lista, incluindo os usados pelo Google Sheets e pelo Excel. Você também pode selecionar "Custom format" para definir seu próprio formato de data e hora.
👉 Consulte nossa documentação para saber mais sobre formatos Datetime personalizados.
Criar Checkboxes a partir de valores de texto
Durante a importação, o Datablist converte automaticamente colunas com valores como "Yes, No" e "TRUE, FALSE" em propriedades Checkbox. Para conversões mais complexas, use o conversor.
Defina os valores, separados por vírgulas, que serão convertidos em uma caixa marcada. Os demais valores permanecerão desmarcados.
Extrair números de textos
Use o conversor "Text to number" para:
- Normalizar números com separadores decimais e de milhar personalizados
- Extrair números de textos que também contenham letras
👉 Consulte nossa documentação para saber mais sobre a conversão de números.
Limpar dados
Converter HTML em texto
Ferramentas de scraping analisam o código HTML, por isso os textos coletados podem conter tags HTML.
Códigos HTML incluem links, imagens e listas com marcadores, além de serem organizados em parágrafos e várias linhas.
O objetivo é preservar parte da estrutura fornecida pelo HTML, mas transformar um código difícil de ler em texto simples.
O conversor HTML to Text do Datablist mantém as quebras de linha e transforma marcadores em uma lista prefixada por -.
Para transformar um texto com tags HTML em texto simples, abra a ferramenta Bulk Edit no menu Edit.
Selecione a propriedade que contém as tags HTML e escolha "Convert HTML into plain text".
Remover espaços extras
Outro problema comum em dados obtidos por scraping é o excesso de espaços. Eles podem vir de quebras de linha, caracteres Tab e outros elementos que representam espaços no HTML.
O Datablist oferece uma ferramenta de limpeza para eliminar esses espaços extras.
- Remove espaços excedentes entre as palavras
- Remove linhas vazias
- Remove espaços no início e no fim de cada linha
Para remover espaços extras, abra a ferramenta "Bulk Edit" no menu "Edit". Selecione a propriedade e a ação "Remove extra spaces".
Padronizar maiúsculas e minúsculas
Alterar o uso de maiúsculas e minúsculas nos textos é simples. Abra a ferramenta "Bulk Edit" no menu "Edit".
Selecione a propriedade que será processada e use a ação "Change text case".
Há quatro modos disponíveis:
- Uppercase - Converte todas as letras em maiúsculas. Ex.:
john=>JOHN - Lowercase - Converte todas as letras em minúsculas. Ex.:
API=>api - Capitalize - Coloca a primeira letra de cada palavra em maiúscula. Ex.:
john is a good man=>John Is A Good Man - Capitalize only the first word - Coloca apenas a primeira letra da primeira palavra em maiúscula. Ex.:
john is a good man=>John is a good man
Remover símbolos dos textos
Textos extraídos de páginas HTML ou inseridos por usuários, como cargos de perfis do LinkedIn, podem conter símbolos, emoticons e outros caracteres capazes de afetar o processamento dos dados. Um simples emoticon no fim de um nome pode impedir que ele seja identificado por um algoritmo de deduplicação.
O Datablist possui um processador integrado para remover dos dados qualquer símbolo que não seja textual.
Clique em "Bulk Edit" no menu "Edit", selecione uma propriedade de texto e escolha a transformação "Remove symbols".
Se a prévia estiver correta, execute a transformação para processar os itens.
Normalizar com Find and Replace
Para criar segmentos nas suas listas de prospects, é necessário normalizar os dados.
- Normalizar cargos
- Normalizar países e cidades
- Normalizar URLs
- Entre outros
Seu objetivo é transformar uma propriedade de texto livre em uma propriedade com opções limitadas. Também pode ser reduzir os textos a uma versão mais básica, como converter URLs com caminhos em apenas seus domínios.
O Datablist oferece uma ferramenta avançada de Find and Replace. Ela funciona tanto com textos simples quanto com expressões regulares.
Expressões regulares são complexas, mas também muito poderosas.
Veja alguns exemplos de como usar RegEx para limpar seus dados.
Remover parâmetros de query de uma URL
Alguns parâmetros de URL rastreiam campanhas; outros selecionam um produto, uma variante, um resultado de busca ou o número de uma página. Remover todos eles pode fazer com que registros diferentes sejam reduzidos à mesma URL.
Primeiro, duplique a propriedade que contém a URL de origem. Use a expressão abaixo somente depois de confirmar que todos os parâmetros de query dessa coluna podem ser descartados. Por exemplo, ela remove ?utm_source=newsletter da URL de uma página, mas também removeria ?variant=blue da URL de um produto. Caso precise preservar a variante, mantenha a query ou remova apenas os parâmetros específicos de rastreamento em outra transformação.
Para remover toda a query, marque Match using regular expression e use a expressão abaixo, deixando o campo de substituição vazio:
\?.*$
Confira na prévia URLs com e sem query strings. Só aplique a transformação à cópia da propriedade se as URLs continuarem identificando as páginas corretas.
Extrair o domínio de endereços de email
Outra aplicação de Find and Replace é a extração do domínio de um email. Assim, você obtém o domínio após o caractere @, embora ele nem sempre corresponda ao site da empresa, pois o contato pode usar um provedor de email pessoal.
Duplique a propriedade de email para preservar os dados de origem. Para células que contenham um único endereço de email em texto simples, use a expressão regular abaixo e deixe o campo de substituição vazio:
^[^@\s]+@(?=[^@\s]+$)
Ela funciona com a parte local de endereços que contenham pontos, sinais de adição e hifens. Por exemplo, jane.smith+sales@example.com se transforma em example.com. A captura de tela mais antiga abaixo utiliza um padrão mais restritivo; use a expressão acima.
Primeiro, remova os espaços ao redor do endereço. Células com um nome de exibição, vários endereços ou um email malformado exigem uma limpeza separada. Essa transformação extrai o domínio, mas não valida a caixa de entrada.
👉 Para saber mais, consulte nossa documentação sobre Find and Replace.
Separar nome completo em First Name e Last Name
Ao extrair listas de leads, é comum obter contatos com o campo "Full Name", que precisa ser dividido em "First Name" e "Last Name". Separar corretamente o nome de uma pessoa em seus componentes é uma etapa essencial.
Separar os campos de nome ajuda a personalizar a abordagem aos contatos e a mapear os dados para um CRM. Preserve o nome completo para poder revisar separações incorretas; apenas o nome não permite determinar o gênero ou o título de uma pessoa.
A separação de nomes pode ser complexa. Felizmente, o Datablist oferece uma ferramenta fácil de usar que divide o campo "Name" em dois valores, usando o espaço como delimitador.
Para começar, abra a ferramenta "Split Property" no menu "Edit".
Depois, selecione a propriedade que contém os nomes. Escolha Space como delimitador e defina como 2 o número máximo de partes.
Execute a prévia. O Datablist analisará os dez primeiros itens para gerar uma amostra do resultado. Se estiver tudo certo, clique em "Split Property" para aplicar o algoritmo a todos os itens atuais.
Depois de executar o algoritmo de separação, renomeie as duas propriedades criadas como "First Name" e "Last Name".
Este exemplo se concentra em nomes que seguem a convenção ocidental, normalmente composta por nome e sobrenome. A tarefa pode ser mais complexa para nomes de outras culturas, inclusive aqueles com vários nomes próprios ou sobrenomes. Também é preciso considerar nomes com títulos ou sufixos.
Remover registros duplicados
Abra Clean > Merge duplicates quando várias linhas contiverem informações que você deseja preservar. Use Remove duplicates quando quiser manter uma linha inalterada e excluir as demais. A captura de tela abaixo mostra uma versão anterior do menu.
Selecione as propriedades que identificam um registro. Eu começo pelo email do contato ou pela URL do produto, em vez de usar apenas o nome da empresa. Não é necessário normalizar todos os campos quando já existe uma chave de correspondência confiável.
A verificação cria grupos para revisão sem alterar os dados. Na área de resultados, escolha Merge and preserve data, confira Record to keep e configure as regras em Resolve conflicting values. Combine valores de texto quando precisar manter ambos; preserve apenas um valor quando estiver disposto a descartar os demais.
Revise os grupos Ready antes de clicar em Merge ready groups. Se optar pela remoção, confira se as linhas excluídas contêm dados adicionais, pois esse modo mantém a linha selecionada sem alterações.
👉 Consulte nosso guia sobre como combinar registros duplicados em arquivos CSV.
Validar endereços de email
Dados obtidos por scraping podem estar desatualizados, conter erros de digitação ou ser inválidos. Isso acontece com frequência nos endereços de email coletados por scraping.
Quando os dados são gerados por usuários, sua base pode acabar contendo emails falsos ou endereços de provedores descartáveis.
O Datablist possui uma ferramenta integrada de validação de email que permite verificar milhares de endereços.
O serviço gratuito de limpeza de emails verifica a sintaxe, os domínios descartáveis e, quando essa opção está habilitada, os registros MX do domínio. Essas verificações não comprovam que uma caixa de entrada específica existe nem que uma mensagem será entregue. Preserve o status ou o motivo retornado para poder revisar as exceções.
O serviço oferece:
- Análise da sintaxe do email - Sinaliza endereços malformados, como textos sem o caractere
@ou com um domínio em formato inválido. - Verificação de provedores descartáveis - A segunda análise detecta emails temporários. O serviço procura domínios pertencentes a provedores de Disposable Email Address (DEA), como Mailinator, Temp-Mail, YopMail e outros.
- Verificação dos registros MX do domínio - Consulta os registros do servidor de email do domínio, a menos que você habilite Disable MX-records analysis. Analise resultados de DNS ausentes ou com falha separadamente dos erros de sintaxe; essa verificação diz respeito ao domínio, não à caixa de entrada específica.
- Segmentação de emails profissionais e pessoais - Ao trabalhar com prospects vindos de lead magnets ou segmentar sua base de usuários, pode ser útil separar contatos com emails profissionais daqueles com emails pessoais. O serviço de validação fornece essa informação para enriquecer os dados dos contatos.
👉 Consulte nosso guia sobre como limpar uma lista de emails.
Extrair nomes de pessoas ou empresas de textos
Ao extrair textos de sites ou de outras fontes, muitas vezes é útil identificar nomes de pessoas ou empresas. Essas informações podem ser usadas para diversos fins, como geração de leads ou análise da concorrência. No entanto, extrair nomes de textos não estruturados pode ser difícil, pois eles aparecem em diversos formatos e podem estar inseridos em blocos maiores de conteúdo.
Um dos principais desafios dessa extração é a grande variedade de convenções e formatos de nomes entre culturas e idiomas. Em algumas culturas, por exemplo, o sobrenome aparece antes do nome; em outras, ocorre o contrário. Algumas pessoas têm vários nomes próprios, enquanto outras não têm nenhum. Além disso, os nomes podem conter erros, abreviações ou formatos fora do padrão, o que dificulta sua identificação com técnicas simples de correspondência de padrões.
Uma abordagem comum é usar Named Entity Recognition (NER), uma técnica de processamento de linguagem natural que identifica e classifica entidades nomeadas em um texto. Modelos NER podem ser treinados para reconhecer diferentes tipos de entidade, como pessoas, organizações e locais, além de serem personalizados para lidar com diferentes convenções e variações de nomes.
O Datablist inclui um modelo avançado de "Named Entity Recognition" (NER), que pode ser executado diretamente nos seus textos. Ele foi treinado em árabe, alemão, inglês, espanhol, francês, italiano, letão, holandês, português e chinês.
Selecione "Entity name extraction" no menu "Enrichments".
Em seguida, nas opções de entrada, selecione a propriedade que contém o texto do qual deseja extrair os nomes.
Nas saídas, clique no botão "Create a new property" para cada tipo de nome que deseja extrair.
O Entity Name extractor do Datablist procura por:
- Organization Name: empresas, por exemplo.
- Person Name: nome completo ou First Name/Last Name.
- Location: extrai cidades, países e lugares.
Em seguida, execute o enrichment.
Precisa de ajuda para limpar seus dados?
Estou sempre em busca de feedback e de problemas de limpeza de dados que eu possa ajudar a resolver. Entre em contato comigo para compartilhar seu caso de uso.





































