La limpieza de datos consiste en detectar y corregir errores en un dataset antes de utilizarlo. En una lista de leads, esto puede implicar corregir fechas, eliminar espacios innecesarios, separar nombres completos y combinar contactos duplicados. Esta guía le muestra cómo realizar estas tareas en Datablist y revisar el resultado antes de exportar o enriquecer la lista.

Empiece por las columnas que identifican cada registro, como la dirección de email o el dominio de la empresa. Corrija su formato, revise los duplicados y, después, convierta o extraiga los demás valores que necesite. Compruebe una muestra de filas después de cada operación para evitar que una regla de formato modifique datos válidos.

Este es un resumen de las operaciones de limpieza que encontrará en el artículo:

Importar un CSV o copiar y pegar datos

Datablist es una herramienta perfecta para limpiar datos. Es un editor de CSV online con funciones de limpieza, edición masiva y enriquecimiento. Además, admite millones de registros por colección.

Si trabaja con campos de texto multilingües, puede añadir etiquetas de idioma a las filas con varios idiomas antes de filtrar, distribuir o traducir los datos.

Abra Datablist y cargue las colecciones de sus fuentes de datos.

Para crear una colección, haga clic en el botón + de la barra lateral. Después, seleccione "Import CSV/Excel" para cargar su archivo. También puede usar el acceso directo de la página de inicio para ir directamente al paso de importación.

Crear una colección
Crear una colección

Detectar el formato automáticamente

El asistente de importación de Datablist detecta automáticamente direcciones de email, fechas y horas en formato ISO 8601, valores booleanos, números, URLs y otros tipos de datos cuando tienen el formato correcto.

Detección automática del tipo de dato
Detección automática del tipo de dato

Si sus datos requieren un análisis más complejo, por ejemplo, porque las fechas usan otro formato o hay errores en las URLs o direcciones de email, impórtelos como una propiedad de tipo Text. En la siguiente sección verá cómo convertir estas propiedades de texto en Datetime, Boolean o Number.

Seleccionar el tipo de dato
Seleccionar el tipo de dato

Convertir texto en fecha, booleano o número

Marie Kondo dice que «la vida comienza de verdad después de poner la casa en orden». Con sus datos ocurre lo mismo: «¡Las ventas comienzan de verdad cuando pone sus datos en orden!». 😅

Filtrar por una fecha —como la fecha de creación o de financiación—, un número —como el precio o el número de empleados— o un booleano resulta mucho más sencillo cuando son objetos nativos y no simples textos.

Abra la herramienta "Text to Datetime, Number, Checkbox" desde el menú "Clean".

Convertir texto en otros tipos de datos
Convertir texto en otros tipos de datos

Convertir cualquier texto al formato Datetime

Datetime dispone de un formato internacional denominado ISO 8601, con una estructura definida. Si sus datos utilizan este formato, durante la importación se creará automáticamente una propiedad Datetime para almacenarlos.

Para los valores Date y Datetime con otros formatos, debe indicar el formato utilizado para que Datablist pueda convertirlos en valores Datetime estructurados.

Seleccione la propiedad que desea convertir y elija "Convert to Datetime".

Convertir texto en Datetime
Convertir texto en Datetime

Puede elegir entre varios formatos habituales —incluidos los utilizados por Google Sheets y Excel— o seleccionar "Custom format" para definir el suyo.

Formato Datetime personalizado
Formato Datetime personalizado
Vista previa de la conversión a Datetime
Vista previa de la conversión a Datetime

Si una misma propiedad contiene fechas o valores Datetime en varios formatos, seleccione "Custom or multiple formats" en "Datetime Conversion Format". A continuación, introduzca un formato por línea. Datablist probará cada formato, empezando por la primera línea, hasta obtener una fecha válida.

👉 Consulte nuestra documentación para obtener más información sobre los formatos Datetime personalizados.

Crear casillas de verificación a partir de texto

Durante la importación, Datablist convierte automáticamente las columnas con valores como "Yes, No" o "TRUE, FALSE" en propiedades Checkbox. Para conversiones más complejas, utilice el conversor.

Defina los valores, separados por comas, que se convertirán en una casilla marcada. Los demás valores se mantendrán sin marcar.

Conversión a Checkbox
Conversión a Checkbox
Vista previa de la conversión a Checkbox
Vista previa de la conversión a Checkbox

Extraer números de un texto

Utilice el conversor "Text to number" para:

  • Normalizar números con separadores decimales y de miles personalizados
  • Extraer números de textos que contienen letras
Conversión de texto en número
Conversión de texto en número
Vista previa de la conversión en número
Vista previa de la conversión en número

👉 Consulte nuestra documentación para obtener más información sobre la conversión de números.

Limpiar datos

Convertir HTML en texto

Las herramientas de scraping analizan código HTML, por lo que los textos obtenidos pueden contener etiquetas HTML.

El código HTML incluye enlaces, imágenes y listas con viñetas, además de párrafos y saltos de línea.

El objetivo es conservar parte de la estructura que aporta el HTML, pero transformar un código difícil de leer en texto plano.

El conversor HTML to Text de Datablist conserva los saltos de línea y transforma las viñetas en listas cuyos elementos comienzan por -.

Para convertir un texto con etiquetas HTML en texto plano, abra la herramienta Bulk Edit desde el menú Edit.

Herramienta Bulk Edit
Herramienta Bulk Edit

Seleccione la propiedad que contiene las etiquetas HTML y elija "Convert HTML into plain text".

Convertir HTML con Bulk Edit
Convertir HTML con Bulk Edit
Conversión de HTML a texto
Conversión de HTML a texto
Resultado de la conversión de HTML a texto
Resultado de la conversión de HTML a texto

Eliminar espacios adicionales

Otro problema habitual de los datos desordenados son los espacios innecesarios. Pueden proceder de saltos de línea, caracteres Tab y otros caracteres que representan un espacio en HTML.

Datablist incorpora una herramienta de limpieza para eliminarlos.

Dispone de dos modos:

  • Modo 1: eliminar todos los espacios. Este modo elimina cualquier carácter de espacio. Resulta útil para limpiar números de teléfono, precios y otros datos que solo deben contener letras, cifras u otros caracteres concretos.
  • Modo 2: eliminar únicamente los «espacios adicionales».

En el segundo modo, el algoritmo funciona así:

  • Elimina los espacios adicionales entre palabras
  • Elimina las líneas vacías
  • Elimina los espacios al principio y al final de cada línea

Para eliminar espacios adicionales, abra la herramienta "Bulk Edit" desde el menú "Edit". Seleccione la propiedad y la acción "Remove extra spaces".

Marque la opción "Remove all spaces" si quiere eliminar todos los caracteres de espacio. Déjela desactivada para quitar únicamente los espacios adicionales.

Configuración para eliminar espacios adicionales
Configuración para eliminar espacios adicionales

Este es un ejemplo del algoritmo eliminando espacios adicionales:

Eliminar espacios adicionales
Eliminar espacios adicionales

Después de la limpieza, el texto queda sin espacios adicionales:

Resultado tras eliminar espacios adicionales
Resultado tras eliminar espacios adicionales

Corregir mayúsculas y minúsculas

Cambiar las mayúsculas y minúsculas de un texto es sencillo. Abra la herramienta "Bulk Edit" desde el menú "Edit".

Seleccione la propiedad que desea procesar y utilice la acción "Change text case".

Cambiar mayúsculas y minúsculas
Cambiar mayúsculas y minúsculas

Hay cuatro modos disponibles:

  • Uppercase - Convierte todas las letras en mayúsculas. Ejemplo: john => JOHN
  • Lowercase - Convierte todas las letras en minúsculas. Ejemplo: API => api
  • Capitalize - Escribe en mayúscula la primera letra de cada palabra. Ejemplo: john is a good man => John Is A Good Man
  • Capitalize only the first word - Escribe en mayúscula únicamente la primera letra de la primera palabra. Ejemplo: john is a good man => John is a good man

Eliminar símbolos de los textos

Los textos extraídos de páginas HTML o introducidos por usuarios —por ejemplo, los cargos de perfiles de LinkedIn— pueden contener símbolos, emoticonos y otros caracteres que afectan al procesamiento de los datos. Un simple emoticono al final de un nombre puede impedir que un algoritmo de deduplicación lo detecte.

Datablist incorpora un procesador para eliminar de sus datos cualquier símbolo que no forme parte del texto.

Haga clic en "Bulk Edit" dentro del menú "Edit", seleccione una propiedad de texto y elija la transformación "Remove symbols".

Eliminar símbolos
Eliminar símbolos

Si la vista previa es correcta, ejecute la transformación para procesar sus registros.

Resultado tras eliminar símbolos
Resultado tras eliminar símbolos

Normalizar datos con Buscar y reemplazar

Para crear segmentos en sus listas de leads, debe normalizar los datos.

  • Normalizar cargos profesionales
  • Normalizar países y ciudades
  • Normalizar URLs
  • Etc.

El objetivo es convertir una propiedad de texto libre en otra con un conjunto limitado de opciones. También puede transformar sus textos en una versión más básica, por ejemplo, convertir una URL con rutas en un simple dominio.

Datablist incluye una potente herramienta Find and Replace. Funciona tanto con texto simple como con expresiones regulares.

Las expresiones regulares son complejas, pero también muy potentes.

Estos son algunos ejemplos de cómo utilizar RegEx para limpiar sus datos.

Eliminar parámetros de consulta de una URL

Las URLs obtenidas mediante scraping suelen incluir parámetros de consulta innecesarios con fines de seguimiento o marketing. Al eliminarlos, obtendrá URLs limpias y podrá gestionar mejor la deduplicación utilizando la URL para detectar registros duplicados.

Para eliminar estos parámetros, marque la opción "Match using regular expression" y utilice la siguiente expresión regular, dejando vacío el texto de sustitución:

\?.*$
Expresión regular para eliminar parámetros de consulta
Expresión regular para eliminar parámetros de consulta

Aplíquela a la propiedad que contiene la URL.

Vista previa sin parámetros de consulta
Vista previa sin parámetros de consulta

Obtener el dominio de una dirección de email

Otra aplicación de Find and Replace con expresiones regulares es extraer el dominio web de una dirección de email.

Duplique la propiedad que contiene el email para conservar los datos originales. Después, utilice la siguiente expresión regular y deje vacío el texto de sustitución:

^(\w)*@
Expresión regular para obtener el dominio de un email
Expresión regular para obtener el dominio de un email
Vista previa de los dominios extraídos de emails
Vista previa de los dominios extraídos de emails

👉 Para obtener más información, consulte nuestra documentación sobre Find and Replace.

Separar el nombre completo en nombre y apellidos

Al extraer listas de leads mediante scraping, suele obtener contactos con un campo "Full Name" que debe dividir en "First Name" y "Last Name". Separar correctamente las distintas partes del nombre de una persona es un paso fundamental.

Separar el nombre y los apellidos resulta útil para dirigirse a cada persona de forma más personalizada en sus campañas de Cold Emailing, averiguar el género de un contacto y obtener su título académico.

Dividir nombres puede ser complicado. Por suerte, Datablist ofrece una herramienta fácil de usar que separa el campo "Name" en dos valores utilizando el espacio como delimitador.

Para empezar, abra la herramienta "Split Property" desde el menú "Edit".

Herramienta Split Property
Herramienta Split Property

A continuación, seleccione la propiedad que contiene los nombres. Elija Space como delimitador y establezca en 2 el número máximo de partes.

Configurar Split Property
Configurar Split Property

Ejecute la vista previa. Datablist analizará los 10 primeros registros para generar una muestra. Si el resultado es correcto, haga clic en "Split Property" para ejecutar el algoritmo en todos los registros actuales.

Ejecutar la vista previa
Ejecutar la vista previa

Después de ejecutar el algoritmo, cambie el nombre de las dos propiedades creadas a "First Name" y "Last Name".

Resultado con nombre y apellidos
Resultado con nombre y apellidos

Este ejemplo se centra en nombres que siguen la convención occidental, normalmente compuestos por un nombre y un apellido. El proceso puede ser más complejo con nombres de otras culturas, que pueden incluir varios nombres o apellidos, o cuando incorporan tratamientos o sufijos.

Eliminar registros duplicados

Datablist cuenta con un potente algoritmo de deduplicación para eliminar registros duplicados. Detecta registros similares utilizando una o varias propiedades y dispone de un algoritmo automático para combinarlos sin perder datos.

Para ejecutar el algoritmo de deduplicación, haga clic en "Duplicate Finder" dentro del menú "Clean".

Ejecutar Duplicate Finder
Ejecutar Duplicate Finder

Seleccione las propiedades que se utilizarán para encontrar coincidencias.

En la página de resultados, ejecute una vez el algoritmo "Auto Merge" con la opción "Merge non-conflicting duplicates" como única selección. Así se combinarán los registros duplicados que no presentan dificultades y se mostrarán las propiedades con conflictos.

El algoritmo de deduplicación ofrece dos opciones para resolver los datos conflictivos. Puede elegir "Combine conflicting properties" y utilizar un delimitador, o descartar los valores conflictivos para conservar un único registro principal.

Combinación automática
Combinación automática

👉 Consulte nuestra guía para combinar duplicados en archivos CSV. También puede aprender a detectar y combinar duplicados mediante el nombre de la empresa.

Extraer emails, URLs y otros datos de textos

Data Extractor de Datablist es una herramienta que analiza textos no estructurados y extrae entidades.

Utiliza el reconocimiento de patrones para detectar:

  • Direcciones de email dentro de un texto
  • URLs dentro de un texto
  • Dominios de URLs
  • Dominios de direcciones de email
  • Menciones —por ejemplo, @nombre— dentro de un texto
  • Etiquetas —por ejemplo, #etiqueta— dentro de un texto

Data Extractor es perfecto para analizar datos y estructurarlos. Con direcciones de email, URLs y otros valores bien formateados, podrá conectar sus datos con otras herramientas y crear flujos automatizados.

Por ejemplo, cuando obtenga direcciones de email, podrá enriquecerlas para encontrar información de contacto. También puede utilizar el dominio de las URLs para consultar su posición en rankings de tráfico como el de Alexa.

Data Extractor de Datablist está disponible en "Edit Menu -> Extract url, email, tag, etc.".

Data Extractor
Data Extractor

Seleccione la propiedad que contiene el texto no estructurado y elija un parser.

Parsers de Data Extractor
Parsers de Data Extractor

Ejecute el parser para generar una vista previa. Si el resultado es correcto, haga clic en "Extract" para procesar sus registros.

Vista previa de Data Extractor
Vista previa de Data Extractor

Usar expresiones regulares para filtrar y validar datos

Datablist le permite utilizar expresiones regulares para filtrar sus datos.

Filtrar textos por número de palabras

Con esta expresión regular puede filtrar textos que tengan al menos {n} palabras:

(?:\w+(?:\s|$)){5,} (sustituya el 5 por el número que desee)

Otras variantes de esta RegEx son:

  • (?:\w+(?:\s|$)){,5}: textos con un máximo de 5 palabras, incluidos los que tienen exactamente 5
  • (?:\w+(?:\s|$)){5,10}: textos que contienen entre 5 y 10 palabras
Filtrar textos con un mínimo de 5 palabras
Filtrar textos con un mínimo de 5 palabras
Resultado del filtro de un mínimo de 5 palabras
Resultado del filtro de un mínimo de 5 palabras

Filtrar URLs no válidas

La siguiente RegEx detecta URLs no válidas:

^(?!(?:http(s)?:\/\/)?[\w.-]+(?:\.[\w\.-]+)+[\w\-\._~:/?#[\]@!\$&'\(\)\*\+,;=.]+).*$

Filtrar URLs no válidas
Filtrar URLs no válidas
Resultado del filtro de URLs no válidas
Resultado del filtro de URLs no válidas

Filtrar direcciones de email no válidas

La siguiente RegEx detecta direcciones de email no válidas:

^(?!([a-zA-Z0-9._%-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,})).*$

Filtrar emails no válidos
Filtrar emails no válidos
Resultado del filtro de emails no válidos
Resultado del filtro de emails no válidos

Crear transformaciones personalizadas con JavaScript

Datablist le permite ejecutar código JavaScript personalizado sobre sus datos. Esta capacidad le ayuda a resolver problemas específicos, gestionar formatos especializados, realizar cálculos complejos y aplicar transformaciones avanzadas.

Esta potente función le permite aprovechar su creatividad y experiencia en la manipulación y transformación de datos. Puede aplicar lógica personalizada, crear bucles y condiciones, y utilizar una amplia variedad de funciones de JavaScript para abordar incluso las tareas de limpieza de datos más complejas.

Abra el editor de JavaScript haciendo clic en "Run JavaScript" dentro del menú "Edit".

Limpieza de datos con código JavaScript
Limpieza de datos con código JavaScript

👉 Consulte nuestra documentación para aprender a escribir código JavaScript.

Validar direcciones de email

Los datos obtenidos mediante scraping pueden estar desactualizados, contener errores tipográficos o no ser válidos. Esto ocurre especialmente con las direcciones de email extraídas mediante scraping.

Cuando los datos proceden de los usuarios, su base de datos puede contener direcciones falsas o pertenecientes a proveedores de email desechable.

Datablist incorpora una herramienta de validación que le permite comprobar miles de direcciones de email.

Hacer clic en "Enrich"
Hacer clic en "Enrich"

El servicio de validación de emails ofrece:

  • Análisis de la sintaxis del email - La primera comprobación verifica que la dirección cumpla el estándar IETF y realiza un análisis sintáctico completo. Detecta direcciones sin arroba (@), dominios no válidos y otros problemas.
  • Comprobación de proveedores desechables - La segunda comprobación detecta emails temporales. El servicio busca dominios pertenecientes a proveedores de direcciones de email desechables (DEA), como Mailinator, Temp-Mail o YopMail.
  • Comprobación de registros MX del dominio - Una dirección de email válida debe tener un dominio asociado con registros MX configurados. Estos registros indican qué servidor de correo acepta los mensajes enviados al dominio. Si no existen registros MX, la dirección no es válida. El servicio comprueba los registros DNS del dominio de cada dirección y busca sus registros MX. Si el dominio no existe, el email se marca como no válido. Si existe, pero no dispone de un registro MX válido, también se marca como no válido.
  • Segmentación de direcciones de email profesionales y personales - Si capta leads mediante lead magnets o quiere segmentar su base de usuarios, puede resultarle útil distinguir los emails profesionales de los personales. El servicio de validación proporciona esta información para enriquecer los datos de sus contactos.
Resultados de la verificación de emails
Resultados de la verificación de emails

👉 Consulte nuestra guía para aprender a limpiar una lista de emails.

FAQ

Qué es la limpieza de datos y por qué es importante

La limpieza de datos, también conocida como depuración o saneamiento de datos, es el proceso de identificar y corregir o eliminar errores, incoherencias e imprecisiones de un dataset. Incluye detectar y resolver problemas como valores ausentes, registros duplicados, errores de formato, valores atípicos e inconsistencias en la representación de los datos.

Es una fase esencial del procesamiento, ya que garantiza que los datos sean precisos, fiables y aptos para analizarlos o utilizarlos en distintas aplicaciones.

Qué otras herramientas gratis existen para limpiar datos

Las soluciones de limpieza de datos abarcan desde herramientas genéricas, como las hojas de cálculo, hasta aplicaciones especializadas. Estas son algunas herramientas gratuitas recomendadas, además de Datablist, que puede utilizar para sus operaciones de limpieza.

OpenRefine

OpenRefine, antes conocido como Google Refine, es una herramienta open source centrada en explorar, limpiar y transformar datos desordenados e inconsistentes.

OpenRefine es una aplicación de escritorio independiente compatible con archivos tabulares —CSV y TSV—, archivos de Microsoft Excel y otros formatos estructurados, como JSON y XML.

OpenRefine resulta muy útil para trabajar con archivos CSV no válidos:

  • Gestiona muy bien los problemas de codificación de los CSV
  • Ofrece opciones para corregir errores de formato en archivos CSV

Entre sus puntos débiles, OpenRefine tiene una curva de aprendizaje pronunciada y carece de algunas funciones orientadas al negocio. No ofrece funciones de deduplicación ni flujos sencillos para unir un dataset con otra lista y actualizar o consolidar información. Tampoco incluye funciones de colaboración, enriquecimientos empresariales ni integraciones específicas para empresas.

Microsoft Excel y Google Sheets

Microsoft Excel y Google Sheets son potentes aplicaciones de hojas de cálculo que pueden utilizarse para limpiar y preparar datos. Aunque presentan algunas diferencias, ambas ofrecen numerosas funciones útiles para depurar y transformar información.

Puede utilizar fórmulas para transformar y manipular los datos. Además, el formato condicional le permite destacar valores no válidos que requieren una revisión manual.

Necesita ayuda para limpiar sus datos

Siempre estoy buscando feedback y nuevos problemas de limpieza de datos que resolver. Puede contactarme para compartir su caso de uso.