La limpieza de datos consiste en detectar y corregir errores en un dataset antes de utilizarlo. En una lista de leads, esto puede implicar corregir fechas, eliminar espacios innecesarios, separar nombres completos y combinar contactos duplicados. Esta guía le muestra cómo realizar estas tareas en Datablist y revisar el resultado antes de exportar o enriquecer la lista.
Empiece por las columnas que identifican cada registro, como la dirección de email o el dominio de la empresa. Corrija su formato, revise los duplicados y, después, convierta o extraiga los demás valores que necesite. Compruebe una muestra de filas después de cada operación para evitar que una regla de formato modifique datos válidos.
Este es un resumen de las operaciones de limpieza que encontrará en el artículo:
- Convertir texto en fecha y hora, número o booleano
- Convertir HTML en texto y eliminar las etiquetas
- Eliminar espacios adicionales de los textos
- Normalizar sus datos
- Eliminar símbolos de los textos
- Separar el nombre completo en nombre y apellidos
- Eliminar registros duplicados
- Extraer direcciones de email, URLs y otros datos de un texto
- Usar expresiones regulares para filtrar y validar datos
- Crear transformaciones personalizadas con JavaScript
- Validar direcciones de email
Importar un CSV o copiar y pegar datos
Datablist es una herramienta perfecta para limpiar datos. Es un editor de CSV online con funciones de limpieza, edición masiva y enriquecimiento. Además, admite millones de registros por colección.
Si trabaja con campos de texto multilingües, puede añadir etiquetas de idioma a las filas con varios idiomas antes de filtrar, distribuir o traducir los datos.
Abra Datablist y cargue las colecciones de sus fuentes de datos.
Para crear una colección, haga clic en el botón + de la barra lateral. Después, seleccione "Import CSV/Excel" para cargar su archivo. También puede usar el acceso directo de la página de inicio para ir directamente al paso de importación.
Detectar el formato automáticamente
El asistente de importación de Datablist detecta automáticamente direcciones de email, fechas y horas en formato ISO 8601, valores booleanos, números, URLs y otros tipos de datos cuando tienen el formato correcto.
Si sus datos requieren un análisis más complejo, por ejemplo, porque las fechas usan otro formato o hay errores en las URLs o direcciones de email, impórtelos como una propiedad de tipo Text. En la siguiente sección verá cómo convertir estas propiedades de texto en Datetime, Boolean o Number.
Convertir texto en fecha, booleano o número
Marie Kondo dice que «la vida comienza de verdad después de poner la casa en orden». Con sus datos ocurre lo mismo: «¡Las ventas comienzan de verdad cuando pone sus datos en orden!». 😅
Filtrar por una fecha —como la fecha de creación o de financiación—, un número —como el precio o el número de empleados— o un booleano resulta mucho más sencillo cuando son objetos nativos y no simples textos.
Abra la herramienta "Text to Datetime, Number, Checkbox" desde el menú "Clean".
Convertir cualquier texto al formato Datetime
Datetime dispone de un formato internacional denominado ISO 8601, con una estructura definida. Si sus datos utilizan este formato, durante la importación se creará automáticamente una propiedad Datetime para almacenarlos.
Para los valores Date y Datetime con otros formatos, debe indicar el formato utilizado para que Datablist pueda convertirlos en valores Datetime estructurados.
Seleccione la propiedad que desea convertir y elija "Convert to Datetime".
Puede elegir entre varios formatos habituales —incluidos los utilizados por Google Sheets y Excel— o seleccionar "Custom format" para definir el suyo.
Si una misma propiedad contiene fechas o valores Datetime en varios formatos, seleccione "Custom or multiple formats" en "Datetime Conversion Format". A continuación, introduzca un formato por línea. Datablist probará cada formato, empezando por la primera línea, hasta obtener una fecha válida.
Crear casillas de verificación a partir de texto
Durante la importación, Datablist convierte automáticamente las columnas con valores como "Yes, No" o "TRUE, FALSE" en propiedades Checkbox. Para conversiones más complejas, utilice el conversor.
Defina los valores, separados por comas, que se convertirán en una casilla marcada. Los demás valores se mantendrán sin marcar.
Extraer números de un texto
Utilice el conversor "Text to number" para:
- Normalizar números con separadores decimales y de miles personalizados
- Extraer números de textos que contienen letras
👉 Consulte nuestra documentación para obtener más información sobre la conversión de números.
Limpiar datos
Convertir HTML en texto
Las herramientas de scraping analizan código HTML, por lo que los textos obtenidos pueden contener etiquetas HTML.
El código HTML incluye enlaces, imágenes y listas con viñetas, además de párrafos y saltos de línea.
El objetivo es conservar parte de la estructura que aporta el HTML, pero transformar un código difícil de leer en texto plano.
El conversor HTML to Text de Datablist conserva los saltos de línea y transforma las viñetas en listas cuyos elementos comienzan por -.
Para convertir un texto con etiquetas HTML en texto plano, abra la herramienta Bulk Edit desde el menú Edit.
Seleccione la propiedad que contiene las etiquetas HTML y elija "Convert HTML into plain text".
Eliminar espacios adicionales
Otro problema habitual de los datos desordenados son los espacios innecesarios. Pueden proceder de saltos de línea, caracteres Tab y otros caracteres que representan un espacio en HTML.
Datablist incorpora una herramienta de limpieza para eliminarlos.
Dispone de dos modos:
- Modo 1: eliminar todos los espacios. Este modo elimina cualquier carácter de espacio. Resulta útil para limpiar números de teléfono, precios y otros datos que solo deben contener letras, cifras u otros caracteres concretos.
- Modo 2: eliminar únicamente los «espacios adicionales».
En el segundo modo, el algoritmo funciona así:
- Elimina los espacios adicionales entre palabras
- Elimina las líneas vacías
- Elimina los espacios al principio y al final de cada línea
Para eliminar espacios adicionales, abra la herramienta "Bulk Edit" desde el menú "Edit". Seleccione la propiedad y la acción "Remove extra spaces".
Marque la opción "Remove all spaces" si quiere eliminar todos los caracteres de espacio. Déjela desactivada para quitar únicamente los espacios adicionales.
Este es un ejemplo del algoritmo eliminando espacios adicionales:
Después de la limpieza, el texto queda sin espacios adicionales:
Corregir mayúsculas y minúsculas
Cambiar las mayúsculas y minúsculas de un texto es sencillo. Abra la herramienta "Bulk Edit" desde el menú "Edit".
Seleccione la propiedad que desea procesar y utilice la acción "Change text case".
Hay cuatro modos disponibles:
- Uppercase - Convierte todas las letras en mayúsculas. Ejemplo:
john=>JOHN - Lowercase - Convierte todas las letras en minúsculas. Ejemplo:
API=>api - Capitalize - Escribe en mayúscula la primera letra de cada palabra. Ejemplo:
john is a good man=>John Is A Good Man - Capitalize only the first word - Escribe en mayúscula únicamente la primera letra de la primera palabra. Ejemplo:
john is a good man=>John is a good man
Eliminar símbolos de los textos
Los textos extraídos de páginas HTML o introducidos por usuarios —por ejemplo, los cargos de perfiles de LinkedIn— pueden contener símbolos, emoticonos y otros caracteres que afectan al procesamiento de los datos. Un simple emoticono al final de un nombre puede impedir que un algoritmo de deduplicación lo detecte.
Datablist incorpora un procesador para eliminar de sus datos cualquier símbolo que no forme parte del texto.
Haga clic en "Bulk Edit" dentro del menú "Edit", seleccione una propiedad de texto y elija la transformación "Remove symbols".
Si la vista previa es correcta, ejecute la transformación para procesar sus registros.
Normalizar datos con Buscar y reemplazar
Para crear segmentos en sus listas de leads, debe normalizar los datos.
- Normalizar cargos profesionales
- Normalizar países y ciudades
- Normalizar URLs
- Etc.
El objetivo es convertir una propiedad de texto libre en otra con un conjunto limitado de opciones. También puede transformar sus textos en una versión más básica, por ejemplo, convertir una URL con rutas en un simple dominio.
Datablist incluye una potente herramienta Find and Replace. Funciona tanto con texto simple como con expresiones regulares.
Las expresiones regulares son complejas, pero también muy potentes.
Estos son algunos ejemplos de cómo utilizar RegEx para limpiar sus datos.
Eliminar parámetros de consulta de una URL
Las URLs obtenidas mediante scraping suelen incluir parámetros de consulta innecesarios con fines de seguimiento o marketing. Al eliminarlos, obtendrá URLs limpias y podrá gestionar mejor la deduplicación utilizando la URL para detectar registros duplicados.
Para eliminar estos parámetros, marque la opción "Match using regular expression" y utilice la siguiente expresión regular, dejando vacío el texto de sustitución:
\?.*$
Aplíquela a la propiedad que contiene la URL.
Obtener el dominio de una dirección de email
Otra aplicación de Find and Replace con expresiones regulares es extraer el dominio web de una dirección de email.
Duplique la propiedad que contiene el email para conservar los datos originales. Después, utilice la siguiente expresión regular y deje vacío el texto de sustitución:
^(\w)*@
👉 Para obtener más información, consulte nuestra documentación sobre Find and Replace.
Separar el nombre completo en nombre y apellidos
Al extraer listas de leads mediante scraping, suele obtener contactos con un campo "Full Name" que debe dividir en "First Name" y "Last Name". Separar correctamente las distintas partes del nombre de una persona es un paso fundamental.
Separar el nombre y los apellidos resulta útil para dirigirse a cada persona de forma más personalizada en sus campañas de Cold Emailing, averiguar el género de un contacto y obtener su título académico.
Dividir nombres puede ser complicado. Por suerte, Datablist ofrece una herramienta fácil de usar que separa el campo "Name" en dos valores utilizando el espacio como delimitador.
Para empezar, abra la herramienta "Split Property" desde el menú "Edit".
A continuación, seleccione la propiedad que contiene los nombres. Elija Space como delimitador y establezca en 2 el número máximo de partes.
Ejecute la vista previa. Datablist analizará los 10 primeros registros para generar una muestra. Si el resultado es correcto, haga clic en "Split Property" para ejecutar el algoritmo en todos los registros actuales.
Después de ejecutar el algoritmo, cambie el nombre de las dos propiedades creadas a "First Name" y "Last Name".
Este ejemplo se centra en nombres que siguen la convención occidental, normalmente compuestos por un nombre y un apellido. El proceso puede ser más complejo con nombres de otras culturas, que pueden incluir varios nombres o apellidos, o cuando incorporan tratamientos o sufijos.
Eliminar registros duplicados
Datablist cuenta con un potente algoritmo de deduplicación para eliminar registros duplicados. Detecta registros similares utilizando una o varias propiedades y dispone de un algoritmo automático para combinarlos sin perder datos.
Para ejecutar el algoritmo de deduplicación, haga clic en "Duplicate Finder" dentro del menú "Clean".
Seleccione las propiedades que se utilizarán para encontrar coincidencias.
En la página de resultados, ejecute una vez el algoritmo "Auto Merge" con la opción "Merge non-conflicting duplicates" como única selección. Así se combinarán los registros duplicados que no presentan dificultades y se mostrarán las propiedades con conflictos.
El algoritmo de deduplicación ofrece dos opciones para resolver los datos conflictivos. Puede elegir "Combine conflicting properties" y utilizar un delimitador, o descartar los valores conflictivos para conservar un único registro principal.
👉 Consulte nuestra guía para combinar duplicados en archivos CSV. También puede aprender a detectar y combinar duplicados mediante el nombre de la empresa.
Extraer emails, URLs y otros datos de textos
Data Extractor de Datablist es una herramienta que analiza textos no estructurados y extrae entidades.
Utiliza el reconocimiento de patrones para detectar:
- Direcciones de email dentro de un texto
- URLs dentro de un texto
- Dominios de URLs
- Dominios de direcciones de email
- Menciones —por ejemplo, @nombre— dentro de un texto
- Etiquetas —por ejemplo, #etiqueta— dentro de un texto
Data Extractor es perfecto para analizar datos y estructurarlos. Con direcciones de email, URLs y otros valores bien formateados, podrá conectar sus datos con otras herramientas y crear flujos automatizados.
Por ejemplo, cuando obtenga direcciones de email, podrá enriquecerlas para encontrar información de contacto. También puede utilizar el dominio de las URLs para consultar su posición en rankings de tráfico como el de Alexa.
Data Extractor de Datablist está disponible en "Edit Menu -> Extract url, email, tag, etc.".
Seleccione la propiedad que contiene el texto no estructurado y elija un parser.
Ejecute el parser para generar una vista previa. Si el resultado es correcto, haga clic en "Extract" para procesar sus registros.
Usar expresiones regulares para filtrar y validar datos
Datablist le permite utilizar expresiones regulares para filtrar sus datos.
Filtrar textos por número de palabras
Con esta expresión regular puede filtrar textos que tengan al menos {n} palabras:
(?:\w+(?:\s|$)){5,} (sustituya el 5 por el número que desee)
Otras variantes de esta RegEx son:
(?:\w+(?:\s|$)){,5}: textos con un máximo de 5 palabras, incluidos los que tienen exactamente 5(?:\w+(?:\s|$)){5,10}: textos que contienen entre 5 y 10 palabras
Filtrar URLs no válidas
La siguiente RegEx detecta URLs no válidas:
^(?!(?:http(s)?:\/\/)?[\w.-]+(?:\.[\w\.-]+)+[\w\-\._~:/?#[\]@!\$&'\(\)\*\+,;=.]+).*$
Filtrar direcciones de email no válidas
La siguiente RegEx detecta direcciones de email no válidas:
^(?!([a-zA-Z0-9._%-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,})).*$
Crear transformaciones personalizadas con JavaScript
Datablist le permite ejecutar código JavaScript personalizado sobre sus datos. Esta capacidad le ayuda a resolver problemas específicos, gestionar formatos especializados, realizar cálculos complejos y aplicar transformaciones avanzadas.
Esta potente función le permite aprovechar su creatividad y experiencia en la manipulación y transformación de datos. Puede aplicar lógica personalizada, crear bucles y condiciones, y utilizar una amplia variedad de funciones de JavaScript para abordar incluso las tareas de limpieza de datos más complejas.
Abra el editor de JavaScript haciendo clic en "Run JavaScript" dentro del menú "Edit".
👉 Consulte nuestra documentación para aprender a escribir código JavaScript.
Validar direcciones de email
Los datos obtenidos mediante scraping pueden estar desactualizados, contener errores tipográficos o no ser válidos. Esto ocurre especialmente con las direcciones de email extraídas mediante scraping.
Cuando los datos proceden de los usuarios, su base de datos puede contener direcciones falsas o pertenecientes a proveedores de email desechable.
Datablist incorpora una herramienta de validación que le permite comprobar miles de direcciones de email.
El servicio de validación de emails ofrece:
- Análisis de la sintaxis del email - La primera comprobación verifica que la dirección cumpla el estándar IETF y realiza un análisis sintáctico completo. Detecta direcciones sin arroba (@), dominios no válidos y otros problemas.
- Comprobación de proveedores desechables - La segunda comprobación detecta emails temporales. El servicio busca dominios pertenecientes a proveedores de direcciones de email desechables (DEA), como Mailinator, Temp-Mail o YopMail.
- Comprobación de registros MX del dominio - Una dirección de email válida debe tener un dominio asociado con registros MX configurados. Estos registros indican qué servidor de correo acepta los mensajes enviados al dominio. Si no existen registros MX, la dirección no es válida. El servicio comprueba los registros DNS del dominio de cada dirección y busca sus registros MX. Si el dominio no existe, el email se marca como no válido. Si existe, pero no dispone de un registro MX válido, también se marca como no válido.
- Segmentación de direcciones de email profesionales y personales - Si capta leads mediante lead magnets o quiere segmentar su base de usuarios, puede resultarle útil distinguir los emails profesionales de los personales. El servicio de validación proporciona esta información para enriquecer los datos de sus contactos.
👉 Consulte nuestra guía para aprender a limpiar una lista de emails.
FAQ
Qué es la limpieza de datos y por qué es importante
La limpieza de datos, también conocida como depuración o saneamiento de datos, es el proceso de identificar y corregir o eliminar errores, incoherencias e imprecisiones de un dataset. Incluye detectar y resolver problemas como valores ausentes, registros duplicados, errores de formato, valores atípicos e inconsistencias en la representación de los datos.
Es una fase esencial del procesamiento, ya que garantiza que los datos sean precisos, fiables y aptos para analizarlos o utilizarlos en distintas aplicaciones.
Qué otras herramientas gratis existen para limpiar datos
Las soluciones de limpieza de datos abarcan desde herramientas genéricas, como las hojas de cálculo, hasta aplicaciones especializadas. Estas son algunas herramientas gratuitas recomendadas, además de Datablist, que puede utilizar para sus operaciones de limpieza.
OpenRefine
OpenRefine, antes conocido como Google Refine, es una herramienta open source centrada en explorar, limpiar y transformar datos desordenados e inconsistentes.
OpenRefine es una aplicación de escritorio independiente compatible con archivos tabulares —CSV y TSV—, archivos de Microsoft Excel y otros formatos estructurados, como JSON y XML.
OpenRefine resulta muy útil para trabajar con archivos CSV no válidos:
- Gestiona muy bien los problemas de codificación de los CSV
- Ofrece opciones para corregir errores de formato en archivos CSV
Entre sus puntos débiles, OpenRefine tiene una curva de aprendizaje pronunciada y carece de algunas funciones orientadas al negocio. No ofrece funciones de deduplicación ni flujos sencillos para unir un dataset con otra lista y actualizar o consolidar información. Tampoco incluye funciones de colaboración, enriquecimientos empresariales ni integraciones específicas para empresas.
Microsoft Excel y Google Sheets
Microsoft Excel y Google Sheets son potentes aplicaciones de hojas de cálculo que pueden utilizarse para limpiar y preparar datos. Aunque presentan algunas diferencias, ambas ofrecen numerosas funciones útiles para depurar y transformar información.
Puede utilizar fórmulas para transformar y manipular los datos. Además, el formato condicional le permite destacar valores no válidos que requieren una revisión manual.
Necesita ayuda para limpiar sus datos
Siempre estoy buscando feedback y nuevos problemas de limpieza de datos que resolver. Puede contactarme para compartir su caso de uso.












































