Si necesita detectar el idioma de cada fila de un dataset, la forma más sencilla es añadir las columnas de idioma directamente al archivo que ya utiliza. Importe el archivo CSV o Excel en Datablist, ejecute la detección de idioma en la columna de texto, revise los niveles de confianza y, después, exporte el dataset enriquecido o continúe con la traducción, el enrutamiento o la segmentación.

Prefiero este método a copiar filas en un chatbot porque los resultados permanecen asociados a cada fila. Obtendrá el nombre del idioma, su código ISO y un nivel de confianza para cada registro. Así, el siguiente paso resulta mucho más fácil: puede filtrar las filas en francés, enviar las filas en español a traducción, revisar los resultados con baja confianza o eliminar las filas sin texto útil.

En esta guía utilizaré un dataset de perfiles multilingües, pero el mismo proceso sirve para tickets de soporte, respuestas a encuestas, reseñas, descripciones de productos, páginas extraídas mediante scraping y notas de CRM.

🔑 Utilice primero el detector específico

Si solo necesita detectar idiomas, empiece por el enrichment de detección de idioma. Utilice ChatGPT únicamente cuando necesite reglas personalizadas o tomar una decisión combinada.

Enlaces rápidos

Respuesta directa

Para detectar el idioma de cada fila de un dataset, importe su archivo CSV o Excel en Datablist, abra el menú Enrich y seleccione Detect Language from a Text enrichment. En el paso Inputs, elija la columna de texto que desea analizar. Datablist añade en nuevas columnas el nombre del idioma detectado, su código y el nivel de confianza, con un precio fijo de 0.05 créditos por fila.

La revisión es la parte importante del proceso. Detectar idiomas es una tarea de clasificación, y el nivel de confianza indica qué filas pueden avanzar y cuáles conviene comprobar. Por lo general, las filas con confianza alta pueden pasar al siguiente workflow. Antes de exportar, filtre las filas con confianza baja, entradas no válidas o sin resultados.

Este es el workflow que utilizo cuando el resultado debe permanecer vinculado a las filas originales. Una fórmula de hoja de cálculo puede servir en casos sencillos, pero suele fallar con textos que mezclan idiomas, fragmentos cortos, celdas vacías y exportaciones poco limpias. Un chatbot puede responder sobre algunos ejemplos, pero no le proporciona un dataset ordenado con un resultado por fila.

Dataset de ejemplo

Para la demostración utilizo un CSV de perfiles sociales con cinco columnas:

ID del perfilNombre completoTitularBiografíaEmpresa
C8C1DXQBNPMaya CollinsFundadora que desarrolla herramientas de analítica para equipos de clientesAyudo a los equipos comerciales a limpiar listas de leads desordenadas...Northstar Labs
61M25JUEHMLucas BernardResponsable de soporte al cliente de un marketplaceCreo workflows sencillos...Market Loop
Y45G9QU71CSofia RomeroEspecialista en CRM y automatización comercialConsultora de operaciones enfocada...Talent Desk
RL20HHREOTFelix WagnerTech Recruiter para equipos de productoAyudo a los equipos a...Cleanbase
TT384W44MWAoi NakamuraConsultora de CRM para equipos de ventasClasifico consultas multilingües...Northstar Labs

El archivo no incluye una columna de idioma de forma intencionada. Quiero que Datablist añada esa información, no que confirme una etiqueta que ya he proporcionado.

El dataset también contiene filas desordenadas: biografías vacías, titulares cortos, nombres de empresas, nombres de usuario, URL, números y fragmentos en varios idiomas. Me gusta utilizar este tipo de archivo porque muestra lo que ocurre fuera de una demostración perfecta. Las exportaciones reales siempre incluyen algunas filas que requieren revisión.

Dataset importado de perfiles multilingües en Datablist
Dataset importado de perfiles multilingües en Datablist

En este ejemplo utilizo tanto Headline como Bio como señales para identificar el idioma. Si su dataset incluye tickets de soporte largos o descripciones de productos en una sola columna, basta con una columna de entrada. Si cada fila contiene campos cortos, combinar dos columnas de texto suele proporcionar más contexto al detector.

Paso 1: importe el archivo CSV o Excel

Empiece con un archivo CSV o Excel que tenga una fila por registro y, al menos, una columna de texto. Abra Datablist, cree una colección e importe el archivo. Puede utilizar el editor de CSV de Datablist para este workflow.

Importar un CSV o Excel desde una colección vacía de Datablist
Importar un CSV o Excel desde una colección vacía de Datablist

En la pantalla de revisión de la importación, compruebe los nombres de las columnas y asegúrese de que los campos de texto útiles se importen como campos de texto. En mi ejemplo, me interesan Headline y Bio. No utilizo Full Name, Company ni Profile ID para detectar el idioma porque ofrecen muy pocas señales lingüísticas.

Revisar el CSV de perfiles multilingües antes de importarlo
Revisar el CSV de perfiles multilingües antes de importarlo

Mantenga intactas las columnas de texto originales. Normalmente añado columnas de salida nuevas en lugar de sobrescribir los datos de origen, ya que así resulta más fácil revisarlos. Si un resultado parece extraño, podrá compararlo de inmediato con el texto original.

💡 Conserve una columna de ID estable

Si más adelante necesita volver a cargar este archivo en otro sistema, conserve una columna de ID, como Profile ID, el ID del ticket, el SKU del producto o el ID del registro en el CRM. Así, la exportación y la correspondencia de registros serán más seguras.

Paso 2: seleccione el enrichment de detección de idioma

Una vez importado el dataset, abra el menú Enrich y busque la detección de idioma. Seleccione Detect Language from a Text enrichment.

Seleccionar Detect Language from a Text enrichment
Seleccionar Detect Language from a Text enrichment

Este enrichment procesa las filas una a una. Para cada elemento, lee el texto de entrada y devuelve:

  • Language Name, como English, French, Spanish o German.
  • Language Code, como en, fr, es o de.
  • Language Confidence, como High, Medium, Low o Very Low.

Este es el formato de resultados que busco para trabajar con hojas de cálculo. El nombre del idioma es fácil de leer. El código resulta útil para automatizaciones y herramientas de traducción. El nivel de confianza indica qué registros hay que revisar.

Evite utilizar campos poco representativos, como nombres, ID, nombres de usuario, URL, códigos numéricos o nombres de empresas, como única entrada. A menudo no contienen suficientes señales lingüísticas. Si el dataset incluye textos cortos, seleccione un segundo campo de texto antes de ejecutar el enrichment.

Paso 3: configure las entradas y salidas

En el paso Inputs, elija el texto que debe analizar Datablist. Puede seleccionar una propiedad o crear una entrada personalizada a partir de varias propiedades.

Para el dataset de perfiles, utilizo una entrada personalizada con Headline y Bio. Esto es importante porque algunas filas tienen una biografía corta, otras incluyen un titular útil y unas pocas están desordenadas. Al combinar ambos campos, el detector obtiene más contexto sin que usted tenga que añadir manualmente otra columna.

Elegir entre un campo de texto o una entrada personalizada para detectar el idioma
Elegir entre un campo de texto o una entrada personalizada para detectar el idioma
Seleccionar Headline y Bio como entradas para detectar el idioma
Seleccionar Headline y Bio como entradas para detectar el idioma

A continuación, configure las columnas de salida. Normalmente creo columnas nuevas para:

  • Language Name
  • Language Code
  • Language Confidence

Una columna con el estado de ejecución permite aislar las filas que han fallado, contenían una entrada no válida o no han devuelto resultados.

Configurar las columnas de nombre, código y confianza del idioma
Configurar las columnas de nombre, código y confianza del idioma

Antes de procesar todo el archivo, ejecute el enrichment en las primeras 10 filas. Sigo haciéndolo incluso en workflows sencillos porque permite detectar rápidamente una asignación incorrecta de las entradas. Si selecciona Company por error en lugar de Bio, verá que los resultados son deficientes antes de gastar créditos en todo el dataset.

⚠️ Los textos cortos son más difíciles

Los fragmentos de una palabra, marcas, nombres de usuario, números y URL pueden no contener suficientes señales lingüísticas. Considere las filas con confianza baja o sin resultados como una cola de revisión, no como errores.

Cuando los resultados de la primera ejecución sean correctos, procese las filas restantes.

Paso 4: revise los idiomas detectados

La primera ejecución de prueba debería mostrar las nuevas columnas de idioma junto a los datos originales. En el siguiente ejemplo, Datablist ha detectado inglés, francés, español, alemán, italiano, portugués, neerlandés, japonés, árabe y chino en las primeras filas.

Revisar los primeros 10 resultados antes de procesar todo el archivo
Revisar los primeros 10 resultados antes de procesar todo el archivo

Puede esperar una tabla de resultados similar a esta:

ID del perfilPatrón del textoLanguage NameLanguage CodeConfianzaRequiere revisión
C8C1DXQBNPBiografía en inglésEnglishenAltaNo
61M25JUEHMBiografía en francésFrenchfrMediaTal vez
Y45G9QU71CBiografía en españolSpanishesAltaNo
RL20HHREOTBiografía en alemánGermandeAltaNo
fila vacíaBiografía vacía y titular poco representativoSin resultado o no válidovacíovacíoSí
fila solo con nombre de usuario@marketloopSin resultado o confianza bajavacíoBajaSí

No considero el nivel de confianza como una decisión de negocio definitiva, sino como una señal de enrutamiento. High y Medium suelen ser suficientes cuando el siguiente paso es preparar una traducción o realizar una segmentación general. Las filas Low, Very Low, no válidas o sin resultados deben revisarse antes de enviar emails, asignar tickets de soporte o actualizar un CRM.

📘 La confianza agiliza la revisión

El nivel de confianza no sustituye su criterio. Le indica dónde debe centrar primero su atención.

Si la precisión es importante, cree una columna Needs Review después de ejecutar el enrichment. Márquela como Yes cuando la confianza sea Low o Very Low, la entrada no sea válida o Datablist no devuelva resultados. Así convertirá la parte desordenada del dataset en una pequeña cola de trabajo.

La detección de idioma es un buen ejemplo de clasificación con IA: cada fila se asigna a una clase y el nivel de confianza le ayuda a decidir cuáles pueden avanzar.

Paso 5: filtre, exporte o continúe con la traducción

Cuando las columnas de idioma estén completas, filtre el dataset antes de exportarlo o de ejecutar el siguiente workflow.

Empiece por el nivel de confianza. Abra el menú de la columna Language Confidence y filtre las filas con confianza baja. Revíselas primero, ya que son las que más probablemente contienen texto vacío, fragmentos cortos, contenido en varios idiomas o valores que no representan un idioma.

Abrir el filtro de la columna Language Confidence
Abrir el filtro de la columna Language Confidence
Filtrar resultados con baja confianza para revisarlos
Filtrar resultados con baja confianza para revisarlos

Después, filtre por Language Code cuando necesite segmentos específicos para cada idioma. Por ejemplo:

  • Envíe las filas fr, es, de e it a traducción.
  • Dirija los tickets de soporte ja y zh al equipo adecuado.
  • Conserve únicamente las filas en inglés para una campaña.
  • Elimine las filas no válidas antes de importar el archivo en un CRM.

Si el siguiente paso es traducir, utilice el código de idioma para preparar el archivo antes de traducir archivos CSV online. Cuando un archivo mezcla idiomas, normalmente prefiero detectar primero el idioma de origen. Así evita traducir filas que ya están en el idioma de destino y la revisión resulta más predecible.

Cuando el dataset esté limpio, expórtelo a CSV o Excel. Conserve el texto original, el nombre y el código del idioma, el nivel de confianza y los campos de revisión. Esas columnas permitirán explicar más adelante por qué una fila se envió a traducción, enrutamiento o revisión manual.

Coste: créditos fijos por fila

Detect Language from a Text enrichment cuesta 0.05 créditos por fila. El precio se fija según el número de filas. No cambia porque una fila contenga un titular corto y otra incluya un ticket de soporte largo, una descripción de producto, una reseña o el extracto de una página obtenida mediante scraping.

Si tomamos como referencia la recarga inicial de Datablist de 20 000 créditos por 20 $, cada crédito cuesta 0,001 $. Estos serían los costes aproximados:

FilasCréditos utilizadosCoste aproximado
1.00050 créditos0,05 $
10.000500 créditos0,50 $
100.0005.000 créditos5,00 $

Esta es una de las razones por las que utilizo el enrichment específico antes de probar ChatGPT. El precio de ChatGPT/OpenAI depende de los tokens de entrada y salida. Procesar una biografía corta con un LLM es barato, pero los tickets largos, las descripciones de productos, las reseñas y el texto de páginas cuestan más porque contienen más tokens. Con el enrichment de detección de idioma, cada fila cuesta 0.05 créditos, independientemente de la cantidad de texto que envíe.

Los nuevos usuarios también pueden probar este workflow con 500 créditos gratuitos si se registran con una dirección de email de un dominio empresarial. A 0.05 créditos por fila, esos 500 créditos permiten realizar 10.000 detecciones de idioma.

Alternativa: utilice ChatGPT para reglas personalizadas

La detección de idioma convencional no suele necesitar un LLM. El enrichment específico es la mejor opción para empezar porque su salida es fija: nombre del idioma, código y nivel de confianza. Además, ofrece un coste predecible por fila, mientras que el coste de ChatGPT/OpenAI depende del volumen de tokens.

Utilice ChatGPT u OpenAI cuando el resultado dependa de reglas de negocio. Por ejemplo, puede querer:

  • Etiquetar las filas multilingües como Mixed en lugar de elegir un idioma principal.
  • Combinar la detección de idioma con una clasificación de la intención del cliente.
  • Añadir un campo Needs Review según sus propios umbrales.
  • Incluir un breve motivo de auditoría para las filas ambiguas.
  • Tratar de una forma específica las variantes regionales o los nombres de productos.

Datablist puede ejecutar prompts de ChatGPT en filas de CSV o Excel con Ask ChatGPT/OpenAI enrichment. Utilice variables de prompt para insertar en el prompt los valores de cada fila.

Este es un prompt sencillo para el mismo dataset de perfiles:

Detecte el idioma principal de este texto.

Texto:
{{Bio}}

Si el texto está vacío, contiene principalmente números, es una URL o resulta demasiado corto para decidirlo, devuelva "No result" y marque Needs review como Yes.

Utilice salidas definidas:

Nombre de la salidaTipoInstrucciones
Language nameTextoIdioma principal de la biografía o el titular. Devuelva No result cuando no haya suficientes señales lingüísticas.
ISO 639-1 codeTextoCódigo de dos letras, como en, fr, es o de. Déjelo vacío si no hay resultados.
ConfidenceSelección o textoHigh, Medium o Low.
Needs reviewSelección o textoYes si el texto está vacío, es ambiguo, mezcla idiomas o presenta una confianza baja. En caso contrario, No.
ReasonTextoNota breve opcional para workflows de auditoría. Omítala si solo necesita etiquetas.

🔍 Utilice ChatGPT para reglas, no para detecciones rutinarias

Si la salida requiere un criterio adicional a «¿en qué idioma está?», ChatGPT resulta útil. Si solo necesita códigos de idioma, utilice el enrichment específico.

El error más habitual es pedir a ChatGPT que devuelva un párrafo. Esto genera trabajo adicional de limpieza. Guarde cada salida en su propia columna para poder filtrar, ordenar, exportar y reutilizar los datos.

Checklist de control de calidad

Antes de utilizar el archivo enriquecido, suelo comprobar estas filas:

  • Entre 20 y 50 filas aleatorias de varios idiomas detectados.
  • Filas con confianza Low o Very Low.
  • Filas con entradas no válidas o sin resultados.
  • Biografías cortas, nombres de usuario, URL, números y textos que solo contienen el nombre de una empresa.
  • Filas multilingües en las que el «idioma principal» puede ser subjetivo.
  • Códigos ISO esperados por la siguiente herramienta.

El umbral adecuado depende del workflow. La preparación de traducciones puede admitir una pequeña cola de revisión manual. El enrutamiento de soporte al cliente exige más cuidado, ya que un idioma incorrecto puede enviar un ticket a la persona equivocada. La segmentación para Outbound también requiere revisión: enviar un mensaje en el idioma equivocado transmite una imagen poco profesional.

Para la mayoría de los archivos, la vía más rápida es sencilla: confíe en High, compruebe Medium cuando el texto sea corto y revise las filas Low, Very Low, no válidas o sin resultados.

Casos de uso y variantes

Los equipos de soporte pueden detectar el idioma de los tickets antes de dirigirlos al agente adecuado. Resulta útil cuando una misma bandeja de entrada recibe mensajes de varios países y el equipo necesita una primera clasificación rápida.

Los equipos de encuestas pueden detectar el idioma de las respuestas abiertas antes de analizarlas. Recomiendo hacerlo antes de traducirlas para mantener organizados los datos de origen.

Los equipos comerciales y de selección pueden segmentar las biografías de perfiles antes de iniciar acciones de Outbound. Una columna con el código del idioma facilita la asignación de responsables y la preparación de mensajes localizados.

Los equipos de ecommerce pueden detectar el idioma de las descripciones de productos antes de localizarlas. Si un catálogo combina contenido de distintos proveedores, la detección permite separar lo que debe traducirse de lo que ya está listo.

Los workflows de scraping se benefician del mismo enfoque. Cuando extraiga páginas de varios mercados, detecte el idioma de cada página antes de decidir qué conservar, traducir o descartar.

Si la columna Bio está vacía en muchas filas, ejecute el enrichment en Headline o combine ambos campos en la entrada. Suelo combinar campos cuando cada uno contiene poco texto y utilizar uno solo cuando ya incluye frases completas.

Solución de problemas

Si el texto está vacío, puede esperar datos no válidos o ningún resultado. Filtre esas filas y decida si desea eliminarlas o completar otro campo de texto.

Si la fila solo contiene una URL, un nombre de usuario, un número, un ID o una marca, no confíe automáticamente en el resultado. Esos valores apenas ofrecen señales lingüísticas al detector.

Si la fila mezcla idiomas, interprete el resultado como el idioma principal y revise el nivel de confianza. En workflows estrictos, cree una etiqueta Mixed independiente con ChatGPT o mediante una revisión manual.

Si aparece un idioma poco habitual en el archivo, revise una muestra antes de confiar en los resultados a gran escala. El enrichment admite muchos idiomas comunes, pero comprobar los casos límite antes de exportar sigue siendo la opción más segura.

Si el archivo es grande, procese primero 10 filas y, si es necesario, una muestra mayor. Cuando la asignación de entradas y las columnas de salida sean correctas, ejecute el proceso en todo el dataset.

Conclusión

La forma práctica de detectar idiomas en una hoja de cálculo es mantener un workflow basado en filas. Importe el archivo CSV o Excel, seleccione Detect Language from a Text, elija una o varias columnas de texto, cree salidas para el nombre y el código del idioma y el nivel de confianza, y revise las filas con baja confianza antes de exportar.

Utilice el enrichment específico para la detección de idioma habitual. Obtendrá las columnas que necesita sin escribir código ni crear un prompt personalizado, y el coste se mantendrá fijo según el número de filas. Recurra a ChatGPT cuando necesite reglas de negocio, etiquetas para contenido multilingüe o lógica de revisión adicional.

Empiece con una pequeña prueba, revise los resultados y, después, procese todo el archivo. Esta sencilla comprobación suele ahorrar mucho más tiempo del que requiere.

FAQ

¿Cómo detectar el idioma de cada fila de un CSV?

Importe el CSV en Datablist, seleccione Detect Language from a Text en el menú Enrich, asigne la columna de texto en el paso Inputs y guarde el nombre del idioma, el código y el nivel de confianza en columnas nuevas.

¿Puedo detectar idiomas en filas de Excel sin programar?

Sí. Importe el archivo Excel en Datablist y ejecute el enrichment de detección de idioma en la columna de texto. Los resultados se añadirán al dataset y podrá exportarlos a CSV o Excel.

¿Qué columnas de salida debo añadir?

Utilice Language Name, Language Code y Language Confidence. Añada una columna Needs Review si quiere aislar las filas Low, Very Low, no válidas o sin resultados.

¿Qué significa el nivel de confianza del idioma?

Indica la fiabilidad probable del idioma detectado. Utilícelo como señal para la revisión. Las filas High y Medium suelen poder avanzar, mientras que Low y Very Low requieren comprobación.

¿Qué hago con los resultados de baja confianza?

Filtre esos resultados para crear una cola de revisión. Compruebe si el texto es demasiado corto, está vacío, mezcla idiomas o se compone de nombres, URL, nombres de usuario o números.

¿Puedo detectar el idioma antes de traducir un CSV multilingüe?

Sí. Detecte primero el idioma de origen y filtre por código de idioma antes de traducir. Así evitará traducir filas que ya están en el idioma de destino.

¿Cuánto cuesta detectar idiomas de forma masiva?

Detect Language from a Text cuesta 0.05 créditos por fila. Con 20.000 créditos por 20 $, el coste aproximado es de 0,05 $ por 1.000 filas, 0,50 $ por 10.000 filas y 5 $ por 100.000 filas. Los nuevos usuarios que se registren con un email de dominio empresarial pueden probarlo con 500 créditos gratuitos, suficientes para 10.000 detecciones.

¿Debo utilizar ChatGPT para detectar idiomas de forma masiva?

Utilice ChatGPT cuando necesite reglas personalizadas o una clasificación combinada. Para una detección de idioma convencional, el enrichment específico es la opción más sencilla y tiene un coste fijo por fila. ChatGPT/OpenAI puede resultar más caro cuando las filas contienen textos largos, ya que el coste de los LLM depende de los tokens.

¿Qué ocurre si el texto está vacío, solo contiene una URL o es demasiado corto?

Un texto vacío no es válido, y un texto sin un idioma claramente identificable puede no devolver resultados o presentar una confianza baja. Filtre esas filas antes de exportarlas o traducirlas.

¿Puedo detectar el idioma a partir del titular en vez de la biografía?

Sí, pero los titulares suelen ser cortos. Si es posible, combine Headline y Bio en la entrada para que Datablist disponga de más texto que analizar.

¿Puedo exportar los nombres y códigos ISO de los idiomas a CSV o Excel?

Sí. Después de ejecutar el enrichment, exporte el dataset con el texto original, el nombre y el código del idioma, el nivel de confianza y los campos de revisión.