Si vous devez détecter la langue de chaque ligne d’un dataset, le workflow le plus propre consiste à ajouter les colonnes de langue directement dans le fichier que vous utilisez déjà. Importez votre fichier CSV ou Excel dans Datablist, lancez la détection sur la colonne de texte, vérifiez les niveaux de confiance, puis exportez le dataset enrichi ou poursuivez avec la traduction, le routage ou la segmentation.

Je préfère cette méthode au copier-coller de lignes dans un chatbot, car les résultats restent associés à chaque ligne. Vous obtenez le nom de la langue, son code ISO et un niveau de confiance pour chaque enregistrement. La suite devient alors beaucoup plus simple : filtrer les lignes en français, envoyer les lignes en espagnol vers un outil de traduction, vérifier les résultats peu fiables ou supprimer les lignes sans texte exploitable.

Dans ce guide, j’utiliserai un dataset multilingue de profils, mais le même workflow fonctionne avec des tickets de support, des réponses à des enquêtes, des avis, des descriptions de produits, des pages scrapées et des notes CRM.

🔑 Commencez par le détecteur dédié

Si votre seul objectif est de détecter la langue, commencez par l’enrichissement de détection de langue. Utilisez ChatGPT uniquement si vous avez besoin de règles personnalisées ou d’une décision combinant plusieurs critères.

Accès rapide

Réponse rapide

Pour détecter la langue de chaque ligne d’un dataset, importez votre fichier CSV ou Excel dans Datablist, ouvrez le menu Enrich, puis sélectionnez l’enrichissement Detect Language from a Text. À l’étape Inputs, choisissez la colonne de texte à analyser. Datablist inscrit le nom de la langue détectée, son code et le niveau de confiance dans de nouvelles colonnes, pour un tarif fixe de 0.05 crédit par ligne.

L’étape essentielle reste la vérification. La détection de langue est une tâche de classification : le niveau de confiance vous indique quelles lignes peuvent poursuivre le workflow et lesquelles méritent un second examen. Les lignes associées à une confiance élevée peuvent généralement passer à l’étape suivante. Les lignes peu fiables, invalides ou sans résultat doivent être filtrées avant l’export.

J’utilise ce workflow lorsque les résultats doivent rester associés aux lignes d’origine. Une formule de tableur peut suffire dans les cas simples, mais elle montre vite ses limites face aux textes multilingues, aux extraits courts, aux cellules vides et aux exports imparfaits. Un chatbot peut analyser quelques exemples, mais il ne vous fournit pas un dataset propre avec un résultat par ligne.

Exemple de dataset

Pour cette démonstration, j’utilise un CSV de profils issus des réseaux sociaux. Il contient cinq colonnes :

ID du profilNom completTitreBioEntreprise
C8C1DXQBNPMaya CollinsFondatrice d’outils d’analyse pour les équipes clientJ’aide les équipes commerciales à nettoyer leurs listes de leads...Northstar Labs
61M25JUEHMLucas BernardResponsable support client pour une marketplaceJe construis des workflows simples...Market Loop
Y45G9QU71CSofia RomeroEspecialista en CRM y automatizacion comercialConsultora de operaciones enfocada...Talent Desk
RL20HHREOTFelix WagnerTech Recruiter fuer ProduktteamsIch helfe Teams dabei...Cleanbase
TT384W44MWAoi Nakamura営業チーム向けCRMコンサルタント多言語の問い合わせを分類...Northstar Labs

Le fichier ne contient volontairement aucune colonne de langue. Je veux que Datablist ajoute cette information, et non qu’il confirme une étiquette déjà présente.

Le dataset comprend aussi des lignes imparfaites : bios vides, titres courts, noms d’entreprises, handles, URL, nombres et extraits mêlant plusieurs langues. J’aime utiliser ce type de fichier, car il montre ce qui se passe en dehors des exemples parfaits d’une démonstration. Les véritables exports contiennent toujours quelques lignes à vérifier.

Dataset multilingue de profils importé dans Datablist
Dataset multilingue de profils importé dans Datablist

Dans cet exemple, j’utilise à la fois Headline et Bio comme signaux linguistiques. Si votre dataset contient de longs tickets de support ou des descriptions de produits dans une seule colonne, une colonne d’entrée suffit. Lorsque chaque ligne comporte plusieurs champs courts, combiner deux colonnes de texte donne généralement davantage de contexte au détecteur.

Étape 1 : importer le fichier CSV ou Excel

Commencez avec un fichier CSV ou Excel comportant un enregistrement par ligne et au moins une colonne de texte. Ouvrez Datablist, créez une collection et importez le fichier. Vous pouvez utiliser l’éditeur CSV de Datablist pour ce workflow.

Importation d’un fichier CSV ou Excel dans une collection Datablist vide
Importation d’un fichier CSV ou Excel dans une collection Datablist vide

Sur l’écran de vérification de l’import, contrôlez le nom des colonnes et assurez-vous que les champs utiles sont bien importés comme champs texte. Dans mon exemple, je m’intéresse à Headline et Bio. Je n’utilise pas Full Name, Company ni Profile ID pour la détection, car ces champs fournissent peu d’indices linguistiques.

Vérification du CSV multilingue de profils avant son import
Vérification du CSV multilingue de profils avant son import

Conservez les colonnes de texte d’origine sans les modifier. Je préfère généralement ajouter de nouvelles colonnes de sortie plutôt que d’écraser les données sources, car cela facilite la vérification. Si un résultat paraît étrange, vous pouvez immédiatement le comparer au texte d’origine.

💡 Conservez une colonne d’identifiant stable

Si ce fichier doit ensuite être réimporté dans un autre système, conservez une colonne d’identifiant comme Profile ID, l’ID du ticket, la référence SKU du produit ou l’ID de l’enregistrement CRM. L’export et la mise en correspondance seront ainsi plus fiables.

Étape 2 : sélectionner l’enrichissement de détection de langue

Une fois le dataset importé, ouvrez le menu Enrich et recherchez la détection de langue. Sélectionnez l’enrichissement Detect Language from a Text.

Sélection de l’enrichissement Detect Language from a Text
Sélection de l’enrichissement Detect Language from a Text

Cet enrichissement traite les données ligne par ligne. Pour chaque élément, il lit le texte d’entrée et renvoie :

  • Language Name, par exemple English, French, Spanish ou German.
  • Language Code, par exemple en, fr, es ou de.
  • Language Confidence, par exemple High, Medium, Low ou Very Low.

C’est exactement le format de résultat dont j’ai besoin pour travailler dans un tableur. Le nom de la langue est facile à lire. Le code sert aux automatisations et aux outils de traduction. Le niveau de confiance indique les lignes à vérifier.

Évitez d’utiliser comme seule entrée des champs peu pertinents tels que les noms, identifiants, usernames, URL, codes numériques ou noms d’entreprises. Ils contiennent rarement assez d’indices linguistiques. Si le dataset comporte des textes courts, sélectionnez un deuxième champ texte avant de lancer l’enrichissement.

Étape 3 : configurer les entrées et les sorties

À l’étape Inputs, choisissez le texte que Datablist doit analyser. Vous pouvez sélectionner une propriété ou créer une entrée personnalisée à partir de plusieurs propriétés.

Pour le dataset de profils, je crée une entrée personnalisée avec Headline et Bio. C’est important, car certaines lignes ont une bio courte, d’autres un titre exploitable, et quelques-unes contiennent des données imparfaites. La combinaison des deux champs donne davantage de contexte au détecteur sans vous obliger à ajouter manuellement une colonne.

Choix entre un champ texte unique et une entrée personnalisée pour la détection
Choix entre un champ texte unique et une entrée personnalisée pour la détection
Sélection de Headline et Bio comme entrées de la détection de langue
Sélection de Headline et Bio comme entrées de la détection de langue

Configurez ensuite les colonnes de sortie. Je crée généralement de nouvelles colonnes pour :

  • Language Name
  • Language Code
  • Language Confidence

Une colonne indiquant le statut d’exécution permet d’isoler les lignes qui ont échoué, contenaient une entrée invalide ou n’ont produit aucun résultat.

Configuration des colonnes de sortie pour le nom, le code et le niveau de confiance
Configuration des colonnes de sortie pour le nom, le code et le niveau de confiance

Avant de traiter l’ensemble du fichier, lancez l’enrichissement sur les 10 premières lignes. Je le fais même pour les workflows simples, car ce test permet de repérer rapidement une mauvaise correspondance des entrées. Si vous sélectionnez accidentellement Company au lieu de Bio, vous constaterez la mauvaise qualité des résultats avant de dépenser des crédits sur tout le dataset.

⚠️ Les textes courts sont plus difficiles à analyser

Un seul mot, un nom de marque, un handle, un nombre ou une URL ne contient pas toujours assez d’indices linguistiques. Considérez les lignes peu fiables ou sans résultat comme une file de vérification, et non comme des échecs.

Lorsque les résultats du premier test vous conviennent, traitez les lignes restantes.

Étape 4 : vérifier les langues détectées

Le premier test doit afficher les nouvelles colonnes de langue à côté de vos données d’origine. Dans l’exemple ci-dessous, Datablist a détecté de l’anglais, du français, de l’espagnol, de l’allemand, de l’italien, du portugais, du néerlandais, du japonais, de l’arabe et du chinois dans les premières lignes.

Vérification des 10 premiers résultats avant de traiter tout le fichier
Vérification des 10 premiers résultats avant de traiter tout le fichier

Voici le type de tableau de résultats auquel vous pouvez vous attendre :

ID du profilType de texteNom de la langueCode de langueConfianceÀ vérifier
C8C1DXQBNPBio en anglaisAnglaisenÉlevéeNon
61M25JUEHMBio en françaisFrançaisfrMoyennePeut-être
Y45G9QU71CBio en espagnolEspagnolesÉlevéeNon
RL20HHREOTBio en allemandAllemanddeÉlevéeNon
ligne videBio vide et titre peu pertinentAucun résultat ou entrée invalidevidevideOui
ligne avec un handle uniquement@marketloopAucun résultat ou confiance faiblevideFaibleOui

Je ne considère pas le niveau de confiance comme une décision métier définitive, mais comme un signal de routage. High et Medium conviennent généralement lorsque l’étape suivante consiste à préparer une traduction ou à effectuer une segmentation générale. Les lignes Low, Very Low, invalides ou sans résultat doivent être vérifiées avant d’envoyer des emails, d’attribuer des tickets de support ou de mettre à jour un CRM.

📘 Le niveau de confiance accélère la vérification

Le niveau de confiance ne remplace pas votre jugement. Il vous indique simplement où porter votre attention en priorité.

Si la précision est importante, créez une colonne Needs Review après l’exécution. Indiquez Yes lorsque le niveau de confiance est Low ou Very Low, lorsque l’entrée est invalide ou lorsque Datablist ne renvoie aucun résultat. Vous transformez ainsi la partie imparfaite du dataset en une petite file de tâches.

La détection de langue est un bon exemple de classification par IA : chaque ligne est affectée à une catégorie, et le niveau de confiance vous aide à décider lesquelles peuvent poursuivre le workflow.

Étape 5 : filtrer, exporter ou poursuivre la traduction

Une fois les colonnes de langue remplies, filtrez le dataset avant de l’exporter ou de lancer le workflow suivant.

Commencez par le niveau de confiance. Ouvrez le menu de la colonne Language Confidence et filtrez les lignes peu fiables. Vérifiez-les en priorité, car ce sont celles qui risquent le plus de contenir du texte vide, de courts extraits, du contenu multilingue ou des valeurs qui ne correspondent pas à une langue.

Ouverture du filtre de la colonne Language Confidence
Ouverture du filtre de la colonne Language Confidence
Filtrage des résultats peu fiables pour vérification
Filtrage des résultats peu fiables pour vérification

Filtrez ensuite les données selon Language Code lorsque vous avez besoin de segments propres à chaque langue. Par exemple :

  • Envoyez les lignes fr, es, de et it vers un outil de traduction.
  • Acheminez les tickets de support ja et zh vers la bonne équipe.
  • Ne conservez que les lignes en anglais pour une campagne donnée.
  • Supprimez les lignes invalides avant d’importer le fichier dans un CRM.

Si l’étape suivante est la traduction, utilisez le code de langue pour préparer le fichier avant de traduire vos fichiers CSV en ligne. Lorsque le fichier contient plusieurs langues, je préfère généralement détecter d’abord la langue source. Vous évitez ainsi de traduire les lignes qui sont déjà dans la langue cible et rendez la vérification plus prévisible.

Lorsque le dataset est propre, exportez-le au format CSV ou Excel. Conservez le texte d’origine, le nom et le code de la langue, le niveau de confiance ainsi que les champs de vérification. Ces colonnes permettront ensuite de comprendre pourquoi une ligne a été envoyée vers la traduction, le routage ou une vérification manuelle.

Coût : un nombre fixe de crédits par ligne

L’enrichissement Detect Language from a Text coûte 0.05 crédit par ligne. Le tarif dépend uniquement du nombre de lignes. Il ne change pas selon qu’une ligne contient un titre court ou un long ticket de support, une description de produit, un avis ou un extrait de page scrapée.

Avec l’offre de recharge Datablist débutant à 20 000 crédits pour 20 $, un crédit revient à 0,001 $. Voici donc une estimation des coûts :

LignesCrédits utilisésCoût approximatif
1 00050 crédits0,05 $
10 000500 crédits0,50 $
100 0005 000 crédits5,00 $

C’est l’une des raisons pour lesquelles j’utilise l’enrichissement dédié avant d’essayer ChatGPT. La tarification de ChatGPT/OpenAI dépend du nombre de tokens en entrée et en sortie. Traiter une courte bio avec un LLM coûte peu, mais les longs tickets, descriptions de produits, avis et contenus de pages coûtent davantage, car ils contiennent plus de tokens. Avec l’enrichissement de détection de langue, chaque ligne coûte 0.05 crédit, quelle que soit la quantité de texte envoyée.

Les nouveaux utilisateurs peuvent également tester ce workflow avec 500 crédits gratuits en s’inscrivant avec une adresse email associée à un domaine professionnel. À raison de 0.05 crédit par ligne, ces 500 crédits couvrent 10 000 détections de langue.

Alternative : utiliser ChatGPT avec des règles personnalisées

Une simple détection de langue ne nécessite généralement pas de LLM. L’enrichissement dédié constitue le meilleur premier choix, car son format de sortie est fixe : nom de la langue, code et niveau de confiance. Son coût par ligne est également prévisible, tandis que celui de ChatGPT/OpenAI dépend du volume de tokens.

Utilisez ChatGPT ou OpenAI lorsque le résultat dépend de règles métier. Vous pouvez par exemple vouloir :

  • Étiqueter les lignes multilingues comme Mixed au lieu de choisir une langue principale.
  • Combiner la détection de langue avec une classification de l’intention du client.
  • Ajouter un champ Needs Review selon vos propres seuils.
  • Renvoyer une brève justification pour auditer les lignes ambiguës.
  • Traiter les variantes régionales ou les noms de produits selon des règles précises.

Datablist peut exécuter des prompts ChatGPT sur les lignes d’un fichier CSV ou Excel avec l’enrichissement Ask ChatGPT/OpenAI. Utilisez des variables de prompt pour insérer les valeurs de chaque ligne dans le prompt.

Voici un prompt simple pour le même dataset de profils :

Détectez la langue principale de ce texte.

Texte :
{{Bio}}

Si le texte est vide, principalement composé de chiffres, correspond à une URL ou est trop court pour trancher, renvoyez "No result" et indiquez Yes dans Needs review.

Utilisez des sorties définies :

Nom de la sortieTypeInstructions
Language nameTextLangue principale de la bio ou du titre. Renvoyez No result lorsque les indices linguistiques sont insuffisants.
ISO 639-1 codeTextCode à deux lettres comme en, fr, es ou de. Laissez ce champ vide en l’absence de résultat.
ConfidenceSelect ou textHigh, Medium ou Low.
Needs reviewSelect ou textYes pour un texte vide, ambigu, multilingue ou associé à une faible confiance. Sinon, No.
ReasonTextCourte note facultative pour les workflows d’audit. Ignorez-la si vous avez uniquement besoin des étiquettes.

🔍 Utilisez ChatGPT pour les règles, pas pour la détection courante

ChatGPT est utile si le résultat exige un jugement qui va au-delà de la question « quelle est cette langue ? ». Si vous avez seulement besoin des codes de langue, conservez l’enrichissement dédié.

L’erreur la plus courante consiste à demander à ChatGPT de renvoyer un paragraphe. Cela ajoute du travail de nettoyage. Enregistrez chaque sortie dans sa propre colonne afin de pouvoir filtrer, trier, exporter et réutiliser les données.

Checklist de contrôle qualité

Avant d’utiliser le fichier enrichi, je vérifie généralement les lignes suivantes :

  • 20 à 50 lignes choisies au hasard parmi plusieurs langues détectées.
  • Les lignes associées à une confiance Low ou Very Low.
  • Les lignes dont l’entrée est invalide ou sans résultat.
  • Les bios courtes, handles, URL, nombres et textes contenant uniquement un nom d’entreprise.
  • Les lignes multilingues pour lesquelles la « langue principale » peut être subjective.
  • Les codes ISO attendus par l’outil suivant.

Le bon seuil dépend du workflow. La préparation d’une traduction peut tolérer une petite file de vérification manuelle. Le routage du support client demande davantage de prudence, car une langue mal détectée risque d’envoyer le ticket à la mauvaise personne. La segmentation Outbound exige également une vérification : envoyer un message dans la mauvaise langue donne une impression de négligence.

Pour la plupart des fichiers, la méthode la plus rapide est simple : faites confiance à High, vérifiez Medium lorsque le texte est court, puis examinez les lignes Low, Very Low, invalides et sans résultat.

Cas d’usage et variantes

Les équipes support peuvent détecter la langue des tickets avant leur routage. C’est utile lorsqu’une même boîte de réception reçoit des messages de plusieurs pays et que l’équipe a besoin d’un premier tri rapide.

Les équipes chargées des enquêtes peuvent détecter la langue des réponses en texte libre avant leur analyse. Je recommande de le faire avant la traduction afin de conserver des données sources bien organisées.

Les équipes commerciales et de recrutement peuvent segmenter les bios des profils avant leurs campagnes Outbound. Une colonne contenant le code de langue facilite l’attribution des responsables et la préparation de messages localisés.

Les équipes e-commerce peuvent détecter la langue des descriptions de produits avant leur localisation. Lorsqu’un catalogue regroupe les contenus de plusieurs fournisseurs, la détection permet de distinguer ce qui doit être traduit de ce qui est déjà prêt.

Les workflows de scraping bénéficient du même principe. Lorsque vous extrayez des pages provenant de plusieurs marchés, détectez leur langue avant de choisir celles à conserver, traduire ou écarter.

Si votre colonne Bio est vide sur de nombreuses lignes, exécutez l’enrichissement sur Headline ou combinez les deux champs en entrée. Je combine généralement les champs lorsqu’ils sont tous courts. Je n’en utilise qu’un seul lorsqu’il contient déjà des phrases complètes.

Résoudre les problèmes courants

Si le texte est vide, attendez-vous à une donnée invalide ou à une absence de résultat. Filtrez ces lignes, puis choisissez de les supprimer ou de renseigner un autre champ texte.

Si la ligne contient uniquement une URL, un handle, un nombre, un ID ou un nom de marque, ne faites pas automatiquement confiance au résultat. Ces valeurs offrent peu d’indices linguistiques au détecteur.

Si la ligne contient plusieurs langues, considérez le résultat comme la langue principale et vérifiez le niveau de confiance. Pour les workflows stricts, créez une étiquette Mixed distincte avec ChatGPT ou à l’aide d’une vérification manuelle.

Si une langue peu courante apparaît dans votre fichier, vérifiez un échantillon avant de vous fier aux résultats à grande échelle. L’enrichissement prend en charge de nombreuses langues courantes, mais la meilleure pratique reste d’examiner les cas limites avant l’export.

Si le fichier est volumineux, traitez d’abord les 10 premières lignes, puis un échantillon plus large si nécessaire. Une fois la correspondance des entrées et les colonnes de sortie validées, lancez le traitement de tout le dataset.

Conclusion

La méthode la plus pratique pour détecter les langues dans un tableur consiste à conserver un workflow ligne par ligne. Importez le fichier CSV ou Excel, sélectionnez Detect Language from a Text, choisissez la ou les colonnes de texte, créez les sorties pour le nom, le code et le niveau de confiance, puis vérifiez les lignes peu fiables avant l’export.

Utilisez l’enrichissement dédié pour une détection de langue classique. Il vous fournit les colonnes nécessaires sans écrire de code ni créer de prompt personnalisé, avec un coût fixe par ligne. Réservez ChatGPT aux règles métier, aux étiquettes de contenu multilingue et aux logiques de vérification supplémentaires.

Commencez par un petit test, examinez les résultats, puis traitez l’ensemble du fichier. Ce simple contrôle vous fera généralement gagner bien plus de temps qu’il n’en demande.

FAQ

Comment détecter la langue de chaque ligne d’un fichier CSV ?

Importez le CSV dans Datablist, sélectionnez Detect Language from a Text dans le menu Enrich, associez la colonne de texte à l’étape Inputs, puis enregistrez le nom de la langue, son code et le niveau de confiance dans de nouvelles colonnes.

Peut-on détecter les langues dans Excel sans écrire de code ?

Oui. Importez le fichier Excel dans Datablist et lancez l’enrichissement de détection de langue sur la colonne de texte. Les résultats sont ajoutés au dataset, que vous pouvez ensuite exporter au format CSV ou Excel.

Quelles colonnes de sortie faut-il ajouter ?

Utilisez Language Name, Language Code et Language Confidence. Ajoutez une colonne Needs Review si vous souhaitez isoler les lignes Low, Very Low, invalides ou sans résultat.

Que signifie le niveau de confiance linguistique ?

Le niveau de confiance indique la fiabilité probable de la langue détectée. Utilisez-le comme signal de vérification. Les résultats High et Medium peuvent généralement poursuivre le workflow, tandis que Low et Very Low méritent un examen.

Que faire des résultats associés à une faible confiance ?

Regroupez-les dans une file de vérification. Contrôlez si le texte est trop court, vide, multilingue ou uniquement composé de noms, d’URL, de handles ou de nombres.

Peut-on détecter la langue avant de traduire un CSV multilingue ?

Oui. Détectez d’abord la langue source, puis filtrez les lignes par code de langue avant la traduction. Vous éviterez ainsi de traduire les lignes qui sont déjà dans la langue cible.

Combien coûte la détection de langue en masse ?

Detect Language from a Text coûte 0.05 crédit par ligne. Avec 20 000 crédits pour 20 $, comptez environ 0,05 $ pour 1 000 lignes, 0,50 $ pour 10 000 lignes et 5 $ pour 100 000 lignes. Les nouveaux utilisateurs disposant d’une adresse email professionnelle peuvent tester la fonctionnalité avec 500 crédits gratuits, soit 10 000 détections.

Faut-il utiliser ChatGPT pour détecter les langues en masse ?

Utilisez ChatGPT si vous avez besoin de règles personnalisées ou d’une classification combinée. Pour une simple détection de langue, l’enrichissement dédié est plus simple et son coût par ligne est fixe. ChatGPT/OpenAI peut devenir plus cher lorsque les lignes contiennent de longs textes, car le coût des LLM dépend du nombre de tokens.

Que se passe-t-il si le texte est vide, trop court ou contient seulement une URL ?

Un texte vide est invalide, tandis qu’un texte sans indice linguistique clair peut ne produire aucun résultat ou être associé à une faible confiance. Filtrez ces lignes avant l’export ou la traduction.

Peut-on détecter la langue avec le titre d’un profil plutôt que sa bio ?

Oui, mais les titres sont souvent courts. Si possible, combinez Headline et Bio en entrée afin de fournir davantage de texte à Datablist.

Peut-on réexporter les noms et codes ISO des langues vers CSV ou Excel ?

Oui. Une fois l’enrichissement terminé, exportez le dataset avec le texte d’origine, le nom et le code de la langue, le niveau de confiance ainsi que les champs de vérification.