Se devi rilevare la lingua di ogni riga di un dataset, il flusso di lavoro più semplice consiste nell'aggiungere le colonne relative alla lingua direttamente al file che già utilizzi. Importa il file CSV o Excel in Datablist, esegui il rilevamento sulla colonna di testo, controlla i livelli di confidenza, quindi esporta il dataset arricchito oppure prosegui con traduzione, routing o segmentazione.

Preferisco questo metodo rispetto a copiare le righe in un chatbot, perché i risultati rimangono associati alle singole righe. Per ognuna ottieni il nome della lingua, il codice ISO e un livello di confidenza. Il passaggio successivo diventa così molto più semplice: puoi filtrare le righe in francese, inviare quelle in spagnolo alla traduzione, verificare i risultati con confidenza bassa o rimuovere le righe prive di testo utilizzabile.

In questa guida userò un dataset multilingue di profili, ma lo stesso flusso funziona anche per ticket di assistenza, risposte ai sondaggi, recensioni, descrizioni di prodotti, pagine estratte tramite scraping e note del CRM.

🔑 Inizia dal rilevatore dedicato

Se devi soltanto identificare la lingua, parti dall'enrichment per il rilevamento della lingua. Usa ChatGPT solo quando servono regole personalizzate o una decisione combinata.

Risposta rapida

Per rilevare la lingua di ogni riga di un dataset, importa il file CSV o Excel in Datablist, apri il menu Enrich e seleziona l'enrichment Detect Language from a Text. Nel passaggio Inputs, scegli la colonna di testo da analizzare. Datablist inserisce il nome della lingua rilevata, il relativo codice e il livello di confidenza in nuove colonne, al prezzo fisso di 0.05 crediti per riga.

La verifica è il passaggio fondamentale. Il rilevamento della lingua è un'attività di classificazione e il livello di confidenza indica quali righe possono proseguire nel workflow e quali richiedono un controllo. In genere, le righe con confidenza alta possono passare alla fase successiva. Quelle con confidenza bassa, input non valido o nessun risultato dovrebbero essere filtrate prima dell'esportazione.

Uso questo flusso quando i risultati devono rimanere associati alle righe originali. Una formula di foglio di calcolo può essere utile nei casi più semplici, ma tende a non funzionare bene con testi in più lingue, frammenti brevi, celle vuote ed esportazioni poco pulite. Un chatbot può analizzare qualche esempio, ma non restituisce un dataset ordinato con un risultato per ogni riga.

Dataset di esempio

Per la demo utilizzo un CSV con profili social. Contiene cinque colonne:

Profile IDFull NameHeadlineBioCompany
C8C1DXQBNPMaya CollinsFounder che sviluppa strumenti di analytics per i team customerAiuto i team sales a ripulire liste di lead disordinate...Northstar Labs
61M25JUEHMLucas BernardResponsabile dell'assistenza clienti per un marketplaceCreo workflow semplici...Market Loop
Y45G9QU71CSofia RomeroSpecialista in CRM e automazione commercialeConsulente operations specializzata...Talent Desk
RL20HHREOTFelix WagnerTech Recruiter per team di prodottoAiuto i team a...Cleanbase
TT384W44MWAoi NakamuraConsulente CRM per team commercialiClassifico le richieste multilingue...Northstar Labs

Il file non contiene intenzionalmente una colonna dedicata alla lingua. Voglio che sia Datablist ad aggiungere questa informazione, non che confermi un'etichetta già presente.

Il dataset include anche righe poco pulite: bio vuote, headline brevi, nomi di aziende, handle, URL, numeri e frammenti in più lingue. Mi piace usare file di questo tipo perché mostrano cosa succede al di fuori delle righe perfette di una demo. Le esportazioni reali contengono sempre qualche riga da verificare.

Dataset multilingue di profili importato in Datablist
Dataset multilingue di profili importato in Datablist

In questo esempio uso sia Headline sia Bio come segnali per identificare la lingua. Se il dataset contiene ticket di assistenza lunghi o descrizioni di prodotti in un'unica colonna, basta una sola colonna di input. Se invece ogni riga contiene campi brevi, combinare due colonne di testo offre solitamente più contesto al rilevatore.

Passaggio 1: importa il file CSV o Excel

Parti da un file CSV o Excel con una riga per ogni record e almeno una colonna di testo. Apri Datablist, crea una collection e importa il file. Per questo workflow puoi usare l'editor CSV di Datablist.

Importazione di un file CSV o Excel da una collection Datablist vuota
Importazione di un file CSV o Excel da una collection Datablist vuota

Nella schermata di verifica dell'importazione, controlla i nomi delle colonne e assicurati che i campi utili siano importati come campi di testo. Nel mio esempio mi interessano Headline e Bio. Non uso Full Name, Company o Profile ID per il rilevamento, perché offrono segnali linguistici deboli.

Verifica del CSV multilingue prima dell'importazione
Verifica del CSV multilingue prima dell'importazione

Mantieni inalterate le colonne di testo originali. Di solito aggiungo nuove colonne di output invece di sovrascrivere i dati di origine, perché semplifica la verifica. Se un risultato sembra strano, puoi confrontarlo subito con il testo originale.

💡 Mantieni una colonna ID stabile

Se in seguito il file deve essere reimportato in un altro sistema, conserva una colonna ID, come Profile ID, ID del ticket, SKU del prodotto o ID del record CRM. In questo modo esportazione e associazione dei dati sono più sicure.

Passaggio 2: seleziona l'enrichment per la lingua

Dopo aver importato il dataset, apri il menu Enrich e cerca il rilevamento della lingua. Seleziona l'enrichment Detect Language from a Text.

Selezione dell'enrichment Detect Language from a Text
Selezione dell'enrichment Detect Language from a Text

Questo enrichment elabora una riga alla volta. Per ciascun elemento legge il testo di input e restituisce:

  • Language Name, per esempio English, French, Spanish o German.
  • Language Code, per esempio en, fr, es o de.
  • Language Confidence, per esempio High, Medium, Low o Very Low.

È esattamente il formato che cerco quando lavoro con un foglio di calcolo. Il nome della lingua è facile da leggere. Il codice è utile per le automazioni e gli strumenti di traduzione. La confidenza indica quali righe controllare.

Evita di usare come unico input campi deboli, come nomi, ID, username, URL, codici numerici o nomi di aziende. Spesso non contengono segnali linguistici sufficienti. Se il dataset contiene testi brevi, seleziona un secondo campo di testo prima di avviare l'enrichment.

Passaggio 3: configura input e output

Nel passaggio Inputs, scegli il testo che Datablist deve analizzare. Puoi selezionare una property oppure creare un input personalizzato combinando più property.

Per il dataset dei profili uso un input personalizzato con Headline e Bio. È importante perché alcune righe hanno una bio breve, altre un'headline significativa e qualcuna contiene dati poco puliti. Combinare entrambi i campi offre più contesto al rilevatore senza dover aggiungere manualmente una nuova colonna.

Scelta tra un singolo campo di testo e un input personalizzato
Scelta tra un singolo campo di testo e un input personalizzato
Selezione di Headline e Bio come input per il rilevamento
Selezione di Headline e Bio come input per il rilevamento

Configura quindi le colonne di output. Di solito creo nuove colonne per:

  • Language Name
  • Language Code
  • Language Confidence

Una colonna con lo stato dell'esecuzione aiuta a isolare le righe non elaborate, con input non valido o senza risultati.

Configurazione delle colonne per lingua, codice e confidenza
Configurazione delle colonne per lingua, codice e confidenza

Prima di elaborare l'intero file, esegui l'enrichment sulle prime 10 righe. Lo faccio anche nei workflow più semplici, perché permette di individuare rapidamente un'associazione errata degli input. Se selezioni per sbaglio Company al posto di Bio, vedrai risultati scadenti prima di spendere crediti sull'intero dataset.

⚠️ I testi brevi sono più difficili

Frammenti di una sola parola, nomi di brand, handle, numeri e URL potrebbero non contenere segnali linguistici sufficienti. Considera le righe con confidenza bassa o senza risultato come una coda da verificare, non come errori.

Se la prima esecuzione restituisce buoni risultati, elabora le righe rimanenti.

Passaggio 4: verifica le lingue rilevate

La prima esecuzione di anteprima dovrebbe mostrare le nuove colonne relative alla lingua accanto ai dati originali. Nell'esempio seguente, nelle prime righe Datablist ha rilevato inglese, francese, spagnolo, tedesco, italiano, portoghese, olandese, giapponese, arabo e cinese.

Verifica dei primi 10 risultati prima di elaborare tutto il file
Verifica dei primi 10 risultati prima di elaborare tutto il file

Ecco il tipo di tabella dei risultati che puoi aspettarti:

Profile IDTipo di testoLanguage NameLanguage CodeConfidenzaDa verificare
C8C1DXQBNPBio in ingleseEnglishenHighNo
61M25JUEHMBio in franceseFrenchfrMediumForse
Y45G9QU71CBio in spagnoloSpanishesHighNo
RL20HHREOTBio in tedescoGermandeHighNo
riga vuotaBio vuota e headline poco significativaNessun risultato o input non validovuotovuotoSì
riga con solo handle@marketloopNessun risultato o confidenza bassavuotoLowSì

Non considero la confidenza come una decisione di business definitiva, ma come un segnale per il routing. High e Medium sono solitamente sufficienti quando il passaggio successivo consiste nella preparazione alla traduzione o in una segmentazione generale. Le righe Low, Very Low, con input non valido o senza risultato dovrebbero essere controllate prima di inviare email, assegnare ticket di assistenza o aggiornare un CRM.

📘 La confidenza accelera la verifica

La confidenza non sostituisce il giudizio. Ti indica soltanto dove concentrare prima l'attenzione.

Se l'accuratezza è importante, dopo l'esecuzione crea una semplice colonna Needs Review. Impostala su Yes quando la confidenza è Low o Very Low, quando l'input non è valido o quando Datablist non restituisce risultati. In questo modo, la parte meno pulita del dataset diventa una piccola coda di lavoro.

Il rilevamento della lingua è un buon esempio di classificazione AI: ogni riga viene assegnata a una classe e la confidenza aiuta a decidere quali dati possono proseguire.

Passaggio 5: filtra, esporta o continua con la traduzione

Dopo aver compilato le colonne relative alla lingua, filtra il dataset prima di esportarlo o avviare il workflow successivo.

Inizia dalla confidenza. Apri il menu della colonna Language Confidence e filtra le righe con confidenza bassa. Controllale per prime, perché hanno maggiori probabilità di contenere testo vuoto, frammenti brevi, contenuti in più lingue o valori non linguistici.

Apertura del filtro della colonna Language Confidence
Apertura del filtro della colonna Language Confidence
Filtro dei risultati con confidenza bassa da verificare
Filtro dei risultati con confidenza bassa da verificare

Filtra poi per Language Code quando ti servono segmenti specifici per lingua. Per esempio:

  • Invia alla traduzione le righe fr, es, de e it.
  • Assegna i ticket di assistenza ja e zh al team giusto.
  • Mantieni soltanto le righe in inglese per una campagna.
  • Rimuovi le righe non valide prima di importare il file in un CRM.

Se il passaggio successivo è la traduzione, usa il codice della lingua per preparare il file prima di tradurre file CSV online. Quando un file contiene più lingue, preferisco rilevare prima quella di origine. Così evito di tradurre le righe già scritte nella lingua di destinazione e rendo più prevedibile la verifica.

Quando il dataset è pulito, esportalo in CSV o Excel. Conserva testo originale, nome della lingua, codice, confidenza e campi di verifica. Queste colonne permetteranno di capire in seguito perché una riga è stata inviata alla traduzione, al routing o al controllo manuale.

Costo: crediti fissi per riga

L'enrichment Detect Language from a Text costa 0.05 crediti per riga. Il prezzo è fisso e dipende dal numero di righe. Non cambia se una riga contiene un'headline breve e un'altra un ticket di assistenza lungo, una descrizione di prodotto, una recensione o un estratto di una pagina ottenuta tramite scraping.

Considerando il pacchetto iniziale di Datablist da 20.000 crediti a $20, 1 credito equivale a $0.001. Ecco una stima dei costi:

RigheCrediti utilizzatiCosto indicativo
1.00050 crediti$0.05
10.000500 crediti$0.50
100.0005.000 crediti$5.00

Questo è uno dei motivi per cui uso l'enrichment dedicato prima di provare ChatGPT. I prezzi di ChatGPT/OpenAI dipendono dai token di input e output. Elaborare una bio breve con un LLM costa poco, ma ticket lunghi, descrizioni di prodotti, recensioni e testi di pagine costano di più perché contengono più token. Con l'enrichment per il rilevamento della lingua, ogni riga costa sempre 0.05 crediti, indipendentemente dalla quantità di testo inviata.

I nuovi utenti possono provare il workflow con 500 crediti gratuiti registrandosi con un indirizzo email aziendale. Al costo di 0.05 crediti per riga, 500 crediti coprono 10.000 rilevamenti.

Alternativa: usa ChatGPT per regole personalizzate

Il semplice rilevamento della lingua di solito non richiede un LLM. L'enrichment dedicato è la scelta migliore da cui partire perché l'output è predefinito: nome della lingua, codice e confidenza. Offre inoltre un costo prevedibile per riga, mentre i costi di ChatGPT/OpenAI dipendono dal volume di token.

Usa ChatGPT o OpenAI quando il risultato deve tenere conto di logiche di business. Per esempio, potresti voler:

  • Etichettare le righe multilingue come Mixed invece di scegliere una lingua principale.
  • Combinare il rilevamento della lingua con una classificazione dell'intento del cliente.
  • Aggiungere un campo Needs Review basato su soglie personalizzate.
  • Restituire una breve motivazione per l'audit delle righe ambigue.
  • Gestire in modo specifico varianti regionali o nomi di prodotti.

Datablist può eseguire prompt ChatGPT sulle righe di file CSV o Excel tramite l'enrichment Ask ChatGPT/OpenAI. Usa le prompt variables per inserire nel prompt i valori di ogni riga.

Ecco un prompt semplice per lo stesso dataset di profili:

Rileva la lingua principale di questo testo.

Testo:
{{Bio}}

Se il testo è vuoto, contiene soprattutto numeri o un URL, oppure è troppo breve per stabilire la lingua, restituisci "No result" e imposta Needs review su Yes.

Usa output definiti:

Nome dell'outputTipoIstruzioni
Language nameTextLingua principale della bio o dell'headline. Restituisci No result quando i segnali linguistici non sono sufficienti.
ISO 639-1 codeTextCodice di due lettere, come en, fr, es o de. Lascia vuoto se non ci sono risultati.
ConfidenceSelect o textHigh, Medium o Low.
Needs reviewSelect o textYes per testi vuoti, ambigui, multilingue o con confidenza bassa. Altrimenti No.
ReasonTextBreve nota facoltativa per i workflow di audit. Omettila se ti servono soltanto le etichette.

🔍 Usa ChatGPT per le regole, non per i casi standard

ChatGPT è utile se l'output richiede una valutazione che va oltre la domanda “in che lingua è scritto?”. Se ti servono soltanto i codici lingua, usa l'enrichment dedicato.

L'errore più comune è chiedere a ChatGPT di restituire un paragrafo. Questo crea ulteriore lavoro di pulizia. Salva ogni output in una colonna separata, così potrai filtrare, ordinare, esportare e riutilizzare i dati.

Checklist per il controllo qualità

Prima di usare il file arricchito, di solito controllo:

  • Da 20 a 50 righe casuali distribuite tra le diverse lingue rilevate.
  • Le righe con confidenza Low o Very Low.
  • Le righe con input non valido o senza risultato.
  • Bio brevi, handle, URL, numeri e testi composti soltanto dal nome dell'azienda.
  • Le righe multilingue per cui la “lingua principale” può essere soggettiva.
  • I codici ISO previsti dallo strumento successivo.

La soglia corretta dipende dal workflow. La preparazione alla traduzione può tollerare una piccola coda di verifica manuale. Il routing dell'assistenza clienti richiede più attenzione, perché una lingua errata può assegnare un ticket alla persona sbagliata. Anche la segmentazione per l'outreach va controllata: inviare un messaggio nella lingua sbagliata comunica scarsa attenzione.

Per la maggior parte dei file, il metodo più rapido è semplice: considera affidabile High, controlla Medium quando il testo è breve e verifica le righe Low, Very Low, non valide o senza risultato.

Casi d'uso e varianti

I team di assistenza possono rilevare la lingua dei ticket prima del routing. È utile quando una sola casella di posta riceve messaggi da più Paesi e il team ha bisogno di una prima classificazione rapida.

I team che gestiscono sondaggi possono rilevare la lingua delle risposte aperte prima dell'analisi. Lo farei prima della traduzione, così i dati di origine rimangono organizzati.

I team sales e recruiting possono segmentare le bio dei profili prima dell'outreach. Una colonna con il codice lingua facilita l'assegnazione dei responsabili o la preparazione di messaggi localizzati.

I team ecommerce possono rilevare la lingua delle descrizioni prodotto prima della localizzazione. Se un catalogo contiene contenuti provenienti da fornitori diversi, il rilevamento aiuta a distinguere ciò che deve essere tradotto da ciò che è già pronto.

Anche i workflow di scraping possono adottare lo stesso approccio. Quando estrai pagine da più mercati, rileva la lingua prima di decidere quali contenuti conservare, tradurre o eliminare.

Se la colonna Bio è vuota in molte righe, esegui l'enrichment su Headline oppure combina i due campi nell'input. Di solito combino i campi quando ciascuno contiene poco testo; ne uso uno solo quando contiene già frasi complete.

Risoluzione dei problemi

Se il testo è vuoto, aspettati un input non valido o nessun risultato. Filtra queste righe e decidi se rimuoverle o compilare un altro campo di testo.

Se una riga contiene soltanto un URL, un handle, un numero, un ID o il nome di un brand, non considerare automaticamente affidabile il risultato. Questi valori non offrono al rilevatore segnali linguistici sufficienti.

Se la riga contiene più lingue, considera il risultato come la lingua principale e controlla la confidenza. Per workflow più rigorosi, crea un'etichetta Mixed separata tramite ChatGPT o una verifica manuale.

Se nel file compare una lingua poco diffusa, verifica un campione prima di affidarti ai risultati su larga scala. L'enrichment supporta molte lingue comuni, ma controllare i casi limite prima dell'esportazione resta la pratica più sicura.

Se il file è grande, esegui prima le 10 righe iniziali e poi, se necessario, un campione più ampio. Quando l'associazione degli input e le colonne di output sono corrette, elabora l'intero dataset.

Conclusione

Il modo più pratico per rilevare le lingue in un foglio di calcolo è mantenere il workflow organizzato per righe. Importa il file CSV o Excel, seleziona Detect Language from a Text, scegli una o più colonne di testo, crea gli output per nome della lingua, codice e confidenza, quindi verifica le righe con confidenza bassa prima dell'esportazione.

Per il normale rilevamento della lingua, usa l'enrichment dedicato. Ti fornisce le colonne necessarie senza scrivere codice o creare un prompt personalizzato, mentre il costo rimane fisso in base al numero di righe. Scegli ChatGPT quando servono regole di business, etichette per testi multilingue o una logica di verifica aggiuntiva.

Inizia con una piccola esecuzione di prova, controlla i risultati e poi elabora l'intero file. Questo semplice controllo di solito fa risparmiare molto più tempo di quanto ne richieda.

FAQ

Come rilevare la lingua di ogni riga di un file CSV?

Importa il CSV in Datablist, seleziona Detect Language from a Text dal menu Enrich, associa la colonna di testo nel passaggio Inputs e salva nome della lingua, codice e confidenza in nuove colonne.

Posso rilevare le lingue nelle righe Excel senza codice?

Sì. Importa il file Excel in Datablist ed esegui l'enrichment per il rilevamento della lingua sulla colonna di testo. I risultati vengono inseriti nel dataset e possono essere esportati in CSV o Excel.

Quali colonne di output devo aggiungere?

Usa Language Name, Language Code e Language Confidence. Aggiungi una colonna Needs Review se vuoi isolare le righe Low, Very Low, non valide o senza risultato.

Che cosa indica il livello di confidenza?

La confidenza indica quanto è probabilmente affidabile la lingua rilevata. Usala come segnale per la verifica. In genere, High e Medium possono proseguire, mentre Low e Very Low richiedono un controllo.

Come gestire i risultati con confidenza bassa?

Filtrali in una coda di verifica. Controlla se il testo è troppo breve, vuoto, multilingue o composto da nomi, URL, handle o numeri.

Posso rilevare la lingua prima di tradurre un CSV multilingue?

Sì. Rileva prima la lingua di origine, quindi filtra per codice lingua prima della traduzione. In questo modo eviti di tradurre le righe già scritte nella lingua di destinazione.

Quanto costa il rilevamento della lingua in bulk?

Detect Language from a Text costa 0.05 crediti per riga. Con 20.000 crediti a $20, il costo è di circa $0.05 per 1.000 righe, $0.50 per 10.000 righe e $5 per 100.000 righe. I nuovi utenti con un indirizzo email aziendale possono provarlo con 500 crediti gratuiti, sufficienti per 10.000 rilevamenti.

Conviene usare ChatGPT per rilevare le lingue in bulk?

Usa ChatGPT quando servono regole personalizzate o una classificazione combinata. Per il semplice rilevamento della lingua, l'enrichment dedicato è la soluzione più immediata e ha un costo fisso per riga. ChatGPT/OpenAI può diventare più costoso quando le righe contengono testi lunghi, perché il costo degli LLM dipende dai token.

Cosa succede se il testo è vuoto, contiene solo un URL o è troppo breve?

Il testo vuoto è un input non valido, mentre un testo privo di segnali linguistici chiari può non restituire risultati o avere una confidenza bassa. Filtra queste righe prima dell'esportazione o della traduzione.

Posso rilevare la lingua dalle headline invece che dalle bio?

Sì, ma le headline sono spesso brevi. Se possibile, combina Headline e Bio nell'input, così Datablist avrà più testo da analizzare.

Posso esportare nomi e codici ISO delle lingue in CSV o Excel?

Sì. Dopo l'esecuzione dell'enrichment, esporta il dataset includendo testo originale, nome della lingua, codice, confidenza e campi di verifica.