Se devi rilevare la lingua di ogni riga di un dataset, il flusso di lavoro più semplice consiste nell'aggiungere le colonne relative alla lingua direttamente al file che già utilizzi. Importa il file CSV o Excel in Datablist, esegui il rilevamento sulla colonna di testo, controlla i livelli di confidenza, quindi esporta il dataset arricchito oppure prosegui con traduzione, routing o segmentazione.
Preferisco questo metodo rispetto a copiare le righe in un chatbot, perché i risultati rimangono associati alle singole righe. Per ognuna ottieni il nome della lingua, il codice ISO e un livello di confidenza. Il passaggio successivo diventa così molto più semplice: puoi filtrare le righe in francese, inviare quelle in spagnolo alla traduzione, verificare i risultati con confidenza bassa o rimuovere le righe prive di testo utilizzabile.
In questa guida userò un dataset multilingue di profili, ma lo stesso flusso funziona anche per ticket di assistenza, risposte ai sondaggi, recensioni, descrizioni di prodotti, pagine estratte tramite scraping e note del CRM.
🔑 Inizia dal rilevatore dedicato
Se devi soltanto identificare la lingua, parti dall'enrichment per il rilevamento della lingua. Usa ChatGPT solo quando servono regole personalizzate o una decisione combinata.
Link rapidi
- Risposta rapida
- Dataset di esempio
- Passaggio 1: importa il file CSV o Excel
- Passaggio 2: seleziona l'enrichment per la lingua
- Passaggio 3: configura input e output
- Passaggio 4: verifica le lingue rilevate
- Passaggio 5: filtra, esporta o continua con la traduzione
- Costo: crediti fissi per riga
- Alternativa: usa ChatGPT per regole personalizzate
Risposta rapida
Per rilevare la lingua di ogni riga di un dataset, importa il file CSV o Excel in Datablist, apri il menu Enrich e seleziona l'enrichment Detect Language from a Text. Nel passaggio Inputs, scegli la colonna di testo da analizzare. Datablist inserisce il nome della lingua rilevata, il relativo codice e il livello di confidenza in nuove colonne, al prezzo fisso di 0.05 crediti per riga.
La verifica è il passaggio fondamentale. Il rilevamento della lingua è un'attività di classificazione e il livello di confidenza indica quali righe possono proseguire nel workflow e quali richiedono un controllo. In genere, le righe con confidenza alta possono passare alla fase successiva. Quelle con confidenza bassa, input non valido o nessun risultato dovrebbero essere filtrate prima dell'esportazione.
Uso questo flusso quando i risultati devono rimanere associati alle righe originali. Una formula di foglio di calcolo può essere utile nei casi più semplici, ma tende a non funzionare bene con testi in più lingue, frammenti brevi, celle vuote ed esportazioni poco pulite. Un chatbot può analizzare qualche esempio, ma non restituisce un dataset ordinato con un risultato per ogni riga.
Dataset di esempio
Per la demo utilizzo un CSV con profili social. Contiene cinque colonne:
| Profile ID | Full Name | Headline | Bio | Company |
|---|---|---|---|---|
C8C1DXQBNP | Maya Collins | Founder che sviluppa strumenti di analytics per i team customer | Aiuto i team sales a ripulire liste di lead disordinate... | Northstar Labs |
61M25JUEHM | Lucas Bernard | Responsabile dell'assistenza clienti per un marketplace | Creo workflow semplici... | Market Loop |
Y45G9QU71C | Sofia Romero | Specialista in CRM e automazione commerciale | Consulente operations specializzata... | Talent Desk |
RL20HHREOT | Felix Wagner | Tech Recruiter per team di prodotto | Aiuto i team a... | Cleanbase |
TT384W44MW | Aoi Nakamura | Consulente CRM per team commerciali | Classifico le richieste multilingue... | Northstar Labs |
Il file non contiene intenzionalmente una colonna dedicata alla lingua. Voglio che sia Datablist ad aggiungere questa informazione, non che confermi un'etichetta già presente.
Il dataset include anche righe poco pulite: bio vuote, headline brevi, nomi di aziende, handle, URL, numeri e frammenti in più lingue. Mi piace usare file di questo tipo perché mostrano cosa succede al di fuori delle righe perfette di una demo. Le esportazioni reali contengono sempre qualche riga da verificare.
In questo esempio uso sia Headline sia Bio come segnali per identificare la lingua. Se il dataset contiene ticket di assistenza lunghi o descrizioni di prodotti in un'unica colonna, basta una sola colonna di input. Se invece ogni riga contiene campi brevi, combinare due colonne di testo offre solitamente più contesto al rilevatore.
Passaggio 1: importa il file CSV o Excel
Parti da un file CSV o Excel con una riga per ogni record e almeno una colonna di testo. Apri Datablist, crea una collection e importa il file. Per questo workflow puoi usare l'editor CSV di Datablist.
Nella schermata di verifica dell'importazione, controlla i nomi delle colonne e assicurati che i campi utili siano importati come campi di testo. Nel mio esempio mi interessano Headline e Bio. Non uso Full Name, Company o Profile ID per il rilevamento, perché offrono segnali linguistici deboli.
Mantieni inalterate le colonne di testo originali. Di solito aggiungo nuove colonne di output invece di sovrascrivere i dati di origine, perché semplifica la verifica. Se un risultato sembra strano, puoi confrontarlo subito con il testo originale.
💡 Mantieni una colonna ID stabile
Se in seguito il file deve essere reimportato in un altro sistema, conserva una colonna ID, come
Profile ID, ID del ticket, SKU del prodotto o ID del record CRM. In questo modo esportazione e associazione dei dati sono più sicure.
Passaggio 2: seleziona l'enrichment per la lingua
Dopo aver importato il dataset, apri il menu Enrich e cerca il rilevamento della lingua. Seleziona l'enrichment Detect Language from a Text.
Questo enrichment elabora una riga alla volta. Per ciascun elemento legge il testo di input e restituisce:
Language Name, per esempio English, French, Spanish o German.Language Code, per esempioen,fr,esode.Language Confidence, per esempio High, Medium, Low o Very Low.
È esattamente il formato che cerco quando lavoro con un foglio di calcolo. Il nome della lingua è facile da leggere. Il codice è utile per le automazioni e gli strumenti di traduzione. La confidenza indica quali righe controllare.
Evita di usare come unico input campi deboli, come nomi, ID, username, URL, codici numerici o nomi di aziende. Spesso non contengono segnali linguistici sufficienti. Se il dataset contiene testi brevi, seleziona un secondo campo di testo prima di avviare l'enrichment.
Passaggio 3: configura input e output
Nel passaggio Inputs, scegli il testo che Datablist deve analizzare. Puoi selezionare una property oppure creare un input personalizzato combinando più property.
Per il dataset dei profili uso un input personalizzato con Headline e Bio. È importante perché alcune righe hanno una bio breve, altre un'headline significativa e qualcuna contiene dati poco puliti. Combinare entrambi i campi offre più contesto al rilevatore senza dover aggiungere manualmente una nuova colonna.
Configura quindi le colonne di output. Di solito creo nuove colonne per:
Language NameLanguage CodeLanguage Confidence
Una colonna con lo stato dell'esecuzione aiuta a isolare le righe non elaborate, con input non valido o senza risultati.
Prima di elaborare l'intero file, esegui l'enrichment sulle prime 10 righe. Lo faccio anche nei workflow più semplici, perché permette di individuare rapidamente un'associazione errata degli input. Se selezioni per sbaglio Company al posto di Bio, vedrai risultati scadenti prima di spendere crediti sull'intero dataset.
⚠️ I testi brevi sono più difficili
Frammenti di una sola parola, nomi di brand, handle, numeri e URL potrebbero non contenere segnali linguistici sufficienti. Considera le righe con confidenza bassa o senza risultato come una coda da verificare, non come errori.
Se la prima esecuzione restituisce buoni risultati, elabora le righe rimanenti.
Passaggio 4: verifica le lingue rilevate
La prima esecuzione di anteprima dovrebbe mostrare le nuove colonne relative alla lingua accanto ai dati originali. Nell'esempio seguente, nelle prime righe Datablist ha rilevato inglese, francese, spagnolo, tedesco, italiano, portoghese, olandese, giapponese, arabo e cinese.
Ecco il tipo di tabella dei risultati che puoi aspettarti:
| Profile ID | Tipo di testo | Language Name | Language Code | Confidenza | Da verificare |
|---|---|---|---|---|---|
C8C1DXQBNP | Bio in inglese | English | en | High | No |
61M25JUEHM | Bio in francese | French | fr | Medium | Forse |
Y45G9QU71C | Bio in spagnolo | Spanish | es | High | No |
RL20HHREOT | Bio in tedesco | German | de | High | No |
| riga vuota | Bio vuota e headline poco significativa | Nessun risultato o input non valido | vuoto | vuoto | Sì |
| riga con solo handle | @marketloop | Nessun risultato o confidenza bassa | vuoto | Low | Sì |
Non considero la confidenza come una decisione di business definitiva, ma come un segnale per il routing. High e Medium sono solitamente sufficienti quando il passaggio successivo consiste nella preparazione alla traduzione o in una segmentazione generale. Le righe Low, Very Low, con input non valido o senza risultato dovrebbero essere controllate prima di inviare email, assegnare ticket di assistenza o aggiornare un CRM.
📘 La confidenza accelera la verifica
La confidenza non sostituisce il giudizio. Ti indica soltanto dove concentrare prima l'attenzione.
Se l'accuratezza è importante, dopo l'esecuzione crea una semplice colonna Needs Review. Impostala su Yes quando la confidenza è Low o Very Low, quando l'input non è valido o quando Datablist non restituisce risultati. In questo modo, la parte meno pulita del dataset diventa una piccola coda di lavoro.
Il rilevamento della lingua è un buon esempio di classificazione AI: ogni riga viene assegnata a una classe e la confidenza aiuta a decidere quali dati possono proseguire.
Passaggio 5: filtra, esporta o continua con la traduzione
Dopo aver compilato le colonne relative alla lingua, filtra il dataset prima di esportarlo o avviare il workflow successivo.
Inizia dalla confidenza. Apri il menu della colonna Language Confidence e filtra le righe con confidenza bassa. Controllale per prime, perché hanno maggiori probabilità di contenere testo vuoto, frammenti brevi, contenuti in più lingue o valori non linguistici.
Filtra poi per Language Code quando ti servono segmenti specifici per lingua. Per esempio:
- Invia alla traduzione le righe
fr,es,deeit. - Assegna i ticket di assistenza
jaezhal team giusto. - Mantieni soltanto le righe in inglese per una campagna.
- Rimuovi le righe non valide prima di importare il file in un CRM.
Se il passaggio successivo è la traduzione, usa il codice della lingua per preparare il file prima di tradurre file CSV online. Quando un file contiene più lingue, preferisco rilevare prima quella di origine. Così evito di tradurre le righe già scritte nella lingua di destinazione e rendo più prevedibile la verifica.
Quando il dataset è pulito, esportalo in CSV o Excel. Conserva testo originale, nome della lingua, codice, confidenza e campi di verifica. Queste colonne permetteranno di capire in seguito perché una riga è stata inviata alla traduzione, al routing o al controllo manuale.
Costo: crediti fissi per riga
L'enrichment Detect Language from a Text costa 0.05 crediti per riga. Il prezzo è fisso e dipende dal numero di righe. Non cambia se una riga contiene un'headline breve e un'altra un ticket di assistenza lungo, una descrizione di prodotto, una recensione o un estratto di una pagina ottenuta tramite scraping.
Considerando il pacchetto iniziale di Datablist da 20.000 crediti a $20, 1 credito equivale a $0.001. Ecco una stima dei costi:
| Righe | Crediti utilizzati | Costo indicativo |
|---|---|---|
| 1.000 | 50 crediti | $0.05 |
| 10.000 | 500 crediti | $0.50 |
| 100.000 | 5.000 crediti | $5.00 |
Questo è uno dei motivi per cui uso l'enrichment dedicato prima di provare ChatGPT. I prezzi di ChatGPT/OpenAI dipendono dai token di input e output. Elaborare una bio breve con un LLM costa poco, ma ticket lunghi, descrizioni di prodotti, recensioni e testi di pagine costano di più perché contengono più token. Con l'enrichment per il rilevamento della lingua, ogni riga costa sempre 0.05 crediti, indipendentemente dalla quantità di testo inviata.
I nuovi utenti possono provare il workflow con 500 crediti gratuiti registrandosi con un indirizzo email aziendale. Al costo di 0.05 crediti per riga, 500 crediti coprono 10.000 rilevamenti.
Alternativa: usa ChatGPT per regole personalizzate
Il semplice rilevamento della lingua di solito non richiede un LLM. L'enrichment dedicato è la scelta migliore da cui partire perché l'output è predefinito: nome della lingua, codice e confidenza. Offre inoltre un costo prevedibile per riga, mentre i costi di ChatGPT/OpenAI dipendono dal volume di token.
Usa ChatGPT o OpenAI quando il risultato deve tenere conto di logiche di business. Per esempio, potresti voler:
- Etichettare le righe multilingue come
Mixedinvece di scegliere una lingua principale. - Combinare il rilevamento della lingua con una classificazione dell'intento del cliente.
- Aggiungere un campo
Needs Reviewbasato su soglie personalizzate. - Restituire una breve motivazione per l'audit delle righe ambigue.
- Gestire in modo specifico varianti regionali o nomi di prodotti.
Datablist può eseguire prompt ChatGPT sulle righe di file CSV o Excel tramite l'enrichment Ask ChatGPT/OpenAI. Usa le prompt variables per inserire nel prompt i valori di ogni riga.
Ecco un prompt semplice per lo stesso dataset di profili:
Rileva la lingua principale di questo testo.
Testo:
{{Bio}}
Se il testo è vuoto, contiene soprattutto numeri o un URL, oppure è troppo breve per stabilire la lingua, restituisci "No result" e imposta Needs review su Yes.
Usa output definiti:
| Nome dell'output | Tipo | Istruzioni |
|---|---|---|
Language name | Text | Lingua principale della bio o dell'headline. Restituisci No result quando i segnali linguistici non sono sufficienti. |
ISO 639-1 code | Text | Codice di due lettere, come en, fr, es o de. Lascia vuoto se non ci sono risultati. |
Confidence | Select o text | High, Medium o Low. |
Needs review | Select o text | Yes per testi vuoti, ambigui, multilingue o con confidenza bassa. Altrimenti No. |
Reason | Text | Breve nota facoltativa per i workflow di audit. Omettila se ti servono soltanto le etichette. |
🔍 Usa ChatGPT per le regole, non per i casi standard
ChatGPT è utile se l'output richiede una valutazione che va oltre la domanda “in che lingua è scritto?”. Se ti servono soltanto i codici lingua, usa l'enrichment dedicato.
L'errore più comune è chiedere a ChatGPT di restituire un paragrafo. Questo crea ulteriore lavoro di pulizia. Salva ogni output in una colonna separata, così potrai filtrare, ordinare, esportare e riutilizzare i dati.
Checklist per il controllo qualità
Prima di usare il file arricchito, di solito controllo:
- Da 20 a 50 righe casuali distribuite tra le diverse lingue rilevate.
- Le righe con confidenza Low o Very Low.
- Le righe con input non valido o senza risultato.
- Bio brevi, handle, URL, numeri e testi composti soltanto dal nome dell'azienda.
- Le righe multilingue per cui la “lingua principale” può essere soggettiva.
- I codici ISO previsti dallo strumento successivo.
La soglia corretta dipende dal workflow. La preparazione alla traduzione può tollerare una piccola coda di verifica manuale. Il routing dell'assistenza clienti richiede più attenzione, perché una lingua errata può assegnare un ticket alla persona sbagliata. Anche la segmentazione per l'outreach va controllata: inviare un messaggio nella lingua sbagliata comunica scarsa attenzione.
Per la maggior parte dei file, il metodo più rapido è semplice: considera affidabile High, controlla Medium quando il testo è breve e verifica le righe Low, Very Low, non valide o senza risultato.
Casi d'uso e varianti
I team di assistenza possono rilevare la lingua dei ticket prima del routing. È utile quando una sola casella di posta riceve messaggi da più Paesi e il team ha bisogno di una prima classificazione rapida.
I team che gestiscono sondaggi possono rilevare la lingua delle risposte aperte prima dell'analisi. Lo farei prima della traduzione, così i dati di origine rimangono organizzati.
I team sales e recruiting possono segmentare le bio dei profili prima dell'outreach. Una colonna con il codice lingua facilita l'assegnazione dei responsabili o la preparazione di messaggi localizzati.
I team ecommerce possono rilevare la lingua delle descrizioni prodotto prima della localizzazione. Se un catalogo contiene contenuti provenienti da fornitori diversi, il rilevamento aiuta a distinguere ciò che deve essere tradotto da ciò che è già pronto.
Anche i workflow di scraping possono adottare lo stesso approccio. Quando estrai pagine da più mercati, rileva la lingua prima di decidere quali contenuti conservare, tradurre o eliminare.
Se la colonna Bio è vuota in molte righe, esegui l'enrichment su Headline oppure combina i due campi nell'input. Di solito combino i campi quando ciascuno contiene poco testo; ne uso uno solo quando contiene già frasi complete.
Risoluzione dei problemi
Se il testo è vuoto, aspettati un input non valido o nessun risultato. Filtra queste righe e decidi se rimuoverle o compilare un altro campo di testo.
Se una riga contiene soltanto un URL, un handle, un numero, un ID o il nome di un brand, non considerare automaticamente affidabile il risultato. Questi valori non offrono al rilevatore segnali linguistici sufficienti.
Se la riga contiene più lingue, considera il risultato come la lingua principale e controlla la confidenza. Per workflow più rigorosi, crea un'etichetta Mixed separata tramite ChatGPT o una verifica manuale.
Se nel file compare una lingua poco diffusa, verifica un campione prima di affidarti ai risultati su larga scala. L'enrichment supporta molte lingue comuni, ma controllare i casi limite prima dell'esportazione resta la pratica più sicura.
Se il file è grande, esegui prima le 10 righe iniziali e poi, se necessario, un campione più ampio. Quando l'associazione degli input e le colonne di output sono corrette, elabora l'intero dataset.
Conclusione
Il modo più pratico per rilevare le lingue in un foglio di calcolo è mantenere il workflow organizzato per righe. Importa il file CSV o Excel, seleziona Detect Language from a Text, scegli una o più colonne di testo, crea gli output per nome della lingua, codice e confidenza, quindi verifica le righe con confidenza bassa prima dell'esportazione.
Per il normale rilevamento della lingua, usa l'enrichment dedicato. Ti fornisce le colonne necessarie senza scrivere codice o creare un prompt personalizzato, mentre il costo rimane fisso in base al numero di righe. Scegli ChatGPT quando servono regole di business, etichette per testi multilingue o una logica di verifica aggiuntiva.
Inizia con una piccola esecuzione di prova, controlla i risultati e poi elabora l'intero file. Questo semplice controllo di solito fa risparmiare molto più tempo di quanto ne richieda.
FAQ
Come rilevare la lingua di ogni riga di un file CSV?
Importa il CSV in Datablist, seleziona Detect Language from a Text dal menu Enrich, associa la colonna di testo nel passaggio Inputs e salva nome della lingua, codice e confidenza in nuove colonne.
Posso rilevare le lingue nelle righe Excel senza codice?
Sì. Importa il file Excel in Datablist ed esegui l'enrichment per il rilevamento della lingua sulla colonna di testo. I risultati vengono inseriti nel dataset e possono essere esportati in CSV o Excel.
Quali colonne di output devo aggiungere?
Usa Language Name, Language Code e Language Confidence. Aggiungi una colonna Needs Review se vuoi isolare le righe Low, Very Low, non valide o senza risultato.
Che cosa indica il livello di confidenza?
La confidenza indica quanto è probabilmente affidabile la lingua rilevata. Usala come segnale per la verifica. In genere, High e Medium possono proseguire, mentre Low e Very Low richiedono un controllo.
Come gestire i risultati con confidenza bassa?
Filtrali in una coda di verifica. Controlla se il testo è troppo breve, vuoto, multilingue o composto da nomi, URL, handle o numeri.
Posso rilevare la lingua prima di tradurre un CSV multilingue?
Sì. Rileva prima la lingua di origine, quindi filtra per codice lingua prima della traduzione. In questo modo eviti di tradurre le righe già scritte nella lingua di destinazione.
Quanto costa il rilevamento della lingua in bulk?
Detect Language from a Text costa 0.05 crediti per riga. Con 20.000 crediti a $20, il costo è di circa $0.05 per 1.000 righe, $0.50 per 10.000 righe e $5 per 100.000 righe. I nuovi utenti con un indirizzo email aziendale possono provarlo con 500 crediti gratuiti, sufficienti per 10.000 rilevamenti.
Conviene usare ChatGPT per rilevare le lingue in bulk?
Usa ChatGPT quando servono regole personalizzate o una classificazione combinata. Per il semplice rilevamento della lingua, l'enrichment dedicato è la soluzione più immediata e ha un costo fisso per riga. ChatGPT/OpenAI può diventare più costoso quando le righe contengono testi lunghi, perché il costo degli LLM dipende dai token.
Cosa succede se il testo è vuoto, contiene solo un URL o è troppo breve?
Il testo vuoto è un input non valido, mentre un testo privo di segnali linguistici chiari può non restituire risultati o avere una confidenza bassa. Filtra queste righe prima dell'esportazione o della traduzione.
Posso rilevare la lingua dalle headline invece che dalle bio?
Sì, ma le headline sono spesso brevi. Se possibile, combina Headline e Bio nell'input, così Datablist avrà più testo da analizzare.
Posso esportare nomi e codici ISO delle lingue in CSV o Excel?
Sì. Dopo l'esecuzione dell'enrichment, esporta il dataset includendo testo originale, nome della lingua, codice, confidenza e campi di verifica.











