Wenn Du die Sprache jeder Zeile in einem Datensatz erkennen möchtest, ist es am einfachsten, die Sprachinformationen direkt als neue Spalten in Deine bestehende Datei einzufügen. Importiere Deine CSV- oder Excel-Datei in Datablist, führe die Spracherkennung für die Textspalte aus, prüfe die Konfidenzwerte und exportiere anschließend den angereicherten Datensatz. Alternativ kannst Du direkt mit Übersetzung, Routing oder Segmentierung weitermachen.

Ich bevorzuge diesen Workflow gegenüber dem Kopieren einzelner Zeilen in einen Chatbot, weil die Ergebnisse sauber den jeweiligen Zeilen zugeordnet bleiben. Für jede Zeile erhältst Du den Namen der Sprache, einen ISO-Sprachcode und einen Konfidenzwert. Dadurch wird der nächste Schritt deutlich einfacher: französische Zeilen filtern, spanische Inhalte zur Übersetzung weiterleiten, Ergebnisse mit niedriger Konfidenz prüfen oder Zeilen ohne verwertbaren Text entfernen.

In diesem Guide verwende ich einen mehrsprachigen Datensatz mit Profilinformationen. Derselbe Workflow funktioniert aber auch für Support-Tickets, Umfrageantworten, Bewertungen, Produktbeschreibungen, gescrapte Webseiten und CRM-Notizen.

🔑 Nutze zuerst die spezielle Spracherkennung

Wenn Du lediglich die Sprache erkennen möchtest, solltest Du mit dem Language Detection Enrichment beginnen. Verwende ChatGPT nur, wenn Du individuelle Regeln oder eine kombinierte Entscheidung benötigst.

Schnellzugriff

Direkte Antwort

Um die Sprache jeder Zeile in einem Datensatz zu erkennen, importierst Du Deine CSV- oder Excel-Datei in Datablist, öffnest das Menü Enrich und wählst das Detect Language from a Text Enrichment. Im Schritt Inputs legst Du die Textspalte fest, die analysiert werden soll. Datablist schreibt den erkannten Sprachnamen, den Sprachcode und den Konfidenzwert in neue Spalten. Der Festpreis beträgt 0.05 Credits pro Zeile.

Entscheidend ist die anschließende Prüfung. Spracherkennung ist eine Klassifizierungsaufgabe, und anhand der Konfidenz siehst Du, welche Zeilen direkt weiterverarbeitet werden können und welche einen zweiten Blick verdienen. Zeilen mit hoher Konfidenz können normalerweise in den nächsten Workflow übernommen werden. Zeilen mit niedriger Konfidenz, ungültigen Daten oder ohne Ergebnis solltest Du vor dem Export filtern.

Diesen Workflow nutze ich immer dann, wenn die Ergebnisse mit den ursprünglichen Zeilen verknüpft bleiben müssen. Eine Tabellenformel kann bei einfachen Fällen helfen, stößt bei mehrsprachigen Texten, kurzen Ausschnitten, leeren Zellen und unübersichtlichen Exporten aber schnell an ihre Grenzen. Ein Chatbot kann einige Beispiele auswerten, liefert Dir jedoch nicht automatisch einen sauberen Datensatz mit genau einem Ergebnis pro Zeile.

Beispieldatensatz

Für die Demo verwende ich eine CSV-Datei mit Social-Media-Profilen. Sie enthält fünf Spalten:

Profil-IDVollständiger NameHeadlineBioUnternehmen
C8C1DXQBNPMaya CollinsGründerin, die Analytics-Tools für Customer-Teams entwickeltIch helfe Sales-Teams, unübersichtliche Lead-Listen zu bereinigen...Northstar Labs
61M25JUEHMLucas BernardResponsable support client pour une marketplaceJe construis des workflows simples...Market Loop
Y45G9QU71CSofia RomeroEspecialista en CRM y automatizacion comercialConsultora de operaciones enfocada...Talent Desk
RL20HHREOTFelix WagnerTech Recruiter fuer ProduktteamsIch helfe Teams dabei...Cleanbase
TT384W44MWAoi Nakamura営業チーム向けCRMコンサルタント多言語の問い合わせを分類...Northstar Labs

Die Datei enthält absichtlich keine Sprachspalte. Datablist soll diese Information ergänzen und nicht lediglich ein bereits vorhandenes Label bestätigen.

Der Datensatz enthält außerdem problematische Zeilen: leere Bios, kurze Headlines, Firmennamen, Handles, URLs, Zahlen und mehrsprachige Textausschnitte. Ich arbeite gern mit solchen Dateien, weil sie zeigen, was außerhalb einer perfekten Demo passiert. Echte Exporte enthalten praktisch immer einige Zeilen, die geprüft werden müssen.

Importierter mehrsprachiger Profildatensatz in Datablist
Importierter mehrsprachiger Profildatensatz in Datablist

Für dieses Beispiel nutze ich sowohl Headline als auch Bio als Sprachsignal. Enthält Dein Datensatz lange Support-Tickets oder Produktbeschreibungen in einer einzigen Spalte, reicht eine Input-Spalte aus. Besteht jede Zeile aus mehreren kurzen Feldern, liefert die Kombination zweier Textspalten der Spracherkennung normalerweise mehr Kontext.

Schritt 1: CSV- oder Excel-Datei importieren

Beginne mit einer CSV- oder Excel-Datei, die pro Datensatz eine Zeile und mindestens eine Textspalte enthält. Öffne Datablist, erstelle eine Collection und importiere die Datei. Für diesen Workflow kannst Du den CSV-Editor von Datablist verwenden.

CSV oder Excel in eine leere Datablist Collection importieren
CSV oder Excel in eine leere Datablist Collection importieren

Prüfe auf der Importübersicht die Spaltennamen und stelle sicher, dass die relevanten Felder als Textfelder importiert werden. In meinem Beispiel sind Headline und Bio wichtig. Full Name, Company und Profile ID verwende ich nicht für die Erkennung, weil sie nur schwache Sprachsignale liefern.

Mehrsprachige Profil-CSV vor dem Import überprüfen
Mehrsprachige Profil-CSV vor dem Import überprüfen

Lass die ursprünglichen Textspalten unverändert. Ich erstelle normalerweise neue Output-Spalten, statt die Quelldaten zu überschreiben, weil das die Kontrolle erleichtert. Sieht ein Ergebnis ungewöhnlich aus, kannst Du es sofort mit dem Originaltext vergleichen.

💡 Behalte eine stabile ID-Spalte

Wenn die Datei später wieder in ein anderes System importiert werden soll, behalte eine ID-Spalte wie Profile ID, Ticket-ID, Produkt-SKU oder CRM-Datensatz-ID. So werden Export und Zuordnung zuverlässiger.

Schritt 2: Language Detection Enrichment auswählen

Sobald der Datensatz importiert ist, öffnest Du das Menü Enrich und suchst nach der Spracherkennung. Wähle anschließend das Detect Language from a Text Enrichment.

Detect Language from a Text Enrichment auswählen
Detect Language from a Text Enrichment auswählen

Dieses Enrichment verarbeitet den Datensatz Zeile für Zeile. Für jeden Eintrag liest es den Input-Text und liefert folgende Werte zurück:

  • Language Name, beispielsweise English, French, Spanish oder German.
  • Language Code, beispielsweise en, fr, es oder de.
  • Language Confidence, beispielsweise High, Medium, Low oder Very Low.

Genau diese Ergebnisstruktur eignet sich gut für die Arbeit mit Tabellen. Der Sprachname ist leicht verständlich, der Code eignet sich für Automatisierungen und Übersetzungstools, und die Konfidenz zeigt Dir, welche Zeilen geprüft werden sollten.

Vermeide es, schwache Felder wie Namen, IDs, Benutzernamen, URLs, Zahlencodes oder Firmennamen als einzigen Input zu verwenden. Sie enthalten oft nicht genug sprachliche Informationen. Wenn Dein Datensatz nur kurze Texte enthält, solltest Du vor dem Start des Enrichments ein zweites Textfeld auswählen.

Schritt 3: Inputs und Outputs konfigurieren

Im Schritt Inputs wählst Du den Text aus, den Datablist analysieren soll. Du kannst eine einzelne Property auswählen oder aus mehreren Properties einen individuellen Input zusammenstellen.

Für den Profildatensatz verwende ich einen individuellen Input aus Headline und Bio. Das ist sinnvoll, weil einige Zeilen eine kurze Bio, andere eine aussagekräftige Headline und manche unvollständige Daten enthalten. Durch die Kombination beider Felder erhält die Spracherkennung mehr Kontext, ohne dass Du manuell eine neue Spalte anlegen musst.

Festlegen, ob die Spracherkennung ein Textfeld oder einen individuellen Input verwendet
Festlegen, ob die Spracherkennung ein Textfeld oder einen individuellen Input verwendet
Headline und Bio als Inputs für die Spracherkennung auswählen
Headline und Bio als Inputs für die Spracherkennung auswählen

Konfiguriere anschließend die Output-Spalten. Normalerweise erstelle ich neue Spalten für:

  • Language Name
  • Language Code
  • Language Confidence

Mit einer Spalte für den Ausführungsstatus kannst Du Zeilen isolieren, bei denen die Verarbeitung fehlgeschlagen ist, der Input ungültig war oder kein Ergebnis zurückgegeben wurde.

Output-Spalten für Sprachname, Sprachcode und Konfidenz konfigurieren
Output-Spalten für Sprachname, Sprachcode und Konfidenz konfigurieren

Bevor Du die gesamte Datei verarbeitest, solltest Du das Enrichment für die ersten zehn Zeilen ausführen. Ich mache das selbst bei einfachen Workflows, weil sich eine falsche Input-Zuordnung so schnell erkennen lässt. Hast Du versehentlich Company statt Bio ausgewählt, bemerkst Du die schlechten Ergebnisse, bevor Du Credits für den vollständigen Datensatz ausgibst.

⚠️ Kurze Texte sind schwieriger

Einzelne Wörter, Markennamen, Handles, Zahlen und URLs enthalten möglicherweise nicht genügend Sprachsignale. Betrachte Zeilen mit niedriger Konfidenz oder ohne Ergebnis als Prüfliste und nicht als fehlgeschlagene Verarbeitung.

Wenn der erste Testlauf gute Ergebnisse liefert, kannst Du die übrigen Zeilen verarbeiten.

Schritt 4: Erkannte Sprachen überprüfen

Nach dem ersten Testlauf sollten die neuen Sprachspalten direkt neben den ursprünglichen Daten erscheinen. Im folgenden Beispiel hat Datablist in den ersten Zeilen Englisch, Französisch, Spanisch, Deutsch, Italienisch, Portugiesisch, Niederländisch, Japanisch, Arabisch und Chinesisch erkannt.

Die ersten zehn Ergebnisse der Spracherkennung vor der vollständigen Verarbeitung prüfen
Die ersten zehn Ergebnisse der Spracherkennung vor der vollständigen Verarbeitung prüfen

Mit einer Ergebnistabelle wie dieser kannst Du rechnen:

Profil-IDTextmusterLanguage NameLanguage CodeKonfidenzPrüfung erforderlich
C8C1DXQBNPEnglische BioEnglishenHighNein
61M25JUEHMFranzösische BioFrenchfrMediumVielleicht
Y45G9QU71CSpanische BioSpanishesHighNein
RL20HHREOTDeutsche BioGermandeHighNein
leere ZeileLeere Bio und wenig aussagekräftige HeadlineKein Ergebnis oder ungültigleerleerJa
Zeile nur mit Handle@marketloopKein Ergebnis oder niedrige KonfidenzleerLowJa

Ich behandle die Konfidenz nicht als endgültige Business-Entscheidung, sondern als Routing-Signal. High und Medium reichen normalerweise aus, wenn im nächsten Schritt eine Übersetzung vorbereitet oder eine grobe Segmentierung vorgenommen wird. Zeilen mit Low, Very Low, ungültigen Daten oder ohne Ergebnis solltest Du prüfen, bevor Du E-Mails versendest, Support-Tickets zuweist oder ein CRM aktualisierst.

📘 Konfidenz verkürzt die manuelle Prüfung

Die Konfidenz ersetzt nicht Dein Urteilsvermögen. Sie zeigt Dir, wo Du zuerst genauer hinschauen solltest.

Wenn Genauigkeit wichtig ist, erstelle nach der Verarbeitung eine einfache Spalte namens Needs Review. Setze sie auf Yes, wenn die Konfidenz Low oder Very Low ist, der Input ungültig war oder Datablist kein Ergebnis liefert. So wird aus dem problematischen Teil des Datensatzes eine überschaubare Arbeitsliste.

Die Spracherkennung ist ein gutes Beispiel für AI Classification: Jede Zeile wird einer Klasse zugeordnet, und die Konfidenz hilft Dir bei der Entscheidung, welche Daten direkt weiterverarbeitet werden können.

Schritt 5: Filtern, exportieren oder übersetzen

Sobald die Sprachspalten ausgefüllt sind, solltest Du den Datensatz filtern, bevor Du ihn exportierst oder den nächsten Workflow startest.

Beginne mit der Konfidenz. Öffne das Spaltenmenü von Language Confidence und filtere nach Zeilen mit niedriger Konfidenz. Prüfe diese zuerst, da sie am wahrscheinlichsten leere Texte, kurze Ausschnitte, mehrsprachige Inhalte oder Werte ohne sprachliche Aussagekraft enthalten.

Filter der Spalte Language Confidence öffnen
Filter der Spalte Language Confidence öffnen
Ergebnisse mit niedriger Konfidenz zur Prüfung filtern
Ergebnisse mit niedriger Konfidenz zur Prüfung filtern

Filtere anschließend nach Language Code, wenn Du sprachspezifische Segmente benötigst. Zum Beispiel:

  • Leite Zeilen mit fr, es, de und it zur Übersetzung weiter.
  • Weise Support-Tickets mit ja und zh dem richtigen Team zu.
  • Behalte für eine Kampagne ausschließlich englische Zeilen.
  • Entferne ungültige Zeilen, bevor Du die Datei in ein CRM importierst.

Wenn im nächsten Schritt eine Übersetzung ansteht, kannst Du die Datei anhand des Sprachcodes vorbereiten, bevor Du CSV-Dateien online übersetzt. Bei Dateien mit mehreren Sprachen ermittle ich normalerweise zuerst die Ausgangssprache. So vermeidest Du, dass Zeilen übersetzt werden, die bereits in der Zielsprache vorliegen, und die anschließende Prüfung wird planbarer.

Wenn der Datensatz sauber aussieht, exportierst Du ihn als CSV- oder Excel-Datei. Behalte den Originaltext, den Sprachnamen, den Sprachcode, die Konfidenz und die Prüffelder. Diese Spalten machen später nachvollziehbar, warum eine Zeile zur Übersetzung, zum Routing oder zur manuellen Prüfung weitergeleitet wurde.

Kosten: feste Credits pro Zeile

Das Detect Language from a Text Enrichment kostet 0.05 Credits pro Zeile. Der Preis richtet sich ausschließlich nach der Anzahl der Zeilen. Es spielt keine Rolle, ob eine Zeile nur eine kurze Headline oder ein langes Support-Ticket, eine Produktbeschreibung, eine Bewertung beziehungsweise einen Ausschnitt einer gescrapten Seite enthält.

Beim Einstiegspreis für zusätzliche Datablist Credits von 20.000 Credits für 20 US-Dollar entspricht ein Credit 0,001 US-Dollar. Daraus ergeben sich ungefähr folgende Kosten:

ZeilenVerbrauchte CreditsUngefähre Kosten
1.00050 Credits0,05 $
10.000500 Credits0,50 $
100.0005.000 Credits5,00 $

Das ist einer der Gründe, warum ich vor ChatGPT zunächst das spezielle Enrichment verwende. Die Preise von ChatGPT/OpenAI hängen von den Input- und Output-Tokens ab. Eine kurze Bio lässt sich mit einem LLM günstig verarbeiten. Lange Tickets, Produktbeschreibungen, Bewertungen und Seitentexte kosten jedoch mehr, weil sie mehr Tokens enthalten. Beim Language Detection Enrichment kostet jede Zeile immer 0.05 Credits – unabhängig von der Textlänge.

Neue Nutzer können diesen Workflow außerdem mit 500 kostenlosen Credits testen, wenn sie sich mit einer geschäftlichen E-Mail-Domain registrieren. Bei 0.05 Credits pro Zeile reichen 500 Credits für 10.000 Spracherkennungen.

Alternative: ChatGPT für individuelle Regeln

Für eine einfache Spracherkennung ist normalerweise kein LLM erforderlich. Das spezielle Enrichment ist die bessere erste Wahl, weil die Outputs feststehen: Sprachname, Code und Konfidenz. Außerdem bietet es planbare Kosten pro Zeile, während die Kosten für ChatGPT/OpenAI vom Token-Volumen abhängen.

Nutze ChatGPT oder OpenAI, wenn das Sprachergebnis von Deiner Business-Logik abhängt. Du könntest beispielsweise:

  • Mehrsprachige Zeilen als Mixed kennzeichnen, statt eine Hauptsprache auszuwählen.
  • Die Spracherkennung mit einer Klassifizierung der Kundenabsicht kombinieren.
  • Ein Feld Needs Review anhand Deiner eigenen Schwellenwerte ergänzen.
  • Bei mehrdeutigen Zeilen eine kurze Begründung für das Audit ausgeben.
  • Regionale Varianten oder Produktnamen nach eigenen Regeln behandeln.

Datablist kann mit dem Ask ChatGPT/OpenAI Enrichment ChatGPT Prompts für CSV- oder Excel-Zeilen ausführen. Mit Prompt-Variablen fügst Du die jeweiligen Zeilenwerte in den Prompt ein.

Hier ist ein einfacher Prompt für denselben Profildatensatz:

Ermittle die Hauptsprache dieses Textes.

Text:
{{Bio}}

Wenn der Text leer ist, überwiegend aus Zahlen besteht, eine URL enthält oder für eine zuverlässige Entscheidung zu kurz ist, gib "No result" zurück und setze Needs review auf Yes.

Verwende definierte Outputs:

Output-NameTypAnweisungen
Language nameTextHauptsprache der Bio oder Headline. Gib No result zurück, wenn nicht genügend Sprachsignale vorhanden sind.
ISO 639-1 codeTextZweistelliger Code wie en, fr, es oder de. Lass das Feld leer, wenn kein Ergebnis vorliegt.
ConfidenceSelect oder TextHigh, Medium oder Low.
Needs reviewSelect oder TextYes bei leeren, mehrdeutigen, mehrsprachigen Texten oder niedriger Konfidenz. Andernfalls No.
ReasonTextOptionale kurze Notiz für Audit-Workflows. Überspringe sie, wenn Du nur Labels benötigst.

🔍 Nutze ChatGPT für Regeln, nicht für Routineerkennung

Wenn der Output mehr Beurteilung als nur die Frage „Welche Sprache ist das?“ erfordert, ist ChatGPT hilfreich. Benötigst Du lediglich Sprachcodes, solltest Du beim speziellen Enrichment bleiben.

Der häufigste Fehler besteht darin, ChatGPT um einen ganzen Absatz als Antwort zu bitten. Dadurch entsteht zusätzlicher Bereinigungsaufwand. Speichere jeden Output in einer eigenen Spalte, damit Du die Daten filtern, sortieren, exportieren und wiederverwenden kannst.

Checkliste zur Qualitätskontrolle

Bevor ich die angereicherte Datei verwende, prüfe ich normalerweise folgende Zeilen:

  • 20 bis 50 zufällige Zeilen aus mehreren erkannten Sprachen.
  • Zeilen mit Low oder Very Low als Konfidenz.
  • Zeilen mit ungültigem Input oder ohne Ergebnis.
  • Kurze Bios, Handles, URLs, Zahlen und Texte, die nur aus Firmennamen bestehen.
  • Mehrsprachige Zeilen, bei denen die „Hauptsprache“ subjektiv sein kann.
  • Die vom nächsten Tool erwarteten ISO-Codes.

Der richtige Schwellenwert hängt vom jeweiligen Workflow ab. Bei der Vorbereitung einer Übersetzung ist eine kleine manuelle Prüfliste normalerweise kein Problem. Das Routing im Customer Support erfordert mehr Sorgfalt, weil ein falsches Sprachergebnis ein Ticket an die falsche Person weiterleiten kann. Auch bei der Outreach-Segmentierung solltest Du die Ergebnisse prüfen, denn eine Nachricht in der falschen Sprache wirkt nachlässig.

Für die meisten Dateien gilt daher: Vertraue High, prüfe Medium bei kurzen Texten und kontrolliere alle Zeilen mit Low, Very Low, ungültigem Input oder ohne Ergebnis.

Anwendungsfälle und Varianten

Support-Teams können die Sprache eines Tickets vor dem Routing erkennen. Das ist hilfreich, wenn Nachrichten aus mehreren Ländern in einem gemeinsamen Postfach eingehen und das Team eine schnelle erste Einordnung benötigt.

Umfrageteams können die Sprache offener Antworten vor der Analyse erkennen. Ich würde das vor der Übersetzung erledigen, damit die Quelldaten übersichtlich bleiben.

Sales- und Recruiting-Teams können Profil-Bios vor dem Outreach segmentieren. Eine Spalte mit dem Sprachcode erleichtert es, Verantwortliche zuzuweisen oder lokalisierte Nachrichten vorzubereiten.

E-Commerce-Teams können die Sprache von Produktbeschreibungen vor der Lokalisierung erkennen. Enthält ein Katalog gemischte Inhalte verschiedener Lieferanten, trennt die Spracherkennung übersetzungsbedürftige Texte von bereits fertigen Inhalten.

Auch Scraping-Workflows profitieren von diesem Muster. Wenn Du Webseiten aus mehreren Märkten extrahierst, solltest Du zuerst die Seitensprache erkennen und anschließend entscheiden, welche Inhalte Du behalten, übersetzen oder verwerfen möchtest.

Wenn Deine Spalte Bio in vielen Zeilen leer ist, führe das Enrichment für Headline aus oder kombiniere beide Felder im Input. Ich kombiniere Felder normalerweise, wenn jedes für sich nur einen kurzen Text enthält. Ein einzelnes Feld reicht aus, wenn es bereits vollständige Sätze enthält.

Fehlerbehebung

Wenn der Text leer ist, musst Du mit ungültigen Daten oder einem fehlenden Ergebnis rechnen. Filtere diese Zeilen und entscheide, ob Du sie entfernen oder ein anderes Textfeld ergänzen möchtest.

Besteht eine Zeile nur aus einer URL, einem Handle, einer Zahl, einer ID oder einem Markennamen, solltest Du dem Ergebnis nicht automatisch vertrauen. Solche Werte liefern der Spracherkennung nur wenige verwertbare Hinweise.

Bei einer mehrsprachigen Zeile solltest Du das Ergebnis als Hauptsprache interpretieren und die Konfidenz prüfen. Für strengere Workflows kannst Du mit ChatGPT oder einer manuellen Prüfung ein separates Label Mixed erstellen.

Wenn eine seltene Sprache in Deiner Datei erscheint, prüfe einige Beispiele, bevor Du das Ergebnis im großen Stil verwendest. Das Enrichment unterstützt viele gängige Sprachen, doch bei Sonderfällen ist eine Stichprobe vor dem Export weiterhin die sicherste Vorgehensweise.

Bei großen Dateien solltest Du zunächst die ersten zehn Zeilen und bei Bedarf anschließend eine größere Stichprobe verarbeiten. Sobald die Input-Zuordnung und Output-Spalten korrekt aussehen, kannst Du den gesamten Datensatz starten.

Fazit

Am praktischsten erkennst Du Sprachen in einer Tabelle mit einem zeilenbasierten Workflow. Importiere die CSV- oder Excel-Datei, wähle Detect Language from a Text, lege eine oder mehrere Textspalten fest und erstelle Outputs für Sprachname, Code und Konfidenz. Prüfe anschließend die Zeilen mit niedriger Konfidenz, bevor Du die Datei exportierst.

Für die normale Spracherkennung solltest Du das spezielle Enrichment verwenden. Es liefert Dir die benötigten Spalten, ohne dass Du Code schreiben oder einen eigenen Prompt erstellen musst. Außerdem bleiben die Kosten pro Zeile konstant. ChatGPT eignet sich, wenn Du Business-Regeln, Labels für mehrsprachige Inhalte oder zusätzliche Prüflogik benötigst.

Starte mit einem kleinen Testlauf, kontrolliere die Ergebnisse und verarbeite anschließend die vollständige Datei. Diese kurze Prüfung spart normalerweise deutlich mehr Zeit, als sie kostet.

FAQ

Wie erkenne ich die Sprache jeder Zeile in einer CSV-Datei?

Importiere die CSV-Datei in Datablist, wähle im Menü Enrich die Option Detect Language from a Text, ordne im Schritt Inputs die Textspalte zu und speichere Sprachname, Code und Konfidenz in neuen Spalten.

Kann ich Sprachen in Excel-Zeilen ohne Programmierung erkennen?

Ja. Importiere die Excel-Datei in Datablist und führe das Language Detection Enrichment für die Textspalte aus. Die Ergebnisse werden in den Datensatz geschrieben und können anschließend als CSV- oder Excel-Datei exportiert werden.

Welche Output-Spalten sollte ich hinzufügen?

Verwende Language Name, Language Code und Language Confidence. Ergänze eine Spalte Needs Review, wenn Du Zeilen mit Low, Very Low, ungültigem Input oder ohne Ergebnis isolieren möchtest.

Was bedeutet die Konfidenz der Spracherkennung?

Die Konfidenz zeigt Dir, wie zuverlässig die erkannte Sprache voraussichtlich ist. Nutze sie als Prüfsignal. High und Medium können normalerweise direkt weiterverarbeitet werden, während Du Low und Very Low genauer kontrollieren solltest.

Was mache ich mit Ergebnissen mit niedriger Konfidenz?

Filtere sie in eine separate Prüfliste. Kontrolliere, ob der Text zu kurz oder leer ist, mehrere Sprachen enthält oder nur aus Namen, URLs, Handles beziehungsweise Zahlen besteht.

Kann ich die Sprache vor der Übersetzung einer mehrsprachigen CSV erkennen?

Ja. Ermittle zuerst die Ausgangssprache und filtere die Zeilen anschließend vor der Übersetzung nach Sprachcode. So vermeidest Du, dass Texte übersetzt werden, die bereits in der Zielsprache vorliegen.

Wie viel kostet die Spracherkennung großer Datenmengen?

Detect Language from a Text kostet 0.05 Credits pro Zeile. Bei 20.000 Credits für 20 US-Dollar entspricht das etwa 0,05 US-Dollar für 1.000 Zeilen, 0,50 US-Dollar für 10.000 Zeilen und 5 US-Dollar für 100.000 Zeilen. Neue Nutzer mit einer geschäftlichen E-Mail-Domain können den Workflow mit 500 kostenlosen Credits testen. Das reicht für 10.000 Erkennungen.

Sollte ich ChatGPT für die Spracherkennung großer Datenmengen verwenden?

Nutze ChatGPT, wenn Du individuelle Regeln oder eine kombinierte Klassifizierung benötigst. Für die reine Spracherkennung ist das spezielle Language Detection Enrichment die einfachere erste Wahl und bietet feste Kosten pro Zeile. ChatGPT/OpenAI kann bei langen Texten teurer werden, weil die Kosten eines LLM von der Anzahl der Tokens abhängen.

Was passiert bei leerem Text, einer URL oder sehr kurzen Inhalten?

Leerer Text ist ungültig. Text ohne eindeutige sprachliche Merkmale kann kein Ergebnis oder nur eine niedrige Konfidenz liefern. Filtere diese Zeilen vor dem Export oder der Übersetzung.

Kann ich die Sprache anhand von Profil-Headlines statt Bios erkennen?

Ja, allerdings sind Headlines oft kurz. Kombiniere nach Möglichkeit Headline und Bio im Input, damit Datablist mehr Text für die Analyse zur Verfügung steht.

Kann ich Sprachnamen und ISO-Codes wieder als CSV oder Excel exportieren?

Ja. Nach der Ausführung des Enrichments exportierst Du den Datensatz zusammen mit dem Originaltext, dem Sprachnamen, dem Sprachcode, der Konfidenz und den Prüffeldern.