Wenn Du CSV-Dateien online vergleichen möchtest, solltest Du vor allem eines vermeiden: einen reinen Text-Diff. CSV-Dateien enthalten strukturierte Daten. Zeilen verschieben sich, Spalten werden umbenannt, Exporte erhalten neue Felder – und ein Vergleich Zeile für Zeile wird schnell unübersichtlich.

Ich vergleiche die Dateien lieber als Tabellen: einen stabilen Schlüssel auswählen, die Spalten zuordnen, hinzugefügte, entfernte, geänderte und unveränderte Zeilen prüfen und anschließend den Diff exportieren. Genau dafür wurde das CSV Diff tool von Datablist entwickelt.

In dieser Anleitung vergleiche ich einen älteren Produktkatalog-Export mit einer neueren Angebotsdatei eines Lieferanten. Die beiden Dateien haben nicht dieselben Spalten, enthalten aber beide EAN, Internal ID, Price und Stock. Damit haben wir ein realistisches Beispiel: Produkte über die EAN abgleichen, Preis und Bestand vergleichen und anschließend das Ergebnis exportieren.

Schnellzugriff

Der schnellste Workflow für den CSV-Vergleich

Wenn Du beide Dateien schon vorbereitet hast, ist der Ablauf kurz:

  1. Öffne das CSV Diff tool von Datablist.
  2. Lade die ältere Datei als Original CSV hoch.
  3. Lade die neuere Datei als Updated CSV hoch.
  4. Beginne mit Auto-Detect und bestätige anschließend die Schlüsselspalte.
  5. Ordne die Spalten zu, falls die Dateien unterschiedliche Bezeichnungen verwenden.
  6. Behalte für die erste Prüfung den Full Outer Join bei.
  7. Prüfe geänderte, hinzugefügte, entfernte und unveränderte Zeilen.
  8. Exportiere im ersten Durchlauf den vollständigen Diff als CSV.
  9. Wechsle zum Export der geänderten Zeilen, wenn Du eine kompaktere Datei zur Weitergabe brauchst.

Das funktioniert besser als ein Text-Diff, weil der Vergleich Datensätzen statt Zeilennummern folgt. Wenn ein CRM-Export Kontakte neu sortiert oder ein Lieferant eine Spalte ergänzt, kann ein Text-Diff den Eindruck erwecken, die gesamte Datei habe sich verändert. Ein Tabellen-Diff zeigt Dir dagegen, welche Datensätze und Zellen tatsächlich geändert wurden.

🔑 Lege den Zeilenschlüssel fest, bevor Du den Diff bewertest

Eine gute Schlüsselspalte macht aus einem unübersichtlichen Vergleich einen brauchbaren. Nutze eine ID, E-Mail-Adresse, SKU, EAN oder interne Kennung, die zwischen den Exporten stabil bleibt.

Beispieldaten: Products CSV vs. Offers CSV

Für diese Anleitung verwende ich einen fiktiven E-Commerce-Datensatz. Die erste Datei ist ein älterer Export des Produktkatalogs. Die zweite Datei ist ein neuerer Angebots-Feed eines Lieferanten oder Marktplatzes.

Die ursprüngliche Products CSV sieht so aus:

IndexEANInternal IDNameBrandCategoryPriceCurrencyStockAvailability
15901234123457PRD-001Trinkflasche mit dichtem VerschlussAcme OutdoorOutdoor24.90EUR42Auf Lager
25901234123464PRD-002Bento-LunchboxNorthlineKüche18.50EUR120Auf Lager
35901234123471PRD-003Baumwoll-TragetascheUrban GoodsAccessoires9.90EUR0Nicht auf Lager
45901234123488PRD-004LED-SchreibtischlampeLumaBüro39.00EUR18Auf Lager
55901234123495PRD-005YogamatteBalanceFitSport29.00EUR65Auf Lager
105901234123549PRD-010Kabellose MausClickProElektronik34.00EUR55Auf Lager

Die aktualisierte Offers CSV enthält weniger beschreibende Felder, aber weiterhin die Kennungen und Geschäftsdaten, die für mich relevant sind:

Offer IDEANInternal IDSupplier SKUStockPrice
OFF-0015901234123457PRD-001ACM-BTL-013823.90
OFF-0025901234123464PRD-002NTH-LBX-0212018.50
OFF-0035901234123471PRD-003UGD-TOTE-03259.90
OFF-0045901234123488PRD-004LMA-LAMP-041835.00
OFF-0055901234123495PRD-005BFT-MAT-056529.00
OFF-0085901234123556PRD-011CLP-CAB-114416.50

Dieses Dateipaar enthält genau die Fälle, die ich in einem Beispiel für einen CSV-Diff sehen möchte: geänderte Werte, neue Zeilen, entfernte Zeilen, unveränderte Zeilen und unterschiedliche Schemata. Beim vollständigen Beispieldatensatz erwarte ich, dass PRD-001, PRD-003, PRD-004, PRD-006 und PRD-010 als geändert erkannt werden. PRD-011 und PRD-012 sollten hinzugefügt, PRD-008 und PRD-009 entfernt worden sein.

Schritt 1: Ursprüngliche und aktualisierte CSV-Datei hochladen

Öffne das CSV Diff tool. Du siehst zwei Upload-Bereiche:

  • Original CSV: der frühere Export, ein älterer Snapshot oder die Ausgangsdatei.
  • Updated CSV: der neuere Export, den Du mit dem Original vergleichen möchtest.

Die Reihenfolge ist wichtig. Existiert eine Zeile nur in der aktualisierten Datei, markiert Datablist sie als added. Existiert sie nur in der ursprünglichen Datei, wird sie als removed markiert.

Im Produktbeispiel lade ich die Products CSV als Originaldatei hoch, weil sie der ältere Katalogexport ist. Die Offers CSV lade ich als aktualisierte Datei hoch, da sie den neueren Lieferanten-Feed darstellt.

Upload-Ansicht des CSV Diff tools mit Eingabefeldern für Original CSV und Updated CSV
Upload-Ansicht des CSV Diff tools mit Eingabefeldern für Original CSV und Updated CSV

Nachdem Du beide Dateien ausgewählt hast, liest das Tool sie ein und bereitet den ersten Vergleich vor. Die CSV-Dateien werden direkt in Deinem Browser verarbeitet und verglichen. Der Parser erkennt gängige Trennzeichen wie Komma, Semikolon, Tabulator und Pipe und unterstützt verbreitete Kodierungen wie UTF-8 sowie Dateien im Stil von Windows-1252.

Bevor ich das Ergebnis prüfe, kontrolliere ich trotzdem noch einmal die Reihenfolge. Viele fehlerhafte CSV-Vergleiche entstehen dadurch, dass alte und neue Datei vertauscht und hinzugefügte sowie entfernte Zeilen anschließend verkehrt herum interpretiert werden.

Schritt 2: Festlegen, wie Zeilen abgeglichen werden

Der Zeilenabgleich ist die wichtigste Einstellung im gesamten Workflow.

Datablist kann zunächst Auto-Detect verwenden. Dabei sucht das Tool nach wahrscheinlichen Identifikationsspalten wie id, email, sku, uuid, external_id, record_id, user_id, contact_id und company_id.

Bei Produktdaten bevorzuge ich normalerweise:

  • EAN, wenn sie vorhanden und eindeutig ist.
  • Internal ID, wenn EAN-Werte fehlen, doppelt vorkommen oder lieferantenspezifisch sind.
  • SKU nur dann, wenn in beiden Dateien dieselbe SKU verwendet wird.

Bei CRM- oder Lead-Dateien kann der entsprechende Schlüssel email, contact_id, company_id oder eine CRM-Datensatz-ID sein.

CSV-Diff-Einstellungen mit Auto-Detect für den Zeilenabgleich und Full Outer Join
CSV-Diff-Einstellungen mit Auto-Detect für den Zeilenabgleich und Full Outer Join

Welcher Matching-Modus passt, hängt von der Struktur Deiner Daten ab:

  • Verwende für die meisten Exporte den Abgleich über einen einzelnen Schlüssel. Eine stabile Spalte lässt sich leichter prüfen.
  • Nutze mehrere Schlüssel, wenn eine Spalte allein nicht eindeutig genug ist, zum Beispiel Company Domain zusammen mit Email.
  • Verwende den Vergleich vollständiger Zeilen nur, wenn Du keine stabile Kennung hast.
  • Nutze Auto-Detect für den ersten Durchlauf und bestätige anschließend den erkannten Schlüssel, bevor Du Dich auf die Zahlen verlässt.

⚠️ Ein schwacher Schlüssel erzeugt viele falsche Zu- und Abgänge

Fehlt der Schlüssel, kommt er mehrfach vor oder wurde er zwischen den Exporten umformatiert, können zusammengehörige Datensätze als eine entfernte und eine hinzugefügte Zeile erscheinen. Prüfe Hinweise auf doppelte Schlüssel, bevor Du das Ergebnis für ein Update verwendest.

Doppelte Schlüssel sind kein Grund, den Diff zu ignorieren. Sie sind aber ein Signal, genauer hinzusehen. Das Tool kennzeichnet doppelte Schlüssel, und ich prüfe diese Datensätze, bevor ich mich auf die ermittelten Zahlen verlasse.

Schritt 3: Unterschiedlich benannte Spalten zuordnen

Über das Spalten-Mapping legst Du fest, welche Felder verglichen werden.

Im Produktbeispiel enthalten beide Dateien EAN, Internal ID, Stock und Price. Die ursprüngliche Datei umfasst außerdem Name, Brand, Category, Currency und Availability. In der aktualisierten Datei kommen Offer ID und Supplier SKU hinzu.

Lieferantenspezifische Metadaten sollen hier keine Änderungen auslösen. Ich möchte nur die Spalten vergleichen, die meine geschäftliche Frage beantworten:

  • Zeilen über EAN abgleichen.
  • Stock mit Stock vergleichen.
  • Price mit Price vergleichen.
  • Beschreibende Spalten als Kontext behalten, wenn sie die Prüfung erleichtern.
  • Nicht relevante Felder ohne Zuordnung lassen, damit sie den Vergleich nicht beeinflussen.

Wenn die Spaltennamen identisch sind, kann Datablist sie anhand ihrer Bezeichnung ausrichten. Die Reihenfolge der Spalten muss nicht übereinstimmen. Ein manuelles Mapping ist wichtig, wenn sich Bezeichnungen geändert haben. Ein CRM-Export könnte in einer Datei customer_id und in der anderen Customer ID verwenden. Ordne diese Felder nur zu, wenn sie tatsächlich denselben Wert darstellen.

💡 Ordne nur die Spalten zu, die Du vergleichen möchtest

In Lieferanten-Feeds und CRM-Exporten tauchen häufig neue Metadatenspalten auf. Soll ein Feld nicht als Änderung zählen, lass es ohne Zuordnung oder nutze es bei der Prüfung lediglich als Kontext.

Dieser Schritt wirkt unscheinbar, spart aber meistens die meiste Zeit. Ein falscher Schlüssel führt zu einem schlechten Zeilenabgleich. Ein falsches Spalten-Mapping verfälscht die Anzahl der Änderungen.

Schritt 4: Join-Typ und Vergleichsoptionen auswählen

Für den ersten Durchlauf empfehle ich diese Einstellungen:

  • Full Outer Join.
  • Eine stabile Schlüsselspalte.
  • Führende und nachgestellte Leerzeichen ignorieren.
  • Leere und null-ähnliche Werte normalisieren.
  • Groß- und Kleinschreibung berücksichtigen, sofern sie nicht irrelevant ist.

Der Full Outer Join ist die beste Standardeinstellung, weil er alles zeigt: übereinstimmende, hinzugefügte und entfernte Zeilen. So erhältst Du zunächst einen vollständigen Überblick, bevor Du das Ergebnis eingrenzt.

CSV-Diff-Vergleichseinstellungen für Spaltenreihenfolge, Leerzeichen, Groß- und Kleinschreibung sowie die Normalisierung null-ähnlicher Werte
CSV-Diff-Vergleichseinstellungen für Spaltenreihenfolge, Leerzeichen, Groß- und Kleinschreibung sowie die Normalisierung null-ähnlicher Werte

Der Join-Typ bestimmt, was im Ergebnis erscheint:

  • Der Full Outer Join zeigt übereinstimmende Zeilen sowie Zeilen, die nur in der ursprünglichen oder nur in der aktualisierten Datei vorkommen.
  • Der Inner Join zeigt ausschließlich Datensätze, die in beiden Dateien vorhanden sind. Nutze ihn, wenn Dich nur Änderungen an gemeinsamen Zeilen interessieren.
  • Der Left Join verwendet die ursprüngliche Datei als Basis und schließt Zeilen aus, die nur in der aktualisierten Datei vorkommen.

Die Vergleichsoptionen reduzieren Unterschiede, die lediglich durch die Formatierung entstehen:

  • Ignore whitespace entfernt vor dem Zellvergleich führende und nachgestellte Leerzeichen.
  • Ignore case behandelt Acme und ACME als gleich.
  • Die Normalisierung leerer und null-ähnlicher Werte behandelt leere Felder, null, undefined, nil, none, n/a und na als gleichwertige Platzhalter.

📘 Nutze für die erste Prüfung den Full Outer Join

Beginne mit dem Gesamtbild und grenze es dann ein. Sobald die Anzahl der hinzugefügten, entfernten und geänderten Zeilen plausibel ist, kannst Du eine kompaktere Datei mit den geänderten Zeilen exportieren.

Bei großen Dateien kommt es auf die Leistung Deines Browsers und Geräts an. Damit das Tool reaktionsschnell bleibt, ist die Vorschau begrenzt. Die herunterladbare CSV basiert dagegen auf dem vollständigen Ergebnis. Ist ein Export zu groß, um ihn bequem zu prüfen, kannst Du die große CSV-Datei zunächst in kleinere Dateien aufteilen.

Schritt 5: Hinzugefügte, entfernte, geänderte und unveränderte Zeilen prüfen

Sobald der Vergleich abgeschlossen ist, prüfst Du zuerst den Status der Zeilen:

  • added: Der Schlüssel existiert nur in der aktualisierten CSV.
  • removed: Der Schlüssel existiert nur in der ursprünglichen CSV.
  • changed: Der Schlüssel kommt in beiden Dateien vor und mindestens ein zugeordneter Wert hat sich geändert.
  • unchanged: Der Schlüssel kommt in beiden Dateien vor und die zugeordneten Werte stimmen nach der Normalisierung überein.

Das Produktbeispiel liefert eindeutige Fälle:

  • PRD-001 wurde geändert, weil Price von 24.90 auf 23.90 und Stock von 42 auf 38 gesunken ist.
  • PRD-003 wurde geändert, weil der Bestand von 0 auf 25 gestiegen ist.
  • PRD-011 wurde hinzugefügt, weil seine EAN nur in der Offers CSV vorkommt.
  • PRD-008 wurde entfernt, weil seine EAN nur in der Products CSV vorkommt.

Nutze die Statusfilter, um Deine Prüfung zu fokussieren. Ich beginne normalerweise mit Changed und kontrolliere danach Added und Removed. Unchanged sehe ich mir zuletzt an – außer ich benötige einen vollständigen Audit-Trail.

CSV-Diff-Vorschautabelle mit Statusfiltern, Suche sowie Aktionen zum Kopieren und Herunterladen
CSV-Diff-Vorschautabelle mit Statusfiltern, Suche sowie Aktionen zum Kopieren und Herunterladen

Die Ansicht der geänderten Zeilen ist hilfreich, wenn Du Unterschiede auf Zellebene prüfen möchtest. Für jede geänderte Spalte werden der ursprüngliche und der aktualisierte Wert nebeneinander angezeigt.

Ansicht geänderter CSV-Diff-Zeilen mit ursprünglichen und aktualisierten Zellwerten im direkten Vergleich
Ansicht geänderter CSV-Diff-Zeilen mit ursprünglichen und aktualisierten Zellwerten im direkten Vergleich

Vor dem Export gehe ich eine kurze Qualitätskontrolle durch:

  • Wirkt die Anzahl hinzugefügter und entfernter Zeilen plausibel?
  • Hat das Tool die Zeilen anhand des erwarteten Schlüssels abgeglichen?
  • Sind doppelte Schlüssel markiert?
  • Wurden die Spalten korrekt zugeordnet?
  • Werden reine Formatierungsunterschiede ignoriert, wenn sie keine Rolle spielen sollen?
  • Sind einige stichprobenartig aufgeklappte Änderungen nachvollziehbar?

Der Zusammenfassungsbereich ermöglicht eine weitere schnelle Kontrolle. Er zeigt Verarbeitungsdetails, zugeordnete Spalten, Hinweise auf doppelte Schlüssel und die Anzahl der jeweiligen Statuswerte.

CSV-Diff-Zusammenfassung mit Kennzahlen zu geänderten, hinzugefügten, entfernten und unveränderten Zeilen sowie Verarbeitung und Spalten-Mapping
CSV-Diff-Zusammenfassung mit Kennzahlen zu geänderten, hinzugefügten, entfernten und unveränderten Zeilen sowie Verarbeitung und Spalten-Mapping

Wenn die Zahlen merkwürdig aussehen, solltest Du noch nicht exportieren. Prüfe zuerst den Schlüssel und das Spalten-Mapping – dort liegen die meisten Ursachen.

Schritt 6: CSV-Diff exportieren

Wenn die Vorschau stimmt, kannst Du das Ergebnis exportieren. Datablist bietet je nach Anwendungsfall verschiedene Ausgabeformate:

  • Summary CSV: für Zeilenstatus, Schlüssel, Kennzahlen und eine übersichtliche Audit-Zusammenfassung.
  • Changed rows CSV: wenn jemand ausschließlich Datensätze mit Unterschieden prüfen soll.
  • Full diff CSV: für die Gegenüberstellung ursprünglicher und aktualisierter Werte.

Beim ersten Durchlauf bevorzuge ich die Full diff CSV. Sie enthält mehr Kontext, was hilfreich ist, wenn Du eine Änderung später erklären musst. Sobald der Workflow validiert ist, wechsle ich für eine kompaktere Datei zur Changed rows CSV.

Du kannst außerdem das Trennzeichen auswählen:

  • Komma für die meisten Spreadsheet-Workflows.
  • Semikolon, wenn Deine Regionseinstellungen oder das nachgelagerte System es erwarten.
  • Pipe oder Tabulator für Tools, die diese Formate voraussetzen.

Mit dem Tool kannst Du die CSV mit den Unterschieden kopieren oder herunterladen. Heruntergeladene Dateien folgen diesem Muster:

csv-diff-{originalBase}-vs-{updatedBase}.csv

Ist das exportierte Ergebnis sehr groß und möchtest Du es vor der Weitergabe filtern oder bearbeiten, hilft Dir die Datablist-Anleitung zum Online-Bearbeiten großer CSV-Dateien.

Beispiel für die Ausgabetabelle

So kann ein kleiner Ausschnitt aus dem vollständigen Diff-Export für unser Produktbeispiel aussehen.

statuskeychanged_columnsoriginal:Priceupdated:Priceoriginal:Stockupdated:Stock
changed5901234123457Price|Stock24.9023.904238
changed5901234123471Stock9.909.90025
added590123412355616.5044
removed59012341235257.5088

Die exportierte CSV kann folgende Felder enthalten:

  • status: added, removed, changed oder unchanged.
  • key: der Wert, mit dem die Zeile abgeglichen wurde.
  • __row_index_original: die Zeilennummer in der ursprünglichen CSV, sofern vorhanden.
  • __row_index_updated: die Zeilennummer in der aktualisierten CSV, sofern vorhanden.
  • __duplicate_key: zeigt an, ob der ausgewählte Schlüssel mehrfach vorkommt.
  • changed_columns: die geänderten Felder.
  • changed_columns_count: die Anzahl geänderter Felder.
  • summary: eine gut lesbare Zusammenfassung der Änderungen.
  • Paare aus original:{column} und updated:{column} für den direkten Vergleich.

Ich mag dieses Format, weil es sich leicht weitergeben lässt. Du kannst nach status = changed filtern, nach changed_columns_count sortieren oder hinzugefügte und entfernte Datensätze isolieren, ohne den Vergleich erneut auszuführen.

Wann sich dieser CSV-Vergleich eignet

Dieser Workflow eignet sich für alle Situationen, in denen Du zwei Snapshots hast und wissen möchtest, was sich geändert hat. Typische Beispiele sind:

  • Preis- und Bestandsaktualisierungen in Produktkatalogen.
  • Prüfung von Lieferanten-Feeds vor dem Import neuer Angebote.
  • CRM-Exporte vor und nach einer Bereinigung.
  • Aktualisierungen von Lead-Listen.
  • Vergleich von Bestands-Snapshots.
  • Prüfung übergebener Tabellen.
  • Erzeugte CSV-Exporte aus einem JSON-Konvertierungsprozess.

Wenn Du zum Beispiel zuerst verschachteltes JSON in CSV konvertierst, kannst Du anschließend mit CSV Diff zwei der erzeugten Exporte vergleichen. Bereitest Du Datensätze für ein CRM vor, führe den Diff vor einer umfassenderen Datenbereinigung aus, damit Du genau weißt, welche Zeilen sich geändert haben.

Vergleichen, verknüpfen oder Duplikate entfernen?

CSV-Dateien zu vergleichen ist nicht dasselbe wie Dateien zu verknüpfen oder zu deduplizieren. Verwende CSV Diff, wenn Deine Frage lautet:

Was hat sich zwischen diesen beiden Snapshots geändert?

Nutze einen Join-Workflow, wenn Du wissen möchtest:

Wie kombiniere ich Felder aus zwei Dateien?

Sieh Dir dazu die Anleitung zum Verknüpfen von CSV-Dateien über eine eindeutige Kennung an.

Verwende die Deduplizierung, wenn Deine Frage lautet:

Welche Datensätze kommen innerhalb einer oder mehrerer Dateien mehrfach vor?

Lies dazu die Anleitung zum Entfernen von CSV-Duplikaten.

Diese Abgrenzung ist wichtig, weil jeder Workflow ein anderes Ziel verfolgt. CSV Diff dient dazu, Snapshots zu vergleichen und einen Diff zu exportieren. Es ist weder ein Fuzzy-Matching- noch ein Merge-Tool.

Fehlerbehebung und Sonderfälle

Zeilen erscheinen als hinzugefügt und entfernt statt geändert

Prüfe zuerst die Schlüsselspalte. Wenn sich der Schlüssel zwischen den Dateien geändert hat, kann Datablist die beiden Zeilen nicht als denselben Datensatz erkennen. Kontrolliere außerdem die Reihenfolge der Dateien. Wurden Original und aktualisierte Datei vertauscht, erscheinen hinzugefügte und entfernte Zeilen genau umgekehrt.

Zu viele Zellen werden als geändert angezeigt

Prüfe die Vergleichsoptionen. Aktiviere das Entfernen überflüssiger Leerzeichen, wenn Abstände keine Rolle spielen. Vergleiche ohne Beachtung der Groß- und Kleinschreibung, wenn die Schreibweise unwichtig ist. Normalisiere leere Werte, wenn leere Felder und Platzhalter übereinstimmen sollen, und kontrolliere das Spalten-Mapping für umbenannte Felder.

Die Spaltennamen sind unterschiedlich

Nutze das manuelle Mapping. Ordne Felder nur dann einander zu, wenn sie dieselbe Bedeutung haben. Lass nicht relevante Spalten ohne Zuordnung, wenn sie den Vergleich nicht beeinflussen sollen.

Doppelte Schlüssel werden angezeigt

Betrachte doppelte Schlüssel als Signal für eine genauere Prüfung. Das Ergebnis kann weiterhin hilfreich sein, doch doppelte Schlüssel bedeuten, dass die ausgewählte Kennung nicht eindeutig genug ist. Bereinige die Quelldateien oder wähle einen besseren Schlüssel, bevor Du die Zahlen für einen Import verwendest.

Die Datei ist langsam oder die Vorschau begrenzt

Bei großen Dateien hängt die Geschwindigkeit von Deinem Browser und Gerät ab. Nutze die Vorschau zur Kontrolle und lade anschließend den CSV-Diff herunter, wenn Du das vollständige Ergebnis benötigst.

Das Einlesen der CSV schlägt fehl

Prüfe die Datei auf nicht geschlossene Anführungszeichen, ungewöhnliche Trennzeichen oder Probleme mit der Zeichenkodierung. Schon ein einziges fehlerhaftes Feld mit Anführungszeichen kann eine CSV-Datei ungültig machen.

Fazit

Zwei CSV-Exporte vergleichst Du am besten als Daten und nicht als Text. Lade die alte Datei als Original CSV und die neue als Updated CSV hoch, wähle einen stabilen Schlüssel, ordne die Spalten zu, prüfe den Zeilenstatus und exportiere den Diff.

Meine Standardeinstellung ist unkompliziert: Full Outer Join, ein stabiler Schlüssel, das Entfernen überflüssiger Leerzeichen, die Normalisierung null-ähnlicher Werte und ein vollständiger Diff-Export für die erste Prüfung.

Du kannst den Workflow mit dem CSV Diff tool von Datablist direkt ausprobieren.

FAQ

Wie kann ich zwei CSV-Dateien online vergleichen?

Öffne das CSV Diff tool von Datablist, lade die ältere Datei als Original CSV und die neuere als Updated CSV hoch, wähle eine Schlüsselspalte, prüfe das Ergebnis und lade anschließend die Diff-CSV herunter.

Kann ich CSV-Dateien nach ID, E-Mail, SKU oder EAN vergleichen?

Ja. Verwende die gemeinsame Kennung als Schlüsselspalte. Geeignet sind Datensatz-IDs, E-Mail-Adressen, SKUs, EANs, interne IDs, Unternehmens-IDs und andere Werte, die zwischen den Exporten stabil bleiben.

Was ist, wenn die Zeilen unterschiedlich sortiert sind?

Nutze den schlüsselbasierten Abgleich. Wenn die Zeilen anhand eines stabilen Schlüssels zugeordnet werden, muss ihre Reihenfolge in den beiden Dateien nicht übereinstimmen.

Kann ich CSV-Dateien mit unterschiedlichen Spaltennamen vergleichen?

Ja. Ordne die Spalten manuell zu, wenn ihre Namen abweichen. Du kannst beispielsweise customer_id aus der einen Datei Customer ID aus der anderen zuordnen, sofern beide dieselbe Kennung darstellen.

Welcher Join-Typ eignet sich am besten für einen CSV-Diff?

Nutze für die erste Prüfung den Full Outer Join. Er zeigt übereinstimmende, hinzugefügte und entfernte Zeilen. Verwende den Inner Join nur, wenn Dich ausschließlich Datensätze interessieren, die in beiden Dateien vorkommen.

Kann ich Leerzeichen, Großschreibung oder leere Werte ignorieren?

Ja. Du kannst Leerzeichen am Anfang und Ende entfernen, Text ohne Beachtung der Groß- und Kleinschreibung vergleichen und leere oder null-ähnliche Platzhalter als gleich behandeln. Ich lasse das Entfernen überflüssiger Leerzeichen und die Normalisierung leerer Werte normalerweise aktiviert.

Kann ich nur geänderte Zeilen exportieren?

Ja. Nutze die Ausgabe der geänderten Zeilen, wenn Du eine kompaktere Datei zur Prüfung brauchst. Ich empfehle trotzdem, zunächst einmal den vollständigen Diff zu exportieren, damit Du den Vergleich validieren kannst.

Was bedeuten added, removed, changed und unchanged?

added bedeutet, dass der Schlüssel nur in der aktualisierten CSV vorkommt. removed heißt, dass er nur in der ursprünglichen CSV vorhanden ist. Bei changed kommt der Schlüssel in beiden Dateien vor, aber zugeordnete Werte unterscheiden sich. unchanged bedeutet, dass der Schlüssel in beiden Dateien vorkommt und die zugeordneten Werte übereinstimmen.

Werden CSV-Dateien auf einen Server hochgeladen?

Die CSV-Dateien werden in Deinem Browser eingelesen und verglichen. Betrachte das Tool als browserbasierte Vergleichslösung und nicht als Import- oder Synchronisierungs-Workflow für eine Datablist Collection.

Kann das Tool große CSV-Dateien vergleichen?

Ja, bei sehr großen Dateien hängt die Leistung allerdings von Deinem Browser und Gerät ab. Die Vorschau ist zugunsten einer schnellen Bedienung begrenzt, während die herunterladbare CSV aus dem vollständigen Ergebnis erstellt wird.