Zum Hauptinhalt springen

Seltsame Zeichen in CSV-Dateien: So behebst du sie

Nichts wird hochgeladenGetestet bis 150 MB

Warum Umlaute und Sonderzeichen in CSV-Dateien als Mojibake erscheinen, wie du die Quellcodierung erkennst und wann ein Encoding-Wechsel nicht hilft.

Veröffentlicht: 2026-08-28Aktualisiert: 2026-09-083 minCSV-Encoding korrigieren
Illustration des Datenablaufs für „Seltsame Zeichen in CSV-Dateien: So behebst du sie“

Wenn aus Müller plötzlich Müller wird, ist meist nicht der Name beschädigt. Die Datei wurde mit einer anderen Zeichencodierung gelesen, als beim Export verwendet wurde. Entscheidend ist deshalb die Quellcodierung der Originaldatei.

Erst prüfen, woher die Datei kommt

Bei deutschen CSV-Dateien sind ältere Windows-Programme, Warenwirtschaft, Lohn- oder Buchhaltungssoftware typische Stellen, an denen noch eine ältere Windows-Codierung auftauchen kann. Neuere Systeme exportieren häufig UTF-8. Aus dem Dateinamen lässt sich das nicht zuverlässig ablesen.

Ein gutes Prüfbeispiel enthält Umlaute, ß und ein Eurozeichen:

Prüfzeile für eine deutsche Exportdatei

kundennr;name;ort;betrag
K-42;Müller & Söhne;Köln;19,95 €

Wenn dieselbe Datei in einem Editor korrekt aussieht, in Excel aber nicht, liegt der Verdacht auf der Import-Einstellung. In der deutschen Excel-Oberfläche kannst du über Daten › Aus Text/CSV importieren und im Dialog den Dateiursprung beziehungsweise die erkannte Codierung prüfen, statt die Datei nur per Doppelklick zu öffnen.

Was typische Zeichenfolgen verraten

ü, ö oder ß sind klassische Hinweise darauf, dass UTF-8-Bytes als eine ältere Ein-Byte-Codierung interpretiert wurden. Ein einzelnes � ist weniger eindeutig: Es zeigt nur, dass die gewählte Decodierung an dieser Stelle keinen gültigen Text ergeben hat.

Darum ist „Suchen und Ersetzen“ keine gute Reparaturstrategie. Die gleiche falsche Zeichenfolge kann je nach Ursprung etwas anderes bedeuten, und bereits korrektes Textmaterial würde leicht mitverändert.

Original richtig lesen, danach neu speichern

Arbeite mit der unveränderten Quelldatei. Wähle die Codierung, die zum Exportprogramm passt, kontrolliere mehrere bekannte Werte und speichere erst dann eine neue UTF-8-Datei.

Nablyx verwendet dafür bewusst eine vorsichtige Erkennungsreihenfolge. Eine Byte-Order-Mark für UTF-8, UTF-16LE oder UTF-16BE hat Vorrang. Fehlt sie, muss die Datei zunächst als gültiges UTF-8 durchgehen. Scheitert diese Prüfung, fällt das Werkzeug auf Windows-1252 zurück und meldet diesen Fallback, damit du ihn als weniger sichere Vermutung und nicht als Gewissheit behandeln kannst.

Die reparierte UTF-8-Datei kann größer sein als die Quelldatei. Windows-1252 speichert viele Zeichen mit Akzent in einem Byte, während dieselben Zeichen in UTF-8 mehrere Bytes benötigen. Eine größere Ausgabedatei ist nach einer erfolgreichen Reparatur daher für sich allein kein Hinweis darauf, dass Zeilen hinzugefügt oder dupliziert wurden.

Originaldatei mit der passenden Codierung lesen

Ein Encoding-Problem ist kein Trennzeichen- oder Strukturproblem

Die deutsche Excel-Umgebung macht diese Unterscheidung besonders wichtig: Wegen Dezimalkomma und dem häufig verwendeten Semikolon als Listentrennzeichen kann eine CSV zusätzlich ein Trennzeichenproblem haben. Das ist aber eine andere Fehlerklasse.

  • Lesbare Werte, alles in Spalte A: Import oder Trennzeichen prüfen.
  • Umlaute kaputt, Spalten ansonsten korrekt: Encoding prüfen.
  • Zeilen springen ab einer bestimmten Stelle in andere Spalten: CSV-Struktur und Anführungszeichen prüfen.
  • Doppelte oder leere Spaltennamen: Kopfzeile strukturell bereinigen.

Ein Encoding-Wechsel setzt keine verrutschten Felder zurück und schließt keine fehlenden Anführungszeichen. Für solche Fälle hilft die Diagnose einer beschädigten CSV-Datei.

Kontrolle nach der Korrektur

Prüfe nicht nur äöü, sondern echte Geschäftsdaten: Namen, Straßennamen, Währungszeichen und Freitext. Öffne die neue Datei anschließend über denselben Excel-Importweg, den die Empfängerin später nutzt. So erkennst du sofort, ob die Zeichen korrekt sind und die Spaltenstruktur unverändert geblieben ist.

Transformation ansehen

Fehlerhafter Text und gemischte Trennzeichen werden zu einer verlässlichen CSV

Reparieren Sie unleserlichen Text und uneinheitliche Trennzeichen, ohne die eigentlichen Zellwerte zu verändern.

Eingabe
name;city;note
José;München,West;"ready"
Chloë|Zürich;review
Ergebnis
name;city;note
José;"München,West";ready
Chloë;Zürich;review