Was ist Mojibake?

Mojibake ist Zeichensalat: ä statt ä, ü statt ü oder € statt €. Er entsteht, wenn ein Text in einer Kodierung gespeichert und in einer anderen gelesen wird – und lässt sich meistens vollständig reparieren. Füg unten einen kaputten Text ein und probier es aus.

Funktioniert mit Text und diesen Dateien:

  • CSV
  • TXT
  • JSON
  • XML
  • SRT
  • VTT
  • TSV
  • MD
  • HTML
  • SQL
  • LOG

Zum Beispiel Excel-Exporte, Datenbank-Dumps, Untertitel oder Website-Code.

Reparieren

  1. Datei ablegen oder Text einfügen
  2. Wird automatisch repariert
  3. Kopieren oder herunterladen
oder Datei einfach hierher ziehen

Woher das Wort kommt

Mojibake (文字化け) ist Japanisch: „moji“ heißt „Schriftzeichen“, „bake“ heißt „Verwandlung“. In den 1990er-Jahren liefen in Japan mehrere Kodierungen parallel – Shift_JIS, EUC-JP und ISO-2022-JP –, verstümmelte E-Mails und Webseiten waren Alltag. Das Wort hat sich gehalten und ist ins Englische und Deutsche gewandert. Im Deutschen sagt man oft einfach „Zeichensalat“ oder „kaputte Umlaute“.

Wie Zeichensalat entsteht

Computer speichern Text als Bytes. Die Kodierung legt fest, welche Bytes für welches Zeichen stehen. In UTF-8 wird ä als die zwei Bytes C3 A4 gespeichert. Ein Programm, das diese Bytes als Windows-1252 liest, zeigt pro Byte ein eigenes Zeichen: Ã für C3 und ¤ für A4.

Dabei geht nichts verloren – die Bytes sind noch da, sie werden nur falsch gelesen. Deshalb lässt sich Mojibake fast immer rückgängig machen: Mojibuster verwandelt die falschen Zeichen zurück in Bytes und liest sie richtig.

UTF-8-Text, als Windows-1252 gelesen

Mojibake

Größe, Grüße, Übermaß – 5 €

Repariert

Größe, Grüße, Übermaß – 5 €

Mojibake in anderen Sprachen

  • Japanisch: 縺薙s縺ォ縺。縺ッ statt こんにちは – UTF-8, als Shift_JIS gelesen. Mehr auf der japanischen Seite.
  • Chinesisch: 浣犲ソ statt 你好 – UTF-8, als GBK gelesen. Auf Chinesisch heißt das 乱码 (luànmǎ, „chaotischer Code“).
  • Russisch: Привет statt Привет – UTF-8, als Windows-1251 gelesen. In Russland nennt man das „Krakosjabry“.
  • Westeuropäische Sprachen: é, ñ oder ç statt é, ñ oder ç – weltweit die häufigste Form. Alle Muster: ü statt ü.

Typische Ursachen

Lässt sich Mojibake immer reparieren?

Fast immer, solange die Bytes noch intakt sind. Unmöglich wird es, wenn ein Programm die Zeichen bereits durch ? oder das Ersatzzeichen � ersetzt hat – dann ist die ursprüngliche Information weg. Mojibuster repariert alles, was sich reparieren lässt, und zeigt dir, wie viele Stellen verloren sind. Mehr dazu: Fragezeichen statt Umlaute.

So vermeidest du Mojibake

  • Dateien als UTF-8 speichern – CSV-Dateien für Excel als CSV UTF-8 (durch Trennzeichen getrennt), das schreibt eine BOM.
  • Die Kodierung angeben: <meta charset="utf-8"> in HTML, utf8mb4 in MySQL und MariaDB.
  • Text nur einmal umwandeln, an der Grenze zwischen zwei Systemen.
  • Beim Import die Kodierung selbst auswählen, statt das Programm raten zu lassen.

Häufige Fragen

Wie spricht man Mojibake aus?

Ungefähr „Mo-dschi-ba-ke“, alle vier Silben werden gesprochen. Das japanische Wort hat keine Betonung wie deutsche Wörter.

Ist meine Datei beschädigt oder infiziert?

Nein. Mojibake ist ein Anzeigeproblem, kein Virus und meist kein Datenverlust. Die Datei wird nur mit der falschen Kodierung gelesen.

Was ist der Unterschied zwischen Mojibake und �?

Zeichensalat wie ä enthält noch die ursprünglichen Bytes und lässt sich reparieren. Das Zeichen � bedeutet, dass ein Programm ein Byte nicht lesen konnte und es ersetzt hat – dieses Zeichen ist verloren.

Wird mein Text hochgeladen?

Nein. Mojibuster repariert den Text in deinem Browser. Er wird weder übertragen noch gespeichert.

Weitere Anleitungen