Réparez les caractères UTF-8 mal encodés

Qu’il vienne d’une base de données, d’un e-mail ou d’une page web : collez le texte cassé et Mojibuster retransforme é, € et ’ en é, et .

Fonctionne avec du texte et ces fichiers :

  • CSV
  • TXT
  • JSON
  • XML
  • SRT
  • VTT
  • TSV
  • MD
  • HTML
  • SQL
  • LOG

Par exemple des exports Excel, des sauvegardes de bases de données, des sous-titres ou du code de site web.

Réparer

  1. Déposez un fichier ou collez du texte
  2. La réparation est automatique
  3. Copiez ou téléchargez
ou glissez simplement un fichier ici
  • Aucun envoi de fichier. Vos fichiers sont réparés directement dans votre navigateur et ne quittent jamais votre appareil.

  • Serveurs dans l’UE. Mojibuster tourne sur un serveur en Finlande (UE) ; le règlement général sur la protection des données (RGPD) s’applique. Texte du RGPD (EUR-Lex)

Qu’est-ce que le mojibake ?

Le mojibake, ce sont des caractères illisibles qui apparaissent quand un texte est enregistré dans un encodage et lu dans un autre. Le plus souvent, un texte UTF-8 est lu par erreur en Windows-1252 ou en ISO-8859-1. Chaque octet d’un caractère spécial apparaît alors comme un caractère à part.

Causes fréquentes

  • La connexion à la base de données utilise latin1 alors que les données sont en UTF-8.
  • Le serveur web envoie charset=ISO-8859-1, mais la page est enregistrée en UTF-8.
  • Un logiciel de messagerie ou d’envoi de newsletters déclare un mauvais encodage.
  • Un ancien site ou un WordPress migré mélange des données en Latin-1 et en UTF-8.
  • Un texte est copié entre des programmes qui attendent des encodages différents.

Cassé deux fois : é

Si un texte déjà cassé est de nouveau mal converti, on obtient un double mojibake : é devient d’abord é, puis é. Mojibuster reconnaît aussi ces niveaux et en répare jusqu’à trois d’un coup.

Pour les développeurs : corriger la cause

  • Déclarez <meta charset="utf-8"> dans le HTML et envoyez l’en-tête Content-Type: text/html; charset=utf-8.
  • Utilisez utf8mb4 dans MySQL et MariaDB pour les tables et la connexion (SET NAMES utf8mb4).
  • Enregistrez les fichiers source en UTF-8 sans BOM.
  • Ne convertissez le texte qu’une seule fois : à la frontière entre votre système et l’extérieur.

Questions fréquentes

Que signifie le caractère � ?

C’est le caractère de remplacement U+FFFD. Un programme l’insère lorsqu’il n’a pas pu lire un octet. Le caractère d’origine est alors perdu ; Mojibuster vous indique combien de positions sont concernées.

Puis-je aussi convertir des codes HTML comme &eacute; ?

Oui. Activez l’option Convertir aussi les codes HTML. Les codes comme &eacute;, &#233; et &#xE9; sont alors transformés en vrais caractères.

Mon texte est-il stocké ?

Non. La réparation se fait dans votre navigateur. Le texte n’est ni transmis ni stocké.

Cela fonctionne-t-il avec d’autres langues ?

Oui. Mojibuster répare tout caractère mal lu depuis l’UTF-8, par exemple les accents espagnols et portugais, les trémas allemands, les emojis ou l’écriture japonaise.

Autres guides