é au lieu de é : reconnaître et réparer les accents cassés

Votre texte affiche é au lieu de é, è au lieu de è ou ç au lieu de ç ? Un texte UTF-8 a été lu en Windows-1252, mais les caractères ne sont pas perdus. Collez le texte ci-dessus ou déposez le fichier : Mojibuster le répare aussitôt.

Fonctionne avec du texte et ces fichiers :

  • CSV
  • TXT
  • JSON
  • XML
  • SRT
  • VTT
  • TSV
  • MD
  • HTML
  • SQL
  • LOG

Par exemple des exports Excel, des sauvegardes de bases de données, des sous-titres ou du code de site web.

Réparer

  1. Déposez un fichier ou collez du texte
  2. La réparation est automatique
  3. Copiez ou téléchargez
ou glissez simplement un fichier ici
  • Aucun envoi de fichier. Vos fichiers sont réparés directement dans votre navigateur et ne quittent jamais votre appareil.

  • Serveurs dans l’UE. Mojibuster tourne sur un serveur en Finlande (UE) ; le règlement général sur la protection des données (RGPD) s’applique. Texte du RGPD (EUR-Lex)

Pourquoi un é devient deux caractères

En UTF-8, chaque lettre accentuée occupe deux octets : é correspond à C3 et A9. Un programme qui lit le fichier en Windows-1252 fait de chaque octet un caractère à part : C3 devient Ã, A9 devient ©. Voilà pourquoi presque tous les accents cassés commencent par à – le second caractère indique la lettre d’origine.

Une phrase enregistrée en UTF-8 et lue en Windows-1252

Avant

Déjà l’été ! Le garçon a goûté une crème brûlée à Noël, c’est très français.

Après

Déjà l’été ! Le garçon a goûté une crème brûlée à Noël, c’est très français.

Les motifs les plus fréquents en français

  • é → é, è → è, ê → ê, ë → ë
  • à suivi d’une espace → à (voir plus bas), â → â, ç → ç
  • î → î, ï → ï, ô → ô, ù → ù, û → û
  • É → É, Ç → Ç, À → À
  • Å“ → œ (cœur, sœur), € → €
  • ’ → ’, « et » → « et » – voir apostrophes et guillemets cassés

Le tableau complet se trouve plus bas. Si le charabia est plus long, comme é, le texte a été encodé deux fois : Mojibuster répare aussi ce double mojibake, jusqu’à trois niveaux. Le principe est expliqué en détail sur la page qu’est-ce que le mojibake.

Le piège du à

Le second octet de à, A0, est une espace insécable en Windows-1252. voilà devient donc voilà suivi d’une espace qui passe inaperçue. Tant que cette espace insécable est présente, Mojibuster rétablit le à. Si un copier-coller l’a transformée en espace normale, rien ne prouve plus qu’il s’agissait d’un à, et Mojibuster laisse cet endroit tel quel. Déposez donc de préférence le fichier d’origine plutôt que du texte copié.

Remplacer à la main ? Mieux vaut éviter

Vous pourriez remplacer é par é avec Rechercher/Remplacer. Cela ne marche que si vous connaissez toutes les erreurs – et le à avec son espace invisible passe facilement à travers. En plus, un à isolé peut être un vrai à dans un texte portugais. Mojibuster vérifie chaque endroit octet par octet et ne change que ce qui est clairement cassé.

D’où vient le problème

Caractères cassés fréquents

Voici à quoi ressemblent souvent les caractères cassés – et ce qui devrait être écrit.
Cassé Correct
éé
èè
êê
ëë
àà
ââ
çç
îî
ïï
ôô
ûû
ùù
üü
Å“œ
ÉÉ
ÈÈ
ÀÇÇ
€€
««
»»
’’
––
……

Questions fréquentes

Mes caractères sont-ils perdus ?

Non. é contient encore exactement les octets du é, et Mojibuster les reconvertit. Les caractères ne sont perdus qu’une fois remplacés par ? ou � – voir points d’interrogation au lieu des accents.

Pourquoi seuls les accents sont-ils touchés ?

Les lettres sans accent occupent un seul octet, identique en UTF-8 et en Windows-1252. Seuls les caractères spéciaux – accents, cédille, œ, €, guillemets – prennent plusieurs octets et se cassent.

Puis-je réparer un fichier entier ?

Oui. Déposez vos fichiers CSV, TXT, JSON ou SQL jusqu’à 100 Mo dans le cadre ci-dessus. Le fichier reste sur votre appareil.

Autres guides