Pourquoi un é devient deux caractères
En UTF-8, chaque lettre accentuée occupe deux octets : é correspond à C3 et A9. Un programme qui lit le fichier en Windows-1252 fait de chaque octet un caractère à part : C3 devient Ã, A9 devient ©. Voilà pourquoi presque tous les accents cassés commencent par à – le second caractère indique la lettre d’origine.
Avant
Déjà l’été ! Le garçon a goûté une crème brûlée à Noël, c’est très français.
Après
Déjà l’été ! Le garçon a goûté une crème brûlée à Noël, c’est très français.
Les motifs les plus fréquents en français
é→é,è→è,ê→ê,ë→ëÃsuivi d’une espace →à(voir plus bas),â→â,ç→çî→î,ï→ï,ô→ô,ù→ù,û→ûÉ→É,Ç→Ç,À→ÀÅ“→œ(cœur, sœur),€→€â€™→’,«et»→«et»– voir apostrophes et guillemets cassés
Le tableau complet se trouve plus bas. Si le charabia est plus long, comme é, le texte a été encodé deux fois : Mojibuster répare aussi ce double mojibake, jusqu’à trois niveaux. Le principe est expliqué en détail sur la page qu’est-ce que le mojibake.
Le piège du à
Le second octet de à, A0, est une espace insécable en Windows-1252. voilà devient donc voilà suivi d’une espace qui passe inaperçue. Tant que cette espace insécable est présente, Mojibuster rétablit le à. Si un copier-coller l’a transformée en espace normale, rien ne prouve plus qu’il s’agissait d’un à, et Mojibuster laisse cet endroit tel quel. Déposez donc de préférence le fichier d’origine plutôt que du texte copié.
Remplacer à la main ? Mieux vaut éviter
Vous pourriez remplacer é par é avec Rechercher/Remplacer. Cela ne marche que si vous connaissez toutes les erreurs – et le à avec son espace invisible passe facilement à travers. En plus, un à isolé peut être un vrai à dans un texte portugais. Mojibuster vérifie chaque endroit octet par octet et ne change que ce qui est clairement cassé.
D’où vient le problème
- Excel ouvre un CSV UTF-8 sans BOM en Windows-1252 – voici comment l’ouvrir correctement.
- Exports CSV de boutiques en ligne, de CRM ou de logiciels de comptabilité lus avec le mauvais encodage – réparer un CSV.
- Bases de données et sites web avec une connexion
latin1ou un mauvaischarset– réparer les caractères UTF-8. - Sous-titres lus par le lecteur dans le mauvais encodage – sous-titres avec accents cassés.
- E-mails qui annoncent un mauvais jeu de caractères.
Caractères cassés fréquents
| Cassé | Correct |
|---|---|
| é | é |
| è | è |
| ê | ê |
| ë | ë |
| Ã | à |
| â | â |
| ç | ç |
| î | î |
| ï | ï |
| ô | ô |
| û | û |
| ù | ù |
| ü | ü |
| Å“ | œ |
| É | É |
| È | È |
| À | À |
| Ç | Ç |
| € | € |
| « | « |
| » | » |
| ’ | ’ |
| – | – |
| … | … |
Questions fréquentes
Mes caractères sont-ils perdus ?
Non. é contient encore exactement les octets du é, et Mojibuster les reconvertit. Les caractères ne sont perdus qu’une fois remplacés par ? ou � – voir points d’interrogation au lieu des accents.
Pourquoi seuls les accents sont-ils touchés ?
Les lettres sans accent occupent un seul octet, identique en UTF-8 et en Windows-1252. Seuls les caractères spéciaux – accents, cédille, œ, €, guillemets – prennent plusieurs octets et se cassent.
Puis-je réparer un fichier entier ?
Oui. Déposez vos fichiers CSV, TXT, JSON ou SQL jusqu’à 100 Mo dans le cadre ci-dessus. Le fichier reste sur votre appareil.