Perché una è diventa due caratteri
In UTF-8 ogni lettera accentata occupa due byte: la è è C3 e A8. Un programma che legge il file come Windows-1252 trasforma ogni byte in un carattere a sé: C3 diventa Ã, A8 diventa ¨. Per questo quasi tutti gli accenti rotti iniziano con Ã: il secondo carattere ti dice qual era la lettera.
Prima
Perché in città il caffè costa di più? È già così da lunedì.
Dopo
Perché in città il caffè costa di più? È già così da lunedì.
Gli schemi più comuni in italiano
è→è,é→é(perché, poiché)Ãseguita da uno spazio →à(città, già – vedi sotto)ì→ì,ò→ò,ù→ùÈ→È,À→À€→€,’→’,“→“– di più su apostrofi e virgolette rotti
La tabella completa è più in basso. Se i caratteri strani sono più lunghi, come è, il testo è stato codificato due volte: Mojibuster corregge anche questo, fino a tre livelli. Il meccanismo è spiegato nella pagina cos’è il mojibake.
Il caso della à: Ã seguita da uno spazio
Per l’italiano la à è il caso più insidioso. Il suo secondo byte, A0, in Windows-1252 è uno spazio unificatore (non-breaking space): città diventa quindi città seguito da uno spazio che sembra normale, e più diventa più. Finché lo spazio unificatore è presente, Mojibuster ripristina la à. Se copiando il testo è diventato uno spazio normale, non è più sicuro che lì ci fosse una à, e Mojibuster lascia quel punto invariato.
Consiglio: se puoi, trascina il file originale invece di copiare il testo da un programma. Così lo spazio unificatore resta intatto.
Meglio non sostituire a mano
Potresti usare Trova e sostituisci per cambiare è in è. Funziona solo se conosci tutti gli errori, e la à con il suo spazio invisibile sfugge facilmente. Inoltre una à isolata può essere una vera à in un testo portoghese. Mojibuster controlla ogni punto byte per byte e cambia solo ciò che è chiaramente rotto.
Da dove nasce il problema
- Excel apre un CSV UTF-8 senza BOM come Windows-1252 – ecco come aprirlo correttamente.
- Esportazioni CSV da e-commerce, gestionali e software di fatturazione lette con la codifica sbagliata – correggere un CSV.
- Database e siti web con connessione
latin1ocharsetsbagliato – correggere caratteri UTF-8. - Sottotitoli letti dal player con la codifica sbagliata – sottotitoli con caratteri strani.
- E-mail che dichiarano il set di caratteri sbagliato.
Caratteri rotti frequenti
| Rotto | Corretto |
|---|---|
| Ã | à |
| è | è |
| é | é |
| ì | ì |
| ò | ò |
| ù | ù |
| À | À |
| È | È |
| É | É |
| Ã’ | Ò |
| € | € |
| “ | “ |
| ’ | ’ |
| – | – |
| … | … |
Domande frequenti
I miei caratteri sono persi?
No. è contiene ancora esattamente i byte della è, e Mojibuster li riconverte. I caratteri sono persi solo quando un programma li ha sostituiti con ? o � – vedi punti interrogativi al posto degli accenti.
Perché “più” si rompe e “pizza” no?
Le lettere senza accento occupano un solo byte, identico in UTF-8 e in Windows-1252. Solo i caratteri speciali – lettere accentate, €, virgolette tipografiche – usano più byte e si rompono.
Posso correggere un file intero?
Sì. Trascina file CSV, TXT, JSON o SQL fino a 100 MB nel riquadro qui sopra. Il file resta sul tuo dispositivo.