è invece di è: riconoscere e correggere gli accenti rotti

Il tuo testo mostra è al posto di è, ù al posto di ù o Perché invece di Perché? Un testo UTF-8 è stato letto come Windows-1252, ma i caratteri non sono persi. Incolla il testo qui sopra o trascina il file: Mojibuster lo corregge subito.

Funziona con testo e con questi file:

  • CSV
  • TXT
  • JSON
  • XML
  • SRT
  • VTT
  • TSV
  • MD
  • HTML
  • SQL
  • LOG

Per esempio esportazioni di Excel, backup di database, sottotitoli o codice di siti web.

Correggi

  1. Trascina un file o incolla il testo
  2. La correzione è automatica
  3. Copia o scarica
oppure trascina semplicemente un file qui
  • Nessun upload. I tuoi file vengono corretti direttamente nel browser e non lasciano mai il tuo dispositivo.

  • Server nell’UE. Mojibuster gira su un server in Finlandia (UE); si applica il Regolamento generale sulla protezione dei dati (GDPR). Testo del GDPR (EUR-Lex)

Perché una è diventa due caratteri

In UTF-8 ogni lettera accentata occupa due byte: la è è C3 e A8. Un programma che legge il file come Windows-1252 trasforma ogni byte in un carattere a sé: C3 diventa Ã, A8 diventa ¨. Per questo quasi tutti gli accenti rotti iniziano con Ã: il secondo carattere ti dice qual era la lettera.

Una frase salvata in UTF-8 e letta come Windows-1252

Prima

Perché in città il caffè costa di più? È già così da lunedì.

Dopo

Perché in città il caffè costa di più? È già così da lunedì.

Gli schemi più comuni in italiano

  • è → è, é → é (perché, poiché)
  • Ã seguita da uno spazio → à (città, già – vedi sotto)
  • ì → ì, ò → ò, ù → ù
  • È → È, À → À
  • € → €, ’ → ’, “ → “ – di più su apostrofi e virgolette rotti

La tabella completa è più in basso. Se i caratteri strani sono più lunghi, come è, il testo è stato codificato due volte: Mojibuster corregge anche questo, fino a tre livelli. Il meccanismo è spiegato nella pagina cos’è il mojibake.

Il caso della à: Ã seguita da uno spazio

Per l’italiano la à è il caso più insidioso. Il suo secondo byte, A0, in Windows-1252 è uno spazio unificatore (non-breaking space): città diventa quindi città seguito da uno spazio che sembra normale, e più diventa più. Finché lo spazio unificatore è presente, Mojibuster ripristina la à. Se copiando il testo è diventato uno spazio normale, non è più sicuro che lì ci fosse una à, e Mojibuster lascia quel punto invariato.

Consiglio: se puoi, trascina il file originale invece di copiare il testo da un programma. Così lo spazio unificatore resta intatto.

Meglio non sostituire a mano

Potresti usare Trova e sostituisci per cambiare è in è. Funziona solo se conosci tutti gli errori, e la à con il suo spazio invisibile sfugge facilmente. Inoltre una à isolata può essere una vera à in un testo portoghese. Mojibuster controlla ogni punto byte per byte e cambia solo ciò che è chiaramente rotto.

Da dove nasce il problema

Caratteri rotti frequenti

Ecco come appaiono di solito i caratteri rotti – e cosa dovrebbe esserci scritto.
Rotto Corretto
àà
èè
éé
ìì
òò
ùù
ÀÈÈ
ÉÉ
Ã’Ò
€€
““
’’
––
……

Domande frequenti

I miei caratteri sono persi?

No. è contiene ancora esattamente i byte della è, e Mojibuster li riconverte. I caratteri sono persi solo quando un programma li ha sostituiti con ? o � – vedi punti interrogativi al posto degli accenti.

Perché “più” si rompe e “pizza” no?

Le lettere senza accento occupano un solo byte, identico in UTF-8 e in Windows-1252. Solo i caratteri speciali – lettere accentate, €, virgolette tipografiche – usano più byte e si rompono.

Posso correggere un file intero?

Sì. Trascina file CSV, TXT, JSON o SQL fino a 100 MB nel riquadro qui sopra. Il file resta sul tuo dispositivo.

Altre guide