Caso 1: � en un archivo que en realidad está bien
Si un editor, un reproductor o el navegador muestra Espa�a o informaci�n, el archivo suele estar guardado en Windows-1252 (ANSI) y se lee como UTF-8. El byte de la letra con tilde no es válido en UTF-8, así que el programa pone el carácter de sustitución � al mostrarlo. El archivo en sí sigue conteniendo el byte correcto.
Solución: suelta el archivo original en el recuadro de arriba. Mojibuster detecta la codificación al leerlo y lo convierte a UTF-8. Importante: usa el propio archivo, no copies el texto desde el programa: al copiar, el � se queda para siempre.
Caso 2: el ? o el � están guardados en el texto
Si un programa guardó o reenvió el texto con el carácter de sustitución, el carácter original se ha perdido. Lo mismo vale para ?: los programas lo ponen cuando un carácter no existe en la codificación de destino, por ejemplo al guardar como ASCII o al escribir en una columna de base de datos que no admite la ñ.
A partir de ahí no se puede calcular nada, porque todas las letras con tilde se han convertido en el mismo signo: Espa?a, canci?n y a?o ya no dicen qué letra faltaba. Mojibuster te indica cuántas posiciones están afectadas en lugar de adivinar. Solo ayuda el origen: repetir la exportación o recurrir a una copia de seguridad.
Causas típicas de los signos de interrogación
- Base de datos: la columna o la conexión usan
latin1oascii, pero los datos llegan en UTF-8, y MySQL sustituye los caracteres desconocidos por?. Cómo configurarlo bien: reparar caracteres UTF-8. - PowerShell 5.1:
Export-Csvescribe por defecto en ASCII y cambia las letras con tilde por?. Añade-Encoding UTF8. - Python:
encode('ascii', errors='replace')sustituye los caracteres por?sin avisar. - Consola: la consola de Windows muestra como
?los caracteres que su página de códigos no conoce. Normalmente solo falla la visualización, no el archivo.
Cómo saber qué caso tienes
- Abre el archivo en un editor que muestre la codificación, como Notepad++ (abajo a la derecha, en la barra de estado). Si pone «ANSI» o «Windows-1252», es el caso 1.
- Suelta el archivo en Mojibuster. Si el resultado dice «Leído como Windows-1252 (ANSI)» y las tildes vuelven a aparecer, era el caso 1.
- Si Mojibuster informa de caracteres perdidos, es el caso 2. Entonces solo ayuda una nueva exportación.
Si en lugar de signos de interrogación ves secuencias como ñ o é, es otro error, y casi siempre se puede reparar: ñ en vez de ñ. Para ¿ y “, mira comillas y signos rotos.
Preguntas frecuentes
¿Puede Mojibuster volver a convertir ? en letras?
No. Un ? puede ocupar el lugar de cualquier letra: la información ya no existe. Mojibuster no toca esas posiciones, pero te dice cuántas hay.
¿Por qué veo � en un programa y en otro no?
Entonces el archivo está bien, y solo uno de los programas lo lee con la codificación equivocada. Conviértelo a UTF-8 con Mojibuster y se verá bien en los dos.
¿Qué es el carácter �?
El carácter de sustitución U+FFFD. Los programas lo insertan cuando no pueden leer un byte como carácter. Indica un error de codificación y no forma parte del texto real.