Kenapa teks berbahasa Indonesia juga bisa kena?
Bahasa Indonesia sendiri tidak memakai huruf beraksen. Karena itu, kesalahan ini sering baru terlihat pada kata-kata yang “asing”: nama merek seperti Nestlé atau Café Batavia, nama orang seperti José atau Müller, kata serapan seperti résumé atau protégé, nama jalan di luar negeri dan alamat pengiriman pelanggan dari daftar ekspor toko online. Sisa teksnya tampak normal, sehingga kerusakan mudah terlewat sampai pelanggan bernama René menerima e-mail atau label paket dengan nama yang berantakan.
Kenapa é berubah menjadi dua karakter
Dalam UTF-8, setiap huruf beraksen memakai dua byte – é terdiri dari C3 dan A9. Program yang membaca file sebagai Windows-1252 mengubah setiap byte menjadi karakter tersendiri: C3 menjadi Ã, A9 menjadi ©. Itulah sebabnya hampir semua huruf beraksen yang rusak diawali dengan à – karakter kedua menunjukkan huruf mana yang dimaksud.
Sebelum
Pesanan Café Nestlé untuk José Müller dikirim ke Jl. Señor Résumé No. 5 – lunas.
Sesudah
Pesanan Café Nestlé untuk José Müller dikirim ke Jl. Señor Résumé No. 5 – lunas.
Pola yang paling sering muncul
é→é,è→è,ê→êá→á,ó→ó,ú→ú,ñ→ñç→ç,ü→ü,ö→öÉ→É,Ç→Ç€→€,’→’,“→“– selengkapnya tentang apostrof dan tanda kutip yang rusak
Tabel lengkap ada di bagian bawah halaman ini. Jika karakter anehnya lebih panjang, misalnya é, berarti teks sudah dikodekan dua kali (dalam bahasa Inggris) – Mojibuster juga bisa memperbaikinya.
Sebaiknya jangan diganti manual
Anda memang bisa memakai Find & Replace untuk mengganti é dengan é. Cara itu hanya berhasil selama Anda mengenal semua bentuk kesalahannya: à yang diikuti spasi tak terputus adalah à yang rusak, tetapi à yang berdiri sendiri bisa juga huruf à asli dalam nama Portugis. Di file berisi ribuan baris, satu penggantian yang keliru mudah merusak data lain. Mojibuster memeriksa setiap tempat byte demi byte dan hanya mengubah bagian yang jelas rusak.
Dari mana masalahnya berasal
- Excel membuka CSV UTF-8 tanpa BOM sebagai Windows-1252 – begini cara membukanya dengan benar.
- Ekspor CSV dari marketplace, aplikasi kasir atau akuntansi dibuka dengan program yang salah membaca file – lihat memperbaiki encoding CSV.
- Database mengirim UTF-8 lewat koneksi
latin1– lihat MySQL dan phpMyAdmin (dalam bahasa Inggris). - Skrip membaca file dengan encoding yang salah, misalnya PowerShell atau Python dengan pandas (dalam bahasa Inggris).
- E-mail menyatakan set karakter yang salah – bantuan untuk Outlook (dalam bahasa Inggris).
- Editor teks membuka file sebagai ANSI – di Notepad++ (dalam bahasa Inggris) biasanya cukup satu klik.
Ingin tahu lebih banyak tentang latar belakangnya? Baca apa itu mojibake atau panduan umum untuk memperbaiki karakter UTF-8.
Karakter rusak yang sering muncul
| Rusak | Benar |
|---|---|
| é | é |
| è | è |
| Ã | à |
| ç | ç |
| ñ | ñ |
| ü | ü |
| ö | ö |
| ’ | ’ |
| “ | “ |
| – | – |
| — | — |
| … | … |
| € | € |
| ° | ° |
Pertanyaan yang sering diajukan
Apakah huruf saya hilang?
Tidak. é masih menyimpan byte yang sama persis dengan é, dan Mojibuster mengembalikannya. Huruf baru benar-benar hilang jika sebuah program sudah menggantinya dengan ? atau � – selengkapnya di tanda tanya pengganti huruf.
Kenapa saya melihat à yang diikuti spasi?
Biasanya itu à yang rusak: byte keduanya adalah spasi tak terputus di Windows-1252. Jika saat disalin spasi itu berubah menjadi spasi biasa, posisinya tidak lagi pasti, dan Mojibuster membiarkannya.
Bisakah saya memperbaiki seluruh file?
Bisa. Letakkan file CSV, TXT, JSON atau SQL hingga 100 MB di kotak di atas. File tetap berada di perangkat Anda dan tidak diunggah.
Apakah teks bahasa Indonesia yang benar ikut diubah?
Tidak. Mojibuster hanya menyentuh urutan karakter yang jelas berasal dari kesalahan encoding. Kata-kata biasa, angka dan tanda baca yang sudah benar tetap seperti semula.