मोजिबाके क्या है?

मोजिबाके ऐसा टेक्स्ट है जो बेमतलब चिह्नों में बदल गया हो – जैसे हिंदी की जगह हिंदी। यह तब होता है जब टेक्स्ट एक एन्कोडिंग में सहेजकर दूसरी में पढ़ा जाए, और ज़्यादातर मामलों में पूरी तरह वापस लाया जा सकता है। नीचे के बॉक्स में बिगड़ा टेक्स्ट पेस्ट करके देखें।

टेक्स्ट और ये फ़ाइलें चलती हैं:

  • CSV
  • TXT
  • JSON
  • XML
  • SRT
  • VTT
  • TSV
  • MD
  • HTML
  • SQL
  • LOG

जैसे Excel एक्सपोर्ट, डेटाबेस डंप, सबटाइटल या वेबसाइट का कोड।

ठीक करें

  1. फ़ाइल खींचकर लाएँ या टेक्स्ट पेस्ट करें
  2. अपने-आप ठीक हो जाता है
  3. कॉपी या डाउनलोड करें
या फ़ाइल यहाँ खींचकर लाएँ
  • कोई अपलोड नहीं। फ़ाइलें आपके ब्राउज़र में ही ठीक होती हैं और आपके डिवाइस से बाहर नहीं जातीं।

  • सर्वर EU में। Mojibuster फ़िनलैंड (EU) के एक सर्वर पर चलता है, इसलिए यूरोप का सामान्य डेटा संरक्षण विनियमन (GDPR) लागू होता है। GDPR पढ़ें (EUR-Lex, अंग्रेज़ी)

“मोजिबाके” शब्द का अर्थ

यह शब्द जापानी 文字化け से आया है, जिसका अर्थ है “अक्षरों का रूप बदल जाना”। हिन्दी में इसे आम तौर पर “बिगड़ा टेक्स्ट”, “टूटे अक्षर” या “हिन्दी फ़ॉन्ट की समस्या” कहा जाता है, हालाँकि असली कारण अक्सर फ़ॉन्ट नहीं, एन्कोडिंग होता है।

टेक्स्ट क्यों बिगड़ता है?

कंप्यूटर अक्षरों को बाइट के रूप में रखता है, और एन्कोडिंग तय करती है कि कौन-सा बाइट कौन-सा अक्षर है। UTF-8 में ह तीन बाइट में रखा जाता है: E0 A4 B9। कोई प्रोग्राम इन बाइट को Windows-1252 मानकर पढ़े, तो हर बाइट को अलग अक्षर दिखाता है: ह।

हिन्दी में एक और कारण है: यूनिकोड से पहले हिन्दी Kruti Dev जैसे फ़ॉन्ट में टाइप की जाती थी। ये फ़ॉन्ट अंग्रेज़ी अक्षरों की जगह हिन्दी आकृतियाँ बनाते हैं। फ़ॉन्ट के बिना खोलने पर वही अंग्रेज़ी अक्षर दिखते हैं। दोनों हालात में जानकारी खोती नहीं, बस गलत पढ़ी जाती है – इसलिए Mojibuster सही टेक्स्ट वापस ला सकता है।

Kruti Dev 010 में लिखा टेक्स्ट, फ़ॉन्ट के बिना खोला गया

Kruti Dev

VwVk fganh VsDLV vc Bhd gks x;k gS

यूनिकोड

टूटा हिंदी टेक्स्ट अब ठीक हो गया है

आम रूप

  • हिंदी: UTF-8 टेक्स्ट Windows-1252 के रूप में पढ़ा गया, Excel में CSV खोलने पर अक्सर दिखता है (Excel और CSV में हिन्दी)।
  • fganh: Kruti Dev फ़ॉन्ट में लिखा टेक्स्ट फ़ॉन्ट के बिना खोला गया (Kruti Dev से यूनिकोड)।
  • ? या �: जो अक्षर बदले नहीं जा सके, उनकी जगह ये रख दिए गए – मूल जानकारी खो चुकी है।

आम कारण

  • BOM के बिना UTF-8 CSV फ़ाइल को Excel में डबल-क्लिक करके खोलना।
  • Kruti Dev में लिखा पुराना डॉक्यूमेंट ऐसे कंप्यूटर या मोबाइल पर खोलना जिसमें वह फ़ॉन्ट नहीं है।
  • वेबसाइट या ई-मेल में गलत एन्कोडिंग (charset) बताना।
  • पहले से बिगड़े टेक्स्ट को फिर से बदलना।

क्या हर बिगड़ा टेक्स्ट ठीक हो सकता है?

ज़्यादातर हाँ, अगर बाइट बचे हुए हों। सहेजते या भेजते समय अक्षर ? या � में बदल गए हों, तो मूल जानकारी खो जाती है। Mojibuster जो हो सकता है सब ठीक करता है और बताता है कि कितनी जगहें वापस नहीं आ सकीं।

इससे कैसे बचें

  • यूनिकोड में लिखें (Mangal, Nirmala UI जैसे फ़ॉन्ट) और फ़ाइलें UTF-8 में सहेजें; Excel के लिए CSV BOM के साथ UTF-8 में।
  • HTML में <meta charset="utf-8"> और MySQL व MariaDB में utf8mb4 इस्तेमाल करें।
  • इम्पोर्ट करते समय प्रोग्राम को अंदाज़ा न लगाने दें, एन्कोडिंग खुद चुनें।
  • एन्कोडिंग सिर्फ़ एक बार बदलें, दो सिस्टम के बीच की सीमा पर।

अक्सर पूछे जाने वाले सवाल

क्या बिगड़ा टेक्स्ट ठीक हो सकता है?

हाँ। ज़्यादातर मोजिबाके बस गलत एन्कोडिंग से पढ़ा गया टेक्स्ट होता है। ऊपर के बॉक्स में टेक्स्ट पेस्ट करें या फ़ाइल खींचें – Mojibuster खुद पहचानकर ठीक करता है।

क्या मेरी फ़ाइल में वायरस है?

नहीं। मोजिबाके दिखाने की समस्या है, वायरस नहीं, और आम तौर पर जानकारी पूरी बची रहती है।

मोजिबाके और � चिह्न में क्या फ़र्क़ है?

हि जैसे बिगड़े टेक्स्ट में मूल बाइट बचे रहते हैं, इसलिए वह ठीक हो सकता है। � का मतलब है कि किसी प्रोग्राम ने एक बाइट न पढ़ पाने पर उसे बदल दिया – मूल अक्षर खो गया।

क्या टेक्स्ट सर्वर पर अपलोड होता है?

नहीं। Mojibuster आपके ब्राउज़र में ही टेक्स्ट ठीक करता है, कहीं भेजता या सहेजता नहीं।

और गाइड