लक्षण से कारण तक: कौन-सी गलती किस वजह से
ऑटोमैटिक ट्रांसक्रिप्ट की हर गलती बेतरतीब नहीं होती। अगर आप पहचान लें कि गलती किस तरह की है, तो उसकी वजह और इलाज दोनों अंदाज़ा लगाना आसान हो जाता है।
- अंग्रेज़ी शब्द अजीब हिंदी शब्दों में बदल गए
- हिंगलिश या कोड-मिक्सिंग
- किसी ख़ास व्यक्ति के हिस्से में ज़्यादा गलतियाँ
- उसका लहजा, बोली या माइक से दूरी
- लोगों, गाँवों, कंपनियों के नाम गलत
- नाम मॉडल के लिए अनजाने हैं
- कि/की, है/हैं जैसी छोटी गड़बड़ियाँ
- मिलती-जुलती ध्वनि और व्याकरण का अंदाज़ा
- कुछ हिस्से गायब या अधूरे
- शोर, धीमी आवाज़ या एक साथ बोलना
- एक ही वाक्य बार-बार दोहराया गया
- शोर या संगीत वाले हिस्से में मॉडल का "भटकना"
आगे हर कारण को अलग से समझते हैं, फिर देखते हैं कि अगली रिकॉर्डिंग में क्या बदलें और मौजूदा ट्रांसक्रिप्ट को कैसे सुधारें।
हिंगलिश: एक वाक्य में दो भाषाएँ
"यार, कल की मीटिंग में क्लाइंट ने बजट रिवाइज़ करने को बोला" — शहरी भारत में यह पूरी तरह सामान्य हिंदी है। लेकिन स्पीच रिकग्निशन मॉडल के लिए यह मुश्किल है, क्योंकि उसे हर कुछ शब्दों पर तय करना होता है कि अब कौन-सी भाषा चल रही है और शब्द किस लिपि में लिखना है।
इसके नतीजे कुछ ऐसे दिखते हैं: अंग्रेज़ी शब्द कहीं देवनागरी में, कहीं रोमन में; "रिवाइज़" जैसा शब्द किसी मिलते-जुलते हिंदी शब्द में बदल जाना; या पूरा वाक्य अंग्रेज़ी में अनुवाद होकर लिखा जाना। मिली-जुली भाषा वाली रिकॉर्डिंग पर मिश्रित भाषा वाले वीडियो (अंग्रेज़ी में) वाला लेख और गहराई से बात करता है।
इसका कोई पूरा इलाज नहीं है, क्योंकि लोग जैसे बोलते हैं वैसे ही बोलेंगे। हाँ, प्रूफ़रीडिंग में अंग्रेज़ी शब्दों पर ख़ास नज़र रखें और तय कर लें कि आपकी फ़ाइल में वे किस लिपि में रहेंगे।
लहजा, बोली और क्षेत्रीय भाषाएँ
हिंदी पट्टी में हर सौ किलोमीटर पर बोलने का ढंग बदल जाता है। बिहार के किसी अध्यापक, राजस्थान के किसी किसान और दिल्ली के किसी कॉलेज छात्र की हिंदी में उच्चारण, शब्द और लय — तीनों अलग होते हैं। मॉडल ने जिस तरह की हिंदी ज़्यादा सुनी है, उससे जितनी दूर बोली होगी, गलतियाँ उतनी बढ़ सकती हैं। इस विषय पर लहजे और स्पीच रिकग्निशन (अंग्रेज़ी में) वाला लेख विस्तार से है।
एक बात साफ़ समझ लें: भोजपुरी, अवधी, मैथिली, हरियाणवी, मारवाड़ी, छत्तीसगढ़ी जैसी भाषाएँ और बोलियाँ mydubly में अलग विकल्प के रूप में नहीं हैं। भारतीय भाषाओं में सिर्फ़ हिंदी उपलब्ध है। अगर रिकॉर्डिंग पूरी तरह भोजपुरी में है, तो नतीजा हिंदी के क़रीब का एक अनुमान होगा, जिसमें काफ़ी शब्द गलत या बदले हुए मिल सकते हैं। बहुत भारी बोली या बहुत छोटे क्लिप में भाषा की अपने-आप पहचान भी चूक सकती है।
नाम, जगहें और एक जैसी सुनाई देने वाली ध्वनियाँ
"साहू" और "साव", "मिश्रा" और "मिश्र", "गोंडा" और "गोंदिया" — नाम मॉडल के लिए सबसे कठिन होते हैं, क्योंकि उनके पीछे कोई व्याकरण या अर्थ का सहारा नहीं होता। किसी कस्बे, स्थानीय नेता, छोटी कंपनी या दवा का नाम अक्सर सबसे नज़दीकी आम शब्द में बदल जाता है।
हिंदी की कुछ व्याकरणिक जोड़ियाँ भी बार-बार गड़बड़ाती हैं:
- "कि" और "की" — बोलने में लगभग एक जैसे, लिखने में अलग अर्थ।
- "है" और "हैं" — तेज़ बोलचाल में अनुनासिकता अक्सर सुनाई नहीं देती।
- बिंदु और चंद्रबिंदु: "हंस" बनाम "हँस", "मै" बनाम "मैं"।
- नुक़्ता: "ज़रा" और "जरा", "फ़न" और "फन" — कुछ स्पीकर नुक़्ता बोलते हैं, कुछ नहीं।
- "ए" और "ये" वाले रूप: "गए" बनाम "गये", "चाहिए" बनाम "चाहिये" — दोनों प्रचलित हैं, पर फ़ाइल में एक ही रहें।
पंखा, कूलर, ट्रैफ़िक: भारतीय घरों का शोर
भारत में ज़्यादातर रिकॉर्डिंग स्टूडियो में नहीं, घर, क्लासरूम या दफ़्तर में होती है। छत का पंखा माइक के ठीक ऊपर हो तो लगातार हवा और गुनगुनाहट रिकॉर्ड होती है। गर्मियों में डेज़र्ट कूलर की आवाज़ अक्सर बोलने वाले से भी तेज़ होती है। खिड़की खुली हो तो हॉर्न, प्रेशर कुकर की सीटी, मंदिर या मस्जिद का लाउडस्पीकर, और फेरीवालों की आवाज़ — सब ट्रांसक्रिप्ट की गुणवत्ता घटाते हैं।
एक और आम वजह है गूँज। ख़ाली कमरे, बड़े हॉल या टाइल वाले कमरे में आवाज़ दीवारों से टकराकर लौटती है, और मॉडल को शब्दों की सीमा पहचानने में दिक़्क़त होती है। शोर का ट्रांसक्रिप्शन पर असर पृष्ठभूमि शोर और स्पीच रिकग्निशन (अंग्रेज़ी में) वाले लेख में अच्छे से समझाया गया है।
एक साथ बोलना और बीच में टोकना
टीवी बहसों की तरह, कई पारिवारिक बातचीतों, मीटिंगों और इंटरव्यू में लोग एक-दूसरे की बात काटते हैं। जब दो आवाज़ें एक साथ आती हैं, तो मॉडल आम तौर पर तेज़ आवाज़ को पकड़ता है और धीमी को छोड़ देता है, या दोनों के टुकड़े मिलाकर एक बेमतलब वाक्य बना देता है।
यह भी ध्यान रखें कि mydubly स्पीकर अलग-अलग नहीं पहचानता — ट्रांसक्रिप्ट में "रमेश:" या "सवाल:" जैसे लेबल नहीं आते। इंटरव्यू के लिए ये लेबल आपको बाद में ख़ुद जोड़ने होंगे।
अगली रिकॉर्डिंग में क्या बदलें
जो गलती रिकॉर्डिंग में ही रोकी जा सके, उसे बाद में सुधारने से बेहतर है। कुछ आसान आदतें:
- फ़ोन या माइक बोलने वाले के मुँह से एक हाथ की दूरी के अंदर रखें; मेज़ के दूसरे छोर पर रखा फ़ोन कमरे को रिकॉर्ड करता है, आवाज़ को नहीं।
- रिकॉर्डिंग के दौरान कूलर बंद करें और पंखा धीमा करें, ख़ासकर अगर वह माइक के ठीक ऊपर है।
- पर्दे, गद्दे या किताबों वाला कमरा ख़ाली कमरे से कम गूँजता है।
- इंटरव्यू में पहले से तय कर लें कि एक समय पर एक ही व्यक्ति बोलेगा।
- शुरुआत में बोलने वाले अपना नाम और ज़रूरी नामों की वर्तनी बोल दें — इससे प्रूफ़रीडिंग में मदद मिलती है।
रिकॉर्डिंग की आवाज़ साफ़ रखने के और व्यावहारिक तरीक़े रिकॉर्डिंग की आवाज़ साफ़ कैसे रखें वाले लेख में हैं।
ट्रांसक्रिप्ट की प्रूफ़रीडिंग का तेज़ तरीक़ा
शुरू से आख़िर तक ऑडियो सुनते हुए हर शब्द मिलाना सबसे धीमा तरीक़ा है। इस क्रम से काम जल्दी निपटता है:
- पहले टाइमस्टैम्प वाला ट्रांसक्रिप्ट लें, ताकि हर संदिग्ध लाइन का समय पता रहे।
- रिकॉर्डिंग में आने वाले नामों की सूची बनाएँ और हर नाम को खोज (Ctrl+F) से ढूँढकर एक साथ ठीक करें।
- पूरा ट्रांसक्रिप्ट एक बार बिना ऑडियो के पढ़ें और जो लाइनें बेतुकी लगें, उनके टाइमस्टैम्प नोट करें।
- अब सिर्फ़ उन्हीं हिस्सों को सुनें, ज़रूरत हो तो धीमी गति पर।
- एक ही वाक्य लगातार कई बार दोहराया दिखे, तो उस हिस्से को ज़रूर सुनें; यह अक्सर शोर या संगीत वाले हिस्से में मॉडल का गढ़ा हुआ टेक्स्ट होता है।
- आख़िर में "कि/की", "है/हैं" और नुक़्ते के लिए एक बार अलग से खोज करें।
मशीन का टेक्स्ट: "[00:04:12] साहब ने कहा की गोंदिया वाली साइट पर काम है अभी बंद।" ऑडियो सुनने के बाद: "[00:04:12] साहू जी ने कहा कि गोंडा वाली साइट पर काम अभी बंद है।" एक ही लाइन में नाम, जगह, "कि" और शब्द-क्रम — चारों गलतियाँ थीं, और चारों अलग-अलग कारणों से।
इस प्रक्रिया का विस्तृत रूप AI ट्रांसक्रिप्ट की प्रूफ़रीडिंग (अंग्रेज़ी में) वाले लेख में है, और दोहराए गए या गढ़े हुए टेक्स्ट पर Whisper हैलुसिनेशन (अंग्रेज़ी में) वाला लेख।
mydubly इसमें कहाँ मदद करता है और कहाँ नहीं
mydubly का वीडियो-टू-टेक्स्ट टूल (अंग्रेज़ी में) Whisper पर आधारित स्पीच रिकग्निशन (faster-whisper large-v3-turbo) इस्तेमाल करता है, साथ में वॉइस-एक्टिविटी डिटेक्शन, जो ख़ामोश हिस्सों को छोड़ देता है। मूल भाषा अपने-आप पहचानी जाती है; हिंदी को हाथ से चुनने का विकल्प नहीं है। गुणवत्ता ऑडियो, लहजे, एक साथ बोलने और नामों पर निर्भर करती है, इसलिए कोई सटीकता का आँकड़ा देना ईमानदार नहीं होगा।
व्यावहारिक बातें:
- वीडियो के लिए "Drop a video here" और ऑडियो के लिए "Drop audio here" इस्तेमाल करें, टॉगल बंद रखें और "Transcribe video" या "Transcribe audio" दबाएँ।
- नतीजे में "Download transcript" (सादा टेक्स्ट), "Download timestamped transcript" और "Download subtitles" (SRT) मिलते हैं। प्रूफ़रीडिंग के लिए टाइमस्टैम्प वाला सबसे काम का है।
- ऑडियो MP3, WAV, M4A, AAC, OGG, FLAC या WebM में चाहिए। WhatsApp का .opus वॉइस नोट और .amr कॉल रिकॉर्डिंग सीधे नहीं चलते; किसी भरोसेमंद कन्वर्टर से MP3 या M4A बना लें। इस पर WhatsApp वॉइस नोट को टेक्स्ट में बदलने वाला लेख मदद करेगा।
- mydubly में ट्रांसक्रिप्ट एडिट करने का इंटरफ़ेस नहीं है और स्पीकर लेबल नहीं आते; सुधार डाउनलोड की गई फ़ाइल में Word, Notepad या किसी भी एडिटर में करें।
- mydubly ऑडियो का शोर साफ़ करने का कोई अलग टूल नहीं देता; ख़राब रिकॉर्डिंग पर बेहतर नतीजा रिकॉर्डिंग सुधारकर ही मिलेगा।
ख़र्च एक क्रेडिट प्रति मिनट है, हर फ़ाइल पर कम से कम 5 क्रेडिट: 40 मिनट की क्लास रिकॉर्डिंग 40 क्रेडिट ($0.04), और 2 घंटे का इंटरव्यू 120 क्रेडिट ($0.12)। साइन-अप के 100 मुफ़्त क्रेडिट से पहले एक छोटी रिकॉर्डिंग पर नतीजा परख लें।
अक्सर पूछे जाने वाले सवाल
मेरे हिंदी ट्रांसक्रिप्ट में अंग्रेज़ी शब्द गलत क्यों आते हैं?
जब एक ही वाक्य में हिंदी और अंग्रेज़ी मिली हों, तो मॉडल को बार-बार भाषा और लिपि का अंदाज़ा लगाना पड़ता है। इसलिए अंग्रेज़ी शब्द कभी देवनागरी में, कभी रोमन में, और कभी किसी मिलते-जुलते हिंदी शब्द के रूप में आ जाते हैं। प्रूफ़रीडिंग में इन शब्दों पर ख़ास ध्यान दें और फ़ाइल के लिए एक लिपि तय करें।
क्या भोजपुरी या अवधी रिकॉर्डिंग का ट्रांसक्रिप्ट बन सकता है?
mydubly में भोजपुरी, अवधी या कोई और क्षेत्रीय भाषा अलग विकल्प के रूप में नहीं है; भारतीय भाषाओं में सिर्फ़ हिंदी उपलब्ध है। हल्के क्षेत्रीय लहजे वाली हिंदी का ट्रांसक्रिप्ट बन जाता है, लेकिन पूरी तरह बोली में हुई बातचीत का नतीजा हिंदी के क़रीब का अनुमान होगा, जिसमें काफ़ी गलतियाँ हो सकती हैं।
ट्रांसक्रिप्ट में एक ही लाइन बार-बार क्यों लिखी आ रही है?
शोर, संगीत या लंबी ख़ामोशी वाले हिस्सों में स्पीच रिकग्निशन मॉडल कभी-कभी ऐसा टेक्स्ट गढ़ देता है जो बोला ही नहीं गया, या पिछली लाइन दोहरा देता है। टाइमस्टैम्प वाले ट्रांसक्रिप्ट में ऐसी लाइनों का समय देखकर उस हिस्से को सुनें और फ़ालतू टेक्स्ट हटा दें।
क्या mydubly में मैं भाषा को हिंदी पर फ़िक्स कर सकता हूँ?
नहीं, मूल भाषा अपने-आप पहचानी जाती है और उसे हाथ से चुनने का विकल्प नहीं है। साफ़ हिंदी बोली वाली रिकॉर्डिंग में यह आम तौर पर मुश्किल नहीं होता। बहुत छोटे क्लिप या भारी बोली में पहचान चूक सकती है, इसलिए नतीजा देखकर ही आगे बढ़ें।
इंटरव्यू ट्रांसक्रिप्ट में किसने क्या कहा, यह कैसे पता चलेगा?
mydubly स्पीकर की पहचान नहीं करता, इसलिए ट्रांसक्रिप्ट में नाम वाले लेबल नहीं आते। टाइमस्टैम्प वाले ट्रांसक्रिप्ट को ऑडियो के साथ सुनते हुए आप "सवाल:" और "जवाब:" या बोलने वालों के नाम ख़ुद जोड़ सकते हैं। रिकॉर्डिंग में एक समय पर एक ही व्यक्ति बोले तो यह काम बहुत आसान हो जाता है।
ट्रांसक्रिप्ट की गलतियाँ कम करने का सबसे असरदार तरीक़ा क्या है?
रिकॉर्डिंग के समय माइक को बोलने वाले के पास रखना और पंखे, कूलर व खिड़की के शोर को कम करना सबसे ज़्यादा फ़र्क डालता है। उसके बाद एक समय पर एक व्यक्ति का बोलना मदद करता है। बची हुई गलतियों के लिए नामों की सूची और टाइमस्टैम्प वाले ट्रांसक्रिप्ट से प्रूफ़रीडिंग सबसे तेज़ रास्ता है।
