प्रदर्शनी

पाठ पहचान सॉफ्टवेयर OCR के बारे में बात कर रहे हैं

Feb 18, 2019 एक संदेश छोड़ें

पाठ पहचान सॉफ्टवेयर OCR के बारे में बात कर रहे हैं

हम शेन्ज़ेन चीन में एक बड़ी मुद्रण कंपनी है। हम सभी पुस्तक प्रकाशन, हार्डकवर बुक प्रिंटिंग, पेपरकवर बुक प्रिंटिंग, हार्डकवर नोटबुक, स्प्रिचुअल बुक प्रिंटिंग, काठी स्टिचिंग बुक प्रिंटिंग, बुकलेट प्रिंटिंग, पैकेजिंग बॉक्स, कैलेंडर, सभी प्रकार के पीवीसी, उत्पाद ब्रोशर, नोट्स, बच्चों की किताब, स्टिकर, सभी प्रदान करते हैं। विशेष कागज रंग मुद्रण उत्पादों के प्रकार, खेल कार्डैंड इतने पर।

अधिक जानकारी के लिये कृपया यहां देखें

http://www.joyful-printing.com। केवल इंग्लैंड

http://www.joyful-printing.net

http://www.joyful-printing.org

ईमेल: info@joyful-printing.net


चीनी चरित्र पहचान सॉफ्टवेयर का कार्य कंप्यूटर "साक्षर" बनाने के तरीके का अध्ययन करना है। प्रणाली आमतौर पर एक चीनी चरित्र या एक शब्द बॉक्स को विद्युत संकेत में बदलने के लिए एक फोटोइलेक्ट्रिक रूपांतरण उपकरण का उपयोग करती है, और इसे एक कंप्यूटर पर भेजती है, जिसे कंप्यूटर द्वारा स्वचालित रूप से पहचाना और पढ़ा जाता है, इसलिए इसे ऑप्टिकल कहा जाता है। ऑप्टिकल कैरेक्टर रिकॉग्निशन (OCR)।


OCR विकास प्रोफ़ाइल


OCR की अवधारणा को पहली बार 1929 में जर्मन वैज्ञानिक Tausheck द्वारा प्रस्तावित किया गया था। बाद में, अमेरिकी वैज्ञानिक Handel ने शब्दों की पहचान करने के लिए प्रौद्योगिकी का उपयोग करने के विचार का भी प्रस्ताव रखा। मुद्रित चीनी पात्रों की मान्यता पर सबसे पहला शोध केसी और आईबीएम का नेगी था। 1966 में, उन्होंने चीनी चरित्र मान्यता पर पहला लेख प्रकाशित किया, जिसमें 1000 मुद्रित चीनी पात्रों की पहचान करने के लिए टेम्पलेट मिलान का उपयोग किया गया था। 1970 के दशक की शुरुआत में, जापानी विद्वानों ने चीनी चरित्र मान्यता का अध्ययन करना शुरू किया और बहुत काम किया। चीन में चीनी चरित्र मान्यता पर शोध अपेक्षाकृत देर से शुरू हुआ और 1970 के दशक के अंत में ओसीआर का शोध कार्य शुरू हुआ। प्रारंभिक ओसीआर सॉफ्टवेयर विभिन्न कारकों जैसे मान्यता दर और उत्पादीकरण के कारण वास्तविक आवश्यकताओं को पूरा करने में विफल रहा। इसी समय, हार्डवेयर उपकरण की उच्च लागत और धीमी गति की गति के कारण, यह व्यावहारिक स्तर पर नहीं पहुंचा है। केवल कुछ विभाग, जैसे सूचना विभाग, प्रेस और प्रकाशन इकाइयाँ, ओसीआर सॉफ्टवेयर का उपयोग करते हैं। 1986 के बाद, चीन के ओसीआर अनुसंधान ने बहुत प्रगति की है, और इसने चीनी चरित्र मॉडलिंग और मान्यता विधियों में नवाचार किए हैं। इसने प्रणाली विकास और विकास अनुप्रयोगों में फलदायी परिणाम प्राप्त किए हैं। कई इकाइयों ने क्रमिक रूप से चीनी ओसीआर उत्पादों को लॉन्च किया है। 1990 के दशक के बाद, प्लेटफ़ॉर्म स्कैनर के व्यापक अनुप्रयोग और चीन में सूचना स्वचालन और कार्यालय स्वचालन के लोकप्रियकरण के साथ, ओसीआर प्रौद्योगिकी के आगे विकास को बहुत बढ़ावा दिया गया है, और ओसीआर की मान्यता दर को मान्यता दी गई है, और मान्यता की गति को संतुष्ट किया गया है उपयोगकर्ता। दावा।


वर्तमान में, कई लोकप्रिय ओसीआर सॉफ्टवेयर हैं। अंग्रेजी OCR में मुख्य रूप से OmniPage, Chinese OCR, मुख्य रूप से Tsinghua Unisplendour OCR, Tsinghua Wentong OCR, Hanwang OCR, Zhongjing Shangshu OCR, Danqing OCR और Mengyu OCR शामिल हैं। बड़ी संख्या में चीनी पात्रों और जटिल फोंट के बावजूद, OCR तकनीक परिपक्व हो गई है। कई ओसीआर सॉफ्टवेयर न केवल काले और सफेद मुद्रित चीनी अक्षरों को पहचान सकते हैं, बल्कि ग्रेस्केल और रंगीन मुद्रित चीनी अक्षरों को भी पहचान सकते हैं। मान्यता की गति तेज है और मान्यता सटीकता दर 99% से अधिक है। यह सॉन्ग, बोल्ड और स्कॉर्पियन जैसे विभिन्न फॉन्ट को पहचान सकता है। पारंपरिक; फोंट की एक किस्म को पहचान सकते हैं, विभिन्न फ़ॉन्ट आकार मिश्रण; कुछ ओसीआर सॉफ्टवेयर छवियों, तालिकाओं की पहचान भी कर सकते हैं। इसी समय, हस्तलिखित चीनी चरित्र मान्यता के अध्ययन में काफी प्रगति हुई है, और सही पहचान दर 70% से अधिक हो गई है।


ओसीआर सॉफ्टवेयर एप्लीकेशन


स्कैनर बाजार में, कई प्रकार के कार्यालय और घर स्कैनर OCR सॉफ्टवेयर से लैस हैं। उदाहरण के लिए, बैंगनी स्कैनर वायलेट ओसीआर से सुसज्जित है, क्रिस्टल स्कैनर शांगशू ओसीआर से सुसज्जित है, और मस्टेक स्कैनर डेनकिंग ओसीसीआर से सुसज्जित है। स्कैनर और ओसीआर सॉफ्टवेयर दस्तावेज़ के इनपुट से लेकर टेक्स्ट रिकग्निशन तक की पूरी प्रक्रिया को साझा करते हैं।


दस्तावेज़ स्कैनिंग का उपयोग अक्सर कार्यालय क्षेत्र में किया जाता है। समाचार पत्रों, पत्रिकाओं आदि में प्रकाशन से संबंधित दस्तावेजों को एक स्कैनर द्वारा स्कैन किया जाता है, और फिर ओसीआर पहचान का प्रदर्शन किया जाता है, या एक छवि फ़ाइल के रूप में संग्रहीत किया जाता है, बाद में ओसीआर मान्यता के लिए, और छवि फ़ाइलों को पाठ में परिवर्तित किया जाता है। भंडारण के लिए फ़ाइल या वर्ड फ़ाइल।


इसके अलावा, डिजिटल जानकारी का भंडारण और प्रसारण न केवल लागत में कम है, उच्च दक्षता में है, बल्कि टाइपिंग और नेटवर्क ट्रांसमिशन की अविकसित जरूरतों के अनुकूल भी है। वर्तमान में, चीन में पुस्तकों, समाचार पत्रों, पत्रिकाओं और इतने पर बाईं ओर बहुत सारे कागजी खजाने हैं, और उन्हें इलेक्ट्रॉनिक जानकारी में परिवर्तित करना तत्काल आवश्यक है। उदाहरण के लिए, इलेक्ट्रॉनिक लाइब्रेरी की स्थापना के लिए आवश्यक है कि पुस्तकों को पृष्ठ द्वारा स्कैन किया जाए, और ओसीआर सॉफ्टवेयर की पहचान शब्दों के मैनुअल टाइपिंग को बदल देती है, जो प्रवेश के समय को कम कर देता है, श्रम तीव्रता को कम कर देता है, श्रमशक्ति को बचाता है और लागत को कम करता है। प्रवेश, कार्य कुशलता और आधुनिक कार्यालय स्वचालन की सटीकता में सुधार।


वर्तमान में, सूचना युग के कई क्षेत्रों जैसे डिजिटल लाइब्रेरियों, विभिन्न रिपोर्टों की पहचान और बैंकिंग और कर प्रणाली मानकों की पहचान के लिए OCR सॉफ्टवेयर और स्कैनर के संयोजन को लागू किया गया है। नेटवर्क और सूचना के विकास और लोकप्रियकरण के साथ, इसका अनुप्रयोग क्षेत्र अधिक से अधिक व्यापक हो जाएगा।


ओसीआर प्रणाली की संरचना


चीनी चरित्र पहचान सॉफ्टवेयर OCR का कार्य कंप्यूटर द्वारा चीनी अक्षरों, प्रिंटों या हस्तलेखों में दर्ज प्रत्येक चीनी चरित्र के विभिन्न ग्राफिक्स या छवियों को पहचानना और चीनी चरित्र श्रेणी कोड को चिह्नित करना है। इसलिए, चीनी चरित्र मान्यता अंततः एक छवि मान्यता समस्या है। बड़ी मात्रा में चीनी अक्षरों, विभिन्न फोंट, फोंट और जटिल संरचनाओं के कारण, चीनी चरित्र मान्यता की प्रक्रिया बेहद जटिल है। OCR सॉफ्टवेयर वर्कफ़्लो का योजनाबद्ध आरेख, जैसा कि निम्नलिखित तालिका में दिखाया गया है:


दस्तावेज़ डेटा → स्कैन इनपुट → छवि प्रसंस्करण → लेआउट विभाजन → पाठ मान्यता → पाठ संपादन → दस्तावेज़ भंडारण


स्कैनर की लोकप्रियता और व्यापक अनुप्रयोग के कारण, ओसीआर सॉफ्टवेयर को केवल स्कैनर के साथ एक इंटरफ़ेस प्रदान करने और स्कैनर ड्राइवर सॉफ्टवेयर का उपयोग करने की आवश्यकता होती है। इसलिए, ओसीआर सॉफ्टवेयर मुख्य रूप से एक इमेज प्रोसेसिंग मॉड्यूल, एक लेआउट डिवीजन मॉड्यूल, एक टेक्स्ट रिकग्निशन मॉड्यूल और एक टेक्स्ट एडिटिंग मॉड्यूल से बना होता है।


1. इमेज प्रोसेसिंग मॉड्यूल

इमेज प्रोसेसिंग मॉड्यूल में मुख्य रूप से डॉक्यूमेंट स्कैनिंग, इमेज स्केलिंग और इमेज रोटेशन जैसे कार्य होते हैं। स्कैनर द्वारा इनपुट के बाद, दस्तावेज़ एक छवि फ़ाइल बनाता है, और छवि प्रसंस्करण मॉड्यूल छवि को दाग और खरोंच को हटाने के लिए बढ़ा सकता है। यदि छवि को सही ढंग से घुमाया नहीं गया है, तो पाठ पहचान के लिए बेहतर स्थिति बनाने के लिए, छवि को मैन्युअल रूप से या स्वचालित रूप से घुमाया जा सकता है। मान्यता दर अधिक है।


2. लेआउट डिवीजन मॉड्यूल

लेआउट डिवीजन मॉड्यूल में मुख्य रूप से लेआउट डिवीजन और परिवर्तन डिवीजन शामिल होते हैं, अर्थात, लेआउट की समझ, शब्द विभाजन, सामान्यीकरण, आदि, और स्वचालित या मैनुअल लेआउट का चयन किया जा सकता है। उद्देश्य ओसीआर सॉफ्टवेयर को लेखों, तालिकाओं आदि को एक ही लेआउट में अलग करने के लिए बताना है, ताकि उन्हें अलग से और किस क्रम में संसाधित किया जा सके।


3. पाठ पहचान मॉड्यूल

पाठ पहचान मॉड्यूल OCR सॉफ्टवेयर का मुख्य भाग है, एक साधारण पाठ पहचान प्रक्रिया आरेख, जैसा कि नीचे दिखाया गया है। पाठ मान्यता मॉड्यूल मुख्य रूप से इनपुट चीनी अक्षरों पर "रीडिंग" करता है, लेकिन यह बहु-पंक्ति नहीं हो सकता है और लाइन द्वारा लाइन काट दिया जाना चाहिए। चीनी पात्रों के लिए, यह आमतौर पर एक शब्द और एक शब्द से पहचाना जाता है, अर्थात एकल शब्द मान्यता, और फिर सामान्यीकृत। टेक्स्ट रिकग्निशन मॉड्यूल अलग-अलग सैंपल चाइनीज कैरेक्टर्स के फीचर्स को एक्सेप्ट करता है, रिकग्निशन को पूरा करता है, ऑटोमैटिकली संदिग्ध शब्द ढूंढता है, और इसमें एसोसिएशन से पहले और बाद के फंक्शन होते हैं।


स्कैन इनपुट मूल → लाइन कटिंग → वर्ड कटिंग → प्राकृतिककरण → मान्यता सुविधा निष्कर्षण → शब्द मान्यता → cutting

└- → पूर्व-वर्गीकरण सुविधा निष्कर्षण → फ़ीचर लाइब्रेरी (शब्दकोश) → आउटपुट पांडुलिपि


4. पाठ संपादन मॉड्यूल

पाठ संपादन मॉड्यूल मुख्य रूप से OCR मान्यता प्राप्त पाठ को संशोधित और संपादित करता है। यदि सिस्टम पहचानता है कि यह गलत है, तो पाठ बोल्ड लाल या नीले रंग में प्रदर्शित होगा, और चयन के लिए समान पाठ प्रदान करेगा, और आउटपुट के लिए संपादक का चयन करेगा।


ओसीआर सॉफ्टवेयर का उपयोग कैसे करें


हालांकि कई प्रकार के ओसीआर सॉफ़्टवेयर हैं, उनका उपयोग समान है। पहला कदम दस्तावेज़ को स्कैन करना और फिर ओसीआर मान्यता प्रदर्शन करना है। OCR सॉफ्टवेयर का उपयोग इस प्रकार है:


1. दस्तावेज़ स्कैनिंग

पाठ पहचान के लिए ओसीआर सॉफ्टवेयर का उपयोग करने के लिए, दस्तावेजों को सीधे ओसीआर सॉफ्टवेयर में स्कैन किया जा सकता है। OCR सॉफ़्टवेयर को चलाने के बाद, OCR सॉफ़्टवेयर इंटरफ़ेस दिखाई देगा।


दस्तावेज़ को स्कैनर के कांच की तरफ स्कैन करने के लिए रखें, ताकि स्कैन किया जाने वाला पक्ष स्कैनर के ग्लास पक्ष का सामना कर सके, दस्तावेज़ के शीर्ष छोर के साथ नीचे शासक के किनारे के साथ संरेखित किया जाए, और फिर स्कैनर है स्कैनिंग के लिए तैयार करने के लिए कवर किया गया। स्कैनिंग के लिए स्कैन ड्राइवर सॉफ्टवेयर में प्रवेश करने के लिए विंडो में "स्कैन" बटन पर क्लिक करें। स्कैनिंग विधि का वर्णन यहां नहीं किया जाएगा। हालांकि, यह ध्यान दिया जाना चाहिए कि रिज़ॉल्यूशन 200 ~ 400 डीपीआई पर सेट किया जा सकता है। पाठ दस्तावेज़ों के लिए, चमक को समायोजित करना महत्वपूर्ण है।


2. ओसीआर मान्यता

ऑपरेशन में आसानी के लिए, मेनू से विकल्प चुनें और विंडो के बाईं ओर विभिन्न आइकन दिखाई दें।

बेहतर उपयोग के लिए, पहले आइकन को ऊपर से नीचे तक स्क्रीन के बाईं ओर पेश करें:


"ज़ूम इन" टूल: छवि को बढ़ाने के लिए; "ज़ूम आउट" टूल: छवि को कम करने के लिए; "पहचान क्षेत्र स्थापित करना" उपकरण: मान्यता क्षेत्र स्थापित करने के लिए; "मान्यता क्रम सेट करना" उपकरण: मान्यता क्रम सेट करने के लिए; मान्यता क्षेत्र उपकरण हटाएँ: मान्यता क्षेत्र को हटाने के लिए; "मिटाएँ छवि शोर" उपकरण: छवि में एक क्षेत्र को मिटाने के लिए; "छवि घुमाएँ" टूल: छवि को 90 °, 180 ° या 270 ° घुमाने के लिए; झुकाव सुधार उपकरण: मैन्युअल छवि झुकाव सुधार के लिए।


ओसीआर पहचान के लिए सामान्य कदम:


(1) दस्तावेज़ के स्कैन के बाद, मान्यता प्राप्त होने वाला पाठ विंडो में दिखाई देने वाला बहुत छोटा है। सबसे पहले, चित्र को अधिक स्पष्ट करने के लिए छवि को ठीक से बड़ा करने के लिए "ज़ूम इन" टूल का चयन करें। यदि आवश्यक हो, तो आप स्क्रीन के आकार को उचित रूप से कम करने के लिए "ज़ूम आउट" टूल का चयन कर सकते हैं।

(२) यदि स्क्रीन को ९ ० °, १ 270० ° या २ use० ° घुमाया जाना है, तो छवि को घुमाने के लिए Rotate Image टूल का उपयोग करें। यदि पाठ स्क्रीन झुकी हुई है, तो स्क्रीन को समायोजित करने के लिए झुकाव सुधार उपकरण चुनें।

(3) मान्यता के दौरान "सेट मान्यता क्षेत्र" उपकरण का चयन करें, और चरित्र स्क्रीन पर पहचाने जाने वाले क्षेत्र को फ्रेम करें। इस स्थिति में, स्क्रीन की स्थिति के अनुसार कई क्षेत्रों को तैयार किया जा सकता है। यदि फ़्रेम किया गया क्षेत्र गलत है, तो आप चयनित पहचाने गए क्षेत्र को हटाने के लिए हटाए गए पहचान क्षेत्र उपकरण का उपयोग कर सकते हैं।

(4) मान्यता दर में सुधार करने के लिए, यदि चयनित मान्यता क्षेत्र में शोर या पहचानने योग्य छवि है, तो बिट द्वारा शोर को मिटाने के लिए "मिटा छवि शोर" उपकरण का चयन किया जा सकता है। यदि आपको टुकड़ों में मिटाने की आवश्यकता है, तो आप वाइप इमेज ब्लॉक टूल का चयन कर सकते हैं।

(5) "पहचानें" आइकन पर क्लिक करें, फिर ओसीआर डिस्प्ले टेक्स्ट सेगमेंटेशन कर रहा है, फिर "रिकॉगनाइजिंग" स्क्रीन पर ट्रांसफर हो जाएगा, और मान्यता प्राप्त टेक्स्ट को चरण दर चरण प्रदर्शित किया जाएगा, और फिर "डॉक्यूमेंट प्रूफ़रीडिंग" विंडो में ट्रांसफर किया जाएगा दिखाया गया है।

कई ओसीआर सॉफ़्टवेयर में एक पाठ संशोधन फ़ंक्शन होता है जो पाठ को पहचानता है जो गलत हो सकता है, एक स्पष्ट रंग में प्रदर्शित होता है, और इसे संशोधित किया जा सकता है।

(6) किसी फ़ाइल (TXT) फ़ाइल या Word RTF फ़ाइल के रूप में मान्यता प्राप्त फ़ाइल को संग्रहीत करें।

जांच भेजें