स्क्यान गरिएका PDF मा कुनै टेक्स्ट लेयर छैन
स्क्यानरबाट PDF बनाउँदा, कन्टेन्ट इमेजको रूपमा भण्डारण हुन्छ। मानक टेक्स्ट एक्सट्र्याक्सनले केही पाउँदैन। OCR ले इमेज पिक्सेलबाट अक्षर चिन्छ।
Scanned PDF → Excel · OCR संचालित
OCR (Optical Character Recognition) प्रयोग गरेर स्क्यान गरिएको PDF बाट टेबल निकाल्नुहोस्। टुलले इमेजबाट टेक्स्ट चिन्छ र टेबल संरचना पुनर्निर्माण गर्छ। सबै प्रोसेसिङ स्थानीय रूपमा चल्छ — कुनै अपलोड छैन, पूर्ण निःशुल्क।
तपाईंको PDF यहाँ छोड्नुहोस्
वा ब्राउज गर्न क्लिक गर्नुहोस् — टेबल स्वचालित रूपमा पहिचान हुन्छ
टेक्स्ट-आधारित र स्क्यान गरिएका PDF समर्थित, अधिकतम ५० एमबी
वेब पेजबाट टेबल निकाल्न चाहनुहुन्छ? Table Extractor एक्सटेन्सन प्रयोग गर्नुहोस्।
एक्सटेन्सन लिनुहोस्स्क्यान गरिएको PDF समस्या
स्क्यान गरिएका PDF अनिवार्य रूपमा इमेज हुन् — कुनै चयन योग्य टेक्स्ट छैन। मानक एक्सट्र्याक्टरले केही फर्काउँदैन। BAngleTools ले OCR प्रयोग गरेर इमेजबाट टेक्स्ट चिन्छ र टेबल पुनर्निर्माण गर्छ।
स्क्यानरबाट PDF बनाउँदा, कन्टेन्ट इमेजको रूपमा भण्डारण हुन्छ। मानक टेक्स्ट एक्सट्र्याक्सनले केही पाउँदैन। OCR ले इमेज पिक्सेलबाट अक्षर चिन्छ।
OCR Web Worker मा चल्छ ताकि ब्राउजर ब्लक नहोस्। प्रोग्रेस रियल-टाइममा देखाइन्छ ताकि तपाईंलाई थाहा होस् कि पहिचान कति टाढा पुगेको छ।
अनलाइन OCR टुलले तपाईंका स्क्यान गरिएका कागजात तिनीहरूको सर्भरमा पठाउँछ। BAngleTools ले OCR पूर्ण रूपमा तपाईंको ब्राउजरमा चलाउँछ — तपाईंका स्क्यान कागजात निजी रहन्छन्।
OCR पूर्ण छैन। प्रिभ्यूले चिनिएको टेक्स्ट सम्पादन योग्य सेलसहित देखाउँछ ताकि तपाईं Excel मा निर्यात गर्नु अघि गलत पढिएका अक्षर सच्याउन सक्नुहुन्छ।
Tesseract.js ले 100+ भाषा समर्थन गर्छ। टुलले कागजातको भाषा स्वचालित रूपमा पहिचान गर्छ र उपयुक्त OCR मोडेल प्रयोग गर्छ।
Adobe Acrobat, ABBYY FineReader वा कमाण्ड-लाइन OCR टुल चाहिँदैन। पेज खोल्नुहोस्, स्क्यान गरिएको PDF अपलोड गर्नुहोस्, र Excel आउटपुट पाउनुहोस्।
कसरी काम गर्छ
BAngleTools Scanned PDF देखि Excel कन्भर्टरले दुई प्रविधि जोड्छ: PDF पेज इमेजको रूपमा पढ्न Mozilla को pdf.js र OCR (Optical Character Recognition) को लागि Tesseract.js। तपाईंले स्क्यान गरिएको PDF अपलोड गर्दा, pdf.js ले हरेक पेज क्यान्भासमा रेन्डर गर्छ, र Tesseract.js ले Web Worker को भित्र रेन्डर गरिएको इमेजबाट टेक्स्ट चिन्छ।
OCR इन्जिनले इमेजलाई पिक्सेल-दर-पिक्सेल विश्लेषण गर्छ, अक्षर आकृति पहिचान गर्छ, र भाषा मोडेल प्रयोग गरेर तिनीहरूलाई टेक्स्टमा म्याप गर्छ। यसले त्यसपछि चिनिएको टेक्स्ट (पोजिसनल डेटासहित) लाई टेक्स्ट-आधारित PDF को लागि प्रयोग गरिएको त्यही टेबल पत्ता लगाउने एल्गोरिदममा पठाउँछ, टेक्स्ट पोजिसनबाट पंक्ति र कलम पुनर्निर्माण गर्छ।
सबै प्रोसेसिङ तपाईंको ब्राउजरमा स्थानीय रूपमा हुन्छ। OCR इन्जिन Web Worker मा चल्छ, त्यसैले पहिचानको क्रममा ब्राउजर रेस्पन्सिभ रहन्छ। तपाईंका स्क्यान गरिएका कागजात — चाहे ती मेडिकल रेकर्ड होऊन्, कानूनी फाइलिङ होऊन्, वा ऐतिहासिक अभिलेखागार होऊन् — कहिल्यै तपाईंको डिभाइस छोड्दैनन्।
कसले प्रयोग गर्छ
स्क्यान गरिएका प्रिन्टेड टेबल, बिजक र फर्मलाई पुनः टाइप नगरी एडिटेबल Excel स्प्रेडसिटमा बदल्नुहोस्।
स्क्यान गरिएका ऐतिहासिक कागजात, जनगणना रेकर्ड र पुराना रिपोर्टबाट ट्याबुलर डेटा निकाल्नुहोस् डिजिटल संरक्षण र अनुसन्धानको लागि।
स्क्यान गरिएका मेडिकल टेस्ट नतिजा, ल्याब रिपोर्ट र बिरामी रेकर्डबाट डेटा संरचित Excel ढाँचामा निकाल्नुहोस् — गोपनीयता अनुपालनको लागि सबै स्थानीय रूपमा।
स्क्यान गरिएका अदालत फाइलिङ, अनुबन्ध र कानूनी टेबललाई एडिटेबल Excel डेटामा बदल्नुहोस् केस व्यवस्थापन र विश्लेषणको लागि।
स्क्यान गरिएका रसिद र सप्लायर बिजकलाई Excel डेटामा बदल्नुहोस् खर्च ट्र्याकिङ, बुककिपिङ र प्रतिपूर्ति प्रोसेसिङको लागि।
स्क्यान गरिएका सरकारी फर्म, ट्याक्स फाइलिङ र नियामक सबमिसनबाट ट्याबुलर डेटा संरचित Excel ढाँचामा निकाल्नुहोस्।
चरण-चरण
प्रश्नोत्तर
हो, BAngleTools स्क्यान गरिएको PDF देखि Excel कन्भर्टर पूर्ण रूपमा निःशुल्क छ — कुनै प्रयोग सीमा छैन, कुनै दर्ता छैन, कुनै वाटरमार्क छैन। OCR तपाईंको ब्राउजरमा निःशुल्क चल्छ।
होइन। PDF रेन्डरिङ र OCR पहिचान दुवै पूर्ण रूपमा तपाईंको ब्राउजरमा Web Worker ले हुन्छन्। तपाईंका स्क्यान कागजात कहिल्यै कुनै सर्भरमा अपलोड हुँदैनन्। यो मेडिकल रेकर्ड र कानूनी फाइलिङजस्ता संवेदनशील कागजातको लागि अत्यन्त महत्त्वपूर्ण छ।
टुलले Tesseract.js प्रयोग गर्छ, जुन Tesseract OCR इन्जिनको एउटा JavaScript पोर्ट हो जुन मूल रूपमा HP ले विकास गरेको र Google ले अनुरक्षण गरेको थियो। यसले 100+ भाषा समर्थन गर्छ र पूर्ण रूपमा ब्राउजरमा चल्छ।
OCR सटीकता स्क्यानको गुणस्तरमा निर्भर गर्छ। स्पष्ट, उच्च-रिजोल्युसन स्क्यान राम्रो कन्ट्रास्टसहित 95%+ सटीकता हासिल गर्छन्। फिका, झुकेका वा कम-रिजोल्युसन स्क्यानले बढी त्रुटि उत्पादन गर्छन्। प्रिभ्यूले तपाईंलाई निर्यात गर्नु अघि कुनै गलत पढिएका अक्षर सच्याउन दिन्छ।
हो। प्रिभ्यूले चिनिएको टेबल सम्पादन योग्य सेलसहित देखाउँछ। कुनै पनि सेल क्लिक गरेर OCR त्रुटि सच्याउनुहोस्, कलम अलाइनमेन्ट मिलाउनुहोस्, वा डाउनलोड गर्नु अघि डेटा सफा गर्नुहोस्।
OCR प्रोसेसिङ समय पेज संख्या र स्क्यान गुणस्तरमा निर्भर गर्छ। एउटा सामान्य एकल-पेज स्क्यानमा 5-15 सेकेन्ड लाग्छ। मल्टि-पेज कागजातमा अनुपातिक रूपमा बढी समय लाग्छ। प्रोग्रेस रियल-टाइममा देखाइन्छ।
Tesseract.js ले 100+ भाषा समर्थन गर्छ जसमा English, Chinese, Japanese, Korean, Arabic, Hindi, Bengali र धेरै थप समावेश छन्। टुलले कागजातको भाषा स्वचालित रूपमा पहिचान गर्छ।
अधिकतम PDF फाइल साइज 50MB हो। चूँकि OCR कम्प्युटेसनली निबिड छ, धेरै ठूला स्क्यान गरिएका PDF प्रोसेस गर्न केही मिनेट लाग्न सक्छ। उत्तम प्रदर्शनको लागि डेस्कटप ब्राउजर प्रयोग गर्नुहोस्।
सम्बन्धित टुल
स्क्यान गरिएको PDF अपलोड गर्नुहोस्, OCR चलाउनुहोस्, नतिजा प्रिभ्यू गर्नुहोस्, र Excel डाउनलोड गर्नुहोस्। नो साइनअप, नो अपलोड, पूर्ण निःशुल्क।