স্ক্যান করা PDF-এ কোনো টেক্সট লেয়ার নেই
স্ক্যানার থেকে PDF তৈরি করলে কন্টেন্ট ইমেজ হিসেবে সংরক্ষিত হয়। স্ট্যান্ডার্ড টেক্সট এক্সট্র্যাকশন কিছুই পায় না। OCR ইমেজ পিক্সেল থেকে অক্ষর চিনে।
Scanned PDF → Excel · OCR চালিত
OCR (Optical Character Recognition) ব্যবহার করে স্ক্যান করা PDF থেকে টেবিল বের করুন। টুল ইমেজ থেকে টেক্সট চিনে এবং টেবিল কাঠামো পুনর্নির্মাণ করে। সব প্রসেসিং লোকালিতে চলে — কোনো আপলোড নেই, সম্পূর্ণ বিনামূল্যে।
আপনার PDF এখানে ছাড়ুন
বা ব্রাউজ করতে ক্লিক করুন — টেবিল স্বয়ংক্রিয়ভাবে সনাক্ত হয়
টেক্সট-ভিত্তিক এবং স্ক্যান করা PDF সমর্থন করে, সর্বোচ্চ ৫০ মেগাবাইট
ওয়েব পেজ থেকে টেবিল বের করতে চান? Table Extractor এক্সটেনশন চেষ্টা করুন।
এক্সটেনশন নিনস্ক্যান করা PDF সমস্যা
স্ক্যান করা PDF মূলত ইমেজ — কোনো সিলেক্টেবল টেক্সট নেই। স্ট্যান্ডার্ড এক্সট্র্যাক্টর কিছুই ফেরত দেয় না। BAngleTools OCR ব্যবহার করে ইমেজ থেকে টেক্সট চিনে এবং টেবিল পুনর্নির্মাণ করে।
স্ক্যানার থেকে PDF তৈরি করলে কন্টেন্ট ইমেজ হিসেবে সংরক্ষিত হয়। স্ট্যান্ডার্ড টেক্সট এক্সট্র্যাকশন কিছুই পায় না। OCR ইমেজ পিক্সেল থেকে অক্ষর চিনে।
OCR Web Worker-এ চলে যাতে ব্রাউজার ব্লক না হয়। রিয়েল-টাইমে প্রগ্রেস দেখানো হয় যাতে আপনি জানেন চেনা কতদূর এগিয়েছে।
অনলাইন OCR টুল আপনার স্ক্যান করা ডকুমেন্ট তাদের সার্ভারে পাঠায়। BAngleTools OCR সম্পূর্ণভাবে আপনার ব্রাউজারে চালায় — আপনার স্ক্যান করা ডকুমেন্ট গোপনীয় থাকে।
OCR নিখুঁত নয়। প্রিভিউ চেনা টেক্সট এডিটেবল সেলসহ দেখায় যাতে আপনি Excel এ এক্সপোর্টের আগে ভুল পড়া অক্ষর ঠিক করতে পারেন।
Tesseract.js 100+ ভাষা সমর্থন করে। টুল ডকুমেন্টের ভাষা স্বয়ংক্রিয়ভাবে সনাক্ত করে এবং উপযুক্ত OCR মডেল ব্যবহার করে।
Adobe Acrobat, ABBYY FineReader বা কমান্ড-লাইন OCR টুলের দরকার নেই। পেজ খুলুন, স্ক্যান করা PDF আপলোড করুন, এবং Excel আউটপুট নিন।
যেভাবে কাজ করে
BAngleTools Scanned PDF থেকে Excel কনভার্টার দুটি প্রযুক্তি যুক্ত করে: PDF পেজ ইমেজ হিসেবে পড়ার জন্য Mozilla এর pdf.js এবং OCR (Optical Character Recognition) এর জন্য Tesseract.js। আপনি স্ক্যান করা PDF আপলোড করলে, pdf.js প্রতিটি পেজ ক্যানভাসে রেন্ডার করে, এবং Tesseract.js Web Worker এর ভেতরে রেন্ডার করা ইমেজ থেকে টেক্সট চিনে।
OCR ইঞ্জিন ইমেজ পিক্সেল বাই পিক্সেল বিশ্লেষণ করে, অক্ষরের আকৃতি সনাক্ত করে, এবং ভাষা মডেল ব্যবহার করে সেগুলোকে টেক্সটে ম্যাপ করে। এটি তারপর চেনা টেক্সট (পজিশনাল ডেটাসহ) টেক্সট-ভিত্তিক PDF এর জন্য ব্যবহৃত একই টেবিল সনাক্তকরণ অ্যালগরিদমে পাঠায়, টেক্সট পজিশন থেকে সারি ও কলাম পুনর্নির্মাণ করে।
সব প্রসেসিং আপনার ব্রাউজারে লোকালিতে হয়। OCR ইঞ্জিন Web Worker এ চলে, তাই চেনার সময় ব্রাউজার রেসপন্সিভ থাকে। আপনার স্ক্যান করা ডকুমেন্ট — মেডিকেল রেকর্ড, আইনি ফাইলিং বা ঐতিহাসিক আর্কাইভ যাই হোক — কখনো আপনার ডিভাইস ছাড়ে না।
কারা ব্যবহার করে
স্ক্যান করা প্রিন্টেড টেবিল, চালান এবং ফর্ম কে পুনরায় টাইপ ছাড়াই এডিটেবল Excel স্প্রেডশিটে রূপান্তর করুন।
স্ক্যান করা ঐতিহাসিক ডকুমেন্ট, সেনসাস রেকর্ড এবং পুরোনো রিপোর্ট থেকে ট্যাবুলার ডেটা বের করুন ডিজিটাল সংরক্ষণ ও গবেষণার জন্য।
স্ক্যান করা মেডিকেল টেস্ট ফলাফল, ল্যাব রিপোর্ট এবং রোগীর রেকর্ড থেকে ডেটা কাঠামোগত Excel ফরম্যাটে বের করুন — গোপনীয়তা কমপ্লায়েন্সের জন্য সব লোকালিতে।
স্ক্যান করা আদালতের ফাইলিং, চুক্তি এবং আইনি টেবিল কে এডিটেবল Excel ডেটায় রূপান্তর করুন কেস ম্যানেজমেন্ট ও বিশ্লেষণের জন্য।
স্ক্যান করা রসিদ এবং সাপ্লায়ার চালান কে Excel ডেটায় পরিণত করুন খরচ ট্র্যাকিং, বুককিপিং এবং পরিশোধ প্রসেসিংয়ের জন্য।
স্ক্যান করা সরকারি ফর্ম, ট্যাক্স ফাইলিং এবং রেগুলেটরি সাবমিশন থেকে ট্যাবুলার ডেটা কাঠামোগত Excel ফরম্যাটে বের করুন।
ধাপে ধাপে
প্রশ্নোত্তর
হ্যাঁ, BAngleTools স্ক্যান করা PDF থেকে Excel কনভার্টার সম্পূর্ণ বিনামূল্যে — কোনো ব্যবহারের সীমা নেই, কোনো রেজিস্ট্রেশন নেই, কোনো ওয়াটারমার্ক নেই। OCR আপনার ব্রাউজারে বিনামূল্যে চলে।
না। PDF রেন্ডারিং এবং OCR চেনা উভয়ই সম্পূর্ণভাবে আপনার ব্রাউজারে Web Worker দিয়ে হয়। আপনার স্ক্যান করা ডকুমেন্ট কখনো কোনো সার্ভারে আপলোড হয় না। এটি মেডিকেল রেকর্ড এবং আইনি ফাইলিংয়ের মতো সংবেদনশীল ডকুমেন্টের জন্য অত্যন্ত গুরুত্বপূর্ণ।
টুল Tesseract.js ব্যবহার করে, যা Tesseract OCR ইঞ্জিনের একটি JavaScript পোর্ট যা মূলত HP দ্বারা তৈরি এবং Google দ্বারা রক্ষিত। এটি 100+ ভাষা সমর্থন করে এবং সম্পূর্ণভাবে ব্রাউজারে চলে।
OCR নির্ভুলতা স্ক্যানের গুণগত মানের উপর নির্ভর করে। পরিষ্কার, উচ্চ-রেজোলিউশন স্ক্যান ভালো কন্ট্রাস্টের সাথে 95%+ নির্ভুলতা অর্জন করে। ফ্যাকেড, বাঁকা বা কম-রেজোলিউশন স্ক্যানে বেশি ত্রুটি হয়। প্রিভিউ আপনাকে এক্সপোর্টের আগে যেকোনো ভুল পড়া অক্ষর সংশোধন করতে দেয়।
হ্যাঁ। প্রিভিউ চেনা টেবিল এডিটেবল সেলসহ দেখায়। যেকোনো সেল ক্লিক করে OCR ত্রুটি সংশোধন, কলাম অ্যালাইনমেন্ট ঠিক বা ডেটা পরিষ্কার করতে পারেন ডাউনলোডের আগে।
OCR প্রসেসিং সময় পেজ সংখ্যা এবং স্ক্যান গুণমানের উপর নির্ভর করে। একটি সাধারণ একক-পেজ স্ক্যানে 5-15 সেকেন্ড লাগে। মাল্টি-পেজ ডকুমেন্টে আনুপাতিকভাবে বেশি সময় লাগে। প্রগ্রেস রিয়েল-টাইমে দেখানো হয়।
Tesseract.js 100+ ভাষা সমর্থন করে যার মধ্যে English, Chinese, Japanese, Korean, Arabic, Hindi, Bengali এবং আরও অনেক ভাষা। টুল ডকুমেন্টের ভাষা স্বয়ংক্রিয়ভাবে সনাক্ত করে।
সর্বোচ্চ PDF ফাইল সাইজ 50MB। যেহেতু OCR কম্পিউটেশনালি নিবিড়, খুব বড় স্ক্যান করা PDF প্রসেস করতে কয়েক মিনিট লাগতে পারে। সেরা পারফরম্যান্সের জন্য ডেস্কটপ ব্রাউজার ব্যবহার করুন।
সম্পর্কিত টুল
স্ক্যান করা PDF আপলোড করুন, OCR চালান, ফলাফল প্রিভিউ করুন, এবং Excel ডাউনলোড করুন। নো সাইনআপ, নো আপলোড, সম্পূর্ণ বিনামূল্যে।