LuraPDF
Tutorial

স্ক্যান করা PDF সার্চযোগ্য করুন OCR দিয়ে

OCR কীভাবে কাজ করে ও এর নির্ভুলতা কীসে নির্ভর করে জানুন। ব্রাউজারেই স্ক্যান করা PDF-কে সার্চযোগ্য ডকুমেন্টে রূপান্তর করুন, যাতে টেক্সট কপি করা যায়।

LuraPDF Team
LuraPDF Team

সম্পাদনা এবং প্রযুক্তিগত দল · ৪ মে, ২০২৬ · 6 মিনিটের পাঠ

স্ক্যান করা PDF হলো একটি নথির ডিজিটাল ছবি। পৃষ্ঠাগুলো হলো ইমেজ। আপনি টেক্সট সিলেক্ট করতে, কোনো শব্দ খুঁজতে, কোনো বাক্য কপি করতে বা কোনো টেক্সট প্রসেসিং টুলে বিষয়বস্তু দিতে পারবেন না। তথ্য পুনরুদ্ধারের দৃষ্টিকোণ থেকে, একটি স্ক্যান করা PDF মূলত অস্বচ্ছ।

OCR (Optical Character Recognition) এই সমস্যা সমাধান করে সেই ইমেজগুলো বিশ্লেষণ করে এবং ভিজ্যুয়াল কন্টেন্টের উপরে একটি টেক্সট লেয়ার তৈরি করে। ফলাফল: একটি PDF যা মূল স্ক্যানের মতো দেখতে অভিন্ন কিন্তু একটি অদৃশ্য টেক্সট লেয়ার ধারণ করে যা সবকিছু সিলেক্টযোগ্য, অনুসন্ধানযোগ্য এবং কপিযোগ্য করে তোলে।

OCR কীভাবে কাজ করে

LuraPDF Tesseract.js ব্যবহার করে, যা Tesseract-এর ব্রাউজার-কম্পাইলড সংস্করণ — সবচেয়ে নির্ভুল ওপেন-সোর্স OCR ইঞ্জিনগুলোর মধ্যে একটি, Google দ্বারা রক্ষণাবেক্ষণ করা হয় এবং মূলত HP Labs দ্বারা তৈরি করা হয়েছিল। Tesseract একটি নিউরাল নেটওয়ার্ক মডেল (LSTM-ভিত্তিক) ব্যবহার করে যা ডজনখানেক ভাষায় লক্ষ লক্ষ নথির পৃষ্ঠায় প্রশিক্ষিত।

OCR পাইপলাইন:

  1. পৃষ্ঠা রেন্ডারিং: প্রতিটি PDF পৃষ্ঠা উচ্চ রেজোলিউশনে (সর্বোচ্চ নির্ভুলতার জন্য 300+ DPI) একটি ক্যানভাস ইমেজে রেন্ডার করা হয়
  2. প্রি-প্রসেসিং: ইমেজ উন্নয়ন — বাইনারাইজেশন, নয়েজ হ্রাস, ডিস্কিউয়িং (ঘোরানো স্ক্যান সোজা করা)
  3. লেআউট বিশ্লেষণ: টেক্সট অঞ্চল, কলাম, টেবিল এবং নন-টেক্সট উপাদান শনাক্ত করা
  4. অক্ষর শনাক্তকরণ: নিউরাল নেটওয়ার্ক বিভক্ত টেক্সট অঞ্চল থেকে প্রতিটি অক্ষর শ্রেণীবদ্ধ করে
  5. পোস্ট-প্রসেসিং: একই রকম অক্ষর অস্পষ্টতা দূর করতে ভাষা মডেল স্কোরিং (যেমন, "l" বনাম "1", "O" বনাম "0")
  6. PDF লেখা: শনাক্তকৃত টেক্সট সংশ্লিষ্ট ভিজ্যুয়াল অক্ষরের উপরে নির্ভুলভাবে স্থাপিত অদৃশ্য টেক্সট লেয়ার হিসেবে এম্বেড করা হয়

অদৃশ্য টেক্সট লেয়ারই ফলাফলকে অনুসন্ধানযোগ্য করে তোলে। ভিজ্যুয়াল পৃষ্ঠার চেহারা মূল স্ক্যান ইমেজই থাকে — আপনি ঠিক যা স্ক্যান করেছেন তাই দেখেন, কিন্তু নিচের টেক্সট এখন মেশিন-পাঠযোগ্য।

OCR নির্ভুলতাকে কী প্রভাবিত করে

ইনপুটের মান অনুযায়ী নির্ভুলতা উল্লেখযোগ্যভাবে পরিবর্তিত হয়:

স্ক্যান রেজোলিউশন

নির্ভরযোগ্য নির্ভুলতার জন্য 300 DPI হলো ন্যূনতম। 200 DPI-এর নিচে, অক্ষর শনাক্তকরণ উল্লেখযোগ্যভাবে হ্রাস পায়। যদি আপনি OCR-এর জন্য নথি স্ক্যান করেন, সবসময় 300 DPI বা তার বেশিতে স্ক্যান করুন।

150 DPI বা তার কম রেজোলিউশনে স্ক্যান করা নথিগুলো OCR করার আগে উচ্চতর রেজোলিউশনে পুনরায় স্ক্যান করা উচিত। কম রেজোলিউশনের স্ক্যানে OCR চালালে ইঞ্জিন যত ভালোই হোক না কেন, খারাপ ফলাফল দেয়।

ফন্ট এবং প্রিন্টের মান

  • মুদ্রিত টেক্সট (লেজার প্রিন্টার আউটপুট, টাইপসেট বই): পরিষ্কার মূল কপিতে 98–99% নির্ভুলতা
  • স্পষ্ট অক্ষর সহ উচ্চমানের হস্তলিপি: 85–95%
  • ম্লান বা বিবর্ণ টেক্সট: কনট্রাস্টের উপর নির্ভর করে 80–95%
  • কার্বন কপি কাগজ: 60–85%
  • পুরনো সংবাদপত্র / টাইপরাইটার: পরিষ্কার স্ক্যানে 90–95%
  • কার্সিভ হস্তলিপি: 40–70% — নিউরাল নেটওয়ার্ক OCR কার্সিভে দুর্বল

পৃষ্ঠার অভিমুখ

মারাত্মকভাবে কাত বা ঘোরানো পৃষ্ঠা নির্ভুলতা ক্ষতিগ্রস্ত করে। Tesseract সহ অধিকাংশ OCR ইঞ্জিন স্বয়ংক্রিয়ভাবে ছোটখাট ঘূর্ণন শনাক্ত ও সংশোধন করে (প্রায় ~10 ডিগ্রি পর্যন্ত)। মারাত্মকভাবে ঘোরানো পৃষ্ঠাগুলো OCR চালানোর আগে Rotate PDF ব্যবহার করে ম্যানুয়ালি সংশোধন করা উচিত।

ভাষা

Tesseract 100+ ভাষা সমর্থন করে। LuraPDF-এর OCR টুল স্বয়ংক্রিয়ভাবে ইংরেজি শনাক্ত করে। নন-ল্যাটিন স্ক্রিপ্ট বা ইংরেজি ছাড়া অন্য নথির জন্য, ভাষা নির্বাচন নির্ভুলতা উল্লেখযোগ্যভাবে উন্নত করে।

LuraPDF দিয়ে PDF OCR করার পদ্ধতি

  1. OCR টুল খুলুন: LuraPDF OCR PDF-এ যান
  2. স্ক্যান করা PDF আপলোড করুন: আপনার ফাইলটি টেনে এনে ছেড়ে দিন
  3. ভাষা নির্বাচন করুন (ইংরেজি না হলে): নথির প্রাথমিক ভাষা বেছে নিন
  4. "Run OCR" ক্লিক করুন: প্রসেসিং আপনার ব্রাউজারে পৃষ্ঠা অনুযায়ী ঘটে। সময় নথির দৈর্ঘ্যের উপর নির্ভর করে — একটি আধুনিক কম্পিউটারে 20 পৃষ্ঠার স্ক্যান সাধারণত 30–90 সেকেন্ড সময় নেয়।
  5. অনুসন্ধানযোগ্য PDF ডাউনলোড করুন: আউটপুট হলো মূল স্ক্যান ইমেজ এবং এম্বেডেড টেক্সট লেয়ার সহ একটি PDF

ফলাফল যাচাই করা

OCR-এর পরে, নির্ভুলতা যাচাই করুন:

  • পৃষ্ঠায় টেক্সট সিলেক্ট করুন — টেক্সট মুদ্রিত অক্ষরের ঠিক উপরে সিলেক্টযোগ্য হওয়া উচিত
  • একটি সাধারণ শব্দ খুঁজতে (Ctrl+F / Cmd+F) অনুসন্ধান করুন — এটি পাওয়া উচিত
  • একটি অনুচ্ছেদ কপি করে টেক্সট এডিটরে পেস্ট করুন — আউটপুট পাঠযোগ্য হওয়া উচিত

নির্ভুলতা খারাপ হলে, অন্য টুল চেষ্টা করার আগে প্রথমে ইনপুট স্ক্যানের মান পরীক্ষা করুন।

কখন অন্য অপারেশনের আগে OCR চালাবেন

OCR বিশুদ্ধ-ইমেজ PDFতে কাজ না করা অতিরিক্ত LuraPDF অপারেশন আনলক করে:

  • OCR-এর পরে Compress PDF: একবার টেক্সট বের করা হলে, ইমেজ অঞ্চলগুলো কখনো কখনো আরো আক্রমণাত্মকভাবে কম্প্রেস করা যায়
  • OCR-এর পরে PDF to Word: OCR করা PDF থেকে Word-এ রূপান্তর করলে সম্পাদনযোগ্য টেক্সট পাওয়া যায়; কাঁচা স্ক্যান রূপান্তর করলে এম্বেডেড ইমেজ সহ একটি Word ফাইল পাওয়া যায়
  • OCR-এর পরে Redact PDF: টেক্সট-ভিত্তিক রিড্যাকশন OCR করা নথিতে সঠিকভাবে কাজ করে
  • অনুসন্ধান এবং উদ্ধার: পুনরায় টাইপ না করে নির্দিষ্ট তথ্য খুঁজুন এবং কপি করুন

গোপনীয়তা: OCR আপনার ব্রাউজারে চলে

Tesseract.js WebAssembly ব্যবহার করে সম্পূর্ণ OCR প্রক্রিয়া স্থানীয়ভাবে চালায়। আপনার স্ক্যান করা নথিগুলো — যাতে প্রায়ই চিকিৎসা রেকর্ড, আর্থিক বিবরণী, আইনি নথি বা ব্যক্তিগতভাবে সনাক্তযোগ্য তথ্য থাকে — কখনো আপনার ডিভাইস ছাড়ে না। কোনো রিমোট সার্ভার আপনার ফাইল প্রসেস করে না।

ক্লাউড OCR সেবার তুলনায় এটি একটি উল্লেখযোগ্য সুবিধা, কারণ ক্লাউড সেবাগুলো আপনার প্রসেস করা সবকিছুর একটি কপি অবশ্যই গ্রহণ করে।

ব্রাউজার-ভিত্তিক OCR-এর সীমাবদ্ধতা

প্রসেসিং সময়

Tesseract.js নেটিভ ডেস্কটপ Tesseract বা ক্লাউড OCR API-এর চেয়ে ধীর। আপনার হার্ডওয়্যারের উপর নির্ভর করে প্রতি পৃষ্ঠায় প্রায় 3–8 সেকেন্ড আশা করুন। একটি 50 পৃষ্ঠার নথিতে কয়েক মিনিট সময় লাগতে পারে।

টেবিল

Tesseract টেবিলের বিষয়বস্তু শনাক্ত করে কিন্তু PDF-এর টেক্সট লেয়ারে টেবিলের কাঠামো পুনর্গঠন করে না — টেক্সট পড়ার ক্রমে থাকবে কিন্তু সেলের কাঠামো সংরক্ষিত হবে না। কাঠামোবদ্ধ টেবিল উদ্ধারের জন্য, OCR করা PDF থেকে Word-এ রূপান্তর করুন এবং টেবিলটি ম্যানুয়ালি পুনরায় ফরম্যাট করুন।

গাণিতিক নোটেশন

LaTeX-স্টাইলের সমীকরণ এবং গাণিতিক প্রতীকের নির্ভুলতা কম। Tesseract মডেলগুলো স্বাভাবিক ভাষার টেক্সটের জন্য অপ্টিমাইজ করা।

হস্তলিপি

যেমন উল্লেখ করা হয়েছে, কার্সিভ হস্তলিপির নির্ভুলতা সীমিত। মুদ্রিত হস্তলিপি ভালো ফলাফল দেয়। গুরুত্বপূর্ণ হস্তলিখিত নথির জন্য, প্রতিটি পৃষ্ঠা ম্যানুয়ালি যাচাই করুন।

সাধারণ জিজ্ঞাসা

OCR করা টেক্সট অক্ষরের সাথে মিলছে না — এটা কি বাগ? এটি মারাত্মকভাবে কাত স্ক্যানের সাথে ঘটতে পারে। টেক্সটের অবস্থান শনাক্তকৃত অক্ষরের অবস্থান থেকে গণনা করা হয়, কিন্তু পৃষ্ঠার জ্যামিতি অস্বাভাবিক হলে, সংযোজন সরে যেতে পারে। OCR চালানোর আগে কাত সংশোধন করতে PDF ঘোরানো ব্যবহার করে দেখুন।

আমি কি শুধু নির্দিষ্ট পৃষ্ঠায় OCR করতে পারি? LuraPDF সব পৃষ্ঠা প্রসেস করে। আপনি যদি শুধু নির্দিষ্ট পৃষ্ঠায় OCR চান, তাহলে প্রথমে Extract PDF Pages ব্যবহার করে সেই পৃষ্ঠাগুলো বের করুন, OCR চালান, তারপর ঐচ্ছিকভাবে ফলাফল মার্জ করুন।

OCR কি আমার স্ক্যান করা নথির ভিজ্যুয়াল চেহারা পরিবর্তন করে? না। মূল স্ক্যান ইমেজগুলো হুবহু সংরক্ষিত থাকে। শুধুমাত্র একটি অদৃশ্য টেক্সট লেয়ার যোগ করা হয়।

আমি কি এমন PDF-এ OCR চালাতে পারি যার কিছু পৃষ্ঠায় টেক্সট আছে এবং কিছু পৃষ্ঠা স্ক্যান করা? হ্যাঁ — Tesseract ইমেজ-ভিত্তিক পৃষ্ঠা প্রসেস করে এবং একটি টেক্সট লেয়ার যোগ করে। যেসব পৃষ্ঠায় ইতোমধ্যে টেক্সট লেয়ার আছে সেগুলো অপ্রভাবিত থাকে।

আমার নথি আরবি / চীনা / জাপানি ভাষায় — OCR কি কাজ করবে? হ্যাঁ, কিন্তু চালানোর আগে টুলে সঠিক ভাষা নির্বাচন করুন। CJK এবং ডান-থেকে-বাম ভাষার জন্য Tesseract-এর নির্ভুলতা ভালো কিন্তু ল্যাটিন-স্ক্রিপ্ট নথির তুলনায় স্ক্যানের মানের উপর বেশি নির্ভর করে।

OCR স্ক্যান করা নথির লকড আর্কাইভকে অ্যাক্সেসযোগ্য, অনুসন্ধানযোগ্য, প্রসেসযোগ্য তথ্যে রূপান্তরিত করে। স্ক্যান করা চুক্তির একটি ক্যাবিনেট পূর্ণ সংগ্রহ একটি অনুসন্ধানযোগ্য ডেটাবেজে পরিণত হয়। চিকিৎসা রেকর্ডের একটি স্তূপ এমন একটি নথি হয়ে যায় যা আপনি আসলেই নেভিগেট করতে পারেন। প্রক্রিয়াটি কয়েক সেকেন্ড থেকে মিনিট সময় নেয় এবং সম্পূর্ণ আপনার ডিভাইসে চলে।

লেখক সম্পর্কে

LuraPDF Team
LuraPDF Team

সম্পাদনা এবং প্রযুক্তিগত দল · ৪ মে, ২০২৬ · 6 মিনিটের পাঠ

LuraPDF টিম হলো ডকুমেন্ট প্রসেসিং বিশেষজ্ঞ, সফটওয়্যার ইঞ্জিনিয়ার এবং টেকনিক্যাল রাইটারদের একটি দল, যারা PDF এডিটিংকে ফ্রি, প্রাইভেট ও সবার জন্য সহজলভ্য করে তুলছে।