PDF কম্প্রেস করলে কি টেক্সট অনুসন্ধানযোগ্যতা নষ্ট হয়?
বেশিরভাগ PDF কম্প্রেসর পৃষ্ঠাগুলো ছবিতে রূপান্তর করে ফেলে, ফলে সার্চযোগ্য টেক্সট নীরবে হারিয়ে যায়। কোন ধরনের কম্প্রেশন পাচ্ছেন এবং কখন কোনটি সঠিক পছন্দ, তা জানুন।

সম্পাদনা এবং প্রযুক্তিগত দল · ২১ সেপ্টেম্বর, ২০২৬ · 6 মিনিটের পাঠ
হ্যাঁ — বেশিরভাগ ক্ষেত্রে। কোনো কম্প্রেসর যদি আপনার PDF অনেকটা ছোট করে দেয়, তাহলে সে প্রায় নিশ্চিতভাবে প্রতিটি পেজকে একটি ছবিতে পরিণত করে দিয়েছে, এবং ভেতরের লেখা আর লেখা নেই।
সাধারণত এটা পরে জানা যায়, সবচেয়ে খারাপ মুহূর্তে: একটি চুক্তিতে কোনো ধারা খুঁজতে গিয়ে কোনো ফলাফল পাওয়া যায় না, অথবা একটি প্যারাগ্রাফ পেস্ট করতে গিয়ে কিছুই পাওয়া যায় না। এই গাইডে ব্যাখ্যা করা হয়েছে কেন এটা ঘটে, কীভাবে যাচাই করবেন, এবং কীভাবে লেখা না হারিয়ে ফাইল কম্প্রেস করবেন।
একটি শব্দে দুটি সম্পূর্ণ আলাদা কাজ
"Compress" দুটি জিনিস বোঝায় যেগুলো একেবারে বিপরীত পদ্ধতিতে কাজ করে। টুলগুলো খুব কমই জানায় আপনি কোনটি পাচ্ছেন।
Lossless: ফাইল পুনর্গঠন
ডকুমেন্টের কাঠামো আরও দক্ষভাবে পুনর্লিখিত হয়। ডুপ্লিকেট রিসোর্স একত্রিত করা হয়, অব্যবহৃত অবজেক্ট বাদ দেওয়া হয়, এবং অভ্যন্তরীণ স্ট্রিমগুলো পুনরায় প্যাক করা হয়। পেজের কিছুই স্পর্শ করা হয় না।
লেখা লেখাই থাকে। ফন্ট এম্বেডেড থাকে। লিংক, ফর্ম ফিল্ড এবং অ্যানোটেশন টিকে থাকে। সমস্যা হলো সাইজ কমানোর পরিমাণ: সাধারণত ২০–৩০%, এবং আগে থেকেই ভালোভাবে তৈরি ফাইলে কখনো কখনো প্রায় কিছুই না।
Lossy: পেজের ছবি তোলা
প্রতিটি পেজ একটি ইমেজে রেন্ডার করা হয়, সেই ইমেজ কম্প্রেস করা হয়, এবং প্রতি পেজে একটি করে ছবি দিয়ে নতুন PDF তৈরি হয়।
এটি অত্যন্ত কার্যকর — স্ক্যান করা ডকুমেন্টে ৬০–৮০% স্বাভাবিক — কারণ এটি একটি অক্ষর এবং তা আঁকার পিক্সেলের মধ্যে পার্থক্যটাই বাদ দিয়ে দেয়। এটাই ঠিক সমস্যাটা। এরপর পেজটি আপনার ডকুমেন্টের একটি ছবি মাত্র। খোঁজার মতো কোনো লেখা নেই।
আপনি কোনটি পেয়েছেন তা বোঝার উপায়
আউটপুটটি খুলুন এবং কার্সর দিয়ে বডি টেক্সটের একটি লাইন সিলেক্ট করার চেষ্টা করুন।
- টেক্সট কার্সর দেখা যাচ্ছে এবং আলাদা শব্দ হাইলাইট করা যাচ্ছে — লেখা টিকে আছে।
- পুরো পেজজুড়ে একটি সিলেকশন বক্স আসছে, অথবা কিছুই হচ্ছে না — পেজটি একটি ইমেজ।
আরও দুটি দ্রুত পরীক্ষা: Ctrl+F (Mac-এ Cmd+F) চাপুন এবং স্পষ্টভাবে দেখতে পাওয়া একটি শব্দ খুঁজুন। এবং ৪০০%-এ জুম করুন। আসল লেখা যেকোনো জুমে স্পষ্ট থাকে কারণ এটি ফন্ট আউটলাইন থেকে আঁকা হয়; ইমেজ ঝাপসা হয়ে তারপর দানাদার হয়ে যায়।
কেন এটি যতটা মনে হয় তার চেয়ে বেশি গুরুত্বপূর্ণ
সার্চযোগ্য লেখা হারানো শুধু অসুবিধার বিষয় নয়।
সার্চ বা এক্সট্র্যাক্ট করা যাবে না। যেকোনো ওয়ার্কফ্লো যা ডকুমেন্ট থেকে ডেটা পড়ে সেটি কাজ করা বন্ধ করে দেবে — খরচ ব্যবস্থাপনা সিস্টেম, চুক্তি পর্যালোচনা, ডকুমেন্ট ম্যানেজমেন্ট ইন্ডেক্সিং।
স্ক্রিন রিডার পড়তে পারবে না। এটিই গুরুতর বিষয়। যে পেজটি একটি ইমেজ, সেটি অ্যাসিস্টিভ টেকনোলজি ব্যবহারকারী যেকোনো ব্যক্তির কাছে সম্পূর্ণ অপাঠযোগ্য। আপনি যদি এমন কোনো ডকুমেন্ট প্রকাশ করেন যা জনগণ পড়বে, অথবা অ্যাক্সেসিবিলিটি বাধ্যবাধকতা আছে এমন পরিবেশে কাজ করেন, তাহলে ইমেজ-শুধু PDF গ্রহণযোগ্য আউটপুট নয়।
সার্চ ইঞ্জিন ইন্ডেক্স করতে পারবে না। কোনো ওয়েবসাইটে প্রকাশিত PDF যার টেক্সট লেয়ার নেই সেটি সার্চে কোনো অবদান রাখে না।
মান এখন স্থায়ী। পরে লেখা পুনরুদ্ধার করা যাবে না, শুধু OCR চালিয়ে করা যাবে, যা পিক্সেল দেখে অনুমান করে লেখা পুনরায় যোগ করে — সাধারণত সঠিকভাবে, কিন্তু কখনো নিখুঁতভাবে নয়, এবং কখনো মূল ফরম্যাটিং সহ নয়।
সচেতনভাবে বেছে নেওয়া
আমাদের Compress PDF টুল উভয়টাই দেয়, এবং জানায় প্রতিটি সেটিং কোনটি।
Keep text হলো lossless পথ। যখন ডকুমেন্ট সার্চ করা হবে, অ্যাসিস্টিভ টেকনোলজি দিয়ে পড়া হবে, স্বয়ংক্রিয়ভাবে প্রক্রিয়া করা হবে, অথবা রেকর্ড হিসেবে রাখা হবে তখন ব্যবহার করুন। সামান্য কমানোর আশা করুন।
Smallest size হলো lossy পথ, তিনটি শক্তিতে — মোটামুটি ১৪৪, ১০৮ এবং ৭২ DPI। এটি ব্যবহার করুন যখন ফাইলটি একটি নির্দিষ্ট সীমার মধ্যে রাখতে হবে এবং একজন মানুষ শুধু দেখবেন। টুলটি স্পষ্টভাবে জানায় যে এই মোডগুলোর কোনোটিতেই লেখা সিলেক্টযোগ্য থাকে না।
এছাড়াও একটি Target size মোড আছে যখন কোনো পোর্টাল একটি নির্দিষ্ট সংখ্যা চায়। এটি একটি lossy মোড, তাই একই ট্রেড-অফ প্রযোজ্য।
যেখানে এটি কোনো পার্থক্য তৈরি করে না
আপনার PDF যদি স্ক্যান হয়, তাহলে হারানোর মতো কোনো লেখাই ছিল না। একটি পেজের ছবিতে কোনো অক্ষর নেই, শুধু পিক্সেল, যেই টুলই তা তৈরি করুক না কেন।
স্ক্যানের জন্য, lossy কম্প্রেশন সার্চযোগ্যতায় কিছুই কোস্ট করে না — কারণ আপনার কাছে তা ছিলই না। এ কারণেই স্ক্যান এত ভালোভাবে কম্প্রেস হয়: সেগুলো বিশুদ্ধ ইমেজ ডেটা, যা ঠিক lossy কম্প্রেশনের জন্যই ডিজাইন করা।
আপনি যদি স্ক্যান সার্চযোগ্য করতে চান, এটি একটি আলাদা অপারেশন: OCR পিক্সেল পড়ে নিচে একটি টেক্সট লেয়ার যোগ করে। কম্প্রেস করার আগে করা মূল্যবান, কারণ আক্রমণাত্মক কম্প্রেশন অক্ষরগুলো চেনা কঠিন করে দেয় এবং OCR কম নির্ভুল হয়।
একটি নিয়ম যা কাজ করে
একটি প্রশ্ন করুন: ফাইলটি পাঠানোর পরে, একজোড়া মানবচোখ ছাড়া অন্য কিছু কি তা পড়তে হবে?
- না — একজন সহকর্মী এক ঝলক দেখবেন, একজন পোর্টাল রিভিউয়ার অনুমোদন দেবেন, এটি ইমেইলে যাবে। Lossy ঠিক আছে। ৭০% নিয়ে নিন।
- হ্যাঁ — এটি সার্চ করা হবে, ইন্ডেক্স করা হবে, আর্কাইভ করা হবে, জোরে পড়া হবে, বা প্রক্রিয়া করা হবে। Lossless থাকুন, কম সাশ্রয় মেনে নিন, এবং অন্য জায়গায় জায়গা খুঁজুন।
"অন্য জায়গা" সাধারণত পেজ। কেউ চায়নি এমন পেজ সরানো যেকোনো কম্প্রেশন সেটিংকে হারায়, এবং মানে কোনো মূল্য নেই। Extract PDF pages শুধু দরকারি পেজগুলো বের করে দেবে।
যদি আপনি ইতোমধ্যে হারিয়ে ফেলেন
যদি আপনি একটি ফাইল ইমেজে কম্প্রেস করে ফেলেছেন এবং মূল ফাইল আর নেই, তাহলে লেখা তার মূল রূপে পুনরুদ্ধারযোগ্য নয়। আপনার বিকল্প হলো উৎস ডকুমেন্টে ফিরে যাওয়া এবং আবার এক্সপোর্ট করা, অথবা কম্প্রেস করা ভার্সনে OCR চালিয়ে নতুন টেক্সট লেয়ার তৈরি করা।
ইতোমধ্যে ভারীভাবে কম্প্রেস করা ফাইলে OCR সবচেয়ে দুর্বল, কারণ কম্প্রেশন সেই অক্ষরের আকৃতিগুলোই নষ্ট করেছে যার উপর চেনার প্রক্রিয়া নির্ভর করে। যেটি গুরুত্বপূর্ণ যেকোনো কিছুর মূল ফাইল রেখে দেওয়ার সবচেয়ে শক্তিশালী যুক্তি।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
রিডারে না খুলেই কি বোঝা যাবে PDF-এ আসল লেখা আছে? সবচেয়ে দ্রুত পরীক্ষা হলো খুলে একটি লাইন সিলেক্ট করার চেষ্টা করা। নিশ্চিত হতে চাইলে, পেজে স্পষ্টভাবে দেখা একটি শব্দ খুঁজুন — সার্চ কিছু না পেলে কোনো টেক্সট লেয়ার নেই।
স্ক্যান করা হয়নি এমন PDF থেকেও কি কম্প্রেশন লেখা সরিয়ে দিতে পারে? হ্যাঁ। Lossy কম্প্রেশন পেজে যা-ই থাকুক না কেন প্রতিটি পেজকে ইমেজে রেন্ডার করে। Word থেকে এক্সপোর্ট করা সম্পূর্ণ ভালো লেখা-সহ PDF "smallest size" মোডে কম্প্রেস করলে সেই লেখা হারিয়ে যাবে।
ছোট ফাইল মানেই কি সবসময় খারাপ মান? না। Lossless কম্প্রেশন মানের কোনো পরিবর্তন না করেই ফাইল ছোট করে — এটি বিস্তারিত বাদ দেওয়ার বদলে অপচয় সরায়। শুধু মানুষ যে নাটকীয় কমানো আশা করে তা অর্জন করতে পারে না।
কম্প্রেস করা PDF দেখতে একই রকম। লেখা কি থেকেছে? অগত্যা নয়। স্বাভাবিক জুমে, একটি পেজের ভালোভাবে কম্প্রেস করা ইমেজ মূলের কাছাকাছি দেখায়। লেখা সিলেক্ট করার চেষ্টাই একমাত্র নির্ভরযোগ্য পরীক্ষা।
কম্প্রেস করার পরে কি লেখা আবার যোগ করা যাবে? শুধু OCR চালিয়ে, যা পিক্সেল চিনে নতুন টেক্সট লেয়ার তৈরি করে। এটি সাধারণত নির্ভুল কিন্তু কখনো নিশ্চিত নয়, এবং এটি মূল ফরম্যাটিং পুনরুদ্ধার করে না।