PDF থেকে Word-এ ফরম্যাটিং অক্ষুণ্ণ রেখে রূপান্তর করার উপায়
PDF থেকে Word রূপান্তর কেন কখনো নিখুঁত হয় না: কোন ফরম্যাটিং টিকে থাকে, কোনটি হারায় এবং ফরম্যাটিং ক্ষতি ন্যূনতম রাখার কার্যকর কৌশল জেনে নিন।

সম্পাদনা এবং প্রযুক্তিগত দল · ৩ মে, ২০২৬ · 6 মিনিটের পাঠ
PDF থেকে Word-এ রূপান্তর করার সময় ব্যবহারকারীরা একটি পুনরাবৃত্তিমূলক হতাশার মুখোমুখি হন: আউটপুট দেখতে ভুল মনে হয়। কলামগুলি সরে যায়, ছবিগুলি অপ্রত্যাশিত জায়গায় ভাসতে থাকে, ফন্ট পরিবর্তিত হয়, টেবিলগুলি সাধারণ টেক্সটে ভেঙে পড়ে। কনভার্টার "কাজ করেনি।"
অথচ এটি কাজ করেছিল। সমস্যাটি হলো PDF এবং Word-এর মধ্যে একটি মৌলিক কাঠামোগত অমিল। এই অমিল বোঝার মাধ্যমে আপনি জানতে পারবেন কখন রূপান্তর ভালো কাজ করবে, কখন করবে না এবং এর বিষয়ে কী করতে হবে।
কেন PDF এবং Word মৌলিকভাবে আলাদা
PDF (Portable Document Format) একটি ফিক্সড-লেআউট ফরম্যাট। এটি একটি ডকুমেন্টকে পৃষ্ঠায় ভিজ্যুয়াল উপাদানগুলির একটি নির্ভুল বিন্যাস হিসেবে বর্ণনা করে — প্রতিটি অক্ষরের পয়েন্টে একটি নিরঙ্কুশ অবস্থান রয়েছে, প্রতিটি ছবির সঠিক স্থানাঙ্ক রয়েছে, প্রতিটি রেখার একটি নির্দিষ্ট স্ট্রোক প্রস্থ রয়েছে। PDF উপাদানগুলির মধ্যে সম্পর্ক বর্ণনা করে না। এর কাছে শব্দার্থিক অর্থে "প্যারাগ্রাফ," "টেবিল," বা "হেডিং"-এর কোনো ধারণা নেই। এটি শুধু বলে: এই গ্লিফটি (245, 410) অবস্থানে রাখো।
Word (.docx) একটি ফ্লো ডকুমেন্ট ফরম্যাট। এটি শব্দার্থিক কাঠামোর ভিত্তিতে কন্টেন্ট বর্ণনা করে: প্যারাগ্রাফ, স্টাইল, টেবিল, হেডার, কলাম। চূড়ান্ত ভিজ্যুয়াল রূপ ফাইলে নির্ধারিত না থেকে ডিসপ্লে সময়ে একটি রেন্ডারিং ইঞ্জিন দ্বারা গণনা করা হয়।
এই দুটি মডেলের মধ্যে রূপান্তর স্বাভাবিকভাবেই তথ্য হারায়। PDF থেকে Word-এ রূপান্তরের জন্য প্রয়োজন:
- অক্ষর নিষ্কাশন: PDF থেকে গ্লিফ অবস্থান এবং Unicode মান পড়া
- টেক্সট পুনর্গঠন: গ্লিফ স্পেসিং থেকে শব্দের সীমানা অনুমান করা
- লেআউট অনুমান: অবস্থান ডেটা থেকে কোনটি "প্যারাগ্রাফ," "টেবিল," "কলাম," বা "হেডিং" ছিল তা অনুমান করা
- কাঠামো ম্যাপিং: PDF-এর ভিজ্যুয়াল উপস্থিতির কাছাকাছি Word উপাদান তৈরি করা
ধাপ ৩ এবং ৪ হিউরিস্টিক — শিক্ষিত অনুমান। কোনো অ্যালগরিদম ১০০% নির্ভুল নয় কারণ মূল ডকুমেন্ট কাঠামো পুনর্গঠনের জন্য প্রয়োজনীয় তথ্য PDF-এ নেই। ডকুমেন্টটি প্রথমবার PDF-এ এক্সপোর্ট করার সময় মূল কাঠামো হারিয়ে গিয়েছিল।
কোনটি ভালো রূপান্তরিত হয়
সীমাবদ্ধতা সত্ত্বেও, নির্দিষ্ট ধরনের কন্টেন্টের জন্য রূপান্তর ভালো কাজ করে:
- সাধারণ টেক্সট ডকুমেন্ট: ন্যূনতম ফর্ম্যাটিং সহ প্রবাহমান টেক্সটের প্যারাগ্রাফ পরিষ্কারভাবে রূপান্তরিত হয়। বডি টেক্সট, বুলেট তালিকা, নম্বরযুক্ত তালিকা — এগুলো সব ভালো রূপান্তরিত হয়।
- মৌলিক টেবিল: স্পষ্ট সেল বর্ডারযুক্ত টেবিলগুলি সাধারণত Word টেবিল অবজেক্টে সঠিকভাবে রূপান্তরিত হয়।
- সাধারণ হেডার এবং ফুটার: এগুলো সাধারণত সঠিকভাবে সনাক্ত করা হয়।
- স্ট্যান্ডার্ড ফন্ট: সাধারণ ফন্ট (Times New Roman, Arial, Calibri) ব্যবহারকারী ডকুমেন্টগুলি সঠিকভাবে পুনরুৎপাদিত হয়। অস্পষ্ট বা আলংকারিক ফন্ট ব্যবহারকারী ডকুমেন্টগুলি বিকল্প দেখাতে পারে।
কোনটি খারাপ রূপান্তরিত হয়
এই উপাদানগুলি সমস্ত PDF-to-Word কনভার্টারে নির্ভরযোগ্যভাবে সমস্যাজনক:
- মাল্টি-কলাম লেআউট: একটি দুই-কলামের ম্যাগাজিন লেআউট প্রায়ই একটি একক কলামে রূপান্তরিত হয় যেখানে কলামগুলিতে পাঠ ক্রম অনুসারে টেক্সট প্রবাহিত হয়, উদ্দিষ্ট কাঠামো হারিয়ে যায়।
- স্পষ্ট বর্ডারবিহীন টেবিল: সেল বর্ডারের পরিবর্তে স্পেসিং দিয়ে তৈরি দৃশ্যমান টেবিলগুলি টেবিল হিসেবে স্বীকৃত হয় না।
- ছবিতে টেক্সট: ছবির অংশ হিসেবে থাকা টেক্সট (PDF টেক্সট হিসেবে রেন্ডার করার পরিবর্তে) নন-OCR কনভার্টারগুলি দ্বারা একেবারেই বের করা হয় না। এটি একটি ইমেজ অবজেক্ট হিসেবে প্রদর্শিত হয়।
- স্ক্যান করা ডকুমেন্ট: একটি স্ক্যান করা PDF সম্পূর্ণ ইমেজ ডেটা। OCR ছাড়া, রূপান্তর এমবেডেড ছবি সহ একটি Word ফাইল তৈরি করে, সম্পাদনযোগ্য টেক্সট নয়।
- জটিল পজিশনড অবজেক্ট: টেক্সট বক্স, কলআউট, সাইডবার এবং নিরঙ্কুশ পজিশনিং সহ ফ্লোটিং উপাদানগুলি খুব কমই তাদের উদ্দিষ্ট Word সমতুল্যে রূপান্তরিত হয়।
- আলংকারিক ফন্ট এবং লিগেচার: নন-স্ট্যান্ডার্ড গ্লিফ এনকোডিং ব্যবহারকারী ফন্টগুলি বিকৃত টেক্সটে রূপান্তরিত হতে পারে।
স্ক্যান করা PDF রূপান্তর করা
যদি আপনার PDF একটি স্ক্যান করা ডকুমেন্ট হয়, তাহলে আপনার একটি অতিরিক্ত ধাপ রয়েছে: প্রথমে OCR চালান।
- একটি টেক্সট লেয়ার যোগ করে ডকুমেন্টটিকে অনুসন্ধানযোগ্য করতে LuraPDF OCR PDF ব্যবহার করুন
- তারপর LuraPDF PDF to Word দিয়ে OCR করা PDF টি Word-এ রূপান্তর করুন
এই দুই-ধাপের প্রক্রিয়া একটি স্ক্যান সরাসরি রূপান্তর করার চেয়ে উল্লেখযোগ্যভাবে ভালো Word আউটপুট তৈরি করে, কারণ OCR ধাপটি প্রকৃত PDF টেক্সট অবজেক্ট তৈরি করে যা কনভার্টার প্রক্রিয়া করতে পারে।
LuraPDF দিয়ে PDF থেকে Word-এ রূপান্তর করার পদ্ধতি
- কনভার্টার খুলুন: LuraPDF PDF to Word-এ যান
- আপনার PDF আপলোড করুন: ড্র্যাগ অ্যান্ড ড্রপ করুন বা ব্রাউজ করতে ক্লিক করুন
- "Convert" ক্লিক করুন: PDF পার্সিংয়ের জন্য pdf.js এবং Mammoth-এর বিপরীত রূপান্তর লজিক ব্যবহার করে রূপান্তর আপনার ব্রাউজারে চলে
- ডাউনলোড করুন: আপনি Microsoft Word, LibreOffice, বা Google Docs-এ খুলতে প্রস্তুত একটি .docx ফাইল পাবেন
আরও ভালো ফলাফল পাওয়া: ব্যবহারিক কৌশল
টেক্সট-ভারী ডকুমেন্টের জন্য:
- রূপান্তর ফলাফল মূলের কাছাকাছি হবে। যেকোনো স্পেসিং সমস্যা ঠিক করতে দ্রুত একবার দেখে নিন।
টেবিলযুক্ত ডকুমেন্টের জন্য:
- টেবিলগুলি ভুলভাবে রূপান্তরিত হলে, মূল টেবিলে দৃশ্যমান বর্ডার ছিল কিনা পরীক্ষা করুন। বর্ডারহীন টেবিলগুলি প্রায়ই খারাপভাবে রূপান্তরিত হয়।
- রূপান্তর আউটপুটকে টেক্সট রেফারেন্স হিসেবে ব্যবহার করে Word-এ জটিল টেবিলগুলি ম্যানুয়ালি পুনর্নির্মাণ করুন।
মাল্টি-কলাম লেআউটের জন্য:
- মেনে নিন যে কলামগুলি সম্ভবত রৈখিক হয়ে যাবে। রূপান্তরিত টেক্সটকে শুরুর বিন্দু হিসেবে ব্যবহার করুন এবং Word-এ ম্যানুয়ালি কলাম লেআউট পুনরায় প্রয়োগ করুন।
ভারীভাবে ফর্ম্যাট করা ডকুমেন্টের জন্য:
- বিবেচনা করুন আপনার আসলে একটি সম্পাদনযোগ্য Word ফাইল দরকার কিনা, নাকি শুধু টেক্সট বের করতে হবে। শুধু টেক্সট নিষ্কাশনের জন্য, LuraPDF PDF to Text পরিষ্কার প্লেইন টেক্সট আউটপুট দেয়।
কখন রূপান্তর করবেন না
কখনো কখনো PDF-to-Word রূপান্তর সঠিক পদ্ধতি নয়:
- আপনি শুধু কন্টেন্ট পড়তে চান: PDF খুলুন। আপনার রূপান্তর করার দরকার নেই।
- আপনি ছোট সম্পাদনা করতে চান: সরাসরি রূপান্তর ছাড়াই টেক্সট যোগ করতে, টাইপো সংশোধন করতে, বা রিডেক্ট করতে LuraPDF Edit PDF ব্যবহার করুন।
- আপনাকে নির্দিষ্ট পৃষ্ঠা বের করতে হবে: আপনার প্রয়োজনীয় পৃষ্ঠাগুলি একটি ছোট PDF হিসেবে পেতে Extract PDF Pages ব্যবহার করুন।
PDF-to-Word রূপান্তর উপযুক্ত যখন আপনাকে কন্টেন্ট উল্লেখযোগ্যভাবে পুনর্লিখন বা পুনর্ফর্ম্যাট করতে হবে এবং সোর্স ফাইল আর পাওয়া যাচ্ছে না।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
Word ফাইলটি PDF থেকে আলাদা দেখায় কেন? কারণ PDF এবং Word মৌলিকভাবে ভিন্ন লেআউট মডেল ব্যবহার করে। কনভার্টার ভিজ্যুয়াল অবস্থান ডেটা থেকে কাঠামো পুনর্গঠন করে, যা স্বাভাবিকভাবেই আনুমানিক। আউটপুট একটি সর্বোত্তম প্রচেষ্টার আনুমানিক ফলাফল।
রূপান্তরিত টেক্সট বিকৃত দেখাচ্ছে — কেন? PDF সম্ভবত একটি কাস্টম গ্লিফ এনকোডিং বা একটি Type 3 ফন্ট ব্যবহার করে যেখানে স্ট্যান্ডার্ড অক্ষর ম্যাপিং ব্যর্থ হয়। এটি পুরনো PDF, আইনি আদালতের ফাইলিং এবং নন-স্ট্যান্ডার্ড PDF জেনারেটর দ্বারা তৈরি ডকুমেন্টে সাধারণ।
পাসওয়ার্ড-সুরক্ষিত PDF Word-এ রূপান্তর করতে পারব কি? প্রথমে Unlock PDF দিয়ে পাসওয়ার্ড সরান, তারপর রূপান্তর করুন।
রূপান্তর কি হাইপারলিঙ্ক সংরক্ষণ করে? কখনো কখনো। মূল PDF যদি URL-এর দিকে নির্দেশ করে লিঙ্ক অ্যানোটেশন ধারণ করে, তাহলে সেগুলি প্রায়ই রূপান্তরে টিকে থাকে। অভ্যন্তরীণ বুকমার্ক এবং ক্রস-রেফারেন্স সাধারণত থাকে না।
রূপান্তরিত ফাইলের কিছু জায়গায় টেক্সটের পরিবর্তে বড় ছবি রয়েছে। PDF-এর সেই অংশগুলি রাস্টারাইজড ছবি, টেক্সট নয়। প্রথমে PDF-এ OCR চালান, তারপর রূপান্তর করুন।
সফল PDF-to-Word রূপান্তরের মূল চাবিকাঠি হলো ইনপুট ধরনের সাথে আপনার প্রত্যাশা মেলানো। পরিষ্কার, টেক্সট-ভারী PDF চমৎকারভাবে রূপান্তরিত হয়। জটিল লেআউটের জন্য রূপান্তর-পরবর্তী পরিষ্কার প্রয়োজন। স্ক্যান করা ডকুমেন্টের জন্য প্রথমে OCR দরকার। সঠিক প্রত্যাশা নির্ধারণ করলে টুলটি খুব কমই হতাশ করবে।