PDFを圧縮するとテキストは検索できなくなる?
多くのPDF圧縮ツールはページを画像に変換するため、検索可能なテキストがひっそりと失われてしまいます。圧縮の種類を見分ける方法と、それぞれの適切な使いどころを解説します。

編集・技術チーム · 2026年9月21日 · 13分読む
はい — ほとんどの場合はそうです。圧縮ツールでPDFが劇的に小さくなったなら、ほぼ確実にすべてのページが画像に変換されており、中のテキストはもはやテキストではありません。
たいていは最悪のタイミングで気づきます。契約書の条項を検索しても結果が出ない、段落をコピーしようとしても何も取れない、そういった瞬間です。このガイドでは、なぜそうなるのか、確認する方法、そしてテキストを失わずにファイルを圧縮する方法を説明します。
「圧縮」という一つの言葉が指す、まったく異なる二つの操作
「圧縮」は、正反対の仕組みで動く二つのことを指します。どちらの方式が使われているか、ほとんどのツールは教えてくれません。
可逆圧縮:ファイルの再構築
ドキュメントの構造をより効率的に書き直します。重複するリソースは統合され、未使用のオブジェクトは削除され、内部ストリームは再パックされます。ページ上のコンテンツには一切手を加えません。
テキストはテキストのまま残ります。フォントは埋め込まれたまま。リンク、フォームフィールド、注釈も保持されます。ただし、サイズ削減効果は限定的で、通常は 20〜30% 程度。すでに最適化されたファイルでは、ほとんど変わらないこともあります。
非可逆圧縮:ページを「撮影」する
各ページを画像としてレンダリングし、その画像を圧縮して、1ページにつき1枚の画像からなる新しいPDFを作成します。
これは非常に効果的で、スキャン文書では 60〜80% の削減も珍しくありません。文字とそれを描くピクセルの区別を捨て去るからです。そしてそこにこそ問題があります。この処理後、ページはドキュメントの「写真」になります。検索できるテキストは一切存在しません。
どちらの方式が使われたか確認する方法
出力ファイルを開き、本文テキストの一行をカーソルで選択してみてください。
- テキストカーソルが表示されて個々の単語をハイライトできる — テキストは保持されています。
- ページ全体を囲む選択ボックスが表示される、または何も起きない — ページは画像です。
もう二つの簡単な確認方法もあります。Ctrl+F(MacではCmd+F)を押して、はっきり見えている単語を検索してみてください。また、400%に拡大してみてください。本物のテキストはフォントのアウトラインで描かれるため、どの拡大率でも鮮明なままです。画像の場合は徐々にぼやけ、やがてブロック状になります。
思っているより深刻な理由
検索可能なテキストを失うことは、単なる不便にとどまりません。
検索も抽出もできなくなります。 ドキュメントからデータを読み取るあらゆるワークフローが機能しなくなります。経費精算システム、契約レビュー、ドキュメント管理のインデックス化などが該当します。
スクリーンリーダーが読み取れません。 これが最も深刻な問題です。画像のみのページは、支援技術を使用しているすべての人にとってまったくアクセスできません。一般向けに公開するドキュメントや、アクセシビリティ義務がある環境での作業では、画像のみのPDFは許容できる出力ではありません。
検索エンジンがインデックスできません。 テキストレイヤーのないPDFをウェブサイトに公開しても、検索への貢献はゼロです。
品質の劣化は取り戻せません。 OCRを実行してピクセルから文字を推測するという方法以外に、後からテキストを復元する手段はありません。精度はおおむね高いものの、完璧ではなく、元の書式は失われます。
意図を持って選択する
LuraPDFのPDF圧縮ツールは両方の方式を提供しており、各設定がどちらかを明示しています。
「テキストを保持」 は可逆圧縮の方式です。ドキュメントが検索される、支援技術で読まれる、自動処理される、記録として保管されるといった場合は常にこちらを使用してください。削減効果は控えめです。
「最小サイズ」 は非可逆圧縮の方式で、3段階の強度があります(おおよそ144、108、72 DPI)。ファイルサイズに厳しい制限があり、単純に人が目で確認するだけの場合に使用してください。これらのモードではいずれもテキストが選択不可能になることが、ツール上で明記されています。
ポータルが特定のファイルサイズを要求する場合のための 「目標サイズ」 モードもあります。これも非可逆圧縮モードのため、同じトレードオフが発生します。
違いが生じないケース
PDFがスキャンの場合、そもそも失うべきテキストが存在しません。ページの写真には文字がなく、あるのはピクセルだけです。どのツールで作成しても同じです。
スキャン文書では、非可逆圧縮によって検索性は何も失われません。もともと検索性がないからです。スキャンがよく圧縮できる理由もそこにあります。純粋な画像データであり、それこそが非可逆圧縮の想定する対象だからです。
スキャンを検索可能にしたい場合は、別の操作が必要です。OCRはピクセルを読み取り、テキストレイヤーを追加します。圧縮の前に実行することをお勧めします。強い圧縮をかけると文字が認識しにくくなり、OCRの精度が下がるためです。
実用的な判断基準
一つの問いを立ててみてください。このファイルが送られた後、人間の目以外に何か読む必要があるものはありますか?
- いいえ — 同僚がざっと確認する、ポータルのレビュアーが承認する、メールで送るだけ。非可逆圧縮で問題ありません。70%の削減を享受しましょう。
- はい — 検索される、インデックス化される、アーカイブされる、音読される、処理される。可逆圧縮を維持し、削減効果が小さくても受け入れて、スペースは別の方法で確保しましょう。
「別の方法」とは、たいていページを削ることです。不要なページを削除すれば、どんな圧縮設定よりも効果的で、品質も損ないません。PDFページを抽出すれば、必要なページだけを取り出せます。
すでにテキストを失ってしまった場合
ファイルを画像として圧縮してしまい、元のファイルがもう手元にない場合、テキストを元の形で復元することはできません。選択肢は二つです。ソースドキュメントに戻って再エクスポートするか、圧縮済みバージョンにOCRを実行して新しいテキストレイヤーを生成するかです。
すでに大きく圧縮されたファイルへのOCRは、これらの中で最も精度が低くなります。圧縮によって、認識の基となる文字の形そのものが損なわれているためです。これが、大切なファイルの元データを保管しておく最も強力な理由です。
よくある質問
リーダーで開かずに、PDFに本物のテキストがあるか確認できますか? 最も手軽な確認方法は開いて一行選択してみることです。確実に確かめたい場合は、ページに見えている単語を検索してください。何もヒットしなければ、テキストレイヤーはありません。
スキャンでないPDFでも、圧縮によってテキストが失われることがありますか? はい。非可逆圧縮は、元のコンテンツに関係なくすべてのページを画像としてレンダリングします。Wordから書き出した正常なテキスト付きのPDFでも、「最小サイズ」モードで圧縮すればテキストは失われます。
ファイルが小さいほど常に品質が低いのですか? いいえ。可逆圧縮は品質をまったく変えずにファイルを小さくします。詳細情報を削るのではなく、無駄を取り除くからです。ただし、誰もが期待するような劇的な削減は実現できません。
圧縮したPDFが見た目では変わりません。テキストは保持されていますか? 必ずしもそうとは限りません。通常の拡大率では、うまく圧縮されたページの画像は元のものと非常に近く見えます。テキストを選択してみることが唯一の確実なテストです。
圧縮後にテキストを元に戻せますか? OCRを実行してピクセルを認識し、新しいテキストレイヤーを生成する方法しかありません。たいていは正確ですが、保証はなく、元の書式も復元されません。