Tutorial

Como Fazer OCR a um PDF Digitalizado e Torná-lo Pesquisável

Saiba como funciona o OCR, o que afeta a sua precisão e como tornar um PDF digitalizado pesquisável e com texto copiável, diretamente no navegador.

LuraPDF Team
LuraPDF Team

Equipa Editorial e Técnica · 4 de maio de 2026 · 7 min de leitura

Um PDF digitalizado é uma fotografia digital de um documento. As páginas são imagens. Não é possível selecionar texto, pesquisar uma palavra, copiar uma frase ou utilizar o conteúdo em qualquer ferramenta de processamento de texto. Para efeitos de recuperação de informação, um PDF digitalizado é essencialmente opaco.

O OCR (Reconhecimento Ótico de Caracteres) resolve este problema ao analisar essas imagens e construir uma camada de texto que se sobrepõe ao conteúdo visual. O resultado: um PDF visualmente idêntico ao scan original, mas que contém uma camada de texto invisível que torna tudo selecionável, pesquisável e copiável.

Como Funciona o OCR

O LuraPDF utiliza o Tesseract.js, a versão compilada para browser do Tesseract — um dos motores OCR de código aberto mais precisos, mantido pelo Google e originalmente desenvolvido pelos HP Labs. O Tesseract usa um modelo de rede neural (baseado em LSTM) treinado em milhões de páginas de documentos em dezenas de idiomas.

O processo OCR:

  1. Renderização da página: Cada página do PDF é renderizada numa imagem de tela com alta resolução (300+ DPI para melhor precisão)
  2. Pré-processamento: Melhoria da imagem — binarização, redução de ruído, correção de inclinação (endireitamento de scans rodados)
  3. Análise de layout: Deteção de regiões de texto, colunas, tabelas e elementos não textuais
  4. Reconhecimento de caracteres: A rede neural classifica cada caractere a partir de regiões de texto segmentadas
  5. Pós-processamento: Pontuação pelo modelo de linguagem para desambiguar caracteres semelhantes (por exemplo, "l" vs "1", "O" vs "0")
  6. Escrita do PDF: O texto reconhecido é incorporado como camada de texto invisível, posicionada com precisão sobre os caracteres visuais correspondentes

A camada de texto invisível é o que torna o resultado pesquisável. O aspeto visual da página mantém a imagem do scan original — vê exatamente o que digitalizou, mas o texto subjacente é agora legível por máquina.

O Que Afeta a Precisão do OCR

A precisão varia significativamente com a qualidade da entrada:

Resolução do scan

300 DPI é o mínimo para uma precisão fiável. Abaixo de 200 DPI, o reconhecimento de caracteres degrada-se substancialmente. Se estiver a digitalizar documentos para OCR, faça-o sempre a 300 DPI ou superior.

Documentos digitalizados a 150 DPI ou menos devem ser novamente digitalizados com resolução superior antes do OCR. Executar o OCR em scans de baixa resolução produz resultados fracos independentemente da qualidade do motor.

Qualidade da fonte e da impressão

  • Texto impresso (saída de impressora laser, livros tipografados): 98–99% de precisão com originais limpos
  • Caligrafia de boa qualidade com caracteres claros: 85–95%
  • Texto ténue ou desbotado: 80–95% dependendo do contraste
  • Papel de cópia em carbono: 60–85%
  • Jornal antigo / máquina de escrever: 90–95% com scans limpos
  • Caligrafia cursiva: 40–70% — o OCR por rede neural tem dificuldade com cursiva

Orientação da página

Páginas muito inclinadas ou rodadas prejudicam a precisão. A maioria dos motores OCR, incluindo o Tesseract, deteta e corrige automaticamente rotações ligeiras (até ~10 graus). Páginas com rotação acentuada devem ser corrigidas manualmente primeiro utilizando Rodar PDF.

Idioma

O Tesseract suporta mais de 100 idiomas. A ferramenta OCR do LuraPDF deteta automaticamente o inglês. Para scripts não latinos ou documentos noutros idiomas, a seleção do idioma melhora substancialmente a precisão.

Como Fazer OCR de um PDF com o LuraPDF

  1. Abra a ferramenta OCR: Navegue para LuraPDF OCR PDF
  2. Carregue o PDF digitalizado: Arraste e largue o seu ficheiro
  3. Selecione o idioma (se não for inglês): Escolha o idioma principal do documento
  4. Clique em "Run OCR": O processamento ocorre página a página no seu browser. O tempo varia com o comprimento do documento — um scan de 20 páginas demora normalmente 30–90 segundos num computador moderno.
  5. Transfira o PDF pesquisável: O resultado é um PDF com as imagens do scan original mais uma camada de texto incorporada

Testar o Resultado

Após o OCR, verifique a precisão:

  • Selecione texto na página — o texto deve ser selecionável exatamente sobre os caracteres impressos
  • Pesquise (Ctrl+F / Cmd+F) uma palavra comum — deve ser encontrada
  • Copie um parágrafo e cole num editor de texto — o resultado deve ser legível

Se a precisão for fraca, verifique primeiro a qualidade do scan de entrada antes de experimentar outras ferramentas.

Quando Executar o OCR Antes de Outras Operações

O OCR desbloqueia operações adicionais do LuraPDF que não funcionam em PDFs compostos apenas por imagens:

  • Comprimir PDF após OCR: Depois de extraído o texto, as regiões de imagem podem por vezes ser comprimidas de forma mais agressiva
  • PDF para Word após OCR: Converter um PDF com OCR para Word fornece texto editável; converter um scan bruto gera um ficheiro Word com imagens incorporadas
  • Redigir PDF após OCR: A redação baseada em texto funciona corretamente em documentos com OCR aplicado
  • Pesquisar e extrair: Localize e copie informação específica sem necessidade de reescrever

Privacidade: O OCR Corre no Seu Browser

O Tesseract.js executa todo o processo OCR localmente através de WebAssembly. Os seus documentos digitalizados — que frequentemente contêm registos médicos, extratos financeiros, documentos legais ou informação pessoal identificável — nunca saem do seu dispositivo. Nenhum servidor remoto processa o seu ficheiro.

Esta é uma vantagem significativa face aos serviços OCR na nuvem, que necessariamente recebem uma cópia de tudo o que processa.

Limitações do OCR Baseado em Browser

Tempo de processamento

O Tesseract.js é mais lento do que o Tesseract nativo para desktop ou as APIs OCR na nuvem. Conte com aproximadamente 3–8 segundos por página consoante o seu hardware. Um documento de 50 páginas pode demorar vários minutos.

Tabelas

O Tesseract reconhece o conteúdo de tabelas, mas não reconstrói a estrutura de tabela na camada de texto do PDF — o texto ficará em ordem de leitura, mas a estrutura das células não será preservada. Para extração estruturada de tabelas, converta o PDF com OCR para Word e reformate a tabela manualmente.

Notação matemática

Equações em estilo LaTeX e símbolos matemáticos têm menor precisão. Os modelos do Tesseract estão otimizados para texto em linguagem natural.

Caligrafia

Como referido, a precisão com caligrafia cursiva é limitada. A caligrafia em letra de imprensa tem melhor desempenho. Para documentos manuscritos críticos, verifique cada página manualmente.

Perguntas Frequentes

O texto reconhecido pelo OCR não se alinha com os caracteres — é um erro? Isto pode acontecer com scans muito inclinados. As posições do texto são calculadas a partir das posições dos caracteres detetados, mas se a geometria da página não for padrão, o alinhamento pode desviar-se. Tente rodar o PDF para corrigir a inclinação antes de executar o OCR.

Posso aplicar OCR apenas a páginas específicas? O LuraPDF processa todas as páginas. Se apenas precisar de OCR em páginas específicas, extraia primeiro essas páginas usando Extrair Páginas de PDF, execute o OCR e, opcionalmente, junte os resultados.

O OCR altera o aspeto visual do meu documento digitalizado? Não. As imagens do scan original são preservadas na íntegra. É apenas adicionada uma camada de texto invisível.

Posso executar OCR num PDF que já tem algumas páginas de texto e outras digitalizadas? Sim — o Tesseract processa as páginas baseadas em imagem e adiciona uma camada de texto. As páginas que já possuem uma camada de texto não são afetadas.

O meu documento está em árabe / chinês / japonês — o OCR vai funcionar? Sim, mas selecione o idioma correto na ferramenta antes de executar. A precisão do Tesseract para idiomas CJK e da direita para a esquerda é boa, mas varia mais com a qualidade do scan do que os documentos em script latino.

O OCR transforma arquivos fechados de documentos digitalizados em informação acessível, pesquisável e processável. Um armário cheio de contratos digitalizados torna-se uma base de dados pesquisável. Uma pilha de registos médicos torna-se um documento pelo qual se pode realmente navegar. O processo demora segundos a minutos e corre inteiramente no seu dispositivo.

Sobre o autor

LuraPDF Team
LuraPDF Team

Equipa Editorial e Técnica · 4 de maio de 2026 · 7 min de leitura

A equipa LuraPDF é composta por especialistas em processamento de documentos, engenheiros de software e redatores técnicos, dedicados a tornar a edição de PDF gratuita, privada e acessível.