Como Fazer OCR a um PDF Digitalizado e Torná-lo Pesquisável
Saiba como funciona o OCR, o que afeta a sua precisão e como tornar um PDF digitalizado pesquisável e com texto copiável, diretamente no navegador.

Equipa Editorial e Técnica · 4 de maio de 2026 · 7 min de leitura
Um PDF digitalizado é uma fotografia digital de um documento. As páginas são imagens. Não é possível selecionar texto, pesquisar uma palavra, copiar uma frase ou utilizar o conteúdo em qualquer ferramenta de processamento de texto. Para efeitos de recuperação de informação, um PDF digitalizado é essencialmente opaco.
O OCR (Reconhecimento Ótico de Caracteres) resolve este problema ao analisar essas imagens e construir uma camada de texto que se sobrepõe ao conteúdo visual. O resultado: um PDF visualmente idêntico ao scan original, mas que contém uma camada de texto invisível que torna tudo selecionável, pesquisável e copiável.
Como Funciona o OCR
O LuraPDF utiliza o Tesseract.js, a versão compilada para browser do Tesseract — um dos motores OCR de código aberto mais precisos, mantido pelo Google e originalmente desenvolvido pelos HP Labs. O Tesseract usa um modelo de rede neural (baseado em LSTM) treinado em milhões de páginas de documentos em dezenas de idiomas.
O processo OCR:
- Renderização da página: Cada página do PDF é renderizada numa imagem de tela com alta resolução (300+ DPI para melhor precisão)
- Pré-processamento: Melhoria da imagem — binarização, redução de ruído, correção de inclinação (endireitamento de scans rodados)
- Análise de layout: Deteção de regiões de texto, colunas, tabelas e elementos não textuais
- Reconhecimento de caracteres: A rede neural classifica cada caractere a partir de regiões de texto segmentadas
- Pós-processamento: Pontuação pelo modelo de linguagem para desambiguar caracteres semelhantes (por exemplo, "l" vs "1", "O" vs "0")
- Escrita do PDF: O texto reconhecido é incorporado como camada de texto invisível, posicionada com precisão sobre os caracteres visuais correspondentes
A camada de texto invisível é o que torna o resultado pesquisável. O aspeto visual da página mantém a imagem do scan original — vê exatamente o que digitalizou, mas o texto subjacente é agora legível por máquina.
O Que Afeta a Precisão do OCR
A precisão varia significativamente com a qualidade da entrada:
Resolução do scan
300 DPI é o mínimo para uma precisão fiável. Abaixo de 200 DPI, o reconhecimento de caracteres degrada-se substancialmente. Se estiver a digitalizar documentos para OCR, faça-o sempre a 300 DPI ou superior.
Documentos digitalizados a 150 DPI ou menos devem ser novamente digitalizados com resolução superior antes do OCR. Executar o OCR em scans de baixa resolução produz resultados fracos independentemente da qualidade do motor.
Qualidade da fonte e da impressão
- Texto impresso (saída de impressora laser, livros tipografados): 98–99% de precisão com originais limpos
- Caligrafia de boa qualidade com caracteres claros: 85–95%
- Texto ténue ou desbotado: 80–95% dependendo do contraste
- Papel de cópia em carbono: 60–85%
- Jornal antigo / máquina de escrever: 90–95% com scans limpos
- Caligrafia cursiva: 40–70% — o OCR por rede neural tem dificuldade com cursiva
Orientação da página
Páginas muito inclinadas ou rodadas prejudicam a precisão. A maioria dos motores OCR, incluindo o Tesseract, deteta e corrige automaticamente rotações ligeiras (até ~10 graus). Páginas com rotação acentuada devem ser corrigidas manualmente primeiro utilizando Rodar PDF.
Idioma
O Tesseract suporta mais de 100 idiomas. A ferramenta OCR do LuraPDF deteta automaticamente o inglês. Para scripts não latinos ou documentos noutros idiomas, a seleção do idioma melhora substancialmente a precisão.
Como Fazer OCR de um PDF com o LuraPDF
- Abra a ferramenta OCR: Navegue para LuraPDF OCR PDF
- Carregue o PDF digitalizado: Arraste e largue o seu ficheiro
- Selecione o idioma (se não for inglês): Escolha o idioma principal do documento
- Clique em "Run OCR": O processamento ocorre página a página no seu browser. O tempo varia com o comprimento do documento — um scan de 20 páginas demora normalmente 30–90 segundos num computador moderno.
- Transfira o PDF pesquisável: O resultado é um PDF com as imagens do scan original mais uma camada de texto incorporada
Testar o Resultado
Após o OCR, verifique a precisão:
- Selecione texto na página — o texto deve ser selecionável exatamente sobre os caracteres impressos
- Pesquise (Ctrl+F / Cmd+F) uma palavra comum — deve ser encontrada
- Copie um parágrafo e cole num editor de texto — o resultado deve ser legível
Se a precisão for fraca, verifique primeiro a qualidade do scan de entrada antes de experimentar outras ferramentas.
Quando Executar o OCR Antes de Outras Operações
O OCR desbloqueia operações adicionais do LuraPDF que não funcionam em PDFs compostos apenas por imagens:
- Comprimir PDF após OCR: Depois de extraído o texto, as regiões de imagem podem por vezes ser comprimidas de forma mais agressiva
- PDF para Word após OCR: Converter um PDF com OCR para Word fornece texto editável; converter um scan bruto gera um ficheiro Word com imagens incorporadas
- Redigir PDF após OCR: A redação baseada em texto funciona corretamente em documentos com OCR aplicado
- Pesquisar e extrair: Localize e copie informação específica sem necessidade de reescrever
Privacidade: O OCR Corre no Seu Browser
O Tesseract.js executa todo o processo OCR localmente através de WebAssembly. Os seus documentos digitalizados — que frequentemente contêm registos médicos, extratos financeiros, documentos legais ou informação pessoal identificável — nunca saem do seu dispositivo. Nenhum servidor remoto processa o seu ficheiro.
Esta é uma vantagem significativa face aos serviços OCR na nuvem, que necessariamente recebem uma cópia de tudo o que processa.
Limitações do OCR Baseado em Browser
Tempo de processamento
O Tesseract.js é mais lento do que o Tesseract nativo para desktop ou as APIs OCR na nuvem. Conte com aproximadamente 3–8 segundos por página consoante o seu hardware. Um documento de 50 páginas pode demorar vários minutos.
Tabelas
O Tesseract reconhece o conteúdo de tabelas, mas não reconstrói a estrutura de tabela na camada de texto do PDF — o texto ficará em ordem de leitura, mas a estrutura das células não será preservada. Para extração estruturada de tabelas, converta o PDF com OCR para Word e reformate a tabela manualmente.
Notação matemática
Equações em estilo LaTeX e símbolos matemáticos têm menor precisão. Os modelos do Tesseract estão otimizados para texto em linguagem natural.
Caligrafia
Como referido, a precisão com caligrafia cursiva é limitada. A caligrafia em letra de imprensa tem melhor desempenho. Para documentos manuscritos críticos, verifique cada página manualmente.
Perguntas Frequentes
O texto reconhecido pelo OCR não se alinha com os caracteres — é um erro? Isto pode acontecer com scans muito inclinados. As posições do texto são calculadas a partir das posições dos caracteres detetados, mas se a geometria da página não for padrão, o alinhamento pode desviar-se. Tente rodar o PDF para corrigir a inclinação antes de executar o OCR.
Posso aplicar OCR apenas a páginas específicas? O LuraPDF processa todas as páginas. Se apenas precisar de OCR em páginas específicas, extraia primeiro essas páginas usando Extrair Páginas de PDF, execute o OCR e, opcionalmente, junte os resultados.
O OCR altera o aspeto visual do meu documento digitalizado? Não. As imagens do scan original são preservadas na íntegra. É apenas adicionada uma camada de texto invisível.
Posso executar OCR num PDF que já tem algumas páginas de texto e outras digitalizadas? Sim — o Tesseract processa as páginas baseadas em imagem e adiciona uma camada de texto. As páginas que já possuem uma camada de texto não são afetadas.
O meu documento está em árabe / chinês / japonês — o OCR vai funcionar? Sim, mas selecione o idioma correto na ferramenta antes de executar. A precisão do Tesseract para idiomas CJK e da direita para a esquerda é boa, mas varia mais com a qualidade do scan do que os documentos em script latino.
O OCR transforma arquivos fechados de documentos digitalizados em informação acessível, pesquisável e processável. Um armário cheio de contratos digitalizados torna-se uma base de dados pesquisável. Uma pilha de registos médicos torna-se um documento pelo qual se pode realmente navegar. O processo demora segundos a minutos e corre inteiramente no seu dispositivo.