OCR de PDF online: leia texto de PDF digital (embutido) ou escaneado (OCR com Tesseract). Modo automático tenta texto nativo e só usa OCR nas páginas “imagem”. Tudo no navegador.

O PDF não sobe para o Dica. Extração e OCR são locais. Na primeira OCR o idioma é baixado da CDN do Tesseract (~10–20 MB) e fica em cache. 100% local no navegador

No celular: prefira PDFs com poucas páginas. OCR de várias páginas escaneadas pode demorar e usar muita memória.

PDF → Texto (OCR)

Arraste um PDF ou clique para escolher
Digital ou escaneado · máx. ~40 MB · até 15 páginas em OCR
PDF só com texto? O modo automático é quase instantâneo. Scan/foto? Use OCR — mais lento, mas lê a imagem da página. Foto solta (não PDF): OCR imagem.
Texto extraído

PDF digital vs escaneado

  • Digital — o texto já está no arquivo; extração é rápida e fiel
  • Escaneado — cada página é uma imagem; o OCR “lê” os pixels (pode errar em rascunhos ou fotos tortas)
O PDF sobe para o servidor?

Não. pdf.js e Tesseract rodam no navegador. Só a biblioteca de idioma do OCR vem da CDN na primeira vez.

Por que limitar páginas no OCR?

Renderizar + OCR é pesado na CPU e na memória. Para livros longos, processe em partes ou use o modo “só texto embutido” se o PDF for digital.

Qual a diferença para “PDF para texto”?

PDF para texto só lê texto embutido. Esta página adiciona OCR para scans.

Funciona no celular?

Sim, com PDFs curtos. Em aparelhos antigos, prefira poucas páginas e boa iluminação no scan original.