Você sabia?
Como funciona
#A regra por trás do resultado, explicada para quem quer entender a conta, conferir antes de usar ou aplicar no próprio trabalho.
Nem todo PDF tem texto
Esta é a coisa mais importante da página, e a que explica quase toda frustração com extração.
Existem dois tipos de PDF com aparência idêntica na tela:
PDF de texto. Foi gerado a partir de um documento digitado. As letras estão lá como letras, e dá para selecionar, copiar e buscar.
PDF digitalizado. É uma fotografia da página. O que parece letra é um desenho de letra. Não há uma única palavra no arquivo.
O teste leva um segundo: abra no leitor e tente selecionar uma palavra. Se o cursor não seleciona nada, é imagem.
Nesta ferramenta, um arquivo assim devolve o aviso de que não há texto, em vez de uma caixa vazia sem explicação.
Por que não fazemos OCR
O reconhecimento óptico de caracteres resolveria o caso do digitalizado, e a decisão de não ter foi deliberada.
Um modelo de OCR ocupa vários megabytes, que precisariam ser baixados para o navegador antes de qualquer resultado. E a saída erra: confunde caracteres parecidos, perde acentos, embaralha colunas. Um texto assim precisa de revisão linha a linha, e entregá-lo sem dizer isso criaria um problema pior do que o que resolve.
Dizer que não fazemos é mais honesto do que entregar um resultado que ninguém conferiu.
A formatação não vem junto
O que sai é texto puro. As quebras de linha são reconstruídas a partir da posição vertical de cada pedaço na página, que é a informação que o PDF guarda.
Isso funciona bem em texto corrido. Em tabelas, colunas e caixas flutuantes o resultado sai fora de ordem, porque num PDF esses elementos não são estrutura, são apenas coisas desenhadas em certas coordenadas.
Se o seu objetivo é preservar a diagramação, extrair texto não é o caminho.
Documento misto
É comum um contrato digitado ter um anexo escaneado no meio. Nesse caso a ferramenta extrai o que existe, lista quais páginas vieram vazias e segue.
Exemplos
#Documento com texto selecionável
Se você consegue selecionar o texto no leitor de PDF, a extração funciona.
Contrato para citar num e-mail
Extraia, copie o trecho e cole onde precisar, sem digitar de novo.
PDF digitalizado
Se o arquivo é foto de uma página, não há texto para extrair, e a ferramenta diz isso em vez de devolver uma caixa vazia.