Imagem para texto (OCR)
Extraia o texto de fotos, capturas de tela e digitalizações no navegador e depois edite, copie ou salve como arquivo .txt. Nada é enviado.
Como usar
Escolha uma ou mais imagens, arraste-as para a ferramenta ou cole uma captura de tela com Ctrl+V. A ferramenta lê as imagens uma após a outra e coloca todo o texto em uma única caixa, onde você pode corrigi-lo antes de copiar ou baixar como arquivo .txt. Com várias imagens, cada uma começa com uma linha que mostra o nome do arquivo, para você saber de onde veio cada parte.
Escolha o idioma do texto antes de adicionar as imagens. Se você mudar o idioma depois, ou mudar a ordem de leitura, as imagens são lidas de novo. O idioma importa porque indica ao mecanismo quais letras e acentos esperar: um texto em português lido como inglês pode perder acentos como ç e ã. A ordem de leitura importa para o layout: “Linha por linha” mantém inteira cada linha de uma tabela ou de um cupom fiscal, enquanto “Colunas e blocos” lê uma página com colunas uma coluna de cada vez.
O mecanismo de reconhecimento é o Tesseract, o mecanismo de OCR de código aberto, executado no seu navegador como WebAssembly. Suas imagens não são enviadas ao nTools nem a nenhum outro serviço. Na primeira vez, o navegador baixa o mecanismo (cerca de 1,5 MB) e os dados do idioma escolhido (de 0,7 a 3 MB); depois disso, eles normalmente vêm do cache do navegador.
O mecanismo foi treinado com texto impresso. Texto escrito à mão não é suportado, e fotos desfocadas, texto inclinado, letras muito pequenas, fontes decorativas e texto claro sobre um fundo carregado produzem erros. Imagens pequenas, como a maioria das capturas de tela, são ampliadas automaticamente antes da leitura, o que ajuda com textos pequenos de interface. A confiança mostrada é a estimativa do próprio mecanismo, calculada como média sobre o texto encontrado: um sinal de alerta útil, não uma garantia, então confira nomes, números e valores com a imagem.
Os arquivos TIFF são lidos página por página, incluindo digitalizações de várias páginas e arquivos com compressão ZIP, LZW, JPEG ou de fax. As fotos JPEG e HEIC são colocadas na posição correta com base nas informações de orientação, mas um texto que esteja de lado ou de cabeça para baixo na própria imagem não é girado. Cada imagem pode ter até 30 MB, 40 megapixels e 12.000 pixels por lado, e até 20 arquivos podem ser lidos de uma vez (um TIFF de várias páginas conta como um).
Exemplo
Captura de tela de uma mensagem de erro (PNG)A mensagem como texto, que você pode colar em uma busca ou em um chamado de suporte.Foto de uma carta impressa, tirada de frente (JPEG)O texto da carta, pronto para corrigir e salvar como arquivo .txt.TIFF de várias páginas vindo de um scannerO texto de todas as páginas, cada uma começando com o nome do arquivo e o número da página.Foto de um cupom fiscal, lida linha por linhaCada item ao lado do preço, na mesma linha. Confira os valores: um 5 pode ser lido como S, ou uma vírgula como ponto.
Perguntas frequentes
Minhas imagens são enviadas?
Não. O texto é reconhecido no seu navegador, e as imagens e o texto ficam no seu dispositivo. O navegador baixa do nTools só o que precisa para lê-las: o mecanismo de reconhecimento, os dados do idioma e, para arquivos TIFF ou HEIC, um decodificador. Nenhuma imagem ou texto é enviado com essas solicitações.
A ferramenta lê texto escrito à mão?
Não. O mecanismo foi treinado com texto impresso, então texto escrito à mão dá resultados ruins, a menos que seja muito regular, próximo da letra de forma maiúscula.
Por que parte do texto está errada ou faltando?
As causas mais comuns são uma foto desfocada ou inclinada, letras pequenas ou apagadas, um fundo carregado ou a escolha do idioma errado. Tire a foto de frente e com boa luz, ou recorte a imagem deixando só o texto, e tente de novo. Para tabelas e cupons fiscais, use a ordem de leitura “Linha por linha”.
Posso extrair texto de um PDF?
Não aqui: esta ferramenta lê imagens. Se o PDF foi digitalizado, converta as páginas em imagens PNG com 144 DPI com a ferramenta “PDF para imagens” e leia essas imagens. Se você consegue selecionar o texto no PDF, ele já é texto, então copiá-lo é mais preciso do que usar OCR.
A ferramenta mantém a formatação?
Não. O resultado é texto simples com quebras de linha, sem fontes, negrito, colunas ou tabelas. É isso que um arquivo .txt guarda.