Imagem para texto (OCR)

Transforme fotos de texto em texto que você pode editar e pesquisar.

Arraste imagens aqui, clique para escolher ou cole um printJPG, PNG, WebP, HEIC, BMP · vários arquivos · nada é enviado
Layout

Só texto impresso. A escolha do idioma é o que mais importa; a primeira execução baixa o motor (cerca de 4 MB) e um modelo de idioma.

O que esta ferramenta de OCR faz

Arraste a foto de um documento, um print de tela, uma página digitalizada ou a foto de uma placa, e o texto que está nela volta como texto de verdade, selecionável, logo abaixo da imagem. Há doze idiomas disponíveis — inglês, chinês simplificado e tradicional, japonês, coreano, espanhol, francês, alemão, português, russo, italiano e vietnamita — e, para os idiomas asiáticos, uma caixa de seleção adiciona o inglês ao mesmo tempo, de modo que um contrato em chinês com nomes e números em inglês é lido como um único documento. Você pode arrastar várias imagens de uma vez; cada uma é reconhecida em sequência com uma barra de progresso, e a caixa de resultado é editável para você corrigir algum caractere trocado antes de copiar.

O reconhecimento usa o Tesseract, o motor de OCR de código aberto desenvolvido na HP e no Google, compilado para WebAssembly e rodando em uma thread de worker do seu navegador. Antes do reconhecimento, cada imagem é limpa automaticamente: convertida para tons de cinza, ampliada se for pequena (prints de celular e scans de baixa resolução são os que mais ganham com isso) e recebe um fundo branco se era transparente. O motor e o modelo do idioma que você escolher são baixados uma única vez — cerca de 4 MB mais 1–3 MB por idioma — e depois ficam em cache; a imagem em si nunca sai do seu dispositivo, o que faz diferença para documentos de identidade, contratos e papéis médicos.

Como usar

Escolha primeiro o idioma do texto — é o fator que mais pesa na precisão — e deixe Também inglês marcado para documentos em chinês, japonês ou coreano que contenham palavras em alfabeto latino. Arraste, cole ou selecione as imagens. Aguarde a barra de progresso; na primeira execução o motor também é carregado. Leia o resultado na caixa: o número de confiança ao lado é a estimativa do próprio motor, e qualquer valor abaixo de uns 80 % merece uma conferida. Edite direto na caixa se precisar e depois use Copiar para copiar o texto ou Baixar para salvá-lo como arquivo .txt; Copiar tudo e Baixar tudo cuidam de um lote inteiro (vários arquivos vêm em um ZIP).

Layout: Automático detecta colunas e blocos e serve para páginas digitalizadas e fotos; Bloco único trata a imagem como uma única coluna de texto e é mais estável para prints de conversas, código e listas simples. Se o documento chegou como PDF, passe antes pelo PDF para imagem e envie as páginas para cá com um clique. Fotos tortas são lidas melhor depois de Girar imagem e Cortar imagem.

Erros comuns

OCR lê texto impresso; letra à mão, fontes decorativas e texto sobre fundos cheios de detalhes saem embaralhados, e nenhuma ferramenta de navegador muda isso. A precisão depende principalmente da foto: preencha o enquadramento com a página, mantenha-a plana e reta, use luz boa e uniforme, evite sombras e reflexos e não reduza a imagem antes de arrastá-la — uma foto de 12 megapixels de uma página A4 é ideal, uma miniatura de 600 pixels não tem salvação. Escolher o idioma errado é a outra grande causa de resultado sem sentido: uma página em japonês lida como chinês, ou uma em francês lida como inglês, produz um texto que parece plausível mas é lixo.

Tabelas saem como linhas de texto sem a grade; as colunas de um layout de duas colunas podem se misturar no modo Bloco único — use Automático nesses casos. Números com poucas palavras em volta (faturas, leituras de medidor) são lidos bem, mas sempre valem uma conferida, porque um 6 e um 8 se parecem também para a máquina. O primeiro uso em um dispositivo baixa o motor e um modelo de idioma, então precisa de conexão uma vez; depois disso a ferramenta funciona offline. Lotes muito grandes no celular podem ser lentos — alguns segundos por página é normal.

Contexto: como o texto é reconhecido

O motor atual do Tesseract é uma rede neural LSTM que lê uma linha de pixels como uma sequência e emite caracteres, treinada separadamente para cada idioma com milhões de linhas de texto impresso. A página é primeiro analisada quanto ao layout — onde estão os blocos de texto, as linhas e as palavras — e depois cada linha é normalizada para uma altura fixa e enviada à rede. Os modelos usados aqui são o conjunto tessdata_best quantizado para inteiros de 8 bits: a mesma precisão dos modelos de precisão completa com uma fração do tamanho, e é isso que torna viável hospedar os doze idiomas por conta própria.

Tudo roda em WebAssembly com aceleração SIMD quando o navegador oferece suporte (todos os navegadores atuais oferecem), dentro de um worker para que a página continue respondendo. O pré-processamento é feito em um canvas na própria página: a conversão para tons de cinza remove o ruído de cor, e ampliar imagens pequenas até cerca de 2000 pixels no lado maior traz as letras para a faixa de tamanho com que a rede foi treinada. Nenhum pixel é enviado a lugar nenhum; a página funciona offline depois que o motor e o modelo estão em cache.

Quando você precisa de imagem para texto

Copiar um parágrafo de um print que alguém mandou para você. Transformar a foto de um quadro branco, de um slide ou da página de um livro em anotações. Tirar o texto de uma carta digitalizada ou de um PDF antigo que só tem imagens. Extrair um endereço, um número de pedido ou um número de série de uma foto. Digitalizar recibos e notas fiscais para a contabilidade. Ler um cardápio, uma placa ou um rótulo em outro alfabeto para colar em um tradutor.

Neste site a sequência é: girar e cortar a foto se for preciso, reconhecer o texto aqui e, no caso de PDFs, passar antes pelo PDF para imagem. Um documento montado a partir de fotos pode ser reunido com o imagem para PDF depois que o texto tiver sido conferido.

Perguntas frequentes

Minhas imagens são enviadas para algum lugar?

Não. O reconhecimento roda no seu navegador com o Tesseract compilado para WebAssembly. A imagem nunca sai do seu dispositivo. O motor e o modelo de idioma são baixados uma vez e ficam em cache; depois disso a ferramenta funciona offline.

Quais idiomas são suportados?

Inglês, chinês simplificado, chinês tradicional, japonês, coreano, espanhol, francês, alemão, português, russo, italiano e vietnamita. Os idiomas asiáticos podem ser combinados com inglês em uma única passagem.

Ele lê letra à mão?

Não — só texto impresso. Letra à mão, fontes decorativas e texto sobre fundos cheios de detalhes não são lidos com confiabilidade por este nem por nenhum OCR de navegador.

Como consigo mais precisão?

Escolha o idioma certo, use uma foto nítida, reta, com luz uniforme e na resolução original, e corte para deixar só o texto. Imagens pequenas ou borradas são ampliadas automaticamente, mas não dá para deixá-las nítidas.

Posso fazer OCR de um PDF?

Converta as páginas com a ferramenta PDF para imagem e envie-as para cá; cada página vira um bloco de texto editável.