Imagen a texto (OCR)

Convierte imágenes con texto en texto que puedes editar y buscar.

Arrastra imágenes aquí, haz clic para elegir o pega una capturaJPG, PNG, WebP, HEIC, BMP · varios archivos · nada se sube
Diseño

Solo texto impreso. El idioma es lo que más importa; la primera vez se descargan el motor (unos 4 MB) y un modelo de idioma.

Qué hace esta herramienta de OCR

Arrastra la foto de un documento, una captura de pantalla, una página escaneada o la imagen de un letrero, y el texto que contiene aparece como texto real y seleccionable debajo de la imagen. Hay doce idiomas disponibles —inglés, chino simplificado y tradicional, japonés, coreano, español, francés, alemán, portugués, ruso, italiano y vietnamita— y, para los idiomas asiáticos, una casilla añade el inglés al mismo tiempo, de modo que un contrato en chino con nombres y cifras en inglés se lee como un solo documento. Puedes arrastrar muchas imágenes a la vez; cada una se reconoce por turno con una barra de progreso, y el cuadro de resultado es editable para que corrijas algún carácter suelto antes de copiar.

El reconocimiento usa Tesseract, el motor de OCR de código abierto desarrollado en HP y Google, compilado a WebAssembly y ejecutado en un hilo de trabajo (worker) de tu navegador. Antes del reconocimiento, cada imagen se limpia automáticamente: se convierte a escala de grises, se amplía si es pequeña (las capturas de teléfono y los escaneos de baja resolución son los que más ganan) y se le pone un fondo blanco si era transparente. El motor y el modelo del idioma que elijas se descargan una sola vez —unos 4 MB más 1–3 MB por idioma— y luego quedan en caché; la imagen en sí nunca sale de tu dispositivo, algo que importa con documentos de identidad, contratos y papeles médicos.

Cómo se usa

Elige primero el idioma del texto —es el factor que más influye en la precisión— y deja marcada la opción También inglés para documentos en chino, japonés o coreano que contengan palabras en alfabeto latino. Arrastra, pega o selecciona las imágenes. Espera a que avance la barra de progreso; la primera vez también se carga el motor. Revisa el resultado en el cuadro: la cifra de confianza que aparece al lado es la estimación del propio motor, y cualquier valor por debajo de un 80 % merece una revisión. Edita el texto ahí mismo si hace falta y luego cópialo o descárgalo como archivo .txt; Copiar todo y Descargar todo procesan un lote completo (varios archivos se entregan como ZIP).

Diseño: Automático detecta columnas y bloques y va bien para páginas escaneadas y fotos; Bloque único trata la imagen como una sola columna de texto y es más estable para capturas de chats, código y listas sencillas. Si el documento te llegó como PDF, pásalo primero por PDF a imagen y envía las páginas aquí con un clic. Las fotos torcidas se leen mejor después de Girar imagen y Recortar imagen.

Errores comunes

El OCR lee texto impreso; la escritura a mano, las fuentes decorativas y el texto sobre fondos cargados salen ilegibles, y ninguna herramienta de navegador cambia eso. La precisión depende sobre todo de la foto: llena el encuadre con la página, mantenla plana y derecha, usa luz uniforme, evita sombras y reflejos, y no reduzcas la imagen antes de arrastrarla: una foto de 12 megapíxeles de una hoja A4 es ideal, una miniatura de 600 píxeles no tiene remedio. Elegir mal el idioma es la otra gran causa de resultados sin sentido: una página en japonés leída como chino, o una en francés leída como inglés, produce basura de aspecto creíble.

Las tablas salen como líneas de texto sin la cuadrícula; en el modo Bloque único, las columnas de un diseño a dos columnas pueden mezclarse: usa Automático en esos casos. Los números con pocas palabras alrededor (facturas, lecturas de medidores) se leen bien, pero siempre conviene verificarlos, porque un 6 y un 8 también se parecen para una máquina. El primer uso en un dispositivo descarga el motor y un modelo de idioma, así que necesita conexión a internet una vez; después, la herramienta funciona sin conexión. Los lotes muy grandes en un teléfono pueden ser lentos: unos segundos por página es normal.

Contexto: cómo se reconoce el texto

El motor actual de Tesseract es una red neuronal LSTM que lee una línea de píxeles como una secuencia y emite caracteres, entrenada por separado para cada idioma con millones de líneas de texto impreso. Primero se analiza el diseño de la página —dónde están los bloques de texto, las líneas y las palabras— y luego cada línea se normaliza a una altura fija y se pasa a la red. Los modelos que se usan aquí son el conjunto tessdata_best cuantizado a enteros de 8 bits: la misma precisión que los modelos de precisión completa con una fracción del tamaño, que es lo que hace viable alojar los doce idiomas.

Todo se ejecuta en WebAssembly con aceleración SIMD cuando el navegador lo admite (todos los navegadores actuales lo hacen), dentro de un worker para que la página siga respondiendo. El preprocesamiento se hace en un canvas de la página: la conversión a escala de grises elimina el ruido de color, y ampliar las imágenes pequeñas hasta unos 2000 píxeles en el lado largo lleva las letras al rango de tamaño con el que se entrenó la red. No se envía ningún píxel a ninguna parte; la página funciona sin conexión una vez que el motor y el modelo están en caché.

Cuándo necesitas pasar una imagen a texto

Copiar un párrafo de una captura que te enviaron. Convertir en notas una pizarra, una diapositiva o una página de libro fotografiada. Sacar el texto de una carta escaneada o de un PDF antiguo que solo contiene imágenes. Extraer una dirección, un número de pedido o un número de serie de una foto. Digitalizar recibos y facturas para la contabilidad. Leer un menú, un letrero o una etiqueta en otro alfabeto para pegarlo en un traductor.

En este sitio la cadena es: girar y recortar la foto si hace falta, reconocer el texto aquí y, para los PDF, pasar primero por PDF a imagen. Un documento formado por fotos puede armarse con imagen a PDF una vez revisado el texto.

Preguntas frecuentes

¿Se suben mis imágenes?

No. El reconocimiento se ejecuta en tu navegador con Tesseract compilado a WebAssembly. La imagen nunca sale de tu dispositivo. El motor y el modelo de idioma se descargan una vez y quedan en caché; después, la herramienta funciona sin conexión.

¿Qué idiomas admite?

Inglés, chino simplificado, chino tradicional, japonés, coreano, español, francés, alemán, portugués, ruso, italiano y vietnamita. Los idiomas asiáticos se pueden combinar con inglés en una sola pasada.

¿Puede leer escritura a mano?

No, solo texto impreso. Ni esta ni ninguna otra herramienta de OCR en el navegador lee con fiabilidad la escritura a mano, las fuentes decorativas o el texto sobre fondos cargados.

¿Cómo consigo mejor precisión?

Elige el idioma correcto, usa una foto nítida, derecha y con luz uniforme a resolución completa, y recorta al texto. Las imágenes pequeñas o borrosas se amplían automáticamente, pero no se pueden enfocar.

¿Puedo hacer OCR de un PDF?

Convierte sus páginas con la herramienta PDF a imagen y envíalas aquí; cada página se convierte en un bloque de texto editable.