Текст с картинки (OCR)

Превращает картинки с текстом в текст, который можно править и искать.

Перетащите изображения сюда, нажмите для выбора или вставьте скриншотJPG, PNG, WebP, HEIC, BMP · несколько файлов · ничего не загружается
Разметка

Только печатный текст. Важнее всего выбор языка; при первом запуске скачиваются движок (около 4 МБ) и одна языковая модель.

Что делает этот инструмент

Перетащите фотографию документа, скриншот, отсканированную страницу или снимок вывески — и текст с них вернётся под изображением настоящим, выделяемым текстом. Доступно двенадцать языков: русский, английский, упрощённый и традиционный китайский, японский, корейский, испанский, французский, немецкий, португальский, итальянский и вьетнамский, — а для азиатских языков галочка добавляет к ним английский, поэтому китайский договор с латинскими именами и числами читается как единый документ. Можно перетащить сразу много изображений: каждое распознаётся по очереди с полосой прогресса, а поле результата доступно для правки, чтобы поправить отдельный символ перед копированием.

Распознаёт Tesseract — открытый OCR-движок, выросший в HP и Google, — скомпилированный в WebAssembly и работающий в фоновом потоке вашего браузера. Перед распознаванием каждое изображение автоматически готовится: переводится в оттенки серого, увеличивается, если оно мелкое (больше всего от этого выигрывают скриншоты с телефона и сканы низкого разрешения), и получает белый фон, если был прозрачный. Движок и языковая модель для выбранного языка скачиваются один раз — около 4 МБ плюс 1–3 МБ на язык — и кешируются; само изображение никогда не покидает устройство, а это важно для удостоверений, договоров и медицинских бумаг.

Как пользоваться

Сначала выберите язык текста — это важнейший фактор точности — и оставьте галочку «Плюс английский» для китайских, японских и корейских документов с латинскими словами. Перетащите, вставьте или выберите изображения. Дождитесь полосы прогресса; при первом запуске заодно загружается движок. Прочитайте результат в поле: показатель уверенности рядом — это собственная оценка движка, и всё, что ниже примерно 80 %, стоит просмотреть глазами. При необходимости поправьте прямо на месте, затем скопируйте текст или скачайте его файлом .txt; «Скопировать всё» и «Скачать всё» работают с целой пачкой (несколько файлов приходят ZIP-архивом).

Разметка: «Авто» определяет колонки и блоки и подходит для отсканированных страниц и фотографий; «Один блок» считает изображение одной колонкой текста и устойчивее на скриншотах переписки, кода и простых списков. Если документ пришёл в PDF, сначала прогоните его через PDF в изображения и отправьте страницы сюда одним нажатием. Кривые снимки читаются лучше после поворота и обрезки.

Частые сложности

OCR читает печатный текст; рукописный, декоративные шрифты и надписи на пёстром фоне выходят мусором, и никакой браузерный инструмент этого не изменит. Точность зависит прежде всего от снимка: заполните кадр страницей, держите её ровно и плоско, снимайте при хорошем равномерном свете, избегайте теней и бликов и не уменьшайте изображение перед перетаскиванием — 12-мегапиксельная фотография листа A4 идеальна, миниатюра в 600 пикселей безнадёжна. Вторая частая причина бессмыслицы — неверный язык: японская страница, прочитанная как китайская, или французская как английская, даёт правдоподобный на вид мусор.

Таблицы выходят строками текста без сетки; колонки двухколоночной вёрстки в режиме «Один блок» могут перемешаться — для них берите «Авто». Числа с малым количеством слов вокруг (счета, показания счётчиков) читаются хорошо, но их всегда стоит проверить: шестёрка и восьмёрка похожи и для машины. При первом использовании на устройстве скачиваются движок и одна языковая модель, поэтому один раз нужна сеть; дальше инструмент работает офлайн. Очень большие пачки на телефоне идут медленно — несколько секунд на страницу это нормально.

Как текст распознаётся

Нынешний движок Tesseract — это нейросеть LSTM, которая читает строку пикселей как последовательность и выдаёт символы; для каждого языка она обучена отдельно на миллионах строк печатного текста. Сначала страница анализируется по разметке — где блоки, строки и слова, — затем каждая строка приводится к фиксированной высоте и подаётся в сеть. Здесь используются модели набора tessdata_best, квантованные до 8-битных целых: та же точность, что у моделей полной точности, при доле размера — именно это делает практичным самостоятельное размещение всех двенадцати языков.

Всё работает в WebAssembly с ускорением SIMD, когда браузер его поддерживает (а его поддерживают все современные), внутри фонового потока, чтобы страница оставалась отзывчивой. Подготовка идёт на канве самой страницы: перевод в оттенки серого убирает цветовой шум, а увеличение мелких изображений примерно до 2000 пикселей по длинной стороне приводит буквы к тому размеру, на котором сеть обучалась. Никакие пиксели никуда не отправляются; после кеширования движка и модели страница работает офлайн.

Когда это нужно

Скопировать абзац со скриншота, который вам прислали. Превратить сфотографированную доску, слайд или страницу книги в заметки. Достать текст из отсканированного письма или старого PDF, состоящего из одних картинок. Вытащить адрес, номер заказа или серийный номер со снимка. Оцифровать чеки и счета для бухгалтерии. Прочитать меню, вывеску или этикетку на чужом письме, чтобы вставить текст в переводчик.

Цепочка на этом сайте такая: при необходимости повернуть и обрезать снимок, распознать текст здесь, а для PDF сначала пройти через PDF в изображения. Документ, собранный из фотографий, можно затем сложить через изображения в PDF, когда текст уже проверен.

Частые вопросы

Загружаются ли мои изображения на сервер?

Нет. Распознавание идёт в браузере на Tesseract, скомпилированном в WebAssembly. Изображение не покидает устройство. Движок и языковая модель скачиваются один раз и кешируются; после этого инструмент работает офлайн.

Какие языки поддерживаются?

Русский, английский, упрощённый и традиционный китайский, японский, корейский, испанский, французский, немецкий, португальский, итальянский и вьетнамский. Азиатские языки можно сочетать с английским за один проход.

Читает ли он рукописный текст?

Нет — только печатный. Рукописный текст, декоративные шрифты и надписи поверх пёстрого фона надёжно не читает ни этот инструмент, ни любой другой браузерный OCR.

Как повысить точность?

Выберите правильный язык, снимайте резко, при ровном свете, без перекоса и в полном разрешении, и обрежьте кадр по тексту. Мелкие и размытые изображения увеличиваются автоматически, но резкости им это не добавит.

Можно ли распознать PDF?

Переведите его страницы инструментом «PDF в изображения» и отправьте их сюда: каждая страница станет отдельным блоком текста, доступным для правки.