Скан договора, фотография с доски, PDF-книга без текстового слоя — во всех этих случаях вам нужен OCR (Optical Character Recognition, оптическое распознавание символов). Раньше для этого требовались тяжёлые программы. Сегодня можно распознать текст прямо в браузере, не отправляя документы на чужой сервер.
Когда OCR действительно нужен
- PDF — это скан, и текст в нём не выделяется
- Нужно найти определённые слова в отсканированном документе
- Из фотографии конспекта нужно получить текстовый файл
- Перевести книгу из PDF в формат для e-reader
- Автоматически извлечь данные из паспорта, свидетельства, квитанции
Если PDF создан из Word или Excel — OCR не нужен, текст там уже есть. Сначала попробуйте выделить слово в PDF: если выделяется — распознавать нечего.
Как работает OCR в браузере
В основе — библиотека Tesseract.js, порт классического OCR-движка Tesseract, скомпилированный в WebAssembly. Она загружается один раз (языковая модель 5–15 МБ) и работает полностью на вашем устройстве.
Первое распознавание может занять 20–60 секунд — скачивается модель языка. Последующие запуски проходят за секунды, потому что модель кэшируется в браузере.
Как распознать текст в list2doc.ru
- Откройте раздел «Распознавание текста»
- Загрузите одно или несколько изображений или PDF-файлов
- Выберите язык: русский, английский или оба
- Нажмите «Распознать» и подождите результат
- Отредактируйте текст при необходимости и скачайте
.txt
Если файлов несколько — результаты будут разделены блоками с именами файлов.
Как повысить точность распознавания
OCR — это не магия. Качество зависит от исходного изображения. Что можно сделать:
- Освещение. Избегайте теней и бликов. Сканируйте, а не фотографируйте, если есть возможность
- Разрешение. Оптимально 300 DPI. Меньше 150 DPI — точность резко падает
- Наклон. Прямой угол к поверхности. Даже 5° наклона могут испортить распознавание длинного документа
- Шрифт. Печатный текст распознаётся почти идеально. Рукописный — плохо, Tesseract не для этого
- Язык. Указывайте правильный. Если документ русский, не надо ставить «английский + русский» — точность упадёт
Совет: если сканируете документ со смешанным текстом (русский и английский), выбирайте оба языка. Для полностью русских — только русский.
Что распознаётся плохо
- Рукописный текст — только для очень аккуратного почерка
- Таблицы с неявными границами — колонки сливаются
- Стилизованные шрифты, каллиграфия
- Текст на фоне фотографий
- Мелкий шрифт меньше 8pt
Конфиденциальность
Все файлы обрабатываются прямо в вашем браузере. Ничего не отправляется на сервер, не хранится, не передаётся третьим лицам. Это особенно важно для паспортов, договоров, медицинских документов и других файлов с персональными данными.
Итог
Современный OCR в браузере работает достаточно хорошо для большинства практических задач: сканы договоров, книжные страницы, квитанции, конспекты. Если исходник качественный — точность будет 95–99%. Работает быстро, безопасно и без установки программ.
Попробуйте прямо сейчас — 20 бесплатных операций в месяц, без регистрации.
🔍 Открыть распознавание