В мире цифровых данных информация всё чаще приходит к нам не в виде документов, а в виде изображений — сканов, фотографий или скриншотов. Но что, если нужно быстро извлечь текст из такого файла и обработать его дальше?
Решение простое — использовать Tesseract OCR, мощную утилиту с открытым исходным кодом, которая превращает изображение в редактируемый текст за пару секунд.
Что такое Tesseract
Tesseract — это инструмент для оптического распознавания текста (OCR), созданный Google и активно развиваемый сообществом. Он поддерживает большинство популярных форматов изображений — PNG, JPEG, TIFF и другие.
На серверах уже предустановлены языковые пакеты:
- английский (
eng), - русский (
rus), - украинский (
ukr).
Если нужен другой язык, можно обратиться в техническую поддержку — доступно более 100 языков для установки.
Что умеет Tesseract
помощью Tesseract вы можете:
✅ Распознавать текст с изображений любого формата.
✅ Работать с несколькими языками одновременно.
✅ Сохранять результат в текстовом (.txt) или PDF-файле.
✅ Встраивать OCR прямо в свои приложения на PHP, Python, Go, Node.js и других языках.
Как запустить распознавание через консоль
Рассмотрим базовый пример: нужно извлечь текст с изображения image.png на украинском и английском языках.
Достаточно выполнить команду:
$ tesseract image.png output -l ukr+engРезультат появится в файле output.txt.
Пример использования в PHP
Tesseract легко интегрируется с PHP. Ниже пример кода, который запускает OCR и выводит текст прямо в браузере:
<?php
$text = shell_exec('tesseract image.png - -l ukr+eng');
echo "<pre>{$text}</pre>";
?>
Как сохранить результат в PDF
Чтобы результат сохранялся не только в текстовом файле, но и в PDF, можно использовать следующую команду:
<?php
shell_exec('tesseract image.png output pdf txt -l ukr+eng');
?>После выполнения появятся файлы output.txt и output.pdf, где текст будет доступен для копирования и поиска.
Почему стоит использовать Tesseract
- Бесплатно и с открытым исходным кодом.
- Поддерживает более 100 языков.
- Легко интегрируется с любыми серверными языками — PHP, Python, Node.js, Go и другими.
- Работает быстро и надежно даже на больших изображениях.
Где почитать подробнее
Полная документация и примеры доступны на официальном сайте проекта:
👉 Tesseract OCR Documentation