Содержание
    26.10.2025

    В мире цифровых данных информация всё чаще приходит к нам не в виде документов, а в виде изображений — сканов, фотографий или скриншотов. Но что, если нужно быстро извлечь текст из такого файла и обработать его дальше?

    Решение простое — использовать Tesseract OCR, мощную утилиту с открытым исходным кодом, которая превращает изображение в редактируемый текст за пару секунд.

    Что такое Tesseract

    Tesseract — это инструмент для оптического распознавания текста (OCR), созданный Google и активно развиваемый сообществом. Он поддерживает большинство популярных форматов изображений — PNG, JPEG, TIFF и другие.

    На серверах уже предустановлены языковые пакеты:

    • английский (eng),
    • русский (rus),
    • украинский (ukr).

    Если нужен другой язык, можно обратиться в техническую поддержку — доступно более 100 языков для установки.

    Что умеет Tesseract

     помощью Tesseract вы можете:

    ✅ Распознавать текст с изображений любого формата.
    ✅ Работать с несколькими языками одновременно.
    ✅ Сохранять результат в текстовом (.txt) или PDF-файле.
    ✅ Встраивать OCR прямо в свои приложения на PHP, Python, Go, Node.js и других языках.

    Как запустить распознавание через консоль

    Рассмотрим базовый пример: нужно извлечь текст с изображения image.png на украинском и английском языках.

    Достаточно выполнить команду:

    $ tesseract image.png output -l ukr+eng

    Результат появится в файле output.txt.

    Пример использования в PHP

    Tesseract легко интегрируется с PHP. Ниже пример кода, который запускает OCR и выводит текст прямо в браузере:

    <?php
    $text = shell_exec('tesseract image.png - -l ukr+eng');
    echo "<pre>{$text}</pre>";
    ?>
    

    Как сохранить результат в PDF

    Чтобы результат сохранялся не только в текстовом файле, но и в PDF, можно использовать следующую команду:

    <?php
    shell_exec('tesseract image.png output pdf txt -l ukr+eng');
    ?>

    После выполнения появятся файлы output.txt и output.pdf, где текст будет доступен для копирования и поиска.

    Почему стоит использовать Tesseract

    • Бесплатно и с открытым исходным кодом.
    • Поддерживает более 100 языков.
    • Легко интегрируется с любыми серверными языками — PHP, Python, Node.js, Go и другими.
    • Работает быстро и надежно даже на больших изображениях.

    Где почитать подробнее

    Полная документация и примеры доступны на официальном сайте проекта:
    👉 Tesseract OCR Documentation