Tesseract

Сообщество Tesseract OCR · лицензия Apache-2.0

Достаёт текст из сканов договоров, фото чеков, визиток и снимков экрана, понимает русский. Агенту нужен, чтобы прочитать скан и собрать PDF, в котором ищется текст.

macOS · Windows · LinuxНа компьютере, на сервере и в контейнереБесплатно, Apache-2.0

✓ Проверено 01.10.2026: Docker Desktop 29.2.1 на Mac с Apple Silicon: одноразовые контейнеры ubuntu:24.04 (arm64, 2 ядра), Tesseract 5.5.3 через Homebrew 7.0.7, для сравнения 5.3.4 из apt. Что именно проверяли

Установить агентом ↓

Какую задачу решает

Распознаёт печатный текст на картинках и сканах: договоры, счета, чеки, визитки, снимки экрана. Понимает русский и ещё больше 100 языков, работает на твоём компьютере без интернета, документы никуда не уходят. Из скана собирает PDF, в котором текст ищется и копируется.

  • Переводит скан договора или счёта в текст: агент читает его, ищет нужное и сверяет с другими документами.
  • Собирает из сканов PDF с невидимым текстовым слоем: страница выглядит как скан, а слова в ней ищутся и копируются.
  • Читает фото чеков, визитки и снимки экрана: суммы, телефоны, почту и ИНН для таблицы или сверки.
  • Ставит каждому слову оценку уверенности (вывод tsv): агент показывает места, которые стоит проверить глазами.

Пример результата

Говоришь агенту

В папке scans лежат сканы договоров в PNG. Распознай их на русском, рядом сделай PDF, в которых ищется текст, и выпиши в таблицу номер договора, дату, сумму и ИНН сторон. Где не уверен, отметь.

Что получится

В папке scans-pdf появляются PDF с текстовым слоем и файлы txt, агент присылает таблицу с номерами, датами, суммами и ИНН и отмечает места, где сомневается. Сканы остаются как были.

Паспорт

Кто делает
Сообщество Tesseract OCR
Исходный код
github.com/tesseract-ocr/tesseract
Лицензия
Apache-2.0
Версия
5.5.3 на 01.10.2026
Системы
macOS · Windows · Linux
Где работает
На компьютере, на сервере и в контейнере
Цена
Бесплатно
Проверка
Проверено 01.10

Установить агентом

Для Claude Code, Codex, Hermes и любого агента с терминалом
Установи программу «Tesseract». Работай по шагам и после каждого коротко говори, что сделал.

Что это за программа (каталог smyslokod.ru, официальные источники сверены 01.10.2026):
- официальный сайт: https://tesseract-ocr.github.io/
- исходный код: https://github.com/tesseract-ocr/tesseract
- инструкция по установке: https://tesseract-ocr.github.io/tessdoc/Installation.html
- актуальная версия на 01.10.2026: 5.5.3
- лицензия: Apache-2.0
- для работы нужно (обязательно): Русская языковая модель (rus) - без неё -l rus не работает; ставится отдельно: tesseract-ocr-rus в Ubuntu и Debian, tesseract-langpack-rus в Fedora, tesseract-lang в Homebrew, tesseract-rus в MacPorts, пункт Russian в установщике Windows
- для работы нужно (в отдельных случаях): ImageMagick - подготовить плохие фото и снимки экрана перед распознаванием: серый цвет, увеличение, выравнивание наклона, убрать тень
- для работы нужно (в отдельных случаях): Poppler (pdftoppm и pdftotext) - разобрать PDF-скан на картинки страниц и проверить, что в готовом PDF ищется текст
- для работы нужно (в отдельных случаях): Homebrew - на Mac проще всего ставить через него

Правила:
1. Ничего не устанавливай и не меняй, пока я не скажу «да» на твой план.
2. Ставь только способами из этого промпта. Сторонние сборки, скрипты с форумов и из чужих репозиториев не бери.
3. Мои проекты не трогай: не меняй их файлы, виртуальные окружения и списки зависимостей (package.json, requirements.txt, pyproject.toml).
4. Команды с sudo, правку профиля оболочки (~/.zshrc, ~/.bashrc) и переменной PATH делай только после моего отдельного «да» на каждую.
5. Не проси у меня пароли и ключи и не выводи их. Если нужен пароль администратора, дай команду, я выполню её сам.
6. Если в тексте может быть латиница (почта, сайты, названия), распознавай с -l rus+eng: с одним rus латинские буквы превращаются в русские.
7. Исходные картинки и сканы не меняй: подготовленные копии и результаты клади в отдельную папку.
8. После распознавания сверяй числа: пересчитай сумму строк и итог, проверь, что в ИНН 10 или 12 цифр, покажи мне места, где сомневаешься (слова с уверенностью ниже 60 в выводе tsv). Не выдавай распознанный текст за точную копию документа.
9. Если ошибок много, подготовь копию картинки в ImageMagick (серый цвет, увеличение в 2-3 раза, -deskew, -lat) и распознай снова; ставить ImageMagick - только с моего «да». Если и так плохо, скажи мне и попроси переснять: ровно, при хорошем свете, без тени.
10. PDF и фото HEIC в tesseract не подавай: PDF разбери на картинки страниц (pdftoppm -r 300 -png), HEIC переведи в JPEG. Если для этого нужна новая программа, спроси меня.
11. Языковые модели (.traineddata) бери только из пакетов системы, Homebrew, MacPorts, установщика или репозиториев tesseract-ocr/tessdata_fast и tessdata_best. Модели с других сайтов не скачивай.
12. Сканы с личными данными (паспорта, договоры, чеки) не отправляй в облачные сервисы распознавания без моего «да»: Tesseract распознаёт их на этом компьютере.
13. На Windows после установки запускай программу по полному пути "C:\Program Files\Tesseract-OCR\tesseract.exe": установщик не добавляет её в PATH.

Шаги:
0. Определи, где ты работаешь: мой компьютер, сервер или контейнер. Какая система и процессор, какие менеджеры пакетов есть (Homebrew, apt, winget, uv, pipx). Ставить нужно туда, где ты сам запускаешь команды.
   - на компьютере: на Mac - Homebrew или MacPorts, на Windows - winget или установщик, на Linux - пакет дистрибутива. Распознавание идёт на этом компьютере, сканы никуда не отправляются.
   - на сервере: пакетом дистрибутива: в Ubuntu и Debian это tesseract-ocr и tesseract-ocr-rus. Видеокарта не нужна, страница A4 распознаётся меньше чем за секунду на одном ядре.
   - в контейнере: в чистом образе Ubuntu 24.04 apt ставит Tesseract 5.3.4 с русской моделью за 10 секунд: 74 пакета, около 104 МБ. Homebrew в таком контейнере ставит 5.5.3, но тянет ещё 49 зависимостей, папка Cellar вырастает до 1,2 ГБ.
1. Проверь, не стоит ли программа уже: tesseract --version ; tesseract --list-langs. Если стоит и запускается, ничего не ставь и переходи к шагу 5.
2. Проверь, что есть всё нужное для работы: Русская языковая модель (rus). Чего нет, внеси в план отдельным пунктом. Проверь свободное место на диске: нужно около 104 МБ через apt в чистой Ubuntu 24.04 (74 пакета вместе с русской моделью, сама модель rus - 3,9 МБ); через Homebrew программа около 32 МБ и остальные языки 686 МБ (скачиваются одним файлом 345 МБ) плюс зависимости, которых ещё нет; установщик для Windows весит 26,6 МБ и докачивает выбранные языки; модель rus из tessdata_best - 15,3 МБ.
3. Составь план: каким одним способом из списка ниже будешь ставить, что появится на диске и сколько места займёт, что поменяется в системе и как потом удалить. Покажи план и жди моего «да».
   Способы из официальных источников:
   - macOS и Linux, Homebrew: brew install tesseract tesseract-lang (в самой формуле tesseract только английский; tesseract-lang добавляет остальные языки разом, около 690 МБ, и всего их становится 162)
   - macOS, MacPorts: sudo port install tesseract tesseract-rus (русский - отдельный порт tesseract-rus, остальные языки не ставятся)
   - Windows, winget: winget install --id tesseract-ocr.tesseract -e (ставит тот же установщик с GitHub проекта; русский докачивается сам только на Windows с русским языком системы, иначе модель rus.traineddata кладут в папку tessdata вручную; в PATH программа не попадает)
   - Windows, установщик с GitHub: .\tesseract-ocr-w64-setup-5.5.3.20260724.exe (файл скачать со страницы выпуска; в разделе Additional language data (download) отметь Russian, на Windows с русским языком системы он отмечен сам; папку оставь ту, что предлагает установщик; в PATH программа не добавляется)
   - Linux, apt: sudo apt install tesseract-ocr tesseract-ocr-rus (Ubuntu и Debian; в Ubuntu 24.04 это 5.3.4, модели те же, что у 5.5.3)
   - Linux, dnf: sudo dnf install tesseract tesseract-langpack-rus (Fedora; в Fedora 44 это 5.5.3)
4. Установи по согласованному плану. Если что-то идёт не так, как в плане, остановись и спроси.
5. Проверь результат:
   - tesseract --version: программа запускается без ошибки;
   - Сделай картинку с русским текстом программой text2image, она ставится вместе с Tesseract. Распознай её с -l rus+eng сразу в текст и в PDF и сравни с исходником. Шрифт с кириллицей возьми из списка text2image --list_available_fonts --fonts_dir=<папка шрифтов>: на Linux подойдёт DejaVu Sans из /usr/share/fonts, на Mac - Arial из /System/Library/Fonts, на Windows - Arial из C:\Windows\Fonts. Если text2image нет, сделай картинку тем, что уже стоит, и ничего нового не ставь. Если есть pdftotext, проверь, что в PDF ищется «185 000». Делай это во временной папке и не трогай мои файлы.
     printf 'Счёт № 245 от 29 сентября 2026 г.\nИтого к оплате: 185 000 рублей\n' > source.txt
     text2image --text=source.txt --outputbase=check --font='DejaVu Sans' --fonts_dir=/usr/share/fonts
     tesseract check.tif result -l rus+eng txt pdf
     cat result.txt
     pdftotext result.pdf - | grep '185 000'
   - если ты работаешь в папке моего проекта, покажи git status: от установки в проекте не должно появиться изменений.
6. Итог одним сообщением: что установлено, какой версии и куда, сколько места заняло, что поменялось в системе и как всё удалить (macOS и Linux, Homebrew: brew uninstall tesseract-lang tesseract; macOS, MacPorts: sudo port uninstall tesseract-rus tesseract; Windows, winget: winget uninstall --id tesseract-ocr.tesseract -e; Windows, установщик с GitHub: & "$env:ProgramFiles\Tesseract-OCR\tesseract-uninstall.exe"; Linux, apt: sudo apt remove tesseract-ocr tesseract-ocr-rus; Linux, dnf: sudo dnf remove tesseract tesseract-langpack-rus).

Если на любом шаге ошибка, не чини наугад: покажи текст ошибки и скажи, что, по-твоему, случилось. Частые проблемы: https://smyslokod.ru/cli/tesseract#problemy

Промпт собран из официальных инструкций, сверенных 01.10.2026. Агент сначала проверит, что уже стоит, покажет план с местом на диске и способом удаления и без твоего «да» ничего не поставит.

Как ставят вручную

Способы из официальных источников, у каждого ссылка на первоисточник.

  • macOS и Linux · Homebrew · источник

    brew install tesseract tesseract-lang

    в самой формуле tesseract только английский; tesseract-lang добавляет остальные языки разом, около 690 МБ, и всего их становится 162

  • macOS · MacPorts · источник

    sudo port install tesseract tesseract-rus

    русский - отдельный порт tesseract-rus, остальные языки не ставятся

  • Windows · winget · источник

    winget install --id tesseract-ocr.tesseract -e

    ставит тот же установщик с GitHub проекта; русский докачивается сам только на Windows с русским языком системы, иначе модель rus.traineddata кладут в папку tessdata вручную; в PATH программа не попадает

  • Windows · установщик с GitHub · источник

    .\tesseract-ocr-w64-setup-5.5.3.20260724.exe

    файл скачать со страницы выпуска; в разделе Additional language data (download) отметь Russian, на Windows с русским языком системы он отмечен сам; папку оставь ту, что предлагает установщик; в PATH программа не добавляется

  • Linux · apt · источник

    sudo apt install tesseract-ocr tesseract-ocr-rus

    Ubuntu и Debian; в Ubuntu 24.04 это 5.3.4, модели те же, что у 5.5.3

  • Linux · dnf · источник

    sudo dnf install tesseract tesseract-langpack-rus

    Fedora; в Fedora 44 это 5.5.3

Как удалить

  • macOS и Linux, Homebrew: brew uninstall tesseract-lang tesseract
  • macOS, MacPorts: sudo port uninstall tesseract-rus tesseract
  • Windows, winget: winget uninstall --id tesseract-ocr.tesseract -e
  • Windows, установщик с GitHub: & "$env:ProgramFiles\Tesseract-OCR\tesseract-uninstall.exe"
  • Linux, apt: sudo apt remove tesseract-ocr tesseract-ocr-rus
  • Linux, dnf: sudo dnf remove tesseract tesseract-langpack-rus

Что нужно для работы

  • Русская языковая модель (rus) (обязательно) - без неё -l rus не работает; ставится отдельно: tesseract-ocr-rus в Ubuntu и Debian, tesseract-langpack-rus в Fedora, tesseract-lang в Homebrew, tesseract-rus в MacPorts, пункт Russian в установщике Windows
  • ImageMagick (в отдельных случаях) - подготовить плохие фото и снимки экрана перед распознаванием: серый цвет, увеличение, выравнивание наклона, убрать тень
  • Poppler (pdftoppm и pdftotext) (в отдельных случаях) - разобрать PDF-скан на картинки страниц и проверить, что в готовом PDF ищется текст
  • Homebrew (в отдельных случаях) - на Mac проще всего ставить через него

Системы

  • macOS - Homebrew (готовые сборки для Apple Silicon на macOS 15 и новее) или MacPorts.
  • Windows - 64-битная Windows: установщик со страницы выпуска на GitHub или winget. Русский язык докачивается во время установки.
  • Linux - пакеты дистрибутивов: в Ubuntu 24.04 версия 5.3.4, в Debian 13 и Ubuntu 26.04 - 5.5.0, в Fedora 44 - 5.5.3. Последнюю версию на любом Linux ставит Homebrew.

Где запускать

Ставить нужно туда, где работает агент: на твой компьютер, сервер или в контейнер.

  • На компьютере - на Mac - Homebrew или MacPorts, на Windows - winget или установщик, на Linux - пакет дистрибутива. Распознавание идёт на этом компьютере, сканы никуда не отправляются.
  • На сервере - пакетом дистрибутива: в Ubuntu и Debian это tesseract-ocr и tesseract-ocr-rus. Видеокарта не нужна, страница A4 распознаётся меньше чем за секунду на одном ядре.
  • В контейнере - в чистом образе Ubuntu 24.04 apt ставит Tesseract 5.3.4 с русской моделью за 10 секунд: 74 пакета, около 104 МБ. Homebrew в таком контейнере ставит 5.5.3, но тянет ещё 49 зависимостей, папка Cellar вырастает до 1,2 ГБ.

Сколько ресурсов нужно

Место на диске
Около 104 МБ через apt в чистой Ubuntu 24.04 (74 пакета вместе с русской моделью, сама модель rus - 3,9 МБ); через Homebrew программа около 32 МБ и остальные языки 686 МБ (скачиваются одним файлом 345 МБ) плюс зависимости, которых ещё нет; установщик для Windows весит 26,6 МБ и докачивает выбранные языки; модель rus из tessdata_best - 15,3 МБ
Память
На странице A4 в 300 точек - 50-100 МБ памяти, на чеке и снимке экрана - 20-50 МБ (замер в контейнере).
Видеокарта
Не нужна: распознавание идёт на процессоре, страница A4 в 300 точек - около 0,6 секунды на одном ядре.
Сеть
Только чтобы скачать программу и языки. Распознавание работает без интернета, сканы никуда не отправляются.

Папку сканов быстрее распознавать в несколько процессов с переменной OMP_THREAD_LIMIT=1: 10 страниц на двух ядрах заняли 3,1 секунды против 6,1 по очереди. Кэш скачанных файлов Homebrew (в контейнере 522 МБ) чистит brew cleanup.

Лицензия и платные замены

Лицензия Apache-2.0. Свободная лицензия: пользоваться бесплатно можно и лично, и в работе компании. Условия важны тем, кто распространяет Tesseract вместе со своим продуктом: приложить текст лицензии и сохранить уведомления об авторстве. Языковые модели из репозиториев tessdata идут под той же лицензией. Текст лицензии

Цена: Бесплатно

Платные замены

  • Yandex Vision OCR - Облачное распознавание Яндекса: печатный и рукописный текст на русском и английском, таблицы, JPEG, PNG и PDF до 10 МБ. Платно, за каждую страницу, и документы уходят в облако.
  • ContentReader PDF - Программа с окнами от бывшей российской части ABBYY: распознаёт сканы и фото документов, работает на Windows и российских Linux. Подписка от 8 055 рублей в год, пробная версия на 7 дней.

Бесплатные замены

  • OCRmyPDF - Бесплатная программа для PDF-сканов: сама разбирает страницы, распознаёт их тем же Tesseract и собирает PDF с текстовым слоем. Удобна, когда сканы приходят в PDF.
  • EasyOCR - Бесплатное распознавание на нейросетях, больше 80 языков, кириллица есть. Ставится как библиотека Python и требует PyTorch, поэтому тяжелее Tesseract.

О чём помнить

  • Рукописный текст Tesseract читает плохо: по документации программа сделана для печатного текста. Для почерка нужен другой инструмент, например платный Yandex Vision OCR с моделью для рукописного текста.
  • Фото с тенью, наклоном и мелким шрифтом без подготовки читаются плохо: на прогоне фото договора дало 28% ошибок, а после подготовки в ImageMagick ни одной. Размытое мелкое фото чека не спасает и подготовка: суммы в нём остались с ошибками.
  • Ошибки в числах бывают незаметными: в ИНН появилась лишняя цифра, цена 240,00 прочиталась как 246,00, и программа была в этом уверена. Суммы, ИНН и даты после распознавания сверяй с документом.
  • Знака рубля ₽ в русской и английской моделях нет: он читается как «Р» или «2», и «12 990 ₽» может превратиться в «12 9902».
  • На вход Tesseract не берёт PDF, HEIC с iPhone, AVIF и JPEG XL: их сначала переводят в PNG или JPEG. PDF с текстовым слоем на выходе он собирает сам.
  • Языковые модели бери только из официальных источников. С июля по август 2026 года разработчики опубликовали 10 предупреждений об уязвимостях, все - в чтении файлов моделей .traineddata, 6 высокой важности. Восемь касаются и выпуска 5.5.3, выпуска с исправлением на 01.10.2026 ещё нет.
  • На Windows ставь в папку, которую предлагает установщик: удаление стирает папку tessdata целиком, вместе с моделями, которые ты докладывал руками.
  • Ставь Tesseract туда, где работает агент. Если агент на сервере, программа на твоём компьютере ему не поможет.

Частые проблемы

Error opening data file ...rus.traineddata, затем Failed loading language 'rus' и Could not initialize tesseract

Русской модели нет: Homebrew без tesseract-lang, apt без tesseract-ocr-rus или установщик Windows без пункта Russian ставят только английский. Поставь язык своим способом: brew install tesseract-lang, sudo apt install tesseract-ocr-rus, sudo dnf install tesseract-langpack-rus, sudo port install tesseract-rus или заново установщик с пунктом Russian. Или положи rus.traineddata из tessdata_fast в отдельную папку вместе с eng и osd и указывай её ключом --tessdata-dir.

Error in pixReadStream: Pdf reading is not supported

Tesseract не читает PDF на входе, так сказано в документации. PDF он умеет только собирать. Разбери PDF на картинки страниц: pdftoppm -r 300 -png scan.pdf page. Имена картинок запиши в файл pages.txt по одному в строке и распознай одним заходом: tesseract pages.txt result -l rus+eng pdf. Или возьми OCRmyPDF, он делает это сам.

Error during processing на фото с iPhone в формате HEIC

Формат HEIC Tesseract не поддерживает, как и AVIF и JPEG XL. Переведи фото в JPEG: на Mac без установки - sips -s format jpeg photo.heic --out photo.jpg, в ImageMagick - magick photo.heic photo.jpg.

Почта и адрес сайта превратились в кириллицу: office@severveter.ru стал «о се@зеуегущег.ги»

Распознавали с одним русским языком (-l rus), и латинские буквы подменились похожими русскими. Распознавай с -l rus+eng. На прогоне это вернуло почту, сайт и ИНН без ошибок.

Строки таблицы или списка разъехались: номера заказов отдельно, имена и суммы отдельно

Программа сама делит страницу на колонки и иногда видит колонки там, где их нет. На прогоне так вышло на снимке экрана в версии 5.5.3. Попробуй ключ --psm 4 (одна колонка строк разного размера): строки снова собрались целиком.

На фото много ошибок: перепутанные буквы, пропавшие строки, суммы не те

Тень, наклон, размытие и низкое разрешение. Лучше всего программа читает от 300 точек на дюйм, ровно и без теней. Подготовь копию в ImageMagick: magick photo.jpg -colorspace Gray -resize 300% -deskew 40% -lat 60x60-8% clean.png, потом распознай её. Если ошибок всё равно много, пересними: ровно, при хорошем свете, без тени.

Вместо ₽ в тексте «Р» или цифра 2, например «12 9902»

Знака ₽ нет в наборе знаков русской и английской моделей. Проверяй суммы по смыслу и по документу. На снимке экрана помогло увеличение в 3 раза: «12 9902» стало «12 990 Р».

На Windows: «tesseract» не является внутренней или внешней командой

Установщик не добавляет папку программы в PATH, документация Tesseract об этом предупреждает. Запускай по полному пути "C:\Program Files\Tesseract-OCR\tesseract.exe" или добавь эту папку в PATH.

Проверка

✓ Проверено 01.10.2026: Docker Desktop 29.2.1 на Mac с Apple Silicon: одноразовые контейнеры ubuntu:24.04 (arm64, 2 ядра), Tesseract 5.5.3 через Homebrew 7.0.7, для сравнения 5.3.4 из apt.

Когда
01.10.2026
Среда
Docker Desktop 29.2.1 на Mac с Apple Silicon: одноразовые контейнеры ubuntu:24.04 (arm64, 2 ядра), Tesseract 5.5.3 через Homebrew 7.0.7, для сравнения 5.3.4 из apt
Объём
Установили и прогнали задачу на тестовых данных
Что именно сделали
  1. Контейнер ubuntu:24.04 (Ubuntu 24.04.5 LTS, arm64). До установки команды tesseract нет. apt install tesseract-ocr tesseract-ocr-rus: 9 с, 74 новых пакета, скачано 35,2 МБ, на диске 104 МБ; версия 5.3.4 с Leptonica 1.82.0, языки eng, osd, rus.
  2. Тестовые данные сделали в контейнере (Python Pillow, шрифты Liberation и DejaVu): договор на 2 страницы A4 в 300 точек, счёт с таблицей, кассовый чек, визитка, снимок экрана 1280x720 со шрифтом 14 px, записка каллиграфическим шрифтом и «фото» договора и чека: наклон, тень, шум, сжатие JPEG. Имена и реквизиты выдуманные, картинки смотрели.
  3. 5.3.4, чистый скан договора с -l rus: 0 ошибок на 1283 знаках, верны все 9 полей (номер, даты, суммы, проценты, имена), 0,6-0,7 с и 58-72 МБ памяти на страницу. Страница реквизитов: почта стала кириллицей (о се@зеуегущег.ги), с -l rus+eng верны все 11 полей.
  4. 5.3.4, счёт с таблицей: с -l rus в ИНН 667100000123 появилась лишняя цифра, с -l rus+eng верны все 11 полей, рамки таблицы попали в текст как «|». Визитка с -l rus+eng - без ошибок, с -l rus почта и сайт испорчены.
  5. 5.3.4, снимок экрана: суммы и номера заказов верны, знак ₽ стал «Р» или «2» («12 990 ₽» превратилось в «12 9902»). Распаковка моделей: знака ₽ нет ни в rus, ни в eng. Увеличение картинки в 3 раза убрало «12 9902».
  6. 5.3.4, «фото» договора (половинное разрешение, наклон 2°, тень): 28% ошибок, верны 2 поля из 9. После ImageMagick (серый, -resize 300%, -deskew 40%, -lat 60x60-8%) - 0 ошибок и все 9 полей; одно увеличение без -lat не помогло (31%).
  7. 5.3.4, фото чека: 5% ошибок, после той же подготовки 2,8% и все 11 сумм и номеров. Размытое мелкое фото чека: 61% ошибок, после подготовки 14%, но цена 240,00 стала 246,00 с уверенностью 80 из 100; в выводе tsv ниже 60 оказались 9 слов из 71, эта ошибка среди них не попала.
  8. 5.3.4, записка каллиграфическим шрифтом: 5% ошибок («Лозвонить», «№» как «76»). Настоящий почерк не проверяли.
  9. 5.3.4, PDF: tesseract stranicy.txt dogovor -l rus+eng txt pdf - две страницы за 1,0 с, PDF 262 КБ с невидимым слоем GlyphLessFont. pdftotext находит фразу из договора, ИНН, сумму и почту; системная библиотека PDFKit на Mac тоже находит.
  10. 5.3.4, скан в PDF без текста: tesseract на нём - Error in pixReadStream: Pdf reading is not supported. pdftoppm -r 300 -png разобрал 2 страницы за 1 с, из них за 1,4 с собрался PDF с текстом. Фото HEIC - ошибка Error during processing, после перевода в JPEG через sips на Mac прочиталось.
  11. 5.3.4, модели tessdata_best (rus 15,3 МБ) вместо быстрых: в 1,5-1,8 раза медленнее, фото чека 2,5% ошибок вместо 5%, каллиграфический шрифт 2,4% вместо 6%, фото договора без подготовки те же 28%. Пачка из 10 страниц: по очереди 6,1 с, в 2 процесса с OMP_THREAD_LIMIT=1 - 3,1 с.
  12. Второй чистый контейнер, Homebrew 7.0.7 от пользователя без root: brew install tesseract tesseract-lang - 205 с, 51 формула вместе с зависимостями; tesseract --version - 5.5.3 с Leptonica 1.87.0, 162 языка; программа 32,3 МБ, языки 685,7 МБ, вся папка Cellar 1,2 ГБ.
  13. 5.5.3: те же картинки с -l rus и -l rus+eng дали почти те же доли ошибок, что 5.3.4, кроме снимка экрана: строки разъехались на две колонки (28% ошибок), с --psm 4 строки целые, 6%. PDF из двух страниц - 0,9 с, 272 КБ, текст ищется в pdftotext и PDFKit; PDF на входе и HEIC - те же ошибки.
  14. 5.5.3 без tesseract-lang: Error opening data file .../rus.traineddata и Failed loading language 'rus'. Папка с eng, osd и rus.traineddata из tessdata_fast (18 МБ) и ключ --tessdata-dir: визитка распознана верно.
  15. Команды проверки из промпта (text2image, tesseract -l rus+eng txt pdf, pdftotext) прошли на 5.3.4 и 5.5.3. Удаление: apt remove tesseract-ocr tesseract-ocr-rus и brew uninstall tesseract-lang tesseract - команды tesseract нет; модели eng и osd после apt остаются до apt autoremove, после brew 25 зависимостей убирает brew autoremove.
ДатаВерсияОбъёмГдеИтог
01.10.20265.5.3задачаконтейнер, Linuxполучилось
01.10.20265.5.3источникибез установкиполучилось

«Проверено» ставим, только когда сами поставили программу и прогнали её на задаче. Сверка ссылок и вывод версии так не называются.

Похожие программы

Программу делают её авторы. Мы сверяем официальные источники и описываем, что ей нужно, но код остаётся чужим. Перед установкой посмотри план агента: что он поставит и что поменяет в системе.