Whisper

OpenAI · лицензия MIT

Переводит речь в текст на твоём компьютере или сервере: запись эфира, созвона, голосовое. Понимает русский, звук обрабатывает у тебя.

macOS · Windows · LinuxНа компьютере, на сервере и в контейнереБесплатно, MIT

Сверили официальные источники 25.09.2026. Не устанавливали и не запускали. Что именно проверяли

Установить агентом ↓

Какую задачу решает

Переводит речь в текст: запись эфира, созвона, голосовое сообщение. Работает у тебя на компьютере или сервере, звук в облако не уходит, из интернета при первом запуске скачивается только модель. Понимает русский и сам определяет язык записи.

  • Расшифровывает запись в текст и субтитры: txt, srt, vtt, json.
  • Ставит отметки времени, чтобы агент нашёл нужный момент и вырезал его через FFmpeg.
  • Сам определяет язык записи, русский понимает.
  • Работает и без видеокарты, на процессоре, только медленнее.

Пример результата

Говоришь агенту

Расшифруй efir.mp3 моделью small на русском, текст и субтитры положи в папку transcripts.

Что получится

В папке transcripts появляются efir.txt с текстом и efir.srt с отметками времени. Перед первым запуском агент спросит, можно ли скачать модель small: это около 480 МБ.

Паспорт

Кто делает
OpenAI
Исходный код
github.com/openai/whisper
Лицензия
MIT
Версия
20250625 на 25.09.2026
Системы
macOS · Windows · Linux
Где работает
На компьютере, на сервере и в контейнере
Цена
Бесплатно
Проверка
Сверили источники 25.09

Установить агентом

Для Claude Code, Codex, Hermes и любого агента с терминалом
Установи программу «Whisper». Работай по шагам и после каждого коротко говори, что сделал.

Что это за программа (каталог smyslokod.ru, официальные источники сверены 25.09.2026):
- исходный код: https://github.com/openai/whisper
- инструкция по установке: https://github.com/openai/whisper#setup
- актуальная версия на 25.09.2026: 20250625
- лицензия: MIT
- для работы нужно (обязательно): FFmpeg - Whisper читает звук через неё; без FFmpeg не откроет ни одну запись
- для работы нужно (обязательно): Python 3.10 или 3.11 - разработчики называют совместимыми Python 3.8-3.11, а свежий PyTorch требует 3.10 и новее; uv умеет скачать нужную версию сам
- для работы нужно (обязательно): PyTorch - движок для модели, ставится вместе с Whisper сам и весит сотни мегабайт
- для работы нужно (в отдельных случаях): Rust - нужен, только если для системы нет готовой сборки библиотеки tiktoken: установка тогда скажет об этом сама

Правила:
1. Ничего не устанавливай и не меняй, пока я не скажу «да» на твой план.
2. Ставь только способами из этого промпта. Сторонние сборки, скрипты с форумов и из чужих репозиториев не бери.
3. Мои проекты не трогай: не меняй их файлы, виртуальные окружения и списки зависимостей (package.json, requirements.txt, pyproject.toml).
4. Если ставишь из PyPI (пакет openai-whisper), то только в отдельное окружение: uv tool install или pipx. В окружение проекта и в системный Python не ставь.
5. Команды с sudo, правку профиля оболочки (~/.zshrc, ~/.bashrc) и переменной PATH делай только после моего отдельного «да» на каждую.
6. Не проси у меня пароли и ключи и не выводи их. Если нужен пароль администратора, дай команду, я выполню её сам.
7. Не скачивай модели распознавания без моего «да»: назови модель и её размер. Всегда указывай модель флагом --model: без него Whisper берёт turbo на 1,6 ГБ.
8. Если это Linux без видеокарты NVIDIA, предупреди меня до установки: обычный PyTorch тянет библиотеки NVIDIA на гигабайты. Предложи версию PyTorch для процессора по инструкции pytorch.org.

Шаги:
0. Определи, где ты работаешь: мой компьютер, сервер или контейнер. Какая система и процессор, какие менеджеры пакетов есть (Homebrew, apt, winget, uv, pipx). Ставить нужно туда, где ты сам запускаешь команды.
   - на компьютере: удобно на Mac и мощном ноутбуке: модели tiny, base и small работают и без видеокарты.
   - на сервере: на процессоре работает, но длинные записи расшифровываются долго; с видеокартой NVIDIA заметно быстрее. На сервере без видеокарты нужна версия PyTorch для процессора.
   - в контейнере: нужны Python, FFmpeg и место под модели. В официальном Docker-образе Hermes Agent FFmpeg уже есть; Python-программы документация Hermes советует запускать через uvx. Если Python в контейнере новее 3.11, Whisper ставят с Python 3.11 через uv.
1. Проверь, не стоит ли программа уже: whisper --help ; uv tool list ; pipx list. Если стоит и запускается, ничего не ставь и переходи к шагу 5.
2. Проверь, что есть всё нужное для работы: FFmpeg, Python 3.10 или 3.11, PyTorch. Чего нет, внеси в план отдельным пунктом. Проверь свободное место на диске: нужно сотни мегабайт на PyTorch и модель, а на Linux вместе с библиотеками NVIDIA - несколько гигабайт.
3. Составь план: каким одним способом из списка ниже будешь ставить, что появится на диске и сколько места займёт, что поменяется в системе и как потом удалить. Покажи план и жди моего «да».
   Способы из официальных источников:
   - Любая система, uv: uv tool install --python 3.11 openai-whisper (отдельное окружение с Python 3.11, проекты не задевает)
   - Любая система, pipx: pipx install openai-whisper (отдельное окружение на Python, который уже есть в системе)
   - Любая система, pip: pip install -U openai-whisper (официальная команда; только внутри отдельного виртуального окружения, не в проекте и не в системном Python)
4. Установи по согласованному плану. Если что-то идёт не так, как в плане, остановись и спроси.
5. Проверь результат:
   - whisper --help: программа запускается без ошибки;
   - Попроси у меня короткую запись голоса на 10-20 секунд. Модель base (145 МБ) скачивай только после моего «да», потом расшифруй запись. Делай это во временной папке и не трогай мои файлы.
     whisper "[запись]" --model base --language ru --output_format txt --output_dir whisper-check
   - если ты работаешь в папке моего проекта, покажи git status: от установки в проекте не должно появиться изменений.
6. Итог одним сообщением: что установлено, какой версии и куда, сколько места заняло, что поменялось в системе и как всё удалить (uv: uv tool uninstall openai-whisper; pipx: pipx uninstall openai-whisper; pip: pip uninstall openai-whisper).

Если на любом шаге ошибка, не чини наугад: покажи текст ошибки и скажи, что, по-твоему, случилось. Частые проблемы: https://smyslokod.ru/cli/whisper#problemy

Промпт собран из официальных инструкций, сверенных 25.09.2026. Агент сначала проверит, что уже стоит, покажет план с местом на диске и способом удаления и без твоего «да» ничего не поставит. Сами мы этот промпт на живой установке ещё не прогоняли.

Как ставят вручную

Способы из официальных источников, у каждого ссылка на первоисточник.

  • Любая система · uv · источник

    uv tool install --python 3.11 openai-whisper

    отдельное окружение с Python 3.11, проекты не задевает

  • Любая система · pipx · источник

    pipx install openai-whisper

    отдельное окружение на Python, который уже есть в системе

  • Любая система · pip · источник

    pip install -U openai-whisper

    официальная команда; только внутри отдельного виртуального окружения, не в проекте и не в системном Python

Как удалить

  • Любая система, uv: uv tool uninstall openai-whisper
  • Любая система, pipx: pipx uninstall openai-whisper
  • Любая система, pip: pip uninstall openai-whisper

Что нужно для работы

  • FFmpeg (обязательно) - Whisper читает звук через неё; без FFmpeg не откроет ни одну запись
  • Python 3.10 или 3.11 (обязательно) - разработчики называют совместимыми Python 3.8-3.11, а свежий PyTorch требует 3.10 и новее; uv умеет скачать нужную версию сам
  • PyTorch (обязательно) - движок для модели, ставится вместе с Whisper сам и весит сотни мегабайт
  • Rust (в отдельных случаях) - нужен, только если для системы нет готовой сборки библиотеки tiktoken: установка тогда скажет об этом сама

Системы

  • macOS - пакет Python, нужен FFmpeg.
  • Windows - пакет Python, нужен FFmpeg.
  • Linux - пакет Python, нужен FFmpeg. Обычная установка PyTorch на Linux тянет библиотеки для видеокарт NVIDIA.

Где запускать

Ставить нужно туда, где работает агент: на твой компьютер, сервер или в контейнер.

  • На компьютере - удобно на Mac и мощном ноутбуке: модели tiny, base и small работают и без видеокарты.
  • На сервере - на процессоре работает, но длинные записи расшифровываются долго; с видеокартой NVIDIA заметно быстрее. На сервере без видеокарты нужна версия PyTorch для процессора.
  • В контейнере - нужны Python, FFmpeg и место под модели. В официальном Docker-образе Hermes Agent FFmpeg уже есть; Python-программы документация Hermes советует запускать через uvx. Если Python в контейнере новее 3.11, Whisper ставят с Python 3.11 через uv.

Сколько ресурсов нужно

Место на диске
Сотни мегабайт на PyTorch и модель, а на Linux вместе с библиотеками NVIDIA - несколько гигабайт
Память
Видеопамять по таблице разработчиков: tiny и base около 1 ГБ, small около 2 ГБ, medium около 5 ГБ, turbo около 6 ГБ, large около 10 ГБ.
Видеокарта
Не обязательна: на процессоре Whisper работает, но медленнее. С видеокартой NVIDIA расшифровка заметно быстрее.
Сеть
Модель скачивается один раз при первом запуске, дальше Whisper работает без интернета.

Пакет PyTorch в PyPI весит от 124 до 555 МБ в зависимости от системы, на Linux к нему по умолчанию добавляются библиотеки NVIDIA: только четыре из них - около 1 ГБ. Модели скачиваются при первом запуске: tiny 76 МБ, base 145 МБ, small 484 МБ, medium 1,5 ГБ, turbo 1,6 ГБ, large-v3 3,1 ГБ. Размеры моделей сверены 25.09.2026 по ответу сервера, без скачивания.

Лицензия и платные замены

Лицензия MIT. Под MIT и код программы, и веса моделей. Текст лицензии

Цена: Бесплатно

Платные замены

  • Yandex SpeechKit - Распознавание речи в облаке Яндекса, понимает русский. Оплата за секунды звука, цены на странице тарифов. Звук уходит в облако: для записей с персональными данными клиентов это важно.

Бесплатные замены

  • faster-whisper - Те же модели на другом движке. По данным авторов до 4 раз быстрее при той же точности и берёт меньше памяти. Через него Hermes Agent расшифровывает голосовые, если он установлен.
  • whisper.cpp - Whisper на C/C++ без Python и PyTorch. На Mac с процессором Apple работает через Metal.

О чём помнить

  • Без флага --model Whisper берёт модель turbo и скачивает 1,6 ГБ. Промпт установки просит агента называть модель и её размер и ждать твоего «да».
  • Модели лежат в папке ~/.cache/whisper. Удаляешь программу - удали и эту папку, иначе место останется занято.
  • Голосовые сообщения Hermes Agent расшифровывает своими средствами: по документации через faster-whisper или через команду whisper, если она стоит. Эта карточка - про Whisper как программу, которой агент расшифровывает любые записи.
  • Если в записях персональные данные клиентов (созвоны, консультации), расшифровка у себя оставляет их у тебя. Облачный сервис получает звук целиком.

Частые проблемы

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg'

Whisper не нашёл FFmpeg: он читает звук через неё. Поставь FFmpeg туда же, где запускается Whisper (карточка FFmpeg).

UserWarning: FP16 is not supported on CPU; using FP32 instead

Это не ошибка: видеокарты нет, и Whisper считает на процессоре. Ничего делать не нужно. Если слишком медленно, возьми модель поменьше: base или small.

Установка качает гигабайты на сервере без видеокарты

На Linux обычный PyTorch ставится вместе с библиотеками для видеокарт NVIDIA. Поставь PyTorch для процессора по инструкции pytorch.org (вариант CPU), потом Whisper.

Ошибка сборки tiktoken, установка просит Rust

Для твоей системы нет готовой сборки библиотеки tiktoken. Поставь Rust по инструкции rust-lang.org и повтори установку. Если просит setuptools_rust, поставь и его: так советуют разработчики Whisper.

Процесс падает или сервер зависает на большой модели

Модели не хватает памяти. Возьми модель меньше (small, base) или машину с большей памятью.

Проверка

Сверили официальные источники 25.09.2026. Не устанавливали и не запускали.

Когда
25.09.2026
Среда
Официальные сайты, репозитории и реестры пакетов, без установки
Объём
Сверили официальные источники, программу не устанавливали
Что именно сделали
  1. github.com/openai/whisper: лицензия MIT на код и веса моделей, последний выпуск v20250625 от 26.06.2025, изменения в репозитории - 31.08.2026.
  2. PyPI openai-whisper: версия 20250625, Python 3.8 и новее; README: разработчики называют совместимыми Python 3.8-3.11, нужен ffmpeg, иногда Rust.
  3. Исходный код whisper: модель по умолчанию turbo, модели хранятся в ~/.cache/whisper, форматы txt, vtt, srt, tsv, json.
  4. Размеры моделей сняты заголовком ответа сервера, без скачивания: tiny 76 МБ, base 145 МБ, small 484 МБ, medium 1,5 ГБ, large-v3 3,1 ГБ, turbo 1,6 ГБ.
  5. PyPI torch 2.14.0: Python 3.10 и новее, пакеты 124-555 МБ, на Linux зависимости NVIDIA; индекс download.pytorch.org/whl/cpu с вариантами для процессора есть.
  6. Документация Hermes Agent: голосовые расшифровываются через faster-whisper или команду whisper.
ДатаВерсияОбъёмГдеИтог
25.09.202620250625источникибез установкиполучилось

«Проверено» ставим, только когда сами поставили программу и прогнали её на задаче. Сверка ссылок и вывод версии так не называются.

Входит в подборки

Программу делают её авторы. Мы сверяем официальные источники и описываем, что ей нужно, но код остаётся чужим. Перед установкой посмотри план агента: что он поставит и что поменяет в системе.