В Telegram-канале СмыслоКода можно следить за новыми материалами об ИИ-агентах, которые работают за тебя.
Здесь продолжаем с того места, где агент уже установлен, и меняем облачную модель на свою. Если Hermes у тебя ещё не стоит, начни с разбора что такое Hermes Agent и как его установить.
Зачем агенту локальная модель и чем за это платишь
Локальная модель работает прямо на твоём компьютере или сервере. Не нужен ни аккаунт, ни API-ключ, токены облачного провайдера не оплачиваются, и, пока ты не подключил облачного запасного провайдера (о нём в конце), переписка не уходит с твоей машины. Про десктопный вариант документация так и пишет: после загрузки модели не нужны ни аккаунт, ни ключ, ни доступ в сеть.
Платишь железом и скоростью. Hermes не просто болтает, он правит файлы, запускает команды и ходит в браузер, а всё это работает через вызов инструментов. В документации прямо сказано: модель без поддержки вызова инструментов может только разговаривать, действий она выполнять не будет. Поэтому первым делом смотри не на «самую умную модель», а на то, умеет ли она вызывать инструменты и влезает ли в твою память.
Минимальные и рекомендуемые требования из официального гайда:
| Что | Минимум | Рекомендуется |
|---|---|---|
| Оперативная память | 8 ГБ (для моделей 3B) | 32+ ГБ (для моделей 27B+) |
| Место на диске | 5 ГБ | 30+ ГБ (если моделей несколько) |
| Процессор | 4 ядра | 8+ ядер |
| Видеокарта | Не обязательна | NVIDIA с 8+ ГБ видеопамяти заметно ускоряет работу |
Без видеокарты тоже работает, но медленно. По документации модель на 9B на современном восьмиядерном процессоре даёт около 10 токенов в секунду, а на 31B выходит 2-5 токенов в секунду, и каждый ответ занимает 30-120 секунд.
Шаг 1. Поставь Ollama и проверь, что она запущена
Ollama - это программа, которая скачивает модели и отдаёт их другим программам по локальному адресу. Шаги 1-4 ниже идут по официальному гайду Hermes для ручной установки через терминал. Для Mac у Hermes есть отдельный гайд Run Local LLMs on Mac с другим инструментом, llama.cpp, а на любой системе с десктопным приложением проще путь из раздела про Local Models ниже. Поставь Ollama одной командой:
curl -fsSL https://ollama.com/install.sh | shПроверь, что она отвечает:
ollama --version
curl localhost:11434/api/tagsПервая команда показывает, что программа установлена. Вторая проверяет уже сам сервер Ollama: если он запущен, а моделей ещё нет, она вернёт пустой список {"models":[]}. По этому же адресу, порт 11434, Hermes и будет обращаться к Ollama.
Шаг 2. Скачай модель, которая умеет вызывать инструменты
Вот таблица моделей из документации Hermes. Главная колонка - «Вызов инструментов»:
| Модель | Место на диске | Нужно памяти | Вызов инструментов | Для чего |
|---|---|---|---|---|
gemma4:31b | ~20 ГБ | 24+ ГБ | Да | Лучшее качество, работает с инструментами |
gemma2:27b | ~16 ГБ | 20+ ГБ | Нет | Разговор, без действий |
gemma2:9b | ~5 ГБ | 8+ ГБ | Нет | Быстрые ответы, инструменты вызывать не умеет |
llama3.2:3b | ~2 ГБ | 4+ ГБ | Нет | Только короткие ответы |
Из этих четырёх надёжно вызывает инструменты только gemma4:31b. Если памяти меньше 24 ГБ, вывод такой: ни одна модель из этой таблицы не потянет роль агента на твоей машине, получится только обычный чат. Документация советует следить за библиотекой моделей Ollama, потому что поддержка инструментов у моделей быстро расширяется. Но прежде чем подключать новую модель, проверь у неё поддержку вызова инструментов.
Скачай модель:
ollama pull gemma4:31bМоделей можно скачать несколько и переключаться между ними прямо в Hermes командой /model. Ollama сама загружает в память ту, что сейчас нужна, и выгружает простаивающие.
Подключение локальной модели - одна из задач, которые появляются, когда работаешь с ИИ-агентами. Если ты собираешь свои проекты с ИИ-агентами, посмотри программу практикума СмыслоКода.
Шаг 3. Подними контекст до 64 000 токенов
По умолчанию Ollama даёт модели контекст 2048 токенов, а Hermes для работы с инструментами нужно минимум 64 000. В разделе неполадок документация так и пишет: контекст Ollama по умолчанию слишком мал для работы агента, его нужно увеличить.
Документация решает это так: создать вариант модели с большим контекстом.
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/ModelfileТеперь у тебя есть модель gemma4-64k. Дальше в настройках Hermes указывай именно это имя, а не исходное.
64 000 - это нижняя граница, а не точное значение: важно, чтобы контекст был не меньше 64 000 токенов.
Шаг 4. Подключи модель к Hermes
Запусти мастер настройки:
hermes setupКогда он спросит провайдера, выбери Custom Endpoint и введи:
- адрес (Base URL):
http://localhost:11434/v1целиком, сhttpв начале перед://. Это адрес Ollama на твоём компьютере с портом11434и путём/v1, ровно как в шаге 3 гайда; - ключ (API Key): оставь пустым или напиши
no-key, Ollama ключ не нужен; - модель:
gemma4-64k, то есть вариант с большим контекстом из шага 3.
Вместо мастера то же можно прописать вручную в ~/.hermes/config.yaml: в разделе model указываются default с именем модели, provider: "custom" и base_url с этим адресом. Готовый пример есть в шаге 3 гайда по Ollama, только имя модели замени на gemma4-64k.
После этого запускай hermes и давай задачу с проверяемым результатом. По документации пример такой: «List all Python files in this directory and count the lines of code in each» (перечисли все Python-файлы в этой папке и посчитай строки кода в каждом). Для такой задачи Hermes использует инструмент терминала и операции с файлами, а не просто пишет текст. Проверяй не формулировку ответа, а то, совпадает ли список файлов с тем, что реально лежит в папке: попроси Hermes создать тестовый файл и посмотри, появился ли он на диске (ls). Модель без поддержки инструментов может написать правдоподобный список, не открыв ни одного файла, и результат разойдётся с реальной папкой. Если файл не появился, агент работает просто как чат.
Как проверить, что всё работает
ollama psпокажет, какая модель загружена и сколько её слоёв ушло на видеокарту. Если на видеокарту не ушло ничего, ответы считает процессор. На сервере без видеокарты это нормально, просто медленно. Если видеопамяти не хватает на всю модель, это тоже работает: по документации модель на 31B на видеокарте с 12 ГБ частично уходит на видеокарту (около 40 слоёв), остальное считает процессор, и это всё равно заметно быстрее.- Первый ответ может прийти через несколько минут, это не зависание. Hermes в каждом запросе отправляет постоянную часть: системные инструкции и описание всех включённых инструментов. На процессоре модель сначала долго её переваривает, а потом пишет с обычной скоростью.
- Если хочешь ускорить первый ответ, урежь эту постоянную часть:
hermes prompt-sizeпокажет, сколько она весит,hermes toolsотключит ненужные наборы инструментов, аhermes skillsпоможет удалить лишние навыки.
Если ты держишь агента на сервере круглосуточно или он отвечает в Телеграме, учти ещё одно: Ollama выгружает модель из памяти после пяти минут простоя, и следующий ответ снова начнётся с загрузки. В документации есть настройка, которая держит модель загруженной: на Linux-сервере с Ollama как системной службой это переменная OLLAMA_KEEP_ALIVE=24h в файле /etc/systemd/system/ollama.service.d/override.conf:
# /etc/systemd/system/ollama.service.d/override.conf
[Service]
Environment="OLLAMA_KEEP_ALIVE=24h"Как применить этот файл, гайд не пишет. Если ты не работал со службами systemd, не правь его наугад: сначала разберись, как они настраиваются на твоём сервере.
Как вынести агента на сервер, разобрано в статье про Hermes Agent на VPS круглосуточно, а про бота - в настройке Hermes в Телеграме.
Путь проще: Local Models в десктопном приложении
Если ты работаешь в десктопном Hermes, Ollama ставить не обязательно. В Settings → Providers → Local Models приложение само ставит и обслуживает локальный сервер llama.cpp: скачивает модели, прикидывает, хватит ли памяти, и подбирает контекст.
Порядок из документации:
- Открой Settings → Providers → Local Models или выбери Run models locally при первом запуске.
- Нажми Install runtime: Hermes скачает официальную сборку llama.cpp под твоё железо (несколько сотен мегабайт) и будет её обновлять.
- Выбери модель в каталоге и нажми Download.
- Нажми Use: новые чаты пойдут через локальную модель.
В разделе Local Models документация не говорит, какие модели каталога умеют вызывать инструменты. Поэтому после выбора модели проверь её так же, как в шаге 4: дай задачу с действием, например перечислить файлы в папке. Если агент только отвечает текстом и ничего не выполняет, выбери другую модель.
У каждой модели в каталоге есть цветная метка памяти: зелёная - целиком помещается в видеопамять, жёлтая - работает, но использует оперативную память и медленнее, красная - для этого компьютера слишком большая. Каждая рекомендованная модель получает контекст минимум 64K, так что шаг 3 здесь делать не нужно. Простаивающую модель приложение выгружает из видеопамяти через 15 минут и снова загружает со следующим сообщением. У Ollama из шагов выше этот срок свой, пять минут, не путай их. Видеокарта на 8+ ГБ спокойно тянет маленькие модели каталога, на 16+ ГБ - модели 27-35B.
Одна оговорка: по документации этот раздел включён в canary-сборках приложения, то есть в ранних тестовых версиях. В остальных сборках его нужно включать флагом запуска --local. Если ты не видишь Local Models в настройках, причина скорее всего в этом.
Если что-то не так
| Что видишь | Почему | Что делать |
|---|---|---|
| «Connection refused» при запуске | Ollama не запущена | sudo systemctl start ollama или ollama serve |
provider 'ollama' has no endpoint configured | Запуск с --provider ollama, но адрес Ollama нигде не прописан | Указать адрес в providers.ollama.base_url или model.base_url. Без адреса Hermes не отправит запрос в облако, даже если в настройках есть ключ OpenRouter или OpenAI |
| Агент отвечает, но ничего не делает с файлами | Модель не умеет вызывать инструменты | Перейти на модель с вызовом инструментов, например gemma4:31b, и снова сделать для неё вариант с контекстом 64 000 (шаг 3) |
| Ошибки, связанные с окном контекста | Контекст Ollama по умолчанию 2048 токенов | Шаг 3: вариант модели с num_ctx 64000 |
| Долгое молчание перед первым ответом | Модель переваривает постоянную часть запроса | Подождать; урезать инструменты и навыки |
| Медленно отвечает | Модели не хватает памяти, или ответы считает процессор | Сверить размер модели с памятью по таблице и добавить память. Модель меньше из таблицы ответит быстрее, но вызывать инструменты она не умеет: агент станет просто чатом |
| Запросы обрываются по таймауту на медленной модели без видеокарты | Ответ считается дольше, чем ждёт Hermes | Увеличить таймаут HERMES_API_TIMEOUT=1800 в ~/.hermes/.env. Модель от этого быстрее не станет, но Hermes будет ждать ответ дольше и не оборвёт запрос |
| Тормозит длинная переписка | Большой контекст тормозит модель | Регулярно /compress |
Запасной облачный провайдер на сложные задачи
Документация прямо перечисляет, где локальная модель проигрывает: очень сложные многошаговые рассуждения, длинный контекст (у облачных моделей от 100 тысяч до миллиона токенов) и скорость на больших ответах без видеокарты.
Поэтому можно оставить локальную модель основной, а облачную подключить запасной. Для этого в ~/.hermes/config.yaml добавляется блок из документации. Это отдельный раздел верхнего уровня, рядом с model, а не внутри него:
fallback_providers:
- provider: openrouter
model: anthropic/claude-sonnet-4Раздел model с локальной моделью остаётся как был. По документации, если локальная модель не справляется три раза, Hermes переключается на облачного провайдера. Учти две вещи. По документации бесплатной остаётся только локальная часть, а сложные задачи уходят в платный API запасного провайдера. И запросы, которые ушли на запасного провайдера, уходят в облако, так что для них обещание «переписка не покидает машину» уже не работает.
Что сделать прямо сейчас
Если память позволяет (от 24 ГБ), начни с шага 1: поставь Ollama и скачай gemma4:31b. Если памяти меньше, но у тебя десктопный Hermes, открой Settings → Providers → Local Models и посмотри, какая модель каталога помечена зелёным для твоего железа. В обоих случаях первую проверку делай одинаково: дай агенту задачу с проверяемым результатом и сверь, что он реально сделал на диске, а не что написал в ответе.
Контекст-инжиниринг для агентов разбирают на практикуме СмыслоКода.
Источники
- Hermes Agent: Running Local Models with Ollama - требования к железу, установка, таблица моделей, контекст, подключение, устранение неполадок, сравнение стоимости (получено 1 октября 2026 года, закреплённая версия коммита 357f51c).
- Hermes Agent: Local Models (desktop) - встроенный менеджер локальных моделей в десктопном приложении, память и контекст (получено 1 октября 2026 года, закреплённая версия коммита 357f51c).
Новые материалы - дайджестом, без спама
Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

