Hermes Agent с локальной моделью: как подключить Ollama и не упереться в контекст

Опубликовано 07.10.202610 мин чтенияБазовый
Артемий Миллер рядом с логотипами Hermes Agent и Ollama, ниже надпись «РАБОТАЕТ БЕЗ КЛЮЧА».
Что узнаешь
  • Какая локальная модель умеет выполнять действия в Hermes, а какая будет только отвечать текстом
  • Как подключить Ollama к Hermes без API-ключа и поднять контекст до 64 000 токенов
  • Как проверить, что всё работает, и что делать, если агент молчит или отказывается подключаться
Базовый
3просмотров

В Telegram-канале СмыслоКода можно следить за новыми материалами об ИИ-агентах, которые работают за тебя.

Здесь продолжаем с того места, где агент уже установлен, и меняем облачную модель на свою. Если Hermes у тебя ещё не стоит, начни с разбора что такое Hermes Agent и как его установить.

Зачем агенту локальная модель и чем за это платишь

Локальная модель работает прямо на твоём компьютере или сервере. Не нужен ни аккаунт, ни API-ключ, токены облачного провайдера не оплачиваются, и, пока ты не подключил облачного запасного провайдера (о нём в конце), переписка не уходит с твоей машины. Про десктопный вариант документация так и пишет: после загрузки модели не нужны ни аккаунт, ни ключ, ни доступ в сеть.

Платишь железом и скоростью. Hermes не просто болтает, он правит файлы, запускает команды и ходит в браузер, а всё это работает через вызов инструментов. В документации прямо сказано: модель без поддержки вызова инструментов может только разговаривать, действий она выполнять не будет. Поэтому первым делом смотри не на «самую умную модель», а на то, умеет ли она вызывать инструменты и влезает ли в твою память.

Минимальные и рекомендуемые требования из официального гайда:

ЧтоМинимумРекомендуется
Оперативная память8 ГБ (для моделей 3B)32+ ГБ (для моделей 27B+)
Место на диске5 ГБ30+ ГБ (если моделей несколько)
Процессор4 ядра8+ ядер
ВидеокартаНе обязательнаNVIDIA с 8+ ГБ видеопамяти заметно ускоряет работу

Без видеокарты тоже работает, но медленно. По документации модель на 9B на современном восьмиядерном процессоре даёт около 10 токенов в секунду, а на 31B выходит 2-5 токенов в секунду, и каждый ответ занимает 30-120 секунд.

Шаг 1. Поставь Ollama и проверь, что она запущена

Ollama - это программа, которая скачивает модели и отдаёт их другим программам по локальному адресу. Шаги 1-4 ниже идут по официальному гайду Hermes для ручной установки через терминал. Для Mac у Hermes есть отдельный гайд Run Local LLMs on Mac с другим инструментом, llama.cpp, а на любой системе с десктопным приложением проще путь из раздела про Local Models ниже. Поставь Ollama одной командой:

bash
curl -fsSL https://ollama.com/install.sh | sh

Проверь, что она отвечает:

bash
ollama --version
curl localhost:11434/api/tags

Первая команда показывает, что программа установлена. Вторая проверяет уже сам сервер Ollama: если он запущен, а моделей ещё нет, она вернёт пустой список {"models":[]}. По этому же адресу, порт 11434, Hermes и будет обращаться к Ollama.

Шаг 2. Скачай модель, которая умеет вызывать инструменты

Вот таблица моделей из документации Hermes. Главная колонка - «Вызов инструментов»:

МодельМесто на дискеНужно памятиВызов инструментовДля чего
gemma4:31b~20 ГБ24+ ГБДаЛучшее качество, работает с инструментами
gemma2:27b~16 ГБ20+ ГБНетРазговор, без действий
gemma2:9b~5 ГБ8+ ГБНетБыстрые ответы, инструменты вызывать не умеет
llama3.2:3b~2 ГБ4+ ГБНетТолько короткие ответы

Из этих четырёх надёжно вызывает инструменты только gemma4:31b. Если памяти меньше 24 ГБ, вывод такой: ни одна модель из этой таблицы не потянет роль агента на твоей машине, получится только обычный чат. Документация советует следить за библиотекой моделей Ollama, потому что поддержка инструментов у моделей быстро расширяется. Но прежде чем подключать новую модель, проверь у неё поддержку вызова инструментов.

Скачай модель:

bash
ollama pull gemma4:31b

Моделей можно скачать несколько и переключаться между ними прямо в Hermes командой /model. Ollama сама загружает в память ту, что сейчас нужна, и выгружает простаивающие.

Подключение локальной модели - одна из задач, которые появляются, когда работаешь с ИИ-агентами. Если ты собираешь свои проекты с ИИ-агентами, посмотри программу практикума СмыслоКода.

Интенсив по Hermes-агентам
Собери свою компанию на ИИ-агентах
Три вечера: от метода одного агента до связки ролей в компании
Старт 6–8 октября  ·  2 000 ₽
Записаться на интенсив по Hermes-агентам →

Шаг 3. Подними контекст до 64 000 токенов

По умолчанию Ollama даёт модели контекст 2048 токенов, а Hermes для работы с инструментами нужно минимум 64 000. В разделе неполадок документация так и пишет: контекст Ollama по умолчанию слишком мал для работы агента, его нужно увеличить.

Документация решает это так: создать вариант модели с большим контекстом.

bash
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF

ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Теперь у тебя есть модель gemma4-64k. Дальше в настройках Hermes указывай именно это имя, а не исходное.

64 000 - это нижняя граница, а не точное значение: важно, чтобы контекст был не меньше 64 000 токенов.

Шаг 4. Подключи модель к Hermes

Запусти мастер настройки:

bash
hermes setup

Когда он спросит провайдера, выбери Custom Endpoint и введи:

  • адрес (Base URL): http://localhost:11434/v1 целиком, с http в начале перед ://. Это адрес Ollama на твоём компьютере с портом 11434 и путём /v1, ровно как в шаге 3 гайда;
  • ключ (API Key): оставь пустым или напиши no-key, Ollama ключ не нужен;
  • модель: gemma4-64k, то есть вариант с большим контекстом из шага 3.

Вместо мастера то же можно прописать вручную в ~/.hermes/config.yaml: в разделе model указываются default с именем модели, provider: "custom" и base_url с этим адресом. Готовый пример есть в шаге 3 гайда по Ollama, только имя модели замени на gemma4-64k.

После этого запускай hermes и давай задачу с проверяемым результатом. По документации пример такой: «List all Python files in this directory and count the lines of code in each» (перечисли все Python-файлы в этой папке и посчитай строки кода в каждом). Для такой задачи Hermes использует инструмент терминала и операции с файлами, а не просто пишет текст. Проверяй не формулировку ответа, а то, совпадает ли список файлов с тем, что реально лежит в папке: попроси Hermes создать тестовый файл и посмотри, появился ли он на диске (ls). Модель без поддержки инструментов может написать правдоподобный список, не открыв ни одного файла, и результат разойдётся с реальной папкой. Если файл не появился, агент работает просто как чат.

Как проверить, что всё работает

  1. ollama ps покажет, какая модель загружена и сколько её слоёв ушло на видеокарту. Если на видеокарту не ушло ничего, ответы считает процессор. На сервере без видеокарты это нормально, просто медленно. Если видеопамяти не хватает на всю модель, это тоже работает: по документации модель на 31B на видеокарте с 12 ГБ частично уходит на видеокарту (около 40 слоёв), остальное считает процессор, и это всё равно заметно быстрее.
  2. Первый ответ может прийти через несколько минут, это не зависание. Hermes в каждом запросе отправляет постоянную часть: системные инструкции и описание всех включённых инструментов. На процессоре модель сначала долго её переваривает, а потом пишет с обычной скоростью.
  3. Если хочешь ускорить первый ответ, урежь эту постоянную часть: hermes prompt-size покажет, сколько она весит, hermes tools отключит ненужные наборы инструментов, а hermes skills поможет удалить лишние навыки.

Если ты держишь агента на сервере круглосуточно или он отвечает в Телеграме, учти ещё одно: Ollama выгружает модель из памяти после пяти минут простоя, и следующий ответ снова начнётся с загрузки. В документации есть настройка, которая держит модель загруженной: на Linux-сервере с Ollama как системной службой это переменная OLLAMA_KEEP_ALIVE=24h в файле /etc/systemd/system/ollama.service.d/override.conf:

bash
# /etc/systemd/system/ollama.service.d/override.conf
[Service]
Environment="OLLAMA_KEEP_ALIVE=24h"

Как применить этот файл, гайд не пишет. Если ты не работал со службами systemd, не правь его наугад: сначала разберись, как они настраиваются на твоём сервере.

Как вынести агента на сервер, разобрано в статье про Hermes Agent на VPS круглосуточно, а про бота - в настройке Hermes в Телеграме.

Путь проще: Local Models в десктопном приложении

Если ты работаешь в десктопном Hermes, Ollama ставить не обязательно. В Settings → Providers → Local Models приложение само ставит и обслуживает локальный сервер llama.cpp: скачивает модели, прикидывает, хватит ли памяти, и подбирает контекст.

Порядок из документации:

  1. Открой Settings → Providers → Local Models или выбери Run models locally при первом запуске.
  2. Нажми Install runtime: Hermes скачает официальную сборку llama.cpp под твоё железо (несколько сотен мегабайт) и будет её обновлять.
  3. Выбери модель в каталоге и нажми Download.
  4. Нажми Use: новые чаты пойдут через локальную модель.

В разделе Local Models документация не говорит, какие модели каталога умеют вызывать инструменты. Поэтому после выбора модели проверь её так же, как в шаге 4: дай задачу с действием, например перечислить файлы в папке. Если агент только отвечает текстом и ничего не выполняет, выбери другую модель.

У каждой модели в каталоге есть цветная метка памяти: зелёная - целиком помещается в видеопамять, жёлтая - работает, но использует оперативную память и медленнее, красная - для этого компьютера слишком большая. Каждая рекомендованная модель получает контекст минимум 64K, так что шаг 3 здесь делать не нужно. Простаивающую модель приложение выгружает из видеопамяти через 15 минут и снова загружает со следующим сообщением. У Ollama из шагов выше этот срок свой, пять минут, не путай их. Видеокарта на 8+ ГБ спокойно тянет маленькие модели каталога, на 16+ ГБ - модели 27-35B.

Одна оговорка: по документации этот раздел включён в canary-сборках приложения, то есть в ранних тестовых версиях. В остальных сборках его нужно включать флагом запуска --local. Если ты не видишь Local Models в настройках, причина скорее всего в этом.

Если что-то не так

Что видишьПочемуЧто делать
«Connection refused» при запускеOllama не запущенаsudo systemctl start ollama или ollama serve
provider 'ollama' has no endpoint configuredЗапуск с --provider ollama, но адрес Ollama нигде не прописанУказать адрес в providers.ollama.base_url или model.base_url. Без адреса Hermes не отправит запрос в облако, даже если в настройках есть ключ OpenRouter или OpenAI
Агент отвечает, но ничего не делает с файламиМодель не умеет вызывать инструментыПерейти на модель с вызовом инструментов, например gemma4:31b, и снова сделать для неё вариант с контекстом 64 000 (шаг 3)
Ошибки, связанные с окном контекстаКонтекст Ollama по умолчанию 2048 токеновШаг 3: вариант модели с num_ctx 64000
Долгое молчание перед первым ответомМодель переваривает постоянную часть запросаПодождать; урезать инструменты и навыки
Медленно отвечаетМодели не хватает памяти, или ответы считает процессорСверить размер модели с памятью по таблице и добавить память. Модель меньше из таблицы ответит быстрее, но вызывать инструменты она не умеет: агент станет просто чатом
Запросы обрываются по таймауту на медленной модели без видеокартыОтвет считается дольше, чем ждёт HermesУвеличить таймаут HERMES_API_TIMEOUT=1800 в ~/.hermes/.env. Модель от этого быстрее не станет, но Hermes будет ждать ответ дольше и не оборвёт запрос
Тормозит длинная перепискаБольшой контекст тормозит модельРегулярно /compress

Запасной облачный провайдер на сложные задачи

Документация прямо перечисляет, где локальная модель проигрывает: очень сложные многошаговые рассуждения, длинный контекст (у облачных моделей от 100 тысяч до миллиона токенов) и скорость на больших ответах без видеокарты.

Поэтому можно оставить локальную модель основной, а облачную подключить запасной. Для этого в ~/.hermes/config.yaml добавляется блок из документации. Это отдельный раздел верхнего уровня, рядом с model, а не внутри него:

yaml
fallback_providers:
  - provider: openrouter
    model: anthropic/claude-sonnet-4

Раздел model с локальной моделью остаётся как был. По документации, если локальная модель не справляется три раза, Hermes переключается на облачного провайдера. Учти две вещи. По документации бесплатной остаётся только локальная часть, а сложные задачи уходят в платный API запасного провайдера. И запросы, которые ушли на запасного провайдера, уходят в облако, так что для них обещание «переписка не покидает машину» уже не работает.

Что сделать прямо сейчас

Если память позволяет (от 24 ГБ), начни с шага 1: поставь Ollama и скачай gemma4:31b. Если памяти меньше, но у тебя десктопный Hermes, открой Settings → Providers → Local Models и посмотри, какая модель каталога помечена зелёным для твоего железа. В обоих случаях первую проверку делай одинаково: дай агенту задачу с проверяемым результатом и сверь, что он реально сделал на диске, а не что написал в ответе.

Контекст-инжиниринг для агентов разбирают на практикуме СмыслоКода.

Источники

  • Hermes Agent: Running Local Models with Ollama - требования к железу, установка, таблица моделей, контекст, подключение, устранение неполадок, сравнение стоимости (получено 1 октября 2026 года, закреплённая версия коммита 357f51c).
  • Hermes Agent: Local Models (desktop) - встроенный менеджер локальных моделей в десктопном приложении, память и контекст (получено 1 октября 2026 года, закреплённая версия коммита 357f51c).
Интенсив по Hermes-агентам
Собери свою компанию на ИИ-агентах
Три вечера: от метода одного агента до связки ролей в компании
Старт 6–8 октября  ·  2 000 ₽
Записаться на интенсив по Hermes-агентам →

Новые материалы - дайджестом, без спама

Гайды выходят регулярно. Подпишись, чтобы не пропускать: пришлю подборку в Telegram или на email. Раз в неделю или каждый день - выбираешь сам.

Была инструкция полезна?
Артемий Миллер
Автор
Артемий Миллер
Предприниматель и вайб-кодер

Артемий Миллер - предприниматель и вайб-кодер. Бывший программист, собирает продукты исключительно вместе с ИИ-агентами, без найма разработчиков.

Как мы готовим материалы

Связанные инструкции

Профили Hermes: как разделить личного и рабочего агента

Настройка двух профилей Hermes с явным выбором при запуске. Проверяем разделение состояния и объясняем, почему профиль не ограничивает доступ к файлам компьютера.

6 мин

Dots в ChatGPT: что это, как создать своего агента и как им пользоваться

В ChatGPT появились dots - агенты, которые продолжают работу между разговорами. Разбираем по официальной документации, кому они доступны, как создать своего dot, поручить ему работу и настроить ограничения на отправку сообщений.

9 мин

Почему сайт в Claude Code выходит ИИшным и как это починить

Claude по умолчанию выдаёт узнаваемый ИИшный дизайн: фиолетовый градиент, одинаковые карточки. Разбираю, почему так и как скилл UI UX Pro Max даёт Claude вкус под конкретную нишу.

14 мин

Что даёт платная подписка Grok в 2026 и стоит ли платить

У Grok есть бесплатный вход и три платных тарифа, и разница между ними не в одной цифре. Разбираю, за что берут деньги, что открывает SuperGrok, кому нужен Plus за 100 долларов и что с оплатой из России.

12 мин

Связанные термины