DeepSeek напрямую или через подписку Ollama: что выгоднее харнессу
Одна и та же модель, один и тот же агент — разные маршруты и разные часы. Считаю на прайсе и на настоящих сеансах харнесса.

Разобраться, что дешевле — DeepSeek или Ollama, напрямую не выйдет. В обоих случаях работает одна модель, DeepSeek-V4-Pro, а деньги берут за разное. DeepSeek считает чистый расход по токенам, Ollama продаёт подписку за 20 долларов, из которых 60 долларов покрывают токены. И решает ещё одна вещь, о которой вспоминают в конце: время суток, когда работает харнесс.
Прайс одинаковый, но не совсем
Базовые ставки за миллион токенов у обоих совпадают до копейки:
- вход, кэш попал: $0,003 у DeepSeek вне пика, $0,022 у Ollama;
- вход, кэш промахнулся: $0,15 против $0,66;
- выход: $0,60 против $1,98;
- подписка: у DeepSeek нет, у Ollama $20 в месяц, включая $60 расхода.
Это внепиковые цены. Вне пика DeepSeek берёт вдвое меньше, чем Ollama. Но слово «вне пика» — ключевое: у DeepSeek двойной тариф действует в будни с 01:00 до 04:00 и с 06:00 до 10:00 UTC, остальное время, включая выходные, считается за половину. У Ollama пиковые часы — будни с 12:00 до 18:00 UTC.
Кэш решает, сколько вы платите
Цена за миллион токенов не ответит на главный вопрос: каких токенов в счёте больше. Харнесс, который подолгу работает в одном репозитории, почти весь вход читает из кэша — это инструкции, история шагов, файлы, которые модель видит при каждом вызове. Свежего текста в запросе немного, и он попадает в промахи кэша.

Смотрю журнал своих сеансов: 75 миллионов прочитанных токенов против 250 тысяч новых. Кэш — 99,7% входа, а разница на кэше в четыре раза бьёт по счёту сильнее, чем на выходе.
Расписание важнее тарифов
Переведём пиковые окна в московское время. У DeepSeek пик — с четырёх до семи утра и с девяти до часа дня. У Ollama — с трёх до девяти вечера. И это важно: вечер — как раз то время, когда за работу садятся, а рабочий день сервера уже закончился.
В итоге в самые рабочие часы по Москве одинаковый запрос у Ollama стоит вчетверо дороже на кэше, вдвое на промахах и вдвое на выходе. Модель тут ни при чём — виновато расписание.
Харнесс сам считает расход по сеансу: кэш, новые входные, выходные токены. Умножаем на прайс нужного окна — и правило проявляется: длинные автономные задания, где агент долго крутит один контекст, выгоднее запускать не тогда, когда удобно вам, а когда дёшево маршруту. За месяц разница на расписании набегает на ещё одну подписку.
Считаем не токены, а сеанс
Полезнее считать не миллион токенов, а один рабочий сеанс харнесса. Возьму реальные цифры из своих запусков: за сеанс агент прочитал 75 миллионов токенов из кэша, добавил 250 тысяч новых на входе и выдал 250 тысяч на выходе.
DeepSeek вне пика: 75×0,003 + 0,25×0,15 + 0,25×0,60 = $1,01 Ollama в пик: 75×0,022 + 0,25×0,66 + 0,25×1,98 = $2,43
Два сорок три против одного — та же модель, та же работа. Сорок вечерних сеансов в месяц дают разницу около 57 долларов. Подписка Ollama это не убирает, а упаковывает: 60 долларов включённого расхода входят в 20 долларов платы.
Что ещё прячется в подписке
Подписка Ollama — это не только DeepSeek. В тот же счёт входят Kimi, GLM, Qwen, Mistral, и расход по ним списывается из общего пула. Если харнессу нужны разные модели под разные задачи, один счёт удобнее пяти. У DeepSeek в прайсе одна семья моделей, зато нет ни подписки, ни обязательств.
Ограничения тоже отличаются. На плане Pro у Ollama три одновременных запроса, дальше — очередь, которая может отказать. У DeepSeek на V4-Pro заявлено 500 одновременных обращений, на Flash — 2500. Для одного агента это не видно, для конвейера из субагентов — критично.
Как харнесс подключается к каждому из них
DeepSeek встаёт в харнесс родным маршрутом deepseek-official: усилия рассуждения, режим мышления, распознавание картинок у Flash и сжатие контекста работают сразу. Ollama подключается вторым провайдером через pi-ai — совместимый с OpenAI интерфейс. Чтобы модель появилась в выборе, её идентификатор прописывают в настройках руками, а возможности ограничены тем, что отдаёт площадка.
Проверял на своём конфиге: маршрут ollama-cloud собран, ключ стоит, но модели DeepSeek на текущем плане отвечают отказом 402 — до оплаты подписки доступны только gpt-oss, gemma и nemotron. Это важно: подписку включают до того, как начинают считать, иначе мерить нечего.
Что выбрать
Если сеансы идут по московскому дню и вечеру, прямая оплата DeepSeek дешевле — иногда в разы, потому что двойной тариф Ollama ложится ровно на рабочие часы. Подписка Ollama выигрывает в другом: один счёт на десяток открытых моделей и понятная плата за месяц. Сравнивать надо не прайс, а расписание — оно здесь весит больше, чем цена токена.
По случаям:
- один агент днём и вечером по Москве — прямая оплата DeepSeek;
- конвейер из субагентов — DeepSeek: на Pro у Ollama всего три одновременных обращения;
- несколько открытых моделей в одном счёте — подписка Ollama;
- твёрдый месячный потолок расходов — подписка: 20 долларов платы и 60 включённых;
- ночные и выходные прогоны — DeepSeek вне пика.
Оба маршрута живут в харнессе рядом: родной deepseek-official и второй провайдер через совместимый интерфейс. Держать оба и переключаться по часам — не хитрость, а обычная экономика: маршрут выбирают по расписанию, а не по вкусу.
Полная версия: https://habr.com/ru/articles/1084484/





Комментарии