Сравнивать DeepSeek и Ollama как два разных продукта бессмысленно: внутри обоих работает одна и та же модель — DeepSeek-V4-Pro. Разница в том, за что вы платите. У DeepSeek вы оплачиваете только токены по факту. У Ollama — подписку за 20 долларов, внутри которой 60 долларов расхода. И есть деталь, которую обычно замечают в последнюю очередь: время суток, когда запускаются задачи.
За токен берут одинаково, но с оговорками
Прайс на модель у обоих поставщиков совпадает до долей цента. За миллион токенов:
- вход при попадании в кэш: DeepSeek — $0,003 вне пика, Ollama — $0,022;
- вход при промахе кэша: $0,15 против $0,66;
- выход: $0,60 против $1,98;
- подписка: у DeepSeek её нет, у Ollama — $20 в месяц, включая $60 расхода.
Обе цифры — базовые ставки, без пиковых коэффициентов. И здесь DeepSeek вне пика берёт ровно в два раза меньше Ollama. Главное слово — «вне пика». У DeepSeek удвоенный тариф действует в окна 01:00–04:00 и 06:00–10:00 UTC по будням, всё остальное — включая выходные — считается по половине. У Ollama пик наступает в 12:00–18:00 UTC по будням.
Какую часть счёта делает кэш
Цена за миллион токенов мало что говорит, если не разобраться, каких токенов в работе больше. Агент, который долго трудится над одним репозиторием, почти всё время читает кэш: инструкции, историю шагов, файлы, которые модель видит в каждом новом вызове. Свежего текста на входе немного, и он целиком уходит в промахи кэша.
Я взял журнал своих сеансов: на 75 миллионов прочитанных токенов пришлось около 250 тысяч новых. Кэш покрывает 99,7% входа. Четырёхкратная разница в цене кэша бьёт по счёту заметнее, чем любая надбавка на выходе.
Расписание решает больше, чем прайс
Переведу окна в московское время. Пик DeepSeek — с четырёх до семи утра и с девяти до часа дня. Пик Ollama — с трёх до девяти вечера. И это важно: вечер — как раз то время, когда за такую работу садятся. Рабочий день у сервера уже закончился, а у вас — только начался.
Выходит, что в самые активные часы по Москве один и тот же запрос у Ollama стоит вчетверо дороже на кэше, вдвое — на несбитом кэше и вдвое — на выходе. Модель ни при чём: проигрывает расписание.
Харнесс сам ведёт учёт по каждому сеансу: прочитанный кэш, новые входные токены, выход. Умножаете на тариф нужного окна — и правило видно сразу. Длинные автономные задачи, где агент подолгу крутит один контекст, дешевле запускать не когда вам удобно, а когда маршруту дёшево. За месяц разница в расписании набегает на ещё одну подписку.
Считать надо сеанс, а не токен
Куда полезнее смотреть не на цену миллиона токенов, а на стоимость одного сеанса харнесса. Возьму реальные цифры из журнала запусков: за один сеанс агент прочитал из кэша 75 миллионов токенов, добавил 250 тысяч новых на входе и выдал 250 тысяч на выходе.
DeepSeek вне пика: 75x0,003 + 0,25x0,15 + 0,25x0,60 = $1,01
Ollama в пик: 75x0,022 + 0,25x0,66 + 0,25x1,98 = $2,43
Два доллара сорок три против одного — при той же работе и той же модели. За сорок вечерних сеансов в месяц разница составит около 57 долларов. Подписка Ollama не спасает: она просто упаковывает расход — 60 долларов включённого использования внутри 20 долларов платы.
Что ещё даёт подписка
Подписка Ollama — это не одна модель. В тот же счёт входят Kimi, GLM, Qwen, Mistral, и расход по ним идёт из общего пула. Если харнессу нужны разные модели под разные задачи, один счёт удобнее пяти отдельных. У DeepSeek в прайсе одна семья моделей, зато никаких подписок и обязательств.
Лимиты тоже отличаются. У Ollama на Pro — три одновременных запроса, дальше они встают в очередь, а при переполнении их могут отклонить. У DeepSeek на V4-Pro заявлено 500 одновременных обращений, на Flash — 2500. Одиночному агенту это незаметно, конвейеру из субагентов — критично.
Как это встаёт в харнесс
DeepSeek цепляется родным маршрутом deepseek-official: усилия рассуждения, режим мышления, распознавание картинок у Flash и сжатие контекста включаются из коробки. Ollama подключается вторым провайдером через pi-ai — интерфейс, совместимый с OpenAI. Идентификатор модели прописывается в настройках руками, а набор возможностей ограничен тем, что отдаёт площадка.
Проверил на своём конфиге: маршрут ollama-cloud собран, ключ на месте, но модели DeepSeek на текущем плане отвечают отказом 402 — до оплаты подписки работают только gpt-oss, gemma и nemotron. Это важно для сравнения: подписку включают до начала расчётов, иначе мерить нечего.
Вывод
Когда сеансы идут днём и вечером по Москве, прямая оплата у DeepSeek дешевле — иногда в разы, потому что пик Ollama бьёт точно в рабочие часы. Подписка Ollama выигрывает в другом: десяток открытых моделей на одном счёте и предсказуемая плата за месяц. Сравнивать нужно не прайсы, а собственное расписание — в этом споре оно весит больше цены токена.
Разложу по ситуациям:
- один агент, работа по московскому дню и вечеру — прямая оплата DeepSeek;
- конвейер из субагентов — DeepSeek: у Ollama на Pro три одновременных обращения;
- несколько открытых моделей в одном счёте — подписка Ollama;
- жёсткий потолок расходов в месяц — подписка: 20 долларов платы и 60 включённого расхода;
- ночные и выходные прогоны — DeepSeek вне пика.
Оба маршрута спокойно живут в харнессе рядом: родной deepseek-official и второй провайдер через совместимый интерфейс. Держать оба и переключаться по часам — не хитрость, а обычная калькуляция: маршрут выбирают не по вкусу, а по расписанию.
Полная версия: https://habr.com/ru/articles/1084484/
Текст подготовлен с использованием искусственного интеллекта.


Top comments (0)