Июль 2026, типичный сценарий: GigaChat 3.5 Ultra выложен под MIT, GGUF-репозиторий на Hugging Face открыт, квант Q4_K_M ждёт. Энтузиаст ставит файл на закачку - и только потом считает память. Под веса нужно около 240 гигабайт VRAM. У него - карта на 24. Тот же сценарий повторяется с GLM-5.2 и повторится с Kimi K3, чьи веса обещаны к 27 июля.
Считать надо до закачки. Ниже - цифры по трём флагманам июля на 19 июля 2026: сколько памяти ест каждый в 4 битах, почему «28 миллиардов активных параметров» не значит «влезет в 28 гигабайт» и что вообще поднимается на бытовом железе.
Собирать железо под флагмана - проект со сметой на серверный стенд. Проверить саму модель - задача на вечер: на provod.ai (российский OpenRouter) июльские модели доступны через единый API по ценам официальных провайдеров, без наценки, с оплатой в рублях. provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT и остальные июльские флагманы - в одном чате и через единый OpenAI- и Anthropic-совместимый API, без VPN и зарубежных карт. А теперь арифметика.
Что значит «в 4 бита» - и почему это не ровно четыре?
Коротко: ходовой квант Q4_K_M кладёт на вес в среднем 4,85 бита, а не 4 - так устроены K-кванты llama.cpp, цифра прямо указана в карточках Ollama. Прикидка «параметры подели надвое» занижает объём на 17%.
Внутри GGUF веса пакуются блоками: часть тензоров остаётся в 6-8 битах ради точности, остальные режутся жёстче - в среднем выходят те самые 4,85 бита на вес. У соседних квантов свои коэффициенты: Q5_K_M - 5,65, Q8_0 - 8,5. Отсюда формула весов: параметры × бит-на-вес ÷ 8 = гигабайты. Дальше она встретится в каждом разделе.
Как посчитать VRAM для любой модели самому?
Коротко: VRAM = веса (параметры × байт-на-вес) плюс KV-кэш (2 × контекст × слои × head_dim × головы × байт-на-элемент). На коротком чате кэш - мелочь, на контексте в миллион токенов - сотни гигабайт.
Проверка на живом примере. GigaChat 3.5 Ultra, 432 миллиарда параметров: 432 × 4,85 ÷ 8 ≈ 262 ГБ (~244 ГиБ). Официальная оценка под 4-бит GGUF - 220-250 ГБ, сходится. Kimi K3, 2,8 триллиона: 2800 × 4,85 ÷ 8 ≈ 1698 ГБ - это 1,6-1,7 ТБ только на веса.
С кэшем вендоры борются по-разному: GigaChat 3.5 уменьшил его на токен в 4 раза против 3.1 Ultra (700 миллиардов параметров) за счёт гибридного внимания MLA + GatedDeltaNet. А у GLM-5.2 и Kimi K3 контекст в миллион токенов - и кэш превращается из сноски в отдельную строку сметы.
Сводная таблица по состоянию на 19 июля 2026 - по карточкам Hugging Face и докам Unsloth:
| Модель | Параметры: всего / активных | Память под веса, 4 бита | Минимальное железо | Скорость-ориентир |
|---|---|---|---|---|
| GigaChat 3.5 Ultra | 432B / 28B | ~220-250 ГБ | 8×H100 | 58,4 ток/с, с MTP-2 - 84,0 (замеры из карточки) |
| GLM-5.2 | 744B / ~40B | 372-475 ГБ | 8×H200-класса; 2-бит - Mac на 256 ГБ | 3-6 ток/с на 4×RTX 3090 (2-бит) |
| Kimi K3 | 2,8T / 16 из 896 экспертов на токен | ~1,6-1,7 ТБ (расчёт) | веса выходят 27 июля | пока только API: $3/$15 за 1M токенов |
Строка Kimi K3 - прикидка по формуле, а не официальная цифра: GGUF для K3 на 19 июля не существует.
Сколько памяти просит GigaChat 3.5 Ultra?
Коротко: под 4-бит квант - 220-250 ГБ. Полные версии тяжелее: FP8 - ~432 ГБ и восемь карт H100 или H200, bf16 - ~865 ГБ и уже мультинода.
Модель Сбера выложили около 6 июля под MIT, GGUF появился в тот же день: Q4_K_M, Q6_K, Q8_0 и bf16 в репозитории ai-sage/GigaChat3.5-432B-A28B-GGUF. Нюанс: поддержка архитектуры в llama.cpp живёт в pull request #25342 и на 19 июля в master не влита - рантайм придётся собирать из ветки. В карточке запуск описан через vLLM и SGLang; в гайдах вокруг релиза фигурирует связка vLLM на CUDA 12.8.
Из официальных замеров карточки: на 8×H100 модель декодирует 58,4 токена в секунду, со спекулятивным MTP-2 - 84,0; на чистом CPU (Xeon 8462Y+, 64 потока) - 7,7-9,6: диалог получается, но с паузами. Против 3.1 Ultra новая модель на 40% компактнее, throughput выше на 20%, MTP разгоняет greedy-декод до 2,2 раза. Это заявления вендора: независимых замеров на бытовом железе нет - железа нужного класса в быту не существует.
Сколько нужно GLM-5.2 - и при чём тут Mac на 256 гигабайт?
Коротко: 4-бит версия просит 372-475 ГБ памяти и ~400 ГБ диска - так написано в доках Unsloth. 2-бит UD-IQ2_M ужимается до ~245 ГБ и влезает в Mac на 256 ГБ unified memory. Влезает - не значит работает: на 4×RTX 3090 двухбитный GLM выдаёт 3-6 токенов в секунду.
GLM-5.2 от Z.ai вышла 13 июня: 744 миллиарда параметров всего, около 40 активных, контекст в миллион токенов, лицензия MIT. Unsloth выпустил Dynamic GGUF с квантами от 1 до 8 бит; полная модель в BF16 - 33 шарда и примерно 1,51 ТБ.
Три-шесть токенов в секунду - темп чтения вслух: для эксперимента сойдёт, для прода нет, пользователь уйдёт раньше конца первого абзаца. В FP8 модель просит около 744 ГБ VRAM - восемь H200.
Что с Kimi K3 - самым тяжёлым открытым весом июля?
Коротко: 2,8 триллиона параметров - крупнейшая open-weight модель на дату выхода, 16 июля. Веса обещаны к 27 июля под Modified MIT. Под 4 бита, по прикидке формулой, уйдёт 1,6-1,7 ТБ - и это только веса, без кэша.
K3 - смесь экспертов: на каждый токен активируются 16 из 896. Контекст - миллион токенов, есть нативное зрение, а связка Kimi Delta Attention и Attention Residuals, по заявлению Moonshot, ускоряет декодирование до 6,3 раза. В рейтинге Artificial Analysis модель набрала Intelligence Index 57 и встала на 4-е место из 189 - впереди Claude Opus 4.8 и GPT-5.5 (данные на 17 июля).
Повторю: 1,6-1,7 ТБ - расчёт по формуле, а не цифра из карточки; официальных квантов и требований к памяти на 19 июля нет. Зато уже работает API: $3 за миллион входных, $15 за миллион выходных токенов, $0,30 за кэшированный вход, эндпоинт OpenAI-совместимый.
Почему «активных 28B» не значит «влезет в 28 ГБ»?
Коротко: MoE гоняет на токен часть экспертов, но хранить в памяти обязана всех: у GigaChat - все 432 миллиарда, у GLM - 744, у Kimi K3 - 2,8 триллиона. «Активные 28B» - про вычисления, не про хранение.
Это самая частая ошибка в чатах про локальные модели. Человек видит в карточке «28B active» и мысленно делит надвое: «14 гигов, влезет». Не влезет. Пока модель отвечает, все 432 миллиарда весов лежат в VRAM целиком - механизм выбора экспертов лишь решает, к каким из них обратиться.
Что тогда влезает в бытовую карту?
Коротко: класс 9B-24B. 24B в Q4_K_M - ~14,6 ГБ весов, с запасом под контекст комфортно в 16-24 ГБ. Класс 70B - 40-48 ГБ: пара RTX 3090 или 4090 либо Mac Studio от 64 ГБ.
Живой спрос подтверждает: массово ищут «mistral small 3 2 24b instruct 2506 gguf» и «flux 2 klein 9b q8 0 gguf». Квантуют и картиночные модели - «qwen image 2512 gguf» из той же серии: GGUF давно вышел за пределы текстовых LLM.
| Железо | Память | Что реально поднимает |
|---|---|---|
| GeForce RTX 3060 | 12 ГБ | модели класса 9B в Q8 |
| GeForce RTX 3090 / 4090 | 24 ГБ | класс 24B в Q4_K_M с запасом на контекст |
| 2×24 ГБ или Mac Studio 64+ | 48-64 ГБ | 70B в Q4_K_M |
| RTX PRO 6000 | 96 ГБ | всё ещё в 2,5 раза мало для GigaChat 3.5 |
Запросы вида «2060 какая есть видеокарта», «модификация rtx 3070 ti» или просто «ртх» и «gtx» сводятся к одному: сколько памяти на борту и что в неё поместится по формуле. Старые GTX и карты класса RTX 2060 или 3070 ещё тянут модели до 9B-13B, но к июльским флагманам отношения не имеют.
Флагман не влез - что делать сегодня вечером?
Коротко: сначала арифметика, потом закачка - пять шагов экономят сутки трафика и разочарование.
- Умножь полное число параметров модели на 4,85 и подели на 8 - это веса в гигабайтах для Q4_K_M.
- Прикинь KV-кэш под рабочий контекст; на сотнях тысяч токенов закладывай ещё десятки и сотни гигабайт.
- Сверь сумму с памятью своей карты или Mac. Число больше - дальше не иди.
- Проверь поддержку в рантайме: для GigaChat 3.5 в llama.cpp есть только PR #25342, в master на 19 июля её нет - понадобится сборка из ветки.
- Не сошлось - не геройствуй. Оверклок и своп на NVMe сотни гигабайт VRAM не заменят.
И про короткий путь: Kimi K3 до выхода весов существует только как API, и из России к нему есть доступ без зарубежной карты. На provod.ai июльские модели живут через единый OpenAI-совместимый API: один ключ на задачи от чата до кода - оплата в рублях картой РФ, СБП или по счёту, по ценам официальных провайдеров без наценки. Проверить тезис из таблицы на живой модели - пять минут, дешевле ошибки в смете на стенд.
Чего GGUF в 4 бита не решает?
Коротко: квант решает задачу «запустить». Он не решает задачу «запустить у себя, быстро и дёшево» - а именно её обычно имеют в виду.
Первое - цена железа и скорость вне GPU. 240 ГБ видеопамяти - это серверный стенд или аренда, а не апгрейд домашней машины. А если выгнать модель на чистый CPU, GigaChat на 64 потоках Xeon даёт 7,7-9,6 токена в секунду: жить можно, продавать - нет.
Второе - поддержка свежих релизов и качество на пределах. GGUF для Kimi K3 на 19 июля не существует, поддержка GigaChat в llama.cpp ещё не в master: день-ноль у open-source всегда означает ручную сборку. А на длинных контекстах и строгих JSON-схемах дешёвые кванты проседают заметнее, чем в коротком чате - оценка автора по механике квантования, проверяй на своих задачах.
Когда provod.ai не подходит
Коротко: есть сценарии, где агрегатор мимо, и я назову их прямо.
Если по требованиям безопасности веса обязаны лежать внутри периметра - медицина, банк, госконтур - вопрос закрыт: нужен свой стенд, и эта статья помогла посчитать его размер. Если задача - fine-tuning или дообучение, нужны сами веса и свои GPU-часы; API этого не даст. Если поток переваливает за сотни миллионов токенов в месяц, своё железо по расчётам экономики GPU начинает отбиваться - а до этой отметки API дешевле на порядки. Фирменные подписочные фичи - приложения, память, проекты - живут только у самих вендоров.
Словарик запросов кластера
Коротко: поисковый кластер, рядом с которым живёт эта тема, собран вокруг слова «открыть» - поэтому выдача рядом с GGUF выглядит сюрреалистично.
Про открытки. Люди ищут «открытку с днём рождения» для мама, бабушки и папа (так и пишут, с опечатками вроде «открытк»), «поздравительную открытку с пожеланиями к юбилеем», пригласительных, варианты для дочь и дочки, для внучки и тетя, женщине и именинника. С картинками: букет, пионы, ретро, винтажной стилистики, эстетика ссср, новогодняя и весенние, анимационные, с объемными элементами и желтыми тонами, именную, что-нибудь для молодежи. Это генерация картинок, к локальным моделям отношения нет.
Про файлы. Вторая очередь - «чем открыть»: djvu, dwg, dxf, heic, webp, ipynb, vcf, nsp, nwd, mdf, p7s, odg, sldprt, m3d, gpx, xapk, sig, рар и ехе (да, кириллицей). GGUF - из той же серии «файл непонятного вида», ответ простой: llama.cpp, Ollama или LM Studio.
Про смешанный шум. Дальше кластер рассыпается на три бытовые группы и хвост абракадабры. Мобильное: спрашивают, как включить gemini на honor и на галакси, ищут приложения tecno и ipad. Программы и сервисы: safari и pages, pinterest, steam и games, шутеры, adult, med, dictionary, generators, sms. Быт и платежи: пэй, втб, домофон, мята, бин, интерсвязь, самозанятость, плюс свернутые окна, принудительно, разъемы и ученые без явной темы. И наконец чистый шум: ax, ckdcgs, plague, uncesories, vpngate, zapretgithub, ирт, сфс. Всё это прилетело в кластер из-за леммы «открыть», а не из-за нейросетей.
А вот это уже по теме. «qwythos 9b claude mythos 5 1m gguf» - охота за экзотическим комьюнити-квантом. «city96 flux 1 dev gguf» - city96 известный автор квантов Flux. «llama 3 8b lexi uncensored gguf» - lexi-сборки. «deepsee локально» - опечатка DeepSeek, а «powershell как открыть» обычно означает запуск llama.cpp на Windows из PowerShell.
provod.ai — российский AI API-роутер для личных и корпоративных сценариев
Один API и веб-интерфейс объединяют привычную AI-экосистему: от первого запроса в чате до агентных систем, мультимедиа и production-интеграций для бизнеса.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Ценовая основа платформы — официальный тариф без собственной маржи: 1:1 с провайдером, оплата в рублях, единый баланс и документы для бизнеса. Это один из самых прямых и доступных способов оплачивать мировой AI-каталог из России.
Подключитесь к provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai
Частые вопросы
Коротко: чем открыть GGUF, хватит ли четырёх 4090 на GigaChat, когда ждать веса Kimi K3 и где точка, в которой своё железо начинает бить API.
Чем открыть файл GGUF?
Рантаймом llama.cpp, обёртками Ollama или LM Studio. Для GigaChat 3.5 Ultra на 19 июля нужна сборка из PR #25342 - релизная версия архитектуру не знает.
Влезет ли GigaChat 3.5 Ultra в 4×RTX 4090?
Нет. Четыре карты по 24 ГБ дают 96 ГБ против нужных ~240. Даже RTX PRO 6000 с 96 ГБ не закрывает и половины.
Когда выйдут веса Kimi K3 и сколько памяти понадобится?
Moonshot обещает к 27 июля 2026 под лицензией Modified MIT. Под 4 бита, по расчёту формулой, - 1,6-1,7 ТБ только на веса; официальных квантов и требований пока нет.
Почему 2-бит GLM-5.2 запускается на Mac с 256 ГБ, но для прода это плохая идея?
245 ГБ помещается в память, но скорость - 3-6 токенов в секунду даже на 4×RTX 3090. Это темп диктовки, а не сервиса.
Что дешевле: собрать 8×H100 под Q4_K_M или платить за API?
По расчёту из разбора экономики своей GPU (ссылка в источниках) точка перевеса - поток в сотни миллионов токенов в месяц. Ниже неё API дешевле на порядки: счёт за Kimi K3 - $3/$15 за миллион входных и выходных токенов, а стенд из восьми H100 обслуживает одну модель и одного тебя.
Источники
Коротко: первоисточники, по которым сверено каждое число в тексте.
- «Экономика своей GPU для нейросетей», provod.AI на vc.ru, данные на 10.07.2026: https://vc.ru/provod/3029738-ekonomika-svoey-gpu-dlya-neyrosetey
- Карточка ai-sage/GigaChat3.5-432B-A28B, Hugging Face: https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B
- GGUF-репозиторий ai-sage/GigaChat3.5-432B-A28B-GGUF: https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B-GGUF
- AINews, выпуски 6-7.07.2026: https://news.smol.ai/issues/26-07-06-not-much/
- Репозиторий unsloth/GLM-5.2-GGUF: https://huggingface.co/unsloth/GLM-5.2-GGUF
- Developers Digest, таблица памяти по квантам из доки Unsloth, 23.06.2026: https://www.developersdigest.tech/blog/glm-5-2-local-deployment-unsloth-quantization
- Spheron, деплой GLM-5.2, 17.06.2026: https://www.spheron.network/blog/deploy-glm-5-2-gpu-cloud/
- Pure AI о Kimi K3 и рейтинге Artificial Analysis, 17.07.2026: https://pureai.com/articles/2026/07/17/china-moonshot-ai-releases-kimi-k3.aspx
- TheAIDude и LinkLoot о ценах API и дате весов K3, 16-17.07.2026: https://theaidude.net/blog/kimi-k3-moonshots-28t-open-model-launches
- Winzheng о архитектуре K3, 19.07.2026: https://www.winzheng.com/en/article/moonshot-ai-kimi-k3-2-8-trillion-open-model
- SitePoint о квантовании и формуле VRAM, 13.03.2026: https://www.sitepoint.com/quantization-explained-q4km-vs-awq-vs-fp16-for-local-llms/
- Карточки Ollama с указанием «Q4_K_M (4.85 bits per weight)»: https://ollama.com/richardyoung/qwen3-14b-abliterated
- Анонс GigaChat 3.5 Ultra на vc.ru, 15.07.2026: https://vc.ru/ai/3027960-gigachat-3-5-ultra-ot-sbera
- OpenSource AINews, гайд по квантованию в GGUF, 11.02.2026: https://opensourceainews.com/quantizing-llms-step-by-step-fp16-to-gguf-conversion-guide/
Июль 2026 расставил всё по местам жестоко и просто: «открытые веса» теперь значат «можно посмотреть и посчитать», а не «можно запустить дома». Формула из второго раздела честнее любого пресс-релиза - перемножь параметры на бит-на-вес, и решение за тебя примет арифметика.
Дальше выбор с ценой: дождаться 27 июля, собрать кворум из восьми карт и держать Kimi K3 дома - со счётом за стенд, питание и охлаждение. Или проверить ту же модель через API сегодня и потратить меньше, чем на доставку еды. У обоих решений есть сторонники, и у обоих - счёт.
Проверь флагмана раньше выхода его весов: на provod.ai все июльские модели - в одном чате и через единый OpenAI-совместимый API, оплата в рублях с карты РФ или по счёту, для юрлиц - договор и закрывающие. Без VPN и без наценки: официальный тариф, только в рублях.
А ты как считаешь: домашняя ферма на двух картах со своими 70B - ещё здравый смысл или уже хобби ради хобби? Где твоя точка перевеса между своим железом и API - напиши в комментариях.


Top comments (0)