6 июля 2026 года Сбер выложил GigaChat 3.5 Ultra в открытый доступ под лицензией MIT: веса лежат на Hugging Face в организации ai-sage, зеркало - на GitVerse. Та самая нейросеточка, которую в быту зовут «гигабот», стала примерно на 40% компактнее прошлого флагмана - и при этом, по данным самого Сбера, сильнее в коде, математике и агентных сценариях.
Главная новость - не размер, а память. Гибридная архитектура тратит примерно вчетверо меньше KV-кэша на токен, и в ту же видеопамять влезает в 2,14 раза больше контекста. Для бизнеса это переводится без формул: договоры и длинные переписки обрабатывать стало дешевле. Ниже - механика на пальцах, замеры с оговорками и все двери, через которые модель реально потрогать.
Попробовать «гигабота» можно бесплатно за минуту. Брать его в работу по пресс-релизу - плохая идея; правильный путь - прогнать свои пять запросов и сравнить с мировыми флагманами. Тот же тест против Claude или DeepSeek из России удобно делать через provod.ai (российский OpenRouter): один чат и единый API с оплатой в рублях.
Что такое «гигабот» и где его искать?
Коротко: «гигабот» - народное имя ассистента ГигаЧат от Сбера. Это Telegram- и VK-боты, веб на giga.chat и мобильные приложения. Вход через SberID, денег не просят; именно тут, по состоянию на середину июля 2026, и живёт свежая версия 3.5 Ultra.
Путаница в терминах тут у всех. Бот - интерфейс, окошко в чате. За окошком стоит языковая модель, и 6 июля её подменили на новую: пользователь ничего не настраивал, ответы просто стали другими.
Важная развилка - API. На developers.sber.ru, по данным на июль 2026, модель 3.5 Ultra ещё не выдана: там действуют тарифы прошлой линейки GigaChat 2 (Lite 65 ₽ за миллион токенов, Pro 500 ₽, Max 650 ₽, апдейт февраля 2026; миллион токенов в год - бесплатно, нужен сертификат НУЦ Минцифры). «Поговорил с гигаботом» и «подключил GigaChat к продукту» сегодня - две разные истории.
Чем GigaChat 3.5 Ultra отличается от прошлого флагмана?
Коротко: 432 млрд общих параметров вместо 700 млрд у 3.1 Ultra, активных - 28 млрд, это MoE (репозиторий GigaChat3.5-432B-A28B). Модель меньше, но на замерах Сбера сильнее. Лицензия - MIT, и это первая модель линейки, где гибридную архитектуру масштабировали на сотни миллиардов параметров после 1500+ экспериментов.
| Что сравниваем | Было | Стало (3.5 Ultra) |
|---|---|---|
| Параметры | 700B (3.1 Ultra) | 432B общих, 28B активных |
| Внимание | классическое MLA | гибрид: 3 слоя GatedDeltaNet + каждый четвёртый MLA |
| KV-кэш на токен | полный | примерно в 4 раза меньше |
| Контекст в той же памяти | 1× | 2,14× |
| Throughput под нагрузкой | all-MLA вариант | +20% на 4-128 тыс. токенов |
| Декодинг | 1 MTP-голова, accept ~1,8 | 3 головы, accept 2,3-2,5; greedy до 2,2× |
| Открытость | - | MIT: fp8, bf16, GGUF, base, промежуточные чекпоинты |
Данные таблицы - из статьи Сбербанка на Habr и карточки модели на Hugging Face, 06.07.2026.
Про открытость отдельное слово. Для модели такого масштаба выложить основные веса (fp8 и деquantизированную bf16), а сверх того base-версию для дообучения и промежуточные training checkpoints - жест беспрецедентный, так формулирует источник. Это уже не чёрный ящик за API, а конструктор, который можно разобрать по слоям.
Позиционирование в карточке честное: «flagship instant model». Быстрая модель на каждый день, а не reasoning-монстр, который думает минуту перед ответом.
Как линейное внимание ужало KV-кэш в четыре раза?
Коротко: классическое внимание хранит по каждому прочитанному токену запись в кэше, и счёт памяти растёт с длиной текста. Линейное сворачивает всю историю в блокнот фиксированного размера: сколько ни прочитай, блокнот не толстеет. В 3.5 Ultra три четверти слоёв линейные, каждый четвёртый - полный MLA.
Представь секретаря. Вариант MLA: на каждый токен он заводит карточку и кладёт в папку; стоимость слоя растёт как O(L·d_c) - чем длиннее документ, тем толще папка. Вариант GatedDeltaNet: секретарь ведёт один блокнот размером с матрицу d_k·d_v на каждую голову и переписывает в нём записи - O(H·d_k·d_v), от длины текста не зависит вообще. Отсюда экономия: у гибридной 432B примерно вчетверо меньше кэша на токен.
Доля слоёв подобрана экспериментально. MLA каждым вторым или каждым четвёртым слоем дали почти одинаковое качество, пишет Сбер, - оставили каждым четвёртым: так память экономится сильнее. Так ллма получила пропорцию 3:1 в пользу линейных слоёв.
Сам механизм Сбер не изобретал. GatedDeltaNet - из статьи NVIDIA «Gated Delta Networks: Improving Mamba2 with Delta Rule» (arXiv:2412.06464, декабрь 2024, принята на ICLR 2025): delta rule точечно перезаписывает ассоциации в состоянии, а гейт позволяет быстро забывать лишнее.
Из истории, в одну строку: от персептрона Розенблатта к трансформеру 2017 года, а теперь к гибридам - каждый этап ужимал цену вычисления на единицу смысла.
Что это даёт по скорости и памяти на практике?
Коротко: на контекстах от 4 до 128 тыс. токенов гибрид обгоняет all-MLA по throughput примерно на 20% под нагрузкой. Ускорение генерации растёт с длиной: от 1,15× на коротком контексте до 1,25× на 131 тыс.
Второй ускоритель - MTP, Multi-Token Prediction. К одной голове, жившей в модели с версии 3.0, добавили ещё две: за шаг модель предсказывает сразу несколько токенов и сама себя проверяет (self-speculative decoding, отдельная draft-модель не нужна). Accept length вырос с ~1,8 до ~2,3-2,5 токена за шаг; greedy-декодинг ускоряется в 1,5 раза с одной головой и до 2,2 раза с двумя. При температуре 1.0 ускорение остаётся ~1,5×: цифра 2,2× относится к жадному декодингу, а не к любому чату.
Есть у истории и своя экология. Обучение шло в нативном FP8 по рецепту DeepSeek; хранение части активаций в FP8 для activation checkpointing срезало пиковое потребление VRAM на 20%. Меньше памяти - меньше железа - меньше энергии на каждый ответ.
Почему такую модель вообще удалось обучить?
Коротко: без набора стабилизаторов гибрид на 432 млрд параметров разваливался в обучении. Сбер перечисляет: Gated Attention, GatedNorm с репараметризацией 2·sigmoid, сэндвич-нормализация, клиппинг активаций внутри эксперта.
Соль в деталях. У GatedNorm при инициализации гейт равен примерно единице и не режет сигнал на старте. Активации перед перемножением в SwiGLU прижали точечно: up в диапазоне от -10 до 10, gate не выше 10.
Самая вкусная история - про оптимизатор. Команда уменьшила eps в AdamW и заметила, что у более чем 90% параметров eps стал доминирующим слагаемым: градиентный спуск деградировал до SGD with Momentum, по сути до спуска без адаптивного шага. Такие находки не читаются в анонсах, а именно они отличают лабораторию от пресс-службы.
При чём тут агенты и «нейросотрудники»?
Коротко: Сбер позиционирует модель как сильную в агентных сценариях - вызов инструментов, работа с внешними системами. На TAU2-bench, по карточке модели, 3.5 Ultra набрала 68,71 против 66 у DeepSeek V3.2.
Агентный сценарий в 2026 году - это уже не «напиши текст». Это модель, которая открывает отчёт, лезет в корпоративную систему и кликает по интерфейсу: управление бравзером, вызов API, заполнение форм. У Сбера таких агентов называют нейросотрудниками, а слой, который ставит им задачи и проверяет результат, - по сути нейроменеджер. И длинный контекст здесь рабочий инструмент: агент держит в памяти всю переписку задачи, поэтому экономия кэша бьёт прямо в агентный сценарий.
Кто ещё режет KV-кэш: Qwen, Kimi и гонка эффективности?
Коротко: Сбер - первый, кто довёл гибрид линейного внимания в открытом доступе до масштаба 400B+. Само направление - мировой тренд: Alibaba и Moonshot AI идут тем же путём.
Qwen3-Next от Alibaba - тоже гибрид, где каждый четвёртый слой полное внимание и порядка 75% слоёв Gated DeltaNet (по разбору исходников HF transformers). Kimi Linear от Moonshot AI (arXiv:2510.26692) - Kimi Delta Attention с более мелкозернистым гейтингом, связка KDA:MLA 3:1; по статье, архитектура обходит full MLA по качеству, режет KV-кэш до 75% и даёт до 6× throughput декодинга на контексте в миллион токенов, с открытыми весами 48B-A3B.
Гонка идёт за более эффективным «фронтир» качеством. Ответ Сбера - масштаб 432B, лицензия MIT и открытые чекпоинты обучения.
На что модель способна по замерам - и на что нет?
Коротко: по собственным бенчмаркам Сбера 3.5 Ultra первая в математике (среднее 78,1) и коде (среднее 71,9, HumanEval 80,49). По независимому рейтингу MySummit - первая внутри своей линейки, но в нижней половине общего зачёта. Обе картинки держи в голове одновременно.
Сначала оговорка: бенчмарки из карточки - самооценка вендора, судья на аренах - модель MiniMax-M2.7. Base-версия набирает среднее 72,3 по 11 general-задачам (3.1 Base - 69,6; DeepSeek V4 Flash Base - 71,9). Instruct против DeepSeek V3.2: среднее 60,1 против 61,0; SWE-bench Verified 42,6 против 44,8. Arena Hard Ru против GPT-5 - 69,5 против 38,3 у прошлой 3.1. MERA Text - 67,3 против 61,7 у V3.2. Даже по своим замерам модель выигрывает не везде.
Независимый срез - MySummit (42 модели, 80 управленческих сценариев, обновлено июлем 2026): скачок от GigaChat 2 Max заметный, сильнейшая категория - стратегический анализ (первая среди российских моделей), слабые - финансовые расчёты, ссылки на ТК РФ (ошибки там опасные) и управление командой. Вердикт замера: берут ради замкнутого контура и данных внутри РФ, а не ради качества самой модели.
Что это НЕ решает:
- Точный retrieval на длинном контексте. Состояние фиксированного размера - компромисс: поиск иголки в стоге проверяй на своих документах.
- Reasoning-задачи с долгим размышлением. Это instant-модель, заявленная в карточке.
- Графовые нейросети и анализ графов - другая область, GigaChat тут ни при чём.
- API-доступ к 3.5 Ultra. На июль 2026 в облаке Сбера её нет, только линейка 2.
Как проверить «гигабота» на своих задачах за один вечер?
Коротко: бесплатно - в ботах Telegram/VK, на giga.chat и в приложениях; через API Сбера - пока только прошлая линейка; полный контроль - веса под MIT, но fp8-версии нужно около 432 ГБ VRAM, это кластер уровня 8×H100/H200.
| Путь | Цена | Кому подходит |
|---|---|---|
| Telegram- и VK-боты, giga.chat, приложения | бесплатно | попробовать лично |
| API developers.sber.ru | 65-650 ₽/1M токенов (февраль 2026); 3.5 Ultra нет | продукты на линейке GigaChat 2 |
| Веса на Hugging Face (ai-sage) | MIT, бесплатно; железо своё | лаборатории с кластером |
Практический тест - пять своих запросов, тех самых, на которых всё ломается. Студент гоняет конспекты уроков (в поиске это выглядит и как «конспект оурок онлайн» - с опечаткой, но интент честный). Школьник решает интегралы - математика тут сильнейший блок по замерам Сбера. Маркетолог просит самоанализ для годового отчёта и пачку хештегов под пост. Гуманитарий тащит «знайку» для анализа стихотворения. Приходят и с творчеством - каллиграфия, открытки, поздравления. Любую ллмку, и эту тоже, стоит мерить именно так: свой корпус, свои edge case.
Самостоятельный запуск - отдельная история. Запуск идёт через SGLang (PR #29189) или vLLM (PR #47708) с expert parallel и MTP-спекуляцией; GGUF есть, но поддержка в llama.cpp (PR #25342) на 10 июля 2026 ещё не влита в master. И железо: fp8 - около 432 ГБ VRAM, bf16 - 865 ГБ и мультинода. Никакой нейрочип или нейропроцессор в обычном компьютере такое не потянет.
Самое полезное сравнение - твои пять запросов на разных моделях. Прогнать те же задачи через GPT для кода, через Gemini для длинных документов или через Qwen для мультиязычности можно сменой двух строк - ключа и base_url: provod.ai совместим с OpenAI- и Anthropic-SDK, так что Claude Code, Cursor или n8n подхватывают его без переписывания кода, а платёж идёт рублёвой картой или по счёту с закрывающими.
Когда provod.ai не подходит
Коротко: агрегатор открывает мировые модели из России, но не заменяет российский контур. Если задача - именно GigaChat, своё железо или работа внутри периметра Сбера - тебе не к нам.
Конкретно по этой теме. GigaChat в каталоге provod.ai нет: у Сбера свой SDK, свой договор и свои каналы. Если безопасность требует данные строго в контуре РФ - прямой контракт со Сбером решает это без посредников. Self-host открытых весов 3.5 Ultra - тоже не сюда: provod.ai не продаёт железо и не внедряет on-prem. А пользователю, который весь день живёт в одном ассистенте, фирменная подписка вендора может выйти дешевле оплаты по токенам. Всем остальным - тем, кто сравнивает модели на своих задачах и платит в рублях, - агрегатор проще.
Словарик запросов кластера
Коротко: рядом с «нейросеть гигабот» люди ищут странное. Разбираем честно, что значат соседние запросы.
Музыка, стримеры, мемы
- «акапеллу» - как убрать вокал из песни; задача аудиосервисов.
- «акулич» и «братишкина» - стримеры; ищут ролики с их нейрокопиями.
- «алейкум», «ассаламу» и «багров» - обрывок мема: Данила Багров из «Брат 2» здоровается голосом нейросети.
- «антошка», «иевлееч», «скелетбаны», «шашлычок» - песенки, треки и мемные ролики в нейроозвучке.
- «гигичад» - мемный персонаж; с GigaChat созвучие случайное.
- «кардинала», «княжна», «сюита», «металлика», «кашемир», «старостина» - треки и артисты в нейрокаверах: ария Ришелье, Metallica, «Кашемир», Адель Старостина.
- «римэйки» - ремейки треков, часто с пометкой про битрейт.
Имена и «отзывы»
- «дьяков», «нателла», «носков», «палаш», «пшинник», «рыков», «тарба», «хасаншин», «юмаев», «езам», «студген», «экзамка» - имена и ники с пометкой «отзыв» (Дмитрий Дьяк, Нателла Зубченко и др.); ищут чужие мнения, подлинность не проверить.
- «иронов» - дизайнер Николай Ирон и его работы с нейросетями.
- «мурашкина», «фомин», «люся», «оленька», «алиск», «кувен» - блогеры и ники из запросов «нейро ...»; к Сберу отношения нет.
Сервисы, компании, железо
- «айклауд» и «альф» - чужие бренды (облако Apple, вероятно банк); слиплось с темой нейросетей.
- «аравинд» - Аравинд Сринивас, глава Perplexity; сравнивают поисковые ИИ-сервисы.
- «вэймо», «динамикс», «робособака» - беспилотники и роботы (Waymo, Boston Dynamics); другая отрасль.
- «ванг» - Александр Ванг, фигура американской ИИ-индустрии; из той же ленты новостей.
- «галбот» - бытовое искажение; имеют в виду чат-бота вообще.
- «дииспик» - разговорное имя DeepSeek из сравнений выше.
- «маката» - вероятно, искажённое название китайской нейросети.
- «нейролинк» - Neuralink, чипы в мозг; другая тема.
- «нетбук» - запустится ли модель на нетбуке; для 432B ответ - нет.
- «полбузз» - вероятно, сервис генерации; запросы со словом «взломать» не разбираем.
- «промобот» - производитель роботов; не путать с ботом Сбера.
- «реактор» - мем про «нейросетевую барышню»; не по теме.
- «таробот» - бот для раскладов таро.
- «ауфоник», «бизон», «нейронит» - неочевидные запросы; скорее ники или опечатки.
- «псионы» - фантастика про космос; не про Сбера.
- «неолуддиты» - противники новых технологий; из общих споров про ИИ.
Эзотерика, игры, фандом
- «аркан» и «ленорман» - таро: старшие арканы и колода Ленорман; ищут нейросети-гадалки.
- «поттериана» - фанфики по Гарри Поттеру, сценарий для любых текстовых моделей.
- «квадроберы» - субкультура; тексты про Есенина и квадроберов.
- «зверушки» и «браинротов» - мемные картинки и brainrot-ролики, генерируемые пачками.
Картинки и творчество
- «беллами» и «эдмонда» - «портрет Эдмона де Беллами», знаменитая работа нейросети, ушедшая с аукциона.
- «блонд» и «причестку» - «примерить причёску онлайн» через нейрофильтры.
- «вышивки» - схемы вышивки по фото.
- «киски», «милашка», «спортсменки» - генерация изображений людей; платформы режут такое фильтрами.
- «штрафбат» и «экранизация» - сериалы и книги: «актеры тогда и сейчас», «сделай экранизацию».
- «войстег» - voice tag, метка голоса для треков.
- «община» - вероятно, обсуждения нейросетей в сообществах.
- «юрушатунова» - «оживить Юру Шатунова»: ролики с воскрешёнными артистами, вопросы по правам.
provod.ai — соедините LLM и медиамодели в одном сценарии
Пусть одна модель готовит идею и промпт, другая создаёт изображение, а третья собирает видео: общий API упрощает автоматизацию цепочки и управление доступом команды.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Составной сценарий не получает составную наценку: каждый вызов рассчитывается 1:1 по официальной цене соответствующей модели.
Автоматизируйте путь от идеи до ролика: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Частые вопросы
Коротко: пять вопросов, которые слышны вокруг темы, с прямыми ответами.
«Гигабот» - это бот или нейросеть? В быту - и то, и другое. Строго говоря, бот в Telegram или VK - интерфейс, а нейросеть - модель GigaChat за ним. С 6 июля 2026 за бесплатным ассистентом стоит версия 3.5 Ultra.
GigaChat 3.5 Ultra бесплатный? В ассистенте - да, по состоянию на середину июля 2026. В API Сбера этой модели пока нет: там линейка GigaChat 2 с тарифами 65-650 ₽ за миллион токенов и бесплатный миллион токенов в год, но нужен сертификат НУЦ Минцифры.
Чем линейное внимание отличается от обычного? Обычное хранит запись о каждом токене - память растёт с длиной текста. Линейное сворачивает историю в состояние фиксированного размера. Платишь за экономию точностью точечного поиска в длинном контексте.
Можно ли запустить GigaChat 3.5 Ultra на своём сервере? Веса открыты под MIT, но fp8-версии нужно около 432 ГБ VRAM - кластер уровня 8×H100/H200; bf16 - 865 ГБ и несколько нод. На домашнем железе не взлетит.
«Гигабот» или «клаудия» - что выбрать для работы? Зависит от контура. Данные обязаны остаться в РФ - твой путь прямой договор со Сбером. Нужно качество мировых моделей на твоих задачах - прогоняй те же запросы через Claude (её в народе зовут «клаудия») и сравнивай по делу: независимый MySummit ставит 3.5 Ultra в нижнюю половину рейтинга, хотя внутри своей линейки она первая.
Гигабот стал быстрее и дешевле именно там, где болит у бизнеса, - на длинных документах. До суперинтеллекта тут, понятно, далеко: это крепкий инженерный шаг, а не прорыв века. Но шаг проверяемый - веса открыты, замеры на столе, бот бесплатный.
Проверь выводы этой статьи за пять минут: на provod.ai флагманские модели доступны в одном чате и через единый API - тестируешь в чате, катишь в прод тем же ключом. Оплата в рублях с карты РФ или по счёту, без VPN и без наценки к официальным тарифам.
Источники
- S1: https://habr.com/ru/companies/sberbank/articles/1055826/ - блог Сбербанка на Habr, 06.07.2026 (первоисточник)
- S2: https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B - официальная карточка модели, 06.07.2026
- S3: https://news.smol.ai/issues/26-07-06-not-much/ - AINews, 06.07.2026
- S4: https://arxiv.org/abs/2412.06464 - «Gated Delta Networks», NVIDIA, 09.12.2024, ICLR 2025
- S5: https://gist.github.com/justinchuby/0213aa253664fb72e9adb0089816de15 - разбор исходников Qwen3-Next, 27.02.2026
- S6: https://arxiv.org/abs/2510.26692 - «Kimi Linear», Moonshot AI, окт-ноя 2025
- S7: https://vc.ru/ai/3027960-gigachat-3-5-ultra-ot-sbera - vc.ru/ai, 15.07.2026
- S8: https://mysummit.school/blog/en/gigachat-sber-review-2026/ - MySummit, обновлено июлем 2026
- S9: https://vc.ru/provod/3029738-ekonomika-svoey-gpu-dlya-neyrosetey - provod.AI на vc.ru, 10.07.2026
- S10: https://serverflow.ru/blog/novosti/sber-predstavil-gigachat-3-5-ultra-otechestvennaya-432b-moe-model-s-otkrytym-iskhodnym-kodom/ - ServerFlow, июль 2026
- S11: https://www.unisender.com/ru/blog/gigachat-nejroset-ot-sbera-obzor/ - Unisender, 27.02.2026


Top comments (0)