DEV Community

Cover image for Нейросеть гигабот и GigaChat 3.5 Ultra: как linear attention ужал KV-кэш вчетверо
Promptra Team for Promptra

Posted on

Нейросеть гигабот и GigaChat 3.5 Ultra: как linear attention ужал KV-кэш вчетверо

6 июля 2026 года Сбер выложил GigaChat 3.5 Ultra в открытый доступ под лицензией MIT: веса лежат на Hugging Face в организации ai-sage, зеркало - на GitVerse. Та самая нейросеточка, которую в быту зовут «гигабот», стала примерно на 40% компактнее прошлого флагмана - и при этом, по данным самого Сбера, сильнее в коде, математике и агентных сценариях.

Главная новость - не размер, а память. Гибридная архитектура тратит примерно вчетверо меньше KV-кэша на токен, и в ту же видеопамять влезает в 2,14 раза больше контекста. Для бизнеса это переводится без формул: договоры и длинные переписки обрабатывать стало дешевле. Ниже - механика на пальцах, замеры с оговорками и все двери, через которые модель реально потрогать.

Попробовать «гигабота» можно бесплатно за минуту. Брать его в работу по пресс-релизу - плохая идея; правильный путь - прогнать свои пять запросов и сравнить с мировыми флагманами. Тот же тест против Claude или DeepSeek из России удобно делать через provod.ai (российский OpenRouter): один чат и единый API с оплатой в рублях.

Что такое «гигабот» и где его искать?

Коротко: «гигабот» - народное имя ассистента ГигаЧат от Сбера. Это Telegram- и VK-боты, веб на giga.chat и мобильные приложения. Вход через SberID, денег не просят; именно тут, по состоянию на середину июля 2026, и живёт свежая версия 3.5 Ultra.

Путаница в терминах тут у всех. Бот - интерфейс, окошко в чате. За окошком стоит языковая модель, и 6 июля её подменили на новую: пользователь ничего не настраивал, ответы просто стали другими.

Важная развилка - API. На developers.sber.ru, по данным на июль 2026, модель 3.5 Ultra ещё не выдана: там действуют тарифы прошлой линейки GigaChat 2 (Lite 65 ₽ за миллион токенов, Pro 500 ₽, Max 650 ₽, апдейт февраля 2026; миллион токенов в год - бесплатно, нужен сертификат НУЦ Минцифры). «Поговорил с гигаботом» и «подключил GigaChat к продукту» сегодня - две разные истории.

Чем GigaChat 3.5 Ultra отличается от прошлого флагмана?

Коротко: 432 млрд общих параметров вместо 700 млрд у 3.1 Ultra, активных - 28 млрд, это MoE (репозиторий GigaChat3.5-432B-A28B). Модель меньше, но на замерах Сбера сильнее. Лицензия - MIT, и это первая модель линейки, где гибридную архитектуру масштабировали на сотни миллиардов параметров после 1500+ экспериментов.

Что сравниваем Было Стало (3.5 Ultra)
Параметры 700B (3.1 Ultra) 432B общих, 28B активных
Внимание классическое MLA гибрид: 3 слоя GatedDeltaNet + каждый четвёртый MLA
KV-кэш на токен полный примерно в 4 раза меньше
Контекст в той же памяти 2,14×
Throughput под нагрузкой all-MLA вариант +20% на 4-128 тыс. токенов
Декодинг 1 MTP-голова, accept ~1,8 3 головы, accept 2,3-2,5; greedy до 2,2×
Открытость - MIT: fp8, bf16, GGUF, base, промежуточные чекпоинты

Данные таблицы - из статьи Сбербанка на Habr и карточки модели на Hugging Face, 06.07.2026.

Про открытость отдельное слово. Для модели такого масштаба выложить основные веса (fp8 и деquantизированную bf16), а сверх того base-версию для дообучения и промежуточные training checkpoints - жест беспрецедентный, так формулирует источник. Это уже не чёрный ящик за API, а конструктор, который можно разобрать по слоям.

Позиционирование в карточке честное: «flagship instant model». Быстрая модель на каждый день, а не reasoning-монстр, который думает минуту перед ответом.

Сравнение GigaChat 3.1 Ultra и 3.5 Ultra: параметры, кэш, скорость, лицензия

Как линейное внимание ужало KV-кэш в четыре раза?

Коротко: классическое внимание хранит по каждому прочитанному токену запись в кэше, и счёт памяти растёт с длиной текста. Линейное сворачивает всю историю в блокнот фиксированного размера: сколько ни прочитай, блокнот не толстеет. В 3.5 Ultra три четверти слоёв линейные, каждый четвёртый - полный MLA.

Представь секретаря. Вариант MLA: на каждый токен он заводит карточку и кладёт в папку; стоимость слоя растёт как O(L·d_c) - чем длиннее документ, тем толще папка. Вариант GatedDeltaNet: секретарь ведёт один блокнот размером с матрицу d_k·d_v на каждую голову и переписывает в нём записи - O(H·d_k·d_v), от длины текста не зависит вообще. Отсюда экономия: у гибридной 432B примерно вчетверо меньше кэша на токен.

Доля слоёв подобрана экспериментально. MLA каждым вторым или каждым четвёртым слоем дали почти одинаковое качество, пишет Сбер, - оставили каждым четвёртым: так память экономится сильнее. Так ллма получила пропорцию 3:1 в пользу линейных слоёв.

Сам механизм Сбер не изобретал. GatedDeltaNet - из статьи NVIDIA «Gated Delta Networks: Improving Mamba2 with Delta Rule» (arXiv:2412.06464, декабрь 2024, принята на ICLR 2025): delta rule точечно перезаписывает ассоциации в состоянии, а гейт позволяет быстро забывать лишнее.

Из истории, в одну строку: от персептрона Розенблатта к трансформеру 2017 года, а теперь к гибридам - каждый этап ужимал цену вычисления на единицу смысла.

Что это даёт по скорости и памяти на практике?

Коротко: на контекстах от 4 до 128 тыс. токенов гибрид обгоняет all-MLA по throughput примерно на 20% под нагрузкой. Ускорение генерации растёт с длиной: от 1,15× на коротком контексте до 1,25× на 131 тыс.

Второй ускоритель - MTP, Multi-Token Prediction. К одной голове, жившей в модели с версии 3.0, добавили ещё две: за шаг модель предсказывает сразу несколько токенов и сама себя проверяет (self-speculative decoding, отдельная draft-модель не нужна). Accept length вырос с ~1,8 до ~2,3-2,5 токена за шаг; greedy-декодинг ускоряется в 1,5 раза с одной головой и до 2,2 раза с двумя. При температуре 1.0 ускорение остаётся ~1,5×: цифра 2,2× относится к жадному декодингу, а не к любому чату.

Есть у истории и своя экология. Обучение шло в нативном FP8 по рецепту DeepSeek; хранение части активаций в FP8 для activation checkpointing срезало пиковое потребление VRAM на 20%. Меньше памяти - меньше железа - меньше энергии на каждый ответ.

Почему такую модель вообще удалось обучить?

Коротко: без набора стабилизаторов гибрид на 432 млрд параметров разваливался в обучении. Сбер перечисляет: Gated Attention, GatedNorm с репараметризацией 2·sigmoid, сэндвич-нормализация, клиппинг активаций внутри эксперта.

Соль в деталях. У GatedNorm при инициализации гейт равен примерно единице и не режет сигнал на старте. Активации перед перемножением в SwiGLU прижали точечно: up в диапазоне от -10 до 10, gate не выше 10.

Самая вкусная история - про оптимизатор. Команда уменьшила eps в AdamW и заметила, что у более чем 90% параметров eps стал доминирующим слагаемым: градиентный спуск деградировал до SGD with Momentum, по сути до спуска без адаптивного шага. Такие находки не читаются в анонсах, а именно они отличают лабораторию от пресс-службы.

При чём тут агенты и «нейросотрудники»?

Коротко: Сбер позиционирует модель как сильную в агентных сценариях - вызов инструментов, работа с внешними системами. На TAU2-bench, по карточке модели, 3.5 Ultra набрала 68,71 против 66 у DeepSeek V3.2.

Агентный сценарий в 2026 году - это уже не «напиши текст». Это модель, которая открывает отчёт, лезет в корпоративную систему и кликает по интерфейсу: управление бравзером, вызов API, заполнение форм. У Сбера таких агентов называют нейросотрудниками, а слой, который ставит им задачи и проверяет результат, - по сути нейроменеджер. И длинный контекст здесь рабочий инструмент: агент держит в памяти всю переписку задачи, поэтому экономия кэша бьёт прямо в агентный сценарий.

Кто ещё режет KV-кэш: Qwen, Kimi и гонка эффективности?

Коротко: Сбер - первый, кто довёл гибрид линейного внимания в открытом доступе до масштаба 400B+. Само направление - мировой тренд: Alibaba и Moonshot AI идут тем же путём.

Qwen3-Next от Alibaba - тоже гибрид, где каждый четвёртый слой полное внимание и порядка 75% слоёв Gated DeltaNet (по разбору исходников HF transformers). Kimi Linear от Moonshot AI (arXiv:2510.26692) - Kimi Delta Attention с более мелкозернистым гейтингом, связка KDA:MLA 3:1; по статье, архитектура обходит full MLA по качеству, режет KV-кэш до 75% и даёт до 6× throughput декодинга на контексте в миллион токенов, с открытыми весами 48B-A3B.

Гонка идёт за более эффективным «фронтир» качеством. Ответ Сбера - масштаб 432B, лицензия MIT и открытые чекпоинты обучения.

На что модель способна по замерам - и на что нет?

Коротко: по собственным бенчмаркам Сбера 3.5 Ultra первая в математике (среднее 78,1) и коде (среднее 71,9, HumanEval 80,49). По независимому рейтингу MySummit - первая внутри своей линейки, но в нижней половине общего зачёта. Обе картинки держи в голове одновременно.

Сначала оговорка: бенчмарки из карточки - самооценка вендора, судья на аренах - модель MiniMax-M2.7. Base-версия набирает среднее 72,3 по 11 general-задачам (3.1 Base - 69,6; DeepSeek V4 Flash Base - 71,9). Instruct против DeepSeek V3.2: среднее 60,1 против 61,0; SWE-bench Verified 42,6 против 44,8. Arena Hard Ru против GPT-5 - 69,5 против 38,3 у прошлой 3.1. MERA Text - 67,3 против 61,7 у V3.2. Даже по своим замерам модель выигрывает не везде.

Независимый срез - MySummit (42 модели, 80 управленческих сценариев, обновлено июлем 2026): скачок от GigaChat 2 Max заметный, сильнейшая категория - стратегический анализ (первая среди российских моделей), слабые - финансовые расчёты, ссылки на ТК РФ (ошибки там опасные) и управление командой. Вердикт замера: берут ради замкнутого контура и данных внутри РФ, а не ради качества самой модели.

Что это НЕ решает:

  • Точный retrieval на длинном контексте. Состояние фиксированного размера - компромисс: поиск иголки в стоге проверяй на своих документах.
  • Reasoning-задачи с долгим размышлением. Это instant-модель, заявленная в карточке.
  • Графовые нейросети и анализ графов - другая область, GigaChat тут ни при чём.
  • API-доступ к 3.5 Ultra. На июль 2026 в облаке Сбера её нет, только линейка 2.

Как проверить «гигабота» на своих задачах за один вечер?

Коротко: бесплатно - в ботах Telegram/VK, на giga.chat и в приложениях; через API Сбера - пока только прошлая линейка; полный контроль - веса под MIT, но fp8-версии нужно около 432 ГБ VRAM, это кластер уровня 8×H100/H200.

Путь Цена Кому подходит
Telegram- и VK-боты, giga.chat, приложения бесплатно попробовать лично
API developers.sber.ru 65-650 ₽/1M токенов (февраль 2026); 3.5 Ultra нет продукты на линейке GigaChat 2
Веса на Hugging Face (ai-sage) MIT, бесплатно; железо своё лаборатории с кластером

Практический тест - пять своих запросов, тех самых, на которых всё ломается. Студент гоняет конспекты уроков (в поиске это выглядит и как «конспект оурок онлайн» - с опечаткой, но интент честный). Школьник решает интегралы - математика тут сильнейший блок по замерам Сбера. Маркетолог просит самоанализ для годового отчёта и пачку хештегов под пост. Гуманитарий тащит «знайку» для анализа стихотворения. Приходят и с творчеством - каллиграфия, открытки, поздравления. Любую ллмку, и эту тоже, стоит мерить именно так: свой корпус, свои edge case.

Самостоятельный запуск - отдельная история. Запуск идёт через SGLang (PR #29189) или vLLM (PR #47708) с expert parallel и MTP-спекуляцией; GGUF есть, но поддержка в llama.cpp (PR #25342) на 10 июля 2026 ещё не влита в master. И железо: fp8 - около 432 ГБ VRAM, bf16 - 865 ГБ и мультинода. Никакой нейрочип или нейропроцессор в обычном компьютере такое не потянет.

Самое полезное сравнение - твои пять запросов на разных моделях. Прогнать те же задачи через GPT для кода, через Gemini для длинных документов или через Qwen для мультиязычности можно сменой двух строк - ключа и base_url: provod.ai совместим с OpenAI- и Anthropic-SDK, так что Claude Code, Cursor или n8n подхватывают его без переписывания кода, а платёж идёт рублёвой картой или по счёту с закрывающими.

Когда provod.ai не подходит

Коротко: агрегатор открывает мировые модели из России, но не заменяет российский контур. Если задача - именно GigaChat, своё железо или работа внутри периметра Сбера - тебе не к нам.

Конкретно по этой теме. GigaChat в каталоге provod.ai нет: у Сбера свой SDK, свой договор и свои каналы. Если безопасность требует данные строго в контуре РФ - прямой контракт со Сбером решает это без посредников. Self-host открытых весов 3.5 Ultra - тоже не сюда: provod.ai не продаёт железо и не внедряет on-prem. А пользователю, который весь день живёт в одном ассистенте, фирменная подписка вендора может выйти дешевле оплаты по токенам. Всем остальным - тем, кто сравнивает модели на своих задачах и платит в рублях, - агрегатор проще.

Словарик запросов кластера

Коротко: рядом с «нейросеть гигабот» люди ищут странное. Разбираем честно, что значат соседние запросы.

Музыка, стримеры, мемы

  • «акапеллу» - как убрать вокал из песни; задача аудиосервисов.
  • «акулич» и «братишкина» - стримеры; ищут ролики с их нейрокопиями.
  • «алейкум», «ассаламу» и «багров» - обрывок мема: Данила Багров из «Брат 2» здоровается голосом нейросети.
  • «антошка», «иевлееч», «скелетбаны», «шашлычок» - песенки, треки и мемные ролики в нейроозвучке.
  • «гигичад» - мемный персонаж; с GigaChat созвучие случайное.
  • «кардинала», «княжна», «сюита», «металлика», «кашемир», «старостина» - треки и артисты в нейрокаверах: ария Ришелье, Metallica, «Кашемир», Адель Старостина.
  • «римэйки» - ремейки треков, часто с пометкой про битрейт.

Имена и «отзывы»

  • «дьяков», «нателла», «носков», «палаш», «пшинник», «рыков», «тарба», «хасаншин», «юмаев», «езам», «студген», «экзамка» - имена и ники с пометкой «отзыв» (Дмитрий Дьяк, Нателла Зубченко и др.); ищут чужие мнения, подлинность не проверить.
  • «иронов» - дизайнер Николай Ирон и его работы с нейросетями.
  • «мурашкина», «фомин», «люся», «оленька», «алиск», «кувен» - блогеры и ники из запросов «нейро ...»; к Сберу отношения нет.

Сервисы, компании, железо

  • «айклауд» и «альф» - чужие бренды (облако Apple, вероятно банк); слиплось с темой нейросетей.
  • «аравинд» - Аравинд Сринивас, глава Perplexity; сравнивают поисковые ИИ-сервисы.
  • «вэймо», «динамикс», «робособака» - беспилотники и роботы (Waymo, Boston Dynamics); другая отрасль.
  • «ванг» - Александр Ванг, фигура американской ИИ-индустрии; из той же ленты новостей.
  • «галбот» - бытовое искажение; имеют в виду чат-бота вообще.
  • «дииспик» - разговорное имя DeepSeek из сравнений выше.
  • «маката» - вероятно, искажённое название китайской нейросети.
  • «нейролинк» - Neuralink, чипы в мозг; другая тема.
  • «нетбук» - запустится ли модель на нетбуке; для 432B ответ - нет.
  • «полбузз» - вероятно, сервис генерации; запросы со словом «взломать» не разбираем.
  • «промобот» - производитель роботов; не путать с ботом Сбера.
  • «реактор» - мем про «нейросетевую барышню»; не по теме.
  • «таробот» - бот для раскладов таро.
  • «ауфоник», «бизон», «нейронит» - неочевидные запросы; скорее ники или опечатки.
  • «псионы» - фантастика про космос; не про Сбера.
  • «неолуддиты» - противники новых технологий; из общих споров про ИИ.

Эзотерика, игры, фандом

  • «аркан» и «ленорман» - таро: старшие арканы и колода Ленорман; ищут нейросети-гадалки.
  • «поттериана» - фанфики по Гарри Поттеру, сценарий для любых текстовых моделей.
  • «квадроберы» - субкультура; тексты про Есенина и квадроберов.
  • «зверушки» и «браинротов» - мемные картинки и brainrot-ролики, генерируемые пачками.

Картинки и творчество

  • «беллами» и «эдмонда» - «портрет Эдмона де Беллами», знаменитая работа нейросети, ушедшая с аукциона.
  • «блонд» и «причестку» - «примерить причёску онлайн» через нейрофильтры.
  • «вышивки» - схемы вышивки по фото.
  • «киски», «милашка», «спортсменки» - генерация изображений людей; платформы режут такое фильтрами.
  • «штрафбат» и «экранизация» - сериалы и книги: «актеры тогда и сейчас», «сделай экранизацию».
  • «войстег» - voice tag, метка голоса для треков.
  • «община» - вероятно, обсуждения нейросетей в сообществах.
  • «юрушатунова» - «оживить Юру Шатунова»: ролики с воскрешёнными артистами, вопросы по правам.

provod.ai — соедините LLM и медиамодели в одном сценарии

Пусть одна модель готовит идею и промпт, другая создаёт изображение, а третья собирает видео: общий API упрощает автоматизацию цепочки и управление доступом команды.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Составной сценарий не получает составную наценку: каждый вызов рассчитывается 1:1 по официальной цене соответствующей модели.

Автоматизируйте путь от идеи до ролика: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Частые вопросы

Коротко: пять вопросов, которые слышны вокруг темы, с прямыми ответами.

«Гигабот» - это бот или нейросеть? В быту - и то, и другое. Строго говоря, бот в Telegram или VK - интерфейс, а нейросеть - модель GigaChat за ним. С 6 июля 2026 за бесплатным ассистентом стоит версия 3.5 Ultra.

GigaChat 3.5 Ultra бесплатный? В ассистенте - да, по состоянию на середину июля 2026. В API Сбера этой модели пока нет: там линейка GigaChat 2 с тарифами 65-650 ₽ за миллион токенов и бесплатный миллион токенов в год, но нужен сертификат НУЦ Минцифры.

Чем линейное внимание отличается от обычного? Обычное хранит запись о каждом токене - память растёт с длиной текста. Линейное сворачивает историю в состояние фиксированного размера. Платишь за экономию точностью точечного поиска в длинном контексте.

Можно ли запустить GigaChat 3.5 Ultra на своём сервере? Веса открыты под MIT, но fp8-версии нужно около 432 ГБ VRAM - кластер уровня 8×H100/H200; bf16 - 865 ГБ и несколько нод. На домашнем железе не взлетит.

«Гигабот» или «клаудия» - что выбрать для работы? Зависит от контура. Данные обязаны остаться в РФ - твой путь прямой договор со Сбером. Нужно качество мировых моделей на твоих задачах - прогоняй те же запросы через Claude (её в народе зовут «клаудия») и сравнивай по делу: независимый MySummit ставит 3.5 Ultra в нижнюю половину рейтинга, хотя внутри своей линейки она первая.

Гигабот стал быстрее и дешевле именно там, где болит у бизнеса, - на длинных документах. До суперинтеллекта тут, понятно, далеко: это крепкий инженерный шаг, а не прорыв века. Но шаг проверяемый - веса открыты, замеры на столе, бот бесплатный.

Те же пять запросов - на мировых флагманах рядом с гигаботом

Проверь выводы этой статьи за пять минут: на provod.ai флагманские модели доступны в одном чате и через единый API - тестируешь в чате, катишь в прод тем же ключом. Оплата в рублях с карты РФ или по счёту, без VPN и без наценки к официальным тарифам.

Источники

Top comments (0)