14 июля 2026 года Сбер обновил аудиомодель в своём ИИ-помощнике и выложил облегчённую версию для разработчиков. Главное, что изменилось на практике: модель работает с голосом и аудиофайлами напрямую, без обязательной предварительной расшифровки всей записи в текст, ловит позитивную или негативную эмоциональную окраску речи и умеет отвечать со ссылками на таймкоды в записях длиной до трёх часов. Это данные из сообщения Сбера и разборов CNews и Компьютерры от 14 июля 2026.
Проще говоря, теперь не нужно кидать всю встречу целиком в отдельный расшифровщик, а потом вручную перематывать. Спросил "куда делся кусок про бюджет?" - и получил ответ с указанием на конкретный таймкод. Если ты уже гоняешь голосовые сценарии в проде, удобнее держать под рукой другие LLM для сравнения того, как они анализируют уже готовые транскрипты. provod.ai (российский OpenRouter) - сервис с единым API к разным LLM; сам GigaChat Audio туда не входит, зато его транскрипты можно проверять в нескольких моделях на своих данных, не заводя пять разных подписок.
Что именно произошло 14 июля
По сообщению Сбера, обновлённая GigaChat Audio появилась в ИИ-помощнике, а в открытый доступ выложена облегчённая GigaChat3.1-Audio-10B. Отдельно опубликована научная работа (arXiv, 11 июля 2026), которая описывает временную привязку ответов в длинных аудиозаписях.
Кратко по фактам, каждый из которых подтверждён источниками из пакета:
- модель обрабатывает голосовые сообщения и аудиофайлы напрямую, без обязательного преобразования всей записи в текст;
- она определяет позитивную или негативную окраску речи по интонации, голосу и произношению;
- продуктовая версия работает с записями до трёх часов, различает спикеров, делает саммари и отвечает со ссылками на таймкоды;
- вместе с этим Сбер открыл семейство распознавания речи GigaAM Multilingual для русского, английского, киргизского, казахского и узбекского языков.
Здесь важно сразу развести маркетинг и проверяемое. Сбер активно рекламирует новые возможности, но два ключевых числа - внутренние. По внутреннему тесту Arena Hard Audio GigaChat Audio получила 75% побед, а заявленная точность распознавания эмоций - 80%. Это измерения самого Сбера, не независимый аудит, и выдавать их за внешнюю проверку нельзя.
Ещё одна тонкость, о которой стоит помнить, чтобы не пускать пыль в глаза себе и заказчику: научная статья описывает исследовательский режим с окном около двух часов, а продуктовая версия заявлена на три часа. Это линия, отделяющая эксперимент от продукта, и смешивать эти цифры не нужно.
Что открыли в open source и как это забрать
Открытая часть - это как раз то, ради чего многие и приходят по запросу gigachat open source. Из практичного здесь два артефакта: облегчённая GigaChat3.1-Audio-10B, которую можно дообучить и запускать локально, и GigaAM Multilingual для распознавания речи на пяти языках. Оба выложены Сбером 14 июля 2026, по данным CNews и Компьютерры.
Открытые модели, по данным Сбера, можно научить дополнительным языкам и применять для транскрибации, голосовых переводчиков, анализа звонков и навигации по встречам. То есть базовый пайплайн ты собираешь сам, а не ждёшь готовую кнопку в интерфейсе. Это принципиально важно для оценки трудозатрат: открытый вес - это старт, а не финиш.
Минимальный старт выглядит буднично: подготовь окружение и возьми карточку модели за источник истины по загрузке весов. Точные имена репозиториев, формат входа и требования к железу смотри именно там - в source pack этих деталей нет, и придумывать их за вендора не нужно.
# Облегчённая открытая модель, о которой сообщил Сбер 14 июля 2026
# GigaChat3.1-Audio-10B: можно дообучать и запускать локально
pip install transformers torch
# точную процедуру загрузки весов и формат входа смотри в карточке модели
Дальше логика такая: аудио на вход, диаризация по спикерам, разметка эмоций, саммари и таймкоды на выход. Никакого волшебства - но и обязательного полного перегона в текст теперь не требуется. Ниже - что именно уехало в открытый доступ, а что осталось внутри продукта.
Почему к 75% и 80% стоит относиться осторожно
Цифры звучат красиво, и их будут цитировать в презентациях. Но давай честно разложим, откуда они. 75% побед по Arena Hard Audio и 80% точности распознавания эмоций - это внутренние измерения Сбера, опубликованные вместе с релизом 14 июля 2026. Ни один внешний бенчмарк эти значения на момент проверки (14 июля 2026) не подтверждал.
Это не значит, что цифры завышены. Это значит, что у тебя нет независимой точки опоры, и полагаться на них как на финальную истину рано. Внутренний тест меряет модель на данных и в условиях, которые выбрал сам вендор. Для голосовых сценариев с грязным звуком, перебивками и региональными акцентами реальная точность может отличаться в обе стороны. Поэтому единственный разумный подход - прогнать модель на своих записях и посмотреть на свои проценты, а не чужие.
Отдельно держи в голове, что эмоция в этой модели - бинарная по смыслу: позитивная или негативная окраска. Это полезно для грубой навигации ("где в звонке клиент был недоволен"), но это не тонкая палитра из десяти состояний. Не проецируй на 80% больше, чем там есть.
Где это реально пригодится: звонки, встречи, голосовые сервисы
Самый очевидный сценарий - аудиопротоколирование звонков и разбор обзвонов. Компании накапливают сотни часов разговоров, и вручную это не разбирается. Модель различает спикеров и подписывает реплики, а таймкоды позволяют быстро прыгнуть к нужному фрагменту вместо перематывания трёхчасовой записи. Для контроля качества и обучения операторов это экономит основную часть ручной рутины.
Голосовые сообщения из мессенджеров - главный бытовой источник. Раньше длинный войс приходилось слушать целиком, чтобы вытащить одну договорённость. Теперь можно спросить конкретно и получить ответ с меткой времени, а нужный фрагмент вырезать по таймкоду. Модель, по данным Сбера, умеет и делать саммари, если исходный монолог слишком рыхлый.
Навигация по встречам - третий крупный сценарий. Диаризация спикеров плюс саммари плюс ответы с таймкодами превращают часовую запись созвона в структуру, по которой можно ходить как по оглавлению. Здесь же удобнее сравнивать инструменты честно: GigaChat Audio - это модель Сбера, заточенная под русскоязычный контур. Если после расшифровки тебе нужно прогнать транскрипт через Claude, GPT, Gemini, DeepSeek или Qwen для суммаризации и анализа, это можно делать через один API без VPN и с оплатой рублёвой картой. Для сценариев с персональными данными provod.ai предлагает защищённый российский контур для рабочих процессов по 152-ФЗ; конкретную схему обработки данных нужно сверять с документацией и договором под свой кейс. Подчеркну: provod.ai не даёт доступ к самому GigaChat - это разные вещи, и путать их не стоит.
from openai import OpenAI
client = OpenAI(api_key="ВАШ_КЛЮЧ", base_url="https://api.provod.ai/v1")
# сюда приходит уже готовый транскрипт из аудиомодели,
# дальше суммируешь и анализируешь в удобной LLM
Важный практический нюанс: два часа исследовательского режима из научной статьи и три часа продуктового режима из сообщения Сбера - это разные величины из разных источников. Планируя обработку длинных записей, ориентируйся на продуктовые три часа только там, где ты работаешь с продуктовой версией, а не с открытой 10B в собственном контуре.
Что учитывать по деньгам и рискам
Открытая модель - это не бесплатный обед. Ты платишь за железо и инженеров, дообучаешь под свои языки и домены, держишь инфраструктуру. Продуктовая версия в ИИ-помощнике снимает часть этой боли, но закрывается рамками сервиса: то, что доступно только в подписке или интерфейсе, локально ты не воспроизведёшь один в один. Выбор между открытой 10B и продуктом - это выбор между контролем и удобством, а не между "бесплатно" и "платно".
Отдельно про безопасность. Синтез и клонирование голоса дешевеют, и это оборотная сторона всей голосовой эволюции. GigaChat Audio слышит интонацию и размечает окраску речи, но сама по себе она не детектор фейка и не заменит проверку личности. В source pack нет заявления о том, что модель обнаруживает подделку голоса, - значит, закладывать это в архитектуру защиты нельзя.
Для сравнения инструментов честнее держать вот такую таблицу под рукой. Там, где стоит прочерк или "не заявлено", вендор ничего конкретного не обещал, и дорисовывать за него не нужно.
| Сценарий | GigaChat Audio (продукт) | Открытая 10B | Что делать самому |
|---|---|---|---|
| Анализ звонков, обзвон | до 3 часов, эмоции, спикеры | дообучение под свой домен | хранение и доступ |
| Навигация по встречам | таймкоды, саммари | локальный контур | интеграция в CRM |
| Транскрибация на 5 языках | - | GigaAM Multilingual | разметка данных |
| Детекция фейков голоса | не заявлено | не заявлено | отдельная защита |
Из таблицы видно, что открытая модель и продуктовая версия закрывают разные части задачи, а немалый кусок работы - хранение, интеграции, защита - всё равно остаётся на тебе. Ниже - как выглядит сам пайплайн от файла до ответа с таймкодом, чтобы не было иллюзии одной волшебной кнопки.
Чего это не решает
Модель не читает мысли и не понимает контекст бизнеса за тебя. Она разметит окраску речи вплоть до грубости, но приоритеты и выводы всё равно ставишь ты. Персональные данные в расшифровке придётся закрывать самому: маскирование чувствительных фрагментов - твоя задача, а не встроенная гарантия сервиса.
Точность распознавания эмоций в 80% и 75% побед по Arena Hard Audio - внутренние цифры Сбера на середину июля 2026. Пока нет независимой проверки, относись к ним как к ориентиру, а не как к финальной истине. И ещё раз: два часа исследовательского режима и три часа продуктового - это разные вещи из разных источников, arXiv и сообщения Сбера соответственно.
Наконец, это инструмент распознавания и навигации, а не замена продуктовой работы. Он не построит за тебя интеграцию, не заменит платформы автоматизации и не отменит приватную или on-prem инфраструктуру там, где она нужна по требованиям. Голос он слышит - решение принимаешь ты.
Частые вопросы
GigaChat открыт целиком?
Нет. В открытый доступ выложены облегчённая GigaChat3.1-Audio-10B и семейство GigaAM Multilingual. Полная продуктовая GigaChat Audio живёт в ИИ-помощнике. Запрос gigachat open source точнее описывает эти две модели, а не весь продукт.
На каких языках работает открытое распознавание речи?
GigaAM Multilingual поддерживает русский, английский, киргизский, казахский и узбекский. Открытую модель, по данным Сбера, можно научить и дополнительным языкам через дообучение.
Сколько часов аудио она держит?
Продуктовая версия заявлена до трёх часов. Научная работа описывает исследовательский режим около двух часов. Это разные цифры из разных источников, не путай их.
Можно ли доверять 80% точности по эмоциям?
Это внутренняя оценка Сбера от 14 июля 2026, а не независимый аудит. Пока внешней проверки нет, считай это ориентиром и проверяй на своих данных.
Заменяет ли это провайдера облачных LLM?
Нет. GigaChat Audio решает задачу голоса. Если дальше нужен анализ текста разными моделями - это отдельный слой, и держать его можно там, где удобно.
Собери свой голосовой пайплайн под задачу и подключи разные LLM для анализа транскриптов через один API на provod.ai - меняешь ключ и base_url, платишь рублями с карты, по СБП или по счёту, а на бизнес получаешь договор, счёт и закрывающие документы.
Источники
- arXiv, научная работа о временной привязке в длинных аудио, 11 июля 2026: https://arxiv.org/abs/2607.10387
- CNews, 14 июля 2026: https://www.cnews.ru/news/line/2026-07-14_ii-pomoshchnik_gigachat_teper
- Компьютерра, 14 июля 2026: https://www.computerra.ru/351915/sber-predstavil-audiomodel-gigachat-audio-s-raspoznavaniem-emotsij/
provod.ai — Russian LLM API aggregator. One OpenAI-compatible endpoint to all flagship models: OpenAI (GPT-5.6, GPT-5.5), Anthropic (Claude Opus 4.8, Sonnet 4.6), Google (Gemini 3.1 Pro, 3.5 Flash), DeepSeek V4 Pro, Qwen 3.6 Plus. Provider prices at the CBR rate, no token markup. Pay in rubles to a Russian legal entity with full closing documents.
Try: provod.ai · model catalog · docs





Top comments (0)