DEV Community

Cover image for «Гига чат песня»: что ГигаЧат правда умеет с текстом, вокалом и обложкой
Promptra Team for provod.ai

Posted on

«Гига чат песня»: что ГигаЧат правда умеет с текстом, вокалом и обложкой

Разбираем документальную нестыковку между обещанием полноформатной песни и реальными лимитами сервиса — по шагам, с источниками и без иллюзий про финальный трек.

Открываешь официальную справку developers.sber.ru — там написано, что функция создания песни в ГигаЧате работает с лирикой: генерирует идеи, куплеты, структуру текста, и прямо указано, что сервис «не генерирует аудио, обложку или полноценный трек» (developers.sber.ru). А в собственном пресс-релизе Сбера на Habr от 13 декабря 2024 года — совсем другая картина: по текстовому запросу генерируются лирика, вокал (мужской, женский, хор), инструментал и обложка трека, всё в одном сценарии мини-приложения во ВКонтакте (habr.com). Это не опечатка одного автора — оба документа официальные, оба сберовские, и они описывают функцию с одним названием, но с диаметрально разными возможностями.

Цена этой путаницы конкретна. Человек, который увидел новость про «песню от ГигаЧата», заходит в обычный чат, просит написать и спеть песню — и не получает ничего, кроме текста. Или наоборот: слышит про голос и обложку, ищет их в API и веб-версии, где этого физически нет. Похоже, речь о двух разных продуктах под одним именем, но явно эту границу Сбер нигде не проводит: ни справка, ни пресс-релиз не оговаривают, что описывают разные сценарии. Текстовый сценарий и API живут в основном чате ГигаЧата — там модель пишет лирику, и текст можно заказать хоть под трёхминутную композицию (EastRussia). Вокал, инструментал и обложка — это отдельное мини-приложение, на момент запуска доступное только через ВКонтакте, и оно появилось на год позже.

Откуда взялся вокал и почему у него потолок в 90 секунд

История функции длиннее, чем один анонс. В ноябре 2023 года на AI Journey Сбер показал первую версию генерации музыки в ГигаЧате — только инструментал, без единого слова вокала, с выдачей аудиофайла и MIDI-партитуры (CNews, 2023). Технически это трёхэтапный пайплайн: CLaMP переводит текстовый запрос в формат генератора мелодий, SymFormer собирает саму композицию — модель обучена на более чем 200 000 произведений на суперкомпьютере Christofari, — а дальше идёт рендеринг в аудио и MIDI (Audiomania/SAMESOUND). На тот момент базовая языковая модель ГигаЧата имела 29 млрд параметров, но связь именно музыкального движка с этой моделью источники не уточняют (Hightech.plus).

Вокал добавили только 13 декабря 2024 года — с этим и связано мини-приложение «Создать песню» во ВКонтакте. У готового трека есть жёсткий потолок: не более 90 секунд аудио, при этом текст можно написать хоть на полноценные три минуты — лирика и звук не совпадают по длительности (EastRussia, 16.12.2024 — лимит длительности трека). Официально поддерживаются только русский и английский языки — вокал звучит на том языке, на котором написан текст (DTF, Maol). Это не мелкая деталь — это причина, по которой запрос «гига чат песня» на что-то длиннее полутора минут в принципе не может закрыться одним инструментом.

Три шага одной песни

Шаг Что происходит Где делать Ограничения
Текст Лирика, куплеты, структура песни Основной чат ГигаЧат (веб, приложение, API) Текст можно написать хоть под трёхминутную композицию; условия оплаты API в источниках не раскрыты
Вокал + бэк-трек Мужской/женский/хор голос, инструментал по тексту Мини-приложение «Создать песню» во ВКонтакте До 90 секунд, только рус/англ, бесплатно на момент запуска; по пресс-релизу сценарий включает и обложку, но справка Сбера это отрицает — третья строка нужна как запасной маршрут
Обложка и полный трек 3+ минуты Изображение для релиза, удлинение или пересведение аудио Kandinsky, Шедеврум (обложка); Suno или Udio (полноформатный трек) Отдельные сервисы, связь обложки именно с Kandinsky документально не подтверждена

Третья строка таблицы — самая слабая по доказательности, и это важно проговорить честно. В июне 2026 года ГигаЧат получил функции Kandinsky 6.0: объединение до трёх фото в одну композицию, точечное редактирование кистью, автоподбор формата под пост или баннер — но ни слова про обложки музыкальных треков в этом обновлении нет (computerra.ru). Пресс-релиз декабря 2024 года действительно включает обложку в сценарий «Создать песню», но не называет модель, которая её рисует. Разумный вывод: если обложка и была на Kandinsky, к июлю 2026 года это никем независимо не переподтверждено.

Где встал вопрос доступа — и почему это важно раньше, чем вопрос качества

На момент запуска в декабре 2024 года функция была доступна исключительно через мини-приложение ГигаЧата во ВКонтакте; доступ через Telegram, Одноклассники и веб-версию был анонсирован только как «планируется» (CNews, 2024). Более поздние SEO-агрегаторы 2026 года без указания дат утверждают, что бот теперь доступен и в Telegram, но ни один первичный источник Сбера это не подтверждает. Практический вывод: прежде чем строить план вокруг функции, проверяй, где именно она сейчас включена — для бизнеса, который хочет ставить генерацию музыки в постоянный процесс, а не разово поразвлекаться, зависимость от одной социальной платформы — уже сама по себе операционный риск.

Для компании, которая хочет генерировать фоновую музыку регулярно и программно, а не вручную через VK-бота, разумнее смотреть в сторону API-доступа к музыкальным моделям как к отдельному классу задач, а не привязываться к одному консьюмерскому каналу — здесь и работает такая платформа, как provod.ai: она даёт один API-доступ к моделям из поддерживаемого каталога, включая категорию музыки и аудио, и оплату по рублёвому счёту от российского юрлица. Важно не перепутать: это не доступ к сберовской функции «Создать песню» — ГигаЧат остаётся отдельным продуктом со своим контуром, — а альтернативный маршрут к другим музыкальным моделям каталога, который не завязан на одну соцсеть.

Права принадлежат тебе, риск — тоже

По пользовательскому соглашению ГигаЧата для физлиц исключительное право на сгенерированный контент — включая аудио и изображения — принадлежит пользователю, который может использовать его в коммерческих целях (п. 6.2) (developers.sber.ru — соглашение для физлиц). Но то же соглашение честно предупреждает: сгенерированный контент может полностью или частично совпасть с контентом третьих лиц, и весь риск нарушения чужих прав несёт пользователь — Сбер не даёт гарантий соответствия результата целям заказчика (п. 6.4, 7.3). Это стандартная защитная оговорка для генеративных сервисов, и конкретных прецедентов претензий именно по трекам ГигаЧата в открытых источниках нет — но перед коммерческим релизом стоит свериться с актуальной редакцией документа, а не с пересказом в статье.

Настоящий вопрос — не права, а качество вокала

Вице-президент «Салют» Денис Филиппов ещё в 2023 году позиционировал функцию как легальный и быстрый фон для малого бизнеса — кафе, салонов красоты, роликов для соцсетей: «Новые возможности GigaChat будут полезны не только музыкальным энтузиастам и представителям творческих профессий» (CNews). Пресс-релизы 2024 года пошли дальше — «фантазия пользователей ничем не ограничена», вокал и звук для каждого трека создаются заново нейросетью, а не берутся из библиотеки сэмплов (hi-tech.mail.ru).

Это маркетинговая рамка. Независимый обзор Mobile-review за март 2025 года заранее ставит ГигаЧат в позицию «андердога» рядом со специализированным зарубежным генератором UdioAI — уже в заголовке, ещё до детального сравнения характеристик (mobile-review.com). Автор блога на DTF, протестировавший сервис лично, признаёт, что результат оказался заметно лучше, чем он ожидал, но формулирует вывод предельно конкретно: «если надо песню на фон, то вполне можно создать» — и явно не говорит о готовности к финальному продакшену (dtf.ru). Рецензент и практик пришли к одному, разными путями: как черновик инструмент работает, до готового релиза не дотягивает.

Сильное возражение против всей идеи «песни из ГигаЧата» звучит так: если вокал уступает специализированным сервисам, а сам сервис называет себя ограниченным на официальной странице, то весь сценарий — это демо-функция, а не рабочий инструмент для настоящей песни. Возражение справедливо для одного сценария использования — релиза, который должен звучать профессионально. Оно неверно для другого — быстрого фона под ролик или черновика идеи перед обращением к специалисту. Разница между этими сценариями и определяет, какой шаг из таблицы вообще нужен.

Если задача — фон для видео в соцсетях, короткий джингл для бизнеса или прототип идеи, три шага из таблицы закрывают её полностью, с понятными правами на результат. Если задача — трек для дистрибуции на стриминги, требующий более 90 секунд и вокала выше черновой планки, придётся выйти за пределы ГигаЧата: обложку доверить Kandinsky или Шедевруму, а полную композицию — Suno или Udio. И если ради лучшего результата приходится перебирать несколько музыкальных моделей подряд, удобнее сравнивать их в одном личном аккаунте — так, как это устроено в provod.ai для моделей из поддерживаемого каталога, — чем заводить отдельную регистрацию под каждый сервис. Но начинать стоит не с выбора платформы, а с честного ответа на один вопрос: нужен тебе черновик под ролик или релиз, который должен звучать профессионально, — от этого и зависит, на каком шаге таблицы ты остановишься.


provod.ai — переведите AI из тестов в постоянный процесс

Когда модели становятся частью ежедневной работы, важны единые доступы, понятная оплата и совместимый API: платформа объединяет эти элементы для команды и бизнеса.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Постоянная работа строится на прозрачной цене: официальный тариф модели передаётся 1:1, без собственной наценки provod.ai.

Соберите рабочий AI-контур: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Источники

Top comments (0)