DEV Community

Cover image for xAI добавила 21 многоязычный голос для Grok Voice Agent Builder: grok build 0.1
Promptra Team for Promptra

Posted on

xAI добавила 21 многоязычный голос для Grok Voice Agent Builder: grok build 0.1

6 июля xAI показала 21 новый флагманский голос для Grok Voice Agent Builder. По данным анонса xAI от 6 июля, это варианты для многоязычных голосовых приложений и разных стилей общения, которые разработчик слушает и выбирает прямо в консоли xAI при сборке voice agent. Ключевое, что теряется в пересказах: релиз расширяет набор голосов API, а не подтверждает, что все 21 разом появились у каждого пользователя приложения Grok.

Если ты пришел за инструкцией "включить 21 голос в приложении" - сразу честно: это не тот релиз. Разбираем, что реально приехало, где это слушать и почему у соседа по форуму цифры другие. Если собираешь голосового ассистента и не хочешь платить за зарубежную карту и VPN, посмотри, как подключить те же текстовые модели через один русскоязычный доступ - к этому вернемся ниже отдельным блоком. Речь идёт о provod.ai (российский OpenRouter) — агрегаторе моделей по аналогии с зарубежным сервисом.

Что именно выкатили 6 июля?

Факт первый и главный: 21 новый голос относится к Voice Agent Builder - инструменту для разработчиков. По данным xAI, голоса рассчитаны на многоязычные сценарии, то есть один агент может говорить на нескольких языках, а не только по-английски. Второй факт от TestingCatalog: 7 июля, на следующий день после анонса, они нашли эти 21 голос уже в xAI Console и прослушали их при сборке агента.

Что из этого не следует. Не следует, что у тебя в мобильном приложении Grok завтра будет ровно 21 новый персонаж. Обсуждение в сообществе r/LoveGrok (пост от 14 июля) прямо показывает: rollout идет постепенно, а число доступных голосов у конкретного пользователя зависит от продукта и стадии развертывания. То есть API, веб-интерфейс и мобильное приложение в один и тот же день могут показывать разное.

Разложим по слоям, чтобы не путать инструмент разработчика и потребительскую фичу. Это тот случай, когда "билд" для консоли и "то, что видит юзер" - две разные сущности, и их удобно отобразить на одной шкале времени.

Событие компактное, поэтому проще всего увидеть его как три датированные точки, а не как один взрыв новостей. Ниже - именно такая шкала: анонс от xAI, независимая проверка TestingCatalog, реакция сообщества.

Шкала времени релиза: 6 июля анонс, 7 июля проверка в консоли, 14 июля реакция сообщества

Как послушать и выбрать голос в консоли?

Порядок действий простой, но важно не перепутать точку входа. Слушать голоса нужно там, где ты собираешь агента, а не в чате приложения.

  1. Открой xAI Console и раздел сборки voice agent (Voice Agent Builder). По данным TestingCatalog от 7 июля, именно там 21 новый голос появился первым.
  2. Пройдись по списку и нажми play на каждом варианте - это короткий дикторский сэмпл. Здесь "плей" просто запускает прослушивание голоса.
  3. Отбери 2-3 кандидата под сценарий: спокойный голос для поддержки, нейтральный для навигации, более живой - для роли компаньона.
  4. Проверь многоязычность: дай агенту фразу с переключением языка внутри реплики. Заявлено, что варианты многоязычные (xAI, 6 июля), но конкретное качество на твоем языке проверяй сам.
  5. Зафиксируй выбранный голос в конфиге агента и только потом думай про интеграцию.

Маленькая, но частая ошибка: человек ищет "21 голос" в приложении, не находит, идет на форум и пишет, что xAI все сломала. На деле ничего не сломали и не запретили - просто ты смотришь не в тот продукт. Это ровно то расхождение поверхностей, которое зафиксировано в обсуждении r/LoveGrok.

Как это подключить к своему коду?

Дальше начинается инженерная часть. Voice Agent Builder - это конструктор, но за ним стоит API, и агента нужно куда-то встроить: в обзвон клиентов, в бота для отделения банка, в справочную. Голос - только верхний слой; логика, память и маршрутизация остаются твоими.

Ниже - схематичный псевдокод того, как обычно выглядит вызов: ты задаешь выбранный голос, язык и текст реплики. Реальные имена полей смотри в актуальной документации xAI - я не выдумываю их значения, а показываю форму запроса.

# Псевдокод формы запроса к голосовому агенту.
# Точные поля и модель - по документации xAI.
agent = VoiceAgent(
    voice_id="flagship_voice_07",   # выбран в консоли из 21 варианта
    languages=["ru", "en"],          # многоязычный сценарий
    style="calm_support",            # спокойный тон для поддержки
)

reply = agent.say(
    text="Здравствуйте, соединяю с оператором. Секунду.",
)
Enter fullscreen mode Exit fullscreen mode

Обрати внимание на две вещи. Первая: голос и текст разделены. Голос - это только тембр и подача; что именно он скажет, решает твой сценарий. Вторая: выбор голоса и язык - разные параметры, и "многоязычный" не значит, что один и тот же голос одинаково хорошо звучит на всех языках.

Форма запроса важна ровно потому, что от нее зависит, насколько дешево ты потом поменяешь провайдера или добавишь резервный. На схеме ниже видно, где заканчивается голос от xAI и начинается твоя логика, и почему стоит держать вызов абстрактным.

Если завтра тебе понадобится не только голос Grok, но и текстовая модель для расшифровки того же звонка, удобно, когда весь стек ходит через один совместимый интерфейс, а не через пять разных SDK.

Схема потока: выбор голоса в консоли, вызов API, твой сценарий, канал доставки

Когда 21 голос реально решает задачу, а когда это витрина?

Здесь полезно быть честным. Больше голосов - не всегда лучше продукт. Разберем по сценариям, где выбор из 21 варианта дает ценность, а где это украшение.

Сценарий Нужны ли 21 голос Что реально решает
Обзвон и справочная отделения банка Скорее нет, хватит 1-2 нейтральных Скрипт, распознавание, интеграция с CRM
Многоязычный ассистент для международного продукта Да, разные тембры под языки Качество на каждом языке, а не количество голосов
Приложение-компаньон с ролью и характером Да, персонализация тона важна Память диалога и характер, а не только голос
Озвучка контента для блогеров и кино Частично Права, лицензия, монтаж; голос вторичен
Пет-проект на ардуино с голосовым выводом Нет Латентность и офлайн, а не палитра тембров

Вывод из таблицы простой: 21 голос - это про разнообразие подачи, а не про то, что агент станет умнее. Если твой сценарий - сухой обзвон, тебе важнее стабильность и цена минуты, а не то, есть ли в наборе более "дикторская" интонация.

И отдельно про соблазн имитации. Официальный набор - это нейтральные флагманские голоса, а не разрешение подделывать конкретных людей. Попытки заставить голос звучать как узнаваемая знаменитость - вне заявленных возможностей и юридически рискованны.

Экономика и ограничения обычно всплывают там, где заканчивается демо и начинается прод. Матрица ниже помогает решить это заранее: где 21 голос - реальный выигрыш, а где важнее скрипт и права.

Решающая таблица: в каких сценариях 21 голос помогает, а где важнее скрипт и права

Почему у меня не 21 голос, а у блогера - другое число?

Это самый частый вопрос недели. Ответ прямой: ты и автор видео смотрите разные поверхности продукта. По обсуждению в r/LoveGrok (14 июля), rollout идет постепенно, и API, веб и мобайл рассинхронизированы. Разработчик в консоли уже 7 июля видел все 21, а пользователь приложения может видеть меньше или пока ничего нового.

Отсюда типичные "страшные" истории на форумах, которые на деле - недоразумение:

  • "У меня пропали голоса, это скрытая цензура" - нет, ты в приложении, а не в консоли; про цензуру релиз ничего не сообщал.
  • "Чтобы получить все голоса, надо обойти приложение" - нет, никакой обходной путь не ускорит серверный rollout, развертывание идет на стороне xAI.
  • "Значит, голоса подделывают знаменитостей" - нет, набор флагманский и нейтральный; система не имитирует конкретного человека по умолчанию.

Как проверить свою ситуацию без домыслов:

  1. Зайди в xAI Console и посмотри Voice Agent Builder - если там 21, значит на уровне API все на месте.
  2. Сравни с тем, что показывает мобильное приложение и веб. Расхождение - это норма развертывания, а не баг.
  3. Не ориентируйся на скриншоты блогеров: у них могла быть другая стадия rollout или другой продукт.

Отдельно про модерацию, раз уж тема всплывает. То, что бот-компаньон в приложении не выдает любую реплику по первому запросу - это про политику контента, которая модерируется отдельно, а не про новые голоса. Голос - это тембр; что именно скажет агент, решают правила сценария и фильтры, а не выбор из 21 варианта.

Чего этот релиз не решает?

Честный список, чтобы не было завышенных ожиданий.

Он не делает Grok разговорным двойником знаменитости. Это нейтральные флагманские голоса, а не клоны конкретных артистов или спортсменов. Любое "звучит как известный человек" - твоя интерпретация, а не заявленная возможность.

Он не заменяет текстовые инструменты. Если тебе нужен конспект лекции, аннотация к статье, синопсис сценария или черновик раздела диссертации - это работа текстовой модели, а не голосового билда. Голос озвучит готовый текст, но не напишет за тебя главу.

Он не решает вопрос прав и этики. Голосовой агент, который имитирует живого человека без согласия, - это потенциальный юридический риск, а не крутая фича. Многоязычность и живость подачи - инструмент, а ответственность за применение на тебе.

Он не отменяет проверку качества на твоем языке. "Многоязычный" в анонсе - это обещание охвата, а не гарантия, что русский звучит идеально. Прогоняй свои тексты сам: дай агенту сложную фразу, попроси нужную эмоцию, послушай, нет ли металлического призвука или артефактов в паузах.

Дальше - практический слой для тех, кто в РФ: как разделить голос и текстовую логику так, чтобы оплата не превратилась в отдельную проблему.

Три слоя решения: голос от xAI, текстовая логика через один API, оплата в рублях

Где здесь provod.ai и российский рынок?

Теперь обещанный практический блок для тех, кто в РФ. Voice Agent Builder - продукт xAI, и голоса живут в его экосистеме. Но когда ты строишь агента, тебе почти всегда нужна и текстовая модель: расшифровать звонок, сгенерировать скрипт, персонализировать реплику под клиента. И вот тут удобно не собирать зоопарк из пяти SDK.

provod.ai агрегирует Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и дает один API, совместимый с SDK OpenAI и Anthropic: меняешь key и base_url - и тот же код ходит к нужной модели. Оплата в рублях: российская карта, СБП или счет; работает без VPN и зарубежных карт. Для бизнеса есть договор, счет и закрывающие документы.

Что это дает в контексте голосового агента на практике:

# Тот же клиент, другой провайдер: меняются только key и base_url
client = OpenAI(
    api_key="ВАШ_КЛЮЧ",
    base_url="https://api.provod.ai/v1",
)
# дальше - текстовая логика сценария для голосового бота
Enter fullscreen mode Exit fullscreen mode

Важно и честно: provod.ai - это доступ к текстовым и мультимодальным моделям через один рублевый баланс, а не поставка голосов Grok Voice Agent Builder и не GigaChat. Он не заменяет платформы автоматизации, приватную или on-prem инфраструктуру, функции, доступные только по подписке у вендора, и не делает за тебя внедрение. Голосовой слой ты по-прежнему берешь у xAI; provod.ai закрывает текстовый мозг сценария без плясок с зарубежной оплатой.

Такое разделение - голос отдельно, текстовая логика отдельно, оплата в рублях - обычно и есть тот момент, где проект перестает буксовать.

Короткий план внедрения

  1. Выбери 2-3 голоса в консоли xAI под конкретную роль, а не "все 21 на всякий случай".
  2. Проверь многоязычность и качество именно на своем языке, включая эмоциональные реплики.
  3. Отдели голос от логики: сценарий, память и маршрутизацию держи в своем коде.
  4. Текстовую часть подключи через совместимый API, чтобы легко менять модель.
  5. Заложи правовую проверку: никакой имитации живых людей без согласия.
  6. Тестируй на реальном канале - веб, мобайл и телефония ведут себя по-разному.

FAQ

У всех пользователей Grok теперь 21 новый голос?
Нет. По данным xAI (6 июля) релиз касается Voice Agent Builder и консоли. Появление в приложении идет постепенно, число у конкретного юзера отличается (r/LoveGrok, 14 июля).

Можно ли сделать голос конкретной знаменитости?
Официально это нейтральные флагманские голоса. Попытки заставить их звучать как узнаваемый человек - вне заявленных возможностей, и с точки зрения прав это риск, а не фича.

Это заменит текстовые модели для учебы и контента?
Нет. Конспект, синопсис, аннотацию или раздел диссертации пишет текстовая модель. Голос лишь озвучивает готовый текст.

Почему у блогера на видео другое число голосов?
Разные поверхности продукта и разные стадии rollout. Сравнивай консоль с консолью, а не скриншот приложения с API.

Снимает ли новый набор ограничения контента?
Нет. Контент модерируется отдельно от выбора голоса. Никакие обходные промпты не меняют политику, а голоса тут ни при чем.

Разработчику набор из 21 голоса - приятное расширение палитры, а не революция. Он полезен ровно там, где важна многоязычная и живая подача, и бесполезен там, где решают скрипт, права и цена минуты. А текстовый мозг сценария удобнее подключать через один рублевый доступ, чем собирать зоопарк SDK.

provod.ai: один API для текстовых моделей, оплата в рублях, без VPN

Собираешь голосового агента и не хочешь возиться с зарубежной оплатой для текстового слоя - подключи один API на provod.ai, поменяй key и base_url и проверь свой сценарий сегодня.

Источники


provod.ai — Russian LLM API aggregator. One OpenAI-compatible endpoint to all flagship models: OpenAI (GPT-5.6, GPT-5.5), Anthropic (Claude Opus 4.8, Sonnet 4.6), Google (Gemini 3.1 Pro, 3.5 Flash), DeepSeek V4 Pro, Qwen 3.6 Plus. Provider prices at the CBR rate, no token markup. Pay in rubles to a Russian legal entity with full closing documents.

Try: provod.ai · model catalog · docs

Top comments (0)