Человек набирает в поиске «open ai fm», потому что услышал: у OpenAI вышла какая-то аудио-штука, она вроде бы переводит голос. Правда состоит из двух половинок. Первая: openai.fm существует, но это витрина синтеза речи - она читает текст голосом и не переводит ничего. Вторая: живой перевод у OpenAI действительно есть. Модель gpt-realtime-translate вышла 7 мая 2026 года тихо, одним девелоперским постом, без презентации.
Цена вопроса смешная: $0.034 за минуту аудио по официальному анонсу, примерно 2.54 ₽ по курсу ЦБ РФ на 08.05.2026. Дорого обходится другое - разобраться, где у модели слабые места и как подключить её из России к своему продукту. Для прямого подключения заранее проверь доступные для твоего аккаунта способы биллинга. Рабочих путей три - зарубежная карта, посредники с наценкой и агрегаторы вроде provod.ai, где те же модели доступны в рублях по официальным тарифам. Дальше - по порядку, с ценами на июль 2026.
«open ai fm» - это что вообще?
Коротко: это официальное интерактивное демо TTS-модели gpt-4o-mini-tts. OpenAI запустила его примерно 20 марта 2025 года вместе с моделями транскрипции gpt-4o-transcribe и gpt-4o-mini-transcribe. Демо превращает текст в речь - и только.
Внутри 13 встроенных голосов, от alloy до marin и cedar (OpenAI рекомендует последние два), а манера речи задаётся текстовой инструкцией вида «говори как...». Код демо открыт и лежит на GitHub в репозитории openai/openai-fm. По смыслу это витрина синтеза: текст внутрь, голос наружу, никакого перевода.
Буквы fm и сбивают людей: слово звучит как радио, поэтому выдача подмешивает музыкальные сервисы. Этот шум разберём в конце отдельной рубрикой. А пока - новость, ради которой ты сюда и пришёл.
Что OpenAI тихо запустила 7 мая 2026 года?
Коротко: сразу три realtime-аудиомодели и перевод Realtime API из беты в общедоступность. GPT-Realtime-2 - голосовая модель с рассуждениями уровня GPT-5, GPT-Realtime-Translate - живой перевод, GPT-Realtime-Whisper - потоковая транскрипция.
«Тихо» - не метафора. Ни ивента, ни презентации: один пост в девелоперском блоге OpenAI. На vc.ru тогда отметили, что в самом релизе даже списка языков переводчика не было - он нашёлся позже в OpenAI Cookbook. В мае новость прошла почти незамеченной, а интерес к ней вернулся в июле, когда OpenAI дала перевод обычным пользователям ChatGPT. Об этом ниже.
Как устроена сессия gpt-realtime-translate?
Коротко: это потоковая модель speech-to-speech. Она переводит устную речь с 70 с лишним входных языков на 13 выходных «в темпе говорящего», не дожидаясь конца фразы. Вся сессия живёт в spoken контуре: микрофон внутрь, динамик наружу.
У переводчика отдельный эндпоинт /v1/realtime/translations (WebSocket wss://api.openai.com/v1/realtime/translations) и свой тип сессии - translation. Язык источника модель определяет сама, целевой ты задаёшь параметром. Звук гоняется сырым PCM (24 kHz PCM16) чанками. На выходе сразу три потока: переведённое аудио, транскрипт оригинала и транскрипт перевода - синхронно с речью.
Режим намеренно урезан: текстовый вход отключён, системные инструкции и вызов инструментов не работают. По данным OpenAI, модель обучали на тысячах часов записей профессиональных синхронных переводчиков, с пост-тренингом в духе RLHF, но под роль строгого интерпретатора. Машинный перевод прошёл путь от систем на LSTM до такого end-to-end контура, где одна модель делает всё сразу.
Заявленные сценарии в релизе - поддержка клиентов, трансграничные продажи, образование, мероприятия, медиа и креаторы. Представь перевод объявления в реве аэропорта, где каскад «распознать, перевести, озвучить» не успевает за говорящим. Среди задокументированных пользователей - Deutsche Telekom, Vimeo и BolnaAI.
Сколько стоит минута и какие языки в списке?
Коротко: $0.034 за минуту аудио, тарификация за длительность, а не за токены. По курсу ЦБ РФ 74.6209 ₽ за доллар на 08.05.2026 это примерно 2.54 ₽ за минуту; час двустороннего разговора обходится в $2.04, то есть около 152 ₽. Цена не менялась и в июльском апдейте - актуально на июль 2026.
| Что считаем | Цена по официальному анонсу OpenAI | В рублях по курсу ЦБ 08.05.2026 |
|---|---|---|
| Классический Whisper (файл на транскрипцию) | $0.006/мин | ≈0.45 ₽ |
| GPT-Realtime-Whisper (потоковая транскрипция) | $0.017/мин | ≈1.27 ₽ |
| GPT-Realtime-Translate (живой перевод) | $0.034/мин | ≈2.54 ₽ |
| GPT-Realtime-2 (голосовой агент) | $32 за 1M входных аудиотокенов, $64 за 1M выходных | - |
Из языковой математики важна асимметрия: на вход - 70 с лишним языков с автоопределением, на выход - только 13. Документированный список выходных: английский, испанский, португальский, французский, немецкий, итальянский, русский, китайский, японский, корейский, хинди, индонезийский и вьетнамский. Русский в списке есть.
Техническая рамка из карточки модели: контекстное окно 16 000 токенов, максимум 2 000 на выход, knowledge cutoff 30.09.2024. Бесплатного тира API нет: Tier 1 даёт 50 минут аудио в минуту, Tier 4 - 650. Модель развёрнута и в Azure AI Foundry со статусом GA (июнь 2026), но спеки листинга Azure расходятся с карточкой OpenAI - ориентируйся на цифры OpenAI.
Насколько это хорошо: независимый замер
Коротко: рекордная скорость, посредственный смысл. В бенчмарке LiveLingo Research (замер 10.06.2026; 120 реплик, пары английский→испанский/китайский/японский/немецкий, три клипа VOA) gpt-realtime-translate выдал первый переведённый звук быстрее всех - медианно за 711 мс. А по понятности перевода оказался последним из шести систем - 4.53 из 5.
| Система | Понятность перевода, 0-5 |
|---|---|
| LiveLingo | 4.96 |
| Gemini 3.5 Live Translate | 4.93 |
| Google STT + Translate | 4.77 |
| Azure | 4.65 |
| DIY Whisper + GPT-4o-mini | 4.63 |
| gpt-realtime-translate | 4.53 |
Типовые ошибки из отчёта: лишние вставки, инверсии смысла, подмена имён собственных. На плотной непрерывной речи перевод ещё и отстаёт: медиана задержки 3.8 секунды, дрейф до 20.3. У Gemini 3.5 Live Translate первый звук занимает около 2947 мс - вчетверо дольше, зато смысл держит ровнее.
У OpenAI своя статистика: по словам Пратика Сачана, сооснователя и CTO BolnaAI, на хинди, тамильском и телугу модель показала на 12.5% меньше ошибок распознавания (Word Error Rate), чем любая другая протестированная. Это данные вендора и его партнёра - относись к ним как к заявлению. Независимый замер говорит другое: скорость первого звука и точность смысла живут по разные стороны.
Что изменилось в июле 2026?
Коротко: OpenAI дала перевод обычным пользователям ChatGPT - и этим усилила интерес к API-модели. 8 июля вышел GPT-Live (модели GPT-Live-1 и GPT-Live-1 mini): full-duplex голосовой режим, который слушает и говорит одновременно и переводит «по промпту». Скажи «переводи всё, что я говорю, на испанский» - и он будет.
У GPT-Live нет API, список языков не опубликован; TechCrunch в пресс-демо отметил у хинди-перевода сильный американский акцент и книжный тон. Днём раньше, 7 июля, в Realtime API добавили GPT-Realtime-2.1-mini - рассуждения и tool use в mini-тире по $0.60/$2.40 за миллион токенов, а улучшенное кеширование снизило p95-латентность минимум на 25% по всем realtime-моделям. Вывод недели: потребителям дали перевод в чате, а разработчику по-прежнему нужен gpt-realtime-translate.
Чего gpt-realtime-translate не решает?
Коротко: это узкий инструмент с жёсткой рамкой. Только аудио на вход, только 13 языков на выход, никакой настройки поведения. Всё, что за пределами рамки, - уже не про него.
- Выходных языков 13. Нужен узбекский, казахский или армянский на выход - мимо, хотя на вход модель поймёт больше семидесяти.
- Текстовый вход, системные промпты и вызов инструментов отключены; function calling и fine-tuning не поддерживаются. Никакого дообучения под твой домен - ни полного, ни экономного вроде QLoRA. Терминологию придётся беречь иначе, например постобработкой транскрипта.
- Клонирование голоса - другая задача: нужен перевод голосом конкретного спикера - это территория инструментов класса SoVITS. Выбор голоса в переводной сессии не документирован как полноценная функция: вторичные источники противоречат друг другу, проверить не удалось.
- Модерация встроена в сам API: классификаторы могут прервать сессию на ходу за нарушение политики, а разработчик обязан явно показывать пользователю, что тот общается с ИИ. Для чувствительных переговоров это ограничение, а не формальность.
- Локально такую модель не поднять: весов в открытом доступе нет. Если ты из мира локального инференса - openvino, vulkan, lmcache, ncmoe, mtmd, params и прочие флаги вокруг llama.cpp - здесь они бесполезны.
- Цифры про «задержку полсекунды-секунду» из вторичных обзоров не подтвердились: замер показывает медиану отставания 3.8 секунды на плотной речи.
Как подключить живой перевод из России?
Коротко: совместимость нужно проверять у конкретного провайдера: gpt-realtime-translate использует отдельный WebSocket-эндпоинт и сессию translation, поэтому могут потребоваться изменения в подключении и коде. Прямой биллинг OpenAI для российского юрлица закрыт, поэтому рабочая схема идёт через агрегатора.
- Заведи API-ключ у провайдера с OpenAI-совместимым доступом и рублёвым биллингом.
- Поменяй две строки в конфиге клиента - ключ и base_url:
from openai import OpenAI
client = OpenAI(
api_key="PROVOD_API_KEY",
base_url="https://api.provod.ai/v1",
)
# дальше код как для OpenAI Realtime API: WebSocket-сессия
# типа "translation", параметр output_language, аудио PCM 24 kHz
- Подними сессию перевода и гоняй звук чанками; принимай аудио и оба транскрипта.
- Перед продакшеном прогони свои языковые пары и фоновые шумы - бенчмарк выше показывает, что качество смысла гуляет.
Клиентская сторона не привязана к вендору: Open WebUI (в поисковых запросах - openwebui), совместимые IDE, боты и автоматизации подхватывают такой endpoint без переписывания кода. Из российских сервисов рядом по смыслу стоит Yandex SpeechKit, но это распознавание и синтез речи, а не живой перевод speech-to-speech: каскад «распознал - перевёл - озвучил» придётся собирать вручную, со своей суммарной задержкой.
Здесь и ложится provod.ai (российский OpenRouter): единый API, совместимый с OpenAI и Anthropic SDK, один рублёвый баланс на команду, оплата картой РФ, СБП или по счёту с закрывающими, цены без наценки к официальным тарифам. Новые востребованные модели добавляются в каталог максимально быстро - когда gpt-realtime-translate там появится, подключение будет ровно тем, что в листинге выше.
Когда provod.ai не подходит
Коротко: есть сценарии, где агрегатор лишний. Вот честный список.
- Тебе достаточно перевода внутри ChatGPT. GPT-Live переводит голосом по промпту прямо в приложении - там не нужен ни API, ни код, ни сторонний сервис.
- Тебе нужен закрытый контур. Агрегатор - про облачный API; если политика безопасности требует on-prem и свои GPU, ищите self-hosted решения, их здесь нет.
- Тебе нужен прямой Enterprise-контракт с OpenAI. Свой SLA и персональные условия берутся только напрямую у вендора.
- Тебе нужна свежая модель в день её выхода. Новые модели добавляются в каталог быстро, но не мгновенно; если ждать нельзя - придётся идти напрямую с зарубежной картой.
Словарик запросов кластера: что ещё люди гуглят рядом с «open ai fm»
Коротко: рядом с этой темой в поиске живёт целый зоопарк. Разбираем по группам, что вы могли иметь в виду.
Опечатки, раскладка и «как скачать»
- «hpt» - «open ai chat hpt»: опечатка в ChatGPT.
- «kompyuter» - «chatgpt skachat kompyuter»: скачивать нечего, всё в браузере и API.
- «qilish» - то же «скачать» по-узбекски.
- «уеуоа» и «роиеа» - абракадабра из чужой раскладки в поиске бесплатных генераторов.
- «мирджони» - транслит без значения; искали бесплатную нейросеть.
- «ojol» - «open ojol ai»: опечатка, продукта нет.
- «хей» - «хей бро, нейросеть»: обращение, не название.
- «ыр» - обрывок казахского музыкального запроса.
Сторонние сервисы и файлы
- «cex» - криптобиржа CEX, смешалась с ботами для картинок.
- «zeta» - сторонний «zeta ai bot», не OpenAI.
- «razdevator» и «sovetnik» - сомнительные сайты «бесплатных нейросетей».
- «textplus» - виртуальные номера, не нейросеть.
- «sculptok» - малоизвестный 3D-генератор.
- «toppal» - охота за бесплатной лицензией сервиса.
- «sls» и «schoolboy» - коды и чужой пароль из экосистемы Runway; так делать не стоит.
- «photogrid» и «photolab» - фоторедакторы с нейрофильтрами.
- «vizai» и «pro100» - плагин к мебельному CAD pro100.
- «cdr» - конвертация CorelDRAW: «ai» там - формат файла.
- «1920х1080» - обои под размер экрана.
Фамилии и имена
- «hands» - «open hands ai» это OpenHands, кодинговый агент.
- «karparov» - фамилия из запросов про «skills» для Claude.
- «rustam» - «gillman rustam gemini»: искали автора.
- «зубченко», «исаченко» и «ятленко» - фигуры ИИ-курсов; ищут отзывы.
Музыка: «fm» тянет за собой радио
- «suno fm» и само «fm» - музыкальный сервис Suno и радиоэфир; буквы совпали, смысл нет.
- «любэ», «нэнси», «буратино», «четырка» и «вертолет» - запросы вида «Алиса, включи музыку» с названиями групп и песен.
- «итало» - «итало-диско ремикс нейросетью»; «прорвемся» - песня у Алисы; «самопроизвольно» - жалоба, что Алиса сама включает музыку.
- «бмв» - музыка «как из рекламы БМВ»; бренд тут случайный.
- «tbox» и «tuvio» - голосовой помощник и пульт для ТВ с Алисой.
- «дрд» - «озвучка дрд 1»: запрос про дубляж сериала.
- «рингионы2026» - рингтоны на звонок, в запросе с опечаткой.
- «techno» и «mixgen» - генерация треков.
- «souls» и «cry» - группа Souls Cry; спрашивают, нейросеть ли это.
- «ohnuma» и «celtic» - трек «ai ohnuma celtic scene», ищут скачать бесплатно.
Бренды, устройства и аббревиатуры - не про этот кластер
- «00150» - «Яндекс Дропс с Алисой, yndx 00150»: старая история про промокоды.
- «aero» - «geo aero ai продвижение в Екатеринбурге»: маркетинговый запрос.
- «brutalism» - группа Brutalism; спрашивают, применяет ли она нейросети.
- «girlfriends» - «aiko ai girlfriends взлом»: серая тема, тут не поможем.
- «gptunell» - «тоннели» к ChatGPT: серая зона доступа, к API не относится.
- «matter» и «tuya» - умный дом с Алисой.
- «neuralink» - компания Маска про чипы в мозг; к OpenAI не относится.
- «nolimit» - «nolimit gpt часы»: сторонний аксессуар с ассистентом.
- «notewise» - приложение для заметок, сосед Perplexity и GoodNotes по запросам.
- «nwsf» - обрывок запроса про промпты для DeepSeek.
- «openx» - «openx gemini»: ещё одна сторонняя обёртка.
- «roborock» - роботы-пылесосы; нейросети там про навигацию.
- «serisi» - «anthropic claude serisi»: «серия» по-турецки, запрос про Claude.
- «sidebar» - боковая панель Gemini в Chrome.
- «ttd» - OpenTTD, старая транспортная игра; «open» совпал случайно.
- «matte» - open matte, видеоформат кадра; не ИИ.
- «unblock» - «gemini unblock github»: обход блокировок, серая зона.
- «waymo» - беспилотники Waymo; к переводу речи отношения нет.
- «wispr» - Wispr Flow, диктовка голосом; близко по смыслу, но не перевод.
- «zfold7» - складной смартфон Samsung; спрашивают про генерацию картинок.
- «битрикс24» - «вайб-кодинг в Битрикс24»: корпоративная автоматизация.
- «вэд» - внешнеэкономическая деятельность; ищут ИИ для таможенных документов.
- «нмо» - непрерывное медицинское образование; там свои ИИ-сервисы.
- «рехау» - окна Rehau; выбор окон люди доверяют и нейросетям.
- «сбр» - «ГигаЧат от Сбера»; другая экосистема, не OpenAI.
- «тм1» - запросы про ИИ для процессов в корпоративном планировщике ТМ1.
- «эмп» - «персонаж по ЭМП»: ролевые запросы, не про голос.
- «юфс» - «рейтинг ЮФС 2026»: смешанные единоборства, прилетели случайно.
- «а-1001» и «а-1004» - коды ошибок DeepSeek; чинятся на стороне их API.
- «certification» - «open ai certification»: официальной сертификации у OpenAI нет.
- «отсчет» - «нейросеть, напиши отчёт по практике»: текстовая задача, не голосовая.
- «spoken» - «open spoken ai»: так называют голосовые модели OpenAI; точное имя - Realtime API.
- «мертвого» - «теория мёртвого интернета»: философский соседний запрос.
- «обнаженная» - запросы на генерацию обнажённых изображений и «сливы»; Realtime API такое не обслуживает: классификаторы прерывают сессию прямо на ходу.
provod.ai — роли и отдельные аккаунты для AI-команды
Не передавайте коллегам личные логины и ключи: разделяйте доступ внутри корпоративного пространства и сохраняйте централизованное управление рабочими сценариями.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Управляемые доступы идут без тарифной надбавки агрегатора: стоимость моделей остаётся 1:1 с официальными ценами провайдеров.
Организуйте безопасную командную работу: форма регистрации · цены на модели · защита данных по 152-ФЗ · политика обработки данных
FAQ
Коротко: пять быстрых ответов - про деньги, языки, бесплатный доступ и задержку.
«open ai fm» - это переводчик? Нет. openai.fm - демо синтеза речи gpt-4o-mini-tts: текст внутрь, голос наружу. Живой перевод делает другая модель - gpt-realtime-translate в Realtime API.
Сколько стоит минута перевода? $0.034 за минуту аудио по официальному анонсу OpenAI, тарификация за длительность. По курсу ЦБ РФ на 08.05.2026 это около 2.54 ₽; час двустороннего разговора - примерно $2.04, около 152 ₽.
Русский язык поддерживается? Да, он входит в 13 выходных языков. На вход модель понимает больше 70 языков и определяет их сама.
Можно ли пользоваться бесплатно? В API бесплатного тира нет, биллинг начинается с Tier 1. Альтернатива внутри ChatGPT - перевод голосом через GPT-Live; у него нет API, список языков не опубликован, а тариф и доступность нужно проверять отдельно.
Какая задержка в реальности? Медианно 711 мс до первого переведённого звука по замеру LiveLingo от 10.06.2026, но на плотной речи перевод отстаёт: медиана 3.8 секунды, дрейф до 20.3. Цифры «полсекунды» из вторичных обзоров не подтвердились.
Где я бы провёл границу применимости. Живая поддержка и мероприятия прощают кривой смысл, если ответ звучит мгновенно; переговоры с контрактами, именами и числами - нет, там подмена одного имени собственного стоит дороже любой задержки. Отсюда спорный вывод: gpt-realtime-translate выигрывает там, где важнее темп, и проигрывает там, где важна точность. Если у тебя другой опыт - расскажи в комментариях, особенно про редкие языковые пары.
А подключение остаётся вопросом биллинга, а не кода. Если пайплайн готов, а платить OpenAI напрямую нечем, логично смотреть в сторону единого API с рублёвым балансом - код при этом не меняется.
Проверь живой перевод на своей языковой паре за один вечер: на provod.ai единый API подключается сменой base URL и ключа, оплата в рублях с карты РФ, для юрлиц - договор и закрывающие. Актуальные условия доступа и цены уточняйте на сайте сервиса.
Источники
- S1. OpenAI, 07.05.2026: https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/
- S2. OpenAI Developers - карточка GPT-Realtime-Translate: https://developers.openai.com/api/docs/models/gpt-realtime-translate
- S3. LiveLingo, 09.07.2026: https://www.livelingo.io/guides/gpt-live-translation
- S4. LiveLingo Research - бенчмарк, 10.06.2026: https://livelingo.io/research/benchmark-2026
- S5. LiveLingo, 10.06.2026: https://www.livelingo.io/guides/openai-live-translation
- S6. MarkTechPost, 08.05.2026: https://www.marktechpost.com/2026/05/08/openai-releases-three-realtime-audio-models-gpt-realtime-2-gpt-realtime-translate-and-gpt-realtime-whisper-in-the-realtime-api/
- S7. vc.ru (AI), 07.05.2026: https://vc.ru/ai/2915334-openai-dobavila-v-realtime-api-novye-audiomodeli-s-rassuzhdeniyami-urovnya-gpt5-a-takzhe-dlya-perevoda-i-rasshifrovki-v-rezhime-realnogo-vremeni
- S8. itsnew.ru, 09.05.2026 (рублёвый пересчёт): https://itsnew.ru/stati/tri-novye-golosovyh-api-ot-openai-revolyucija-v-golosovyh-agentah-i-multimodalnyh-interfeisah.html
- S9. ai-stat.ru, 17.05.2026 (фрейминг «тихого запуска»): https://www.ai-stat.ru/news/2026-05-17-openai-gpt-realtime-translate
- S10. OpenAI Developers Showcase - openai.fm: https://developers.openai.com/showcase/openai-fm
- S11. OpenAI Developers - «Text to speech»: https://developers.openai.com/api/docs/guides/text-to-speech
- S12. Effloow, 14.05.2026: https://effloow.com/articles/openai-realtime-audio-api-voice-agents-guide-2026
- S13. ExplainX, 07.07.2026: https://explainx.ai/blog/openai-gpt-realtime-2-1-mini-reasoning-tool-use-api-2026
- S14. Zerlo, 22.10.2025: https://zerlo.net/en/blog/open-ai-fm
- S15. Rozetked, 08.05.2026: https://rozetked.me/news/45985-openai-vypustila-po-api-novye-golosovye-modeli-odna-iz-nih-perevodit-rech-v-real-nom-vremeni
- S16. Azure AI Foundry - каталог моделей: https://ai.azure.com/catalog/models/gpt-realtime-translate


Top comments (0)