DEV Community

Cover image for «lip sync» без доплаты: Synthesia Dubbing 2.0 держит синхрон губ на любых склейках
Promptra Team for Promptra

Posted on

«lip sync» без доплаты: Synthesia Dubbing 2.0 держит синхрон губ на любых склейках

Знакомая картина: отдал ролик на ИИ-дубляж, получил назад перевод - и на первой же склейке губы спикера живут своей жизнью. Звук правильный, слова верные, а смотреть невозможно. Правка таких мест вручную съедала часы, и именно за нормальный lip sync сервисы до недавних пор просили отдельных денег.

В середине июля 2026 Synthesia пересобрала весь стек дубляжа и выпустила Dubbing 2.0: новая lip-sync-модель включена по умолчанию на всех тарифах и ничего сверху не стоит (запись в фиде релизов зафиксирована 15.07.2026). Это меняет расклад во всём сегменте: рядом уже стоят «голые» API синхрона губ с посекундной оплатой. Разберём, что поменялось, во что это упирается в минутах и кредитах.

Платить за западные сервисы из России по-прежнему нужно зарубежной картой, и тарифы у всех в долларах. Рабочих путей два: карта иностранного банка или российские агрегаторы вроде provod.ai, где модели оплачиваются в рублях по официальным тарифам. Дальше - с цифрами на 19.07.2026.

Что такое lip sync и почему он «ломался» именно на склейках?

Коротко: lip sync - это синхронизация движения губ героя кадра со звуковой дорожкой. Глаз зрителя жёстко ловит рассинхрон в местах монтажа: на склейке меняется поза и ракурс, и старые модели в этой точке «дрейфовали».

Когда переведённая фраза длиннее или короче оригинала, алгоритм обязан перерисовать рот под новые звуки. На стыке двух планов модель теряет опорный трек лица: полсекунды рот движется не в такт, и мозг это считывает мгновенно - эффект дешёвого перевода из 90-х.

По данным Synthesia, прежняя модель дрейфовала на быстрых склейках, сменах сцен и когда говорят несколько человек одновременно. Долгие годы стандартом «липсинка на коленке» была открытая Wav2Lip (ACM Multimedia 2020) - но и она была про один статичный рот, а не про монтаж.

Что нового в Synthesia Dubbing 2.0?

Коротко: полностью новый end-to-end стек - модель синхрона губ уровня state-of-the-art (формулировка вендора), более натуральные голоса и переводы, держащие тайминг оригинала. Новая версия lip sync бесплатна и включена по умолчанию на всех тарифах.

Новая модель отслеживает микродвижения рта и держит покадровую точность на быстрых склейках, сменах сцен и в мультиспикерных сценах. Заявлена и работа с окклюзиями: если перед ртом спикера что-то кратковременно проходит, синхрон остаётся на правильном человеке. Демонстрационная пара языков с разной артикуляцией - английский в японский.

Поверх синхрона добавились три практических вещи. Первое - два режима тайминга: Adaptive video duration (по умолчанию, видео подстраивается под длину переведённой озвучки; рекомендован для обучающего контента) и Original video duration (видео идёт как шло, подстраивается только озвучка). Второе - глоссарий: названия брендов, продуктов и аббревиатуры применяются автоматически и единообразно во всём воркспейсе. Третье, только на Enterprise: правка транскрипта и перевода без расхода кредитов, перегенерация одного изменённого сегмента вместо всего ролика; аудит-лог правок в статусе coming soon.

В блоге анонса приведены слова Florian Metz из Merck Group - держи в уме, что это вендорская цитата из маркетингового материала, независимо её не проверить.

Как продублировать видео: что нажимать?

Коротко: загружаешь файл или ссылку на YouTube, включаешь тумблер Lip Sync, выбираешь режим длительности, проверяешь транскрипт и забираешь результат. Весь цикл - в браузере, по данным хелп-центра Synthesia на июль 2026.

Порядок такой:

  1. Загрузи MP4, MOV или WebM до 4K - или вставь ссылку на YouTube. Язык оригинала определится автоматически. Важно: с self-serve тарифов видео, продублированные по YouTube-ссылке, публиковать нельзя.
  2. Включи тумблер Lip Sync - учти, он удваивает расход кредитов (об этом ниже).
  3. Выбери режим: Adaptive для обучения, Original - если в кадре важен каждый визуальный акцент.
  4. Проверь транскрипт и перевод. Свою терминологию заранее занеси в глоссарий.
  5. Забери выход: MP4 по каждому языку, WAV-аудио, субтитры SRT или VTT - или единую смарт-ссылку с мультиязычным плеером.

Если исходный звук грязный, прогони дорожку через auphonic до загрузки: сервис выравнивает громкость и чистит шум. Это важно, потому что модель клонирует голос каждого спикера отдельно - и мусор в исходнике мешает клонированию.

Сколько это стоит на самом деле?

Коротко: сам lip sync больше не продаётся отдельно, но «бесплатно» не значит «без счёта». Включённый тумблер Lip Sync расходует двойные кредиты, а минуты жёстко лимитированы тарифом - цены по официальной странице тарифов, проверенной 19.07.2026.

Тариф Цена Минуты дубляжа в месяц Кредиты Языки дубляжа
Basic $0, без карты 10 1 200/мес 70+
Starter $29/мес или $18/мес при годовой ($264/год) 10 - 70+
Creator $89/мес или $64/мес при годовой ($804/год) 30 3 600/мес 70+
Enterprise custom лимит снят - 140+

Два нюанса решают бюджет. Первый: Lip Sync включён - платишь 2× кредитов за те же минуты. Второй: акция запуска - каждому пользователю 15 бесплатных минут дубляжа в день с 15 июля по 15 августа 2026, суммарно до 450+ минут; неиспользованные минуты сгорают. Десятиминутное обращение CEO влезает в дневную акционную квоту целиком.

Экономика дубляжа Synthesia на июль 2026: тарифы, минуты и двойной расход кредитов за lip sync

Чем Dubbing 2.0 отличается от Sync Labs и встроенного lip sync в Kling?

Коротко: это три разных подхода. Synthesia - SaaS-пайплайн «загрузил - получил ролик». Sync Labs продаёт API синхрона губ с оплатой за секунды. У Kling lip sync встроен в генератор и работает только внутри него.

Synthesia Dubbing 2.0 Sync Labs (sync.so) Kling
Что это полный дубляж: перевод, голоса, синхрон «голый» lip-sync API фича генератора клипов
Оплата подписка, минуты и кредиты за секунду внутри приложения
Цена от $0 (Basic) lipsync-2: $0,04-0,05/сек; lipsync-2-pro: $0,067-0,083/сек; sync-3: $0,107-0,133/сек включён в генерацию
Языки 70+ (140+ на Enterprise) 95+ у sync-3 зависит от TTS внутри
Ключевой предел лимиты минут, 2× кредиты только речевая мимика и human-like лица только клипы, сделанные в самом Kling

Цены Sync Labs - из его документации моделей на 19.07.2026. Флагманский sync-3 даёт 4K native, обработку окклюзий и профильных ракурсов из коробки, active speaker detection и дублирует ИИ-клипы из Kling, Sora, Veo и Runway обычно быстрее трёх минут. У Kling своя логика: даёшь текст для TTS или загружаешь аудио, и он анимирует рот персонажа - но только в клипах, сгенерированных внутри сервиса (их уже 600+ млн). А свежая фича elements в Kling - про сборку персонажей из референсов, а не про дубляж готового видео.

Выбор упирается в задачу: есть снятый ролик и нужна локализация «под ключ» - Synthesia; свой конвейер с оплатой за секунды - API вроде sync.so; съёмка с нуля внутри генератора - встроенного синхрона хватит.

Если собираешь такой конвейер локализации сам - перевод, синтез речи, синхрон губ - все эти классы моделей живут в одном API у provod.ai (российский OpenRouter): для конкретного пайплайна уточняй у сервиса доступные модели, эндпоинты, цены и требования к коду.

Как технология дошла до «студийного» уровня?

Коротко: Synthesia вернулась к собственной ДНК. Компания начиналась в 2018 году как сервис профессионального lip sync - и Dubbing 2.0 это та же ставка, но на self-serve масштабе.

В 2018-м Synthesia делала «native dubbing» для студий: инструмент ENACT, проект с BBC, сооснователь Matthias Niessner - из команды Face2Face (по материалам fxguide от 19.11.2018). Потом компания ушла в аватаров, а дубляж оставался полуфабрикатом. В декабре 2025 вышли Dubbing API и Assets API для автоматизации перевода видео на потоке, а в июле 2026 стек пересобрали целиком.

Параллельно зрела открытая база: Wav2Lip в 2020-м, потом zero-shot модели вроде lipsync-2, потом встроенный синхрон у генераторов видео. То, что вчера требовало студии, сегодня - тумблер в браузере. Впечатляет и немного тревожит: планка «что считается дешёвым переводом» только что поднялась у всего рынка.

Что Dubbing 2.0 не решает?

Коротко: он закрывает главный визуальный дефект - рассинхрон на склейках - и снимает ценовой барьер на сам синхрон. Но лимиты минут, двойной расход кредитов, языковой потолок, права на исходник и модерация никуда не делись.

Честный список границ:

  • Лимиты минут не переносятся: 10 или 30 в месяц на self-serve, акционные 15 в день сгорают ежедневно.
  • Lip Sync включён - кредиты удваиваются. На длинных роликах это решающая строка бюджета.
  • 70+ языков на Basic, Starter и Creator против 140+ на Enterprise; 1-Click Translations - тоже Enterprise-история на 80+ языков.
  • Правка транскрипта без расхода кредитов - только Enterprise. На self-serve ошибся в исходнике - перегенерируй всё.
  • Загружающий обязан иметь права на видео и голоса. Модерация автоматически отклоняет политический, дискриминационный и иной неприемлемый контент; для остальных категорий сверяйся с актуальной политикой провайдера.
  • Не для любого видео: у Sync Labs прямо описаны пределы класса - нужна активная речевая мимика (модель работает двухсекундными чанками, стоп-кадры и статика не синхронятся), только human-like лица, экстремальный профиль ухудшает результат. Пение и хор такие системы не держат: там нет речевой мимики, за которую модель может зацепиться.

Когда provod.ai не подходит

Коротко: агрегатор не заменяет фирменную студию Synthesia и не нужен при разовой задаче. Его место - потоковая локализация с оплатой за фактическое использование.

Нужен фирменный флоу Synthesia - браузерная студия, аватары, тумблер Lip Sync, посегментная правка на Enterprise - понадобится прямая подписка у вендора: через API такой интерфейс не получить. Дубляж раз в квартал на десять минут? Проще взять бесплатный Basic у самой Synthesia. А вот если локализация у тебя потоковая - переводы, озвучка, синхрон, нарезка - и хочется платить за секунды реального использования с одного рублёвого баланса, тогда единый API уместнее подписки.

Словарик запросов кластера

Коротко: вместе с темой lip sync поиск тащит соседние формулировки - опечатки брендов, телефонные вопросы, музыку и быт. Разводим их по полкам, чтобы ты не путал их с дубляжом.

Генераторы видео и их искажения

  • «klin» - опечатка Kling, генератора видео.
  • «klinik» - ещё одна опечатка Kling, к клиникам отношения нет.
  • «шот» - обрывок запросов про клипы Kling («мультя шота»).
  • «кл» - обрывок «клипа» или «Kling».
  • «ки» - обрывок запроса про мультики.
  • «пикачу» - покемон; искали музыку, а не Pika Labs.
  • «boost» - хвост запроса «pika boost», смысл неясен.
  • «diller» - «pika diller», вероятно ник или опечатка.
  • «effected» - «pika effected», про эффекты в Pika.
  • «xd» - «pika xd», эмоция, а не функция.
  • «уе» - «pika уе», мусорный хвост запроса.
  • «tikkurila» - краски Tikkurila; попал сюда из-за созвучия с Pika.
  • «vinha» - колеровочная система тех же красок.
  • «Banana» - Nano Banana, модель редактирования изображений.
  • «AnythingLLM» - локальный чат-клиент для LLM.
  • «kt» - обрывок запроса про Midjourney.
  • «kontakt» - «flux kontakt», коверканный Kontext у Flux.
  • «klap» - сервис нарезки роликов Klap.
  • «skild» - Skild AI, это робототехника.
  • «spore» - игра Spore, люди делают в ней «грокса».
  • «tik» - обрывок TikTok из музыкальных запросов.

Чаты, входы и установки

  • «cht» - опечатка ChatGPT.
  • «тык» - так же коверкают адрес chatgpt.com.
  • «ka» - из запросов про «ai ka digital singer», музыка.
  • «taki» - «beni ai taki», снова музыка.
  • «pa» - обрывок запроса про Gemini.
  • «pk» - установка чат-бота на ПК.
  • «py» - запуск Python-скриптов Stable Diffusion.
  • «поч» - «поч дипсик не работает», жалоба.
  • «соо» - «как удалить соо в дипсик», про сообщения.
  • «лк» - «дипсик вход в лк», личный кабинет.
  • «вка» - ролевые чаты ВКонтакте.
  • «ек» - «клип есенин ек жалеть», музыкальный запрос.
  • «кел» - «милс кел гигачат», ник или опечатка.
  • «созд» - обрывок «создать» из запроса про нейросеть.

Телефоны, платы и голосовые помощники

  • «13t» - Xiaomi 13T, замена Gemini на Алису.
  • «7а» - Redmi 7A, отключение Алисы.
  • «c51» - Realme C51, отключение Gemini.
  • «а16» и «а56» - Samsung A16 и A56, то же про Gemini.
  • «x7» - Poco X7 Pro.
  • «oppo» - отключение Gemini на Oppo.
  • «виво» - та же тема на Vivo, просторечное написание.
  • «кли» - обрывок голосовой команды; те же люди пишут «кло».
  • «ка» - частица из команд Алисе.
  • «ку» - «алиса ты ку ку», приветствие ассистенту.
  • «bigsur» - macOS Big Sur, искали Шедеврум на мак.
  • «esp32» - микроконтроллер для самодельных голосовых ассистентов.
  • «стерео» - стереопара из колонок с Алисой.
  • «пуру» - Huawei Pura 80, установка чат-бота.

Музыка, которую просят «липсинкнуть»

  • «адель» - песни Адель, сгенерированные нейросетью.
  • «ска» - «есенин нейросеть песня ска», музыка.
  • «сура» - «новый песня мастер сура», тоже музыка.
  • «lacht» - «und der himmel lacht», генерация песни.
  • «пати» - «гендер пати», это про фото, не про дубляж.
  • «булинг» - мемный трек про пингвина.
  • «колы» - реклама кока-колы нейросетью.
  • «кин» - «кина дза дза», аниме.
  • «воители» - озвучка аудиокниг про котов-воителей.

Бытовые вопросы Алисе (попали случайно)

  • «lego» - поделки из конструктора.
  • «желе» - желе из красной смородины.
  • «мороженое» - мороженое из молока.
  • «сквиши» - сквиши из скотча.
  • «оригами» - поделки из бумаги.
  • «торнадо» - «перехватчик торнадо» из коробки.
  • «куст» - «что это за куст».
  • «кустарник» - тот же вопрос про кустарник.
  • «лук» - почему желтеет лук на грядке.
  • «фигня» - «что это за фигня», дословный запрос.
  • «луксмаксинга» - «оцени внешность по таблице луксмаксинга».
  • «флирт» - персонажи для флирт-общения.
  • «прагамму» - «скачать прагамму», опечатка.
  • «ханьян» - нейросеть для 3D.
  • «харант» - нейросеть для юристов.
  • «лана» - обрывок запроса про Шедеврум.
  • «мятний» - обрывок со ссылкой на Character AI.

provod.ai — общий AI-бюджет без личных подписок сотрудников

Соберите расходы на модели в одном рабочем пространстве: коллеги получают отдельные аккаунты, а компания управляет общим балансом и не возмещает десятки разрозненных оплат.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Централизация не добавляет процента к цене моделей: официальный тариф действует 1:1, без наценки provod.ai.

Переведите команду на общий баланс: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

FAQ

Можно ли липсинкнуть песню или клип?
У Sync Labs lipsync-2/pro нужна активная речевая мимика: стоп-кадры и статика не синхронизируются. Для пения и хора результат не подтверждён - сначала проверь его на коротком тесте.

Работает ли дубляж, если видео снято на телефон?
Да, обработка идёт в облаке, устройство не важно: ролик с redmi, samsung s24, oneplus, сяоми, vivo или хиоми обрабатывается одинаково - лишь бы лицо и речь были различимы в кадре.

Можно ли продублировать презентацию?
В подтверждённом сценарии дубляжа Synthesia принимает видеофайл или ссылку на YouTube; презентацию сначала нужно вывести в поддерживаемый видеоформат. Запросы вида «вепик», «питч», «самма» или «пифагор» - это про генераторы слайдов и сторителлинга, а не про дубляж; но записанный голосом рассказ поверх слайдов продублировать можно.

Что делать с длинным контентом - лекциями и аудиокнигами?
Считать минуты заранее. Раньше локализаторы лили переведённую озвучку поверх оригинала и мирились с рассинхроном; теперь проблема другая - часовая лекция это 60 минут квоты, а на self-serve тарифах их 10-30 в месяц.

Есть ли полностью бесплатный путь?
Два. Первый - Basic у Synthesia плюс акция: 15 минут в день до 15.08.2026. Второй - поднять открытую Wav2Lip 2020 года на vps: бесплатно, но качество вчерашнего дня, на склейках плывёт, и всю обвязку (перевод, голоса) собираешь сам.

Чем нарезать ролики после дубляжа?
Для автоматической нарезки длинного видео на шортсы люди ищут «опус клип» - Opus Clip; это отдельный этап после локализации, к самому синхрону губ отношения не имеет.

Часть читателей приходит в эту тему с другого входа - с запросов вида «rk chatgpt rubot moscow rus»: люди ищут, как вообще платить за ИИ из России без серых схем. Ответ одинаковый и для дубляжа, и для языковых моделей: единый баланс в рублях и прозрачный расход.

Схема конвейера локализации через единый API provod.ai

Собери свой пайплайн локализации за вечер: на provod.ai один ключ и один рублёвый баланс для чата и API, оплата картой РФ или по счёту с закрывающими, цены официальных провайдеров без наценки - платишь за секунды и токены реального использования, а не за подписку «с запасом».

Спорный момент напоследок: для разового обращения CEO бесплатных акционных минут Synthesia хватит с запасом, и строить ради этого собственный конвейер странно. Для регулярной локализации сравни стоимость на своих длинах роликов, лимитах кредитов и API-ставках. Где твоя граница - десять минут в месяц или тридцать?

Источники

Top comments (0)