Знакомая картина: отдал ролик на ИИ-дубляж, получил назад перевод - и на первой же склейке губы спикера живут своей жизнью. Звук правильный, слова верные, а смотреть невозможно. Правка таких мест вручную съедала часы, и именно за нормальный lip sync сервисы до недавних пор просили отдельных денег.
В середине июля 2026 Synthesia пересобрала весь стек дубляжа и выпустила Dubbing 2.0: новая lip-sync-модель включена по умолчанию на всех тарифах и ничего сверху не стоит (запись в фиде релизов зафиксирована 15.07.2026). Это меняет расклад во всём сегменте: рядом уже стоят «голые» API синхрона губ с посекундной оплатой. Разберём, что поменялось, во что это упирается в минутах и кредитах.
Платить за западные сервисы из России по-прежнему нужно зарубежной картой, и тарифы у всех в долларах. Рабочих путей два: карта иностранного банка или российские агрегаторы вроде provod.ai, где модели оплачиваются в рублях по официальным тарифам. Дальше - с цифрами на 19.07.2026.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Что такое lip sync и почему он «ломался» именно на склейках?
Коротко: lip sync - это синхронизация движения губ героя кадра со звуковой дорожкой. Глаз зрителя жёстко ловит рассинхрон в местах монтажа: на склейке меняется поза и ракурс, и старые модели в этой точке «дрейфовали».
Когда переведённая фраза длиннее или короче оригинала, алгоритм обязан перерисовать рот под новые звуки. На стыке двух планов модель теряет опорный трек лица: полсекунды рот движется не в такт, и мозг это считывает мгновенно - эффект дешёвого перевода из 90-х.
По данным Synthesia, прежняя модель дрейфовала на быстрых склейках, сменах сцен и когда говорят несколько человек одновременно. Долгие годы стандартом «липсинка на коленке» была открытая Wav2Lip (ACM Multimedia 2020) - но и она была про один статичный рот, а не про монтаж.
Что нового в Synthesia Dubbing 2.0?
Коротко: полностью новый end-to-end стек - модель синхрона губ уровня state-of-the-art (формулировка вендора), более натуральные голоса и переводы, держащие тайминг оригинала. Новая версия lip sync бесплатна и включена по умолчанию на всех тарифах.
Новая модель отслеживает микродвижения рта и держит покадровую точность на быстрых склейках, сменах сцен и в мультиспикерных сценах. Заявлена и работа с окклюзиями: если перед ртом спикера что-то кратковременно проходит, синхрон остаётся на правильном человеке. Демонстрационная пара языков с разной артикуляцией - английский в японский.
Поверх синхрона добавились три практических вещи. Первое - два режима тайминга: Adaptive video duration (по умолчанию, видео подстраивается под длину переведённой озвучки; рекомендован для обучающего контента) и Original video duration (видео идёт как шло, подстраивается только озвучка). Второе - глоссарий: названия брендов, продуктов и аббревиатуры применяются автоматически и единообразно во всём воркспейсе. Третье, только на Enterprise: правка транскрипта и перевода без расхода кредитов, перегенерация одного изменённого сегмента вместо всего ролика; аудит-лог правок в статусе coming soon.
В блоге анонса приведены слова Florian Metz из Merck Group - держи в уме, что это вендорская цитата из маркетингового материала, независимо её не проверить.
Как продублировать видео: что нажимать?
Коротко: загружаешь файл или ссылку на YouTube, включаешь тумблер Lip Sync, выбираешь режим длительности, проверяешь транскрипт и забираешь результат. Весь цикл - в браузере, по данным хелп-центра Synthesia на июль 2026.
Порядок такой:
- Загрузи MP4, MOV или WebM до 4K - или вставь ссылку на YouTube. Язык оригинала определится автоматически. Важно: с self-serve тарифов видео, продублированные по YouTube-ссылке, публиковать нельзя.
- Включи тумблер Lip Sync - учти, он удваивает расход кредитов (об этом ниже).
- Выбери режим: Adaptive для обучения, Original - если в кадре важен каждый визуальный акцент.
- Проверь транскрипт и перевод. Свою терминологию заранее занеси в глоссарий.
- Забери выход: MP4 по каждому языку, WAV-аудио, субтитры SRT или VTT - или единую смарт-ссылку с мультиязычным плеером.
Если исходный звук грязный, прогони дорожку через auphonic до загрузки: сервис выравнивает громкость и чистит шум. Это важно, потому что модель клонирует голос каждого спикера отдельно - и мусор в исходнике мешает клонированию.
Сколько это стоит на самом деле?
Коротко: сам lip sync больше не продаётся отдельно, но «бесплатно» не значит «без счёта». Включённый тумблер Lip Sync расходует двойные кредиты, а минуты жёстко лимитированы тарифом - цены по официальной странице тарифов, проверенной 19.07.2026.
| Тариф | Цена | Минуты дубляжа в месяц | Кредиты | Языки дубляжа |
|---|---|---|---|---|
| Basic | $0, без карты | 10 | 1 200/мес | 70+ |
| Starter | $29/мес или $18/мес при годовой ($264/год) | 10 | - | 70+ |
| Creator | $89/мес или $64/мес при годовой ($804/год) | 30 | 3 600/мес | 70+ |
| Enterprise | custom | лимит снят | - | 140+ |
Два нюанса решают бюджет. Первый: Lip Sync включён - платишь 2× кредитов за те же минуты. Второй: акция запуска - каждому пользователю 15 бесплатных минут дубляжа в день с 15 июля по 15 августа 2026, суммарно до 450+ минут; неиспользованные минуты сгорают. Десятиминутное обращение CEO влезает в дневную акционную квоту целиком.

Чем Dubbing 2.0 отличается от Sync Labs и встроенного lip sync в Kling?
Коротко: это три разных подхода. Synthesia - SaaS-пайплайн «загрузил - получил ролик». Sync Labs продаёт API синхрона губ с оплатой за секунды. У Kling lip sync встроен в генератор и работает только внутри него.
| Synthesia Dubbing 2.0 | Sync Labs (sync.so) | Kling | |
|---|---|---|---|
| Что это | полный дубляж: перевод, голоса, синхрон | «голый» lip-sync API | фича генератора клипов |
| Оплата | подписка, минуты и кредиты | за секунду | внутри приложения |
| Цена | от $0 (Basic) | lipsync-2: $0,04-0,05/сек; lipsync-2-pro: $0,067-0,083/сек; sync-3: $0,107-0,133/сек | включён в генерацию |
| Языки | 70+ (140+ на Enterprise) | 95+ у sync-3 | зависит от TTS внутри |
| Ключевой предел | лимиты минут, 2× кредиты | только речевая мимика и human-like лица | только клипы, сделанные в самом Kling |
Цены Sync Labs - из его документации моделей на 19.07.2026. Флагманский sync-3 даёт 4K native, обработку окклюзий и профильных ракурсов из коробки, active speaker detection и дублирует ИИ-клипы из Kling, Sora, Veo и Runway обычно быстрее трёх минут. У Kling своя логика: даёшь текст для TTS или загружаешь аудио, и он анимирует рот персонажа - но только в клипах, сгенерированных внутри сервиса (их уже 600+ млн). А свежая фича elements в Kling - про сборку персонажей из референсов, а не про дубляж готового видео.
Выбор упирается в задачу: есть снятый ролик и нужна локализация «под ключ» - Synthesia; свой конвейер с оплатой за секунды - API вроде sync.so; съёмка с нуля внутри генератора - встроенного синхрона хватит.
Если собираешь такой конвейер локализации сам - перевод, синтез речи, синхрон губ - все эти классы моделей живут в одном API у provod.ai (российский OpenRouter): для конкретного пайплайна уточняй у сервиса доступные модели, эндпоинты, цены и требования к коду.
Как технология дошла до «студийного» уровня?
Коротко: Synthesia вернулась к собственной ДНК. Компания начиналась в 2018 году как сервис профессионального lip sync - и Dubbing 2.0 это та же ставка, но на self-serve масштабе.
В 2018-м Synthesia делала «native dubbing» для студий: инструмент ENACT, проект с BBC, сооснователь Matthias Niessner - из команды Face2Face (по материалам fxguide от 19.11.2018). Потом компания ушла в аватаров, а дубляж оставался полуфабрикатом. В декабре 2025 вышли Dubbing API и Assets API для автоматизации перевода видео на потоке, а в июле 2026 стек пересобрали целиком.
Параллельно зрела открытая база: Wav2Lip в 2020-м, потом zero-shot модели вроде lipsync-2, потом встроенный синхрон у генераторов видео. То, что вчера требовало студии, сегодня - тумблер в браузере. Впечатляет и немного тревожит: планка «что считается дешёвым переводом» только что поднялась у всего рынка.
Что Dubbing 2.0 не решает?
Коротко: он закрывает главный визуальный дефект - рассинхрон на склейках - и снимает ценовой барьер на сам синхрон. Но лимиты минут, двойной расход кредитов, языковой потолок, права на исходник и модерация никуда не делись.
Честный список границ:
- Лимиты минут не переносятся: 10 или 30 в месяц на self-serve, акционные 15 в день сгорают ежедневно.
- Lip Sync включён - кредиты удваиваются. На длинных роликах это решающая строка бюджета.
- 70+ языков на Basic, Starter и Creator против 140+ на Enterprise; 1-Click Translations - тоже Enterprise-история на 80+ языков.
- Правка транскрипта без расхода кредитов - только Enterprise. На self-serve ошибся в исходнике - перегенерируй всё.
- Загружающий обязан иметь права на видео и голоса. Модерация автоматически отклоняет политический, дискриминационный и иной неприемлемый контент; для остальных категорий сверяйся с актуальной политикой провайдера.
- Не для любого видео: у Sync Labs прямо описаны пределы класса - нужна активная речевая мимика (модель работает двухсекундными чанками, стоп-кадры и статика не синхронятся), только human-like лица, экстремальный профиль ухудшает результат. Пение и хор такие системы не держат: там нет речевой мимики, за которую модель может зацепиться.
Когда provod.ai не подходит
Коротко: агрегатор не заменяет фирменную студию Synthesia и не нужен при разовой задаче. Его место - потоковая локализация с оплатой за фактическое использование.
Нужен фирменный флоу Synthesia - браузерная студия, аватары, тумблер Lip Sync, посегментная правка на Enterprise - понадобится прямая подписка у вендора: через API такой интерфейс не получить. Дубляж раз в квартал на десять минут? Проще взять бесплатный Basic у самой Synthesia. А вот если локализация у тебя потоковая - переводы, озвучка, синхрон, нарезка - и хочется платить за секунды реального использования с одного рублёвого баланса, тогда единый API уместнее подписки.
Словарик запросов кластера
Коротко: вместе с темой lip sync поиск тащит соседние формулировки - опечатки брендов, телефонные вопросы, музыку и быт. Разводим их по полкам, чтобы ты не путал их с дубляжом.
Генераторы видео и их искажения
- «klin» - опечатка Kling, генератора видео.
- «klinik» - ещё одна опечатка Kling, к клиникам отношения нет.
- «шот» - обрывок запросов про клипы Kling («мультя шота»).
- «кл» - обрывок «клипа» или «Kling».
- «ки» - обрывок запроса про мультики.
- «пикачу» - покемон; искали музыку, а не Pika Labs.
- «boost» - хвост запроса «pika boost», смысл неясен.
- «diller» - «pika diller», вероятно ник или опечатка.
- «effected» - «pika effected», про эффекты в Pika.
- «xd» - «pika xd», эмоция, а не функция.
- «уе» - «pika уе», мусорный хвост запроса.
- «tikkurila» - краски Tikkurila; попал сюда из-за созвучия с Pika.
- «vinha» - колеровочная система тех же красок.
- «Banana» - Nano Banana, модель редактирования изображений.
- «AnythingLLM» - локальный чат-клиент для LLM.
- «kt» - обрывок запроса про Midjourney.
- «kontakt» - «flux kontakt», коверканный Kontext у Flux.
- «klap» - сервис нарезки роликов Klap.
- «skild» - Skild AI, это робототехника.
- «spore» - игра Spore, люди делают в ней «грокса».
- «tik» - обрывок TikTok из музыкальных запросов.
Чаты, входы и установки
- «cht» - опечатка ChatGPT.
- «тык» - так же коверкают адрес chatgpt.com.
- «ka» - из запросов про «ai ka digital singer», музыка.
- «taki» - «beni ai taki», снова музыка.
- «pa» - обрывок запроса про Gemini.
- «pk» - установка чат-бота на ПК.
- «py» - запуск Python-скриптов Stable Diffusion.
- «поч» - «поч дипсик не работает», жалоба.
- «соо» - «как удалить соо в дипсик», про сообщения.
- «лк» - «дипсик вход в лк», личный кабинет.
- «вка» - ролевые чаты ВКонтакте.
- «ек» - «клип есенин ек жалеть», музыкальный запрос.
- «кел» - «милс кел гигачат», ник или опечатка.
- «созд» - обрывок «создать» из запроса про нейросеть.
Телефоны, платы и голосовые помощники
- «13t» - Xiaomi 13T, замена Gemini на Алису.
- «7а» - Redmi 7A, отключение Алисы.
- «c51» - Realme C51, отключение Gemini.
- «а16» и «а56» - Samsung A16 и A56, то же про Gemini.
- «x7» - Poco X7 Pro.
- «oppo» - отключение Gemini на Oppo.
- «виво» - та же тема на Vivo, просторечное написание.
- «кли» - обрывок голосовой команды; те же люди пишут «кло».
- «ка» - частица из команд Алисе.
- «ку» - «алиса ты ку ку», приветствие ассистенту.
- «bigsur» - macOS Big Sur, искали Шедеврум на мак.
- «esp32» - микроконтроллер для самодельных голосовых ассистентов.
- «стерео» - стереопара из колонок с Алисой.
- «пуру» - Huawei Pura 80, установка чат-бота.
Музыка, которую просят «липсинкнуть»
- «адель» - песни Адель, сгенерированные нейросетью.
- «ска» - «есенин нейросеть песня ска», музыка.
- «сура» - «новый песня мастер сура», тоже музыка.
- «lacht» - «und der himmel lacht», генерация песни.
- «пати» - «гендер пати», это про фото, не про дубляж.
- «булинг» - мемный трек про пингвина.
- «колы» - реклама кока-колы нейросетью.
- «кин» - «кина дза дза», аниме.
- «воители» - озвучка аудиокниг про котов-воителей.
Бытовые вопросы Алисе (попали случайно)
- «lego» - поделки из конструктора.
- «желе» - желе из красной смородины.
- «мороженое» - мороженое из молока.
- «сквиши» - сквиши из скотча.
- «оригами» - поделки из бумаги.
- «торнадо» - «перехватчик торнадо» из коробки.
- «куст» - «что это за куст».
- «кустарник» - тот же вопрос про кустарник.
- «лук» - почему желтеет лук на грядке.
- «фигня» - «что это за фигня», дословный запрос.
- «луксмаксинга» - «оцени внешность по таблице луксмаксинга».
- «флирт» - персонажи для флирт-общения.
- «прагамму» - «скачать прагамму», опечатка.
- «ханьян» - нейросеть для 3D.
- «харант» - нейросеть для юристов.
- «лана» - обрывок запроса про Шедеврум.
- «мятний» - обрывок со ссылкой на Character AI.

provod.ai — от идеи и текста до изображения, видео и звука
Соберите контентный процесс без переключения между десятками сервисов: сценарий, визуал, ролик, музыка и аудио используют единый кабинет, API и баланс команды.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Каждый формат оплачивается по базовой цене поставщика 1:1: provod.ai объединяет расчёты, но не добавляет свою наценку.
Соберите медиапроизводство на provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai
FAQ
Можно ли липсинкнуть песню или клип?
У Sync Labs lipsync-2/pro нужна активная речевая мимика: стоп-кадры и статика не синхронизируются. Для пения и хора результат не подтверждён - сначала проверь его на коротком тесте.
Работает ли дубляж, если видео снято на телефон?
Да, обработка идёт в облаке, устройство не важно: ролик с redmi, samsung s24, oneplus, сяоми, vivo или хиоми обрабатывается одинаково - лишь бы лицо и речь были различимы в кадре.
Можно ли продублировать презентацию?
В подтверждённом сценарии дубляжа Synthesia принимает видеофайл или ссылку на YouTube; презентацию сначала нужно вывести в поддерживаемый видеоформат. Запросы вида «вепик», «питч», «самма» или «пифагор» - это про генераторы слайдов и сторителлинга, а не про дубляж; но записанный голосом рассказ поверх слайдов продублировать можно.
Что делать с длинным контентом - лекциями и аудиокнигами?
Считать минуты заранее. Раньше локализаторы лили переведённую озвучку поверх оригинала и мирились с рассинхроном; теперь проблема другая - часовая лекция это 60 минут квоты, а на self-serve тарифах их 10-30 в месяц.
Есть ли полностью бесплатный путь?
Два. Первый - Basic у Synthesia плюс акция: 15 минут в день до 15.08.2026. Второй - поднять открытую Wav2Lip 2020 года на vps: бесплатно, но качество вчерашнего дня, на склейках плывёт, и всю обвязку (перевод, голоса) собираешь сам.
Чем нарезать ролики после дубляжа?
Для автоматической нарезки длинного видео на шортсы люди ищут «опус клип» - Opus Clip; это отдельный этап после локализации, к самому синхрону губ отношения не имеет.
Часть читателей приходит в эту тему с другого входа - с запросов вида «rk chatgpt rubot moscow rus»: люди ищут, как вообще платить за ИИ из России без серых схем. Ответ одинаковый и для дубляжа, и для языковых моделей: единый баланс в рублях и прозрачный расход.
Спорный момент напоследок: для разового обращения CEO бесплатных акционных минут Synthesia хватит с запасом, и строить ради этого собственный конвейер странно. Для регулярной локализации сравни стоимость на своих длинах роликов, лимитах кредитов и API-ставках. Где твоя граница - десять минут в месяц или тридцать?
Источники
- S1: https://releasebot.io/updates/synthesia - фид релизов Synthesia, запись о Dubbing 2.0, 15.07.2026.
- S2: https://www.synthesia.io/post/introducing-dubbing-2-0 - официальный анонс Dubbing 2.0, июль 2026.
- S3: https://help.synthesia.io/en/articles/10054222-how-do-i-dub-a-video - хелп-центр Synthesia.
- S4: https://www.synthesia.io/pricing - тарифы, проверено 19.07.2026.
- S5: https://sync.so/docs/models/lipsync - документация Sync Labs по lipsync-2, lipsync-2-pro и sync-3, проверено 19.07.2026.
- S6: https://sync.so/blog/kling-lip-sync/ - блог sync.so про lip sync в Kling, 07.07.2026.
- S7: https://arxiv.org/abs/2008.10010 и https://github.com/Rudrabha/Wav2Lip - Wav2Lip, ACM MM 2020.
- S8: https://www.fxguide.com/fxfeatured/synthesia-lip-sync/ - история Synthesia и ENACT, 19.11.2018.
- S9: https://www.synthesia.io/features/ai-dubbing - страница AI Dubbing: форматы, права, модерация, проверено 19.07.2026.
