Из речи в готовый ролик: распознавание, смена языка и синхронизация губ
Один креатив размножается на 5 и более языков и стран автоматически. Whisper расшифровывает речь → GPT-4o переводит и переписывает под рынок и тип покупателя → ElevenLabs воспроизводит голос с нужным акцентом → wav2lip подгоняет движение губ под новую звуковую дорожку. Что раньше требовало студии звукозаписи и неделю работы — теперь делается за вечер.
Спай-данные есть, но руками не масштабируется
В интернет-рекламе сервисы наблюдения за конкурентами (AdHeart, AdSpy, AdsLibrary, Anstrex) дают тысячи работающих рекламных роликов конкурентов — но заимствовать можно только то, что не нарушает авторские права. Голос диктора, фон, лицо актёра, движение губ — всё, что защищено авторским правом, приходится создавать заново.
Раньше всё делалось вручную: смотрю чужой ролик → расшифровываю речь в текст → отдаю копирайтеру переписать под своё предложение → нанимаю диктора через Fiverr → жду 1–3 дня → монтирую в Final Cut → повторяю заново. 4–6 часов работы на одну версию, и это без синхронизации губ.
При бюджетах $2–5 тыс. в день на A/B-тесты скорость выпуска роликов и есть конкурентное преимущество. Когда одновременно идёт 8-10 рекламных наборов и каждому нужно 20-30 свежих креативов в неделю, ручная работа перестаёт справляться.
Конвейер из четырёх шагов: распознали речь → переписали текст → озвучили → свели с губами
Whisper расшифровывает видео конкурентов
whisper-large-v3 или OpenAI whisper-1 через API. Поддержка русского, английского, балканских, тюркских, испанского. Выдаёт SRT с таймкодами — знаем точно, на какой секунде какая фраза.
GPT переводит, адаптирует и переписывает под нужного покупателя
GPT-4o делает три задачи в одном проходе: (a) разбирает расшифровку на смысловые блоки — зацепка (первые 3 секунды), боль, доказательство, призыв к действию; (b) переводит на целевой язык (русский / английский / сербский / польский / турецкий) с учётом культурных нюансов — так, как «носитель бы это сказал»; (c) переписывает под нужное предложение, тип покупателя и страну, сохраняя ритм и эмоциональные триггеры оригинала.
Промпты с готовыми примерами «было → стало» для каждого языка и ниши. Главный фокус — сохранить таймкоды: каждая фраза по длительности должна совпадать с оригиналом, иначе движение губ разойдётся со звуком. Выход — 10–30 версий × 5+ языков, отсортированные по ожидаемому отклику аудитории.
ElevenLabs воспроизводит голос с нужным акцентом
ElevenLabs Multilingual v2 поддерживает 29 языков в одной модели — клонированный голос звучит на любом из них с правильным акцентом. Это важно: если оригинальный диктор — американка с южным акцентом, её клон на сербском звучит как естественная сербка-носительница.
Две стратегии: (a) voice cloning — 30-секундного сэмпла достаточно для high-quality клона; (b) готовые голоса для быстрых A/B-тестов по тембру (мужской или женский, возраст, интонация). Настройки стабильности, схожести и стиля подбираются под нишу. На выходе — звуковая дорожка той же длительности с оригиналом (важно для следующего шага).
wav2lip подгоняет движение губ
На этом этапе появляется «магия» — актриса в видео начинает говорить на новом языке так, будто это сняли заново. wav2lip разбирает исходное видео и новую звуковую дорожку и перерисовывает область рта кадр за кадром, чтобы движение губ совпадало с новой речью. Нужна видеокарта; расчёт занимает часы.
Простой случай (voice-over / off-screen): ffmpeg просто заменяет звуковую дорожку. Сложный случай, когда в кадре говорящий человек: wav2lip или SadTalker для синхронизации лица. На выходе — готовый mp4 под рекламные площадки (FB Ads / TikTok / VK Ads / Yandex Direct).
Технологии и инфраструктура
- OpenAI Whisper API (whisper-1)
- whisper-large-v3 на своём сервере — при больших объёмах
- Разбор субтитров ради точных таймкодов
- GPT-4o / Claude Sonnet 4.5
- Промпты с примерами «зацепка → переписанный текст»
- Ответ модели в строгой структуре JSON
- ElevenLabs Multilingual v2
- Воспроизведение голоса — хватает 30-секундного образца
- Настройки голоса: стабильность, схожесть, стиль
- ffmpeg для замены звуковой дорожки
- wav2lip и SadTalker — когда в кадре говорящий человек
- Управление шагами на Python и очередь задач
Что меняется в воронке
на один вариант ролика (замена звука, без синхронизации губ)
версий × языков (одна актриса → 5+ стран без повторных съёмок)
Whisper + GPT + ElevenLabs (по тарифам сервисов, без синхронизации губ)
Главный эффект — скорость итерации. A/B-тест 20 вариантов первой фразы вместо двух запускается за вечер. Выигравшие сочетания видно уже в первые 24-48 часов, проигравшие отключаются раньше, чем сожгут бюджет. Установка дешевеет на 15-30% за счёт того, что первая фраза точнее попадает в нужного покупателя.
Тот же синтез речи вне рекламы
Шаг озвучки работает отдельно от роликов. Два применения в работе: голосовое уведомление для телефонии и голосовые сообщения в мессенджере от имени руководителя через деловое подключение. Голос в обоих случаях фиксированный и берётся из того же конвейера, поэтому озвучка звучит одинаково во всех каналах.
Порядок фразы на исходящем звонке задан жёстко
Сначала звучит, кто звонит, следом — что разговор записывается. Цель записи в реплике остаётся за скобками. Порядок закреплён в тексте озвучки, поэтому каждый звонок начинается одинаково.
Аудиофайлы собираются из скрипта
В репозиторий коммитится скрипт синтеза, сами файлы пересоздаются за секунды: два файла длительностью 4,0 и 3,2 секунды. В истории изменений остаётся текст реплики.
Голосовой пузырёк рисуется только для одного контейнера
Вид голосового сообщения в мессенджере включается единственным форматом контейнера. Любой другой контейнер приходит получателю обычным файлом, поэтому формат зафиксирован прямо на выходе синтеза.
Разборы с числами остаются текстом
Голосом уходят короткие уведомления. Сводки с числами отправляются текстом: к цифре на экране читатель возвращается взглядом и перечитывает её столько раз, сколько нужно.
Открытый блокер: исходящие звонки
У поставщика телефонии проигрывание аудио доступно в схеме входящего вызова. Вставить готовый файл в исходящий звонок сейчас некуда, запрос в поддержку отправлен.
Бесплатная локальная замена платному синтезу
В стеке кейса стоит платный сервис синтеза, и вопрос «а если без подписки» задаёт каждый второй заказчик. Под замену выбрана модель с лицензией MIT: русский язык поддерживается, голос клонируется с образца в 10 секунд. Две лучшие по звуку модели отпали из-за некоммерческих лицензий. Пока это выбор на бумаге: в рабочем конвейере работает платный сервис.
Гигиена ключей
Ключ платного сервиса перевыпущен взамен того, что попал в лог. У нового ключа права только на синтез речи, остальные методы API для него закрыты, лимит расхода выставлен явно.
Где работает, где нет
- · Рекламные агентства, где 5 и более человек делают креативы
- · Рекламные команды и интернет-магазины с большим потоком креативов
- · Свой отдел маркетинга интернет-магазина, который регулярно снимает ролики «как от покупателей»
- · Запуски в 5 и более странах одновременно — все языки из одного исходного сценария
- · Подкасты и онлайн-школы — для нарезки коротких роликов
- · Прямое копирование чужих роликов — это нарушение авторских прав
- · Ниши со строгим регулированием (медицина, фармацевтика, финансы) — там нужны юристы по рекламе
- · Воспроизведение чужого голоса без согласия его владельца — запрещено законом ЕС об ИИ
- · Длинные видео от 10 минут — озвучка и монтаж обойдутся не дешевле дорогого живого диктора
Этическая нота: конвейер предназначен для масштабирования собственных идей и оригинальных сценариев. Использование чужих видео и голосов без разрешения — нарушение авторских прав и европейского регламента об ИИ (AI Act). Я делаю расшифровку чужих роликов, чтобы понимать рынок, а затем пишу собственный сценарий и делаю собственные звук и видео.
Похожие кейсы
GMBSPYLAB — сбор публичной FB Ad Library в свой канал в Telegram
Асинхронный Python и Postgres 16: 30–75k сырых карточек в сутки, отсев похожих оставляет 5–12k уникальных…
Сквозная атрибуция: от рекламного клика до заказа
Свой сервис на стандартной библиотеке Python принимает вебхуки Shopify, проверяет HMAC, шлёт заказ в трекер и…
Оплаченные заказы Shopify → рабочие таблицы склада
Заказы, номера отправлений, статусы и отмены проставляются сами каждые 30 минут. Приёмник на Advanced Sheets…
Аудит за 9 900 ₽ — с конкретным отчётом и сметой
Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).
Или просто напишите свой вопрос — отвечу в течение 2 часов