Перейти к содержимому
VC
Кейс 10 из 33 · Реклама с оплатой за результат

Из речи в готовый ролик: распознавание, смена языка и синхронизация губ

Один креатив размножается на 5 и более языков и стран автоматически. Whisper расшифровывает речь → GPT-4o переводит и переписывает под рынок и тип покупателя → ElevenLabs воспроизводит голос с нужным акцентом → wav2lip подгоняет движение губ под новую звуковую дорожку. Что раньше требовало студии звукозаписи и неделю работы — теперь делается за вечер.

Отрасль
Реклама с оплатой за результат · партнёрский маркетинг
Стек
Whisper · GPT-4o · ElevenLabs · ffmpeg
Сроки
≈ 5 рабочих дней (первая версия)
Итог
1 видео → 10-30 вариантов
01 · Боль

Спай-данные есть, но руками не масштабируется

В интернет-рекламе сервисы наблюдения за конкурентами (AdHeart, AdSpy, AdsLibrary, Anstrex) дают тысячи работающих рекламных роликов конкурентов — но заимствовать можно только то, что не нарушает авторские права. Голос диктора, фон, лицо актёра, движение губ — всё, что защищено авторским правом, приходится создавать заново.

Раньше всё делалось вручную: смотрю чужой ролик → расшифровываю речь в текст → отдаю копирайтеру переписать под своё предложение → нанимаю диктора через Fiverr → жду 1–3 дня → монтирую в Final Cut → повторяю заново. 4–6 часов работы на одну версию, и это без синхронизации губ.

При бюджетах $2–5 тыс. в день на A/B-тесты скорость выпуска роликов и есть конкурентное преимущество. Когда одновременно идёт 8-10 рекламных наборов и каждому нужно 20-30 свежих креативов в неделю, ручная работа перестаёт справляться.

02 · Решение

Конвейер из четырёх шагов: распознали речь → переписали текст → озвучили → свели с губами

01
РАСПОЗНАВАНИЕ

Whisper расшифровывает видео конкурентов

whisper-large-v3 или OpenAI whisper-1 через API. Поддержка русского, английского, балканских, тюркских, испанского. Выдаёт SRT с таймкодами — знаем точно, на какой секунде какая фраза.

02
МОДЕЛЬ · ПЕРЕВОД

GPT переводит, адаптирует и переписывает под нужного покупателя

GPT-4o делает три задачи в одном проходе: (a) разбирает расшифровку на смысловые блоки — зацепка (первые 3 секунды), боль, доказательство, призыв к действию; (b) переводит на целевой язык (русский / английский / сербский / польский / турецкий) с учётом культурных нюансов — так, как «носитель бы это сказал»; (c) переписывает под нужное предложение, тип покупателя и страну, сохраняя ритм и эмоциональные триггеры оригинала.

Промпты с готовыми примерами «было → стало» для каждого языка и ниши. Главный фокус — сохранить таймкоды: каждая фраза по длительности должна совпадать с оригиналом, иначе движение губ разойдётся со звуком. Выход — 10–30 версий × 5+ языков, отсортированные по ожидаемому отклику аудитории.

03
ОЗВУЧКА · ГОЛОС

ElevenLabs воспроизводит голос с нужным акцентом

ElevenLabs Multilingual v2 поддерживает 29 языков в одной модели — клонированный голос звучит на любом из них с правильным акцентом. Это важно: если оригинальный диктор — американка с южным акцентом, её клон на сербском звучит как естественная сербка-носительница.

Две стратегии: (a) voice cloning — 30-секундного сэмпла достаточно для high-quality клона; (b) готовые голоса для быстрых A/B-тестов по тембру (мужской или женский, возраст, интонация). Настройки стабильности, схожести и стиля подбираются под нишу. На выходе — звуковая дорожка той же длительности с оригиналом (важно для следующего шага).

04
ГУБЫ

wav2lip подгоняет движение губ

На этом этапе появляется «магия» — актриса в видео начинает говорить на новом языке так, будто это сняли заново. wav2lip разбирает исходное видео и новую звуковую дорожку и перерисовывает область рта кадр за кадром, чтобы движение губ совпадало с новой речью. Нужна видеокарта; расчёт занимает часы.

Простой случай (voice-over / off-screen): ffmpeg просто заменяет звуковую дорожку. Сложный случай, когда в кадре говорящий человек: wav2lip или SadTalker для синхронизации лица. На выходе — готовый mp4 под рекламные площадки (FB Ads / TikTok / VK Ads / Yandex Direct).

03 · Стек

Технологии и инфраструктура

Распознавание речи
  • OpenAI Whisper API (whisper-1)
  • whisper-large-v3 на своём сервере — при больших объёмах
  • Разбор субтитров ради точных таймкодов
Работа с моделями
  • GPT-4o / Claude Sonnet 4.5
  • Промпты с примерами «зацепка → переписанный текст»
  • Ответ модели в строгой структуре JSON
Синтез речи
  • ElevenLabs Multilingual v2
  • Воспроизведение голоса — хватает 30-секундного образца
  • Настройки голоса: стабильность, схожесть, стиль
Видео и синхронизация губ
  • ffmpeg для замены звуковой дорожки
  • wav2lip и SadTalker — когда в кадре говорящий человек
  • Управление шагами на Python и очередь задач
04 · Результат

Что меняется в воронке

Время на выпуск
4-6 ч ~30 мин

на один вариант ролика (замена звука, без синхронизации губ)

Объём из 1 видео
1-2 10-30 × 5+

версий × языков (одна актриса → 5+ стран без повторных съёмок)

Цена одного ролика
$40-80 ~$2

Whisper + GPT + ElevenLabs (по тарифам сервисов, без синхронизации губ)

Главный эффект — скорость итерации. A/B-тест 20 вариантов первой фразы вместо двух запускается за вечер. Выигравшие сочетания видно уже в первые 24-48 часов, проигравшие отключаются раньше, чем сожгут бюджет. Установка дешевеет на 15-30% за счёт того, что первая фраза точнее попадает в нужного покупателя.

05 · Вне рекламы

Тот же синтез речи вне рекламы

Шаг озвучки работает отдельно от роликов. Два применения в работе: голосовое уведомление для телефонии и голосовые сообщения в мессенджере от имени руководителя через деловое подключение. Голос в обоих случаях фиксированный и берётся из того же конвейера, поэтому озвучка звучит одинаково во всех каналах.

Порядок фразы на исходящем звонке задан жёстко

Сначала звучит, кто звонит, следом — что разговор записывается. Цель записи в реплике остаётся за скобками. Порядок закреплён в тексте озвучки, поэтому каждый звонок начинается одинаково.

Аудиофайлы собираются из скрипта

В репозиторий коммитится скрипт синтеза, сами файлы пересоздаются за секунды: два файла длительностью 4,0 и 3,2 секунды. В истории изменений остаётся текст реплики.

Голосовой пузырёк рисуется только для одного контейнера

Вид голосового сообщения в мессенджере включается единственным форматом контейнера. Любой другой контейнер приходит получателю обычным файлом, поэтому формат зафиксирован прямо на выходе синтеза.

Разборы с числами остаются текстом

Голосом уходят короткие уведомления. Сводки с числами отправляются текстом: к цифре на экране читатель возвращается взглядом и перечитывает её столько раз, сколько нужно.

Открытый блокер: исходящие звонки

У поставщика телефонии проигрывание аудио доступно в схеме входящего вызова. Вставить готовый файл в исходящий звонок сейчас некуда, запрос в поддержку отправлен.

Бесплатная локальная замена платному синтезу

В стеке кейса стоит платный сервис синтеза, и вопрос «а если без подписки» задаёт каждый второй заказчик. Под замену выбрана модель с лицензией MIT: русский язык поддерживается, голос клонируется с образца в 10 секунд. Две лучшие по звуку модели отпали из-за некоммерческих лицензий. Пока это выбор на бумаге: в рабочем конвейере работает платный сервис.

Гигиена ключей

Ключ платного сервиса перевыпущен взамен того, что попал в лог. У нового ключа права только на синтез речи, остальные методы API для него закрыты, лимит расхода выставлен явно.

06 · Применимость

Где работает, где нет

Подходит
  • · Рекламные агентства, где 5 и более человек делают креативы
  • · Рекламные команды и интернет-магазины с большим потоком креативов
  • · Свой отдел маркетинга интернет-магазина, который регулярно снимает ролики «как от покупателей»
  • · Запуски в 5 и более странах одновременно — все языки из одного исходного сценария
  • · Подкасты и онлайн-школы — для нарезки коротких роликов
Не подходит
  • · Прямое копирование чужих роликов — это нарушение авторских прав
  • · Ниши со строгим регулированием (медицина, фармацевтика, финансы) — там нужны юристы по рекламе
  • · Воспроизведение чужого голоса без согласия его владельца — запрещено законом ЕС об ИИ
  • · Длинные видео от 10 минут — озвучка и монтаж обойдутся не дешевле дорогого живого диктора

Этическая нота: конвейер предназначен для масштабирования собственных идей и оригинальных сценариев. Использование чужих видео и голосов без разрешения — нарушение авторских прав и европейского регламента об ИИ (AI Act). Я делаю расшифровку чужих роликов, чтобы понимать рынок, а затем пишу собственный сценарий и делаю собственные звук и видео.

Готовы начать?

Аудит за 9 900 ₽ — с конкретным отчётом и сметой

Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).

Или просто напишите свой вопрос — отвечу в течение 2 часов