В 2026 году контент перестал быть привязан к одному языку.
Блогеры, small-бизнесы, инфопродюсеры и агентства массово выходят за пределы русскоязычной аудитории. Короткие видео работают намного эффективнее, если ролик понимает не только русскоязычный зритель.
Но нанимать актёра озвучки, переводчика и монтажёра под каждый ролик — дорого и медленно.
Недавно я наткнулся на заказ на Kwork:
— перевести и озвучить 5 коротких видео на английский язык
— сохранить интонацию и характер голоса спикера
— добавить синхронизацию губ
— подготовить субтитры на двух языках
Бюджет — 28 000 ₽.
Раньше такая задача означала: студия озвучки, переводчик, монтажёр, несколько дней согласований.
Переключаться между разными сервисами не всегда удобно, поэтому для тестов я использовал единый интерфейс, который работает без ограничений и где доступны Whisper, ChatGPT, Claude, ElevenLabs и другие модели в одном месте.
Воспользовался токенами для теста и так же пользовался через интерфейс бота с телефона.Так оказалось проще сравнивать ответы и сразу выбирать лучший вариант для конкретной задачи.
Разберу весь процесс пошагово — с конкретными разделами и моделями.
Первый шаг — получить точный текст того, что говорит человек в оригинале.
Открываем раздел "Аудио с ИИ" и выбираем модель Whisper — она заточена именно под распознавание речи с таймкодами.
Загружаем исходное видео и пишем запрос.
Промпт:
Сделай точную транскрибацию речи из этого видео с таймкодами для каждой фразы. Сохрани разговорный стиль речи, не приглаживай формулировки.
Whisper хорошо справляется даже с шумным фоном и быстрой речью — важно только не просить его сразу "причёсывать" текст, иначе потом дубляж звучит неестественно.
Дальше нужен перевод — но не дословный.
Переходим в раздел "Текст с ИИ" и открываем GPT-5. Если текст сложный или с большим количеством нюансов в интонации — можно продублировать запрос через Claude и сравнить результат, какой звучит естественнее.
Промпт:
Переведи текст на английский язык так, как сказал бы носитель языка в разговорной речи. Не переводи дословно, сохраняй смысл и характер высказывания, избегай канцелярских формулировок.
После перевода я обычно прогоняю текст ещё раз с уточняющим запросом:
Промпт:
Адаптируй перевод так, чтобы длина фразы примерно совпадала с длительностью оригинальной реплики по таймкоду.
Это важно для дальнейшей синхронизации — если фраза на английском выйдет заметно длиннее или короче оригинала, синхронизация губ поплывёт.
Это ключевой этап всего процесса.
Возвращаемся в раздел "Аудио с ИИ", но теперь выбираем ElevenLabs — эта модель умеет клонировать голос по короткому референсу и генерировать речь на другом языке, сохраняя тембр и характер подачи.
Загружаем 30-60 секунд чистой речи оригинала как референс голоса, затем вставляем переведённый текст и запускаем генерацию.
Что важно для качественного результата:
— референс должен быть без фонового шума, музыки и посторонних голосов
— минимум 30 секунд речи
— в референсе должна быть живая интонация, а не монотонное чтение
ElevenLabs после этого выдаёт озвучку на английском голосом, максимально похожим на оригинал спикера — с сохранением интонационного рисунка, а не роботизированным тоном.
Финальный технический этап — подгонка движения губ спикера под новую аудиодорожку.
Переходим в раздел "Видео с ИИ" и выбираем модель Sync Labs — она специализируется именно на синхронизации губ под готовую аудиодорожку, а не на генерации видео с нуля.
Загружаем исходное видео и новую озвучку из предыдущего шага, указываем нужный сегмент.
Промпт:
Синхронизируй движение губ спикера с новой аудиодорожкой. Сохрани естественную мимику, не искажай остальные черты лица.
Без этого шага ролик выглядит как обычный закадровый перевод — рот двигается по-русски, а звук идёт на английском, и зритель это сразу считывает. С синхронизацией эффект совершенно другой — видео смотрится как нативно снятое на нужном языке.
Заказчику отдельно нужны были субтитры — часть аудитории всё ещё смотрит с выключенным звуком первые секунды.
Возвращаемся в раздел "Текст с ИИ", открываем GPT-5 и вставляем уже готовую транскрибацию с переводом.
Промпт:
Оформи текст в формат субтитров SRT. Разбей на короткие блоки по 5-7 слов, синхронизированные с таймкодами речи.
Этот шаг занимает буквально пару минут, потому что вся тяжёлая работа сделана на предыдущих этапах.
По шагам:
— транскрибация в Whisper — 5 минут
— перевод и адаптация в GPT-5 — 10 минут
— генерация озвучки в ElevenLabs — 15-20 минут на ролик
— синхронизация губ в Sync Labs — 10-15 минут на ролик
— субтитры — 5 минут
На 5 коротких роликов ушло около трёх часов, включая повторные генерации там, где интонация звучала неестественно с первой попытки.
Заказ на Kwork закрылся на 28 000 ₽.
Почти всё время ушло не на саму генерацию, а на общение с заказчиком и пару правок по интонации после его комментариев. Техническая часть — прогон через Whisper, GPT-5, ElevenLabs и Sync Labs — заняла меньше времени, чем переписка с клиентом.
После нескольких проектов стало понятно: качество зависит не столько от того, какую модель выбрать, сколько от подготовки исходников.
Чем чище звук в референсе для ElevenLabs — тем естественнее звучит клонированный голос.
Чем чётче видно лицо и рот спикера в кадре — тем аккуратнее Sync Labs подгоняет движение губ.
Чем внимательнее адаптирован перевод под разговорную речь на этапе GPT-5 — тем меньше приходится переделывать на этапе озвучки.
Средние расценки на Kwork и Avito Услугах сейчас выглядят так:
— озвучка одного короткого видео (до 60 секунд) — 1500-3000 ₽
— пакет из 5-10 роликов — 15 000-30 000 ₽
— дубляж с синхронизацией губ — на 30-50% дороже обычной озвучки
— субтитры на нескольких языках — 500-1000 ₽ за ролик отдельной услугой
Большинство фрилансеров и агентств пока либо не знают о такой связке инструментов, либо продолжают работать по старой схеме — через студии озвучки и переводчиков-фрилансеров.
При этом спрос на локализацию контента растёт вместе с тем, как всё больше блогеров и брендов пытаются выйти на глобальную аудиторию.
Особенно это заметно в нишах:
— инфобизнес и онлайн-курсы
— travel-блогеры
— эксперты, которые хотят выйти на англоязычную аудиторию
— малый бизнес с продуктами под экспорт
— агентства, которые локализуют рекламные ролики под разные страны
Весь процесс дубляжа сегодня укладывается в связку из четырёх моделей: Whisper для транскрибации, GPT-5 для перевода и субтитров, ElevenLabs для озвучки с сохранением голоса и Sync Labs для синхронизации губ.
Раньше такая задача требовала студию, переводчика и несколько дней работы. Сегодня один человек, который знает, куда нажать и что вставить в запрос, закрывает её за вечер.
И судя по тому, как быстро блогеры и бизнесы выходят на международную аудиторию, спрос на такие услуги будет только расти.