Нейросеть для видео FLUX 3: русская реплика попала в губы, а черновик показал другую сцену

2026-08-28 16:53:27 Время чтения 16 мин 107

Мы отсняли шесть роликов в FLUX 3 и получили две новости. Хорошая: модель произносит русскую фразу дословно и попадает в артикуляцию, а три заказанных кадра склеивает сама, ровно в тех местах, где мы просили. Плохая: режим «Черновик», который логично считать превью, показал совершенно другое видео. Другой план, другой ракурс, другой вагон за окном. И реплику в нём распознали иначе.

Разбираем по кадрам и по цифрам, благо мерить тут есть что.

Что проверяли и на чём

FLUX 3 от Black Forest Labs вышла в начале августа. Это нейросеть для видео, которая пишет звук в том же проходе, что и картинку: речь, эффекты, фон. Длительность от 5 до 20 секунд, три режима работы - только по тексту, по кадрам и продолжение готового ролика. Плюс переключатель «Полный рендер» или «Черновик».

Нас интересовали три вопроса, и мы записали их до первой генерации, чтобы потом не подгонять выводы:

  1. держит ли модель русскую речь так, чтобы фразу можно было разобрать на слух;
  2. собирает ли она несколько сцен за один проход и не подменяет ли героя между ними;
  3. можно ли по черновику судить о том, что приедет в полном рендере.

Условия зафиксировали и не меняли: 16:9, HD, звук включён, длительность 10 секунд для речи и 15 для многосценки. Промпты не сочиняли - взяли готовые, уже отработавшие у людей, и перевели на русский. Про это скажем отдельно, потому что именно перевод и подложил нам первую свинью.

Критерии оценки тоже записали заранее. Реплика - распозналась ли дословно и определился ли язык как русский. Артикуляция - двигаются ли губы, проверяем по сетке кадров рта, а не по одному стоп-кадру. Сцены - считаем монтажные стыки детектором смены плана. Звук - средний уровень дорожки, ниже минус сорока децибел это уже почти тишина. Черновик против полного - сравниваем кадры на одинаковых секундах.

Русская реплика: двенадцать слов из тринадцати

Первый дубль - объявление в электричке. Промпт описывал говорящего подробно: возраст, форма, фуражка, микрофон у лица. Реплика в кавычках, русская, кириллицей. В конце обязательная строчка про то, что надписей на экране быть не должно.

Приехал ролик 1280 на 704, 24 кадра в секунду, ровно 10,042 секунды. Звук живой, средний уровень минус 23,2 децибела. Распознавание речи определило язык как русский с вероятностью 0,945 и выдало текст почти дословно. Почти - потому что «Курский вокзал» превратился в «Коский вокзал». Двенадцать слов из тринадцати на месте, споткнулось имя собственное.

Артикуляция есть. Мы вырезали область рта и собрали сетку из шестнадцати кадров между первой и пятой секундой: губы двигаются, челюсть работает, фазы меняются на каждом слове. Это ведь не озвученная фотография, это говорящий человек.

А вот сцена оказалась неправдоподобной. Человек в форме объявляет станцию, стоя в проходе среди пассажиров. В России так не делают, объявления идут из кабины машиниста. Мы взяли промпт из чужого гайда, где пример был построен вокруг японской электрички, и перевели его дословно. Язык перевели, а культуру нет.

Перегенерировали с машинистом в кабине. Пульт с индикаторами, микрофон на гибкой ножке, рельсы уходят вперёд сквозь лобовое стекло. И реплика на этот раз распозналась целиком, вместе с «Курским вокзалом», язык русский с вероятностью 0,962. Похоже, чистая служебная связь даётся модели легче, чем голос в гулком вагоне.

Но вылез новый дефект. Промпт просил камеру «позади и сбоку», модель встала строго за спиной. Лица не видно совсем. Достоверность и видимая артикуляция потянули в разные стороны: в вагоне рот видно, но сцена ненастоящая, в кабине сцена настоящая, а проверить губы нечем.

Вывод для практики простой. Если ролик держится на речи, лицо надо требовать в лоб: назвать план, назвать, что говорящий смотрит в объектив или в три четверти, и запретить съёмку со спины.

Машинист в кабине: реплика распозналась целиком, язык русский с вероятностью 0,962

Три сцены за один проход

Второй тест - многосценка. Промпт описывал три кадра подряд: пекарша вынимает противень из печи, крупный план рук с буханкой, она ставит хлеб в корзину у окна. Никаких реплик, только звук.

Детектор смены плана нашёл ровно два стыка, на 5,79 и на 11,0 секунде. То есть три кадра, в заказанном порядке, внутри одной пятнадцатисекундной генерации. Женщина одна и та же во всех трёх, фартук тот же, колпак тот же.

Это сильная сторона модели. Обычно короткий сюжет собирают из трёх отдельных генераций и потом сводят в монтажке, теряя героя на стыках. Здесь же склейки лежат внутри одного файла, и герой держится сам, без костылей.

Со звуком вышло хуже. Промпт расписал три слоя: хлопок дверцы печи, стук по корке, улица за окном. Средний уровень дорожки - минус 45,1 децибела при пике минус 17,4. На бумаге звук есть, на деле его почти не слышно. Для сравнения, в ролике с речью тот же показатель был минус 23,2. Разница в двадцать с лишним децибел это разница между «слышно» и «кажется, показалось».

Три кадра внутри одной генерации, стыки на 5,79 и 11,0 секунде

Черновик, которому нельзя верить

Вот главный результат теста, и он неприятный.

Мы взяли ровно тот же промпт про электричку, не поменяв ни символа, и переключили тумблер на «Черновик». Дальше сравнили кадры на первой, четвёртой, седьмой и девятой секунде.

Совпало, по сути, только одно: в кадре пожилой мужчина в фуражке. Всё остальное разъехалось, и это бросается в глаза сразу: в полном рендере средний план и весь вагон с синими сиденьями, в черновике почти крупный план головы и плеч. В полном за окном платформа, в черновике рельсы и встречный состав. Пассажиры другие. Свет другой, теплее. Композиция другая.

Речь тоже разошлась. В полном рендере распознали «Следующая станция, Курский вокзал», в черновике - «Следующая станция. Отпуск и вокзал». Один промпт, две разные фразы на выходе.

И третья деталь, которая ломает привычное понимание слова «черновик». Он приехал в тех же 1280 на 704. Разрешение не понижено, файл даже чуть тяжелее полного рендера. То есть это не быстрое превью в низком качестве, это отдельная генерация по тому же описанию.

Что из этого следует. Черновик отвечает на вопрос «модель вообще поняла, что я от неё хочу»: есть ли движение, есть ли речь, тот ли жанр. Он не отвечает на вопрос «как будет выглядеть финал». Планировать по нему раскадровку, согласовывать с клиентом или обещать заказчику «вот такой кадр, только чище» нельзя.

Уточним честно, потому что это важно. У разработчика модели описан механизм, при котором черновик отдаёт служебный слепок, а следующий вызов дорисовывает именно его до полного качества с той же композицией. В интерфейсе, где мы работали, такого второго шага нет. Мы проверили набор доступных полей: там есть только выбор между полным рендером и черновиком, и всё. Поэтому «сделай дёшево, потом дорисуй» здесь пока не работает.

Формат тянет за собой язык

Четвёртый тест мы взяли ради проверки известного приёма: называть не объект, а формат. Промпт был в одну строку - репортаж местных новостей 1987 года о подростках в торговом центре.

Модель собрала целый новостной сюжет. Репортёр с микрофоном, синие плашки внизу экрана, логотип канала в углу, перебивки с фуд-кортом, зернистая картинка, причёски и куртки строго по эпохе. Одна строка вместо абзаца описаний света и камеры.

И один жирный дефект: все титры в кадре по-английски. Промпт русский, надписи английские. Формат «местные новости 1987» намертво связан у модели с американским телевидением, и язык экранной графики приехал вместе с ним.

Чинится добавлением одной фразы: все надписи, плашки и титры на русском языке, кириллицей. Перегенерировали - и получили «МЕСТНЫЕ НОВОСТИ», «ТОРГОВЫЙ ЦЕНТР», «НАТАША, УЧЕНИЦА 10 КЛАССА», «РЕПОРТАЖ МЕСТНЫХ НОВОСТЕЙ». Кириллица чистая, без опечаток и без выдуманных букв, а это до сих пор умеют далеко не все модели.

Заодно сменилась вся фактура. Вместо американского молла приехал позднесоветский универмаг: эскалатор, витрины с обувью, подростки в джинсовках. И кадр сам ужался в 4:3 с чёрными полями по бокам, как настоящее телевещание тех лет. Английская версия так не делала. Одна строка про кириллицу переписала модели и шрифт, и географию.

После строки про кириллицу: титры русские, фактура советская, кадр сам стал 4:3

Где ломается: четыре сбоя подряд

Собираем в одном месте, потому что именно эта часть экономит время.

Чужой промпт тянет чужую культуру. Дословный перевод даёт сцену, которая для местного зрителя выглядит неправильно. Переводить надо и слова, и обстановку: кто у нас делает объявления, как выглядит форма, где стоит говорящий.

Черновик это не превью. Отдельная генерация с другой композицией. Годится проверить замысел, не годится показывать заказчику.

Русский промпт не переводит надписи в кадре. Язык экранного текста тянется за жанром. Если в ролике будут титры, вывеска или ценник, кириллицу надо требовать отдельной фразой.

Звук может приехать пустым. Три расписанных слоя дали минус 45 децибел. Проверять уровень дорожки надо каждый раз: на слух в шумном офисе это не ловится, а в готовом ролике всплывает.

Четыре сбоя, которые вылезли на шести дублях

Матрица: какой режим под какую задачу

Задача | Что ставить | На что смотреть

Проверить идею и жанр - Черновик - Есть ли движение, речь, нужное настроение

Финальный кадр в работу - Полный рендер, HD - Композицию заново, она не совпадёт с черновиком

Ролик с русской репликой - Полный рендер, говорящий описан подробно - Дословность фразы и сетку кадров рта

Мини-сюжет из нескольких кадров - Полный рендер, сцены перечислены по порядку - Число стыков детектором смены плана

Титры и надписи в кадре - Любой, плюс фраза про кириллицу - Каждую надпись глазами, буква за буквой

Сводка по шести дублям

Как повторить

Открываете @gptcyber_bot, жмёте кнопку «Открыть приложение», дальше раздел «Видео» и карточка FLUX 3. Поля там ровно те, о которых шла речь выше: режим, тип рендера, качество, пропорции, звук, длительность и описание. Сохранение настроек и есть запуск генерации, отдельной кнопки нет.

Что стоит держать в голове при первом заходе:

  1. в промпте называйте длительность словами, «10-секундный кадр» модель читает как указание;
  2. говорящего описывайте внешностью и одеждой, иначе модель либо придумает лицо, либо запечёт субтитры вместо звука;
  3. реплику пишите в кавычках и по-русски, а в конце добавляйте запрет надписей и субтитров;
  4. звук расписывайте слоями от главного к фоновому, музыку модель сама не добавляет;
  5. сцены перечисляйте по порядку и явно, «кадр первый», «кадр второй».

Частые вопросы

FLUX 3 умеет русскую речь?

Умеет, и реплику надо писать кириллицей прямо в промпте. В нашем тесте фраза из тринадцати слов распозналась целиком, язык определился как русский с вероятностью 0,962. Транслит не нужен.

Чем черновик отличается от полного рендера?

Ценой и временем, но не композицией. Это отдельная генерация: сцена, план и фон у неё свои. Разрешение при этом такое же.

Сколько сцен помещается в одну генерацию?

Мы получили три за пятнадцать секунд, стыки встали ровно там, где просили. Герой между кадрами сохранился без дополнительных настроек.

Нейросеть для видео со звуком - звук отдельно оплачивается?

Нет, дорожка пишется в том же проходе, что и картинка. Но уровень надо проверять: он может приехать почти нулевым.

Почему в кадре английские надписи?

Потому что жанр тянет за собой язык графики. Добавьте в промпт требование кириллицы, и титры станут русскими.

Что делать, если лица говорящего не видно?

Прописывать план и направление взгляда. Формулировки «камера сбоку» модели мало, она может встать строго за спину.

Что в итоге

Нейросеть для видео FLUX 3 закрывает две вещи, ради которых раньше собирали связку из трёх сервисов: русская речь с попаданием в губы и несколько кадров в одном файле. Это экономит не деньги, а этап монтажа, что на коротких форматах обычно дороже.

Но работать с ней надо с открытыми глазами. Черновик проверяет замысел, а не картинку. Чужой промпт приносит чужую культуру. Язык надписей приходится задавать руками. Ни один из этих пунктов не написан в анонсе модели. Все четыре вылезли на шести роликах за один вечер, что называется, на ровном месте.

Сами модели живут в боте Cyber AI: FLUX 3, Seedance, Kling, Veo, Wan и ещё два десятка, включая звук и 3D. Заходите и проверяйте на своих сценах, наши выводы легко перепроверить тем же промптом.

Попробовать модели можно тут: TG | MAX