Мы отсняли шесть роликов в FLUX 3 и получили две новости. Хорошая: модель произносит русскую фразу дословно и попадает в артикуляцию, а три заказанных кадра склеивает сама, ровно в тех местах, где мы просили. Плохая: режим «Черновик», который логично считать превью, показал совершенно другое видео. Другой план, другой ракурс, другой вагон за окном. И реплику в нём распознали иначе.
Разбираем по кадрам и по цифрам, благо мерить тут есть что.
FLUX 3 от Black Forest Labs вышла в начале августа. Это нейросеть для видео, которая пишет звук в том же проходе, что и картинку: речь, эффекты, фон. Длительность от 5 до 20 секунд, три режима работы - только по тексту, по кадрам и продолжение готового ролика. Плюс переключатель «Полный рендер» или «Черновик».
Нас интересовали три вопроса, и мы записали их до первой генерации, чтобы потом не подгонять выводы:
Условия зафиксировали и не меняли: 16:9, HD, звук включён, длительность 10 секунд для речи и 15 для многосценки. Промпты не сочиняли - взяли готовые, уже отработавшие у людей, и перевели на русский. Про это скажем отдельно, потому что именно перевод и подложил нам первую свинью.
Критерии оценки тоже записали заранее. Реплика - распозналась ли дословно и определился ли язык как русский. Артикуляция - двигаются ли губы, проверяем по сетке кадров рта, а не по одному стоп-кадру. Сцены - считаем монтажные стыки детектором смены плана. Звук - средний уровень дорожки, ниже минус сорока децибел это уже почти тишина. Черновик против полного - сравниваем кадры на одинаковых секундах.
Первый дубль - объявление в электричке. Промпт описывал говорящего подробно: возраст, форма, фуражка, микрофон у лица. Реплика в кавычках, русская, кириллицей. В конце обязательная строчка про то, что надписей на экране быть не должно.
Приехал ролик 1280 на 704, 24 кадра в секунду, ровно 10,042 секунды. Звук живой, средний уровень минус 23,2 децибела. Распознавание речи определило язык как русский с вероятностью 0,945 и выдало текст почти дословно. Почти - потому что «Курский вокзал» превратился в «Коский вокзал». Двенадцать слов из тринадцати на месте, споткнулось имя собственное.
Артикуляция есть. Мы вырезали область рта и собрали сетку из шестнадцати кадров между первой и пятой секундой: губы двигаются, челюсть работает, фазы меняются на каждом слове. Это ведь не озвученная фотография, это говорящий человек.
А вот сцена оказалась неправдоподобной. Человек в форме объявляет станцию, стоя в проходе среди пассажиров. В России так не делают, объявления идут из кабины машиниста. Мы взяли промпт из чужого гайда, где пример был построен вокруг японской электрички, и перевели его дословно. Язык перевели, а культуру нет.
Перегенерировали с машинистом в кабине. Пульт с индикаторами, микрофон на гибкой ножке, рельсы уходят вперёд сквозь лобовое стекло. И реплика на этот раз распозналась целиком, вместе с «Курским вокзалом», язык русский с вероятностью 0,962. Похоже, чистая служебная связь даётся модели легче, чем голос в гулком вагоне.
Но вылез новый дефект. Промпт просил камеру «позади и сбоку», модель встала строго за спиной. Лица не видно совсем. Достоверность и видимая артикуляция потянули в разные стороны: в вагоне рот видно, но сцена ненастоящая, в кабине сцена настоящая, а проверить губы нечем.
Вывод для практики простой. Если ролик держится на речи, лицо надо требовать в лоб: назвать план, назвать, что говорящий смотрит в объектив или в три четверти, и запретить съёмку со спины.
Второй тест - многосценка. Промпт описывал три кадра подряд: пекарша вынимает противень из печи, крупный план рук с буханкой, она ставит хлеб в корзину у окна. Никаких реплик, только звук.
Детектор смены плана нашёл ровно два стыка, на 5,79 и на 11,0 секунде. То есть три кадра, в заказанном порядке, внутри одной пятнадцатисекундной генерации. Женщина одна и та же во всех трёх, фартук тот же, колпак тот же.
Это сильная сторона модели. Обычно короткий сюжет собирают из трёх отдельных генераций и потом сводят в монтажке, теряя героя на стыках. Здесь же склейки лежат внутри одного файла, и герой держится сам, без костылей.
Со звуком вышло хуже. Промпт расписал три слоя: хлопок дверцы печи, стук по корке, улица за окном. Средний уровень дорожки - минус 45,1 децибела при пике минус 17,4. На бумаге звук есть, на деле его почти не слышно. Для сравнения, в ролике с речью тот же показатель был минус 23,2. Разница в двадцать с лишним децибел это разница между «слышно» и «кажется, показалось».
Вот главный результат теста, и он неприятный.
Мы взяли ровно тот же промпт про электричку, не поменяв ни символа, и переключили тумблер на «Черновик». Дальше сравнили кадры на первой, четвёртой, седьмой и девятой секунде.
Совпало, по сути, только одно: в кадре пожилой мужчина в фуражке. Всё остальное разъехалось, и это бросается в глаза сразу: в полном рендере средний план и весь вагон с синими сиденьями, в черновике почти крупный план головы и плеч. В полном за окном платформа, в черновике рельсы и встречный состав. Пассажиры другие. Свет другой, теплее. Композиция другая.
Речь тоже разошлась. В полном рендере распознали «Следующая станция, Курский вокзал», в черновике - «Следующая станция. Отпуск и вокзал». Один промпт, две разные фразы на выходе.
И третья деталь, которая ломает привычное понимание слова «черновик». Он приехал в тех же 1280 на 704. Разрешение не понижено, файл даже чуть тяжелее полного рендера. То есть это не быстрое превью в низком качестве, это отдельная генерация по тому же описанию.
Что из этого следует. Черновик отвечает на вопрос «модель вообще поняла, что я от неё хочу»: есть ли движение, есть ли речь, тот ли жанр. Он не отвечает на вопрос «как будет выглядеть финал». Планировать по нему раскадровку, согласовывать с клиентом или обещать заказчику «вот такой кадр, только чище» нельзя.
Уточним честно, потому что это важно. У разработчика модели описан механизм, при котором черновик отдаёт служебный слепок, а следующий вызов дорисовывает именно его до полного качества с той же композицией. В интерфейсе, где мы работали, такого второго шага нет. Мы проверили набор доступных полей: там есть только выбор между полным рендером и черновиком, и всё. Поэтому «сделай дёшево, потом дорисуй» здесь пока не работает.
Четвёртый тест мы взяли ради проверки известного приёма: называть не объект, а формат. Промпт был в одну строку - репортаж местных новостей 1987 года о подростках в торговом центре.
Модель собрала целый новостной сюжет. Репортёр с микрофоном, синие плашки внизу экрана, логотип канала в углу, перебивки с фуд-кортом, зернистая картинка, причёски и куртки строго по эпохе. Одна строка вместо абзаца описаний света и камеры.
И один жирный дефект: все титры в кадре по-английски. Промпт русский, надписи английские. Формат «местные новости 1987» намертво связан у модели с американским телевидением, и язык экранной графики приехал вместе с ним.
Чинится добавлением одной фразы: все надписи, плашки и титры на русском языке, кириллицей. Перегенерировали - и получили «МЕСТНЫЕ НОВОСТИ», «ТОРГОВЫЙ ЦЕНТР», «НАТАША, УЧЕНИЦА 10 КЛАССА», «РЕПОРТАЖ МЕСТНЫХ НОВОСТЕЙ». Кириллица чистая, без опечаток и без выдуманных букв, а это до сих пор умеют далеко не все модели.
Заодно сменилась вся фактура. Вместо американского молла приехал позднесоветский универмаг: эскалатор, витрины с обувью, подростки в джинсовках. И кадр сам ужался в 4:3 с чёрными полями по бокам, как настоящее телевещание тех лет. Английская версия так не делала. Одна строка про кириллицу переписала модели и шрифт, и географию.
Собираем в одном месте, потому что именно эта часть экономит время.
Чужой промпт тянет чужую культуру. Дословный перевод даёт сцену, которая для местного зрителя выглядит неправильно. Переводить надо и слова, и обстановку: кто у нас делает объявления, как выглядит форма, где стоит говорящий.
Черновик это не превью. Отдельная генерация с другой композицией. Годится проверить замысел, не годится показывать заказчику.
Русский промпт не переводит надписи в кадре. Язык экранного текста тянется за жанром. Если в ролике будут титры, вывеска или ценник, кириллицу надо требовать отдельной фразой.
Звук может приехать пустым. Три расписанных слоя дали минус 45 децибел. Проверять уровень дорожки надо каждый раз: на слух в шумном офисе это не ловится, а в готовом ролике всплывает.
Задача | Что ставить | На что смотреть
Проверить идею и жанр - Черновик - Есть ли движение, речь, нужное настроение
Финальный кадр в работу - Полный рендер, HD - Композицию заново, она не совпадёт с черновиком
Ролик с русской репликой - Полный рендер, говорящий описан подробно - Дословность фразы и сетку кадров рта
Мини-сюжет из нескольких кадров - Полный рендер, сцены перечислены по порядку - Число стыков детектором смены плана
Титры и надписи в кадре - Любой, плюс фраза про кириллицу - Каждую надпись глазами, буква за буквой
Открываете @gptcyber_bot, жмёте кнопку «Открыть приложение», дальше раздел «Видео» и карточка FLUX 3. Поля там ровно те, о которых шла речь выше: режим, тип рендера, качество, пропорции, звук, длительность и описание. Сохранение настроек и есть запуск генерации, отдельной кнопки нет.
Что стоит держать в голове при первом заходе:
FLUX 3 умеет русскую речь?
Умеет, и реплику надо писать кириллицей прямо в промпте. В нашем тесте фраза из тринадцати слов распозналась целиком, язык определился как русский с вероятностью 0,962. Транслит не нужен.
Чем черновик отличается от полного рендера?
Ценой и временем, но не композицией. Это отдельная генерация: сцена, план и фон у неё свои. Разрешение при этом такое же.
Сколько сцен помещается в одну генерацию?
Мы получили три за пятнадцать секунд, стыки встали ровно там, где просили. Герой между кадрами сохранился без дополнительных настроек.
Нейросеть для видео со звуком - звук отдельно оплачивается?
Нет, дорожка пишется в том же проходе, что и картинка. Но уровень надо проверять: он может приехать почти нулевым.
Почему в кадре английские надписи?
Потому что жанр тянет за собой язык графики. Добавьте в промпт требование кириллицы, и титры станут русскими.
Что делать, если лица говорящего не видно?
Прописывать план и направление взгляда. Формулировки «камера сбоку» модели мало, она может встать строго за спину.
Нейросеть для видео FLUX 3 закрывает две вещи, ради которых раньше собирали связку из трёх сервисов: русская речь с попаданием в губы и несколько кадров в одном файле. Это экономит не деньги, а этап монтажа, что на коротких форматах обычно дороже.
Но работать с ней надо с открытыми глазами. Черновик проверяет замысел, а не картинку. Чужой промпт приносит чужую культуру. Язык надписей приходится задавать руками. Ни один из этих пунктов не написан в анонсе модели. Все четыре вылезли на шести роликах за один вечер, что называется, на ровном месте.
Сами модели живут в боте Cyber AI: FLUX 3, Seedance, Kling, Veo, Wan и ещё два десятка, включая звук и 3D. Заходите и проверяйте на своих сценах, наши выводы легко перепроверить тем же промптом.