ByteDance научила Seedance 2.5 генерировать длинные сцены со звуком, несколькими планами и десятками референсов. Разбираю на примерах, как использовать таймкоды, изображения и режиссёрские инструкции.
Я довольно давно работаю с генерацией видео и заметил одну закономерность: каждый большой релиз нейросети для видео сначала выглядит как революция, а через пару недель интернет заполняется одинаковыми роликами.
Красивая девушка идёт по неоновому Токио. Камера медленно приближается. Где-то идёт дождь. В комментариях обсуждают, какая нейросеть это сделала.
С Seedance 2.5 мне интереснее другое.
ByteDance добавила возможность генерировать до 30 секунд видео со звуком за один проход, при этом модель может работать с несколькими связанными действиями, сменой планов и последовательностью событий.
Для маркетинга это намного интереснее очередного прироста детализации.
Потому что 30 секунд — это уже не просто «оживить картинку».
Это короткий рекламный ролик, мини-сцена, демонстрация продукта или эпизод, который можно использовать как часть полноценного видео.
И вместе с этим меняется подход к промптам.
Переключаться между разными сервисами не удобно, поэтому для тестов я использовал единый интерфейс, который работает в России и без всяких обходов, где доступны Seedance 2.5, GPT Image 2, Claude, Nano Banana Pro и другие модели в одном месте.
Воспользовался токенами для теста и так же пользовался через интерфейс бота с телефона.
У коротких генераторов есть очевидная проблема.
Вы создаёте пять секунд. Потом ещё пять. Потом пытаетесь соединить их.
В одном кадре персонаж в одной куртке, в следующем уже в другой. Лицо немного изменилось. Свет стал другим. Камера внезапно оказалась в совершенно другом месте.
В итоге нейросеть превращается не в режиссёра, а в генератор отдельных кадров, которые потом приходится спасать монтажом.
Длинная генерация сама по себе проблему не решает. Если просто написать:
Девушка идёт по футуристическому Токио ночью, cinematic, neon lights, realistic.
нейросеть действительно может сделать красивый ролик.
Но вы практически не контролируете, что произойдёт на пятой, десятой или двадцатой секунде.
А именно здесь Seedance 2.5 становится интереснее.
Вместо описания одного кадра можно задать последовательность событий:
0–5 секунд — одно действие.
5–12 секунд — следующее.
12–20 секунд — развитие сцены.
20–30 секунд — финал.
Получается уже не промпт для картинки, а небольшой режиссёрский сценарий.
Есть простое правило, которое я бы вообще вынес отдельно:
не описывайте текстом то, что можно показать референсом.
Если у вас есть фотография продукта — загрузите её.
Если есть фотография персонажа — загрузите её.
Если есть пример нужной локации — тоже загрузите.
Текст лучше оставить для того, чего изображение не объясняет:
Получается примерно такая формула:
референсы → стиль → действия по времени → камера → звук → ограничения.
И это намного удобнее, чем пытаться написать огромный промпт, описывающий каждую деталь персонажа.
Для теста можно загрузить две фотографии одного персонажа. Если есть подходящий референс локации — добавить его.
Промпт: Изображения @Image1 и @Image2 показывают одного и того же персонажа. Сохраняй его внешность, черты лица, пропорции тела, причёску и одежду неизменными на протяжении всей сцены. Кинематографичная ночная сцена в большом азиатском мегаполисе после сильного дождя. Реалистичная съёмка, мокрый асфальт, отражения вывесок в лужах, лёгкий туман, естественный свет от витрин и уличных фонарей. Атмосфера напряжённого неонуара. Реалистичная физика движения и воды. Никакого текста и логотипов в кадре. 0–6 секунд: широкий план ночной улицы. Персонаж выходит из небольшого круглосуточного магазина и останавливается под навесом. Камера медленно приближается к нему с противоположной стороны улицы. На переднем плане проезжают машины, их свет отражается в мокром асфальте. 6–13 секунд: персонаж замечает кого-то вдалеке и резко поворачивает голову. Камера плавно переходит на средний план и начинает двигаться рядом с ним. Он быстро идёт по улице, обходя прохожих. Движения естественные, без замедления. 13–20 секунд: персонаж сворачивает в узкий переулок. Камера следует за ним со спины, затем плавно обходит сбоку. Свет становится холоднее. В глубине переулка виден человек под красным зонтом. 20–26 секунд: персонаж останавливается. Камера медленно делает полукруг вокруг него и переводит фокус с его лица на человека с красным зонтом. В этот момент городской шум постепенно стихает. 26–30 секунд: крупный план лица персонажа. Он узнаёт человека впереди, слегка меняется выражение глаз. Камера очень медленно приближается. Финальный кадр удерживается на лице две секунды. Звук: естественный шум дождя, редкие автомобили, далёкие голоса прохожих и гул города. В конце городской шум постепенно становится тише. Музыки нет. Сохраняй внешность персонажа, одежду, освещение сцены и геометрию пространства последовательными во всех планах. Движения камеры плавные и физически правдоподобные.
Здесь принципиально важно не само количество текста.
Важна последовательность.
Мы объяснили модели не только, что должно находиться в кадре, но и что должно произойти за следующие 30 секунд.
Представим, что нужно сделать рекламный ролик духов.
Можно написать:
Прозрачный прямоугольный стеклянный флакон с золотой крышкой, чёрной этикеткой, матовой поверхностью...
А можно просто загрузить фотографию продукта.
Второй вариант намного практичнее.
Референс отвечает за внешний вид.
Промпт — за режиссуру.
Это особенно важно для коммерческого видео, где изменение упаковки между кадрами может полностью испортить результат.
Загрузите фотографию продукта и, если нужно, один референс визуального стиля.
@Image1 является точным референсом продукта. Сохраняй форму, материал, пропорции, цвет упаковки и все основные визуальные особенности продукта во всех кадрах. Премиальная рекламная съёмка косметического продукта в минималистичной студии. Тёмная каменная поверхность, мягкий направленный свет, лёгкий туман в воздухе, реалистичные отражения и фактура материалов. Чистая коммерческая эстетика, высокая детализация, естественная физика жидкостей и света. 0–5 секунд: экстремально крупный план поверхности продукта. Камера медленно движется вдоль материала, показывая фактуру и блики. Пока не показывать продукт целиком. 5–11 секунд: камера плавно отдаляется. Продукт полностью появляется в центре композиции. За ним медленно проходит мягкий луч света, подчёркивая форму упаковки. 11–17 секунд: камера начинает плавный облет продукта справа налево примерно на 90 градусов. На поверхности рядом появляются несколько капель воды. Они естественно скатываются по камню.17–23 секунды: одна крупная капля падает рядом с продуктом в замедленном движении. От удара расходятся мелкие капли. Камера быстро приближается к продукту через водяной всплеск. 23–27 секунд: переход через отражение в стекле. Продукт оказывается на чистом светлом фоне. Камера медленно поднимается снизу вверх.27–30 секунд: статичный финальный рекламный кадр. Продукт находится по центру, полностью в фокусе. Мягкий контровой свет подчёркивает силуэт. Оставить свободное пространство вокруг продукта для дальнейшего добавления текста на монтаже. Звук: тихая студийная атмосфера, мягкие звуки движения воздуха и воды, глубокий короткий звуковой акцент в момент падения капли. Без речи и фоновой музыки. Не изменять дизайн продукта. Не добавлять надписи, логотипы или дополнительные элементы упаковки. Сохранять реалистичную физику материалов, воды, отражений и света.
Такой шаблон можно адаптировать под косметику, часы, напитки, электронику, обувь и практически любой физический продукт.
Меняется референс и режиссура, а сама логика промпта остаётся.
Одна из самых частых ошибок в AI-видео — написать:
cinematic camera movement
и ждать, что нейросеть сама поймёт, что именно вы хотите.
Иногда понимает.
Иногда получается красивое видео, но камера ведёт себя совершенно не так, как нужно для рекламы.
Поэтому лучше писать конкретно:
камера медленно приближается; следует за героем со спины; переходит с общего плана на средний; обходит персонажа справа; делает полукруг; плавно переводит фокус с продукта на фон.
Чем точнее описано движение, тем меньше решений модель принимает самостоятельно.
И это особенно важно в коммерческом видео.
В рекламном ролике движение камеры — не украшение. Оно должно помогать показать продукт.
Теперь более простой тест.
Берём обычный портрет и заставляем персонажа выполнить несколько естественных действий.
Используй @Image1 как точный референс внешности персонажа. Сохраняй черты лица, возраст, причёску, одежду и пропорции без изменений. Реалистичная кинематографичная сцена. Персонаж находится у большого окна в кафе вечером. За стеклом идёт дождь, в окне отражаются огни города. Мягкий естественный свет падает сбоку.0–4 секунды: персонаж спокойно смотрит в окно. Движения минимальные и естественные: дыхание, лёгкое движение волос, редкое моргание. Камера почти неподвижна.4–8 секунд: персонаж медленно переводит взгляд в сторону камеры, но ещё не смотрит прямо в объектив. Камера очень плавно приближается.8–12 секунд: персонаж поворачивает голову к камере и смотрит прямо в объектив. Выражение лица остаётся спокойным и естественным.12–16 секунд: появляется едва заметная улыбка. Никакой преувеличенной мимики. Камера продолжает медленное приближение.16–20 секунд: персонаж снова переводит взгляд за окно. Фокус камеры плавно переходит с лица на капли дождя на стекле.Сохраняй лицо максимально стабильным. Не менять форму глаз, губ, носа и подбородка. Избегать резких движений головы, чрезмерной улыбки и театральной мимики. Естественная человеческая пластика.Звук: приглушённый шум кафе, тихий дождь за окном, редкие машины на улице. Без музыки.
Последние ограничения здесь не случайны.
Генеративные модели любят преувеличивать действия. Просишь человека слегка улыбнуться — иногда получаешь улыбку ведущего рекламного ролика зубной пасты.
Поэтому ограничения — такая же часть промпта, как и само действие.
Можно.
Я бы не переводил каждый промпт на английский просто ради английского языка.
Гораздо важнее структура:
Если для конкретного операторского приёма английский термин понятнее, его можно оставить.
Но хороший русский сценарный промпт будет полезнее плохого английского промпта, составленного из набора модных слов.
Для обычного пользователя генерация 30-секундной сцены — просто интересный эксперимент.
Для бизнеса возможностей больше.
Например:
Реклама продукта. Продукт появляется в кадре, камера показывает детали, затем происходит действие и в конце остаётся чистый packshot.Реклама услуги. Показываем проблему, героя, решение и результат в одной последовательности.Контент для Коротких роликов. Не нужно собирать каждый пятёрхсекундный фрагмент отдельно.Презентация нового продукта. Можно показать несколько характеристик в одной визуальной истории.Mood-видео для бренда. Несколько планов, единая цветовая среда и один персонаж могут находиться внутри одной генерации.
И здесь становится понятно, почему возможность держать сцену 30 секунд важнее очередного заявления «теперь ещё реалистичнее».
Если нужно быстро написать запрос для Seedance 2.5, я бы использовал такую последовательность:
1. Референс
Что именно модель должна сохранить из загруженного изображения.
2. Общая сцена
Где мы находимся, какое время суток, какой визуальный стиль.
3. Таймлайн
Что происходит в каждом временном отрезке.
4. Камера
Как она движется и какие планы использует.
5. Звук
Речь, окружение, музыка или отсутствие музыки.
6. Ограничения
Что нельзя изменять, какие артефакты нужно исключить, что должно остаться стабильным.
Получается довольно простой шаблон:
Что вижу → что происходит → когда происходит → как снимаем → что слышим → что нельзя менять.
Для длинной генерации этого обычно достаточно, чтобы перестать заставлять модель угадывать половину режиссуры.
Seedance 2.5 умеет работать с большим количеством входных материалов, включая изображения, видео и аудио.
Это полезно, когда у вас действительно сложная сцена.
Но возможность загрузить много файлов не означает, что нужно загружать много файлов.
Если для рекламного ролика достаточно:
на этом можно остановиться.
Чем больше материалов, тем больше вероятность, что вы сами создадите противоречия.
Один хороший референс продукта лучше пяти похожих фотографий с разным освещением.
Главный сдвиг Seedance 2.5 для меня не в самом числе «30 секунд».
Раньше мы чаще думали кадрами:
Вот изображение. Теперь оживим изображение. Теперь сделаем следующий кадр. Теперь попробуем их соединить.
Сейчас появляется возможность думать сценой целиком.
У героя есть действие.
У камеры есть маршрут.
У истории есть начало и конец.
У звука есть развитие.
И всё это можно описать одним запросом.
Это уже гораздо ближе к работе режиссёра, чем к генерации отдельных картинок.
Возьмите одну фотографию человека или один снимок продукта.
Не начинайте с огромного сценария.
Сделайте ролик на 15–20 секунд и разделите его на четыре части.
Например:
0–5 секунд — знакомство со сценой. 5–10 секунд — основное действие. 10–15 секунд — развитие. 15–20 секунд — финальный кадр.
Для каждого отрезка напишите одно действие и отдельно укажите движение камеры.
После первой генерации смотрите не только на качество картинки.
Проверяйте:
сохранился ли персонаж;
не изменился ли продукт;
понимает ли модель последовательность событий;
не скачет ли камера; не ломается ли физика;
соответствует ли финал тому, что было задумано.
Если проблема только в одном эпизоде, не обязательно переписывать весь промпт.
Меняйте конкретный отрезок и повторяйте генерацию.
Если хочется повторить эти примеры, модель можно протестировать в сервисах, которые дают к ней доступ через единый интерфейс.
Но сам сервис здесь вторичен.
Гораздо важнее освоить принцип работы с моделью: референс вместо длинного описания внешности, таймкоды вместо списка несвязанных действий и конкретная режиссура вместо слова cinematic.
Потому что хорошее AI-видео всё меньше похоже на результат случайного запроса.
И всё больше — на результат нормального технического задания.
30 секунд сами по себе хороший апдейт. Но настоящий апгрейд начинается тогда, когда вы перестаёте просить нейросеть «сделать красивый ролик» и начинаете объяснять ей, что именно должно произойти перед камерой.