Ещё недавно для короткого 3D-мультфильма требовались художник по персонажам, моделлер, аниматор, специалист по свету, монтажёр и несколько недель работы. Сейчас большую часть чернового производства можно собрать иначе: сначала создать персонажа и первый кадр в Nano Banana 2, затем оживить сцену через Seedance 2.5, а после этого собрать отдельные эпизоды в полноценную историю.
Для такого процесса удобно использовать агрегаторы нейросетей. Например, Doitong объединяет генерацию изображений, видео, раскадровку, озвучку и другие инструменты в одном интерфейсе. В Storyboard сервис прямо предлагает зафиксировать единый визуальный стиль — в том числе 3D-анимационную эстетику — и сохранять его между сценами. Для изображений внутри экосистемы доступны Nano Banana 2 и другие модели.
Другой вариант — SYNTX AI. В сервисе собраны десятки моделей для текста, изображений и видео. На текущем сайте SYNTX отдельно представлены Nano Banana 2 и Seedance 2.5, поэтому кадр и его последующую анимацию можно делать в рамках одной платформы.
Ниже разберём полный процесс: от идеи и дизайна героя до первого кадра, промта для Nano Banana 2 и анимации в Seedance 2.5.
Под такой формулировкой обычно имеют в виду не копирование конкретного мультфильма или персонажа, а узнаваемую эстетику современной полнометражной 3D-анимации:
Для собственного проекта лучше создавать оригинальных героев, а не просить нейросеть буквально воспроизводить персонажей известных фильмов. Так проще добиться визуальной последовательности между сценами и безопаснее использовать результат в публичном или коммерческом проекте.
В промтах при этом можно прямо задавать направление вроде stylized cinematic 3D animated feature film, а если задача экспериментальная — дополнительно использовать знакомую формулировку Pixar-style 3D animation.
Я бы не начинал сразу с генерации видео.
Самая частая ошибка — написать в видеонейросеть:
Сделай мультфильм про мальчика, который нашёл робота.
Нейросеть действительно создаст какой-то ролик. Но в следующей сцене мальчик уже будет выглядеть иначе, одежда изменится, робот станет другого размера, а окружающий мир потеряет общий стиль.
Намного стабильнее работать по этапам:
идея → персонаж → эталонный кадр → раскадровка → отдельные сцены → анимация → монтаж.
Именно первый кадр становится визуальным фундаментом всего мультфильма.
Для первого ИИ-мульта не стоит писать сценарий на двадцать минут.
Оптимальный формат для теста — 30–60 секунд.
Например:
Главный герой: мальчик Тим, 10 лет.
Место: маленький прибрежный город.
Завязка: Тим находит старого маленького робота в гараже дедушки.
Развитие: робот внезапно включается и показывает голографическую карту.
Финал: герой понимает, что карта ведёт к неизвестному острову.
У нас уже есть основа для нескольких сцен.
Мальчик заходит в старый гараж.
Замечает коробку.
Достаёт маленького робота.
У робота загораются глаза.
Из груди появляется голографическая карта.
Крупный план удивлённого лица мальчика.
Такой сюжет значительно легче удерживать визуально, чем сразу пытаться генерировать сложную погоню с десятью героями.
Для последовательности персонажа нужно один раз подробно определить его внешность.
Например:
Тим, 10 лет. Худощавый мальчик с круглым лицом, большими зелёными глазами, немного растрёпанными каштановыми волосами. На нём жёлтая толстовка, тёмно-синие джинсы и красные кеды. На левом запястье старые цифровые часы.
Теперь эти признаки желательно сохранять во всех сценах.
Особенно важны:
цвет волос;глаза;одежда;возраст;пропорции;ключевой аксессуар.
Если каждый раз описывать героя по-разному, даже хорошая модель начнёт менять внешность.
Для стартового изображения подходит Nano Banana 2 — модель Google для генерации и редактирования изображений. Google представила Nano Banana 2 в феврале 2026 года как более быструю модель, которая переносит часть возможностей более тяжёлых Pro-моделей в быстрый процесс генерации и итерационного редактирования. Google также рекомендует подробно задавать персонажа, окружение, стиль и настроение изображения.
Через SYNTX модель можно использовать для генерации нового изображения и редактирования исходников; документация платформы также описывает загрузку нескольких изображений и изменение фона, деталей и визуального стиля текстовыми командами.
Я бы использовал английскую версию, потому что в длинных визуальных промтах так проще контролировать терминологию.
Create a cinematic 3D animated feature-film frame in a charming Pixar-inspired style. Main character: Tim, a 10-year-old boy with a slightly round face, large expressive green eyes, soft childlike facial features, and messy medium-brown hair. He is wearing: a mustard-yellow hoodie, dark blue jeans, red sneakers, and an old digital watch on his left wrist. Scene: Tim has just entered his grandfather's old garage near a small coastal town. He stands near the entrance and looks curiously into the room. The garage contains: old wooden shelves, cardboard boxes, vintage tools, an old bicycle, dust particles floating in the air, and a mysterious wooden box partially visible on a workbench in the background. Composition: medium-wide cinematic shot, Tim is positioned slightly left of center, the mysterious wooden box is visible deeper in the frame, the viewer should immediately understand that the box will become important. Lighting: warm late-afternoon sunlight enters through a small side window, soft volumetric light rays, subtle dust particles visible in the light, warm orange highlights and cool blue shadows. Visual style: high-end stylized 3D animated movie, appealing rounded character design, large expressive eyes, detailed fabric, soft skin shading, cinematic global illumination, beautiful depth of field, rich but balanced colors, family animation movie aesthetic. Camera: 35mm cinematic lens, eye-level camera, gentle depth of field, high-quality feature-film composition. Emotion: curiosity, quiet anticipation, a subtle feeling that something magical is about to happen. IMPORTANT: keep the character design clean and consistent, only one boy in the image, no text, no logos, no extra fingers, no distorted hands, no duplicated objects, 16:9 landscape composition.
Главное здесь не слово Pixar, а количество постоянных характеристик.
Мы буквально объяснили модели:
кто герой;
как он выглядит;
во что одет;
где стоит;
что находится вокруг;
какой объект важен для сюжета;
где находится камера;
какой нужен свет;
какое настроение должен испытывать зритель.
Поэтому первый кадр уже выглядит как часть фильма, а не как случайная картинка.
Если персонаж получился удачным, я бы сохранил это изображение как главный character reference.
Не нужно заново генерировать Тима с нуля в каждой сцене.
Дальше можно загружать первый кадр в Nano Banana 2 и писать:
Use the uploaded image as the exact character reference. Keep Tim's face, hairstyle, eye color, body proportions, yellow hoodie, blue jeans, red sneakers and digital watch consistent. Create the next scene...
После этого описывается новое действие.
Таким образом персонаж постепенно переносится из сцены в сцену.
Теперь Тим подходит к коробке.
Промт можно значительно сократить, потому что внешний вид героя уже закреплён референсом:
Use the uploaded image as the exact visual and character reference. Keep the same Tim: same face, same green eyes, same brown messy hair, same yellow hoodie, same jeans, same red sneakers, same body proportions. Create the next cinematic shot. Tim is now standing beside the old wooden workbench. He carefully removes dust from a mysterious wooden box with one hand. His facial expression shows curiosity and slight hesitation. The garage environment must remain visually consistent with the reference image. Keep the same stylized cinematic 3D animated feature-film look, same warm afternoon lighting, same color palette, same materials and atmosphere. Camera: medium shot, slightly closer than the previous scene, 50mm lens, the wooden box is the visual focus. No text. No new characters. 16:9.
Именно такой подход я бы использовал для всей раскадровки.
Необязательно делать изображение для каждой секунды.
Для минутного мультфильма можно подготовить примерно 8–15 ключевых кадров.
Например:
Эти изображения выполняют сразу две функции.
Первая — storyboard.
Вы заранее понимаете, работает ли история визуально.
Вторая — референсы для видео.
Вместо генерации Seedance исключительно по тексту у модели появляется конкретный кадр с уже утверждённым героем.
Doitong особенно интересен именно для многоступенчатых проектов.
Сейчас платформа позиционируется как единая среда для работы с изображениями, видео, голосом и AI-моделями. В Storyboard можно пройти путь от идеи и сценария до отдельных сцен, после чего анимировать их. Платформа также предлагает фиксировать единый визуальный стиль всей истории.
Для мультфильма я бы строил работу так:
Story Idea
Пишем общий сюжет.
↓
Script
Делим историю на короткие сцены.
↓
Character Reference
Создаём персонажа.
↓
Storyboard
Фиксируем ключевые кадры.
↓
Image Generation
Создаём картинки.
↓
Image-to-Video
Оживляем сцены.
↓
Voice
Добавляем диалоги.
↓
Music / SFX
Добавляем музыку и звуковое окружение.
↓
Final Video
Собираем мультфильм.
Преимущество Doitong здесь не в какой-то одной уникальной модели, а именно в связке инструментов.
Когда создаёшь одну картинку — агрегатор не так принципиален.
Когда создаёшь десять сцен, видео, голос и музыку — единый проект становится намного удобнее.
SYNTX подходит для другого варианта рабочего процесса.
Можно самостоятельно контролировать каждую модель:
Nano Banana 2 → первый кадр.
Nano Banana 2 → следующие изображения.
Seedance 2.5 → оживление кадров.
При необходимости можно подключить другие генераторы для отдельных сцен.
SYNTX сейчас заявляет более 100 AI-моделей в одном веб- и Telegram-интерфейсе, а Seedance 2.5 присутствует в актуальном каталоге платформы.
Такой вариант особенно удобен, если вам не требуется полностью автоматический storyboard-процесс и хочется самостоятельно писать промты для каждого кадра.
Когда первый кадр готов, начинается самая интересная часть.
Seedance 2.5 — актуальная видеомодель ByteDance, ориентированная на более длинное повествование и работу с мультимодальными референсами. ByteDance описывает её как модель для 30-секундного storytelling с усиленным контролем референсов и редактированием; в одном проходе она может принимать изображения, видео и аудио в качестве исходных материалов.
Для коротких мультсцен это удобно: вместо попытки за один раз создать всю минуту лучше оживлять отдельные эпизоды.
Загружаем изображение из Nano Banana 2 как reference / first frame.
Дальше используем:
Use the uploaded image as the exact first frame and primary visual reference. Create a cinematic 3D animated movie shot. IMPORTANT: preserve Tim's exact character identity throughout the entire shot: same face, same large green eyes, same messy brown hairstyle, same yellow hoodie, same blue jeans, same red sneakers, same body proportions. Do not redesign the character. Do not change his clothing. Do not change the environment. ACTION: Tim slowly walks two small steps forward into the old garage. He looks around curiously. His eyes briefly move toward the shelves, then he notices the mysterious wooden box on the workbench. His facial expression gradually changes from calm curiosity to focused interest. He slightly tilts his head when he notices the box. Natural subtle blinking. Natural breathing. Small realistic movements of the shoulders and clothing. CAMERA: Start from the exact framing of the reference image. Very slow cinematic dolly-in toward Tim. The camera moves smoothly forward approximately 10–15%. No sudden movement. No camera shake. Maintain natural cinematic parallax between Tim, the shelves and the background. LIGHTING: Preserve the original warm late-afternoon sunlight. Dust particles slowly float through the volumetric light beams. Very subtle movement of light and atmosphere. ANIMATION STYLE: premium stylized 3D animated feature film, smooth physically believable character animation, expressive but restrained facial animation, high-quality family animation aesthetics. TIMING: 0–2 seconds: Tim stands still and looks around the garage. 2–4 seconds: he slowly takes two steps forward. 4–6 seconds: his eyes notice the mysterious box. 6–8 seconds: he slightly turns his head toward it and pauses. ENDING: End with Tim looking directly at the mysterious wooden box. The final frame should naturally prepare the next scene. NO dialogue. NO subtitles. NO text. NO additional characters. NO character morphing. NO face distortion. NO clothing changes. NO duplicated limbs.
Такой промт намного надёжнее обычного:
Мальчик идёт к коробке.
Мы задаём модели не только движение героя, но и режиссуру восьмисекундной сцены.
Для генерации видео полезно думать как режиссёр.
Не просто:
герой открывает дверь.
А:
0–2 сек: герой смотрит на дверь.
2–4 сек: медленно подходит.
4–6 сек: протягивает руку.
6–8 сек: открывает дверь.
Модели легче понять последовательность.
Кроме того, такой подход уменьшает вероятность хаотичных действий.
Есть несколько вещей, которые сразу повышают качество.
В обычном кино герой может несколько секунд просто смотреть на объект.
AI-видео часто портится именно тогда, когда пользователь пытается наполнить движением каждую секунду.
Спокойная сцена:
взгляд;
дыхание;
небольшой поворот головы;
медленное движение камеры
может выглядеть намного профессиональнее постоянных прыжков.
Плохой вариант:
Мальчик подходит, открывает коробку, достаёт робота, робот включается, мальчик пугается, потом они выходят на улицу.
Для одного короткого клипа здесь слишком много событий.
Лучше:
Подходит к коробке.
Открывает коробку.
Видит робота.
Робот включается.
Так появляется монтаж.
И мультфильм становится визуально ближе к настоящему кино.
Не генерируйте весь мульт одинаковыми средними кадрами.
Используйте:
общий план — показывает пространство;
средний план — показывает героя и действие;
крупный план — эмоцию;
деталь — важный предмет.
Например, момент включения робота:
Крупный план металлической головы.
Глаза робота загораются голубым.
Крупный план Тима.
Он отступает назад.
Событие очень простое.
Но монтаж делает его драматичным.
Для второго важного персонажа нужен отдельный reference.
Например:
Create an original small friendly robot character for a cinematic stylized 3D animated feature film. Character design: approximately 45 centimeters tall, compact rounded body, slightly oversized head, two large glowing cyan eyes, white and slightly worn metal panels, small scratches showing age, short mechanical arms, three-finger robotic hands, small wheels hidden under the feet. Personality: curious, friendly, slightly clumsy, emotionally expressive despite being a robot. The design should feel lovable and memorable, with simple readable shapes suitable for consistent animation. Neutral standing pose. Clean studio background. Full body character reference. Front three-quarter view. Soft cinematic lighting. No text. No logos. Original character design.
После этого сохраняем робота точно так же, как Тима.
Для совместной сцены можно использовать два изображения-референса.
Consistency — одна из главных проблем AI-мультов.
Чтобы её уменьшить, во всех промтах повторяем:
Preserve the exact identity of the character.
и:
Use the uploaded image as the primary character reference.
Также сохраняем постоянные детали.
У Тима это:
жёлтая толстовка;
красные кеды;
зелёные глаза;
часы.
У робота:
белый металл;
голубые глаза;
форма головы;
рост.
Человеческий мозг прекрасно замечает изменения персонажа.
Если в одной сцене толстовка горчичная, в другой лимонная, а потом внезапно становится оранжевой — зритель сразу чувствует искусственность.
Не стоит начинать с длинных разговоров.
Первый мульт можно сделать практически без речи.
Например:
Тим:
Кто ты?
Робот:
Я... не помню.
Тим:
Тогда выясним вместе.
Всего три короткие реплики уже создают историю.
Длинные монологи значительно сложнее синхронизировать и удерживать визуально.
Звук очень сильно влияет на восприятие AI-анимации.
Даже хороший визуал без атмосферы может выглядеть как демонстрация генератора.
Добавьте:
скрип двери;
шаги;
шорох одежды;
звук открывающейся коробки;
механический запуск;
электронные сигналы;
лёгкую музыку.
В Doitong голос и sound workflow встроены непосредственно в процесс Storyboard, поэтому озвучивание можно делать в рамках проекта.
Seedance 2.5 также развивает совместное моделирование визуала и аудио, что ByteDance отдельно выделяет среди возможностей модели.
После генерации отдельных видео получается примерно такая структура:
00:00–00:06Герой входит в гараж.
00:06–00:12Замечает коробку.
00:12–00:18Подходит.
00:18–00:23Открывает.
00:23–00:28Робот внутри.
00:28–00:34Глаза робота включаются.
00:34–00:40Реакция мальчика.
00:40–00:48Робот поднимается.
00:48–00:55Появляется карта.
00:55–01:00Финальный кадр.
Получается минутный эпизод.
Причём каждая сцена достаточно простая для видеогенератора.
Я бы разделил их по подходу.
Лучше подходит, если хочется собрать целый production workflow.
Идея.
Сценарий.
Storyboard.
Изображения.
Видео.
Озвучка.
Готовая история.
На платформе действительно предусмотрен Storyboard с фиксацией единого визуального стиля между сценами.
хочется автоматизировать большую часть процесса;
нужно много сцен;
нужно собирать длинные ролики;
не хочется вручную прыгать между большим количеством интерфейсов.
Больше подходит для ручного режиссёрского подхода.
Создал кадр.
Посмотрел.
Переписал промт.
Создал второй.
Загрузил в Seedance.
Настроил движение.
Повторил.
хочется самостоятельно контролировать каждый кадр;
нужно использовать разные модели;
важно быстро переключаться между изображениями и видео;
вы готовы самостоятельно строить раскадровку.
Текущий каталог SYNTX включает и Banana 2, и Seedance 2.5.
Технически современные модели уже способны создавать довольно продолжительные сцены. Seedance 2.5 официально ориентирована на повествование длительностью до 30 секунд за один проход.
Но я бы всё равно не делал минутный сюжет одной генерацией.
Чем больше событий происходит внутри одного клипа, тем сложнее контролировать:
внешность героя;
камеру;
предметы;
последовательность;
эмоции;
монтаж.
AI-мульт лучше воспринимать как настоящее кинопроизводство.
Короткие дубли.
Потом монтаж.
Если каждый кадр начинается с одного только текстового описания, персонаж постепенно меняется.
Решение:
используйте reference image.
Сделай мальчика в стиле Pixar.
Это описание направления, но не сцены.
Добавляйте:
возраст;
лицо;
одежду;
локацию;
свет;
камеру;
эмоцию.
Одна сцена должна содержать одно основное событие.
Так качество обычно выше.
Камера — половина ощущения кино.
Используйте:
slow dolly-in
slow pan
tracking shot
close-up
wide establishing shot
low angle
over-the-shoulder shot
Но не пытайтесь одновременно использовать пять движений камеры.
Настоящий мульт состоит не только из красивых кадров.
Нужны и простые связующие моменты.
Герой смотрит.
Берёт предмет.
Думает.
Идёт.
Останавливается.
Именно они создают историю.
Если хочется использовать собственный сюжет, вот шаблон.
Create the opening frame of a cinematic stylized 3D animated feature film. MAIN CHARACTER: [описание персонажа] CLOTHING: [одежда] LOCATION: [место] SCENE: [что происходит в первом кадре] IMPORTANT STORY OBJECT: [важный объект] COMPOSITION: cinematic 16:9 frame, clear visual hierarchy, professional animated movie composition. LIGHTING: [время суток], cinematic volumetric lighting, soft global illumination, natural shadows. STYLE: high-end stylized 3D family animated feature film, appealing rounded character design, expressive eyes, detailed materials, cinematic depth of field, rich balanced colors. CAMERA: [тип плана], [объектив], [угол]. EMOTION: [эмоция]. IMPORTANT: original character design, consistent anatomy, clean hands, no text, no logos, no duplicated characters.
Use the uploaded image as the exact first frame and primary character reference. Preserve: the exact face, hairstyle, clothing, body proportions, colors, environment, lighting, and visual style. ACTION: 0–2 seconds: [действие] 2–4 seconds: [действие] 4–6 seconds: [действие] 6–8 seconds: [финальное действие] CAMERA: smooth cinematic [camera movement]. Keep the movement subtle and physically believable. Preserve natural facial expressions, blinking, breathing, clothing physics, and environmental motion. Do not redesign the character. Do not change clothes. Do not change facial features. Do not add new characters. No morphing. No distorted hands. No subtitles. No text. End the shot in a composition that naturally leads into the next scene.
Этот шаблон можно использовать практически для каждой сцены мультфильма.
Да — но именно слово «сериал» меняет требования.
Для одного ролика можно простить небольшое изменение героя.
Для десяти эпизодов уже понадобится отдельная система.
Я бы создал для каждого персонажа:
Character Sheet
— лицо;
— вид спереди;
— профиль;
— полный рост;
— одежда;
— эмоции.
Затем:
Environment Sheet
— дом;
— комната;
— улица;
— школа;
— основные декорации.
После этого:
Style Guide
— цвета;
— освещение;
— форма персонажей;
— материалы;
— общий визуальный язык.
Фактически это маленькая AI-анимационная студия.
И именно здесь Doitong со Storyboard или SYNTX с набором моделей становятся намного полезнее одиночного генератора.
Чтобы создать хороший ИИ-мульт в стиле Pixar, не нужно пытаться найти одну волшебную нейросеть.
Работает именно связка.
Nano Banana 2 создаёт персонажей и ключевые изображения. Google позиционирует модель как быстрый современный инструмент генерации и редактирования изображений с улучшенным пониманием сложных инструкций.
Seedance 2.5 превращает изображения в движение и рассчитана на более длинное последовательное повествование с большим количеством визуальных и мультимодальных референсов.
SYNTX AI позволяет использовать эти модели из единого сервиса.
Doitong идёт дальше и предлагает построить вокруг моделей целый Storyboard-процесс: от идеи и сценария до последовательных кадров, видео и звука.
Но главная часть работы всё равно остаётся не в выборе модели.
Она заключается в режиссуре.
Нужно один раз хорошо придумать персонажа.
Зафиксировать его внешность.
Создать сильный первый кадр.
Разбить историю на простые действия.
И только после этого оживлять сцены.
Тогда вместо десяти красивых, но никак не связанных AI-видео начинает появляться настоящий мультфильм — с одним героем, одной визуальной системой и понятной историей.