WAN — одна из самых известных open-source-моделей для генерации видео. Кроме генерации роликов с нуля, её используют для анимации персонажей, редактирования готового видео и сборки локальных пайплайнов через Hugging Face, GitHub и ComfyUI.
От Kling, Runway, Pika и похожих сервисов WAN отличает сама модель распространения: команда не предлагает закрытый продукт, а выкладывает нейросети в открытый доступ — их можно скачать, запустить локально и дообучить под нужную задачу. У WAN есть официальные релизы моделей, хранилища с датасетами и скриптами, набор версий на Hugging Face для тестов и скачивания, а также сборки для локального запуска, например через Diffusers.
Дальше разберём, что умеет WAN, в каких сценариях модель раскрывается лучше всего, как составлять промпты и — самое важное для российской аудитории — как получить доступ к этой нейросети из России.
Под названием WAN, или Wan2.x, скрывается семейство крупных видеогенеративных моделей, которое связывают с Alibaba и командой Wan. В открытой экосистеме представлены версии Wan2.1 и Wan2.2, а также отдельные модели под text-to-video, image-to-video, video-to-video, анимацию, S2V и варианты для Diffusers. На странице Wan-AI на Hugging Face собраны отдельные коллекции для Wan2.1, Wan2.2 и Wan2.2-diffusers.
Научный отчёт о WAN характеризует нейросеть как открытую серию крупномасштабных видеогенеративных моделей. В линейке две основные конфигурации: компактная — на 1,3 миллиарда параметров, и более тяжёлая — на 14 миллиардов. Версию на 1,3B обычно запускают на стандартных игровых видеокартах, а версия на 14B даёт заметно более качественное видео, но и требует значительно более мощного оборудования.
Здесь важно понимать: WAN — это не один сайт с единым интерфейсом, а набор моделей и способов их запуска. Кто-то открывает готовый веб-интерфейс и за пару минут превращает картинку в короткое видео. Кто-то разворачивает модель у себя, встраивает её в ComfyUI и строит собственный pipeline для серийной генерации контента.
То, как выглядит интерфейс, зависит от площадки: официальный сайт, сторонний веб-сервис, Hugging Face, ComfyUI или локальный запуск. Логика работы при этом почти везде совпадает: выбрать режим, написать промпт, настроить формат ролика и запустить генерацию.
В типичном веб-интерфейсе можно выделить несколько зон:
- Free (бесплатно)
Подойдёт для первого знакомства с сервисом и нерегулярных задач. В тарифе:
- Pro ($5 в месяц при годовой оплате со скидкой 50%, иначе $10 в месяц)
Самый востребованный тариф — баланс цены и расширенного функционала:
- Premium ($20 в месяц при годовой оплате со скидкой 50%, иначе $40 в месяц)
Тариф для активной коммерческой работы:
Стоит держать в уме несколько моментов. Годовая оплата сразу даёт скидку 50%, заметно снижая ежемесячные траты. Кредиты ускоряют обработку сложных запросов — чем их больше в запасе, тем быстрее генерация. Неограниченная генерация без кредитов есть на всех тарифах, но идёт через стандартную очередь, поэтому работает медленнее, чем при использовании кредитов.
Есть пять рабочих путей:
WAN работает в нескольких режимах, и смешивать их не стоит: каждый заточен под свою задачу и требует отдельного подхода к промпту.
Text-to-videoГенерация видео из текстового описания: пользователь задаёт сцену, действие, камеру, свет, стиль и ограничения, модель собирает короткий ролик.
Хорошо работает для визуальных концептов, коротких сцен, mood-видео, фонов, b-roll, рекламных черновиков, превизов, идей для Reels, Shorts и Telegram, а также для проверки визуального направления перед съёмкой.
Хуже справляется, если нужно сохранить конкретного персонажа, точный продукт, фирменный стиль или композицию — модель сама придумывает кадр, и результат может выглядеть красиво, но не совпасть с задачей.
Пример промпта: «Чёрный электромобиль едет по мокрой ночной улице, отражения неоновых вывесок на асфальте, медленное движение камеры сбоку, реалистичный стиль, кинематографичный свет, без текста, без логотипов, без деформации колёс».
Image-to-videoСамый полезный режим для большинства креаторов: сначала создаётся или загружается исходный кадр, а WAN добавляет ему движение.
Здесь контроля больше, чем в text-to-video: композиция, персонаж, продукт, фон, цвет, стиль и ракурс уже заданы изображением, а модель отвечает преимущественно за движение.
Подходит для оживления портретов, product shot, анимированных обложек, motion-креативов, оживления изображений из Midjourney, Flux или Stable Diffusion, коротких видео для соцсетей, заставок, рекламных тестов, оживления concept art и лёгкого движения камеры в статичной сцене.
Пример промпта: «Оживи исходное изображение: камера медленно приближается, волосы слегка двигаются от ветра, фон остаётся стабильным, лицо не менять, одежду не менять, стиль и композицию сохранить».
Главное правило: если важен контроль над результатом, стартовать стоит не с text-to-video, а с сильного исходного изображения — чем точнее первый кадр, тем меньше пространства для додумок у модели.
Video-to-video и редактированиеПодходит, когда ролик уже снят, но требуется сменить стиль, усилить движение, сделать вариацию сцены или преобразовать видео в другой визуальный формат.
В Wan2.2 на Hugging Face есть направления Animate и video-to-video, а в экосистеме Wan упоминается instruction-guided video editing — модель получает видео и инструкцию, что именно нужно изменить.
Используется для стилизации ролика, чернового превиза, изменения атмосферы, создания вариаций, анимации персонажа, теста движения перед продакшном и для того, чтобы сделать слабое статичное видео более выразительным.
Этот режим требует контроля: модель легко меняет больше, чем планировалось — лицо, одежду, фон, пропорции, фактуру объекта. Поэтому в промпте нужно прямо прописывать, что должно остаться неизменным.
Пример: «Сохрани композицию, лицо, одежду и положение персонажа. Измени только стиль света: сделать сцену более холодной, добавить мягкий контровой свет, не менять фон и пропорции тела».
AnimateWan2.2-Animate отвечает за анимацию и video-to-video-сценарии, в первую очередь — за персонажную анимацию, оживление поз, движение тела, сцены с человеком и контролируемую анимацию. Запрос вроде «сделай красивый ролик» здесь не работает — нужно прописывать конкретику: что движется, что остаётся стабильным, какие элементы запрещено менять.
Пример: «Анимируй персонажа: лёгкий поворот головы вправо, моргание, небольшое движение плеч, камера статична, фон не менять, лицо и причёску сохранить».
S2VWan2.2-S2V — направление Speech-to-Video и audio-driven digital human video: портретное фото превращается в аватара, который говорит, поёт и двигается.
Это уже не просто оживление картинки — S2V нужен там, где есть изображение человека и аудио: аватар, речь, пение, lip-sync, цифровой ведущий, обучающий ролик, презентационный формат.
Типичные применения: говорящий аватар, обучающее видео, ролик с ведущим, digital human для продукта, тест персонажа перед продакшном, локализация ролика с новым голосом, прототип видеоинструкции.
Хороший промпт строит управляемую сцену по формуле: объект → действие → сцена (место действия) → настройки камеры → свет → стиль → ограничения.
Пример полного промпта: «Матовый чёрный флакон духов на стеклянной поверхности в минималистичной студии. Медленный поворот флакона на 15 градусов, камера слегка приближается, мягкий студийный свет, реалистичный стиль, отражение на поверхности. Без текста, без логотипов, без рук в кадре, форму флакона не менять».
У WAN пять рабочих режимов — text-to-video, image-to-video, video-to-video, Animate и S2V, — и единого промпта, который одинаково хорошо подходит для всех, не существует. Ниже — 50 промптов, разбитых по режимам.
Продуктовые и рекламные сцены
Природа и атмосферные сцены
Городские и сюжетные сцены
Персонажи и портретные сцены
Фантастика и нестандартные сцены
Формула здесь проще: описание движения плюс движение камеры — исходное изображение уже задаёт субъект, сцену и стиль, а промпт описывает только то, что должно произойти.
Портреты и люди
Продукты и предметы
Пейзажи и природа
Анимация изображений из других нейросетей
Динамичные сцены
В этом режиме принципиально прямо указывать, что должно остаться без изменений — модель легко переделывает больше, чем требуется.
Запрос «сделай красивый ролик» здесь не сработает — нужна конкретика по тому, что двигается и что остаётся стабильным.
Для S2V понадобятся изображение человека и аудио — модель синхронизирует движение губ и мимику с речью.
WAN не универсален. Он хорошо подходит AI-креаторам, делающим короткие ролики; дизайнерам, которым нужно оживлять визуалы; motion-специалистам для быстрых тестов; маркетологам с креативными гипотезами; редакциям для визуальных вставок; продакшн-командам для превиза; разработчикам, собирающим open-source video pipeline; студиям, которым важен контроль над генерацией; и тем, кто уже работает с ComfyUI.
WAN — не лучший выбор, если нужно одно финальное видео без отбора дублей, длинная сложная сцена, стабильный персонаж на протяжении минуты, точный текст в кадре или гарантированный результат с первого промпта.
Чтобы просто попробовать WAN — подойдёт готовый веб-интерфейс. Для быстрого результата без настройки окружения — агрегатор или сайт. Если важен контроль над пайплайном — ComfyUI. Для исследовательских или технических задач — Hugging Face и GitHub. Для серийной генерации и воспроизводимости — локальный запуск с фиксацией параметров.
Для большинства пользователей оптимальной точкой входа остаётся image-to-video: сначала создаётся сильный кадр, а затем WAN добавляет движение — так проще получить управляемый результат и меньше случайных деталей.
WAN интересен именно тем, что это не просто генератор роликов, а целая модельная экосистема. С его помощью можно делать text-to-video, image-to-video, video-to-video, анимацию, S2V-сценарии и собирать локальные пайплайны.
Для пользователя из России доступ открывается разными путями — через веб-интерфейсы, Hugging Face, GitHub, ComfyUI или агрегаторы. Главное — заранее понимать, какой режим выбрать и как контролировать результат.
Из всех вариантов агрегаторы обычно оказываются самым практичным путём. ComfyUI и локальные пайплайны требуют железа и настройки, а прямая оплата зарубежных сервисов — это отдельная подписка под каждую модель, которую нужно продлевать и оплачивать картой, которая не всегда проходит. Агрегатор решает это иначе: один баланс, из которого списываются токены за конкретную генерацию в WAN и в других моделях, без необходимости заводить и оплачивать несколько подписок параллельно. Для тех, кто пробует WAN нерегулярно или использует его вместе с другими нейросетями, это выходит ощутимо выгоднее, чем держать отдельный тариф под каждый сервис.
Для рабочих задач разумнее начинать с image-to-video, коротких сцен, понятного движения камеры, сильного исходного кадра и жестких ограничений в промпте. WAN отлично подходит для концептов, motion-креативов, превизов, b-roll и коротких визуальных сцен, но не заменяет полноценный продакшн, не гарантирует стабильность деталей и почти всегда требует отбора дублей.