WAN: как использовать эту нейросеть в России

2026-07-03 19:22:24 Время чтения 27 мин 562

WAN — одна из самых известных open-source-моделей для генерации видео. Кроме генерации роликов с нуля, её используют для анимации персонажей, редактирования готового видео и сборки локальных пайплайнов через Hugging Face, GitHub и ComfyUI.

От Kling, Runway, Pika и похожих сервисов WAN отличает сама модель распространения: команда не предлагает закрытый продукт, а выкладывает нейросети в открытый доступ — их можно скачать, запустить локально и дообучить под нужную задачу. У WAN есть официальные релизы моделей, хранилища с датасетами и скриптами, набор версий на Hugging Face для тестов и скачивания, а также сборки для локального запуска, например через Diffusers.

Дальше разберём, что умеет WAN, в каких сценариях модель раскрывается лучше всего, как составлять промпты и — самое важное для российской аудитории — как получить доступ к этой нейросети из России.

Что такое WAN

Под названием WAN, или Wan2.x, скрывается семейство крупных видеогенеративных моделей, которое связывают с Alibaba и командой Wan. В открытой экосистеме представлены версии Wan2.1 и Wan2.2, а также отдельные модели под text-to-video, image-to-video, video-to-video, анимацию, S2V и варианты для Diffusers. На странице Wan-AI на Hugging Face собраны отдельные коллекции для Wan2.1, Wan2.2 и Wan2.2-diffusers.

Научный отчёт о WAN характеризует нейросеть как открытую серию крупномасштабных видеогенеративных моделей. В линейке две основные конфигурации: компактная — на 1,3 миллиарда параметров, и более тяжёлая — на 14 миллиардов. Версию на 1,3B обычно запускают на стандартных игровых видеокартах, а версия на 14B даёт заметно более качественное видео, но и требует значительно более мощного оборудования.

Здесь важно понимать: WAN — это не один сайт с единым интерфейсом, а набор моделей и способов их запуска. Кто-то открывает готовый веб-интерфейс и за пару минут превращает картинку в короткое видео. Кто-то разворачивает модель у себя, встраивает её в ComfyUI и строит собственный pipeline для серийной генерации контента.

Как устроен интерфейс WAN

То, как выглядит интерфейс, зависит от площадки: официальный сайт, сторонний веб-сервис, Hugging Face, ComfyUI или локальный запуск. Логика работы при этом почти везде совпадает: выбрать режим, написать промпт, настроить формат ролика и запустить генерацию.

В типичном веб-интерфейсе можно выделить несколько зон:

  1. Выбор режима — для видео обычно работают с text-to-video и image-to-video.
  2. Поле промпта — здесь прописываются визуальные параметры: движение камеры, угол съёмки, объектив, освещение, цветокоррекция, стиль и то, что нужно оставить без изменений. Чем точнее заданы камера, свет и ограничения, тем меньше у модели свободы для собственной интерпретации. Подробные шпаргалки по настройке кадра — ближе к концу статьи.
  3. Negative prompt — отдельное поле для отсечения типовых артефактов: лишнего текста, логотипов, деформации лица, нестабильного фона, мерцания, искажения формы объектов.
  4. Формат видео — выбор соотношения сторон: 9:16 для Reels, Shorts и TikTok; 16:9 для YouTube, сайта и презентаций; 1:1 или 4:5 для ленты. Формат разумнее задать заранее, а не подгонять ролик под нужные пропорции после генерации.
  5. Длительность и качество — короткие ролики ведут себя стабильнее длинных. Для AI-видео практичнее делать сцены по 3–5 секунд с одним объектом, одним движением камеры и одним действием, а длинный ролик собирать монтажом из таких фрагментов.
  6. Seed и вариации — seed позволяет воспроизвести похожий результат или получить близкие версии удачного кадра. Если ролик почти удался, лучше точечно скорректировать промпт и оставить тот же seed; если результат не подходит совсем — seed стоит сменить.

Тарифы и лимиты WAN: на что смотреть перед оплатой

- Free (бесплатно)

Подойдёт для первого знакомства с сервисом и нерегулярных задач. В тарифе:

  1. одновременная отправка до 1 видео и 1 изображения;
  2. 6 доступных стилей изображений;
  3. неограниченная генерация без расхода кредитов.

- Pro ($5 в месяц при годовой оплате со скидкой 50%, иначе $10 в месяц)

Самый востребованный тариф — баланс цены и расширенного функционала:

  1. 300 кредитов ежемесячно;
  2. ускоренная генерация: до 1200 изображений или 60 видео;
  3. до 3 видео и 3 изображений одновременно;
  4. видео в 1080p с длительностью до 10–15 секунд;
  5. апскейл изображений;
  6. все стили изображений;
  7. скачивание без водяных знаков;
  8. неограниченная генерация без кредитов.

- Premium ($20 в месяц при годовой оплате со скидкой 50%, иначе $40 в месяц)

Тариф для активной коммерческой работы:

  1. 1200 кредитов ежемесячно;
  2. ускоренная генерация: до 4800 изображений или 240 видео;
  3. до 8 видео и 5 изображений одновременно;
  4. скачивание без водяных знаков;
  5. видео в 1080p с длительностью до 10–15 секунд;
  6. апскейл изображений;
  7. все стили изображений;
  8. неограниченная генерация без кредитов.

Стоит держать в уме несколько моментов. Годовая оплата сразу даёт скидку 50%, заметно снижая ежемесячные траты. Кредиты ускоряют обработку сложных запросов — чем их больше в запасе, тем быстрее генерация. Неограниченная генерация без кредитов есть на всех тарифах, но идёт через стандартную очередь, поэтому работает медленнее, чем при использовании кредитов.

Как пользоваться WAN в России

Есть пять рабочих путей:

  1. Официальный сайт Wan — самый прямой способ протестировать text-to-video, image-to-video и редактирование изображений, если сайт открывается и нужный функционал доступен.
  2. Hugging Face — площадка, на которой публикуют готовые нейросети, датасеты и вспомогательные инструменты. Там размещены модели Wan-AI: Wan2.2-T2V, Wan2.2-I2V, Wan2.2-S2V, Wan2.2-Animate и Diffusers-версии. Подходит тем, кто хочет разобраться в линейке моделей, протестировать демо или взять веса для своего окружения.
  3. GitHub — пространство для хранения и совместного редактирования кода. Репозитории Wan2.1 и Wan2.2 нужны для локального запуска, экспериментов, настройки окружения и встраивания в собственные пайплайны.
  4. ComfyUI — программа для генерации изображений и видео нейросетями. Удобна для креаторов и технических специалистов, которые собирают workflow из узлов: генерация изображения, image-to-video, апскейл, интерполяция, цвет, постобработка.
  5. Агрегаторы — вариант для тех, кому нужен результат без виртуальной частной сети, без локальной настройки, без скачивания весов и без работы с зависимостями.

Главные режимы WAN

WAN работает в нескольких режимах, и смешивать их не стоит: каждый заточен под свою задачу и требует отдельного подхода к промпту.

Text-to-videoГенерация видео из текстового описания: пользователь задаёт сцену, действие, камеру, свет, стиль и ограничения, модель собирает короткий ролик.

Хорошо работает для визуальных концептов, коротких сцен, mood-видео, фонов, b-roll, рекламных черновиков, превизов, идей для Reels, Shorts и Telegram, а также для проверки визуального направления перед съёмкой.

Хуже справляется, если нужно сохранить конкретного персонажа, точный продукт, фирменный стиль или композицию — модель сама придумывает кадр, и результат может выглядеть красиво, но не совпасть с задачей.

Пример промпта: «Чёрный электромобиль едет по мокрой ночной улице, отражения неоновых вывесок на асфальте, медленное движение камеры сбоку, реалистичный стиль, кинематографичный свет, без текста, без логотипов, без деформации колёс».

Image-to-videoСамый полезный режим для большинства креаторов: сначала создаётся или загружается исходный кадр, а WAN добавляет ему движение.

Здесь контроля больше, чем в text-to-video: композиция, персонаж, продукт, фон, цвет, стиль и ракурс уже заданы изображением, а модель отвечает преимущественно за движение.

Подходит для оживления портретов, product shot, анимированных обложек, motion-креативов, оживления изображений из Midjourney, Flux или Stable Diffusion, коротких видео для соцсетей, заставок, рекламных тестов, оживления concept art и лёгкого движения камеры в статичной сцене.

Пример промпта: «Оживи исходное изображение: камера медленно приближается, волосы слегка двигаются от ветра, фон остаётся стабильным, лицо не менять, одежду не менять, стиль и композицию сохранить».

Главное правило: если важен контроль над результатом, стартовать стоит не с text-to-video, а с сильного исходного изображения — чем точнее первый кадр, тем меньше пространства для додумок у модели.

Video-to-video и редактированиеПодходит, когда ролик уже снят, но требуется сменить стиль, усилить движение, сделать вариацию сцены или преобразовать видео в другой визуальный формат.

В Wan2.2 на Hugging Face есть направления Animate и video-to-video, а в экосистеме Wan упоминается instruction-guided video editing — модель получает видео и инструкцию, что именно нужно изменить.

Используется для стилизации ролика, чернового превиза, изменения атмосферы, создания вариаций, анимации персонажа, теста движения перед продакшном и для того, чтобы сделать слабое статичное видео более выразительным.

Этот режим требует контроля: модель легко меняет больше, чем планировалось — лицо, одежду, фон, пропорции, фактуру объекта. Поэтому в промпте нужно прямо прописывать, что должно остаться неизменным.

Пример: «Сохрани композицию, лицо, одежду и положение персонажа. Измени только стиль света: сделать сцену более холодной, добавить мягкий контровой свет, не менять фон и пропорции тела».

AnimateWan2.2-Animate отвечает за анимацию и video-to-video-сценарии, в первую очередь — за персонажную анимацию, оживление поз, движение тела, сцены с человеком и контролируемую анимацию. Запрос вроде «сделай красивый ролик» здесь не работает — нужно прописывать конкретику: что движется, что остаётся стабильным, какие элементы запрещено менять.

Пример: «Анимируй персонажа: лёгкий поворот головы вправо, моргание, небольшое движение плеч, камера статична, фон не менять, лицо и причёску сохранить».

S2VWan2.2-S2V — направление Speech-to-Video и audio-driven digital human video: портретное фото превращается в аватара, который говорит, поёт и двигается.

Это уже не просто оживление картинки — S2V нужен там, где есть изображение человека и аудио: аватар, речь, пение, lip-sync, цифровой ведущий, обучающий ролик, презентационный формат.

Типичные применения: говорящий аватар, обучающее видео, ролик с ведущим, digital human для продукта, тест персонажа перед продакшном, локализация ролика с новым голосом, прототип видеоинструкции.

Как писать промпт для WAN

Хороший промпт строит управляемую сцену по формуле: объект → действие → сцена (место действия) → настройки камеры → свет → стиль → ограничения.

Пример полного промпта: «Матовый чёрный флакон духов на стеклянной поверхности в минималистичной студии. Медленный поворот флакона на 15 градусов, камера слегка приближается, мягкий студийный свет, реалистичный стиль, отражение на поверхности. Без текста, без логотипов, без рук в кадре, форму флакона не менять».

WAN: 50 промптов под каждый режим работы

У WAN пять рабочих режимов — text-to-video, image-to-video, video-to-video, Animate и S2V, — и единого промпта, который одинаково хорошо подходит для всех, не существует. Ниже — 50 промптов, разбитых по режимам.

Text-to-video: 15 промптов

Продуктовые и рекламные сцены

  1. Матовый чёрный флакон духов на стеклянной поверхности в минималистичной студии. Медленный поворот флакона на 15 градусов, камера слегка приближается, мягкий студийный свет, реалистичный стиль, отражение на поверхности. Без текста, без логотипов, без рук в кадре, форму не менять.
  2. Чашка кофе на деревянном столе у окна, пар медленно поднимается вверх. Камера статична, мягкий утренний свет слева, неглубокая глубина фокуса, тёплая цветокоррекция. Без текста, без логотипов.
  3. Кроссовок медленно вращается в воздухе на чёрном фоне, частицы пыли подсвечены сбоку. Камера орбитально движется вокруг объекта, студийный контровой свет, рекламный стиль. Без деформации формы.

Природа и атмосферные сцены

  1. Чёрный электромобиль едет по мокрой ночной улице, отражения неоновых вывесок на асфальте. Медленное движение камеры сбоку, реалистичный стиль, кинематографичный свет. Без текста, без логотипов, без деформации колёс.
  2. Туман медленно стелется над тихим озером на рассвете, силуэты деревьев на дальнем берегу. Камера медленно панорамирует вправо, мягкий рассеянный свет, спокойная атмосфера.
  3. Дождь капает по оконному стеклу, за окном размытые огни города. Камера статична, крупный план на каплях, холодная цветокоррекция, меланхоличное настроение.

Городские и сюжетные сцены

  1. Исследователь в хаки-куртке на коленях очищает древние фрагменты от земли в тропических джунглях, солнечный свет пробивается через листву. Камера медленно приближается к рукам персонажа в момент находки, кинематографичный стиль.
  2. Уличный музыкант играет на скрипке на вечерней площади, прохожие проходят размыто на фоне. Камера медленно движется слева вправо, тёплый уличный свет, документальный стиль.
  3. Поезд метро прибывает на пустую станцию ночью, мерцающий свет фонарей. Камера статична на платформе, холодный синий свет, кинематографичная атмосфера, без текста на вывесках.

Персонажи и портретные сцены

  1. Крупный план молодой женщины, мягко улыбающейся под дождём, капли блестят на лице и ресницах. Камера статична, мягкий рассеянный свет, детализированная передача эмоции.
  2. Два антропоморфных персонажа в спортивной форме интенсивно соревнуются на освещённой арене. Камера динамично следует за движением, яркий сценический свет, энергичный стиль.
  3. Воин в боевых доспехах стоит неподвижно, взгляд полон решимости. Камера медленно приближается или кружит вокруг персонажа, подчёркивая мощь и героизм образа.

Фантастика и нестандартные сцены

  1. Летающая фея из другого мира в потрёпанном, но красивом одеянии, с крыльями из обломков руин за спиной, парит в воздухе. Камера медленно вращается вокруг персонажа, мягкое магическое свечение, фэнтезийный стиль.
  2. Гигантское дерево со светящимися листьями растёт посреди заброшенного города, листья медленно падают. Камера снизу вверх, мистическая атмосфера, мягкий контраст света и тени.
  3. Робот медленно открывает глаза в тёмной лаборатории, искры от проводов вокруг. Камера крупный план на лице робота, холодный синий свет, напряжённая атмосфера, без деформации деталей.

Image-to-video: 15 промптов

Формула здесь проще: описание движения плюс движение камеры — исходное изображение уже задаёт субъект, сцену и стиль, а промпт описывает только то, что должно произойти.

Портреты и люди

  1. Оживи исходное изображение: камера медленно приближается, волосы слегка двигаются от ветра, фон остаётся стабильным. Лицо не менять, одежду не менять, стиль и композицию сохранить.
  2. Человек на фото медленно моргает и спокойно дышит, лёгкая улыбка появляется на лице. Камера статична. Не менять фон, не менять причёску.
  3. Главное движение: человек медленно поворачивает голову вправо. Второстепенное движение: волосы слегка колышутся. Камера статична, фон неподвижен.
  4. Танцовщица на фото изящно вращается на месте, камера орбитально движется по часовой стрелке, сценический свет создаёт драматичные тени.

Продукты и предметы

  1. Товар на фото медленно поворачивается на 360 градусов, камера статична. Сохранить форму, цвет и пропорции без изменений, фон не трогать.
  2. Лёгкое отражение света скользит по поверхности продукта слева вправо, камера слегка приближается. Не менять форму объекта, не добавлять текст.
  3. Пар медленно поднимается от чашки на фото, камера статична. Остальная часть кадра остаётся полностью неподвижной.

Пейзажи и природа

  1. Облака на фото медленно плывут, вода в кадре покрывается лёгкой рябью. Камера медленно отъезжает назад, открывая более широкий план.
  2. Листья деревьев на фото слегка колышутся от ветра, трава внизу едва заметно движется. Камера статична, общая атмосфера фото сохраняется.
  3. Главное движение: волны на фото набегают на берег. Второстепенное: чайки вдалеке медленно летят. Камера медленно панорамирует вправо.

Анимация изображений из других нейросетей

  1. Оживи это изображение, сгенерированное другой нейросетью: добавь лёгкое дыхание и моргание персонажу, камера статична. Стиль изображения сохранить полностью, не добавлять фотореализм.
  2. Превратить статичную иллюстрацию в видео: лёгкое покачивание объекта на переднем плане, фон остаётся неподвижным. Сохранить художественный стиль исходного изображения без изменений.
  3. Анимировать обложку: лёгкое свечение пульсирует вокруг центрального объекта, камера медленно приближается. Текст на обложке не трогать, не искажать.

Динамичные сцены

  1. Главное движение: персонаж на фото бежит вперёд. Второстепенное: плащ развевается на ветру. Камера следует за персонажем сбоку, динамичный стиль.
  2. Огонь на фото костра медленно колышется, искры поднимаются вверх. Камера статична, остальная часть сцены неподвижна, тёплое свечение усиливается.

Video-to-video и редактирование: 8 промптов

В этом режиме принципиально прямо указывать, что должно остаться без изменений — модель легко переделывает больше, чем требуется.

  1. Сохрани композицию, лицо, одежду и положение персонажа. Измени только стиль света: сделать сцену более холодной, добавить мягкий контровой свет, не менять фон и пропорции тела.
  2. Преобразуй цветовую палитру видео в тёплые осенние тона. Композицию, движение и персонажей не менять, только цветокоррекцию.
  3. Усиль движение камеры: добавь лёгкое покачивание, как при ручной съёмке. Содержание кадра, объекты и их положение оставить без изменений.
  4. Измени время суток в видео с дневного на вечернее: добавь тёплый закатный свет и длинные тени. Объекты, их позиции и движение не трогать.
  5. Сделай вариацию сцены с другим углом камеры, сохранив то же действие и того же персонажа. Одежду, лицо и фон оставить идентичными оригиналу.
  6. Стилизуй видео в более кинематографичном стиле: добавь лёгкое зерно плёнки и контраст. Содержание кадра и движение объектов не менять.
  7. Создай черновой превиз сцены с упрощённым освещением для быстрой проверки композиции. Расположение объектов и персонажей сохранить точно.
  8. Преврати статичное слабое видео в более выразительный вариант: усиль контраст света и тени. Сюжет, персонажей и фон оставить без изменений.

Animate (персонажная анимация): 7 промптов

Запрос «сделай красивый ролик» здесь не сработает — нужна конкретика по тому, что двигается и что остаётся стабильным.

  1. Анимируй персонажа: лёгкий поворот головы вправо, моргание, небольшое движение плеч. Камера статична, фон не менять, лицо и причёску сохранить.
  2. Анимируй позу персонажа: медленный переход из положения стоя в положение сидя. Лицо, одежду и фон оставить неизменными, камера статична.
  3. Главное движение: рука персонажа медленно поднимается в приветственном жесте. Второстепенное: лёгкое покачивание волос. Фон стабилен.
  4. Анимируй ходьбу персонажа на месте: естественное движение ног и рук в среднем темпе. Камера статична, лицо и одежду не менять.
  5. Добавь персонажу лёгкую жестикуляцию во время разговора: движение рук, кивки головой. Фон и освещение оставить без изменений.
  6. Анимируй танцевальное движение персонажа: плавные повороты корпуса в среднем темпе. Камера статична, одежда и черты лица сохраняются.
  7. Создай движение оглядывания через плечо: персонаж медленно поворачивает голову назад. Фон и поза тела остаются стабильными.

S2V — говорящие аватары: 5 промптов

Для S2V понадобятся изображение человека и аудио — модель синхронизирует движение губ и мимику с речью.

  1. Создай говорящего аватара на основе портрета: синхронизируй движение губ с прикреплённым аудио, добавь естественную мимику и лёгкие движения головы. Лицо и фон сохранить без изменений.
  2. Сделай обучающее видео с цифровым ведущим: спокойная мимика, периодические кивки в такт речи, взгляд направлен в камеру на протяжении всего ролика.
  3. Создай аватар для презентации продукта: уверенная мимика, синхронизация с аудио, лёгкие жесты рукой в такт ключевым фразам.
  4. Сделай локализованную версию ролика с новым голосом: синхронизируй губы персонажа с новым аудиотреком, мимику и движения сохранить из оригинального видео.
  5. Создай прототип видеоинструкции: спокойный тон лица, синхронизация речи, периодические указывающие жесты в сторону воображаемого экрана.

Кому подходит WAN

WAN не универсален. Он хорошо подходит AI-креаторам, делающим короткие ролики; дизайнерам, которым нужно оживлять визуалы; motion-специалистам для быстрых тестов; маркетологам с креативными гипотезами; редакциям для визуальных вставок; продакшн-командам для превиза; разработчикам, собирающим open-source video pipeline; студиям, которым важен контроль над генерацией; и тем, кто уже работает с ComfyUI.

WAN — не лучший выбор, если нужно одно финальное видео без отбора дублей, длинная сложная сцена, стабильный персонаж на протяжении минуты, точный текст в кадре или гарантированный результат с первого промпта.

Какой способ использования выбрать

Чтобы просто попробовать WAN — подойдёт готовый веб-интерфейс. Для быстрого результата без настройки окружения — агрегатор или сайт. Если важен контроль над пайплайном — ComfyUI. Для исследовательских или технических задач — Hugging Face и GitHub. Для серийной генерации и воспроизводимости — локальный запуск с фиксацией параметров.

Для большинства пользователей оптимальной точкой входа остаётся image-to-video: сначала создаётся сильный кадр, а затем WAN добавляет движение — так проще получить управляемый результат и меньше случайных деталей.

Вывод

WAN интересен именно тем, что это не просто генератор роликов, а целая модельная экосистема. С его помощью можно делать text-to-video, image-to-video, video-to-video, анимацию, S2V-сценарии и собирать локальные пайплайны.

Для пользователя из России доступ открывается разными путями — через веб-интерфейсы, Hugging Face, GitHub, ComfyUI или агрегаторы. Главное — заранее понимать, какой режим выбрать и как контролировать результат.

Из всех вариантов агрегаторы обычно оказываются самым практичным путём. ComfyUI и локальные пайплайны требуют железа и настройки, а прямая оплата зарубежных сервисов — это отдельная подписка под каждую модель, которую нужно продлевать и оплачивать картой, которая не всегда проходит. Агрегатор решает это иначе: один баланс, из которого списываются токены за конкретную генерацию в WAN и в других моделях, без необходимости заводить и оплачивать несколько подписок параллельно. Для тех, кто пробует WAN нерегулярно или использует его вместе с другими нейросетями, это выходит ощутимо выгоднее, чем держать отдельный тариф под каждый сервис.

Для рабочих задач разумнее начинать с image-to-video, коротких сцен, понятного движения камеры, сильного исходного кадра и жестких ограничений в промпте. WAN отлично подходит для концептов, motion-креативов, превизов, b-roll и коротких визуальных сцен, но не заменяет полноценный продакшн, не гарантирует стабильность деталей и почти всегда требует отбора дублей.