Grok Imagine 1.5: видео из текста и семь референсов. Что из этого работает на практике

2026-08-04 17:09:20 Время чтения 8 мин 24

31 июля xAI выкатил обновление Grok Imagine Video 1.5. Четыре пункта: генерация видео прямо из текста, нативный 1080p, референс голоса и мультиреференс - до семи изображений на одну генерацию.

Третий пункт тут самый интересный, и он же самый непонятный по описанию. Поэтому я не стал пересказывать анонс, а прогнал механику через Grok в нашем боте Cyber AI и снял четыре ролика. Ниже - что подтвердилось, что пока недоступно, и почему мультиреференс закрывает главную боль всех, кто делает видео нейросетями.

Что именно добавили 31 июля

Разбор по официальному анонсу xAI и релиз-нотам:

  1. Текст в видео. Раньше версия 1.5 умела оживлять только загруженную картинку. Теперь стартовый кадр не нужен: модель сама рисует первый кадр по описанию и анимирует его дальше.
  2. Нативный 1080p. Для режимов «текст в видео» и «фото в видео». До обновления потолок был 720p.
  3. Референс голоса. Загружаете фото персонажа и образец голоса - лицо и голос держатся во всех сценах генерации.
  4. Мультиреференс. До семи референсных изображений на одну генерацию. Каждое фиксирует ровно один элемент сцены.

Раскатка началась в США на тарифах SuperGrok Heavy и Plus, дальше по остальным. Дата полного открытия не называлась.

Механика якорей: почему это важнее 1080p

Формулировка xAI звучит сухо: «каждое референсное изображение фиксирует одну вещь - лицо, товар, локацию». На практике это меняет саму логику работы.

Обычная генерация - лотерея. Просите «мужчина в студии подкаста» и получаете случайного мужчину в случайной студии. Просите второй ролик - там уже другой мужчина и другая студия. Собрать из такого связную серию невозможно, и это главная причина, по которой ИИ-видео до сих пор редко доходит до реальных проектов.

Два референса и результат: ни одного стартового кадра

Мультиреференс превращает лотерею в конструктор. Один референс - герой. Второй - помещение. Дальше три варианта:

  1. держим героя, меняем сцену
  2. держим сцену, меняем героя
  3. держим оба, меняем только действие

То есть вы фиксируете то, что должно остаться одинаковым, и меняете только то, что хотите менять.

Проверил на четырёх роликах

Собрал два референса через Banana 2 PRO: портрет мужчины на нейтральном фоне и пустую студию подкаста без людей. Никакого стартового кадра - только эти две картинки как якоря.

Ролик первый. Герой плюс студия. На выходе - тот самый человек с референса за тем самым столом, зелёные акустические панели и лампы совпадают до деталей.

Ролик второй. Тот же герой, но локацию поменял на лофт с панорамным окном. Лицо и тёмно-синяя рубашка остались, комната стала другой. Якорь персонажа отработал.

Держим героя, меняем сцену: студия и лофт, человек один и тот же

Ролик третий. Обратная проверка: студию оставил, героя заменил на женский портрет. Комната совпала с первым роликом один в один, человек в кадре другой.

Держим сцену, меняем героя: комната та же, люди разные

Ролик четвёртый. Генерация из текста без единой картинки, промпт взял из примера в документации xAI - тлеющие угли над полем боя и гребень шлема на ветру.

Генерация из текста: стартовой картинки не было

Что показали файлы: все четыре ролика 1280 × 720, 24 кадра в секунду, длительность 6,04 секунды. Звуковая дорожка живая везде - от минус 11,7 до минус 23,1 дБ. Монтажных стыков ноль: детектор смены планов не нашёл ни одного, то есть шесть секунд идут непрерывным кадром без склеек.

Генерация каждого ролика заняла около полутора минут.

Что доехало до бота, а что нет

Проверил настройки мини-приложения на 4 августа. Картина честная и неоднородная:

  1. Текст в видео - работает, отдельный режим
  2. До семи референсов - работает, лимит ровно 7
  3. Редактирование и продление ролика - работает у версии Grok Pro
  4. Нативный 1080p - нет, потолок 720p
  5. Референс голоса - нет

Ещё пара деталей из настроек. Референсы подключаются в режиме «Изображение → Видео», причём стартовый кадр в нём необязателен - можно отдать только якоря, что я и делал. Базовая версия Grok тянет ролики от 6 до 30 секунд, Grok Pro - от 1 до 15, зато умеет редактировать и продлевать готовое видео. Длина описания - до 5000 символов, промпт понимает русский.

Отсутствие 1080p - главный минус на сегодня. Но для соцсетей 720p закрывает почти все задачи, а якоря дают то, чего разрешением не компенсируешь.

Как повторить

  1. Открыть бот Cyber AI и выбрать «Создать видео».
  2. Выбрать модель Grok.
  3. Нажать «Задать параметры».
  4. Режим генерации - «Изображение → Видео».
  5. Загрузить якоря в блок «Reference изображения»: отдельно героя, отдельно локацию, отдельно предмет.
  6. Выставить пропорцию, качество и длительность.
  7. В поле «Описание видео» написать только действие и движение камеры.
  8. Запустить генерацию.

Главное правило по промпту: не описывайте заново внешность героя и обстановку, если они уже заданы референсами. Модель начинает рисовать нового человека поверх якоря. Описание должно отвечать на вопрос «что происходит», а не «кто и где».

Референсы удобно готовить тем же ботом: портрет и пустую локацию я собрал в Banana 2 PRO на нейтральном свете, без теней и лишних деталей - такие картинки модель читает точнее.

Кому пригодится

Мультиреференс интересен там, где нужна серия, а не один эффектный кадр.

Реклама и карточки: товар фиксируется референсом и не плывёт от ролика к ролику, а обстановка меняется под площадку. Блогерам и подкастерам: один ведущий, разные декорации, без пересъёмки. Обучающие форматы: один спикер проводит человека через десяток сцен.

Ограничение честное: пока нет референса голоса, полноценного говорящего героя с узнаваемым тембром на одном Grok не собрать - звук придётся добирать отдельно.

Итог

Обновление 31 июля - не про разрешение, хотя в заголовках новостей везде вынесли 1080p. Настоящее изменение в том, что генерация перестала быть лотереей: вы явно указываете, что должно остаться неизменным.

В нашем боте из четырёх заявленных пунктов уже доступны текст в видео и семь якорей - то есть ровно та часть, которая меняет работу. 1080p и голос ждём.

Попробовать можно тут: TG | MAX

Больше разборов моделей и рабочих промптов - в нашем канале: TG | MAX