31 июля xAI выкатил обновление Grok Imagine Video 1.5. Четыре пункта: генерация видео прямо из текста, нативный 1080p, референс голоса и мультиреференс - до семи изображений на одну генерацию.
Третий пункт тут самый интересный, и он же самый непонятный по описанию. Поэтому я не стал пересказывать анонс, а прогнал механику через Grok в нашем боте Cyber AI и снял четыре ролика. Ниже - что подтвердилось, что пока недоступно, и почему мультиреференс закрывает главную боль всех, кто делает видео нейросетями.
Разбор по официальному анонсу xAI и релиз-нотам:
Раскатка началась в США на тарифах SuperGrok Heavy и Plus, дальше по остальным. Дата полного открытия не называлась.
Формулировка xAI звучит сухо: «каждое референсное изображение фиксирует одну вещь - лицо, товар, локацию». На практике это меняет саму логику работы.
Обычная генерация - лотерея. Просите «мужчина в студии подкаста» и получаете случайного мужчину в случайной студии. Просите второй ролик - там уже другой мужчина и другая студия. Собрать из такого связную серию невозможно, и это главная причина, по которой ИИ-видео до сих пор редко доходит до реальных проектов.
Мультиреференс превращает лотерею в конструктор. Один референс - герой. Второй - помещение. Дальше три варианта:
То есть вы фиксируете то, что должно остаться одинаковым, и меняете только то, что хотите менять.
Собрал два референса через Banana 2 PRO: портрет мужчины на нейтральном фоне и пустую студию подкаста без людей. Никакого стартового кадра - только эти две картинки как якоря.
Ролик первый. Герой плюс студия. На выходе - тот самый человек с референса за тем самым столом, зелёные акустические панели и лампы совпадают до деталей.
Ролик второй. Тот же герой, но локацию поменял на лофт с панорамным окном. Лицо и тёмно-синяя рубашка остались, комната стала другой. Якорь персонажа отработал.
Ролик третий. Обратная проверка: студию оставил, героя заменил на женский портрет. Комната совпала с первым роликом один в один, человек в кадре другой.
Ролик четвёртый. Генерация из текста без единой картинки, промпт взял из примера в документации xAI - тлеющие угли над полем боя и гребень шлема на ветру.
Что показали файлы: все четыре ролика 1280 × 720, 24 кадра в секунду, длительность 6,04 секунды. Звуковая дорожка живая везде - от минус 11,7 до минус 23,1 дБ. Монтажных стыков ноль: детектор смены планов не нашёл ни одного, то есть шесть секунд идут непрерывным кадром без склеек.
Генерация каждого ролика заняла около полутора минут.
Проверил настройки мини-приложения на 4 августа. Картина честная и неоднородная:
Ещё пара деталей из настроек. Референсы подключаются в режиме «Изображение → Видео», причём стартовый кадр в нём необязателен - можно отдать только якоря, что я и делал. Базовая версия Grok тянет ролики от 6 до 30 секунд, Grok Pro - от 1 до 15, зато умеет редактировать и продлевать готовое видео. Длина описания - до 5000 символов, промпт понимает русский.
Отсутствие 1080p - главный минус на сегодня. Но для соцсетей 720p закрывает почти все задачи, а якоря дают то, чего разрешением не компенсируешь.
Главное правило по промпту: не описывайте заново внешность героя и обстановку, если они уже заданы референсами. Модель начинает рисовать нового человека поверх якоря. Описание должно отвечать на вопрос «что происходит», а не «кто и где».
Референсы удобно готовить тем же ботом: портрет и пустую локацию я собрал в Banana 2 PRO на нейтральном свете, без теней и лишних деталей - такие картинки модель читает точнее.
Мультиреференс интересен там, где нужна серия, а не один эффектный кадр.
Реклама и карточки: товар фиксируется референсом и не плывёт от ролика к ролику, а обстановка меняется под площадку. Блогерам и подкастерам: один ведущий, разные декорации, без пересъёмки. Обучающие форматы: один спикер проводит человека через десяток сцен.
Ограничение честное: пока нет референса голоса, полноценного говорящего героя с узнаваемым тембром на одном Grok не собрать - звук придётся добирать отдельно.
Обновление 31 июля - не про разрешение, хотя в заголовках новостей везде вынесли 1080p. Настоящее изменение в том, что генерация перестала быть лотереей: вы явно указываете, что должно остаться неизменным.
В нашем боте из четырёх заявленных пунктов уже доступны текст в видео и семь якорей - то есть ровно та часть, которая меняет работу. 1080p и голос ждём.
Попробовать можно тут: TG | MAX
Больше разборов моделей и рабочих промптов - в нашем канале: TG | MAX