Как сделать говорящее фото нейросетью через Veo: загрузить портрет, добавить реплику, настроить голос, мимику и движение губ.
Обычную фотографию можно превратить в короткое видеообращение: человек посмотрит в камеру, произнесёт заданный текст, слегка изменит выражение лица и будет естественно двигаться в кадре. Для этого не нужна съёмка — достаточно портрета и подробного промпта.
Я решил проверить такой сценарий через Veo в Pauk AI. Загрузил фотографию, добавил короткую реплику и отдельно описал голос, мимику, движения головы и поведение камеры. Первый вариант получился слишком активным, поэтому я сократил текст и оставил только спокойную речь с минимальными жестами.
Veo поддерживает генерацию видео по тексту и изображению, а актуальные версии модели умеют создавать речь, звуковое окружение и видео в одном процессе. Google также указывает на возможность синхронизации диалога с движением губ, однако качество результата зависит от исходной фотографии, промпта и сложности реплики.
Ниже покажу, как сделать говорящее фото нейросетью в Pauk AI, какой портрет выбрать и что написать, чтобы сохранить внешность человека.
Говорящее фото — это видео, созданное на основе одного портрета. Нейросеть достраивает новые кадры и добавляет:
Veo работает в режимах text-to-video и image-to-video. Официальные материалы Google описывают генерацию аудио, речи и звуковых эффектов вместе с изображением, а также использование фотографии как начального кадра или референса для персонажа.
Нейросеть не находит настоящую видеозапись этого человека. Она создаёт новую сцену на основе загруженного изображения, поэтому мимика, голос и произнесённая реплика являются ИИ-генерацией.
Лучше всего работает чёткий портрет, на котором человек смотрит прямо или почти прямо в камеру.
Подойдёт снимок:
Сложнее оживлять фотографии, где человек снят в профиль, широко улыбается, закрывает рот рукой или находится далеко от камеры.
Для вертикального ролика лучше подготовить кадр 9:16. Для сайта, презентации или YouTube подойдёт формат 16:9. Официальная документация Veo 3.1 указывает поддержку вертикального и горизонтального соотношений сторон, но конкретные настройки внутри Pauk AI могут зависеть от доступной версии модели.
Сервис доступен через привычные платформы:
В главном меню нужно выбрать раздел генерации видео. Для говорящего портрета потребуется режим, в котором загруженная фотография используется как основа будущего ролика.
Для эксперимента я выбрал Veo. Модель умеет создавать видео по фотографии и текстовой инструкции, а также генерировать речь и звуковое сопровождение. (Google DeepMind)
Внутри Pauk AI название доступной версии и параметры могут отличаться, поэтому перед генерацией стоит проверить интерфейс выбранной модели.
Добавьте фотографию и убедитесь, что лицо не обрезано. Вокруг головы и плеч желательно оставить немного свободного пространства, чтобы нейросети было проще добавить естественные движения.
Для первой генерации я бы использовал одно-два предложения. Чем длиннее текст, тем сложнее сохранить точное движение губ, стабильное лицо и естественную интонацию.
Например:
Привет! Я решил записать это короткое видео, чтобы пожелать тебе отличного дня. Надеюсь, сегодня произойдёт что-нибудь хорошее.
В промпте отдельно укажите:
После обработки нужно проверить:
Используй загруженную фотографию как точный референс внешности человека и создай фотореалистичное короткое видео.
Полностью сохрани лицо, возраст, форму глаз, носа, губ, линию челюсти, причёску, оттенок кожи, одежду и узнаваемые черты человека. Не создавай другого персонажа.
Человек смотрит прямо в камеру и спокойно произносит на русском языке следующую реплику:
«Привет! Я решил записать это короткое видео, чтобы пожелать тебе отличного дня. Надеюсь, сегодня произойдёт что-нибудь хорошее».
Голос естественный, спокойный и дружелюбный. Средний темп речи, чёткая дикция, без дикторского пафоса, крика и чрезмерной эмоциональности.
Точно синхронизируй движение губ с русской речью. Мимика минимальная и естественная: спокойный взгляд, лёгкое моргание, едва заметная улыбка в конце.
Голова почти неподвижна, только небольшой естественный поворот и лёгкие микродвижения. Плечи и руки остаются в исходном положении.
Камера неподвижна или очень медленно приближается. Фон полностью стабилен. Мягкое естественное освещение, реалистичная кожа, нормальная анатомия лица.
Без смены сцены, новых людей, лишних предметов, изменения одежды, деформации лица, искажения зубов, резких жестов, случайной музыки и посторонней речи.
Другое лицо, изменение возраста, асимметричные глаза, деформированные губы, лишние зубы, неправильная синхронизация речи, чрезмерная улыбка, резкие движения головы, дрожание лица, изменение одежды, нестабильный фон, лишние люди, субтитры, логотипы, водяные знаки, музыка, шум, иностранная речь.
Фразы «красивый голос» недостаточно. Лучше описать голос через конкретные характеристики.
Например:
Можно попросить:
Лучше выбрать одну основную подачу:
Слишком большое количество противоположных эмоций может сделать речь неестественной.
Google описывает Veo как модель, способную создавать диалог вместе с синхронизированным видео, но результат не следует считать гарантированно идеальным для каждого портрета и текста. (Google Cloud)
Чтобы движение губ выглядело лучше:
Если текст длинный, лучше разделить его на несколько коротких сцен и затем объединить видео в CapCut.
Оживи загруженный портрет. Человек тепло смотрит в камеру и говорит: «Поздравляю тебя с днём рождения! Желаю больше ярких событий, спокойствия и людей, рядом с которыми можно быть собой».
Тёплый дружелюбный голос, средний темп, лёгкая улыбка. Точная синхронизация губ, минимальная мимика, неподвижная камера. Полностью сохрани лицо и одежду.
Создай короткое видео с виртуальным ведущим по загруженной фотографии. Человек уверенно смотрит в камеру и произносит: «Сегодня разберём, как создать изображение через нейросеть и улучшить результат с помощью одного промпта».
Чёткий спокойный голос, профессиональная, но естественная подача. Незаметные движения головы и рук, стабильный фон, точное сохранение внешности.
Человек смотрит в камеру и говорит: «Мы поможем превратить вашу идею в готовый визуал — от первого изображения до короткого видеоролика».
Уверенный доброжелательный голос, чёткая дикция, спокойная улыбка. Короткое рекламное видео без чрезмерного энтузиазма, музыки и дополнительных надписей.
Оживи портрет оригинального персонажа. Он слегка наклоняет голову, смотрит в камеру и говорит: «Ты всё-таки пришёл. Значит, готов услышать, что произошло здесь много лет назад».
Низкий спокойный мужской голос, медленный темп, загадочная подача. Минимальная мимика, мягкое движение камеры, сохранение лица, костюма и атмосферы.
Человек естественно произносит на английском языке: «Hi! Today we’re going to practice a few simple phrases you can use while travelling».
Медленный понятный голос, чёткое произношение, короткие паузы. Точное движение губ, спокойный взгляд в камеру, без фоновой музыки.
Девушка держит товар в исходном положении и говорит: «Эта компактная лампа создаёт мягкий свет и подходит для рабочего стола или зоны отдыха».
Спокойный рекламный голос, естественная мимика, минимальные движения рук. Не изменяй товар, упаковку, лицо и фон.
Сократите реплику и уменьшите скорость:
Используй ту же сцену, но произнеси текст медленнее. Сделай движение губ более точным и спокойным. Не добавляй лишнюю мимику.
Максимально сохрани идентичность человека. Уменьши движение головы и улыбку. Оставь только моргание и движение губ.
Используйте исходник с закрытым ртом и попросите:
Не создавай широкую улыбку. Рот открывается только для произнесения слов, зубы выглядят естественно и анатомически правильно.
Сделай голос обычным и разговорным, как в спокойном голосовом сообщении. Без дикторской подачи, пафоса и чрезмерной эмоциональности.
Только чистая речь и тихий естественный фон помещения. Без музыки, мелодии и звуковых эффектов.
Фон полностью неподвижный. Не меняй стены, мебель, предметы и освещение.
Сохрани исходную одежду, её цвет, ткань и все детали. Не добавляй аксессуары.
После генерации видео можно открыть CapCut и добавить автоматические субтитры:
Лучше размещать субтитры немного выше нижнего края, чтобы их не перекрывали элементы интерфейса социальной сети.
Ролик можно опубликовать как:
При публикации стоит обозначить, что видео создано или обработано с помощью ИИ, особенно если зритель может принять его за настоящую запись.
Veo может создавать видео на основе изображения и текстовой инструкции, включая речь и звуковое сопровождение. В Pauk AI модель доступна внутри раздела генерации видео.
В Pauk AI можно начать пользоваться инструментами бесплатно. Дополнительные генерации доступны по условиям сервиса.
Если интерфейс выбранного режима позволяет добавить аудиореференс, можно использовать запись голоса. Но доступные способы зависят от версии модели и функций Pauk AI. Для чужого голоса необходимо согласие его владельца.
Да, в промпте нужно привести точный русский текст и отдельно попросить русскую речь с чёткой дикцией. Результат стоит проверить: длинные или сложные слова могут произноситься неточно.
Veo создаёт новые кадры, а не просто двигает пиксели исходной фотографии. Сильная улыбка, быстрые движения и повороты головы увеличивают риск изменения внешности.
Для первого опыта лучше одно-два коротких предложения. Длинное обращение стоит разделить на несколько сцен.
Да, но для старого снимка лучше использовать минимальные движения и короткий текст. При работе с фотографиями умерших людей важно учитывать чувства родственников и не выдавать результат за настоящую запись.
Да. Сначала можно создать оригинального персонажа в графической модели Pauk AI, а затем загрузить портрет в Veo и добавить речь, мимику и движение камеры.
Технически изображение может быть загружено, но не следует создавать вводящие в заблуждение обращения от лица реальных людей. Используйте только изображения и голоса, на которые у вас есть разрешение.
Сделать говорящее фото нейросетью можно из одного портрета и текстовой инструкции. В Veo через Pauk AI пользователь задаёт реплику, голос, мимику, движение губ и поведение камеры, а затем получает короткое видео.
Лучше начинать с нейтрального портрета и одного небольшого предложения. Спокойный голос, минимальная мимика и неподвижная камера помогают сохранить внешность и получить более естественную синхронизацию.
Главная формула промпта:
Кто говорит + точная реплика + голос + эмоция + мимика + камера + ограничения.
Pauk AI позволяет открыть Veo через Telegram, VK или MaX и объединить весь процесс в одном интерфейсе: создать портрет, сделать говорящее видео, добавить музыку, озвучку и подготовить ролик для публикации.