Я скинул в Telegram пару фото и три коротких видео с телефона, написал идею в две строки и пошёл ставить чайник. Когда вернулся, в чате лежал готовый вертикальный ролик. С переходами, с текстом, который выезжает на каждом кадре, и сразу в двух версиях: на русском и на английском.
Я пересмотрел его несколько раз подряд. Ролик неидеальный, но его смонтировал не я. Его смонтировал агент, которого я собрал сам, вместе с нейросетью.
В этой статье расскажу, как он устроен, что меня в нём удивило и почему я делаю ставку на живое видео, а не на генерацию.
У меня в телефоне полно коротких видео. Море, работа за ноутбуком, прогулки, мелкие моменты, которые хочется показать. Снимать легко. Телефон всегда в руке.
А дальше начинается монтаж. Открываешь CapCut, отбираешь кадры, режешь видео, выставляешь длительность, подбираешь переход, набираешь текст, анимируешь его, двигаешь так, чтобы кнопки Reels его не перекрыли. Потом понимаешь, что аудитория у тебя на двух языках, и делаешь всё второй раз с английским текстом.
В итоге один ролик съедал вечер. А свободных вечеров мало. Видео копились в галерее и устаревали раньше, чем я до них добирался.
Я десять лет в маркетинге и SMM и прекрасно понимаю, что регулярность решает. Понимать и делать оказалось разными вещами. Тогда я решил, что монтировать должен не я.
Это бот в Telegram. Я выбрал Telegram, потому что там у меня и так вся жизнь: заметки, голосовые, файлы. Никаких новых приложений и кабинетов. Код на Python я писал вместе с нейросетью: я ставил задачу и проверял результат, она помогала с реализацией.
Весь процесс выглядит как обычная переписка:
Отдельно я поработал над текстом. В агента зашит длинный список того, что выдаёт нейросеть с головой: длинные тире, штампы вроде «стоит отметить», пафосные слова, мораль в конце. Тире дополнительно вычищаются кодом, потому что модель не всегда слушается просьб. В итоге текст звучит так, как я сам бы сказал коллеге за кофе.
Я сам писал этого агента и знаю каждую строчку логики. И всё равно каждый раз, когда он присылает ролик, я немного радуюсь, как ребёнок. Вот что работает лучше, чем я ожидал.
Ролик ровно под голос. Я записываю озвучку, и агент смотрит её длину. Время между кадрами он делит по объёму текста: где мысль длиннее, кадр стоит дольше. Если материала не хватает до конца голоса, агент сам добирает другие фрагменты из моих видео и повторяет фото с другим движением камеры. Раньше подгонка под звук съедала больше всего времени.
Фото, которые двигаются. Статичное фото в рилсе выглядит мёртво. Агент держит каждое фото от одной до трёх секунд и добавляет плавный наезд или отъезд камеры. Из видео он берёт фрагмент на две-три секунды, причём из разных мест, а не всегда с начала.
Один аккуратный переход. Никаких вспышек и вращений из шаблонов. Кадры сменяются быстрым сдвигом вбок с лёгким размытием, за четверть секунды. Смотрится как монтаж человека со вкусом.
Текст, который живёт. Заголовок появляется первым, подпункты следом, лесенкой. Анимация меняется от кадра к кадру: снизу, сверху, проявлением, с лёгким увеличением. И текст стоит чуть выше нижнего края, чтобы его не закрывали кнопки и подпись в Reels. Мелочь, про которую забываешь в CapCut, а потом переделываешь.
Два языка без второго монтажа. Один материал, два ролика. Английский получается разговорным, без корпоративного глянца. Для меня это отдельная радость: раньше английская версия означала второй вечер в монтаже.
Сейчас модно генерировать ролики целиком: нейросеть рисует людей, свет, сюжет. Выглядит эффектно первые пару раз, а потом ленты оказались забиты одинаковыми гладкими лицами и пластиковым светом. Зрители научились узнавать такие ролики с первой секунды и листают дальше.
Живое цепляет по-другому. Настоящая кухня, настоящий офис, прогулка у моря, руки мастера в процессе. Такое хочется досмотреть, потому что это правда происходит с человеком. Людям интересно настоящее, и живой лайфстайл сейчас собирает досмотры и комментарии заметно охотнее, чем очередная генерация.
Поэтому мой агент ничего не рисует. Все кадры мои, сняты на телефон. Нейросеть работает там, где её не видно зрителю: пишет текст, считает тайминг, собирает монтаж. Зритель видит мою жизнь. ИИ остаётся за кадром и делает скучную часть работы.
Главное изменение в голове. Раньше видео в галерее было задачей на потом. Теперь это готовый материал. Снял что-то интересное, скинул агенту, написал пару строк, и через несколько минут у меня ролик на двух языках.
Монтаж перестал быть поводом отложить. Можно собрать рилс в дороге, в очереди, между созвонами. Мне остаётся самое приятное: решить, что показать, и сказать об этом своими словами.
И ещё одно чувство, которое трудно описать. Когда ты маркетолог и разработчик одновременно, самое крутое, это собрать инструмент под свою же боль и увидеть, как он работает. Без команды, без бюджета, вдвоём с нейросетью. Сейчас, когда я снимаю что-то на телефон, я уже думаю, в какой ролик это пойдёт.