Фёдор Ананин Путешествую по миру с кошкой и обожаю технологии. В iGaming нашел идеальное сочетание: технологии, психология и развлечения — пишу об этом здесь.
В нашем спецпроекте про ИИ в iGaming был большой блок про AI-инфлюенсеров — аккаунты, которые нейросеть ведет полностью сама. Она постит контент от лица якобы существующего человека, собирает подписчиков, а дальше отправляет им в личку конкретные офферы в ответ на типичное: «Привет! Чем занимаешься?». Схема рабочая, но держится исключительно на контенте — если аккаунт не собирает охваты, отправлять ссылки будет попросту некому.
Помочь может следующий план: сначала персонаж набирает аудиторию на безобидном лайфстайл-контенте, а только потом его подписчики начинают видеть офферы в рилсах, постах, сторис и личке. Дальше разберем первую половину этой схемы и расскажем, как при помощи нейросетей штамповать танцы из TikTok, повторяя уже выстрелившие видео.
Ролик, который собрал миллионы просмотров, уже прошел проверку алгоритмами. Повторяя его, вы повышаете шансы, что видео выстрелит и у вашего персонажа. А вот со своей оригинальной задумкой заранее непонятно, сработает она или нет.
А еще в TikTok и Instagram* трендом часто становится вполне конкретный танец, который в моменте повторяют все подряд. Здесь может сильно помочь перенос движений с чужого видео: нейросеть не поймет команду вроде «станцуй под Ela Desce», зато легко перенесет нужные действия и мимику с видео-референса на вашего персонажа.
В прошлом материале о создании ИИ-креативов мы уже использовали агрегатор нейросетей Higgsfield. Он удобен тем, что сразу предлагает все необходимое в единой подписке: генерацию фото, видеомодели с переносом движения и создание звуков.
Привязываться к нему не обязательно. Каждую нейросеть можно запускать в ее родном сервисе с отдельной подпиской, можно взять и любой другой агрегатор — на результат это не влияет.
Первый шаг самый простой и приятный: листаете ленту TikTok и Instagram*, пока не найдете подходящий ролик. Нужно выбрать тот, который лучше ляжет на вашего персонажа и который нейросеть повторит без артефактов (о том, какие видео повторить легко, а какие нет, — в конце статьи).
Дальше видео нужно скачать. Для этого хватает любого бесплатного сервиса: вводите «скачать TikTok видео» в поисковике и используете первый из выдачи — они все делают одно и то же.
Как делать не нужно: сразу грузить изображение персонажа в видеомодель и запускать генерацию. Если исходные фото и видео сильно расходятся по позе, ракурсу и фону, то перенос движения сработает непредсказуемо.
Поэтому лучше сначала подготовить стартовый кадр, максимально близкий к оригиналу. Чем меньше нейросети приходится додумывать, тем меньше шансов, что она выдаст галлюцинацию вместо адекватного результата.
Генерация фото дешевая и быстрая, а вот видео — дорогая и долгая. Логичнее потратить лишнюю минуту на фото, чем сжечь кредиты на видео, которое точно выйдет неудачным. Бонусом это работает как проверка: если на этапе создания изображения все хорошо, то с большой вероятностью и ролик тоже получится.
Чтобы получить фото персонажа в той же обстановке, что и в оригинале, мы сделали три вещи:
На этом же этапе удобно править все, что не нравится: мимику, фон, одежду. Генерация видео и без того сложный процесс, поэтому лишние вводные тут отрабатывают хуже.
Заходим в список видеомоделей, открываем раздел Motion Control и выбираем Kling 3.0 Motion Control. Модель качественная: аккуратно переносит на персонажа и движения тела, и мимику, и артикуляцию.
В настройках есть выбор, откуда брать фон — из оригинального видео или из кадра с персонажем. Мы выбрали второй вариант. Перенос из видео тоже работает нормально, так что выбор зависит от задачи. Своя картинка дает одно важное преимущество: обстановку вокруг персонажа можно переделать заранее.
Пример ситуации, когда нужно отредактировать фон: у персонажа в профиле указан ГЕО — Великобритания, а на фоне в кадре у него видно американскую розетку. Внимательный зритель зацепится за эту деталь и поймет, что перед ним не живой человек, а сгенерированная имитация или чужие перезаливы. Если вы относитесь к таким мелочам трепетно, движение имеет смысл переносить на свое фото, доведенное до ума заранее.
Запускаем генерацию и через какое-то время получаем точную копию загруженного ролика, но уже с нашим персонажем. Движения, мимика — все передано идеально. Если очень пристально всматриваться, кто-то, возможно, и заподозрит нейросеть, но в общей ленте TikTok вероятность этого невысока.
Почти у всех видеомоделей есть выбор качества готового ролика — у Kling 3.0 Motion Control это 720p и 1080p. Переплачивать за FullHD смысла мало. На телефоне разницу между ними никто не разглядит, а по цене разрыв ощутимый: та же генерация в 720p обошлась в 23 кредита, а в 1080p запросила бы уже 37. Для контента, который живет в вертикальной ленте, это лишние траты.
Для второго ролика мы поменяли стратегию: перенесли и движение, и фон из оригинального видео, а фото персонажа оставили то же самое. Результат снова получился достойным. Повезло, что типаж нашего героя совпал с оригиналом. Гнаться за полным совпадением не нужно, но если разница слишком большая, нейросеть начнет додумывать и может увлечься галлюцинациями.
Без шероховатостей все же не обошлось. На исходнике у героини был длинный рукав, а на нашем фото короткий, и нейросеть на этом расхождении зачем-то дорисовала персонажу татуировки, которых не было ни на фото, ни на видео. Причина в том, что мы не редактировали кадр и загрузили только лицо — контроля над одеждой и другими деталями в таком случае у нас нет. По той же причине на персонаже оказались туфли из оригинального ролика: на нашем фото обуви просто не видно, и нейросеть подтянула ее из исходного видео.
Третий пример честно назовем неудачным. Дело в том, что исходный ролик — это два видео, склеенных в одно. Чтобы повторить его правильно, пришлось бы открыть монтажную программу, разрезать оригинал на две части и генерировать каждую отдельно. Мы не стали этого делать намеренно: задача статьи — честно показать сильные и слабые стороны нейросетей.
В первой половине оригинала героиня без макияжа, во второй — с макияжем, и весь ролик держится на этом переходе. Мы прогнали видео единым потоком, и макияж на нашем варианте так и не появился. Причина в том, что нейросеть от начала до конца копирует исходного персонажа, а подставлять во второй половине его преображенную версию она не умеет.
Отдельно бросается в глаза момент, когда персонаж машет рукой перед камерой: движение выглядит неестественно, заметно хуже, чем в живом оригинале. С этим, к сожалению, нейросети пока справляются плохо.
Если нужна копия, которую сложно отличить от живой съемки, берите за основу простые ролики. Идеально имитируются видео, где человек стоит примерно на одном месте и что-то говорит или танцует.
Нейросеть спотыкается, как только в кадре появляются сложные мелкие детали, быстрые движения и монтаж. В черный список стоит занести:
Чем статичнее оригинал, тем лучше получится копия. Это, пожалуй, главный практический критерий при выборе референса — даже важнее самого сюжета ролика.
Все эксперименты выше мы проводили на Kling 3.0 Motion Control, но переносить движения умеет не только она. Есть, например, Wan 2.2 Animate, и у нее интересное преимущество: модель можно запустить локально на своем компьютере с мощной игровой видеокартой или на макбуке, если хватает оперативной памяти.
Нюанс в том, что открытый доступ и возможность запуска на своем железе есть только у версии 2.2. Более новые отдают уже за деньги — через официальный сайт компании и крупные агрегаторы, актуальная версия там 2.7. Так что открытую 2.2 уже можно считать заметно устаревшей моделью. Лица у нее получаются более пластиковыми, чем у Kling 3.0, да и косяков с артефактами она допускает больше.
При этом локальный запуск остается приятной опцией для тех, у кого уже есть мощное железо. Можно сделать хоть сотню генераций и выбрать из них одну удачную, не платя за каждую попытку отдельно.
Не воспринимайте эту статью как вневременное пособие по генерации. Откроете ее через месяц или через полгода — конкретные названия моделей и сервисов к тому моменту наверняка поменяются. А вот принципы останутся рабочими надолго, так что ориентируйтесь именно на них:
* Соцсеть запрещена в РФ
Andromeda: все о новом алгоритме Facebook Ads*
Слот-игра в Telegram за 10 дней собрала 1,2 млн Stars без рекламы — интервью с фаундером
Lamanche Payments — обзор виртуальных карт для арбитража трафика
Один основатель мертв, второй раскаивается: скандальный букмекер Paddy Power
Не уходим с ивента без контактов: лайфхаки и ошибки HR-специалистов