Почему ваш AI-аватар каждый раз выглядит «почти как вы»

Когда говорят «AI-аватар», обычно представляют одно готовое видео. На деле за одним говорящим двойником стоит несколько слоёв, и если делать их в неправильном порядке - тратишь часы на то, что при правильном порядке решается один раз.

Раскладываю архитектуру на 4 этапа.

1️⃣ Этап 1 — консистентный клон Первая и самая важная часть - зафиксировать лицо так, чтобы оно оставалось узнаваемым от кадра к кадру. Без этого шага каждая новая фотография - это заново «а похоже ли на меня», и генерация превращается в лотерею: 100500 попыток ради одной удачной. Как только образ закреплён, дальше можно свободно менять одежду, фон, обстановку - не беспокоясь, что лицо «поплывёт».

2️⃣ Этап 2 — видео в разных форматах На основе закреплённого образа - говорящая голова (классический формат «в кадре и говорю»), проходки (движение в кадре, не статика) и UGC-формат (снято «как будто на телефон», без постановочности). Три разных задачи, три разных способа генерации поверх одной и той же базы.

3️⃣ Этап 3 — B-roll Без вставок даже хорошее видео смотрится скучно - глаз устаёт от одного статичного плана. Здесь нужно научиться подмешивать перебивки: не отдельная задача ради красоты, а то, что делает ролик смотрибельным до конца.

4️⃣ Этап 4 — голос и манера Финальный слой - чтобы аватар не просто говорил текст, а звучал как я: голос, интонации, манера подачи. Без этого всё предыдущее - просто картинка с озвучкой, а не цифровая версия человека.

Сейчас я на первом этапе - консистентность образа. Дальше по мере продвижения буду показывать, что получается на каждом шаге, что оказалось сложнее, чем ожидала, и во что это выливается по времени.

Если строите что-то похожее для эксперта в своей компании - интересно сверить, на каком этапе спотыкаетесь вы.

Почему ваш AI-аватар каждый раз выглядит «почти как вы» | Сетка — социальная сеть от hh.ru Почему ваш AI-аватар каждый раз выглядит «почти как вы» | Сетка — социальная сеть от hh.ru