Я отправил клона на работу, и никто не заметил
Недавно оказался в деликатной ситуации. Нужно было ехать в Москву, а время отправления электрички выпадало на квартальную планерку, на которой я должен был рассказывать свою часть про новые экспертизы и внедрения AI.
Не долго думая, я собрал всю информацию, которую хотел донести, в емкий текст и нашел инструмент для генерации цифрового аватара.
Процесс оказался очень увлекательным, а главное не занял много времени. Сначала нейросети нужно было создать «голову». Чтобы аватар не выглядел плоской картонкой, система использовала методы 3D-реконструкции лица из одного изображения. Алгоритмы на базе 3D Morphable Models восстановили геометрию и текстуры моего лица, буквально достроив то, чего не было видно на фото. А благодаря нейросетевым представлениям сцены (NeRF), модель поняла, как я должен выглядеть в движении и под разными углами. На выходе получилась полноценная цифровая копия с корректными чертами, но пока еще немая.
Чтобы аватар заговорил именно моим тембром, я использовал современный синтез речи — Zero-Shot TTS. Крутость в том, что нейронку не нужно учить неделями: хватило минутного примера моего голоса, который я записал, находясь в переговорке. Языковая модель проанализировала текст планерки, расставила интонации и ритм, а специализированный вокодер превратил этот математический код в живую звуковую волну. Фактически, нейросеть «напечатала» мой голос со всеми его особенностями.
Финальным штрихом стала синхронизация. Чтобы картинка не разваливалась, аудио перевели в цифровой вектор мимики. Здесь в дело вступили состязательные сети (GAN), которые покадрово генерировали изображение и итеративно улучшали его, пока не исчезло лишнее «мыло» и не появились живые микродвижения лица.
В итоге, пока я спокойно ехал в Москву, мой цифровой двойник уверенно вещал коллегам про нейронки. Кажется, это было самое наглядное внедрение AI, которое я мог продемонстрировать на этой планерке.