Половина людей не отличила бота от человека по видеосвязи? 🤔

Стартап Tavus выкатил модель Griffin, обозвав её новым классом — HIM (Human Interaction Model). А маркетологи заявили, что первыми в мире прошли «видео-тест Тьюринга». 😱 Сначала про архитектуру⚙️

Как до сих пор строились почти все диалоговые аватары? Через костыльный каскад: Микрофон ➔ ASR (распознавание) ➔ LLM (генерация текста) ➔ TTS (синтез речи) ➔ Face model (натягивание губ на видео).

Пайплайн последовательный. Пока юзер договорит, пока разойдётся аудио, пока LLM выплюнет первые токены, пока пойдёт звук и анимация — проходит 1.5–2 секунды мёртвой тишины. Получается фигово: стеклянные глаза, фальшивая улыбка и перебивание невпопад, если вы просто сделали паузу вдохнуть.

В Griffin система непрерывно крутит два параллельных движка: Continuous Conversational Modeling (мозг и восприятие) и Audio Visual Generation (стриминговая генерация лица и голоса). Модель воспринимает видео и аудио непрерывно и не ждёт конца вашей фразы. Вы говорите — она считывает мимику, кивает, издаёт естественные «угу / ага» ровно в тайминг. Если вы запнулись и отвели взгляд, чтобы подумать — она понимает визуальный контекст и не перебивает, а ждёт. На бенчмарке NVIDIA VideoFDB она выбила 3.83 балла по генерации против 3.92 у живого человека (у связки Gemini 2.5 + Anam там грустные 2.80).

В прод, разумеется, модель широкой публике прямо сейчас не отдают — выкатили только превью Griffin-Lite для закрытого пула тестеров. Официальная отмазка — «Модель получилась настолько реалистичной и способной вводить людей в заблуждение, что в паблик мы её пока не дадим из соображений безопасности» (где-то мы это уже слышали, ага) 🤭 Неофициальная, как обычно, куда прозаичнее: инференс тяжелой стриминговой диффузии на H100 под каждого юзера в реальном времени стоит как чугунный мост. Если прикрутить эту систему в условный саппорт банка или колл-центр интернет-провайдера — бюджет на облака сожрёт всю операционную маржу ещё до того, как клиент успеет объяснить, что у него не горит лампочка на роутере.

Пока это дорогая игрушка для очень узких ниш.

Ну и про «тест Тьюринга» 🤡

Тут, как обычно, кринжовый маркетинг чистой воды. В исследовании участвовало всего 54 человека. Формат: видеозвонок ровно на одну минуту. Якобы 48% участников минутного звонка решили, что общались с живым человеком (при этом те, кто заподозрил неладное, выкупили подвох в первые 20 секунд). На такие цифры можно только скептично хмыкнуть — за минуту неподготовленный человек и телефонного мошенника охотно признает майором ФСБ.

Но в целом, конечно, результаты интересные. Когда там уже полноценные ИИ-аватары?

Половина людей не отличила бота от человека по видеосвязи? 🤔
Стартап Tavus выкатил модель Griffin, обозвав её новым классом — HIM (Human Interaction Model) | Сетка — социальная сеть от hh.ru Половина людей не отличила бота от человека по видеосвязи? 🤔
Стартап Tavus выкатил модель Griffin, обозвав её новым классом — HIM (Human Interaction Model) | Сетка — социальная сеть от hh.ru