🚀 Alibaba представила WAN 2.5 — универсальную модель для генерации видео со звуком!

🎬 Что нового: All-in-one foundation model — один движок для text-to-video, image-to-video, video editing и talking faces.

Native audiovisual synthesis — видео и звук рождаются одновременно, без склейки сторонних моделей.

Cinematic control — можно управлять стилем, движением камеры, освещением и атмосферой.

Talking avatars — оживление фотографий и синхронная речь с движением губ.

Поддержка до 1080p, 6 форматов кадра, до 10 сек видео с озвучкой на нескольких языках.

Сообщество отмечает: — прорыв для открытой экосистемы: видео+аудио в одной модели; — качество уже впечатляет, но в превью ещё встречаются баги с лицами и синхронизацией; — ждём открытого релиза весов, как у WAN 2.2 (8k+ ⭐ на GitHub).

Демо и примеры на wan.video