🚀 Alibaba представила WAN 2.5 — универсальную модель для генерации видео со звуком!
🎬 Что нового: All-in-one foundation model — один движок для text-to-video, image-to-video, video editing и talking faces.
Native audiovisual synthesis — видео и звук рождаются одновременно, без склейки сторонних моделей.
Cinematic control — можно управлять стилем, движением камеры, освещением и атмосферой.
Talking avatars — оживление фотографий и синхронная речь с движением губ.
Поддержка до 1080p, 6 форматов кадра, до 10 сек видео с озвучкой на нескольких языках.
Сообщество отмечает: — прорыв для открытой экосистемы: видео+аудио в одной модели; — качество уже впечатляет, но в превью ещё встречаются баги с лицами и синхронизацией; — ждём открытого релиза весов, как у WAN 2.2 (8k+ ⭐ на GitHub).
Демо и примеры на wan.video