Ребята из Qwen релизнули мультимодальную модель 😱
Встречайте, Qwen3-Omni — «из коробки» жуёт текст, аудио, картинки и видео.
В чём крутота: 🏆 По ряду ключевых метрик обходит GPT-4o и Gemini 2.5 Pro. 🔓 Лицензия Apache 2.0. Бери и используй в коммерции, никаких ограничений. 🧠 Элегантная архитектура "Мыслитель-Говорун" (Thinker-Talker) под капотом. ⚡️ Сверхнизкая задержка: ответ в аудио-сценариях всего за 211 мс. Идеально для ассистентов в реальном времени.
Я подготовил разбор: что у неё под капотом, как работает архитектура Thinker-Talker и как всё это запустить локально с примерами код Залетайте читать: Qwen3-Omni: разбор SOTA-модели, бросившей вызов GPT-4o и Gemini. Архитектура, тесты и запуск 👈🏻
А демку можно пощупать в чатике 💬