Сегодня день Qwen - три модели сразу! Пашут не покладая рук.
Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
Ссылки: Qwen Blog Qwen-Image-Edit-2509 Demo GitHub
Qwen3-TTS-Flash: мультиязычный голосовой движок
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов
Ссылки: Qwen Blog TTS Demo API Docs
Qwen3-Omni: нативная мультимодальная модель от Alibaba
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.