Сегодня день Qwen - три модели сразу! Пашут не покладая рук.

Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений

Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.

Главные нововведения:

  • Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
  • Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
  • Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
  • Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
  • Нативная поддержка ControlNet (keypoints, depth maps, sketches)

Особенности:

  • Поддержка двуязычного редактирования текста (китайский и английский)
  • Работа с кириллицей через text rendering capabilities
  • Semantic editing: изменение контента с сохранением визуальной семантики
  • Appearance editing: точные low-level изменения элементов

Применение:

  • IP creation и мем-генерация
  • Реставрация старых фото
  • Создание product постеров
  • Novel view synthesis

Ссылки: Qwen Blog Qwen-Image-Edit-2509 Demo GitHub

Qwen3-TTS-Flash: мультиязычный голосовой движок

Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.

Ключевые характеристики:

  • 17 встроенных голосов без дополнительного обучения
  • Минимум заиканий и ошибок произношения на длинных текстах
  • SOTA word-error rates по бенчмаркам
  • Автоматическая настройка просодии, темпа и эмоциональных интонаций

Языковая поддержка:

  • Оптимизирована для китайского и английского
  • Поддержка 10+ языков, включая русский
  • Интеграция с Qwen3 для мультимодальных ассистентов

Ссылки: Qwen Blog TTS Demo API Docs

Qwen3-Omni: нативная мультимодальная модель от Alibaba

Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.

Ключевые характеристики:

  • MoE-архитектура: 30B параметров, активируется 3B
  • SOTA на 22 из 36 audio/video бенчмарков
  • Производительность распознавания речи сравнима с Gemini 2.5 Pro
  • Латентность: от 234ms (audio) до 507ms (audio+video)
  • Архитектура Thinker-Talker с AuT энкодером

Языковая поддержка:

  • 119 языков для текста (включая русский)
  • 19 языков для голосового ввода (включая русский)
  • 10 языков для голосового вывода (включая русский)

Размер модели:

  • ~70GB в BF16
  • После Q4 квантизации ~14-18GB

Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.

Ссылки: Qwen Blog Qwen3-Omni-30B-A3B-Instruct GitHub Demo

Сегодня день Qwen - три модели сразу! Пашут не покладая рук. | Сетка — социальная сеть от hh.ru