Mistral представил Voxtral — открытую платформу для распознавания речи
15 июля Mistral анонсировал Voxtral — семейство открытых аудиомоделей, конкурирующих с решениями OpenAI и Google.
Ключевые преимущества: 1. Экономичность: Работает вдвое дешевле аналогов (включая Whisper large-v3). 2. Мультиязычность: Транскрибирует и анализирует речь на 8 языках (EN, ES, FR, PT, HI, DE, NL, IT) с автоопределением языка. 3. Гибкость развертывания:
- Voxtral Small (24B): для промышленных задач,
- Voxtral Mini (3B): работает на ноутбуке, превосходит базовый Whisper. 4. Открытость: Модели доступны для модификации и локального развертывания.
Практическая польза для читателей:
- Снижение затрат на речевые функции в проектах
- Упрощение разработки мультиязычных сервисов
- Возможность тестирования и интеграции без зависимостей от проприетарных API
Ссылки для ознакомления:
- Технические детали на TechCrunch
- Модели на Hugging Face: Small и Mini
В этом посте были ссылки, но мы их удалили по правилам Сетки