Вышла языковая модель DeepSeek V3.2 Языковая модель DeepSeek V3.2 выпущена разработчиками DeepSeek AI. Модель доступна в двух вариантах: базовая DeepSeek-V3.2 с 671 миллиардом параметров и облегченная DeepSeek-V3.2-Lite с 15,7 миллиарда параметров. Обучение проводилось на кластере из 32768 ускорителей Nvidia H800 с использованием архитектуры Mixture-of-Experts (MoE).
DeepSeek V3.2 показывает улучшения в задачах с длинным контекстом до 128 тысяч токенов и поддерживает мультимодальность для обработки изображений. По результатам бенчмарков модель опережает аналоги вроде Qwen2.5-72B и Llama-3.1-405B в тестах MMLU-Pro и GPQA-Diamond. Общий объем предобученных данных составил 14,8 триллиона токенов.
Попробовать модель можно через веб-интерфейс на сайте DeepSeek или на Hugging Face в форматах GGUF и MLX. API-сервис предоставляет бесплатный доступ с лимитом 50 запросов в день и платный тариф от $0,14 доллара за лям