DeepSeek V4 — 1 триллион параметров, архитектура MODEL1 снижает память на 40%, достигает 1.8x ускорения инферента

DeepSeek V4 выпущена в начале марта с инновационной архитектурой MODEL1, использующей многоуровневое хранилище KV-кэша (GPU, CPU, диск) и Sparse FP8 декодингом. При 1 триллионе параметров модель достигает 1.8x ускорения инферента с минимальной потерей точности. Это критично для стартапов и корпораций, которые хотят запускать мощные модели на собственном железе без миллиардных инвестиций.