DeepSeek представила DSpark для ускорения генерации ответов больших моделей

DeepSeek выложила DSpark — метод спекулятивного декодирования, который ускоряет ответы больших моделей на живом трафике. Идея знакомая: маленькая модель набрасывает варианты, большая их проверяет. Но тут DeepSeek убрала два слабых места подхода — сделала наброски более согласованными и заранее отсекает заведомо бесполезные кандидаты.

По их данным, на DeepSeek-V4 ответы ускорились на 57–85%, а пропускная способность сервера выросла примерно в 1,5 раза. Код и веса уже доступны, а проверка на Qwen3 показывает, что это не локальный трюк под одну модель.

Источник: Нейроканал

Все новости: ai.popovs.tech

#DeepSeek #LLM #AI


В этом посте были ссылки, но мы их удалили по правилам Сетки