Зачем писать свой LLM-инференс на Rust в 2026 году, когда есть llama.cpp?

История разработки forge - специализированного движка под гибридные модели (Qwen3.5/3.6 с DeltaNet и MTP):

Архитектура и стек: форк candle на Rust, слитный DeltaNet, постраничный KV-кеш, CUDA-графы

Замеры и бенчмарки: обгон llama.cpp на контекстах от 8K до 128K по префилу и декоду

Грабли под капотом: борьба с WDDM в Windows, утечки CUDA-пула, оптимизация MTP и пробитие потолка памяти GPU

Полный разбор с формулами и кодом Отчет по тестам

Зачем писать свой LLM-инференс на Rust в 2026 году, когда есть llama.cpp?
История разработки forge - специализированного движка под гибридные модели (Qwen3.5/3 | Сетка — социальная сеть от hh.ru