Зачем писать свой LLM-инференс на Rust в 2026 году, когда есть llama.cpp?
История разработки forge - специализированного движка под гибридные модели (Qwen3.5/3.6 с DeltaNet и MTP):
Архитектура и стек: форк candle на Rust, слитный DeltaNet, постраничный KV-кеш, CUDA-графы
Замеры и бенчмарки: обгон llama.cpp на контекстах от 8K до 128K по префилу и декоду
Грабли под капотом: борьба с WDDM в Windows, утечки CUDA-пула, оптимизация MTP и пробитие потолка памяти GPU