Обновил сайт Yttri Forge: новые результаты на MoE-модели. Мой yforge обошёл llama.cpp по всем 13 метрикам.

Модель Ornith-1.5-35B-A3B Q8_0, стенд RTX 4090 48 ГБ. У обоих движков один и тот же GGUF и окно 256K, как в проде.

Префил у yforge быстрее на 35–61 %. Отрыв по декоду растёт с длиной контекста: на самом длинном промпте +31 %.

По времени ядер движки шли вровень, но декод у yforge поначалу отставал: время съедал сэмплер. Перевёл отбор top-k с пула потоков на последовательный проход, и yforge вышел вперёд.

На сайт добавил и сравнение с vLLM 0.28 на официальной FP8. По префилу vLLM быстрее - считает его в FP8 на тензорных ядрах, а по декоду вровень.

Сайт: https://forge.yttri.online/

Исходники движка: https://github.com/askidmobile/yttri-forge

Скрипты замеров: https://github.com/askidmobile/qwen36-server/tree/main/scripts/bench/ornith-35b

Обновил сайт Yttri Forge: новые результаты на MoE-модели. Мой yforge обошёл llama.cpp по всем 13 метрикам.
Модель Ornith-1.5-35B-A3B Q80, стенд RTX 4090 48 ГБ | Сетка — социальная сеть от hh.ru Обновил сайт Yttri Forge: новые результаты на MoE-модели. Мой yforge обошёл llama.cpp по всем 13 метрикам.
Модель Ornith-1.5-35B-A3B Q80, стенд RTX 4090 48 ГБ | Сетка — социальная сеть от hh.ru