Мой инференс моделей qwen написаный на Rust впервые обогнал llama.cpp по скорости. Есть и другие преимущества в том числе размер занимаемой памяти.

Остался один небольшой момент по префилу, но он проявляется только при кешировании. Я работаю над этим, уверен скоро я добьюсь успеха и это станет свободным решением без необходимости использовать llama.cpp в проектах, а можно запускать модели прям в своем коде на Rust.

Есть желание потестировать пишите в личку. Решение поддерживает три протокола chat, response, message - что позволяет подключать запущенные модели к любому harness движку.

Исходниками бесплатно делиться не буду, но могу поучаствовать в проектах.

Мой инференс моделей qwen написаный на Rust впервые обогнал llama.cpp по скорости. Есть и другие преимущества в том числе размер занимаемой памяти | Сетка — социальная сеть от hh.ru