Мой инференс моделей qwen написаный на Rust впервые обогнал llama.cpp по скорости. Есть и другие преимущества в том числе размер занимаемой памяти.
Остался один небольшой момент по префилу, но он проявляется только при кешировании. Я работаю над этим, уверен скоро я добьюсь успеха и это станет свободным решением без необходимости использовать llama.cpp в проектах, а можно запускать модели прям в своем коде на Rust.
Есть желание потестировать пишите в личку. Решение поддерживает три протокола chat, response, message - что позволяет подключать запущенные модели к любому harness движку.
Исходниками бесплатно делиться не буду, но могу поучаствовать в проектах.