Малые LLM модели и сложный контекст

Почему малые LLM (7–14B) плохо понимают технические документы, даже при очень чистом RAG? И что вы делаете, чтобы повысить точность?

Столкнулся с ситуацией: есть качественный пайплайн RAG – глубокая семантика, – чёткие чанки, – rich metadata, – reranker, – NER и классификация запросов, – фильтрация нерелевантных блоков. Но малые модели (Qwen2.5 7–14B, Llama 8B, GigaChat 10B) плохо понимают технические фрагменты: схемы, инструкции, таблицы с вложенными структурами, ошибки, кодовые обозначения. Reranker вытаскивает правильный контекст, но модель либо не понимает, либо не может связать куски в корректный ответ. Большие модели (70B+) справляются, но по ресурсам недоступны локально. Вопрос: какие техники помогали вам реально улучшить способность маленьких моделей работать с техническими документами? Рассматривал: дистилляцию, supervising prompts, fine-tuning, head alignment — но интересен практический опыт. Что в итоге у вас сработало?