Малые LLM модели и сложный контекст
Почему малые LLM (7–14B) плохо понимают технические документы, даже при очень чистом RAG? И что вы делаете, чтобы повысить точность?
Столкнулся с ситуацией: есть качественный пайплайн RAG – глубокая семантика, – чёткие чанки, – rich metadata, – reranker, – NER и классификация запросов, – фильтрация нерелевантных блоков. Но малые модели (Qwen2.5 7–14B, Llama 8B, GigaChat 10B) плохо понимают технические фрагменты: схемы, инструкции, таблицы с вложенными структурами, ошибки, кодовые обозначения. Reranker вытаскивает правильный контекст, но модель либо не понимает, либо не может связать куски в корректный ответ. Большие модели (70B+) справляются, но по ресурсам недоступны локально. Вопрос: какие техники помогали вам реально улучшить способность маленьких моделей работать с техническими документами? Рассматривал: дистилляцию, supervising prompts, fine-tuning, head alignment — но интересен практический опыт. Что в итоге у вас сработало?
· 25.01
Попробовать модели oss20b и 30b instruct
+ оптимизировать промт (разметкой md xml)
Помогло в опимизации извлечение сущностей из юр документов
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 26.01
Спасибо! OSS 20B/30B пока не трогал именно из-за ресурсов, но, видимо, придётся попробовать, особенно в Instruct-вариантах. Интересно, как у вас выглядят результаты: — насколько именно 20–30B улучшили способность «сцеплять» технические куски, был ли у вас опыт сравнения с 7-14B моделями? — или прирост был именно в извлечении сущностей?
По поводу разметки — пробовал помечать чанки через pseudo-XML/MD (особенно для таблиц и вложенных структур), но эффект вышел только частичным. Возможно, я недостаточно агрессивно структурировал контент. Если есть какие-то примеры или паттерны разметки, которые реально «заходили» небольшой модели — буду признателен.
Отдельно интересно про опыт с юрдоками: там что больше всего помогло — сама структура (параграфы, номера статей), или fine-grained entity extraction (какие именно сущности выделяли)?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 26.01
В моем случае структуры как таковой не было, поэтому делали на чанки 4096+200 перекрытие И добавлял детекцию по ключ словам >=2-3.
Про xml md имеется ввиду написание промта с выделением определных заголовков Role, Task и тд тоже дает прирост к качеству.
По извлечению реквизиты стороны предмет договора, оплата стоимость, ндс, до 40 полей + потом можно добалвять, но там уже по контксту надо смотреть влезет или неа
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён