TF-IDF: классика, усиливающая современные подходы
Как-то я видел запись собеседования на позицию Data Scientist в области NLP. И соискатель не ответил на вопрос, что такое TF-IDF.
Казалось бы, и что тут ужасного, ведь весь мир давно перешел на использование нейросетевых архитектур в задачах компьютерной лингвистики. Тем не менее TF-IDF сегодня не только позволяет не только создавать baseline для тех же спам-фильтров, но и усиливать решения по автоматизации техподдержки.
Появление LLM заставило задуматься о том, что на них можно переложить работу хоть бы L1 техподдержки, дабы не отвлекать кожаный персонал на распространенные вопросы. Однако даже самые передовые модели не знакомы с инструкциями и регламентами, которые являются сугубо внутренней документацией. Самому как обучать, так и дообучать накладно и не столь уж просто, даже если есть в наличии собственный ЦОД из GPU.
Поэтому несколько лет назад был предложен подход «Retrieval+Augmentation+Generation» (RAG). Его суть базируется на простом жизненном примере. А именно даже самый выдающийся лектор может допустить ошибки, опираясь исключительно на собственную память. В то время как подобные риски минимизируются, если есть возможность подглядывать в заранее подготовленные материалы. В рамках же RAG аналогичным образом LLM способна подсматривать в имеющуюся базу знаний, чтобы точнее ответить на пользовательский вопрос.
Но проблема в том, что RAG-системы не оказались универсальной серебряной пулей. Классическая ситуация, когда чат-бот на ее основе демонстрирует низкие метрики. Пытаются менять стратегию чанкирования, редактировать системный промпт, ставить иные гиперпараметры, даже использовать другие модели для извлечения эмбеддингов и генерации текста. Тем не менее метрики качества не только не растут, да еще и порой падают.
Один из вариантов решения проблемы — обращение к классике NLP путем применения TF-IDF. Данная величина характеризует важность каждого слова в корпусе текстов, и ее расчет базируется на дистрибутивной гипотезе. Которая заключается в том, что наиболее ценные слова в корпусе текстов одновременно часто имеют место в документе и редко встречаются в коллекции документов.
В контексте векторного поиска дополнительное использование TF-IDF позволяет гораздо точнее переранжировать тексты, поскольку эмбеддинги слабо улавливают лексическую близость с содержанием пользовательского запроса.
Да, усиление векторного поиска с помощью TF-IDF тоже не дает никаких гарантий того, что метрики качества точно взлетят вверх. Однако описанная мной инженерия емко подтверждает избитый штамп, что новое и эффективное — это зачастую хорошо забытое старое.
· 12.08
IDOR-CB-1786511875914
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён