Принципы работы с LLM

Использование нейросети LLM в workflow — это уже не магия, а инструмент. Но чтобы им эффективно пользоваться и понимать, где можно ему доверять, а где нет, важно знать, как оно работает изнутри.

У нейронки нет своей памяти. Она не помнит, о чем вы говорили с ней вчера или даже 10 минут назад. Каждый ваш новый запрос в чате — для неё чистый лист.

В основе получения данных, лежит промт-запрос — надстройка в API системе. То есть система чата искусственно подкладывает историю вашего диалога в начало каждого нового запроса. Вы говорите не с нейросетью, а с «менеджером» (API), который шепчет нейросети на ухо: «Вот что вы уже обсуждали, а теперь вот новый вопрос…».

«Знания» нейросети — это не база данных, куда она ходит искать. Это её «врождённый опыт» (веса модели), полученный во время обучения на гигантских массивах текстов. Она не ищет ответ, а предсказывает его, как опытный шахматист предсказывает ходы.

Важное уточнение: когда мы закидываем в чат брендбук и аналитику, мы не отправляем его в «базу знаний» нейросети. Мы добавляем этот текст в тот самый промт, который «менеджер» шепчет модели на ухо. То есть мы говорим: «Вот специфические данные по нашему проекту. Запомни их на время этого разговора и используй для ответов».

Объём текста (промта), который мы можем передать нейросети за раз, ограничен количеством токенов. Это как лимит символов в СМС. У нейросети свои расчёты, но для лёгкого понимания 1 токен — это ориентировочно 3 символа.

Лимиты токенов контекстного окна моделей бывают максимальными и активными: Максимальный контекст — это технический лимит, установленный разработчиками моделей. Активный контекст — то, что реально влияет на ответ, и обычно заметно меньше.

На графике я показала примерную область, где ответы будут самые точные и релевантные вашему запросу. И таблицу некоторых моделей с диапазонами токенов в максимальном и активном контексте.

Эти данные нам говорят о том, что чем дольше диалог и чем больше данных мы в него закинули, тем сильнее эта «оперативная память» переполняется. Самые старые части диалога (например, важные пункты из загруженного в начале брендбука) начинают «вытесняться» из контекста, и модель о них забывает. От перегрузки он начинает «галлюцинировать».

Вот мы и подошли к главной проблеме: когда контекст переполняется, модель теряет нить и начинает выдумывать. Она уверенно генерирует текст, который похож на правду и стилистически верен, но по смыслу может быть полной чушью: придумывает несуществующие пункты в брендбуке, искажает данные аналитики и т. д.

Ключевой инсайт моего поста: чем дольше и сложнее ваш чат, тем выше риск получить красивую, но бесполезную или вредную «дичь».

Вывод для workflow:

• Изучите слабые и сильное стороны языковых моделей. Принимайте во внимание диапазоны активного контекста и отличайте его от максимального.

• Всегда перепроверяйте ключевые факты, цифры и утверждения, особенно в длинных сессиях.

• Дробите задачи. Вместо одного гигантского чата «на весь проект» создавайте отдельные чаты под конкретные задачи: «чат для анализа XYZ», «чат для копирайтинга по новому продукту». Залили нужные файлы, получили ответ, завершили сессию.

• Перезагружайте контекст. Если чувствуете, что ответы стали странными, просто начните новый чат и заново загрузите туда критически важные данные (брендбук, ТЗ). Это сбросит «оперативную память» и вернёт качество ответов.

Сохраняйте себе эту готовую мини-инструкцию, которая поможет нам всем получать от нейросети максимально качественные и полезные ответы для работы.

Принципы работы с LLM | Сетка — социальная сеть от hh.ru Принципы работы с LLM | Сетка — социальная сеть от hh.ru