🖥 К вечеру в том же чате AI отвечает как сильно выпивший коллега на удаленке?

Старается не спалиться. Но все равно себя выдает. Это не сбой и не усталость. Это архитектура.

LLM работает без памяти. Каждый раз, когда ты пишешь новое сообщение, он вынужден перечитывать все, что было до – весь чат с самого начала.

5-й ответ дается ему дешево. 200-й – уже совсем другая история.

Контекст переполняется. Качество падает. Токены тратятся на то, чтобы «вспомнить», с чего вы вообще начали. Вот почему я так топлю за архитектуру и контекст.

Это не про красивые папки. Это экономия токенов, нервов и принципиально другой уровень работы.

💡Что такое токены – расскажу на следующей неделе в этой же рубрике.

Что объяснить дальше? Пишите в комментариях🎀

🖥 К вечеру в том же чате AI отвечает как сильно выпивший коллега на удаленке?
Старается не спалиться. Но все равно себя выдает. Это не сбой и не усталость. Это архитектура.
LLM работает без памяти | Сетка — социальная сеть от hh.ru