🖥 К вечеру в том же чате AI отвечает как сильно выпивший коллега на удаленке?
Старается не спалиться. Но все равно себя выдает. Это не сбой и не усталость. Это архитектура.
LLM работает без памяти. Каждый раз, когда ты пишешь новое сообщение, он вынужден перечитывать все, что было до – весь чат с самого начала.
5-й ответ дается ему дешево. 200-й – уже совсем другая история.
Контекст переполняется. Качество падает. Токены тратятся на то, чтобы «вспомнить», с чего вы вообще начали. Вот почему я так топлю за архитектуру и контекст.
Это не про красивые папки. Это экономия токенов, нервов и принципиально другой уровень работы.
💡Что такое токены – расскажу на следующей неделе в этой же рубрике.
Что объяснить дальше? Пишите в комментариях🎀