Память! Как же я забыла про память!
Это и есть отличие ламера от спеца. Но какой захватывающий образовательный трип! Пойти поесть и лечь спать заставляю себя уговорами.
В общем, вчера мой обновленный код со всеми ограничениями и памятью заработал. Даже анимация «печатает» заработала на русском языке. Я думала, что сегодня уже покачу на сервер.
Но! Легенда меняется, Штирлиц, вы — нищий 😅 Параллельно со мной бота делает спец с техническим бекграундом. Когда моя партнерша сказала «нужно запоминать все в диалогах с пользователем», он ответил, что токены будут улетать только так.
Сначала я легкомысленно заявила, что 1 млн токенов хватит на месяц для средне-разговорчивого пользователя, и даже для нескольких пользователей 🤣 Это была уверенность из разговоров и расчетов с ChatGPT недели 2 назад, когда я совсем ничего не понимала. Количество токенов он мне тогда рассчитал, исходя просто из взаимодействия «вопрос-ответ». Но паааамять укрыыыыта такими большими снегаааами.
Все грандиозные расходы токенов приходятся именно на память. Прям улетают только так. Дальше я опять пошла общаться с чатиком на предмет, как это оптимизировать. Расчет токенов — код — мой вопрос «а этот код точно поможет уложиться в 1 млн токенов в месяц, если » — код… и по кругу, пока мы не пришли к выводу, что при всех оптимизациях, нужно брать минимум 3,5 млн токенов в месяц на пользователя. Но это не точно. Опять все проверять и исправлять 🥹
Но это так интересно и офигительно. Надеюсь, после всех тестов мы сможем выпросить исходники кода у спеца за недорого. Надо ж сравнить. Даже если у меня все заработает, мы не сможем делать это вдвоем вечно. А значит, нужны алгоритмы постановки ТЗ, какой-то начальный набор best practices и документация.