🤖 Алиса и вторники
Вы, наверняка, встречались с хохмой, в которой Алису просят просчитать число вторников в ближайшем месяце. А она в ответ бодро галлюцинирует цифрами от 2 до 10 (кстати, в Про версии на такие провокации она уже не поддаётся). Аналогичный прикол был и у новой модели Strawberry (она же — о1) от OpenAI — несмотря на заявленный разработчиками прорыв буквы r в strawberry она тоже считала с трудом. После таких вот провалов так и хочется сказать “фигня всё эти ваши нейросети, какой от них толк, первоклассник с гуглом и калькуляторм справится лучше!”. А я нашёл отличную статью, которая достаточно внятно объясняет, в чём реально модели стали лучше, и какого рода новые задачи она научилась решать. Там прям жирнейший лонгрид, запасайтесь чаем-кофе, и вперёд! Меня статья тоже надоумила на новые идейки, проверю и поделюсь результатами в одном из следующих постов!
P.S. Обратил внимание в статье на приложенную картинку, она показывает потенциальную линейку, которой можно оценивать модели. В o1 потихоньку нащупываем второй, то есть сделали не просто продвинутый генератор текста, а что-то, что более-менее умеет “обосновывать” свой текст. Это очень круто для LLM-ок, но я вот с грустью подумал, что и очень много людей вокруг тоже крутятся где-то на первом уровне и не особо стремятся выйти за уровень биочатботов :(