Вообщем для конкурса от openAI, не трудно спиздить чей то код и бить BPB 1, но это абсолютно глупо, я предпочитаю придумывать какие то свои математические вещи, а не придумывать что я самый умный с ллм подкрути гиперпараметры в чужой архитектуре,
хотя я какие то свои идеи пробовал прибивать к чужому коду, ну да кайф, можно победить как гиена, можно не победить и лежать в теньке как лев. В целом считаю что будущее за рекурсивными трансформерами,
а то что гугл там придумали сжатие нууу, че сказать сжимать эти ваши трансформеры получается уже дальше некуда ведь , от этого умнее и логичнее они не станут и дальше своей трансформерности не уйдут.
за месяц постараюсь найти выход как добиться 1,2 BPB на своей модели, горжусь собой что мои идеи работают, так гораздо совесть чище и нет синдрома самозванца. Это не отменяет той вещи что я тоже использую отчасти что то готовое созданное другими людьми. Но мне не хочется делать вид потому что и так всёвидно.
Наработанного за 2025 год ресерча еще хватит до конца 2027го.
И пока в основном все чалчтся на простой математике, я планирую сращивать свою архитектуру именно с конфигурациями когнитивными а не просто простынями Claude.md
а так реально чет сегодня подраастроился, гавнистый день. Ну и если вы не понимаете почему немного сегодня лагает ллм и все прочее из Электроники, помните что не во всех серверах есть экранирование от вспышек класса G1. А может на самом деле и не 1 🫡