ПРОДОЛЖЕНИЕ ПРЕДЫДУЩЕГО ПОСТА

Успеху DeepSeek во многом способствовала новая архитектура Multi-head Latent Attention (MLA), которая позволила сократить стоимость обучения на 90%, игнорируя 95% ненужных данных. Вопрос остаётся открытым: это гениальное упрощение или просто экономия на алгоритмах? Как бы то ни было, результат поражает, что обогнала ChatGPT по всем основным бенчмаркам. Модели серии R1 обучались математике методом проб и ошибок, как аспиранты с PhD, и в итоге достигли уровня GPT-4, но при этом оказались на 95% дешевле.

💬Что происходит на рынке сейчас? 💬 Китайский чат-бот DeepSeek мгновенно взлетел на первое место в топе AppStore в шести странах, включая США, обогнав даже ChatGPT на его родной территории.

💬 Акции технологических гигантов, таких как Nvidia, упали на 17%, Microsoft — почти на 5%, а индекс NASDAQ в совокупности потерял более 500 миллиардов долларов.

💬 DeepSeek стала первой моделью с открытым исходным кодом, доступной каждому разработчику без необходимости использования VPN.

Этот технологический скачок вызвал настоящую истерику среди американских корпораций. Экстренные совещания, пересмотр стратегий и миллиардные инвестиции — всё это стало реакцией на неожиданное лидерство Китая. Китай не только обошёл санкции США, но и вышел вперёд в гонке искусственного интеллекта.

США не могут позволить Китаю доминировать в сфере ИИ. Учитывая, что нынешнее правительство США состоит из технократов, таких как Илон Маск, можно ожидать ответа, сопоставимого с запуском советского «Спутника» в 20-ом веке. Триллионы долларов будут вложены в эту гонку, и она только набирает обороты.

🫧НЕБОЛЬШАЯ ОТСЫЛКА: По моим предположениям для успешной работы модели DeepSeek потребовалось чуть более, чем 100 северных стоек в дата-центре. И, что интересно, я вместе со своей командой как раз разрабатываю инновационный дата-центр, который, сможет удовлетворять все запросы рынка и уверен, что он также произведёт революцию на рынке коммерческих ЦОД.

👨‍💻 Эта история — не просто новость, а сигнал о том, что мир технологий меняется с невероятной скоростью. И те, кто сегодня кажется лидером, завтра могут оказаться в роли догоняющих.

ПРОДОЛЖЕНИЕ ПРЕДЫДУЩЕГО ПОСТА
Успеху DeepSeek во многом способствовала новая архитектура Multi-head Latent Attention (MLA), которая позволила сократить стоимость обучения на 90%, игнорируя 95% ненужны... | Сетка — социальная сеть от hh.ru