GPU в соло не вывозят
На протяжении последнего десятилетия развитие искусственного интеллекта подчинялось простой и понятной логике: чем больше вычислительной мощности, тем умнее становится модель. Казалось, что GPU — это незыблемый фундамент цифрового будущего, универсальный инструмент, способный решить любую задачу, от рендеринга графики до обучения нейросети.
Однако к середине 2020-х годов этот фундамент дал трещину. Индустрия столкнулась с последствиями собственного успеха. Экспоненциальный рост сложности моделей уперся в жесткие физические барьеры: законы термодинамики, пределы пропускной способности электросетей и банальную экономическую нецелесообразность. Универсальность графических ускорителей, их главное историческое преимущество, внезапно стала обузой. Оказалось, что для массового, повседневного использования ИИ не нужны сложнейшие комбайны, способные на любые вычисления. Нужен скальпель — дешевый, холодный и невероятно быстрый в одной конкретной задаче.
Аппаратный раскол затрагивает все уровни технологической цепочки: от фундаментальной физики передачи данных до того, как мы держим смартфон в руках. В этой статье мы рассмотрим, как именно происходит этот распад: почему классические GPU уступают место узкоспециализированным электронным схемам и вычислителям на основе света, как децентрализация переносит интеллект из облаков на периферию, и почему массовая автономия ИИ создала парадоксальную проблему, заставив машины контролировать другие машины в сферах кибербезопасности и финансов.
Аппаратный раскол на ASIC и оптику
Классические графические ускорители, включая флагманские системы NVIDIA Vera Rubin NVL72, окончательно утратили статус оптимального инструмента для всех задач искусственного интеллекта. Глобальная инфраструктура переживает аппаратный раскол, формируя два несовместимых, но взаимодополняющих технологических стека: узкоспециализированную электронику (ASIC) для логики и световые (фотонные) процессоры для преодоления законов физики.
Триумф ASIC над GPU
Если архитектура GPU исторически развивалась по пути универсальности, то новое поколение чипов — это бескомпромиссная специализация под архитектуру Transformer.
Ключевыми бенефициарами этого сдвига стали Etched и Groq.
Etched (чип Sohu): Инженеры компании пошли на радикальный шаг, полностью вырезав из архитектуры поддержку устаревших нейросетевых моделей (сверточных и рекуррентных сетей). Весь транзисторный бюджет направлен на матричные умножения. Результат — серверный узел из 8 чипов Sohu выдает до 500 000 токенов в секунду на модели Llama 70B. В задачах инференса такие решения обеспечивают превосходство над GPU (H100/B200) в 3 — 5 раз по показателю производительности на каждый ватт затраченной энергии.
Groq (LPU): Архитектура Language Processing Unit использует детерминированное планирование вычислений. Это позволяет достигать задержки в 2 — 3 миллисекунды на токен, оставляя традиционные GPU с их 8 — 12 мс далеко позади.
Влияние на инфраструктуру:
Ликвидация медных соединений: Традиционные электрические кабели внутри шасси полностью заменяются на интегрированные волоконно-оптические волноводы.
Смена парадигмы охлаждения: Так как вычислительные ядра остаются холодными, классические системы кондиционирования дополняются точечным жидкостным охлаждением только для электронных интерфейсов (лазеров и приемников).
Стирание границы между Сетью и Вычислениями: Фотонные процессоры интегрируются напрямую в коммутаторы. Обработка трафика происходит в оптике без затратного преобразования свет — электричество — свет (O-E-O), устраняя главное узкое место современных дата-центров.
Теперь аппаратная стратегия любого технологического гиганта строится на жесткой специализации: Edge устройства на ARM собирают данные, ASIC ускорители мгновенно обрабатывают рутину, GPU Rubin с трудом справляются с обучением новых фундаментальных моделей, а магистральная инфраструктура дата центров переходит на свет, навсегда закрывая главу универсальных графических процессоров.