Эпоха когнитивной инфраструктуры
Развитие искусственного интеллекта воспринимается широкой публикой и даже многими специалистами как сугубо программная гонка - бесконечное соревнование в создании более совершенных алгоритмов, архитектур трансформеров и методов дообучения. Мы привыкли измерять прогресс мегабайтами датасетов и миллиардами параметров, полагая, что единственным препятствием на пути к сверхразуму является нехватка вычислительных мощностей, которые можно просто докупить у очередного провайдера. Однако сегодня этот цифровой оптимизм сталкивается с жесткой физической реальностью.
Вычислительная инфраструктура достигла своего структурного предела. Дальнейшее масштабирование нейросетей упирается не в дефицит транзисторов, а в фундаментальные законы физики: скорость электрического сигнала в медных проводах, сопротивление материалов и термодинамическую стоимость перемещения данных. Пока классические графические ускорители тратят львиную долю энергии на бесконечную перекачку матриц между памятью и логикой, планета начинает испытывать физический голод по электроэнергии, необходимой для питания дата-центров.
В этой точке бифуркации технологическая повестка радикально меняется. Гонка скоростей сменяется борьбой за выживание в условиях энергетического дефицита, а вопрос: “насколько умна модель?” отходит на второй план перед вопросом “что именно она думает внутри себя и кто контролирует ее физические границы?”.
Фон Неймана и природа “бутылочного горлышка”
Фундаментальное ограничение современных вычислительных систем, на которых держится весь нынешний бум генеративного ИИ, кроется не в нехватке транзисторов, а в самой логике их расположения. Любая современная видеокарта или центральный процессор работают по канонам архитектуры фон Неймана: данные живут в одной части чипа (или системы), а вычисления происходят в другой. Для обучения нейросети весом в сотни миллиардов параметров графический ускоритель вынужден ежесекундно совершать триллионы циклов перекачки матриц весов из оперативной памяти HBM к тензорным ядрам и обратно.
Этот процесс порождает бутылочное горлышко, известное как стена памяти (Memory Wall). Физическая скорость передачи данных по шине ограничена сопротивлением проводников и скоростью распространения электрического сигнала. В результате до 80% времени и более половины всей потребляемой дата-центром электроэнергии уходит не на сами математические операции, к примеру сложение и умножение, которые занимают пикосекунды, а на бесконечное перемещение нулей и единиц между памятью и логикой. Энергия буквально рассеивается в виде тепла на медных дорожках печатных плат.
Новая китайская разработка 40-нанометрового чипа знаменует собой попытку обойти этот физический предел за счет отказа от разделения хранения и обработки. В основе устройства лежат фазовые мемристоры. Это компоненты, чье электрическое сопротивление меняется в зависимости от прошедшего через них заряда и способно сохранять это состояние без подпитки. Главное свойство мемристора заключается в его аналоговой природе: он может находиться не просто в состоянии включено или выключено, а принимать множество промежуточных значений сопротивления.
В новом китайском чипе массивы таких элементов организованы в сетки (кроссбары). Здесь вступает в силу чистая физика: операция векторно-матричного умножения, лежащая в основе любой нейронной сети, сводится к законам Ома и Кирхгофа. Когда на сетку подается напряжение, ток распределяется по ветвям пропорционально сопротивлению мемристоров. Итоговый результат суммирования токов получается мгновенно, естественным образом, без участия тактовых импульсов и микрокода. Вычисление происходит там же, где хранится информация. Данным больше не нужно никуда ехать.
Согласно спецификациям разработчиков из Пекинского университета, площадь этого вычислительного массива составляет всего 0,28 квадратных миллиметра. Устройство работает на скромной частоте 50 МГц, что несопоставимо с гигагерцами традиционных GPU, однако архитектура позволяет достичь задержки одного шага в 2,12 м.