⚒️ NVIDIA научила ИИ не думать за деньги, а просто делать

Представь фабрику, где гениальный инженер сам чертит каждый шуруп. Так жили все большие модели ещё вчера. Один гигантский мозг вызывал инструменты, проверял результаты, ждал ответа, снова думал. Это медленно и дико дорого, как гонять БелАЗ за хлебом. NVIDIA первой сказала — хватит. Будущее не в одном монстре, а в команде, где один планирует, а второй молниеносно исполняет рутину. В этом и суть августовского рывка. Компания разделила агентный ИИ на два слоя и закрыла всю цепочку от чипа до памяти.

В этом и фокус — от моделей до железа всё стало командой, а не одиночкой.

⚡️ Где треснула старая система * Модель-исполнитель Nemotron 3.5 Lightning — 30 млрд всего, активны лишь 3 млрд (MoE — смесь экспертов, когда из сотен специалистов включается только нужная горстка). Итог — до 4 раз быстрее аналогов при той же точности, уже ставится в Ubuntu одной командой. * KV-кэш (короткая память модели, как черновики на столе, куда она складывает посчитанное) стал узким местом. DPU BlueField-4 STX вынес хранение этих черновиков из процессора прямо в сеть и хранилище — заявлено до 5 раз больше токенов и в разы меньше энергии. * Миллион токенов (примерно целая кодовая база или час видео) теперь жуёт новый GPU Rubin CPX — 30 петафлопс в формате NVFP4 (суперсжатые числа для ИИ) и 128 ГБ GDDR7, собранный в стойку на 8 экзафлопс. Это первый чип, сделанный именно под длинный контекст, а не под обучение.

🧠 Что будет на втором шаге и о чём молчат * Последствие последствий — цена рассуждения падает, а цена памяти растёт. Кто владеет KV-кэшем, тот владеет агентом. Поэтому NVIDIA строит вокруг него экосистему — от DOCA до Spectrum-X. * Контринтуитивный вывод — маленький мозг важнее большого. В долгоживущем агенте 90% времени — скучные вызовы, проверки, повторы. И выигрывает не тот, у кого IQ выше, а тот, у кого исполнитель дешевле и быстрее. * Контраргумент — «зачем дробить, если можно один фронтир?» Не работает, потому что один фронтир стоит как самолёт на каждый чих. Двухуровневая схема режет бюджет токенов на 30% без потери качества на тестах PinchBench и Terminal-Bench.

💸 Как это бьёт по нам и по кошельку * Для бизнеса это смена тарифа — от поминутной оплаты гения к оплате бригады. Локальные агенты на RTX Spark (20 ядер Grace + графика уровня RTX 5070) смогут жить прямо в ноутбуке на Windows on Arm без облака, а DGX Station на чипе GB300 даст триллион параметров на столе. * Ограничения — Rosa с ядрами Rigel (кастомные ядра на архитектуре Arm v9.2 с увеличенным кэшем L2, как большая полка для инструментов) выйдет только в 2028 с Feynman, Rubin CPX — в конце 2026. Первые покупатели снова станут бета-тестерами, а Китай на паузе — H200 одобрили для Alibaba, Tencent, ByteDance, но Пекин требует покупать свои чипы в придачу.

💡 Мы переходим от эпохи «кто умнее» к эпохе «кто дешевле удержит мысль». NVIDIA показала, что интеллект — это не один прожектор, а оркестр из прожектора и сотен лампочек. Когда память становится дороже вычислений, побеждает тот, кто научился не думать лишний раз, а просто помнить и делать. И именно это делает агентный ИИ finally рентабельным.

👇 А ты бы доверил рутину маленькому быстрому агенту или всё ещё гонишь огромную модель за каждой мелочью? 👇

#NVIDIA #Nemotron #искусственныйинтеллект #чипы #технологии #AIagents #RosaCPU #RubinCPX #будущее #инновации

⚒️ NVIDIA научила ИИ не думать за деньги, а просто делать | Сетка — социальная сеть от hh.ru