Новости к 08:00
✦ Ну вот. OpenAI вынесла наружу Jalapeño — свой первый рабочий inference-чип. И это не игрушка: SemiAnalysis уже гоняла на нём GPT-OSS 120B, DeepSeek R1 и Kimi K2.5. По их замерам, Jalapeño даёт прирост производительности на ватт в 1.5–1.9 раза и режет задержку в 1.7–3.6 раза. На части интерактивных нагрузок — до 4.1 раза.
Самое важное тут даже не цифры. OpenAI полезла в железо там, где раньше жила на чужих GPU. Если чип и правда держит такие режимы без тонкой подстройки под конкретную нагрузку, это уже не разовая проба. Это собственный инференс-стек, а не аренда мощности у Nvidia.
✦ OpenAI представила Jalapeño — свой первый реально рабочий inference-чип. На нём уже крутят GPT-OSS 120B, DeepSeek R1 и Kimi K2.5. Компания говорит про рост производительности на ватт в 1.5–1.9 раза и про снижение end-to-end latency в 1.7–3.6 раза. На некоторых интерактивных нагрузках выигрыш доходит до 4.1 раза.
Кстати, при проектировании чипа и софта OpenAI использовала свои модели. Это уже выглядит не как эксперимент для отчёта, а как попытка собрать у себя весь стек целиком.
✦ Jalapeño явно делали не ради красивого анонса. Судя по опубликованным бенчмаркам, OpenAI заточила его под быстрый инференс больших моделей в масштабе. То есть под снижение задержек и рост пропускной способности, когда запросов много и они не прощают лишних миллисекунд.
✦ Apple тоже вытащила железо на сцену. Анонсированы M5 Ultra и M6. У M5 Ultra — 512 ГБ унифицированной памяти и пропускная способность 1.2 ТБ/с; по сообщению источника, он способен локально запускать модели с более чем 100 млрд параметров. Это ещё и первый четырёхкристальный дизайн Apple. M6 сделан по техпроцессу 2 нм и стоит от $899.
✦ Apple показала новое поколение Mac mini и Mac Studio с чипами M6 и M5 Ultra. В Mac mini стоит M6 с 12-ядерными CPU и GPU, двумя 16-ядерными Neural Engine и памятью до 32 ГБ; Apple говорит о до 4 раз более высокой ИИ-производительности по сравнению с M4. Есть и версия Mac mini с M5 Pro и памятью до 64 ГБ.
Базовый M6, по заявлению Apple, подходит для локального запуска моделей на 7–14B параметров. Версия с 32 ГБ — для 27–32B. M5 Pro на 64 ГБ — для 70B в 4-битном кванте.
Mac Studio с M5 Ultra, по данным Apple, получил до 36 ядер CPU, 80 ядер GPU, 512 ГБ общей памяти и пропускную способность 1.2 ТБ/с. Компания утверждает, что на такой системе могут помещаться модели на 235–405B и даже DeepSeek V3/R1 671B в сильном кванте. Предзаказы уже открыты, продажи стартуют 22 сентября.
✦ Sber AI представила новое поколение эмбеддинговых моделей GigaEmbeddings. Их делают под семантический поиск и RAG-системы — чтобы ИИ искал не по совпадению слов, а по смыслу.
В линейке три модели: 10B-A1.8B, 3B и 480M. По данным источника, 10B-A1.8B стала лидером ruMTEB, 3B дала лучший прирост качества и обработки кода на 14.5 пункта, а 480M стала лидером среди моделей на русском языке до 500M параметров.
Из улучшений Sber AI называет рост объёма обучающих данных за счёт открытых датасетов вроде Nemotron, F2LLM и KALM, упрощение архитектуры и поддержку vLLM и SGLang. Это ускорило инференс: 3B стала быстрее в 1.6 раза, а 10B-A1.8B — в 2 раза.
Модели доступны бесплатно под MIT-лицензией на Hugging Face и Gitverse.
Источники: Prompt, Метаверсище и ИИще, TechCrunch, Prompt, Futuris, Sber AI
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки