Как засунуть 27B модель в телефон 📲
Ребята из PrismML недавно выкатили Bonsai 27B — это Qwen 3.6 на 27 млрд параметров, жёстко упиханный в 1-битные и тернарные веса.
Если вы когда-то пытались локально поднять что-то подобное, то в курсе математики: в fp16 это ~54 ГБ VRAM. Даже адекватный 4-битный квант сожрет около 18 ГБ. Ни один телефон или дефолтный рабочий ноут это не переварит, так как ОС просто не отдаст столько памяти одному приложению.
Возьмем условный iPhone 17 Pro — там 12 ГБ памяти. Из них iOS отдает приложению под работу максимум около 6 ГБ (и это потолок).
Что предлагают в Bonsai:
1️⃣ 1-bit Bonsai 27B. Бинарные веса {−1, +1}. Модель весит 3.9 ГБ. Впервые 27B влезает в телефон и оставляет место под контекст и активации. 2️⃣ Ternary Bonsai 27B. Тернарные веса {−1, 0, +1}. Весит 5.9 ГБ. Вариант для обычных ноутбуков без кластеров GPU.
Самые жирные и дорогие юзкейсы сейчас — это агентские пайплайны. Когда ИИ делает не один вызов, а сотню: парсит данные, вызывает тулы, пишет код, чекает свои же ошибки. Гонять такие бесконечные циклы через облачные API — это, во-первых, финансовое самоубийство на объемах, а во-вторых, слив приватных данных пользователя (файлов, экрана) наружу по сети. Bonsai 27B позволяет крутить эти агентские циклы локально на девайсе юзера. Маржинальная стоимость 100-шагового цикла становится равна нулю рублей.
Что по деградации интеллекта? 🧠
Интуиция подсказывает, что 1-битная модель должна стать тупой, как пробка. Но на 15 бенчмарках (в thinking mode) тернарная версия сохранила 95% от fp16-бейзлайна, а 1-битная — 90%. Математика, кодинг и tool-calling пострадали меньше всего. То есть ровно те навыки, которые критически нужны для агентов, остались на месте.
Скорости тоже в порядке: на RTX 5090 это до 163 ток/с, на M5 Max — до 87 ток/с. Поддержка Apple MLX и CUDA есть из коробки.
Все веса и кастомные ядра под MLX и CUDA отдают бесплатно под Apache 2.0. Забирать на HuggingFace.
· 18.07
Выглядит мощно, но есть важные оговорки 👇 📦 3,9 ГБ — это только упакованные веса. Реальное потребление 1-bit Bonsai 27B составляет около 5,2–5,9 ГБ уже при контексте 4K. Для 100K потребуется примерно 6,8 ГБ, а для заявленных 262K — около 9,4 ГБ даже с 4-битным KV-кэшем. 📱 На телефоне модель пока запустили только на iPhone 17 Pro Max через кастомный MLX Swift. Готового приложения нет, а обычные Android-рантаймы этот нестандартный формат не поддерживают. Это скорее демонстрация технологии и SDK для разработчиков, чем модель, которую сегодня можно просто скачать на любой смартфон. 🧠 «Сохранила 90% интеллекта» — усреднённое отношение результатов выбранных авторами бенчмарков. Например, tool calling у 1-битной версии упал с 80 до 66 — потеря уже заметная. Сама PrismML отдельно признаёт, что длинные агентские циклы с кодом, несколькими файлами и итеративным исправлением ошибок пока не являются сильной стороной модели. 💸 И маржинальная стоимость локального цикла не совсем нулевая: остаются электричество, расход батареи, нагрев и ограничения мобильной ОС на длительную фоновую работу. Но сам результат всё равно впечатляет: полноценные 27 млрд параметров действительно удалось довести до интерактивных ~11 ток/с на iPhone. Просто пока это не «ChatGPT-агент в каждом телефоне», а очень перспективный первый работающий прототип такого будущего.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён