🤏 27B УМЕСТИЛИ В НОУТБУК Модель с 27 млрд параметров похудела с 54 до 5,9 ГБ — и почти не растеряла способности. Серверная стойка больше не обязательный предмет мебели. 🧠 ДАВАЙ ПО ПОРЯДКУ • 🧠 PrismML собрала компактную модель Bonsai 2 27B сделана на базе Qwen3.8 и содержит 27 млрд параметров.
• 📦 Вес сократился в девять раз Вместо 54 ГБ модель занимает 5,9 ГБ. По описанию, её можно запускать даже на ноутбуке.
• ⚖️ Параметрам оставили три значения Каждый вес хранится как −1, 0 или +1 с FP16 scaling. Так модели нужно заметно меньше памяти и энергии.
• 👀 Способности сохранились Модель пишет код, работает с инструментами, понимает визуальные данные и держит контекст до 262K токенов.
• 💻 Запускать можно по-разному Поддерживаются NVIDIA GPU через CUDA, Apple Silicon через MLX и браузеры через WebGPU. 🔥 ВОТ В ЧЁМ ФИШКА! ▸ Сжатие почти не съело качество По заявленным тестам, Bonsai 2 сохранила 98,2% производительности оригинала. Похоже, low-bit модели перестают быть вариантом «дёшево, но сердито» 🧩
▸ Большая модель помещается ближе к человеку Раньше для такого класса ИИ пришлось бы смотреть в сторону тяжёлого железа. Теперь достаточно устройства с поддерживаемой платформой — стойка может отдохнуть 🪑
▸ Энергии требуется меньше На RTX 4090 заявлено 0,714 мВт на токен — на 40% экономнее полноразмерной модели 8B. Для частых локальных запросов разница может стать заметной 🔋
▸ Ответы приходят быстро Скорость достигает 143 токенов в секунду на RTX 5090 и примерно 47 на M5 Max. Особенно полезно там, где модель постоянно правит и проверяет код 🏎️
▸ Лицензия не запирает дверь Apache 2.0 допускает коммерческое использование и доработку модели. Командам не придётся начинать знакомство с юристом и таблицей запретов 🔓 💼 РЕАЛЬНЫЕ СЦЕНАРИИ ▸ Документы можно разбирать локально Компания может анализировать договоры и переписку внутри своего контура, не отправляя их в облако. Понадобятся подходящее железо и настройка среды 🔐
▸ Кодовый агент сможет работать рядом Модель может писать код, использовать инструменты и быстро проходить циклы правок. Заявленная скорость зависит от конкретного устройства 🧑💻
▸ Облако останется для сложных случаев Потенциальный сценарий: рутинные запросы обрабатываются локально, а тяжёлые уходят более крупной облачной модели. Так можно сократить задержки и передачу чувствительных данных 🔄
▸ Прототип откроется прямо в браузере WebGPU даёт возможность запускать модель без отдельного Python-окружения. Но браузер и устройство должны поддерживать нужную технологию 🌐
▸ ИИ приблизится к устройствам на месте Судя по описанию, модель можно пробовать на камерах, дронах и промышленных контроллерах. Результаты таких полевых запусков в новости не приведены, поэтому сначала — тесты 🛰️ 🔹🔹🔹🔹🔹🔹 🏆 ЛУЧШИЕ ПРОМПТЫ В PROJECT POOL 🤖 ИИ АГЕНТЫ — собери своего 📈 ИИ-агенты. - просто и понятно #новости #news #нейросети #ии
В этом посте были ссылки, но мы их удалили по правилам Сетки