🍏 СИЛИКОНОВЫЕ ЛИЛИ МОЖНО ЩУПАТЬ? Perplexity выкатили Lily — собственный движок, который запускает Qwen3.6-35B-A3B прямо на Apple Silicon, игнорируя PyTorch и MLX как устаревший софт 🙃. Это движок, написанный с нуля под архитектуру конкретной модели и кремний от Тима Кука ⚡️ ▌ Что внутри? • 🧠 Qwen3.6-35B-A3B в 4-битной квантизации — занимает всего 19,4 ГБ. Влезает даже в MacBook с 32 ГБ памяти, оставляя место на Chrome и кота 🐈 • ⚙️ Нативная работа под архитектуру — распределение экспертов, GPU-вычисления и управление памятью заточены именно под эту модель, а не под «универсальный фреймворк для всего подряд» • 📏 Контекст до 128K токенов — закидывай целые книги, кодбазы и архивы переписки, модель не подавится и не потеряет нить повествования 📚 • 🧬 Без PyTorch и MLX — написан с нуля, поэтому не тащит за собой зоопарк зависимостей и лишнего оверхеда 🎒🚫
▌ Скорость, которую можно потрогать → MacBook Pro M5 Max показывает входной текст в 1,23 раза быстрее, чем MLX-LM 🚀 → Генерация ответа — 1,35 раза быстрее конкурента ⚡️ → На контексте 4K скорость достигает 187 токенов в секунду — текст льётся быстрее, чем ты успеваешь читать 👀 → Это уже не «ой, подожди, думает», это реальный диалог в реальном времени 🗣
▌ Главная интрига Большие модели на Mac упираются не в железо, а в то, насколько движок дружит с конкретным чипом и архитектурой модели 🤝. Lily — это доказательство, что локальный инференс может быть не болью, а удовольствием.
Perplexity планируют открыть код в ближайшее время — сообщество уже потирает руки в предвкушении форков и допилов под свои нужды 🛠. 💥 ПОЧЕМУ ЭТО КРУТО? ▸ Локальный ИИ без боли Запустил модель на своём железе — забыл про API-лимиты, тарификацию за токены и страх, что твои данные улетят в чужое облако 🔐. Приватность + скорость = комбо 🥊
▸ Кремний решает Apple Silicon уже давно не «для браузера и Final Cut». M5 Max показывает, что Mac — это серьёзная AI-станция, просто ей нужен был правильный софт 💻⚡️
▸ Отказ от универсальности Пока все пишут «один движок под все модели», Perplexity сделали наоборот: движок под одну модель, но идеально. Узкая специализация бьёт универсальность, как всегда 🎯
▸ Скорость, которая чувствуется 187 токенов/сек — это не цифра из бенчмарка. Это ощущение, что модель думает вместе с тобой, а не где-то на сервере в Орегоне 🌩
▸ Open-source на подходе Когда код откроют — начнётся эра форков. Каждый допилит под свой чип, свою задачу, свой контекст. Экосистема локальных ИИ на Mac скакнёт вверх 📈
▸ Смерть «железного» оправдания Больше нельзя сказать «у меня не тянет». Если Qwen3.6 на 19 ГБ работает быстрее MLX, значит проблема была не в железе, а в лени разработчиков движков 💀 💼 КАК НА ЭТОМ ЗАРАБОТАТЬ? ▸ Локальные ИИ-ассистенты для компаний Разверни Qwen3.6 на Mac в офисе — получи приватного помощника, который работает с внутренними документами без отправки данных в облако. Юристы и финансисты скажут спасибо ⚖️💼
▸ Офлайн-решения для полей Консультанты, врачи, инженеры — все, кто работает без стабильного интернета, получают мощный ИИ прямо в рюкзаке. Скорость 187 ток/сек позволяет работать в реальном времени 🎒📶🚫
▸ Быстрые прототипы и ресерч Закинул кодбазу, архив документации или датасет — получил локального аналитика, который не жрёт деньги за каждый запрос. Идеально для стартапов и R&D-отделов 🧪📊
▸ Контент-продакшн без задержек Копирайтеры, сценаристы, журналисты могут крутить промпты на лету, не ожидая ответа от облака. Скорость генерации = скорость мысли = больше итераций в день 📝⚡️
▸ Обучение и онбординг Новички в команде получают локального тьютора, который отвечает мгновенно и без лимитов. Mac с M5 Max становится учебной станцией без подписок и тарифов 🎓💻
▸ Конкурентное преимущество Пока конкуренты ждут ответа от API, ты уже работаешь с результатом. Локальный инференс с правильной оптимизацией = скорость принятия решений в бизнесе 🏆 ⏳⏳⏳⏳⏳⏳⏳⏳ 👩🍼 Это наш ИИ-Продавец 🫢 Маркетплейс ИИ-Менеджеров ▶️ Это наш Ютубчик #софт
В этом посте были ссылки, но мы их удалили по правилам Сетки