Новости к 19:00
✦ 4-битная модель, которая обходит полноточную. Звучит как баг в презентации, но тут, похоже, есть смысл: Quantization-Aware Healing не просто режет веса до 4 бит, а потом лечит модель от потерь точности. Мне это нравится именно так — не магия, а попытка вернуть качество после грубого сжатия.
Если цифры в статье держатся, это очень рабочая штука: меньше памяти, быстрее инференс, и без привычного ощущения, что квантование всё ломает.
✦ OpenAI тоже показала железо — Jalapeño, свой чип для инференса. Тут всё ожидаемо: скорость, энергоэффективность, пропускная способность, меньшая задержка. Сам факт интереснее формулировок. Компания явно не хочет вечно жить на чужих GPU и уже примеряет свой контур под запуск моделей.
Источники: Hugging Face Blog, OpenAI News
Все новости: ai.popovs.tech