Новости к 19:00

✦ 4-битная модель, которая обходит полноточную. Звучит как баг в презентации, но тут, похоже, есть смысл: Quantization-Aware Healing не просто режет веса до 4 бит, а потом лечит модель от потерь точности. Мне это нравится именно так — не магия, а попытка вернуть качество после грубого сжатия.

Если цифры в статье держатся, это очень рабочая штука: меньше памяти, быстрее инференс, и без привычного ощущения, что квантование всё ломает.

✦ OpenAI тоже показала железо — Jalapeño, свой чип для инференса. Тут всё ожидаемо: скорость, энергоэффективность, пропускная способность, меньшая задержка. Сам факт интереснее формулировок. Компания явно не хочет вечно жить на чужих GPU и уже примеряет свой контур под запуск моделей.

Источники: Hugging Face Blog, OpenAI News

Все новости: ai.popovs.tech

#HuggingFace #LLM #AI