Новости за последний час
Liquid AI выкатили сразу две retrieval-модели на 350M параметров: LFM2.5-Embedding-350M и LFM2.5-ColBERT-350M. Это первые двунаправленные модели в семействе LFM, и они заточены под быстрый мультиязычный поиск для RAG, FAQ, саппорта и баз знаний — без раздувания до тяжёлых embedding-решений.
Интереснее всего не сам релиз, а то, как его собрали: causal decoder превратили в bidirectional encoder, убрали causal mask и включили full attention. Для retrieval это логично, хотя ColBERT по-прежнему остаётся более тяжёлым вариантом: качество выше, индекс дороже. На H100 у них уже миллисекундный поиск, а значит это не игрушка, а вполне прикладной кандидат для продакшена.
MiniMax тоже копает в сторону длинных контекстов, но уже через Sparse Attention: разреженное блочное внимание поверх GQA. Авторы заявляют до 28,4x меньше FLOPs на блоке внимания и ускорение на H800, при этом код и веса MiniMax-M3 открыли. Здесь как раз тот случай, когда оптимизация выглядит не как маркетинг, а как попытка сделать длинный контекст пережёвываемым по цене и скорости.
И ещё одна полезная публикация — про то, как Claude Code и RAGAS упираются в реальность, когда надо автоматизировать оценку качества RAG-систем. Красивые библиотеки не отменяют ручной работы и кода: если хочется честной оценки, ассистент помогает, но не магией, а черновой рутиной, которую всё равно надо доводить руками.
Источники: Machinelearning, Habr AI, Habr AI, gonzo-обзоры ML статей, AI и точка
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки