DeepSeek выпустили новую модель 4.1 flash Из личных ощущений при общении: токены генерируются намного быстрее, sycophancy level упал с одного из самых высоких до одного из самых низких. Второе наблюдение вызывает смешанные чувства, но так и должно быть. Из самого интересного для меня в сопутствующей модели документу: оптимизация MoE моделей движется в сторону ещё большей специализации и количества параметров активирующихся на токен. Интересно, дойдут ли OSS модели до момента когда экспертов под задачу будут подгружать не с локального кластера MoE, а из сети.