Борьба нейросетей: новая модель M1 от MiniMax обошла DeepSeek-R1 и Qwen3-235B
Модель M1 обрабатывает до 1 млн токенов, компания опубликовала демоверсию и исходный код.
В тестах на программирование и математику M1 обошла DeepSeek-R1 и Qwen3-235B от Alibaba, уступив o3 от OpenAI и Gemini 2.5 Pro.
Компания внедрила механизм «молниеносного внимания» — lightning attention. Он позволяет модели работать «быстрее» и экономнее при обработке длинных запросов. Например, при генерации 100 тысяч символов MiniMax-M1 потратит на 25% меньше вычислительных ресурсов, чем DeepSeek-R1, заявляют разработчики.
Модель обрабатывает 1 млн токенов (около 750 000 слов). Для сравнения, DeepSeek-R1 поддерживает контекст в 64 000 токенов.
Демоверсия MiniMax-M1 доступна на HuggingFace, также модель выложили на GitHub.
💬 Я уже успел немного потестировать на коде и вёрстке. По ощущениям — очень даже неплохо, несколько слабее Gemini 2.5 Pro, но продолжаю наблюдение!
Новая классная модель даром — хороший денёк!
🔗 Протестировать можно на сайте сервиса: chat.minimax.io