Вот OpenAI и выпустили новую модельку o1 🍓
По внутренним бенчмаркам она превосходит GPT-4o в разных категориях, включая соревновательное программирование на задачках с CodeForces (разница при этом прям большая), математические олимпиады и вопросы научного уровня PhD.
🧠Основной прирост как раз в задачах, которые требуют сложных рассуждений.
Когда раскатают на всех, судя по всему, будут сильные ограничение на количество запросов, т.к. инференс дороже и дольше, т.к. модельки нужно время "на подумать".
Интересно, что промптинг будет сильно отличаться от предыдущих моделей, т.к. цепочка рассуждений сама будет разматывать запрос на верные мысли, очень подробные промпты, всякие инъекции и обманки уже будут не нужны (либо будут другие).
Ждём сравнения в программировании на LLMArena с другими моделями. Я уже даже и не задаюсь вопросами "а на сколько ещё можно лучше". Все слишком быстро 🌝
🍩 Поддержать канал 🫶