Не будем писать про мелочи — новая моделька o3 от OpenAI обходит большинство людей в тесте на AGI.
Нас больше волнует, что она сильно лучше текущего лидера o1 справляется с задачами Software Engineering. А на CodeForces она заняла 175 место среди всего рейтинга (то есть решает задачи лучше 99.99% программистов).
Пора идти в доставщики? Не совсем. Один запуск модельки может стоить до 1к баксов, кожаные мешки пока дешевле 🙃
Пока в общем доступе нету, но скоро-скоро.
⚡️ Забустить канал 🚀
· 21.12.2024
I call bullshit У нейроделов постоянно самая свежая модель – просто вау, никогда такого не было, возможности безграничны, а на деле... Ну, не Лев Толстой короче. Тут то же самое, что с бенчмарками на железо – поверю, когда увижу бенчи от кого-то кроме производителей, а пока копилот например ответственен за ухудшение качества кода на сколько там, 40%? Вообще слышал, что вопреки утверждениям Альтмана и ко, в вопросе написания кода новая модель вообще едва ли лучше полуджуна.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 21.12.2024
Есть достаточно объективное ранжирование на https://lmarena.ai/?leaderboard. Там люди вслепую оценивают результат.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 22.12.2024
Посмотрю на досуге, благодарю
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён