💡 Искусственный интеллект не справился с загадками из радиошоу: успешность решения менее 60%
Исследователи протестировали способности современных моделей ИИ, предложив им загадки из программы NPR Sunday Puzzle. Эксперимент показал неожиданные результаты: даже самые продвинутые системы испытывают трудности с решением логических задач.
Лидером теста стала модель o1 от OpenAI, верно решившая 59% загадок. Второе место заняла o3-mini с результатом 47%. Другие модели, включая DeepSeek's R1, часто "сдавались", предлагая случайные ответы или зацикливаясь на неверных решениях.
Эксперимент демонстрирует, что современный ИИ, несмотря на впечатляющие достижения в обработке данных, пока далек от человеческого уровня решения логических задач.