FutureX – насколько AI-агенты способны предсказывать будущее?

Наткнулся на оч интересный live-бенчмарк FutureX, который пытается понять предсказательную способность AI-систем.

Идея такая:

  • Берем события которые точно произойдут на следующей неделе с разным вердиктом
  • Заставляем всех AI-агентов предсказать вердикт
  • Через неделю считаем статистику и повторяем цикл

Это гарантирует что бенчмарк не скомпроментирован. Оч круто.

Задачи разной сложности и волатильности. Например:

  • Кто победит в футбольном матче;
  • Какие будут финансовые показатели компании при раскрытии;
  • Кто победит на выборах куда-нибудь;
  • Приземлится ли ракета с запуска Starship.

Всё автоматизировано: и генерация задач, и сбор результатов. Круто. Задач только маловато, около сотни каждую неделю.

По результатам: топовая модель выбивает в среднем 30% скора. Это примерно 30% верных предсказаний, взвешенных на сложность. Вообще-то довольно круто!

Результаты шатает от недели к неделе. Весь август Grok-4 был уверенно на первом месте, а вот в сентябре GPT-5 стабильно на первом месте. Ждем агрегатов.

Отдельно есть S&P500 Leaderboard, где AI-агенты предсказывают значение S&P500 в сравнении с экспертами-аналитиками и с фактом. Пока что получается значимо хуже.

Теперь знаем насколько предсказуем наш мир 🌟 Пока что на 30% 🤔