Будущее ИИ как «Мыслитель-as-a-Service». Почему ИИ всё ещё плохой партнер.
Сегодня в посте: ИИ пока не партнер. Он — инструмент, иногда полезный, но партнёром его назвать нельзя. Как я писал раньше: за блестящими формулировками прячется куча ошибок, выдуманных фактов и логических дыр.
Но не всё так просто. На горизонте уже видны первые сигналы, что траектория меняется.
Почему нынешний ИИ — хромой ассистент
1. Непредсказуемость. Он всё ещё «галлюцинирует» — и это не баги, а системная особенность.
2. Ограничение контекста. Модель знает только то, что загрузили. За рамками обучения — пустота или имитация.
3. Нет проверки себя. Он не понимает, когда врёт. Может уверенно доказывать ерунду.
4. Сложные задачи ломают логику. В реальных кейсах, где нужно соединять дисциплины, он сыпется.
Итого: Дополняет — да. Заменяет — нет.
Где уже появляются признаки «непросто машинного интеллекта» Чтобы не казаться одержимым одним только экспериментом с GPT, стоит посмотреть на разные тесты. Они показывают, что модели начинают прорываться, но пока кусками и нестабильно.
1. Тест Гёделя. Команда Универа Хайфы и Cisco проверила GPT-5 на пяти новых математических гипотезах.
В трёх задачах — корректные решения.
В одной — неожиданное альтернативное доказательство.
Но там, где требовалось соединять разные подходы, модель не справилась. Вывод: это уже не «школьник», но ещё не гений — уровень аспиранта на старте.
2. LongReasonArena. 12 моделей тестировали на многозвенных задачах.
Чем длиннее цепочка рассуждений, тем ниже точность.
Особенно тяжело с возвратами и комбинированием промежуточных выводов. Иными словами: пока ИИ боится глубины.
3. LLM-SRBench. 239 задач по четырём научным дисциплинам, чтобы проверить способность открывать новые уравнения.
Лучшая модель показала всего 31,5 % точности. То есть, «изобретатель» из ИИ пока слабый.
4. CARL-GT. Бенчмарк на причинно-следственные связи: графы, таблицы, тексты.
Модели проваливаются особенно на табличных данных.
Даже если в тексте сильны, в причинности они теряются.
Все эти эксперименты складываются в одну картину: модели уже не игрушка, но до настоящего творческого интеллекта им ещё далеко.
Логика развития
GPT-5 — первые проблески оригинальности, но без устойчивости.
GPT-6 может выйти на уровень компетентного аспиранта: творчески комбинировать знания, а не только воспроизводить.
GPT-7 — это уже «Мыслитель-as-a-Service»: интеллект, который можно подключать как облачный сервис, и он будет выдавать результат уровня лучших исследователей.
GPT-8 и дальше — уровень, где человечество уже не главный игрок интеллектуальной игры.
Итог Сегодня ИИ — это просто инструмент. Стабильной надёжности и партнёрской роли пока нет. Но тесты вроде Гёделя, LongReasonArena и SRBench показывают: переход от «хромого ассистента» к «Мыслителю-as-a-Service» — это уже не фантазия, а траектория, которую можно измерить данными.