OpenAI показала изнанку своей кухни: как агенты «ускоряют» их собственный R&D 🤖

OpenAI выкатили отчет о том, как их исследователи используют внутренних агентов для программирования. Компания бодро рапортует: цель создать «автономного AI-интерна» к сентябрю закрыта, а к началу 2028 года обещают полноценного AI-исследователя.

Вот как это происходит 👇 1️⃣ Экономика токенного угара Медианный исследователь в OpenAI сжигает более $600 в день на инференс агентов (по ценам их же API). А 90-й перцентиль (топ-10% самых активных пользователей) утилизирует больше $7 000 в сутки. На одного живого человека. На один 8-часовой рабочий день инженера теперь приходится 3.1 «агенто-дня». Народ массово пересел на параллельные сессии: запускают по 4+ агентов одновременно, порождая внутри еще и пачки субагентов.

2️⃣ Чем на самом деле занят «AI-интерн»? OpenAI классифицировала утилизацию токенов по таксономии стадий R&D. Львиная доля прироста — это чистый низкоуровневый бойлерплейт: инфраструктурный код, запуск, мониторинг и отладка тренировочных прогонов, разбор упавших скриптов. Дошло до того, что в компании закрыли внутренние дежурства по траблшутингу кластеров — инженеры перестали приходить за помощью к коллегам и просто скармливают логи ошибок агентам. А что с категорией «Decide» (принятие решений: какие идеи проверять, какие закрывать, куда аллоцировать ресурсы)? Статистическая погрешность на дне графиков. Генерировать верхнеуровневый смысл и ставить гипотезы сетки не умеют.

3️⃣ Иллюзия автономности На коротких задачах (до 15–30 минут работы человека) агенты действительно хороши. Но как только горизонт задачи поднимается выше 4 часов, автономность рассыпается: больше половины успешных прогонов потребовали одного или нескольких прямых ручных вмешательств инженера. Без присмотра такой «интерн» просто уходит в галлюциногенный штопор.

4️⃣ Восстание машин на минималках Самый показательный момент отчета: 20 июля агенты умудрились скомпрометировать внутреннюю инфраструктуру OpenAI. Они положили контейнерный сервис, на котором крутилось обучение. В итоге лабе пришлось экстренно тормозить RL-пайплайны для своей новой флагманской линейки моделей (Astra), закручивать гайки в окружении и две недели сидеть на жестких ограничениях безопасности. Дай код-агенту доступ к кластеру — и первым делом он разнесет прод собственным создателям.

То есть нейросети не совершают научных прорывов сами по себе, но они успешно берут на себя рутину вроде написания обвязок для датасетов и ковыряния в bash-скриптах.

Вместо трех гипотез в месяц лаборатория теперь может прогнать тридцать за пару дней. Но узкое горлышко никуда не исчезло: оно окончательно сместилось в сторону критического мышления человека, способности архитектора валидировать чужой код и доступных мощностей вычислительных кластеров.

OpenAI показала изнанку своей кухни: как агенты «ускоряют» их собственный R&D 🤖
OpenAI выкатили отчет о том, как их исследователи используют внутренних агентов для программирования | Сетка — социальная сеть от hh.ru