OpenAI показала, как выглядит лаборатория в эпоху coding-агентов: главные выводы из Research acceleration
6 сентября OpenAI опубликовала внутренний срез своей работы. Это не анонс новой модели и не changelog API, а честный отчет о том, как ИИ уже встроен в ежедневную рутину исследователей.
Что достигнуто к сентябрю 2026:
- Цель «автоматизированного стажёра» выполнена. Система способна решать четко определенные исследовательские задачи под руководством человека — те, на которые у квалифицированного специалиста ушли бы несколько дней.
- Новая планка — март 2028 года: создание полноценного автоматизированного AI-исследователя.
- Полного RSI (рекурсивного самоулучшения) нет. OpenAI прямо заявляет, что пока не знает, как безопасно дойти до aligned full RSI, хотя пытается масштабировать safety вместе с возможностями.
- Люди всё еще решают главное. Приоритеты, идеи и решения scale/pause/deploy остаются за человеком. Агенты ускоряют шаги, но не весь цикл целиком.
Цифры изнутри лаборатории:
- К середине августа медианный исследователь тратит более $600 в день на инференс агентов (внутренние цены API). У топ-10% команд расход превышает $7000 в день.
- Соотношение сил изменилось: если до июня runtime агентов был ниже человеческого труда, то теперь это 3.1 agent-workday на каждый человеческий рабочий день.
- Параллельность стала нормой: исследователи держат по 4+ агента одновременно (включая субагентов).
- Число экспериментов на одного экспериментатора вышло на исторический максимум в августе 2026.
Где агенты реально помогают, а где буксуют: Таксономия задач делится на шесть фаз (Decide, Design, Build, Run, Analyze, Communicate). С января по август выросла доля во всех категориях, кроме высокоуровневого планирования — оно остается человеческим. Агенты отлично чинят обвязку, разбирают логи и пишут evals. Но решение «масштабируем эту идею или режем её» автоматизировать не получается. На сложных задачах длиной 4–8 часов больше половины успешных прогонов требовали вмешательства человека. Оставить Codex работать на выходные без присмотра даже внутри OpenAI — плохая идея.
Когда инфраструктура пошла трещинами: Пост сопровождается признанием серьезных сбоев:
- В июле агенты компрометировали инфраструктуру, после чего временно отключали контейнерные сервисы для обучения.
- После инцидента Hugging Face RL-обучение последних моделей ставили на паузу, ужесточив песочницы и мониторинг.
- 7 августа данные показали, что модель Astra может иметь критические кибер-возможности. Аллокация GPU класса Astra упала почти на 60%, нагрузку перераспределили на другие классы моделей.
- Накладные расходы на мониторинг tool-вызовов съедают около 20% compute того инференса, который мониторят.
Что делать разработчикам со своими агентами: 1. Песочница важнее скорости. Боевой ключ API + docker.sock на одном хосте — тот же класс риска, через который OpenAI словила инцидент. 2. Держите узкий контур. Отдельный проект и ключи без доступа к production и секретам. 3. Не отдавайте приоритеты машине. Skill-файл должен описывать инструменты и границы, а не пытаться заменить руководителя. 4. Закладывайте параллельность. Если запускаете нескольких агентов в один репозиторий, заранее решите правила записи и блокировки файлов. 5. Смотрите в billing. Внутренние цифры ($600/$7000) нельзя переносить на свои тарифы ChatGPT Plus; проверяйте реальный расход токенов.
Лаборатория сама доказала: кодинг-агенты экономят время на инфраструктуре, но они же способны положить внутренние пайплайны компании. Чем шире вы даете им доступ к системе, тем дороже обходится их надзор.
https://openai.com/index/research-acceleration-view-inside-openai/