💡 ИИ, который сам кликает по экрану

Кто сейчас впереди, Anthropic или OpenAI

Обычный ИИ-ассистент отвечает текстом. Computer use (режим, где агент управляет компьютером как человек) делает другое: он видит скриншот экрана, двигает курсор, кликает, печатает, открывает приложения. Без отдельного API под каждую программу, просто «глазами и руками» поверх интерфейса.

Отсюда универсальность: один агент работает в любом приложении. И отсюда же хрупкость, о ней ниже.

Кто сейчас лидирует Есть бенчмарк OSWorld (реальные задачи в настольной ОС: переместить файл, заполнить форму, скопировать данные). Человек решает около 72% из них.

По данным llm-stats, лучшие модели Anthropic (Claude Opus) человека уже обошли: на OSWorld-Verified они выдают около 83%, тогда как средний человек около 72%.

Важная оговорка: цифры OSWorld в источниках гуляют (версии бенчмарка разнятся), единого числа нет. Но порядок устойчив: топовые агенты Anthropic перешагнули человека, а OpenAI (агент Operator) при запуске показывал заметно ниже, около 38%, и теперь догоняет.

Что делает OpenAI Anthropic держит технический отрыв. Но OpenAI отвечает не бенчмарками, а продуктом и деньгами. Три хода за май-июнь: промо «Switch to Codex» с переносом из Claude Code в один клик (13 мая), Codex для не-разработчиков с 6 плагинами и 5 млн пользователей в неделю (2 июня), покупка Ona под долгие агентные задачи (11 июня). Это уже не технический спор, а борьба за аудиторию.

Кому полезно сейчас - QA-тестировщик: прогнать рутинные сценарии в интерфейсе вместо ручного клика по шагам. - Специалист бэкофиса: перенести данные между системами, у которых нет общего API. - Аналитик или ресёрчер: собрать данные с нескольких сайтов, не писать парсер. - Операционный ассистент: рутина в веб-панелях: обновить записи, выгрузить отчёт.

Везде под присмотром человека: «запустил и ушёл» пока ненадёжно.

Где границы - Ненадёжность кликов. Агент не всегда понимает, куда и в каком порядке нажимать. Интерфейс чуть обновился, агент потерялся. - Медленно и дорого. Каждый шаг: скриншот, анализ, действие. Много токенов на простую работу. - Prompt injection. Это главный риск. Вредоносный текст на странице может перехватить управление агентом. По данным Center for Internet Security (CIS, апрель 2026), такие атаки выросли на 340% за год. Для computer use это критично: успешная инъекция запускает реальные действия, клик «удалить», «перевести деньги». Не просто текст в ответе, а действие в системе. И замечают их поздно, часто лишь задним числом.

Пока это инструмент для контролируемых сценариев, не автопилот. Но граница двигается быстро.

Ставь 🔥, если уже пробовал или хочешь попробовать computer use на практике.

Источник: llm-stats OSWorld https://llm-stats.com/benchmarks/osworld #объясни #спросинейронку

💡 ИИ, который сам кликает по экрану | Сетка — социальная сеть от hh.ru