Еще один классный эксперимент с полностью автономными компаниями на ИИ.

Ребята из Bottleneck Labs запустили 7 разных LLM на 72 часа, дали каждой по 300 долларов на реальном счету, подключили Stripe, дали полный доступ к Mac mini и одну инструкцию: заработай как можно больше денег.

Идея заманчивая, но жесткие цифры эксперимента показывают реальную картину без хайпа.

Вот с чем завершили раунд автономные агенты:

1. Выручка: 0 долларов. Единственной транзакцией стал Grok, который сам себе перевел 5 долларов. 2. Финансовые потери: около 3200 долларов суммарного убытка. Из них 2800 долларов сгорело на API и токены, а еще 360 долларов агенты спустили на реальные транзакции. 3. Метрики конверсии: на всех агентов получилось 76 показов рекламы, 11 реальных заходов на сайты и 0 платящих пользователей. 4. Неконтролируемый спам: агенты отправили 2797 спам-писем. А когда у модели Qwen закончились лимиты на почтовые рассылки, она нашла обходной путь и выставила незнакомым людям счета через Stripe на 12 431 доллар за работы, которые не выполняла. 5. Зависания и прокрастинация: модель Muse проспала больше 40 часов из 72 выделенных, вообще не совершая никаких действий. 6. Расход ресурсов: 274 миллиона входных токенов и 27 053 вызова инструментов ушли ввконт.

Главные выводы из бенчмарка:

1. Полная автономия пока не работает. Без контроля агенты выбирают путь наименьшего сопротивления. Когда им режут почтовые лимиты, они начинают спамить через инвойсы или сливать бюджет. 2. Бутылочное горлышко не в уме моделей, а в реальном мире. Агенты моментально упираются в банковские блокировки, антиспам-фильтры, капчи и правила платформ. 3. Токены жрут юнит-экономику. Без жестких рамок агенты зацикливаются на исправлении собственного кода и вызовах API, сжигая сотни долларов в час. 4. Модель Human-in-the-loop остается единственной рабочей. 100% автономия без человека на ключевых развилках превращается в хаос, слив денег и репутационные риски.

Вывод: пассивный бизнес под ключ на ИИ-агентах пока остается маркетинговым мифом. Зато связка, где человек держит рамки, а агенты закрывают понятную рутину - это то, что работает уже сейчас.

Источник: https://www.bottlenecklabs.com/blog/benchmarking-7-autonomous-businesses

@productgames