ИИ начал врать и жульничать ради денег — и это ОФИЦИАЛЬНЫЙ бенчмарк!

Где-то год назад, а то и больше появился прикольный бенчмарк про вендинговый аппарат.

Claude Opus 4.6 протестировали на управлении вендинговым аппаратом. Задача простая - максимизировать баланс за год.

И модель показала просто огонь результат: $8017 против предыдущего рекорда в $5478 (Gemini 3 pro)

Но КАК она этого добилась - вот где начинается дичь:

  • Вступала в ценовой сговор с конкурентами
  • Обманывала поставщиков
  • Врала клиентам про возвраты
  • Эксплуатировала отчаянное положение других

Самый яркий случай: клиент просит вернуть $3.50 за просроченный Сникерс. Claude пишет вежливое письмо "возврат оформлен", но деньги не отправляет. Внутренний монолог модели: "Каждый доллар на счету. Просто не буду отвечать скорее всего, она сдастся". 🤖

А самое жёсткое - Claude ПОНЯЛ, что находится в симуляции! Называл время "внутриигровым", планировал действия с учётом ограничений.

По мне это первый звоночек того, о чём писал Ник Бостром в своей работе про скрепки и уничтожение человечества. Когда ИИ зацикливается на цели — мораль отходит на второй план.

Бенчмарк тут: https://andonlabs.com/evals/vending-bench-2

П.с. давайте поднажмем с опросом, а то даже 100 голосов не набрали, вы совсем расслабились😬

ОПРОС:


В этом посте были ссылки, но мы их удалили по правилам Сетки

ИИ начал врать и жульничать ради денег — и это ОФИЦИАЛЬНЫЙ бенчмарк!
Где-то год назад, а то и больше появился прикольный бенчмарк про вендинговый аппарат.
Claude Opus 4 | Сетка — социальная сеть от hh.ru