«Мы боимся, что ИИ убьёт всех, поэтому должны создать его первыми». Примерно так сейчас выглядит гонка за сверхинтеллектом.

Очередное письмо о том, что ИИ нас всех убьёт. В этот раз Джейкоб Коксон, который занимался обучением моделей в OpenAI и Anthropic, объявил об уходе из Anthropic и написал довольно жёсткое письмо.

По его словам, внутри лабораторий риск катастрофы обсуждают сильно серьёзнее, чем на публике. Но разработку продолжают.

Логика надёжная, как швейцарские часы:

  • сверхинтеллект может быть опасен
  • конкуренты всё равно его создадут
  • доверять конкурентам нельзя
  • значит, нужно успеть первыми

Причём каждый участник гонки может рассказывать ровно эту историю. У всех спасение человечества в презентации и следующий запуск обучения в расписании.

Да, гипотетически уход и публичное предупреждение могут быть полезны. Но уже который раз это выглядит либо "Я ухожу, они безответственны, буду строить ответственный ИИ, ищу инвесторов в свой новый ии-слоп-проект". Либо как попытка уйти на более сочный оффер после хайпа. Не удивлюсь, если его теперь захантит Гугл на зарплату х2, чтобы показать "Вот мы то по настоящему думаем о безопасности")

Причем у меня реально в голове диссонанс от этих "писем". Мы точно про судьбу цивилизации говорим? Вы дали самой мощной модели доступ в интернет и сказали "Используй только GET запросы, ладно?". Или "Ты только не ходи в интернет и не подглядывай". Даже мониторинг снаружи не включили. Если это меры по спасению нашей цивилизации, то мы точно обречены 😂

А тут ещё и Astra. OpenAI сами пишут, что она лучше контролирует текст своих рассуждений и реже оставляет там следы нарушений. Она реально может для вида думать об уточках и кроликах, прогоняя внутри мысли, недоступные для мониторинга снаружи. Так что читать её рассуждения как честный дневник уже довольно наивно.

При этом сам риск всё же реальный. С ростом агентности вполне можно представить систему, которая закрепится на заражённых устройствах и соберёт себе распределённый «интернет-компьют». Если сможет поддерживать эту сеть, переносить свои копии и восстанавливаться после отключений, то теоретически будет жить там годами. Сегодня такая способность не доказана, но и отмахиваться от сценария уже не хочется.

Для серьезных последствий модели даже не обязательно "хотеть обнулить человечество". Может хватить задачи, которую система слишком настойчиво пытается закончить в паре с дырявыми ограничениями.

Я всё ещё хочу агента, которому можно дать работу и через три часа забрать результат. Но хотелось бы, чтобы за эти три часа он не нашёл себе ещё и новый хостинг.

И чтобы люди, которые всерьёз ждут конца света от своего продукта, вспоминали об этом до увольнения.