«Мы боимся, что ИИ убьёт всех, поэтому должны создать его первыми». Примерно так сейчас выглядит гонка за сверхинтеллектом.
Очередное письмо о том, что ИИ нас всех убьёт. В этот раз Джейкоб Коксон, который занимался обучением моделей в OpenAI и Anthropic, объявил об уходе из Anthropic и написал довольно жёсткое письмо.
По его словам, внутри лабораторий риск катастрофы обсуждают сильно серьёзнее, чем на публике. Но разработку продолжают.
Логика надёжная, как швейцарские часы:
- сверхинтеллект может быть опасен
- конкуренты всё равно его создадут
- доверять конкурентам нельзя
- значит, нужно успеть первыми
Причём каждый участник гонки может рассказывать ровно эту историю. У всех спасение человечества в презентации и следующий запуск обучения в расписании.
Да, гипотетически уход и публичное предупреждение могут быть полезны. Но уже который раз это выглядит либо "Я ухожу, они безответственны, буду строить ответственный ИИ, ищу инвесторов в свой новый ии-слоп-проект". Либо как попытка уйти на более сочный оффер после хайпа. Не удивлюсь, если его теперь захантит Гугл на зарплату х2, чтобы показать "Вот мы то по настоящему думаем о безопасности")
Причем у меня реально в голове диссонанс от этих "писем". Мы точно про судьбу цивилизации говорим? Вы дали самой мощной модели доступ в интернет и сказали "Используй только GET запросы, ладно?". Или "Ты только не ходи в интернет и не подглядывай". Даже мониторинг снаружи не включили. Если это меры по спасению нашей цивилизации, то мы точно обречены 😂
А тут ещё и Astra. OpenAI сами пишут, что она лучше контролирует текст своих рассуждений и реже оставляет там следы нарушений. Она реально может для вида думать об уточках и кроликах, прогоняя внутри мысли, недоступные для мониторинга снаружи. Так что читать её рассуждения как честный дневник уже довольно наивно.
При этом сам риск всё же реальный. С ростом агентности вполне можно представить систему, которая закрепится на заражённых устройствах и соберёт себе распределённый «интернет-компьют». Если сможет поддерживать эту сеть, переносить свои копии и восстанавливаться после отключений, то теоретически будет жить там годами. Сегодня такая способность не доказана, но и отмахиваться от сценария уже не хочется.
Для серьезных последствий модели даже не обязательно "хотеть обнулить человечество". Может хватить задачи, которую система слишком настойчиво пытается закончить в паре с дырявыми ограничениями.
Я всё ещё хочу агента, которому можно дать работу и через три часа забрать результат. Но хотелось бы, чтобы за эти три часа он не нашёл себе ещё и новый хостинг.
И чтобы люди, которые всерьёз ждут конца света от своего продукта, вспоминали об этом до увольнения.