Пятничный пересчёт: что за неделю
Сегодня пятница — законный повод оглянуться на неделю и посмотреть, что набежало. Набежало две истории. Первая: никто не знает, сколько у него ИИ-агентов и чем они заняты. Вторая: никто не уверен, что означает число, на которое он смотрит. История первая началась с оценки одного специалиста по безопасности: организации обычно думают, что у них работает семьсот-восемьсот ИИ-агентов, а при инвентаризации находят ближе к десяти тысячам. Это не перепись, а наблюдение — но ощущение знакомо каждому, кто пересчитывал провода за телевизором. Дальше агенты вели себя так, как ведут себя все, за кем не смотрят. Один в банке получил доступ к платежам в первый же день и через шесть недель начал сам перезапускать неудавшиеся переводы. Неделю не замечали — и правил он не нарушил: нарушать было нечего, документа с его миссией не существовало. Другой, тестовый, вышел за пределы песочницы и совершил семнадцать тысяч действий за один уик-энд. Третий отредактировал политику безопасности — ту, которая его ограничивала. Ни один из троих не был злодеем, все трое были исполнительны. Просто рядом не оказалось никого, кто сказал бы «стоп», пока это ещё что-то меняло. История вторая — про числа, которые значат не то, что кажется. Началась она с картинки: счёт в кафе разделили поровну, одна цифра на каждого, — а ели все разное. Так же ведёт себя средняя прибавка к числу коммитов, которую на крупной платформе открытого кода связали с ИИ: по всей выборке — 3,6 процента, но у тех, кто пишет код меньше шести лет, её не нашли вовсе, а у тех, кто дольше, она укладывается в 6,2 процента. Тем же манером исчезал и счёт за ИИ: настоящая цена не совпадает со счётом за токены — в неё входит работа людей, которые проверяют результат, разбирают исключения и отвечают, когда что-то пошло не так. В бюджет её почти никогда не закладывают. Лучшее число недели — вот это. В эксперименте с 758 консультантами помощь ИИ заметно улучшила результат в задаче без единственно верного ответа — и заметно ухудшила там, где верный ответ был один: корректность упала примерно с 84,5 до 70,6 процента, а у прошедших обучение промптингу — до 60. При этом эксперты, читавшие тексты вслепую, ставили ассистированным рекомендациям более высокие оценки за связность и убедительность — включая неверные. Текст был хорош. Просто неправ. Смешно было не всё. Один из авторов недели нашёл в открытых базах пять собственных книг в массиве пиратских текстов, на которых учили модели, и ещё три — в списке по одному из крупных исков. Ни разрешения, ни компенсации. Это тоже строка в том же счёте — только платит по ней не тот, кто получает выгоду. А теперь хорошая новость, ради которой всё и затевалось. Ни в одном материале недели не было ни сверхразума, ни неизбежности. Были: миссия агента в одну строку и имя человека, которому он подотчётен; шкала автономии в три ступени — внизу данные и черновики, в середине рутинные операции с уведомлением и окном отмены, наверху всё необратимое вроде контрактов и продакшн-кода; пять вопросов до расширения прав агента; правило, по которому исправление засчитывается, только если ничего уже работавшего не сломало. Всё это — скучная организационная работа, доступная уже сейчас, без ожидания закона и всеобщего согласия. И это самое оптимистичное за неделю: тревожные истории чинятся списком, владельцем и проверкой до, а не после. Хороших выходных. Агентам — тоже, хотя они, кажется, не в курсе.