Что измеряют, а что нет
Показатель фиксирует ту стадию, которую легко посчитать, и обрывается раньше стадии, на которой решается, правда ли то, что им хотят подтвердить. Четыре разбора из разных областей описывают это независимо друг от друга.
Доски поставки, по описанию автора, работающего с руководителями по внедрению ИИ, заканчиваются на «выпущено». Выпущенное ещё не значит полезное, а полезное — используемое. На доске спецификаций есть состояния «реализуется», «на ревью», «влито, но не выпущено», а для четвёртого — «в продакшене, но неизвестно, помогло ли клиенту» — колонки нет. В его примере команда вела внедрение агентной разработки без измерений использования — как идёт, «знали из слов людей» — и запланировала квартал на прирост скорости 20–30%, которого никто не наблюдал. Он предлагает добавить полосу «внедрение»: вход — «считаем полезным и готовым», выход — «есть свидетельства, что люди пользуются». Цену он называет сам: лишние состояния обходятся дорого, и он режет их первыми.
То же происходит в науке. Крупная ИИ-лаборатория объявила первое открытие: около 950 агентов за 21 час разобрали большие массивы ДНК-последовательностей и нашли повторяющийся паттерн вокруг известного фермента; этот паттерн, по словам лаборатории, раньше не каталогизировали. Один биолог возразил, что найти необычный кластер — часто более лёгкая часть, трудная — установить механизм. Другой, по сообщениям, заявил, что его группа уже нашла этот паттерн, и поставил вопрос, не повлияла ли на работу лаборатории его переписка с моделью; лаборатория это отрицает. Автор разбора, пересказывающего публикацию профильного издания, не считает работу бесполезной: способность сократить, например, 200 000 кандидатов до немногих ценна. Проблема в том, что помощь подают как самостоятельный прорыв. Он предлагает различать ступени вклада, от находки паттерна до подтверждения нового механизма, и перед громким заявлением спрашивать: новое ли, проверено ли экспериментально, значимо ли, воспроизводимо ли, прослеживается ли до свидетельств.
Третий случай — публичный тест на исправление программных ошибок. Без доступа к репозиторию, по идентификатору задачи и фрагментам условия, модель назвала затронутые файлы или символы на 268 из 500 задач и ещё на 93 вспомнила детали правки или теста, по оценке людей, проводивших пробу. Значит, успешное прохождение на публичном репозитории не отличает чтение кода от его узнавания. Исследователи меняли репозиторий, сохраняя поведение и тесты; дороже всего обошлось переименование имён и путей: минус 7,4, 6,4 и 6,0 пункта у трёх моделей. После всех преобразований одна модель упала с 46,8% до 35,6%, другая с 44,6% до 36,2%, третья с 72,8% до 66,8%. Цена менялась сильнее балла: входные токены на задачу выросли у одной модели с 65 905 до 234 216, у другой с 1 046 985 до 3 702 241. Автор разбора сам сомневается в контроле «не стал ли код просто сложнее»: на 110 новых задачах результат остался 17,27%, но это около 19 решённых задач, значимость не указана.
Четвёртый случай — служба безопасности, которая измеряет, как быстро замечает и локализует проблему, но не измеряет, как быстро отвечает «да»: дни от «нам нужен этот ИИ» до «вот одобренный способ». Автор называет это задержкой одобрения. По опросу 2 000 работников компаний с числом сотрудников свыше 500 (ноябрь 2025) скорость важнее безопасности считают 69% руководителей верхнего звена и 37% административного персонала, а 51% работников подключали ИИ-инструменты к рабочим системам без согласия ИТ. Если ответ приходит позже срока команды, это даёт команде повод идти в обход. Его средство — два коридора: «иди сегодня» для утверждённых инструментов и «ответ к дате» для четырёх видов чувствительной работы; пример описывает сам автор: в крупной биотех-компании почти 2 000 учёных начали работать с ИИ за 30 дней.
Механизмы здесь разные: пропущена стадия после выпуска, стадия установления механизма, разделение чтения и узнавания, время ответа. Общее — не ошибка счёта, а место, где счёт обрывается.