Критерий определяет, что вы получите

Управление разработкой, оценка ИИ-рецензентов и найм: мало кто пишет о критерии как таковом. Связь проводит редактор: везде показатель выглядит благополучно, но не различает то, ради чего заведён.

По рассказу, менеджер вывел на панель число дефектов на каждого. Число упало, отзывы клиентов остались плохими: новые дефекты перестали заносить в систему. Его проверка: если метрика может поставить одно имя наверх списка, она нацелена на человека, а не на систему. Он продаёт инструмент метрик потока.

В исследовании ИИ-рецензентов 60 заявок переписали в 1 260 вариантов. Самая «устойчивая» конфигурация меняла оценку в среднем на 0,205 балла, но версии одной статьи от версий разных отличала на 0,511 при «монете» 0,5. Усреднение двух обычных рецензий даёт согласованность 0,758, трёх — 0,781, система, предложенная авторами исследования, — 0,775. Замечается: выбор равными долями из шести диапазонов оценок завышает разброс.

В найме ошибок две: взять не того (видно примерно за 90 дней) и не взять того (почти не видно). Нет перечня результатов первого года, и решение заполняет первое впечатление. Обещание «вдвое меньше ошибок» ничем не подкреплено.

Механизмы разные (подгонка, неразличимость, отсутствие критерия); редакторский вывод один: проверять показатель на исходе.