KPI на ИИ: что метрика меряет на самом деле
Чувствую, что история не будет полной без этого разбора. Я побеседовал с несколькими людьми, повтыкал в документацию - кое-что понял
Напомню, как реализована метрика сейчас: доля сгенерированных токенов, дошедших до коммита в неизменном виде
В чём проблемы: линтер заменяет readonly string[] на ReadonlyArray или наоборот. По сути синонимы, а для метрики 0% отправил код, сгенерированный нейросеткой, обратно на доработку? 0%
На дэшборде по каждому видно: общий объём закоммиченного кода и сколько из него сопоставилось со сгенерированным. Сопоставление теряет часть честной генерации - примеры выше как раз об этом. Но ненулевой счётчик врать не может: раз что-то сопоставилось, значит человек инструментом пользуется. Вот проникновение и видно: кто генерит, кто нет
Измерять уровень использования - неплохая идея. Реализация только переусложнена, хотя и понятно почему: простой учёт токенов абузится гонянием нейронки вхолостую. И не надо ожидать, что всё будут коммитить - нормой стоит считать единицы процентов доехавшего кода, а не десятки
Метрика честно меряет проникновение. А экономическим эффектом её назначили не от хорошей жизни - без ROI денег на развитие не будет, а другой цифры просто
З.Ы. Подумал ещё - даже проникновение она меряет криво. Ненулевой процент честно доказывает одно - человек инструментом пользовался. А вот сравнивать людей по величине нельзя: у того, кто гоняет агентный цикл с правками и линтером, выйдет 3%, у того, кто делает 'напиши jsdoc → accept', - 30%. А тот, кто обсудил с нейронкой подход и написал код руками, получит честный ноль. При том что пользы в третьем случае может быть больше всего