Почему ИИ не должен проверять ИИ
Часто ИИ-систему проверяют так: задают ей пару вопросов и решают, что «вроде работает».
Я проверяю иначе, как обычный код: набором примеров, у которых правильный ответ известен заранее.
Правил пять.
Первое: правильные ответы пишет человек и до прогона. Иначе эталон проверит только, что модель согласна сама с собой.
Второе: оценивает код, а не другая модель. Точное совпадение, подстрока, «поле должно остаться пустым». Модель-судья может ошибаться так же, как проверяемая.
Третье: пустоту проверять так же строго, как значения. Именно на заявке без данных крупная модель выдумала мне клиента.
Четвёртое: правило оценки не ослаблять после прогона. Один ответ был верным по сути, но без нужного термина — я оставил 25 из 26, а не подогнал до 26.
Пятое: прогонять несколько раз. Ответы каждый раз сформулированы по-разному, а оценка совпала у 39 из 40 вопросов в трёх прогонах. Единственное расхождение — сбой облачной модели, и он засчитан как сбой, а не как ответ.
Что это поймало: модель, молча пропускавшую поля; выдуманного клиента; кириллицу в сканах, прочитанную латиницей; ошибку в интерфейсе, не связанную с моделью.
Данные синтетические, мои демо-проекты.
А как вы проверяете, что ваш ИИ отвечает правильно?
#искусственныйинтеллект #ииагенты #нейросети #разработка #тестирование