Почему ИИ не должен проверять ИИ

Часто ИИ-систему проверяют так: задают ей пару вопросов и решают, что «вроде работает».

Я проверяю иначе, как обычный код: набором примеров, у которых правильный ответ известен заранее.

Правил пять.

Первое: правильные ответы пишет человек и до прогона. Иначе эталон проверит только, что модель согласна сама с собой.

Второе: оценивает код, а не другая модель. Точное совпадение, подстрока, «поле должно остаться пустым». Модель-судья может ошибаться так же, как проверяемая.

Третье: пустоту проверять так же строго, как значения. Именно на заявке без данных крупная модель выдумала мне клиента.

Четвёртое: правило оценки не ослаблять после прогона. Один ответ был верным по сути, но без нужного термина — я оставил 25 из 26, а не подогнал до 26.

Пятое: прогонять несколько раз. Ответы каждый раз сформулированы по-разному, а оценка совпала у 39 из 40 вопросов в трёх прогонах. Единственное расхождение — сбой облачной модели, и он засчитан как сбой, а не как ответ.

Что это поймало: модель, молча пропускавшую поля; выдуманного клиента; кириллицу в сканах, прочитанную латиницей; ошибку в интерфейсе, не связанную с моделью.

Данные синтетические, мои демо-проекты.

А как вы проверяете, что ваш ИИ отвечает правильно?

#искусственныйинтеллект #ииагенты #нейросети #разработка #тестирование

Почему ИИ не должен проверять ИИ | Сетка — социальная сеть от hh.ru