Датасеты для тестирования ИИ-инструментов
Привет, охотники! 🏹
В предыдущем посте (https://set.ki/post/Tf4WQYz) я начала серию исследований по теме “Тестирование ИИ-продуктов”. Сейчас расскажу про датасеты для тестирования ИИ-агентов
На каком этапе применяем?
Чуть ли не в самом начале тестирования. Датасеты нужны для предварительной проверки агента, до проверки пользователями, НО этот этап не заменяет “живую” проверку
Что такое датасет?
Тестовый датасет - это набор данных, который используется для финальной проверки и независимой оценки уже обученной модели
По формату он состоит из тех же частей, что и обучающий датасет: - объекты (записи) - изображения, текст, таблицы - примеры для проверки - признаки - характеристики и параметры объекта, по которым модель делает выводы - метки (целевые значения) - ожидаемые/правильные ответы для каждого объекта. Используются для оценки метрик качества* - метаданные - техническая информация
Какие датасеты бывают?
- Бенчмарк датасеты - универсальные датасеты, которые проверяют большинство моделей. Они помогают оценить, насколько хороший уровень у модели относительно остальных (“золотой стандарт”). Но такой датасет не всегда поможет найти какие-то уникальные критичные кейсы
- Кастомные датасеты - датасеты с адаптированным набором данных, настроенным под конкретные граничные особые кейсы сферы, в которой используется агент
- Синтетические датасеты - сгенерированные искусственно с помощью алгоритмов, а не собранные из реального мира (если есть NDA или данных слишком мало)
- Краудсорсинговые датасеты - данные, которые собираются миллионами людей добровольно через специальные платформы (например, голоса для распознавания речи)
Также есть еще множество классификаций датасетов, здесь я привела самые интересные по моему мнению
Где найти датасеты?
Источников бенчмарк датасетов много, конкретные названия лучше искать на сайтах глобальных AI-разработчиков. Кастомные датасеты можно создавать самостоятельно под конкретную специализацию агента (если это личный проект - с помощью ИИ, если корпоративный - следите, чтобы не было утечки данных)
*Когда тестирование датасетами пройдено, нужно оценить качество ответов. В одном из следующих постов поговорим про метрики ИИ-агентов