Понимание K-кратного целевого кодирования для работы с высокой мощностью

•Традиционные модели машинного обучения не всегда эффективны для обработки категориальных данных. •Однократное кодирование может значительно увеличить размерность данных, что снижает производительность. •Метод кодирования, который заменяет категориальные метки целевыми средними значениями. •Разбивает данные на K подмножеств и вычисляет средневзвешенное значение для каждой метки. •Разбивает данные на K подмножеств одинакового размера. •Вычисляет средневзвешенное значение для каждой метки на основе других подмножеств. •Использует глобальное среднее значение для редких категорий. •Разбивает данные на 8 подмножеств. •Вычисляет среднее значение для каждой метки на основе других подмножеств. •Объединяет среднее значение для конкретной категории и глобальное среднее значение. •Метод может быть рискованным при существенной разнице между обучающими и тестовыми данными. •Модель может перестроиться под шаблон обучения, что снизит точность новых данных.

читать материал полностью

Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.