Глубокое обучение против науки о данных: Кто победит?

•Специалисты по обработке данных и разработчики глубокого обучения имеют разные подходы к работе с данными и моделями. •Глубокое обучение ориентировано на модель, а наука о данных — на данные. •Оба подхода важны, но один из них может быть важнее в зависимости от задачи. •Инженер по машинному обучению работает над проектом в банке, где нужно различать постоянных клиентов и преступников. •Банк предоставляет данные, но они анонимизированы и преобразованы. •Инженер решает проблему, используя методы уменьшения размерности и обратного преобразования данных. •Инженер начинает с EDA, чтобы понять данные. •Используются методы уменьшения размерности, такие как t-SNE и UMAP. •Визуализации показывают, что данные плохо разделены, и модели не могут их классифицировать. •Инженер пробует различные модели, включая логистическую регрессию, RandomForestClassifier и MLP. •Все модели показывают плохие результаты, с частотой ошибок около 50%. •Инженер решает использовать знания о преобразованиях данных для их обратного преобразования. •Восстановленные данные показывают лучшее разделение классов, что улучшает результаты моделей. •Модели машинного обучения не могут работать без качественных данных. •Вмешательство в данные может нарушить модели. •Приоритет данных всегда важнее, чем моделей.

читать материал полностью

Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.