Качество данных важнее архитектуры модели?🤔

В ML очень много различных архитектур: GNN, трансформеры, автоэнкодеры, и многие другие. Однако в сложных задачах можно до них и не дойти, т.к. так называемое"бутылочное горлышко" - это будут сами данные😭

Если в датасете много дубликатов, неверные значения, много выбросов,пропусков, разные единицы измерения и невалидные структуры, модели будет сложно учиться на всём этом шуме. Здесь-то и работает принцип «Garbage In, Garbage Out». Это основной принцип в информатике и анализе данных.

Архитектура безусловно важна. Однако единая природа данных, корректные значения, чистые данные и честный сплит на train/test: всё это куда важнее😉