Таки прочитал лучшие решения с соревнований Kaggle за 2023 год (the Best Solution Write-up Authors 🏆), все еще актуально. За статьи в сумме раздали 100 тысяч долларов.

1. Три статьи от одного автора (Chris Deotte) посвящены задачам про временные ряды:

  • В одной задаче нужно былопредсказать количество микробизнесов на 100 человек в каждом штате на следующие месяцы. Как всегда, важна хорошая валидация: GroupKFold по компаниям + cross time series validation для увеличения объема данных и получения более робастных метрик. Так как метрика SMAPE, то и loss обычный MSE, и нужно предсказывать не саму плотность, а только прирост. Таким образом, все данные по штатам становятся ближе друг к другу. Необычно, что лучшая модель получилась с сеткой с GRU слоями. Автор признает, что такой же результат получился бы при использовании магического коэффициента 1.0045 в качестве поправочного коэффициента для соотношения в динамике прошлых месяцев. И, конечно же, LB public probing (для тех, кто знает; кто не знает – ни в коем случае не использовать).

  • В следующем соревновании требовалосьпрогнозировать прогрессирование болезни Паркинсона. Мало кейсов (248 пациентов), много лишних и шумных показателей (1000 показателей). 99% успеха – признак, как часто человек приходит в больницу. Наверное, не для этого запускали соревнование. И понятно, что тут зашли наиболее простые модели, у автора – SVR (Support Vector Regression).

  • В 3м соревновании автор перестарался с подходом из пункта а и улетел с 1-го места в предварительном этапе на 967-е. Во всем виноват как раз LB public probing (буквально переобучился). А надо было всего лишь прочитать книжку "Простые правила" из прошлого поста.

2. Распознавание предложений языков жестов: решение через адаптированный Squeezeformer, который изначально был для распознавания речи. С помощью MediaPipe ключевые точки (landmarks) трансформируются в аналогичный входной спектр. Забавно, что dropout здесь называется FingerDropout, то есть буквально зануляются пальцы. А вот в задаче распознавания букв языков жестов – обычный 1D CNN эффективнее трансформеров (by Hoyeol Sohn).

3. Задача - предсказание успеваемости студентов поинформации, как студент проходит развивающие игры. Слышал, что в какой-то компании так определяют производительность сотрудников по 5-минутной игре в начале рабочего дня (aka фильм "Особое мнение", только про корпоративную эффективность). Решение – объединение бустингов, лики и использование открытого API игры, чтобы сгенерировать больше данных, погружение в данные, чтобы создать осмысленные признаки. Интересно, что под задачу удалось адаптировать подход, вдохновленный WaveNet, с использованием embedding слоев и объединив с TimeEmbedding + avg_pooling, создать решение с сетками (причем там двухшаговое обучение с претрейном для backbona), и, как они говорят, итерационное обучение ускорил pipeline обучения.

4. Две статьи про физические задачи: детекция гравитационных волн (топ-решение G2Net) и нейтрино (лучшее решение gnn, т.е. графовые сетки).

5. Задача Маммографии: YOLOX для правильного кропа изображения + EfficientNet и ConvNeXt для классификации. Примечательно, что использование label smoothing работало все-таки лучше, чем soft positive label trick (always been).

+там еще про Image Matching Challenge и распознавание пении птиц по пению