Как простая линейная регрессия обыграла XGBoost и CatBoost
На активе, где я работаю, часть газоконденсатных скважин потеряла измерения забойного давления — глубинные датчики выходят из строя в условиях 500+ бар и 100+°C, а их замена требует остановки скважины и дорогостоящего подземного ремонта. Без этих данных невозможен нормальный факторный анализ добычи и мониторинг продуктивности — часть фонда превращается в «слепую зону».
Задача: восстановить непрерывный ряд забойного давления по косвенным промысловым данным (устьевое давление, дебит газа, водогазовый фактор и т.д.), которые продолжают собираться штатно.
Первым делом посмотрел на корреляции. Устьевое давление (WHP) и забойное (BHP) оказались связаны почти линейно — 0.98. Это и стало ключом к решению. Протестировал 536 конфигураций моделей — от классической линейной регрессии до CatBoost, XGBoost, Random Forest и гибридных ансамблей. Победила… обычная линейная регрессия (OLS): — R² = 0.983 — MAPE = 1.5–8% — Проверка методом Leave-One-Out (модель обучается без одной скважины, потом предсказывает именно по ней) — точность держится даже на «невидимых» скважинах. Почему сложные модели проиграли: на скважину приходится всего 30-50 суточных замеров — на таких объёмах CatBoost и XGBoost переобучаются, запоминают шум вместо закономерности. А раз связь физически почти линейна — не нужен сложный алгоритм, чтобы её уловить.
Самое интересное — сравнение с гидродинамической моделью. На этом графике видно: факт (синий) плавно сменяется прогнозом ML (оранжевый), а ГДМ (серый) держится заметно выше и почти не реагирует на реальное истощение пласта. Модель, обученная на простых промысловых данных, оказалась физичнее сложной гидродинамической модели. Итог: восстановленные данные легли в основу факторного анализа и выбора ГТМ для скважин без действующих датчиков. Вывод для себя: не всегда “сложнее = лучше”. Задача и объём данных должны определять инструмент, а не мода на алгоритм.