Точечная оценка и доверительный интервал

🔵Accuracy 90% на 100 объектах и на 100 000 — это разные 90%

Регулярная ситуация на работе. Заказчик смотрит ежемесячный замер качества: в этом месяце accuracy 90%, в следующем 87%, потом 91%. И каждый раз вопрос: что случилось с моделью в прошлом месяце?

Часто ничего. 90% — это точечная оценка, число, посчитанное на конкретной выборке. Возьмите другую выборку того же размера из того же потока — получите другое число. Вопрос в том, насколько другое.

🔵Почему accuracy описывается биномиальным распределением

Accuracy — доля верных ответов среди n объектов. Каждый объект модель либо угадала, либо нет, исходов два. Если объекты независимы и приходят из одного потока, у каждого одна и та же вероятность p быть угаданным — это и есть «настоящая» accuracy модели. Тогда число верных ответов k распределено биномиально, Bin(n, p), а accuracy = k/n — та же величина в долях.

🔵Формула

При большом n биномиальный закон близок к нормальному, и 95%-й доверительный интервал считается так:

[p̂ − h ; p̂ + h], где h = 1.96 · √( p̂(1 − p̂) / n )

p̂ — accuracy на выборке, n — размер выборки, 1.96 — квантиль нормального распределения для уровня 95%, h — полуширина интервала: на сколько отступаем от p̂ в каждую сторону. Полная ширина интервала — 2h.

🔵Одна и та же accuracy 90% на выборках разного размера

• 90 из 100 → от 84.1% до 95.9%, ширина 11.8 п.п. • 900 из 1 000 → от 88.1% до 91.9%, ширина 3.7 п.п. • 9 000 из 10 000 → от 89.4% до 90.6%, ширина 1.2 п.п. • 90 000 из 100 000 → от 89.8% до 90.2%, ширина 0.37 п.п.

Выборка в 10 раз больше — интервал уже в √10 ≈ 3.2 раза. Чтобы сузить интервал вдвое, нужно вчетверо больше данных.

При 100 объектах «90%» означает «где-то от 84 до 96». Я прогнал симуляцию: модель с настоящей accuracy ровно 90%, каждый месяц новая выборка из 100 объектов. Двенадцать месяцев подряд: 90, 85, 93, 85, 92, 91, 87, 91, 90, 95, 88, 90. Модель не менялась, а разброс 10 п.п.

🔵Вернёмся к 90 → 87 → 91

Прежде чем разбирать, что случилось с моделью, первый вопрос — на скольких объектах посчитано каждое число. При 100 объектах интервал вокруг 90% — от 84 до 96, и 87 и 91 в него попадают. При 10 000 интервал — от 89.4 до 90.6, и ни одно из соседних чисел в него уже не попадает. Как корректно сравнивать два месяца между собой — разберу отдельным постом.

🔵Сколько нужно данных

Формулу для h можно развернуть: задаём, какую полуширину интервала хотим получить, и находим нужное n.

h = 1.96 · √( p(1 − p) / n ) h² = 1.96² · p(1 − p) / n n = 1.96² · p(1 − p) / h²

При accuracy около 90%:

• ±5 п.п. → 139 объектов • ±2 п.п. → 865 объектов • ±1 п.п. → 3 458 объектов • ±0.5 п.п. → 13 830 объектов

Если заказчику важны колебания в 1–2 п.п., тестовая выборка в пару сотен объектов их не различает.

#процессы #статистика