Две модели могут одинаково сортировать заявки — и по-разному понимать 80%
Классификатор часто выдаёт балл от 0 до 1. Его легко принять за честную вероятность: 0,8 — значит модель права примерно в восьми случаях из десяти. Но это верно только для хорошо откалиброванной модели.
Калибровку проверяют на множестве примеров: берут случаи с похожими баллами и сравнивают прогноз с реальной долей правильных ответов. Если среди оценок около 0,8 успех встречается заметно реже, модель переоценивает уверенность.
Поэтому перед решениями по баллу уточняйте не только точность модели, но и проверялась ли её калибровка на данных, похожих на ваши.