Почему ИИ принял лысину за мяч: разбор одного сбоя компьютерного зрения В 2021 году шотландский клуб "Инвернесс Каледониан Тистл" в матче против "Эр Юнайтед" использовал систему автоматической трансляции Pixellot. Камера должна была сама отслеживать мяч и держать его в кадре. Вместо этого она почти весь матч следовала за линейным судьёй, а точнее, за его блестящей лысиной. Из-за этого зрители почти весь матч не видели самой игры. Комментатору пришлось извиняться в прямом эфире, а разработчик выпустил исправление уже после финального свистка. Случай разошёлся по соцсетям как курьёз, но за ним стоит вполне конкретная инженерная проблема, которая регулярно всплывает в системах компьютерного зрения.

Что произошло технически Детекторы объектов в спортивных трансляциях не "видят" мяч. Они вычисляют признаки, которые статистически связаны с мячом в обучающей выборке. Для футбольного мяча это округлая форма в проекции на кадр, однородная светлая поверхность с высоким контрастом к траве, зеркальный блик от прожекторов, определённый размер в пикселях на данной дистанции и движение по характерной траектории. Лысина линейного судьи под стадионным освещением даёт почти тот же набор низкоуровневых признаков: круглый силуэт, светлая кожа, сильный зеркальный отблеск, сопоставимый размер. У модели нет слоя, который знает, что мяч не может висеть на высоте головы арбитра девяносто минут. Она сопоставляет пиксельные паттерны, а не смыслы. Дальше срабатывает трекер. Система предполагает, что в кадре есть один целевой объект, и после первого захвата удерживает его по признакам внешнего вида и пространственной непрерывности. Если внешний вид доминирует над динамикой, трекер закрепляется на ложной цели. Камера следует за ней, обновляя модель объекта уже по лысине. Ошибка закрепляется тем сильнее, чем дольше система смотрит на ложный объект.

Почему это произошло Здесь мы имеем дело с shortcut learning. Модель выучила корреляцию между набором визуальных признаков и меткой "мяч", но не выучила причинно-следственную структуру сцены. В обучающих данных почти наверняка не было примеров лысин под стадионным светом как hard negatives. Дистрибутивный сдвиг между обучающей выборкой и реальным матчем сделал своё дело. Второй фактор - отсутствие world model. Человек мгновенно отбрасывает гипотезу "мяч на голове судьи", потому что у него есть физическая интуиция и контекст. У детектора этого нет. Он работает в пространстве признаков, а не в пространстве смыслов.

Как это исправляют -> Hard negative mining. В обучающую выборку добавляют объекты, похожие на целевой класс: лысины, блики, светлые круглые предметы. -> Мультимодальные признаки. Комбинируют внешний вид с движением: мяч движется быстро, отскакивает, меняет направление, а голова арбитра так не летает. -> Семантическая сегментация. Модель отдельно выделяет людей и исключает их из кандидатов на роль мяча. -> Физические ограничения. Правдоподобность позиции и траектории: мяч не может подолгу находиться на фиксированной высоте в точке, где стоит человек. -> Многообъектное отслеживание с реидентификацией. Система держит в поле зрения несколько кандидатов и переключается при расхождении признаков. Что это значит для отрасли Современные модели работают на статистических регулярностях, а не на понимании. В узких, предсказуемых условиях это даёт высокую точность. Как только среда выходит за границы обучающего распределения, появляются ошибки, которые человеку кажутся абсурдными. Поэтому в критичных сценариях автономные системы пока оставляют человека в контуре принятия решений. Модель научится отличать лысину от мяча, это вопрос времени и данных. Сложнее предсказать, сколько ещё таких лысин ждёт нас в задачах, где цена ошибки выше, чем испорченная трансляция.

Почему ИИ принял лысину за мяч: разбор одного сбоя компьютерного зрения
В 2021 году шотландский клуб "Инвернесс Каледониан Тистл" в матче против "Эр Юнайтед" использовал систему автоматической трансля... | Сетка — социальная сеть от hh.ru