Поигрался с ИИ-агентами — в итоге получился интересный QA-эксперимент

Последнее время экспериментирую с ИИ-агентами и промтами.

Для эксперимента взял хоккейную статистику. Просто потому, что на большом количестве исторических данных хорошо видно, где модель действительно находит закономерности, а где начинает додумывать.

Собрал датасеты по матчам и постепенно усложнял задачу: статистика команд, форма, составы, состояние игроков, разные выборки и расчёт вероятностей. Результаты потом сравнивал с тем, что произошло на самом деле.

И здесь уже появились первые интересные результаты.

На одной из серий получилось 5 успешных прогнозов подряд. Например:

— Зауралье — Югра: ТМ 5.0 → 0:2 — Шанхай — Металлург: ТБ 4.5 → 4:1 — Колорадо — Лос-Анджелес: ТБ 5.5 → 4:2 после второго периода

По трём результатам, которые удалось подробно зафиксировать, получилось 3/3, средний коэффициент около 1.48.

Но гораздо интереснее оказался следующий результат.

Северсталь — Адмирал закончился 3:3, и выбранный ТМ 5.5 не прошёл.

И вот здесь для меня эксперимент становится действительно полезным.

Удачный прогноз можно принять как приятный результат, но гораздо больше информации даёт ситуация, когда модель ошиблась. Можно вернуться к исходным данным, посмотреть, что именно учитывалось, где прогноз оказался слишком уверенным и что можно изменить в самом подходе.

Поэтому постепенно строю вокруг этого небольшой процесс: датасет → промт → анализ → результат → сравнение с фактом → разбор ошибки → корректировка.

В какой-то момент поймал себя на мысли, что занимаюсь практически тем же, чем привык заниматься в QA — только вместо приложения передо мной модель, а вместо бага может оказаться неправильный вывод.

И это, пожалуй, самая интересная часть эксперимента.

Мне интересно не просто получить ответ от агента, а понять, почему он его получил и насколько этому результату вообще можно доверять.

Пока это личный эксперимент со спортивными данными, но сам подход легко переносится на рабочие задачи: тестовые данные, анализ логов, поиск аномалий, генерация сценариев и автоматизацию рутины.

Похоже, для QA сейчас становится важным не просто уметь пользоваться ИИ, а уметь нормально поставить ему задачу, дать нужные данные и потом проверить, что он действительно сделал всё правильно.

Поигрался с ИИ-агентами — в итоге получился интересный QA-эксперимент
Последнее время экспериментирую с ИИ-агентами и промтами.
Для эксперимента взял хоккейную статистику | Сетка — социальная сеть от hh.ru