Поигрался с ИИ-агентами — в итоге получился интересный QA-эксперимент
Последнее время экспериментирую с ИИ-агентами и промтами.
Для эксперимента взял хоккейную статистику. Просто потому, что на большом количестве исторических данных хорошо видно, где модель действительно находит закономерности, а где начинает додумывать.
Собрал датасеты по матчам и постепенно усложнял задачу: статистика команд, форма, составы, состояние игроков, разные выборки и расчёт вероятностей. Результаты потом сравнивал с тем, что произошло на самом деле.
И здесь уже появились первые интересные результаты.
На одной из серий получилось 5 успешных прогнозов подряд. Например:
— Зауралье — Югра: ТМ 5.0 → 0:2 — Шанхай — Металлург: ТБ 4.5 → 4:1 — Колорадо — Лос-Анджелес: ТБ 5.5 → 4:2 после второго периода
По трём результатам, которые удалось подробно зафиксировать, получилось 3/3, средний коэффициент около 1.48.
Но гораздо интереснее оказался следующий результат.
Северсталь — Адмирал закончился 3:3, и выбранный ТМ 5.5 не прошёл.
И вот здесь для меня эксперимент становится действительно полезным.
Удачный прогноз можно принять как приятный результат, но гораздо больше информации даёт ситуация, когда модель ошиблась. Можно вернуться к исходным данным, посмотреть, что именно учитывалось, где прогноз оказался слишком уверенным и что можно изменить в самом подходе.
Поэтому постепенно строю вокруг этого небольшой процесс: датасет → промт → анализ → результат → сравнение с фактом → разбор ошибки → корректировка.
В какой-то момент поймал себя на мысли, что занимаюсь практически тем же, чем привык заниматься в QA — только вместо приложения передо мной модель, а вместо бага может оказаться неправильный вывод.
И это, пожалуй, самая интересная часть эксперимента.
Мне интересно не просто получить ответ от агента, а понять, почему он его получил и насколько этому результату вообще можно доверять.
Пока это личный эксперимент со спортивными данными, но сам подход легко переносится на рабочие задачи: тестовые данные, анализ логов, поиск аномалий, генерация сценариев и автоматизацию рутины.
Похоже, для QA сейчас становится важным не просто уметь пользоваться ИИ, а уметь нормально поставить ему задачу, дать нужные данные и потом проверить, что он действительно сделал всё правильно.