Как я играю в квизы с GPT и почему он иногда “галлюцинирует”
Ещё в детстве мне нравилось разгадывать разные задачки. Когда только появился интернет, я зависал в локальных чатах — тогда был какой-то mIRC или что-то похожее. И там были каналы с викторинами – появлялся вопрос, показывалось количество букв в загаданном слове — и нужно было первым написать правильный ответ. Порой мне было интереснее чем в другие игры играть.
Наверное, это одно из проявлений моего исследовательского ума — я люблю решать задачи и находить ответы.
К чему я это. Сейчас разные сервисы, особенно банковские приложения всячески пытаются увеличить вовлечение пользователей и внедряют разные механики геймификации, а порой даже напрямую игры (Монополии, три в ряд и другие). У меня есть счёт в Т-банке, и там недавно появилась новая игра — Квизы, где как раз нужно отвечать на вопросы, как в “Кто хочет стать миллионером”.
Учитывая контекст, которым я поделился в начале поста, я, естественно, не удержался и начал в неё играть. Мне нравится проверять себя, узнавать новые факты таким способом (причем, кстати, запоминаем мы лучше то, где ошибаемся). А также развивать профессиональную насмотренность – изучать новые механики геймификации для увеличения активности пользователей и выработки привычек.
В какой-то момент я решил – а что если подключить chatGPT и отвечать вместе? 🤔
Все бы ничего, но почему я решил написать пост. Вы возможно уже слышали и сталкивались с тем, что разные языковые модели дают странные ответы, это еще называют – “галлюцинируют”. И вот что оказалось любопытным. В формате квиза, где есть конкретный вопрос и список вариантов ответа, GPT довольно часто ошибается. Причём не потому, что он не знает, а потому что начинает придумывать – “галлюцинирует”. Я бы сказал, что примерно в 1 из 10 случаев (может меньше) он даёт неправильный ответ.
Самое интересное — когда потом уточняешь у него: “А почему ответ такой? Ведь правильный другой”, он спокойно соглашается: “Ой, да, извините, вот правильный ответ, потому что…” и раскладывает по полочкам. (Смотрите пример на скриншоте).
Как бы я его ни просил быть внимательным, проверять себя и актуализировать знания — через несколько вопросов история повторяется. (Про это я рассказывал в подкасте).
Что еще я подметил, что может быть полезно – если задавать вопрос с вариантами ответа, то, как мне показалось, GPT лучше справляется. То есть с задачей выбора он справляется лучше, чем с задачей дать ответ на вопрос, где он начинает просто придумывать, и тут вероятность ошибки резко возрастает.
💬 Интересно, а где вы чаще всего замечаете, что GPT или другие языковые модели начинают “галлюцинировать”?