Три языка, несколько моделей и один сброс лимита: как я проверял локализацию с ИИ.
Нужно было проверить веб-приложение на русском, английском и французском. Не только качество переводов, но и поведение интерфейса при смене языка, повторном открытии экранов и перезагрузке.
Для работы выбрал Codex. Спросил у ChatGPT, какие модели использовать. Он предложил несколько проходов: Первый - GPT-5.6 Terra Medium; Второй - GPT-6 Astra Low; Третий - GPT-6 Astra Medium.
Решил попробовать этот план.
Первый проход нашёл ошибки в переводах и строки, которые оставались на предыдущем языке после переключения.
Второму передал результаты первого, конкретные области для перепроверки и спорные наблюдения. Задача была уточнить найденное и расширить покрытие.
Во время этого прохода закончился доступный лимит. Использовал оставшийся сброс, чтобы завершить работу. Третий запускать уже не стал.
При этом второй проход принёс пользу: появились новые находки, а у предыдущих стали понятнее условия воспроизведения.
Например, удалось разделить ситуации, когда перевода действительно нет, и когда он есть, но открытый экран не обновляется. Нашлись и случаи, когда после переключения языка исчезали отдельные элементы интерфейса.
Каждый найденный Codex дефект я затем перепроверял сам. В итоговый список вошли подтверждённые находки.
Считать это сравнением моделей было бы неправильно: второй проход получил предыдущие результаты и охватил дополнительные области и состояния.
Второй проход оказался полезным, но потребовал больше доступного лимита, чем я ожидал. Поэтому рекомендованный план из трёх проходов полностью выполнять не стал.
Для следующей подобной задачи остаётся вопрос: насколько оправдана проверка с постепенным подключением более мощных моделей и когда дополнительный проход стоит потраченного лимита?
Если используете ИИ в тестировании, пробовали проверять приложение в несколько проходов — начиная с более лёгкой модели и затем подключая более мощную? Дала ли такая схема заметную пользу по сравнению с одним проходом?