Почему зелёные тесты не доказывают правильность AI‑системы

AI‑агент написал код, тесты проходят, сборка зелёная. Кажется, задачу можно принимать. Но тесты подтверждают только то, что реализация соответствует заложенным проверкам. Они не отвечают на более неприятный вопрос: правильно ли мы вообще описали поведение системы? Если в требованиях не определено, что делать при повторном запросе, частичном сбое, устаревших данных или неожиданном порядке событий, агент может написать аккуратное и полностью протестированное решение для неверного сценария. Перед генерацией кода полезно зафиксировать проверяемый контракт: • какие входные данные допустимы; • что считается успешным результатом; • какие действия можно безопасно повторить; • что происходит при частичном выполнении; • как система сообщает об ошибке; • какие события и решения должны попасть в журнал; • когда требуется вмешательство человека. После этого тестировать нужно не только ожидаемый путь, но и границы: дубли, тайм-ауты, конкурирующие запросы, потерю связи и некорректные данные. AI действительно снижает стоимость написания кода. Но стоимость неверно сформулированной задачи от этого только растёт: ошибочную реализацию теперь можно получить быстрее и в большем объёме. Поэтому главный вопрос при проверке AI‑кода для меня звучит не «все ли тесты прошли?», а «какое поведение системы эти тесты на самом деле доказывают?» А в вашей практике чаще ломается реализация или первоначальное описание задачи?