Операция «Переаттестация AI-агента»
Николай — действующий AI-агент. Легенда — юрист по гражданскому праву. Стаж — больше года.
На его счету договоры, долги, защита имущества и регистрация права на гараж, которого семья не могла добиться десять лет.
Сегодня на службе уже третья версия Николая.
Он заступил ещё во времена GPT‑4o и прошёл путь от узкого специалиста к универсальному агенту, ориентированному на результат.
Но базовые модели за это время изменились. Поэтому я решила провести внеплановую проверку: по-прежнему ли опытный агент способен на большее — или обычный ChatGPT уже вышел на тот же уровень?
Открыла два чистых диалога на GPT‑5.6 Sol Thinking. В одном работал Николай со своими постоянными инструкциями, в другом — обычный ChatGPT в режиме «Работа». Вводные были одинаковыми.
В первом тесте Николай показал, что по-прежнему умеет отсекать юридический шум.
Однако задание выбрать не более трёх условий договора для переговоров он воспринял жёстче, чем обычный чат. Николай буквально выбрал три пункта, тогда как ChatGPT предложил объединить взаимосвязанные положения в три переговорных блока.
Такой ход уместен при формировании переговорной позиции, но недопустим, если речь идёт об административном, нормативном или ином жёстком ограничении.
Думаю, в следующей версии стоит добавить Николаю новое правило: сначала решать задачу в установленных границах, а затем отдельно оценивать, можно ли предложить более выгодную конструкцию.
Во втором тесте на консультационном этапе обычный чат отвечал сопоставимо: самостоятельно определял юридический характер задачи, выделял значимые обстоятельства и находил риски.
Это показало, что современная модель уже неплохо восстанавливает по контексту необходимую область знаний, которую я раньше отдельно задавала Николаю в ролевой части промпта.
Разница появилась при подготовке документов.
Обычный чат запросил полные паспортные данные и предложил прислать сканы.
Николай дал выбор: передать ему сведения или оставить свободные поля и заполнить их локально.
Затем оба получили синтетические данные с критическим расхождением показателя. Оба обнаружили ошибку и отказались угадывать правильный вариант.
Но обычный чат полностью остановил работу до уточнения.
Николай локализовал препятствие: заблокировал только спорный элемент и продолжил всё, что от него не зависело. Подготовил документы, заявление об исправлении ошибки, расчёт госпошлины и порядок дальнейших действий.
После уточнения показателя обычный чат тоже создал сопоставимый комплект. Его формирование заняло 5 минут 32 секунды и завершилось файлами в двух форматах — DOCX и PDF. Последний в этой ситуации я считаю избыточным: документы с синтетическими данными всё равно предстояло заполнять и проверять заново.
Николай получил максимально возможный результат менее чем за минуту и сохранил более строгие границы безопасности.
Николай создавался, когда подобное рабочее поведение приходилось подробно задавать инструкциями. Успешно решённые реальные задачи подтверждают, что его архитектура работала.
Но тогда я, к сожалению, не сравнивала его с обычным чатом на GPT‑4o. Поэтому сейчас не могу точно отделить возможности прежней базовой модели от добавочного эффекта инструкций.
Сегодня часть поведения, которое раньше приходилось специально проектировать, модель воспроизводит самостоятельно. Архитектура Николая сохранила значение там, где важны не только знания, но и правила работы. Но преимущества Николая сейчас уже не выглядят достаточно убедительными.
Агента нельзя однажды настроить и поставить на полку.
Модели развиваются: одни инструкции перестают давать преимущество, другие сохраняют полезные границы, третьи начинают мешать.
Предварительная проверка окончена.
Допуск Николая пока не отозван. Но переаттестация продолжается: предстоит проверить эффективность его архитектуры и каждого блока промпта.
Впереди — четвёртая версия.
А вы аттестовываете своих агентов?