Агент отвечает в чате. А команды уже не работают
AI-агент может бодро обсуждать задачу, пока его среда выполнения уже сломана. По переписке этого можно и не заметить.
10 сентября Anthropic сообщил о сбое Claude Cowork на Windows: после обновления ОС от 8 сентября рабочая среда потеряла доступ к диску для запуска локальных команд. При этом у большинства пользователей чат, чтение и редактирование файлов продолжали работать. По сообщению компании, перезапуск и переустановка не помогают; Microsoft подготовила исправление и работает над его выпуском.
Меня здесь зацепил именно частичный отказ. Обычная проверка «агент отвечает» могла бы пройти. Даже изменённый файл ещё не доказывает, что агент способен выполнить задачу до конца.
Для .NET-команды представим простой сценарий: агент поправил обработчик и тесты, но запустить dotnet test уже не может. Diff готов, проверка не состоялась. Если в отчёте останется только «задача выполнена», человек на review получит лишнюю уверенность вместо результата.
Я бы проверял такую среду коротким smoke-тестом перед работой: создать временный файл в рабочем каталоге, прочитать его через локальную команду, запустить безопасную проверку с ожидаемым кодом выхода. Важно пройти тот же путь выполнения, который понадобится задаче, а не просто проверить доступность модели.
В итоговом отчёте стоит отдельно показывать, что агент изменил и что действительно исполнил. Не запустил тесты - пусть это будет видимый незавершённый шаг, а не примечание после «готово».
Такой smoke-тест не гарантирует, что среда не сломается позже. Он хотя бы позволяет обнаружить отказ до того, как агент начнёт менять проект. Дальше нужны результаты конкретных команд и независимый CI. Отключать защиту ОС ради возвращения агента в строй я бы точно не стал.
У вас готовность агента проверяется реальным запуском команды или пока только ответом в чате?