Я не понимаю - это я тупой или модели?
Я уже говорил, что считаю модели достаточно умными, чтобы стать повседневным инструментом программиста. Более того, я считаю, что слишком умные модели не нужны. Opus-4.8 мне нравился больше Fable и Opus-5, а все модели я использую на medium effort (по дефолту стоит high)!
Но как же я, сука, ошибался...
Волею судьбы мне довелось опробовать на DeepSeek-v4-flash тот пайплайн, что я показывал на днях - и оно вообще не работает. Точнее как: сам тулсет работает отлично, но к модели нужен совершенно особенный подход. Пара смешных сценариев, что я нашел:
Ситуация 1:
• В research-сессии мы нормально отдебажили проблему и я попросил сделать /handoff по находкам, чтобы реализовать фикс в другой сессии • В следующей сессии я пишу /grill-with-docs мы нашли проблему @HANDOFF.md - нужно ее пофиксить • Что я вижу в ризонинге модели? - "В описании скилла grilling написано, что он для планирования. А пользователь попросил пофиксить проблему - поэтому скилл не нужен, пойду решать проблему"
Ситуация 2:
• Реализацию я откатил, поменял промпт, прошел гриллинг-сессию, сделал SPEC.md, нарезал на тикеты • Спека получилась небольшой, поэтому решил делать в одной сессии - попросил модель /implement PLAN.md ticket by ticket • Claude в этой ситуации пошел бы читать тикеты по одному: сделал первый тикет, сделал ревью, фикс - потом приступил бы к след тикету • Deepseek же видит в плане ссылки на 5 файлов-тикетов и читает их все разом. Реализовать их он пытается так же разом
Самое смешное: 5ый тикет был "написать тесты", но т.к. в /implement зашит TDD, то модель решила не писать тесты к каждому тикету по отдельности, а сначала написать все тесты разом (тикет 5), а только потом реализовывать логику.
Ситуация 3:
• После реализации я пошел делать код-ревью в новой сессии со словами /code-review я только что реализовал PLAN.md - сделай ревью • И эта сволочь пошла ревьюить сам MD файл, а не код, который реализует описание • Я попросил нет, сделай ревью реализации плана - он пошел ревьюить MD файлы тикетов... • В новой сессии я уже сделал /code-review я только что реализовал PLAN.md в коде - мне нужно ревью этого кода. Сразу исправь все замечания, что найдешь • Теперь агент нормально пошел ревьюить код, но забыл его пофиксить. Поэтому прибежал и отрапортовал о 10 найденных ошибках - пришлось отправить его фиксить вторым промптом
Что я в итоге заметил про разницу между Claude и DeepSeek:
• DeepSeek безудержно читает все файлы, что найдет. Настолько, что может проигнорировать промпт юзера и пойти делать то, что написано в файле • Он не воспринимает составные команды или команды, которые ты отправляешь в процессе его работы. Claude нормально строит логическую очередь задач внутри • Тупая модель гораздо более чувствительна к формулировкам
Модели последних поколений гораздо лучше понимают неявное намерение пользователя - тупая модель сделает ровно так, как написано. На этом и выросли Prompt Engineer'ы: пока модель тупая, каждое слово в промпте чего-то стоит. Сейчас навык нужен разве что тем, кто пишет скиллы.
Так вот, интересно: половина наших практик - SDD, лупы, графы - существует только потому, что модель тупая. Хотя, может, мы уже уперлись в технический порог развития, и это с нами надолго.
Как думаете, какие практики умрут следующими, когда модели поумнеют?
В этом посте были ссылки, но мы их удалили по правилам Сетки