Про кодинг-агенты

Захотелось немного структурировать мысли и зафиксировать опыт.

Буквально до этого месяца я по работе и для личных проектов использовал в основном Cursor как IDE с платным планом, гоняя Auto режим, где он сам подбирает "самую подходящую" модель. Меня полностью устраивал результат: и обсуждения задач, и попутное создание документации и, собственно, сами задачи по программированию решались просто, без бесконечных циклов "ДА КАКОГО ХРЕНА ТЫ ТВОРИШЬ!!!111".

Но лимиты (даже несмотря на то, что поверх включённых в тариф $20 они мне выдавали до ~$60 бесплатными) кончались с какой-то космической скоростью. Буквально 3-4 плотные сессии по несколько часов и привет, жди следующего месяца или плати. В какой-то момент, когда начались активные "вайбкод" проекты по работе + начал плотно дорабатывать свои инструменты, этого категорически перестало хватаь и я начал искать альтернативы.

Я попробовал примерно всё, что было на рынке: как IDE вроде Windsurf или Kiro, так и экстеншены вроде Copilot или Kilo Code. На мой скромный взгляд и по итогам не очень экстенсивных тестов Cursor всё ещё остался фаворитом. Моя догадка — дело в архитектуре. Для понимания масштабов трагедии: Antigravity — казалось бы, родная IDE от гугла, с их же родной моделью Gemini 3 Flash всухую проиграла Cursor с той же моделью. В Antigravity мне пришлось добивать несколько раз промт, уточняя что нужно сделать и корректируя "нет нихрена я это не просил, вот тут и тут ошибки и не так". В курсоре же всё сделалось с первого промта как нужно — ту же задачу.

В очередной раз, когда лимиты в курсоре кончились, а колупаться с другими IDE/агентами совершенно не хотелось, решил всё-таки попробовать более "традиционные" агенты вроде Codex, Claude Code и Gemini CLI.

Во-первых, про Claude Code. Какой вокруг него стоит хайп и как все его хвалят — я ожидал чего-то волшебного. Но не получил. При использовании тогда ещё Sonnet 4.5 результаты были hit or miss — и стабильно хуже опыта в курсоре. С появлением Opus 4.6 сиутация изменилась: результаты правда радовали. Однако, то как он жрёт лимиты — это просто жесть. Буквально за полчаса с опусом можно на изи сожрать недельный лимит. И это, кстати, относится в целом к клоду — лимиты уходят очень быстро. До сих пор загадка, как некоторые наши отделы юзают шареные аккаунты. Я один-то вырабатываю лимиты и постоянно приходится переключаться на другие нейронки.

И вот тут меня оч приятно удивил Codex 5.3 — последняя модель от OpenAI. Несмотря на то, что по всяким там бенчмаркам (которых пока вроде не очень много) он не такой понтовый как Opus 4.6 или Gemini 3, меня он внезапно очень приятно удивил. Я его усиленно гоняю на этой неделе и пока нареканий нет. Буквально один раз он скатился куда-то не туда в длинном треде, но это в целом антипаттерн — давать кучу задач в рамках одного треда, поэтому тут скорее мой косяк. При этом лимиты ощущаются очень щедрыми — я его несколько дней уже по несколько часов гонял, и у меня всё ещё 70% недельного лимита! А "пятичасовой" лимит я ни разу не выжрал, в отличие от того же Клода, где это постоянно случается.

А вот Gemini CLI, кстати, говно собачье. Вот прям вообще отвратительный экспириенс получил. Этот кусок кода слишком узко понимает задачи, нихрена не думает и выполняет буквально минимум (условно — обновляет функцию на бэке, но не подтягивает фронт под это изменение, чтоб ничо не падало), при этом у меня он чуть ли не каждый раз залезал в те части, в которые вообще не просили и удалял лишнее. Вот тут прям жирнющий минус.