Claude: тупой и еще тупеет
У меня давно были подозрения, что качество начало проседать. Но тут всплыла история, которая смогла подтвердить это на реальных цифрах. Senior AI Director из AMD проанализировала 6 852 сессии Claude Code за январь-март и выложила issue на GitHub с говорящим названием:"Claude Code is unusable for complex engineering tasks with the Feb updates" (Claude Code стал непригоден для сложных инженерных задач после февральских обновлений)
Главные факты оттуда: 1. Медианная длина reasoning упала с ~2200 до ~600 символов. Модель буквально стала меньше думать. 2. Read-per-edit (сколько файлов модель читает перед правкой) упал с 6.6 до 2.0. Claude правит код, не читая контекст. 3. 173 случая за 17 дней, когда модель «сдавалась» или спрашивала разрешения продолжить. До 8 марта - ноль. 4. При решении тех же задач от человека модель стала генерировать в разы больше внутренних запросов - ошибается, ретраит, ходит по кругу.
Anthropic это подаёт как «оптимизацию для среднего пользователя». На деле произошло два изменения: adaptive thinking (модель сама решает, сколько думать - иногда решает не думать вообще) и тихое понижение дефолтного effort с high до medium. Оба снижают нагрузку на GPU. Как именно модель решает сколько ей думать - загадка, но теперь качество зависит даже от времени суток. Всё это говорит само за себя - вычисления сжигают кучу денег, а мощностей на всех пользователей явно не хватает.