⚡️ Anthropic вскрыли 100,000 диалогов в Claude: что там с нашей продуктивностью?
Ребята из Anthropic выпустили ресерч, где попытались оценить реальное влияние ИИ на экономику, проанализировав (анонимно, конечно же) сотню тысяч реальных сессий пользователей.
Методология там — моё почтение. Они взяли 100,000 реальных диалогов и... попросили Claude оценить, сколько времени эти задачи заняли бы у человека без ИИ, и сравнили с тем, сколько это заняло с ИИ. 😏 Fox guarding the henhouse во всей красе. Конечно, они попытались валидировать это на JIRA-тикетах и утверждают, что оценки модели коррелируют с оценками живых сеньоров (ага, которые тоже ошибаются в сроках в 2-3 раза, но это детали).
Но важные инсайты все равно есть:
1️⃣Разработчики — главные бенефициары (или жертвы) По данным отчета, именно Software Developers вносят самый большой вклад (19%) в общий рост производительности от ИИ. Для сравнения: менеджеры — 6%, маркетологи — 5%. Наша рутина автоматизируется быстрее и жестче всего.
2️⃣ Парадокс JIRA и оценки сроков Чтобы валидировать свои метрики, они сравнивали оценки Claude с реальными тикетами из JIRA (open-source репозитории). ИИ оценивает время выполнения задачи почти так же паршиво, как и живые разработчики. Корреляция с реальностью у людей 0.50, у Claude — 0.44. То есть, мы научили нейронки не только писать код, но и так же профессионально ошибаться в эстимейтах. Achievement unlocked. 3️⃣ Эффект компрессии Модель страдает классической "болезнью джуна": — Длинные и сложные задачи она сильно недооценивает (думает, что сделает рефакторинг легаси-монолита за пару часов). — Короткие задачи переоценивает (думает, что поправить конфиг — это на полдня).
4️⃣ Самое главное "НО" В исследовании честно признают лимит: они считают время генерации решения vs время написания руками. Они НЕ учитывают время, которое вы потратите на: — Валидацию того, что выдала сетка. — Интеграцию куска кода в проект. — Отладку багов, которые модель внесла.
По сути, метрика "time savings" тут немного лукавая. Если Claude написал скрипт за 2 минуты вместо ваших 30, но вы потом 40 минут искали, почему он падает на граничных случаях — ваша продуктивность отрицательная.
5️⃣ Смена узких мест Очень здравая мысль из отчета: если ИИ ускоряет написание кода, то узким местом становится не "как написать", а "что писать" и "как это проверить". То есть ценность навыка скоростного набора кода стремится к нулю. Ценность навыка системного дизайна, постановки задачи и code review — возрастает.
И да, готовимся к тому, что менеджеры, начитавшись таких отчетов, начнут резать сроки вдвое. Ведь "Claude же сказал, что это на 15 минут". 🌚