🔥 AI МОЖЕТ ЧИНИТЬ БАГИ, НО НЕ ПОНИМАЕТ, ПОЧЕМУ ОНИ ВОЗНИКАЮТ. ЧЕЛОВЕКИ ПОКА ВЫИГРЫВАЮТ! OpenAI выпустили исследование про то, как LLM справляются с задачами фриланс-разработчиков. Главное👇
Был создан бенчмарк SWE-Lancer с 1,488 задачами с Upwork на $1 млн. Задачи делились на: ▫️ Индивидуальные — пофиксить баги, добавить фичи. ▫️ Менеджерские — выбрать лучший способ решения.
Тестировали GPT-4o, o1 и Claude-3.5 Sonnet. Лучший результат оказался у Claude-3.5 Sonnet: $208K заработка (26.2% реализованных задач). Но и тут модель чаще косячила, чем делала, как надо.
Модели быстро находили ошибки, но не понимали их причины. А вот в роли «тимлида», который выбирает решения, модели справились лучше. Видимо, выбирать хорошие решения легче, чем самому их писать 😏
Итого: ИИ очень плохо умеет искать причины проблем, а ещё тратит кучу времени на исправление своих же ошибок. Но OpenAI намекает: «скоро может быть иначе».
В целом я тут полностью согласен, т.к. мой опыт примерно такой же. Сначала «вау», а потом можно потратить часы, чтобы исправить какой-то конкретный нюанс.