Новый бенчмарк DeepSWE.

Конечно, хочется иметь линейку, чтобы можно было померить, какой AI-инструмент лучше. Вот ребята представили DeepSWE, как утверждают, новый бенчмарк для тестирования агентного программирования.

Вообще они хотят показать, в чем они модели, и хотят отражать «реальный опыт» разработчиков в повседневной работе. Посмотрим, что из этого выйдет.

Новый бенчмарк DeepSWE.
Конечно, хочется иметь линейку, чтобы можно было померить, какой AI-инструмент лучше | Сетка — социальная сеть от hh.ru