Внезапно...
Хотя большие языковые модели демонстрируют впечатляющие успехи в создании программного кода, пока остается неясным, насколько глубоко они понимают программирование. Для изучения их реальных возможностей мы разработали специальный инструмент — «кодовый треугольник». Этот подход позволяет комплексно оценить три важнейших аспекта: умение анализировать задания, способность писать работающий код и создавать тесты для проверки качества своего же решения. Наши исследования показывают, что, несмотря на наличие определенных закономерностей в работе моделей, они далеко отстают от профессиональных разработчиков по оригинальности подходов и устойчивости результатов. Ошибки LLM чаще всего обусловлены недостатком разносторонних примеров в учебных данных и ограниченными возможностями переноса знаний. Тем не менее, привлечение опыта людей в виде анализа заданий, готовых решений и множества вариантов тестирования, а также комбинирование различных моделей позволяют значительно повысить эффективность и надежность больших языковых моделей. Это открывает путь к дальнейшему развитию инструментов машинного программирования, способствующих обучению самих себя и улучшению их собственных алгоритмов.
https://arxiv.org/pdf/2507.06138
Не когда не было и вот опять ))