DeepCode: как ИИ превзошёл все нейросети и людей

Как это работает: сравнение с агентами и людьми.

Тестировалось всё это дело на PaperBench Code-Dev: 20 статей ICML, где нужно «с нуля» собрать репозиторий и скрипт воспроизведения. Судя по описанию авторов, DeepCode набирает 73.5 ± 2.8 метрики replication score — это сильно лучше любых прошлых LLM–агентов (около 43 было в лучших предыдущих работах), и лучше узко заточенного на такую тематику пайплайна PaperCoder (около 51 там).

Cравнение с коммерческими агентами для кода на подмножестве из пяти статей: DeepCode в среднем 0.854, при том что Cursor и Claude Code около 0.58, а Codex вообще около 0.40. Причём DeepCode использует ровно тот же модельный бэкенд, что и часть решений из сравнений, и значит прирост результата обусловлен именно архитектурой управления информацией, а не просто другой нейронкой.

А на маленьком подмножестве из трёх статей DeepCode в среднем даже (внезапно) превосходит группу экспертов уровня PhD (у экспертов — 72.4, а у DeepCode в среднем 75.9).