Нейросети теперь сами для себя придумывают экзамены 🧑‍💻

Все привыкли к бенчмаркам вроде HumanEval, которые давно заезжены и на которых все модели уже натренировались. Как понять, какая LLM реально программирует лучше? И вот Tencent выкатили в опенсорс AutoCodeBenchmark.

Это целый конвейер, который использует LLM, чтобы создавать новые, уникальные задачи по программированию на 20 языках.

Как это работает? 1. Берется простейший кусок кода (типа a+b). 2. LLM получает задание "эволюционировать" его во что-то сложное и написать тесты. 3. Самое главное: сгенерированный код тут же отправляется в безопасную "песочницу" (MultiLanguageSandbox), где он компилируется и выполняется. Если код — нерабочая дичь, он отбраковывается. 4. Только после успешной проверки код превращается в полноценную задачу бенчмарка.

Такой подход "генерация-проверка" гарантирует, что задачи в бенчмарке корректны и решаемы. Это позволяет бесконечно генерировать новые тестовые наборы, которые модели еще не видели. По сути, это новый, куда более честный и масштабируемый способ измерять реальные возможности кодовых LLM.

Описание архитектуры смотрим тут: ▶️Разбираем AutoCodeBenchmark от Tencent: нейросеть, которая сама придумывает и проверяет задачи по программированию◀️

Интересно, как скоро модели научатся генерировать бенчмарки, на которых они сами будут выглядеть лучше конкурентов? 😊

#щупаем_сорцы

Нейросети теперь сами для себя придумывают экзамены 🧑‍💻
Все привыкли к бенчмаркам вроде HumanEval, которые давно заезжены и на которых все модели уже натренировались | Сетка — социальная сеть от hh.ru