Нейросети теперь сами для себя придумывают экзамены 🧑💻
Все привыкли к бенчмаркам вроде HumanEval, которые давно заезжены и на которых все модели уже натренировались. Как понять, какая LLM реально программирует лучше? И вот Tencent выкатили в опенсорс AutoCodeBenchmark.
Это целый конвейер, который использует LLM, чтобы создавать новые, уникальные задачи по программированию на 20 языках.
Как это работает? 1. Берется простейший кусок кода (типа a+b). 2. LLM получает задание "эволюционировать" его во что-то сложное и написать тесты. 3. Самое главное: сгенерированный код тут же отправляется в безопасную "песочницу" (MultiLanguageSandbox), где он компилируется и выполняется. Если код — нерабочая дичь, он отбраковывается. 4. Только после успешной проверки код превращается в полноценную задачу бенчмарка.
Такой подход "генерация-проверка" гарантирует, что задачи в бенчмарке корректны и решаемы. Это позволяет бесконечно генерировать новые тестовые наборы, которые модели еще не видели. По сути, это новый, куда более честный и масштабируемый способ измерять реальные возможности кодовых LLM.
Описание архитектуры смотрим тут: ▶️Разбираем AutoCodeBenchmark от Tencent: нейросеть, которая сама придумывает и проверяет задачи по программированию◀️
Интересно, как скоро модели научатся генерировать бенчмарки, на которых они сами будут выглядеть лучше конкурентов? 😊