📑 ВЫШЛА БИБЛИЯ CODE AI НА 300 СТРАНИЦ

Группа исследователей из Alibaba, ByteDance, Huawei и топовых университетов выкатила монументальный труд: "From Code Foundation Models to Agents and Applications".

Это огромный обзор всего, что произошло с Code LLM с 2021 по 2025 год.

Вот самая мякотка:

1️⃣ Python — самый «жадный» язык 🐍 Исследователи вывели законы масштабирования (Scaling Laws) для разных языков. Оказалось, что Python требует больше всего параметров и данных, чтобы модель начала выдавать годный код. Почему? Из-за динамической типизации и огромного разнообразия идиом. А вот строгие C#, Java и Rust модели "выучивают" гораздо быстрее — там синтаксис не дает разгуляться, энтропия ниже.

2️⃣ Секрет успеха — RLVR Простого SFT (Supervised Fine-Tuning) уже недостаточно. Чтобы модель реально думала, а не просто подражала паттернам, нужен Reinforcement Learning with Verifiable Rewards. Грубо говоря: модель генерит код -> прогоняет юнит-тесты -> получает награду, если тесты прошли. Именно так тренируются SOTA-модели.

3️⃣ Эволюция: от Copilot к Агентам Мы официально перешли из эры "AI-Assisted" (допиши строчку) в эру "AI-Driven" (вот тебе тикет, иди фикси баг). Бенчмарки типа SWE-bench показывают, что будущее не за моделями, которые просто пишут код, а за агентами, которые умеют: — Читать документацию. — Запускать код. — Дебажить по трейсбекам (как люди). — Лазить по всему репозиторию.

4️⃣ Insecure by Design Авторы честно признают: Code LLM небезопасны по умолчанию. Они обучаются на публичном коде (GitHub), который кишит уязвимостями. Модель идет по пути наименьшего сопротивления: генерит рабочий, но дырявый код. Без специальных этапов "Safety Alignment" и использования статических анализаторов в цикле обучения, вы просто масштабируете легаси-баги.

👉 Ссылка на PDF (arXiv)