📑 ВЫШЛА БИБЛИЯ CODE AI НА 300 СТРАНИЦ
Группа исследователей из Alibaba, ByteDance, Huawei и топовых университетов выкатила монументальный труд: "From Code Foundation Models to Agents and Applications".
Это огромный обзор всего, что произошло с Code LLM с 2021 по 2025 год.
Вот самая мякотка:
1️⃣ Python — самый «жадный» язык 🐍 Исследователи вывели законы масштабирования (Scaling Laws) для разных языков. Оказалось, что Python требует больше всего параметров и данных, чтобы модель начала выдавать годный код. Почему? Из-за динамической типизации и огромного разнообразия идиом. А вот строгие C#, Java и Rust модели "выучивают" гораздо быстрее — там синтаксис не дает разгуляться, энтропия ниже.
2️⃣ Секрет успеха — RLVR Простого SFT (Supervised Fine-Tuning) уже недостаточно. Чтобы модель реально думала, а не просто подражала паттернам, нужен Reinforcement Learning with Verifiable Rewards. Грубо говоря: модель генерит код -> прогоняет юнит-тесты -> получает награду, если тесты прошли. Именно так тренируются SOTA-модели.
3️⃣ Эволюция: от Copilot к Агентам Мы официально перешли из эры "AI-Assisted" (допиши строчку) в эру "AI-Driven" (вот тебе тикет, иди фикси баг). Бенчмарки типа SWE-bench показывают, что будущее не за моделями, которые просто пишут код, а за агентами, которые умеют: — Читать документацию. — Запускать код. — Дебажить по трейсбекам (как люди). — Лазить по всему репозиторию.
4️⃣ Insecure by Design Авторы честно признают: Code LLM небезопасны по умолчанию. Они обучаются на публичном коде (GitHub), который кишит уязвимостями. Модель идет по пути наименьшего сопротивления: генерит рабочий, но дырявый код. Без специальных этапов "Safety Alignment" и использования статических анализаторов в цикле обучения, вы просто масштабируете легаси-баги.
· 06.12.2025
Самое приятное - в опенсорсе полно отвратительного, неэффективного, упоротого кода. И теперь ваши решения будут такими же! Это ли не счастье, это ли не радость для настоящих профессионалов?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён