Границы LLM: почему даже топ-модели не заменят разработчиков

Многие здесь пишут о повсеместном внедрении AI всюду и везде, что должно привести к буквально ТЕХНИЧЕСКОЙ РЕВОЛЮЦИИ XXI века, оставив без работы начинающих специалистов.

Всё чаще в индустрии специалисты разного уровня в результатах своей работы всецело опираются на результаты, полученные посредством языковых моделей.

Я задался вопросом об объективных границах применимости языковых моделей. И вот, что из этого вышло.

Из очевидного выделяются проблемы с

Ограничением объёма контекста и его рамки считывания.

Это фундаментальный барьер. Дефолтная модель опирается на минимальный набор валидных данных своего датасета, использованного для обучения, и на контекст своей интерпретации промпта. В какой-то момент это приводит к тотальному непониманию того, что от модели требуется. Предобучение на триллионах токенов даёт широкий, но "грязный" охват.

Галлюцинации.

Учитывая пункт выше и то, что LLM - вероятностная модель, а не оракул знаний a.k.a демон Лапласа, когда контекст и предобучение подводят, начинаются жесточайшие галлюцинации (например, формулировка теоремы о спектральном разложении биополя топира по инвариантам колорадского жука в терминах заголовков объектных файлов, описанная ниже, приводит большинство моделей свободного доступа к совершенно неадекватным ответам).

В лучшем случае, модель учтиво заметит, что не нашла информации об упомянаемой сущности. В худшем, - готовьтесь к инвариантам колорадского жука... 🤡

Неоднородность данных предобучения.

Датасеты, лежащие в основе современных LLM, такие как Common Crawl и BookCorpus, содержат гигантский объём текстов, но при этом страдают от хронического шума, bias’ов и системных пробелов

Содержание веб-страниц в современном Интернете - это смесь адекватных текстов, рекламы, кода, плагиата, битых ссылок, откровенного бреда и прочего крэпа. Исследования 2024 года выявили, что LLM по‑разному реагируют на "грязные" данные: часть шума модель игнорирует за счёт механизма внимания, но часть вместо фильтрации просто запоминает и воспроизводит. ​ Вот забавный тому пример в рамках обзора Vibe-code системного программирования от PVS-Studio: "Давайте заглянем в этот самый вайб-код".

Анализ C4 (Colossal Clean Crawl) и BookCorpus выявляет системные смещения: доминирование определённых групп, религий, культур и языков, а также отсутствие/притушенность многих других. Например, в BookCorpus доминируют художественные и "массовые" текста, а религиозные и научные представлены выборочно, что напрямую влияет на тематическую и лексическую асимметрию модели.

Большинство языковых моделей обучаются на коллекциях, серьёзно перекошенных в сторону английского языка и нескольких крупных языковых регионов. Редкие контекстно-зависимые темы если и всплывают, то с большими искажениями. Как результат, грязные данные = предобучение на веб‑мусоре: модель не "читала" всё, что есть в мире, а просто очень долго "долбилась в полторы страницы", оставив за бортом реально значимую информацию.

В заключение хочется добавить, что, будучи стохастическим алгоритмом, языковая модель способна оперировать синтаксическими категориями посредством вероятностных методов. Но, наш вид вообще в принципе дошёл до текущей точки ровно на том, что мы эти категории интерпретируем. Это фундаментальное различие и определяет необходимость в начинающих специалистах, как в ресурсе с куда большей перспективой, чем модная технология.

Очевидным образом, описано выше только то, что сразу бросается в глаза и приходит в голову. Помимо того, конечно, есть и серьёзные преимущества, и фатальные косяки. Надо понимать, что LLM - это мощный, но существенно ограниченный инструмент. Объём и качество контекста задают жёсткий верхний предел тому, насколько адекватным может быть ответ: даже топ‑модели не "читают весь интернет", а опираются на зашумлённый, неполный и неоднородный срез реальности с запозданием в несколько лет.

Границы LLM: почему даже топ-модели не заменят разработчиков | Сетка — социальная сеть от hh.ru Границы LLM: почему даже топ-модели не заменят разработчиков | Сетка — социальная сеть от hh.ru Границы LLM: почему даже топ-модели не заменят разработчиков | Сетка — социальная сеть от hh.ru Границы LLM: почему даже топ-модели не заменят разработчиков | Сетка — социальная сеть от hh.ru