Правда в том, что мы находимся всего в одном исследовательском шаге от того, чтобы привычная архитектура Transformer (на которой работают ChatGPT, Claude, Gemini и другие) устарела - и триллион долларов, вложенных в дата-центры, оказался потрачен впустую.

31 октября 2025 года была опубликована научная работа под названием «Непрерывные авторегрессионные языковые модели» (Continuous Autoregressive Language Models, CALM). В ней говорится, что:

Главная проблема современных больших языковых моделей (LLM) - это то, что они генерируют текст по одному токену (слову или символу) за раз. Чтобы сделать ИИ в десятки раз быстрее и эффективнее, нужно научить его создавать смысл целыми блоками, а не по кусочкам.

Исследование сделали Tencent и Цинхуа университет (Tsinghua University) в Китае. Они представили архитектуру CALM, которая может полностью изменить способ мышления всех современных языковых моделей.

💡 Что делает CALM: • Вместо того чтобы предсказывать следующее слово, она предсказывает следующую мысль - сразу целый смысловой фрагмент. • Для этого используется особая система сжатия (вариационный автоэнкодер), которая упаковывает несколько слов (например, 4) в один «вектор мысли». • Затем ИИ восстанавливает эти слова обратно с точностью более 99,9%. • Вся генерация происходит не пошагово, а почти мгновенно, в один «мысленный шаг».

⚙️ Что это значит на практике: • CALM делает генерацию текста в несколько раз быстрее. • Для обучения и работы ей нужно на 30–40% меньше вычислительной мощности. • При этом качество остаётся таким же или даже лучше.

📊 Пример сравнения: • Модель CALM с 371 млн параметров работает на уровне обычной модели с 281 млн, но требует на 44% меньше ресурсов для обучения и на 34% меньше - для генерации.

#llm #ai

Правда в том, что мы находимся всего в одном исследовательском шаге от того, чтобы привычная архитектура Transformer (на которой работают ChatGPT, Claude, Gemini и другие) устарела - и триллион доллар... | Сетка — социальная сеть от hh.ru