Почему ИИ сначала молчит, а потом отвечает рывком

У языковой модели есть две разные фазы работы. Сначала — prefill: она принимает весь промпт и вычисляет связи между его токенами. Эти вычисления можно во многом выполнять параллельно, но длинный контекст всё равно увеличивает ожидание до первого слова.

Затем начинается декодирование. Ответ рождается по одному токену: следующий нельзя выбрать, пока не появился предыдущий. Поэтому длинный запрос чаще влияет на паузу перед ответом, а длинный ответ — на время печати.

И да: потоковый вывод не показывает заранее готовый текст. Вы буквально наблюдаете его последовательную генерацию.

#языковыемодели #токены #какэтоработает

Почему ИИ сначала молчит, а потом отвечает рывком
У языковой модели есть две разные фазы работы. Сначала — prefill: она принимает весь промпт и вычисляет связи между его токенами | Сетка — социальная сеть от hh.ru