Почему ИИ сначала молчит, а потом отвечает рывком
У языковой модели есть две разные фазы работы. Сначала — prefill: она принимает весь промпт и вычисляет связи между его токенами. Эти вычисления можно во многом выполнять параллельно, но длинный контекст всё равно увеличивает ожидание до первого слова.
Затем начинается декодирование. Ответ рождается по одному токену: следующий нельзя выбрать, пока не появился предыдущий. Поэтому длинный запрос чаще влияет на паузу перед ответом, а длинный ответ — на время печати.
И да: потоковый вывод не показывает заранее готовый текст. Вы буквально наблюдаете его последовательную генерацию.
· 1 ч
Думает....
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён