Как две модели отвечают быстрее одной ⚡
В некоторых системах генерацию ускоряет speculative decoding — «черновое декодирование». Небольшая модель быстро предлагает сразу несколько следующих токенов. Затем основная, более мощная, проверяет всю пачку за один проход. Подходящие токены принимаются, а в месте первой ошибки большая модель вносит исправление.
Это не голосование и не «смешивание умов»: маленькая модель лишь готовит черновик, окончательное решение остаётся за основной. Выигрыш появляется, когда догадки часто проходят проверку. Иногда скорость — результат не спешки, а удачно устроенного контроля.