Увидел одну цифру: 1000+ токенов в секунду. В 5 раз быстрее

Пошёл разбираться, как - и оказалось, дело в том, что модель вообще не пишет слева направо. Это Mercury 2 на диффузии. Обычные LLM (GPT, Claude, Gemini) генерят последовательно - пятое слово только после четвёртого. Чем длиннее ответ, тем дольше ждёшь. Диффузия идёт иначе: берёт сразу всё полотно ответа из «замазанных» заглушек и за несколько шагов проявляет его целиком, как фото в проявителе. Каждый шаг видит весь ответ сразу, в обе стороны. И вот что зацепило: три года индустрия выжимала скорость не там. Чипы, сжатие, серверные стеки - лишь бы выбить пару процентов из того же цикла «по одному токену». А узкое место было в самой генерации. В прод я бы пока не нёс - на общих бенчмарках авторегрессия ещё впереди, у неё годы оптимизаций за спиной. Но там, где задержка копится — агентные циклы, голос, реалтайм - это не +10%, это смена категории. Рискнули бы поставить диффузию в боевой пайплайн? Или подождёте, пока устаканится? #LLM #AI #Mercury2 #Разработка

Увидел одну цифру: 1000+ токенов в секунду. В 5 раз быстрее | Сетка — социальная сеть от hh.ru