Трансформеры не только для кино — разбираем архитектуру LLM
В репозитории poloclub/transformer-explainer крутая интерактивная визуализация работы трансформеров — тех самых, что стоят за ChatGPT и другими LLM. Можно буквально потыкать в self-attention и feed-forward слои, чтобы понять магию под капотом.
Проще один раз увидеть, чем сто раз прочитать про query/key/value