Общаться с языковой моделью: как игра в 'Что? Где? Когда?', только она — все знатоки сразу

LLM — это тип модели искусственного интеллекта, которая отлично справляется с пониманием и генерированием человеческого языка. Она обучается на огромных объёмах текстовых данных, что позволяет ей изучать закономерности, структуру и даже нюансы языка. Эти модели обычно состоят из многих миллионов параметров.

Большинство современных LLM построены на основе архитектуры Transformer — архитектуры глубокого обучения, основанной на алгоритме «Внимание», которая вызвала значительный интерес после выпуска BERT от Google в 2018 году. Существует 3 типа трансформаторов :

Кодеры Трансформатор на основе кодировщика принимает на вход текст (или другие данные) и выводит плотное представление (или встраивание) этого текста.

Пример: БЕРТ из Google Примеры использования: Классификация текста, семантический поиск, Распознавание именованных объектов. Типичный размер: Миллионы параметров Декодеры Трансформатор на основе декодера фокусируется на создании новых токенов для завершения последовательности, по одному токену за раз.

Пример: Лама из Meta Примеры использования: Генерация текста, чат-боты, генерация кода Типичный размер: миллиарды (в американском понимании, то есть 10^9) параметров Seq2Seq (Кодировщик–Декодер) Трансформатор «последовательность в последовательность» объединяет кодировщик и декодировщик. Кодировщик сначала преобразует входную последовательность в контекстное представление, а затем декодировщик генерирует выходную последовательность.

Общаться с языковой моделью: как игра в 'Что? Где? Когда?', только она — все знатоки сразу
LLM — это тип модели искусственного интеллекта, которая отлично справляется с пониманием и генерированием чел... | Сетка — социальная сеть от hh.ru