Основы генеративного ИИ — часть 2

Разбор больших языковых моделей

Понимание больших языковых моделей — одна из самых важных тем на собеседованиях по генеративному ИИ.

1. Что такое большая языковая модель?

Большая языковая модель — это модель глубокого обучения, обученная на огромных объёмах текстовых данных. Она умеет понимать, генерировать, кратко пересказывать, переводить и анализировать человеческий язык.

Такие модели строятся на архитектуре трансформера и предсказывают следующий токен на основе контекста предыдущих токенов.

Примеры:

GPT

Llama

ChatGPT

Claude

Mistral

2. Как обучают большие языковые модели?

Обычно обучение проходит в три этапа.

Этап 1: предварительное обучение

Модель изучает языковые закономерности на миллиардах слов, собранных из книг, сайтов, статей и кода.

Модель учится:

грамматике;

фактам;

моделям рассуждения;

стилям письма;

связям между словами.

Этап 2: дообучение

Предварительно обученную модель дополнительно обучают на данных из конкретной области.

Примеры:

медицинский чат-бот;

банковский помощник;

юридический помощник;

помощник для программирования.

Так модель становится специализированной под конкретные задачи.

Этап 3: согласование с человеком

Модель учится на обратной связи от людей.

Цели:

давать более безопасные ответы;

лучше следовать инструкциям;

снижать количество вредных ответов;

становиться полезнее.

3. Как большая языковая модель генерирует текст?

Запрос пользователя

Разбиение на токены

Преобразование в эмбеддинги

Слои трансформера

Механизм внимания

Распределение вероятностей

Предсказание следующего токена

Повтор до завершения ответа

Модель предсказывает текст по одному токену за раз, пока ответ не будет завершён.

4. Что такое токены?

Токен — это минимальная единица текста, которую обрабатывает большая языковая модель.

Пример.

Предложение:

Artificial Intelligence is amazing.

Возможные токены:

Artificial

Intelligence

is

amazing

.

Некоторые токенизаторы разбивают слова на более мелкие части.

Пример:

unbelievable

un

believ

able

5. Что такое параметры?

Параметры — это обученные веса внутри нейронной сети.

В них хранится всё, что модель усвоила во время обучения.

Примеры:

маленькая модель → миллионы параметров;

большая модель → миллиарды параметров.

В общем случае:

больше параметров → выше способность к обучению;

больше параметров → выше требования к памяти и вычислительным ресурсам.

6. Что такое контекстное окно?

Контекстное окно — это максимальный объём информации, который модель может обработать за один запрос. Обычно он измеряется в токенах.

В него входят:

запрос пользователя;

предыдущая переписка;

найденные документы;

системные инструкции.

Большее контекстное окно помогает при работе с:

длинными документами;

многошаговыми диалогами;

поисково-дополненной генерацией.

7. Что такое вывод модели?

Вывод модели — это процесс, при котором уже обученная модель генерирует прогнозы или ответы.

Пример:

обучение → мы учим модель;

вывод → используем обученную модель, чтобы отвечать на вопросы.

Вывод происходит каждый раз, когда вы взаимодействуете с ИИ-чат-ботом.

8. Что такое температура?

Температура управляет степенью случайности в сгенерированном ответе.

Низкая температура: 0,1–0,3

Более предсказуемые ответы

Лучше подходит для фактических задач

Меньше креативности

Высокая температура: 0,8–1,2

Больше креативности

Более разнообразные ответы

Выше шанс неожиданных результатов

9. Что такое выборка Top-p?

Top-p, или ядерная выборка, выбирает следующий токен из минимального набора токенов, суммарная вероятность которых превышает выбранный порог.

Продолжение в комментариях