Основы генеративного ИИ — часть 2
Разбор больших языковых моделей
Понимание больших языковых моделей — одна из самых важных тем на собеседованиях по генеративному ИИ.
1. Что такое большая языковая модель?
Большая языковая модель — это модель глубокого обучения, обученная на огромных объёмах текстовых данных. Она умеет понимать, генерировать, кратко пересказывать, переводить и анализировать человеческий язык.
Такие модели строятся на архитектуре трансформера и предсказывают следующий токен на основе контекста предыдущих токенов.
Примеры:
GPT
Llama
ChatGPT
Claude
Mistral
2. Как обучают большие языковые модели?
Обычно обучение проходит в три этапа.
Этап 1: предварительное обучение
Модель изучает языковые закономерности на миллиардах слов, собранных из книг, сайтов, статей и кода.
Модель учится:
грамматике;
фактам;
моделям рассуждения;
стилям письма;
связям между словами.
Этап 2: дообучение
Предварительно обученную модель дополнительно обучают на данных из конкретной области.
Примеры:
медицинский чат-бот;
банковский помощник;
юридический помощник;
помощник для программирования.
Так модель становится специализированной под конкретные задачи.
Этап 3: согласование с человеком
Модель учится на обратной связи от людей.
Цели:
давать более безопасные ответы;
лучше следовать инструкциям;
снижать количество вредных ответов;
становиться полезнее.
3. Как большая языковая модель генерирует текст?
Запрос пользователя
↓
Разбиение на токены
↓
Преобразование в эмбеддинги
↓
Слои трансформера
↓
Механизм внимания
↓
Распределение вероятностей
↓
Предсказание следующего токена
↓
Повтор до завершения ответа
Модель предсказывает текст по одному токену за раз, пока ответ не будет завершён.
4. Что такое токены?
Токен — это минимальная единица текста, которую обрабатывает большая языковая модель.
Пример.
Предложение:
Artificial Intelligence is amazing.
Возможные токены:
Artificial
Intelligence
is
amazing
.
Некоторые токенизаторы разбивают слова на более мелкие части.
Пример:
unbelievable
↓
un
believ
able
5. Что такое параметры?
Параметры — это обученные веса внутри нейронной сети.
В них хранится всё, что модель усвоила во время обучения.
Примеры:
маленькая модель → миллионы параметров;
большая модель → миллиарды параметров.
В общем случае:
больше параметров → выше способность к обучению;
больше параметров → выше требования к памяти и вычислительным ресурсам.
6. Что такое контекстное окно?
Контекстное окно — это максимальный объём информации, который модель может обработать за один запрос. Обычно он измеряется в токенах.
В него входят:
запрос пользователя;
предыдущая переписка;
найденные документы;
системные инструкции.
Большее контекстное окно помогает при работе с:
длинными документами;
многошаговыми диалогами;
поисково-дополненной генерацией.
7. Что такое вывод модели?
Вывод модели — это процесс, при котором уже обученная модель генерирует прогнозы или ответы.
Пример:
обучение → мы учим модель;
вывод → используем обученную модель, чтобы отвечать на вопросы.
Вывод происходит каждый раз, когда вы взаимодействуете с ИИ-чат-ботом.
8. Что такое температура?
Температура управляет степенью случайности в сгенерированном ответе.
Низкая температура: 0,1–0,3
Более предсказуемые ответы
Лучше подходит для фактических задач
Меньше креативности
Высокая температура: 0,8–1,2
Больше креативности
Более разнообразные ответы
Выше шанс неожиданных результатов
9. Что такое выборка Top-p?
Top-p, или ядерная выборка, выбирает следующий токен из минимального набора токенов, суммарная вероятность которых превышает выбранный порог.
Продолжение в комментариях