RLHF: зачем ИИ нужен фидбек от человека

Когда мы общаемся с ИИ-ассистентами, мы ожидаем, что они будут понятными, вежливыми и точными. Но что, если модель отвечает формально, не улавливает иронию или предлагает неуместные советы?🤷‍♂️

В таких случаях помогает Reinforcement Learning from Human Feedback (RLHF) — обучение на основе обратной связи от человека.

Как выглядит процесс RLHF: 1⃣ Подготовка данных. Люди пишут промпты и составляют идеальные ответы.

2⃣ Предобучение модели. На этих данных обучают языковую модель с учителем (supervised learning) или берут уже предобученную.

3⃣ Генерация ответов. Модель отвечает на запросы, а аннотаторы сравнивают ответы с эталонными и оценивают. Это помогает подстроить стратегию формирования ответов.

Но вручную оценивать всё — дорого и долго. Поэтому используется дополнительная модель.

4⃣ Reward model. Эту модель обучают на фидбеке от аннотаторов. Она учится распознавать, какие ответы кажутся человеку удачными.

5⃣ Дообучение. Модель вознаграждения начинает автоматически оценивать ответы основной модели. Этот цикл (шаги 3-5) повторяется несколько раз.

6⃣ Оптимизация. Основная модель учится ориентироваться на оценки reward-модели. А значит — и на человеческие ожидания.

У RLHF есть ограничения: фидбек субъективен, его сложно масштабировать, а модель может начать давать ожидаемые ответы, но бесполезные.

🔗 Подробнее о технологии RLHF, её применении и ограничениях — в нашей статье на «РБК Компаниях».