Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов.

Они применяют LLM-as-a-Judge для проверки синопсисов фильмов и сериалов: насколько описание точное, ясное, выдержанное по тону и не содержит фактических ошибок.

Идея пзц простая, но реализация сильная: хороший синопсис влияет не только на тап, но и на то, останется ли юзер смотреть дальше или быстро скипнет

синопсис — это вот этот текст обведённый красным на картинке, если что интересно

они оценивают синопсис сразу в двух плоскостях:

• редакционная или creative quality: то есть соответствует ли текст внутренним стандартам качества. • продуктовая: влияет ли этот текст на реальные метрики: выбирают ли тайтл чаще и не бросают ли его почти сразу после старта

а ещё, по сути, они научили LLM смотреть на синопсис глазами высокогорейдового редактора :)) и разбивать их по критериям

clarity — синопсис должен быть понятным с первого чтения precision — речь не только о фактах, но и о том, насколько аккуратно текст передает суть истории tone — синопсис должен звучать в правильной интонации: соответствовать жанру, типу проекта и редакционному голосу платформы. factuality — они выделяют несколько отдельных типов фактических ошибок: неверные детали сюжета, ошибки в метаданных, ошибки в указании актеров или других участников проекта, ошибки в наградах и достижениях

то есть, что конкретно они сделали

1. они разбили оценку на отдельные критерии, это важный инженерный принцип: узкие LLM-задачи почти всегда работают надежнее, чем одна большая и расплывчатая

2. для сложных случаев они усилили рассуждение модели, использовали более длинные rationale, потом сжимали их до краткого объяснения, удобного для человека, плюс запускали несколько прогонов и агрегировали ответ

3. проверку фактов вообще разложили на агентов. отдельно сюжет, отдельно метаданные, отдельно актеры, отдельно награды, это уже очень похоже на то, как реально стоит строить production-grade AI-системы))

4. самое главное: они проверили не только совпадение с редакторами, но и связь с продуктовыми метриками, более высокие оценки LLM коррелировали с тем, что пользователи чаще выбирали тайтл и реже бросали его сразу после старта

——

Результат: LLM-судья достиг 85% совпадения с оценками профессиональных креативных редакторов. это, по сути, означает, что модель научили достаточно стабильно воспроизводить экспертное представление о хорошем синопсисе)

——

И всё это для одного блока с текстом, друзья мои))

Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru
Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов | Сетка — социальная сеть от hh.ru