Netflix заспичил зрелый кейс использования LLM не для генерации, а для оценки качества текстов.
Они применяют LLM-as-a-Judge для проверки синопсисов фильмов и сериалов: насколько описание точное, ясное, выдержанное по тону и не содержит фактических ошибок.
Идея пзц простая, но реализация сильная: хороший синопсис влияет не только на тап, но и на то, останется ли юзер смотреть дальше или быстро скипнет
синопсис — это вот этот текст обведённый красным на картинке, если что интересно
они оценивают синопсис сразу в двух плоскостях:
• редакционная или creative quality: то есть соответствует ли текст внутренним стандартам качества. • продуктовая: влияет ли этот текст на реальные метрики: выбирают ли тайтл чаще и не бросают ли его почти сразу после старта
а ещё, по сути, они научили LLM смотреть на синопсис глазами высокогорейдового редактора :)) и разбивать их по критериям
clarity — синопсис должен быть понятным с первого чтения precision — речь не только о фактах, но и о том, насколько аккуратно текст передает суть истории tone — синопсис должен звучать в правильной интонации: соответствовать жанру, типу проекта и редакционному голосу платформы. factuality — они выделяют несколько отдельных типов фактических ошибок: неверные детали сюжета, ошибки в метаданных, ошибки в указании актеров или других участников проекта, ошибки в наградах и достижениях
то есть, что конкретно они сделали
1. они разбили оценку на отдельные критерии, это важный инженерный принцип: узкие LLM-задачи почти всегда работают надежнее, чем одна большая и расплывчатая
2. для сложных случаев они усилили рассуждение модели, использовали более длинные rationale, потом сжимали их до краткого объяснения, удобного для человека, плюс запускали несколько прогонов и агрегировали ответ
3. проверку фактов вообще разложили на агентов. отдельно сюжет, отдельно метаданные, отдельно актеры, отдельно награды, это уже очень похоже на то, как реально стоит строить production-grade AI-системы))
4. самое главное: они проверили не только совпадение с редакторами, но и связь с продуктовыми метриками, более высокие оценки LLM коррелировали с тем, что пользователи чаще выбирали тайтл и реже бросали его сразу после старта
——
Результат: LLM-судья достиг 85% совпадения с оценками профессиональных креативных редакторов. это, по сути, означает, что модель научили достаточно стабильно воспроизводить экспертное представление о хорошем синопсисе)
——
И всё это для одного блока с текстом, друзья мои))