🔹 Оценка ответов LLM: метрики и смысл 🔹 Почему одни метрики высоки, а ответ всё равно плох? 🔸 Перплексия (perplexity) — показывает, насколько модель "удивляется" тексту; решает задачу диагностики обучения: низкая перплексия значит модель лучше предсказывает токены, но она не гарантирует правдивость или пригодность ответа.
🔸 BLEU (Bilingual Evaluation Understudy) — считает совпадения n‑грам с эталоном; полезен для проверки поверхностного сходства; плохо работает с парафразами. Пример: эталон "Он купил книгу", кандидат "Книга была куплена им" — семантически OK, BLEU низкий.
🔸 ROUGE (Recall-Oriented Understudy for Gisting Evaluation) — ориентирован на полноту (recall), часто для суммаризации; показывает, сколько важного содержимого сохранено; не ловит фактические ошибки.
🔸 human eval — оценка человеком: проверяет полезность, факты, тон и контекст; необходима для финальной валидации, хоть дороже и медленнее.
📚 Комбинируйте: перплексия для тренинга, BLEU/ROUGE для мониторинга, human eval для качества и фактов.
➡️ Мы в Telegram - Сетке - Дзен Буду рад вашей реакции здесь⬇️
В этом посте были ссылки, но мы их удалили по правилам Сетки