🔹 Оценка ответов LLM: метрики и смысл 🔹 Почему одни метрики высоки, а ответ всё равно плох? 🔸 Перплексия (perplexity) — показывает, насколько модель "удивляется" тексту; решает задачу диагностики обучения: низкая перплексия значит модель лучше предсказывает токены, но она не гарантирует правдивость или пригодность ответа.

🔸 BLEU (Bilingual Evaluation Understudy) — считает совпадения n‑грам с эталоном; полезен для проверки поверхностного сходства; плохо работает с парафразами. Пример: эталон "Он купил книгу", кандидат "Книга была куплена им" — семантически OK, BLEU низкий.

🔸 ROUGE (Recall-Oriented Understudy for Gisting Evaluation) — ориентирован на полноту (recall), часто для суммаризации; показывает, сколько важного содержимого сохранено; не ловит фактические ошибки.

🔸 human eval — оценка человеком: проверяет полезность, факты, тон и контекст; необходима для финальной валидации, хоть дороже и медленнее.

📚 Комбинируйте: перплексия для тренинга, BLEU/ROUGE для мониторинга, human eval для качества и фактов.

#CODERIKK #Prompt #Middle

➡️ Мы в Telegram - Сетке - Дзен Буду рад вашей реакции здесь⬇️


В этом посте были ссылки, но мы их удалили по правилам Сетки

🔹 Оценка ответов LLM: метрики и смысл
🔹 Почему одни метрики высоки, а ответ всё равно плох?
🔸 Перплексия (perplexity) — показывает, насколько модель "удивляется" тексту; решает задачу диагностики обуч... | Сетка — социальная сеть от hh.ru