Дашборд для анализа и сравнения LLM-моделей
Пока что внутренний проект — интерактивное веб-приложение на Streamlit, созданное для того, чтобы просто и наглядно оценивать работу языковых моделей.
🔎 Что доступно сейчас:
✅Загрузка и сравнение нескольких CSV-отчётов одновременно.
✅Показ ключевых метрик (Correctness, Faithfulness, Relevancy и др.) в наглядном формате.
✅Блок Executive Summary для быстрого понимания сильных и слабых сторон каждой модели.
✅Гибкий анализ: выбор метрики и установка порога для выявления проблемных кейсов.
✅Визуализация причин ошибок и конкретные примеры, где модель даёт сбой.
✅Генерация подробного диагностического отчёта с помощью YandexGPT и др.
✨ А теперь вопрос к вам: Что, на ваш взгляд, можно добавить в такой дашборд, чтобы он стал ещё полезнее и реально помогал в работе с LLM?