Дашборд для анализа и сравнения LLM-моделей

Пока что внутренний проект — интерактивное веб-приложение на Streamlit, созданное для того, чтобы просто и наглядно оценивать работу языковых моделей.

🔎 Что доступно сейчас:

✅Загрузка и сравнение нескольких CSV-отчётов одновременно.

✅Показ ключевых метрик (Correctness, Faithfulness, Relevancy и др.) в наглядном формате.

✅Блок Executive Summary для быстрого понимания сильных и слабых сторон каждой модели.

✅Гибкий анализ: выбор метрики и установка порога для выявления проблемных кейсов.

✅Визуализация причин ошибок и конкретные примеры, где модель даёт сбой.

✅Генерация подробного диагностического отчёта с помощью YandexGPT и др.

А теперь вопрос к вам: Что, на ваш взгляд, можно добавить в такой дашборд, чтобы он стал ещё полезнее и реально помогал в работе с LLM?

Дашборд для анализа и сравнения LLM-моделей | Сетка — социальная сеть от hh.ru