Evaluations: CI для качества AI-фич 👻

📊 Нельзя #expect-нуть LLM: один промпт — разные ответы. Фреймворк Evaluations прогоняет датасет через модель, скорит результат метриками или моделью-судьёй и гейтит CI через Swift Testing — трейт .eva

читать далее
Evaluations: CI для качества AI-фич 👻 | Сетка — социальная сеть от hh.ru